Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Methodenartikel

Eine konfidenzgesteuerte Multi-Object-Tracking-Methode für Sportvideos unter Verwendung von Jersey-Semantikfusion

87 Aufrufe

⸱

DOI:

10.3791/71557

⸱

14. August 2026

In diesem Artikel

Zusammenfassung

Dieses Protokoll beschreibt einen vertrauensbasierten Workflow zur Mehrfachobjektverfolgung in Sportvideos, der Informationen zur Trikotfarbe und Spielernummer integriert, um die Zuordnung von Trajektorien und die Identitätskonsistenz bei Schwankungen des Vertrauens, bei Verdeckungen und optisch ähnlichen Erscheinungsbildern der Athleten zu verbessern.

Zusammenfassung

Die Mehrfach-Objektverfolgung (MOT) in Sportvideos liefert Trajektorieninformationen für taktische Analysen, die Interpretation des Spielerverhaltens und automatisierte statistische Auswertungen. Sportaufnahmen weisen jedoch häufig schnelle Richtungswechsel, abrupte Stopps, häufige Verdeckungen und optisch ähnliche Teamkameraden auf, was zu Schwankungen der Detektionszuverlässigkeit und Identitätsverwirrung bei der Zuordnung zwischen aufeinanderfolgenden Bildern führt. Um diese Herausforderungen zu bewältigen, stellt diese Studie JerseyTrack vor, eine vertrauensbasierte Methode zur Sport-MOT, die auf der semantischen Fusion von Trikotinformationen beruht. Der Arbeitsablauf unterteilt die Detektionsboxen adaptiv in hoch-, mittel- und niedrigvertrauenswürdige Intervalle, basierend auf der Konfidenzverteilung jedes Einzelbilds. Hochvertrauenswürdige Detektionen werden hauptsächlich anhand der Bewegungsähnlichkeit zugeordnet, während mittel- und niedrigvertrauenswürdige Detektionen zusätzlich Trikotfarb- und Spielernummernmerkmale nutzen, die mittels Farbclustering und einem leichten Optical Character Recognition-Modell (OCR) extrahiert werden. Diese semantischen Merkmale werden während der ergänzenden Zuordnung mit Bewegungsinformationen fusioniert, um die Kontinuität der Trajektorien und die Konsistenz der Identitäten zu verbessern. Die Methode wurde auf dem SportsMOT-Datensatz evaluiert. JerseyTrack erreichte eine Multiple Object Tracking Accuracy (MOTA) von 88,9 %, eine IDentity F1 Score (IDF1) von 74,3 % und eine Higher Order Tracking Accuracy (HOTA) von 69,9 %, was eine verbesserte Verfolgungsleistung im untersuchten Szenario der Sportverfolgung belegt. Dieses Protokoll stellt einen reproduzierbaren Arbeitsablauf bereit, um die vertrauensbasierte Zuordnung mit semantischen Trikotinformationen zu integrieren und dadurch die Mehrfach-Objektverfolgung in Sportvideos zu verbessern.

Einleitung

Das Mehrfachobjekt-Tracking (MOT) ermöglicht eine kontinuierliche Lokalisierung von Objekten und die Beibehaltung ihrer Identität in Videosequenzen und unterstützt die Extraktion von Athletentrajektorien, taktische Analysen sowie automatisierte statistische Auswertungen in Anwendungen mit Sportvideos1,2,3. Zuverlässige visuelle Informationen sind zudem mit sportartspezifischen Entscheidungsprozessen und der Leistungsbewertung in der Sportwissenschaft verknüpft, was den Wert stabiler, aus Videos gewonnener Bewegungsdaten für nachgeschaltete sportliche Analysen weiter unterstreicht4. In sportlichen Szenarien hängt die Zuverlässigkeit taktischer Daten von der Kontinuität der Verfolgungstrajectorien und der Konsistenz der Zielidentitäten ab.

Im Vergleich zu allgemeinen MOT-Szenarien enthalten Sportvideos schnelle Richtungswechsel, abrupte Stopps, Sprünge, dichte Interaktionen und häufige Verdeckungen. Diese Faktoren verursachen erhebliche Schwankungen der Vertrauenswürdigkeit der Erkennungsboxen und erhöhen die Häufigkeit von Erkennungen mit geringer Zuverlässigkeit, was die Zuordnung von Trajektorien unterbrechen kann5,6. Einheitliche Teamtrikots verringern zudem die Unterscheidungsfähigkeit allgemeiner Erscheinungsmerkmale und erhöhen die Identitätsverwirrung zwischen optisch ähnlichen Teammitgliedern7,8. Wenn Verdeckungen und Ähnlichkeit im Erscheinungsbild in derselben Sequenz auftreten, nimmt die Erkennungszuverlässigkeit ab und die Erscheinungsinformationen des Ziels werden unvollständig, wodurch die Schwierigkeit der Trajektorienzuordnung und der Identitätserhaltung zunimmt9,10. In der mehrfachen Objektverfolgung (MOT) bezeichnet die Wiedererkennung (Re-ID) den Prozess, bei dem dieselbe Zielidentität über mehrere Bilder, Verdeckungsphasen oder Wiedereintrittssituationen hinweg anhand identitätsbezogener visueller Merkmale zugeordnet wird. In Videos von Mannschaftssportarten können allgemeine Re-ID-Merkmale geschwächt sein, da Athleten derselben Mannschaft oft ähnliche Trikots und Körperformen aufweisen. Die technische Literaturübersicht zeigt, dass Trajektorienbrüche und Identitätsverwirrungen in der Sport-MOT üblicherweise durch zwei komplementäre Ansätze angegangen werden: die Nutzung der Erkennungszuverlässigkeit und die Verbesserung der Identitätsmerkmale. JerseyTrack positioniert sich an der Schnittstelle dieser Ansätze, indem es die Verwendung semantischer Trikotmerkmale je nach Qualität der Erkennung reguliert, anstatt Farb- und Spielernummerninformationen einheitlich auf alle Erkennungen anzuwenden.

Die vorliegende Studie stellt JerseyTrack vor, eine vertrauensbasierte Methode zur mehrfachen Objektverfolgung (MOT) im Sport, die auf der semantischen Fusion von Trikotmerkmalen basiert. Die Methode ist für Videos von Mannschaftssportarten konzipiert, bei denen Athleten sichtbare Trikots tragen und die Detektionsergebnisse Begrenzungsboxen mit Vertrauenswerten liefert. JerseyTrack kombiniert vier Hauptkomponenten: Athletendetektion, vertrauensbasierte Gruppeneinteilung, Extraktion semantischer Trikotmerkmale und kaskadierte inter-frame-Verknüpfung. Die Vertrauenswerte der Detektion werden verwendet, um die erkannten Objekte adaptiv in Gruppen mit hohem, mittlerem und niedrigem Vertrauen einzuteilen, die jeweils mit unterschiedlichen Verknüpfungsstrategien verarbeitet werden. Detektionen mit hohem Vertrauen werden vorrangig über Bewegungsinformationen verknüpft, während bei Detektionen mit mittlerem und niedrigem Vertrauen zusätzlich Trikotfarbe und Spielernummern berücksichtigt werden, um die Identitätssicherung zu verbessern, wenn die visuellen Hinweise schwach sind. Die Methode ist für die Analyse von Sportvideos gedacht, die stabile Athletentrajektorien erfordern, beispielsweise für taktische Analysen oder die Interpretation des Spielerverhaltens.

Der vorgeschlagene Ansatz weist ebenfalls betriebliche Einschränkungen auf. Die semantische Extraktion von Trikots kann durch starke Verdeckung, Bewegungsunschärfe, niedrige Bildauflösung, abnormale Trikotpositionen oder unsichtbare Spielernummern beeinträchtigt werden. In solchen Fällen können die trikotbasierten semantischen Hinweise unvollständig werden, wodurch der Assoziierungsprozess stärker auf Bewegungskonsistenz und Mehrbildverifizierung angewiesen ist. Die Leistungsbehauptungen dieser Studie gelten daher nur für die ausgewerteten Datensätze und experimentellen Rahmenbedingungen. Experimente auf dem SportsMOT-Datensatz zeigen, dass JerseyTrack die bewerteten Tracking-Metriken verbessert und die Anzahl von Identitätswechseln unter den getesteten Sport-Tracking-Bedingungen verringert. Die Hauptschwierigkeit des Mehrfachobjekt-Trackings (MOT) in Sportvideos liegt darin, die Trajektorienkontinuität und Identitätskonsistenz bei schnellen Bewegungen, Verdeckungen und ähnlicher Erscheinung aufrechtzuerhalten. Bestehende Studien im Zusammenhang mit JerseyTrack lassen sich grob in zwei Forschungsrichtungen einteilen: die Nutzung der Detektionszuverlässigkeit für die Trajektorienzuordnung und die Verbesserung von Identitätshinweisen durch sportartspezifische semantische Merkmale.

Die Erkennungskonfidenz wird häufig verwendet, um die Zuverlässigkeit von Erkennungsboxen abzuschätzen und die Trajektorienzuordnung in der Mehrfachobjektverfolgung (MOT) zu steuern. Frühe Verfolgungsmethoden behandelten die Konfidenz meist als binäres Filterkriterium, bei dem Erkennungen unterhalb einer festen Schwelle entfernt wurden, um Falschpositiv-Ergebnisse zu reduzieren11,12. Diese Strategie verringert verrauschte Erkennungen, kann jedoch auch echte Ziele bei Verdeckung, schneller Bewegung oder geringer Bildqualität verwerfen, was zu einer Fragmentierung der Trajektorien führt13,14,15. Ähnliche Filterstrategien haben außerdem gezeigt, dass feste Konfidenzschwellen empfindlich gegenüber Szenenvariationen und der Qualität der Erkennung sind16,17. Um die Nutzung von Erkennungen mit niedriger Konfidenz zu verbessern, führte ByteTrack eine Zuordnungsstrategie ein, die Erkennungsboxen mit niedriger Konfidenz als Kandidaten für eine sekundäre Zuordnung beibehält und sie mithilfe von Bewegungsähnlichkeit und Trajektorienverlauf mit bestehenden Trajektorien verknüpft18. McByte erweitert diese Zuordnung für Sport-MOT weiter, indem zeitlich fortgepflanzte Segmentierungsmasken als zusätzlicher Hinweis für die Zuordnung integriert werden, wodurch die Robustheit bei schneller Bewegung, Verdeckung und Kameraverschiebung verbessert wird, ohne zusätzliches Training pro Video zu erfordern19. Verwandte Studien haben ebenfalls die Nutzung von Erkennungen mit niedriger Konfidenz angepasst, um schwache, aber potenziell gültige Ziele während der Zuordnung zu erhalten20,21,22. Konfidenzadaptive Zuordnungsstrategien haben daraufhin die Zuordnungskriterien basierend auf Bewegungskonsistenz und Erkennungszuverlässigkeit verfeinert23,24,25. Methoden zur Trajektorienverbesserung, die auf der Regressionsanalyse von Erkennungsboxen und der Optimierung der Trajektorienglättung basieren, wurden ebenfalls eingesetzt, um die Fragmentierung von Trajektorien zu reduzieren26,27,28. Zusätzliche Verfeinerungsstrategien liefern ergänzende Unterstützung, um die Kontinuität der Trajektorien unter komplexen Bewegungsbedingungen aufrechtzuerhalten29. Der zeitlich kohärente Objektfluss modelliert zudem die objektbasierte zeitliche Konsistenz über mehrere Bilder hinweg und stellt einen weiteren, auf die Zuordnung ausgerichteten Ansatz zur Verringerung von Trajektorienunterbrechungen in komplexen MOT-Szenarien bereit30. Tracker-Fusionsmethoden lernen aus den Ausgaben mehrerer Tracker und nutzen lernbasierte Selektions- oder Fusionsstrategien, um die Robustheit der Verfolgung über verschiedene MOT-Benchmarks hinweg zu verbessern31. Insgesamt zeigen diese Studien, dass eine konfidenzbewusste Zuordnung dabei hilft, unterbrochene Trajektorien wiederherzustellen. Allerdings liefern Konfidenz- und Bewegungshinweise nur begrenzte Identitätsinformationen, wenn Spieler derselben Mannschaft ein ähnliches visuelles Erscheinungsbild aufweisen. Obwohl diese Methoden die Trajektorienfragmentierung in allgemeinen Szenarien effektiv verringern, stoßen sie in Sportkontexten an inhärente Grenzen, da Spieler derselben Mannschaft oft ein sehr ähnliches visuelles Erscheinungsbild haben und eine alleinige Orientierung an Konfidenz- und Bewegungsinformationen keine ausreichende Grundlage für die Unterscheidung von Identitäten bietet32,33,34. Selbst wenn Erkennungsboxen mit niedriger Konfidenz effektiv reidentifiziert werden, kann die Ähnlichkeit der Merkmale weiterhin zu Identitätswechseln führen, was die Erfüllung der strengen Anforderungen an die Identitätskonsistenz in der Sportanalyse erschwert.

Sportartspezifische Identitätsmerkmale wurden ebenfalls verwendet, um die Identitätsdiskriminierung bei der Athletenverfolgung zu verbessern. Semantische Informationen des Trikots, wie Mannschaftsfarbe und Spielernummer, liefern Identitätsmerkmale, die direkter mit Sportzenarien verknüpft sind als allgemeine Erscheinungseigenschaften35,36,37. Die Trikotfarbe wurde genutzt, um die Unterscheidung auf Mannschaftsebene zu unterstützen und Verwechslungen zwischen Mannschaften zu reduzieren, während die Erkennung der Spielernummer einen feiner abgestuften Identitätsanhaltspunkt bietet, wenn der Nummernbereich sichtbar und lesbar ist38,39. Bestehende Studien zur Sportverfolgung haben domänenspezifische visuelle Merkmale und die Erkennung von Trikotfarben integriert, um die Zuordnung von Spielern unter überfüllten Sportbedingungen zu verbessern40,41. Arbeiten zur Erkennung von Trikotnummern und synthetischen Nummerndaten unterstützen zudem die Identitätsmodellierung unter Bedingungen niedriger Auflösung oder teilweiser Verdeckung42,43. Diese Studien zeigen, dass Trikotsemantik die Identitätsrepräsentation im sportlichen Mehrfachobjekt-Tracking (MOT) stärken kann. Die meisten semantikbasierten Verfolgungsmethoden modellieren jedoch nicht ausreichend den Zusammenhang zwischen Detektionsvertrauen und der Qualität semantischer Merkmale. Detektionen mit hohem Vertrauen enthalten möglicherweise bereits zuverlässige räumliche und visuelle Informationen, wodurch eine wiederholte semantische Extraktion weniger effizient wird. Detektionen mit niedrigem Vertrauen leiden oft unter Verdeckung, Unschärfe, Abschneidung oder niedriger Auflösung, was die Zuverlässigkeit von Farb- und Spielernummernmerkmalen verringert. Diese Einschränkung motiviert ein vertrauensgeleitetes Zuordnungsdesign, bei dem Trikotsemantik entsprechend der Detektionsqualität eingeführt wird, anstatt einheitlich auf alle Detektionen angewendet zu werden. Die ausgewerteten Studien zeigen, dass vertrauensbasierte Zuordnung und semantische Trikotmodellierung unterschiedliche Aspekte des sportlichen MOT adressieren. Strategien basierend auf Vertrauen bestimmen hauptsächlich, ob eine Detektion an der Zuordnung teilnehmen soll und wie sie mit bestehenden Trajektorien abgeglichen werden soll, während semantische Trikotstrategien die Identitätsrepräsentation primär durch sportartspezifische Merkmale verbessern. Diese beiden Mechanismen werden jedoch oft als separate Komponenten konzipiert. Dadurch werden semantische Merkmale nicht immer entsprechend der Detektionsqualität angepasst, und Vertrauensniveaus regulieren nicht direkt die Nutzung von Farb- und Spielernummerinformationen während der Zuordnung. Diese Trennung begrenzt die gemeinsame Bewältigung von Trajektorienbrüchen und Identitätsverwirrung in Videos von Mannschaftssportarten. Die verbleibende Forschungslücke besteht darin, die Bewertung der Detektionsvertrauensqualität mit der semantischen Trikotzuordnung innerhalb desselben Tracking-Workflows zu verknüpfen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Diese Studie umfasste eine sekundäre Analyse öffentlich zugänglicher Benchmark-Videodatensätze, und zwar SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 und MOT20. Es wurden keine Teilnehmer rekrutiert, es wurde keine Intervention durchgeführt und es wurden keine neuen Daten an menschlichen Versuchspersonen erhoben. Eine Genehmigung durch einen Ethikausschuss war für diese Studie gemäß den geltenden institutionellen Vorgaben der Bangkok Thonburi University nicht erforderlich.

Das folgende Protokoll beschreibt den Arbeitsablauf zur Reproduktion von JerseyTrack, beginnend mit der Datenaufbereitung bis hin zur Auswertung der Objektverfolgung. Der Arbeitsablauf umfasst die Datensatzvorbereitung, die Vorbereitung des Detektors, die semantische Extraktion der Trikots, die Aufteilung nach Konfidenzniveau, die konfidenzgeleitete Zuordnung, die Verfolgungsanalyse und die Leistungsbewertung, wie in Abbildung 1 zusammengefasst. Die erforderliche Software, Datensätze und Hardwareressourcen sind in der Tabelle der Materialien aufgelistet.

Extraktion von Jersey-Merkmalen mithilfe von Erscheinungsmerkmalen; Zustandsvorhersage; Datenzuordnungsprozess.
Abbildung 1. Gesamtablauf des JerseyTrack-Verfahrens. Der Ablauf umfasst die semantische Merkmalsextraktion von Trikots, die anfängliche Objektzuordnung, eine vertrauensbasierte ergänzende Zuordnung sowie die Merkmalsfusion. Teamfarb- und Spielernummernmerkmale werden aus erkannten Athletenbereichen extrahiert und in den Zuordnungsprozess integriert, um die Trajektorienzuordnung unter unsicheren Erkennungsbedingungen zu verbessern. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

1. Bereiten Sie die Datensätze und die Verzeichnisstruktur vor

  1. Laden Sie die in der Tabelle der Materialien aufgeführten öffentlichen Benchmark-Datensätze herunter. Verwenden Sie SportsMOT als primären Datensatz für die Vorbereitung des Detektors und die Bewertung der Verfolgung. Behalten Sie TeamTrack, SoccerNet Tracking, MOT17 und MOT20 für die Querdatensatz-Evaluation bei.
  2. Speichern Sie alle Datensätze in einem einheitlichen Projektverzeichnis. Stellen Sie sicher, dass der Detektor, das Modul zur semantischen Extraktion, das Verfolgungsmodul und das Evaluierungswerkzeug identische Sequenzbezeichner verwenden.
  3. Konvertieren Sie die offiziellen SportsMOT-Anmerkungen mithilfe des in dieser Studie verwendeten Datenvorbereitungsskripts in das Format für das Training des Detektors. Führen Sie den folgenden Befehl aus:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. Das Datenvorbereitungsskript (scripts/prepare_data.py) ist im JerseyTrack-Quellcode-Repository verfügbar (https://doi.org/10.5281/zenodo.21274352). Die erforderlichen Softwareabhängigkeiten sind in der Datei environment.yml angegeben, einschließlich Python 3.12, PyTorch 2.11.0 und OpenCV 4.10 oder höher. Richten Sie die Softwareumgebung mit dem folgenden Befehl ein: conda env create -f environment.yml. Führen Sie das Datenvorbereitungsskript mit dem folgenden Befehl aus: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Überprüfen Sie, ob die Konvertierung die Konfigurationsdatei für das Training des Detektors erzeugt: data\processed\SportsMOT_yolo\data.yaml sowie das Konvertierungsprotokoll: data\processed\SportsMOT_yolo\conversion_manifest.csv.
    HINWEIS: In dieser Studie enthielt der konvertierte SportsMOT-Trainings- und Validierungsdatensatz 90 Sequenzen, 55.544 Bilder und 608.152 annotierte Objekte.
  6. Untersuchen Sie repräsentative Sequenzen, um sicherzustellen, dass die Reihenfolge der Bilder, die Koordinaten der Begrenzungsboxen und die Identitätskennzeichnungen mit den ursprünglichen Benchmark-Anmerkungen übereinstimmen.
  7. Bewahren Sie die konvertierten Anmerkungsdateien während der gesamten Vorbereitung des Detektors, der Verfolgungsinferenz und der Evaluierung unverändert auf, damit alle Methoden dieselbe Datensatzpartition und dasselbe Evaluierungsprotokoll verwenden.
    HINWEIS: Das erwartete Ergebnis dieses Abschnitts ist ein standardisiertes SportsMOT-Detektor-Trainingsverzeichnis, das die konvertierten Anmerkungen, das Konvertierungsprotokoll und die Datensatz-Aufteilungsdateien enthält, die für die Vorbereitung des Detektors und die Evaluierung der Verfolgung erforderlich sind.

2. Vorbereitung der Detektorausgänge

  1. Feinjustieren Sie den Objektdetektor mithilfe des vorbereiteten SportsMOT-Trainingssplits. Optimieren Sie den Detektor unter Verwendung des Klassifizierungsverlusts und des Begrenzungsbox-Regressionsverlusts, die in Gleichung 1 definiert sind. Verwenden Sie die im Implementierungsaufbau sowie in der Tabelle der Materialien angegebenen Parameter für die Eingangsauflösung des Detektors, die Batch-Größe, die Lernrate, die Anzahl der Trainingsepochen und andere Trainingsparameter.
    Ldet = Lcls + Lbox   (1)
    Hierbei bezeichnet Ldet  den gesamten Detektorverlust, Lcls den Klassifizierungsverlust und Lbox  den Begrenzungsbox-Regressionsverlust.
    HINWEIS: Der im Hauptexperiment verwendete Detektor-Checkpoint (interner Experiment-Identifier e3) wurde mit dem Ultralytics-YOLO-Framework unter Verwendung der SportsMOT-YOLO-Datensatzkonfiguration (data/processed/SportsMOT_yolo/data.yaml) trainiert. Führen Sie das Training des Detektors mit dem folgenden Befehl durch: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. Verwenden Sie nach Abschluss des Trainings den resultierenden leistungsstärksten Checkpoint, um mit dem folgenden Befehl Detektor-Ausgaben für die Validierungssequenzen zu generieren: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. Speichern Sie nach dem Training den trainierten Detektor-Checkpoint, die zugehörige Metadatendatei und das Trainingsprotokoll.
    HINWEIS: In dieser Studie wurde der für die formalen Experimente verwendete Detektor-Checkpoint unter folgendem Pfad gespeichert:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. Die entsprechende Metadatendatei wurde unter folgendem Pfad gespeichert: outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. Das für die Hauptvalidierungsexperimente mit SportsMOT verwendete Detektor-Ausgabeverzeichnis war: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Führen Sie den trainierten Detektor auf jeder Validierungssequenz aus, um Begrenzungsboxen und Konfidenzwerte für Athleten zu generieren. Exportieren Sie pro Sequenz eine Detektionsdatei, die den Frame-Index, die Koordinaten der Begrenzungsbox, die Detektionskonfidenz und die Klassenbezeichnung enthält.
    HINWEIS: Bei der für die Hauptexperimente verwendeten SportsMOT-Validierungslauf wurde mit einem Konfidenzschwellenwert von 0,05 eine Gesamtanzahl von 343.990 Athletendetektionen erzielt.
  4. Überprüfen Sie das Detektor-Ausgabeverzeichnis vor der Tracking-Inferenz. Stellen Sie sicher, dass jeder Sequenz eine entsprechende Detektionsdatei zugeordnet ist, dass die Frame-Indizes mit der vorbereiteten Bildsequenz übereinstimmen und dass jeder Detektionsdatensatz einen Konfidenzwert enthält.
    HINWEIS: Das erwartete Ergebnis dieses Abschnitts ist ein vollständiges Detektor-Ausgabeverzeichnis, das als Eingabe für die semantische Extraktion der Trikots, die Aufteilung nach Konfidenzniveau und die Tracking-Zuordnung dient.

3. Extrahieren Sie semantische Merkmale des Trikots

  1. Verwenden Sie die Ausgabedateien des Detektors, um die Athletenbereiche aus jedem Videobild auszuschneiden. Speichern Sie jedes zugeschnittene Athletenbild mit seinem Sequenzbezeichner, Bildindex und Detektionsindex. Schließen Sie ungültige Ausschnitte aus, bei denen Bilddaten fehlen oder die Begrenzungsboxen außerhalb der Bildgrenze liegen. Behalten Sie die Verknüpfung zwischen jedem Ausschnitt-Dateinamen und dem zugehörigen ursprünglichen Detektionsdatensatz bei, sodass die extrahierten semantischen Merkmale während der Verfolgungsverknüpfung den entsprechenden Detektionen zugeordnet werden können.
  2. Extrahieren Sie die Trikotfarbmerkmale aus den zugeschnittenen Athletenbildern mithilfe des in dieser Studie verwendeten semantischen Extraktionsskripts.
    HINWEIS: Die Skripte zur semantischen Merkmalsextraktion (scripts/extract_fast_color_semantics.py und scripts/formal_extract_semantics.py) sind im JerseyTrack-Quellcode-Repository verfügbar (https://doi.org/10.5281/zenodo.21274352). Es ist keine separate Konfigurationsdatei erforderlich; alle Laufzeitparameter werden über Befehlszeilenargumente bereitgestellt.
    Generieren Sie Trikotfarbdeskriptoren mit dem folgenden Befehl: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Generieren Sie semantische Merkmale der Spielernummer mithilfe des OCR-Modells mit dem folgenden Befehl: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. Die generierten Trikotfarbdeskriptoren und die Wahrscheinlichkeitsausgaben für die Spielernummer werden über den Sequenzbezeichner verknüpft und zu den semantischen Merkmalsdateien kombiniert, die während der Verfolgungsverknüpfung verwendet werden.
  3. Konvertieren Sie jedes zugeschnittene Athletenbild in den Farbraum Hue, Saturation, Value (HSV). Extrahieren Sie Vordergrundpixel aus dem Trikotbereich und fassen Sie die dominante Trikotfarbe mittels K-Means-Clustering mit K = 3 zusammen. Normalisieren Sie den resultierenden Farbdeskriptor mittels L2-Normalisierung vor dem Merkmalsvergleich.
  4. Trainieren Sie den Zweig zur Erkennung der Spielernummer mithilfe der zugeschnittenen Athletenbilder mit einer Eingabegröße von 128 × 64 Pixeln. Generieren Sie Pseudobezeichnungen für die Spielernummer mithilfe des in dieser Studie verwendeten schwach überwachten Bezeichnungsverfahrens. Schließen Sie Ausschnitte mit unsichtbaren, unlesbaren, stark verdeckten oder niedrigen Konfidenzbereichen für die Spielernummer von der Berechnung des Optical-Character-Recognition- (OCR-) Verlusts aus.
  5. Optimieren Sie den OCR-Zweig mithilfe des in Gleichung 2 definierten Kreuzentropieverlusts.
    Formel für Kreuzentropieverlust \(L_{ocr}=-\sum_{i=1}^{N}y_i\log(\hat{y}_i)\), Gleichung zur Klassifizierung. (2)
    Hier bezeichnet Locr den OCR-Verlust, yi  bezeichnet die überwachte Bezeichnung der Spielernummer und Polynomregressionsgleichung, ŷᵢ=β₀+β₁xᵢ+…+βₙxᵢⁿ, statistische Analysegrafik bezeichnet die vorhergesagte Kategorie der Spielernummer.
  6. Optimieren Sie das Modul zur semantischen Merkmalsextraktion mithilfe des adaptiven Optimierers, der Lernrate, der Batch-Größe, des Gewichtsverfalls und der Trainingsdauer, die in der Tabelle der Materialien aufgeführt sind. Kombinieren Sie den Detektorverlust und den OCR-Verlust mithilfe des in Gleichung 3 definierten gesamten Trainingsziels.
    Ltotal = Ldet + γLocr   (3)
    Hier bezeichnet Ltotal den gesamten Trainingsverlust, Ldet bezeichnet den in Gleichung 1 definierten Detektorverlust, Locr bezeichnet den in Gleichung 2 definierten OCR-Verlust und bezeichnet den benutzerdefinierten Gewichtungskoeffizienten für den OCR-Verlust.
  7. Wenden Sie den trainierten OCR-Zweig auf jedes zugeschnittene Athletenbild an. Speichern Sie die vorhergesagte Kategorie oder den Wahrscheinlichkeitsvektor der Spielernummer für jeden Ausschnitt. Wenn die Spielernummer nicht sichtbar ist oder die OCR-Konfidenz unterhalb des in der Implementierung definierten Schwellwerts liegt, vermerken Sie das Spielernummernmerkmal als nicht verfügbar, anstatt eine Vorhersage zu erzwingen.
  8. Kombinieren Sie den Trikotfarbdeskriptor und die Ausgabe der Spielernummer zur semantischen Merkmalsdatei, die vom Verfolgungsmodul verwendet wird.
    HINWEIS: Bei der Hauptvalidierung in SportsMOT verarbeitete das Skript zur semantischen Extraktion 343.990 Detektionen ohne fehlende Bilder oder ungültige Ausschnitte. Im aktuellen Überarbeitungspaket wurde in der Zusammenfassung zur semantischen Extraktion eine Gesamtgenauigkeit der Extraktion von Farb- und OCR-Informationen von 86,7 % unter den evaluierten SportsMOT-Bedingungen gemeldet. Das erwartete Ergebnis dieses Abschnitts ist eine semantische Merkmalsdatei, in der jeder gültige Detektionsdatensatz mit einem Trikotfarbdeskriptor, einer verfügbaren Ausgabe der Spielernummer und einer Markierung verknüpft ist, die angibt, ob semantische Informationen für die Verfolgungsverknüpfung verfügbar sind.

4. Konfidenzniveaus für die Partitionserkennung

  1. Laden Sie die Detektor-Ausgabedatei für jede Videosequenz. Sammeln Sie die Konfidenzwerte aller Athleten-Detektionen in jedem Einzelbild.
  2. Teilen Sie die Konfidenzwerte auf Ebene der Einzelbilder in Intervalle mit hoher, mittlerer und niedriger Konfidenz mithilfe von K-Means-Clustering mit K = 3 auf, gemäß dem im Abbildung 2 gezeigten konfidenzgeführten Assoziierungsworkflow. Bestimmen Sie die adaptiven Konfidenzschwellenwerte durch Minimierung der Varianz innerhalb der Cluster gemäß Gleichung 4.
    Symbolformel für statisches Gleichgewicht; J_conf=min Σ(sd-μ_i)^2; mathematische Optimierung.  (4)
    Hier bezeichnet sd den Konfidenzwert der Detektion d; D1, D2 und D3 bezeichnen die Intervalle mit hoher, mittlerer und niedriger Konfidenz, jeweils; μ1, μ2 und μ3 bezeichnen die mittleren Konfidenzwerte der drei Intervalle; und τ1 und τ2 bezeichnen die aus den K-Means-Clustering-Ergebnissen gewonnenen adaptiven Konfidenzschwellenwerte.
    HINWEIS: Das Skript zur Konfidenzunterteilung (scripts/formal_partition_confidence.py) ist im JerseyTrack-Quellcode-Repository verfügbar (https://doi.org/10.5281/zenodo.21274352). Das Konfidenzunterteilungsmodul verwendet ein eindimensionales K-Means-Clustering-Verfahren auf Basis von NumPy mit K = 3. Es ist keine separate Konfigurationsdatei erforderlich; das Eingabeverzeichnis, Ausgabeverzeichnis und der Clustering-Parameter werden über Befehlszeilenargumente angegeben. Führen Sie die Konfidenzunterteilung mit folgendem Befehl aus: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. Die erforderlichen Softwareabhängigkeiten, einschließlich der NumPy-Version, sind in environment.yml angegeben.
  3. Führen Sie die Konfidenzunterteilung mit dem Verzeichnis der Detektor-Ausgabe als Eingabe durch.
    HINWEIS: In dieser Studie war das Verzeichnis der Detektor-Ausgabe: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. Das Ausgabeverzeichnis der Konfidenzunterteilung war: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. Die generierten Ausgabedateien enthielten pro Sequenz die Konfidenz-CSV-Dateien, _confidence_frame_summary.csv und _confidence_runtime.csv.
  4. Weisen Sie jeder Detektion eine Konfidenzstufen-Bezeichnung zu. Kennzeichnen Sie Detektionen mit hoher Konfidenz für die bewegungsbasierte Assoziation, Detektionen mit mittlerer Konfidenz für die bewegungssemantische Assoziation und Detektionen mit niedriger Konfidenz ausschließlich für die Trajektorienrekonstruktion. Bewahren Sie den ursprünglichen Konfidenzwert zusammen mit der zugewiesenen Konfidenzstufen-Bezeichnung auf.
  5. Überprüfen Sie die Verteilungen der Konfidenzwerte und repräsentative Einzelbilder, wie in Abbildung 3 veranschaulicht. Stellen Sie sicher, dass Detektionen mit hoher Konfidenz vorwiegend vollständigen und zuverlässigen Begrenzungsrahmen der Athleten entsprechen, während Detektionen mit mittlerer und niedriger Konfidenz hauptsächlich unvollständige, verdeckte, unscharfe oder schwache Detektionen enthalten.
    HINWEIS: Das erwartete Ergebnis dieses Abschnitts ist eine Konfidenzunterteilungsdatei, die den Detektionsindex, den ursprünglichen Konfidenzwert, die zugewiesene Konfidenzstufe und die auf Ebene der Einzelbilder adaptiven Konfidenzschwellenwerte für jede Detektion enthält.

Videoanalyse basierend auf Vertrauen; Diagramm mit K-Means-Clustering und Intervallberechnungen zur Korrelation.
Abbildung 2. Strategie zur vertrauensbasierten Zuordnung. Der Arbeitsablauf unterteilt die Detektionsverlässlichkeit mithilfe eines adaptiven Vertrauens-Clustering in hohe, mittlere und niedrige Vertrauensintervalle. Zuordnungen bei hoher Verlässlichkeit erfolgen basierend auf Bewegungsähnlichkeit, bei mittlerer Verlässlichkeit anhand einer Kombination aus Bewegungs- und Trikot-Semantik-Ähnlichkeit, und bei niedriger Verlässlichkeit werden die Detektionen zur semantikunterstützten Trajektorienrekonstruktion unter Verwendung einer Mehrfrahmenverifikation genutzt. Das rechte Panel fasst die mathematische Formulierung zusammen, die für die Vertrauenseinteilung und -zuordnung verwendet wird. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Balkendiagramm zum Vergleich der Entscheidungsdosen bei Sportarten nach Konfidenzintervall; Fußball, Basketball, Volleyball.
Abbildung 3. Verteilung der Erkennungssicherheitswerte. Das Histogramm zeigt die Anzahl der Erkennungsfelder für Athleten innerhalb von fünf Konfidenzintervallen für die Sportarten Fußball, Basketball und Volleyball in den Sequenzen des SportsMOT-Datensatzes. Die Verteilung veranschaulicht Unterschiede in der Erkennungssicherheit zwischen den evaluierten Sportkategorien. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

5. Führen Sie eine vertrauensgeleitete Assoziation durch

  1. Laden Sie die Detektor-Ausgabedatei, die Datei mit semantischen Merkmalen und die Datei mit den Konfidenzpartitionen für jede Videosequenz. Initialisieren Sie den Tracker mithilfe der ersten gültigen Detektionen und verwalten Sie einen Trajektoriezustand für jeden verfolgten Athleten. Für jeden nachfolgenden Frame prognostizieren Sie die Position jeder bestehenden Trajektorie unter Verwendung des Bewegungsmodells des Kalman-Filters.
  2. Berechnen Sie die Bewegungsähnlichkeit zwischen jeder prognostizierten Trajektorie und der Kandidatendetektion unter Verwendung des Mahalanobis-Abstands, wie in Gleichung 5 definiert.
    Mathematische Formel für statisches Gleichgewicht, Gleichung: S_mot(t_i^k,d_j) mit Kovarianzmatrix.  (5)
    Hierbei bezeichnet statisches Gleichgewicht, ΣFx=0, ΣFy=0, Kräftegleichgewichtsdiagramm, physikalisches Konzept, Problemlösungstechnik die I-te Trajektorie im Frame k, Diagramm zum statischen Gleichgewicht, ΣFx=0, Darstellung von Kraftvektoren und Gleichgewicht, pädagogisches Physikdiagramm. den durch den Kalman-Filter prognostizierten Trajektoriezustand, dj die Kandidatendetektion, Gleichung zum statischen Gleichgewicht Σi^{-1}; Diagramm mit mathematischen Symbolen für den Bildungseinsatz. die inverse Kovarianzmatrix des prognostizierten Trajektoriezustands und Smot den Bewegungsabstand zwischen der prognostizierten Trajektorie und der Detektion.
    HINWEIS: Der Kern des Zuordnungsworkflows ist in jerseytrack/formal_tracker.py implementiert und wird über scripts/formal_track.py ausgeführt, beides verfügbar im JerseyTrack-Quellcode-Repository (https://doi.org/10.5281/zenodo.21274352). Es wird keine separate Konfigurationsdatei benötigt. Alle Laufzeitparameter, einschließlich der Konfidenzschwellen, maximale Track-Alter, Bewegungsgewichtskoeffizienten und Zentralabstandsgewicht, werden über Kommandozeilenargumente übergeben. Der vollständige Ausführungsbefehl und die Parameter sind in Schritt 6.2 angegeben. Die Implementierung verwendet den linearen Summenzuweisungsalgorithmus von SciPy für das ungarische Matching und NumPy für die kostenbasierte Zuordnung.
  3. Führen Sie den Tracking-Workflow mit der Detektor-Ausgabedatei, der Datei mit semantischen Merkmalen und der Datei mit den Konfidenzpartitionen als Eingaben aus.
    HINWEIS: In dieser Studie wurde der Kern-Tracker in jerseytrack\formal_tracker.py implementiert, und der Tracking-Workflow wurde mithilfe von scripts\formal_track.py ausgeführt.
  4. Ordnen Sie Detektionen mit hoher Konfidenz an bestehende Trajektorien unter Berücksichtigung der Bewegungskonsistenz zu. Aktualisieren Sie die übereinstimmenden Trajektorien und initialisieren Sie neue Trajektorien nur, wenn nicht zugeordnete Detektionen mit hoher Konfidenz die Kriterien für die Trajektorieninitialisierung erfüllen.
  5. Überprüfen Sie die in Abbildung 4 dargestellten Ergebnisse der semantischen Extraktion der Trikots und erstellen Sie für jede Detektion den semantischen Merkmalsvektor des Trikots, indem Sie den Teamfarb-Deskriptor und das Spielernummern-Merkmal gemäß Gleichung 6 kombinieren.
    fsem = [fcol;fid] (6)
    Hierbei bezeichnet fsem den fusionierten semantischen Merkmalsvektor, fcol den Teamfarb-Deskriptor und fid das vom OCR-Zweig generierte Spielernummern-Merkmal.
  6. Ordnen Sie Detektionen mit mittlerer Konfidenz durch Kombination der Bewegungsähnlichkeit mit der semantischen Trikot-Ähnlichkeit zu. Berechnen Sie die fusionierte Zuordnungspunktzahl gemäß Gleichung 7.
    Gleichung zur Fusion von Bewegungs- und semantischer Punktzahl, Sf=λ(Sm/max(Sm))+(1-λ)(1-Sem). (7)
    Hierbei bezeichnet Ssem die Kosinus-Ähnlichkeit zwischen den semantischen Merkmalsvektoren der Trajektorie und der Kandidatendetektion, Smot den in Gleichung 5 definierten Bewegungsabstand und λ den adaptiven Fusionskoeffizienten, der die Terme für Bewegungs- und semantische Ähnlichkeit ausbalanciert.
  7. Berechnen Sie den adaptiven Fusionskoeffizienten gemäß Gleichung 8.
    Statisches Gleichgewicht; λ=λ₀exp(-σsd/σmax); Formel im Zusammenhang mit Spannungsverteilung in Materialien. (8)
    Hierbei bezeichnet λ0 den initialen Bewegungsgewichtskoeffizienten, σsd die Standardabweichung der Konfidenz-Scores der Detektionen im aktuellen Frame und σmax die maximale Standardabweichung der Konfidenz-Scores, die zur Normalisierung verwendet wird.
  8. Verwenden Sie Detektionen mit niedriger Konfidenz ausschließlich zur Wiederherstellung von Trajektorien. Ordnen Sie Detektionen mit niedriger Konfidenz nur unterbrochenen Trajektorien zu, wenn semantische Informationen verfügbar sind und die Wiederherstellungskriterien erfüllt sind. Wenden Sie eine Mehr-Frames-Verifizierung an, bevor die Trajektorienidentität wiederhergestellt wird, und verwerfen Sie Detektionen, die die Verifizierung nicht bestehen.
    HINWEIS: Wenn das Merkmal der Spielernummer nicht verfügbar ist, führen Sie die Zuordnung unter Verwendung der verfügbaren semantischen Informationen und der Bewegungskonsistenz durch, anstatt eine Übereinstimmung der Spielernummer erzwingen zu wollen. Das erwartete Ergebnis dieses Abschnitts ist eine Frame-für-Frame-Tracking-Aufzeichnung, die Trajektorienidentitäten, Begrenzungsboxen, Konfidenzstufen, Bewegungskosten, semantische Informationen und endgültige Zuordnungsentscheidungen enthält. Im Überarbeitungsnachweis-Paket wurden die Tracking-Ergebnisse unter: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking gespeichert.

Diagramm zur Volleyballspielanalyse mit Spieler-Tracking-Daten für Leistungserkenntnisse
Abbildung 4. Extraktion semantischer Merkmale aus Trikots. Dargestellte Athletenerkennungen sind mit den extrahierten Beschreibungen der Teamfarben und der Spielerzahlen versehen, die vom Modul zur semantischen Trikotmerkmalsextraktion generiert wurden. Die extrahierten semantischen Merkmale werden anschließend in die vertrauensgeleitete Datenzuordnung integriert. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

6. Führen Sie die Bewegungsverfolgungsanalyse durch und exportieren Sie die Ergebnisse

  1. Führen Sie die Verfolgungsinferenz für jede Videosequenz unter Verwendung der vorbereiteten Dateien mit Detektorergebnissen, semantischen Merkmalen und Konfidenz-Partitionsdateien durch. Verarbeiten Sie die Videobilder in chronologischer Reihenfolge, damit die Zustände der Trajektorien, die semantische Historie und die Entscheidungen zur Trajektorienwiederherstellung während der gesamten Sequenz konsistent aktualisiert werden. Verwenden Sie dieselbe Inferenzkonfiguration für alle ausgewerteten Sequenzen, es sei denn, es wird ausdrücklich eine datensatzspezifische Einstellung angegeben.
    ANMERKUNG: Die Verfolgungsinferenz wurde mithilfe des Skripts formal_track.py ausgeführt, das im JerseyTrack-Quellcode-Repository verfügbar ist (https://doi.org/10.5281/zenodo.21274352). Eine separate Konfigurationsdatei ist nicht erforderlich. Führen Sie die Verfolgungsinferenz mit dem folgenden Befehl aus: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Alle nicht angegebenen Parameter behielten die Standardwerte, die im archivierten Quellcode festgelegt sind.
  2. Wenden Sie nach der Inferenz die primäre Nachbearbeitungssequenz mit den folgenden Befehlen an: python scripts/merge_tracklets.py und python scripts/sweep_track_filter.py --min-len 95.
  3. Exportieren Sie die Verfolgungsergebnisse im Format, das vom Evaluierungswerkzeug benötigt wird. Schließen Sie den Bildindex, die Trajektorienidentität, die Begrenzungsboxkoordinaten und alle Felder ein, die vom Benchmark-Evaluierungsformat gefordert werden. Speichern Sie eine Ergebnisdatei pro Sequenz unter Verwendung einer einheitlichen Benennungskonvention, sodass jede Ergebnisdatei der entsprechenden Ground-Truth-Anmerkungsdatei zugeordnet werden kann.
  4. Wenden Sie ausschließlich die in dieser Studie verwendeten Nachbearbeitungsschritte an. Führen Sie das Zusammenführen von Tracklets und das Filtern von Spuren mithilfe der in dem Überarbeitungspaket beschriebenen Nachbearbeitungsskripte durch.
    ANMERKUNG: In dieser Studie wurde der folgende Nachbearbeitungsworkflow verwendet:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Überprüfen Sie die exportierten Verfolgungsergebnisse vor der quantitativen Auswertung. Stellen Sie sicher, dass die Trajektorienidentitäten innerhalb jeder Sequenz numerisch und konsistent bleiben, dass keine Bildindizes fehlen und dass alle Begrenzungsboxen innerhalb der Bilddimensionen liegen.
    ANMERKUNG: Das erwartete Ergebnis dieses Abschnitts ist ein vollständiger Satz an sequenzbasierten Verfolgungsergebnisdateien, die zur quantitativen Evaluierung bereitstehen.

7. Bewertung der Verfolgungsleistung

  1. Werten Sie die exportierten Nachverfolgungs-Ergebnisdateien mithilfe des im Materialienverzeichnis aufgeführten Evaluierungstools aus. Ordnen Sie jede Nachverfolgungs-Ergebnisdatei der entsprechenden Ground-Truth-Anmerkungsdatei und Datensatz-Aufteilung zu. Verwenden Sie für alle verglichenen Methoden dieselbe Evaluierungskonfiguration, um sicherzustellen, dass Leistungsunterschiede auf den Nachverfolgungsergebnissen und nicht auf den Evaluierungseinstellungen beruhen.
  2. Führen Sie die Auswertung mit dem folgenden Befehl durch
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    HINWEIS: Die Auswertung wurde mit der standardmäßigen TrackEval-Metrikimplementierung (Version 1.3.0) durchgeführt, die im Reproduzierbarkeitspaket von JerseyTrack archiviert ist. Es wurden keine Änderungen an den Implementierungen der Higher Order Tracking Accuracy (HOTA), CLEAR oder Identitätsmetriken vorgenommen. Das Repository enthält die MOTChallenge-artige Ausführungsumgebung unter evaluation/trackeval/scripts/run_mot_challenge.py, die die Pfade für Datensatz und Ergebnisse konfiguriert und die standardmäßigen TrackEval-Auswertungsmetriken aufruft.
  3. Notieren Sie die in der Publikation angegebenen Evaluierungsmetriken, darunter Multiple Object Tracking Accuracy (MOTA), IDentity F1 Score (IDF1), Higher Order Tracking Accuracy (HOTA), Detektionsgenauigkeit (DetA), Assoziationsgenauigkeit (AssA), falsch positive (FPs), falsch negative (FNs) sowie Identitätswechselereignisse. Exportieren Sie die Evaluierungszusammenfassung als Tabelle und bewahren Sie die pro Sequenz vorliegenden Evaluierungsdateien zur Überprüfung auf.
  4. Vergleichen Sie JerseyTrack mit Baseline-Methoden unter Verwendung derselben Datensatz-Aufteilung, Detektor-Ausgaben und Evaluierungskonfiguration für alle Methoden. Notieren Sie den Datensatz, die Quelle der Detektor-Ausgaben, die Konfiguration des Evaluierungstools sowie die Metrikwerte für jeden Vergleich.
  5. Überprüfen Sie die Evaluierungs-Logs, um sicherzustellen, dass alle Sequenzen erfolgreich ausgewertet wurden und keine Nachverfolgungs-Ergebnisdateien fehlen.
    HINWEIS: In dieser Studie wurde die primäre TrackEval-Zusammenfassungsdatei gespeichert unter: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. Das erwartete Ergebnis dieses Abschnitts ist eine vollständige Zusammenfassungstabelle der Evaluierung zusammen mit den metrischen Dateien pro Sequenz, die die berichteten Ergebnisse unterstützen und eine nachträgliche Überprüfung ermöglichen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Dieser Abschnitt berichtet über die quantitativen und qualitativen Ergebnisse, die aus den evaluierten Experimenten zum Mehrfachobjekt-Tracking im Sport gewonnen wurden. Die Ergebnisse konzentrieren sich auf die Genauigkeit des Trackings, die Erhaltung der Identität, die Qualität der Zuordnung und die Robustheit unter den getesteten Datensatzeinstellungen. Leistungsbehauptungen beschränken sich auf die evaluierten Methoden, Datensätze, Detektorausgaben und die Konfiguration des Evaluierungstools, wie sie im Protokoll und...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Diese Studie evaluierte einen vertrauensbasierten Sport-MOT-Workflow, der die Aufteilung nach Erkennungsvertrauen mit semantischen Trikotmerkmalen kombiniert. Vertrauensbasierte Zuordnung und semantische Merkmalsfusion wurden als komplementäre Strategien zur Verbesserung der Datenzuordnung beim Mehrfachobjekt-Tracking untersucht12,20,23,24,46. Die Ergebnisse z...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren erklären, dass sie keine finanziellen Interessenkonflikte haben.

Danksagungen

Die Autoren haben keine Danksagungen zu machen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
CUDA-LaufzeitumgebungNVIDIAVersion 12.8GPU-Rechenlaufzeitumgebung, die für das Training des Detektors, die semantische Merkmalsextraktion und die Verfolgungsinferenz verwendet wird.
EasyOCRJaided AIVersion 1.7.2Optische Zeichenerkennungstoolbox, die zur Erkennung von Spielernummern verwendet wird.
JerseyTrack-QuellcodeAutorenN/VBenutzerdefinierte Implementierung, die die Datenaufbereitung, semantische Merkmalsextraktion, Konfidenzpartitionierung, Verfolgung, Nachbearbeitung und Bewertungsskripte enthält. Verfügbar unter: https://doi.org/10.5281/zenodo.21274352
Leichtgewichtiger CRNN-OCR-ModellAutorenN/VBenutzerdefiniertes faltendes rekurrentes neuronales Netzwerk (CRNN), das zur Erkennung von Spielernummern verwendet wird.
MOT17-DatensatzMOTChallengeN/VÖffentlicher Benchmark-Datensatz, der für die Querdatensatzevaluation verwendet wird. Verfügbar unter: https://motchallenge.net/data/MOT17/
MOT20-DatensatzMOTChallengeN/VÖffentlicher Benchmark-Datensatz, der für die Querdatensatzevaluation verwendet wird. Verfügbar unter: https://motchallenge.net/data/MOT20/
motmetricsmotmetrics-EntwicklerVersion 1.4.0Bibliothek zur Berechnung diagnostischer Metriken für die Mehrfachobjektverfolgung.
NVIDIA-GPUNVIDIAGeForce RTX 5090 D V2Graphikverarbeitungseinheit, die für das Training des Detektors und die Verfolgungsinferenz verwendet wird.
NVIDIA-GPU-TreiberNVIDIAVersion 610.62GPU-Treiber, der in der experimentellen Umgebung verwendet wird.
NumPyNumPy-EntwicklerVersion 2.4.4Numerische Rechenbibliothek, die für die Merkmalsverarbeitung und Datenverwaltung verwendet wird.
OpenCVOpenCVVersion 4.10.0Bibliothek für maschinelles Sehen, die zum Laden, Zuschneiden, Vorverarbeiten und Visualisieren von Bildern verwendet wird.
PythonPython Software FoundationVersion 3.12.2Programmiersprache, die im gesamten Workflow verwendet wird.
PyTorchPyTorch FoundationVersion 2.11.0+cu128Tiefenlern-Framework, das für die Implementierung des Detektors und des semantischen Modells verwendet wird.
scikit-learnscikit-learn-EntwicklerVersion 1.9.0Machine-Learning-Bibliothek, die für das K-Means-Clustering während der Trikotfarben-Extraktion und Konfidenzpartitionierung verwendet wird.
SoccerNet-VerfolgungsdatensatzSoccerNetN/VÖffentlicher Fußball-Verfolgungsbenchmark, der für die Querdatensatzevaluation verwendet wird. Verfügbar unter: https://www.soccer-net.org/tasks/tracking
SportsMOT-DatensatzSportsMOT-BenchmarkN/VPrimärer Benchmark-Datensatz, der für die Detektorvorbereitung und Verfolgungsbewertung verwendet wird. Verfügbar unter: https://deeperaction.github.io/datasets/sportsmot.html
TeamTrack-DatensatzTeamTrack-BenchmarkN/VÖffentlicher Sportverfolgungsbenchmark, der für die Querdatensatzevaluation verwendet wird. Verfügbar unter: https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch FoundationVersion 0.26.0+cu128Bibliothek für maschinelles Sehen, die zusammen mit PyTorch für Bildtransformationen und Modellunterstützung verwendet wird.
TrackEvalTrackEval-EntwicklerVersion 1.3.0Bewertungstoolkit zur Berechnung der Genauigkeit der Mehrfachobjektverfolgung (MOTA), des ID-F1-Scores (IDF1), der höhergradigen Verfolgungsgenauigkeit (HOTA), der Detektionsgenauigkeit (DetA), der Assoziationsgenauigkeit (AssA), falsch positiver (FP), falsch negativer (FN) und Identitätswechsel (IDs).
UltralyticsUltralyticsVersion 8.4.90Objekterkennungs-Framework, das zum Training des Detektors und zur Generierung von Athletenerkennungen verwendet wird.

Referenzen

  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Tags

Konfidenzgesteuertes TrackingSpielertrajektorieBewegungsähnlichkeitTrikotfarbeoptische ZeichenerkennungIdentitätskonsistenzSportsMOT-Datensatz