Das Mehrfachobjekt-Tracking (MOT) ermöglicht eine kontinuierliche Lokalisierung von Objekten und die Beibehaltung ihrer Identität in Videosequenzen und unterstützt die Extraktion von Athletentrajektorien, taktische Analysen sowie automatisierte statistische Auswertungen in Anwendungen mit Sportvideos1,2,3. Zuverlässige visuelle Informationen sind zudem mit sportartspezifischen Entscheidungsprozessen und der Leistungsbewertung in der Sportwissenschaft verknüpft, was den Wert stabiler, aus Videos gewonnener Bewegungsdaten für nachgeschaltete sportliche Analysen weiter unterstreicht4. In sportlichen Szenarien hängt die Zuverlässigkeit taktischer Daten von der Kontinuität der Verfolgungstrajectorien und der Konsistenz der Zielidentitäten ab.
Im Vergleich zu allgemeinen MOT-Szenarien enthalten Sportvideos schnelle Richtungswechsel, abrupte Stopps, Sprünge, dichte Interaktionen und häufige Verdeckungen. Diese Faktoren verursachen erhebliche Schwankungen der Vertrauenswürdigkeit der Erkennungsboxen und erhöhen die Häufigkeit von Erkennungen mit geringer Zuverlässigkeit, was die Zuordnung von Trajektorien unterbrechen kann5,6. Einheitliche Teamtrikots verringern zudem die Unterscheidungsfähigkeit allgemeiner Erscheinungsmerkmale und erhöhen die Identitätsverwirrung zwischen optisch ähnlichen Teammitgliedern7,8. Wenn Verdeckungen und Ähnlichkeit im Erscheinungsbild in derselben Sequenz auftreten, nimmt die Erkennungszuverlässigkeit ab und die Erscheinungsinformationen des Ziels werden unvollständig, wodurch die Schwierigkeit der Trajektorienzuordnung und der Identitätserhaltung zunimmt9,10. In der mehrfachen Objektverfolgung (MOT) bezeichnet die Wiedererkennung (Re-ID) den Prozess, bei dem dieselbe Zielidentität über mehrere Bilder, Verdeckungsphasen oder Wiedereintrittssituationen hinweg anhand identitätsbezogener visueller Merkmale zugeordnet wird. In Videos von Mannschaftssportarten können allgemeine Re-ID-Merkmale geschwächt sein, da Athleten derselben Mannschaft oft ähnliche Trikots und Körperformen aufweisen. Die technische Literaturübersicht zeigt, dass Trajektorienbrüche und Identitätsverwirrungen in der Sport-MOT üblicherweise durch zwei komplementäre Ansätze angegangen werden: die Nutzung der Erkennungszuverlässigkeit und die Verbesserung der Identitätsmerkmale. JerseyTrack positioniert sich an der Schnittstelle dieser Ansätze, indem es die Verwendung semantischer Trikotmerkmale je nach Qualität der Erkennung reguliert, anstatt Farb- und Spielernummerninformationen einheitlich auf alle Erkennungen anzuwenden.
Die vorliegende Studie stellt JerseyTrack vor, eine vertrauensbasierte Methode zur mehrfachen Objektverfolgung (MOT) im Sport, die auf der semantischen Fusion von Trikotmerkmalen basiert. Die Methode ist für Videos von Mannschaftssportarten konzipiert, bei denen Athleten sichtbare Trikots tragen und die Detektionsergebnisse Begrenzungsboxen mit Vertrauenswerten liefert. JerseyTrack kombiniert vier Hauptkomponenten: Athletendetektion, vertrauensbasierte Gruppeneinteilung, Extraktion semantischer Trikotmerkmale und kaskadierte inter-frame-Verknüpfung. Die Vertrauenswerte der Detektion werden verwendet, um die erkannten Objekte adaptiv in Gruppen mit hohem, mittlerem und niedrigem Vertrauen einzuteilen, die jeweils mit unterschiedlichen Verknüpfungsstrategien verarbeitet werden. Detektionen mit hohem Vertrauen werden vorrangig über Bewegungsinformationen verknüpft, während bei Detektionen mit mittlerem und niedrigem Vertrauen zusätzlich Trikotfarbe und Spielernummern berücksichtigt werden, um die Identitätssicherung zu verbessern, wenn die visuellen Hinweise schwach sind. Die Methode ist für die Analyse von Sportvideos gedacht, die stabile Athletentrajektorien erfordern, beispielsweise für taktische Analysen oder die Interpretation des Spielerverhaltens.
Der vorgeschlagene Ansatz weist ebenfalls betriebliche Einschränkungen auf. Die semantische Extraktion von Trikots kann durch starke Verdeckung, Bewegungsunschärfe, niedrige Bildauflösung, abnormale Trikotpositionen oder unsichtbare Spielernummern beeinträchtigt werden. In solchen Fällen können die trikotbasierten semantischen Hinweise unvollständig werden, wodurch der Assoziierungsprozess stärker auf Bewegungskonsistenz und Mehrbildverifizierung angewiesen ist. Die Leistungsbehauptungen dieser Studie gelten daher nur für die ausgewerteten Datensätze und experimentellen Rahmenbedingungen. Experimente auf dem SportsMOT-Datensatz zeigen, dass JerseyTrack die bewerteten Tracking-Metriken verbessert und die Anzahl von Identitätswechseln unter den getesteten Sport-Tracking-Bedingungen verringert. Die Hauptschwierigkeit des Mehrfachobjekt-Trackings (MOT) in Sportvideos liegt darin, die Trajektorienkontinuität und Identitätskonsistenz bei schnellen Bewegungen, Verdeckungen und ähnlicher Erscheinung aufrechtzuerhalten. Bestehende Studien im Zusammenhang mit JerseyTrack lassen sich grob in zwei Forschungsrichtungen einteilen: die Nutzung der Detektionszuverlässigkeit für die Trajektorienzuordnung und die Verbesserung von Identitätshinweisen durch sportartspezifische semantische Merkmale.
Die Erkennungskonfidenz wird häufig verwendet, um die Zuverlässigkeit von Erkennungsboxen abzuschätzen und die Trajektorienzuordnung in der Mehrfachobjektverfolgung (MOT) zu steuern. Frühe Verfolgungsmethoden behandelten die Konfidenz meist als binäres Filterkriterium, bei dem Erkennungen unterhalb einer festen Schwelle entfernt wurden, um Falschpositiv-Ergebnisse zu reduzieren11,12. Diese Strategie verringert verrauschte Erkennungen, kann jedoch auch echte Ziele bei Verdeckung, schneller Bewegung oder geringer Bildqualität verwerfen, was zu einer Fragmentierung der Trajektorien führt13,14,15. Ähnliche Filterstrategien haben außerdem gezeigt, dass feste Konfidenzschwellen empfindlich gegenüber Szenenvariationen und der Qualität der Erkennung sind16,17. Um die Nutzung von Erkennungen mit niedriger Konfidenz zu verbessern, führte ByteTrack eine Zuordnungsstrategie ein, die Erkennungsboxen mit niedriger Konfidenz als Kandidaten für eine sekundäre Zuordnung beibehält und sie mithilfe von Bewegungsähnlichkeit und Trajektorienverlauf mit bestehenden Trajektorien verknüpft18. McByte erweitert diese Zuordnung für Sport-MOT weiter, indem zeitlich fortgepflanzte Segmentierungsmasken als zusätzlicher Hinweis für die Zuordnung integriert werden, wodurch die Robustheit bei schneller Bewegung, Verdeckung und Kameraverschiebung verbessert wird, ohne zusätzliches Training pro Video zu erfordern19. Verwandte Studien haben ebenfalls die Nutzung von Erkennungen mit niedriger Konfidenz angepasst, um schwache, aber potenziell gültige Ziele während der Zuordnung zu erhalten20,21,22. Konfidenzadaptive Zuordnungsstrategien haben daraufhin die Zuordnungskriterien basierend auf Bewegungskonsistenz und Erkennungszuverlässigkeit verfeinert23,24,25. Methoden zur Trajektorienverbesserung, die auf der Regressionsanalyse von Erkennungsboxen und der Optimierung der Trajektorienglättung basieren, wurden ebenfalls eingesetzt, um die Fragmentierung von Trajektorien zu reduzieren26,27,28. Zusätzliche Verfeinerungsstrategien liefern ergänzende Unterstützung, um die Kontinuität der Trajektorien unter komplexen Bewegungsbedingungen aufrechtzuerhalten29. Der zeitlich kohärente Objektfluss modelliert zudem die objektbasierte zeitliche Konsistenz über mehrere Bilder hinweg und stellt einen weiteren, auf die Zuordnung ausgerichteten Ansatz zur Verringerung von Trajektorienunterbrechungen in komplexen MOT-Szenarien bereit30. Tracker-Fusionsmethoden lernen aus den Ausgaben mehrerer Tracker und nutzen lernbasierte Selektions- oder Fusionsstrategien, um die Robustheit der Verfolgung über verschiedene MOT-Benchmarks hinweg zu verbessern31. Insgesamt zeigen diese Studien, dass eine konfidenzbewusste Zuordnung dabei hilft, unterbrochene Trajektorien wiederherzustellen. Allerdings liefern Konfidenz- und Bewegungshinweise nur begrenzte Identitätsinformationen, wenn Spieler derselben Mannschaft ein ähnliches visuelles Erscheinungsbild aufweisen. Obwohl diese Methoden die Trajektorienfragmentierung in allgemeinen Szenarien effektiv verringern, stoßen sie in Sportkontexten an inhärente Grenzen, da Spieler derselben Mannschaft oft ein sehr ähnliches visuelles Erscheinungsbild haben und eine alleinige Orientierung an Konfidenz- und Bewegungsinformationen keine ausreichende Grundlage für die Unterscheidung von Identitäten bietet32,33,34. Selbst wenn Erkennungsboxen mit niedriger Konfidenz effektiv reidentifiziert werden, kann die Ähnlichkeit der Merkmale weiterhin zu Identitätswechseln führen, was die Erfüllung der strengen Anforderungen an die Identitätskonsistenz in der Sportanalyse erschwert.
Sportartspezifische Identitätsmerkmale wurden ebenfalls verwendet, um die Identitätsdiskriminierung bei der Athletenverfolgung zu verbessern. Semantische Informationen des Trikots, wie Mannschaftsfarbe und Spielernummer, liefern Identitätsmerkmale, die direkter mit Sportzenarien verknüpft sind als allgemeine Erscheinungseigenschaften35,36,37. Die Trikotfarbe wurde genutzt, um die Unterscheidung auf Mannschaftsebene zu unterstützen und Verwechslungen zwischen Mannschaften zu reduzieren, während die Erkennung der Spielernummer einen feiner abgestuften Identitätsanhaltspunkt bietet, wenn der Nummernbereich sichtbar und lesbar ist38,39. Bestehende Studien zur Sportverfolgung haben domänenspezifische visuelle Merkmale und die Erkennung von Trikotfarben integriert, um die Zuordnung von Spielern unter überfüllten Sportbedingungen zu verbessern40,41. Arbeiten zur Erkennung von Trikotnummern und synthetischen Nummerndaten unterstützen zudem die Identitätsmodellierung unter Bedingungen niedriger Auflösung oder teilweiser Verdeckung42,43. Diese Studien zeigen, dass Trikotsemantik die Identitätsrepräsentation im sportlichen Mehrfachobjekt-Tracking (MOT) stärken kann. Die meisten semantikbasierten Verfolgungsmethoden modellieren jedoch nicht ausreichend den Zusammenhang zwischen Detektionsvertrauen und der Qualität semantischer Merkmale. Detektionen mit hohem Vertrauen enthalten möglicherweise bereits zuverlässige räumliche und visuelle Informationen, wodurch eine wiederholte semantische Extraktion weniger effizient wird. Detektionen mit niedrigem Vertrauen leiden oft unter Verdeckung, Unschärfe, Abschneidung oder niedriger Auflösung, was die Zuverlässigkeit von Farb- und Spielernummernmerkmalen verringert. Diese Einschränkung motiviert ein vertrauensgeleitetes Zuordnungsdesign, bei dem Trikotsemantik entsprechend der Detektionsqualität eingeführt wird, anstatt einheitlich auf alle Detektionen angewendet zu werden. Die ausgewerteten Studien zeigen, dass vertrauensbasierte Zuordnung und semantische Trikotmodellierung unterschiedliche Aspekte des sportlichen MOT adressieren. Strategien basierend auf Vertrauen bestimmen hauptsächlich, ob eine Detektion an der Zuordnung teilnehmen soll und wie sie mit bestehenden Trajektorien abgeglichen werden soll, während semantische Trikotstrategien die Identitätsrepräsentation primär durch sportartspezifische Merkmale verbessern. Diese beiden Mechanismen werden jedoch oft als separate Komponenten konzipiert. Dadurch werden semantische Merkmale nicht immer entsprechend der Detektionsqualität angepasst, und Vertrauensniveaus regulieren nicht direkt die Nutzung von Farb- und Spielernummerinformationen während der Zuordnung. Diese Trennung begrenzt die gemeinsame Bewältigung von Trajektorienbrüchen und Identitätsverwirrung in Videos von Mannschaftssportarten. Die verbleibende Forschungslücke besteht darin, die Bewertung der Detektionsvertrauensqualität mit der semantischen Trikotzuordnung innerhalb desselben Tracking-Workflows zu verknüpfen.