Методическая статья

Метод многообъектного трекинга в спортивных видео с использованием семантического слияния номеров на джерси и управления на основе уверенности

DOI:

10.3791/71557

14 августа 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном протоколе описывается рабочий процесс многообъектного трекинга в спортивных видеороликах с использованием оценки уверенности, который интегрирует информацию о цвете формы и номерах игроков для улучшения ассоциации траекторий и обеспечения согласованности идентификации в условиях колебаний уверенности, окклюзии и визуального сходства внешнего вида спортсменов.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Многообъектное отслеживание (MOT) в спортивных видеороликах предоставляет информацию о траекториях для тактического анализа, интерпретации поведения игроков и автоматизированного статистического анализа. Однако спортивные сценарии часто характеризуются резкими сменами направления, внезапными остановками, частыми перекрытиями объектов и визуальным сходством игроков одной команды, что приводит к колебаниям достоверности детектирования и путанице идентификаторов при межфреймовой ассоциации. Для решения этих проблем в данной работе представлен JerseyTrack — метод спортивного MOT с адаптивным управлением на основе достоверности и семантического слияния данных о форме игроков. Рабочий процесс адаптивно разделяет рамки детектирования на интервалы высокой, средней и низкой достоверности в соответствии с распределением достоверности в каждом кадре. Детектирования с высокой достоверностью ассоциируются преимущественно с использованием сходства движения, в то время как для детектирований со средней и низкой достоверностью дополнительно используются признаки цвета формы и номера игрока, извлеченные с помощью кластеризации по цвету и облегченной модели оптического распознавания символов (OCR). Эти семантические признаки объединяются с информацией о движении в процессе дополнительного сопоставления для повышения непрерывности траекторий и согласованности идентификаторов. Метод был протестирован на наборе данных SportsMOT. JerseyTrack достиг показателей 88,9% по точности многообъектного отслеживания (MOTA), 74,3% по F1-мере идентификации (IDF1) и 69,9% по точности отслеживания высшего порядка (HOTA), что демонстрирует улучшение качества трекинга в оцениваемых условиях спортивного отслеживания. Данный протокол представляет собой воспроизводимый алгоритм интеграции ассоциации с управлением по достоверности и семантической информации о форме для улучшения многообъектного отслеживания в спортивных видеороликах.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Многообъектное отслеживание (MOT) обеспечивает непрерывную локализацию объектов и сохранение их идентичности в видеопоследовательностях, что позволяет извлекать траектории перемещения спортсменов, проводить тактический и автоматизированный статистический анализ в приложениях для анализа спортивного видео1,2,3. Достоверная визуальная информация также связана с принятием решений в конкретных видах спорта и оценкой эффективности в спортивной науке, что дополнительно подчеркивает ценность стабильных данных о движении, полученных из видео, для последующего спортивного анализа4. В спортивных сценариях надежность тактических данных зависит от непрерывности траекторий отслеживания и согласованности идентификаторов целей.

По сравнению с общими сценариями MOT, спортивные видео содержат резкие изменения направления, внезапные остановки, прыжки, плотные взаимодействия и частые перекрытия. Эти факторы вызывают значительные колебания уверенности в определении ограничивающих рамок (detection-box confidence) и увеличивают частоту обнаружений с низкой степенью уверенности, что может привести к разрыву ассоциации траекторий5,6. Одинаковая командная форма дополнительно снижает дискриминационную способность общих признаков внешнего вида и увеличивает вероятность путаницы с идентификаторами визуально похожих товарищей по команде7,8. Когда перекрытие и сходство внешнего вида происходят в одной последовательности, уверенность в обнаружении снижается, а информация о внешнем виде объекта становится неполной, что затрудняет ассоциацию траекторий и поддержание идентификатора9,10. В MOT повторная идентификация (Re-ID) представляет собой процесс сопоставления одного и того же идентификатора объекта в разных кадрах, периоды перекрытия или случаи повторного появления с использованием визуальных доказательств, связанных с личностью. В видеозаписях командных видов спорта общие признаки Re-ID могут быть ослаблены, поскольку спортсмены одной команды часто имеют схожую форму и телосложение. Обзор технической литературы показывает, что фрагментация траекторий и путаница с идентификаторами в спортивном MOT обычно решаются с помощью двух взаимодополняющих подходов: использования уверенности в обнаружении и усиления признаков идентификации. JerseyTrack расположен на пересечении этих подходов, регулируя использование семантических признаков формы в зависимости от качества обнаружения, а не применяя информацию о цвете и номере игрока единообразно ко всем обнаружениям.

В данном исследовании представлен JerseyTrack — метод многообъектного трекинга (MOT) в спорте с использованием guidance-механизма на основе доверительных интервалов и семантического слияния данных о форме. Метод разработан для видеозаписей командных видов спорта, где атлеты одеты в заметную форму, а результаты детектирования предоставляют ограничивающие рамки с показателями уверенности (confidence scores). JerseyTrack объединяет четыре основных компонента: детектирование атлетов, разделение по уровню уверенности, извлечение семантических признаков формы и каскадную межквадровую ассоциацию. Степень уверенности детектирования используется для адаптивного разделения обнаруженных объектов на группы с высокой, средней и низкой уверенностью, которые обрабатываются с помощью различных стратегий ассоциации. Объекты с высокой уверенностью ассоциируются преимущественно на основе информации о движении, тогда как для объектов со средней и низкой уверенностью дополнительно используются данные о цвете формы и номере игрока для более стабильного сохранения идентификатора при недостаточных визуальных данных. Данный метод предназначен для задач анализа спортивного видео, требующих стабильных траекторий атлетов, таких как тактический анализ и интерпретация поведения игроков.

Предложенный подход также имеет эксплуатационные ограничения. На семантическое извлечение данных с формы могут влиять сильные окклюзии, размытие при движении, низкое разрешение изображения, аномальные позы игроков или невидимые номера на форме. В таких случаях семантические признаки формы могут оказаться неполными, и процесс ассоциации будет в большей степени опираться на согласованность движения и многокадровую верификацию. Таким образом, заявления о производительности в данном исследовании ограничены оценочными наборами данных и экспериментальными условиями. Эксперименты на наборе данных SportsMOT показывают, что JerseyTrack улучшает оцениваемые метрики трекинга и сокращает количество событий переключения идентификаторов (identity-switching) в протестированных условиях спортивного отслеживания. Основная сложность MOT в спортивных видео заключается в поддержании непрерывности траектории и согласованности идентификаторов при быстром движении, окклюзиях и сходстве внешнего вида. Существующие исследования, имеющие отношение к JerseyTrack, можно в целом разделить на два направления: использование достоверности детектирования для ассоциации траекторий и усиление идентификационных признаков с помощью специфических для спорта семантических характеристик.

Доверительная оценка детектирования широко используется для оценки надежности ограничивающих рамок (bounding boxes) и управления ассоциацией траекторий в задачах многообъектного слежения (MOT). Ранние методы трекинга обычно рассматривали уверенность как бинарный критерий фильтрации, при котором детекции ниже фиксированного порога удалялись для сокращения числа ложноположительных срабатываний11,12. Такая стратегия уменьшает количество зашумленных детектий, но может привести к отбраковке истинных целей при окклюзии, быстром движении или низком качестве изображения, что вызывает фрагментацию траекторий13,14,15. Аналогичные стратегии фильтрации также показали, что фиксированные пороги уверенности чувствительны к изменениям сцены и качеству детектирования16,17. Для более эффективного использования детекций с низкой уверенностью в ByteTrack была представлена стратегия ассоциации, которая сохраняет рамки с низкой уверенностью в качестве потенциальных целей для вторичного сопоставления и связывает их с существующими траекториями на основе сходства движения и истории траекторий18. McByte далее расширяет возможности ассоциации в спортивном MOT, используя временно распространяемые маски сегментации в качестве признака ассоциации, что повышает робастность в условиях быстрого движения, окклюзий и смещения камеры без необходимости дополнительного обучения для каждого видео19. В смежных исследованиях также корректировалось использование детекций с низкой уверенностью для сохранения слабых, но потенциально валидных целей в процессе ассоциации20,21,22. Стратегии ассоциации с адаптивной уверенностью в дальнейшем уточнили критерии сопоставления в соответствии с согласованностью движения и надежностью детектирования23,24,25. Методы уточнения траекторий, основанные на регрессии ограничивающих рамок и оптимизации плавности траекторий, также применялись для снижения фрагментации траекторий26,27,28. Дополнительные стратегии уточнения обеспечивают вспомогательную поддержку для поддержания непрерывности траекторий в условиях сложного движения29. Временно когерентный поток объектов дополнительно моделирует временную согласованность на уровне объектов между кадрами, предлагая еще один ориентированный на ассоциацию подход для сокращения разрывов траекторий в сложных сценариях MOT30. Методы слияния трекеров также обучаются на выходных данных нескольких трекеров и используют стратегии выбора или слияния на основе обучаемых моделей для повышения робастности трекинга в различных бенчмарках MOT31. В совокупности эти исследования показывают, что ассоциация с учетом уверенности помогает восстанавливать прерванные траектории; однако признаки уверенности и движения предоставляют ограниченную информацию об идентичности, когда игроки одной команды имеют схожий внешний вид. Хотя эти методы эффективно уменьшают фрагментацию траекторий в общих сценариях, они сталкиваются с внутренними ограничениями в спортивных условиях, поскольку игроки одной команды часто имеют очень похожее визуальное представление, и опора исключительно на информацию об уверенности и движении не может обеспечить достаточную основу для дифференциации личностей32,33,34. Даже при эффективном восстановлении рамок с низкой уверенностью сходство признаков все равно может привести к перепутыванию идентификаторов (identity switching), что затрудняет соблюдение строгих требований к согласованности идентификации, необходимых для спортивного анализа.

Для улучшения дискриминации личностей при отслеживании атлетов также использовались специфические для спорта идентификационные признаки. Семантическая информация о форме, такая как цвет команды и номер игрока, дает идентификационные подсказки, которые более непосредственно связаны со спортивными сценариями, чем общие эмбеддинги внешнего вида35,36,37. Цвет формы использовался для поддержки дискриминации на уровне команд и снижения путаницы между командами, в то время как распознавание номера игрока обеспечивает более точный идентификационный признак, когда область с номером видна и читаема38,39. В существующих исследованиях по спортивному трекингу применялись специфические для данной области визуальные признаки и распознавание цвета формы для улучшения ассоциации игроков в условиях скопления людей на спортивных площадках40,41. Соответствующие работы по распознаванию номеров на форме и синтетическим данным о номерах дополнительно поддерживают моделирование личности в условиях низкого разрешения или частичного перекрытия42,43. Эти исследования показывают, что семантика формы может усилить представление личности в спортивном MOT. Однако большинство методов трекинга с семантическим усилением недостаточно моделируют связь между достоверностью детектирования и качеством семантических признаков. Детектирования с высокой достоверностью могут уже содержать надежную пространственную информацию и информацию о внешнем виде, что делает повторное извлечение семантики менее эффективным. Детектирования с низкой достоверностью часто страдают от перекрытий, размытия, обрезания или низкого разрешения, что снижает надежность признаков цвета и номера игрока. Это ограничение обосновывает разработку ассоциации под руководством достоверности, при которой семантика формы вводится в зависимости от качества детектирования, а не применяется единообразно ко всем объектам. Рассмотренные исследования показывают, что ассоциация с учетом достоверности и семантическое моделирование формы решают разные аспекты спортивного MOT. Стратегии на основе достоверности в основном определяют, должно ли детектирование участвовать в ассоциации и как оно должно быть сопоставлено с существующими траекториями, в то время как стратегии семантики формы прежде всего улучшают представление личности с помощью специфических для спорта признаков. Однако эти два механизма часто проектируются как отдельные компоненты. В результате семантические признаки не всегда корректируются в соответствии с качеством детектирования, а уровни достоверности не регулируют напрямую использование информации о цвете и номере игрока во время ассоциации. Такое разделение ограничивает совместную обработку фрагментации траекторий и путаницы личностей в видеозаписях командных видов спорта. Оставшийся исследовательский пробел заключается в связывании оценки качества достоверности детектирования с семантической ассоциацией формы в рамках одного рабочего процесса трекинга.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Данное исследование включало вторичный анализ общедоступных эталонных видеодатасетов, а именно SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 и MOT20. Участники не привлекались, вмешательств не проводилось, новые данные о людях не собирались. Одобрение комитета по этике для данного исследования не требовалось в соответствии с применимыми институциональными требованиями Университета Бангкок Тонбури.

В данном протоколе описан рабочий процесс, использованный для воспроизведения JerseyTrack, начиная от подготовки данных и заканчивая оценкой качества трекинга. Рабочий процесс включает подготовку набора данных, подготовку детектора, семантическое извлечение номеров на майках, разделение по уровням достоверности, ассоциацию с учетом достоверности, выполнение трекинга и оценку производительности, как обобщено в Рисунок 1Необходимое программное обеспечение, наборы данных и аппаратные ресурсы перечислены в Таблица материалов.

figure-protocol-1
Рисунок 1. Общая схема работы метода JerseyTrack. Рабочий процесс состоит из извлечения семантических признаков формы, первоначального сопоставления объектов, дополнительного сопоставления с учетом степени достоверности и объединения признаков. Признаки цвета команды и номера игрока извлекаются из обнаруженных областей атлетов и включаются в процесс ассоциации для улучшения сопоставления траекторий в условиях неопределенности детектирования. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

1. Подготовка наборов данных и структуры каталогов

  1. Загрузите общедоступные эталонные наборы данных, перечисленные в Таблице материалов. Используйте SportsMOT в качестве основного набора данных для подготовки детектора и оценки трекинга. Сохраните TeamTrack, SoccerNet Tracking, MOT17 и MOT20 для кросс-датасетной оценки.
  2. Храните все наборы данных в едином каталоге проекта. Убедитесь, что детектор, модуль семантического извлечения, модуль трекинга и инструментарий оценки используют идентичные идентификаторы последовательностей.
  3. Преобразуйте официальные аннотации SportsMOT в формат обучения детектора, используя скрипт подготовки данных, примененный в данном исследовании. Выполните следующую команду:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. Скрипт подготовки данных (scripts/prepare_data.py) доступен в репозитории исходного кода JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Необходимые программные зависимости указаны в файле environment.yml, включая Python 3.12, PyTorch 2.11.0 и OpenCV 4.10 или более поздней версии. Настройте программную среду с помощью следующей команды: conda env create -f environment.yml. Запустите скрипт подготовки данных с помощью следующей команды: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Убедитесь, что в результате преобразования созданы файл конфигурации для обучения детектора: data\processed\SportsMOT_yolo\data.yaml и манифест преобразования: data\processed\SportsMOT_yolo\conversion_manifest.csv.
    ПРИМЕЧАНИЕ: В данном исследовании преобразованный обучающий и валидационный наборы данных SportsMOT содержали 90 последовательностей, 55 544 кадра и 608 152 аннотированных объекта.
  6. Просмотрите репрезентативные последовательности, чтобы убедиться, что порядок кадров, координаты ограничивающих рамок и метки идентификаторов соответствуют оригинальным эталонным аннотациям.
  7. Сохраняйте преобразованные файлы аннотаций без изменений на протяжении всего процесса подготовки детектора, инференса трекинга и оценки, чтобы все методы использовали один и тот же раздел данных и протокол оценки.
    ПРИМЕЧАНИЕ: Ожидаемым результатом этого раздела является стандартизированный каталог обучения детектора SportsMOT, содержащий преобразованные аннотации, манифест преобразования и файлы разделения данных, необходимые для подготовки детектора и оценки трекинга.

2. Подготовка выходов детектора

  1. Выполните тонкую настройку детектора объектов, используя подготовленный обучающий набор данных SportsMOT. Оптимизируйте детектор, используя функцию потерь классификации и функцию потерь регрессии ограничивающих рамок, определенные в Уравнении 1. Используйте разрешение входных данных детектора, размер пакета, скорость обучения, количество эпох обучения и другие параметры обучения, указанные в описании настройки реализации и в Таблице материалов
    Ldet = Lcls + Lbox   (1)
    Здесь  Ldet  обозначает общие потери детектора, Lcls  — потери классификации, а Lbox  — потери регрессии ограничивающих рамок.
    ПРИМЕЧАНИЕ: Контрольная точка детектора, использованная в основных экспериментах (внутренний идентификатор эксперимента e3), была обучена с использованием фреймворка Ultralytics YOLO с конфигурацией набора данных SportsMOT в формате YOLO (data/processed/SportsMOT_yolo/data.yaml). Запустите обучение детектора с помощью следующей команды: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. После обучения используйте полученную наилучшую контрольную точку для генерации результатов работы детектора для валидационных последовательностей с помощью следующей команды: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. После обучения сохраните контрольную точку обученного детектора, соответствующий файл метаданных и лог обучения.
    ПРИМЕЧАНИЕ: В данном исследовании контрольная точка детектора, использованная для формальных экспериментов, была сохранена как:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. Соответствующий файл метаданных был сохранен как: outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. Директория с выходными данными детектора, использованная для основных экспериментов по валидации SportsMOT, была: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Запустите обученный детектор для каждой валидационной последовательности, чтобы создать ограничивающие рамки атлетов и определить показатели уверенности. Экспортируйте один файл детекции для каждой последовательности, содержащий индекс кадра, координаты ограничивающей рамки, уверенность детекции и метку класса.
    ПРИМЕЧАНИЕ: В ходе валидационного запуска SportsMOT, использованного в основных экспериментах, порог уверенности 0.05 позволил получить 343 990 детекций атлетов.
  4. Проверьте директорию с выходными данными детектора перед запуском инференса трекинга. Убедитесь, что для каждой последовательности существует соответствующий файл детекции, что индексы кадров совпадают с подготовленной последовательностью изображений и что каждая запись о детекции содержит показатель уверенности.
    ПРИМЕЧАНИЕ: Ожидаемым результатом данного раздела является полностью заполненная директория выходных данных детектора, которая служит входными данными для семантического извлечения формы, разделения по уровням уверенности и ассоциации при трекинге.

3. Извлечение семантических признаков джерси

  1. Используйте файлы вывода детектора для обрезки областей с атлетами из каждого кадра видео. Сохраните каждое обрезанное изображение атлета с его идентификатором последовательности, индексом кадра и индексом детектирования. Исключите некорректные фрагменты с отсутствующим содержимым изображения или ограничивающими рамками, выходящими за границы изображения. Сохраняйте связь между именем файла фрагмента и соответствующей записью о детектировании, чтобы извлеченные семантические признаки могли быть сопоставлены с соответствующим детектированием при ассоциации трекинга.
  2. Извлеките признаки цвета формы с обрезанных изображений атлетов, используя скрипт семантического извлечения, примененный в данном исследовании.
    ПРИМЕЧАНИЕ: Скрипты извлечения семантических признаков (scripts/extract_fast_color_semantics.py и scripts/formal_extract_semantics.py) доступны в репозитории исходного кода JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Отдельный конфигурационный файл не требуется; все параметры выполнения передаются через аргументы командной строки.
    Сгенерируйте дескрипторы цвета формы с помощью следующей команды: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Сгенерируйте семантические признаки номеров игроков с помощью модели OCR следующей командой: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. Сгенерированные дескрипторы цвета формы и выходные данные по вероятности номеров игроков связываются по идентификатору последовательности и объединяются в файлы семантических признаков, используемые при ассоциации трекинга.
  3. Преобразуйте каждое обрезанное изображение атлета в цветовое пространство HSV (Hue, Saturation, Value — цвет, насыщенность, яркость). Извлеките пиксели переднего плана из области формы и определите доминирующий цвет формы с помощью кластеризации K-means при K = 3. Перед сравнением признаков нормализуйте полученный цветовой дескриптор с помощью L2-нормализации.
  4. Обучите ветку распознавания номеров игроков, используя обрезанные изображения атлетов с входным размером 128 × 64 пикселей. Сгенерируйте псевдометки номеров игроков, используя процедуру маркировки со слабым контролем, примененную в данном исследовании. Исключите из расчета функции потерь оптического распознавания символов (OCR) фрагменты, где области с номерами игроков невидимы, нечитаемы, сильно перекрыты или имеют низкую степень достоверности.
  5. Оптимизируйте ветку OCR, используя перекрестную энтропию потерь, определенную в Уравнении 2.
    figure-protocol-2 (2)
    Здесь Locr обозначает потери OCR, yi  обозначает контролируемую метку номера игрока, а figure-protocol-3 обозначает предсказанную категорию номера игрока.
  6. Оптимизируйте модуль извлечения семантических признаков, используя адаптивный оптимизатор, скорость обучения, размер пакета, затухание весов и продолжительность обучения, указанные в Таблице материалов. Объедините потери детектора и потери OCR, используя общую цель обучения, определенную в Уравнении 3.
    Ltotal = Ldet + γLocr   (3)
    Здесь Ltotal обозначает общие потери при обучении, Ldet обозначает потери детектора, определенные в Уравнении 1, Locr обозначает потери OCR, определенные в Уравнении 2, а γ обозначает заданный пользователем весовой коэффициент для потерь OCR.
  7. Примените обученную ветку OCR к каждому обрезанному изображению атлета. Сохраните предсказанную категорию номера игрока или вектор вероятностей для каждого фрагмента. Если номер игрока не виден или достоверность OCR ниже порога, определенного в реализации, отметьте признак номера игрока как недоступный, вместо того чтобы принудительно делать предсказание.
  8. Объедините цветовой дескриптор формы и выходные данные по номеру игрока в файл семантических признаков, используемый модулем трекинга.
    ПРИМЕЧАНИЕ: В основном валидационном прогоне SportsMOT скрипт семантического извлечения обработал 343 990 детектирований без пропущенных кадров или некорректных фрагментов. В текущем пакете ревизии в отчете о семантическом извлечении указана общая точность извлечения семантики цвета и OCR 86,7% в исследуемых условиях SportsMOT. Ожидаемым результатом данного раздела является файл семантических признаков, в котором каждая запись о валидном детектировании связана с цветовым дескриптором формы, данными о номере игрока (при их наличии) и флагом, указывающим на доступность семантической информации для ассоциации трекинга.

4. Уровни достоверности обнаружения разделений

  1. Загрузите файл с результатами работы детектора для каждой видеопоследовательности. Соберите показатели уверенности (confidence scores) для всех обнаружений спортсменов в каждом кадре.
  2. Разделите показатели уверенности на уровне кадров на интервалы высокой, средней и низкой уверенности, используя кластеризацию K-means с K = 3, следуя рабочему процессу ассоциации с учетом уверенности, показанному на Рисунке 2. Определите адаптивные пороги уверенности путем минимизации внутрикластерной дисперсии в соответствии с Уравнением 4.
    figure-protocol-4  (4)
    Здесь sd обозначает показатель уверенности обнаружения d; D1, D2 и D3 обозначают интервалы высокой, средней и низкой уверенности соответственно; μ1, μ2 и μ3 обозначают средние показатели уверенности для трех интервалов; а  τ1 и  τ2 обозначают адаптивные пороги уверенности, полученные в результате кластеризации K-means.
    ПРИМЕЧАНИЕ: Скрипт разделения уверенности (scripts/formal_partition_confidence.py) доступен в репозитории исходного кода JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Модуль разделения уверенности использует одномерную процедуру кластеризации K-means на базе NumPy с K = 3. Отдельный файл конфигурации не требуется; входной каталог, выходной каталог и параметр кластеризации указываются через аргументы командной строки. Выполните процедуру разделения уверенности с помощью следующей команды: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. Необходимые программные зависимости, включая версию NumPy, указаны в файле environment.yml.
  3. Запустите процедуру разделения уверенности, используя каталог с результатами работы детектора в качестве входных данных.
    ПРИМЕЧАНИЕ: В данном исследовании каталогом с результатами работы детектора был: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. Выходным каталогом разделения уверенности был: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. Сгенерированные выходные файлы включали CSV-файлы уверенности для каждой последовательности, _confidence_frame_summary.csv и _confidence_runtime.csv.
  4. Присвойте метку уровня уверенности каждому обнаружению. Пометьте обнаружения с высокой уверенностью для ассоциации на основе движения, с средней уверенностью — для семантической ассоциации на основе движения, а с низкой уверенностью — только для восстановления траектории. Сохраните исходный показатель уверенности вместе с присвоенной меткой уровня уверенности.
  5. Изучите распределение показателей уверенности и репрезентативные кадры, как показано на Рисунке 3. Убедитесь, что обнаружения с высокой уверенностью преимущественно соответствуют полным и надежным ограничивающим рамкам спортсменов, тогда как обнаружения со средней и низкой уверенностью в основном содержат частичные, перекрытые, размытые или слабые обнаружения.
    ПРИМЕЧАНИЕ: Ожидаемым результатом этого раздела является файл разделения уверенности, содержащий индекс обнаружения, исходный показатель уверенности, присвоенный уровень уверенности и адаптивные пороги уверенности на уровне кадров для каждого обнаружения.

figure-protocol-5
Рисунок 2. Стратегия ассоциации на основе доверительных интервалов. Рабочий процесс разделяет уверенность детектирования на интервалы высокой, средней и низкой степени уверенности с помощью адаптивной кластеризации уверенности. Детектирования с высокой степенью уверенности ассоциируются с использованием сходства движения, с средней степенью уверенности — с использованием комбинированного сходства движения и семантики формы, а детектирования с низкой степенью уверенности используются для семантически поддерживаемого восстановления траекторий с многокадровой верификацией. На правой панели приведена сводка математических формул, используемых для разделения уверенности и ассоциации. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-protocol-6
Рисунок 3. Распределение показателей уверенности детектирования. Гистограмма отображает количество рамок детектирования спортсменов в пяти интервалах уверенности для последовательностей футбола, баскетбола и волейбола в наборе данных SportsMOT. Распределение иллюстрирует различия в уверенности детектора по оцениваемым категориям видов спорта. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

5. Запуск ассоциации с руководством по достоверности

  1. Загрузите файл с выходными данными детектора, файл семантических признаков и файл разделения по уровню уверенности для каждой видеопоследовательности. Инициализируйте трекер, используя первые достоверные детектирования, и поддерживайте одно состояние траектории для каждого отслеживаемого атлета. Для каждого последующего кадра прогнозируйте положение каждой существующей траектории, используя модель движения фильтра Калмана.
  2. Рассчитайте сходство движения между каждой прогнозируемой траекторией и кандидатским детектированием, используя расстояние Махаланобиса, определенное в Уравнении 5.
    figure-protocol-7  (5)
    Здесь figure-protocol-8 обозначает I-ю траекторию в кадре k, figure-protocol-9 обозначает состояние траектории, предсказанное фильтром Калмана, dj обозначает кандидатское детектирование, figure-protocol-10 обозначает обратную ковариационную матрицу состояния предсказанной траектории, а Smot обозначает расстояние движения между предсказанной траекторией и детектированием.
    ПРИМЕЧАНИЕ: Основной рабочий процесс ассоциации реализован в jerseytrack/formal_tracker.py и выполняется через scripts/formal_track.py; оба файла доступны в репозитории исходного кода JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Отдельный конфигурационный файл не требуется. Все параметры выполнения, включая пороги уверенности, максимальный возраст трека, коэффициенты веса движения и вес расстояния между центрами, передаются через аргументы командной строки. Полная команда выполнения и настройки параметров приведены в Шаге 6.2. В реализации используется алгоритм линейного суммарного назначения SciPy для венгерского метода сопоставления и NumPy для ассоциации на основе стоимости.
  3. Запустите процесс трекинга, используя в качестве входных данных файл с выходными данными детектора, файл семантических признаков и файл разделения по уровню уверенности.
    ПРИМЕЧАНИЕ: В данном исследовании основной трекер был реализован в jerseytrack\formal_tracker.py, а рабочий процесс трекинга выполнялся с помощью scripts\formal_track.py.
  4. Свяжите детектирования с высоким уровнем уверенности с существующими траекториями, используя согласованность движения. Обновляйте сопоставленные траектории и инициируйте новые траектории только в том случае, если несопоставленные детектирования с высоким уровнем уверенности удовлетворяют критериям инициализации траектории.
  5. Ознакомьтесь с результатами семантического извлечения элементов формы, показанными на Рисунке 4, и сформируйте вектор семантических признаков формы для каждого детектирования, объединив дескриптор цвета команды и признак номера игрока согласно Уравнению 6.
    fsem = [fcol;fid] (6)
    Здесь fsem  обозначает объединенный вектор семантических признаков, fcol обозначает дескриптор цвета команды, а fid обозначает признак номера игрока, созданный ветвью OCR.
  6. Свяжите детектирования со средним уровнем уверенности, объединив сходство движения с семантическим сходством формы. Рассчитайте объединенную оценку сопоставления согласно Уравнению 7.
    figure-protocol-11 (7)
    Здесь Ssem обозначает косинусное сходство между векторами семантических признаков траектории и кандидатского детектирования, Smot обозначает расстояние движения, определенное в Уравнении 5, а λ обозначает адаптивный коэффициент объединения, балансирующий члены сходства движения и семантического сходства.
  7. Рассчитайте адаптивный коэффициент объединения согласно Уравнению 8.
    figure-protocol-12 (8)
    Здесь λ обозначает начальный коэффициент веса движения, σsd обозначает стандартное отклонение оценок уверенности детектирования в текущем кадре, а σmax обозначает максимальное стандартное отклонение оценки уверенности, используемое для нормализации.
  8. Используйте детектирования с низким уровнем уверенности только для восстановления траектории. Сопоставляйте детектирования с низким уровнем уверенности с прерванными траекториями только при наличии семантической информации и соблюдении критериев восстановления. Применяйте многокадровую верификацию перед восстановлением идентификатора траектории и отбраковывайте детектирования, не прошедшие проверку.
    ПРИМЕЧАНИЕ: Если признак номера игрока недоступен, выполняйте ассоциацию, используя имеющуюся семантическую информацию и согласованность движения, вместо принудительного сопоставления по номеру игрока. Ожидаемым результатом этого раздела является покадровая запись трекинга, содержащая идентификаторы траекторий, ограничивающие рамки, метки уровня уверенности, стоимость движения, семантическую информацию и окончательные решения по ассоциации. В пакете доказательств пересмотренной версии результаты трекинга были сохранены по адресу: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

figure-protocol-13
Рисунок 4. Извлечение семантических признаков формы. Репрезентативные детекции спортсменов аннотированы извлеченными дескрипторами цвета команды и информацией о номере игрока, сгенерированными модулем семантического извлечения данных формы. Извлеченные семантические признаки впоследствии включаются в процесс ассоциации данных под руководством оценки достоверности. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

6. Запуск вывода трекинга и экспорт результатов

  1. Выполните вывод трекинга для каждой видеопоследовательности, используя подготовленные файлы вывода детектора, файлы семантических признаков и файлы разделения уверенности. Обрабатывайте кадры видео в хронологическом порядке, чтобы состояния траекторий, семантическая история и решения по восстановлению траекторий обновлялись последовательно на протяжении всей последовательности. Используйте одну и ту же конфигурацию вывода для всех оцениваемых последовательностей, если явно не указаны настройки для конкретного набора данных.
    ПРИМЕЧАНИЕ: Вывод трекинга выполнялся с помощью скрипта scripts/formal_track.py, который доступен в репозитории исходного кода JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Отдельный конфигурационный файл не требуется. Выполните вывод трекинга с помощью следующей команды: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Для всех неуказанных параметров были сохранены значения по умолчанию, зафиксированные в архивном исходном коде.
  2. После выполнения вывода примените основную последовательность постобработки с помощью следующих команд: python scripts/merge_tracklets.py и python scripts/sweep_track_filter.py --min-len 95.
  3. Экспортируйте результаты трекинга в формате, требуемом инструментарием для оценки. Включите индекс кадра, идентификатор траектории, координаты ограничивающей рамки и все поля, необходимые для формата оценки бенчмарка. Сохраните один файл с результатами трекинга для каждой последовательности, используя единообразное соглашение об именовании файлов, чтобы каждый файл с результатами можно было сопоставить с соответствующим файлом разметки ground-truth.
  4. Применяйте только те операции постобработки, которые использовались в данном исследовании. Выполните слияние треклетов и фильтрацию треков с помощью скриптов постобработки, описанных в пакете ревизии.
    ПРИМЕЧАНИЕ: В данном исследовании в рабочем процессе постобработки использовались следующие скрипты:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Проверьте экспортированные результаты трекинга перед количественной оценкой. Убедитесь, что идентификаторы траекторий остаются числовыми и согласованными внутри каждой последовательности, что индексы кадров не пропущены и что все ограничивающие рамки находятся в пределах границ изображения.
    ПРИМЕЧАНИЕ: Ожидаемым результатом этого раздела является полный набор файлов с результатами трекинга на уровне последовательностей, готовых к количественной оценке.

7. Оценка эффективности отслеживания

  1. Оцените экспортированные файлы с результатами трекинга с помощью инструментария для оценки, указанного в Таблице материалов. Сопоставьте каждый файл с результатами трекинга с соответствующим файлом разметки истинных значений (ground-truth) и разделом набора данных. Используйте одну и ту же конфигурацию оценки для всех сравниваемых методов, чтобы убедиться, что различия в производительности обусловлены результатами трекинга, а не настройками оценки.
  2. Запустите оценку с помощью следующей команды:
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    ПРИМЕЧАНИЕ: Оценка проводилась с использованием стандартной реализации метрик TrackEval (версия 1.3.0), заархивированной в пакете воспроизводимости JerseyTrack. Модификации реализации метрик Higher Order Tracking Accuracy (HOTA), CLEAR или Identity не вносились. Репозиторий включает обертку для выполнения в стиле MOTChallenge, расположенную по адресу evaluation/trackeval/scripts/run_mot_challenge.py, которая настраивает пути к набору данных и результатам, а также вызывает стандартные метрики оценки TrackEval.
  3. Зафиксируйте метрики оценки, представленные в рукописи, включая точность многообъектного трекинга (MOTA), показатель F1 для идентификации (IDF1), точность трекинга высокого порядка (HOTA), точность детектирования (DetA), точность ассоциации (AssA), количество ложноположительных результатов (FPs), ложноотрицательных результатов (FNs) и событий переключения идентификаторов. Экспортируйте сводку оценки в виде таблицы и сохраните файлы оценки по каждой последовательности для последующей проверки.
  4. При сравнении JerseyTrack с базовыми методами используйте один и тот же раздел набора данных, выходные данные детектора и конфигурацию оценки для всех методов. Зафиксируйте набор данных, источник выходных данных детектора, конфигурацию инструментария оценки и значения метрик для каждого сравнения.
  5. Проверьте логи оценки, чтобы убедиться, что все последовательности оценены успешно и что файлы с результатами трекинга отсутствуют.
    ПРИМЕЧАНИЕ: В данном исследовании основной файл сводки TrackEval хранился по адресу: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. Ожидаемым результатом этого раздела является полная сводная таблица оценки вместе с файлами метрик по каждой последовательности, подтверждающими представленные результаты и последующую верификацию.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном разделе представлены количественные и качественные результаты, полученные в ходе экспериментов по многообъектному трекингу в спортивных сценариях. Результаты сосредоточены на точности отслеживания, сохранении идентификации объектов, качестве ассоциации и устойчивости в условиях протестированных наборов данных. Заявления о производительности ограничены оцененными методами, наборами данных, выходными данными детекторов и конфигурацией инструментария оценки, описанными в разделе «Протокол и настройка реализации».

Экспериментальная установка и план оценки

Набор данных и предварительная обработка:

SportsMOT использовался в качестве основного эталона для подготовки детектора, вывода трекинга и количественной оценки. Набор данных содержит 240 видеопоследовательностей и более 150 000 кадров изображений, охватывающих сценарии футбола, баскетбола и волейбола (Рисунок 5). При формальной оценке основные результаты SportsMOT рассчитывались с использованием валидационной выборки, а также выходов детектора, конфигурации трекинга и настроек TrackEval, описанных в протоколе. Междатасетная оценка проводилась на TeamTrack, SoccerNet Tracking, MOT17 и MOT20 для изучения переноса производительности между различными типами наборов данных, а не для прямого сравнения метрик между датасетами.

figure-results-1
Рисунок 5. Репрезентативные наборы данных, использованные для оценки. Примеры кадров демонстрируют репрезентативные последовательности футбола, баскетбола и волейбола, использованные для экспериментальной оценки. На рисунке показаны различия в ракурсе камеры, плотности игроков и сложности сцен в оцениваемых наборах данных. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Данные SportsMOT были организованы в соответствии с официальной структурой набора данных и преобразованы в формат обучения детектора, описанный в Протоколе. Преобразованные обучающие и валидационные данные SportsMOT содержали 90 последовательностей, 55 544 кадра и 608 152 аннотированных объекта. Обучающая выборка использовалась для подготовки детектора и настройки параметров, в то время как валидационная выборка применялась для формальной оценки трекинга, представленной в данном исследовании. Все входные кадры были масштабированы в соответствии с конфигурацией детектора, указанной в Протоколе и Таблице материалов. Одна и та же процедура предобработки применялась при подготовке детектора, извлечении семантических признаков, логическом выводе трекинга и оценке с помощью TrackEval, чтобы представленные различия в первую очередь отражали стратегию ассоциации трекинга, а не различия в обработке данных.

Показатели оценки:

Эффективность отслеживания оценивали с помощью протокола оценки, совместимого с MOTChallenge, который был реализован с использованием инструментария для оценки, указанного в таблице материалов. Представленные метрики описывают три аспекта эффективности MOT в спорте: общую точность отслеживания, сохранение идентификации и качество детектирования и ассоциации. В качестве основных метрик оценки использовали MOTA, IDF1 и HOTA44,45. MOTA объединяет ложноположительные результаты, ложноотрицательные результаты и смены идентификаторов в общий показатель точности отслеживания. IDF1 измеряет согласованность между предсказанными траекториями и истинными идентификаторами. HOTA совместно оценивает точность детектирования и точность ассоциации, и, следовательно, характеризует баланс между локализацией цели и ассоциацией траекторий. DetA и AssA приводились в качестве дополнительных метрик. FPs, FNs и смены идентификаторов (IDs) использовались для характеристики источников ошибок, связанных с ложными обнаружениями, пропусками детектирования и сменами идентификации. Для сравнения методов на наборе данных SportsMOT использовали одинаковые выходные данные детектора и конфигурацию инструментария оценки, чтобы снизить влияние вариативности детектора и различий в настройках оценки. Для сравнения между разными наборами данных значения метрик интерпретировались как результаты оценки внутри конкретного набора данных, а не как доказательство абсолютного превосходства в эффективности между различными наборами данных.

Экспериментальная среда и конфигурация параметров:

Эксперименты проводились с использованием аппаратных и программных ресурсов, перечисленных в Таблице материалов. На протяжении всех основных экспериментов SportsMOT использовались одни и те же вычислительная среда, платформа детектирования, выходные данные детектора и инструментарий оценки для обеспечения согласованности при подготовке детектора, логическом выводе трекинга и оценке производительности. Платформа детектирования, указанная в Таблице материалов, была обучена с использованием размера пакета 16, начальной скорости обучения 0,01 и 80 эпох обучения. В модуле семантического извлечения данных о форме для кластеризации цветов использовался метод K-средних с K = 3, а в ветке OCR — легковесная сверточно-рекуррентная нейронная сеть с входным размером 128 × 64 пикселя. Ветка OCR была оптимизирована с помощью адаптивного оптимизатора, указанного в Таблице материалов, при скорости обучения 1 × 10⁻3, коэффициенте затухания весов 1 × 10⁻5, размере пакета 64 и 40 эпохах обучения. При обучении модуля извлечения семантических признаков дополнительное планирование скорости обучения не применялось. Коэффициент взвешивания потерь OCR (γ) рассматривался как определяемый пользователем гиперпараметр и выбирался в соответствии с производительностью на валидационной выборке. Для стратификации уровней достоверности использовалось адаптивное разделение методом K-средних, при котором τ₁ и τ₂ рассчитывались на основе распределения достоверности детектирования для каждого кадра, а не задавались вручную перед логическим выводом.

Отслеживание эффективности в различных видах спорта и при разной сложности сценариев

Количественные показатели при различных спортивных сценариях и условиях:

Эффективность трекинга оценивалась по двум групповым факторам: категории спорта и сложности сцены. Анализ по категориям спорта включал последовательности действий в футболе, баскетболе и волейболе. При анализе сложности сцены учитывались уровень окклюзии, скорость движения и плотность объектов, используя одни и те же критерии группировки для всех оцениваемых последовательностей. Представленные показатели соответствуют протоколу оценки, описанному в разделе 7 «Протокол». 

Рисунок 6 обобщает результаты количественного трекинга для различных категорий спорта и условий сложности сцены. На рисунке 6A представлены показатели MOTA и DetA для последовательностей с футболом, баскетболом и волейболом. На рисунке 6B показано изменение MOTA при различных уровнях окклюзии, скорости движения и плотности объектов. На рисунке 6C представлены накопленные значения FP и FN для каждого измерения сложности сцены.

figure-results-2
Рисунок 6. Эффективность трекинга в различных спортивных категориях и условиях сцены. (A) Точность многообъектного трекинга (MOTA) и точность детектирования (DetA) для футбола, баскетбола, волейбола и общий средний показатель. (B) MOTA в репрезентативных условиях сцены с различными уровнями окклюзии, плотностью игроков и сложностью движения. (C) Количество ложноположительных (FPs) и ложноотрицательных (FNs) результатов в оцениваемых условиях сцены. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

В трех категориях видов спорта JerseyTrack достиг среднего значения MOTA 88,9% и среднего DetA 80,2%. Разница в MOTA между категориями видов спорта составила 1,3 процентных пункта: самый высокий показатель MOTA наблюдался для последовательностей волейбола (89,2%), а самый низкий — для последовательностей баскетбола (87,9%). Более низкое значение MOTA для баскетбольных последовательностей согласуется с более высокой частотой взаимодействий на коротком расстоянии и плотными окклюзиями в оцениваемых последовательностях. В условиях менее сложных сцен, включая легкую окклюзию, низкую скорость движения и разреженное распределение целей, MOTA составил 91,8%, 93,1% и 93,8% соответственно. В условиях более сложных сцен MOTA снизился до 84,9% при сильной окклюзии, до 83,6% при высокоскоростном движении и до 83,1% при плотном распределении целей. Эти результаты показывают, что эффективность трекинга снижалась по мере увеличения сложности сцены, оставаясь при этом в пределах заявленного диапазона для всех оцениваемых спортивных сценариев.

Отслеживание согласованности в репрезентативных спортивных сценариях:

Рисунок 7 представляет репрезентативные примеры трекинга, иллюстрирующие временную стабильность JerseyTrack в трех сложных спортивных сценариях: интенсивном взаимодействии игроков, длительной частичной окклюзии и резких изменениях направления движения. В этих репрезентативных последовательностях трекер сохранял согласованность идентификаторов траекторий, несмотря на частое перекрытие атлетов и динамику движения. Фрагментация идентификаторов наблюдалась преимущественно при сильной окклюзии или в моменты временного отсутствия семантических данных о джерси; однако стратегия ассоциации на основе оценки уверенности позволила восстановить траектории после появления надежных детекций. Эти репрезентативные примеры качественно подтверждают количественные результаты, представленные на Рисунке 6, демонстрируя стабильное сохранение идентификаторов в оцениваемых условиях спортивного трекинга.

figure-results-3
Рисунок 7. Репрезентативные результаты трекинга, полученные с помощью JerseyTrack. Последовательные кадры из записей баскетбола, футбола и волейбола иллюстрируют сохранение идентификации и траекторий спортсменов в процессе трекинга. Цветные ограничивающие рамки обозначают отслеживаемые объекты, идентификация которых сохраняется в последовательных кадрах видео. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Результаты абляции для сохранения идентичности:

Был проведен абляционный анализ для изучения вклада стратегии ассоциации с учетом уверенности и модуля семантического слияния джерси в сохранение идентичности. Сравнивались четыре варианта модели: V0 — базовая модель без ассоциации с учетом уверенности и семантического слияния джерси; V1 — вариант, использующий только ассоциацию с учетом уверенности; V2 — вариант, использующий только семантическое слияние джерси; и V3 — полная конфигурация JerseyTrack, включающая оба компонента. Оценка была сосредоточена на метриках, связанных с идентичностью, включая IDs, IDF1, точность идентификации (IDP) и полноту идентификации (IDR). Репрезентативные паттерны сохранения идентичности показаны на Рисунке 8.

figure-results-4
Рисунок 8. Абляционный анализ семантической ассоциации джерси с руководством по уверенности. (A) Общее количество переключений идентификаторов (IDs) и показатель F1-меры идентификации (IDF1) для оцениваемых вариантов модели. (B) Сравнение IDs между полной моделью (V3) и базовой конфигурацией (V0) в репрезентативных сложных сценариях отслеживания. (C) IDF1, точность идентификации (IDP) и полнота идентификации (IDR) полной модели в различных сценариях отслеживания. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

В общих условиях валидации SportsMOT полная конфигурация V3 обеспечила наименьшее количество ID и наивысший показатель IDF1 среди четырех вариантов модели. Для V3 было зафиксировано 2 768 ID, что на 477 меньше переключений идентификаторов, чем у V0, а значение IDF1 составило 74,3%, что на 7,1 процентного пункта выше, чем у V0. Эти результаты указывают на то, что оба модуля совместно способствовали сохранению идентификации в оцениваемых условиях спорного трекинга. Сравнение вариантов с одним модулем с полной конфигурацией дополнительно показало, что два модуля влияли на разные источники ошибок трекинга. Стратегия ассоциации с учетом уверенности (confidence-guided association) позволила сократить ошибки сопоставления, связанные с нестабильной уверенностью детектирования и неопределенностью локализации, в то время как модуль семантического слияния джерси (jersey semantic fusion module) предоставлял дополнительную информацию об идентификаторе в случаях, когда данных о движении было недостаточно. Полная конфигурация V3 продемонстрировала лучшие показатели сохранения идентификации, чем любой из вариантов с одним модулем, что свидетельствует о взаимодополняющем, а не избыточном вкладе обоих модулей.

Результаты на уровне сценариев продемонстрировали более значительные различия в более сложных условиях сохранения идентификации. При длительном перекрытии V3 зафиксировал 215 ID по сравнению с 482 для V0. В сценариях с высокой плотностью игроков одной команды (от 6 до 10 игроков) V3 зафиксировал 328 ID по сравнению с 615 для V0. При резких изменениях направления движения на высокой скорости V3 зафиксировал 482 ID по сравнению с 960 для V0. Данное снижение соответствует предполагаемому использованию семантических подсказок при перекрытии и плотных взаимодействиях, а также ассоциации на основе доверительного интервала при колебаниях уверенности детектирования во время быстрого движения. Тенденции IDP и IDR, показанные на Рисунке 8C, указывают на то, что сокращение количества ID не сопровождалось существенным снижением точности идентификации (identity precision) или полноты идентификации (identity recall). Полная конфигурация поддерживала значения IDF1 выше 71% во всех оцениваемых сложных сценариях, при этом более низкие значения наблюдались при плотных взаимодействиях игроков одной команды и резких изменениях направления движения на высокой скорости. Эти результаты свидетельствуют об улучшении согласованности идентификации в исследованных условиях, при этом плотные взаимодействия и быстрое движение остаются основными причинами снижения производительности.

Результаты кросс-датасетной оценки:

Была проведена перекрестная оценка на различных наборах данных, чтобы проверить, сохранится ли поведение трекинга, наблюдаемое на SportsMOT, в условиях разных датасетов. Оценка включала два специализированных спортивных набора данных, SoccerNet Tracking и TeamTrack, а также два общих набора данных для MOT — MOT17 и MOT20. Целью данного эксперимента было изучение переноса производительности между различными типами наборов данных. Результаты не использовались для утверждения о прямом превосходстве на уровне метрик между датасетами, так как протоколы аннотирования, композиция сцен, ракурсы камер и категории объектов различаются.

Таблица 1 обобщает результаты кросс-датасетной оценки. На специализированных спортивных датасетах JerseyTrack продемонстрировал относительно стабильные значения MOTA и IDF1 по сравнению с основной валидационной настройкой SportsMOT. Эта тенденция указывает на то, что стратегия ассоциации под руководством доверия (confidence-guided association) и семантические признаки, связанные с джерси, оставались эффективными, когда сцены трекинга сохраняли визуальные характеристики командного спорта, включая повторяющуюся форму, плотное взаимодействие спортсменов и частые окклюзии. На общих датасетах MOT метод сохранил конкурентоспособные значения MOTA и DetA, в то время как IDF1 был ниже, чем на специализированных спортивных датасетах. Такая закономерность согласуется с отсутствием признаков цвета джерси и номеров игроков в MOT17 и MOT20, которые используются модулем семантического слияния. В этих условиях компонент ассоциации под руководством доверия оставался применимым, в то время как семантическая ветвь предоставляла меньше специфической информации об идентичности, чем в видео с командным спортом. В целом, эти результаты показывают, что JerseyTrack более эффективно переносится на датасеты, содержащие специфическую для спорта визуальную семантику, чем на общие датасеты для трекинга пешеходов. Таким образом, кросс-датасетная оценка подтверждает целевое применение метода в качестве трекера, ориентированного на спорт, и одновременно определяет отсутствие явной семантики джерси как ограничивающий фактор для общих датасетов MOT.

Набор данныхMOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86.871.377.932.1
TeamTrack86.270.777.332.8
MOT1784.769.576.133.9
MOT2084.168.975.333.2

Таблица 1: Результаты оценки на различных наборах данных. Показатели эффективности JerseyTrack, оцененные на четырех общедоступных эталонных наборах данных. Представлены точность многообъектного отслеживания (MOTA), F1-мера идентификации (IDF1), точность детектирования (DetA) и скорость обработки, измеренная в кадрах в секунду (FPS). Более высокие значения MOTA, IDF1, DetA и FPS свидетельствуют о лучшей производительности.

Устойчивость в условиях контролируемого возмущения

Для изучения стабильности JerseyTrack в условиях типичных визуальных помех и нарушений качества детектирования, характерных для спортивных видеозаписей, были проведены эксперименты с контролируемым внесением возмущений. Исследуемые возмущения были разделены на три категории: возмущения семантических признаков, возмущения рамок детектирования и внешние (средовые) возмущения. Возмущения семантических признаков включали перекрытие номера игрока, размытие изображения, снижение разрешения и схожие цвета джерси. Возмущения рамок детектирования включали смещение ограничивающей рамки, колебания уверенности детектирования и ложноположительные рамки детектирования. Внешние возмущения включали шум, имитирующий дождь, деградацию изображения, имитирующую туман, сильное освещение и помехи от теней. На рисунке 9 обобщены результаты работы трекера в данных условиях возмущений. При воздействии возмущений семантических признаков эффективность трекинга снижалась по мере ухудшения видимости номера игрока и качества вырезанного изображения. При перекрытии 40% области номера игрока показатель MOTA снизился на 3,2 процентных пункта, а IDF1 — на 5,3 процентных пункта относительно условия без возмущений, в то время как точность извлечения семантики осталась на уровне 86,7%. Эти результаты показывают, что цвет джерси и номер игрока предоставляли взаимодополняющую информацию в случаях, когда один из семантических признаков становился менее надежным. При воздействии возмущений рамок детектирования метод демонстрировал умеренное снижение производительности, а не резкий отказ. При смещении рамок детектирования на ±10 пикселей и добавлении гауссова шума к показателям уверенности снижение MOTA оставалось в пределах 3 процентных пунктов, а увеличение количества ID — в пределах 16%. Эта тенденция согласуется со стратегией ассоциации с учетом уверенности, при которой детектирования со средней и низкой уверенностью обрабатываются с использованием дополнительных ограничений ассоциации, в отличие от стратегии, применяемой к детектированиям с высокой уверенностью.

figure-results-5
Рисунок 9. Оценка устойчивости при контролируемых возмущениях. (A) Изменения точности многообъектного трекинга (MOTA), показателя IDF1 (IDentity F1 Score) и количества переключений идентификаторов (IDs) при увеличении перекрытия номеров на футболках. (B) Снижение производительности в репрезентативных условиях помех. (C) Рост количества IDs при различных типах помех. (D) Точность семантического извлечения номеров на футболках при оцениваемых условиях возмущения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

При воздействии факторов внешней среды снижение основных показателей отслеживания в исследованных условиях оставалось в пределах 5 процентных пунктов, а точность семантического извлечения составила 87,2%. Использование цветовых дескрипторов на основе HSV снизило чувствительность к изменениям освещения, в то время как ветка OCR сохранила полезную информацию о номерах игроков для части размытых или деградировавших фрагментов изображений. Эти результаты указывают на то, что семантический модуль оставался работоспособным при исследованных условиях возмущения, хотя его надежность по-прежнему зависела от видимости формы и качества фрагментации. В целом, эксперименты с контролируемыми возмущениями показали, что JerseyTrack сохраняет измеримую эффективность отслеживания при воздействии исследованных семантических факторов, факторов качества детектирования и условий окружающей среды. Данные выводы следует интерпретировать в рамках протестированного диапазона возмущений. Системная повторная идентификация после выхода из поля зрения, сильное загромождение фона и длительная полная окклюзия не оценивались в данном эксперименте отдельно и рассматриваются как ограничения в разделе «Обсуждение».

Анализ вклада модулей и дискриминации признаков

Для изучения того, как два предложенных компонента влияют на эффективность отслеживания, связанного с идентификацией, были дополнительно проанализированы вклад модулей и дискриминация признаков. В анализе вклада модулей использовались четыре варианта модели, определенные в ходе абляционного анализа, в то время как в анализе дискриминации признаков сравнивались традиционные признаки Re-ID, признаки только по цвету, признаки только по номеру игрока и объединенные семантические признаки формы. Для описания разделимости признаков использовалось отношение межклассового расстояния к внутриклассовому, где более высокие значения указывали на большее разделение между разными личностями относительно вариативности внутри одной и той же личности. В Таблице 2 обобщены результаты анализа вклада модулей. В общей оценке расчетный вклад стратегии ассоциации с учетом достоверности составил 41,7%, расчетный вклад семантического объединения признаков формы — 47,6%, а оставшиеся 10,7% были attributed совместному использованию этих двух компонентов. Эти значения показывают, что оба компонента способствовали наблюдаемому улучшению, в то время как полная конфигурация получила выгоду именно от их совместного использования, а не от каждого компонента по отдельности. Характер вклада варьировался в зависимости от типа сцены. При сильных окклюзиях расчетный вклад семантического объединения признаков формы увеличился до 69,4%, что согласуется со снижением надежности признаков движения в случаях, когда спортсмены были частично или временно перекрыты. При высокоскоростном движении расчетный вклад ассоциации с учетом достоверности достиг 44,3%, а совокупный прирост составил 20,6%, что указывает на то, что разделение по уровню достоверности становится более значимым при колебаниях уверенности детектирования из-за быстрого движения или неопределенности локализации.

Вариант моделиСценарий тестированияMOTA↑IDF1↑IDs↓Вклад модуляСинергетический прирост
V0 (Базовая модель)Общая сцена83.567.23245
Сцены с сильными перекрытиями77.861.53862
Сцена с высокоскоростным движением77.162.33689
V1 (Ассоциация на основе уверенности)Общая сцена86.370.9289341.7
Сцены с сильными перекрытиями80.965.9341529.8
Сцена с высокоскоростным движением81.467.9302444.3
V2 (Семантическая ассоциация по джерси)Общая сцена85.271.8293747.6
Сцены с сильными перекрытиями82.772.8275369.4
Сцена с высокоскоростным движением80.166.8315735.1
V3 (Полный JerseyTrack)Общая сцена88.974.3276810.7
Сцены с сильными перекрытиями84.975.626890.8
Сцена с высокоскоростным движением83.671.5284220.6

Таблица 2: Абляционный анализ вклада модулей. Сравнение производительности различных вариантов модели JerseyTrack в сценариях с общим обзором, сильными перекрытиями и высокоскоростным движением. Точность многообъектного отслеживания (MOTA), показатель IDF1 (IDentity F1 Score) и количество переключений идентификаторов (IDs) приведены вместе с расчетным вкладом модулей и синергетическим эффектом. Более высокие значения указывают на лучшую производительность для MOTA, IDF1, вклада модулей и синергетического эффекта, в то время как более низкие значения указывают на лучшую производительность для IDs.

Таблица 3 обобщает результаты анализа дискриминации признаков. Объединенный семантический признак джерси обеспечил отношение межклассового/внутриклассового расстояния 5,63 по сравнению с 1,82 для традиционных признаков Re-ID, что соответствует относительному улучшению показателя отношения расстояний на 209,3%. Признаки, основанные только на цвете или только на номере игрока, также улучшили разделимость признаков по сравнению с традиционными признаками Re-ID, хотя каждый отдельный признак оставался подвержен конкретным случаям сбоя, включая схожие цвета команд, перекрытие номера игрока, размытие при движении и нечитаемые области джерси. Среди оцениваемых представлений признаков объединенное семантическое представление обеспечило самую высокую разделимость признаков и соответствовало самому высокому значению IDF1 и самому низкому количеству ID, зафиксированным в ходе абляционного анализа. Эти результаты подтверждают целесообразность использования специфических семантических признаков джерси в качестве дополнительной идентификационной информации для MOT в спорте, когда атлеты имеют схожий внешний вид, а одной только информации о движении недостаточно. Данные наблюдения ограничены оцениваемыми условиями SportsMOT и не должны интерпретироваться как доказательство того, что семантика джерси устраняет всю неоднозначность идентификации в любом спортивном видео.

Тип признакаОтношение межклассового/внутриклассового расстоянияОтносительное улучшение (%)IDF1↑IDs↓
Традиционные признаки Re-ID1.8265.73482
Признаки цвета команды3.1774.269.83125
Признаки номера игрока3.4991.870.53018
Слитые семантические признаки формы5.63209.374.32768

Таблица 3: Дискриминационный анализ различных представлений признаков. Сравнение дискриминации признаков с использованием традиционных признаков повторной идентификации (Re-ID), признаков цвета формы, признаков номера игрока и объединенных семантических признаков. Представлены отношение межклассового/внутриклассового расстояния, относительное улучшение дискриминации признаков, показатель IDentity F1 Score (IDF1) и количество переключений идентификаторов (IDs). Более высокие значения указывают на лучшую эффективность для отношения расстояний, относительного улучшения и IDF1, в то время как более низкие значения указывают на лучшую эффективность для IDs.

Сравнительный анализ с существующими методами MOT

Для сравнения JerseyTrack с репрезентативными методами MOT в одинаковых условиях валидации SportsMOT был проведен сравнительный анализ. Сравниваемые методы включали QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT и MOTR. Все методы использовали одни и те же выходные данные детектора, сгенерированные фреймворком детектора, указанным в таблице материалов, чтобы сравнение было сосредоточено на эффективности ассоциации при трекинге, а не на вариативности детекторов. Оценка проводилась с использованием метрик, определенных в разделе 7 протокола. Основные метрики оценки включали MOTA, HOTA и IDF1. Вспомогательные метрики включали DetA, AssA, FPs, FNs и IDs. В таблице 4 приведен количественный сравнительный анализ на валидационной выборке SportsMOT, а на рисунке 10 представлено визуальное сравнение точности трекинга, скорости вывода и распределения HOTA по оцениваемым спортивным сценам. JerseyTrack продемонстрировал наивысший показатель MOTA среди сравниваемых методов, достигший 88,9%. Это значение на 1,1 процентного пункта выше, чем у Deep OC-SORT (87,8%), и на 2,5 процентного пункта выше, чем у ByteTrack (86,4%). Таким образом, в условиях валидации SportsMOT метод JerseyTrack достиг наивысшей общей точности трекинга среди всех сравниваемых методов. Для HOTA JerseyTrack достиг 69,9% по сравнению с 64,4% для Deep OC-SORT и 62,8% для ByteTrack. Эти различия соответствуют улучшению на 5,5 и 7,1 процентного пункта соответственно, что указывает на более высокий баланс между качеством детектирования и ассоциации в одних и тех же условиях оценки.

МетодMOTA↑HOTA↑IDF1↑DetA↑AssA↑ФП (Флуоресцентный зонд)↓ФН↓Идентификаторы↓
QDTrack75.953.751.665.639.796,32489,8718,216
DeepSORT77.654.153.267.34476,22886,3196,836
ByteTrack86.462.867.773.850.933,75278,6984,192
FairMOT84.154.762.577.847.845,18783,6204,817
Deep OC-SORT87.864.469.978.252.125,01274,3853,211
MOTR82.957.258.468.946.154,93185,0635,137
JerseyTrack88.969.974.380.254.321,95367,1602,768

Таблица 4: Сравнение эффективности JerseyTrack и репрезентативных методов многообъектного трекинга на валидационной выборке SportsMOT.Сравнение JerseyTrack с репрезентативными методами многообъектного трекинга (MOT) на валидационном наборе данных SportsMOT. Приведенные метрики включают точность многообъектного трекинга (MOTA), точность трекинга высшего порядка (HOTA), показатель F1-меры идентификации (IDF1), точность детектирования (DetA), точность ассоциации (AssA), количество ложноположительных результатов (FP), количество ложноотрицательных результатов (FN) и число переключений идентификаторов (IDs). Более высокие значения указывают на лучшую эффективность для MOTA, HOTA, IDF1, DetA и AssA, в то время как более низкие значения указывают на лучшую эффективность для FP, FN и IDs.

figure-results-6
Рисунок 10. Сравнение производительности с репрезентативными методами многообъектного трекинга. (A) Сравнение точности многообъектного трекинга (MOTA) и количества кадров в секунду (FPS) для JerseyTrack и репрезентативных методов многообъектного трекинга, оцененных на наборе данных SportsMOT. (B) Распределение точности трекинга высшего порядка (HOTA) по оцениваемым методам трекинга. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Что касается сохранения идентичности, JerseyTrack достиг показателя IDF1 74,3%, по сравнению с 69,9% для Deep OC-SORT и 67,7% для ByteTrack. JerseyTrack также зарегистрировал 2 768 ID, что меньше, чем 3 211 ID, зарегистрированных Deep OC-SORT, и 4 192 ID, зарегистрированных ByteTrack. Эти наблюдения согласуются с результатами абляционного анализа, представленными на Рисунке 8  и в Таблице 2, в которых полная конфигурация JerseyTrack снизила частоту переключения идентичности относительно базовых вариантов модели. По качеству детектирования и ассоциации JerseyTrack достиг DetA 80,2% и AssA 54,3%. По сравнению с Deep OC-SORT, JerseyTrack улучшил DetA на 2,0 процентных пункта и AssA на 2,2 процентных пункта. JerseyTrack также дал меньше FP и FN, чем другие сравниваемые методы, указанные в Таблице 4, зафиксировав 21 953 FP и 67 160 FN. В целом, бенчмарк-сравнение показало, что JerseyTrack достиг самых высоких значений основных метрик трекинга среди оцениваемых методов в условиях валидации SportsMOT. Эти результаты согласуются с наблюдаемыми улучшениями в сохранении идентичности и стабильности ассоциаций, полученными благодаря ассоциации с руководством по уверенности и семантическому слиянию джерси. Данное сравнение ограничено общими выходными данными детектора и конфигурацией валидации SportsMOT, использованными в этом исследовании.

Результаты анализа чувствительности параметров

Был проведен анализ чувствительности параметров, чтобы изучить, как ключевые параметры реализации влияют на эффективность трекинга в условиях валидации SportsMOT. Были оценены три параметра: весовой коэффициент потерь OCR (γ), количество иерархических кластеров уровня достоверности (K) и скорость обучения сети OCR (η). В таблице 5 обобщены значения MOTA, IDF1, HOTA и IDs, полученные при различных настройках параметров.

ПараметрЗначениеMOTA↑IDF1↑HOTA↑IDs↓
Вес функции потерь OCR (γ)0.284.769.466.22,944
0.486.371.568.22,893
0.687.973.168.92,815
0.8 (оптимально)88.974.369.92,768
188.273.869.32,792
Количество кластеров уверенности (K)286.772.168.52,876
3 (оптимально)88.974.369.92,768
488.173.669.72,803
587.372.869.22,851
Скорость обучения OCR (η)1 × 10⁻⁴85.970.867.32,934
5 × 10⁻⁴87.672.768.72,832
1 × 10⁻³ (оптимально)88.974.369.92,768
5 × 10⁻³87.873.2692,817
1 × 10⁻²86.571.668.72,889

Таблица 5: Анализ чувствительности параметров. Показатели эффективности отслеживания, полученные при различных настройках параметров для JerseyTrack. Приведены значения точности многообъектного отслеживания (MOTA), F1-меры идентификации (IDF1), точности отслеживания высокого порядка (HOTA) и количество переключений идентификаторов (IDs) для различных значений весового коэффициента функции потерь оптического распознавания символов (OCR) (γ), количества кластеров уверенности (K) и скорости обучения OCR (η). Значения параметров, определенные как оптимальные, соответствуют настройкам, использованным в описанных экспериментах. Более высокие значения указывают на лучшую эффективность для MOTA, IDF1 и HOTA, в то время как более низкие значения указывают на лучшую эффективность для IDs.

Для коэффициента взвешивания потерь OCR (γ) наилучшие показатели эффективности были получены при γ = 0.8. При таких настройках JerseyTrack достиг значений MOTA 88.9%, IDF1 74.3%, HOTA 69.9% и 2 768 ID. При снижении γ до 0.2 показатели MOTA, IDF1 и HOTA снизились до 84.7%, 69.4% и 66.2% соответственно, в то время как количество ID увеличилось до 2 944. При увеличении γ до 1.0 показатели эффективности немного снизились по сравнению с γ = 0.8: MOTA составил 88.2%, IDF1 — 73.8%, HOTA — 69.3%, а количество ID — 2 792. Эти результаты указывают на то, что недостаточный контроль OCR снижал точность распознавания номеров игроков, в то время как увеличение веса потерь OCR сверх оцененного оптимума не привело к улучшению качества трекинга в протестированных условиях.

Для количества иерархических кластеров на уровне доверия (K) наилучшие показатели эффективности были получены при K = 3. Эта настройка соответствует стратегии ассоциации с высоким, средним и низким уровнями доверия, описанной в методе. При K = 2 разделение по доверительным интервалам было менее детализированным, а показатели MOTA, IDF1 и HOTA снизились до 86,7%, 72,1% и 68,5% соответственно. При увеличении K до 4 или 5 эффективность также снизилась по сравнению с K = 3, что позволяет предположить, что чрезмерное разделение разбило детектирования на слишком узкие группы доверия и снизило стабильность стратегии ассоциации. Эти результаты подтверждают использование трех уровней доверия в оцениваемой конфигурации JerseyTrack.

Для скорости обучения (η) сети OCR наилучшие показатели эффективности были получены при η = 1 × 10-3. При более низкой скорости обучения 1 × 10-4 значения MOTA, IDF1 и HOTA снизились до 85,9%, 70,8% и 67,3% соответственно, в то время как количество ID увеличилось до 2 934. При более высокой скорости обучения 1 × 10-2 показатели MOTA, IDF1 и HOTA снизились до 86,5%, 71,6% и 68,7% соответственно, а количество ID увеличилось до 2 889. Эти результаты указывают на то, что ветвь OCR была чувствительна к выбору скорости обучения, причем значение 1 × 10-3 обеспечивало наилучший баланс между распознаванием количества игроков и сохранением идентичности в исследуемых условиях.

В целом, Таблица 5 показывает, что комбинация параметров γ = 0.8, K = 3 и η = 1 × 10-3 обеспечила самые высокие рассчитанные значения MOTA, IDF1 и HOTA при наименьшем количестве ID. Анализ чувствительности также показал, что умеренные отклонения от этих значений параметров приводили к заметным, но не резким изменениям эффективности трекинга. Соответственно, данные настройки параметров использовались для эталонного сравнения и основных экспериментов по валидации SportsMOT, описанных в данном исследовании.

Доступность данных

Первичные сводные данные оценки, окончательные результаты трекинга, записи об окружающей среде, файлы сопоставления наборов данных и промежуточные сводные файлы, подтверждающие результаты данного исследования, доступны в открытом репозитории по адресу https://doi.org/10.5281/zenodo.21274353. Оригинальные общедоступные эталонные наборы данных, использованные в этом исследовании, включая SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 и MOT20, доступны от соответствующих поставщиков и не перераспределяются в репозитории.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании оценивался рабочий процесс MOT в спорте с использованием управления по уровню уверенности, который сочетает разделение по уверенности детектирования с семантическими признаками формы. Управление ассоциацией по уверенности и слияние семантических признаков изучались как взаимодополняющие стратегии для улучшения ассоциации данных при многообъектном отслеживании12,20,23,24,46. Результаты показывают, что полная конфигурация JerseyTrack улучшила сохранение идентификации и стабильность ассоциации в исследуемых условиях валидации SportsMOT. Основной результат валидации SportsMOT достиг значений MOTA 88.9%, HOTA 69.9%, IDF1 74.3%, DetA 80.2% и AssA 54.3%. Эти значения следует интерпретировать с учетом выходных данных детектора, разделения набора данных и конфигурации TrackEval, описанных в Протоколе.

Критическим этапом рабочего процесса является разделение по уровню достоверности, которое позволяет применять различные стратегии ассоциации в зависимости от надежности выходных данных детектора20,22,23,24. Разделяя детектированные объекты на группы с высокой, средней и низкой достоверностью, JerseyTrack применяет различные правила ассоциации к объектам с разными уровнями надежности. Детекции с высокой достоверностью ассоциируются преимущественно на основе согласованности движения, в то время как для детекций со средней достоверностью совместно используются семантика движения и формы. Детекции с низкой достоверностью не используются для инициализации новых траекторий и учитываются только при восстановлении траекторий. Такой подход снизил риск того, что слабые детекции или ложноположительные результаты приведут к созданию нестабильных идентификаторов, при этом позволяя частичным детекциям способствовать восстановлению траекторий при наличии дополнительных семантических данных8,11,20. Вторым критическим этапом является извлечение семантики формы. Признаки цвета команды обеспечивают ограничение на уровне команды, тогда как признаки номера игрока служат более точным идентификационным признаком, когда область номера видна и читаема35,41,42,43. Результаты абляционного анализа показывают, что эти признаки наиболее полезны в случаях плотного взаимодействия игроков одной команды и перекрытий, когда ассоциация только по движению менее надежна. Однако семантику формы следует рассматривать как вспомогательное доказательство, а не как полную замену ассоциации по движению. Номера игроков могут быть нечитаемы из-за размытия, обрезки кадра, ракурса со спины, сильных перекрытий или низкого разрешения изображения. Кроме того, признаки цвета команды не позволяют различать спортсменов одной команды при отсутствии информации о номере35,42,43. Результаты кросс-датасетного анализа дополнительно уточняют область применения метода. JerseyTrack переносился на датасеты командных видов спорта более естественно, чем на общие датасеты MOT для пешеходов, поскольку семантическая ветвь была разработана с учетом цвета формы и номеров игроков19,33,34,35,36,37. На общих датасетах MOT компонент ассоциации с учетом достоверности оставался применимым, но специфическая для спорта семантическая ветвь предоставляла меньше идентификационной информации. Таким образом, данный метод наиболее подходит для видеозаписей командных видов спорта, в которых спортсмены носят различимую униформу, а область формы достаточно видна для извлечения семантики19,33,34,35,36,37.

Остается ряд ограничений. Во-первых, метод зависит от качества выходных данных детектора; значительное количество пропущенных детекций или неточные ограничивающие рамки снижают надежность как прогнозирования движения, так и семантической обрезки14,17,46. Во-вторых, в текущей реализации не была проведена отдельная оптимизация повторной идентификации объектов после длительного отсутствия в поле зрения. Если спортсмен покидает область обзора камеры на продолжительный период, а затем снова в нее возвращается, текущая стратегия восстановления траектории может оказаться недостаточной для восстановления исходного идентификатора19,34. В-третьих, сильный зашумленный фон, перекрытие игроков, размытие при движении и нечитаемые номера на футболках могут снизить надежность семантических признаков14,35,42,46. В-четвертых, текущая оценка была сосредоточена на общедоступных эталонных наборах данных и контролируемых условиях возмущений; развертывание системы на трансляционных видео с монтажными склейками, изменением масштаба и нестандартными ракурсами может потребовать дополнительных модулей предобработки или повторной идентификации19,33,34.

Основной практический вывод заключается в том, что ассоциация на основе уверенности и семантические подсказки, специфичные для формы игроков, могут быть интегрированы в модульный конвейер MOT без изменения структуры детектора. Эта возможность применима к задачам анализа спорта, таким как извлечение траекторий спортсменов, анализ перемещений команды, разбор тактических событий и полуавтоматическая аннотация видео1,4,33,36. Будущие исследования должны быть сосредоточены на улучшении повторной идентификации объектов вне зоны видимости, обработке зашумленного фона, агрегации временных признаков и более надежном распознавании номеров игроков в условиях сильного размытия или окклюзии14,19,34,46.

Таким образом, JerseyTrack представляет собой метод MOT для спорта, который сочетает в себе ассоциацию на основе уровней уверенности с семантическим слиянием данных о форме. Метод разделяет результаты детектирования на группы с высокой, средней и низкой степенью уверенности и применяет различные правила ассоциации в зависимости от надежности детектирования, используя при этом цвет формы и номера игроков в качестве вспомогательной идентификационной информации при ассоциации со средней степенью уверенности и восстановлении траекторий. В рамках оцениваемых настроек валидации SportsMOT метод JerseyTrack продемонстрировал повышенную точность трекинга и лучшее сохранение идентичности по сравнению с оцениваемыми базовыми конфигурациями. Результаты абляционного анализа показали, что полная конфигурация сокращает количество смен идентичности по сравнению с базовым вариантом и вариантами с одним модулем, а сравнение с эталонными показателями выявило более высокие значения основных метрик трекинга при общих выходных данных детектора и конфигурации оценки. Эти результаты подтверждают целесообразность использования информации об уровне уверенности и специфических семантических признаков формы для трекинга спортсменов в видеозаписях командных видов спорта, особенно когда области формы видимы, а информация о цвете команды или номере игрока предоставляет дополнительные данные для идентификации20,35,46. Устранение выявленных ограничений может в дальнейшем расширить применимость предложенного рабочего процесса для более сложных сценариев спортивного трекинга.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют об отсутствии финансовых конфликтов интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не имеют заявлений о благодарностях.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
CUDA RuntimeNVIDIAВерсия 12.8Среда выполнения вычислений на GPU, используемая для обучения детектора, извлечения семантических признаков и инференса трекинга.
EasyOCRJaided AIВерсия 1.7.2Инструментарий оптического распознавания символов, используемый для распознавания номеров игроков.
Исходный код JerseyTrackАвторыН/ДСобственная реализация, содержащая скрипты подготовки данных, извлечения семантических признаков, разделения по уровню достоверности, трекинга, постобработки и оценки. Доступно по адресу: https://doi.org/10.5281/zenodo.21274352
Легковесная модель OCR CRNNАвторыН/ДСобственная сверточно-рекуррентная нейронная сеть (CRNN), используемая для распознавания номеров игроков.
Датасет MOT17MOTChallengeН/ДПубличный эталонный датасет, используемый для перекрестной оценки датасетов. Доступен по адресу: https://motchallenge.net/data/MOT17/
Датасет MOT20MOTChallengeН/ДПубличный эталонный датасет, используемый для перекрестной оценки датасетов. Доступен по адресу: https://motchallenge.net/data/MOT20/
motmetricsРазработчики motmetricsВерсия 1.4.0Библиотека, используемая для расчета диагностических метрик многообъектного трекинга.
GPU NVIDIANVIDIAGeForce RTX 5090 D V2Графический процессор, используемый для обучения детектора и инференса трекинга.
Драйвер GPU NVIDIANVIDIAВерсия 610.62Драйвер GPU, используемый в экспериментальной среде.
NumPyРазработчики NumPyВерсия 2.4.4Библиотека для численных вычислений, используемая для обработки признаков и работы с данными.
OpenCVOpenCVВерсия 4.10.0Библиотека компьютерного зрения, используемая для загрузки, обрезки, предобработки и визуализации изображений.
PythonPython Software FoundationВерсия 3.12.2Язык программирования, используемый на протяжении всего рабочего процесса.
PyTorchPyTorch FoundationВерсия 2.11.0+cu128Фреймворк глубокого обучения, используемый для реализации детектора и семантической модели.
scikit-learnРазработчики scikit-learnВерсия 1.9.0Библиотека машинного обучения, используемая для кластеризации методом K-средних при извлечении цвета формы и разделении по уровню достоверности.
Датасет SoccerNet TrackingSoccerNetН/ДПубличный эталон для трекинга в футболе, используемый для перекрестной оценки датасетов. Доступен по адресу: https://www.soccer-net.org/tasks/tracking
Датасет SportsMOTSportsMOT BenchmarkН/ДОсновной эталонный датасет, используемый для подготовки детектора и оценки трекинга. Доступен по адресу: https://deeperaction.github.io/datasets/sportsmot.html
Датасет TeamTrackTeamTrack BenchmarkН/ДПубличный эталон трекинга в спорте, используемый для перекрестной оценки датасетов. Доступен по адресу: https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch FoundationВерсия 0.26.0+cu128Библиотека компьютерного зрения, используемая совместно с PyTorch для трансформации изображений и поддержки моделей.
TrackEvalРазработчики TrackEvalВерсия 1.3.0Инструментарий оценки, используемый для расчета точности многообъектного трекинга (MOTA), показателя IDF1 (IDentity F1 Score), точности трекинга высшего порядка (HOTA), точности детектирования (DetA), точности ассоциации (AssA), ложноположительных результатов (FP), ложноотрицательных результатов (FN) и переключений идентификаторов (IDs).
UltralyticsUltralyticsВерсия 8.4.90Фреймворк детектирования объектов, используемый для обучения детектора и генерации результатов детектирования атлетов.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

SportsMOT

Похожие статьи