$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В данном разделе представлены количественные и качественные результаты, полученные в ходе экспериментов по многообъектному трекингу в спортивных сценариях. Результаты сосредоточены на точности отслеживания, сохранении идентификации объектов, качестве ассоциации и устойчивости в условиях протестированных наборов данных. Заявления о производительности ограничены оцененными методами, наборами данных, выходными данными детекторов и конфигурацией инструментария оценки, описанными в разделе «Протокол и настройка реализации».
Экспериментальная установка и план оценки
Набор данных и предварительная обработка:
SportsMOT использовался в качестве основного эталона для подготовки детектора, вывода трекинга и количественной оценки. Набор данных содержит 240 видеопоследовательностей и более 150 000 кадров изображений, охватывающих сценарии футбола, баскетбола и волейбола (Рисунок 5). При формальной оценке основные результаты SportsMOT рассчитывались с использованием валидационной выборки, а также выходов детектора, конфигурации трекинга и настроек TrackEval, описанных в протоколе. Междатасетная оценка проводилась на TeamTrack, SoccerNet Tracking, MOT17 и MOT20 для изучения переноса производительности между различными типами наборов данных, а не для прямого сравнения метрик между датасетами.

Рисунок 5. Репрезентативные наборы данных, использованные для оценки. Примеры кадров демонстрируют репрезентативные последовательности футбола, баскетбола и волейбола, использованные для экспериментальной оценки. На рисунке показаны различия в ракурсе камеры, плотности игроков и сложности сцен в оцениваемых наборах данных. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.
Данные SportsMOT были организованы в соответствии с официальной структурой набора данных и преобразованы в формат обучения детектора, описанный в Протоколе. Преобразованные обучающие и валидационные данные SportsMOT содержали 90 последовательностей, 55 544 кадра и 608 152 аннотированных объекта. Обучающая выборка использовалась для подготовки детектора и настройки параметров, в то время как валидационная выборка применялась для формальной оценки трекинга, представленной в данном исследовании. Все входные кадры были масштабированы в соответствии с конфигурацией детектора, указанной в Протоколе и Таблице материалов. Одна и та же процедура предобработки применялась при подготовке детектора, извлечении семантических признаков, логическом выводе трекинга и оценке с помощью TrackEval, чтобы представленные различия в первую очередь отражали стратегию ассоциации трекинга, а не различия в обработке данных.
Показатели оценки:
Эффективность отслеживания оценивали с помощью протокола оценки, совместимого с MOTChallenge, который был реализован с использованием инструментария для оценки, указанного в таблице материалов. Представленные метрики описывают три аспекта эффективности MOT в спорте: общую точность отслеживания, сохранение идентификации и качество детектирования и ассоциации. В качестве основных метрик оценки использовали MOTA, IDF1 и HOTA44,45. MOTA объединяет ложноположительные результаты, ложноотрицательные результаты и смены идентификаторов в общий показатель точности отслеживания. IDF1 измеряет согласованность между предсказанными траекториями и истинными идентификаторами. HOTA совместно оценивает точность детектирования и точность ассоциации, и, следовательно, характеризует баланс между локализацией цели и ассоциацией траекторий. DetA и AssA приводились в качестве дополнительных метрик. FPs, FNs и смены идентификаторов (IDs) использовались для характеристики источников ошибок, связанных с ложными обнаружениями, пропусками детектирования и сменами идентификации. Для сравнения методов на наборе данных SportsMOT использовали одинаковые выходные данные детектора и конфигурацию инструментария оценки, чтобы снизить влияние вариативности детектора и различий в настройках оценки. Для сравнения между разными наборами данных значения метрик интерпретировались как результаты оценки внутри конкретного набора данных, а не как доказательство абсолютного превосходства в эффективности между различными наборами данных.
Экспериментальная среда и конфигурация параметров:
Эксперименты проводились с использованием аппаратных и программных ресурсов, перечисленных в Таблице материалов. На протяжении всех основных экспериментов SportsMOT использовались одни и те же вычислительная среда, платформа детектирования, выходные данные детектора и инструментарий оценки для обеспечения согласованности при подготовке детектора, логическом выводе трекинга и оценке производительности. Платформа детектирования, указанная в Таблице материалов, была обучена с использованием размера пакета 16, начальной скорости обучения 0,01 и 80 эпох обучения. В модуле семантического извлечения данных о форме для кластеризации цветов использовался метод K-средних с K = 3, а в ветке OCR — легковесная сверточно-рекуррентная нейронная сеть с входным размером 128 × 64 пикселя. Ветка OCR была оптимизирована с помощью адаптивного оптимизатора, указанного в Таблице материалов, при скорости обучения 1 × 10⁻3, коэффициенте затухания весов 1 × 10⁻5, размере пакета 64 и 40 эпохах обучения. При обучении модуля извлечения семантических признаков дополнительное планирование скорости обучения не применялось. Коэффициент взвешивания потерь OCR (γ) рассматривался как определяемый пользователем гиперпараметр и выбирался в соответствии с производительностью на валидационной выборке. Для стратификации уровней достоверности использовалось адаптивное разделение методом K-средних, при котором τ₁ и τ₂ рассчитывались на основе распределения достоверности детектирования для каждого кадра, а не задавались вручную перед логическим выводом.
Отслеживание эффективности в различных видах спорта и при разной сложности сценариев
Количественные показатели при различных спортивных сценариях и условиях:
Эффективность трекинга оценивалась по двум групповым факторам: категории спорта и сложности сцены. Анализ по категориям спорта включал последовательности действий в футболе, баскетболе и волейболе. При анализе сложности сцены учитывались уровень окклюзии, скорость движения и плотность объектов, используя одни и те же критерии группировки для всех оцениваемых последовательностей. Представленные показатели соответствуют протоколу оценки, описанному в разделе 7 «Протокол».
Рисунок 6 обобщает результаты количественного трекинга для различных категорий спорта и условий сложности сцены. На рисунке 6A представлены показатели MOTA и DetA для последовательностей с футболом, баскетболом и волейболом. На рисунке 6B показано изменение MOTA при различных уровнях окклюзии, скорости движения и плотности объектов. На рисунке 6C представлены накопленные значения FP и FN для каждого измерения сложности сцены.

Рисунок 6. Эффективность трекинга в различных спортивных категориях и условиях сцены. (A) Точность многообъектного трекинга (MOTA) и точность детектирования (DetA) для футбола, баскетбола, волейбола и общий средний показатель. (B) MOTA в репрезентативных условиях сцены с различными уровнями окклюзии, плотностью игроков и сложностью движения. (C) Количество ложноположительных (FPs) и ложноотрицательных (FNs) результатов в оцениваемых условиях сцены. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
В трех категориях видов спорта JerseyTrack достиг среднего значения MOTA 88,9% и среднего DetA 80,2%. Разница в MOTA между категориями видов спорта составила 1,3 процентных пункта: самый высокий показатель MOTA наблюдался для последовательностей волейбола (89,2%), а самый низкий — для последовательностей баскетбола (87,9%). Более низкое значение MOTA для баскетбольных последовательностей согласуется с более высокой частотой взаимодействий на коротком расстоянии и плотными окклюзиями в оцениваемых последовательностях. В условиях менее сложных сцен, включая легкую окклюзию, низкую скорость движения и разреженное распределение целей, MOTA составил 91,8%, 93,1% и 93,8% соответственно. В условиях более сложных сцен MOTA снизился до 84,9% при сильной окклюзии, до 83,6% при высокоскоростном движении и до 83,1% при плотном распределении целей. Эти результаты показывают, что эффективность трекинга снижалась по мере увеличения сложности сцены, оставаясь при этом в пределах заявленного диапазона для всех оцениваемых спортивных сценариев.
Отслеживание согласованности в репрезентативных спортивных сценариях:
Рисунок 7 представляет репрезентативные примеры трекинга, иллюстрирующие временную стабильность JerseyTrack в трех сложных спортивных сценариях: интенсивном взаимодействии игроков, длительной частичной окклюзии и резких изменениях направления движения. В этих репрезентативных последовательностях трекер сохранял согласованность идентификаторов траекторий, несмотря на частое перекрытие атлетов и динамику движения. Фрагментация идентификаторов наблюдалась преимущественно при сильной окклюзии или в моменты временного отсутствия семантических данных о джерси; однако стратегия ассоциации на основе оценки уверенности позволила восстановить траектории после появления надежных детекций. Эти репрезентативные примеры качественно подтверждают количественные результаты, представленные на Рисунке 6, демонстрируя стабильное сохранение идентификаторов в оцениваемых условиях спортивного трекинга.

Рисунок 7. Репрезентативные результаты трекинга, полученные с помощью JerseyTrack. Последовательные кадры из записей баскетбола, футбола и волейбола иллюстрируют сохранение идентификации и траекторий спортсменов в процессе трекинга. Цветные ограничивающие рамки обозначают отслеживаемые объекты, идентификация которых сохраняется в последовательных кадрах видео. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Результаты абляции для сохранения идентичности:
Был проведен абляционный анализ для изучения вклада стратегии ассоциации с учетом уверенности и модуля семантического слияния джерси в сохранение идентичности. Сравнивались четыре варианта модели: V0 — базовая модель без ассоциации с учетом уверенности и семантического слияния джерси; V1 — вариант, использующий только ассоциацию с учетом уверенности; V2 — вариант, использующий только семантическое слияние джерси; и V3 — полная конфигурация JerseyTrack, включающая оба компонента. Оценка была сосредоточена на метриках, связанных с идентичностью, включая IDs, IDF1, точность идентификации (IDP) и полноту идентификации (IDR). Репрезентативные паттерны сохранения идентичности показаны на Рисунке 8.

Рисунок 8. Абляционный анализ семантической ассоциации джерси с руководством по уверенности. (A) Общее количество переключений идентификаторов (IDs) и показатель F1-меры идентификации (IDF1) для оцениваемых вариантов модели. (B) Сравнение IDs между полной моделью (V3) и базовой конфигурацией (V0) в репрезентативных сложных сценариях отслеживания. (C) IDF1, точность идентификации (IDP) и полнота идентификации (IDR) полной модели в различных сценариях отслеживания. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
В общих условиях валидации SportsMOT полная конфигурация V3 обеспечила наименьшее количество ID и наивысший показатель IDF1 среди четырех вариантов модели. Для V3 было зафиксировано 2 768 ID, что на 477 меньше переключений идентификаторов, чем у V0, а значение IDF1 составило 74,3%, что на 7,1 процентного пункта выше, чем у V0. Эти результаты указывают на то, что оба модуля совместно способствовали сохранению идентификации в оцениваемых условиях спорного трекинга. Сравнение вариантов с одним модулем с полной конфигурацией дополнительно показало, что два модуля влияли на разные источники ошибок трекинга. Стратегия ассоциации с учетом уверенности (confidence-guided association) позволила сократить ошибки сопоставления, связанные с нестабильной уверенностью детектирования и неопределенностью локализации, в то время как модуль семантического слияния джерси (jersey semantic fusion module) предоставлял дополнительную информацию об идентификаторе в случаях, когда данных о движении было недостаточно. Полная конфигурация V3 продемонстрировала лучшие показатели сохранения идентификации, чем любой из вариантов с одним модулем, что свидетельствует о взаимодополняющем, а не избыточном вкладе обоих модулей.
Результаты на уровне сценариев продемонстрировали более значительные различия в более сложных условиях сохранения идентификации. При длительном перекрытии V3 зафиксировал 215 ID по сравнению с 482 для V0. В сценариях с высокой плотностью игроков одной команды (от 6 до 10 игроков) V3 зафиксировал 328 ID по сравнению с 615 для V0. При резких изменениях направления движения на высокой скорости V3 зафиксировал 482 ID по сравнению с 960 для V0. Данное снижение соответствует предполагаемому использованию семантических подсказок при перекрытии и плотных взаимодействиях, а также ассоциации на основе доверительного интервала при колебаниях уверенности детектирования во время быстрого движения. Тенденции IDP и IDR, показанные на Рисунке 8C, указывают на то, что сокращение количества ID не сопровождалось существенным снижением точности идентификации (identity precision) или полноты идентификации (identity recall). Полная конфигурация поддерживала значения IDF1 выше 71% во всех оцениваемых сложных сценариях, при этом более низкие значения наблюдались при плотных взаимодействиях игроков одной команды и резких изменениях направления движения на высокой скорости. Эти результаты свидетельствуют об улучшении согласованности идентификации в исследованных условиях, при этом плотные взаимодействия и быстрое движение остаются основными причинами снижения производительности.
Результаты кросс-датасетной оценки:
Была проведена перекрестная оценка на различных наборах данных, чтобы проверить, сохранится ли поведение трекинга, наблюдаемое на SportsMOT, в условиях разных датасетов. Оценка включала два специализированных спортивных набора данных, SoccerNet Tracking и TeamTrack, а также два общих набора данных для MOT — MOT17 и MOT20. Целью данного эксперимента было изучение переноса производительности между различными типами наборов данных. Результаты не использовались для утверждения о прямом превосходстве на уровне метрик между датасетами, так как протоколы аннотирования, композиция сцен, ракурсы камер и категории объектов различаются.
Таблица 1 обобщает результаты кросс-датасетной оценки. На специализированных спортивных датасетах JerseyTrack продемонстрировал относительно стабильные значения MOTA и IDF1 по сравнению с основной валидационной настройкой SportsMOT. Эта тенденция указывает на то, что стратегия ассоциации под руководством доверия (confidence-guided association) и семантические признаки, связанные с джерси, оставались эффективными, когда сцены трекинга сохраняли визуальные характеристики командного спорта, включая повторяющуюся форму, плотное взаимодействие спортсменов и частые окклюзии. На общих датасетах MOT метод сохранил конкурентоспособные значения MOTA и DetA, в то время как IDF1 был ниже, чем на специализированных спортивных датасетах. Такая закономерность согласуется с отсутствием признаков цвета джерси и номеров игроков в MOT17 и MOT20, которые используются модулем семантического слияния. В этих условиях компонент ассоциации под руководством доверия оставался применимым, в то время как семантическая ветвь предоставляла меньше специфической информации об идентичности, чем в видео с командным спортом. В целом, эти результаты показывают, что JerseyTrack более эффективно переносится на датасеты, содержащие специфическую для спорта визуальную семантику, чем на общие датасеты для трекинга пешеходов. Таким образом, кросс-датасетная оценка подтверждает целевое применение метода в качестве трекера, ориентированного на спорт, и одновременно определяет отсутствие явной семантики джерси как ограничивающий фактор для общих датасетов MOT.
| Набор данных | MOTA↑ | IDF1↑ | DetA↑ | FPS↑ |
| SoccerNet Tracking | 86.8 | 71.3 | 77.9 | 32.1 |
| TeamTrack | 86.2 | 70.7 | 77.3 | 32.8 |
| MOT17 | 84.7 | 69.5 | 76.1 | 33.9 |
| MOT20 | 84.1 | 68.9 | 75.3 | 33.2 |
Таблица 1: Результаты оценки на различных наборах данных. Показатели эффективности JerseyTrack, оцененные на четырех общедоступных эталонных наборах данных. Представлены точность многообъектного отслеживания (MOTA), F1-мера идентификации (IDF1), точность детектирования (DetA) и скорость обработки, измеренная в кадрах в секунду (FPS). Более высокие значения MOTA, IDF1, DetA и FPS свидетельствуют о лучшей производительности.
Устойчивость в условиях контролируемого возмущения
Для изучения стабильности JerseyTrack в условиях типичных визуальных помех и нарушений качества детектирования, характерных для спортивных видеозаписей, были проведены эксперименты с контролируемым внесением возмущений. Исследуемые возмущения были разделены на три категории: возмущения семантических признаков, возмущения рамок детектирования и внешние (средовые) возмущения. Возмущения семантических признаков включали перекрытие номера игрока, размытие изображения, снижение разрешения и схожие цвета джерси. Возмущения рамок детектирования включали смещение ограничивающей рамки, колебания уверенности детектирования и ложноположительные рамки детектирования. Внешние возмущения включали шум, имитирующий дождь, деградацию изображения, имитирующую туман, сильное освещение и помехи от теней. На рисунке 9 обобщены результаты работы трекера в данных условиях возмущений. При воздействии возмущений семантических признаков эффективность трекинга снижалась по мере ухудшения видимости номера игрока и качества вырезанного изображения. При перекрытии 40% области номера игрока показатель MOTA снизился на 3,2 процентных пункта, а IDF1 — на 5,3 процентных пункта относительно условия без возмущений, в то время как точность извлечения семантики осталась на уровне 86,7%. Эти результаты показывают, что цвет джерси и номер игрока предоставляли взаимодополняющую информацию в случаях, когда один из семантических признаков становился менее надежным. При воздействии возмущений рамок детектирования метод демонстрировал умеренное снижение производительности, а не резкий отказ. При смещении рамок детектирования на ±10 пикселей и добавлении гауссова шума к показателям уверенности снижение MOTA оставалось в пределах 3 процентных пунктов, а увеличение количества ID — в пределах 16%. Эта тенденция согласуется со стратегией ассоциации с учетом уверенности, при которой детектирования со средней и низкой уверенностью обрабатываются с использованием дополнительных ограничений ассоциации, в отличие от стратегии, применяемой к детектированиям с высокой уверенностью.

Рисунок 9. Оценка устойчивости при контролируемых возмущениях. (A) Изменения точности многообъектного трекинга (MOTA), показателя IDF1 (IDentity F1 Score) и количества переключений идентификаторов (IDs) при увеличении перекрытия номеров на футболках. (B) Снижение производительности в репрезентативных условиях помех. (C) Рост количества IDs при различных типах помех. (D) Точность семантического извлечения номеров на футболках при оцениваемых условиях возмущения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
При воздействии факторов внешней среды снижение основных показателей отслеживания в исследованных условиях оставалось в пределах 5 процентных пунктов, а точность семантического извлечения составила 87,2%. Использование цветовых дескрипторов на основе HSV снизило чувствительность к изменениям освещения, в то время как ветка OCR сохранила полезную информацию о номерах игроков для части размытых или деградировавших фрагментов изображений. Эти результаты указывают на то, что семантический модуль оставался работоспособным при исследованных условиях возмущения, хотя его надежность по-прежнему зависела от видимости формы и качества фрагментации. В целом, эксперименты с контролируемыми возмущениями показали, что JerseyTrack сохраняет измеримую эффективность отслеживания при воздействии исследованных семантических факторов, факторов качества детектирования и условий окружающей среды. Данные выводы следует интерпретировать в рамках протестированного диапазона возмущений. Системная повторная идентификация после выхода из поля зрения, сильное загромождение фона и длительная полная окклюзия не оценивались в данном эксперименте отдельно и рассматриваются как ограничения в разделе «Обсуждение».
Анализ вклада модулей и дискриминации признаков
Для изучения того, как два предложенных компонента влияют на эффективность отслеживания, связанного с идентификацией, были дополнительно проанализированы вклад модулей и дискриминация признаков. В анализе вклада модулей использовались четыре варианта модели, определенные в ходе абляционного анализа, в то время как в анализе дискриминации признаков сравнивались традиционные признаки Re-ID, признаки только по цвету, признаки только по номеру игрока и объединенные семантические признаки формы. Для описания разделимости признаков использовалось отношение межклассового расстояния к внутриклассовому, где более высокие значения указывали на большее разделение между разными личностями относительно вариативности внутри одной и той же личности. В Таблице 2 обобщены результаты анализа вклада модулей. В общей оценке расчетный вклад стратегии ассоциации с учетом достоверности составил 41,7%, расчетный вклад семантического объединения признаков формы — 47,6%, а оставшиеся 10,7% были attributed совместному использованию этих двух компонентов. Эти значения показывают, что оба компонента способствовали наблюдаемому улучшению, в то время как полная конфигурация получила выгоду именно от их совместного использования, а не от каждого компонента по отдельности. Характер вклада варьировался в зависимости от типа сцены. При сильных окклюзиях расчетный вклад семантического объединения признаков формы увеличился до 69,4%, что согласуется со снижением надежности признаков движения в случаях, когда спортсмены были частично или временно перекрыты. При высокоскоростном движении расчетный вклад ассоциации с учетом достоверности достиг 44,3%, а совокупный прирост составил 20,6%, что указывает на то, что разделение по уровню достоверности становится более значимым при колебаниях уверенности детектирования из-за быстрого движения или неопределенности локализации.
| Вариант модели | Сценарий тестирования | MOTA↑ | IDF1↑ | IDs↓ | Вклад модуля | Синергетический прирост |
| V0 (Базовая модель) | Общая сцена | 83.5 | 67.2 | 3245 | – | – |
| Сцены с сильными перекрытиями | 77.8 | 61.5 | 3862 | – | – |
| Сцена с высокоскоростным движением | 77.1 | 62.3 | 3689 | – | – |
| V1 (Ассоциация на основе уверенности) | Общая сцена | 86.3 | 70.9 | 2893 | 41.7 | – |
| Сцены с сильными перекрытиями | 80.9 | 65.9 | 3415 | 29.8 | – |
| Сцена с высокоскоростным движением | 81.4 | 67.9 | 3024 | 44.3 | – |
| V2 (Семантическая ассоциация по джерси) | Общая сцена | 85.2 | 71.8 | 2937 | 47.6 | – |
| Сцены с сильными перекрытиями | 82.7 | 72.8 | 2753 | 69.4 | – |
| Сцена с высокоскоростным движением | 80.1 | 66.8 | 3157 | 35.1 | – |
| V3 (Полный JerseyTrack) | Общая сцена | 88.9 | 74.3 | 2768 | – | 10.7 |
| Сцены с сильными перекрытиями | 84.9 | 75.6 | 2689 | – | 0.8 |
| Сцена с высокоскоростным движением | 83.6 | 71.5 | 2842 | – | 20.6 |
Таблица 2: Абляционный анализ вклада модулей. Сравнение производительности различных вариантов модели JerseyTrack в сценариях с общим обзором, сильными перекрытиями и высокоскоростным движением. Точность многообъектного отслеживания (MOTA), показатель IDF1 (IDentity F1 Score) и количество переключений идентификаторов (IDs) приведены вместе с расчетным вкладом модулей и синергетическим эффектом. Более высокие значения указывают на лучшую производительность для MOTA, IDF1, вклада модулей и синергетического эффекта, в то время как более низкие значения указывают на лучшую производительность для IDs.
Таблица 3 обобщает результаты анализа дискриминации признаков. Объединенный семантический признак джерси обеспечил отношение межклассового/внутриклассового расстояния 5,63 по сравнению с 1,82 для традиционных признаков Re-ID, что соответствует относительному улучшению показателя отношения расстояний на 209,3%. Признаки, основанные только на цвете или только на номере игрока, также улучшили разделимость признаков по сравнению с традиционными признаками Re-ID, хотя каждый отдельный признак оставался подвержен конкретным случаям сбоя, включая схожие цвета команд, перекрытие номера игрока, размытие при движении и нечитаемые области джерси. Среди оцениваемых представлений признаков объединенное семантическое представление обеспечило самую высокую разделимость признаков и соответствовало самому высокому значению IDF1 и самому низкому количеству ID, зафиксированным в ходе абляционного анализа. Эти результаты подтверждают целесообразность использования специфических семантических признаков джерси в качестве дополнительной идентификационной информации для MOT в спорте, когда атлеты имеют схожий внешний вид, а одной только информации о движении недостаточно. Данные наблюдения ограничены оцениваемыми условиями SportsMOT и не должны интерпретироваться как доказательство того, что семантика джерси устраняет всю неоднозначность идентификации в любом спортивном видео.
| Тип признака | Отношение межклассового/внутриклассового расстояния | Относительное улучшение (%) | IDF1↑ | IDs↓ |
| Традиционные признаки Re-ID | 1.82 | – | 65.7 | 3482 |
| Признаки цвета команды | 3.17 | 74.2 | 69.8 | 3125 |
| Признаки номера игрока | 3.49 | 91.8 | 70.5 | 3018 |
| Слитые семантические признаки формы | 5.63 | 209.3 | 74.3 | 2768 |
Таблица 3: Дискриминационный анализ различных представлений признаков. Сравнение дискриминации признаков с использованием традиционных признаков повторной идентификации (Re-ID), признаков цвета формы, признаков номера игрока и объединенных семантических признаков. Представлены отношение межклассового/внутриклассового расстояния, относительное улучшение дискриминации признаков, показатель IDentity F1 Score (IDF1) и количество переключений идентификаторов (IDs). Более высокие значения указывают на лучшую эффективность для отношения расстояний, относительного улучшения и IDF1, в то время как более низкие значения указывают на лучшую эффективность для IDs.
Сравнительный анализ с существующими методами MOT
Для сравнения JerseyTrack с репрезентативными методами MOT в одинаковых условиях валидации SportsMOT был проведен сравнительный анализ. Сравниваемые методы включали QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT и MOTR. Все методы использовали одни и те же выходные данные детектора, сгенерированные фреймворком детектора, указанным в таблице материалов, чтобы сравнение было сосредоточено на эффективности ассоциации при трекинге, а не на вариативности детекторов. Оценка проводилась с использованием метрик, определенных в разделе 7 протокола. Основные метрики оценки включали MOTA, HOTA и IDF1. Вспомогательные метрики включали DetA, AssA, FPs, FNs и IDs. В таблице 4 приведен количественный сравнительный анализ на валидационной выборке SportsMOT, а на рисунке 10 представлено визуальное сравнение точности трекинга, скорости вывода и распределения HOTA по оцениваемым спортивным сценам. JerseyTrack продемонстрировал наивысший показатель MOTA среди сравниваемых методов, достигший 88,9%. Это значение на 1,1 процентного пункта выше, чем у Deep OC-SORT (87,8%), и на 2,5 процентного пункта выше, чем у ByteTrack (86,4%). Таким образом, в условиях валидации SportsMOT метод JerseyTrack достиг наивысшей общей точности трекинга среди всех сравниваемых методов. Для HOTA JerseyTrack достиг 69,9% по сравнению с 64,4% для Deep OC-SORT и 62,8% для ByteTrack. Эти различия соответствуют улучшению на 5,5 и 7,1 процентного пункта соответственно, что указывает на более высокий баланс между качеством детектирования и ассоциации в одних и тех же условиях оценки.
| Метод | MOTA↑ | HOTA↑ | IDF1↑ | DetA↑ | AssA↑ | ФП (Флуоресцентный зонд)↓ | ФН↓ | Идентификаторы↓ |
| QDTrack | 75.9 | 53.7 | 51.6 | 65.6 | 39.7 | 96,324 | 89,871 | 8,216 |
| DeepSORT | 77.6 | 54.1 | 53.2 | 67.3 | 44 | 76,228 | 86,319 | 6,836 |
| ByteTrack | 86.4 | 62.8 | 67.7 | 73.8 | 50.9 | 33,752 | 78,698 | 4,192 |
| FairMOT | 84.1 | 54.7 | 62.5 | 77.8 | 47.8 | 45,187 | 83,620 | 4,817 |
| Deep OC-SORT | 87.8 | 64.4 | 69.9 | 78.2 | 52.1 | 25,012 | 74,385 | 3,211 |
| MOTR | 82.9 | 57.2 | 58.4 | 68.9 | 46.1 | 54,931 | 85,063 | 5,137 |
| JerseyTrack | 88.9 | 69.9 | 74.3 | 80.2 | 54.3 | 21,953 | 67,160 | 2,768 |
Таблица 4: Сравнение эффективности JerseyTrack и репрезентативных методов многообъектного трекинга на валидационной выборке SportsMOT.Сравнение JerseyTrack с репрезентативными методами многообъектного трекинга (MOT) на валидационном наборе данных SportsMOT. Приведенные метрики включают точность многообъектного трекинга (MOTA), точность трекинга высшего порядка (HOTA), показатель F1-меры идентификации (IDF1), точность детектирования (DetA), точность ассоциации (AssA), количество ложноположительных результатов (FP), количество ложноотрицательных результатов (FN) и число переключений идентификаторов (IDs). Более высокие значения указывают на лучшую эффективность для MOTA, HOTA, IDF1, DetA и AssA, в то время как более низкие значения указывают на лучшую эффективность для FP, FN и IDs.

Рисунок 10. Сравнение производительности с репрезентативными методами многообъектного трекинга. (A) Сравнение точности многообъектного трекинга (MOTA) и количества кадров в секунду (FPS) для JerseyTrack и репрезентативных методов многообъектного трекинга, оцененных на наборе данных SportsMOT. (B) Распределение точности трекинга высшего порядка (HOTA) по оцениваемым методам трекинга. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Что касается сохранения идентичности, JerseyTrack достиг показателя IDF1 74,3%, по сравнению с 69,9% для Deep OC-SORT и 67,7% для ByteTrack. JerseyTrack также зарегистрировал 2 768 ID, что меньше, чем 3 211 ID, зарегистрированных Deep OC-SORT, и 4 192 ID, зарегистрированных ByteTrack. Эти наблюдения согласуются с результатами абляционного анализа, представленными на Рисунке 8 и в Таблице 2, в которых полная конфигурация JerseyTrack снизила частоту переключения идентичности относительно базовых вариантов модели. По качеству детектирования и ассоциации JerseyTrack достиг DetA 80,2% и AssA 54,3%. По сравнению с Deep OC-SORT, JerseyTrack улучшил DetA на 2,0 процентных пункта и AssA на 2,2 процентных пункта. JerseyTrack также дал меньше FP и FN, чем другие сравниваемые методы, указанные в Таблице 4, зафиксировав 21 953 FP и 67 160 FN. В целом, бенчмарк-сравнение показало, что JerseyTrack достиг самых высоких значений основных метрик трекинга среди оцениваемых методов в условиях валидации SportsMOT. Эти результаты согласуются с наблюдаемыми улучшениями в сохранении идентичности и стабильности ассоциаций, полученными благодаря ассоциации с руководством по уверенности и семантическому слиянию джерси. Данное сравнение ограничено общими выходными данными детектора и конфигурацией валидации SportsMOT, использованными в этом исследовании.
Результаты анализа чувствительности параметров
Был проведен анализ чувствительности параметров, чтобы изучить, как ключевые параметры реализации влияют на эффективность трекинга в условиях валидации SportsMOT. Были оценены три параметра: весовой коэффициент потерь OCR (γ), количество иерархических кластеров уровня достоверности (K) и скорость обучения сети OCR (η). В таблице 5 обобщены значения MOTA, IDF1, HOTA и IDs, полученные при различных настройках параметров.
| Параметр | Значение | MOTA↑ | IDF1↑ | HOTA↑ | IDs↓ |
| Вес функции потерь OCR (γ) | 0.2 | 84.7 | 69.4 | 66.2 | 2,944 |
| 0.4 | 86.3 | 71.5 | 68.2 | 2,893 |
| 0.6 | 87.9 | 73.1 | 68.9 | 2,815 |
| 0.8 (оптимально) | 88.9 | 74.3 | 69.9 | 2,768 |
| 1 | 88.2 | 73.8 | 69.3 | 2,792 |
| Количество кластеров уверенности (K) | 2 | 86.7 | 72.1 | 68.5 | 2,876 |
| 3 (оптимально) | 88.9 | 74.3 | 69.9 | 2,768 |
| 4 | 88.1 | 73.6 | 69.7 | 2,803 |
| 5 | 87.3 | 72.8 | 69.2 | 2,851 |
| Скорость обучения OCR (η) | 1 × 10⁻⁴ | 85.9 | 70.8 | 67.3 | 2,934 |
| 5 × 10⁻⁴ | 87.6 | 72.7 | 68.7 | 2,832 |
| 1 × 10⁻³ (оптимально) | 88.9 | 74.3 | 69.9 | 2,768 |
| 5 × 10⁻³ | 87.8 | 73.2 | 69 | 2,817 |
| 1 × 10⁻² | 86.5 | 71.6 | 68.7 | 2,889 |
Таблица 5: Анализ чувствительности параметров. Показатели эффективности отслеживания, полученные при различных настройках параметров для JerseyTrack. Приведены значения точности многообъектного отслеживания (MOTA), F1-меры идентификации (IDF1), точности отслеживания высокого порядка (HOTA) и количество переключений идентификаторов (IDs) для различных значений весового коэффициента функции потерь оптического распознавания символов (OCR) (γ), количества кластеров уверенности (K) и скорости обучения OCR (η). Значения параметров, определенные как оптимальные, соответствуют настройкам, использованным в описанных экспериментах. Более высокие значения указывают на лучшую эффективность для MOTA, IDF1 и HOTA, в то время как более низкие значения указывают на лучшую эффективность для IDs.
Для коэффициента взвешивания потерь OCR (γ) наилучшие показатели эффективности были получены при γ = 0.8. При таких настройках JerseyTrack достиг значений MOTA 88.9%, IDF1 74.3%, HOTA 69.9% и 2 768 ID. При снижении γ до 0.2 показатели MOTA, IDF1 и HOTA снизились до 84.7%, 69.4% и 66.2% соответственно, в то время как количество ID увеличилось до 2 944. При увеличении γ до 1.0 показатели эффективности немного снизились по сравнению с γ = 0.8: MOTA составил 88.2%, IDF1 — 73.8%, HOTA — 69.3%, а количество ID — 2 792. Эти результаты указывают на то, что недостаточный контроль OCR снижал точность распознавания номеров игроков, в то время как увеличение веса потерь OCR сверх оцененного оптимума не привело к улучшению качества трекинга в протестированных условиях.
Для количества иерархических кластеров на уровне доверия (K) наилучшие показатели эффективности были получены при K = 3. Эта настройка соответствует стратегии ассоциации с высоким, средним и низким уровнями доверия, описанной в методе. При K = 2 разделение по доверительным интервалам было менее детализированным, а показатели MOTA, IDF1 и HOTA снизились до 86,7%, 72,1% и 68,5% соответственно. При увеличении K до 4 или 5 эффективность также снизилась по сравнению с K = 3, что позволяет предположить, что чрезмерное разделение разбило детектирования на слишком узкие группы доверия и снизило стабильность стратегии ассоциации. Эти результаты подтверждают использование трех уровней доверия в оцениваемой конфигурации JerseyTrack.
Для скорости обучения (η) сети OCR наилучшие показатели эффективности были получены при η = 1 × 10-3. При более низкой скорости обучения 1 × 10-4 значения MOTA, IDF1 и HOTA снизились до 85,9%, 70,8% и 67,3% соответственно, в то время как количество ID увеличилось до 2 934. При более высокой скорости обучения 1 × 10-2 показатели MOTA, IDF1 и HOTA снизились до 86,5%, 71,6% и 68,7% соответственно, а количество ID увеличилось до 2 889. Эти результаты указывают на то, что ветвь OCR была чувствительна к выбору скорости обучения, причем значение 1 × 10-3 обеспечивало наилучший баланс между распознаванием количества игроков и сохранением идентичности в исследуемых условиях.
В целом, Таблица 5 показывает, что комбинация параметров γ = 0.8, K = 3 и η = 1 × 10-3 обеспечила самые высокие рассчитанные значения MOTA, IDF1 и HOTA при наименьшем количестве ID. Анализ чувствительности также показал, что умеренные отклонения от этих значений параметров приводили к заметным, но не резким изменениям эффективности трекинга. Соответственно, данные настройки параметров использовались для эталонного сравнения и основных экспериментов по валидации SportsMOT, описанных в данном исследовании.
Доступность данных
Первичные сводные данные оценки, окончательные результаты трекинга, записи об окружающей среде, файлы сопоставления наборов данных и промежуточные сводные файлы, подтверждающие результаты данного исследования, доступны в открытом репозитории по адресу https://doi.org/10.5281/zenodo.21274353. Оригинальные общедоступные эталонные наборы данных, использованные в этом исследовании, включая SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 и MOT20, доступны от соответствующих поставщиков и не перераспределяются в репозитории.