方法文章

一种基于球衣语义融合的置信度引导体育视频多目标跟踪方法

22 次观看

DOI:

10.3791/71557

2026年8月14日

本文内容

摘要

本方案描述了一种基于置信度引导的多目标跟踪工作流程,用于体育视频分析,通过整合球衣颜色和球员号码信息,以提高在置信度波动、遮挡以及运动员外观相似等情况下的轨迹关联性和身份一致性。

摘要

体育视频中的多目标跟踪(Multi-Object Tracking, MOT)可为战术分析、运动员行为解读和自动化统计分析提供轨迹信息。然而,体育场景中常出现快速变向、突然停止、频繁遮挡以及队友外观相似等情况,导致检测置信度波动以及帧间关联时的身份混淆。为应对这些挑战,本研究提出JerseyTrack,一种基于球衣语义融合的置信度引导型体育MOT方法。该工作流程根据每帧的置信度分布,自适应地将检测框划分为高、中、低三种置信度区间。高置信度检测主要依据运动相似性进行关联,而中低置信度检测则进一步融合通过颜色聚类和轻量级光学字符识别(Optical Character Recognition, OCR)模型提取的球衣颜色与球员号码特征。这些语义特征在补充匹配过程中与运动信息融合,以提升轨迹连续性与身份一致性。该方法在SportsMOT数据集上进行了评估。JerseyTrack取得了88.9%的多目标跟踪精度(Multiple Object Tracking Accuracy, MOTA)、74.3%的身份F1分数(IDentity F1 Score, IDF1)以及69.9%的高阶跟踪精度(Higher Order Tracking Accuracy, HOTA),表明其在所评估的体育跟踪场景下具有更优的跟踪性能。本方案提供了一套可复现的工作流程,用于整合置信度引导的关联策略与球衣语义信息,以提升体育视频中的多目标跟踪效果。

引言

多目标跟踪(MOT)可在视频序列中实现目标的持续定位与身份保持,支持体育视频应用中的运动员轨迹提取、战术分析及自动化统计分析1,2,3。可靠的视觉信息还与运动专项中的决策制定和表现评估密切相关,进一步凸显了稳定的视频衍生运动数据在后续体育分析中的重要价值4。在体育场景中,战术数据的可靠性取决于跟踪轨迹的连续性以及目标身份的一致性。

与一般的多目标跟踪(MOT)场景相比,体育视频包含快速的方向变化、突然的停顿、跳跃、密集的交互以及频繁的遮挡。这些因素导致检测框置信度出现显著波动,并增加低置信度检测的频率,从而可能中断轨迹关联5,6。统一的队服进一步削弱了一般外观特征的区分能力,增加了外观相似的队友之间的身份混淆7,8。当遮挡与外观相似性在同一视频序列中同时发生时,检测置信度下降,目标外观信息变得不完整,从而加大了轨迹关联与身份维持的难度9,10。在多目标跟踪中,重识别(Re-ID)是指利用与身份相关的视觉证据,将在不同帧、遮挡期间或重新进入场景时的同一目标进行身份关联的过程。在团队体育视频中,由于同队运动员通常穿着相似的队服并具有类似的体型,通用的重识别线索可能被削弱。技术文献综述表明,体育场景中的多目标跟踪所面临的轨迹碎片化和身份混淆问题,通常通过两种互补的方法加以解决:利用检测置信度和增强身份线索。JerseyTrack 位于这两种方法的交汇点,其根据检测质量来调节队服语义线索的使用,而非将颜色和球员号码信息无差别地应用于所有检测结果。

本研究提出了JerseyTrack,一种基于球衣语义融合的置信度引导型多人运动目标跟踪(MOT)方法。该方法适用于运动员穿着明显球衣且检测结果提供带有置信度评分的边界框的团队运动视频。JerseyTrack结合了四个主要组件:运动员检测、置信度层级划分、球衣语义特征提取以及级联帧间关联。利用检测置信度自适应地将检测结果划分为高、中、低置信度三组,并采用不同的关联策略进行处理。高置信度检测主要通过运动信息进行关联,而中低置信度检测则额外引入球衣颜色和球员号码信息,以在视觉证据较弱时提升身份保持能力。该方法适用于需要稳定运动员轨迹的体育视频分析任务,例如战术分析和球员行为解读。

该方法也存在操作上的局限性。球衣语义信息的提取可能受到严重遮挡、运动模糊、图像分辨率低、球衣姿态异常或球员号码不可见等因素的影响。在这些情况下,基于球衣的语义线索可能变得不完整,此时关联过程将更依赖于运动一致性与多帧验证。因此,本研究中的性能结论仅限于所评估的数据集和实验设置。在 SportsMOT 数据集上的实验表明,JerseyTrack 在测试的体育运动跟踪条件下,提升了各项跟踪指标的表现,并减少了身份切换事件的发生。体育视频中多目标跟踪(MOT)的主要难点在于快速运动、遮挡以及外观相似性条件下维持轨迹连续性和身份一致性。与 JerseyTrack 相关的现有研究大致可分为两个方向:一是利用检测置信度进行轨迹关联,二是通过体育场景特有的语义特征增强身份线索。

检测置信度已被广泛用于估计检测框的可靠性,并在多目标跟踪(MOT)中指导轨迹关联。早期的跟踪方法通常将置信度视为二值化过滤标准,即移除低于固定阈值的检测结果,以减少误检11,12。该策略虽可降低噪声检测,但在遮挡、快速运动或图像质量较低的情况下,也可能丢弃真实目标,导致轨迹断裂13,14,15。类似过滤策略还表明,固定的置信度阈值对场景变化和检测质量较为敏感16,17。为更有效地利用低置信度检测结果,ByteTrack 提出了一种关联策略,保留低置信度检测框作为候选目标进行二次匹配,并通过运动相似性和轨迹历史信息将其与已有轨迹进行关联18。McByte 进一步在体育场景的多目标跟踪中引入了时序传播的分割掩码作为关联线索,在无需额外视频训练的情况下,提升了在快速运动、遮挡和相机位移条件下的鲁棒性19。相关研究也调整了对低置信度检测结果的使用方式,以在关联过程中保留微弱但可能有效的目标20,21,22。随后,置信度自适应的关联策略根据运动一致性与检测可靠性进一步优化了匹配准则23,24,25。基于检测框回归和轨迹平滑性优化的轨迹 refinement 方法也被用于减少轨迹断裂现象26,27,28。其他 refinement 策略在复杂运动条件下为维持轨迹连续性提供了补充支持29。时序一致的对象流进一步建模了跨帧的对象级时序一致性,为减少复杂 MOT 场景中的轨迹中断提供了另一种面向关联的解决方案30。跟踪器融合方法则通过学习多个跟踪器的输出,采用基于学习的选择或融合策略,提升了在不同 MOT 基准上的跟踪鲁棒性31。总体而言,这些研究表明,考虑置信度的关联策略有助于恢复中断的轨迹;然而,当同一队伍的运动员外观相似时,置信度和运动线索所提供的身份信息十分有限。尽管这些方法在一般场景下能有效缓解轨迹断裂问题,但在体育场景中仍存在固有局限性,因为同队运动员通常具有高度相似的视觉外观,仅依赖置信度和运动信息无法为身份区分提供充分依据32,33,34。即使低置信度检测框被有效召回,特征相似性仍可能导致身份切换,难以满足体育分析中对身份一致性的严格要求。

运动特异性身份线索也被用于提升运动员追踪中的身份区分能力。球衣语义信息(如球队颜色和球员号码)所提供的身份线索相较于通用的外观嵌入特征,与体育场景的关联更为直接35,36,37。球衣颜色可用于支持球队层级的区分,减少跨队混淆,而当号码区域可见且可读时,球员号码识别则能提供更精细的身份线索38,39。现有的体育追踪研究已结合领域特定的视觉特征和球衣颜色识别,以在人群密集的体育场景下提升球员关联准确性40,41。关于球衣号码识别及合成号码数据的相关工作进一步支持了在低分辨率或部分遮挡条件下的身份建模42,43。这些研究表明,球衣语义信息能够增强体育多目标追踪(MOT)中的身份表征。然而,大多数语义增强的追踪方法未能充分建模检测置信度与语义特征质量之间的关系。高置信度的检测结果通常已包含可靠的时空和外观信息,此时重复提取语义特征效率较低。低置信度的检测结果则常受遮挡、模糊、截断或低分辨率影响,导致颜色和球员号码线索的可靠性下降。这一局限性促使研究者设计一种基于置信度引导的关联策略,即根据检测质量选择性引入球衣语义信息,而非对所有检测结果统一应用。综述的研究表明,置信度感知的关联机制与球衣语义建模分别解决了体育多目标追踪中的不同问题:基于置信度的策略主要决定某个检测是否应参与关联,以及如何与现有轨迹进行匹配;而球衣语义策略则主要通过运动特异性线索增强身份表征。然而,这两种机制通常被设计为独立组件,导致语义线索未能始终根据检测质量进行调整,且置信度水平无法在关联过程中直接调控颜色和球员号码信息的使用。这种分离限制了对团队运动视频中轨迹断裂和身份混淆问题的联合处理。当前尚未解决的研究空白在于,如何在同一追踪流程中将检测置信度的质量评估与球衣语义关联机制有效结合。

方案

本研究涉及对公开可用的基准视频数据集(即 SportsMOT、TeamTrack、SoccerNet Tracking、MOT17 和 MOT20)进行二次分析。研究未招募任何参与者,未实施任何干预,也未收集新的人类受试者数据。根据曼谷吞武里大学适用的机构规定,本研究无需获得伦理委员会批准。

以下方案描述了从数据准备到跟踪评估的 JerseyTrack 复现工作流程。该工作流程包括数据集准备、检测器准备、球衣语义提取、置信度分级划分、置信度引导关联、跟踪推理和性能评估,如图1所示。所需的软件、数据集和硬件资源列于材料表中。

figure-protocol-1
图1.JerseyTrack 方法的整体工作流程。 该工作流程包括球衣语义特征提取、初始目标匹配、置信度引导的补充匹配以及特征融合。从检测到的运动员区域中提取球队颜色和球员号码特征,并将其融入关联过程中,以在检测结果不确定的情况下提升轨迹匹配的准确性。请点击此处查看该图的放大版本。

1. 准备数据集和目录结构

  1. 下载材料表中列出的公开基准数据集。使用 SportsMOT 作为检测器准备和跟踪评估的主要数据集。保留 TeamTrack、SoccerNet Tracking、MOT17 和 MOT20 用于跨数据集评估。
  2. 将所有数据集存储在统一的项目目录下。确保检测器、语义提取模块、跟踪模块和评估工具包使用相同的序列标识符。
  3. 使用本研究中采用的数据预处理脚本,将官方 SportsMOT 标注转换为检测器训练格式。执行以下命令:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val。
  4. 数据预处理脚本(scripts/prepare_data.py)可在 JerseyTrack 源代码仓库中获取(https://doi.org/10.5281/zenodo.21274352)。所需软件依赖项在 environment.yml 中指定,包括 Python 3.12、PyTorch 2.11.0 以及 OpenCV 4.10 或更高版本。使用以下命令配置软件环境:conda env create -f environment.yml。使用以下命令执行数据预处理脚本:python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val。
  5. 验证转换是否生成了检测器训练配置文件:data\processed\SportsMOT_yolo\data.yaml 和转换清单文件:data\processed\SportsMOT_yolo\conversion_manifest.csv。
    注意:在本研究中,转换后的 SportsMOT 训练与验证数据集包含 90 个序列、55,544 帧图像以及 608,152 个标注对象。
  6. 检查代表性序列,以验证帧顺序、边界框坐标和身份标签与原始基准标注保持一致。
  7. 在整个检测器准备、跟踪推理和评估过程中,保留未经修改的转换后标注文件,以确保所有方法使用相同的数据集划分和评估协议。
    注意:本节的预期结果是一个标准化的 SportsMOT 检测器训练目录,其中包含转换后的标注文件、转换清单以及用于检测器准备和跟踪评估所需的数据集划分文件。

2. 准备检测器输出

  1. 使用准备好的 SportsMOT 训练集对目标检测器进行微调。通过公式 1中定义的分类损失和边界框回归损失来优化检测器。采用实施设置以及材料表中报告的检测器输入分辨率、批量大小、学习率、训练轮数及其他训练参数。
    Ldet = Lcls + Lbox   (1)
    其中, Ldet  表示总检测器损失,Lcls  表示分类损失,Lbox  表示边界框回归损失。
    注意:主实验中使用的目标检测器检查点(内部实验标识符 e3)是基于 Ultralytics YOLO 框架,并采用 SportsMOT YOLO 格式数据集配置(data/processed/SportsMOT_yolo/data.yaml)进行训练的。使用以下命令执行检测器训练:yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0。训练完成后,使用性能最优的检查点,通过以下命令为验证序列生成检测器输出:python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16。
  2. 训练完成后,保存训练好的检测器检查点、相应的元数据文件以及训练日志。
    注意:本研究中用于正式实验的检测器检查点保存路径为:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt。相应的元数据文件保存路径为:outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json。主 SportsMOT 验证实验所使用的检测器输出目录为:outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections。
  3. 在每个验证序列上运行训练好的检测器,以生成运动员的边界框及其置信度分数。为每个序列导出一个检测文件,文件中包含帧索引、边界框坐标、检测置信度和类别标签。
    注意:在主实验所用的 SportsMOT 验证运行中,置信度阈值设为 0.05 时共生成了 343,990 个运动员检测结果。
  4. 在进行跟踪推理之前,检查检测器输出目录。确认每个序列都有对应的检测文件,帧索引与准备好的图像序列一致,且每条检测记录均包含置信度分数。
    注意:本步骤的预期结果是一个完整的检测器输出目录,该目录将作为球衣语义提取、置信度分级和跟踪关联的输入。

3. 提取球衣语义特征

  1. 利用检测器输出文件从每个视频帧中裁剪出运动员区域。将每个裁剪后的运动员图像与其序列标识符、帧索引和检测索引一起保存。排除图像内容缺失或边界框超出图像边界的无效裁剪区域。保持每个裁剪文件名与其原始检测记录之间的关联,以便在跟踪关联过程中将提取的语义特征匹配到对应的检测结果。
  2. 使用本研究中采用的语义特征提取脚本,从裁剪后的运动员图像中提取球衣颜色特征。
    注意:语义特征提取脚本(scripts/extract_fast_color_semantics.py 和 scripts/formal_extract_semantics.py)可在 JerseyTrack 源代码仓库中获取(https://doi.org/10.5281/zenodo.21274352)。无需单独的配置文件;所有运行时参数均通过命令行参数提供。
    使用以下命令生成球衣颜色描述符:python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color。使用OCR模型生成球员号码语义特征,命令如下:python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr。生成的球衣颜色描述符和球员号码概率输出通过序列标识符进行关联,并合并为跟踪关联过程中使用的语义特征文件。
  3. 将每个裁剪后的运动员图像转换为色调、饱和度、明度(HSV)颜色空间。从球衣区域提取前景像素,并使用K=3的K均值聚类方法总结主导球衣颜色。在进行特征比较前,使用L2归一化对得到的颜色描述符进行归一化处理。
  4. 使用输入尺寸为128 × 64像素的裁剪运动员图像训练球员号码识别分支。使用本研究中采用的弱监督标注方法生成球员号码伪标签。在光学字符识别(OCR)损失计算中,排除号码不可见、无法辨认、严重遮挡或置信度低的裁剪区域。
  5. 使用公式2中定义的交叉熵损失优化OCR分支。
    figure-protocol-2 (2)
    其中,Locr 表示OCR损失,yi  表示监督式球员号码标签,figure-protocol-3 表示预测的球员号码类别。
  6. 使用材料表中列出的自适应优化器、学习率、批量大小、权重衰减和训练时长优化语义特征提取模块。使用公式3中定义的总训练目标函数,将检测器损失与OCR损失结合。
    Ltotal = Ldet + γLocr   (3)
    其中,Ltotal 表示总训练损失,Ldet 表示公式1中定义的检测器损失,Locr 表示公式2中定义的OCR损失,γ表示用户定义的OCR损失权重系数。
  7. 将训练好的OCR分支应用于每个裁剪后的运动员图像。保存每个裁剪区域预测的球员号码类别或概率向量。若球员号码不可见或OCR置信度低于实现中定义的阈值,则将球员号码特征记录为不可用,而非强制输出预测结果。
  8. 将球衣颜色描述符与球员号码输出合并为跟踪模块所使用的语义特征文件。
    注意:在主要的SportsMOT验证运行中,语义提取脚本处理了343,990个检测结果,未出现丢失帧或无效裁剪。在当前修订版本中,语义提取摘要报告在评估的SportsMOT设置下,颜色与OCR语义提取整体准确率为86.7%。本节的预期结果是一个语义特征文件,其中每个有效检测记录均关联一个球衣颜色描述符、一个可用的球员号码输出,以及一个指示语义信息是否可用于跟踪关联的标志。

4. 分区检测置信度水平

  1. 加载每个视频序列的检测器输出文件,收集每帧中所有运动员检测的置信度分数。
  2. 使用 K-means 聚类(K = 3)将帧级置信度分数划分为高、中、低三个置信度区间,遵循 图 2 所示的置信度引导关联流程。通过最小化簇内方差确定自适应置信度阈值,如 公式 4 所示。
    figure-protocol-4  (4)
    其中,sd 表示检测 d 的置信度分数;D1D2D3 分别表示高、中、低置信度区间;μ1、μ2 和 μ3 分别表示三个区间的平均置信度分数; τ1 和  τ2 表示由 K-means 聚类结果获得的自适应置信度阈值。
    注:置信度划分脚本(scripts/formal_partition_confidence.py)可在 JerseyTrack 源代码仓库中获取(https://doi.org/10.5281/zenodo.21274352)。该置信度划分模块采用基于 NumPy 的一维 K-means 聚类方法(K = 3),无需单独的配置文件,输入目录、输出目录和聚类参数通过命令行参数指定。使用以下命令执行置信度划分过程:python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3。所需软件依赖项(包括 NumPy 版本)在 environment.yml 中有明确说明。
  3. 以检测器输出目录作为输入,运行置信度划分程序。
    注:本研究中,检测器输出目录为:outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections;置信度划分输出目录为:outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence。生成的输出文件包括按序列划分的置信度 CSV 文件、_confidence_frame_summary.csv 和 _confidence_runtime.csv。
  4. 为每个检测分配一个置信度等级标签。高置信度检测用于基于运动的关联,中置信度检测用于运动-语义联合关联,低置信度检测仅用于轨迹恢复。保留原始置信度分数,并与分配的置信度等级标签一同存储。
  5. 检查置信度分数分布及代表性帧,如 图 3 所示。验证高置信度检测主要对应完整且可靠的运动员边界框,而中低置信度检测主要包含部分可见、被遮挡、模糊或弱检测的情况。
    注:本步骤的预期输出是一个置信度划分文件,其中包含每个检测的索引、原始置信度分数、分配的置信度等级以及帧级自适应置信度阈值。

figure-protocol-5
图 2。基于置信度引导的关联策略。 该工作流程通过自适应置信度聚类将检测置信度划分为高、中、低三个置信度区间。高置信度检测结果通过运动相似性进行关联,中等置信度检测结果通过结合运动与球衣语义相似性进行关联,低置信度检测结果则用于语义辅助的轨迹恢复,并通过多帧验证加以确认。右侧面板总结了用于置信度划分与关联的数学表达式。请点击此处查看该图的放大版本。

figure-protocol-6
图3。检测置信度分数的分布情况。 该直方图展示了SportsMOT数据集中足球、篮球和排球序列中五个置信度区间内的运动员检测框数量。该分布反映了在所评估的不同运动类别中检测器置信度的差异。请点击此处查看该图的放大版本。

5. 运行基于置信度引导的关联分析

  1. 加载每个视频序列的检测器输出文件、语义特征文件和置信度分区文件。使用首个有效检测结果初始化跟踪器,并为每个被跟踪运动员维护一条轨迹状态。对于后续每一帧,利用卡尔曼滤波运动模型预测每条现有轨迹的位置。
  2. 使用公式 5中定义的马氏距离,计算每条预测轨迹与候选检测之间的运动相似性。
    figure-protocol-7  (5)
    其中,figure-protocol-8 表示第 k 帧中的第 I 条轨迹,figure-protocol-9 表示卡尔曼预测的轨迹状态,dj 表示候选检测,figure-protocol-10 表示预测轨迹状态的逆协方差矩阵,Smot 表示预测轨迹与检测之间的运动距离。
    注:核心关联工作流在 JerseyTrack 源代码仓库(https://doi.org/10.5281/zenodo.21274352)中的 jerseytrack/formal_tracker.py 中实现,并通过 scripts/formal_track.py 执行。无需单独的配置文件。所有运行时参数,包括置信度阈值、最大轨迹寿命、运动权重系数和中心距离权重,均通过命令行参数提供。完整的执行命令和参数设置见第 6.2 步。该实现使用 SciPy 的线性求和分配算法进行匈牙利匹配,并使用 NumPy 进行基于代价的关联。
  3. 以检测器输出文件、语义特征文件和置信度分区文件作为输入,运行跟踪工作流。
    注:本研究中,核心跟踪器在 jerseytrack\formal_tracker.py 中实现,跟踪工作流通过 scripts\formal_track.py 执行。
  4. 利用运动一致性将高置信度检测结果与现有轨迹进行关联。仅当未匹配的高置信度检测满足轨迹初始化条件时,才更新已匹配轨迹并初始化新轨迹。
  5. 检查 图 4 所示的球衣语义提取输出结果,并根据公式 6将球队颜色描述符和球员号码特征组合,为每个检测构建球衣语义特征向量。
    fsem = [fcol;fid] (6)
    其中,fsem  表示融合后的语义特征向量,fcol 表示球队颜色描述符,fid 表示由 OCR 分支生成的球员号码特征。
  6. 结合运动相似性与球衣语义相似性,对中等置信度检测进行关联。根据公式 7计算融合匹配得分。
    figure-protocol-11 (7)
    其中,Ssem 表示轨迹与候选检测语义特征向量之间的余弦相似性,Smot 表示在公式 5中定义的运动距离, λ 表示平衡运动与语义相似性项的自适应融合系数。
  7. 根据公式 8计算自适应融合系数。
    figure-protocol-12 (8)
    其中,λ 表示初始运动权重系数, σsd 表示当前帧中检测置信度得分的标准差, σmax 表示用于归一化的最大置信度得分标准差。
  8. 仅将低置信度检测用于轨迹恢复。仅当语义信息可用且满足恢复条件时,才将低置信度检测与中断的轨迹进行匹配。在恢复轨迹身份前应用多帧验证,并丢弃未通过验证的检测。
    注:当球员号码特征不可用时,应基于可用的语义信息和运动一致性进行关联,而非强制进行球员号码匹配。本部分的预期输出为逐帧跟踪记录,包含轨迹标识、边界框、置信度标签、运动代价、语义信息及最终关联决策。在修订证据包中,跟踪结果存储于:outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking。

figure-protocol-13
图4.球衣语义特征提取。 代表性运动员检测结果标注了由球衣语义提取模块生成的球队颜色描述符和球员号码信息。提取出的语义特征随后被整合到置信度引导的数据关联中。请点击此处查看该图的放大版本。

6. 运行追踪推断并导出结果

  1. 使用准备好的检测器输出文件、语义特征文件和置信度分区文件,对每个视频序列运行跟踪推理。按时间顺序处理视频帧,以确保在整个序列中一致地更新轨迹状态、语义历史和轨迹恢复决策。除非明确报告了数据集特定的设置,否则所有评估序列均使用相同的推理配置。
    注意:跟踪推理通过 JerseyTrack 源代码仓库(https://doi.org/10.5281/zenodo.21274352)中提供的 scripts/formal_track.py 脚本执行。无需单独的配置文件。使用以下命令执行跟踪推理:python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1。所有未指定的参数均保留归档源代码中记录的默认值。
  2. 推理完成后,使用以下命令应用主要的后处理流程:python scripts/merge_tracklets.py 和 python scripts/sweep_track_filter.py --min-len 95。
  3. 以评估工具包要求的格式导出跟踪结果。包括帧索引、轨迹标识、边界框坐标以及基准评估格式所需的所有字段。为每个序列保存一个跟踪结果文件,并采用一致的文件命名约定,以便每个结果文件可与对应的真值标注文件匹配。
  4. 仅应用本研究中使用的后处理操作。使用修订包中描述的后处理脚本执行短轨迹合并和轨迹过滤。
    注意:在本研究中,后处理工作流使用了以下脚本:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. 在进行定量评估前,检查导出的跟踪结果。确认轨迹标识在每个序列内保持为数值型且一致,无帧索引缺失,且所有边界框均位于图像边界内。
    注意:本节的预期结果是一组完整的、可用于定量评估的序列级跟踪结果文件。

7. 评估追踪性能

  1. 使用材料表中列出的评估工具包评估导出的跟踪结果文件。将每个跟踪结果文件与相应的真值标注文件和数据集划分部分进行匹配。对所有对比方法使用相同的评估配置,以确保性能差异源于跟踪结果本身,而非评估设置的不同。
  2. 使用以下命令运行评估
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    注意:本研究中的评估使用了存档于 JerseyTrack 可重复性软件包内的标准 TrackEval(版本 1.3.0)指标实现。未对高阶跟踪精度(HOTA)、CLEAR 或身份(Identity)指标的实现进行任何修改。该代码库包含位于 evaluation/trackeval/scripts/run_mot_challenge.py 的 MOTChallenge 风格执行封装脚本,用于配置数据集路径和结果路径,并调用标准的 TrackEval 评估指标。
  3. 记录论文中报告的评估指标,包括多目标跟踪精度(MOTA)、身份 F1 分数(IDF1)、高阶跟踪精度(HOTA)、检测精度(DetA)、关联精度(AssA)、误报数(FPs)、漏报数(FNs)以及身份切换事件。将评估汇总结果导出为表格,并保留各序列的评估文件以供验证。
  4. 在将 JerseyTrack 与基线方法进行比较时,需对所有方法使用相同的数据集划分、检测器输出和评估配置。记录每次比较所用的数据集、检测器输出来源、评估工具包配置及各项指标数值。
  5. 检查评估日志,确认所有序列均已成功完成评估,且无跟踪结果文件缺失。
    注意:在本研究中,主要的 TrackEval 汇总文件存储于:outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt。本节的预期成果是一份完整的评估汇总表,以及支持报告结果和后续验证的各序列指标文件。

结果

本节报告了在评估的体育多目标跟踪实验中获得的定量与定性结果。结果重点关注在测试数据集设置下的跟踪准确性、身份保持、关联质量及鲁棒性。性能声明仅限于协议与实施设置中描述的评估方法、数据集、检测器输出及评估工具包配置。

实验设置与评估设计

数据集与预处理:

SportsMOT 被用作检测器准备、跟踪推理和定量评估的主要基准。该数据集包含 240 个视频序列,涵盖足球、篮球和排球场景,共计超过 150,000 张图像帧(图 5)。在正式评估中,主要的 SportsMOT 结果是通过验证集划分,结合协议中描述的检测器输出、跟踪配置以及 TrackEval 设置进行计算的。跨数据集评估在 TeamTrack、SoccerNet Tracking、MOT17 和 MOT20 上进行,旨在考察不同数据集类型之间的性能迁移能力,而非在数据集之间进行直接的指标级别比较。

figure-results-1
图5。用于评估的代表性数据集。 示例帧展示了用于实验评估的代表性足球、篮球和排球序列。该图强调了在所评估的数据集中,摄像机视角、球员密度以及场景复杂度的变化情况。 请点击此处查看该图的放大版本。

SportsMOT 数据按照官方数据集结构进行组织,并转换为本方案中描述的检测器训练格式。转换后的 SportsMOT 训练和验证数据包含 90 个序列、55,544 帧图像以及 608,152 个标注对象。训练集用于检测器的准备和参数调优,而验证集则用于本研究中报告的正式跟踪评估。所有输入帧均根据本方案及材料表中报告的检测器配置进行尺寸调整。在检测器准备、语义特征提取、跟踪推理和 TrackEval 评估过程中均应用了相同的预处理流程,以确保报告的差异主要反映的是跟踪关联策略的不同,而非数据处理上的差异。

评估指标:

使用材料表中列出的评估工具包所实现的 MOTChallenge 兼容评估协议来评估跟踪性能。报告的指标描述了体育多目标跟踪(MOT)性能的三个方面:整体跟踪准确率、身份保持能力以及检测-关联质量。MOTA、IDF1 和 HOTA 被用作主要评估指标44,45。MOTA 将误报、漏报和身份切换汇总为一个整体跟踪准确率得分。IDF1 衡量预测轨迹与真实身份之间的一致性。HOTA 同时评估检测准确率和关联准确率,因此能够表征目标定位与轨迹关联之间的平衡。DetA 和 AssA 作为补充指标进行报告。FPs、FNs 和身份切换(IDs)用于刻画与错误检测、漏检及身份变化相关的误差来源。在 SportsMOT 数据集上进行方法间比较时,采用相同的检测器输出和评估工具包配置,以减少检测器差异和评估设置不同所带来的影响。在跨数据集比较中,指标值应解释为各数据集内部的评估结果,而非不同数据集之间绝对性能优劣的证据。

实验环境与参数设置:

实验使用了材料表中列出的硬件和软件资源。在主要的SportsMOT实验过程中,始终采用相同的计算环境、检测器框架、检测器输出和评估工具包,以确保检测器准备、跟踪推理和性能评估的一致性。材料表中列出的检测器框架使用16的批量大小、0.01的初始学习率以及80个训练周期进行训练。在球衣语义提取模块中,颜色聚类采用K-means算法,其中K = 3;OCR分支使用轻量级卷积循环神经网络,输入尺寸为128 × 64像素。OCR分支采用材料表中列出的自适应优化器进行优化,学习率为1 × 10⁻3,权重衰减为1 × 10⁻5,批量大小为64,并训练40个周期。在语义特征提取模块的训练过程中未使用额外的学习率调度策略。OCR损失权重系数(γ)被视为用户自定义的超参数,并根据验证集上的性能进行选择。置信度分层采用自适应K-means划分方法,其中τ₁和τ₂是根据每帧的检测置信度分布计算得出,而非在推理前手动预设。

跨运动项目和情景复杂性的表现追踪

不同运动项目和场景条件下的定量性能表现:

跟踪性能的评估基于两个分组因素:运动类别和场景复杂度。运动类别分析包括足球、篮球和排球序列。场景复杂度分析则在所有被评估序列中,采用相同的分组标准,考虑遮挡程度、运动速度和目标密度。所报告的指标遵循第7节“方案”中描述的评估协议。 

图6总结了在不同运动类别和场景复杂度条件下的定量跟踪结果。图6A展示了足球、篮球和排球序列中的MOTA和DetA指标。图6B展示了在不同遮挡程度、运动速度和目标密度下的MOTA变化情况。图6C展示了每个场景复杂度维度的累积FP和FN计数。

figure-results-2
图6。不同运动类别和场景条件下的追踪性能。 (A) 足球、篮球、排球以及总体平均的多目标追踪准确率(MOTA)和检测准确率(DetA)。(B) 在不同遮挡程度、球员密度和运动复杂性水平的代表性场景条件下,MOTA 的表现。(C) 各评估场景条件下的误报(FP)和漏报(FN)数量。请点击此处查看该图的放大版本。

在三个运动类别中,JerseyTrack 的平均多目标跟踪准确率(MOTA)为 88.9%,平均检测准确率(DetA)为 80.2%。不同运动类别之间的 MOTA 差异为 1.3 个百分点,其中排球序列的 MOTA 最高(89.2%),篮球序列的 MOTA 最低(87.9%)。篮球序列中较低的 MOTA 与所评估序列中更频繁的近距离交互和严重遮挡现象一致。在复杂度较低的场景条件下,包括轻度遮挡、低速运动和稀疏目标分布,MOTA 分别达到 91.8%、93.1% 和 93.8%。而在更复杂的场景条件下,MOTA 在重度遮挡下下降至 84.9%,在高速运动下下降至 83.6%,在密集目标分布下下降至 83.1%。这些结果表明,随着场景复杂度的增加,跟踪性能有所下降,但仍处于所报道的各类运动场景的性能范围内。

在代表性体育场景中追踪一致性:

图7展示了代表性跟踪示例,说明了JerseyTrack在三种具有挑战性的体育场景下的时间一致性:密集的运动员交互、长时间的部分遮挡以及快速的方向变化。在这些代表性序列中,尽管运动员频繁重叠且运动状态动态变化,跟踪器仍保持了稳定的轨迹身份。身份碎片化主要发生在严重遮挡或球衣语义信息暂时不可用时;然而,得益于置信度引导的关联策略,在可靠检测结果重新出现后,轨迹得以恢复。这些代表性示例通过在所评估的体育跟踪条件下展示稳定的身份保持能力,定性地支持了图6中所示的定量结果。

figure-results-3
图7.JerseyTrack 生成的代表性跟踪结果。 来自篮球、足球和排球视频序列的连续帧展示了在跟踪过程中运动员身份与轨迹的保持情况。彩色边界框表示在连续视频帧中被持续跟踪的身份。请点击此处查看该图的放大版本。

身份保持的消融实验结果:

为了分析置信度引导关联策略和球衣语义融合模块对身份保持的贡献,进行了消融实验。比较了四种模型变体:V0,即无置信度引导关联和球衣语义融合的基线模型;V1,仅使用置信度引导关联的变体;V2,仅使用球衣语义融合的变体;以及V3,完整版JerseyTrack配置,包含上述两个组件。评估重点为与身份相关的指标,包括ID数(IDs)、IDF1分数、身份精确率(IDP)和身份召回率(IDR)。具有代表性的身份保持模式如图8所示。

figure-results-4
图8. 基于置信度引导的球衣语义关联的消融分析。 (A) 所评估模型变体的整体身份切换次数(IDs)和身份F1分数(IDF1)。(B) 完整模型(V3)与基线配置(V0)在代表性挑战性跟踪场景下的身份切换次数(IDs)比较。(C) 完整模型在不同跟踪场景下的IDF1、ID精确率(IDP)和ID召回率(IDR)。请点击此处查看该图的放大版本。

在整体的SportsMOT验证设置中,完整的V3配置在四种模型变体中产生的ID数量最少,IDF1得分最高。V3记录了2,768个ID,比V0减少了477次身份切换,IDF1达到74.3%,较V0提高了7.1个百分点。这些结果表明,在所评估的运动追踪条件下,两个模块共同促进了身份保持。将单模块变体与完整配置进行比较进一步显示,这两个模块影响了不同来源的追踪误差。基于置信度引导的关联策略减少了与检测置信度不稳定和定位不确定性相关的匹配错误,而球衣语义融合模块在仅靠运动信息不足以区分身份时提供了额外的身份信息。完整的V3配置在与身份相关的性能上优于任一单模块变体,表明这两个模块提供了互补而非冗余的贡献。

在更具挑战性的身份保持条件下,场景级结果显示出更大的差异。在长时间遮挡情况下,V3记录的ID数为215,而V0为482。在包含6至10名球员的密集同队场景中,V3记录的ID数为328,而V0为615。在高速方向变化条件下,V3记录的ID数为482,而V0为960。这些减少与在遮挡和密集交互期间使用语义线索的预期用途一致,也与在快速运动过程中检测置信度波动时基于置信度引导的关联策略相符。图8C所示的身份精度(IDP)和身份召回率(IDR)趋势表明,ID数量的减少并未伴随身份精度或身份召回率的显著下降。完整配置在所有评估的挑战性场景中均保持IDF1值高于71%,其中在密集同队交互和高速方向变化条件下的值相对较低。这些结果表明,在所评估的条件下身份一致性有所提升,同时指出密集交互和快速运动仍是当前性能下降的主要来源。

跨数据集评估结果:

进行了跨数据集评估,以检验在SportsMOT上观察到的跟踪行为是否能在不同的数据集条件下保持。评估包括两个体育专用数据集SoccerNet Tracking和TeamTrack,以及两个通用MOT数据集MOT17和MOT20。本实验的目的是考察在不同类型数据集之间的性能迁移能力。由于各数据集的标注协议、场景构成、摄像机视角和目标类别存在差异,因此未将结果用于声称在数据集间具有直接的指标级优势。

表1总结了跨数据集的评估结果。在特定运动数据集上,与主要的SportsMOT验证设置相比,JerseyTrack保持了相对稳定的MOTA和IDF1值。这一趋势表明,当跟踪场景保留了团队运动的视觉特征(包括重复的队服、密集的运动员交互以及频繁的遮挡)时,基于置信度引导的关联策略和与队服相关的语义线索仍然有效。在通用MOT数据集上,该方法保持了具有竞争力的MOTA和DetA值,但IDF1低于在特定运动数据集上观察到的结果。这一模式与MOT17和MOT20中缺乏队服颜色和球员号码线索一致,而这些线索正是语义融合模块所依赖的。在此类条件下,置信度引导的关联组件仍然适用,而语义分支所提供的身份特异性信息则少于其在团队运动视频中的贡献。总体而言,这些结果表明,JerseyTrack向包含特定运动视觉语义的数据集迁移的效果优于向通用行人跟踪数据集的迁移。因此,跨数据集评估支持该方法作为面向运动场景的跟踪器的预期应用,同时也指出了在非运动MOT数据集中缺乏明确的队服语义是其性能受限的一个因素。

数据集MOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86.871.377.932.1
TeamTrack86.270.777.332.8
MOT1784.769.576.133.9
MOT2084.168.975.333.2

表1: 跨数据集评估结果。 JerseyTrack在四个公开基准数据集上的跟踪性能。报告了多目标跟踪准确率(MOTA)、身份F1分数(IDF1)、检测准确率(DetA)以及以每秒帧数(FPS)衡量的处理速度。MOTA、IDF1、DetA和FPS的数值越高,表示性能越好。

在受控扰动条件下的稳健性

为评估JerseyTrack在体育视频中常见的视觉干扰和检测质量下降情况下的稳定性,开展了受控扰动实验。所评估的扰动分为三类:语义特征扰动、检测框扰动和环境扰动。语义特征扰动包括球员号码遮挡、图像模糊、分辨率降低以及相似球衣颜色。检测框扰动包括边界框偏移、检测置信度波动和错误检测框。环境扰动包括雨点状噪声、雾化状退化、强光照和阴影干扰。图9总结了在这些扰动条件下的跟踪性能。在语义特征扰动下,随着球员号码可见性和裁剪图像质量的下降,跟踪性能也随之降低。当40%的球员号码区域被遮挡时,MOTA相较于无扰动条件下降了3.2个百分点,IDF1下降了5.3个百分点,而语义提取准确率仍保持在86.7%。这些结果表明,当某一语义线索可靠性降低时,球衣颜色和球员号码线索提供了互补信息。在检测框扰动下,该方法表现出适度的性能下降,而非突然失效。当检测框偏移±10像素且置信度分数受到高斯噪声干扰时,MOTA的下降幅度低于3个百分点,ID切换次数的增加控制在16%以内。这一趋势与置信度引导的关联策略一致,即中低置信度检测会采用额外的关联约束进行处理,而非采用与高置信度检测相同的策略。

figure-results-5
图9. 在受控扰动下的鲁棒性评估。 (A) 随着球衣号码遮挡程度增加,多目标跟踪精度(MOTA)、身份F1分数(IDF1)和身份切换次数(IDs)的变化情况。 (B) 在代表性干扰条件下的性能下降情况。 (C) 在不同类型干扰下IDs的增长情况。 (D) 在评估的扰动条件下球衣语义提取的准确率。 请点击此处查看此图的放大版本。

在环境扰动条件下,主要跟踪指标的下降幅度在评估条件下保持在5个百分点以内,语义提取准确率保持在87.2%。基于HSV的颜色描述符降低了对光照变化的敏感性,而OCR分支则在部分模糊或质量下降的图像裁剪区域中保留了可用的球员号码信息。这些结果表明,语义模块在所评估的扰动条件下仍具备可用性,尽管其可靠性仍依赖于球衣的可见性及图像裁剪质量。总体而言,受控扰动实验表明,JerseyTrack在所评估的语义、检测质量及环境扰动条件下仍能维持可测量的跟踪性能。这些发现应在已测试的扰动范围内进行解读。系统性的视野外重识别、严重背景杂乱以及长期完全遮挡未在本实验中单独评估,相关内容已在讨论部分作为局限性进行阐述。

模块贡献与特征区分分析

为进一步分析所提出的两个组件如何影响与身份相关的跟踪性能,进行了模块贡献分析和特征区分分析。模块贡献分析采用了消融分析中定义的四种模型变体,而特征区分分析则比较了传统的行人重识别(Re-ID)特征、仅颜色特征、仅球员号码特征以及融合的球衣语义特征。采用类间/类内距离比值来描述特征的可分性,比值越大,表示不同身份之间的特征分离程度相对于同一身份内部的变化更为显著。表2总结了模块贡献分析结果。在整体评估中,置信度引导关联策略的估计贡献为41.7%,球衣语义融合的估计贡献为47.6%,剩余10.7%归因于两个组件的联合使用。这些数值表明,两个组件均对性能提升有所贡献,而完整配置的性能优势来源于两个组件的协同作用,而非任一组件单独作用。贡献模式随场景类型而变化。在严重遮挡情况下,球衣语义融合的估计贡献上升至69.4%,这与运动员部分或暂时被遮挡时运动线索可靠性降低的情况一致。在高速运动场景下,置信度引导关联的估计贡献达到44.3%,联合增益达到20.6%,表明由于快速运动或定位不确定性导致检测置信度波动时,基于置信度水平的划分变得更加重要。

模型变体测试场景MOTA↑IDF1↑IDs↓模块贡献协同增益
V0(基线)整体场景83.567.23245
严重遮挡场景77.861.53862
高速运动场景77.162.33689
V1(置信度引导关联)整体场景86.370.9289341.7
严重遮挡场景80.965.9341529.8
高速运动场景81.467.9302444.3
V2(球衣语义关联)整体场景85.271.8293747.6
严重遮挡场景82.772.8275369.4
高速运动场景80.166.8315735.1
V3(完整 JerseyTrack)整体场景88.974.3276810.7
严重遮挡场景84.975.626890.8
高速运动场景83.671.5284220.6

表2: 模块贡献的消融分析。 不同 JerseyTrack 模型变体在整体、严重遮挡和高速运动场景下的性能比较。报告了多目标跟踪精度(MOTA)、身份F1分数(IDF1)以及身份切换次数(IDs),并附有估计的模块贡献和协同增益。MOTA、IDF1、模块贡献和协同增益的数值越高表示性能越好,而IDs数值越低表示性能越好。

表3总结了特征判别分析结果。融合的球衣语义特征的类间/类内距离比达到5.63,而传统Re-ID特征为1.82,距离比指标相对提升了209.3%。仅使用颜色和仅使用球员号码的特征相较于传统Re-ID特征也提高了特征可分性,但每种单一线索仍易受特定失败情况的影响,包括相似的球队颜色、球员号码被遮挡、运动模糊以及无法识别的球衣区域。在所评估的特征表示中,融合语义表示实现了最高的特征可分性,并在消融分析中对应最高的IDF1分数和最低的ID切换次数。这些发现支持在运动员外观相似且仅靠运动信息不足以区分身份时,将球衣特异性语义线索作为体育多目标跟踪(MOT)中的补充身份信息使用。这些观察结果仅限于所评估的SportsMOT场景,不应被解读为球衣语义能够解决所有体育视频中的身份歧义问题。

特征类型类间/类内距离比相对提升 (%)IDF1↑IDs↓
传统行人重识别特征1.8265.73482
队服颜色特征3.1774.269.83125
球员号码特征3.4991.870.53018
融合球衣语义特征5.63209.374.32768

表3: 不同特征表示的判别性分析。 对比了传统行人重识别(Re-ID)特征、球衣颜色特征、球员号码特征以及融合语义特征在特征判别性上的表现。报告了类间/类内距离比、特征判别性的相对提升、IDentity F1分数(IDF1)以及身份切换次数(IDs)。距离比、相对提升和IDF1的数值越高表示性能越好,而IDs数值越低表示性能越好。

与现有多目标跟踪方法的基准比较

通过基准比较,在相同的 SportsMOT 验证设置下,将 JerseyTrack 与具有代表性的多目标跟踪(MOT)方法进行了对比。参与比较的方法包括 QDTrack、DeepSORT、ByteTrack、FairMOT、Deep OC-SORT 和 MOTR。所有方法均使用由材料表中所列检测器框架生成的相同检测输出,以确保比较聚焦于跟踪关联性能,而非检测器差异。评估采用了第 7 节协议中定义的指标 。主要评估指标包括 MOTA、HOTA 和 IDF1;辅助指标包括 DetA、AssA、FPs、FNs 和 IDs。表 4 总结了在 SportsMOT 验证集上的定量比较结果,图 10 则展示了在所评估的体育场景中,各方法在跟踪精度、推理速度和 HOTA 分布方面的可视化对比。JerseyTrack 在参与比较的方法中取得了最高的 MOTA,达到 88.9%。该数值比 Deep OC-SORT(87.8%)高出 1.1 个百分点,比 ByteTrack(86.4%)高出 2.5 个百分点。因此,在所评估的 SportsMOT 验证设置下,JerseyTrack 在整体跟踪精度方面优于其他对比方法。在 HOTA 指标上,JerseyTrack 达到 69.9%,高于 Deep OC-SORT 的 64.4% 和 ByteTrack 的 62.8%。这些差异分别对应 5.5 和 7.1 个百分点的提升,表明在相同评估条件下,JerseyTrack 在检测与关联性能之间实现了更高的平衡性。

方法MOTA↑HOTA↑IDF1↑DetA↑AssA↑FP↓FN↓IDs↓
QDTrack75.953.751.665.639.796,32489,8718,216
DeepSORT77.654.153.267.34476,22886,3196,836
ByteTrack86.462.867.773.850.933,75278,6984,192
FairMOT84.154.762.577.847.845,18783,6204,817
Deep OC-SORT87.864.469.978.252.125,01274,3853,211
MOTR82.957.258.468.946.154,93185,0635,137
JerseyTrack88.969.974.380.254.321,95367,1602,768

表4: JerseyTrack 与代表性多目标跟踪方法在 SportsMOT 验证集上的性能比较。 JerseyTrack 与代表性多目标跟踪(MOT)方法在 SportsMOT 验证数据集上的比较。报告的指标包括多目标跟踪精度(MOTA)、高阶跟踪精度(HOTA)、身份 F1 分数(IDF1)、检测精度(DetA)、关联精度(AssA)、误报数(FP)、漏报数(FN)以及身份切换次数(IDs)。对于 MOTA、HOTA、IDF1、DetA 和 AssA,数值越高表示性能越好;而对于 FP、FN 和 IDs,数值越低表示性能越好。

figure-results-6
图10.与代表性多目标跟踪方法的性能比较。 (A) JerseyTrack 与在 SportsMOT 数据集上评估的代表性多目标跟踪方法在多目标跟踪准确率(MOTA)和每秒帧数(FPS)方面的比较。(B) 各跟踪方法在高阶跟踪准确率(HOTA)上的分布情况。请点击此处查看此图的放大版本。

在身份保持方面,JerseyTrack 的 IDF1 达到 74.3%,高于 Deep OC-SORT 的 69.9% 和 ByteTrack 的 67.7%。JerseyTrack 记录的 ID 数量为 2,768 个,少于 Deep OC-SORT 的 3,211 个 ID 和 ByteTrack 的 4,192 个 ID。这些观察结果与 图 8 表 2 中所示的消融实验结果一致,表明完整的 JerseyTrack 配置相较于基线模型变体减少了身份切换现象。在检测与关联质量方面,JerseyTrack 的 DetA 为 80.2%,AssA 为 54.3%。与 Deep OC-SORT 相比,JerseyTrack 的 DetA 提高了 2.0 个百分点,AssA 提高了 2.2 个百分点。此外,JerseyTrack 产生的假阳性(FP)和假阴性(FN)数量也少于 表 4 中报告的其他对比方法,分别记录为 21,953 个 FP 和 67,160 个 FN。总体而言,在 SportsMOT 验证设置下,基准对比表明 JerseyTrack 在所评估方法中实现了最高的主要跟踪指标值。这些结果与采用置信度引导关联和球衣语义融合所观察到的身份保持和关联稳定性提升一致。本比较仅限于本研究中使用的共享检测器输出和 SportsMOT 验证配置。

参数敏感性结果

通过参数敏感性分析,研究了关键实现参数在SportsMOT验证设置下对跟踪性能的影响。评估了三个参数:OCR损失加权系数(γ)、置信度层级聚类数量(K)以及OCR网络学习率(η)。表5总结了在不同参数设置下获得的MOTA、IDF1、HOTA和ID数量。

参数数值MOTA↑IDF1↑HOTA↑IDs↓
OCR 损失权重 (γ)0.284.769.466.22,944
0.486.371.568.22,893
0.687.973.168.92,815
0.8 (最优)88.974.369.92,768
188.273.869.32,792
置信度聚类数量 (K)286.772.168.52,876
3 (最优)88.974.369.92,768
488.173.669.72,803
587.372.869.22,851
OCR 学习率 (η)1 × 10⁻⁴85.970.867.32,934
5 × 10⁻⁴87.672.768.72,832
1 × 10⁻³ (最优)88.974.369.92,768
5 × 10⁻³87.873.2692,817
1 × 10⁻²86.571.668.72,889

表5: 参数敏感性分析。 使用 JerseyTrack 的不同参数设置所获得的跟踪性能。针对光学字符识别(OCR)损失加权系数(γ)、置信度聚类数量(K)和 OCR 学习率(η)的不同取值,报告了多目标跟踪精度(MOTA)、身份 F1 分数(IDF1)、高阶跟踪精度(HOTA)以及身份切换次数(IDs)。被确定为最优的参数值对应于报告实验中所采用的设置。MOTA、IDF1 和 HOTA 的数值越高表示性能越好,而 IDs 的数值越低表示性能越好。

对于OCR损失权重系数(γ),在γ = 0.8时获得了最佳的评估性能。在此设置下,JerseyTrack实现了88.9%的MOTA、74.3%的IDF1、69.9%的HOTA以及2,768个ID。当γ降低至0.2时,MOTA、IDF1和HOTA分别下降至84.7%、69.4%和66.2%,而ID数量增加至2,944个。当γ增加至1.0时,各项性能指标相较于γ = 0.8时略有下降,MOTA为88.2%,IDF1为73.8%,HOTA为69.3%,ID数量为2,792个。这些结果表明,OCR监督不足会降低球员号码的区分能力,而在测试条件下,进一步提高OCR损失权重超过所评估的最优值并不能改善追踪性能。

对于置信度层次聚类数(K),在 K = 3 时获得了最佳的评估性能。该设置对应于方法中描述的高、中、低置信度关联策略。当 K = 2 时,置信度划分的粒度较粗,MOTA、IDF1 和 HOTA 分别下降至 86.7%、72.1% 和 68.5%。当 K 增加至 4 或 5 时,性能相较于 K = 3 也有所下降,表明过度划分将检测结果分入了过于狭窄的置信度组,从而降低了关联策略的稳定性。这些结果支持在所评估的 JerseyTrack 配置中采用三个置信度等级。

对于OCR网络的学习率(η),在η = 1 × 10-3时获得了最佳的评估性能。当学习率降低至1 × 10-4时,MOTA、IDF1和HOTA分别下降至85.9%、70.8%和67.3%,而ID数量增加至2,934。当学习率升高至1 × 10-2时,MOTA、IDF1和HOTA分别下降至86.5%、71.6%和68.7%,而ID数量增加至2,889。这些结果表明,OCR分支对学习率的选择较为敏感,在评估条件下,1 × 10-3的学习率在球员号码识别与身份保持性能之间提供了最佳平衡。

总体而言,表5 显示参数组合 γ = 0.8、K = 3 和 η = 1 × 10-3 产生了最高的 MOTA、IDF1 和 HOTA 评估值,同时伴随最少的 ID 切换次数。敏感性分析还表明,从这些参数值适度偏离会导致跟踪性能发生可测量但非突变的变化。因此,本研究中报告的基准比较以及主要的 SportsMOT 验证实验均采用了这些参数设置。

数据可用性

支持本研究结果的原始评估摘要、最终跟踪输出、环境记录、数据集映射文件以及中间摘要文件均公开存放在以下公共仓库中:https://doi.org/10.5281/zenodo.21274353。本研究使用的原始公开基准数据集,包括 SportsMOT、TeamTrack、SoccerNet Tracking、MOT17 和 MOT20,均由各自的数据提供方发布,未在该仓库中重新分发。

讨论

本研究评估了一种结合检测置信度划分与球衣语义线索的置信度引导体育多目标跟踪(MOT)工作流程。置信度引导关联与语义特征融合已被作为提升多目标跟踪中数据关联性能的互补策略进行研究12,20,23,24,46。结果表明,在所评估的SportsMOT验证设置下,完整的JerseyTrack配置提升了身份保持能力与关联稳定性。主要的SportsMOT验证结果达到了88.9%的MOTA、69.9%的HOTA、74.3%的IDF1、80.2%的DetA以及54.3%的AssA。这些数值应在协议中描述的检测器输出源、数据集划分和TrackEval配置背景下进行解读。

工作流程中的一个关键步骤是置信度分级划分,它能够根据检测器输出的可靠性应用不同的关联策略20,22,23,24。通过将检测结果划分为高、中、低三种置信度组别,JerseyTrack 对不同可靠性级别的检测采用不同的关联规则。高置信度检测主要通过运动一致性进行关联,中等置信度检测则结合运动信息与球衣语义信息共同进行关联。低置信度检测不用于初始化新轨迹,仅在轨迹恢复阶段被考虑。该设计降低了弱检测或误检导致身份不稳定的风险,同时仍允许在存在额外语义证据时,部分检测结果参与轨迹恢复过程8,11,20。第二个关键步骤是球衣语义特征提取。队服颜色特征提供了团队层面的约束,而当球员号码区域可见且可读时,号码特征则提供更精细的身份线索35,41,42,43。消融实验结果表明,这些线索在密集的同队交互和遮挡场景中最为有效,因为在这些情况下仅依赖运动的关联方法可靠性较低。然而,球衣语义信息应被视为辅助证据,而非对运动关联的完全替代。球员号码在图像模糊、截断、背身姿态、严重遮挡或低分辨率情况下可能无法识别。当号码信息不可用时,队服颜色特征也无法区分同一队内的不同运动员35,42,43。跨数据集实验结果进一步明确了该方法的适用范围。JerseyTrack 在团队运动数据集上的迁移效果优于通用行人多目标跟踪(MOT)数据集,因为其语义分支的设计基于球衣颜色和球员号码线索19,33,34,35,36,37。在通用MOT数据集中,置信度引导的关联组件仍然适用,但针对体育场景设计的语义分支所提供的身份信息贡献较小。因此,该方法最适用于运动员穿着可区分队服、且球衣区域足够可见以支持语义特征提取的团队运动视频19,33,34,35,36,37

目前仍存在若干局限性。首先,该方法依赖于检测器输出的质量;严重的漏检或不准确的边界框会降低运动预测和语义裁剪的可靠性14,17,46。其次,当前实现未对长期离开视野后的重识别进行单独优化。当运动员长时间离开摄像机视野后重新进入时,现有的轨迹恢复策略可能不足以恢复其原始身份19,34。第三,严重的背景杂乱、球员重叠、运动模糊以及无法辨认的球衣号码均可能降低语义特征的可靠性14,35,42,46。第四,当前评估主要集中于公开基准数据集和受控的扰动设置;在包含镜头切换、变焦变化和非标准视角的广播视频中部署时,可能需要额外的预处理或重识别模块19,33,34

主要的实际意义在于,可以在不改变检测器结构的情况下,将基于置信度的关联方法与特定球衣的语义线索整合到模块化的多目标跟踪(MOT)流程中。该能力可应用于运动员轨迹提取、球队移动分析、战术事件回顾以及半自动视频标注等体育分析任务1,4,33,36。未来的研究应聚焦于更强大的视野外重识别、背景杂乱处理、时序特征聚合,以及在严重模糊或遮挡条件下的更鲁棒的球员号码识别14,19,34,46

综上所述,JerseyTrack 是一种结合了置信度引导关联与球衣语义融合的体育运动多目标跟踪(MOT)方法。该方法将检测结果划分为高、中、低三种置信度组,并根据检测的可靠性应用不同的关联规则,同时在中等置信度关联和轨迹恢复过程中,利用球衣颜色和球员号码作为辅助的身份信息。在所评估的 SportsMOT 验证设置下,JerseyTrack 相较于基准配置表现出更高的跟踪精度和身份保持能力。消融实验结果表明,完整配置相比基准方法及单一模块变体减少了身份切换次数;基准对比结果显示,在共享检测器输出和评估配置条件下,主要跟踪指标均取得更高数值。这些发现支持在团队运动视频的运动员跟踪中使用置信度层级信息以及针对球衣的语义线索,尤其是在球衣区域可见、且球队颜色或球员号码能够提供补充身份证据的情况下20,35,46。解决所识别出的局限性,可能进一步提升该方法在更具挑战性的体育跟踪场景中的适用性。

披露

作者声明不存在经济利益冲突。

材料

本文使用的材料清单
姓名公司目录编号评论
CUDA 运行时NVIDIA版本 12.8用于检测器训练、语义特征提取和跟踪推理的 GPU 计算运行环境。
EasyOCRJaided AI版本 1.7.2用于球员号码识别的光学字符识别工具包。
JerseyTrack 源代码作者N/A包含数据准备、语义特征提取、置信度划分、跟踪、后处理和评估脚本的自定义实现。可从以下网址获取:https://doi.org/10.5281/zenodo.21274352
轻量级 CRNN OCR 模型作者N/A用于球员号码识别的自定义卷积循环神经网络(CRNN)。
MOT17 数据集MOTChallengeN/A用于跨数据集评估的公开基准数据集。可从以下网址获取:https://motchallenge.net/data/MOT17/
MOT20 数据集MOTChallengeN/A用于跨数据集评估的公开基准数据集。可从以下网址获取:https://motchallenge.net/data/MOT20/
motmetricsmotmetrics 开发者版本 1.4.0用于诊断多目标跟踪指标计算的库。
NVIDIA GPUNVIDIAGeForce RTX 5090 D V2用于检测器训练和跟踪推理的图形处理器。
NVIDIA GPU 驱动程序NVIDIA版本 610.62实验环境中使用的 GPU 驱动程序。
NumPyNumPy 开发者版本 2.4.4用于特征处理和数据操作的数值计算库。
OpenCVOpenCV版本 4.10.0用于图像加载、裁剪、预处理和可视化的计算机视觉库。
PythonPython 软件基金会版本 3.12.2整个工作流程中使用的编程语言。
PyTorchPyTorch 基金会版本 2.11.0+cu128用于实现检测器和语义模型的深度学习框架。
scikit-learnscikit-learn 开发者版本 1.9.0在球衣颜色提取和置信度划分过程中用于 K 均值聚类的机器学习库。
SoccerNet 跟踪数据集SoccerNetN/A用于跨数据集评估的公开足球跟踪基准。可从以下网址获取:https://www.soccer-net.org/tasks/tracking
SportsMOT 数据集SportsMOT 基准N/A用于检测器准备和跟踪评估的主要基准数据集。可从以下网址获取:https://deeperaction.github.io/datasets/sportsmot.html
TeamTrack 数据集TeamTrack 基准N/A用于跨数据集评估的公开体育跟踪基准。可从以下网址获取:https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch 基金会版本 0.26.0+cu128与 PyTorch 配合使用的计算机视觉库,用于图像变换和模型支持。
TrackEvalTrackEval 开发者版本 1.3.0评估工具包,用于计算多目标跟踪精度(MOTA)、身份 F1 分数(IDF1)、高阶跟踪精度(HOTA)、检测精度(DetA)、关联精度(AssA)、误报(FP)、漏报(FN)和身份切换(IDs)。
UltralyticsUltralytics版本 8.4.90用于训练检测器并生成运动员检测结果的目标检测框架。

参考文献

  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

SportsMOT

相关文章