需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

一种基于球衣语义融合的置信度引导体育视频多目标跟踪方法

59 次观看

DOI:

10.3791/71557

2026年8月14日

本文内容

摘要

本方案描述了一种基于置信度引导的多目标跟踪工作流程,用于体育视频分析,通过整合球衣颜色和球员号码信息,以提高在置信度波动、遮挡以及运动员外观相似等情况下的轨迹关联性和身份一致性。

摘要

体育视频中的多目标跟踪(Multi-Object Tracking, MOT)可为战术分析、运动员行为解读和自动化统计分析提供轨迹信息。然而,体育场景中常出现快速变向、突然停止、频繁遮挡以及队友外观相似等情况,导致检测置信度波动以及帧间关联时的身份混淆。为应对这些挑战,本研究提出JerseyTrack,一种基于球衣语义融合的置信度引导型体育MOT方法。该工作流程根据每帧的置信度分布,自适应地将检测框划分为高、中、低三种置信度区间。高置信度检测主要依据运动相似性进行关联,而中低置信度检测则进一步融合通过颜色聚类和轻量级光学字符识别(Optical Character Recognition, OCR)模型提取的球衣颜色与球员号码特征。这些语义特征在补充匹配过程中与运动信息融合,以提升轨迹连续性与身份一致性。该方法在SportsMOT数据集上进行了评估。JerseyTrack取得了88.9%的多目标跟踪精度(Multiple Object Tracking Accuracy, MOTA)、74.3%的身份F1分数(IDentity F1 Score, IDF1)以及69.9%的高阶跟踪精度(Higher Order Tracking Accuracy, HOTA),表明其在所评估的体育跟踪场景下具有更优的跟踪性能。本方案提供了一套可复现的工作流程,用于整合置信度引导的关联策略与球衣语义信息,以提升体育视频中的多目标跟踪效果。

引言

多目标跟踪(MOT)可在视频序列中实现目标的持续定位与身份保持,支持体育视频应用中的运动员轨迹提取、战术分析及自动化统计分析1,2,3。可靠的视觉信息还与运动专项中的决策制定和表现评估密切相关,进一步凸显了稳定的视频衍生运动数据在后续体育分析中的重要价值4。在体育场景中,战术数据的可靠性取决于跟踪轨迹的连续性以及目标身份的一致性。

与一般的多目标跟踪(MOT)场景相比,体育视频包含快速的方向变化、突然的停顿、跳跃、密集的交互以及频繁的遮挡。这些因素导致检测框置信度出现显著波动,并增加低置信度检测的频率,从而可能中断轨迹关联5,6。统一的队服进一步削弱了一般外观特征的区分能力,增加了外观相似的队友之间的身份混淆7,8。当遮挡与外观相似性在同一视频序列中同时发生时,检测置信度下降,目标外观信息变得不完整,从而加大了轨迹关联与身份维持的难度9,10。在多目标跟踪中,重识别(Re-ID)是指利用与身份相关的视觉证据,将在不同帧、遮挡期间或重新进入场景时的同一目标进行身份关联的过程。在团队体育视频中,由于同队运动员通常穿着相似的队服并具有类似的体型,通用的重识别线索可能被削弱。技术文献综述表明,体育场景中的多目标跟踪所面临的轨迹碎片化和身份混淆问题,通常通过两种互补的方法加以解决:利用检测置信度和增强身份线索。JerseyTrack 位于这两种方法的交汇点,其根据检测质量来调节队服语义线索的使用,而非将颜色和球员号码信息无差别地应用于所有检测结果。

本研究提出了JerseyTrack,一种基于球衣语义融合的置信度引导型多人运动目标跟踪(MOT)方法。该方法适用于运动员穿着明显球衣且检测结果提供带有置信度评分的边界框的团队运动视频。JerseyTrack结合了四个主要组件:运动员检测、置信度层级划分、球衣语义特征提取以及级联帧间关联。利用检测置信度自适应地将检测结果划分为高、中、低置信度三组,并采用不同的关联策略进行处理。高置信度检测主要通过运动信息进行关联,而中低置信度检测则额外引入球衣颜色和球员号码信息,以在视觉证据较弱时提升身份保持能力。该方法适用于需要稳定运动员轨迹的体育视频分析任务,例如战术分析和球员行为解读。

该方法也存在操作上的局限性。球衣语义信息的提取可能受到严重遮挡、运动模糊、图像分辨率低、球衣姿态异常或球员号码不可见等因素的影响。在这些情况下,基于球衣的语义线索可能变得不完整,此时关联过程将更依赖于运动一致性与多帧验证。因此,本研究中的性能结论仅限于所评估的数据集和实验设置。在 SportsMOT 数据集上的实验表明,JerseyTrack 在测试的体育运动跟踪条件下,提升了各项跟踪指标的表现,并减少了身份切换事件的发生。体育视频中多目标跟踪(MOT)的主要难点在于快速运动、遮挡以及外观相似性条件下维持轨迹连续性和身份一致性。与 JerseyTrack 相关的现有研究大致可分为两个方向:一是利用检测置信度进行轨迹关联,二是通过体育场景特有的语义特征增强身份线索。

检测置信度已被广泛用于估计检测框的可靠性,并在多目标跟踪(MOT)中指导轨迹关联。早期的跟踪方法通常将置信度视为二值化过滤标准,即移除低于固定阈值的检测结果,以减少误检11,12。该策略虽可降低噪声检测,但在遮挡、快速运动或图像质量较低的情况下,也可能丢弃真实目标,导致轨迹断裂13,14,15。类似过滤策略还表明,固定的置信度阈值对场景变化和检测质量较为敏感16,17。为更有效地利用低置信度检测结果,ByteTrack 提出了一种关联策略,保留低置信度检测框作为候选目标进行二次匹配,并通过运动相似性和轨迹历史信息将其与已有轨迹进行关联18。McByte 进一步在体育场景的多目标跟踪中引入了时序传播的分割掩码作为关联线索,在无需额外视频训练的情况下,提升了在快速运动、遮挡和相机位移条件下的鲁棒性19。相关研究也调整了对低置信度检测结果的使用方式,以在关联过程中保留微弱但可能有效的目标20,21,22。随后,置信度自适应的关联策略根据运动一致性与检测可靠性进一步优化了匹配准则23,24,25。基于检测框回归和轨迹平滑性优化的轨迹 refinement 方法也被用于减少轨迹断裂现象26,27,28。其他 refinement 策略在复杂运动条件下为维持轨迹连续性提供了补充支持29。时序一致的对象流进一步建模了跨帧的对象级时序一致性,为减少复杂 MOT 场景中的轨迹中断提供了另一种面向关联的解决方案30。跟踪器融合方法则通过学习多个跟踪器的输出,采用基于学习的选择或融合策略,提升了在不同 MOT 基准上的跟踪鲁棒性31。总体而言,这些研究表明,考虑置信度的关联策略有助于恢复中断的轨迹;然而,当同一队伍的运动员外观相似时,置信度和运动线索所提供的身份信息十分有限。尽管这些方法在一般场景下能有效缓解轨迹断裂问题,但在体育场景中仍存在固有局限性,因为同队运动员通常具有高度相似的视觉外观,仅依赖置信度和运动信息无法为身份区分提供充分依据32,33,34。即使低置信度检测框被有效召回,特征相似性仍可能导致身份切换,难以满足体育分析中对身份一致性的严格要求。

运动特异性身份线索也被用于提升运动员追踪中的身份区分能力。球衣语义信息(如球队颜色和球员号码)所提供的身份线索相较于通用的外观嵌入特征,与体育场景的关联更为直接35,36,37。球衣颜色可用于支持球队层级的区分,减少跨队混淆,而当号码区域可见且可读时,球员号码识别则能提供更精细的身份线索38,39。现有的体育追踪研究已结合领域特定的视觉特征和球衣颜色识别,以在人群密集的体育场景下提升球员关联准确性40,41。关于球衣号码识别及合成号码数据的相关工作进一步支持了在低分辨率或部分遮挡条件下的身份建模42,43。这些研究表明,球衣语义信息能够增强体育多目标追踪(MOT)中的身份表征。然而,大多数语义增强的追踪方法未能充分建模检测置信度与语义特征质量之间的关系。高置信度的检测结果通常已包含可靠的时空和外观信息,此时重复提取语义特征效率较低。低置信度的检测结果则常受遮挡、模糊、截断或低分辨率影响,导致颜色和球员号码线索的可靠性下降。这一局限性促使研究者设计一种基于置信度引导的关联策略,即根据检测质量选择性引入球衣语义信息,而非对所有检测结果统一应用。综述的研究表明,置信度感知的关联机制与球衣语义建模分别解决了体育多目标追踪中的不同问题:基于置信度的策略主要决定某个检测是否应参与关联,以及如何与现有轨迹进行匹配;而球衣语义策略则主要通过运动特异性线索增强身份表征。然而,这两种机制通常被设计为独立组件,导致语义线索未能始终根据检测质量进行调整,且置信度水平无法在关联过程中直接调控颜色和球员号码信息的使用。这种分离限制了对团队运动视频中轨迹断裂和身份混淆问题的联合处理。当前尚未解决的研究空白在于,如何在同一追踪流程中将检测置信度的质量评估与球衣语义关联机制有效结合。

访问受限。请登录或开始试用以查看此内容。

方案

本研究涉及对公开可用的基准视频数据集(即 SportsMOT、TeamTrack、SoccerNet Tracking、MOT17 和 MOT20)进行二次分析。研究未招募任何参与者,未实施任何干预措施,也未收集新的人类受试者数据。根据曼谷吞武里大学适用的机构规定,本研究无需获得伦理委员会批准。

以下方案描述了从数据准备到跟踪评估的 JerseyTrack 复现工作流程。该流程包括数据集准备、检测器准备、球衣语义提取、置信度分级划分、置信度引导关联、跟踪推理以及性能评估,如图1所示。所需软件、数据集和硬件资源列于材料表中。

使用外观特征进行球衣特征提取;状态预测;数据关联过程。
图1.JerseyTrack 方法的整体工作流程。 该工作流程包括球衣语义特征提取、初始目标匹配、置信度引导的补充匹配以及特征融合。从检测到的运动员区域中提取球队颜色和球员号码特征,并将其融入关联过程中,以在检测条件不确定的情况下提高轨迹匹配的准确性。 请点击此处查看该图的放大版本。

1. 准备数据集和目录结构

  1. 下载材料表中列出的公开基准数据集。使用 SportsMOT 作为检测器准备和跟踪评估的主要数据集。保留 TeamTrack、SoccerNet Tracking、MOT17 和 MOT20 用于跨数据集评估。
  2. 将所有数据集存储在一个统一的项目目录下。确保检测器、语义提取模块、跟踪模块和评估工具包使用相同的序列标识符。
  3. 使用本研究中采用的数据预处理脚本,将官方的 SportsMOT 注释转换为检测器训练格式。执行以下命令:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val。
  4. 数据预处理脚本(scripts/prepare_data.py)可在 JerseyTrack 源代码仓库中获取(https://doi.org/10.5281/zenodo.21274352)。所需的软件依赖项在 environment.yml 中指定,包括 Python 3.12、PyTorch 2.11.0 和 OpenCV 4.10 或更高版本。使用以下命令配置软件环境:conda env create -f environment.yml。使用以下命令执行数据预处理脚本:python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val。
  5. 验证转换是否生成了检测器训练配置文件:data\processed\SportsMOT_yolo\data.yaml 和转换清单文件:data\processed\SportsMOT_yolo\conversion_manifest.csv。
    注意:在本研究中,转换后的 SportsMOT 训练和验证数据集包含 90 个序列、55,544 帧图像以及 608,152 个标注对象。
  6. 检查代表性序列,以验证帧顺序、边界框坐标和身份标签与原始基准注释保持一致。
  7. 在整个检测器准备、跟踪推理和评估过程中,保留已转换的注释文件不做修改,以确保所有方法使用相同的数据集划分和评估协议。
    注意:本节的预期结果是一个标准化的 SportsMOT 检测器训练目录,其中包含已转换的注释文件、转换清单以及检测器准备和跟踪评估所需的数据集划分文件。

2. 准备检测器输出

  1. 使用准备好的 SportsMOT 训练集划分对目标检测器进行微调。通过分类损失和边界框回归损失优化检测器,损失函数定义如下 公式 1使用实现设置中报告的检测器输入分辨率、批量大小、学习率、训练轮数及其他训练参数 材料表
    Ldet = Lcls + L盒子   (1)
    此处,Ldet  表示总探测器损耗,Lcls  表示分类损失,L盒子 表示边界框回归损失。
    注意:主实验中使用的检测器检查点(内部实验标识符 e3)是基于 Ultralytics YOLO 框架,采用 SportsMOT YOLO 格式数据集配置(data/processed/SportsMOT_yolo/data.yaml)进行训练的。使用以下命令执行检测器训练:yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0。训练完成后,使用所得性能最优的检查点,通过以下命令为验证序列生成检测器输出:python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16。
  2. 保存训练好的检测器检查点、相应的元数据文件以及训练日志。
    注意:在本研究中,用于正式实验的检测器检查点保存为:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt。对应的元数据文件已保存为:outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json。用于主要 SportsMOT 验证实验的检测输出目录为:outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections。
  3. 在每个验证序列上运行训练好的检测器,以生成运动员的边界框及置信度分数。为每个序列导出一个检测文件,文件中包含帧索引、边界框坐标、检测置信度和类别标签。
    注意:在用于主要实验的 SportsMOT 验证运行中,置信度阈值设为 0.05 时生成了 343,990 个运动员检测结果。
  4. 在进行追踪推理之前,检查检测器输出目录。确认每个序列都有对应的检测文件,帧索引与准备好的图像序列一致,且每条检测记录均包含置信度分数。
    注意:本节的预期结果是一个完整的检测器输出目录,该目录将用作 jersey 语义提取、置信度分级划分和跟踪关联的输入。

3. 提取球衣语义特征

  1. 利用检测器输出文件从每个视频帧中裁剪出运动员区域。将每个裁剪后的运动员图像与其序列标识符、帧索引和检测索引一并保存。排除图像内容缺失或边界框超出图像边界的无效裁剪区域。保持每个裁剪文件名与其原始检测记录之间的关联,以便在跟踪关联过程中将提取的语义特征匹配到对应的检测结果。
  2. 使用本研究中采用的语义特征提取脚本,从裁剪后的运动员图像中提取球衣颜色特征。
    注意:语义特征提取脚本(scripts/extract_fast_color_semantics.py 和 scripts/formal_extract_semantics.py)可在 JerseyTrack 源代码仓库中获取(https://doi.org/10.5281/zenodo.21274352)。无需单独的配置文件;所有运行时参数均通过命令行参数提供。
    使用以下命令生成球衣颜色描述符:python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color。使用OCR模型生成球员号码语义特征,命令如下:python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr。生成的球衣颜色描述符和球员号码概率输出通过序列标识符进行关联,并合并为跟踪关联过程中使用的语义特征文件。
  3. 将每个裁剪后的运动员图像转换为色调、饱和度、明度(HSV)颜色空间。从球衣区域提取前景像素,并使用K=3的K均值聚类方法总结主导球衣颜色。在进行特征比较前,使用L2归一化对得到的颜色描述符进行归一化处理。
  4. 使用输入尺寸为128 × 64像素的裁剪运动员图像训练球员号码识别分支。使用本研究中采用的弱监督标注方法生成球员号码伪标签。在光学字符识别(OCR)损失计算中,排除号码不可见、无法辨认、严重遮挡或置信度较低的裁剪区域。
  5. 使用公式2中定义的交叉熵损失优化OCR分支。
    交叉熵损失公式 \(L_{ocr}=-\sum_{i=1}^{N}y_i\log(\hat{y}_i)\),分类任务公式。 (2)
    其中,Locr 表示OCR损失,yi 表示监督下的球员号码标签,多项式回归方程,ŷᵢ=β₀+β₁xᵢ+…+βₙxᵢⁿ,统计分析图表 表示预测的球员号码类别。
  6. 使用材料表中列出的自适应优化器、学习率、批量大小、权重衰减和训练时长优化语义特征提取模块。使用公式3中定义的总训练目标函数,将检测器损失与OCR损失结合。
    Ltotal = Ldet + γLocr   (3)
    其中,Ltotal 表示总训练损失,Ldet 表示公式1中定义的检测器损失,Locr 表示公式2中定义的OCR损失,γ 表示用户定义的OCR损失权重系数。
  7. 将训练好的OCR分支应用于每个裁剪后的运动员图像。保存每个裁剪区域预测的球员号码类别或概率向量。若球员号码不可见或OCR置信度低于实现中定义的阈值,则将球员号码特征标记为不可用,而非强制输出预测结果。
  8. 将球衣颜色描述符与球员号码输出合并为跟踪模块所使用的语义特征文件。
    注意:在主要的SportsMOT验证运行中,语义提取脚本处理了343,990个检测结果,未出现丢失帧或无效裁剪。在当前修订版本中,语义提取汇总报告显示,在评估的SportsMOT设置下,颜色与OCR语义提取整体准确率为86.7%。本部分的预期结果是一个语义特征文件,其中每个有效的检测记录均关联一个球衣颜色描述符、一个可选的球员号码输出,以及一个指示语义信息是否可用于跟踪关联的标志位。

4. 分区检测置信度水平

  1. 加载每个视频序列的检测器输出文件,收集每帧中所有运动员检测的置信度分数。
  2. 使用 K-means 聚类方法(K = 3)将帧级置信度分数划分为高、中、低三个置信度区间,遵循 图2 所示的置信度引导关联流程。通过最小化簇内方差确定自适应置信度阈值,如 公式4 所示。
    静态平衡符号公式;J_conf=min Σ(sd-μ_i)^2;数学优化。  (4)
    其中,sd 表示检测结果 d 的置信度分数;D1D2D3 分别表示高、中、低置信度区间;μ1、μ2 和 μ3 分别表示三个区间的平均置信度分数;τ1 和 τ2 表示由 K-means 聚类结果获得的自适应置信度阈值。
    注意:置信度划分脚本(scripts/formal_partition_confidence.py)可在 JerseyTrack 源代码仓库中获取(https://doi.org/10.5281/zenodo.21274352)。该模块采用基于 NumPy 的一维 K-means 聚类过程(K = 3),无需单独的配置文件,输入目录、输出目录和聚类参数通过命令行参数指定。使用以下命令执行置信度划分过程:python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3。所需软件依赖项(包括 NumPy 版本)在 environment.yml 中有明确说明。
  3. 以检测器输出目录作为输入,运行置信度划分程序。
    注意:本研究中,检测器输出目录为:outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections;置信度划分输出目录为:outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence。生成的输出文件包括每个序列的置信度 CSV 文件、_confidence_frame_summary.csv 和 _confidence_runtime.csv。
  4. 为每个检测结果分配一个置信度等级标签:高置信度检测用于基于运动的关联,中置信度检测用于运动-语义联合关联,低置信度检测仅用于轨迹恢复。同时保留原始置信度分数与分配的置信度等级标签。
  5. 检查置信度分数分布及代表性帧,如 图3 所示。验证高置信度检测主要对应完整且可靠的运动员边界框,而中低置信度检测主要包含部分可见、被遮挡、模糊或弱检测的情况。
    注意:本步骤的预期输出是一个置信度划分文件,包含每个检测的索引、原始置信度分数、分配的置信度等级以及帧级自适应置信度阈值。

基于置信度的视频分析;包含K-means聚类和相关性区间计算的示意图。
图2.基于置信度引导的关联策略。 该工作流程通过自适应置信度聚类将检测置信度划分为高、中、低三个置信度区间。高置信度检测结果通过运动相似性进行关联,中等置信度检测结果通过运动与球衣语义相似性的组合进行关联,低置信度检测结果则用于语义辅助的轨迹恢复,并通过多帧验证加以确认。右侧面板总结了用于置信度划分与关联的数学表达式。请点击此处查看该图的放大版本。

柱状图比较不同置信区间的运动决策剂量;足球、篮球、排球。
图3。检测置信度分数的分布情况。 该直方图显示了SportsMOT数据集中足球、篮球和排球序列中五个置信度区间内的运动员检测框数量。该分布展示了在所评估的运动类别中检测器置信度的差异。请点击此处查看该图的放大版本。

5. 运行置信度引导的关联分析

  1. 加载每个视频序列的检测器输出文件、语义特征文件和置信度划分文件。使用首个有效检测结果初始化追踪器,并为每个被追踪的运动员维护一条轨迹状态。对于后续每一帧,使用卡尔曼滤波运动模型预测每条现有轨迹的位置。
  2. 利用公式 5中定义的马氏距离,计算每条预测轨迹与候选检测之间的运动相似性。
    静力学平衡数学公式,公式:S_mot(t_i^k,d_j),含协方差矩阵  (5)
    其中,静力学平衡,ΣFx=0,ΣFy=0,力平衡示意图,物理概念,解题方法 表示第 k 帧中的第 I 条轨迹,静力学平衡示意图,ΣFx=0,展示力矢量与平衡,教学用物理图表 表示卡尔曼预测的轨迹状态,dj 表示候选检测,静力学平衡公式 Σi^{-1};含数学符号的教学用图示 表示预测轨迹状态的逆协方差矩阵,Smot 表示预测轨迹与检测之间的运动距离。
    注:核心关联工作流在 JerseyTrack 源代码仓库(https://doi.org/10.5281/zenodo.21274352)中的 jerseytrack/formal_tracker.py 中实现,并通过 scripts/formal_track.py 执行。无需单独的配置文件。所有运行时参数,包括置信度阈值、最大轨迹寿命、运动权重系数和中心距离权重,均通过命令行参数提供。完整的执行命令和参数设置见第 6.2 步。该实现使用 SciPy 的线性分配算法进行匈牙利匹配,并使用 NumPy 进行基于代价的关联。
  3. 以检测器输出文件、语义特征文件和置信度划分文件作为输入,运行追踪工作流。
    注:本研究中,核心追踪器在 jerseytrack\formal_tracker.py 中实现,追踪工作流通过 scripts\formal_track.py 执行。
  4. 通过运动一致性将高置信度检测结果与现有轨迹进行关联。仅当未匹配的高置信度检测满足轨迹初始化条件时,才更新已匹配轨迹并初始化新轨迹。
  5. 检查 图 4 中展示的球衣语义提取输出结果,并根据公式 6将球队颜色描述符和球员号码特征组合,为每个检测构建球衣语义特征向量。
    fsem = [fcol;fid] (6)
    其中,fsem 表示融合后的语义特征向量,fcol 表示球队颜色描述符,fid 表示由 OCR 分支生成的球员号码特征。
  6. 结合运动相似性与球衣语义相似性,对中等置信度检测进行关联。根据公式 7计算融合匹配得分。
    运动与语义得分融合公式,Sf=λ(Sm/max(Sm))+(1-λ)(1-Sem) (7)
    其中,Ssem 表示轨迹与候选检测之间语义特征向量的余弦相似性,Smot 表示公式 5中定义的运动距离,λ 表示平衡运动与语义相似性项的自适应融合系数。
  7. 根据公式 8计算自适应融合系数。
    静力学平衡;λ=λ₀exp(-σsd/σmax);与材料中应力分布相关的公式 (8)
    其中,λ0 表示初始运动权重系数,σsd 表示当前帧中检测置信度得分的标准差,σmax 表示用于归一化的最大置信度得分标准差。
  8. 仅将低置信度检测用于轨迹恢复。仅当语义信息可用且满足恢复条件时,才将低置信度检测与中断的轨迹进行匹配。在恢复轨迹身份前应用多帧验证,并丢弃未通过验证的检测。
    注:当球员号码特征不可用时,应基于可用的语义信息和运动一致性进行关联,而非强制进行球员号码匹配。本部分的预期输出为逐帧追踪记录,包含轨迹标识、边界框、置信度标签、运动代价、语义信息及最终关联决策。在修订证据包中,追踪结果存储于:outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking。

包含球员追踪数据的排球比赛分析图,用于表现洞察。
图 4.球衣语义特征提取。 代表性运动员检测结果标注了由球衣语义提取模块生成的队伍颜色描述符和球员号码信息。提取的语义特征随后被整合到置信度引导的数据关联中。请点击此处查看该图的放大版本。

6. 运行追踪推断并导出结果

  1. 使用准备好的检测器输出文件、语义特征文件和置信度分区文件,对每个视频序列执行跟踪推理。按时间顺序处理视频帧,以确保在整个序列中一致地更新轨迹状态、语义历史和轨迹恢复决策。除非明确报告了特定数据集的设置,否则所有评估序列均使用相同的推理配置。
    注意:跟踪推理通过 JerseyTrack 源代码仓库(https://doi.org/10.5281/zenodo.21274352)中提供的 scripts/formal_track.py 脚本执行。无需单独的配置文件。使用以下命令执行跟踪推理:python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1。所有未明确指定的参数均保留归档源代码中记录的默认值。
  2. 推理完成后,使用以下命令应用主要的后处理流程:python scripts/merge_tracklets.py 和 python scripts/sweep_track_filter.py --min-len 95。
  3. 以评估工具包要求的格式导出跟踪结果。包含帧索引、轨迹标识、边界框坐标以及基准评估格式所需的所有字段。使用统一的文件命名约定为每个序列保存一个跟踪结果文件,以便每个结果文件可与对应的真实标注文件匹配。
  4. 仅应用本研究中使用的后处理操作。使用修订包中描述的后处理脚本执行短轨迹合并和轨迹过滤。
    注意:在本研究中,后处理工作流使用了以下脚本:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. 在进行定量评估前,检查导出的跟踪结果。确认轨迹标识在每个序列内保持为数值型且一致,无缺失帧索引,且所有边界框均位于图像边界范围内。
    注意:本节的预期结果是一组完整的、可用于定量评估的序列级跟踪结果文件。

7. 评估追踪性能

  1. 使用材料表中列出的评估工具包对导出的跟踪结果文件进行评估。将每个跟踪结果文件与相应的真值标注文件及数据集划分部分相匹配。对所有对比方法使用相同的评估配置,以确保性能差异源于跟踪结果本身,而非评估设置的不同。
  2. 使用以下命令运行评估
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    注意:本研究中的评估采用标准 TrackEval(版本 1.3.0)度量实现,该实现已归档于 JerseyTrack 可重复性软件包中。Higher Order Tracking Accuracy(HOTA)、CLEAR 和 IDentity 指标实现均未作任何修改。代码库包含位于 evaluation/trackeval/scripts/run_mot_challenge.py 的 MOTChallenge 风格执行封装脚本,用于配置数据集路径和结果路径,并调用标准 TrackEval 评估指标。
  3. 记录论文中报告的评估指标,包括多目标跟踪精度(MOTA)、IDentity F1 分数(IDF1)、高阶跟踪精度(HOTA)、检测精度(DetA)、关联精度(AssA)、误报数(FPs)、漏报数(FNs)以及身份切换事件。将评估摘要导出为表格形式,并保留每段序列的评估文件以供验证。
  4. 在将 JerseyTrack 与基线方法进行比较时,需对所有方法使用相同的数据集划分、检测器输出和评估配置。记录每个对比实验所使用的数据集、检测器输出来源、评估工具包配置及各项指标数值。
  5. 检查评估日志,确认所有序列均已成功完成评估,且无跟踪结果文件缺失。
    注意:本研究中,主要的 TrackEval 摘要文件存储于:outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt。本节预期结果为一份完整的评估摘要表格,以及支持所报告结果和后续验证的各序列独立指标文件。

访问受限。请登录或开始试用以查看此内容。

结果

本节报告了在评估的体育多目标跟踪实验中获得的定量与定性结果。结果重点关注跟踪精度、身份保持、关联质量以及在测试数据集设置下的鲁棒性。性能声明仅限于协议与实现设置中描述的评估方法、数据集、检测器输出及评估工具包配置。

实验设置与评估设计

数据集与预处理:

SportsMOT 被用作检测器准备、跟踪推理和定量评估的主要基准。该数据集包含 240 个视频序列,涵盖足球、篮球和排球场景,共计超过 150,000 张图像帧(图 5)。在正式评估中,主要的 SportsMOT 结果是通过验证集划分,结合协议中描述的检测器输出、跟踪配置以及 TrackEval 设置计算得出的。跨数据集评估在 TeamTrack、SoccerNet Tracking、MOT17 和 MOT20 上进行,旨在考察不同数据集类型之间的性能迁移能力,而非在数据集之间...

访问受限。请登录或开始试用以查看此内容。

讨论

本研究评估了一种结合检测置信度划分与球衣语义线索的置信度引导体育多目标跟踪(MOT)工作流程。置信度引导关联与语义特征融合已被作为提升多目标跟踪中数据关联性能的互补策略进行研究12,20,23,24,46。结果表明,在所评估的SportsMOT验证设置下,完整的JerseyTrack配置提升了身份保持能力与关联稳定性。主要的SportsMOT验证结果达到了88.9%的MOTA、69.9%的HOTA、74.3%的IDF1、80.2%的DetA以及54.3%的AssA。这些数值应在协议中描述的检测器输出源、数据集划分和TrackEval配置背景下进行解读。

工作流程中的一个关键步骤是置信度分级划分,它能够根据检测器输出的可靠性应用不同的关联策略

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在经济利益冲突。

材料

本文使用的材料清单
姓名公司目录编号评论
CUDA 运行时NVIDIA版本 12.8用于检测器训练、语义特征提取和跟踪推理的 GPU 计算运行环境。
EasyOCRJaided AI版本 1.7.2用于球员号码识别的光学字符识别工具包。
JerseyTrack 源代码作者N/A包含数据准备、语义特征提取、置信度划分、跟踪、后处理和评估脚本的自定义实现。可从以下网址获取:https://doi.org/10.5281/zenodo.21274352
轻量级 CRNN OCR 模型作者N/A用于球员号码识别的自定义卷积循环神经网络(CRNN)。
MOT17 数据集MOTChallengeN/A用于跨数据集评估的公开基准数据集。可从以下网址获取:https://motchallenge.net/data/MOT17/
MOT20 数据集MOTChallengeN/A用于跨数据集评估的公开基准数据集。可从以下网址获取:https://motchallenge.net/data/MOT20/
motmetricsmotmetrics 开发者版本 1.4.0用于诊断多目标跟踪指标计算的库。
NVIDIA GPUNVIDIAGeForce RTX 5090 D V2用于检测器训练和跟踪推理的图形处理器。
NVIDIA GPU 驱动程序NVIDIA版本 610.62实验环境中使用的 GPU 驱动程序。
NumPyNumPy 开发者版本 2.4.4用于特征处理和数据操作的数值计算库。
OpenCVOpenCV版本 4.10.0用于图像加载、裁剪、预处理和可视化的计算机视觉库。
PythonPython 软件基金会版本 3.12.2整个工作流程中使用的编程语言。
PyTorchPyTorch 基金会版本 2.11.0+cu128用于实现检测器和语义模型的深度学习框架。
scikit-learnscikit-learn 开发者版本 1.9.0在球衣颜色提取和置信度划分过程中用于 K 均值聚类的机器学习库。
SoccerNet 跟踪数据集SoccerNetN/A用于跨数据集评估的公开足球跟踪基准。可从以下网址获取:https://www.soccer-net.org/tasks/tracking
SportsMOT 数据集SportsMOT 基准N/A用于检测器准备和跟踪评估的主要基准数据集。可从以下网址获取:https://deeperaction.github.io/datasets/sportsmot.html
TeamTrack 数据集TeamTrack 基准N/A用于跨数据集评估的公开体育跟踪基准。可从以下网址获取:https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch 基金会版本 0.26.0+cu128与 PyTorch 配合使用的计算机视觉库,用于图像变换和模型支持。
TrackEvalTrackEval 开发者版本 1.3.0评估工具包,用于计算多目标跟踪精度(MOTA)、身份 F1 分数(IDF1)、高阶跟踪精度(HOTA)、检测精度(DetA)、关联精度(AssA)、误报(FP)、漏报(FN)和身份切换(IDs)。
UltralyticsUltralytics版本 8.4.90用于训练检测器并生成运动员检测结果的目标检测框架。

参考文献

  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

置信度引导跟踪球员轨迹运动相似性球衣颜色光学字符识别身份一致性SportsMOT 数据集