本方案描述了一种基于置信度引导的多目标跟踪工作流程,用于体育视频分析,通过整合球衣颜色和球员号码信息,以提高在置信度波动、遮挡以及运动员外观相似等情况下的轨迹关联性和身份一致性。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本方案描述了一种基于置信度引导的多目标跟踪工作流程,用于体育视频分析,通过整合球衣颜色和球员号码信息,以提高在置信度波动、遮挡以及运动员外观相似等情况下的轨迹关联性和身份一致性。
体育视频中的多目标跟踪(Multi-Object Tracking, MOT)可为战术分析、运动员行为解读和自动化统计分析提供轨迹信息。然而,体育场景中常出现快速变向、突然停止、频繁遮挡以及队友外观相似等情况,导致检测置信度波动以及帧间关联时的身份混淆。为应对这些挑战,本研究提出JerseyTrack,一种基于球衣语义融合的置信度引导型体育MOT方法。该工作流程根据每帧的置信度分布,自适应地将检测框划分为高、中、低三种置信度区间。高置信度检测主要依据运动相似性进行关联,而中低置信度检测则进一步融合通过颜色聚类和轻量级光学字符识别(Optical Character Recognition, OCR)模型提取的球衣颜色与球员号码特征。这些语义特征在补充匹配过程中与运动信息融合,以提升轨迹连续性与身份一致性。该方法在SportsMOT数据集上进行了评估。JerseyTrack取得了88.9%的多目标跟踪精度(Multiple Object Tracking Accuracy, MOTA)、74.3%的身份F1分数(IDentity F1 Score, IDF1)以及69.9%的高阶跟踪精度(Higher Order Tracking Accuracy, HOTA),表明其在所评估的体育跟踪场景下具有更优的跟踪性能。本方案提供了一套可复现的工作流程,用于整合置信度引导的关联策略与球衣语义信息,以提升体育视频中的多目标跟踪效果。
多目标跟踪(MOT)可在视频序列中实现目标的持续定位与身份保持,支持体育视频应用中的运动员轨迹提取、战术分析及自动化统计分析1,2,3。可靠的视觉信息还与运动专项中的决策制定和表现评估密切相关,进一步凸显了稳定的视频衍生运动数据在后续体育分析中的重要价值4。在体育场景中,战术数据的可靠性取决于跟踪轨迹的连续性以及目标身份的一致性。
与一般的多目标跟踪(MOT)场景相比,体育视频包含快速的方向变化、突然的停顿、跳跃、密集的交互以及频繁的遮挡。这些因素导致检测框置信度出现显著波动,并增加低置信度检测的频率,从而可能中断轨迹关联5,6。统一的队服进一步削弱了一般外观特征的区分能力,增加了外观相似的队友之间的身份混淆7,8。当遮挡与外观相似性在同一视频序列中同时发生时,检测置信度下降,目标外观信息变得不完整,从而加大了轨迹关联与身份维持的难度9,10。在多目标跟踪中,重识别(Re-ID)是指利用与身份相关的视觉证据,将在不同帧、遮挡期间或重新进入场景时的同一目标进行身份关联的过程。在团队体育视频中,由于同队运动员通常穿着相似的队服并具有类似的体型,通用的重识别线索可能被削弱。技术文献综述表明,体育场景中的多目标跟踪所面临的轨迹碎片化和身份混淆问题,通常通过两种互补的方法加以解决:利用检测置信度和增强身份线索。JerseyTrack 位于这两种方法的交汇点,其根据检测质量来调节队服语义线索的使用,而非将颜色和球员号码信息无差别地应用于所有检测结果。
本研究提出了JerseyTrack,一种基于球衣语义融合的置信度引导型多人运动目标跟踪(MOT)方法。该方法适用于运动员穿着明显球衣且检测结果提供带有置信度评分的边界框的团队运动视频。JerseyTrack结合了四个主要组件:运动员检测、置信度层级划分、球衣语义特征提取以及级联帧间关联。利用检测置信度自适应地将检测结果划分为高、中、低置信度三组,并采用不同的关联策略进行处理。高置信度检测主要通过运动信息进行关联,而中低置信度检测则额外引入球衣颜色和球员号码信息,以在视觉证据较弱时提升身份保持能力。该方法适用于需要稳定运动员轨迹的体育视频分析任务,例如战术分析和球员行为解读。
该方法也存在操作上的局限性。球衣语义信息的提取可能受到严重遮挡、运动模糊、图像分辨率低、球衣姿态异常或球员号码不可见等因素的影响。在这些情况下,基于球衣的语义线索可能变得不完整,此时关联过程将更依赖于运动一致性与多帧验证。因此,本研究中的性能结论仅限于所评估的数据集和实验设置。在 SportsMOT 数据集上的实验表明,JerseyTrack 在测试的体育运动跟踪条件下,提升了各项跟踪指标的表现,并减少了身份切换事件的发生。体育视频中多目标跟踪(MOT)的主要难点在于快速运动、遮挡以及外观相似性条件下维持轨迹连续性和身份一致性。与 JerseyTrack 相关的现有研究大致可分为两个方向:一是利用检测置信度进行轨迹关联,二是通过体育场景特有的语义特征增强身份线索。
检测置信度已被广泛用于估计检测框的可靠性,并在多目标跟踪(MOT)中指导轨迹关联。早期的跟踪方法通常将置信度视为二值化过滤标准,即移除低于固定阈值的检测结果,以减少误检11,12。该策略虽可降低噪声检测,但在遮挡、快速运动或图像质量较低的情况下,也可能丢弃真实目标,导致轨迹断裂13,14,15。类似过滤策略还表明,固定的置信度阈值对场景变化和检测质量较为敏感16,17。为更有效地利用低置信度检测结果,ByteTrack 提出了一种关联策略,保留低置信度检测框作为候选目标进行二次匹配,并通过运动相似性和轨迹历史信息将其与已有轨迹进行关联18。McByte 进一步在体育场景的多目标跟踪中引入了时序传播的分割掩码作为关联线索,在无需额外视频训练的情况下,提升了在快速运动、遮挡和相机位移条件下的鲁棒性19。相关研究也调整了对低置信度检测结果的使用方式,以在关联过程中保留微弱但可能有效的目标20,21,22。随后,置信度自适应的关联策略根据运动一致性与检测可靠性进一步优化了匹配准则23,24,25。基于检测框回归和轨迹平滑性优化的轨迹 refinement 方法也被用于减少轨迹断裂现象26,27,28。其他 refinement 策略在复杂运动条件下为维持轨迹连续性提供了补充支持29。时序一致的对象流进一步建模了跨帧的对象级时序一致性,为减少复杂 MOT 场景中的轨迹中断提供了另一种面向关联的解决方案30。跟踪器融合方法则通过学习多个跟踪器的输出,采用基于学习的选择或融合策略,提升了在不同 MOT 基准上的跟踪鲁棒性31。总体而言,这些研究表明,考虑置信度的关联策略有助于恢复中断的轨迹;然而,当同一队伍的运动员外观相似时,置信度和运动线索所提供的身份信息十分有限。尽管这些方法在一般场景下能有效缓解轨迹断裂问题,但在体育场景中仍存在固有局限性,因为同队运动员通常具有高度相似的视觉外观,仅依赖置信度和运动信息无法为身份区分提供充分依据32,33,34。即使低置信度检测框被有效召回,特征相似性仍可能导致身份切换,难以满足体育分析中对身份一致性的严格要求。
运动特异性身份线索也被用于提升运动员追踪中的身份区分能力。球衣语义信息(如球队颜色和球员号码)所提供的身份线索相较于通用的外观嵌入特征,与体育场景的关联更为直接35,36,37。球衣颜色可用于支持球队层级的区分,减少跨队混淆,而当号码区域可见且可读时,球员号码识别则能提供更精细的身份线索38,39。现有的体育追踪研究已结合领域特定的视觉特征和球衣颜色识别,以在人群密集的体育场景下提升球员关联准确性40,41。关于球衣号码识别及合成号码数据的相关工作进一步支持了在低分辨率或部分遮挡条件下的身份建模42,43。这些研究表明,球衣语义信息能够增强体育多目标追踪(MOT)中的身份表征。然而,大多数语义增强的追踪方法未能充分建模检测置信度与语义特征质量之间的关系。高置信度的检测结果通常已包含可靠的时空和外观信息,此时重复提取语义特征效率较低。低置信度的检测结果则常受遮挡、模糊、截断或低分辨率影响,导致颜色和球员号码线索的可靠性下降。这一局限性促使研究者设计一种基于置信度引导的关联策略,即根据检测质量选择性引入球衣语义信息,而非对所有检测结果统一应用。综述的研究表明,置信度感知的关联机制与球衣语义建模分别解决了体育多目标追踪中的不同问题:基于置信度的策略主要决定某个检测是否应参与关联,以及如何与现有轨迹进行匹配;而球衣语义策略则主要通过运动特异性线索增强身份表征。然而,这两种机制通常被设计为独立组件,导致语义线索未能始终根据检测质量进行调整,且置信度水平无法在关联过程中直接调控颜色和球员号码信息的使用。这种分离限制了对团队运动视频中轨迹断裂和身份混淆问题的联合处理。当前尚未解决的研究空白在于,如何在同一追踪流程中将检测置信度的质量评估与球衣语义关联机制有效结合。
访问受限。请登录或开始试用以查看此内容。
本研究涉及对公开可用的基准视频数据集(即 SportsMOT、TeamTrack、SoccerNet Tracking、MOT17 和 MOT20)进行二次分析。研究未招募任何参与者,未实施任何干预措施,也未收集新的人类受试者数据。根据曼谷吞武里大学适用的机构规定,本研究无需获得伦理委员会批准。
以下方案描述了从数据准备到跟踪评估的 JerseyTrack 复现工作流程。该流程包括数据集准备、检测器准备、球衣语义提取、置信度分级划分、置信度引导关联、跟踪推理以及性能评估,如图1所示。所需软件、数据集和硬件资源列于材料表中。

图1.JerseyTrack 方法的整体工作流程。 该工作流程包括球衣语义特征提取、初始目标匹配、置信度引导的补充匹配以及特征融合。从检测到的运动员区域中提取球队颜色和球员号码特征,并将其融入关联过程中,以在检测条件不确定的情况下提高轨迹匹配的准确性。 请点击此处查看该图的放大版本。
1. 准备数据集和目录结构
2. 准备检测器输出
3. 提取球衣语义特征
(2)
表示预测的球员号码类别。4. 分区检测置信度水平
(4)
图2.基于置信度引导的关联策略。 该工作流程通过自适应置信度聚类将检测置信度划分为高、中、低三个置信度区间。高置信度检测结果通过运动相似性进行关联,中等置信度检测结果通过运动与球衣语义相似性的组合进行关联,低置信度检测结果则用于语义辅助的轨迹恢复,并通过多帧验证加以确认。右侧面板总结了用于置信度划分与关联的数学表达式。请点击此处查看该图的放大版本。

图3。检测置信度分数的分布情况。 该直方图显示了SportsMOT数据集中足球、篮球和排球序列中五个置信度区间内的运动员检测框数量。该分布展示了在所评估的运动类别中检测器置信度的差异。请点击此处查看该图的放大版本。
5. 运行置信度引导的关联分析
(5)
表示第 k 帧中的第 I 条轨迹,
表示卡尔曼预测的轨迹状态,dj 表示候选检测,
表示预测轨迹状态的逆协方差矩阵,Smot 表示预测轨迹与检测之间的运动距离。
(7)
(8)
图 4.球衣语义特征提取。 代表性运动员检测结果标注了由球衣语义提取模块生成的队伍颜色描述符和球员号码信息。提取的语义特征随后被整合到置信度引导的数据关联中。请点击此处查看该图的放大版本。
6. 运行追踪推断并导出结果
7. 评估追踪性能
访问受限。请登录或开始试用以查看此内容。
本节报告了在评估的体育多目标跟踪实验中获得的定量与定性结果。结果重点关注跟踪精度、身份保持、关联质量以及在测试数据集设置下的鲁棒性。性能声明仅限于协议与实现设置中描述的评估方法、数据集、检测器输出及评估工具包配置。
实验设置与评估设计
数据集与预处理:
SportsMOT 被用作检测器准备、跟踪推理和定量评估的主要基准。该数据集包含 240 个视频序列,涵盖足球、篮球和排球场景,共计超过 150,000 张图像帧(图 5)。在正式评估中,主要的 SportsMOT 结果是通过验证集划分,结合协议中描述的检测器输出、跟踪配置以及 TrackEval 设置计算得出的。跨数据集评估在 TeamTrack、SoccerNet Tracking、MOT17 和 MOT20 上进行,旨在考察不同数据集类型之间的性能迁移能力,而非在数据集之间...
访问受限。请登录或开始试用以查看此内容。
本研究评估了一种结合检测置信度划分与球衣语义线索的置信度引导体育多目标跟踪(MOT)工作流程。置信度引导关联与语义特征融合已被作为提升多目标跟踪中数据关联性能的互补策略进行研究12,20,23,24,46。结果表明,在所评估的SportsMOT验证设置下,完整的JerseyTrack配置提升了身份保持能力与关联稳定性。主要的SportsMOT验证结果达到了88.9%的MOTA、69.9%的HOTA、74.3%的IDF1、80.2%的DetA以及54.3%的AssA。这些数值应在协议中描述的检测器输出源、数据集划分和TrackEval配置背景下进行解读。
工作流程中的一个关键步骤是置信度分级划分,它能够根据检测器输出的可靠性应用不同的关联策略
访问受限。请登录或开始试用以查看此内容。
作者声明不存在经济利益冲突。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| CUDA 运行时 | NVIDIA | 版本 12.8 | 用于检测器训练、语义特征提取和跟踪推理的 GPU 计算运行环境。 |
| EasyOCR | Jaided AI | 版本 1.7.2 | 用于球员号码识别的光学字符识别工具包。 |
| JerseyTrack 源代码 | 作者 | N/A | 包含数据准备、语义特征提取、置信度划分、跟踪、后处理和评估脚本的自定义实现。可从以下网址获取:https://doi.org/10.5281/zenodo.21274352 |
| 轻量级 CRNN OCR 模型 | 作者 | N/A | 用于球员号码识别的自定义卷积循环神经网络(CRNN)。 |
| MOT17 数据集 | MOTChallenge | N/A | 用于跨数据集评估的公开基准数据集。可从以下网址获取:https://motchallenge.net/data/MOT17/ |
| MOT20 数据集 | MOTChallenge | N/A | 用于跨数据集评估的公开基准数据集。可从以下网址获取:https://motchallenge.net/data/MOT20/ |
| motmetrics | motmetrics 开发者 | 版本 1.4.0 | 用于诊断多目标跟踪指标计算的库。 |
| NVIDIA GPU | NVIDIA | GeForce RTX 5090 D V2 | 用于检测器训练和跟踪推理的图形处理器。 |
| NVIDIA GPU 驱动程序 | NVIDIA | 版本 610.62 | 实验环境中使用的 GPU 驱动程序。 |
| NumPy | NumPy 开发者 | 版本 2.4.4 | 用于特征处理和数据操作的数值计算库。 |
| OpenCV | OpenCV | 版本 4.10.0 | 用于图像加载、裁剪、预处理和可视化的计算机视觉库。 |
| Python | Python 软件基金会 | 版本 3.12.2 | 整个工作流程中使用的编程语言。 |
| PyTorch | PyTorch 基金会 | 版本 2.11.0+cu128 | 用于实现检测器和语义模型的深度学习框架。 |
| scikit-learn | scikit-learn 开发者 | 版本 1.9.0 | 在球衣颜色提取和置信度划分过程中用于 K 均值聚类的机器学习库。 |
| SoccerNet 跟踪数据集 | SoccerNet | N/A | 用于跨数据集评估的公开足球跟踪基准。可从以下网址获取:https://www.soccer-net.org/tasks/tracking |
| SportsMOT 数据集 | SportsMOT 基准 | N/A | 用于检测器准备和跟踪评估的主要基准数据集。可从以下网址获取:https://deeperaction.github.io/datasets/sportsmot.html |
| TeamTrack 数据集 | TeamTrack 基准 | N/A | 用于跨数据集评估的公开体育跟踪基准。可从以下网址获取:https://atomscott.github.io/TeamTrack/ |
| Torchvision | PyTorch 基金会 | 版本 0.26.0+cu128 | 与 PyTorch 配合使用的计算机视觉库,用于图像变换和模型支持。 |
| TrackEval | TrackEval 开发者 | 版本 1.3.0 | 评估工具包,用于计算多目标跟踪精度(MOTA)、身份 F1 分数(IDF1)、高阶跟踪精度(HOTA)、检测精度(DetA)、关联精度(AssA)、误报(FP)、漏报(FN)和身份切换(IDs)。 |
| Ultralytics | Ultralytics | 版本 8.4.90 | 用于训练检测器并生成运动员检测结果的目标检测框架。 |
访问受限。请登录或开始试用以查看此内容。