本方案描述了一种基于置信度引导的多目标跟踪工作流程,用于体育视频分析,通过整合球衣颜色和球员号码信息,以提高在置信度波动、遮挡以及运动员外观相似等情况下的轨迹关联性和身份一致性。
本方案描述了一种基于置信度引导的多目标跟踪工作流程,用于体育视频分析,通过整合球衣颜色和球员号码信息,以提高在置信度波动、遮挡以及运动员外观相似等情况下的轨迹关联性和身份一致性。
体育视频中的多目标跟踪(Multi-Object Tracking, MOT)可为战术分析、运动员行为解读和自动化统计分析提供轨迹信息。然而,体育场景中常出现快速变向、突然停止、频繁遮挡以及队友外观相似等情况,导致检测置信度波动以及帧间关联时的身份混淆。为应对这些挑战,本研究提出JerseyTrack,一种基于球衣语义融合的置信度引导型体育MOT方法。该工作流程根据每帧的置信度分布,自适应地将检测框划分为高、中、低三种置信度区间。高置信度检测主要依据运动相似性进行关联,而中低置信度检测则进一步融合通过颜色聚类和轻量级光学字符识别(Optical Character Recognition, OCR)模型提取的球衣颜色与球员号码特征。这些语义特征在补充匹配过程中与运动信息融合,以提升轨迹连续性与身份一致性。该方法在SportsMOT数据集上进行了评估。JerseyTrack取得了88.9%的多目标跟踪精度(Multiple Object Tracking Accuracy, MOTA)、74.3%的身份F1分数(IDentity F1 Score, IDF1)以及69.9%的高阶跟踪精度(Higher Order Tracking Accuracy, HOTA),表明其在所评估的体育跟踪场景下具有更优的跟踪性能。本方案提供了一套可复现的工作流程,用于整合置信度引导的关联策略与球衣语义信息,以提升体育视频中的多目标跟踪效果。
多目标跟踪(MOT)可在视频序列中实现目标的持续定位与身份保持,支持体育视频应用中的运动员轨迹提取、战术分析及自动化统计分析1,2,3。可靠的视觉信息还与运动专项中的决策制定和表现评估密切相关,进一步凸显了稳定的视频衍生运动数据在后续体育分析中的重要价值4。在体育场景中,战术数据的可靠性取决于跟踪轨迹的连续性以及目标身份的一致性。
与一般的多目标跟踪(MOT)场景相比,体育视频包含快速的方向变化、突然的停顿、跳跃、密集的交互以及频繁的遮挡。这些因素导致检测框置信度出现显著波动,并增加低置信度检测的频率,从而可能中断轨迹关联5,6。统一的队服进一步削弱了一般外观特征的区分能力,增加了外观相似的队友之间的身份混淆7,8。当遮挡与外观相似性在同一视频序列中同时发生时,检测置信度下降,目标外观信息变得不完整,从而加大了轨迹关联与身份维持的难度9,10。在多目标跟踪中,重识别(Re-ID)是指利用与身份相关的视觉证据,将在不同帧、遮挡期间或重新进入场景时的同一目标进行身份关联的过程。在团队体育视频中,由于同队运动员通常穿着相似的队服并具有类似的体型,通用的重识别线索可能被削弱。技术文献综述表明,体育场景中的多目标跟踪所面临的轨迹碎片化和身份混淆问题,通常通过两种互补的方法加以解决:利用检测置信度和增强身份线索。JerseyTrack 位于这两种方法的交汇点,其根据检测质量来调节队服语义线索的使用,而非将颜色和球员号码信息无差别地应用于所有检测结果。
本研究提出了JerseyTrack,一种基于球衣语义融合的置信度引导型多人运动目标跟踪(MOT)方法。该方法适用于运动员穿着明显球衣且检测结果提供带有置信度评分的边界框的团队运动视频。JerseyTrack结合了四个主要组件:运动员检测、置信度层级划分、球衣语义特征提取以及级联帧间关联。利用检测置信度自适应地将检测结果划分为高、中、低置信度三组,并采用不同的关联策略进行处理。高置信度检测主要通过运动信息进行关联,而中低置信度检测则额外引入球衣颜色和球员号码信息,以在视觉证据较弱时提升身份保持能力。该方法适用于需要稳定运动员轨迹的体育视频分析任务,例如战术分析和球员行为解读。
该方法也存在操作上的局限性。球衣语义信息的提取可能受到严重遮挡、运动模糊、图像分辨率低、球衣姿态异常或球员号码不可见等因素的影响。在这些情况下,基于球衣的语义线索可能变得不完整,此时关联过程将更依赖于运动一致性与多帧验证。因此,本研究中的性能结论仅限于所评估的数据集和实验设置。在 SportsMOT 数据集上的实验表明,JerseyTrack 在测试的体育运动跟踪条件下,提升了各项跟踪指标的表现,并减少了身份切换事件的发生。体育视频中多目标跟踪(MOT)的主要难点在于快速运动、遮挡以及外观相似性条件下维持轨迹连续性和身份一致性。与 JerseyTrack 相关的现有研究大致可分为两个方向:一是利用检测置信度进行轨迹关联,二是通过体育场景特有的语义特征增强身份线索。
检测置信度已被广泛用于估计检测框的可靠性,并在多目标跟踪(MOT)中指导轨迹关联。早期的跟踪方法通常将置信度视为二值化过滤标准,即移除低于固定阈值的检测结果,以减少误检11,12。该策略虽可降低噪声检测,但在遮挡、快速运动或图像质量较低的情况下,也可能丢弃真实目标,导致轨迹断裂13,14,15。类似过滤策略还表明,固定的置信度阈值对场景变化和检测质量较为敏感16,17。为更有效地利用低置信度检测结果,ByteTrack 提出了一种关联策略,保留低置信度检测框作为候选目标进行二次匹配,并通过运动相似性和轨迹历史信息将其与已有轨迹进行关联18。McByte 进一步在体育场景的多目标跟踪中引入了时序传播的分割掩码作为关联线索,在无需额外视频训练的情况下,提升了在快速运动、遮挡和相机位移条件下的鲁棒性19。相关研究也调整了对低置信度检测结果的使用方式,以在关联过程中保留微弱但可能有效的目标20,21,22。随后,置信度自适应的关联策略根据运动一致性与检测可靠性进一步优化了匹配准则23,24,25。基于检测框回归和轨迹平滑性优化的轨迹 refinement 方法也被用于减少轨迹断裂现象26,27,28。其他 refinement 策略在复杂运动条件下为维持轨迹连续性提供了补充支持29。时序一致的对象流进一步建模了跨帧的对象级时序一致性,为减少复杂 MOT 场景中的轨迹中断提供了另一种面向关联的解决方案30。跟踪器融合方法则通过学习多个跟踪器的输出,采用基于学习的选择或融合策略,提升了在不同 MOT 基准上的跟踪鲁棒性31。总体而言,这些研究表明,考虑置信度的关联策略有助于恢复中断的轨迹;然而,当同一队伍的运动员外观相似时,置信度和运动线索所提供的身份信息十分有限。尽管这些方法在一般场景下能有效缓解轨迹断裂问题,但在体育场景中仍存在固有局限性,因为同队运动员通常具有高度相似的视觉外观,仅依赖置信度和运动信息无法为身份区分提供充分依据32,33,34。即使低置信度检测框被有效召回,特征相似性仍可能导致身份切换,难以满足体育分析中对身份一致性的严格要求。
运动特异性身份线索也被用于提升运动员追踪中的身份区分能力。球衣语义信息(如球队颜色和球员号码)所提供的身份线索相较于通用的外观嵌入特征,与体育场景的关联更为直接35,36,37。球衣颜色可用于支持球队层级的区分,减少跨队混淆,而当号码区域可见且可读时,球员号码识别则能提供更精细的身份线索38,39。现有的体育追踪研究已结合领域特定的视觉特征和球衣颜色识别,以在人群密集的体育场景下提升球员关联准确性40,41。关于球衣号码识别及合成号码数据的相关工作进一步支持了在低分辨率或部分遮挡条件下的身份建模42,43。这些研究表明,球衣语义信息能够增强体育多目标追踪(MOT)中的身份表征。然而,大多数语义增强的追踪方法未能充分建模检测置信度与语义特征质量之间的关系。高置信度的检测结果通常已包含可靠的时空和外观信息,此时重复提取语义特征效率较低。低置信度的检测结果则常受遮挡、模糊、截断或低分辨率影响,导致颜色和球员号码线索的可靠性下降。这一局限性促使研究者设计一种基于置信度引导的关联策略,即根据检测质量选择性引入球衣语义信息,而非对所有检测结果统一应用。综述的研究表明,置信度感知的关联机制与球衣语义建模分别解决了体育多目标追踪中的不同问题:基于置信度的策略主要决定某个检测是否应参与关联,以及如何与现有轨迹进行匹配;而球衣语义策略则主要通过运动特异性线索增强身份表征。然而,这两种机制通常被设计为独立组件,导致语义线索未能始终根据检测质量进行调整,且置信度水平无法在关联过程中直接调控颜色和球员号码信息的使用。这种分离限制了对团队运动视频中轨迹断裂和身份混淆问题的联合处理。当前尚未解决的研究空白在于,如何在同一追踪流程中将检测置信度的质量评估与球衣语义关联机制有效结合。
本研究涉及对公开可用的基准视频数据集(即 SportsMOT、TeamTrack、SoccerNet Tracking、MOT17 和 MOT20)进行二次分析。研究未招募任何参与者,未实施任何干预,也未收集新的人类受试者数据。根据曼谷吞武里大学适用的机构规定,本研究无需获得伦理委员会批准。
以下方案描述了从数据准备到跟踪评估的 JerseyTrack 复现工作流程。该工作流程包括数据集准备、检测器准备、球衣语义提取、置信度分级划分、置信度引导关联、跟踪推理和性能评估,如图1所示。所需的软件、数据集和硬件资源列于材料表中。

图1.JerseyTrack 方法的整体工作流程。 该工作流程包括球衣语义特征提取、初始目标匹配、置信度引导的补充匹配以及特征融合。从检测到的运动员区域中提取球队颜色和球员号码特征,并将其融入关联过程中,以在检测结果不确定的情况下提升轨迹匹配的准确性。请点击此处查看该图的放大版本。
1. 准备数据集和目录结构
2. 准备检测器输出
3. 提取球衣语义特征
(2)
表示预测的球员号码类别。4. 分区检测置信度水平
(4)
图 2。基于置信度引导的关联策略。 该工作流程通过自适应置信度聚类将检测置信度划分为高、中、低三个置信度区间。高置信度检测结果通过运动相似性进行关联,中等置信度检测结果通过结合运动与球衣语义相似性进行关联,低置信度检测结果则用于语义辅助的轨迹恢复,并通过多帧验证加以确认。右侧面板总结了用于置信度划分与关联的数学表达式。请点击此处查看该图的放大版本。

图3。检测置信度分数的分布情况。 该直方图展示了SportsMOT数据集中足球、篮球和排球序列中五个置信度区间内的运动员检测框数量。该分布反映了在所评估的不同运动类别中检测器置信度的差异。请点击此处查看该图的放大版本。
5. 运行基于置信度引导的关联分析
(5)
表示第 k 帧中的第 I 条轨迹,
表示卡尔曼预测的轨迹状态,dj 表示候选检测,
表示预测轨迹状态的逆协方差矩阵,Smot 表示预测轨迹与检测之间的运动距离。
(7)
(8)
图4.球衣语义特征提取。 代表性运动员检测结果标注了由球衣语义提取模块生成的球队颜色描述符和球员号码信息。提取出的语义特征随后被整合到置信度引导的数据关联中。请点击此处查看该图的放大版本。
6. 运行追踪推断并导出结果
7. 评估追踪性能
本节报告了在评估的体育多目标跟踪实验中获得的定量与定性结果。结果重点关注在测试数据集设置下的跟踪准确性、身份保持、关联质量及鲁棒性。性能声明仅限于协议与实施设置中描述的评估方法、数据集、检测器输出及评估工具包配置。
实验设置与评估设计
数据集与预处理:
SportsMOT 被用作检测器准备、跟踪推理和定量评估的主要基准。该数据集包含 240 个视频序列,涵盖足球、篮球和排球场景,共计超过 150,000 张图像帧(图 5)。在正式评估中,主要的 SportsMOT 结果是通过验证集划分,结合协议中描述的检测器输出、跟踪配置以及 TrackEval 设置进行计算的。跨数据集评估在 TeamTrack、SoccerNet Tracking、MOT17 和 MOT20 上进行,旨在考察不同数据集类型之间的性能迁移能力,而非在数据集之间进行直接的指标级别比较。

图5。用于评估的代表性数据集。 示例帧展示了用于实验评估的代表性足球、篮球和排球序列。该图强调了在所评估的数据集中,摄像机视角、球员密度以及场景复杂度的变化情况。 请点击此处查看该图的放大版本。
SportsMOT 数据按照官方数据集结构进行组织,并转换为本方案中描述的检测器训练格式。转换后的 SportsMOT 训练和验证数据包含 90 个序列、55,544 帧图像以及 608,152 个标注对象。训练集用于检测器的准备和参数调优,而验证集则用于本研究中报告的正式跟踪评估。所有输入帧均根据本方案及材料表中报告的检测器配置进行尺寸调整。在检测器准备、语义特征提取、跟踪推理和 TrackEval 评估过程中均应用了相同的预处理流程,以确保报告的差异主要反映的是跟踪关联策略的不同,而非数据处理上的差异。
评估指标:
使用材料表中列出的评估工具包所实现的 MOTChallenge 兼容评估协议来评估跟踪性能。报告的指标描述了体育多目标跟踪(MOT)性能的三个方面:整体跟踪准确率、身份保持能力以及检测-关联质量。MOTA、IDF1 和 HOTA 被用作主要评估指标44,45。MOTA 将误报、漏报和身份切换汇总为一个整体跟踪准确率得分。IDF1 衡量预测轨迹与真实身份之间的一致性。HOTA 同时评估检测准确率和关联准确率,因此能够表征目标定位与轨迹关联之间的平衡。DetA 和 AssA 作为补充指标进行报告。FPs、FNs 和身份切换(IDs)用于刻画与错误检测、漏检及身份变化相关的误差来源。在 SportsMOT 数据集上进行方法间比较时,采用相同的检测器输出和评估工具包配置,以减少检测器差异和评估设置不同所带来的影响。在跨数据集比较中,指标值应解释为各数据集内部的评估结果,而非不同数据集之间绝对性能优劣的证据。
实验环境与参数设置:
实验使用了材料表中列出的硬件和软件资源。在主要的SportsMOT实验过程中,始终采用相同的计算环境、检测器框架、检测器输出和评估工具包,以确保检测器准备、跟踪推理和性能评估的一致性。材料表中列出的检测器框架使用16的批量大小、0.01的初始学习率以及80个训练周期进行训练。在球衣语义提取模块中,颜色聚类采用K-means算法,其中K = 3;OCR分支使用轻量级卷积循环神经网络,输入尺寸为128 × 64像素。OCR分支采用材料表中列出的自适应优化器进行优化,学习率为1 × 10⁻3,权重衰减为1 × 10⁻5,批量大小为64,并训练40个周期。在语义特征提取模块的训练过程中未使用额外的学习率调度策略。OCR损失权重系数(γ)被视为用户自定义的超参数,并根据验证集上的性能进行选择。置信度分层采用自适应K-means划分方法,其中τ₁和τ₂是根据每帧的检测置信度分布计算得出,而非在推理前手动预设。
跨运动项目和情景复杂性的表现追踪
不同运动项目和场景条件下的定量性能表现:
跟踪性能的评估基于两个分组因素:运动类别和场景复杂度。运动类别分析包括足球、篮球和排球序列。场景复杂度分析则在所有被评估序列中,采用相同的分组标准,考虑遮挡程度、运动速度和目标密度。所报告的指标遵循第7节“方案”中描述的评估协议。
图6总结了在不同运动类别和场景复杂度条件下的定量跟踪结果。图6A展示了足球、篮球和排球序列中的MOTA和DetA指标。图6B展示了在不同遮挡程度、运动速度和目标密度下的MOTA变化情况。图6C展示了每个场景复杂度维度的累积FP和FN计数。

图6。不同运动类别和场景条件下的追踪性能。 (A) 足球、篮球、排球以及总体平均的多目标追踪准确率(MOTA)和检测准确率(DetA)。(B) 在不同遮挡程度、球员密度和运动复杂性水平的代表性场景条件下,MOTA 的表现。(C) 各评估场景条件下的误报(FP)和漏报(FN)数量。请点击此处查看该图的放大版本。
在三个运动类别中,JerseyTrack 的平均多目标跟踪准确率(MOTA)为 88.9%,平均检测准确率(DetA)为 80.2%。不同运动类别之间的 MOTA 差异为 1.3 个百分点,其中排球序列的 MOTA 最高(89.2%),篮球序列的 MOTA 最低(87.9%)。篮球序列中较低的 MOTA 与所评估序列中更频繁的近距离交互和严重遮挡现象一致。在复杂度较低的场景条件下,包括轻度遮挡、低速运动和稀疏目标分布,MOTA 分别达到 91.8%、93.1% 和 93.8%。而在更复杂的场景条件下,MOTA 在重度遮挡下下降至 84.9%,在高速运动下下降至 83.6%,在密集目标分布下下降至 83.1%。这些结果表明,随着场景复杂度的增加,跟踪性能有所下降,但仍处于所报道的各类运动场景的性能范围内。
在代表性体育场景中追踪一致性:
图7展示了代表性跟踪示例,说明了JerseyTrack在三种具有挑战性的体育场景下的时间一致性:密集的运动员交互、长时间的部分遮挡以及快速的方向变化。在这些代表性序列中,尽管运动员频繁重叠且运动状态动态变化,跟踪器仍保持了稳定的轨迹身份。身份碎片化主要发生在严重遮挡或球衣语义信息暂时不可用时;然而,得益于置信度引导的关联策略,在可靠检测结果重新出现后,轨迹得以恢复。这些代表性示例通过在所评估的体育跟踪条件下展示稳定的身份保持能力,定性地支持了图6中所示的定量结果。

图7.JerseyTrack 生成的代表性跟踪结果。 来自篮球、足球和排球视频序列的连续帧展示了在跟踪过程中运动员身份与轨迹的保持情况。彩色边界框表示在连续视频帧中被持续跟踪的身份。请点击此处查看该图的放大版本。
身份保持的消融实验结果:
为了分析置信度引导关联策略和球衣语义融合模块对身份保持的贡献,进行了消融实验。比较了四种模型变体:V0,即无置信度引导关联和球衣语义融合的基线模型;V1,仅使用置信度引导关联的变体;V2,仅使用球衣语义融合的变体;以及V3,完整版JerseyTrack配置,包含上述两个组件。评估重点为与身份相关的指标,包括ID数(IDs)、IDF1分数、身份精确率(IDP)和身份召回率(IDR)。具有代表性的身份保持模式如图8所示。

图8. 基于置信度引导的球衣语义关联的消融分析。 (A) 所评估模型变体的整体身份切换次数(IDs)和身份F1分数(IDF1)。(B) 完整模型(V3)与基线配置(V0)在代表性挑战性跟踪场景下的身份切换次数(IDs)比较。(C) 完整模型在不同跟踪场景下的IDF1、ID精确率(IDP)和ID召回率(IDR)。请点击此处查看该图的放大版本。
在整体的SportsMOT验证设置中,完整的V3配置在四种模型变体中产生的ID数量最少,IDF1得分最高。V3记录了2,768个ID,比V0减少了477次身份切换,IDF1达到74.3%,较V0提高了7.1个百分点。这些结果表明,在所评估的运动追踪条件下,两个模块共同促进了身份保持。将单模块变体与完整配置进行比较进一步显示,这两个模块影响了不同来源的追踪误差。基于置信度引导的关联策略减少了与检测置信度不稳定和定位不确定性相关的匹配错误,而球衣语义融合模块在仅靠运动信息不足以区分身份时提供了额外的身份信息。完整的V3配置在与身份相关的性能上优于任一单模块变体,表明这两个模块提供了互补而非冗余的贡献。
在更具挑战性的身份保持条件下,场景级结果显示出更大的差异。在长时间遮挡情况下,V3记录的ID数为215,而V0为482。在包含6至10名球员的密集同队场景中,V3记录的ID数为328,而V0为615。在高速方向变化条件下,V3记录的ID数为482,而V0为960。这些减少与在遮挡和密集交互期间使用语义线索的预期用途一致,也与在快速运动过程中检测置信度波动时基于置信度引导的关联策略相符。图8C所示的身份精度(IDP)和身份召回率(IDR)趋势表明,ID数量的减少并未伴随身份精度或身份召回率的显著下降。完整配置在所有评估的挑战性场景中均保持IDF1值高于71%,其中在密集同队交互和高速方向变化条件下的值相对较低。这些结果表明,在所评估的条件下身份一致性有所提升,同时指出密集交互和快速运动仍是当前性能下降的主要来源。
跨数据集评估结果:
进行了跨数据集评估,以检验在SportsMOT上观察到的跟踪行为是否能在不同的数据集条件下保持。评估包括两个体育专用数据集SoccerNet Tracking和TeamTrack,以及两个通用MOT数据集MOT17和MOT20。本实验的目的是考察在不同类型数据集之间的性能迁移能力。由于各数据集的标注协议、场景构成、摄像机视角和目标类别存在差异,因此未将结果用于声称在数据集间具有直接的指标级优势。
表1总结了跨数据集的评估结果。在特定运动数据集上,与主要的SportsMOT验证设置相比,JerseyTrack保持了相对稳定的MOTA和IDF1值。这一趋势表明,当跟踪场景保留了团队运动的视觉特征(包括重复的队服、密集的运动员交互以及频繁的遮挡)时,基于置信度引导的关联策略和与队服相关的语义线索仍然有效。在通用MOT数据集上,该方法保持了具有竞争力的MOTA和DetA值,但IDF1低于在特定运动数据集上观察到的结果。这一模式与MOT17和MOT20中缺乏队服颜色和球员号码线索一致,而这些线索正是语义融合模块所依赖的。在此类条件下,置信度引导的关联组件仍然适用,而语义分支所提供的身份特异性信息则少于其在团队运动视频中的贡献。总体而言,这些结果表明,JerseyTrack向包含特定运动视觉语义的数据集迁移的效果优于向通用行人跟踪数据集的迁移。因此,跨数据集评估支持该方法作为面向运动场景的跟踪器的预期应用,同时也指出了在非运动MOT数据集中缺乏明确的队服语义是其性能受限的一个因素。
| 数据集 | MOTA↑ | IDF1↑ | DetA↑ | FPS↑ |
| SoccerNet Tracking | 86.8 | 71.3 | 77.9 | 32.1 |
| TeamTrack | 86.2 | 70.7 | 77.3 | 32.8 |
| MOT17 | 84.7 | 69.5 | 76.1 | 33.9 |
| MOT20 | 84.1 | 68.9 | 75.3 | 33.2 |
表1: 跨数据集评估结果。 JerseyTrack在四个公开基准数据集上的跟踪性能。报告了多目标跟踪准确率(MOTA)、身份F1分数(IDF1)、检测准确率(DetA)以及以每秒帧数(FPS)衡量的处理速度。MOTA、IDF1、DetA和FPS的数值越高,表示性能越好。
在受控扰动条件下的稳健性
为评估JerseyTrack在体育视频中常见的视觉干扰和检测质量下降情况下的稳定性,开展了受控扰动实验。所评估的扰动分为三类:语义特征扰动、检测框扰动和环境扰动。语义特征扰动包括球员号码遮挡、图像模糊、分辨率降低以及相似球衣颜色。检测框扰动包括边界框偏移、检测置信度波动和错误检测框。环境扰动包括雨点状噪声、雾化状退化、强光照和阴影干扰。图9总结了在这些扰动条件下的跟踪性能。在语义特征扰动下,随着球员号码可见性和裁剪图像质量的下降,跟踪性能也随之降低。当40%的球员号码区域被遮挡时,MOTA相较于无扰动条件下降了3.2个百分点,IDF1下降了5.3个百分点,而语义提取准确率仍保持在86.7%。这些结果表明,当某一语义线索可靠性降低时,球衣颜色和球员号码线索提供了互补信息。在检测框扰动下,该方法表现出适度的性能下降,而非突然失效。当检测框偏移±10像素且置信度分数受到高斯噪声干扰时,MOTA的下降幅度低于3个百分点,ID切换次数的增加控制在16%以内。这一趋势与置信度引导的关联策略一致,即中低置信度检测会采用额外的关联约束进行处理,而非采用与高置信度检测相同的策略。

图9. 在受控扰动下的鲁棒性评估。 (A) 随着球衣号码遮挡程度增加,多目标跟踪精度(MOTA)、身份F1分数(IDF1)和身份切换次数(IDs)的变化情况。 (B) 在代表性干扰条件下的性能下降情况。 (C) 在不同类型干扰下IDs的增长情况。 (D) 在评估的扰动条件下球衣语义提取的准确率。 请点击此处查看此图的放大版本。
在环境扰动条件下,主要跟踪指标的下降幅度在评估条件下保持在5个百分点以内,语义提取准确率保持在87.2%。基于HSV的颜色描述符降低了对光照变化的敏感性,而OCR分支则在部分模糊或质量下降的图像裁剪区域中保留了可用的球员号码信息。这些结果表明,语义模块在所评估的扰动条件下仍具备可用性,尽管其可靠性仍依赖于球衣的可见性及图像裁剪质量。总体而言,受控扰动实验表明,JerseyTrack在所评估的语义、检测质量及环境扰动条件下仍能维持可测量的跟踪性能。这些发现应在已测试的扰动范围内进行解读。系统性的视野外重识别、严重背景杂乱以及长期完全遮挡未在本实验中单独评估,相关内容已在讨论部分作为局限性进行阐述。
模块贡献与特征区分分析
为进一步分析所提出的两个组件如何影响与身份相关的跟踪性能,进行了模块贡献分析和特征区分分析。模块贡献分析采用了消融分析中定义的四种模型变体,而特征区分分析则比较了传统的行人重识别(Re-ID)特征、仅颜色特征、仅球员号码特征以及融合的球衣语义特征。采用类间/类内距离比值来描述特征的可分性,比值越大,表示不同身份之间的特征分离程度相对于同一身份内部的变化更为显著。表2总结了模块贡献分析结果。在整体评估中,置信度引导关联策略的估计贡献为41.7%,球衣语义融合的估计贡献为47.6%,剩余10.7%归因于两个组件的联合使用。这些数值表明,两个组件均对性能提升有所贡献,而完整配置的性能优势来源于两个组件的协同作用,而非任一组件单独作用。贡献模式随场景类型而变化。在严重遮挡情况下,球衣语义融合的估计贡献上升至69.4%,这与运动员部分或暂时被遮挡时运动线索可靠性降低的情况一致。在高速运动场景下,置信度引导关联的估计贡献达到44.3%,联合增益达到20.6%,表明由于快速运动或定位不确定性导致检测置信度波动时,基于置信度水平的划分变得更加重要。
| 模型变体 | 测试场景 | MOTA↑ | IDF1↑ | IDs↓ | 模块贡献 | 协同增益 |
| V0(基线) | 整体场景 | 83.5 | 67.2 | 3245 | – | – |
| 严重遮挡场景 | 77.8 | 61.5 | 3862 | – | – | |
| 高速运动场景 | 77.1 | 62.3 | 3689 | – | – | |
| V1(置信度引导关联) | 整体场景 | 86.3 | 70.9 | 2893 | 41.7 | – |
| 严重遮挡场景 | 80.9 | 65.9 | 3415 | 29.8 | – | |
| 高速运动场景 | 81.4 | 67.9 | 3024 | 44.3 | – | |
| V2(球衣语义关联) | 整体场景 | 85.2 | 71.8 | 2937 | 47.6 | – |
| 严重遮挡场景 | 82.7 | 72.8 | 2753 | 69.4 | – | |
| 高速运动场景 | 80.1 | 66.8 | 3157 | 35.1 | – | |
| V3(完整 JerseyTrack) | 整体场景 | 88.9 | 74.3 | 2768 | – | 10.7 |
| 严重遮挡场景 | 84.9 | 75.6 | 2689 | – | 0.8 | |
| 高速运动场景 | 83.6 | 71.5 | 2842 | – | 20.6 |
表2: 模块贡献的消融分析。 不同 JerseyTrack 模型变体在整体、严重遮挡和高速运动场景下的性能比较。报告了多目标跟踪精度(MOTA)、身份F1分数(IDF1)以及身份切换次数(IDs),并附有估计的模块贡献和协同增益。MOTA、IDF1、模块贡献和协同增益的数值越高表示性能越好,而IDs数值越低表示性能越好。
表3总结了特征判别分析结果。融合的球衣语义特征的类间/类内距离比达到5.63,而传统Re-ID特征为1.82,距离比指标相对提升了209.3%。仅使用颜色和仅使用球员号码的特征相较于传统Re-ID特征也提高了特征可分性,但每种单一线索仍易受特定失败情况的影响,包括相似的球队颜色、球员号码被遮挡、运动模糊以及无法识别的球衣区域。在所评估的特征表示中,融合语义表示实现了最高的特征可分性,并在消融分析中对应最高的IDF1分数和最低的ID切换次数。这些发现支持在运动员外观相似且仅靠运动信息不足以区分身份时,将球衣特异性语义线索作为体育多目标跟踪(MOT)中的补充身份信息使用。这些观察结果仅限于所评估的SportsMOT场景,不应被解读为球衣语义能够解决所有体育视频中的身份歧义问题。
| 特征类型 | 类间/类内距离比 | 相对提升 (%) | IDF1↑ | IDs↓ |
| 传统行人重识别特征 | 1.82 | – | 65.7 | 3482 |
| 队服颜色特征 | 3.17 | 74.2 | 69.8 | 3125 |
| 球员号码特征 | 3.49 | 91.8 | 70.5 | 3018 |
| 融合球衣语义特征 | 5.63 | 209.3 | 74.3 | 2768 |
表3: 不同特征表示的判别性分析。 对比了传统行人重识别(Re-ID)特征、球衣颜色特征、球员号码特征以及融合语义特征在特征判别性上的表现。报告了类间/类内距离比、特征判别性的相对提升、IDentity F1分数(IDF1)以及身份切换次数(IDs)。距离比、相对提升和IDF1的数值越高表示性能越好,而IDs数值越低表示性能越好。
与现有多目标跟踪方法的基准比较
通过基准比较,在相同的 SportsMOT 验证设置下,将 JerseyTrack 与具有代表性的多目标跟踪(MOT)方法进行了对比。参与比较的方法包括 QDTrack、DeepSORT、ByteTrack、FairMOT、Deep OC-SORT 和 MOTR。所有方法均使用由材料表中所列检测器框架生成的相同检测输出,以确保比较聚焦于跟踪关联性能,而非检测器差异。评估采用了第 7 节协议中定义的指标 。主要评估指标包括 MOTA、HOTA 和 IDF1;辅助指标包括 DetA、AssA、FPs、FNs 和 IDs。表 4 总结了在 SportsMOT 验证集上的定量比较结果,图 10 则展示了在所评估的体育场景中,各方法在跟踪精度、推理速度和 HOTA 分布方面的可视化对比。JerseyTrack 在参与比较的方法中取得了最高的 MOTA,达到 88.9%。该数值比 Deep OC-SORT(87.8%)高出 1.1 个百分点,比 ByteTrack(86.4%)高出 2.5 个百分点。因此,在所评估的 SportsMOT 验证设置下,JerseyTrack 在整体跟踪精度方面优于其他对比方法。在 HOTA 指标上,JerseyTrack 达到 69.9%,高于 Deep OC-SORT 的 64.4% 和 ByteTrack 的 62.8%。这些差异分别对应 5.5 和 7.1 个百分点的提升,表明在相同评估条件下,JerseyTrack 在检测与关联性能之间实现了更高的平衡性。
| 方法 | MOTA↑ | HOTA↑ | IDF1↑ | DetA↑ | AssA↑ | FP↓ | FN↓ | IDs↓ |
| QDTrack | 75.9 | 53.7 | 51.6 | 65.6 | 39.7 | 96,324 | 89,871 | 8,216 |
| DeepSORT | 77.6 | 54.1 | 53.2 | 67.3 | 44 | 76,228 | 86,319 | 6,836 |
| ByteTrack | 86.4 | 62.8 | 67.7 | 73.8 | 50.9 | 33,752 | 78,698 | 4,192 |
| FairMOT | 84.1 | 54.7 | 62.5 | 77.8 | 47.8 | 45,187 | 83,620 | 4,817 |
| Deep OC-SORT | 87.8 | 64.4 | 69.9 | 78.2 | 52.1 | 25,012 | 74,385 | 3,211 |
| MOTR | 82.9 | 57.2 | 58.4 | 68.9 | 46.1 | 54,931 | 85,063 | 5,137 |
| JerseyTrack | 88.9 | 69.9 | 74.3 | 80.2 | 54.3 | 21,953 | 67,160 | 2,768 |
表4: JerseyTrack 与代表性多目标跟踪方法在 SportsMOT 验证集上的性能比较。 JerseyTrack 与代表性多目标跟踪(MOT)方法在 SportsMOT 验证数据集上的比较。报告的指标包括多目标跟踪精度(MOTA)、高阶跟踪精度(HOTA)、身份 F1 分数(IDF1)、检测精度(DetA)、关联精度(AssA)、误报数(FP)、漏报数(FN)以及身份切换次数(IDs)。对于 MOTA、HOTA、IDF1、DetA 和 AssA,数值越高表示性能越好;而对于 FP、FN 和 IDs,数值越低表示性能越好。

图10.与代表性多目标跟踪方法的性能比较。 (A) JerseyTrack 与在 SportsMOT 数据集上评估的代表性多目标跟踪方法在多目标跟踪准确率(MOTA)和每秒帧数(FPS)方面的比较。(B) 各跟踪方法在高阶跟踪准确率(HOTA)上的分布情况。请点击此处查看此图的放大版本。
在身份保持方面,JerseyTrack 的 IDF1 达到 74.3%,高于 Deep OC-SORT 的 69.9% 和 ByteTrack 的 67.7%。JerseyTrack 记录的 ID 数量为 2,768 个,少于 Deep OC-SORT 的 3,211 个 ID 和 ByteTrack 的 4,192 个 ID。这些观察结果与 图 8 和 表 2 中所示的消融实验结果一致,表明完整的 JerseyTrack 配置相较于基线模型变体减少了身份切换现象。在检测与关联质量方面,JerseyTrack 的 DetA 为 80.2%,AssA 为 54.3%。与 Deep OC-SORT 相比,JerseyTrack 的 DetA 提高了 2.0 个百分点,AssA 提高了 2.2 个百分点。此外,JerseyTrack 产生的假阳性(FP)和假阴性(FN)数量也少于 表 4 中报告的其他对比方法,分别记录为 21,953 个 FP 和 67,160 个 FN。总体而言,在 SportsMOT 验证设置下,基准对比表明 JerseyTrack 在所评估方法中实现了最高的主要跟踪指标值。这些结果与采用置信度引导关联和球衣语义融合所观察到的身份保持和关联稳定性提升一致。本比较仅限于本研究中使用的共享检测器输出和 SportsMOT 验证配置。
参数敏感性结果
通过参数敏感性分析,研究了关键实现参数在SportsMOT验证设置下对跟踪性能的影响。评估了三个参数:OCR损失加权系数(γ)、置信度层级聚类数量(K)以及OCR网络学习率(η)。表5总结了在不同参数设置下获得的MOTA、IDF1、HOTA和ID数量。
| 参数 | 数值 | MOTA↑ | IDF1↑ | HOTA↑ | IDs↓ |
| OCR 损失权重 (γ) | 0.2 | 84.7 | 69.4 | 66.2 | 2,944 |
| 0.4 | 86.3 | 71.5 | 68.2 | 2,893 | |
| 0.6 | 87.9 | 73.1 | 68.9 | 2,815 | |
| 0.8 (最优) | 88.9 | 74.3 | 69.9 | 2,768 | |
| 1 | 88.2 | 73.8 | 69.3 | 2,792 | |
| 置信度聚类数量 (K) | 2 | 86.7 | 72.1 | 68.5 | 2,876 |
| 3 (最优) | 88.9 | 74.3 | 69.9 | 2,768 | |
| 4 | 88.1 | 73.6 | 69.7 | 2,803 | |
| 5 | 87.3 | 72.8 | 69.2 | 2,851 | |
| OCR 学习率 (η) | 1 × 10⁻⁴ | 85.9 | 70.8 | 67.3 | 2,934 |
| 5 × 10⁻⁴ | 87.6 | 72.7 | 68.7 | 2,832 | |
| 1 × 10⁻³ (最优) | 88.9 | 74.3 | 69.9 | 2,768 | |
| 5 × 10⁻³ | 87.8 | 73.2 | 69 | 2,817 | |
| 1 × 10⁻² | 86.5 | 71.6 | 68.7 | 2,889 |
表5: 参数敏感性分析。 使用 JerseyTrack 的不同参数设置所获得的跟踪性能。针对光学字符识别(OCR)损失加权系数(γ)、置信度聚类数量(K)和 OCR 学习率(η)的不同取值,报告了多目标跟踪精度(MOTA)、身份 F1 分数(IDF1)、高阶跟踪精度(HOTA)以及身份切换次数(IDs)。被确定为最优的参数值对应于报告实验中所采用的设置。MOTA、IDF1 和 HOTA 的数值越高表示性能越好,而 IDs 的数值越低表示性能越好。
对于OCR损失权重系数(γ),在γ = 0.8时获得了最佳的评估性能。在此设置下,JerseyTrack实现了88.9%的MOTA、74.3%的IDF1、69.9%的HOTA以及2,768个ID。当γ降低至0.2时,MOTA、IDF1和HOTA分别下降至84.7%、69.4%和66.2%,而ID数量增加至2,944个。当γ增加至1.0时,各项性能指标相较于γ = 0.8时略有下降,MOTA为88.2%,IDF1为73.8%,HOTA为69.3%,ID数量为2,792个。这些结果表明,OCR监督不足会降低球员号码的区分能力,而在测试条件下,进一步提高OCR损失权重超过所评估的最优值并不能改善追踪性能。
对于置信度层次聚类数(K),在 K = 3 时获得了最佳的评估性能。该设置对应于方法中描述的高、中、低置信度关联策略。当 K = 2 时,置信度划分的粒度较粗,MOTA、IDF1 和 HOTA 分别下降至 86.7%、72.1% 和 68.5%。当 K 增加至 4 或 5 时,性能相较于 K = 3 也有所下降,表明过度划分将检测结果分入了过于狭窄的置信度组,从而降低了关联策略的稳定性。这些结果支持在所评估的 JerseyTrack 配置中采用三个置信度等级。
对于OCR网络的学习率(η),在η = 1 × 10-3时获得了最佳的评估性能。当学习率降低至1 × 10-4时,MOTA、IDF1和HOTA分别下降至85.9%、70.8%和67.3%,而ID数量增加至2,934。当学习率升高至1 × 10-2时,MOTA、IDF1和HOTA分别下降至86.5%、71.6%和68.7%,而ID数量增加至2,889。这些结果表明,OCR分支对学习率的选择较为敏感,在评估条件下,1 × 10-3的学习率在球员号码识别与身份保持性能之间提供了最佳平衡。
总体而言,表5 显示参数组合 γ = 0.8、K = 3 和 η = 1 × 10-3 产生了最高的 MOTA、IDF1 和 HOTA 评估值,同时伴随最少的 ID 切换次数。敏感性分析还表明,从这些参数值适度偏离会导致跟踪性能发生可测量但非突变的变化。因此,本研究中报告的基准比较以及主要的 SportsMOT 验证实验均采用了这些参数设置。
数据可用性
支持本研究结果的原始评估摘要、最终跟踪输出、环境记录、数据集映射文件以及中间摘要文件均公开存放在以下公共仓库中:https://doi.org/10.5281/zenodo.21274353。本研究使用的原始公开基准数据集,包括 SportsMOT、TeamTrack、SoccerNet Tracking、MOT17 和 MOT20,均由各自的数据提供方发布,未在该仓库中重新分发。
本研究评估了一种结合检测置信度划分与球衣语义线索的置信度引导体育多目标跟踪(MOT)工作流程。置信度引导关联与语义特征融合已被作为提升多目标跟踪中数据关联性能的互补策略进行研究12,20,23,24,46。结果表明,在所评估的SportsMOT验证设置下,完整的JerseyTrack配置提升了身份保持能力与关联稳定性。主要的SportsMOT验证结果达到了88.9%的MOTA、69.9%的HOTA、74.3%的IDF1、80.2%的DetA以及54.3%的AssA。这些数值应在协议中描述的检测器输出源、数据集划分和TrackEval配置背景下进行解读。
工作流程中的一个关键步骤是置信度分级划分,它能够根据检测器输出的可靠性应用不同的关联策略20,22,23,24。通过将检测结果划分为高、中、低三种置信度组别,JerseyTrack 对不同可靠性级别的检测采用不同的关联规则。高置信度检测主要通过运动一致性进行关联,中等置信度检测则结合运动信息与球衣语义信息共同进行关联。低置信度检测不用于初始化新轨迹,仅在轨迹恢复阶段被考虑。该设计降低了弱检测或误检导致身份不稳定的风险,同时仍允许在存在额外语义证据时,部分检测结果参与轨迹恢复过程8,11,20。第二个关键步骤是球衣语义特征提取。队服颜色特征提供了团队层面的约束,而当球员号码区域可见且可读时,号码特征则提供更精细的身份线索35,41,42,43。消融实验结果表明,这些线索在密集的同队交互和遮挡场景中最为有效,因为在这些情况下仅依赖运动的关联方法可靠性较低。然而,球衣语义信息应被视为辅助证据,而非对运动关联的完全替代。球员号码在图像模糊、截断、背身姿态、严重遮挡或低分辨率情况下可能无法识别。当号码信息不可用时,队服颜色特征也无法区分同一队内的不同运动员35,42,43。跨数据集实验结果进一步明确了该方法的适用范围。JerseyTrack 在团队运动数据集上的迁移效果优于通用行人多目标跟踪(MOT)数据集,因为其语义分支的设计基于球衣颜色和球员号码线索19,33,34,35,36,37。在通用MOT数据集中,置信度引导的关联组件仍然适用,但针对体育场景设计的语义分支所提供的身份信息贡献较小。因此,该方法最适用于运动员穿着可区分队服、且球衣区域足够可见以支持语义特征提取的团队运动视频19,33,34,35,36,37。
目前仍存在若干局限性。首先,该方法依赖于检测器输出的质量;严重的漏检或不准确的边界框会降低运动预测和语义裁剪的可靠性14,17,46。其次,当前实现未对长期离开视野后的重识别进行单独优化。当运动员长时间离开摄像机视野后重新进入时,现有的轨迹恢复策略可能不足以恢复其原始身份19,34。第三,严重的背景杂乱、球员重叠、运动模糊以及无法辨认的球衣号码均可能降低语义特征的可靠性14,35,42,46。第四,当前评估主要集中于公开基准数据集和受控的扰动设置;在包含镜头切换、变焦变化和非标准视角的广播视频中部署时,可能需要额外的预处理或重识别模块19,33,34。
主要的实际意义在于,可以在不改变检测器结构的情况下,将基于置信度的关联方法与特定球衣的语义线索整合到模块化的多目标跟踪(MOT)流程中。该能力可应用于运动员轨迹提取、球队移动分析、战术事件回顾以及半自动视频标注等体育分析任务1,4,33,36。未来的研究应聚焦于更强大的视野外重识别、背景杂乱处理、时序特征聚合,以及在严重模糊或遮挡条件下的更鲁棒的球员号码识别14,19,34,46。
综上所述,JerseyTrack 是一种结合了置信度引导关联与球衣语义融合的体育运动多目标跟踪(MOT)方法。该方法将检测结果划分为高、中、低三种置信度组,并根据检测的可靠性应用不同的关联规则,同时在中等置信度关联和轨迹恢复过程中,利用球衣颜色和球员号码作为辅助的身份信息。在所评估的 SportsMOT 验证设置下,JerseyTrack 相较于基准配置表现出更高的跟踪精度和身份保持能力。消融实验结果表明,完整配置相比基准方法及单一模块变体减少了身份切换次数;基准对比结果显示,在共享检测器输出和评估配置条件下,主要跟踪指标均取得更高数值。这些发现支持在团队运动视频的运动员跟踪中使用置信度层级信息以及针对球衣的语义线索,尤其是在球衣区域可见、且球队颜色或球员号码能够提供补充身份证据的情况下20,35,46。解决所识别出的局限性,可能进一步提升该方法在更具挑战性的体育跟踪场景中的适用性。
作者声明不存在经济利益冲突。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| CUDA 运行时 | NVIDIA | 版本 12.8 | 用于检测器训练、语义特征提取和跟踪推理的 GPU 计算运行环境。 |
| EasyOCR | Jaided AI | 版本 1.7.2 | 用于球员号码识别的光学字符识别工具包。 |
| JerseyTrack 源代码 | 作者 | N/A | 包含数据准备、语义特征提取、置信度划分、跟踪、后处理和评估脚本的自定义实现。可从以下网址获取:https://doi.org/10.5281/zenodo.21274352 |
| 轻量级 CRNN OCR 模型 | 作者 | N/A | 用于球员号码识别的自定义卷积循环神经网络(CRNN)。 |
| MOT17 数据集 | MOTChallenge | N/A | 用于跨数据集评估的公开基准数据集。可从以下网址获取:https://motchallenge.net/data/MOT17/ |
| MOT20 数据集 | MOTChallenge | N/A | 用于跨数据集评估的公开基准数据集。可从以下网址获取:https://motchallenge.net/data/MOT20/ |
| motmetrics | motmetrics 开发者 | 版本 1.4.0 | 用于诊断多目标跟踪指标计算的库。 |
| NVIDIA GPU | NVIDIA | GeForce RTX 5090 D V2 | 用于检测器训练和跟踪推理的图形处理器。 |
| NVIDIA GPU 驱动程序 | NVIDIA | 版本 610.62 | 实验环境中使用的 GPU 驱动程序。 |
| NumPy | NumPy 开发者 | 版本 2.4.4 | 用于特征处理和数据操作的数值计算库。 |
| OpenCV | OpenCV | 版本 4.10.0 | 用于图像加载、裁剪、预处理和可视化的计算机视觉库。 |
| Python | Python 软件基金会 | 版本 3.12.2 | 整个工作流程中使用的编程语言。 |
| PyTorch | PyTorch 基金会 | 版本 2.11.0+cu128 | 用于实现检测器和语义模型的深度学习框架。 |
| scikit-learn | scikit-learn 开发者 | 版本 1.9.0 | 在球衣颜色提取和置信度划分过程中用于 K 均值聚类的机器学习库。 |
| SoccerNet 跟踪数据集 | SoccerNet | N/A | 用于跨数据集评估的公开足球跟踪基准。可从以下网址获取:https://www.soccer-net.org/tasks/tracking |
| SportsMOT 数据集 | SportsMOT 基准 | N/A | 用于检测器准备和跟踪评估的主要基准数据集。可从以下网址获取:https://deeperaction.github.io/datasets/sportsmot.html |
| TeamTrack 数据集 | TeamTrack 基准 | N/A | 用于跨数据集评估的公开体育跟踪基准。可从以下网址获取:https://atomscott.github.io/TeamTrack/ |
| Torchvision | PyTorch 基金会 | 版本 0.26.0+cu128 | 与 PyTorch 配合使用的计算机视觉库,用于图像变换和模型支持。 |
| TrackEval | TrackEval 开发者 | 版本 1.3.0 | 评估工具包,用于计算多目标跟踪精度(MOTA)、身份 F1 分数(IDF1)、高阶跟踪精度(HOTA)、检测精度(DetA)、关联精度(AssA)、误报(FP)、漏报(FN)和身份切换(IDs)。 |
| Ultralytics | Ultralytics | 版本 8.4.90 | 用于训练检测器并生成运动员检测结果的目标检测框架。 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可