需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

一种基于Transformer的多模态框架在团队运动战术决策分析中的应用——以足球为例

3K 次观看

DOI:

10.3791/69806

2026年1月27日

本文内容

摘要

为了提升足球比赛中战术决策的分类效果,本研究提出了一种基于 Transformer 的多模态融合模型,该模型整合了视觉、位置、声学和上下文数据。该模型在包含 500 个序列的多模态数据集上实现了接近实时的性能,在准确率以及压力导致的误分类方面均优于 CNN-LSTM、BiLSTM-Attention 和 GNN 基线模型。

摘要

现代足球运动要求快速且准确的战术决策能力。然而,传统的战术决策评估方法生态效度较差,且难以大规模应用。为应对这些挑战,本文介绍了一种基于 Transformer 的多模态融合模型,该模型结合球员位置信息、视频、音频以及上下文元数据,用于对实时战术决策进行分类。研究对40名男性球员开展了实验,并构建了一个包含500段多模态比赛片段的数据集。其中,40名球员的数据集来源于受控的实验室风格决策实验,用于初步验证和可靠性评估;随后,从扩展的比赛模拟和真实比赛录像中提取了500段多模态序列,构成用于训练和测试多模态 Transformer 模型的较大规模数据集。

该方法通过五个阶段处理输入:数据采集、预处理、特征提取、基于Transformer的融合以及决策分类。与CNN-LSTM、BiLSTM-Attention和GNN等基线模型相比,所提出的方法将决策预测准确率提高了28%,由压力引起的误分类减少了41%,且推理延迟低至52.6 ms,适用于近实时应用。然而,由于样本群体局限于单一地区年轻男性运动员,样本量相对较小且同质性较高,研究结果在更广泛战术情境和更广泛运动员人群中的可推广性仍受限。这些结果强调了基于Transformer的多模态融合在自动化战术决策分析中的贡献,同时也指出了其在更多样化和大规模比赛场景中进一步验证的必要性。

引言

足球等团队运动要求运动员在动态且不确定的环境中迅速做出战术决策。运动员必须持续观察来自球体、队友和对手的视觉信息,并在极短时间内做出反应,以确保竞争优势。足球中的战术决策高度依赖于对球员移动、球的轨迹以及情境线索的快速感知。尽管反应时间与选择性注意等一般性感知认知能力确实会影响运动表现,但近期研究更强调基于数据、具备情境感知能力的模型,以逼近真实比赛中的战术认知过程1,2,3,4,5。反应时间以及认知能力等感知能力在运动表现中同样发挥着关键作用6,7,8。近年来关于运动认知的研究表明,战术决策不仅依赖于感知技能,还依赖于运动员实时整合动态空间信息、对手施压情况以及比赛情境线索的能力。关于感知-认知专长的研究提示,战术素养更高的运动员能够更快识别线索,更高效地获取信息,并在压力下表现出更稳定的决策模式。这些发现支持了构建能够捕捉体育决策过程复杂性与多层次特性的计算模型的必要性。

访问受限。请登录或开始试用以查看此内容。

方案

研究纳入了40名年龄在18至24岁之间的男性足球运动员(平均年龄 = 20.1 ± 1.2岁),这些运动员来自一个地区联赛中的四支业余和半职业俱乐部。所有参与者均具有至少三年的竞技经验,并且目前处于结构化训练环境中。数据采集在两个受控环境下进行:首先,在标准化的训练场训练中模拟战术性传球/带球决策场景;其次,在长时间的比赛模拟会话中提取多模态序列。所有实验程序均经北部湾大学机构伦理委员会批准(批准编号:BG-PE-2023-117),并在数据采集前获得所有参与者的书面知情同意。本研究严格遵守国际及机构伦理标准。北部湾大学机构伦理委员会审查并批准了所有涉及人类受试者的研究程序(批准编号:BG-PE-2023-117)。在数据采集前,每位参与者均签署书面知情同意书,所有收集的数据在分析前均进行了匿名化处理。

本研究旨在通过基于 Transformer 的多模态融合架构,实现对团队运动中战术决策过程的自动化与增强化分析。该方法整合多种数据源,包括视频、音频、空间位置信息以及运动员元数据,以构建一个稳健的实时预测模型。图1展示了所提出方法的架构。本研究共包含五个阶段,各阶段描述如下:

访问受限。请登录或开始试用以查看此内容。

结果

该设计将多样化的数据、视频、空间坐标和比赛情境数据融合为单一通道,以预测传球、突破或持球等战术动作。该方法首先输入视频,并利用三维卷积神经网络(3D CNN)对其进行处理。随后,情境信息、位置信息和视频流的输出可通过低秩融合模块进行融合。该方法通过融合空间分解有效获取跨模态相关性,在保留各模态间关键关系的同时,最小化计算复杂度。最后,融合后的多模态表征由具有跨模态注意力机制的Transformer编码器进行处理。表3展示了所提方法的仿真环境。

仿真环境规格
编程框架Python 配合 PyTorch/TensorFlow
硬件NVIDIA RTX 3080 GPU,32 GB RAM

访问受限。请登录或开始试用以查看此内容。

讨论

本文提出的基于Transformer的多模态融合框架,相较于基础论文中描述的基线斯特鲁普任务足球测试(STFT),代表了一项重要进展。与基础论文中专注于受控的、以实验室为导向的测试不同——其使用的刺激材料有限且静态,例如彩色箭头以及预定义的任务(传球或运球)——新模型利用真实比赛中的多模态源数据,从而实现更丰富、自动化的战术分析流程。然而,尽管整合了真实比赛的多模态序列,受控的传球/运球任务在整体任务中所占比例仍高于理想水平,限制了模型在生态真实性方面充分反映足球比赛中战术多样性的能力。特别是,基础研究采用人工视频标注、小规模测试环境以及主观的人类专家评分来获取决策准确性(DMA)和执行时间(ET)。尽管该方法在基线测试中表现良好,但其可扩展性有限,生态效度不足,且依赖于人工刺激材料。

对该方案的批判性评估表明,多个阶段对所提出的多模态框架的成功与稳定性具有显著影响。首先,多模态数据采集与时间对齐阶段极为敏感。25 fps 的视频与 10 Hz 的位置数据之间微小的时间不同步,会导致时间上错位的线索,这些误差可能在后续的融合层中持续传播。其次,基于 3D-CNN 的特征提取阶段在捕.......

访问受限。请登录或开始试用以查看此内容。

披露

作者声明无任何利益冲突。

致谢

作者衷心感谢北部湾大学体育学院和西南财经大学统计学院在本研究期间提供的资源和机构支持。本研究还得到了2023年国家社会科学基金项目“左江—右江革命老区红色体育文化资源有效利用研究”(项目编号:23CTY016)的资助。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
3D CNN自定义实现从视频中提取时空特征
GoPro Hero4GoPro Inc.https://gopro.com/比赛视频录制
GPS/IMU 传感器Catapult Sports / Xsenshttps://www.catapultsports.com/运动员位置追踪
Intel Core i7-11700K CPUIntelhttps://www.intel.com模型训练工作站 CPU
Librosalibrosa.orghttps://pypi.org/project/librosa/音频信号处理与重采样
MLP 分类器PyTorch / TensorFlow战术决策分类
NumPyPython 软件基金会https://pypi.org/project/numpy/数值计算与矩阵运算
NVIDIA RTX 3080 GPUNVIDIAhttps://www.nvidia.com深度学习训练与推理
OpenCVOpenCV.orghttps://pypi.org/project/opencv-python/从视频中提取帧
pandasPython 软件基金会https://pypi.org/project/pandas/数据操作与表格处理
PCA(Scikit-learn)Scikit-learnhttps://scikit-learn.org/降维
Python 3.9Python 软件基金会https://www.python.org/downloads/release/python-390/编程语言环境
PyTorchPyTorch 基金会https://pytorch.org/深度学习框架
scikit-learnscikit-learn 开发者https://pypi.org/project/scikit-learn/交叉验证、组内相关系数计算
TensorFlow 2.8Googlehttps://www.tensorflow.org/深度学习框架
Transformer 编码器PyTorch / TensorFlow基于注意力机制的多模态特征融合
Ubuntu 20.04 LTSCanonical Ltd.https://ubuntu.com/模型训练用操作系统
工作站自定义 / Intel, NVIDIA用于模型训练的 CPU、GPU 和内存

参考文献

  1. Calle-Jaramillo, G. A., Franco, R., González, S. R., Forero, L. M., González, H. Design and validation of a test to evaluate the execution time and decision-making in technical–tactical football actions (passing and driving). Behav Sci. 13 (1), 101(2023).
  2. Renshaw, I., Davids, K., O’Sullivan, M., Maloney, M. A., Crowther, R., McCosker, C.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

Transformer