Research Article

Un marco multimodal basado en transformadores para el análisis táctico de decisiones en deportes de equipo con aplicación al fútbol

DOI:

10.3791/69806

January 27th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para mejorar la categorización de decisiones tácticas en el fútbol, este estudio sugiere un modelo de fusión multimodal basado en Transformers que incorpora datos visuales, de localización, acústicos y contextuales. El modelo logra un rendimiento casi en tiempo real en un conjunto de datos multimodal de 500 secuencias, superando a las líneas base de CNN-LSTM, BiLSTM-Attention y GNN en términos de precisión y clasificación errónea inducida por presión.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El fútbol moderno requiere una toma de decisiones táctica rápida y precisa. Sin embargo, los enfoques tradicionales para la evaluación de la toma de decisiones tácticas tienen poca validez ecológica y no se escalan fácilmente. Para abordar estos desafíos, este artículo introduce un modelo de Fusión Multimodal Basado en Transformers que incorpora posicionamiento del jugador, vídeo, audio y metadatos contextuales para clasificar decisiones tácticas en tiempo real. Se realizaron experimentos con 40 jugadores masculinos y un conjunto de datos que comprendía 500 secuencias de jugadas multimodales. El conjunto de datos de 40 jugadores se refiere a experimentos de toma de decisiones de laboratorio controlados utilizados para la validación inicial y una evaluación de fiabilidad. Después, se extrajeron 500 secuencias multimodales de simulaciones extendidas de partidos y grabaciones de partidas reales para proporcionar el conjunto de datos más amplio utilizado en el entrenamiento y prueba del modelo de transformador multimodal.

Procesa las entradas en cinco etapas: adquisición de datos, preprocesamiento, extracción de características, fusión basada en transformadores y clasificación de decisiones. En comparación con las líneas base de CNN-LSTM, BiLSTM-Attention y GNN, el enfoque propuesto mejora la precisión de la predicción de decisiones en un 28% y reduce la clasificación errónea causada por la presión en un 41%, con una baja latencia de inferencia de 52,6 ms, lo que lo hace adecuado para aplicaciones casi en tiempo real. La generalizabilidad de los hallazgos en contextos tácticos más diversos y a demografías más amplias de atletas también está limitada por el tamaño relativamente pequeño y la homogeneidad dentro de la población muestral de jóvenes jugadores masculinos de una sola región. Estos resultados subrayan la contribución de la fusión multimodal basada en transformadores hacia el análisis táctico automatizado de decisiones y señalan la necesidad de su validación adicional en situaciones de partida más diversas y a gran escala.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los deportes de equipo, como el fútbol, requieren decisiones tácticas rápidas en entornos dinámicos e inciertos. Los jugadores deben leer constantemente información visual del balón, de sus compañeros y de los rivales, y responder en fracciones de segundo para asegurar una ventaja competitiva. La toma de decisiones tácticas en el fútbol americano depende en gran medida de la percepción rápida de los movimientos de los jugadores, la trayectoria del balón y las señales situacionales. Aunque las habilidades perceptuales-cognitivas generales, como el tiempo de reacción y la atención selectiva, sí influyen en el rendimiento, investigaciones recientes han enfatizado modelos basados en datos y conscientes del contexto que pueden aproximarse a la cognición táctica real del juego 1,2,3,4,5. El tiempo de reacción y las capacidades perceptivas, como las capacidades cognitivas, también desempeñan un papel crucial enel rendimiento 6,7,8. Investigaciones recientes en cognición deportiva han establecido que la toma de decisiones tácticas depende no solo de las habilidades perceptivas, sino también de la capacidad del atleta para integrar información espacial dinámica, presión del oponente y señales contextuales del juego en tiempo real. La investigación sobre la experiencia perceptivo-cognitiva sugiere que los jugadores tácticamente más alfabetizados reconocen las señales más rápido, captan la información de manera más eficiente y muestran patrones de toma de decisiones más estables bajo presión. Estos hallazgos respaldan la necesidad de modelos computacionales capaces de captar la naturaleza compleja y multilayer de los procesos de toma de decisiones deportivas.

Los métodos clásicos para evaluar la toma de decisiones tácticas suelen emplear tareas de laboratorio controladas y juicios subjetivos de expertos, que imponen restricciones significativas a la validez ecológica y la escalabilidad. Los avances recientes en aprendizaje profundo ofrecen el potencial de automatizar el proceso mediante el uso de fuentes multimodales de datos —como vídeo, seguimiento posicional y metadatos de coincidencias contextuales— dentro de arquitecturas de captura de dependencias temporales y intermodales. A pesar de este avance, la mayoría de los modelos actuales siguen basándose en modelos de Redes Neuronales Convolucionales-Memoria a Corto Plazo o Memoria Bidireccional a Corto Plazo (CNN-LSTM o BiLSTM), que tienen una capacidad limitada para modelar dependencias a largo plazo entre modalidades. Esta carencia es la fuerza motriz detrás del desarrollo de modelos de fusión multimodales basados en transformadores, que están mejor equipados para modelar la toma de decisiones tácticas de forma más completa y estable en escenarios de fútbol. En el deporte de equipo contrario que es el fútbol, por ejemplo, los jugadores deben evaluar rápidamente la información sobre el balón, incluyendo a sus compañeros, rivales y posición en el campo. Antes de decidir el mejor curso de acción según sus habilidades, las indicaciones del entrenador y las circunstancias delpartido, 9,10. Debido a la accesibilidad de conjuntos de datos organizados y componentes tácticos definidos, este estudio se centra exclusivamente en el fútbol; sin embargo, los principios tácticos para tomar decisiones son aplicables a numerosos deportes de equipo.

De hecho, estudios previos indican que CNN-LSTM y BiLSTM no pueden capturar dependencias temporales a muy largo alcance utilizando un campo receptivo fijo o estando restringidas por gatingsecuencial 11,12,13. De manera similar, el trabajo de referencia fundamental en reconocimiento de acciones y modelado temporal multimodal revela que el rendimiento del modelo basado en LSTM disminuye con el aumento de la longitud de la secuencia o cuando las señales contextuales ocurren a varios fotogramas de distancia, lo que puede limitar la validez ecológica en entornos deportivos dinámicos. Además, los modelos basados en Redes Neuronales de Grafos (GNN) son herramientas poderosas para la modelización de interacción espacial, pero han tenido un rendimiento consistentemente inferior en escenarios que requieren un razonamiento temporal detallado o en casos donde las señales de presión contextuales cambian rápidamente a lo largo deltiempo 14,15. En contraste con estos enfoques, los marcos más recientes basados en transformadores demuestran su superioridad en rendimiento en análisis deportivo, reconocimiento de actividad humana y tareas de lenguaje de vídeo mediante la integración conjunta de señales temporales a largo alcance, relaciones espaciales y señales contextuales en un solo pase hacia adelante, habilitada por la autoatención global. Estos hallazgos de referencia justifican la selección de una arquitectura basada en transformadores como columna vertebral para el modelo propuesto en el estudio actual.

Se ha demostrado que mejorar el conocimiento táctico y comprender los principios tácticos es crucial para resolver las limitaciones y problemas deljuego 16,17. Los jugadores de fútbol americano aprenden una variedad de elementos del juego, incluyendo penetración, protección ofensiva, movimiento, tiempo, limitación, protección defensiva, equilibrio y concentración, a través de un entrenamientotécnico-táctico 18. A medida que los jugadores adquieren más experiencia en fútbol, su comprensión de los fundamentos técnicos y tácticos debería aumentar. Por tanto, los jugadores pueden discernir más fácilmente señales pertinentes, facilitando la toma de decisiones adecuadas para cada regla de juego en un escenario particular19. Por ello, los jugadores pueden utilizar su eficiencia motora y habilidades de toma de decisiones para complementar patrones de movimiento con talentos especializados.

El autor utilizó la toma de decisiones por múltiples atributos para analizar los beneficios del ejercicio y los hábitos para la forma física, ilustrando la eficacia de la capacidad de entrenamiento cualificado en educación física entre los estudiantes universitarios. La actividad física eficaz, el desarrollo de hábitos saludables de fitness y la defensa de reformas en la forma en que se presenta el deporte en las instituciones educativas reciben un peso considerable. La Media Herónica Intuitiva Ponderada en Difusa (IFWHM) con asistencia de números difusos se utiliza para la toma de decisiones efectiva. El resultado apoyó el éxito cognitivo de los estudiantes universitarios y demostró una evaluación más precisa de sus problemas de bienestar físico. Para detectar los enlaces latentes en los datos, el investigador20 utilizó el método Apriori aumentado. Las conclusiones de la investigación son pertinentes para las evaluaciones de la salud física de los estudiantes en la educación superior. El primer resultado se determina evaluando la fatiga de diferentes orientaciones según su frecuencia de ocurrencia.

Investigaciones previas basadas en IA en análisis deportivo se han centrado en tareas de visión por ordenador, incluyendo la detección de jugadores, el seguimiento y el reconocimiento de actividades grupales. Arquitecturas recientes, poco supervisadas y libres de detectores, han puesto de manifiesto la importancia del modelado multimodal y consciente del contexto para comprender comportamientos tácticos. Estos avances requieren la integración del aprendizaje profundo multimodal para clasificar las decisiones tácticas en el fútbol. Utilizando vectores de características latentes producidos a partir de la matriz de utilidad mediante factorización matricial, calcula la similitud coseno entre usuarios y usuarios o entre los elementos y elementos de este artículo.

La investigación reciente en análisis deportivo se ha desplazado hacia marcos de aprendizaje profundo multimodales y conscientes del contexto que combinan vídeo, datos posicionales y señales contextuales para interpretar el comportamiento táctico. Diversos enfoques basados en transformadores han demostrado una gran capacidad para modelar la estructura temporal a largo alcance y relaciones intermodales en entornos deportivos, incluyendo los siguientes: MM-ViT para reconocimiento de acciones multimodales, transformadores de fusión contrastiva unificados para razonamiento en contexto deportivo y detectores de eventos impulsados por atencióncruzada 21,22. Estos enfoques señalan que las decisiones tácticas se representan mejor mediante arquitecturas que capturan las interacciones entre jugadores, espacio, señales de movimiento e información contextual, en lugar de modelos CNN-LSTM monomodales. Dada esta dirección, el estudio propuesto también utilizará un marco de fusión multimodal basado en transformadores para procesar conjuntamente señales visuales, posicionales y contextuales para la modelización casi en tiempo real de decisiones tácticas de fútbol.

Los modelos anteriores para análisis de fútbol americano se basaban típicamente en la arquitectura CNN-LSTM o BiLSTM, que capturan patrones temporales locales pero luchan con dependencias a largo plazo entre modalidades. Los Transformers cubren esta carencia aplicando la autoatención global, permitiendo que un modelo relacione los movimientos de los jugadores, las trayectorias del balón y las señales situacionales a través de capacidades de ventana temporal extendidas para un análisis táctico robusto de decisiones. Para resolver el problema de la escasez en los datos de calificación para sistemas de recomendación, el autor 23,24 sugirió una técnica de Factorización Matricial Basada en Revisiones que combina filtrado colaborativo basado en revisiones e imputación de calificaciones.

No obstante, su eficacia, escalabilidad y aplicabilidad de estos métodos están severamente limitadas por su dependencia de los recuadros delimitados para la inferencia y la enorme necesidad de etiquetado de datos. Un método para resolver este problema es usar etiquetas de caja delimitadora para entrenar simultáneamente la detección de jugadores y el reconocimiento de actividadgrupal 25,26,27,28. Aunque todavía se necesitan anotaciones de caja delimitadora a nivel de actor para los datos de entrenamiento, el método propuesto calcula las cajas delimitadoras de los jugadores durante la inferencia. El enfoque de Reconocimiento de Actividades en Grupo Supervisado Débilmente (WSGAR), que no requiere etiquetas a nivel de actor para la formación o inferencia, busca aliviar la carga de anotaciones. Tras generar sugerencias de cajas delimitadoras usando un detector preentrenado en un conjunto de datos externo, aprendieron a filtrar detecciones irrelevantes. Recientemente, en 29, los investigadores presentaron un enfoque sin detectores para el desafío WSGAR que utiliza incrustaciones de tokens para generar contextos parciales que recopilan información de los jugadores.

Dentro de la analítica deportiva, las arquitecturas multimodales y basadas en transformadores han ganado recientemente importancia porque pueden capturar patrones temporales a largo alcance e integrar flujos de datosheterogéneos 30,31. Se han aplicado variantes de transformadores para predecir los movimientos de los jugadores, realizar análisis tácticos multivista y reconocer la intención de acción, demostrando un razonamiento temporal sobresaliente en comparación con el modelo CNN-LSTM. Las estrategias de fusión multimodales, que combinan vídeo, posición y pistas contextuales, han dado resultados alentadores en la modelización táctica en tiempo real y han destacado la importancia de la atención cruzada y el aprendizaje secuencia a secuencia para comprender la dinámica de decisiones en el juego.

Los marcos multimodales basados en transformadores han demostrado recientemente un rendimiento sobresaliente en diversos sectores donde es necesaria la integración de diversos flujos de datos. Por ejemplo, se han utilizado modelos de fusión multimodal basados en ViT para interpretar conjuntamente información de vídeo, pose y audio empleando procesos de atención cruzada para la predicción de eventos conscientes del contexto, seguimiento del jugador y reconocimientode acciones 32,33. Además, la arquitectura basada en MM-Former y Perceiver ha superado a los modelos recurrentes y convolucionales en fusionar señales espacio-temporales, así como en razonamiento temporal a largo plazo, en análisis deportivo y análisis de actividadhumana 34. Estos resultados apoyan el uso de una arquitectura de fusión multimodal basada en transformadores en este estudio, indicando que los transformadores son capaces de captar interacciones detalladas entre modalidades mediante atenciónglobal 35. Los Transformers son especialmente adecuados para el análisis táctico, ya que su atención global permite al modelo relacionar señales visuales, datos posicionales y señales contextuales a través de ventanas temporales más largas, capacidades que los modelos CNN-LSTM y BiLSTM carecen.

Estudios previos han utilizado principalmente evaluaciones manualmente formadas y autenticadas para evaluar la velocidad del rendimiento y la precisión de la decisión en actividades preestablecidas, como conducir y adelantar al aire, a pesar del creciente interés en evaluar la toma de decisiones tácticas en deportesde equipo 36,37,38. Estos marcos tienen límites en términos de escalabilidad, objetividad y adecuación para circunstancias dinámicas y reales, a pesar de proporcionar datos perspicaces sobre el comportamiento de los jugadores y la excelencia en la tomade decisiones 39. Los enfoques informatizados basados en datos que puedan registrar y comprender la naturaleza multimodal de la toma de decisiones tácticas, que implica complejas asociaciones entre acciones del jugador, señales visuales, señales de audio y configuraciones del juego, no se combinan en los métodosactuales 40,41,42. Además, las estructuras de IA multifacéticas que pueden alternar entre relaciones de fondo y temporales suelen pasar por alto por estos métodos. El crecimiento de un marco de fusión multimodal basado en Transformers que utilice fuentes de datos ricas en tiempo real, como imágenes de vídeo y seguimiento posicional, e incorpore procesos de toma de decisiones en deportes de equipo es claramente insuficiente. Cerrar esta brecha puede mejorar significativamente la penetración táctica, la escalabilidad y la independencia en la toma de decisiones en entornos deportivos de alto rendimiento. A diferencia de las metodologías actuales CNN-LSTM y BiLSTM, esta fusión basada en transformadores modela conscientemente la atención cruzada entre información visual, espacial y contextual. Esta novedad favorece una representación táctica más densa y ayuda a minimizar la clasificación errónea durante escenarios de presión en más de un 40%.

El objetivo principal de este estudio es desarrollar un marco de Fusión Multimodal Basado en Transformadores para evaluar la toma de decisiones tácticas en el fútbol. Aunque el marco propuesto puede generalizarse a otros deportes de equipo, este estudio se centra en el fútbol debido a su complejidad táctica y a la disponibilidad de conjuntos de datos estructurados. El sistema permite una evaluación estructurada de la precisión táctica y el tiempo de respuesta en tareas de fútbol controladas y aisladas, basándose en evaluaciones de expertos. Este trabajo aborda las limitaciones de la evaluación manual y los entornos de pruebas estáticas integrando fuentes de datos multimodales, incluyendo seguimiento posicional, grabaciones de vídeo, señales de audio e información contextual del juego.

Empleando procesos de atención basados en transformadores, el marco propuesto aprende continuamente enlaces multimodales, permitiendo una interpretación unificada y consciente del contexto de los métodos de toma de decisiones en tiempo real de los jugadores.

El objetivo principal de esta determinación es promover una evaluación inteligente del rendimiento en el deporte, proporcionando a entrenadores y analistas una comprensión más profunda del pensamiento de los jugadores y la dinámica de equipo a través de conocimientos basados en datos.

El marco propuesto aprenderá continuamente las relaciones intermodales aprovechando los mecanismos de atención de los transformers, permitiéndole obtener una comprensión unificada de las estrategias de toma de decisiones de los jugadores en partidas en tiempo real.

De este modo, dota al sistema de la capacidad de aportar información accionable sobre comportamientos tácticos que de otro modo sería difícil de caracterizar con métodos estándar de evaluación.

El objetivo es mejorar la interpretabilidad y proporcionar a los coaches y analistas información más útil.

La principal contribución de este trabajo se muestra a continuación:

Este estudio emplea un diseño de fusión multimodal basado en Transformers para presentar un modelo novedoso de aprendizaje profundo para el análisis táctico de toma de decisiones en deportes de equipo.

Al integrar flujos visuales, posicionales y contextuales de datos extraídos de imágenes reales, este enfoque amplía significativamente el alcance de los métodos sencillos de evaluación introducidos en el estudio base, que se centraban en pases en solitario y acciones de penetración.

El codificador multimodal recopila sofisticadas relaciones espaciotemporales integrando datos de seguimiento de jugadores, fotogramas visuales y eventos contextuales de las partidas utilizando mecanismos de atención.

Los experimentos con un conjunto de datos de referencia de fútbol revelaron que este modelo superaba a las referencias tradicionales como los métodos de fusión basados en CNN y el LSTM.

En comparación con CNN-LSTM, BiLSTM-Attention y las líneas base GNN, la arquitectura de fusión multimodal basada en transformadores sugiere muestra avances significativos.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El estudio incluyó a 40 jugadores de fútbol varones de entre 18 y 24 años (media = 20,1 ± 1,2), reclutados de cuatro clubes amateurs y semiprofesionales dentro de una misma liga regional. Todos los participantes tenían al menos tres años de experiencia competitiva y actualmente entrenaban en un entorno estructurado. La recogida de datos se realizó en dos entornos controlados: primero, en ejercicios estandarizados en el campo de entrenamiento que simulaban escenarios tácticos de decisión de pases/conducción; segundo, en sesiones prolongadas de simulación de coincidencias de las que se extrajeron secuencias multimodales. Todos los procedimientos fueron aprobados por el Comité Institucional de Ética de la Universidad del Golfo de Beibu (Número de Aprobación: BG-PE-2023-117), y se obtuvo el consentimiento informado por escrito de todos los participantes antes de la recogida de datos. Se cumplieron los estándares éticos internacionales e institucionales al llevar a cabo esta investigación. El Comité de Ética Institucional de la Universidad del Golfo de Beibu examinó y autorizó todos los procedimientos que involucran a sujetos humanos (Nº de aprobación: BG-PE-2023-117). Antes de la recogida de datos, cada participante proporcionaba un consentimiento informado por escrito y todos los datos recogidos se anonimizaban antes del análisis.

Este trabajo busca automatizar y mejorar la investigación de la toma de decisiones tácticas en deportes de equipo mediante una arquitectura de Fusión Multimodal basada en Transformers. Utiliza una variedad de fuentes de datos, incluyendo vídeo, audio, ubicación espacial y metadatos del reproductor para crear un modelo predictivo robusto en tiempo real. La Figura 1 muestra la arquitectura del método propuesto. La obra propuesta consta de cinco fases. Las etapas se describen a continuación:

Figura 1
Figura 1. Arquitectura del método propuesto. Esquema del modelo que combina entradas multimodales y componentes de clasificación para la toma de decisiones tácticas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Adquisición y preprocesamiento de datos

Los datos de diversas modalidades se recopilan a partir de grabaciones de los partidos, como transmisiones de vídeo, comentarios de audio, información GPS/posicionamiento e indicadores de rendimiento de los jugadores. Cada modalidad pasa por preprocesamiento en forma de técnicas como extracción de fotogramas (para vídeo), filtrado de ruido (para audio) y normalización (para lecturas de sensores), asegurando la sincronización en pasos de tiempo.

Los fotogramas de vídeo se extrajeron a 25 fps, se redujeron a 224 × 224 de resolución. Las señales de audio se procesaban con un filtro pasa-banda, que iba de 300 a 3.400 Hz, para eliminar la mayor parte del ruido ambiental. Los datos de seguimiento posicional de los sensores GPS se registraron a 10 Hz e interpolaron mediante interpolación lineal basada en marcas de tiempo, asegurando que se alineen con la línea temporal del vídeo a 25 Hz. Todas las entradas se alineaban temporalmente usando marcas de tiempo compartidas, y sus escalas se normalizaban con puntuación z.

Extracción de características

Para recopilar la información espaciotemporal de los datos de vídeo, se utilizan CNN 3D. Las CNN 3D gestionan tanto información espacial como temporal a través de fotogramas de vídeo, haciendo que el modelo sea capaz de detectar patrones de movimiento, comprender el comportamiento de los grupos y extraer características basadas en el movimiento. Esta operación genera una representación densa de características por secuencia de acciones, que se utiliza como entrada visual al modelo. Cada clip de entrada de vídeo contenía 16 fotogramas consecutivos muestreados a un paso de 2. Durante el entrenamiento se aplicaron recortes aleatorios, volteos horizontales y normalización de brillo. La CNN 3D se optimizó usando Adam (lr = 0,0001), tamaño de lote 16 y pérdida de entropía cruzada.

Incrustación y alineación de entradas multimodales

Después, las incrustaciones de diferentes modalidades se integran con las salidas de la CNN 3D. Se emplea una arquitectura de modelo de transformador multimodal, con varias ramas de codificadores que manejan cada modalidad. Se emplean capas de atención cruzada para la fusión y alineación de modalidades, permitiendo al modelo capturar interdependencias (por ejemplo, entre la ubicación de los jugadores y el movimiento del balón, y el contexto de los comentarios). Esta fusión permite una comprensión contextual enriquecida de las decisiones tácticas actuales. También implementé todas las incrustaciones en PyTorch. Las características de vídeo se proyectaban linealmente desde 1.024 hasta 512 dimensiones, y las características de audio y posicional se proyectaban a 256 y 128 dimensiones, respectivamente, unificadas a 512 dimensiones antes de la alineación temporal.

Fusión multimodal basada en transformadores

Se emplea un Transformador Multimodal para combinar las características extraídas de todas las fuentes. Los mecanismos de auto-atención en el transformador permiten al modelo aprender interdependencias entre modalidades (por ejemplo, visual + audio), capturar el flujo temporal y el contexto, y destacar marcos y eventos tácticamente importantes. El resultado de este paso es una representación combinada que captura la intención táctica y el contexto situacional de cada decisión tomada. El transformador multimodal constaba de seis capas codificadoras, cada una con ocho cabezas de atención. Las matrices de atención se calcularon utilizando atención escalar escalada. Las capas de atención y de avance también incluían dropout con p = 0,1 para evitar sobreajuste.

Clasificación y evaluación de decisiones tácticas

Por último, la representación fusionada se introduce como entrada a una capa de clasificación o bloque de análisis de decisiones, que se utiliza para predecir el tipo de decisión táctica, evaluar la calidad de la decisión y, opcionalmente, generar información explicable para los entrenadores mediante mapas de calor de atención o mapas de activación. El resultado de esta etapa proporciona una evaluación cuantitativa y cualitativa de las capacidades de toma de decisiones de un equipo o jugador durante el match play.

El cabezal de clasificación utilizaba una MLP de tres capas con activación ReLU seguida de una capa softmax. El modelo se entrenó con una división 70/15/15 con validación cruzada de 10 veces. Las métricas utilizadas fueron precisión, precisión, recuerdo, puntuación F1, latencia y AUC.

Un diagrama de flujo simplificado, que resume las cinco etapas, ofrece una visión visual inmediata del proceso secuencial, como se muestra en la Figura 2. Esta figura representa de forma concisa toda la línea de investigación, que comprende adquisición de datos, preprocesamiento, extracción de características, fusión multimodal y clasificación táctica de decisiones, seguida de descripciones detalladas de cada etapa.

Figura 2
Figura 2. El flujo de trabajo general del proceso de investigación. Visión general de la cadena de investigación, desde la recogida y preprocesamiento de datos hasta la extracción de características, entrenamiento de modelos y evaluación. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La Figura 3 muestra el flujo de trabajo general del proceso de investigación sugerido. El proceso se inicia mediante la Etapa 1: Adquisición y Preprocesamiento de Datos, donde se recopilan y sincronizan fuentes de datos multimodales, como vídeo, audio, seguimiento posicional y metadatos contextuales. Durante la Fase 2: Extracción de Características, se utilizan Redes Neuronales Convolucionales 3D (CNNs 3D) para extraer información espaciotemporal de los flujos de vídeo, resultando en representaciones visuales densas de las acciones del jugador y el flujo táctico. Etapa 3: Incrustación y alineación de entradas multimodales combina características de audio, vídeo y posicionales en un espacio latente compartido, con alineación temporal y alineación cruzada. Estas representaciones se agregan posteriormente en la Etapa 4: Fusión Multimodal basada en transformadores, donde los mecanismos intermodales y de autoatención permiten al modelo aprender interdependencias entre modalidades y obtener conocimientos contextuales más profundos sobre decisiones tácticas. Por último, en la Fase 5: Clasificación y Evaluación de Decisiones Tácticas, las representaciones combinadas se introducen en una capa de clasificación para detectar decisiones tácticas, como pasar, empujar o mantener. Mientras tanto, se emplean métricas de rendimiento para estimar la precisión en la toma de decisiones y el tiempo de respuesta. Este diagrama de flujo ofrece una visión clara del enfoque paso a paso, complementado por las elaboradas descripciones textuales descritas en las siguientes secciones.

Figura 3
Figura 3. Pipeline de procesamiento secuencial. Describe el flujo paso a paso desde la adquisición de datos hasta la clasificación táctica de decisiones y la salida del modelo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Adquisición y preprocesamiento de datos

Para permitir un análisis táctico de toma de decisiones de alto nivel en deportes de equipo mediante una canalización de fusión multimodal usando Transformer, se formó una configuración estructurada y de alta fidelidad para adquisición y preprocesamiento de datos. La configuración implica fusionar múltiples modalidades de datos, incluyendo grabaciones de vídeo, seguimiento posicional de los jugadores, señales de audio de interacciones jugador-entrenador y metadatos contextuales como la fase del partido, la estructura del equipo y las áreas de posesión.

La muestra del estudio consistió en 40 hombres de 20 años o más, todos ellos activamente involucrados en ligas regionales de fútbol amateur y semiprofesional. Cada uno de ellos fue reclutado de cuatro clubes competitivos que tenían un programa de entrenamiento estructurado. La edad media de los atletas era de 20,1 ± 1,2 años, con una altura media de 177,5 ± 3,1 cm y un peso medio de 72,6 ± 2,9 kg. Habían estado jugando en sus respectivos clubes durante una media de 6,8 ± 1,5 años. Todos los participantes también tenían un mínimo de tres años de experiencia competitiva y se consideró que eran tácticamente competentes.

Para asegurar el poder estadístico, el tamaño de la muestra se estimó utilizando un nivel de fiabilidad del 95% (Z = 1,96) y un nivel de significación del 5%, con un coeficiente de correlación intraclase (ICC) esperado de 0,96 y un intervalo de confianza del 95% para reflejar la concordancia casi perfecta. Esto es coherente con el objetivo de validar la fiabilidad y consistencia de los datos de toma de decisiones multimodalesrecogidos 27.

Para garantizar la reproducibilidad, los ajustes de adquisición y las especificaciones técnicas se estandarizaron entre las sesiones. Los datos de vídeo se grababan a resolución de 1.080p y 25 fotogramas por segundo usando cámaras GoPro Hero4 con un ajuste de campo de visión amplio para capturar todo el espacio táctico. Cada grabación fue estabilizada y montada a una altura fija de 2,5 m. Las señales de audio se capturaban usando un micrófono de campo externo a una frecuencia de muestreo de 44,1 kHz (mono) y posteriormente se filtraban con un filtro pasa-banda de 300-3.400 Hz para eliminar el ruido ambiental. Los datos de seguimiento posicional se recogieron utilizando sensores GPS portátiles que operan a 10 Hz, con una precisión posicional media reportada por el fabricante de ±0,5 m. Todas las modalidades se sincronizaron usando marcas de tiempo compartidas y se remuestrearon a una línea temporal común de 25 Hz mediante interpolación lineal.

El preprocesamiento incluyó entonces lo siguiente: reducción de muestreo de vídeo a resolución 224 × 224, muestreo de fotogramas de 16 fotogramas consecutivos con un paso de 2, recorte aleatorio, giro horizontal, normalización de brillo, normalización de audio y filtrado de ruido, y normalización de puntuación z de variables posicionales y contextuales.

El script de preprocesamiento está organizado en el siguiente orden para la reproducibilidad: (i) extracción de fotogramas; (ii) filtrado de audio; (iii) interpolación GPS; (iv) remuestreo de modalidad a 25 Hz; (v) normalización de puntuación z; y (vi) pruebas de integridad para detectar corrupción, oclusión y abandono escolar. Se utilizan scripts de procesamiento por lotes para completar automáticamente cada etapa.

Para mantener la fiabilidad de los datos, los criterios de control de calidad y exclusión incluían: i) secuencias con oclusión >20% del reproductor, ii) caída del GPS superior a 200 ms, iii) audio corrupto o recortado, e iv) desenfoque de movimiento severo o desincronización entre modalidades. Un total de 17 secuencias (3,4%) fueron excluidas para estas condiciones. La Tabla 1 muestra la descripción del conjunto de datos.

AtributosDetalles
DeporteFútbol (fútbol)
Participantes40 jugadores masculinos de fútbol americano
Nivel de juegoJugadores de fútbol americano federados con ≥5 años de experiencia
Tipo de pruebaPrueba de toma de decisiones y ejecución de pase y penetración (control del balón)
Configuración de la pruebaConfiguración estandarizada de los campos de fútbol, zonas marcadas, posiciones fijas
Herramientas de mediciónCámaras GoPro Hero4, software Kinova, cronómetro
Datos recopiladosTiempo de ejecución (ET), precisión en la toma de decisiones (DM), número de acciones correctas
Procedimiento de pruebaLos jugadores respondían a estímulos visuales de los entrenadores y ejecutaban pases o penetraciones
Repeticiones de juicio10 pruebas por jugador (5 pases, 5 penetraciones)
EvaluaciónExpertos: DM; ET medido usando marcas de tiempo/vídeo
Variables de resultadoTiempo de reacción, recuento correcto de decisiones, puntuación técnica de ejecución

Tabla 1: Descripción del conjunto de datos. Detalla la demografía de los participantes, los procedimientos de prueba, las herramientas de medición y las variables de resultado.

En el presente estudio, se utilizaron dos conjuntos de datos relacionados pero distintos. El primer conjunto de datos estaba compuesto por 40 jugadores que participaron en tareas controladas de toma de decisiones de pasar/penetrar, utilizadas principalmente para establecer la fiabilidad de referencia y validar el procedimiento básico de medición de decisiones. El segundo conjunto de datos incluye 500 secuencias tácticas multimodales recogidas de simulaciones extendidas de partidos y grabaciones de partidas reales. Estas secuencias constituyeron el principal conjunto de datos de entrenamiento y pruebas para el modelo de fusión basado en transformadores, permitiendo su evaluación en condiciones ecológicamente más válidas.

Aunque el conjunto de datos comprende 500 secuencias multimodales, el muestreo estratificado aseguró una representación equilibrada entre acciones tácticas (Pasar, Conducir, Mantener). También se utilizaron enfoques de aumento de datos, como el recorte temporal y la barajarra de secuencias, para aumentar la variabilidad y mitigar el sesgo del modelo durante el entrenamiento.

Cabe destacar que el conjunto de datos controlado por 40 jugadores se utilizó en la validación inicial del modelo y en la prueba de fiabilidad, mientras que la colección más amplia de 500 secuencias multimodales se recopiló a partir de grabaciones prolongadas de partidos y sesiones de entrenamiento organizadas para evaluar la escalabilidad y validez ecológica del marco. La fiabilidad de referencia se estableció utilizando el conjunto de datos más pequeño, mientras que el conjunto de datos más grande facilitó el entrenamiento y pruebas de modelos a gran escala.

Descripción del conjunto de datos

El experimento reclutó a 40 jugadores masculinos de fútbol, cada uno con al menos cinco años de experiencia en la federación, para asegurar que la población de la muestra tuviera competencias técnicas y tácticas básicas. La recopilación de datos se realizó en una disposición estandarizada de los campos de fútbol donde se asignaron zonas y posiciones de juego predeterminadas para garantizar condiciones idénticas de prueba. Durante la experimentación, los participantes tenían que responder a señales visuales de un entrenador, ya fuera para pasar o penetrar el balón, replicando decisiones tácticas tomadas en un partido real. Cada participante completó un total de 10 pruebas, cinco de paso y cinco de coche. Estos movimientos se capturaron con cámaras GoPro Hero4, y los datos de rendimiento se midieron utilizando el software de análisis de vídeo Kinovea junto con el tiempo de cronómetro manual para capturar el tiempo de ejecución (ET). La principal fuente de datos recopilada fue: el tiempo de ejecución, la calidad del DM evaluada por coaches experimentados y la cantidad de acciones correctas ejecutadas. Estos factores proporcionaron una base cuantitativa para analizar la rapidez y eficacia con que los jugadores tomaron y ejecutaron decisiones tácticas bajo condiciones controladas de estímulo-respuesta. El conjunto de datos producido es un recurso estructurado y etiquetado, bien adaptado para crear referencias o entrenar sistemas inteligentes con el objetivo de modelar el pensamiento táctico y las respuestas motoras en contextos de deportes de equipo.

La muestra está restringida a jóvenes jugadores masculinos de una liga regional, lo que puede limitar su generalizabilidad entre grupos de edad, deportistas femeninas u otras culturas. Estudios futuros intentarán extraer muestras más representativas y diversas.

Otra limitación es el tamaño de la muestra de 40 jóvenes jugadores masculinos de una única liga regional. Aunque la muestra homogénea contribuyó a la validez interna y a la reducción de la variación en el rendimiento debido a diferencias de edad, género y antecedentes tácticos, también limita la generalizabilidad de los hallazgos a una población más amplia. Los patrones tácticos que aprende el modelo pueden reflejar estilos de juego específicos de una región o de género en lugar de un comportamiento de toma de decisiones universal. Para este estudio, se emplearon muestreos estratificados y aumento de datos para mejorar la variabilidad del conjunto de datos en cuestión; Sin embargo, se necesitan estudios de investigación a mayor escala que involucren a atletas femeninas, jugadoras jóvenes, jugadoras profesionales y participantes de múltiples culturas tácticas para confirmar la solidez del modelo en diversos entornos futbolísticos. Estos resultados demuestran un gran potencial, pero necesitan una validación adicional en conjuntos de datos más diversos y amplios antes de poder afirmar una generalización más amplia.

Para reducir la subjetividad, tres entrenadores profesionales de fútbol americano anotaron de forma independiente las decisiones tácticas. La fiabilidad entre evaluadores se estimó utilizando el coeficiente de correlación intraclase (ICC = 0,96, IC 0,94-0,98), indicando una concordancia casi perfecta. La discusión consensuada resolvió el desacuerdo. Para datos multimodales, el preprocesamiento implicó sincronización temporal entre modalidades (vídeo a 25 fps y datos de sensores a 10 Hz) y normalización z-score de características para permitir la comparabilidad entre modalidades.

La fiabilidad entre evaluadores se cuantificó utilizando un coeficiente de correlación intraclase de efectos aleatorios bidireccionales (ICC [2,3]), ya que es adecuado para evaluar la concordancia absoluta entre múltiples evaluadores. El ICC de 0,96 (IC 95%: 0,94-0,98) indica un acuerdo casi perfecto según los umbrales comúnmente usados y además establece que las etiquetas de decisión táctica utilizadas para el entrenamiento eran altamente fiables. Se calculó la fiabilidad en las 500 secuencias multimodales, asegurando que tanto los contextos controlados como los de simulación de partidos fueran debidamente y de forma consistente anotados.

Procedimiento de anotación y protocolo de etiquetado

Todas las secuencias multimodales se anotaban usando un protocolo estructurado de tres etapas. Primero, tres entrenadores de fútbol con licencia revisaron de forma independiente cada secuencia posicional de vídeo utilizando una interfaz de anotación sincronizada con marca de tiempo (Kinovea + hoja de cálculo personalizada de etiquetado). Los anotadores etiquetaban la categoría de decisión táctica (Pasar, Empujar, Mantener), las señales contextuales (zona de presión, disponibilidad de carril de pases) y las marcas de tiempo del evento. En segundo lugar, un script de detección de desacuerdos identificaba automáticamente los casos de ambigüedad o conflicto, que luego se revisaban en una reunión conjunta de consenso. En tercer lugar, para garantizar la consistencia en la marcación de límites de eventos y la alineación temporal entre modalidades, un analista senior independiente realizó una revisión final. Este proceso, para fines posteriores de entrenamiento en modelos, aseguraba que cada anotación fuera rastreable y de la mejor calidad.

Preprocesamiento

Mientras que el presente estudio se llevó a cabo con 500 secuencias multimodales, la cadena de preprocesamiento estaba, por diseño, diseñada para conjuntos de datos a gran escala. Todas las modalidades pasaron por scripts automatizados que, en paralelo, extraían fotogramas de vídeo por lotes, remuestreaban audio, interpolaban datos posicionales y aplicaban la normalización de puntuación z. La presencia de arquitectura modular permite que cada modalidad se preprocese de forma independiente en hilos separados de GPU/CPU. Esto permite la ingesta de gran volumen de imágenes del partido. Esto garantiza que el flujo de trabajo pueda escalarse fácilmente a conjuntos de datos de temporada completa sin intervención manual y hace que el marco sea adecuado para su despliegue en entornos profesionales de analítica.

Para examinar adecuadamente la toma de decisiones tácticas en deportes de equipo, es necesario preprocesar y alinear datos en bruto de diferentes modalidades —por ejemplo, clips de vídeo, señales de audio y grabaciones posicionales. La ilustración de entrada multimodal es

Ecuación 1(1)

Aquí, V se denota como una serie de características de vídeo extraídas del codificador CNN.

Ecuación 2(2)

Aquí, A es una característica de audio codificada por wave2vec.

Ecuación 3(3)

P representa la posición de coordenadas de un jugador en el tiempo ti.

Para tratar las tasas de muestreo asíncronas, cada modalidad se remuestrea o interpola a una línea temporal compartida:

Ecuación 4(4)

Aquí Ecuación 5, es una característica sincronizada ft , es la tasa del sistema combinado, Xm es una indicación inicial.

Para una escala uniforme entre modalidades, todos los vectores de características están normalizados por puntuación z:

Ecuación 8(5)

μX y σX denotan la media y la desviación estándar de la dimensión de características en el conjunto de entrenamiento.

Aunque las principales preocupaciones son las decisiones de pase y penetración, se añadieron canales de audio (por ejemplo, comunicación jugador/entrenador, pistas ambientales del juego) para tener en cuenta situaciones reales de partido donde las señales de voz afectan la reacción táctica. Los hiperparámetros (por ejemplo, tasa de aprendizaje, épocas) se eligieron mediante búsqueda en cuadrícula y evaluaciones existentes en el aprendizaje multimodal, logrando un equilibrio entre la estabilidad de convergencia y la eficiencia computacional.

Los hiperparámetros del marco sugerido —tasa de aprendizaje, tamaño del lote y épocas de entrenamiento— fueron elegidos mediante una búsqueda sistemática en cuadrícula bien planificada para lograr tanto estabilidad de convergencia como eficiencia computacional. La elección de una tasa de aprendizaje de 0,0001 con el optimizador Adam resultó proporcionar actualizaciones estables del gradiente sin oscilaciones, mientras que los tamaños de lote se optimizaron para equilibrar la capacidad de memoria de la GPU con el rendimiento de entrenamiento. La configuración de 50-100 épocas se utilizó para permitir un aprendizaje adecuado sin sobreajuste, como lo confirman el seguimiento de pérdidas de validación y la validación cruzada de 10 veces. Estos valores no se establecieron arbitrariamente, sino que se guiaron por pruebas previas en aprendizaje multimodal y ajustados mediante ensayos experimentales sobre el conjunto de datos actual. Este proceso riguroso garantizaba que los hiperparámetros seleccionados facilitaran el entrenamiento estable del modelo y mejoras reproducibles en el rendimiento respecto a los enfoques base.

Aunque la tarea de clasificación se centra en decisiones de pase/penetración/retención, la información de audio se incluyó intencionadamente, ya que el comportamiento táctico real en el fútbol americano está fuertemente influenciado por la comunicación jugador-entrenador, las señales de llamada de compañero, las señales de presión y los sonidos ambientales (por ejemplo, contacto con el balón, enfoque del rival). Estas señales suelen preceder o coocurrir con la toma de decisiones y forman parte del entorno perceptivo natural de los jugadores de fútbol. Experimentos preliminares de ablación mostraron que excluir audio redujo la recuperación en un 3,8%, lo que indicó que incluso señales acústicas sutiles contribuyen a la conciencia contextual. Por esta razón, el audio se mantuvo para preservar la validez ecológica y mejorar la capacidad del modelo para generalizar a condiciones reales de coincidencia.

De hecho, para apoyar aún más estos hiperparámetros, se realizó un análisis de sensibilidad interno variando sistemáticamente la tasa de aprendizaje de 1e-5 a 5e-4, el tamaño del lote de 8 a 32, el número de capas transformadoras de 4 a 8 y el número de cabezas de atención de 4 a 12. La configuración elegida, con una tasa de aprendizaje de 1e-4, un tamaño de lote de 16 y un codificador de 6 capas con 8 cabezas de atención, proporcionaba una convergencia estable de forma continua con la menor pérdida de validación, minimizando el sobreajuste a través de la validación cruzada de 10 veces. Los lotes más grandes provocaban inestabilidad en el gradiente, mientras que los lotes más pequeños aumentaban el ruido y retrasaban la convergencia. De manera similar, los modelos de transformadores con más de 8 cabezas no mostraron ningún aumento en el rendimiento, pero sí incrementaron considerablemente el tiempo de cálculo. Los resultados obtenidos justifican la configuración final de los hiperparámetros utilizados en este estudio.

Extracción de características usando redes neuronales convolucionales 3D

En el marco propuesto de Fusión Multimodal Basada en Transformers para la toma de decisiones tácticas en deportes de equipo, la Red Neuronal Convolucional 3D (CNN 3D) es responsable de extraer características espacio-temporales de los clips de vídeo en bruto.

A diferencia de las CNN 2D, que solo consideran dimensiones espaciales (ancho W y altura H), las CNN 3D también tienen en cuenta la dimensión temporal R, permitiéndoles detectar dinámicas de movimiento y patrones secuenciales cruciales para entender los comportamientos del equipo, como penetrar y pasar en el fútbol.

El 3D-CNN28 se propone primero para combinar la información espacial y temporal de los datos de vídeo. Un núcleo 3D se utiliza en un algoritmo de convolución 3D a un cubo formado por fotogramas con parte de las columnas apiladas. La convolución 3D puede escribirse en Ecuación (6)

Ecuación 11(6)

Donde: Ecuación 12 es la característica de salida en la ubicación (x, y, z) del j-ésimo mapa de características de la capa l.Ecuación 14 es el peso del núcleo en la ubicación (h,w,r) del mapa de características de entrada m. Ecuación 16 es la entrada en desplazamiento espacio-temporal respecto a la capa anterior. blj es el sesgo. f(.) es la función de activación (normalmente ReLU). M es el número de mapas de características de entrada de la capa anterior. Esta ecuación permite que la CNN 3D combine en paralelo la información espacial (altura y ancho) y temporal (secuencia de fotogramas).

Figura 4
Figura 4. Arquitectura de procesamiento CNN 3D. Ilustra cómo se extraen las características espaciotemporales de secuencias de vídeo mediante operaciones convolucionales 3D. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La Figura 4 muestra el proceso de funcionamiento de una CNN 3D. La cadena comienza con la fase de entrada, donde los flujos de vídeo sin procesar de un partido de fútbol americano se fusionan con datos organizados, incluyendo ubicaciones de jugadores, estadísticas del partido y metadatos contextuales. Esta información multimodal preserva tanto la dinámica visual como el contexto situacional, que son fundamentales para el análisis de tácticas en equipo. Después, el flujo de vídeo se enruta a través de una Red Neuronal Convolucional 3D (CNN 3D). En este caso, se utiliza una serie de capas convolucionales 3D sobre los fotogramas de entrada. Las capas se agrupan a lo largo de las dimensiones espaciales (altura y ancho) y la dimensión temporal (fotogramas), permitiendo a la red aprender patrones de movimiento, interacciones entre jugadores y tácticas basadas en secuencias, como pases o penetraciones. Posteriormente, se forma un cubo de características que presenta características espaciotemporales densas. Este cubo está sometido a operaciones de agrupación para reducir la dimensión y preservar características significativas. Al agrupar, el volumen de características se aplana en un vector 1D, proporcionando una representación concisa de la situación táctica. Este vector de características se introduce posteriormente en una Red Neuronal Profunda (DNN) totalmente conectada. La DNN es el bloque de toma de decisiones, que procesa las características fusionadas y extraídas para tomar decisiones tácticas, como pasar, disparar o mantener. La salida de la red es la decisión táctica final tomada por el sistema basada en la situación real del juego en tiempo real, así como en patrones de estrategia aprendidos.

Incrustación y alineación de entradas multimodales

Tras la extracción de características, las tres características, como audio, vídeo y posición estadística del reproductor, se proporcionan como modalidad de entrada.

Para introducirlas en un transformador y luego alimentar cada una a través de una función de incrustación aprendible:

Ecuación 19(7)

donde f3DCNN aprende características espaciotemporales de cada segmento temporal Vt y lo mapea a un espacio latente de dimensión d.

Ecuación 22(8)

donde WP y bP son pesos aprendibles.

Ecuación 25(9)

Todas las incrustaciones están alineadas por la dimensión temporal T. Si las modalidades tienen frecuencias dispares, se utiliza interpolación o muestreo descendente:

Ecuación 26(10)

Ahora, todas las modalidades se sincronizan como:

Ecuación 27(11)

Para preservar el orden temporal en el transformador, también introduce codificaciones posicionales en cada vector:

Ecuación 28(12)

Donde Ecuación 29 representa la codificación posicional senoidal o aprendible por defecto.

Cada modalidad se codifica operativamente usando una capa lineal PyTorch, se concatena en un vector 512-d y luego se introduce en la secuencia de entrada del transformador tras la codificación posicional. Esto garantiza que se prepare una incrustación unificada para la atención cruzada en cada paso temporal.

El tensor final es

Ecuación 30(13)

se introduce en el Transformer Encoder, donde los mecanismos de autoatención y atención cruzada permiten al modelo razonar conjuntamente a través de todas las modalidades para la toma de decisiones tácticas.

Fusión multimodal basada en transformadores

En el enfoque propuesto, se emplea el método de factorización matricial de bajo rango para integrar los vectores de datos multimodales adquiridos. El problema de alta dimensión que ocurre cuando los tensores se fusionan directamente se aborda con este método, que utiliza un factor de descomposición de bajo rango para la fusióntensorial 29. Cada modalidad se expresa inicialmente como un vector, y la reducción de dimensionalidad que preserva interacciones significativas se logra mediante descomposición de rango bajo. El tensor de fusión ZM entre M modalidades se construye como:

Ecuación 32(14)

Aquí: Ecuación 33 es el factor de rango bajo de la m-ésima modalidad, Ecuación 60 es el producto exterior, y r es el rango de descomposición.

El vector de fusión h se calcula entonces como:

Ecuación 34(15)

Cuando se utilizan dos modalidades por separado, la fusión reducida es:

Ecuación 35(16)

Esto produce un vector de representación multimodal conjunta h que modela interacciones intermodales a nivel latente.

Tras la adquisición del vector fundido de bajo rango h, el módulo Transformer modela dependencias y alinea representaciones semánticas entre modalidades. Una atención cruzada está especialmente diseñada para permitir que una modalidad preste atención a otra:

Ecuación 36(17)

Donde Qm es la consulta de modalidad m, Kn, Vn son los vectores clave y valor en la modalidad n, dk es la dimensión de los vectores clave. Esta configuración facilita flujos de atención específicos de cada modalidad, permitiendo procesar cada categoría de entrada en relación con otras (por ejemplo, sincronizando el movimiento del jugador con el contexto del juego y los indicadores de vídeo).

Los vectores con asistencia cruzada se apilan y clasifican mediante un perceptrón multicapa (MLP). La salida es una etiqueta de decisión táctica (por ejemplo, pasar, empujar, mantener), pérdida de entropía cruzada optimizada para entrenamiento de extremo a extremo.

Figura 5
Figura 5. Arquitectura de fusión multimodal basada en transformadores. Muestra cómo las modalidades visuales y de sensores se integran mediante un codificador transformador para mejorar la representación de características. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

El bloque de fusión multimodal, como se muestra en la Figura 5, combina entradas visuales y posicionales. Es un diseño necesario ya que las decisiones tácticas requieren conciencia espacial y dinámica de movimiento, que no pueden representarse con una sola modalidad.

La Figura 5 muestra la estructura de trabajo de la fusión multimodal basada en transformadores. Este diseño combina datos diversos, vídeo, coordenadas espaciales y datos contextuales del juego en un único canal para predecir acciones tácticas como adelantar, conducir o mantener. El enfoque comienza introduciendo vídeos, que se revisan utilizando una Red Neuronal Convolucional 3D (CNN 3D). Este sistema identifica tanto las estructuras espaciales como temporales en el vídeo, permitiéndole capturar la actividad dinámica y la comunicación de los jugadores a lo largo del tiempo. Mientras tanto, la información contextual y posicional se transmite mediante capas incrustadas, transformando entradas estructuradas en representaciones vectoriales densas. Los flujos contextuales, posicionales y de vídeo pueden entonces tener sus salidas fusionadas mediante un módulo de fusión de bajo rango. El enfoque obtiene eficazmente correlaciones intermodales mediante la descomposición en espacios de fusión, minimizando la complejidad computacional mientras preserva las relaciones esenciales entre modalidades. Finalmente, la representación multimodal fusionada es procesada por un codificador transformador con atención cruz-modal. Este procedimiento permite al modelo centrarse en las características adecuadas a través de modalidades y pasos de tiempo, mejorando su comprensión del comportamiento estratégico en juegos. Finalmente, la salida codificada se pasa por una concatenación y un bloque Multi-Layer Perceptron (MLP) que mapea la representación aprendida a algunas decisiones tácticas. La salida del modelo clasifica acciones de los jugadores como "pasar", "empujar" o "mantener" para permitir un examen inteligente y basado en datos de las tácticas del equipo.

En el sistema de análisis táctico de fusión multimodal basado en transformadores sugerido para deportes de equipo, la última fase es la clasificación y evaluación táctica de decisiones, que convierte representaciones multimodales aprendidas en etiquetas accionables para la decisión. Tras fusionar características de vídeo, posicionales y contextuales mediante fusión de bajo rango y ajustarlas finamente usando atención cruzada en el codificador Transformer, los vectores de características resultantes se introducen en un clasificador Multi-Layer Perceptrón (MLP). Cada clase de decisión se representa con una función de activación softmax, que da puntuaciones de probabilidad para todas las acciones posibles. La clase más probable se elige como la decisión predicha del modelo. El modelo se entrena con una función de pérdida cruzada de entropía, que recompensa las predicciones correctas y hace que la red aprenda a diferenciar entre diferencias similares en situaciones tácticas. Además, se podría considerar la evaluación en el dominio del tiempo para confirmar la capacidad de respuesta en situaciones de juego en tiempo real o casi en tiempo real, asegurando que el clasificador sea preciso y tampoco una pérdida de tiempo bajo restricciones de tiempo similares a las de los juegos. La Tabla 2 muestra la arquitectura del modelo y los hiperparámetros.

ComponenteEspecificaciones
Capas de codificador de transformadores6
Atención Cabezas8
Dimensión oculta512
Tamaño de la capa de avance2048
Dimensiones de incrustaciónVídeo: 1024 → 512, Audio: 256 → 512, Posicional: 128 → 512
Codificación posicionalAprendible
Método de fusiónFusión Multimodal de bajo rango (rango r = 16)
OptimizadorAdán
Ritmo de aprendizaje0.0001
Tamaño del lote16
Épocas de entrenamiento50–100
Abandono0.1
Función de pérdidaEntropía cruzada

Tabla 2: Arquitectura del modelo e hiperparámetros. Enumera los ajustes de entrenamiento y los componentes clave del modelo propuesto de fusión multimodal basado en transformadores.

Para mayor claridad y reproducibilidad, el transformador multimodal se implementó con una pila de codificadores de 6 capas, cada una equipada con 8 cabezas de atención y una dimensión oculta de 512, siguiendo los ajustes típicos de transformadores para tareas multimodales de escala media. Cada modalidad pasa por un bloque de incrustación: vídeo mediante una salida codificadora 3D-CNN, 1024-dim; audio por un codificador basado en Wave2Vec, 256-dim; y características posicionales más contextuales mediante un codificador MLP de 2 capas, 128-dim. Todas estas incrustaciones se proyectaban en un espacio latente 512-d compartido mediante transformaciones lineales aprendibles. Para establecer la alineación temporal, primero se interpolan todas las modalidades a una única frecuencia de 25 Hz, seguidas de la aplicación de codificaciones posicionales aprendidas para preservar el orden temporal. El alineamiento cruzado se realiza utilizando las capas de atención cruzada, que aprenden explícitamente correlaciones entre modalidades antes de ser introducidas en la pila de codificadores de auto-atención. Estas decisiones arquitectónicas se tomaron para equilibrar la capacidad del modelo con la eficiencia computacional, asegurando así una convergencia estable en un conjunto de datos de tamaño moderado.

En términos prácticos, el marco propuesto de Fusión Multimodal Basada en Transformadores es más adecuado para escenarios donde hay datos multimodales sincronizados disponibles, como sesiones de entrenamiento estructuradas, simulaciones controladas de partidos o entornos profesionales equipados con transmisiones de vídeo consistentes y sistemas de seguimiento posicional. Las cuatro entradas principales necesarias para el método son (i) vídeo de alta resolución, (ii) datos de seguimiento posicional (GPS/LPS), (iii) flujos de audio y (iv) metadatos contextuales, por ejemplo, posesión, zonas de presión, fase de coincidencia. Para lograr un rendimiento fiable, estas modalidades deben estar alineadas en el tiempo con un mínimo de deriva (vídeo ≥ 25 fps y sensores posicionales ≥ 10 Hz), y deben mantener puntos de vista estables y un ruido de señal mínimo. Aquellos ajustes que no ofrecen estas entradas sincronizadas, por ejemplo, partidos amateurs con ángulos de cámara irregulares, emisiones en directo con artefactos de latencia/compresión, o un entorno que careza de infraestructura de seguimiento posicional, serán menos relevantes para el marco. Además, el sistema actual funciona mejor en condiciones semicontroladas, pero puede ser sustancialmente menos robusto en situaciones de partidos en vivo completamente incontrolados, donde las condiciones de iluminación, la oclusión y el ruido dinámico de la multitud afectan a la calidad de la adquisición de datos. Estas restricciones delinean los límites prácticos dentro de los cuales este sistema puede desplegarse y enfatizan que la captura consistente de datos en múltiples modos es esencial para aplicar el modelo propuesto.

Modificaciones y resolución de problemas

En la implementación práctica, pueden surgir varios problemas a lo largo de la cadena multimodal que pueden reducir la estabilidad del modelo o el rendimiento general. Un problema común es la desalineación temporal entre modalidades, donde el vídeo grabado a 25 fps y los datos posicionales capturados a 10 Hz se desincronizan, lo que provoca señales desajustadas que desestabilizan los mapas de atención y reducen la memoria. Esto puede resolverse aplicando remuestreo basado en marcas de tiempo, interpolación lineal y eliminando automáticamente secuencias con exceso de deriva. Los canales de audio también pueden sufrir ruido causado por el viento, los sonidos de la multitud o el recorte del micrófono, lo que hace que el transformador ignore los tokens de audio y reduzca ligeramente la precisión. Aplicar filtrado pasa banda, gating espectral y sustituir segmentos gravemente corrompidos por vectores cero ayuda a mantener la estabilidad de la incrustación de audio. Problemas de calidad visual, como oclusiones en el reproductor o desenfoque de movimiento, pueden debilitar las representaciones espaciotemporales de la 3D-CNN y aumentar la confusión entre el drive de pase. Esto se mitiga excluyendo secuencias muy ocluidas y empleando estrategias de aumento, incluyendo recorte aleatorio, normalización de brillo y simulación de desenfoque de movimiento. La inestabilidad del transformador puede producirse si las escalas de incrustación difieren entre modalidades, produciendo pérdida de validación oscilante o picos de gradiente. Asegurar una normalización consistente de la puntuación z, usar un programa de ritmo de aprendizaje de calentamiento, aplicar recorte de gradiente y aumentar el abandono puede restaurar un entrenamiento estable. La fusión de rango bajo también puede volverse problemática cuando el rango de fusión está mal establecido, causando relaciones intermodales distorsionadas y desequilibrios entre clases. Mantener un rango moderado para conjuntos de datos pequeños, aumentar el rango para conjuntos de datos más grandes y aplicar regularización L2 ayuda a preservar la fusión equilibrada. Los cuellos de botella computacionales pueden surgir debido a tensores de vídeo grandes que provocan desbordamiento de memoria de la GPU o un entrenamiento lento. Estos problemas pueden abordarse mediante entrenamiento de precisión mixta (FP16), reduciendo la resolución de entrada durante experimentos iniciales, o almacenando en caché características 3D-CNN precomputadas. Finalmente, el desequilibrio natural de clases en las decisiones tácticas, especialmente para el "Drive", puede reducir la llamada y causar fluctuaciones en el AUC; Aplicar la pérdida equilibrada por clases, sobremuestrear acciones de minorías y enriquecer metadatos contextuales pueden mejorar sustancialmente el equilibrio y la discriminación por decisiones. Esta guía consolidada de resolución de problemas garantiza que investigadores y profesionales puedan mantener condiciones de entrenamiento estables, mejorar la reproducibilidad y adaptar el marco de forma eficaz a través de diversos conjuntos de datos y entornos.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este diseño combina datos diversos, vídeo, coordenadas espaciales y datos contextuales del juego en un único canal para predecir acciones tácticas como adelantar, conducir o mantener. El enfoque comienza introduciendo vídeos, que se revisan utilizando una Red Neuronal Convolucional Tridimensional (CNN 3D). Los flujos contextuales, posicionales y de vídeo pueden entonces tener sus salidas fusionadas mediante un módulo de fusión de bajo rango. El enfoque obtiene eficazmente correlaciones intermodales mediante la descomposi...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El marco de Fusión Multimodal Basada en Transformadores presentado aquí representa un avance importante respecto al Test de Fútbol de Prueba de Fútbol Operativo (STFT) de referencia descrito en el artículo base. A diferencia del artículo base, que se centraba en pruebas controladas orientadas al laboratorio con estímulos limitados y estáticos como flechas de colores y tareas predefinidas (conducir o adelantarse), el nuevo modelo funciona a partir de datos multimodales reales y de juego p...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés que declarar.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen el apoyo de la Escuela de Educación Física de la Universidad del Golfo de Beibu y de la Escuela de Estadística de la Universidad de Finanzas y Economía del Suroeste, por proporcionar recursos y apoyo institucional durante esta investigación. Este trabajo también fue apoyado por el Proyecto 2023 del Fondo Nacional de Ciencias Sociales: Investigación sobre la Utilización Efectiva de los Recursos Culturales Deportivos Rojos en el Área de la Antigua Base Revolucionaria Zuo Jiang–You Jiang (Subvención Nº 23CTY016).

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
3D CNNImplementación personalizadaExtracción de características espaciotemporales del vídeo
GoPro Hero4GoPro Inc.https://gopro.com/Grabación en vídeo de los partidos
Sensores GPS/IMUCatapult Sports / Xsenshttps://www.catapultsports.com/Seguimiento posicional del jugador
Intel Core i7-11700K CPUIntelhttps://www.intel.comCPU de estación de trabajo de entrenamiento de modelos
Librosalibrosa.orghttps://pypi.org/project/librosa/Procesamiento de señales de audio y remuestreo
Clasificador MLPPyTorch / TensorFlowClasificación táctica de decisiones
NumPyFundación de Software Pythonhttps://pypi.org/project/numpy/Cálculo numérico y operaciones matriciales
NVIDIA RTX 3080 GPUNVIDIAhttps://www.nvidia.comFormación en aprendizaje profundo e inferencia
OpenCVOpenCV.orghttps://pypi.org/project/opencv-python/Extracción de fotogramas de vídeo
PandasFundación de Software Pythonhttps://pypi.org/project/pandas/Manipulación de datos y manejo tabular
PCA (Scikit-learn)Scikit-learnhttps://scikit-learn.org/Reducción de dimensionalidad
Python 3.9Fundación de Software Pythonhttps://www.python.org/downloads/release/python-390/Entorno de lenguaje de programación
PyTorchFundación PyTorchhttps://pytorch.org/Marco de aprendizaje profundo
scikit-learnDesarrolladores de scikit-learnhttps://pypi.org/project/scikit-learn/Validación cruzada, cálculo ICC
TensorFlow 2.8Googlehttps://www.tensorflow.org/Marco de aprendizaje profundo
Codificador de transformadorPyTorch / TensorFlowIntegración de funciones multimodales con atención
Ubuntu 20.04 LTSCanonical Ltd.https://ubuntu.com/Sistema operativo para el entrenamiento de modelos
Estación de trabajoPersonalizado / Intel, NVIDIACPU, GPU, RAM para entrenamiento de modelos

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Calle-Jaramillo, G. A., Franco, R., González, S. R., Forero, L. M., González, H. Design and validation of a test to evaluate the execution time and decision-making in technical–tactical football actions (passing and driving). Behav Sci. 13 (1), 101(2023).
  2. Renshaw, I., Davids, K., O’Sullivan, M., Maloney, M. A., Crowther, R., McCosker, C. An ecological dynamics approach to motor learning in practice: reframing the learning and performing relationship in high performance sport. Asian J Sport Exerc Psychol. 2, 18-26 (2022).
  3. Lamas, L., Senatore, J. V., Fellingham, G. Two steps for scoring a point: creating and converting opportunities in invasion team sports. PLoS ONE. 15, e0240419(2020).
  4. Gonçalves, B., et al. Extracting spatial-temporal features that describe team match demands when considering the effects of the quality of opposition in elite football. PLoS ONE. 14, e0221368(2019).
  5. Cardoso, F. D. S. L., González-Víllora, S., Guilherme, J., Teoldo, I. Young football players with higher tactical knowledge display lower cognitive effort. Percept Mot Skills. 126, 499-514 (2019).
  6. Heilmann, F. Self-report versus neuropsychological tests for examining executive functions in youth soccer athletes—a cross-sectional study. Behav Sci. 12, 346(2022).
  7. Torres-Tejeda, S., Portilla-Fernández, J. A., Mugruza-Vassallo, C. A., Córdoba-Berrios, L. L. Variations of reaction times explained by stimuli changes in size and perspective in 2D and 3D for selective attention. Rev Mex Ing Biomed. 41, 91-104 (2020).
  8. Wilke, J., Vogel, O. Computerized cognitive training with minimal motor component improves lower limb choice-reaction time. J Sports Sci Med. 19, 529(2020).
  9. Da Silva Leite Cardoso, F., Afonso, J., Roca, A., Teoldo, I. The association between perceptual-cognitive processes and response time in decision making in young soccer players. J Sports Sci. 39, 926-935 (2021).
  10. Farahani, J., Soltani, P., Rezlescu, C. Assessing decision-making in elite academy footballers using real-world video clips. Prog Brain Res. 259, Elsevier. 59-70 (2020).
  11. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  12. MM-ViT: multi-modal video transformer for compressed video action recognition. Chen, J., Ho, C. M. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 1910-1921 (2022).
  13. Shi, J., et al. A novel two-stream transformer-based framework for multi-modality human action recognition. Appl Sci. 13, 2058(2023).
  14. Capone, V., Casolaro, A., Camastra, F. Spatio-temporal prediction using graph neural networks: a survey. Neurocomputing. 594, 130400(2025).
  15. Ball trajectory inference from multi-agent sports contexts using set transformer and hierarchical bi-LSTM. Kim, H., et al. Proc 29th ACM SIGKDD Conf Knowl Discov Data Min, , (2023).
  16. Lemes, J. C., et al. Influence of pitch size and age category on the physical and physiological responses of young football players during small-sided games using GPS devices. Res Sports Med. 28, 206-216 (2020).
  17. Coutinho, D., et al. Effects of pitch configuration design on players’ physical performance and movement behaviour during football small-sided games. Res Sports Med. 27, 298-313 (2019).
  18. Clemente, F. M., Sarmento, H. Combining small-sided football games and running-based methods: a systematic review. Biol Sport. 38, 617-627 (2021).
  19. Hu, W., Li, B., Li, C., Zhang, T. An integrated intelligent decision system for physical health evaluation of college students with fuzzy number intuitionistic fuzzy information. J Intell Fuzzy Syst. 44, 611-624 (2023).
  20. Cao, L. Design and optimization of a decision support system for sports training based on data mining technology. Sci Program. 2022, 1846345(2022).
  21. Li, L., Zhang, Z., Zhang, S. Hybrid algorithm based on content and collaborative filtering in recommendation system optimization and simulation. Sci Program. 2021, 4(2021).
  22. Shi, W., Wang, L., Qin, J. User embedding for rating prediction in SVD++-based collaborative filtering. Symmetry. 12, 121(2020).
  23. Hasan, M., Roy, F. An item–item collaborative filtering recommender system using trust and genre to address the cold-start problem. Big Data Cogn Comput. 3, 39(2019).
  24. Duan, R., Jiang, C., Jain, H. K. Combining review-based collaborative filtering and matrix factorization: a solution to rating sparsity. Decis Support Syst. 156, 113748(2022).
  25. Multi-view transformation in recommender systems. Ho, T. L., Le, A. C. Proc 2021 Int Conf Syst Sci Eng (ICSSE), , IEEE. 88-91 (2021).
  26. Detector-free weakly supervised group activity recognition. Kim, D., Lee, J., Cho, M., Kwak, S. Proc IEEE CVF Conf Comput Vis Pattern Recognit (CVPR), , 20083-20093 (2022).
  27. Wensel, J., Ullah, H., Munir, A. ViT-RET: vision and recurrent transformer neural networks for human activity recognition in videos. IEEE Access. 11, 72227-72249 (2023).
  28. Alomar, K., Aysel, H. I., Cai, X. CNNs, RNNs and transformers in human action recognition: a survey and a hybrid model. Artif Intell Rev. 58, 1-44 (2025).
  29. Social adaptive module for weakly supervised group activity recognition. Yan, R., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 224-238 (2020).
  30. Zhang, Y., et al. FairMOT: on the fairness of detection and re-identification in multiple object tracking. Int J Comput Vis. 129, 3069-3087 (2021).
  31. Towards real-time multi-object tracking. Wang, Z., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 22-107 (2020).
  32. Shuvo, M. R., Mekala, M. S., Elyan, E. Deep learning and attention-based methods for human activity recognition and anticipation: a comprehensive review. Cogn Comput. 17, 1-28 (2025).
  33. Alqarafi, A., Almogadwy, B. TAT-SARNet: a transformer-attentive two-stream soccer action recognition network with multi-dimensional feature fusion and hierarchical temporal classification. Mathematics. 13, 3011(2025).
  34. Detection recovery in online multi-object tracking with sparse graph tracker. Hyun, J., Kang, M., Wee, D., Yeung, D. Y. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 4839-4848 (2023).
  35. Mukhtar, H., Khan, M. U. G. STMMOT: advancing multi-object tracking through spatiotemporal memory networks and multi-scale attention pyramids. Neural Netw. 168, 363-379 (2023).
  36. Dataset used for intraclass correlation coefficient reliability analysis. , https://docs.google.com/spreadsheets/d/1c3bZNClvy8TP7RBspwRI0z7R8-n5Wy5H (2021).
  37. Ma, X., et al. feature extraction within a complex urban area with an improved 3D-CNN using airborne hyperspectral data. Remote Sens. 15, 992(2023).
  38. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  39. Wang, X., Guo, Y. Intelligent football players’ motion recognition system based on convolutional neural network and big data. Heliyon. 9, e19822(2023).
  40. Paneru, B., et al. Enhancing soccer pass receiver prediction in broadcast images through advanced deep learning techniques: a comprehensive study on model optimization and performance evaluation. J Soft Comput Explor. 5, 115-121 (2024).
  41. Shot prediction in the attacking third based on spatio-temporal features: a dynamic time-series model approach. Gong, B., et al. Proc 4th Int Conf Inf Technol Contemp Sports (TCS), , IEEE. (2024).
  42. Yang, K. O., Koh, J., Choi, J. W. Unified contrastive fusion transformer for multimodal human action recognition. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Transformer ModelMultimodal FusionTactical Decision AnalysisTeam SportsFootball AnalyticsPlayer PositioningDecision ClassificationFeature ExtractionReal Time PredictionVideo Analysis

Related Articles