$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El estudio incluyó a 40 jugadores de fútbol varones de entre 18 y 24 años (media = 20,1 ± 1,2), reclutados de cuatro clubes amateurs y semiprofesionales dentro de una misma liga regional. Todos los participantes tenían al menos tres años de experiencia competitiva y actualmente entrenaban en un entorno estructurado. La recogida de datos se realizó en dos entornos controlados: primero, en ejercicios estandarizados en el campo de entrenamiento que simulaban escenarios tácticos de decisión de pases/conducción; segundo, en sesiones prolongadas de simulación de coincidencias de las que se extrajeron secuencias multimodales. Todos los procedimientos fueron aprobados por el Comité Institucional de Ética de la Universidad del Golfo de Beibu (Número de Aprobación: BG-PE-2023-117), y se obtuvo el consentimiento informado por escrito de todos los participantes antes de la recogida de datos. Se cumplieron los estándares éticos internacionales e institucionales al llevar a cabo esta investigación. El Comité de Ética Institucional de la Universidad del Golfo de Beibu examinó y autorizó todos los procedimientos que involucran a sujetos humanos (Nº de aprobación: BG-PE-2023-117). Antes de la recogida de datos, cada participante proporcionaba un consentimiento informado por escrito y todos los datos recogidos se anonimizaban antes del análisis.
Este trabajo busca automatizar y mejorar la investigación de la toma de decisiones tácticas en deportes de equipo mediante una arquitectura de Fusión Multimodal basada en Transformers. Utiliza una variedad de fuentes de datos, incluyendo vídeo, audio, ubicación espacial y metadatos del reproductor para crear un modelo predictivo robusto en tiempo real. La Figura 1 muestra la arquitectura del método propuesto. La obra propuesta consta de cinco fases. Las etapas se describen a continuación:

Figura 1. Arquitectura del método propuesto. Esquema del modelo que combina entradas multimodales y componentes de clasificación para la toma de decisiones tácticas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Adquisición y preprocesamiento de datos
Los datos de diversas modalidades se recopilan a partir de grabaciones de los partidos, como transmisiones de vídeo, comentarios de audio, información GPS/posicionamiento e indicadores de rendimiento de los jugadores. Cada modalidad pasa por preprocesamiento en forma de técnicas como extracción de fotogramas (para vídeo), filtrado de ruido (para audio) y normalización (para lecturas de sensores), asegurando la sincronización en pasos de tiempo.
Los fotogramas de vídeo se extrajeron a 25 fps, se redujeron a 224 × 224 de resolución. Las señales de audio se procesaban con un filtro pasa-banda, que iba de 300 a 3.400 Hz, para eliminar la mayor parte del ruido ambiental. Los datos de seguimiento posicional de los sensores GPS se registraron a 10 Hz e interpolaron mediante interpolación lineal basada en marcas de tiempo, asegurando que se alineen con la línea temporal del vídeo a 25 Hz. Todas las entradas se alineaban temporalmente usando marcas de tiempo compartidas, y sus escalas se normalizaban con puntuación z.
Extracción de características
Para recopilar la información espaciotemporal de los datos de vídeo, se utilizan CNN 3D. Las CNN 3D gestionan tanto información espacial como temporal a través de fotogramas de vídeo, haciendo que el modelo sea capaz de detectar patrones de movimiento, comprender el comportamiento de los grupos y extraer características basadas en el movimiento. Esta operación genera una representación densa de características por secuencia de acciones, que se utiliza como entrada visual al modelo. Cada clip de entrada de vídeo contenía 16 fotogramas consecutivos muestreados a un paso de 2. Durante el entrenamiento se aplicaron recortes aleatorios, volteos horizontales y normalización de brillo. La CNN 3D se optimizó usando Adam (lr = 0,0001), tamaño de lote 16 y pérdida de entropía cruzada.
Incrustación y alineación de entradas multimodales
Después, las incrustaciones de diferentes modalidades se integran con las salidas de la CNN 3D. Se emplea una arquitectura de modelo de transformador multimodal, con varias ramas de codificadores que manejan cada modalidad. Se emplean capas de atención cruzada para la fusión y alineación de modalidades, permitiendo al modelo capturar interdependencias (por ejemplo, entre la ubicación de los jugadores y el movimiento del balón, y el contexto de los comentarios). Esta fusión permite una comprensión contextual enriquecida de las decisiones tácticas actuales. También implementé todas las incrustaciones en PyTorch. Las características de vídeo se proyectaban linealmente desde 1.024 hasta 512 dimensiones, y las características de audio y posicional se proyectaban a 256 y 128 dimensiones, respectivamente, unificadas a 512 dimensiones antes de la alineación temporal.
Fusión multimodal basada en transformadores
Se emplea un Transformador Multimodal para combinar las características extraídas de todas las fuentes. Los mecanismos de auto-atención en el transformador permiten al modelo aprender interdependencias entre modalidades (por ejemplo, visual + audio), capturar el flujo temporal y el contexto, y destacar marcos y eventos tácticamente importantes. El resultado de este paso es una representación combinada que captura la intención táctica y el contexto situacional de cada decisión tomada. El transformador multimodal constaba de seis capas codificadoras, cada una con ocho cabezas de atención. Las matrices de atención se calcularon utilizando atención escalar escalada. Las capas de atención y de avance también incluían dropout con p = 0,1 para evitar sobreajuste.
Clasificación y evaluación de decisiones tácticas
Por último, la representación fusionada se introduce como entrada a una capa de clasificación o bloque de análisis de decisiones, que se utiliza para predecir el tipo de decisión táctica, evaluar la calidad de la decisión y, opcionalmente, generar información explicable para los entrenadores mediante mapas de calor de atención o mapas de activación. El resultado de esta etapa proporciona una evaluación cuantitativa y cualitativa de las capacidades de toma de decisiones de un equipo o jugador durante el match play.
El cabezal de clasificación utilizaba una MLP de tres capas con activación ReLU seguida de una capa softmax. El modelo se entrenó con una división 70/15/15 con validación cruzada de 10 veces. Las métricas utilizadas fueron precisión, precisión, recuerdo, puntuación F1, latencia y AUC.
Un diagrama de flujo simplificado, que resume las cinco etapas, ofrece una visión visual inmediata del proceso secuencial, como se muestra en la Figura 2. Esta figura representa de forma concisa toda la línea de investigación, que comprende adquisición de datos, preprocesamiento, extracción de características, fusión multimodal y clasificación táctica de decisiones, seguida de descripciones detalladas de cada etapa.

Figura 2. El flujo de trabajo general del proceso de investigación. Visión general de la cadena de investigación, desde la recogida y preprocesamiento de datos hasta la extracción de características, entrenamiento de modelos y evaluación. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La Figura 3 muestra el flujo de trabajo general del proceso de investigación sugerido. El proceso se inicia mediante la Etapa 1: Adquisición y Preprocesamiento de Datos, donde se recopilan y sincronizan fuentes de datos multimodales, como vídeo, audio, seguimiento posicional y metadatos contextuales. Durante la Fase 2: Extracción de Características, se utilizan Redes Neuronales Convolucionales 3D (CNNs 3D) para extraer información espaciotemporal de los flujos de vídeo, resultando en representaciones visuales densas de las acciones del jugador y el flujo táctico. Etapa 3: Incrustación y alineación de entradas multimodales combina características de audio, vídeo y posicionales en un espacio latente compartido, con alineación temporal y alineación cruzada. Estas representaciones se agregan posteriormente en la Etapa 4: Fusión Multimodal basada en transformadores, donde los mecanismos intermodales y de autoatención permiten al modelo aprender interdependencias entre modalidades y obtener conocimientos contextuales más profundos sobre decisiones tácticas. Por último, en la Fase 5: Clasificación y Evaluación de Decisiones Tácticas, las representaciones combinadas se introducen en una capa de clasificación para detectar decisiones tácticas, como pasar, empujar o mantener. Mientras tanto, se emplean métricas de rendimiento para estimar la precisión en la toma de decisiones y el tiempo de respuesta. Este diagrama de flujo ofrece una visión clara del enfoque paso a paso, complementado por las elaboradas descripciones textuales descritas en las siguientes secciones.

Figura 3. Pipeline de procesamiento secuencial. Describe el flujo paso a paso desde la adquisición de datos hasta la clasificación táctica de decisiones y la salida del modelo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Adquisición y preprocesamiento de datos
Para permitir un análisis táctico de toma de decisiones de alto nivel en deportes de equipo mediante una canalización de fusión multimodal usando Transformer, se formó una configuración estructurada y de alta fidelidad para adquisición y preprocesamiento de datos. La configuración implica fusionar múltiples modalidades de datos, incluyendo grabaciones de vídeo, seguimiento posicional de los jugadores, señales de audio de interacciones jugador-entrenador y metadatos contextuales como la fase del partido, la estructura del equipo y las áreas de posesión.
La muestra del estudio consistió en 40 hombres de 20 años o más, todos ellos activamente involucrados en ligas regionales de fútbol amateur y semiprofesional. Cada uno de ellos fue reclutado de cuatro clubes competitivos que tenían un programa de entrenamiento estructurado. La edad media de los atletas era de 20,1 ± 1,2 años, con una altura media de 177,5 ± 3,1 cm y un peso medio de 72,6 ± 2,9 kg. Habían estado jugando en sus respectivos clubes durante una media de 6,8 ± 1,5 años. Todos los participantes también tenían un mínimo de tres años de experiencia competitiva y se consideró que eran tácticamente competentes.
Para asegurar el poder estadístico, el tamaño de la muestra se estimó utilizando un nivel de fiabilidad del 95% (Z = 1,96) y un nivel de significación del 5%, con un coeficiente de correlación intraclase (ICC) esperado de 0,96 y un intervalo de confianza del 95% para reflejar la concordancia casi perfecta. Esto es coherente con el objetivo de validar la fiabilidad y consistencia de los datos de toma de decisiones multimodalesrecogidos 27.
Para garantizar la reproducibilidad, los ajustes de adquisición y las especificaciones técnicas se estandarizaron entre las sesiones. Los datos de vídeo se grababan a resolución de 1.080p y 25 fotogramas por segundo usando cámaras GoPro Hero4 con un ajuste de campo de visión amplio para capturar todo el espacio táctico. Cada grabación fue estabilizada y montada a una altura fija de 2,5 m. Las señales de audio se capturaban usando un micrófono de campo externo a una frecuencia de muestreo de 44,1 kHz (mono) y posteriormente se filtraban con un filtro pasa-banda de 300-3.400 Hz para eliminar el ruido ambiental. Los datos de seguimiento posicional se recogieron utilizando sensores GPS portátiles que operan a 10 Hz, con una precisión posicional media reportada por el fabricante de ±0,5 m. Todas las modalidades se sincronizaron usando marcas de tiempo compartidas y se remuestrearon a una línea temporal común de 25 Hz mediante interpolación lineal.
El preprocesamiento incluyó entonces lo siguiente: reducción de muestreo de vídeo a resolución 224 × 224, muestreo de fotogramas de 16 fotogramas consecutivos con un paso de 2, recorte aleatorio, giro horizontal, normalización de brillo, normalización de audio y filtrado de ruido, y normalización de puntuación z de variables posicionales y contextuales.
El script de preprocesamiento está organizado en el siguiente orden para la reproducibilidad: (i) extracción de fotogramas; (ii) filtrado de audio; (iii) interpolación GPS; (iv) remuestreo de modalidad a 25 Hz; (v) normalización de puntuación z; y (vi) pruebas de integridad para detectar corrupción, oclusión y abandono escolar. Se utilizan scripts de procesamiento por lotes para completar automáticamente cada etapa.
Para mantener la fiabilidad de los datos, los criterios de control de calidad y exclusión incluían: i) secuencias con oclusión >20% del reproductor, ii) caída del GPS superior a 200 ms, iii) audio corrupto o recortado, e iv) desenfoque de movimiento severo o desincronización entre modalidades. Un total de 17 secuencias (3,4%) fueron excluidas para estas condiciones. La Tabla 1 muestra la descripción del conjunto de datos.
| Atributos | Detalles |
| Deporte | Fútbol (fútbol) |
| Participantes | 40 jugadores masculinos de fútbol americano |
| Nivel de juego | Jugadores de fútbol americano federados con ≥5 años de experiencia |
| Tipo de prueba | Prueba de toma de decisiones y ejecución de pase y penetración (control del balón) |
| Configuración de la prueba | Configuración estandarizada de los campos de fútbol, zonas marcadas, posiciones fijas |
| Herramientas de medición | Cámaras GoPro Hero4, software Kinova, cronómetro |
| Datos recopilados | Tiempo de ejecución (ET), precisión en la toma de decisiones (DM), número de acciones correctas |
| Procedimiento de prueba | Los jugadores respondían a estímulos visuales de los entrenadores y ejecutaban pases o penetraciones |
| Repeticiones de juicio | 10 pruebas por jugador (5 pases, 5 penetraciones) |
| Evaluación | Expertos: DM; ET medido usando marcas de tiempo/vídeo |
| Variables de resultado | Tiempo de reacción, recuento correcto de decisiones, puntuación técnica de ejecución |
Tabla 1: Descripción del conjunto de datos. Detalla la demografía de los participantes, los procedimientos de prueba, las herramientas de medición y las variables de resultado.
En el presente estudio, se utilizaron dos conjuntos de datos relacionados pero distintos. El primer conjunto de datos estaba compuesto por 40 jugadores que participaron en tareas controladas de toma de decisiones de pasar/penetrar, utilizadas principalmente para establecer la fiabilidad de referencia y validar el procedimiento básico de medición de decisiones. El segundo conjunto de datos incluye 500 secuencias tácticas multimodales recogidas de simulaciones extendidas de partidos y grabaciones de partidas reales. Estas secuencias constituyeron el principal conjunto de datos de entrenamiento y pruebas para el modelo de fusión basado en transformadores, permitiendo su evaluación en condiciones ecológicamente más válidas.
Aunque el conjunto de datos comprende 500 secuencias multimodales, el muestreo estratificado aseguró una representación equilibrada entre acciones tácticas (Pasar, Conducir, Mantener). También se utilizaron enfoques de aumento de datos, como el recorte temporal y la barajarra de secuencias, para aumentar la variabilidad y mitigar el sesgo del modelo durante el entrenamiento.
Cabe destacar que el conjunto de datos controlado por 40 jugadores se utilizó en la validación inicial del modelo y en la prueba de fiabilidad, mientras que la colección más amplia de 500 secuencias multimodales se recopiló a partir de grabaciones prolongadas de partidos y sesiones de entrenamiento organizadas para evaluar la escalabilidad y validez ecológica del marco. La fiabilidad de referencia se estableció utilizando el conjunto de datos más pequeño, mientras que el conjunto de datos más grande facilitó el entrenamiento y pruebas de modelos a gran escala.
Descripción del conjunto de datos
El experimento reclutó a 40 jugadores masculinos de fútbol, cada uno con al menos cinco años de experiencia en la federación, para asegurar que la población de la muestra tuviera competencias técnicas y tácticas básicas. La recopilación de datos se realizó en una disposición estandarizada de los campos de fútbol donde se asignaron zonas y posiciones de juego predeterminadas para garantizar condiciones idénticas de prueba. Durante la experimentación, los participantes tenían que responder a señales visuales de un entrenador, ya fuera para pasar o penetrar el balón, replicando decisiones tácticas tomadas en un partido real. Cada participante completó un total de 10 pruebas, cinco de paso y cinco de coche. Estos movimientos se capturaron con cámaras GoPro Hero4, y los datos de rendimiento se midieron utilizando el software de análisis de vídeo Kinovea junto con el tiempo de cronómetro manual para capturar el tiempo de ejecución (ET). La principal fuente de datos recopilada fue: el tiempo de ejecución, la calidad del DM evaluada por coaches experimentados y la cantidad de acciones correctas ejecutadas. Estos factores proporcionaron una base cuantitativa para analizar la rapidez y eficacia con que los jugadores tomaron y ejecutaron decisiones tácticas bajo condiciones controladas de estímulo-respuesta. El conjunto de datos producido es un recurso estructurado y etiquetado, bien adaptado para crear referencias o entrenar sistemas inteligentes con el objetivo de modelar el pensamiento táctico y las respuestas motoras en contextos de deportes de equipo.
La muestra está restringida a jóvenes jugadores masculinos de una liga regional, lo que puede limitar su generalizabilidad entre grupos de edad, deportistas femeninas u otras culturas. Estudios futuros intentarán extraer muestras más representativas y diversas.
Otra limitación es el tamaño de la muestra de 40 jóvenes jugadores masculinos de una única liga regional. Aunque la muestra homogénea contribuyó a la validez interna y a la reducción de la variación en el rendimiento debido a diferencias de edad, género y antecedentes tácticos, también limita la generalizabilidad de los hallazgos a una población más amplia. Los patrones tácticos que aprende el modelo pueden reflejar estilos de juego específicos de una región o de género en lugar de un comportamiento de toma de decisiones universal. Para este estudio, se emplearon muestreos estratificados y aumento de datos para mejorar la variabilidad del conjunto de datos en cuestión; Sin embargo, se necesitan estudios de investigación a mayor escala que involucren a atletas femeninas, jugadoras jóvenes, jugadoras profesionales y participantes de múltiples culturas tácticas para confirmar la solidez del modelo en diversos entornos futbolísticos. Estos resultados demuestran un gran potencial, pero necesitan una validación adicional en conjuntos de datos más diversos y amplios antes de poder afirmar una generalización más amplia.
Para reducir la subjetividad, tres entrenadores profesionales de fútbol americano anotaron de forma independiente las decisiones tácticas. La fiabilidad entre evaluadores se estimó utilizando el coeficiente de correlación intraclase (ICC = 0,96, IC 0,94-0,98), indicando una concordancia casi perfecta. La discusión consensuada resolvió el desacuerdo. Para datos multimodales, el preprocesamiento implicó sincronización temporal entre modalidades (vídeo a 25 fps y datos de sensores a 10 Hz) y normalización z-score de características para permitir la comparabilidad entre modalidades.
La fiabilidad entre evaluadores se cuantificó utilizando un coeficiente de correlación intraclase de efectos aleatorios bidireccionales (ICC [2,3]), ya que es adecuado para evaluar la concordancia absoluta entre múltiples evaluadores. El ICC de 0,96 (IC 95%: 0,94-0,98) indica un acuerdo casi perfecto según los umbrales comúnmente usados y además establece que las etiquetas de decisión táctica utilizadas para el entrenamiento eran altamente fiables. Se calculó la fiabilidad en las 500 secuencias multimodales, asegurando que tanto los contextos controlados como los de simulación de partidos fueran debidamente y de forma consistente anotados.
Procedimiento de anotación y protocolo de etiquetado
Todas las secuencias multimodales se anotaban usando un protocolo estructurado de tres etapas. Primero, tres entrenadores de fútbol con licencia revisaron de forma independiente cada secuencia posicional de vídeo utilizando una interfaz de anotación sincronizada con marca de tiempo (Kinovea + hoja de cálculo personalizada de etiquetado). Los anotadores etiquetaban la categoría de decisión táctica (Pasar, Empujar, Mantener), las señales contextuales (zona de presión, disponibilidad de carril de pases) y las marcas de tiempo del evento. En segundo lugar, un script de detección de desacuerdos identificaba automáticamente los casos de ambigüedad o conflicto, que luego se revisaban en una reunión conjunta de consenso. En tercer lugar, para garantizar la consistencia en la marcación de límites de eventos y la alineación temporal entre modalidades, un analista senior independiente realizó una revisión final. Este proceso, para fines posteriores de entrenamiento en modelos, aseguraba que cada anotación fuera rastreable y de la mejor calidad.
Preprocesamiento
Mientras que el presente estudio se llevó a cabo con 500 secuencias multimodales, la cadena de preprocesamiento estaba, por diseño, diseñada para conjuntos de datos a gran escala. Todas las modalidades pasaron por scripts automatizados que, en paralelo, extraían fotogramas de vídeo por lotes, remuestreaban audio, interpolaban datos posicionales y aplicaban la normalización de puntuación z. La presencia de arquitectura modular permite que cada modalidad se preprocese de forma independiente en hilos separados de GPU/CPU. Esto permite la ingesta de gran volumen de imágenes del partido. Esto garantiza que el flujo de trabajo pueda escalarse fácilmente a conjuntos de datos de temporada completa sin intervención manual y hace que el marco sea adecuado para su despliegue en entornos profesionales de analítica.
Para examinar adecuadamente la toma de decisiones tácticas en deportes de equipo, es necesario preprocesar y alinear datos en bruto de diferentes modalidades —por ejemplo, clips de vídeo, señales de audio y grabaciones posicionales. La ilustración de entrada multimodal es
(1)
Aquí, V se denota como una serie de características de vídeo extraídas del codificador CNN.
(2)
Aquí, A es una característica de audio codificada por wave2vec.
(3)
P representa la posición de coordenadas de un jugador en el tiempo ti.
Para tratar las tasas de muestreo asíncronas, cada modalidad se remuestrea o interpola a una línea temporal compartida:
(4)
Aquí
, es una característica sincronizada ft , es la tasa del sistema combinado, Xm es una indicación inicial.
Para una escala uniforme entre modalidades, todos los vectores de características están normalizados por puntuación z:
(5)
μX y σX denotan la media y la desviación estándar de la dimensión de características en el conjunto de entrenamiento.
Aunque las principales preocupaciones son las decisiones de pase y penetración, se añadieron canales de audio (por ejemplo, comunicación jugador/entrenador, pistas ambientales del juego) para tener en cuenta situaciones reales de partido donde las señales de voz afectan la reacción táctica. Los hiperparámetros (por ejemplo, tasa de aprendizaje, épocas) se eligieron mediante búsqueda en cuadrícula y evaluaciones existentes en el aprendizaje multimodal, logrando un equilibrio entre la estabilidad de convergencia y la eficiencia computacional.
Los hiperparámetros del marco sugerido —tasa de aprendizaje, tamaño del lote y épocas de entrenamiento— fueron elegidos mediante una búsqueda sistemática en cuadrícula bien planificada para lograr tanto estabilidad de convergencia como eficiencia computacional. La elección de una tasa de aprendizaje de 0,0001 con el optimizador Adam resultó proporcionar actualizaciones estables del gradiente sin oscilaciones, mientras que los tamaños de lote se optimizaron para equilibrar la capacidad de memoria de la GPU con el rendimiento de entrenamiento. La configuración de 50-100 épocas se utilizó para permitir un aprendizaje adecuado sin sobreajuste, como lo confirman el seguimiento de pérdidas de validación y la validación cruzada de 10 veces. Estos valores no se establecieron arbitrariamente, sino que se guiaron por pruebas previas en aprendizaje multimodal y ajustados mediante ensayos experimentales sobre el conjunto de datos actual. Este proceso riguroso garantizaba que los hiperparámetros seleccionados facilitaran el entrenamiento estable del modelo y mejoras reproducibles en el rendimiento respecto a los enfoques base.
Aunque la tarea de clasificación se centra en decisiones de pase/penetración/retención, la información de audio se incluyó intencionadamente, ya que el comportamiento táctico real en el fútbol americano está fuertemente influenciado por la comunicación jugador-entrenador, las señales de llamada de compañero, las señales de presión y los sonidos ambientales (por ejemplo, contacto con el balón, enfoque del rival). Estas señales suelen preceder o coocurrir con la toma de decisiones y forman parte del entorno perceptivo natural de los jugadores de fútbol. Experimentos preliminares de ablación mostraron que excluir audio redujo la recuperación en un 3,8%, lo que indicó que incluso señales acústicas sutiles contribuyen a la conciencia contextual. Por esta razón, el audio se mantuvo para preservar la validez ecológica y mejorar la capacidad del modelo para generalizar a condiciones reales de coincidencia.
De hecho, para apoyar aún más estos hiperparámetros, se realizó un análisis de sensibilidad interno variando sistemáticamente la tasa de aprendizaje de 1e-5 a 5e-4, el tamaño del lote de 8 a 32, el número de capas transformadoras de 4 a 8 y el número de cabezas de atención de 4 a 12. La configuración elegida, con una tasa de aprendizaje de 1e-4, un tamaño de lote de 16 y un codificador de 6 capas con 8 cabezas de atención, proporcionaba una convergencia estable de forma continua con la menor pérdida de validación, minimizando el sobreajuste a través de la validación cruzada de 10 veces. Los lotes más grandes provocaban inestabilidad en el gradiente, mientras que los lotes más pequeños aumentaban el ruido y retrasaban la convergencia. De manera similar, los modelos de transformadores con más de 8 cabezas no mostraron ningún aumento en el rendimiento, pero sí incrementaron considerablemente el tiempo de cálculo. Los resultados obtenidos justifican la configuración final de los hiperparámetros utilizados en este estudio.
Extracción de características usando redes neuronales convolucionales 3D
En el marco propuesto de Fusión Multimodal Basada en Transformers para la toma de decisiones tácticas en deportes de equipo, la Red Neuronal Convolucional 3D (CNN 3D) es responsable de extraer características espacio-temporales de los clips de vídeo en bruto.
A diferencia de las CNN 2D, que solo consideran dimensiones espaciales (ancho W y altura H), las CNN 3D también tienen en cuenta la dimensión temporal R, permitiéndoles detectar dinámicas de movimiento y patrones secuenciales cruciales para entender los comportamientos del equipo, como penetrar y pasar en el fútbol.
El 3D-CNN28 se propone primero para combinar la información espacial y temporal de los datos de vídeo. Un núcleo 3D se utiliza en un algoritmo de convolución 3D a un cubo formado por fotogramas con parte de las columnas apiladas. La convolución 3D puede escribirse en Ecuación (6)
(6)
Donde:
es la característica de salida en la ubicación (x, y, z) del j-ésimo mapa de características de la capa l.
es el peso del núcleo en la ubicación (h,w,r) del mapa de características de entrada m.
es la entrada en desplazamiento espacio-temporal respecto a la capa anterior. blj es el sesgo. f(.) es la función de activación (normalmente ReLU). M es el número de mapas de características de entrada de la capa anterior. Esta ecuación permite que la CNN 3D combine en paralelo la información espacial (altura y ancho) y temporal (secuencia de fotogramas).

Figura 4. Arquitectura de procesamiento CNN 3D. Ilustra cómo se extraen las características espaciotemporales de secuencias de vídeo mediante operaciones convolucionales 3D. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
La Figura 4 muestra el proceso de funcionamiento de una CNN 3D. La cadena comienza con la fase de entrada, donde los flujos de vídeo sin procesar de un partido de fútbol americano se fusionan con datos organizados, incluyendo ubicaciones de jugadores, estadísticas del partido y metadatos contextuales. Esta información multimodal preserva tanto la dinámica visual como el contexto situacional, que son fundamentales para el análisis de tácticas en equipo. Después, el flujo de vídeo se enruta a través de una Red Neuronal Convolucional 3D (CNN 3D). En este caso, se utiliza una serie de capas convolucionales 3D sobre los fotogramas de entrada. Las capas se agrupan a lo largo de las dimensiones espaciales (altura y ancho) y la dimensión temporal (fotogramas), permitiendo a la red aprender patrones de movimiento, interacciones entre jugadores y tácticas basadas en secuencias, como pases o penetraciones. Posteriormente, se forma un cubo de características que presenta características espaciotemporales densas. Este cubo está sometido a operaciones de agrupación para reducir la dimensión y preservar características significativas. Al agrupar, el volumen de características se aplana en un vector 1D, proporcionando una representación concisa de la situación táctica. Este vector de características se introduce posteriormente en una Red Neuronal Profunda (DNN) totalmente conectada. La DNN es el bloque de toma de decisiones, que procesa las características fusionadas y extraídas para tomar decisiones tácticas, como pasar, disparar o mantener. La salida de la red es la decisión táctica final tomada por el sistema basada en la situación real del juego en tiempo real, así como en patrones de estrategia aprendidos.
Incrustación y alineación de entradas multimodales
Tras la extracción de características, las tres características, como audio, vídeo y posición estadística del reproductor, se proporcionan como modalidad de entrada.
Para introducirlas en un transformador y luego alimentar cada una a través de una función de incrustación aprendible:
(7)
donde f3DCNN aprende características espaciotemporales de cada segmento temporal Vt y lo mapea a un espacio latente de dimensión d.
(8)
donde WP y bP son pesos aprendibles.
(9)
Todas las incrustaciones están alineadas por la dimensión temporal T. Si las modalidades tienen frecuencias dispares, se utiliza interpolación o muestreo descendente:
(10)
Ahora, todas las modalidades se sincronizan como:
(11)
Para preservar el orden temporal en el transformador, también introduce codificaciones posicionales en cada vector:
(12)
Donde
representa la codificación posicional senoidal o aprendible por defecto.
Cada modalidad se codifica operativamente usando una capa lineal PyTorch, se concatena en un vector 512-d y luego se introduce en la secuencia de entrada del transformador tras la codificación posicional. Esto garantiza que se prepare una incrustación unificada para la atención cruzada en cada paso temporal.
El tensor final es
(13)
se introduce en el Transformer Encoder, donde los mecanismos de autoatención y atención cruzada permiten al modelo razonar conjuntamente a través de todas las modalidades para la toma de decisiones tácticas.
Fusión multimodal basada en transformadores
En el enfoque propuesto, se emplea el método de factorización matricial de bajo rango para integrar los vectores de datos multimodales adquiridos. El problema de alta dimensión que ocurre cuando los tensores se fusionan directamente se aborda con este método, que utiliza un factor de descomposición de bajo rango para la fusióntensorial 29. Cada modalidad se expresa inicialmente como un vector, y la reducción de dimensionalidad que preserva interacciones significativas se logra mediante descomposición de rango bajo. El tensor de fusión ZM entre M modalidades se construye como:
(14)
Aquí:
es el factor de rango bajo de la m-ésima modalidad,
es el producto exterior, y r es el rango de descomposición.
El vector de fusión h se calcula entonces como:
(15)
Cuando se utilizan dos modalidades por separado, la fusión reducida es:
(16)
Esto produce un vector de representación multimodal conjunta h que modela interacciones intermodales a nivel latente.
Tras la adquisición del vector fundido de bajo rango h, el módulo Transformer modela dependencias y alinea representaciones semánticas entre modalidades. Una atención cruzada está especialmente diseñada para permitir que una modalidad preste atención a otra:
(17)
Donde Qm es la consulta de modalidad m, Kn, Vn son los vectores clave y valor en la modalidad n, dk es la dimensión de los vectores clave. Esta configuración facilita flujos de atención específicos de cada modalidad, permitiendo procesar cada categoría de entrada en relación con otras (por ejemplo, sincronizando el movimiento del jugador con el contexto del juego y los indicadores de vídeo).
Los vectores con asistencia cruzada se apilan y clasifican mediante un perceptrón multicapa (MLP). La salida es una etiqueta de decisión táctica (por ejemplo, pasar, empujar, mantener), pérdida de entropía cruzada optimizada para entrenamiento de extremo a extremo.

Figura 5. Arquitectura de fusión multimodal basada en transformadores. Muestra cómo las modalidades visuales y de sensores se integran mediante un codificador transformador para mejorar la representación de características. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
El bloque de fusión multimodal, como se muestra en la Figura 5, combina entradas visuales y posicionales. Es un diseño necesario ya que las decisiones tácticas requieren conciencia espacial y dinámica de movimiento, que no pueden representarse con una sola modalidad.
La Figura 5 muestra la estructura de trabajo de la fusión multimodal basada en transformadores. Este diseño combina datos diversos, vídeo, coordenadas espaciales y datos contextuales del juego en un único canal para predecir acciones tácticas como adelantar, conducir o mantener. El enfoque comienza introduciendo vídeos, que se revisan utilizando una Red Neuronal Convolucional 3D (CNN 3D). Este sistema identifica tanto las estructuras espaciales como temporales en el vídeo, permitiéndole capturar la actividad dinámica y la comunicación de los jugadores a lo largo del tiempo. Mientras tanto, la información contextual y posicional se transmite mediante capas incrustadas, transformando entradas estructuradas en representaciones vectoriales densas. Los flujos contextuales, posicionales y de vídeo pueden entonces tener sus salidas fusionadas mediante un módulo de fusión de bajo rango. El enfoque obtiene eficazmente correlaciones intermodales mediante la descomposición en espacios de fusión, minimizando la complejidad computacional mientras preserva las relaciones esenciales entre modalidades. Finalmente, la representación multimodal fusionada es procesada por un codificador transformador con atención cruz-modal. Este procedimiento permite al modelo centrarse en las características adecuadas a través de modalidades y pasos de tiempo, mejorando su comprensión del comportamiento estratégico en juegos. Finalmente, la salida codificada se pasa por una concatenación y un bloque Multi-Layer Perceptron (MLP) que mapea la representación aprendida a algunas decisiones tácticas. La salida del modelo clasifica acciones de los jugadores como "pasar", "empujar" o "mantener" para permitir un examen inteligente y basado en datos de las tácticas del equipo.
En el sistema de análisis táctico de fusión multimodal basado en transformadores sugerido para deportes de equipo, la última fase es la clasificación y evaluación táctica de decisiones, que convierte representaciones multimodales aprendidas en etiquetas accionables para la decisión. Tras fusionar características de vídeo, posicionales y contextuales mediante fusión de bajo rango y ajustarlas finamente usando atención cruzada en el codificador Transformer, los vectores de características resultantes se introducen en un clasificador Multi-Layer Perceptrón (MLP). Cada clase de decisión se representa con una función de activación softmax, que da puntuaciones de probabilidad para todas las acciones posibles. La clase más probable se elige como la decisión predicha del modelo. El modelo se entrena con una función de pérdida cruzada de entropía, que recompensa las predicciones correctas y hace que la red aprenda a diferenciar entre diferencias similares en situaciones tácticas. Además, se podría considerar la evaluación en el dominio del tiempo para confirmar la capacidad de respuesta en situaciones de juego en tiempo real o casi en tiempo real, asegurando que el clasificador sea preciso y tampoco una pérdida de tiempo bajo restricciones de tiempo similares a las de los juegos. La Tabla 2 muestra la arquitectura del modelo y los hiperparámetros.
| Componente | Especificaciones |
| Capas de codificador de transformadores | 6 |
| Atención Cabezas | 8 |
| Dimensión oculta | 512 |
| Tamaño de la capa de avance | 2048 |
| Dimensiones de incrustación | Vídeo: 1024 → 512, Audio: 256 → 512, Posicional: 128 → 512 |
| Codificación posicional | Aprendible |
| Método de fusión | Fusión Multimodal de bajo rango (rango r = 16) |
| Optimizador | Adán |
| Ritmo de aprendizaje | 0.0001 |
| Tamaño del lote | 16 |
| Épocas de entrenamiento | 50–100 |
| Abandono | 0.1 |
| Función de pérdida | Entropía cruzada |
Tabla 2: Arquitectura del modelo e hiperparámetros. Enumera los ajustes de entrenamiento y los componentes clave del modelo propuesto de fusión multimodal basado en transformadores.
Para mayor claridad y reproducibilidad, el transformador multimodal se implementó con una pila de codificadores de 6 capas, cada una equipada con 8 cabezas de atención y una dimensión oculta de 512, siguiendo los ajustes típicos de transformadores para tareas multimodales de escala media. Cada modalidad pasa por un bloque de incrustación: vídeo mediante una salida codificadora 3D-CNN, 1024-dim; audio por un codificador basado en Wave2Vec, 256-dim; y características posicionales más contextuales mediante un codificador MLP de 2 capas, 128-dim. Todas estas incrustaciones se proyectaban en un espacio latente 512-d compartido mediante transformaciones lineales aprendibles. Para establecer la alineación temporal, primero se interpolan todas las modalidades a una única frecuencia de 25 Hz, seguidas de la aplicación de codificaciones posicionales aprendidas para preservar el orden temporal. El alineamiento cruzado se realiza utilizando las capas de atención cruzada, que aprenden explícitamente correlaciones entre modalidades antes de ser introducidas en la pila de codificadores de auto-atención. Estas decisiones arquitectónicas se tomaron para equilibrar la capacidad del modelo con la eficiencia computacional, asegurando así una convergencia estable en un conjunto de datos de tamaño moderado.
En términos prácticos, el marco propuesto de Fusión Multimodal Basada en Transformadores es más adecuado para escenarios donde hay datos multimodales sincronizados disponibles, como sesiones de entrenamiento estructuradas, simulaciones controladas de partidos o entornos profesionales equipados con transmisiones de vídeo consistentes y sistemas de seguimiento posicional. Las cuatro entradas principales necesarias para el método son (i) vídeo de alta resolución, (ii) datos de seguimiento posicional (GPS/LPS), (iii) flujos de audio y (iv) metadatos contextuales, por ejemplo, posesión, zonas de presión, fase de coincidencia. Para lograr un rendimiento fiable, estas modalidades deben estar alineadas en el tiempo con un mínimo de deriva (vídeo ≥ 25 fps y sensores posicionales ≥ 10 Hz), y deben mantener puntos de vista estables y un ruido de señal mínimo. Aquellos ajustes que no ofrecen estas entradas sincronizadas, por ejemplo, partidos amateurs con ángulos de cámara irregulares, emisiones en directo con artefactos de latencia/compresión, o un entorno que careza de infraestructura de seguimiento posicional, serán menos relevantes para el marco. Además, el sistema actual funciona mejor en condiciones semicontroladas, pero puede ser sustancialmente menos robusto en situaciones de partidos en vivo completamente incontrolados, donde las condiciones de iluminación, la oclusión y el ruido dinámico de la multitud afectan a la calidad de la adquisición de datos. Estas restricciones delinean los límites prácticos dentro de los cuales este sistema puede desplegarse y enfatizan que la captura consistente de datos en múltiples modos es esencial para aplicar el modelo propuesto.
Modificaciones y resolución de problemas
En la implementación práctica, pueden surgir varios problemas a lo largo de la cadena multimodal que pueden reducir la estabilidad del modelo o el rendimiento general. Un problema común es la desalineación temporal entre modalidades, donde el vídeo grabado a 25 fps y los datos posicionales capturados a 10 Hz se desincronizan, lo que provoca señales desajustadas que desestabilizan los mapas de atención y reducen la memoria. Esto puede resolverse aplicando remuestreo basado en marcas de tiempo, interpolación lineal y eliminando automáticamente secuencias con exceso de deriva. Los canales de audio también pueden sufrir ruido causado por el viento, los sonidos de la multitud o el recorte del micrófono, lo que hace que el transformador ignore los tokens de audio y reduzca ligeramente la precisión. Aplicar filtrado pasa banda, gating espectral y sustituir segmentos gravemente corrompidos por vectores cero ayuda a mantener la estabilidad de la incrustación de audio. Problemas de calidad visual, como oclusiones en el reproductor o desenfoque de movimiento, pueden debilitar las representaciones espaciotemporales de la 3D-CNN y aumentar la confusión entre el drive de pase. Esto se mitiga excluyendo secuencias muy ocluidas y empleando estrategias de aumento, incluyendo recorte aleatorio, normalización de brillo y simulación de desenfoque de movimiento. La inestabilidad del transformador puede producirse si las escalas de incrustación difieren entre modalidades, produciendo pérdida de validación oscilante o picos de gradiente. Asegurar una normalización consistente de la puntuación z, usar un programa de ritmo de aprendizaje de calentamiento, aplicar recorte de gradiente y aumentar el abandono puede restaurar un entrenamiento estable. La fusión de rango bajo también puede volverse problemática cuando el rango de fusión está mal establecido, causando relaciones intermodales distorsionadas y desequilibrios entre clases. Mantener un rango moderado para conjuntos de datos pequeños, aumentar el rango para conjuntos de datos más grandes y aplicar regularización L2 ayuda a preservar la fusión equilibrada. Los cuellos de botella computacionales pueden surgir debido a tensores de vídeo grandes que provocan desbordamiento de memoria de la GPU o un entrenamiento lento. Estos problemas pueden abordarse mediante entrenamiento de precisión mixta (FP16), reduciendo la resolución de entrada durante experimentos iniciales, o almacenando en caché características 3D-CNN precomputadas. Finalmente, el desequilibrio natural de clases en las decisiones tácticas, especialmente para el "Drive", puede reducir la llamada y causar fluctuaciones en el AUC; Aplicar la pérdida equilibrada por clases, sobremuestrear acciones de minorías y enriquecer metadatos contextuales pueden mejorar sustancialmente el equilibrio y la discriminación por decisiones. Esta guía consolidada de resolución de problemas garantiza que investigadores y profesionales puedan mantener condiciones de entrenamiento estables, mejorar la reproducibilidad y adaptar el marco de forma eficaz a través de diversos conjuntos de datos y entornos.