Este estudio empleó un marco de aprendizaje profundo en dos etapas para el reconocimiento de acciones en videos deportivos que integra una red neuronal convolucional multiescala (MSCNN) con una red de memoria a corto y largo plazo (LSTM). Se utilizaron conjuntos de datos de referencia disponibles públicamente, específicamente UCF11, UCF Sports y JHMDB, para el desarrollo y evaluación del modelo. No se recopilaron nuevos datos de participantes humanos, ni se accedió ni procesó información personalmente identificable. Dado que el estudio implicó el análisis secundario de conjuntos de datos públicos y anonimizados y no involucró participación humana directa, no se requirió aprobación ética institucional ni consentimiento informado.
El flujo de trabajo consistió en muestreo de fotogramas y normalización temporal, seguido de la extracción de características mediante el módulo MSCNN. Las características extraídas se procesaron posteriormente utilizando una red LSTM para modelado temporal y luego se enviaron a una capa de clasificación multiclase. Finalmente, el modelo se entrenó y evaluó utilizando los conjuntos de datos de referencia seleccionados. Figura 1 ilustra la arquitectura general del marco propuesto.

Figura 1: Marco propuesto MSCNN-LSTM para el reconocimiento de acciones en videos deportivos. Flujo de trabajo general que ilustra el preprocesamiento de video, la extracción de características espaciales multiescala, el aprendizaje de secuencias temporales y la clasificación de acciones. Haga clic aquí para ver una versión más grande de esta figura.
Figura 1 ilustra el flujo de trabajo del marco propuesto para el reconocimiento de acciones en videos deportivos basado en una arquitectura híbrida MSCNN-LSTM. El proceso comienza con clips de video deportivos que contienen diversas acciones atléticas, incluyendo patear, montar a caballo y realizar golpes de golf. Los videos originales se descompusieron en cuadros individuales durante la etapa de preprocesamiento, en la cual los cuadros se recortan, estandarizan y preparan para la entrada al modelo. Los cuadros preprocesados se introdujeron luego en el módulo MSCNN para la extracción de características. La arquitectura convolucional multiescala captura características espaciales en diferentes campos receptivos, permitiendo la extracción de información local y contextual de los cuadros del video deportivo. Los vectores de características extraídos fueron posteriormente procesados por la red LSTM para modelar las dependencias temporales y la evolución del movimiento a través de cuadros consecutivos. Finalmente, el módulo de clasificación y entrenamiento utilizó las representaciones espacio-temporales aprendidas para predecir la categoría de acción de cada clip de video. El marco propuesto comprendió cuatro pasos secuenciales, comenzando con la recolección de datos y el preprocesamiento utilizando los conjuntos de datos de referencia UCF11 (YouTube Actions), UCF Sports y JHMDB. Cada video deportivo se convirtió en una secuencia de cuadros, que fueron redimensionados, normalizados y aumentados mediante rotación, inversión y recorte para mejorar la robustez frente a variaciones ambientales. Los cuadros preprocesados fueron posteriormente procesados por la Red Neuronal Convolucional Multiescala (MSCNN) propuesta, en la cual ramas convolucionales paralelas con núcleos de 3 × 3, 5 × 5 y 7 × 7 extrajeron características espaciales locales y contextuales complementarias. Estas características multiescala se concatenaron y refinaron utilizando normalización por lotes y agrupación máxima (max pooling) para generar representaciones compactas de características. Las características resultantes a nivel de cuadro se proporcionaron posteriormente a una red de Memoria a Corto y Largo Plazo (LSTM) para modelar las dependencias temporales entre cuadros consecutivos. Las salidas finales de la LSTM se aplanaron y se transmitieron a través de capas completamente conectadas con activación ReLU, seguidas por un clasificador Softmax para predecir la categoría de acción. La red se entrenó utilizando el optimizador Adam con una función de pérdida de entropía cruzada y regularización por abandono (dropout) para reducir el sobreajuste. El rendimiento del modelo se evaluó finalmente en los conjuntos de datos de referencia UCF11, UCF Sports y JHMDB utilizando precisión, exactitud, recuperación y puntuación F1.
1. Recolección y preprocesamiento de datos
En este estudio se utilizaron tres conjuntos de datos de referencia disponibles públicamente para deportes y acciones humanas. Estos conjuntos de datos contienen imágenes reales de deportes con movimiento de cámara, puntos de vista y complejidad de fondo variables. Específicamente, el estudio utilizó UCF11 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php), que contiene 11 categorías de acciones recopiladas a partir de 1.168 videos de YouTube grabados aproximadamente por 25 individuos, con múltiples muestras por acción. La Base de Datos de Movimiento Humano con Anotaciones Conjuntas (JHMDB)34,35 contiene 21 clases de acciones y 928 videos anotados. El conjunto de datos UCF Sports comprende 10 clases de acciones y 150 secuencias de video capturadas a partir de fuentes de transmisión con una resolución de 720 × 480 píxeles (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).
En conjunto, estos conjuntos de datos abarcan deportes individuales y colectivos y ofrecen variación en duración temporal y escala visual para evaluar el marco propuesto de reconocimiento de acciones MSCNN-LSTM. Como parte del proceso de evaluación de la calidad de los datos, los conjuntos de datos UCF11, UCF Sports y JHMDB fueron examinados en busca de videos dañados, archivos duplicados y fragmentos con anotaciones incompletas. No se identificaron muestras que cumplieran con estos criterios de exclusión; por lo tanto, todos los videos disponibles se conservaron para el análisis posterior. Luego, los conjuntos de datos se dividieron en subconjuntos de entrenamiento (70 %), validación (15 %) y prueba (15 %) utilizando una estrategia consistente de división aleatoria. Figura 2 presenta imágenes representativas utilizadas para el entrenamiento y la evaluación.

Figura 2: Cuadros representativos de conjuntos de datos de reconocimiento de acciones deportivas de referencia. Los paneles (A–D) muestran ejemplos del conjunto de datos UCF11 (YouTube Actions), los paneles (E–H) del conjunto de datos UCF Sports y los paneles (I–L) del conjunto de datos JHMDB. Los cuadros ilustran variaciones en clases de acciones, puntos de vista, fondos, condiciones de iluminación y complejidad del movimiento. Haga clic aquí para ver una versión más grande de esta figura.
El modelo propuesto de reconocimiento de acciones fue evaluado en los conjuntos de datos de referencia UCF11, UCF Sports y JHMDB, como se resume en la Tabla 3. Estos conjuntos de datos representan patrones de movimiento diversos y condiciones ambientales desafiantes. El conjunto de datos UCF11 (Acciones de YouTube) contiene acciones deportivas de 11 clases adquiridas bajo condiciones variables de iluminación, punto de vista y fondo. El conjunto de datos UCF Sports comprende 150 videos de deportes de campo procedentes de emisiones profesionales, con secuencias de movimiento realistas. El conjunto de datos JHMDB proporciona anotaciones detalladas de movimiento humano para 21 categorías de acciones finamente diferenciadas y sirve como conjunto de datos de referencia para el reconocimiento espaciotemporal de acciones. En conjunto, estos conjuntos de datos se utilizaron para evaluar el rendimiento del modelo en escenarios de deportes y acciones humanas. La red fue entrenada utilizando el optimizador Adam durante 100 épocas con un tamaño de lote de 32, una tasa de aprendizaje inicial de 0.001 y una función de pérdida de entropía cruzada. Se seleccionó el modelo con la menor pérdida de validación para la evaluación final. Todos los experimentos utilizaron una semilla aleatoria fija de 42. Se aplicaron detención temprana y reducción de la tasa de aprendizaje en meseta para mejorar la convergencia, y se utilizó recorte de gradientes con un umbral de 5.0 durante el entrenamiento del LSTM para prevenir gradientes explosivos. El modelo propuesto MSCNN-LSTM contenía aproximadamente 15 millones de parámetros entrenables. La configuración de hardware y software utilizada para la implementación se resume en la Tabla 4. Dado que las distribuciones de clases estaban suficientemente equilibradas, no se aplicaron procedimientos adicionales de ponderación por clases ni remuestreo. Los modelos comparadores se implementaron utilizando los hiperparámetros reportados en sus estudios originales, con configuraciones de entrenamiento armonizadas cuando fue factible. Los valores de rendimiento se reportaron como la media ± desviación estándar de cinco ejecuciones independientes con diferentes inicializaciones aleatorias. Las diferencias entre el modelo propuesto y los modelos comparadores se evaluaron mediante pruebas t pareadas con un umbral de significancia de p < 0.05.
| Conjunto de datos | N.º de clases | N.º de vídeos | Resolución (px) | Origen | Descripción |
| UCF11 (YouTube Actions) | 11 | 1168 | Variable (≈ 320×240) | University of Central Florida | Incluye 11 acciones humanas de deportes (por ejemplo, lanzamiento de baloncesto, saltos de trampolín, swing de golf, malabares con fútbol). Los vídeos se recopilaron de YouTube con gran variación en iluminación, punto de vista y fondo. |
| UCF Sports | 10 | 150 | 720×480 | UCF Sports Action Dataset | Contiene actividades deportivas como saltos de trampolín, equitación, swing de golf, carrera y levantamiento de pesas, grabadas a partir de imágenes reales de televisión (BBC, ESPN). |
| JHMDB | 21 | 928 | 320×240 | Max Planck Institute for Intelligent Systems | Incluye actividades cotidianas y deportivas como atrapar, saltar, cepillarse el cabello, disparar y correr, con anotaciones articulares para el análisis de movimiento y postura. |
Tabla 3: Características de los conjuntos de datos de referencia utilizados para entrenamiento y evaluación. Resumen de los conjuntos de datos UCF11, UCF Sports y JHMDB, que incluye el número de clases de acciones, muestras de video, características del conjunto de datos y sus roles en el entrenamiento, validación y prueba del modelo.
| Parámetros utilizados | Descripción |
| Lenguaje de programación | Python 3.8.18 [4] |
| Framework de aprendizaje profundo | TensorFlow 2.15.0 [1] |
| Acelerador GPU | NVIDIA GeForce RTX 3090 (24 GB VRAM) [1] |
| CPU | Intel Core i9 @ 3.5 GHz × 16 núcleos |
| Sistema operativo | Windows 11 |
| Memoria (RAM) | 64 GB DDR4 |
| Optimizador | Adam (tasa de aprendizaje = 0.001) |
| Tamaño del lote | 32 |
| Número de épocas | 100 |
| Funciones de activación | ReLU (capas CNN), Softmax (capa de salida) |
| Tasa de abandono (dropout) | 0.5 |
Tabla 4: Configuración del entorno de simulación y de los hiperparámetros del modelo MSCNN-LSTM propuesto. Especificaciones de hardware, entorno de software, ajustes del optimizador, tasa de aprendizaje, tamaño de lote, número de épocas, dimensiones de entrada y otros hiperparámetros utilizados durante el entrenamiento y la evaluación del modelo.
2. Preprocesamiento
Antes del entrenamiento, cada video en bruto se convirtió en una secuencia de cuadros ordenada en el tiempo y luego se normalizó, muestreó temporalmente y aumentó. Cada video de entrada V se convirtió primero en una secuencia de cuadros y se representó como un tensor 4D V ∈ RT×H×W×C, donde T es el número de cuadros, H × W i denota el índice del cuadro, y C denota el número de canales de color (3 para RGB). La canalización de preprocesamiento consistió en la extracción de cuadros, el redimensionamiento espacial seguido del recorte central o aleatorio a una resolución fija (H′, W′), la normalización de la intensidad por píxel y la ampliación opcional de los datos, incluyendo inversión aleatoria, escalado y variación aleatoria del color, antes de la extracción de características. Concretamente, la normalización de la intensidad se implementó como normalización por puntuación estándar según se muestra en la ecuación (1).
(1)
donde μ, σ son las medias y desviaciones estándar de los canales calculadas sobre el conjunto de entrenamiento, o como escalado min-máx según la ecuación (2).
(2)
Después de la normalización, cada cuadro se representó como F̃t ∈ RH′×W′×C′ y el tensor de video resultante se representó como V′ ∈ RT×H′×W′×C. En un frontend convolucional multi-escala, se obtienen varios mapas de características espaciales con campos receptivos diferentes mediante la aplicación de varias convoluciones 2D (o 3D para las primeras convoluciones espacio-temporales) con distintos tamaños de núcleo; luego se generó una representación de características temporales para cada cuadro o clip de video corto, que se envió al módulo LSTM. El artículo original aplica MobileNetV2 y luego Deep BiLSTM para la modelización temporal; la misma tubería de preprocesamiento descrita es completamente compatible con un reemplazo basado en convolución multi-escala más LSTM.
3. Muestreo y normalización temporal
Dado que las duraciones de los videos T varían entre y dentro de los conjuntos de datos, se muestrean o remuestrean temporalmente los fotogramas de forma uniforme para proporcionar al modelo de convolución multiescala + LSTM una longitud de entrada fija N en términos de fotogramas o fragmentos cortos. Los índices de fotogramas uniformes pueden calcularse según la ecuación (3),
(3)
por lo tanto, la secuencia de fotogramas muestreados es Vs = {F̃t0, …, F̃tN−1}. Cuando se requiere una fidelidad temporal más precisa, realizamos una interpolación temporal lineal: para cualquier tiempo fraccional remuestreado τ ∈ [0, T−1] calculado según la ecuación (4).
(4)
de modo que la secuencia remuestreada Vs tenga exactamente N fotogramas y conserve un movimiento suave. Alternativamente, el muestreo mediante clips cortos y contiguos (longitud de ventana temporal w con paso s) produce un conjunto de tensores de clips donde cada clip Cj ∈ RT×H′×W′×C y j = 0, …, ⌊(T − w)/s⌋. Para la normalización temporal dentro de la red, un agrupamiento temporal simple a múltiples escalas es efectivo: dada una secuencia de características temporales X = {x1, …, xN} generada por convoluciones de múltiples escalas, aplique las características agrupadas como se indica en la ecuación (5).
(5)
donde Sk es el soporte temporal para la escala k (por ejemplo, Sk puede ser bloques no superpuestos o índices dilatados) y mk = |Sk|.
Antes de la extracción de características, todos los videos se redimensionaron a 224 × 224 píxeles y se muestrearon a 25 fotogramas por segundo. Cada experimento utilizó una longitud de secuencia constante de 32 fotogramas. Entre las técnicas de aumento de datos se incluyeron el recorte aleatorio (escala = 0,8–1,0), la rotación aleatoria (±15°), el volteo horizontal aleatorio (probabilidad = 0,5) y la modificación del brillo (±20%). Se utilizaron los valores promedio de ImageNet [0,485, 0,456, 0,406] y las desviaciones estándar [0,229, 0,224, 0,225] para estandarizar los valores de los píxeles. Para cada secuencia de video, se utilizó una selección uniforme de fotogramas para el muestreo temporal. Las películas más largas se recortaron o muestrearon uniformemente para mantener una longitud de secuencia consistente, mientras que los videos con menos de 32 fotogramas se rellenaron con ceros. Durante todo el entrenamiento y la evaluación, estos parámetros se utilizaron de forma constante.
4. Extracción de características utilizando MSCNN
Se empleó una red neuronal convolucional multiescala (MSCNN) para mejorar la representación espacial de las acciones en videos deportivos. Las redes neuronales convolucionales convencionales que dependen de un único tamaño de kernel pueden tener una capacidad limitada para capturar características a múltiples escalas espaciales. Debido a que algunas acciones deportivas presentan características visuales similares, puede ser difícil para una arquitectura convolucional de una sola escala capturar simultáneamente características locales y globales. Para abordar esta limitación, el marco propuesto utiliza kernels convolucionales de diferentes tamaños para realizar la extracción multiescala de características y la fusión de características.
En la arquitectura de red propuesta, se utilizaron núcleos de convolución de 1 × 1 para organizar la información a través de los canales y reducir la dimensionalidad de los mapas de características de entrada. Además, estas capas aumentan la capacidad expresiva de la red mediante la introducción de transformaciones de características adicionales y representaciones no lineales. Los núcleos de convolución de diferentes tamaños permiten la extracción de información espacial a múltiples escalas. Se realiza una normalización secuencial tras la fusión ponderada de características multiescala para mejorar la estabilidad del entrenamiento. Con el fin de mitigar los problemas de desvanecimiento y explosión del gradiente durante el entrenamiento de redes profundas, la arquitectura sugerida utiliza conexiones residuales y modelado temporal basado en LSTM.
El diseño multi-escala mejora la capacidad de la red para capturar características a diferentes resoluciones espaciales y potencia la capacidad de representación de características. Además, el núcleo convolucional convencional de N × N se descompone en operaciones convolucionales de N × 1 y 1 × N. Las convoluciones de N × 1 y 1 × N empleadas en el módulo MSCNN están diseñadas para capturar características espaciales direccionales y multi-escala complementarias a partir de cuadros individuales del video. Estas operaciones convolucionales mejoran la representación de características espaciales al extraer patrones a diferentes escalas de campo receptivo. Las relaciones temporales entre cuadros consecutivos son posteriormente modeladas por el módulo LSTM, que procesa la secuencia de características extraídas por el MSCNN para aprender dependencias temporales a largo plazo en el reconocimiento de acciones.
Cada video deportivo V = {F1, F2, …, FT} se descompone en T fotogramas. Para codificar las variaciones espaciales, por ejemplo, la postura de los jugadores, el desenfoque por movimiento y la trayectoria del balón, ramas convolucionales a tres escalas diferentes operan s ∈ {1, 2, 3}, correspondientes a tamaños de núcleo 3 × 3, 5 × 5 y 7 × 7. Cada rama extrae mapas de características según la ecuación (6):
(6)
Donde Ws y bs son los pesos y sesgos de la convolución a la escala s, y σ es la activación ReLU. La capa de fusión multiescala agrega características como en la ecuación (7):
(7)
Este tensor de características fusionadas incorpora tanto señales de movimiento finas como información contextual de áreas amplias, como actividades grupales. Figura 3 ilustra únicamente el módulo de extracción de características MSCNN. La capa LSTM (256 unidades ocultas), la capa densa (128 neuronas) y la capa de dropout (0,5) utilizadas para modelado temporal y clasificación se presentan por separado en la Figura 4.

Figura 3: Módulo propuesto de extracción de características de la red neuronal convolucional multi-escala (MSCNN). Tres ramas convolucionales paralelas con tamaños de núcleo de 3 × 3, 5 × 5 y 7 × 7 extraen características espaciales multi-escala complementarias, que se fusionan antes de la modelización temporal mediante la red LSTM. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Arquitectura LSTM propuesta para el reconocimiento de acciones en videos deportivos. El módulo LSTM modela las dependencias temporales mediante operaciones de puertas de entrada, olvido y salida a través de cuadros de video consecutivos. Haga clic aquí para ver una versión más grande de esta figura.
Figura 3 ilustra el módulo propuesto de extracción de características mediante una Red Neuronal Convolucional Multiescala (MSCNN, por sus siglas en inglés) para el reconocimiento de acciones en videos deportivos. Los fotogramas de video de entrada se procesaron en paralelo a través de tres ramas convolucionales con tamaños de núcleo de 3 × 3, 5 × 5 y 7 × 7, cada una conteniendo 64 filtros para capturar características espaciales finas y gruesas complementarias. Las salidas se refinaron mediante normalización por lotes, activación ReLU y agrupación máxima de 2 × 2, luego se concatenaron y fusionaron mediante una convolución de 1 × 1 con 128 filtros. Una conexión residual de salto preservó la información espacial de bajo nivel y mejoró el flujo de gradientes. Los mapas de características fusionados se aplanaron y se transmitieron a una capa LSTM con 256 unidades ocultas para modelado temporal, seguida por una capa completamente conectada con 128 neuronas, activación ReLU y una tasa de abandono (dropout) de 0,5 antes de la clasificación final mediante una capa Softmax. Los mapas de características multiescala (f1l, f2l y f3l) se concatenaron para formar la representación fusionada (Fl), que se refinó adicionalmente mediante una convolución de 3 × 3 para generar el mapa de características de salida para la capa subsiguiente. Esta arquitectura jerárquica permitió el aprendizaje de características espaciales complementarias en múltiples campos receptivos, mejorando el rendimiento en el reconocimiento de acciones deportivas.
5. Modelado temporal utilizando LSTM
Con el fin de modelar la evolución basada en el tiempo a lo largo de los bordes del video, la secuencia de características agregadas se proporcionó al sistema LSTM para capturar las dependencias dinámicas y la continuidad del movimiento. Para cada video de entrada, primero extraímos características CNN multiescala por cuadro. Sean los cuadros del video I1, …, IT. Para cada cuadro t y cada escala s, el codificador convolucional multiescala produce un vector de características ft(s) ∈ Rd. Luego se fusionan las escalas en un único descriptor de cuadro mediante proyección + concatenación o suma ponderada, como se muestra en la ecuación (8):
(8)
Luego, introduzca la secuencia {xt}tT=1 en una LSTM para modelar la dinámica temporal. En la notación estándar de LSTM, en el tiempo t las puertas y los estados se definen en las ecuaciones (9) a (13):
(9)
(10)
(11)
(12)
(13)
Aquí σ es la activación sigmoide, ⊙ es la multiplicación elemento a elemento. Aunque se pueden utilizar arquitecturas LSTM bidireccionales para capturar el contexto temporal pasado y futuro, el marco propuesto emplea un LSTM estándar para modelar las dependencias temporales a través de los fotogramas secuenciales del video. Esta elección de diseño es coherente con la arquitectura MSCNN-LSTM presentada en este estudio. Después de procesar el clip, se obtuvo una representación del clip (por ejemplo, último estado oculto o agrupamiento temporal): z = Poolt(vt).
Figura 4 ilustra el flujo de trabajo de la arquitectura LSTM propuesta para el reconocimiento de acciones deportivas. La red recibió una secuencia de fotogramas de video o características extraídas por una CNN y las procesó en pasos de tiempo sucesivos (t−2, t−1 y t). Cada celda LSTM constaba de una puerta de entrada, una puerta de olvido y una puerta de salida, que regulaban el flujo de información a través de la red. La puerta de entrada incorporaba nueva información al estado de la celda, la puerta de olvido descartaba información temporal irrelevante y la puerta de salida generaba el estado oculto que se propagaba al siguiente paso de tiempo. El estado de la celda preservaba dependencias temporales a largo plazo, mientras que el estado oculto capturaba información temporal a corto plazo. Tras el procesamiento secuencial, las salidas del LSTM se agruparon para generar una representación de características temporales, que se transmitió a una capa completamente conectada y a un clasificador Softmax para predecir la acción deportiva correspondiente. La red se entrenó utilizando el optimizador Adam durante 100 épocas con un tamaño de lote de 32, una tasa de aprendizaje inicial de 0,001 y una función de pérdida de entropía cruzada. Se seleccionó el modelo con la menor pérdida de validación para la evaluación final. Para garantizar la reproducibilidad, todos los experimentos se realizaron utilizando una semilla aleatoria fija de 42. Se emplearon la detención temprana y la reducción de la tasa de aprendizaje en meseta para mejorar la convergencia, y se aplicó recorte de gradientes con un umbral de 5,0 durante el entrenamiento del LSTM para evitar gradientes explosivos. El modelo MSCNN-LSTM propuesto contenía aproximadamente 15 millones de parámetros entrenables.
Las puntuaciones finales de la clase y la probabilidad utilizan una capa lineal + softmax como en la Ec. (14):
(14)
Entrene minimizando la pérdida de entropía cruzada sobre los clips etiquetados según la ecuación (15):
(15)
donde Nb es el tamaño del lote, C el número de clases, y y(n) es la verdad fundamental codificada en one-hot. Se aplica regularización (dropout en las salidas de xt/LSTM, decaimiento de pesos) y recorte de gradientes para ayudar a la estabilidad en secuencias largas de deportes.