В данном исследовании использовалась двухэтапная архитектура глубокого обучения для распознавания действий на спортивных видеозаписях, которая объединяет многомасштабную сверточную нейронную сеть (MSCNN) с сетью долгой краткосрочной памяти (LSTM). Для разработки и оценки модели использовались общедоступные эталонные наборы данных, а именно UCF11, UCF Sports и JHMDB. Новые данные от людей-участников не собирались, доступ к персональным данным не осуществлялся и их обработка не производилась. Поскольку исследование заключалось во вторичном анализе общедоступных анонимизированных наборов данных и не предполагало прямого участия людей, получение одобрения этического комитета учреждения и информированного согласия не требовалось.
Рабочий процесс включал выборку кадров и временную нормализацию с последующим извлечением признаков с помощью модуля MSCNN. Извлеченные признаки затем обрабатывались с использованием сети LSTM для временного моделирования и передавались на слой многоклассовой классификации. Наконец, модель была обучена и протестирована с использованием выбранных эталонных наборов данных. Рисунок 1 иллюстрирует общую архитектуру предлагаемой структуры.

Рисунок 1: Предложенная архитектура MSCNN-LSTM для распознавания действий на спорческом видео. Общий рабочий процесс, иллюстрирующий предварительную обработку видео, многомасштабное извлечение пространственных признаков, обучение временным последовательностям и классификацию действий. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Рисунок 1 иллюстрирует рабочий процесс предлагаемой системы распознавания действий в спортивных видеороликах на основе гибридной архитектуры MSCNN-LSTM. Процесс начинается со спортивных видеоклипов, содержащих различные атлетические действия, включая удары по мячу, верховую езду и замах в гольфе. На этапе предобработки исходные видео были разложены на отдельные кадры, которые затем обрезались, стандартизировались и подготавливались для подачи на вход модели. Предобработанные кадры затем подавались в модуль MSCNN для извлечения признаков. Многомасштабная сверточная архитектура фиксирует пространственные признаки в различных рецептивных полях, что позволяет извлекать как локальную, так и контекстуальную информацию из кадров спортивного видео. Извлеченные векторы признаков затем обрабатывались сетью LSTM для моделирования временных зависимостей и эволюции движения в последовательных кадрах. Наконец, модуль классификации и обучения использовал изученные пространственно-временные представления для прогнозирования категории действия для каждого видеоклипа. Предложенная система состоит из четырех последовательных этапов, начиная со сбора и предобработки данных с использованием эталонных наборов данных UCF11 (YouTube Actions), UCF Sports и JHMDB. Каждое спортивное видео было преобразовано в последовательность кадров, которые были изменены по размеру, нормализованы и дополнены с помощью поворота, отражения и обрезки для повышения устойчивости к изменениям окружающей среды. Предобработанные кадры затем обрабатывались предлагаемой многомасштабной сверточной нейронной сетью (MSCNN), где параллельные сверточные ветви с ядрами 3 × 3, 5 × 5 и 7 × 7 извлекали взаимодополняющие локальные и контекстуальные пространственные признаки. Эти многомасштабные признаки объединялись и уточнялись с помощью пакетной нормализации и макс-пулинга для создания компактных представлений признаков. Полученные признаки на уровне кадров впоследствии передавались в сеть долгой краткосрочной памяти (LSTM) для моделирования временных зависимостей между последовательными кадрами. Конечные выходные данные LSTM выравнивались и проходили через полносвязные слои с активацией ReLU, после чего следовал классификатор Softmax для прогнозирования категории действия. Сеть обучалась с использованием оптимизатора Adam с функцией потерь перекрестной энтропии и регуляризацией dropout для уменьшения переобучения. Эффективность модели в итоге оценивалась на эталонных наборах данных UCF11, UCF Sports и JHMDB с использованием показателей точности (accuracy), прецизионности (precision), полноты (recall) и F1-меры (F1-score).
1. Сбор и предварительная обработка данных
В данном исследовании использовались три общедоступных эталонных набора данных (бенчмарка) для анализа спорта и действий человека. Эти наборы данных содержат реальные записи спортивных мероприятий с различными движениями камеры, ракурсами и сложностью фона. В частности, в работе использовался набор UCF11 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php), который включает 11 категорий действий, собранных из 1 168 видеороликов с YouTube, записанных примерно у 25 человек, с несколькими примерами для каждого действия. База данных совместно аннотированных движений человека (Joint-Annotated Human Motion Database, JHMDB)34,35 содержит 21 класс действий и 928 аннотированных видео. Набор данных UCF Sports состоит из 10 классов действий и 150 видеопоследовательностей, полученных из эфирных источников с разрешением 720 × 480 пикселей (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).
В совокупности эти наборы данных охватывают как индивидуальные, так и командные виды спорта и обеспечивают вариативность по временной продолжительности и визуальному масштабу для оценки предлагаемой структуры распознавания действий MSCNN-LSTM. В рамках процесса проверки качества данных наборы UCF11, UCF Sports и JHMDB были изучены на предмет поврежденных видео, дублирующих файлов и клипов с неполной аннотацией. Образцов, соответствующих этим критериям исключения, выявлено не было; следовательно, все доступные видео были сохранены для последующего анализа. Затем наборы данных были разделены на обучающую (70%), валидационную (15%) и тестовую (15%) подвыборки с использованием стратегии согласованного случайного разделения. На рисунке 2 представлены репрезентативные изображения, использованные для обучения и оценки.

Рисунок 2: Репрезентативные кадры из эталонных наборов данных для распознавания спортивных действий. На панелях (A–D) представлены примеры из набора данных UCF11 (YouTube Actions), на панелях (E–H) — из набора данных UCF Sports, а на панелях (I–L) — из набора данных JHMDB. Кадры иллюстрируют вариации классов действий, ракурсов, фонов, условий освещения и сложности движения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Предложенная модель распознавания действий была протестирована на эталонных наборах данных UCF11, UCF Sports и JHMDB, сведения о которых приведены в таблице 3. Эти наборы данных характеризуются разнообразными паттернами движения и сложными условиями окружающей среды. Набор данных UCF11 (YouTube Actions) содержит спортивные действия 11 классов, записанные при различном освещении, ракурсах и условиях фона. Набор данных UCF Sports состоит из 150 видеозаписей полевых видов спорта из профессиональных трансляций, содержащих реалистичные последовательности движений. Набор данных JHMDB предоставляет детальную разметку движений человека для 21 категории детальных действий и служит эталонным набором данных для пространственно-временного распознавания действий. В совокупности эти наборы данных использовались для оценки эффективности модели в сценариях спорта и действий человека. Сеть обучалась с использованием оптимизатора Adam в течение 100 эпох с размером пакета 32, начальной скоростью обучения 0.001 и функцией потерь перекрестной энтропии. Для окончательной оценки была выбрана модель с наименьшими потерями на валидационной выборке. Во всех экспериментах использовалось фиксированное случайное число (seed) 42. Для улучшения сходимости применялись ранняя остановка и снижение скорости обучения при выходе на плато, а во время обучения LSTM использовалось отсечение градиентов с порогом 5.0 для предотвращения их взрыва. Предложенная модель MSCNN-LSTM содержала примерно 15 миллионов обучаемых параметров. Конфигурация аппаратного и программного обеспечения, использованная при реализации, приведена в таблице 4. Поскольку распределение классов было достаточно сбалансированным, дополнительные процедуры взвешивания классов или ресэмплинга не применялись. Модели-конкуренты были реализованы с использованием гиперпараметров, указанных в их оригинальных исследованиях, при этом настройки обучения были гармонизированы там, где это было возможно. Значения эффективности представлены как среднее ± стандартное отклонение по результатам пяти независимых запусков с различными случайными инициализациями. Различия между предложенной моделью и моделями-конкурентами оценивались с помощью парных t-тестов при пороге значимости p < 0.05.
| Набор данных | Количество классов | Кол-во видео | Разрешение (пкс) | Пожалуйста, предоставьте исходный текст для перевода. | Описание |
| UCF11 (действия в YouTube) | 11 | 1168 | Переменное (≈ 320×240) | Центральный университет Флориды | Включает 11 видов действий человека в спорте (например, бросок в баскетболе, прыжки в воду, замах в гольфе, жонглирование мячом в футболе). Видеоматериалы собраны из YouTube и характеризуются значительным разнообразием освещения, ракурсов съемки и фонов. |
| Спортивные достижения UCF | 10 | 150 | 720×480 | Набор данных спортивных действий UCF | Содержит записи спортивных мероприятий, таких как прыжки в воду, верховая езда, замах в гольфе, бег и тяжелая атлетика, записанные из реальных телевизионных трансляций (BBC, ESPN). |
| JHMDB | 21 | 928 | 320×240 | Институт интеллектуальных систем Общества Макса Планка | Включает повседневную и спортивную деятельность, такую как ловля предметов, прыжки, расчесывание волос, стрельба и бег, с совместной разметкой для анализа движения и позы. |
Таблица 3: Характеристики эталонных наборов данных, использованных для обучения и оценки. Обзор наборов данных UCF11, UCF Sports и JHMDB, включая количество классов действий, видеообразцов, характеристики наборов данных, а также их роль в обучении, валидации и тестировании модели.
| Используемые параметры | Описание |
| Язык программирования | Python 3.8.18 [4] |
| Фреймворк глубокого обучения | TensorFlow 2.15.0 [1] |
| GPU-акселератор | NVIDIA GeForce RTX 3090 (24 ГБ видеопамяти) [1] |
| ЦП (центральный процессор) | Intel Core i9 @ 3,5 ГГц × 16 ядер |
| Операционная система | Windows 11 |
| Оперативная память (ОЗУ) | 64 ГБ DDR4 |
| Оптимизатор | Adam (скорость обучения = 0,001) |
| Размер партии | 32 |
| Количество эпох | 100 |
| Функции активации | ReLU (слои CNN), Softmax (выходной слой) |
| Доля выбывания | 0.5 |
Таблица 4: Симуляционная среда и конфигурация гиперпараметров предлагаемой модели MSCNN-LSTM. Технические характеристики оборудования, программная среда, настройки оптимизатора, скорость обучения, размер пакета, количество эпох, входные размерности и другие гиперпараметры, использованные при обучении и оценке модели.
2. Предварительная обработка
Перед обучением каждое исходное видео было преобразовано в упорядоченную по времени последовательность кадров, а затем нормализовано, подвергнуто временному сэмплированию и аугментации. Каждое входное видео V сначала преобразовывалось в последовательность кадров и представлялось в виде 4D-тензора V ∈ RT×H×W×C, где T — количество кадров, H × W i обозначает индекс кадра, а C — количество цветовых каналов (3 для RGB). Конвейер предобработки состоял из извлечения кадров, пространственного изменения размера с последующей центральной или случайной обрезкой до фиксированного разрешения (H′, W′), попиксельной нормализации интенсивности и опциональной аугментации данных, включая случайное отражение, масштабирование и цветовой джиттер, перед извлечением признаков. Конкретно, нормализация интенсивности была реализована либо как стандартная Z-нормализация, как в уравнении (1).
(1)
где μ, σ — средние значения и стандартные отклонения по каналам, вычисленные на обучающей выборке, или же используется масштабирование min–max, как в уравнении (2).
(2)
После нормализации каждый кадр представлялся как F̃t ∈ RH′×W′×C′, а результирующий видеотензор представлялся как V′ ∈ RT×H′×W′×C. В многомасштабном сверточном фронтенде несколько пространственных карт признаков с различными рецептивными полями получались путем применения нескольких 2D-сверток (или 3D-сверток для ранних пространственно-временных сверток) с разными размерами ядер; затем для каждого кадра или короткого видеоклипа формировалось временное представление признаков, которое передавалось в модуль LSTM. В оригинальной работе для временного моделирования использовались MobileNetV2, а затем Deep BiLSTM; вышеописанный конвейер предобработки полностью совместим с заменой на многомасштабную свертку + LSTM.
3. Отбор проб и временная нормализация
Поскольку длительность видео T различается между наборами данных и внутри них, мы проводим равномерную выборку или временной ресемплинг кадров, чтобы обеспечить многомасштабной свертке + LSTM фиксированную длину входных данных N в виде кадров или коротких фрагментов. Равномерные индексы кадров могут быть вычислены согласно уравнению (3),
(3)
Таким образом, последовательность выбранных кадров представляет собой Vs = {F̃t0, …, F̃tN−1}. В случаях, когда требуется более высокая временная точность, выполняется линейная временная интерполяция: для любого передискретизированного дробного значения времени τ ∈ [0, T−1], вычисленного согласно уравнению (4).
(4)
чтобы передискретизированная последовательность Vs содержала ровно N кадров и сохраняла плавность движения. В качестве альтернативы, дискретизация короткими непрерывными клипами (длина временного окна w с шагом s) дает набор тензоров клипов, где каждый клип Cj ∈ RT×H′×W′×C и j = 0, …, ⌊(T − w)/s⌋. Для временной нормализации внутри сети эффективен простой временной пулинг на нескольких масштабах: для последовательности временных признаков X = {x1, …, xN}, сгенерированной многомасштабными свертками, примените пулинг признаков, как показано в уравнении (5).
(5)
где Sк является ли временная поддержка для масштабирования к (например, Sк могут быть неперекрывающимися блоками или расширенными индексами) и мк = |Sк|.
Перед извлечением признаков все видео были масштабированы до 224 × 224 пикселей с частотой дискретизации 25 кадров в секунду. В каждом эксперименте использовалась постоянная длина последовательности, равная 32 кадрам. Методы аугментации данных включали случайную обрезку (масштаб = 0.8–1.0), случайный поворот (±15°), случайное горизонтальное отражение (вероятность = 0.5) и изменение яркости (±20%). Для стандартизации значений пикселей использовались средние значения ImageNet [0.485, 0.456, 0.406] и стандартные отклонения [0.229, 0.224, 0.225]. Для временной выборки в каждой видеопоследовательности применялся метод равномерного отбора кадров. Более длинные видео равномерно обрезались или подвергались выборке для сохранения постоянной длины последовательности, тогда как видео с количеством кадров менее 32 дополнялись нулями. Эти настройки неизменно использовались на протяжении всего процесса обучения и оценки.
4. Извлечение признаков с использованием MSCNN
Для улучшения пространственного представления действий в спортивных видеороликах была использована многомасштабная сверточная нейронная сеть (MSCNN). Традиционные сверточные нейронные сети, основанные на одном размере ядра, могут иметь ограниченные возможности при извлечении признаков в нескольких пространственных масштабах. Поскольку некоторые спортивные действия обладают схожими визуальными характеристиками, одномасштабной сверточной архитектуре может быть сложно одновременно фиксировать как локальные, так и глобальные признаки. Чтобы преодолеть это ограничение, в предлагаемой структуре используются сверточные ядра разных размеров для многомасштабного извлечения и слияния признаков.
В предлагаемой архитектуре сети использовались сверточные ядра 1 × 1 для организации информации по каналам и снижения размерности входных карт признаков. Кроме того, эти слои расширяют экспрессивные возможности сети за счет введения дополнительных преобразований признаков и нелинейных представлений. Сверточные ядра различных размеров позволяют извлекать пространственную информацию на нескольких масштабах. После взвешенного многомасштабного слияния признаков выполняется последовательная нормализация для повышения стабильности обучения. Чтобы смягчить проблемы затухания и взрыва градиентов при обучении глубокой сети, в предлагаемой архитектуре используются остаточные связи и временное моделирование на основе LSTM.
Многомасштабная архитектура расширяет возможности сети по захвату признаков при различных пространственных разрешениях и улучшает способность представления признаков. Кроме того, традиционное сверточное ядро N × N разлагается на операции свертки N × 1 и 1 × N. Свертки N × 1 и 1 × N, используемые в модуле MSCNN, предназначены для извлечения взаимодополняющих направленных и многомасштабных пространственных признаков из отдельных видеокадров. Эти операции свертки улучшают представление пространственных признаков за счет извлечения паттернов на разных масштабах рецептивного поля. Временные связи между последовательными кадрами впоследствии моделируются модулем LSTM, который обрабатывает последовательность признаков, извлеченных MSCNN, для изучения долгосрочных временных зависимостей с целью распознавания действий.
Каждое спортивное видео V = {F1, F2, …, FT} разлагается на T кадров. Для кодирования пространственных вариаций, например, позы игрока, размытия при движении, траектории мяча, используются сверточные ветви на трех различных масштабах s ∈ {1, 2, 3}, соответствующих размерам ядер 3 × 3, 5 × 5 и 7 × 7. Каждая ветвь извлекает карты признаков согласно уравнению (6):
(6)
Где Ws и bs — веса и смещения свертки в масштабе s, а σ — функция активации ReLU. Слой многомасштабного слияния объединяет признаки согласно уравнению (7):
(7)
Этот объединенный тензор признаков включает в себя как детальные признаки движения, так и контекстную информацию по большим областям, такую как групповая активность. На Рисунке 3 показан только модуль извлечения признаков MSCNN. Слой LSTM (256 скрытых блоков), полносвязный слой (128 нейронов) и слой дропаута (0,5), используемые для временного моделирования и классификации, представлены отдельно на Рисунке 4.

Рисунок 3: Предложенный модуль извлечения признаков многомасштабной сверточной нейронной сети (MSCNN). Три параллельные сверточные ветви с размерами ядер 3 × 3, 5 × 5 и 7 × 7 извлекают взаимодополняющие многомасштабные пространственные признаки, которые объединяются перед временным моделированием с помощью сети LSTM. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 4: Предлагаемая архитектура LSTM для распознавания действий в спортивных видео. Модуль LSTM моделирует временные зависимости с помощью операций входного, забывающего и выходного гейтов в последовательных кадрах видео. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Рисунок 3 иллюстрирует предлагаемый модуль извлечения признаков на основе многомасштабной сверточной нейронной сети (MSCNN) для распознавания действий в спортивных видеороликах. Входные кадры видео обрабатывались параллельно тремя сверточными ветвями с размерами ядер 3 × 3, 5 × 5 и 7 × 7, каждая из которых содержала 64 фильтра для захвата взаимодополняющих мелкозернистых и крупнозернистых пространственных признаков. Результаты обрабатывались с помощью пакетной нормализации (Batch Normalization), функции активации ReLU и макспулинга 2 × 2, затем объединялись (конкатенировались) и объединялись с помощью свертки 1 × 1 со 128 фильтрами. Остаточная связь (residual skip connection) позволяла сохранить низкоуровневую пространственную информацию и улучшить поток градиентов. Объединенные карты признаков выравнивались и передавались на слой LSTM с 256 скрытыми блоками для временного моделирования, после чего следовал полносвязный слой со 128 нейронами, функцией активации ReLU и коэффициентом дропаута 0,5 перед финальной классификацией с использованием слоя Softmax. Многомасштабные карты признаков (f1l, f2l и f3l) конкатенировались для формирования объединенного представления (Fl), которое затем уточнялось с помощью свертки 3 × 3 для генерации выходной карты признаков для следующего слоя. Данная иерархическая архитектура позволила изучать взаимодополняющие пространственные признаки в нескольких рецептивных полях, что повысило эффективность распознавания спортивных действий.
5. Временное моделирование с использованием LSTM
Для моделирования временной эволюции по кадрам видео последовательность агрегированных признаков была подана в систему LSTM для фиксации динамических зависимостей и непрерывности движения. Для каждого входного видео мы сначала извлекали многомасштабные признаки CNN для каждого кадра. Пусть кадры видео будут I1, …, IT. Для каждого кадра t и каждого масштаба s многомасштабный сверточный кодировщик формирует вектор признаков ft(s) ∈ Rd. Затем масштабы объединяются в единый дескриптор кадра с помощью проекции + конкатенации или взвешенной суммы, как показано в уравнении (8):
(8)
Затем подайте последовательность {xt}tT=1 в LSTM для моделирования временной динамики. В стандартном обозначении LSTM для момента времени t вентили и состояния определяются уравнениями (9)–(13):
(9)
(10)
(11)
(12)
(13)
Здесь σ — сигмоидная функция активации, ⊙ — поэлементное умножение. Хотя для захвата временного контекста как прошлого, так и будущего могут быть использованы двунаправленные архитектуры LSTM, в предлагаемом фреймворке для моделирования временных зависимостей между последовательными кадрами видео используется стандартная LSTM. Данный выбор архитектуры соответствует структуре MSCNN-LSTM, представленной в настоящем исследовании. После обработки клипа было получено его представление (например, последнее скрытое состояние или временной пулинг): z = Poolt(vt).
Рисунок 4 иллюстрирует рабочий процесс предлагаемой архитектуры LSTM для распознавания спортивных действий. Сеть получала последовательность видеокадров или признаков, извлеченных с помощью CNN, и обрабатывала их на последовательных временных шагах (t−2, t−1 и t). Каждая ячейка LSTM состояла из входного вентиля, вентиля забывания и выходного вентиля, которые регулировали поток информации через сеть. Входной вентиль внедрял новую информацию в состояние ячейки, вентиль забывания удалял нерелевантную временную информацию, а выходной вентиль формировал скрытое состояние, передаваемое на последующий временной шаг. Состояние ячейки сохраняло долгосрочные временные зависимости, в то время как скрытое состояние фиксировало краткосрочную временную информацию. После последовательной обработки выходные данные LSTM объединялись (пулинг) для создания темпорального представления признаков, которое передавалось на полносвязный слой и классификатор Softmax для прогнозирования соответствующего спортивного действия. Сеть обучалась с использованием оптимизатора Adam в течение 100 эпох с размером батча 32, начальной скоростью обучения 0.001 и функцией потерь перекрестной энтропии. Для финальной оценки была выбрана модель с наименьшими потерями на валидации. Для обеспечения воспроизводимости все эксперименты проводились с использованием фиксированного случайного числа (seed) 42. Для улучшения сходимости применялись ранняя остановка и снижение скорости обучения при выходе на плато, а во время обучения LSTM использовалось отсечение градиентов с порогом 5.0 для предотвращения проблемы взрывающихся градиентов. Предложенная модель MSCNN-LSTM содержала приблизительно 15 миллионов обучаемых параметров.
Итоговые показатели классов и вероятности определяются с помощью линейного слоя и функции softmax, как показано в уравнении (14):
(14)
Обучение проводится путем минимизации перекрестной энтропии потерь по размеченным клипам, как показано в уравнении (15):
(15)
где Nb — размер пакета, C — количество классов, а y(n) — истинное значение в формате one-hot. Регуляризация (dropout для xt/выходов LSTM, weight decay). Для повышения стабильности при работе с длинными спортивными последовательностями применяется обрезка градиента (gradient clipping).