В данном исследовании использовалась двухэтапная архитектура глубокого обучения для распознавания действий на спортивных видео, интегрирующая многомасштабную сверточную нейронную сеть (MSCNN) с сетью долгой краткосрочной памяти (LSTM). Для разработки и оценки модели использовались общедоступные эталонные наборы данных, а именно UCF11, UCF Sports и JHMDB. Новые данные от людей-участников не собирались, доступ к персонально идентифицируемой информации не осуществлялся, и такая информация не обрабатывалась. Поскольку исследование включало вторичный анализ общедоступных анонимизированных наборов данных и не предполагало прямого участия людей, институциональное этическое одобрение и информированное согласие не требовались.
Рабочий процесс состоял из выборки кадров и временной нормализации, после чего следовало извлечение признаков с использованием модуля MSCNN. Извлеченные признаки затем обрабатывались с помощью сети LSTM для временного моделирования и передавались на слой многоклассовой классификации. Наконец, модель была обучена и оценена с использованием выбранных эталонных наборов данных. Рисунок 1 иллюстрирует общую архитектуру предлагаемого фреймворка.

Рисунок 1: Предлагаемая архитектура MSCNN-LSTM для распознавания действий на спортивных видеозаписях.Общий рабочий процесс, иллюстрирующий предварительную обработку видео, многомасштабное извлечение пространственных признаков, изучение временных последовательностей и классификацию действий. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Рисунок 1 иллюстрирует рабочий процесс предлагаемой системы распознавания действий в спортивных видео на основе гибридной архитектуры MSCNN-LSTM. Процесс начинается со спортивных видеоклипов, содержащих различные атлетические действия, включая удары по мячу, верховую езду и замах в гольфе. На этапе предварительной обработки исходные видео были разложены на отдельные кадры, которые затем обрезались, стандартизировались и подготавливались для подачи на вход модели. Обработанные кадры затем подавались в модуль MSCNN для извлечения признаков. Многомасштабная сверточная архитектура фиксирует пространственные признаки в различных рецептивных полях, что позволяет извлекать как локальную, так и контекстуальную информацию из кадров спортивного видео. Извлеченные векторы признаков затем обрабатывались сетью LSTM для моделирования временных зависимостей и эволюции движения в последовательных кадрах. Наконец, модуль классификации и обучения использовал полученные пространственно-временные представления для предсказания категории действия для каждого видеоклипа. Предложенная система состоит из четырех последовательных этапов, начиная со сбора данных и предварительной обработки с использованием эталонных наборов данных UCF11 (YouTube Actions), UCF Sports и JHMDB. Каждое спортивное видео было преобразовано в последовательность кадров, которые были масштабированы, нормализованы и дополнены с помощью поворота, зеркального отражения и обрезки для повышения устойчивости к изменениям условий среды. Предварительно обработанные кадры затем обрабатывались предложенной многомасштабной сверточной нейронной сетью (MSCNN), где параллельные сверточные ветви с ядрами 3 × 3, 5 × 5 и 7 × 7 извлекали взаимодополняющие локальные и контекстуальные пространственные признаки. Эти многомасштабные признаки объединялись (конкатенировались) и уточнялись с помощью пакетной нормализации и макс-пулинга для создания компактных представлений признаков. Полученные признаки на уровне кадров впоследствии подавались в сеть долгой краткосрочной памяти (LSTM) для моделирования временных зависимостей между последовательными кадрами. Конечные выходные данные LSTM выпрямлялись и проходили через полносвязные слои с активацией ReLU, за которыми следовал классификатор Softmax для предсказания категории действия. Сеть обучалась с использованием оптимизатора Adam с функцией перекрестной энтропии потерь и регуляризацией dropout для уменьшения переобучения. Эффективность модели в итоге оценивалась на эталонных наборах данных UCF11, UCF Sports и JHMDB с использованием показателей точности (accuracy), прецизионности (precision), полноты (recall) и F1-меры (F1-score).
1. Сбор и предварительная обработка данных
В данном исследовании были использованы три общедоступных эталонных набора данных для анализа спорта и действий человека. Эти наборы данных содержат реальные видеозаписи спортивных мероприятий с различным движением камеры, ракурсами и сложностью фона. В частности, в исследовании использовался набор UCF11 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php), который включает 11 категорий действий, собранных из 1168 видеороликов YouTube, записанных примерно у 25 человек, с несколькими образцами для каждого действия. База данных совместно аннотированных движений человека (Joint-Annotated Human Motion Database, JHMDB)34,35 содержит 21 класс действий и 928 аннотированных видео. Набор данных UCF Sports состоит из 10 классов действий и 150 видеопоследовательностей, полученных из телевизионных эфиров с разрешением 720 × 480 пикселей (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).
В совокупности эти наборы данных охватывают как индивидуальные, так и командные виды спорта, обеспечивая вариативность временной продолжительности и визуального масштаба для оценки предлагаемой структуры распознавания действий MSCNN-LSTM. В рамках процесса проверки качества данных наборы UCF11, UCF Sports и JHMDB были проверены на наличие поврежденных видео, дубликатов файлов и клипов с неполной аннотацией. Образцов, соответствующих этим критериям исключения, выявлено не было; следовательно, все доступные видео были сохранены для последующего анализа. Затем наборы данных были разделены на обучающую (70%), валидационную (15%) и тестовую (15%) выборки с использованием единой стратегии случайного разделения. На рисунке 2 представлены репрезентативные изображения, использованные для обучения и оценки.

Рисунок 2: Репрезентативные кадры из эталонных наборов данных для распознавания спортивных действий.На панелях (A–D) представлены примеры из набора данных UCF11 (YouTube Actions), на панелях (E–H) — из набора данных UCF Sports, а на панелях (I–L) — из набора данных JHMDB. Кадры иллюстрируют вариации классов действий, ракурсов, фонов, условий освещения и сложности движения. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Предложенная модель распознавания действий была оценена на эталонных наборах данных UCF11, UCF Sports и JHMDB, как суммировано в Таблице 3. Эти наборы данных представляют разнообразные паттерны движения и сложные условия окружающей среды. Набор данных UCF11 (YouTube Actions) содержит спортивные действия из 11 классов, записанные при различном освещении, ракурсах и условиях фона. Набор данных UCF Sports состоит из 150 видеозаписей полевых видов спорта из профессиональных трансляций, содержащих реалистичные последовательности движений. Набор данных JHMDB предоставляет детальные аннотации движений человека для 21 категории детально описанных действий и служит эталонным набором данных для пространственно-временного распознавания действий. Вместе эти наборы данных использовались для оценки эффективности модели в сценариях спорта и действий человека. Сеть обучалась с использованием оптимизатора Adam в течение 100 эпох с размером пакета 32, начальной скоростью обучения 0.001 и функцией потерь перекрестной энтропии. Для окончательной оценки была выбрана модель с наименьшими потерями на валидации. Во всех экспериментах использовался фиксированный случайный seed 42. Для улучшения сходимости применялись ранняя остановка и снижение скорости обучения при выходе на плато; во время обучения LSTM использовалось отсечение градиентов с порогом 5.0 для предотвращения проблемы взрывного градиента. Предложенная модель MSCNN-LSTM содержала примерно 15 миллионов обучаемых параметров. Конфигурация оборудования и программного обеспечения, использованная для реализации, суммирована в Таблице 4. Поскольку распределение классов было достаточно сбалансированным, дополнительные процедуры взвешивания классов или ресэмплинга не применялись. Модели-сравнения были реализованы с использованием гиперпараметров, указанных в их оригинальных исследованиях, при этом настройки обучения были гармонизированы там, где это было возможно. Значения эффективности представлены как среднее ± стандартное отклонение по результатам пяти независимых запусков с разными случайными инициализациями. Различия между предложенной моделью и моделями-сравнениями оценивались с помощью парных t-тестов при пороге значимости p < 0.05.
| Набор данных | Кол-во классов | Количество видео | Разрешение (px) | [Здесь должен быть исходный текст для перевода. Пожалуйста, предоставьте текст, который необходимо перевести на русский язык.] | Описание |
| UCF11 (Действия в YouTube) | 11 | 1168 | Переменная (≈ 320×240) | Университет Центральной Флориды | Включает 11 видов действий человека из спорта (например, бросок в баскетболе, прыжки в воду, удар в гольфе, жонглирование мячом в футболе). Видеоматериалы собраны с YouTube и характеризуются высокой вариативностью освещения, ракурса и фона. |
| Спорт UCF | 10 | 150 | 720×480 | Набор данных спортивных действий UCF | Содержит записи спортивных мероприятий, таких как прыжки в воду, верховая езда, замах в гольфе, бег и тяжелая атлетика, записанные из реальных телевизионных трансляций (BBC, ESPN). |
| JHMDB | 21 | 928 | 320×240 | Институт интеллектуальных систем Общества Макса Планка | Включает повседневную и спортивную деятельность, такую как ловля предметов, прыжки, расчесывание волос, стрельба и бег, с совмещенными аннотациями для анализа движения и позы. |
Таблица 3: Характеристики эталонных наборов данных, использованных для обучения и оценки.Обзор наборов данных UCF11, UCF Sports и JHMDB, включая количество классов действий, видеообразцов, характеристики наборов данных и их роль в обучении, валидации и тестировании модели.
| Используемые параметры | Описание |
| Язык программирования | Python 3.8.18 [4] |
| Фреймворк глубокого обучения | TensorFlow 2.15.0 [1] |
| GPU-ускоритель | NVIDIA GeForce RTX 3090 (24 ГБ видеопамяти) [1] |
| ЦП (центральный процессор) | Intel Core i9 @ 3,5 ГГц × 16 ядер |
| Операционная система | Windows 11 |
| Оперативная память (ОЗУ) | 64 ГБ DDR4 |
| Оптимизатор | Adam (скорость обучения = 0,001) |
| Размер партии | 32 |
| Количество эпох | 100 |
| Функции активации | ReLU (слои CNN), Softmax (выходной слой) |
| Доля выбывших | 0.5 |
Таблица 4: Симуляционная среда и конфигурация гиперпараметров предложенной модели MSCNN-LSTM. Технические характеристики оборудования, программная среда, настройки оптимизатора, скорость обучения, размер пакета, количество эпох, размерность входных данных и другие гиперпараметры, использованные при обучении и оценке модели.
2. Предварительная обработка
Перед началом обучения каждое исходное видео было преобразовано в хронологическую последовательность кадров, а затем нормализовано, подвергнуто временному семплированию и аугментации. Каждое входное видео V сначала преобразовывалось в последовательность кадров и представлялось в виде 4D-тензора V ∈ RT×H×W×C, где T — количество кадров, H × W i обозначает индекс кадра, а C — количество цветовых каналов (3 для RGB). Конвейер предобработки состоял из извлечения кадров, пространственного изменения размера с последующей центральной или случайной обрезкой до фиксированного разрешения (H′, W′), попиксельной нормализации интенсивности и опциональной аугментации данных, включая случайный переворот, масштабирование и цветовое дрожание (color jittering), перед извлечением признаков. В частности, нормализация интенсивности была реализована либо как стандартная Z-нормализация, как в уравнении (1).
(1)
где μ, σ — средние значения и стандартные отклонения по каналам, вычисленные по обучающей выборке, или с использованием масштабирования min–max, как в уравнении (2).
(2)
После нормализации каждый кадр представлял собой F̃t ∈ RH′×W′×C′, а результирующий видеотензор представлял собой V′ ∈ RT×H′×W′×C. В многомасштабном сверточном фронтенде несколько пространственных карт признаков с различными рецептивными полями получали путем применения нескольких 2D-сверток (или 3D-сверток для ранних пространственно-временных сверток) с разным размером ядер; затем для каждого кадра или короткого видеоклипа создавалось временное представление признаков, которое передавалось в модуль LSTM. В оригинальной статье для временного моделирования используются MobileNetV2, а затем Deep BiLSTM; вышеописанный конвейер предобработки полностью совместим с заменой на многомасштабную свертку + LSTM.
3. Отбор проб и временная нормализация
Поскольку длительность видео T варьируется между наборами данных и внутри них, мы применяем равномерную выборку или временную передискретизацию кадров, чтобы обеспечить многомасштабной свертке + LSTM фиксированную длину входных данных N в виде кадров или коротких фрагментов. Равномерные индексы кадров могут быть вычислены согласно уравнению (3),
(3)
Таким образом, последовательность выбранных кадров представляет собой Vs = {F̃t0, …, F̃tN−1}. Когда требуется более высокая временная точность, мы выполняем линейную временную интерполяцию: для любого передискретизированного дробного времени τ ∈ [0, T−1], вычисленного согласно уравнению (4).
(4)
так, чтобы передискретизированная последовательность Vs содержала ровно N кадров и сохраняла плавность движения. В качестве альтернативы, дискретизация короткими непрерывными клипами (длина временного окна w с шагом s) дает набор тензоров клипов, где каждый клип Cj ∈ RT×H′×W′×C и j = 0, …, ⌊(T − w)/s⌋. Для временной нормализации внутри сети эффективно использование простого временного пулинга на нескольких масштабах: для последовательности временных признаков X = {x1, …, xN}, сформированной с помощью многомасштабных сверток, примените пулинг признаков, как показано в уравнении (5).
(5)
где Sк является ли временная поддержка масштабируемой к (например, Sк могут быть неперекрывающимися блоками или расширенными индексами) и мк = |Sк|.
Перед извлечением признаков все видео были масштабированы до 224 × 224 пикселей с частотой дискретизации 25 кадров в секунду. В каждом эксперименте использовалась постоянная длина последовательности, составляющая 32 кадра. Методы аугментации данных включали случайную обрезку (масштаб = 0.8–1.0), случайный поворот (±15°), случайное горизонтальное отражение (вероятность = 0.5) и изменение яркости (±20%). Для стандартизации значений пикселей использовались средние значения ImageNet [0.485, 0.456, 0.406] и стандартные отклонения [0.229, 0.224, 0.225]. Для временной выборки каждой видеопоследовательности применялся равномерный отбор кадров. Более длинные ролики равномерно обрезались или подвергались выборке для сохранения постоянной длины последовательности, в то время как видео, содержащие менее 32 кадров, дополнялись нулями. Данные настройки неизменно использовались на протяжении всего процесса обучения и оценки.
4. Извлечение признаков с помощью MSCNN
Для улучшения пространственного представления действий в спортивных видеороликах была применена многомасштабная сверточная нейронная сеть (MSCNN). Традиционные сверточные нейронные сети, полагающиеся на один размер ядра, могут иметь ограниченные возможности при захвате признаков на нескольких пространственных масштабах. Поскольку некоторые спортивные действия обладают схожими визуальными характеристиками, одномасштабной сверточной архитектуре может быть сложно одновременно фиксировать как локальные, так и глобальные признаки. Чтобы преодолеть этот недостаток, в предлагаемой структуре используются сверточные ядра разных размеров для проведения многомасштабного извлечения и слияния признаков.
В предлагаемой архитектуре сети использовались сверточные ядра размером 1 × 1 для организации информации по каналам и снижения размерности входных карт признаков. Кроме того, эти слои расширяют экспрессивные возможности сети за счет введения дополнительных преобразований признаков и нелинейных представлений. Сверточные ядра разных размеров позволяют извлекать пространственную информацию на нескольких масштабах. После взвешенного многомасштабного слияния признаков выполняется последовательная нормализация для повышения стабильности обучения. Чтобы смягчить проблемы затухания и взрыва градиентов при обучении глубокой сети, в предлагаемой архитектуре используются остаточные связи и временное моделирование на основе LSTM.
Многомасштабная архитектура расширяет возможности сети по захвату признаков при различных пространственных разрешениях и улучшает способность представления признаков. Кроме того, традиционное сверточное ядро N × N разлагается на операции свертки N × 1 и 1 × N. Свертки N × 1 и 1 × N, используемые в модуле MSCNN, предназначены для захвата взаимодополняющих направленных и многомасштабных пространственных признаков из отдельных видеокадров. Эти сверточные операции улучшают представление пространственных признаков за счет извлечения паттернов на различных масштабах рецептивного поля. Временные связи между последовательными кадрами впоследствии моделируются модулем LSTM, который обрабатывает последовательность признаков, извлеченных MSCNN, для изучения долгосрочных временных зависимостей с целью распознавания действий.
Каждое спортивное видео V = {F1, F2, …, FT} разлагается на T кадров. Для кодирования пространственных вариаций, например, позы игрока, размытия при движении, траектории мяча, используются сверточные ветви на трех различных масштабах s ∈ {1, 2, 3}, что соответствует размерам ядер 3 × 3, 5 × 5 и 7 × 7. Каждая ветвь извлекает карты признаков, как показано в уравнении (6):
(6)
Где Ws и bs — веса и смещения свертки в масштабе s, а σ — функция активации ReLU. Слой многомасштабного слияния объединяет признаки согласно уравнению (7):
(7)
Этот объединенный тензор признаков включает в себя как детализированные признаки движения, так и контекстную информацию по большим областям, такую как групповая активность. На рисунке 3 показан только модуль извлечения признаков MSCNN. Слой LSTM (256 скрытых блоков), полносвязный слой (128 нейронов) и слой дропаута (0,5), используемые для временного моделирования и классификации, представлены отдельно на рисунке 4.

Рисунок 3: Предлагаемый модуль извлечения признаков многомасштабной сверточной нейронной сети (MSCNN). Три параллельные сверточные ветви с размерами ядер 3 × 3, 5 × 5 и 7 × 7 извлекают взаимодополняющие многомасштабные пространственные признаки, которые объединяются перед временным моделированием с помощью сети LSTM. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Предлагаемая архитектура LSTM для распознавания действий на спортивных видеозаписях. Модуль LSTM моделирует временные зависимости с помощью операций входных, забывающих и выходных вентилей в последовательных видеокадрах. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Рисунок 3 иллюстрирует предлагаемый модуль извлечения признаков на основе многомасштабной сверточной нейронной сети (MSCNN) для распознавания действий в спортивных видеозаписях. Входные кадры видео обрабатывались параллельно через три сверточные ветви с размерами ядер 3 × 3, 5 × 5 и 7 × 7, каждая из которых содержала 64 фильтра для захвата дополняющих друг друга мелко- и крупнозернистых пространственных признаков. Результаты обрабатывались с помощью пакетной нормализации (Batch Normalization), функции активации ReLU и макс-пулинга 2 × 2, затем объединялись и объединялись с помощью свертки 1 × 1 со 128 фильтрами. Остаточное пропускное соединение (residual skip connection) позволило сохранить низкоуровневую пространственную информацию и улучшить поток градиентов. Объединенные карты признаков выравнивались и передавались на слой LSTM с 256 скрытыми блоками для временного моделирования, за которым следовал полносвязный слой со 128 нейронами, активацией ReLU и коэффициентом дропаута (dropout rate) 0,5 перед окончательной классификацией с использованием слоя Softmax. Многомасштабные карты признаков (f1l, f2l и f3l) были конкатенированы для формирования объединенного представления (Fl), которое затем уточнялось с помощью свертки 3 × 3 для генерации выходной карты признаков для последующего слоя. Данная иерархическая архитектура позволила изучать дополняющие друг друга пространственные признаки в нескольких рецептивных полях, что повысило эффективность распознавания спортивных действий.
5. Временное моделирование с использованием LSTM
Для моделирования временной эволюции по краям видео agregado-последовательность признаков была подана в систему LSTM для захвата динамических зависимостей и непрерывности движения. Для каждого входного видео мы сначала извлекли многомасштабные признаки CNN для каждого кадра. Пусть кадры видео будут I1, …, IT. Для каждого кадра t и каждого масштаба s многомасштабный сверточный кодировщик создает вектор признаков ft(s) ∈ Rd. Затем масштабы объединяются в единый дескриптор кадра либо путем проекции + конкатенации, либо с помощью взвешенной суммы, как показано в уравнении (8):
(8)
Затем подайте последовательность {xt}tT=1 в LSTM для моделирования временной динамики. В стандартной нотации LSTM в момент времени t гейты и состояния описываются уравнениями (9)–(13):
(9)
(10)
(11)
(12)
(13)
Здесь σ — это сигмоидальная функция активации, ⊙ — поэлементное умножение.) Хотя двунаправленные архитектуры LSTM могут быть использованы для захвата как прошлого, так и будущего временного контекста, в предлагаемой структуре применяется стандартная LSTM для моделирования временных зависимостей между последовательными кадрами видео. Данный выбор конструкции соответствует архитектуре MSCNN-LSTM, представленной в этом исследовании. После обработки клипа было получено представление клипа (например, последнее скрытое состояние или временной пулинг): z = Poolt(vt).
Рисунок 4 иллюстрирует рабочий процесс предложенной архитектуры LSTM для распознавания спортивных действий. Сеть принимала последовательность видеокадров или признаков, извлеченных с помощью CNN, и обрабатывала их на последовательных временных шагах (t−2, t−1 и t). Каждая ячейка LSTM состояла из входного затвора, затвора забывания и выходного затвора, которые регулировали поток информации через сеть. Входной затвор вносил новую информацию в состояние ячейки, затвор забывания удалял несущественную временную информацию, а выходной затвор формировал скрытое состояние, передаваемое на следующий временной шаг. Состояние ячейки сохраняло долгосрочные временные зависимости, в то время как скрытое состояние фиксировало краткосрочную временную информацию. После последовательной обработки выходные данные LSTM объединялись (пулинг) для создания временного представления признаков, которое передавалось на полносвязный слой и классификатор Softmax для прогнозирования соответствующего спортивного действия. Сеть обучалась с использованием оптимизатора Adam в течение 100 эпох с размером пакета 32, начальной скоростью обучения 0,001 и функцией потерь перекрестной энтропии. Для окончательной оценки была выбрана модель с наименьшими потерями на валидации. Для обеспечения воспроизводимости все эксперименты проводились с использованием фиксированного случайного зерна (seed) 42. Для улучшения сходимости применялись ранняя остановка и снижение скорости обучения при достижении плато, а во время обучения LSTM для предотвращения взрыва градиентов использовалось отсечение градиентов с порогом 5,0. Предложенная модель MSCNN-LSTM содержала примерно 15 миллионов обучаемых параметров.
Для получения окончательных показателей классов и вероятностей используется линейный слой + softmax, как в уравнении (14):
(14)
Обучение проводится путем минимизации перекрестной энтропии потерь по размеченным клипам, как показано в уравнении (15):
(15)
где Nb — размер пакета, C — количество классов, а y(n — истинное значение в формате one-hot кодирования. Регуляризация (дропаут для xt/выходов LSTM, распад весов). Для обеспечения стабильности при обработке длинных спортивных последовательностей применяется отсечение градиента.