Research Article

Мультимодальная структура на основе трансформеров для анализа тактических решений в командных видах спорта с применением в футболе

DOI:

10.3791/69806

January 27th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Для улучшения тактической категоризации решений в футболе в этом исследовании предлагается мультимодальная модель слияния на базе Transformer, включающая визуальные, локационные, акустические и контекстные данные. Модель достигает почти реального времени на мультимодальном наборе данных из 500 последовательностей, превосходя базовые линии CNN-LSTM, BiLSTM-Attention и GNN по точности и неправильной классификации, вызванной давлением.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В современном футболе необходимы быстрые и точные тактические решения. Однако традиционные подходы к оценке тактического принятия решений имеют слабую экологическую обоснованность и не поддаются легкому масштабированию. Для решения этих проблем в этой статье представлена модель мультимодального слияния на основе трансформеров, которая включает позиционирование игроков, видео, аудио и контекстные метаданные для классификации тактических решений в реальном времени. Эксперименты проводились с 40 мужчинами-исполнителями и набором данных, включающим 500 последовательностей мультимодальных игр. Набор данных на 40 игроков относится к контролируемым лабораторным экспериментам по принятию решений, используемым для начальной валидации и оценки надёжности. Затем из расширенных симуляций матчей и записей реальных игр было извлечено 500 мультимодальных последовательностей для получения большого набора данных, используемого для обучения и тестирования модели мультимодальных трансформаторов.

Он обрабатывает входные данные в пять этапов: сбор данных, предварительная обработка, извлечение признаков, синтез на основе трансформаторов и классификация решений. По сравнению с базовыми стандартами CNN-LSTM, BiLSTM-Attention и GNN, предлагаемый подход повышает точность прогнозирования принятия решений на 28% и снижает ошибочную классификацию, вызванную давлением, на 41%, при низкой задержке вывода 52,6 мс, что делает его подходящим для приложений почти в реальном времени. Обобщимость результатов в более разнообразных тактических контекстах и на более широкую демографию спортсменов также ограничена относительно небольшим размером и однородностью в выборке молодых мужчин-игроков из одного региона. Эти результаты подчёркивают вклад мультимодального синтеза на основе трансформаторов в автоматизированный анализ тактических решений и указывают на необходимость его дальнейшей валидации в более разнообразных и масштабных матчевых ситуациях.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Командные виды спорта, такие как футбол, требуют быстрых тактических решений в динамичных и нестабильных условиях. Игроки должны постоянно читать визуальную информацию с мяча, товарищей по команде и соперников и отвечать в течение долей секунды, чтобы обеспечить конкурентное преимущество. Тактическое принятие решений в футболе сильно зависит от быстрого восприятия движений игрока, траектории мяча и ситуационных сигналов. Хотя общие перцептивно-когнитивные навыки, такие как время реакции и избирательное внимание, действительно влияют на результаты, недавние исследования делают акцент на моделях, основанных на данных и контексте, которые могут приближать реальное тактическое мышление в игре 1,2,3,4,5. Время реакции и восприятие, такие как когнитивные способности, также играют ключевую роль врезультатах 6,7,8. Недавние исследования в области спортивной когниции показали, что тактическое принятие решений опирается не только на перцептивные навыки, но и на способность спортсмена интегрировать динамическую пространственную информацию, давление соперника и контекстуальные игровые сигналы в реальном времени. Исследования перцептивно-когнитивной экспертизы показывают, что более грамотные тактически игроки быстрее распознают сигналы, эффективнее усваивают информацию и демонстрируют более стабильные модели принятия решений под давлением. Такие результаты подтверждают необходимость вычислительных моделей, способных отражать сложную и многоуровневую природу спортивных процессов принятия решений.

Классические методы оценки тактического принятия решений часто используют контролируемые лабораторные задачи и субъективные экспертные суждения, которые накладывают значительные ограничения на экологическую валидность и масштабируемость. Недавние достижения в области глубокого обучения открывают потенциал автоматизации процесса с помощью мультимодальных источников данных — таких как видео, отслеживание позиции и метаданные контекстного совпадения — в рамках временных и кроссмодальных архитектур захвата зависимостей. Несмотря на этот прогресс, большинство современных моделей по-прежнему основаны на моделях Convolutional Neural Neural Networks — Long-Short Term Memory или Bidirectional Long-Short Term Memory (CNN-LSTM или BiLSTM), которые имеют ограниченные возможности моделирования долгосрочных зависимостей между модальностями. Этот недостаток является движущей силой разработки мультимодальных моделей слияния на основе трансформаторов, которые лучше способны более комплексно и стабильно моделировать тактическое принятие решений в футбольных сценариях. В командном виде футбола, например, игрокам необходимо быстро оценивать информацию о мяче, включая своих товарищей по команде, соперников и позицию на поле. Прежде чем принять решение о наилучшем плане действий, исходя из своих способностей, указаний тренера и обстоятельств игры,9 и 10. Благодаря доступности организованных наборов данных и определённых тактических компонентов, это исследование сосредоточено исключительно на футболе; однако тактические принципы принятия решений применимы к многим командным видам спорта.

Действительно, предыдущие исследования показывают, что CNN-LSTM и BiLSTM не могут захватить очень дальние временные зависимости с помощью фиксированного рецептивного поля или ограничения последовательнымгейтингом 11,12,13. Аналогично, фундаментальные работы по распознаванию действий и мультимодальному временному моделированию показывают, что производительность модели на основе LSTM снижается с увеличением длины последовательности или когда контекстуальные сигналы появляются с интервалом нескольких кадров, что может ограничивать экологическую валидность в динамических спортивных условиях. Кроме того, модели на основе графовых нейронных сетей (GNN) являются мощными инструментами для моделирования пространственных взаимодействий, но они постоянно ухудшаются в сценариях, требующих детализированного временного мышления, или в случаях, когда контекстуальные сигналы давления быстро меняются вовремени 14,15. В отличие от этих подходов, более современные фреймворки на основе трансформеров демонстрируют своё превосходство в спортивной аналитике, распознавании человеческой активности и видео-языковых задачах через совместную интеграцию дальних временных сигналов, пространственных связей и контекстуальных сигналов в одном проходе вперёд, что обеспечивается глобальным самосознанием. Такие результаты бенчмарков оправдывают выбор архитектуры на основе трансформаторов в качестве основы для предлагаемой модели в текущем исследовании.

Улучшение тактических знаний и понимания тактических принципов доказано является ключевым для решения игровых ограничений и проблем16,17. Футболисты осваивают различные игровые элементы, включая прорыв, защиту в атаке, движение, время, ограничения, защиту в защите, баланс и концентрацию, через техническо-тактическуюподготовку 18. По мере того как игроки получают больше футбольного опыта, их понимание технических и тактических основ должно расти. Таким образом, игроки могут легче распознавать важные сигналы, что облегчает принятие правильных решений для каждого правила игры в конкретномсценарии 19. Благодаря этому игроки могут использовать свою моторную эффективность и навыки принятия решений, чтобы дополнить движения специализированными талантами.

Автор использовал принятие решений по нескольким атрибутам для анализа фитнес-пользы от упражнений и привычек, иллюстрируя эффективность квалифицированных тренировочных способностей в физическом воспитании среди студентов колледжей. Эффективная физическая активность, формирование здоровых фитнес-привычек и продвижение реформ в образе спорта в учебных заведениях получают значительное значение. Для эффективного принятия решений используется интуиционистское нечеткое взвешенное геронское среднее значение (IFWHM) с помощью с нечеткими числами. Результаты поддержали когнитивные успехи студентов университета и показали более точную оценку их проблем с физическим здоровьем. Для обнаружения латентных связей в данных исследователь20 использовал дополненный метод Априори. Выводы исследования имеют отношение к оценке физического здоровья студентов в высшем образовании. Первый результат определяется путём оценки усталости разных ориентаций в зависимости от их частоты.

Предыдущие исследования на основе искусственного интеллекта в спортивной аналитике были сосредоточены на задачах компьютерного зрения, включая обнаружение игроков, отслеживание и распознавание групповых активностей. Недавние слабо контролируемые и свободные от детекторов архитектуры показали важность мультимодального и контекстно-ориентированного моделирования для понимания тактического поведения. Эти достижения требуют интеграции мультимодального глубокого обучения для классификации тактических решений в футболе. Используя латентные векторы признаков, полученные из матрицы утилитарных систем посредством факторизации матрицы, он вычисляет косинусное сходство между пользователями и пользователями или элементами и элементами, представленными в этой статье.

Недавние исследования в области спортивной аналитики сместились в сторону мультимодальных и контекстно-ориентированных фреймворков глубокого обучения, которые объединяют видео, позиционные данные и контекстуальные сигналы для интерпретации тактического поведения. Различные подходы на основе трансформеров показали сильные возможности моделирования долгосрочной временной структуры и межмодальных отношений в спортивных условиях, включая следующие: MM-ViT для мультимодального распознавания действий, унифицированные контрастные термо-трансформеры для спортивно-контекстного мышления и детекторы событий с перекрёстнымвниманием 21,22. Эти подходы показывают, что тактические решения лучше всего представлены с помощью архитектур, отражающих взаимодействие между игроками, пространством, сигналами движения и контекстной информацией, а не одномодальными моделями CNN-LSTM. Учитывая это направление, предлагаемое исследование также будет использовать мультимодальную структуру слияния на основе трансформаторов для совместной обработки визуальных, позиционных и контекстуальных сигналов для почти реального времени моделирования футбольных тактических решений.

Предыдущие модели футбольного анализа обычно строились на архитектуре CNN-LSTM или BiLSTM, которые фиксируют локальные временные паттерны, но испытывают трудности с долгосрочными зависимостями между модальностями. Трансформеры заполняют этот пробел, применяя глобальное самосознание, позволяя модели связывать движения игроков, траектории мяча и ситуативные сигналы через расширенные временные окна ключевых возможностей для надёжного анализа тактических решений. Для решения проблемы редкости рейтинговых данных для рекомендательных систем автор23,24 предложил метод факторизации матриц на основе обзоров, сочетающий совместную фильтрацию на основе рецензий и импутацию рейтинга.

Тем не менее, их эффективность, масштабируемость и применимость этих методов серьёзно ограничены их зависимостью от ограничивающих рамок для вывода и огромной потребностью в маркировке данных. Один из способов решения этой проблемы — использование меток ограничивающих коробок для одновременного обучения распознаванию игроков и групповойактивности 25,26,27,28. Хотя аннотации ограничивающих ящиков на уровне акторов всё ещё необходимы для обучающих данных, предлагаемый метод рассчитывает ограничивающие рамки игроков при выводе. Подход слабо контролируемой групповой активности (WSGAR), который не требует меток на уровне акторов для обучения или вывода, направлен на облегчение нагрузки на аннотирование. После генерации предложений ограничивающих коробок с использованием предварительно обученного детектора на внешнем наборе данных они научились фильтровать нерелевантные обнаружения. Недавно29 года исследователи представили подход без детекторов для вызова WSGAR, который использует встраивания токенов для генерации частичных контекстов, собирающих информацию о игроках.

В спортивной аналитике мультимодальные и трансформерные архитектуры недавно приобрели значение, поскольку они могут фиксировать дальнодействующие временные паттерны и интегрировать гетерогенные потоки данных30,31. Варианты трансформаторов применялись для прогнозирования движений игроков, проведения многовидного тактического анализа и распознавания намерений действий, демонстрируя выдающуюся временную рефлексию по сравнению с моделью CNN-LSTM. Мультимодальные стратегии слияния, сочетающие видео, позиционирование и контекстные подсказки, дали обнадеживающие ранние результаты в тактическом моделировании в реальном времени и подчеркнули важность кросс-внимания и обучения последовательности последовательности для понимания динамики принятия решений в игре.

Мультимодальные фреймворки на основе трансформаторов недавно продемонстрировали выдающиеся результаты в различных секторах, где необходима интеграция различных потоков данных. Например, мультимодальные слияния на основе ViT применялись для совместной интерпретации видео, позы и аудиоинформации с использованием процессов перекрёстного внимания для контекстно-ориентированного прогнозирования событий, отслеживания игроков и распознавания действий32,33. Кроме того, архитектура MM-Former и Perceiver превосходит повторяющиеся и сверточные модели в слиянии пространственно-временных сигналов, а также в долгосрочном временном мышлении в спортивной аналитике и анализе человеческойактивности 34. Эти результаты подтверждают использование архитектуры мультимодального синтеза на основе трансформаторов в данном исследовании, указывая на то, что трансформаторы способны фиксировать тонкие взаимодействия между модальностями с помощью глобальноговнимания 35. Трансформаторы особенно подходят для тактического анализа, поскольку их глобальное внимание позволяет модели связывать визуальные сигналы, позиционные данные и контекстные сигналы через более длинные временные окна — возможностей, которых не хватает моделям CNN-LSTM и BiLSTM.

Предыдущие исследования в основном использовали вручную формируемые и подтверждённые оценки для оценки скорости и точности принятия решений в заранее запланированных действиях, таких как вождение и обгон, несмотря на растущий интерес к оценке тактического принятия решений в командныхвидах спорта 36,37,38. Эти фреймворки имеют границы с точки зрения масштабируемости, объективности и уместности для динамичных, реальных обстоятельств, несмотря на то, что предоставляют содержательные данные о поведении игроков и высоком уровне принятиярешений 39. Компьютеризированные подходы, основанные на данных, способные фиксировать и понимать мультимодальный характер тактического принятия решений, включающий сложные ассоциации между действиями игрока, визуальными сигналами, аудиосигналами и настройками игры, не объединены в современныеметоды 40, 41 и 42. Кроме того, многогранные структуры ИИ, способные переключаться между фоновым и временным отношениями, часто остаются незамеченными этими методами. Развитие мультимодального фьюжн-фреймворка на базе Transformer, использующего богатые источники данных в реальном времени, такие как видеозаписи и отслеживание позиции, а также интегрирующую процессы принятия решений в командных видах спорта, явно отсутствует. Сокращение этого разрыва может значительно повысить тактическую проникновение, масштабируемость и независимость принятия решений в условиях высокоэффективного спорта. В отличие от современных методологий CNN-LSTM и BiLSTM, этот синтез на основе трансформаторов сознательно моделирует кроссмодальное внимание между визуальной, пространственной и контекстной информацией. Такая новизна способствует более плотному тактическому представлению и помогает минимизировать неправильную классификацию в сценариях давления более чем на 40%.

Основная цель данного исследования — разработать трансформерную мультимодальную слиятельную структуру для оценки тактического принятия решений в футболе. Хотя предлагаемую структуру можно обобщить на другие командные виды спорта, данное исследование сосредоточено на футболе из-за его тактической сложности и доступности структурированных наборов данных. Система позволяет структурированно оценивать тактическую точность и время реакции в контролируемых, изолированных футбольных задачах на основе экспертных оценок. Эта работа решает ограничения сред ручной оценки и статического тестирования, интегрируя мультимодальные источники данных, включая отслеживание позиции, видеоматериалы, аудиосигналы и контекстную информацию о игре.

Используя процессы внимания на основе трансформеров, предлагаемая структура постоянно осваивает мультимодальные связи, позволяя единую и контекстно-ориентированную интерпретацию методов принятия решений игроками в реальном времени.

Основная цель этого решения — способствовать интеллектуальной оценке эффективности в спорте, предоставляя тренерам и аналитикам более глубокое понимание мышления игроков и командной динамики с помощью аналитики, основанной на данных.

Предлагаемая структура будет постоянно изучать интермодальные отношения, используя механизмы внимания трансформеров, что позволит ей получить единое понимание стратегий принятия решений игроками в играх в реальном времени.

Таким образом, она даёт системе возможность предоставлять практическое понимание тактического поведения, которое иначе трудно охарактеризовать стандартными методами оценки.

Цель — повысить интерпретируемость и предоставить тренерам и аналитикам более полезную информацию.

Основной вклад этой работы приведён ниже:

В данном исследовании используется мультимодальный синтез на базе трансформеров для представления новой модели глубокого обучения для анализа тактического принятия решений в командных видах спорта.

Интегрируя визуальные, позиционные и контекстные потоки данных, извлечённых из видеозаписей реальных игр, этот подход значительно расширяет охват простых методов оценки, введённых в базовое исследование, которые были сосредоточены на одиночных передачах и действиях драйва.

Мультимодальный кодировщик собирает сложные пространственно-временные отношения, интегрируя данные отслеживания игроков, визуальные кадры и контекстные события матчей с помощью механизмов внимания.

Эксперименты на эталонном футбольном наборе показали, что эта модель превосходит традиционные базовые показатели, такие как методы синтеза на основе CNN и LSTM.

По сравнению с базовыми уровнями CNN-LSTM, BiLSTM-Attention и GNN, это предполагает, что архитектура мультимодального синтеза на основе трансформаторов демонстрирует значительные улучшения.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В исследование приняли участие 40 футболистов-мужчин в возрасте 18-24 лет (среднее = 20,1 ± 1,2), набранных из четырёх любительских и полупрофессиональных клубов в рамках одной региональной лиги. Все участники имели не менее трёх лет опыта соревнований и в настоящее время проходили обучение в структурированной среде. Сбор данных проводился в двух контролируемых условиях: во-первых, на стандартизированных тренировочных учениях, которые моделировали тактические сценарии принятия решений о передаче/проезде; во-вторых, в длительных сессиях симуляции матчей, из которых извлекались мультимодальные последовательности. Все процедуры были утверждены Институциональным комитетом по этике Университета залива Бейбу (номер одобрения: BG-PE-2023-117), а письменное информированное согласие было получено от всех участников до сбора данных. При проведении этого расследования соблюдались международные и институциональные этические стандарты. Комитет по институциональной этике Университета залива Бейбу изучил и санкционировал все процедуры, связанные с людьми (Одобрение No BG-PE-2023-117). До начала сбора данных каждый участник предоставлял письменное информированное согласие, и все собранные данные анонимизировались перед анализом.

Эта работа направлена на автоматизацию и улучшение исследования тактического принятия решений в командном спорте с помощью архитектуры мультимодального синтеза на базе трансформеров. Он использует различные источники данных, включая видео, аудио, пространственное местоположение и метаданные игроков, чтобы создать надёжную модель прогнозирования в реальном времени. Рисунок 1 показывает архитектуру предлагаемого метода. Предлагаемые работы состоят из пяти этапов. Этапы описаны ниже:

Рисунок 1
Рисунок 1. Архитектура предлагаемого метода. Схема модели, объединяющая мультимодальные входы и компоненты классификации для принятия тактических решений. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Сбор и предобработка данных

Данные из различных модальностей собираются с записей матчей, таких как видеопотоки, аудиокомментарии, информация о GPS/позиционировании и показатели эффективности игроков. Каждая модальность проходит предварительную обработку в виде таких методов, как извлечение кадров (для видео), фильтрация шума (для аудио) и нормализация (для показаний датчиков), обеспечивая синхронизацию по временным шагам.

Видеокадры извлекались с частотой 25 кадров в секунду, с уменьшением разрешения до 224 × 224. Аудиосигналы обрабатывались с помощью полосного фильтра диапазона от 300 до 3400 Гц, чтобы устранить большинство шума окружающей среды. Данные отслеживания положения с GPS-датчиков записывались на частоте 10 Гц и интерполировались с помощью линейной интерполяции на основе временных меток, обеспечивая их соответствие с временной шкалой видео с частотой 25 Гц. Все входы выравнивались по времени с помощью общих временных меток, а их шкалы нормализовались с помощью z-скорнинга.

Извлечение признаков

Для сбора пространственно-временной информации видеоданных используются 3D CNN. 3D-CNN обрабатывают как пространственную, так и временную информацию между видеокадрами, что позволяет модели обнаруживать паттерны движения, понимать поведение группы и извлекать признаки, основанные на движении. Эта операция генерирует плотное представление признаков для каждой последовательности действий, которое используется как визуальный вход для модели. Каждый видеоклип содержал 16 последовательных кадров, сэмплированных с шагом 2. Во время обучения применялись случайное обрезывание, горизонтальное переворачивание и нормализация яркости. 3D-CNN был оптимизирован с использованием Адама (lr = 0,0001), размера партии 16 и потери перекрестной энтропии.

Встраивание и выравнивание мультимодальных входов

После этого с выходами 3D CNN интегрируются встраивания из разных модальностей. Используется архитектура мультимодальных трансформаторов, при этом различные ветви кодировщиков обрабатывают каждую модальность. Для слияния и выравнивания модальностей используются слои перекрёстного внимания, что позволяет модели фиксировать взаимозависимости (например, между положением игрока и движением мяча, а также контекстом из комментариев). Такое слияние позволяет обогащать контекстуальное понимание текущих тактических решений. Также реализовал все встраивания в PyTorch. Видеоэлементы проецировались линейно от 1 024 до 512 измерений, а аудио и позиционные элементы — в 256 и 128 измерениях соответственно, объединённые до 512 измерений до выравнивания времени.

Мультимодальный синтез на основе трансформаторов

Используется мультимодальный трансформатор для объединения характеристик, извлечённых из всех источников. Механизмы самоконцентрации в трансформаторе позволяют модели изучать взаимозависимости между модальностями (например, визуальная + аудио), фиксировать временной поток и контекст, а также выделять тактически важные кадры и события. Результатом этого шага является комбинированное представление, отражающее тактическое намерение и ситуационный контекст каждого принятого решения. Мультимодальный трансформатор состоял из шести слоёв энкодеров, каждый из которых имел восемь головок внимания. Матрицы внимания вычислялись с помощью масштабированного точечного произведения внимания. В Attention и Feed-Forward также были слои dropout с p = 0.1, чтобы избежать перенасадки.

Классификация и оценка тактических решений

Наконец, слитое представление подаётся в качестве входных данных в классифицированный слой или блок анализа решений, который используется для прогнозирования типа тактического решения, оценки качества решений и, по желанию, генерации объяснимых инсайтов для тренеров с помощью тепловых карт внимания или карт активации. Результаты этого этапа обеспечивают количественную и качественную оценку способностей команды или игрока принимать решения во время матчевой игры.

Глава классификации использовала трёхслойный MLP с активацией ReLU, за которой следовал слой softmax. Модель была обучена на разделении 70/15/15 с 10-кратной перекрёстной валидацией. Используемые метрики включали точность, точность, отзыв, результат F1, задержку и AUC.

Упрощённая блок-схема, суммирующая пять этапов, даёт немедленный визуальный обзор последовательного процесса, как показано на рисунке 2. Этот рисунок кратко отражает полный исследовательский конвейер, включающий сбор данных, предварительную обработку, извлечение признаков, мультимодальное слияние и тактическую классификацию решений, а затем подробные описания каждого этапа.

Рисунок 2
Рисунок 2. Общий рабочий процесс исследования. Обзор исследовательского конвейера — от сбора и предварительной обработки данных до извлечения признаков, обучения моделей и оценки. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 3 показывает общий рабочий процесс предлагаемого исследовательского процесса. Процесс начинается на этапе 1: сбор и предобработка данных, где собираются и синхронизируются мультимодальные источники данных, такие как видео, аудио, отслеживание позиции и контекстные метаданные. На этапе 2: Извлечение признаков используются 3D сверточные нейронные сети (3D CNN) для извлечения пространственно-временной информации из видеопотоков, что приводит к плотным визуальным представлениям действий игроков и тактического потока. Этап 3: Встраивание и выравнивание мультимодальных входов объединяет аудио, видео и позиционные функции в общем латентном пространстве с временным и кросс-модальным выравниванием. Эти представления впоследствии агрегируются в Стадии 4: Мультимодальное слияние на основе трансформеров, где кроссмодальные и механизмы самовнимания позволяют модели изучать взаимозависимости между модальностями и получать более глубокие контекстуальные инсайты тактических решений. Наконец, на этапе 5: Классификация и оценка тактических решений, комбинированные представления подаются в слой классификации для обнаружения тактических решений, таких как пас, драйв или удержание. В то же время для оценки точности принятия решений и времени отклика используются показатели эффективности. Эта блок-схема даёт чёткий обзор пошагового подхода, дополняемый подробными текстовыми описаниями, изложенными в следующих разделах.

Рисунок 3
Рисунок 3. Конвейер последовательной обработки. Показывает пошаговый переход от сбора данных к классификации тактических решений и выводу модели. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Сбор и предобработка данных

Для обеспечения высокоуровневого тактического анализа принятия решений в командных видах спорта с помощью мультимодального синтеза с использованием Transformer была создана структурированная и высокоточная система сбора и предварительной обработки данных. Настройка включает объединение нескольких модальностей данных, включая видеозаписи, отслеживание позиций игроков, аудиосигналы взаимодействия игрока и тренера, а также контекстные метаданные, такие как фаза матча, структура команды и зоны владения мячом.

В выборке участвовали 40 мужчин в возрасте 20 лет и старше, все они активно участвовали в региональных любительских и полупрофессиональных футбольных лигах. Каждый из них был набран из четырёх конкурентных клубов с организованной программой тренировок. Средний возраст спортсменов составлял 20,1 ± 1,2 года, средний рост — 177,5 ± 3,1 см, а вес — 72,6 ± 2,9 кг. Они играли за свои клубы в среднем 6,8 ± 1,5 года. Все участники также имели не менее трёх лет опыта соревнований и были признаны тактически компетентными.

Для обеспечения статистической эффективности размер выборки был приближён с использованием уровня надёжности 95% (Z = 1,96) и уровня значимости 5% с ожидаемым коэффициентом внутриклассовой корреляции (ICC) 0,96 и доверительным интервалом 95% для почти идеального согласования. Это соответствует цели проверки надёжности и согласованности собранных мультимодальных данных принятиярешений 27.

Для обеспечения воспроизводимости настройки приобретения и технические спецификации стандартизировались на протяжении всех сессий. Видеоданные записывались в разрешении 1080p и 25 кадров в секунду с помощью камер GoPro Hero4 с режимом широкого обзора для захвата полного тактического пространства. Каждая запись была стабилизирована и установлена на фиксированной высоте 2,5 м. Аудиосигналы захватывались с помощью внешнего микрофона с частотой дискретизации 44,1 кГц (моно), а затем фильтровались с помощью фильтра полосы 300-3 400 Гц для удаления шума окружающей среды. Данные отслеживания положения собирались с помощью носимых GPS-датчиков с частотой 10 Гц, со средней точностью позиции, сообщаемой производителем, составляла ±0,5 м. Все модальности синхронизировались с помощью общих временных меток и пересэмплировались на общую временную шкалу 25 Гц с помощью линейной интерполяции.

Предварительная обработка включала следующее: понижение дискретизации видео до разрешения 224 × 224, кадровую дискретизацию 16 последовательных кадров с шагом 2, случайную обрезку, горизонтальное переворачивание, нормализацию яркости, нормализацию звука и фильтрацию шума, а также нормализацию позиционной и контекстной переменной z-score.

Скрипт предварительной обработки устроен в следующем порядке для воспроизводимости: (i) извлечение кадров; (ii) аудиофильтрация; (iii) GPS-интерполяция; (iv) модальность редискретизации до 25 Гц; (v) нормализация z-score; и (vi) тесты на целостность на коррупцию, закрытие и отсечение. Для автоматического прохождения каждого этапа используются скрипты для обработки пакетов.

Для обеспечения достоверности данных критерии контроля качества и исключения включали: i) последовательности с >20% окклюзией игрока, ii) GPS-перепадение более 200 мс, iii) повреждённое или обрезаемое аудио, и iv) сильное размытие движения или десинхронизация между модальностями. Всего было исключено 17 последовательностей (3,4%) для этих состояний. Таблица 1 показывает описание набора данных.

АтрибутыПодробности
СпортФутбол (соккер)
Участники40 мужчин-футболистов
Уровень игрыФедеративные футболисты с ≥5 годами опыта
Тип тестаТест на принятие решений и исполнение пасов и драйв (контроль мяча)
Настройка тестированияСтандартизированная организация футбольного поля, отмеченные зоны, фиксированные позиции
Инструменты измеренияКамеры GoPro Hero4, программное обеспечение Kinovea, хронометраж
Собранные данныеВремя выполнения (ET), точность принятия решений (DM), количество правильных действий
Процедура тестированияИгроки реагировали на визуальные стимулы тренеров и выполняли передачи или драйвы
Повторения судебных процессов10 испытаний на игрока (5 пасов, 5 драйвов)
ОценкаЭксперты получили рейтинг DM; ET измеряется с помощью временных меток/видео
Переменные исходаВремя реакции, правильное количество решений, технический результат исполнения

Таблица 1: Описание набора данных. Подробно описаны демографические данные участников, процедуры тестирования, инструменты измерения и переменные результатов.

В настоящем исследовании использовались два связанных, но различных набора данных. Первый набор данных включал 40 игроков, участвовавших в задачах по принятию решений по контролируемому пасу и передаче, в основном используемых для установления базовой надёжности и валидации базовой процедуры измерения решений. Второй набор данных включает 500 мультимодальных тактических последовательностей, собранных из расширенных симуляций матчей и записей реальных игр. Эти последовательности составляли основной набор данных для обучения и тестирования для модели синтеза на основе трансформаторов, позволяя проводить оценку при более экологически обоснованных условиях.

Хотя набор данных включает 500 мультимодальных последовательностей, стратифицированная дискретизация обеспечивала сбалансированное представление тактических действий (Pass, Drive, Hold). Подходы к дополнению данных, такие как временное обрезывание и перетасовка последовательностей, также использовались для повышения вариабельности и снижения смещения модели во время обучения.

Стоит отметить, что управляемый набор данных из 40 игроков использовался при первоначальной валидации и тестировании надёжности модели, а большая коллекция из 500 мультимодальных последовательностей была собрана на основе длительных записей матчей и организованных обучающих сессий для оценки масштабируемости и экологической валидности фреймворка. Базовая надёжность обеспечивалась с помощью меньшего набора данных, тогда как более крупный набор данных способствовал обучению и тестированию крупномасштабных моделей.

Описание набора данных

В эксперименте было принято участие 40 мужчин-футболистов, каждый из которых имел не менее пяти лет опыта федеративной игры, чтобы убедиться, что выборка обладает базовыми техническими и тактическими компетенциями. Сбор данных велся в стандартизированной схеме футбольных полей, где заранее определённые зоны и игровые позиции распределялись для обеспечения одинаковых условий тестирования. Во время экспериментов участники должны были реагировать на визуальные сигналы тренера — либо передавать пас, либо продвигать мяч, воспроизводя тактические решения, принятые в реальной игре. Каждый участник прошёл в общей сложности 10 испытаний: пять с обгоном и пять с вождением. Эти движения фиксировались камерами GoPro Hero4, а данные о производительности измерялись с помощью программного обеспечения для видеоанализа Kinovea вместе с ручной секундомером для фиксации времени выполнения (ET). Основным источником данных: время выполнения, качество DM, оценённое опытными коучами, и количество правильных действий. Эти факторы предоставили количественную основу для анализа того, насколько быстро и эффективно игроки принимали и выполняли тактические решения в условиях контролируемого стимул-ответа. Созданный набор данных представляет собой структурированный и маркированный ресурс, хорошо подходящий для создания эталонов или обучения интеллектуальных систем с целью моделирования тактического мышления и моторных реакций в контекстах командных видов спорта.

Выборка ограничена молодыми мужчинами из одной региональной лиги, что может ограничить её обобщимость по возрастным группам, спортсменкам или другим культурам. Будущие исследования будут стремиться получить более репрезентативные и разнообразные выборки.

Ещё одним ограничением является размер выборки из 40 молодых игроков-мужчин из одной региональной лиги. Хотя однородная выборка способствовала внутренней валидности и снижению вариаций в результатах из-за возраста, пола и тактических различий, она также ограничивает обобщимость результатов для более широкой популяции. Тактические паттерны, которые модель усваивает, могут отражать региональные или гендерно-специфичные стили игры, а не универсальное поведение при принятии решений. Для этого исследования использовались стратифицированные выборки и дополнение данных для повышения вариабельности рассматриваемого набора данных; Однако для подтверждения устойчивости модели в различных футбольных условиях необходимы более масштабные исследования с участием женщин-спортсменок, молодых игроков, профессиональных игроков и участников из различных тактических культур. Эти результаты демонстрируют серьёзные перспективы, но требуют дополнительной проверки на более разнообразных и больших наборах данных, прежде чем можно будет получить более широкое обобщение.

Чтобы снизить субъективность, три профессиональных футбольных тренера независимо аннотировали тактические решения. Надёжность между оценщиками оценивалась с использованием коэффициента корреляции внутриклассов (ICC = 0,96, CI 0,94-0,98), что указывало на почти идеальное согласование. Обсуждение консенсуса разрешило разногласия. Для мультимодальных данных предварительная обработка включала временную синхронизацию между модальностями (видео с 25 кадрами в секунду и данные с датчиков 10 Гц) и нормализацию характеристик по z-score для сопоставимости между модальностями.

Надёжность между оценщиками была количественно измерена с помощью коэффициента корреляции между классами с двунаправленными случайными эффектами (ICC [2,3]), так как он подходит для оценки абсолютного согласия между несколькими оценщиками. ICC 0,96 (95% ДИ: 0,94-0,98) указывает на почти идеальное согласование по широко используемым порогам и дополнительно подтверждает, что тактические метки для обучения были высоко надёжными. Надёжность была рассчитана по всем 500 мультимодальным последовательностям, обеспечивая должное и последовательное аннотирование как контролируемых, так и симуляционных контекстов.

Процедура аннотаций и протокол маркировки

Все мультимодальные последовательности были аннотированы с помощью структурированного трёхступенчатого протокола. Во-первых, три лицензированных футбольных тренера независимо просматривали каждую видео-позиционную последовательность с помощью интерфейса аннотаций, синхронизированного временными метками (Kinovea + пользовательская таблица тегирования). Аннотаторы обозначали тактические категории принятия решений (Pass, Drive, Hold), контекстные сигналы (зона давления, доступность полос для обгона) и временные метки событий. Во-вторых, скрипт обнаружения разногласий автоматически выявлял случаи неоднозначности или конфликта, которые затем рассматривались на совместной встрече консенсуса. В-третьих, для обеспечения согласованности границ событий и временного выравнивания между модальностями, финальный проход проводил независимый старший аналитик. Этот процесс, для целей последующего обучения моделей, обеспечивал отслеживаемость каждой аннотации и наилучшего качества.

Предварительная обработка

В то время как текущее исследование проводилось с 500 мультимодальными последовательностями, конвейер предварительной обработки по замыслу был настроен для крупномасштабных наборов данных. Все модальности проходили автоматические скрипты, которые параллельно извлекали видеокадры пакетно, пересэмплировали аудио, интерполиировали позиционные данные и применяли нормализацию z-score. Наличие модульной архитектуры позволяет каждой модальности самостоятельно предварительно обрабатываться на отдельных потоках GPU/CPU. Это позволяет воспринимать материалы матчей в большом объеме. Это позволяет легко масштабировать рабочий процесс до полносезонных наборов данных без ручного вмешательства и делает фреймворк подходящим для реального внедрения в профессиональных аналитических средах.

Для правильного анализа тактического принятия решений в командных видах спорта необходимо предварительно обработать и выравнивать исходные данные из различных модальностей — например, видеоклипы, аудиосигналы и записи позиций. Иллюстрация мультимодального входа выглядит

Уравнение 1(1)

Здесь V обозначается как серия характеристик видео, извлеченных из энкодера CNN.

Уравнение 2(2)

Здесь A — аудиохарактеристика, кодируемая wave2vec.

Уравнение 3(3)

P обозначает координатное положение игрока в момент времени ti.

Для работы с асинхронными частотами дискретизации каждая модальность редискретируется или интерполируется в общую временную шкалу:

Уравнение 4(4)

Здесь Уравнение 5, — синхронизированнаяхарактеристика f t , — скорость объединённого кадра, Xm — начальное указание.

Для равномерного масштаба по модальностям все векторы признаков нормализуются по z-шкале:

Уравнение 8(5)

μX и σX обозначают среднее и стандартное отклонение размерности признаков в обучающем множестве.

Хотя основными проблемами являются решения по передаче/прорыву, аудиоканалы (например, коммуникация игрок/тренер, игровые сигналы окружения) были добавлены для учёта реальных ситуаций матча, когда речевые сигналы влияют на тактическую реакцию. Гиперпараметры (например, скорость обучения, эпохи) выбирались с помощью поиска по сетке и существующих оценок в мультимодальном обучении, что обеспечивало баланс между стабильностью сходимости и вычислительной эффективностью.

Гиперпараметры предлагаемого фреймворка — скорость обучения, размер пакетов и эпохи обучения — были выбраны с помощью хорошо спланированного систематического поиска сетки для достижения как стабильности сходимости, так и вычислительной эффективности. Выбор скорости обучения 0,0001 с оптимизатором Адама оказался стабильным для обновления градиента без колебаний, а размеры пакетов оптимизировались для балансировки ёмкости памяти GPU с обучающей пропускной способностью. Настройка 50-100 эпох была использована для обеспечения адекватного обучения без перенагона, что подтверждается отслеживанием потерь валидации и 10-кратной перекрёстной валидацией. Эти значения не устанавливались произвольно, а определялись более ранними испытаниями в мультимодальном обучении и корректировались экспериментальными испытаниями на текущем наборе данных. Этот строгий процесс гарантировал, что выбранные гиперпараметры способствовали стабильному обучению модели и воспроизводимому улучшению производительности по сравнению с базовыми подходами.

Хотя задание по классификации сосредоточено на решениях по передаче/драйву/удержанию, аудиоинформация была включена намеренно, поскольку реальное тактическое поведение в футболе сильно зависит от коммуникации между игроком и тренером, отдачи командных сигналов, прессинговых сигналов и звуков окружающей среды (например, контакт с мячом, подход соперника). Эти сигналы часто предшествуют или совпадают с принятием решений и являются частью естественной перцептивной среды футболистов. Предварительные абляционные эксперименты показали, что исключение аудио снижает воспоминание на 3,8%, что свидетельствует о том, что даже тонкие акустические сигналы способствуют осознанию контекста. По этой причине аудио сохранялось для сохранения экологической достоверности и улучшения способности модели обобщать на реальные условия совпадения.

Действительно, в дополнительную поддержку этих гиперпараметров был проведён внутренний анализ чувствительности путём систематического изменения скорости обучения от 1e-5 до 5e-4, размера пакета от 8 до 32, количества слоёв трансформаторов от 4 до 8 и количества головок внимания от 4 до 12. Выбранная конфигурация с частотой обучения 1e-4, размером партии 16 и 6-слоевым энкодером с 8 головками внимания непрерывно обеспечивала стабильную сходимость с минимальными потерями валидации, минимизируя перенасадку при 10-кратной кросс-валидации. Большие партии приводили к нестабильности градиента, тогда как меньшие партии увеличивали шум и задерживали сходимость. Аналогично, модели трансформаторов с более чем 8 головками не показывали повышения производительности, но значительно увеличивали время вычислений. Полученные результаты оправдывают окончательные настройки гиперпараметров, использованных в этом исследовании.

Извлечение признаков с использованием 3D-сверточной нейронной сети

В предлагаемой фреймворке Transformer-Based Multimodal Fusion для тактического принятия решений в командных видах спорта 3D сверточная нейронная сеть (3D CNN) отвечает за извлечение пространственно-временных признаков из необработанных видеоклипов.

В отличие от двумерных CNN, которые учитывают только пространственные измерения (ширина W и высота H), 3D-CNN также учитывают временную размерность R, что позволяет им обнаруживать динамику движения и последовательные паттерны, важные для понимания поведения команды, таких как продвижение и передачи в футболе.

3D-CNN28 впервые предложен для объединения пространственной и временной информации видеоданных. 3D-ядро используется в алгоритме 3D-свёртки для куба, состоящего из кадров с частью столбцов, сложенных в стопе. 3D-свёртка может быть записана в Eqn (6)

Уравнение 11(6)

Где: Уравнение 12 — выходная особенность в точке (x, y, z) на j-й карте признаков l-го слоя.Уравнение 14 — вес ядра в точке (h,w,r) из входной карты m-го входа. Уравнение 16 — вход при пространственно-временном смещении от предыдущего слоя. blj — смещение. f(.) — функция активации (обычно ReLU). M — это количество входных отображений признаков из предыдущего слоя. Это уравнение позволяет 3D-CNN параллельно объединять пространственную (высоту и ширину) и временную (последовательность кадров) информацию.

Рисунок 4
Рисунок 4. Архитектура обработки 3D CNN. Иллюстрирует, как пространственно-временные особенности извлекаются из видеопоследовательностей с помощью 3D-сверточных операций. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 4 показывает рабочий процесс 3D-CNN. Конвейер начинается с фазы ввода, когда необработанные видеопотоки футбольной игры объединяются с организованными данными, включая местоположение игроков, статистику игры и контекстные метаданные. Эта мультимодальная информация сохраняет как визуальную динамику, так и ситуационный контекст, что критически важно для анализа тактики команды. Затем видеопоток проходит через 3D-сверточную нейронную сеть (3D CNN). В этом случае на входных кадрах используется серия 3D-сверточных слоёв. Слои связаны с пространственными измерениями (высота и ширина) и временным измерениями (фреймы), позволяя сети изучать паттерны движения, взаимодействия игроков и тактику, основанную на последовательности, такие как передачи или драйвы. Впоследствии образуется куб особенностей с плотными пространственно-временными особенностями. Этот куб подвергается операциям пулирования для уменьшения размера при сохранении значимых особенностей. При пуле объём признаков сжимается в одномерный вектор, обеспечивая краткое представление тактической ситуации. Этот вектор признаков впоследствии входит в полностью связанную глубокую нейронную сеть (DNN). DNN — это блок принятия решений, который обрабатывает объединённые и извлеченные функции для принятия тактических решений, таких как передача, удар или удержание. Выход сети — это окончательное тактическое решение, принимаемое системой, исходя из реальной ситуации в реальном времени, а также изученных стратегических шаблонов.

Встраивание и выравнивание мультимодальных входов

После извлечения признака три элемента, такие как аудио, видео и статистическое положение плеера, приводятся в качестве входной модальности.

Чтобы ввести их в трансформатор, а затем подать каждый из них через обучаемую функцию вложения:

Уравнение 19(7)

где f3DCNN изучает пространственно-временные особенности каждого временного среза Vt и отображает его в d-мерное латентное пространство.

Уравнение 22(8)

где W, P и bP — обучаемые веса.

Уравнение 25(9)

Все вложения выровнены по временной размерности T. Если у модальностей разные частоты, используется интерполяция или понижающая дискретизация:

Уравнение 26(10)

Теперь все модальности синхронизируются следующим образом:

Уравнение 27(11)

Чтобы сохранить временной порядок в трансформаторе, также введите позиционные кодировки для каждого вектора:

Уравнение 28(12)

Где Уравнение 29 обозначает стандартное синусоидальное или обучаемое позиционное кодирование.

Каждая модальность операционно кодируется с помощью линейного слоя PyTorch, объединяется в 512-мерный вектор и затем подаётся в последовательность входа трансформатора после позиционного кодирования. Это гарантирует, что единое вложение готовится к перекрёстному внимания на каждом этапе времени.

Финальный тензор —

Уравнение 30(13)

подаётся в Transformer Encoder, где механизмы самосознания и кроссмодального внимания позволяют модели совместно рассуждать по всем модальностям для принятия тактических решений.

Мультимодальный синтез на основе трансформаторов

В предлагаемом подходе используется метод факторизации матриц с низким рангом для интеграции полученных мультимодальных векторов данных. Проблема высокоразмерности, возникающая при прямом слиянии тензоров, решается этим методом, который использует коэффициент низкорангового разложения длятензорного синтеза 29. Каждая модальность изначально выражается как вектор, а уменьшение размерности, сохраняющее значимые взаимодействия, достигается с помощью низкорангового разложения. Термоядерный тензор ZM среди M модальностей построен следующим образом:

Уравнение 32(14)

Здесь: Уравнение 33 — низкоранговый множитель m-го модальности, Уравнение 60 — внешнее произведение, а r — ранг разложения.

Вектор слияния h затем вычисляется как:

Уравнение 34(15)

При использовании двух модальностей отдельно, редуцированное слияние выглядит следующим образом:

Уравнение 35(16)

Это создаёт совместный мультимодальный вектор представления h, который моделирует кроссмодальные взаимодействия на латентном уровне.

После получения низкорангового вектора слияния h, модуль трансформера моделирует зависимости и выравнивает семантические представления между модальностями. Кросс-модальное внимание специально разработано так, чтобы одна модальность могла обращать внимание на другую:

Уравнение 36(17)

Где Qm — запрос по модальности m, Kn, Vn — векторы ключа и значения в модальности n, dk — размерность ключевых векторов. Такая схема облегчает потоки внимания, специфические по модальности, позволяя обрабатывать каждую категорию ввода относительно других (например, синхронизация движения игрока с индикаторами контекста игры и видео).

Векторы с перекрестным присутствием накладываются и классифицируются через многослойный перцептрон (MLP). Результат — тактическая метка принятия решений (например, pass, drive, hold), кросс-энтропийные потери, оптимизированная для сквозного обучения.

Рисунок 5
Рисунок 5. Мультимодальная архитектура слияния на основе трансформаторов. Показывает, как визуальные и сенсорные модальности интегрируются с помощью трансформаторного кодера для улучшения представления признаков. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Мультимодальный блок слияния, как показано на рисунке 5, сочетает визуальные и позиционные входы. Это необходимая конструкция, поскольку тактические решения требуют пространственного восприятия и динамики движений, которые нельзя представить одной модальностью.

Рисунок 5 показывает рабочую структуру мультимодального синтеза на основе трансформаторов. Эта конструкция объединяет разнообразные данные, видео, пространственные координаты и контекстные данные игры в одном канале для прогнозирования тактических действий, таких как передача, драйв или удержание. Подход начинается с ввода видео, которые проверяются с помощью 3D сверточной нейронной сети (3D CNN). Эта система идентифицирует как пространственные, так и временные структуры в видео, что позволяет ей фиксировать динамичную активность и коммуникацию игроков со временем. Тем временем контекстуальная и позиционная информация передаётся через вложенные слои, преобразующие структурированные входы в плотные векторные представления. Контекстные, позиционные и видеопотоки затем могут быть объединены с помощью модуля низкорангового синтеза. Этот подход эффективно достигает межмодальных корреляций через разложение пространственного слияния, минимизируя вычислительную сложность и сохраняя существенные взаимосвязи между модальностями. Наконец, слитое мультимодальное представление обрабатывается кодером трансформатора с кросс-модальным вниманием. Эта процедура позволяет модели сосредоточиться на правильных характеристиках в разных модальностях и временных шагах, что улучшает понимание стратегического поведения в игре. Наконец, закодированный выход проходит через блок конкатенации и многослойного перцептрона (MLP), который сопоставляет полученное представление с некоторыми тактическими решениями. Результаты модели классифицируют действия игроков, такие как «пас», «драйв» или «удержать», чтобы позволить интеллектуально и основанное на данных анализировать тактику команды.

В предлагаемой системе тактического анализа Transformer-Based Multimodal Fusion для командных видов спорта последним этапом является классификация и оценка тактических решений, которые преобразуют изученные мультимодальные представления в применимые для принятия решений ярлыки. После слияния видео, позиционных и контекстных признаков с помощью низкорангового слияния и тонкой настройки с помощью кросс-модального внимания в кодере трансформера, полученные векторы признаков подаются в классификатор многослойного перцептрона (MLP). Каждый класс принятия решений представлен функцией активации softmax, что даёт вероятностные оценки для всех возможных действий. Наиболее вероятный класс выбирается как предсказанное решение модели. Модель обучена на функции потери кросс-энтропии, которая вознаграждает правильные прогнозы и помогает сети научиться различать схожие различия в тактических ситуациях. Кроме того, можно рассматривать оценку во временной области для подтверждения отзывчивости в игровых ситуациях в реальном времени или почти в реальном времени, обеспечивая точность классификатора и не тратя времени в игровых условиях. Таблица 2 показывает архитектуру модели и гиперпараметры.

КомпонентТехнические характеристики
Слои кодировщиков трансформаторов6
Внимание, руководители8
Скрытое измерение512
Размер слоя с подающей прямой подачи2048
Измерения вложенияВидео: 1024 → 512, Аудио: 256 → 512, Позиционирование: 128 → 512
Позиционное кодированиеОбучаемость
Метод термоядерного синтезаМультимодальное слияние низкого ранга (ранг r = 16)
ОптимизаторАдам
Скорость обучения0.0001
Размер партии16
Эпохи обучения50–100
Отброс0.1
Функция потерьКросс-энтропия

Таблица 2: Архитектура модели и гиперпараметры. Перечисляет обучающие настройки и ключевые компоненты предлагаемой мультимодальной модели синтеза на основе трансформаторов.

Для большей ясности и воспроизводимости мультимодальный трансформатор реализовывался с помощью 6-слойного стека энкодеров, каждая из которых была оснащена 8 головками внимания и скрытой размерностью 512, что соответствует типичным настройкам трансформатора для мультимодальных задач среднего масштаба. Каждая модальность проходит через блок вложения: видео через выход 3D-CNN-энкодера, 1024-дим; аудио с помощью энкодера на базе Wave2Vec, 256-дим; а также позиционные плюс контекстные функции с помощью двухслойного MLP-энкодера 128-DIM. Все эти вложения были проецированы в общее 512-мерное латентное пространство посредством обучаемых линейных преобразований. Для установления временного выравнивания все модальности сначала интерполируются на одну частоту 25 Гц, затем применяются изученные позиционные кодировки для сохранения временного порядка. Кросс-модальное выравнивание осуществляется с помощью слоёв кросс-внимания, которые явно изучают корреляции между модальностями перед тем, как быть введены в стек энкодеров самовнимания. Эти архитектурные решения были сделаны для баланса ёмкости модели с вычислительной эффективностью, обеспечивая стабильную сходимость на среднеразмерном наборе данных.

На практике предлагаемая фреймворк Transformer-Based Multimodal Fusion наиболее подходит для сценариев с доступными синхронизированными мультимодальными данными, таких как структурированные тренировки, контролируемые симуляции матчей или профессиональные среды с согласованными видеопотоками и системами отслеживания позиции. Четыре основных входа, необходимые для метода: (i) видео высокого разрешения, (ii) данные позиционного отслеживания (GPS/LPS), (iii) аудиопотоки и (iv) контекстные метаданные — например, владение, зоны давления, фаза совпадения. Для достижения надёжной работы эти методы должны быть согласованы по времени с минимальным дрейфом (видео ≥ 25 кадров в секунду и датчики положения ≥ 10 Гц), а также сохранять стабильные точки обзора и минимальный шум сигнала. Те настройки, которые не обеспечивают такие синхронизированные входы, например, любительские матчи с нерегулярными ракурсами камеры, прямые трансляции с артефактами задержки/сжатия или среда без инфраструктуры позиционного отслеживания, будут менее актуальны для фреймворка. Кроме того, текущая система лучше всего работает в полуконтролируемых условиях, но может быть значительно менее надёжной в полностью неконтролируемых условиях живых матчей, где освещение, окклюзия и динамический шум толпы влияют на качество сбора данных. Эти ограничения очерчивают практические границы, в рамках которых может быть внедрена эта система, и подчеркивают, что последовательное захваление данных в нескольких режимах крайне важно для применения предлагаемой модели.

Модификации и устранение неисправностей

На практике в мультимодальном конвейере могут возникнуть различные проблемы, которые снижают стабильность модели или общую производительность. Одной из распространённых проблем является временное несогласование между модальностями, когда видео, записанное на 25 кадрах в секунду, и позиционные данные, зафиксированные на 10 Гц, не синхронизируются, что приводит к несовпадающим сигналам, дестабилизируя карты внимания и снижая воспоминание. Это можно решить, применяя ресемплирование на основе временных меток, линейную интерполяцию и автоматическое удаление последовательностей с чрезмерным дрейфом. Аудиоканалы также могут страдать от шума, вызванного ветром, шумом толпы или клиппингом микрофона, из-за чего трансформатор игнорирует аудиотокены и немного снижает точность. Применение полосной фильтрации, спектрального гейтинга и замена сильно повреждённых сегментов нулевыми векторами помогает сохранить стабильность аудиовложения. Проблемы с качеством изображения, такие как окклюзия игрока или размытие движения, могут ослабить пространственно-временные представления 3D-CNN и усилить путаницу между пасом и драйвом. Это компенсируется за счёт исключения сильно окклюзированных последовательностей и применения стратегий аугментации, включая случайное обрезывание, нормализацию яркости и симуляцию размытия движения. Нестабильность трансформатора может возникнуть, если шкалы вложения различаются между модальностями, что приводит к колебаниям потерь валидации или скачки градиента. Обеспечение стабильной нормализации z-скорлов, использование расписания разогревающей скорости обучения, использование градиентного клиппинга и увеличение количества выброса могут восстановить стабильные тренировки. Слияние низкого ранга также может стать проблемой, если ранг слияния установлен неправильно, что приводит к искажению межмодальных отношений и дисбалансу классов. Поддержание умеренного ранга для небольших наборов данных, повышение ранга для больших наборов данных и применение регуляризации L2 помогают сохранить сбалансированное слияние. Вычислительные узкие места могут возникать из-за больших видеотензоров, вызывающих переполнение памяти GPU или медленное обучение. Эти проблемы можно решить с помощью обучения смешанной точности (FP16), снижения разрешения входов во время ранних экспериментов или кэширования заранее вычисленных 3D-CNN-возможностей. Наконец, естественный дисбаланс классов в тактических решениях, особенно для «Драйв», может снизить отзыв и вызвать колебания в AUC; Применение классово-сбалансированных потерь, чрезмерная выборка действий меньшинств и обогащение контекстных метаданных значительно улучшают баланс и дискриминацию при принятии решений. Это объединённое руководство по устранению неполадок гарантирует, что исследователи и практики могут поддерживать стабильные условия обучения, повышать воспроизводимость и эффективно адаптировать фреймворк в различных наборах данных и средах.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эта конструкция объединяет разнообразные данные, видео, пространственные координаты и контекстные данные игры в одном канале для прогнозирования тактических действий, таких как пас, драйв или удержание. Подход начинается с ввода видео, которые проверяются с помощью трёхмерной сверточной нейронной сети (3D CNN). Контекстные, позиционные и видеопотоки затем могут быть объединены с помощью модуля низкорангового синтеза. Этот подход эффективно достигает межмодальных корреляций через разложение пространственного слияния, мини...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Фреймворк Transformer-Based Multimodal Fusion, представленный здесь, представляет собой важное развитие по сравнению с базовым тестом Stroop Task Football Test (STFT), изложенным в базовом документе. В отличие от базовой работы, которая была сосредоточена на контролируемом, лабораторно-ориентированном тестировании с ограниченными и статическими стимулами, такими как цветные стрелки и заранее определённые задачи (вождение или обгон), новая модель работает на основе реальных мультимодальны...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликта интересов, которые можно было бы заявлять.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы с благодарностью выражают признательность Школе физического воспитания Университета залива Бейбу и Школы статистики Юго-Западного университета финансов и экономики за предоставленные ресурсы и институциональную поддержку в ходе этого исследования. Эта работа также была поддержана проектом Национального фонда социальных наук 2023 года: исследование эффективного использования культурных ресурсов красного спорта в районе старой революционной базы Цзо цзян–Ю Цзян (грант No 23CTY016).

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
3D CNNПользовательская реализацияПространственно-временное извлечение признаков из видео
GoPro Hero4GoPro Inc.https://gopro.com/Видеозапись матчей
GPS/IMU датчикиCatapult Sports / Xsenshttps://www.catapultsports.com/Отслеживание позиции игроков
Процессор Intel Core i7-11700KIntelhttps://www.intel.comПроцессор рабочей станции для обучения моделей
Librosalibrosa.orghttps://pypi.org/project/librosa/Обработка аудиосигналов и ресемплирование
Классификатор MLPPyTorch / TensorFlowКлассификация тактических решений
NumPyФонд программного обеспечения Pythonhttps://pypi.org/project/numpy/Численное вычисление и матричные операции
Видеокарта NVIDIA RTX 3080NVIDIAhttps://www.nvidia.comГлубокое обучение и вывод
OpenCVOpenCV.orghttps://pypi.org/project/opencv-python/Извлечение кадров из видео
ПандыФонд программного обеспечения Pythonhttps://pypi.org/project/pandas/Обработка данных и обработка таблиц
PCA (Scikit-learn)Scikit-learnhttps://scikit-learn.org/Уменьшение размерности
Python 3.9Фонд программного обеспечения Pythonhttps://www.python.org/downloads/release/python-390/Среда языка программирования
PyTorchФонд PyTorchhttps://pytorch.org/Фреймворк глубокого обучения
scikit-learnРазработчики SCIKIT-Learnhttps://pypi.org/project/scikit-learn/Перекрёстная валидация, вычисление ICC
TensorFlow 2.8Googlehttps://www.tensorflow.org/Фреймворк глубокого обучения
Трансформаторный кодировщикPyTorch / TensorFlowИнтеграция мультимодальных функций с вниманием
Ubuntu 20.04 LTSCanonical Ltd.https://ubuntu.com/Операционная система для обучения моделей
Рабочая станцияCustom / Intel, NVIDIACPU, GPU, RAM для обучения моделям

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Calle-Jaramillo, G. A., Franco, R., González, S. R., Forero, L. M., González, H. Design and validation of a test to evaluate the execution time and decision-making in technical–tactical football actions (passing and driving). Behav Sci. 13 (1), 101(2023).
  2. Renshaw, I., Davids, K., O’Sullivan, M., Maloney, M. A., Crowther, R., McCosker, C. An ecological dynamics approach to motor learning in practice: reframing the learning and performing relationship in high performance sport. Asian J Sport Exerc Psychol. 2, 18-26 (2022).
  3. Lamas, L., Senatore, J. V., Fellingham, G. Two steps for scoring a point: creating and converting opportunities in invasion team sports. PLoS ONE. 15, e0240419(2020).
  4. Gonçalves, B., et al. Extracting spatial-temporal features that describe team match demands when considering the effects of the quality of opposition in elite football. PLoS ONE. 14, e0221368(2019).
  5. Cardoso, F. D. S. L., González-Víllora, S., Guilherme, J., Teoldo, I. Young football players with higher tactical knowledge display lower cognitive effort. Percept Mot Skills. 126, 499-514 (2019).
  6. Heilmann, F. Self-report versus neuropsychological tests for examining executive functions in youth soccer athletes—a cross-sectional study. Behav Sci. 12, 346(2022).
  7. Torres-Tejeda, S., Portilla-Fernández, J. A., Mugruza-Vassallo, C. A., Córdoba-Berrios, L. L. Variations of reaction times explained by stimuli changes in size and perspective in 2D and 3D for selective attention. Rev Mex Ing Biomed. 41, 91-104 (2020).
  8. Wilke, J., Vogel, O. Computerized cognitive training with minimal motor component improves lower limb choice-reaction time. J Sports Sci Med. 19, 529(2020).
  9. Da Silva Leite Cardoso, F., Afonso, J., Roca, A., Teoldo, I. The association between perceptual-cognitive processes and response time in decision making in young soccer players. J Sports Sci. 39, 926-935 (2021).
  10. Farahani, J., Soltani, P., Rezlescu, C. Assessing decision-making in elite academy footballers using real-world video clips. Prog Brain Res. 259, Elsevier. 59-70 (2020).
  11. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  12. MM-ViT: multi-modal video transformer for compressed video action recognition. Chen, J., Ho, C. M. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 1910-1921 (2022).
  13. Shi, J., et al. A novel two-stream transformer-based framework for multi-modality human action recognition. Appl Sci. 13, 2058(2023).
  14. Capone, V., Casolaro, A., Camastra, F. Spatio-temporal prediction using graph neural networks: a survey. Neurocomputing. 594, 130400(2025).
  15. Ball trajectory inference from multi-agent sports contexts using set transformer and hierarchical bi-LSTM. Kim, H., et al. Proc 29th ACM SIGKDD Conf Knowl Discov Data Min, , (2023).
  16. Lemes, J. C., et al. Influence of pitch size and age category on the physical and physiological responses of young football players during small-sided games using GPS devices. Res Sports Med. 28, 206-216 (2020).
  17. Coutinho, D., et al. Effects of pitch configuration design on players’ physical performance and movement behaviour during football small-sided games. Res Sports Med. 27, 298-313 (2019).
  18. Clemente, F. M., Sarmento, H. Combining small-sided football games and running-based methods: a systematic review. Biol Sport. 38, 617-627 (2021).
  19. Hu, W., Li, B., Li, C., Zhang, T. An integrated intelligent decision system for physical health evaluation of college students with fuzzy number intuitionistic fuzzy information. J Intell Fuzzy Syst. 44, 611-624 (2023).
  20. Cao, L. Design and optimization of a decision support system for sports training based on data mining technology. Sci Program. 2022, 1846345(2022).
  21. Li, L., Zhang, Z., Zhang, S. Hybrid algorithm based on content and collaborative filtering in recommendation system optimization and simulation. Sci Program. 2021, 4(2021).
  22. Shi, W., Wang, L., Qin, J. User embedding for rating prediction in SVD++-based collaborative filtering. Symmetry. 12, 121(2020).
  23. Hasan, M., Roy, F. An item–item collaborative filtering recommender system using trust and genre to address the cold-start problem. Big Data Cogn Comput. 3, 39(2019).
  24. Duan, R., Jiang, C., Jain, H. K. Combining review-based collaborative filtering and matrix factorization: a solution to rating sparsity. Decis Support Syst. 156, 113748(2022).
  25. Multi-view transformation in recommender systems. Ho, T. L., Le, A. C. Proc 2021 Int Conf Syst Sci Eng (ICSSE), , IEEE. 88-91 (2021).
  26. Detector-free weakly supervised group activity recognition. Kim, D., Lee, J., Cho, M., Kwak, S. Proc IEEE CVF Conf Comput Vis Pattern Recognit (CVPR), , 20083-20093 (2022).
  27. Wensel, J., Ullah, H., Munir, A. ViT-RET: vision and recurrent transformer neural networks for human activity recognition in videos. IEEE Access. 11, 72227-72249 (2023).
  28. Alomar, K., Aysel, H. I., Cai, X. CNNs, RNNs and transformers in human action recognition: a survey and a hybrid model. Artif Intell Rev. 58, 1-44 (2025).
  29. Social adaptive module for weakly supervised group activity recognition. Yan, R., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 224-238 (2020).
  30. Zhang, Y., et al. FairMOT: on the fairness of detection and re-identification in multiple object tracking. Int J Comput Vis. 129, 3069-3087 (2021).
  31. Towards real-time multi-object tracking. Wang, Z., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 22-107 (2020).
  32. Shuvo, M. R., Mekala, M. S., Elyan, E. Deep learning and attention-based methods for human activity recognition and anticipation: a comprehensive review. Cogn Comput. 17, 1-28 (2025).
  33. Alqarafi, A., Almogadwy, B. TAT-SARNet: a transformer-attentive two-stream soccer action recognition network with multi-dimensional feature fusion and hierarchical temporal classification. Mathematics. 13, 3011(2025).
  34. Detection recovery in online multi-object tracking with sparse graph tracker. Hyun, J., Kang, M., Wee, D., Yeung, D. Y. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 4839-4848 (2023).
  35. Mukhtar, H., Khan, M. U. G. STMMOT: advancing multi-object tracking through spatiotemporal memory networks and multi-scale attention pyramids. Neural Netw. 168, 363-379 (2023).
  36. Dataset used for intraclass correlation coefficient reliability analysis. , https://docs.google.com/spreadsheets/d/1c3bZNClvy8TP7RBspwRI0z7R8-n5Wy5H (2021).
  37. Ma, X., et al. feature extraction within a complex urban area with an improved 3D-CNN using airborne hyperspectral data. Remote Sens. 15, 992(2023).
  38. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  39. Wang, X., Guo, Y. Intelligent football players’ motion recognition system based on convolutional neural network and big data. Heliyon. 9, e19822(2023).
  40. Paneru, B., et al. Enhancing soccer pass receiver prediction in broadcast images through advanced deep learning techniques: a comprehensive study on model optimization and performance evaluation. J Soft Comput Explor. 5, 115-121 (2024).
  41. Shot prediction in the attacking third based on spatio-temporal features: a dynamic time-series model approach. Gong, B., et al. Proc 4th Int Conf Inf Technol Contemp Sports (TCS), , IEEE. (2024).
  42. Yang, K. O., Koh, J., Choi, J. W. Unified contrastive fusion transformer for multimodal human action recognition. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Transformer ModelMultimodal FusionTactical Decision AnalysisTeam SportsFootball AnalyticsPlayer PositioningDecision ClassificationFeature ExtractionReal Time PredictionVideo Analysis

Related Articles