$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В исследование приняли участие 40 футболистов-мужчин в возрасте 18-24 лет (среднее = 20,1 ± 1,2), набранных из четырёх любительских и полупрофессиональных клубов в рамках одной региональной лиги. Все участники имели не менее трёх лет опыта соревнований и в настоящее время проходили обучение в структурированной среде. Сбор данных проводился в двух контролируемых условиях: во-первых, на стандартизированных тренировочных учениях, которые моделировали тактические сценарии принятия решений о передаче/проезде; во-вторых, в длительных сессиях симуляции матчей, из которых извлекались мультимодальные последовательности. Все процедуры были утверждены Институциональным комитетом по этике Университета залива Бейбу (номер одобрения: BG-PE-2023-117), а письменное информированное согласие было получено от всех участников до сбора данных. При проведении этого расследования соблюдались международные и институциональные этические стандарты. Комитет по институциональной этике Университета залива Бейбу изучил и санкционировал все процедуры, связанные с людьми (Одобрение No BG-PE-2023-117). До начала сбора данных каждый участник предоставлял письменное информированное согласие, и все собранные данные анонимизировались перед анализом.
Эта работа направлена на автоматизацию и улучшение исследования тактического принятия решений в командном спорте с помощью архитектуры мультимодального синтеза на базе трансформеров. Он использует различные источники данных, включая видео, аудио, пространственное местоположение и метаданные игроков, чтобы создать надёжную модель прогнозирования в реальном времени. Рисунок 1 показывает архитектуру предлагаемого метода. Предлагаемые работы состоят из пяти этапов. Этапы описаны ниже:

Рисунок 1. Архитектура предлагаемого метода. Схема модели, объединяющая мультимодальные входы и компоненты классификации для принятия тактических решений. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Сбор и предобработка данных
Данные из различных модальностей собираются с записей матчей, таких как видеопотоки, аудиокомментарии, информация о GPS/позиционировании и показатели эффективности игроков. Каждая модальность проходит предварительную обработку в виде таких методов, как извлечение кадров (для видео), фильтрация шума (для аудио) и нормализация (для показаний датчиков), обеспечивая синхронизацию по временным шагам.
Видеокадры извлекались с частотой 25 кадров в секунду, с уменьшением разрешения до 224 × 224. Аудиосигналы обрабатывались с помощью полосного фильтра диапазона от 300 до 3400 Гц, чтобы устранить большинство шума окружающей среды. Данные отслеживания положения с GPS-датчиков записывались на частоте 10 Гц и интерполировались с помощью линейной интерполяции на основе временных меток, обеспечивая их соответствие с временной шкалой видео с частотой 25 Гц. Все входы выравнивались по времени с помощью общих временных меток, а их шкалы нормализовались с помощью z-скорнинга.
Извлечение признаков
Для сбора пространственно-временной информации видеоданных используются 3D CNN. 3D-CNN обрабатывают как пространственную, так и временную информацию между видеокадрами, что позволяет модели обнаруживать паттерны движения, понимать поведение группы и извлекать признаки, основанные на движении. Эта операция генерирует плотное представление признаков для каждой последовательности действий, которое используется как визуальный вход для модели. Каждый видеоклип содержал 16 последовательных кадров, сэмплированных с шагом 2. Во время обучения применялись случайное обрезывание, горизонтальное переворачивание и нормализация яркости. 3D-CNN был оптимизирован с использованием Адама (lr = 0,0001), размера партии 16 и потери перекрестной энтропии.
Встраивание и выравнивание мультимодальных входов
После этого с выходами 3D CNN интегрируются встраивания из разных модальностей. Используется архитектура мультимодальных трансформаторов, при этом различные ветви кодировщиков обрабатывают каждую модальность. Для слияния и выравнивания модальностей используются слои перекрёстного внимания, что позволяет модели фиксировать взаимозависимости (например, между положением игрока и движением мяча, а также контекстом из комментариев). Такое слияние позволяет обогащать контекстуальное понимание текущих тактических решений. Также реализовал все встраивания в PyTorch. Видеоэлементы проецировались линейно от 1 024 до 512 измерений, а аудио и позиционные элементы — в 256 и 128 измерениях соответственно, объединённые до 512 измерений до выравнивания времени.
Мультимодальный синтез на основе трансформаторов
Используется мультимодальный трансформатор для объединения характеристик, извлечённых из всех источников. Механизмы самоконцентрации в трансформаторе позволяют модели изучать взаимозависимости между модальностями (например, визуальная + аудио), фиксировать временной поток и контекст, а также выделять тактически важные кадры и события. Результатом этого шага является комбинированное представление, отражающее тактическое намерение и ситуационный контекст каждого принятого решения. Мультимодальный трансформатор состоял из шести слоёв энкодеров, каждый из которых имел восемь головок внимания. Матрицы внимания вычислялись с помощью масштабированного точечного произведения внимания. В Attention и Feed-Forward также были слои dropout с p = 0.1, чтобы избежать перенасадки.
Классификация и оценка тактических решений
Наконец, слитое представление подаётся в качестве входных данных в классифицированный слой или блок анализа решений, который используется для прогнозирования типа тактического решения, оценки качества решений и, по желанию, генерации объяснимых инсайтов для тренеров с помощью тепловых карт внимания или карт активации. Результаты этого этапа обеспечивают количественную и качественную оценку способностей команды или игрока принимать решения во время матчевой игры.
Глава классификации использовала трёхслойный MLP с активацией ReLU, за которой следовал слой softmax. Модель была обучена на разделении 70/15/15 с 10-кратной перекрёстной валидацией. Используемые метрики включали точность, точность, отзыв, результат F1, задержку и AUC.
Упрощённая блок-схема, суммирующая пять этапов, даёт немедленный визуальный обзор последовательного процесса, как показано на рисунке 2. Этот рисунок кратко отражает полный исследовательский конвейер, включающий сбор данных, предварительную обработку, извлечение признаков, мультимодальное слияние и тактическую классификацию решений, а затем подробные описания каждого этапа.

Рисунок 2. Общий рабочий процесс исследования. Обзор исследовательского конвейера — от сбора и предварительной обработки данных до извлечения признаков, обучения моделей и оценки. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Рисунок 3 показывает общий рабочий процесс предлагаемого исследовательского процесса. Процесс начинается на этапе 1: сбор и предобработка данных, где собираются и синхронизируются мультимодальные источники данных, такие как видео, аудио, отслеживание позиции и контекстные метаданные. На этапе 2: Извлечение признаков используются 3D сверточные нейронные сети (3D CNN) для извлечения пространственно-временной информации из видеопотоков, что приводит к плотным визуальным представлениям действий игроков и тактического потока. Этап 3: Встраивание и выравнивание мультимодальных входов объединяет аудио, видео и позиционные функции в общем латентном пространстве с временным и кросс-модальным выравниванием. Эти представления впоследствии агрегируются в Стадии 4: Мультимодальное слияние на основе трансформеров, где кроссмодальные и механизмы самовнимания позволяют модели изучать взаимозависимости между модальностями и получать более глубокие контекстуальные инсайты тактических решений. Наконец, на этапе 5: Классификация и оценка тактических решений, комбинированные представления подаются в слой классификации для обнаружения тактических решений, таких как пас, драйв или удержание. В то же время для оценки точности принятия решений и времени отклика используются показатели эффективности. Эта блок-схема даёт чёткий обзор пошагового подхода, дополняемый подробными текстовыми описаниями, изложенными в следующих разделах.

Рисунок 3. Конвейер последовательной обработки. Показывает пошаговый переход от сбора данных к классификации тактических решений и выводу модели. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Сбор и предобработка данных
Для обеспечения высокоуровневого тактического анализа принятия решений в командных видах спорта с помощью мультимодального синтеза с использованием Transformer была создана структурированная и высокоточная система сбора и предварительной обработки данных. Настройка включает объединение нескольких модальностей данных, включая видеозаписи, отслеживание позиций игроков, аудиосигналы взаимодействия игрока и тренера, а также контекстные метаданные, такие как фаза матча, структура команды и зоны владения мячом.
В выборке участвовали 40 мужчин в возрасте 20 лет и старше, все они активно участвовали в региональных любительских и полупрофессиональных футбольных лигах. Каждый из них был набран из четырёх конкурентных клубов с организованной программой тренировок. Средний возраст спортсменов составлял 20,1 ± 1,2 года, средний рост — 177,5 ± 3,1 см, а вес — 72,6 ± 2,9 кг. Они играли за свои клубы в среднем 6,8 ± 1,5 года. Все участники также имели не менее трёх лет опыта соревнований и были признаны тактически компетентными.
Для обеспечения статистической эффективности размер выборки был приближён с использованием уровня надёжности 95% (Z = 1,96) и уровня значимости 5% с ожидаемым коэффициентом внутриклассовой корреляции (ICC) 0,96 и доверительным интервалом 95% для почти идеального согласования. Это соответствует цели проверки надёжности и согласованности собранных мультимодальных данных принятиярешений 27.
Для обеспечения воспроизводимости настройки приобретения и технические спецификации стандартизировались на протяжении всех сессий. Видеоданные записывались в разрешении 1080p и 25 кадров в секунду с помощью камер GoPro Hero4 с режимом широкого обзора для захвата полного тактического пространства. Каждая запись была стабилизирована и установлена на фиксированной высоте 2,5 м. Аудиосигналы захватывались с помощью внешнего микрофона с частотой дискретизации 44,1 кГц (моно), а затем фильтровались с помощью фильтра полосы 300-3 400 Гц для удаления шума окружающей среды. Данные отслеживания положения собирались с помощью носимых GPS-датчиков с частотой 10 Гц, со средней точностью позиции, сообщаемой производителем, составляла ±0,5 м. Все модальности синхронизировались с помощью общих временных меток и пересэмплировались на общую временную шкалу 25 Гц с помощью линейной интерполяции.
Предварительная обработка включала следующее: понижение дискретизации видео до разрешения 224 × 224, кадровую дискретизацию 16 последовательных кадров с шагом 2, случайную обрезку, горизонтальное переворачивание, нормализацию яркости, нормализацию звука и фильтрацию шума, а также нормализацию позиционной и контекстной переменной z-score.
Скрипт предварительной обработки устроен в следующем порядке для воспроизводимости: (i) извлечение кадров; (ii) аудиофильтрация; (iii) GPS-интерполяция; (iv) модальность редискретизации до 25 Гц; (v) нормализация z-score; и (vi) тесты на целостность на коррупцию, закрытие и отсечение. Для автоматического прохождения каждого этапа используются скрипты для обработки пакетов.
Для обеспечения достоверности данных критерии контроля качества и исключения включали: i) последовательности с >20% окклюзией игрока, ii) GPS-перепадение более 200 мс, iii) повреждённое или обрезаемое аудио, и iv) сильное размытие движения или десинхронизация между модальностями. Всего было исключено 17 последовательностей (3,4%) для этих состояний. Таблица 1 показывает описание набора данных.
| Атрибуты | Подробности |
| Спорт | Футбол (соккер) |
| Участники | 40 мужчин-футболистов |
| Уровень игры | Федеративные футболисты с ≥5 годами опыта |
| Тип теста | Тест на принятие решений и исполнение пасов и драйв (контроль мяча) |
| Настройка тестирования | Стандартизированная организация футбольного поля, отмеченные зоны, фиксированные позиции |
| Инструменты измерения | Камеры GoPro Hero4, программное обеспечение Kinovea, хронометраж |
| Собранные данные | Время выполнения (ET), точность принятия решений (DM), количество правильных действий |
| Процедура тестирования | Игроки реагировали на визуальные стимулы тренеров и выполняли передачи или драйвы |
| Повторения судебных процессов | 10 испытаний на игрока (5 пасов, 5 драйвов) |
| Оценка | Эксперты получили рейтинг DM; ET измеряется с помощью временных меток/видео |
| Переменные исхода | Время реакции, правильное количество решений, технический результат исполнения |
Таблица 1: Описание набора данных. Подробно описаны демографические данные участников, процедуры тестирования, инструменты измерения и переменные результатов.
В настоящем исследовании использовались два связанных, но различных набора данных. Первый набор данных включал 40 игроков, участвовавших в задачах по принятию решений по контролируемому пасу и передаче, в основном используемых для установления базовой надёжности и валидации базовой процедуры измерения решений. Второй набор данных включает 500 мультимодальных тактических последовательностей, собранных из расширенных симуляций матчей и записей реальных игр. Эти последовательности составляли основной набор данных для обучения и тестирования для модели синтеза на основе трансформаторов, позволяя проводить оценку при более экологически обоснованных условиях.
Хотя набор данных включает 500 мультимодальных последовательностей, стратифицированная дискретизация обеспечивала сбалансированное представление тактических действий (Pass, Drive, Hold). Подходы к дополнению данных, такие как временное обрезывание и перетасовка последовательностей, также использовались для повышения вариабельности и снижения смещения модели во время обучения.
Стоит отметить, что управляемый набор данных из 40 игроков использовался при первоначальной валидации и тестировании надёжности модели, а большая коллекция из 500 мультимодальных последовательностей была собрана на основе длительных записей матчей и организованных обучающих сессий для оценки масштабируемости и экологической валидности фреймворка. Базовая надёжность обеспечивалась с помощью меньшего набора данных, тогда как более крупный набор данных способствовал обучению и тестированию крупномасштабных моделей.
Описание набора данных
В эксперименте было принято участие 40 мужчин-футболистов, каждый из которых имел не менее пяти лет опыта федеративной игры, чтобы убедиться, что выборка обладает базовыми техническими и тактическими компетенциями. Сбор данных велся в стандартизированной схеме футбольных полей, где заранее определённые зоны и игровые позиции распределялись для обеспечения одинаковых условий тестирования. Во время экспериментов участники должны были реагировать на визуальные сигналы тренера — либо передавать пас, либо продвигать мяч, воспроизводя тактические решения, принятые в реальной игре. Каждый участник прошёл в общей сложности 10 испытаний: пять с обгоном и пять с вождением. Эти движения фиксировались камерами GoPro Hero4, а данные о производительности измерялись с помощью программного обеспечения для видеоанализа Kinovea вместе с ручной секундомером для фиксации времени выполнения (ET). Основным источником данных: время выполнения, качество DM, оценённое опытными коучами, и количество правильных действий. Эти факторы предоставили количественную основу для анализа того, насколько быстро и эффективно игроки принимали и выполняли тактические решения в условиях контролируемого стимул-ответа. Созданный набор данных представляет собой структурированный и маркированный ресурс, хорошо подходящий для создания эталонов или обучения интеллектуальных систем с целью моделирования тактического мышления и моторных реакций в контекстах командных видов спорта.
Выборка ограничена молодыми мужчинами из одной региональной лиги, что может ограничить её обобщимость по возрастным группам, спортсменкам или другим культурам. Будущие исследования будут стремиться получить более репрезентативные и разнообразные выборки.
Ещё одним ограничением является размер выборки из 40 молодых игроков-мужчин из одной региональной лиги. Хотя однородная выборка способствовала внутренней валидности и снижению вариаций в результатах из-за возраста, пола и тактических различий, она также ограничивает обобщимость результатов для более широкой популяции. Тактические паттерны, которые модель усваивает, могут отражать региональные или гендерно-специфичные стили игры, а не универсальное поведение при принятии решений. Для этого исследования использовались стратифицированные выборки и дополнение данных для повышения вариабельности рассматриваемого набора данных; Однако для подтверждения устойчивости модели в различных футбольных условиях необходимы более масштабные исследования с участием женщин-спортсменок, молодых игроков, профессиональных игроков и участников из различных тактических культур. Эти результаты демонстрируют серьёзные перспективы, но требуют дополнительной проверки на более разнообразных и больших наборах данных, прежде чем можно будет получить более широкое обобщение.
Чтобы снизить субъективность, три профессиональных футбольных тренера независимо аннотировали тактические решения. Надёжность между оценщиками оценивалась с использованием коэффициента корреляции внутриклассов (ICC = 0,96, CI 0,94-0,98), что указывало на почти идеальное согласование. Обсуждение консенсуса разрешило разногласия. Для мультимодальных данных предварительная обработка включала временную синхронизацию между модальностями (видео с 25 кадрами в секунду и данные с датчиков 10 Гц) и нормализацию характеристик по z-score для сопоставимости между модальностями.
Надёжность между оценщиками была количественно измерена с помощью коэффициента корреляции между классами с двунаправленными случайными эффектами (ICC [2,3]), так как он подходит для оценки абсолютного согласия между несколькими оценщиками. ICC 0,96 (95% ДИ: 0,94-0,98) указывает на почти идеальное согласование по широко используемым порогам и дополнительно подтверждает, что тактические метки для обучения были высоко надёжными. Надёжность была рассчитана по всем 500 мультимодальным последовательностям, обеспечивая должное и последовательное аннотирование как контролируемых, так и симуляционных контекстов.
Процедура аннотаций и протокол маркировки
Все мультимодальные последовательности были аннотированы с помощью структурированного трёхступенчатого протокола. Во-первых, три лицензированных футбольных тренера независимо просматривали каждую видео-позиционную последовательность с помощью интерфейса аннотаций, синхронизированного временными метками (Kinovea + пользовательская таблица тегирования). Аннотаторы обозначали тактические категории принятия решений (Pass, Drive, Hold), контекстные сигналы (зона давления, доступность полос для обгона) и временные метки событий. Во-вторых, скрипт обнаружения разногласий автоматически выявлял случаи неоднозначности или конфликта, которые затем рассматривались на совместной встрече консенсуса. В-третьих, для обеспечения согласованности границ событий и временного выравнивания между модальностями, финальный проход проводил независимый старший аналитик. Этот процесс, для целей последующего обучения моделей, обеспечивал отслеживаемость каждой аннотации и наилучшего качества.
Предварительная обработка
В то время как текущее исследование проводилось с 500 мультимодальными последовательностями, конвейер предварительной обработки по замыслу был настроен для крупномасштабных наборов данных. Все модальности проходили автоматические скрипты, которые параллельно извлекали видеокадры пакетно, пересэмплировали аудио, интерполиировали позиционные данные и применяли нормализацию z-score. Наличие модульной архитектуры позволяет каждой модальности самостоятельно предварительно обрабатываться на отдельных потоках GPU/CPU. Это позволяет воспринимать материалы матчей в большом объеме. Это позволяет легко масштабировать рабочий процесс до полносезонных наборов данных без ручного вмешательства и делает фреймворк подходящим для реального внедрения в профессиональных аналитических средах.
Для правильного анализа тактического принятия решений в командных видах спорта необходимо предварительно обработать и выравнивать исходные данные из различных модальностей — например, видеоклипы, аудиосигналы и записи позиций. Иллюстрация мультимодального входа выглядит
(1)
Здесь V обозначается как серия характеристик видео, извлеченных из энкодера CNN.
(2)
Здесь A — аудиохарактеристика, кодируемая wave2vec.
(3)
P обозначает координатное положение игрока в момент времени ti.
Для работы с асинхронными частотами дискретизации каждая модальность редискретируется или интерполируется в общую временную шкалу:
(4)
Здесь
, — синхронизированнаяхарактеристика f t , — скорость объединённого кадра, Xm — начальное указание.
Для равномерного масштаба по модальностям все векторы признаков нормализуются по z-шкале:
(5)
μX и σX обозначают среднее и стандартное отклонение размерности признаков в обучающем множестве.
Хотя основными проблемами являются решения по передаче/прорыву, аудиоканалы (например, коммуникация игрок/тренер, игровые сигналы окружения) были добавлены для учёта реальных ситуаций матча, когда речевые сигналы влияют на тактическую реакцию. Гиперпараметры (например, скорость обучения, эпохи) выбирались с помощью поиска по сетке и существующих оценок в мультимодальном обучении, что обеспечивало баланс между стабильностью сходимости и вычислительной эффективностью.
Гиперпараметры предлагаемого фреймворка — скорость обучения, размер пакетов и эпохи обучения — были выбраны с помощью хорошо спланированного систематического поиска сетки для достижения как стабильности сходимости, так и вычислительной эффективности. Выбор скорости обучения 0,0001 с оптимизатором Адама оказался стабильным для обновления градиента без колебаний, а размеры пакетов оптимизировались для балансировки ёмкости памяти GPU с обучающей пропускной способностью. Настройка 50-100 эпох была использована для обеспечения адекватного обучения без перенагона, что подтверждается отслеживанием потерь валидации и 10-кратной перекрёстной валидацией. Эти значения не устанавливались произвольно, а определялись более ранними испытаниями в мультимодальном обучении и корректировались экспериментальными испытаниями на текущем наборе данных. Этот строгий процесс гарантировал, что выбранные гиперпараметры способствовали стабильному обучению модели и воспроизводимому улучшению производительности по сравнению с базовыми подходами.
Хотя задание по классификации сосредоточено на решениях по передаче/драйву/удержанию, аудиоинформация была включена намеренно, поскольку реальное тактическое поведение в футболе сильно зависит от коммуникации между игроком и тренером, отдачи командных сигналов, прессинговых сигналов и звуков окружающей среды (например, контакт с мячом, подход соперника). Эти сигналы часто предшествуют или совпадают с принятием решений и являются частью естественной перцептивной среды футболистов. Предварительные абляционные эксперименты показали, что исключение аудио снижает воспоминание на 3,8%, что свидетельствует о том, что даже тонкие акустические сигналы способствуют осознанию контекста. По этой причине аудио сохранялось для сохранения экологической достоверности и улучшения способности модели обобщать на реальные условия совпадения.
Действительно, в дополнительную поддержку этих гиперпараметров был проведён внутренний анализ чувствительности путём систематического изменения скорости обучения от 1e-5 до 5e-4, размера пакета от 8 до 32, количества слоёв трансформаторов от 4 до 8 и количества головок внимания от 4 до 12. Выбранная конфигурация с частотой обучения 1e-4, размером партии 16 и 6-слоевым энкодером с 8 головками внимания непрерывно обеспечивала стабильную сходимость с минимальными потерями валидации, минимизируя перенасадку при 10-кратной кросс-валидации. Большие партии приводили к нестабильности градиента, тогда как меньшие партии увеличивали шум и задерживали сходимость. Аналогично, модели трансформаторов с более чем 8 головками не показывали повышения производительности, но значительно увеличивали время вычислений. Полученные результаты оправдывают окончательные настройки гиперпараметров, использованных в этом исследовании.
Извлечение признаков с использованием 3D-сверточной нейронной сети
В предлагаемой фреймворке Transformer-Based Multimodal Fusion для тактического принятия решений в командных видах спорта 3D сверточная нейронная сеть (3D CNN) отвечает за извлечение пространственно-временных признаков из необработанных видеоклипов.
В отличие от двумерных CNN, которые учитывают только пространственные измерения (ширина W и высота H), 3D-CNN также учитывают временную размерность R, что позволяет им обнаруживать динамику движения и последовательные паттерны, важные для понимания поведения команды, таких как продвижение и передачи в футболе.
3D-CNN28 впервые предложен для объединения пространственной и временной информации видеоданных. 3D-ядро используется в алгоритме 3D-свёртки для куба, состоящего из кадров с частью столбцов, сложенных в стопе. 3D-свёртка может быть записана в Eqn (6)
(6)
Где:
— выходная особенность в точке (x, y, z) на j-й карте признаков l-го слоя.
— вес ядра в точке (h,w,r) из входной карты m-го входа.
— вход при пространственно-временном смещении от предыдущего слоя. blj — смещение. f(.) — функция активации (обычно ReLU). M — это количество входных отображений признаков из предыдущего слоя. Это уравнение позволяет 3D-CNN параллельно объединять пространственную (высоту и ширину) и временную (последовательность кадров) информацию.

Рисунок 4. Архитектура обработки 3D CNN. Иллюстрирует, как пространственно-временные особенности извлекаются из видеопоследовательностей с помощью 3D-сверточных операций. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Рисунок 4 показывает рабочий процесс 3D-CNN. Конвейер начинается с фазы ввода, когда необработанные видеопотоки футбольной игры объединяются с организованными данными, включая местоположение игроков, статистику игры и контекстные метаданные. Эта мультимодальная информация сохраняет как визуальную динамику, так и ситуационный контекст, что критически важно для анализа тактики команды. Затем видеопоток проходит через 3D-сверточную нейронную сеть (3D CNN). В этом случае на входных кадрах используется серия 3D-сверточных слоёв. Слои связаны с пространственными измерениями (высота и ширина) и временным измерениями (фреймы), позволяя сети изучать паттерны движения, взаимодействия игроков и тактику, основанную на последовательности, такие как передачи или драйвы. Впоследствии образуется куб особенностей с плотными пространственно-временными особенностями. Этот куб подвергается операциям пулирования для уменьшения размера при сохранении значимых особенностей. При пуле объём признаков сжимается в одномерный вектор, обеспечивая краткое представление тактической ситуации. Этот вектор признаков впоследствии входит в полностью связанную глубокую нейронную сеть (DNN). DNN — это блок принятия решений, который обрабатывает объединённые и извлеченные функции для принятия тактических решений, таких как передача, удар или удержание. Выход сети — это окончательное тактическое решение, принимаемое системой, исходя из реальной ситуации в реальном времени, а также изученных стратегических шаблонов.
Встраивание и выравнивание мультимодальных входов
После извлечения признака три элемента, такие как аудио, видео и статистическое положение плеера, приводятся в качестве входной модальности.
Чтобы ввести их в трансформатор, а затем подать каждый из них через обучаемую функцию вложения:
(7)
где f3DCNN изучает пространственно-временные особенности каждого временного среза Vt и отображает его в d-мерное латентное пространство.
(8)
где W, P и bP — обучаемые веса.
(9)
Все вложения выровнены по временной размерности T. Если у модальностей разные частоты, используется интерполяция или понижающая дискретизация:
(10)
Теперь все модальности синхронизируются следующим образом:
(11)
Чтобы сохранить временной порядок в трансформаторе, также введите позиционные кодировки для каждого вектора:
(12)
Где
обозначает стандартное синусоидальное или обучаемое позиционное кодирование.
Каждая модальность операционно кодируется с помощью линейного слоя PyTorch, объединяется в 512-мерный вектор и затем подаётся в последовательность входа трансформатора после позиционного кодирования. Это гарантирует, что единое вложение готовится к перекрёстному внимания на каждом этапе времени.
Финальный тензор —
(13)
подаётся в Transformer Encoder, где механизмы самосознания и кроссмодального внимания позволяют модели совместно рассуждать по всем модальностям для принятия тактических решений.
Мультимодальный синтез на основе трансформаторов
В предлагаемом подходе используется метод факторизации матриц с низким рангом для интеграции полученных мультимодальных векторов данных. Проблема высокоразмерности, возникающая при прямом слиянии тензоров, решается этим методом, который использует коэффициент низкорангового разложения длятензорного синтеза 29. Каждая модальность изначально выражается как вектор, а уменьшение размерности, сохраняющее значимые взаимодействия, достигается с помощью низкорангового разложения. Термоядерный тензор ZM среди M модальностей построен следующим образом:
(14)
Здесь:
— низкоранговый множитель m-го модальности,
— внешнее произведение, а r — ранг разложения.
Вектор слияния h затем вычисляется как:
(15)
При использовании двух модальностей отдельно, редуцированное слияние выглядит следующим образом:
(16)
Это создаёт совместный мультимодальный вектор представления h, который моделирует кроссмодальные взаимодействия на латентном уровне.
После получения низкорангового вектора слияния h, модуль трансформера моделирует зависимости и выравнивает семантические представления между модальностями. Кросс-модальное внимание специально разработано так, чтобы одна модальность могла обращать внимание на другую:
(17)
Где Qm — запрос по модальности m, Kn, Vn — векторы ключа и значения в модальности n, dk — размерность ключевых векторов. Такая схема облегчает потоки внимания, специфические по модальности, позволяя обрабатывать каждую категорию ввода относительно других (например, синхронизация движения игрока с индикаторами контекста игры и видео).
Векторы с перекрестным присутствием накладываются и классифицируются через многослойный перцептрон (MLP). Результат — тактическая метка принятия решений (например, pass, drive, hold), кросс-энтропийные потери, оптимизированная для сквозного обучения.

Рисунок 5. Мультимодальная архитектура слияния на основе трансформаторов. Показывает, как визуальные и сенсорные модальности интегрируются с помощью трансформаторного кодера для улучшения представления признаков. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Мультимодальный блок слияния, как показано на рисунке 5, сочетает визуальные и позиционные входы. Это необходимая конструкция, поскольку тактические решения требуют пространственного восприятия и динамики движений, которые нельзя представить одной модальностью.
Рисунок 5 показывает рабочую структуру мультимодального синтеза на основе трансформаторов. Эта конструкция объединяет разнообразные данные, видео, пространственные координаты и контекстные данные игры в одном канале для прогнозирования тактических действий, таких как передача, драйв или удержание. Подход начинается с ввода видео, которые проверяются с помощью 3D сверточной нейронной сети (3D CNN). Эта система идентифицирует как пространственные, так и временные структуры в видео, что позволяет ей фиксировать динамичную активность и коммуникацию игроков со временем. Тем временем контекстуальная и позиционная информация передаётся через вложенные слои, преобразующие структурированные входы в плотные векторные представления. Контекстные, позиционные и видеопотоки затем могут быть объединены с помощью модуля низкорангового синтеза. Этот подход эффективно достигает межмодальных корреляций через разложение пространственного слияния, минимизируя вычислительную сложность и сохраняя существенные взаимосвязи между модальностями. Наконец, слитое мультимодальное представление обрабатывается кодером трансформатора с кросс-модальным вниманием. Эта процедура позволяет модели сосредоточиться на правильных характеристиках в разных модальностях и временных шагах, что улучшает понимание стратегического поведения в игре. Наконец, закодированный выход проходит через блок конкатенации и многослойного перцептрона (MLP), который сопоставляет полученное представление с некоторыми тактическими решениями. Результаты модели классифицируют действия игроков, такие как «пас», «драйв» или «удержать», чтобы позволить интеллектуально и основанное на данных анализировать тактику команды.
В предлагаемой системе тактического анализа Transformer-Based Multimodal Fusion для командных видов спорта последним этапом является классификация и оценка тактических решений, которые преобразуют изученные мультимодальные представления в применимые для принятия решений ярлыки. После слияния видео, позиционных и контекстных признаков с помощью низкорангового слияния и тонкой настройки с помощью кросс-модального внимания в кодере трансформера, полученные векторы признаков подаются в классификатор многослойного перцептрона (MLP). Каждый класс принятия решений представлен функцией активации softmax, что даёт вероятностные оценки для всех возможных действий. Наиболее вероятный класс выбирается как предсказанное решение модели. Модель обучена на функции потери кросс-энтропии, которая вознаграждает правильные прогнозы и помогает сети научиться различать схожие различия в тактических ситуациях. Кроме того, можно рассматривать оценку во временной области для подтверждения отзывчивости в игровых ситуациях в реальном времени или почти в реальном времени, обеспечивая точность классификатора и не тратя времени в игровых условиях. Таблица 2 показывает архитектуру модели и гиперпараметры.
| Компонент | Технические характеристики |
| Слои кодировщиков трансформаторов | 6 |
| Внимание, руководители | 8 |
| Скрытое измерение | 512 |
| Размер слоя с подающей прямой подачи | 2048 |
| Измерения вложения | Видео: 1024 → 512, Аудио: 256 → 512, Позиционирование: 128 → 512 |
| Позиционное кодирование | Обучаемость |
| Метод термоядерного синтеза | Мультимодальное слияние низкого ранга (ранг r = 16) |
| Оптимизатор | Адам |
| Скорость обучения | 0.0001 |
| Размер партии | 16 |
| Эпохи обучения | 50–100 |
| Отброс | 0.1 |
| Функция потерь | Кросс-энтропия |
Таблица 2: Архитектура модели и гиперпараметры. Перечисляет обучающие настройки и ключевые компоненты предлагаемой мультимодальной модели синтеза на основе трансформаторов.
Для большей ясности и воспроизводимости мультимодальный трансформатор реализовывался с помощью 6-слойного стека энкодеров, каждая из которых была оснащена 8 головками внимания и скрытой размерностью 512, что соответствует типичным настройкам трансформатора для мультимодальных задач среднего масштаба. Каждая модальность проходит через блок вложения: видео через выход 3D-CNN-энкодера, 1024-дим; аудио с помощью энкодера на базе Wave2Vec, 256-дим; а также позиционные плюс контекстные функции с помощью двухслойного MLP-энкодера 128-DIM. Все эти вложения были проецированы в общее 512-мерное латентное пространство посредством обучаемых линейных преобразований. Для установления временного выравнивания все модальности сначала интерполируются на одну частоту 25 Гц, затем применяются изученные позиционные кодировки для сохранения временного порядка. Кросс-модальное выравнивание осуществляется с помощью слоёв кросс-внимания, которые явно изучают корреляции между модальностями перед тем, как быть введены в стек энкодеров самовнимания. Эти архитектурные решения были сделаны для баланса ёмкости модели с вычислительной эффективностью, обеспечивая стабильную сходимость на среднеразмерном наборе данных.
На практике предлагаемая фреймворк Transformer-Based Multimodal Fusion наиболее подходит для сценариев с доступными синхронизированными мультимодальными данными, таких как структурированные тренировки, контролируемые симуляции матчей или профессиональные среды с согласованными видеопотоками и системами отслеживания позиции. Четыре основных входа, необходимые для метода: (i) видео высокого разрешения, (ii) данные позиционного отслеживания (GPS/LPS), (iii) аудиопотоки и (iv) контекстные метаданные — например, владение, зоны давления, фаза совпадения. Для достижения надёжной работы эти методы должны быть согласованы по времени с минимальным дрейфом (видео ≥ 25 кадров в секунду и датчики положения ≥ 10 Гц), а также сохранять стабильные точки обзора и минимальный шум сигнала. Те настройки, которые не обеспечивают такие синхронизированные входы, например, любительские матчи с нерегулярными ракурсами камеры, прямые трансляции с артефактами задержки/сжатия или среда без инфраструктуры позиционного отслеживания, будут менее актуальны для фреймворка. Кроме того, текущая система лучше всего работает в полуконтролируемых условиях, но может быть значительно менее надёжной в полностью неконтролируемых условиях живых матчей, где освещение, окклюзия и динамический шум толпы влияют на качество сбора данных. Эти ограничения очерчивают практические границы, в рамках которых может быть внедрена эта система, и подчеркивают, что последовательное захваление данных в нескольких режимах крайне важно для применения предлагаемой модели.
Модификации и устранение неисправностей
На практике в мультимодальном конвейере могут возникнуть различные проблемы, которые снижают стабильность модели или общую производительность. Одной из распространённых проблем является временное несогласование между модальностями, когда видео, записанное на 25 кадрах в секунду, и позиционные данные, зафиксированные на 10 Гц, не синхронизируются, что приводит к несовпадающим сигналам, дестабилизируя карты внимания и снижая воспоминание. Это можно решить, применяя ресемплирование на основе временных меток, линейную интерполяцию и автоматическое удаление последовательностей с чрезмерным дрейфом. Аудиоканалы также могут страдать от шума, вызванного ветром, шумом толпы или клиппингом микрофона, из-за чего трансформатор игнорирует аудиотокены и немного снижает точность. Применение полосной фильтрации, спектрального гейтинга и замена сильно повреждённых сегментов нулевыми векторами помогает сохранить стабильность аудиовложения. Проблемы с качеством изображения, такие как окклюзия игрока или размытие движения, могут ослабить пространственно-временные представления 3D-CNN и усилить путаницу между пасом и драйвом. Это компенсируется за счёт исключения сильно окклюзированных последовательностей и применения стратегий аугментации, включая случайное обрезывание, нормализацию яркости и симуляцию размытия движения. Нестабильность трансформатора может возникнуть, если шкалы вложения различаются между модальностями, что приводит к колебаниям потерь валидации или скачки градиента. Обеспечение стабильной нормализации z-скорлов, использование расписания разогревающей скорости обучения, использование градиентного клиппинга и увеличение количества выброса могут восстановить стабильные тренировки. Слияние низкого ранга также может стать проблемой, если ранг слияния установлен неправильно, что приводит к искажению межмодальных отношений и дисбалансу классов. Поддержание умеренного ранга для небольших наборов данных, повышение ранга для больших наборов данных и применение регуляризации L2 помогают сохранить сбалансированное слияние. Вычислительные узкие места могут возникать из-за больших видеотензоров, вызывающих переполнение памяти GPU или медленное обучение. Эти проблемы можно решить с помощью обучения смешанной точности (FP16), снижения разрешения входов во время ранних экспериментов или кэширования заранее вычисленных 3D-CNN-возможностей. Наконец, естественный дисбаланс классов в тактических решениях, особенно для «Драйв», может снизить отзыв и вызвать колебания в AUC; Применение классово-сбалансированных потерь, чрезмерная выборка действий меньшинств и обогащение контекстных метаданных значительно улучшают баланс и дискриминацию при принятии решений. Это объединённое руководство по устранению неполадок гарантирует, что исследователи и практики могут поддерживать стабильные условия обучения, повышать воспроизводимость и эффективно адаптировать фреймворк в различных наборах данных и средах.