Research Article

チームスポーツにおける戦術的意思決定分析のためのトランスフォーマーベースのマルチモーダルフレームワークで、サッカーに応用

DOI:

10.3791/69806

January 27th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

フットボールにおける戦術的意思決定の分類を改善するために、本研究は視覚的、位置的、音響的、文脈的データを統合したトランスフォーマーベースのマルチモーダル融合モデルを提案します。このモデルは500シーケンスのマルチモーダルデータセット上でほぼリアルタイムの性能を達成し、精度と圧力による誤分類の面でCNN-LSTM、BiLSTM-Attention、GNNベースラインを上回っています。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

現代サッカーでは迅速かつ正確な戦術的判断が求められます。しかし、戦術的意思決定の評価における従来のアプローチは生態学的妥当性が低く、容易にスケールアップできません。これらの課題に対応するため、本記事ではプレイヤーの位置取り、映像、音声、コンテキストメタデータを取り入れたトランスフォーマーベースのマルチモーダルフュージョンモデルを紹介し、リアルタイムの戦術的意思決定を分類します。40人の男性プレイヤーと、500回のマルチモーダルプレイのシーケンスからなるデータセットを対象に実験が行われました。40人のプレイヤーデータセットは、初期検証と信頼性評価に使用される管理された実験室スタイルの意思決定実験を指します。その後、拡張されたマッチシミュレーションと実戦記録から500のマルチモーダルシーケンスを抽出し、マルチモーダルトランスモデルのトレーニングおよびテストに用いられる大規模なデータセットを提供しました。

入力はデータ取得、前処理、特徴抽出、トランスベースの融合、意思決定分類の5段階で処理されます。CNN-LSTM、BiLSTM-Attention、GNNの基準と比較して、提案されたアプローチは意思決定予測の精度を28%向上させ、圧力による誤分類を41%削減し、推論遅延が52.6msと低く、ほぼリアルタイムの応用に適しています。また、発見の一般化は、より多様な戦術的文脈やより広範なアスリート層への一般化も、単一地域の若い男性選手というサンプル集団の規模が比較的小さく均質であることによって制限されています。これらの結果は、トランスを基盤としたマルチモーダル融合が自動化された戦術的意思決定解析への貢献を強調し、より多様で大規模なマッチ状況でのさらなる検証の必要性を指摘しています。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

サッカーのようなチームスポーツは、動的で不確実な環境で迅速な戦術的判断を求められます。プレイヤーは常にボールや味方、相手の視覚情報を読み取り、数分の一秒で反応して競争上の優位を確保しなければなりません。フットボールにおける戦術的意思決定は、選手の動き、ボールの軌道、状況の合図を素早く把握することに大きく依存しています。反応時間や選択的注意などの一般的な知覚認知スキルは確かにパフォーマンスに影響を与えますが、最近の研究では実際のゲーム内の戦術認知を近似できるデータ駆動型の文脈認識モデルが強調されています。反応時間や認知能力などの知覚能力もパフォーマンスに重要な役割を果たします 6,7,8。スポーツ認知の最近の研究では、戦術的意思決定は知覚スキルだけでなく、動的な空間情報、相手のプレッシャー、そしてリアルタイムでゲーム内の状況を統合するアスリートの能力にも依存していることが明らかになっています。知覚認知の専門性に関する研究は、戦術的にリテラシーの高いプレイヤーほど、手がかりをより早く認識し、より効率的に情報を収集し、プレッシャー下でもより安定した意思決定パターンを示すことが示唆されています。これらの発見は、スポーツ意思決定プロセスの複雑で多層的な性質を捉えることができる計算モデルの必要性を支持しています。

戦術的意思決定を評価する古典的な方法は、しばしば制御された実験室作業や主観的な専門家判断を用いており、生態学的妥当性や拡張性に大きな制約を課します。最近のディープラーニングの進歩は、ビデオ、位置追跡、コンテキストマッチメタデータなどのマルチモーダルデータ源を用いて、時間的およびクロスモーダル依存性キャプチャアーキテクチャ内でこのプロセスを自動化する可能性を示しています。この進歩にもかかわらず、現在のほとんどのモデルは依然として畳み込みニューラルネットワーク-長短期記憶または双方向長短期記憶(CNN-LSTM または BiLSTM)モデルに基づいており、モダリティ間の長期依存性をモデル化する能力は限られています。この欠点こそが、フットボールのシナリオで戦術的意思決定をより包括的かつ安定的にモデル化するために、トランスを基盤としたマルチモーダル融合モデルの開発の原動力となっています。例えば、対戦相手のチームスポーツであるサッカーでは、選手はチームメイトや相手、フィールド上の位置など、ボールに関する情報を素早く評価しなければなりません。選手の能力、コーチの指示、試合の状況に基づいて最善の方針を決める前に、9,10。組織化されたデータセットと定義された戦術要素のアクセス可能性のため、本研究はサッカーに専念しています。しかし、意思決定のための戦術的原則は多くのチームスポーツに適用されます。

実際、過去の研究では、CNN-LSTMとBiLSTMは固定された受容野を用いたり、シーケンシャルゲーティング11,12,13によって制限されることで、非常に長距離の時間的依存性を捉えることができないことが示されています。同様に、アクション認識やマルチモーダル時間モデリングの基礎的なベンチマーク研究は、LSTMベースのモデル性能がシーケンス長の増加や文脈的な手がかりが数フレーム間隔で発生する場合に低下し、動的なスポーツ環境での生態学的妥当性を制限することを示しています。さらに、グラフニューラルネットワーク(GNN)ベースのモデルは空間的相互作用モデリングにおいて強力なツールですが、細かい時間的推論が必要なシナリオや、文脈の圧力手がかりが時間とともに急激に変化する場合では一貫して性能を発揮していません(14,15)。これらのアプローチとは対照的に、より新しいトランスフォーマーベースのフレームワークは、長距離の時間的手がかり、空間的関係、文脈的信号を単一の前進パスで統合し、グローバルな自己注意によって可能にすることで、スポーツ分析、人間の活動認識、ビデオ言語タスクにおいて優れているパフォーマンスを示しています。このようなベンチマーク的な発見は、本研究で提案されたモデルの基盤としてトランス構成アーキテクチャを選定することを正当化しています。

戦術的知識の向上と戦術原則の理解は、ゲームの制約や課題を解決するために重要であることが示されています。フットボール選手は、テクニカル・タクティカル・トレーニングを通じて、ペネレーション、オフェンシブプロテクション、ムーブメント、時間、リミテクション、ディフェンスプロテクション、バランス、フォーカスなど、さまざまなゲーム要素を学びます。選手がフットボールの経験を積むにつれて、技術的・戦術的な基本への理解も深まるはずです。そのため、プレイヤーは関連するシグナルをより容易に識別でき、特定のシナリオ19における各ゲームルールに適した意思決定を容易にします。そのため、選手は運動効率や意思決定能力を活かし、動きのパターンに専門的な才能を活かすことができます。

著者は多属性意思決定を用いて運動と習慣のフィットネス効果を分析し、学生の体育における専門的なトレーニング能力の有効性を示しました。効果的な身体活動、健康的なフィットネス習慣の形成、そして教育機関におけるスポーツの描かれ方の改革を提唱することなど、すべてが非常に重視されています。ファジィ数の補助付き直観主義的ファジィ加重ヘロン平均(IFWHM)が効果的な意思決定に用いられます。その結果は大学生の認知的成功を支え、身体的健康問題をより正確に評価できることを示しました。データ内の潜在的なリンクを検出するために、研究者20 は拡張アプリオリ法を用いました。この研究の結論は、高等教育における学生の身体的健康評価に関連しています。最初の結果は、発生頻度に応じて異なる向きの疲労を評価することで決定されます。

これまでのスポーツ分析におけるAIベースの研究は、選手の検出、追跡、グループ活動の認識などのコンピュータビジョンタスクに焦点を当ててきました。近年の弱い監督型かつ検出器なしのアーキテクチャは、戦術的行動の理解においてマルチモーダルおよびコンテキスト認識モデリングの重要性を明らかにしました。これらの進歩により、フットボールにおける戦術的判断を分類するためのマルチモーダル深層学習の統合が必要とされています。行列分解によって効用行列から生成された潜在特徴ベクトルを用いて、本記事のユーザーとユーザー、またはアイテムとアイテム間の余弦類似度を計算します。

最近のスポーツ分析研究は、映像、位置データ、文脈的手がかりを組み合わせて戦術的行動を解釈するマルチモーダルかつコンテキスト認識型ディープラーニングフレームワークへとシフトしています。スポーツ環境における長期時間構造やクロスモーダル関係のモデリングにおいて強力な能力を示す様々なトランスフォーマー手法が示されており、以下にはマルチモーダルアクション認識のためのMM-ViT、スポーツ文脈推論のための統一コントラビティブフュージョントランスフォーマー、クロスアテンシパインドイベント検出器が含まれます21,22.これらのアプローチは、戦術的意思決定は単一モーダリティのCNN-LSTMモデルではなく、プレイヤー間の相互作用、空間、動きの手がかり、文脈情報の相互作用を捉えるアーキテクチャで最もよく表現されることを示しています。この方向性のもと、本研究ではトランスフォーマーベースのマルチモーダル融合フレームワークを活用し、視覚的、ポジショナル、コンテキストの信号を共同処理し、フットボールの戦術的意思決定をほぼリアルタイムでモデリングします。

従来のフットボール分析モデルは、局所的な時間パターンを捉えつつも、モダリティをまたいで長期的な依存性に苦労するCNN-LSTMやBiLSTMアーキテクチャを基に構築されていました。トランスフォーマーはグローバルな自己注意を適用することでこのギャップを埋め、プレイヤーの動き、ボールの軌道、状況的な手がかりを延長時間ウィンドウの鍵機能にまたがらせ、堅牢な戦術的意思決定分析を可能にします。推薦システムにおける評価データのスパーシティ問題を解決するために、著者23,24はレビューベースの協働フィルタリングと評価補完を組み合わせたレビューベースマトリックス分解技術を提案しました。

しかしながら、これらの手法の有効性、スケーラビリティ、適用性は、推論にバウンディングボックスに依存していることや膨大なデータラベリングの必要性によって大きく制約されています。この問題を解決する一つの方法は、バウンディングボックスラベルを使ってプレイヤー検出とグループ活動認識を同時に訓練することです(25,26,27,28)。アクターレベルのバウンディングボックス注釈はトレーニングデータに依然として必要ですが、提案された手法は推論中のプレイヤーのバウンディングボックスを計算します。弱い監督付きグループ活動認識(WSGAR)アプローチは、トレーニングや推論にアクターレベルのラベルを必要としず、注釈の負担を軽減することを目的としています。外部データセットで事前学習済み検出器を使ってバウンディングボックスの提案を生成した後、無関係な検出をフィルタリングする方法を学びました。最近研究者たちはWSGARチャレンジに対して検出器を使わないアプローチを発表し、トークン埋め込みを用いて部分的なコンテキストを生成し、プレイヤー情報を収集しました。

スポーツ分析において、マルチモーダルおよびトランスフォーマーベースのアーキテクチャは、長距離の時間的パターンを捉え、異種なデータストリームを統合できるため、近年重要性を増しています(30,31)。トランスフォーマーのバリアントは、プレイヤーの動き予測、マルチビュー戦術分析の実行、行動意図の認識に応用されており、CNN-LSTMモデルと比較して優れた時間的推論能力を示しています。映像、位置、文脈の手がかりを組み合わせたマルチモーダル融合戦略は、リアルタイム戦術モデリングにおいて有望な早期成果をもたらし、ゲーム内の意思決定動態を理解する上でクロスアテンションやシーケンス間学習の重要性を強調しました。

トランスフォーマーベースのマルチモーダルフレームワークは、多様なデータストリームの統合が必要な分野で、最近優れた性能を示しています。例えば、ViTベースのマルチモーダル融合モデルは、クロスアテンションプロセスを用いてビデオ、ポーズ、音声情報を共同解釈し、コンテキスト認識イベント予測、プレイヤー追跡、アクション認識に活用されています32,33。さらに、MM-FormalおよびPerceiverベースのアーキテクチャは、スポーツ分析や人間活動分析において、空間・時間的な手がかりの融合や長期時間推論において、再帰モデルや畳み込みモデルを上回っています。34。これらの結果は、トランスフォーマーがグローバルアテンションを通じてモダリティ間の細かな相互作用を捉えることができることを示すことで、本研究におけるトランスフォーマーベースのマルチモーダル融合アーキテクチャの使用を支持しています。35。トランスフォーマーは特に戦術的解析に適しており、そのグローバルな注意により、モデルは視覚的手がかりや位置データ、文脈信号をより長い時間的ウィンドウにわたって関連付けることができ、これはCNN-LSTMやBiLSTMモデルにはない機能です。

これまでの研究では、ドライビングやパスなどの事前に決められた活動におけるパフォーマンススピードや意思決定の正確さを評価するために、主に手動で作成された認証済みの評価が用いられてきましたが、チームスポーツにおける戦術的意思決定の評価への関心が高まっているにもかかわらずです。これらのフレームワークは、プレイヤーの行動や意思決定の卓越性に関する洞察に満ちたデータを提供しつつも、スケーラビリティ、客観性、動的で現実世界の状況への適切さの面で限界があります。プレイヤーの行動、視覚信号、音声手がかり、ゲーム設定間の複雑な関連付けを含む戦術的意思決定の多様性を記録・理解できるコンピュータ化されたデータ駆動型アプローチは、現在の手法40,41,42には統合されていません。さらに、背景関係と時間的関係を切り替えられる多面的なAI構造は、これらの手法ではしばしば見落とされがちです。ビデオ映像や位置追跡などの豊富なリアルタイムデータソースを利用し、チームスポーツにおける意思決定プロセスを組み込むトランスフォーマーベースのマルチモーダル融合フレームワークの成長は明らかに不足しています。このギャップを埋めることで、高性能スポーツ環境における戦術的浸透性、スケーラビリティ、意思決定の独立性が大幅に向上します。現在のCNN-LSTMおよびBiLSTM手法とは対照的に、このトランスフォーマーベースの融合は視覚的、空間的、文脈的情報間のクロスモーダル注意を意識的にモデル化します。このような新規性は戦術的表現をより密に促進し、圧力シナリオにおける誤分類を40%以上最小化するのに役立ちます。

本研究の主な目的は、フットボールにおける戦術的意思決定を評価するためのトランスフォーマーベースのマルチモーダル融合フレームワークを開発することです。提案された枠組みは他のチームスポーツにも一般化可能ですが、本研究は戦術的複雑さと構造化されたデータセットの利用可能性からフットボールに焦点を当てています。このシステムは、専門家の評価に基づき、管理された孤立したフットボールタスクにおける戦術的正確さと対応タイミングの構造化された評価を可能にします。本研究は、位置追跡、映像、音声信号、文脈ゲーム情報などのマルチモーダルデータソースを統合することで、手動評価および静的テスト環境の限界に取り組みます。

トランスフォーマーベースの注意プロセスを用い、提案されたフレームワークはマルチモーダルリンクを継続的に学習し、プレイヤーのリアルタイム意思決定方法を統一的かつ文脈認識した解釈を可能にします。

この決定の主な目的は、データ駆動型の洞察を通じてコーチやアナリストに選手の思考やチームのダイナミクスをより深く理解させることで、スポーツにおける知的なパフォーマンス評価を促進することです。

提案されたフレームワークは、トランスフォーマーの注意メカニズムを活用してインターモーダル関係を継続的に学習し、リアルタイムゲームにおけるプレイヤーの意思決定戦略を統一的に理解できるようにします。

これにより、標準的な評価手法では特徴づけにくい戦術的行動に関する実用的な洞察を与える能力がシステムに提供されます。

目標は解釈性を高め、コーチやアナリストにより有用な情報を提供することです。

本書の主な貢献は以下の通りです。

本研究は、トランスフォーマーベースのマルチモーダル融合設計を用いて、チームスポーツにおける戦術的意思決定分析のための新しいディープラーニングモデルを提示します。

実際の試合映像から抽出された視覚的、位置情報的、文脈的なデータの流れを統合することで、このアプローチは単独パスやドライブアクションに焦点を当てたベース研究で導入された単純な評価手法の範囲を大幅に拡大します。

マルチモーダルエンコーダは、プレイヤーの追跡データ、視覚フレーム、文脈的なマッチイベントをアテンション機構を用いて統合することで、高度な時空間関係を収集します。

ベンチマークフットボールデータセットでの実験では、このモデルがCNNベースの融合手法やLSTMなどの従来のベースラインを上回ることが明らかになりました。

CNN-LSTM、BiLSTM-Attention、GNNのベースラインと比較して、これらの提案されたトランスを用いたマルチモーダル融合アーキテクチャは有意な向上を示しています。

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この調査には、18歳から24歳の男性フットボール選手40名(平均=20.1 ± 1.2)が含まれ、1つの地域リーグ内の4つのアマチュアおよびセミプロクラブからリクルートされました。参加者全員が少なくとも3年の競技経験を持ち、現在は構造化された環境でトレーニングを受けています。データ収集は2つの制御された環境で行われました。第一に、戦術的なパス/ドライブの意思決定シナリオを模擬した標準化された訓練場訓練、次に、マルチモーダルシーケンスを抽出する長時間のマッチシミュレーションセッションで行われました。すべての手続きはベイブ湾岸大学の機関倫理委員会(承認番号:BG-PE-2023-117)によって承認され、データ収集前にすべての参加者から書面によるインフォームドコンセントが取得されました。この調査の実施においては、国際的および機関的な倫理基準が遵守されました。ベイブ湾岸大学の機関倫理委員会は、人間被験者に関するすべての手続きを審査し承認しました(承認番号:BG-PE-2023-117)。データ収集前に、各参加者は書面によるインフォームドコンセントを提供し、分析前に収集されたすべてのデータは匿名化されました。

この取り組みは、トランスフォーマーベースのマルチモーダルフュージョンアーキテクチャを通じて、チームスポーツの戦術的意思決定の調査を自動化・強化することを目指しています。映像、音声、空間位置情報、プレイヤーメタデータなど多様なデータソースを用いて、堅牢なリアルタイム予測モデルを作成します。 図1 は提案された手法のアーキテクチャを示しています。提案されている作業は5つの段階で構成されています。以下に段階について説明します:

図1
図1。提案された手法のアーキテクチャ。 戦術的意思決定のためのマルチモーダル入力と分類要素を組み合わせたモデルの回路図。 この図の拡大版はこちらをクリックしてご覧ください。

データ取得と前処理

ビデオフィード、音声解説、GPS/ポジショニング情報、選手のパフォーマンス指標など、試合の録画から様々なモダリティからデータが収集されます。各モダリティは、フレーム抽出(ビデオ用)、ノイズフィルタリング(音声用)、正規化(センサー読み取り用)などの技術による前処理を受け、時間ステップでの同期を保証します。

映像フレームは25fpsで抽出され、224×224解像度にダウンサンプリングされました。音声信号は300Hzから3,400Hzの範囲のバンドパスフィルターで処理され、環境雑音の大部分を除去しました。GPSセンサーからの位置追跡データは10Hzで記録され、線形タイムスタンプベースの補間で補間され、25Hzのビデオタイムラインと一致するように調整されました。すべての入力は共有タイムスタンプで時間的に整列され、そのスケールはzスコアリングで正規化されました。

特徴抽出

ビデオデータの時空間情報を収集するために、3D CNNが使用されます。3D CNNはビデオフレーム全体で空間的および時間的情報を処理し、動きパターンの検出、集団行動の理解、動きに基づく特徴の抽出が可能です。この操作はアクションシーケンスごとに密度の高い特徴表現を生成し、モデルの視覚入力として使用します。各ビデオ入力クリップには、2フレームのストライドで連続した16フレームがサンプリングされていました。トレーニング中にランダムクロッピング、水平反転、明るさ正規化が適用されました。3D CNNはAdam(lr = 0.0001)、バッチサイズ16、交差エントロピー損失を用いて最適化されました。

マルチモーダル入力の埋め込みと整列

その後、異なるモダリティからの埋め込みが3D CNNの出力と統合されます。マルチモーダルトランスフォーマーモデルアーキテクチャが採用されており、各モーダリティを様々なエンコーダブランチが処理します。モダリティの融合とアライメントにはクロスアテンシャル層が用いられ、モデルは相互依存関係(例:選手の位置とボールの動き、解説からの文脈)を捉えることができます。この融合により、現在の戦術的選択肢に対する文脈的理解が深まります。また、すべての埋め込みもPyTorchで実装しています。映像特徴は1,024次元から512次元まで線形に投影され、音声と位置特徴はそれぞれ256次元と128次元に投影され、時間的整合前に512次元に統一されました。

トランスベースのマルチモーダル融合

マルチモーダルトランスは、すべてのソースから抽出された特徴を組み合わせるために用いられます。トランスフォーマー内の自己注意メカニズムにより、モデルはモダリティ間の相互依存性(例:視覚+音声)を学び、時間の流れや文脈を捉え、戦術的に重要なフレームやイベントを強調表示できます。このステップの結果は、各決定の戦術的意図と状況的文脈を捉えた複合表現です。マルチモーダルトランスは6つのエンコーダ層で構成され、それぞれ8つの注意ヘッドを持ちました。注意行列はスケーリングドット積注意を用いて計算されました。注意層とフィードフォワード層には、過学習を避けるためにp = 0.1のドロップアウトも含まれていました。

戦術的意思決定の分類と評価

最後に、融合された表現は分類層や意思決定解析ブロックへの入力として送られ、戦術的意思決定タイプを予測し、意思決定の質を評価し、必要に応じて注意ヒートマップや活性化マップを通じてコーチ向けの説明可能な洞察を生成するために使用されます。この段階の出力は、マッチプレー中のチームや選手の意思決定能力を定量的かつ質的に評価します。

分類ヘッドはReLU活性化の3層MLPと、その後にsoftmax層を用いていました。モデルは70/15/15分割で10分割のクロス検証を用いて訓練されました。使用された指標は、正確性、精度、リコール率、F1スコア、レイテンシー、AUCでした。

2に示すように、5つの段階をまとめた簡略化されたフローチャートが、連続したプロセスの即時的な視覚的概要を提供します。この図は、データ取得、前処理、特徴抽出、マルチモーダル融合、戦術的意思決定分類を含む研究パイプライン全体を簡潔に示し、各段階の詳細な説明を添えています。

図2
図2。研究プロセス全体のワークフローについて。 データ収集や前処理から特徴抽出、モデルトレーニング、評価に至るまで、研究パイプラインの概要。 この図の拡大版はこちらをクリックしてご覧ください。

図3 は提案された研究プロセスの全体的なワークフローを示しています。このプロセスは第1段階のデータ取得および前処理で開始され、ビデオ、音声、位置追跡、コンテキストメタデータなどのマルチモーダルデータソースが収集・同期されます。第2段階:特徴抽出では、3D畳み込みニューラルネットワーク(3D CNN)を用いて映像ストリームから時空間情報を抽出し、プレイヤーの行動や戦術的流れを密集した視覚表現に導きます。ステージ3:マルチモーダル入力の埋め込みとアラインメントは、音声、映像、位置的特徴を時間的アライメントとクロスモーダルアライメントを伴う共有潜在空間に統合します。これらの表現はその後、ステージ4:トランスフォーマーベースのマルチモーダル融合で集約され、クロスモーダルおよび自己注意メカニズムにより、モデルはモダリティ間の相互依存関係を学び、戦術的意思決定に関するより深い文脈的洞察を得ることができます。最後に、ステージ5:戦術的意思決定の分類と評価では、結合された表現が分類層に入力され、パス、ドライブ、ホールドなどの戦術的意思決定を検出します。一方で、パフォーマンス指標は意思決定の正確性や対応時間を推定するために用いられます。このフローチャートは、ステップバイステップのアプローチを明確に示しており、以下のセクションで詳しいテキスト説明が補完されています。

図3
図3。シーケンシャル処理パイプライン。 データ取得から戦術的意思決定分類、モデル出力までのステップバイステップの流れを示します。 この図の拡大版はこちらをクリックしてご覧ください。

データ取得と前処理

トランスフォーマーを用いたマルチモーダル融合パイプラインを通じてチームスポーツにおける高レベルの戦術的意思決定分析を可能にするため、構造化され高精度なデータ取得および前処理セットアップが構築されました。このセットアップは、ビデオ録画、選手のポジション追跡、選手とコーチのやり取りからの音声信号、試合フェーズ、チーム構成、ポゼッションエリアなどの文脈メタデータなど、複数のデータモダリティを融合させます。

調査対象は20歳以上の男性40名で構成され、全員が地域のアマチュアおよびセミプロフットボールリーグに積極的に関わっていました。彼らはそれぞれ、体系的なトレーニングプログラムを持つ4つの競技クラブからリクルートされました。選手の平均年齢は20.1歳±1.2歳で、平均身長は177.5フィート±3.1cm、平均体重は72.6ポンド±2.9kgでした。彼らはそれぞれのクラブで平均6.8年±1年半プレーしていました。参加者全員が最低3年の競技経験を持ち、戦術的に有能であると判断されました。

統計的検出力を確保するため、サンプルサイズは95%の信頼性レベル(Z = 1.96)と5%の有意水準を用いて近似され、期待クラス内相関係数(ICC)は0.96、95%信頼区間を用いてほぼ完全一致を反映しました。これは、収集されたマルチモーダル意思決定データの信頼性と一貫性を検証するという目的と整合しています。

再現性を確保するため、取得設定と技術仕様はセッションごとに標準化されました。映像データはGoPro Hero4カメラを用いて1,080p解像度、25フレーム毎秒で、広視野設定で戦術空間全体を捉えました。各録音は安定化され、固定高さ2.5mに設置されました。音声信号は外部フィールドマイクで44.1 kHzのサンプリングレート(モノラル)でキャプチャされ、その後300〜3,400 Hzのバンドパスフィルターで環境ノイズを除去しました。位置追跡データは10Hzで動作するウェアラブルGPSセンサーを用いて収集され、メーカーが報告した平均位置精度は±0.5mでした。すべてのモダリティは共有タイムスタンプで同期され、線形補間によって共通の25Hzタイムラインにリサンプリングされました。

前処理には以下の処理が含まれていました:224×224解像度へのビデオダウンサンプリング、ストライド2の16フレーム連続フレームサンプリング、ランダムトリミング、水平反転、明るさ正規化、音声正規化、ノイズ除去、位置およびコンテキスト変数Zスコア正規化。

前処理スクリプトは再現性のために以下の順序で配置されています:(i) フレーム抽出;(ii) 音声フィルタリング;(iii) GPS補間;(iv) 25 Hzへのモダリティ再サンプリング;(v) zスコア正規化;および(vi)破損、遮蔽、ドロップアウトの整合性テスト。バッチ処理スクリプトが各段階を自動的に完了するために使われます。

データの信頼性を保つために、品質管理および除外の基準には、i) >20%のプレイヤー遮蔽、ii) GPS切断が200msを超えるシーケンス、iii) 音声の破損またはクリップ、iv) モーダル間の深刻なモーションブラーまたは同期不同期が含まれていました。これらの疾患については合計17配列(3.4%)が除外されました。 表1は データセットの説明を示しています。

属性詳細
スポーツサッカー
参加者男子フットボール選手40名
プレーレベル≥5年の経験を持つ連盟フットボール選手
テストタイプパスとドライブ(ボールコントロール)の意思決定と実行テスト
試験設定標準化されたサッカーピッチの設置、マーキングゾーン、固定ポジション
測定ツールGoPro Hero4カメラ、Kinoveaソフトウェア、ストップウォッチタイミング
収集されたデータ実行時間(ET)、意思決定(DM)の正確さ、正しい行動回数
試験手順選手たちはコーチからの視覚的刺激に反応し、パスやドライブを実行しました
裁判の繰り返し1人あたり10回のトライアル(パス5回、ドライブ5回)
評価専門家はDM;ETはタイムスタンプや動画で測定されました
結果変数反応時間、正しい意思決定回数、技術実行スコア

表1:データセットの説明。 参加者の人口統計、検査手順、測定ツール、結果変数の詳細を記載しています。

本研究では、関連しているが異なる2つのデータセットが使用されました。最初のデータセットは、主に基準の信頼性確立と基本的な意思決定手順の検証に用いられた、制御されたパス/ドライブの意思決定タスクに参加した40人のプレイヤーで構成されていました。2つ目のデータセットには、拡張された試合シミュレーションと実戦記録から収集された500件のマルチモーダル戦術シーケンスが含まれています。これらの配列はトランスを基盤とした融合モデルの主要な訓練および試験データセットを構成し、より生態学的に妥当な条件下での評価を可能にします。

データセットは500のマルチモーダルシーケンスで構成されていますが、階層化されたサンプリングにより戦術的行動(パス、ドライブ、ホールド)間でバランスの取れた表現が確保されました。また、時間的トリッピングやシーケンスシャッフルなどのデータ拡張手法も用いられ、学習中の変動性を高め、モデルバイアスを軽減しました。

なお、40人のプレイヤーによる管理データセットは初期のモデル検証と信頼性検証に使用され、500のマルチモーダルシーケンスは長期間の試合記録と組織的なトレーニングセッションからまとめられ、フレームワークのスケーラビリティと生態学的妥当性を評価するためにまとめられました。ベースライン信頼性は小規模なデータセットで確立され、大規模なデータセットは大規模なモデルの訓練とテストを促進しました。

データセットの説明

この実験では、少なくとも5年の連邦プレー経験を持つ40人の男子フットボール選手を募集し、サンプル集団が基本的な技術的・戦術的能力を持っていることを確認しました。データ収集は標準化されたサッカーピッチ配置で行われ、あらかじめ決められたゾーンとプレーポジションが割り当てられ、同一のテスト条件を確保しました。実験では、参加者はコーチからの視覚的な合図に反応し、パスやドライブのどちらかで、実際の試合で下された戦術的判断を再現しなければなりませんでした。各参加者は合計10回の試験を完了し、そのうち5回は合格、5回は運転でした。これらの動きはGoPro Hero4カメラで撮影され、パフォーマンスデータはキノベアのビデオ解析ソフトウェアと手動のストップウォッチで実行時間(ET)を記録して測定されました。主なデータソースは、実行時間、経験豊富なコーチによるDMの質、そして実行された正しい行動の数でした。これらの要素は、制御された刺激反応条件下でプレイヤーがどれだけ迅速かつ効果的に戦術的意思決定を行えているかを定量的に分析するための基盤を提供しました。生成されたデータセットは構造化されラベル付きで、ベンチマークの作成や知能システムのトレーニングに適しており、チームスポーツの文脈における戦術的思考や運動反応のモデリングを目的としています。

サンプルは地域リーグの若い男性選手に限定されており、年齢層、女性アスリート、その他の文化に共通する可能性が制限される可能性があります。今後の研究では、より代表的で多様なサンプルを抽出しようと試みます。

もう一つの制約は、単一の地域リーグから40人の若い男子選手のサンプル数が少ないことです。均質なサンプルは内部妥当性に寄与し、年齢、性別、戦術的背景の違いによるパフォーマンスのばらつきを低減しましたが、同時により広範な集団への一般化を制限します。したがって、モデルが学習する戦術パターンは、普遍的な意思決定行動というよりも、地域特有または性別特有のプレイスタイルを反映している可能性があります。本研究では、階層化サンプリングとデータ拡張を用いてデータセットの変動性を高めました。しかし、女性アスリート、ユース選手、プロ選手、複数の戦術文化の参加者を対象とした大規模な研究が、多様なフットボール環境におけるモデルの堅牢性を確認するために必要です。これらの結果は強い可能性を示していますが、より多様な大規模なデータセットでのさらなる検証が求められ、より広範な一般化を主張するには必要です。

主観性を減らすため、3人のプロフットボールコーチが独立して戦術選択に注釈を付けました。評価者間信頼性はクラス内相関係数(ICC = 0.96、CI 0.94-0.98)を用いて推定され、ほぼ完全一致を示しました。合意形成の議論で意見の相違は解決されました。マルチモーダルデータの場合、前処理ではモダリティ間の時間同期(25fpsビデオと10Hzセンサーデータ)と特徴のzスコア正規化が行われ、モダリティ間の比較が可能となりました。

評価者間信頼性は、複数の評価者間の絶対一致を評価するのに適した二方向ランダム効果クラス内相関係数(ICC [2,3])を用いて定量化されました。ICCは0.96(95%信頼区間:0.94-0.98)で、一般的に使われる閾値でほぼ完全一致を示し、訓練に用いられた戦術的意思決定ラベルが非常に信頼性が高いことをさらに示しています。信頼性は500のマルチモーダル配列すべてで計算され、制御された文脈とマッチシミュレーションの文脈の両方に適切かつ一貫した注釈が付けられることが保証されました。

注釈手順とラベル付けプロトコル

すべてのマルチモーダルシーケンスは構造化された3段階プロトコルで注釈が付けられました。まず、3人のライセンスを持つフットボールコーチが、タイムスタンプ同期注釈インターフェース(Kinovea + カスタムタグ付きスプレッドシート)を使って、各ビデオのポジションシーケンスを独立してレビューしました。アノテーターは戦術的意思決定カテゴリ(パス、ドライブ、ホールド)、コンテキストの手がかり(プレッシャーゾーン、追い越しレーンの空き可能性)、イベントタイムスタンプをラベル付けしました。次に、意見の相違検出スクリプトが自動的に曖昧さや対立の事例を特定し、それを合同合意会議で審査しました。第三に、イベント境界のマーキングとモダリティ間の時間的整合性の一貫性を確保するため、独立した上級アナリストによる最終検査が行われました。このプロセスは、後のモデルトレーニングのために、すべての注釈が追跡可能で最高の品質であることを保証するものでした。

前処理

本研究は500のマルチモーダル配列で実施されましたが、前処理パイプラインは設計上、大規模データセット向けに設定されていました。すべてのモダリティは自動化スクリプトを経て、並行してビデオフレームをバッチ抽出し、音声をリサンプリングし、位置データを補間し、zスコア正規化を適用しました。モジュールアーキテクチャの存在により、各モダリティは別々のGPU/CPUスレッド上で独立して前処理されることが可能です。これにより、試合映像の大量ダウンロードが可能になります。これにより、ワークフローを手動介入なしにフルシーズンデータセットに容易にスケールでき、プロの分析環境での実務的な展開に適しています。

チームスポーツにおける戦術的意思決定を適切に検証するためには、ビデオクリップ、音声信号、位置記録など、さまざまなモダリティからの生データを事前処理し、整合させる必要があります。マルチモーダル入力図は次の通りです。

式1(1)

ここでVはCNNエンコーダから抽出された一連のビデオ特性として表されます。

式2(2)

ここで、Aはwave2vecで符号化されたオーディオ特性です。

式3(3)

P は時刻 ti におけるプレイヤーの座標位置を表します。

非同期サンプリング率に対応するため、各モダリティは共有タイムラインにリサンプリングまたは補間されます。

式4(4)

ここで 式5は同期特性ftであり、は結合フレームの速度、Xmは初期指標です。

モダリティ間での均一スケールのために、すべての特徴ベクトルはzスコア正規化されます:

式8(5)

μXとσXは訓練セット内の特徴次元の平均と標準偏差を表します。

主な懸念はパス/ドライブの判断ですが、音声チャンネル(例:選手とコーチのコミュニケーション、環境のゲームキューなど)が追加され、実際の試合状況で音声信号が戦術反応に影響を与えることを考慮しています。ハイパーパラメータ(例:学習率、エポック)はグリッドサーチやマルチモーダル学習の既存の評価を通じて選択され、収束安定性と計算効率のバランスを取った。

提案されたフレームワークのハイパーパラメータ(学習率、バッチサイズ、訓練エポック)は、収束安定性と計算効率の両方を達成するために、よく計画された体系的なグリッド探索によって選ばれました。Adam最適化器で学習率0.0001を選択したことで、振動なく勾配の安定更新が得られ、バッチサイズはGPUメモリ容量と訓練スループットのバランスを取るために最適化されました。50〜100エポックの設定は、検証損失追跡および10折クロス検証によって確認された過学習を可能にするために用いられました。これらの値は恣意的に設定されたものではなく、マルチモーダル学習の以前のテストに基づき、現在のデータセットでの実験試験によって調整されました。この厳格なプロセスにより、選ばれたハイパーパラメータは安定したモデルトレーニングとベースラインアプローチに比べて再現可能な性能向上を促進しました。

分類タスクはパス/ドライブ/ホールドの判断に焦点を当てていますが、音声情報は意図的に含まれています。なぜなら、フットボールにおける実際の戦術的行動は選手とコーチのコミュニケーション、チームメイトのコール、プレッシング信号、環境音(例:ボール接触音、相手接近音)に強く影響されるためです。これらの手がかりはしばしば意思決定の前または同時発生し、フットボール選手の自然な知覚環境の一部を形成しています。予備的なアブレーション実験では、音声を除外すると想起率が3.8%減少し、微かな音響的手がかりでも文脈認識に寄与していることが示されました。このため、生態学的妥当性を保ち、モデルの実際の試合条件への一般化能力を向上させるために音声が保持されました。

さらにこれらのハイパーパラメータを支持するために、学習率を1e-5から5e-4、バッチサイズを8から32、トランス層数を4から8、注意ヘッド数を4から12に体系的に変化させる内部感度解析が行われました。選択した構成は、学習率が1e-4、バッチサイズが16、8つの注意ヘッドを持つ6層エンコーダにより、最も低い検証損失で安定した収束を継続的に実現し、10重クロス検証における過学習を最小限に抑えました。バッチサイズが大きいほど勾配の不安定性が生じ、小さなバッチほどノイズが増し収束が遅れました。同様に、8ヘッド以上のトランスモデルは性能向上は見られませんでしたが、計算時間が大幅に増加しました。得られた結果は、本研究で用いられた最終的なハイパーパラメータ設定を正当化します。

3D畳み込みニューラルネットワークを用いた特徴抽出

チームスポーツの戦術的意思決定のための提案されたトランスモルベースのマルチモーダル融合フレームワークでは、3D畳み込みニューラルネットワーク(3D CNN)が生のビデオクリップから時空間的特徴を抽出する役割を担っています。

空間次元(幅W、高さH)のみを考慮する2次元CNNに対し、3D CNNは時間的次元Rも考慮し、フットボールのドライブやパスなどチームの行動を理解する上で重要な動きのダイナミクスや連続パターンを検出できます。

3D-CNN28 は、まずビデオデータの空間情報と時間情報を統合することが提案されました。3次元カーネルは、フレームで構成されたキューブに3次元畳み込みアルゴリズムで用いられ、その一部が列に積み重ねられています。3次元畳み込みは式(6)で表すことができます。

式11(6)

ここで: 式12 はl層のj番目の特徴マップ上の位置(x, y, z)での出力特徴です。式14 はm番目の入力特徴マップから位置(h,w,r)の核の重みです。 式16 は前層からの時空間的オフセットでの入力です。blj はバイアス。f(.)は活性化関数(通常はReLU)です。Mは前層からの入力特徴マップの数です。この式により、3D CNNは空間(高さと幅)と時間的(フレームシーケンス)情報を並列に組み合わせることができます。

図4
図4。3D CNN処理アーキテクチャ。 3D畳み込み演算を用いてビデオシーケンスから時空間的特徴をどのように抽出するかを示しています。 この図の拡大版はこちらをクリックしてご覧ください。

図4 は3D CNNの動作過程を示しています。パイプラインは入力フェーズから始まり、未処理のフットボールのビデオストリームが選手の位置情報、試合統計、コンテキストメタデータなどの整理されたデータと融合されます。このマルチモーダル情報は、チーム戦術分析にとって重要な視覚的ダイナミクスと状況的文脈の両方を保持します。その後、映像ストリームは3D畳み込みニューラルネットワーク(3D CNN)を経由してルーティングされます。この場合、入力フレームには一連の3D畳み込みレイヤーが用いられます。レイヤーは空間次元(高さと幅)と時間次元(フレーム)に沿って畳み込み、ネットワークは動きパターン、選手の相互作用、パスやドライブなどのシーケンスベースの戦術を学習できます。その後、密集した時空間的特徴を持つ特徴立方体が形成されます。このキューブは重要な特徴を保持しつつ寸法を下げるためにプーリング操作が行われます。プール化時に特徴量は1次元ベクトルに平坦化され、戦術状況を簡潔に表現します。この特徴ベクトルは、その後、完全接続されたディープニューラルネットワーク(DNN)に入力されます。DNNは意思決定ブロックであり、融合・抽出された特徴を処理し、パス、シュート、ホールディングなどの戦術的判断を行います。ネットワークの出力は、リアルタイムの実際のゲーム状況と学習された戦略パターンに基づいてシステムが下す最終的な戦術的決定です。

マルチモーダル入力の埋め込みと整列

特徴抽出後、音声、映像、プレイヤーの統計的位置などの3つの特徴が入力モダリティとして与えられます。

これらをトランスフォーマーに入力し、学習可能な埋め込み関数を通じてそれぞれを供給する方法:

式19(7)

ここで f3DCNN は各時間断片 Vt の時空的特徴を学び、それを d 次元の潜在空間に写します。

式22(8)

ここで WP と bP は学習可能な重みです。

式25(9)

すべての埋め込みは時間次元 T によって整列されます。モダリティの頻度が異なる場合は補間またはダウンサンプリングが用いられます。

式26(10)

現在、すべてのモダリティは以下のように同期されています:

式27(11)

トランスフォーマー内で時間的順序を保つために、すべてのベクトルに位置符号化も導入します。

式28(12)

ここで式29はデフォルトの正弦波または学習可能な位置符号化を表します。

各モダリティはPyTorch線形層を用いて操作符号化され、512次元ベクトルに連結され、位置符号化後にトランス入力シーケンスに入力されます。これにより、各タイムステップでクロスアテンション対応の統一埋め込みが準備されることが保証されます。

最終テンソルは次のようになります。

式30(13)

トランスフォーマーエンコーダーに入力され、自己注意とクロスモーダル注意メカニズムにより、モデルはすべてのモダリティ間で共同で推論し、戦術的意思決定を行うことができます。

トランスベースのマルチモーダル融合

提案されたアプローチでは、低ランク行列分解法を用いて取得したマルチモーダルデータベクトルを積分します。テンソルが直接融合した際に生じる高次元問題は、テンソル融合低ランク分解因子を用いるこの手法で解決されます。各モダリティは最初にベクトルとして表現され、低ランク分解を用いて重要な相互作用を保持する次元削減が実現されます。M個のモダリティによる融合テンソルZM は次のように構成されます。

式32(14)

ここで: 式33 は m 番目のモダリティの低ランク因子、 式60 は外積、r は分解ランクです。

核融合ベクトル h は次のように計算されます:

式34(15)

2つのモダリティを単独で用いる場合、還元核融合は次のようになります。

式35(16)

これにより、潜在的なレベルでの交差モーダル相互作用をモデル化する結合多モーダル表現ベクトルhが生成されます。

低ランク融合ベクトルhの獲得後、トランスフォーマーモジュールはモダリティ間の依存関係をモデル化し、意味表現を整列させます。クロスモーダルアテンションは、あるモダリティが別のモダリティに注意を向けられるように特別に設計されています。

式36(17)

ここでQmはモダリティmクエリ、Kn、Vnはモダリティnの鍵ベクトルと値ベクトル、dkはキーベクトルの次元です。この仕組みにより、モダリティ特有の注意の流れが可能になり、各入力カテゴリを他の入力と比較して処理することが可能になります(例:プレイヤーの動きをゲームのコンテキストやビデオインジケーターと同期させるなど)。

クロスアテンドベクトルは多層パーセプトロン(MLP)を通じて積み重ねられ分類されます。出力は戦術的意思決定ラベル(例:パス、ドライブ、ホールド)であり、エンドツーエンドの訓練に最適化されたクロスエントロピー損失です。

図5
図5。トランスを基盤としたマルチモーダル融合アーキテクチャ。 トランスコーダーを通じて視覚とセンサーのモダリティがどのように統合され、特徴表現を強化するかを示しています。 この図の拡大版はこちらをクリックしてご覧ください。

図5に示されるように、マルチモーダル融合ブロックは視覚入力と位置入力を組み合わせています。戦術的な判断には空間認識や動きのダイナミクスが必要であり、単一のモダリティでは表現できないため、この設計は必要なものです。

図5 はトランスを基盤としたマルチモーダル融合の動作構造を示しています。この設計は、多様なデータ、映像、空間座標、試合のコンテキストデータを単一のチャネルに統合し、パス、ドライブ、ホールディングなどの戦術的行動を予測します。このアプローチは、3D畳み込みニューラルネットワーク(3D CNN)を用いて映像を入力することから始まります。このシステムは映像内の空間的および時間的構造の両方を識別し、時間をかけたプレイヤーの動的な活動やコミュニケーションを捉えることができます。一方で、文脈情報や位置情報は埋め込み層によって伝えられ、構造化された入力を密度の高いベクトル表現に変換します。コンテキスト、ポジション、ビデオストリームの出力は、Low-Rank Fusionモジュールによって融合されます。このアプローチは、融合空間分解を通じてクロスモーダル相関を効果的に得、計算複雑さを最小限に抑えつつ、モダリティ間の本質的な関係性を保持します。最後に、融合したマルチモーダル表現はトランスモーダルエンコーダによってクロスモーダル注意で処理されます。この手法により、モデルはモダリティや時間ステップを超えた適切な特徴に焦点を当て、戦略的なゲーム行動の理解を深めます。最後に、符号化された出力は連結とマルチレイヤーパーセプトロン(MLP)ブロックを通し、学習された表現を戦術的な判断にマッピングします。モデル出力は「パス」「ドライブ」「ホールド」といった選手の行動を分類し、チーム戦術をデータに基づいたインテリジェントな検証を可能にします。

チームスポーツ向けのトランスフォーマーベース多モーダルフュージョン戦術解析システムでは、最後の段階が戦術的意思決定の分類と評価であり、学習したマルチモーダル表現を意思決定可能なラベルに変換します。ビデオ、位置、文脈の特徴を低ランク融合で融合し、トランスフォーマーエンコーダでクロスモーダル注意を用いて微調整した結果、得られた特徴ベクトルはマルチレイヤーパーセプトロン(MLP)分類器に入力されます。すべての意思決定クラスはsoftmax活性化関数で表現され、すべての可能な行動に対して確率スコアが得られます。モデルの予測決定として最も可能性が高いクラスが選ばれます。モデルはクロスエントロピー損失関数で訓練されており、正しい予測に報酬を与え、ネットワークは戦術的状況下で類似した違いを区別することを学習させます。さらに、リアルタイムまたはほぼリアルタイムのゲーム状況での応答性を確認するために、時間領域評価も検討され、分類器が正確であり、ゲームのような時間制約の下で時間を無駄にしないことが保証されます。表2はモデルアーキテクチャとハイパーパラメータを示しています。

構成要素仕様
トランスフォーマーエンコーダ層6
注意の頭たち8
隠された次元512
フィードフォワード層サイズ2048
埋め込み次元映像:1024 → 512、音声:256 → 512、位置:128 → 512
位置符号化学習可能
融合法低ランク多元性融合(ランクr = 16)
オプティマイザーアダム
学習速度0.0001
バッチサイズ16
訓練時代50–100
ドロップアウト0.1
損失関数交差エントロピー

表2:モデルアーキテクチャとハイパーパラメータ。 提案されたトランス型マルチモーダル融合モデルの訓練設定および主要コンポーネントを一覧にします。

さらなる明確さと再現性のために、マルチモーダルトランスは6層エンコーダスタックで実装されており、それぞれ8つの注意ヘッドと隠れ次元512を備え、中規模マルチモーダルタスクの典型的なトランス設定に従っていました。各モダリティは埋め込みブロックを通過します:3D-CNNエンコーダ出力による1024-DIMによるビデオ;Wave2Vecベースのエンコーダーによる256ダイムによる音声、位置およびコンテキスト特徴は2層MLPエンコーダ(128-DIM)によるものです。これらすべての埋め込みは、学習可能な線形変換を通じて共有の512-d潜在空間に投影されました。時間的なアライメントを確立するために、すべてのモダリティはまず25 Hzの単一の周波数に補間され、その後学習された位置符号化を適用して時間的順序を保持します。クロスモーダルアライメントはクロスアティメット層を用いて行われ、モダリティ間の相関を明示的に学習し、その後セルフアテンションエンコーダスタックに入力されます。これらのアーキテクチャ的選択は、モデル容量と計算効率のバランスを取るために行われ、中規模のデータセット上で安定した収束を確保しました。

実務的には、提案されているトランスモンダーベースマルチモーダル融合フレームワークは、構造化されたトレーニングセッション、制御された試合シミュレーション、または安定したビデオフィードや位置追跡システムを備えたプロフェッショナル環境など、同期されたマルチモーダルデータが存在するシナリオに最適です。この手法に必要な主な入力は、(i) 高解像度映像、(ii) 位置追跡データ(GPS/LPS)、(iii) 音声ストリーム、(iv) 文脈メタデータ(例:所持、圧力ゾーン、マッチフェーズ)です。信頼性の高い性能を得るためには、これらのモダリティは最小限のドリフト(動画≥25fps、位置センサー≥10Hz)でタイムアライメントされ、安定した視点と最小限の信号ノイズを維持する必要があります。これらの同期入力を提供できない設定、例えば不規則なカメラアングルのあるアマチュア試合、レイテンシーや圧縮アーティファクトを伴うライブ放送フィード、位置追跡インフラのない環境などは、フレームワークにとってあまり関連性がありません。さらに、現在のシステムは半制御条件下で最も性能を発揮しますが、照明条件、遮蔽、動的な観客騒音がデータ取得の質に影響を与える完全に制御されていないライブマッチ状況では、信頼性が大幅に低下する可能性があります。これらの制約は、このシステムが展開可能な実務的な境界を示し、提案モデルを適用する上で複数のモードで一貫したデータ取得が不可欠であることを強調しています。

改造とトラブルシューティング

実際の実装では、マルチモーダルパイプライン全体でモデルの安定性や全体的な性能を低下させる可能性のある複数の問題が発生することがあります。よくある問題の一つは、25fpsで撮影された動画と10Hzで記録された位置情報が同期せず、手がかりが不一致になり注意マップが不安定になり、想起が低下するという現象です。これはタイムスタンプに基づくリサンプリング、線形補間、過度のドリフトを持つ列の自動除去を適用することで解決できます。また、風や観客の音、マイクのクリッピングによるノイズの影響もあり、トランスがオーディオトークンを無視して精度がわずかに低下することがあります。バンドパスフィルタリング、スペクトルゲーティング、そして重度に破損したセグメントをベクトルゼロに置き換えることで、オーディオ埋め込みの安定性が維持されます。プレイヤーの遮蔽やモーションブラーなどの視覚品質の問題は、3D-CNNの時空間的表現を弱め、パスドライブの混乱を増加させる可能性があります。これは、重度に遮られたシーケンスを除外し、ランダムトリミング、明るさ正規化、モーションブラーシミュレーションなどの増強戦略を用いることで緩和されています。埋め込みスケールがモダリティ間で異なり、振動性検証損失や勾配スパイクが発生する場合、トランス不安定性が生じることがあります。安定したzスコア正規化、ウォームアップ学習率スケジュールの使用、勾配クリッピングの適用、ドロップアウトの増加により、安定したトレーニングを取り戻すことができます。また、低ランク融合は、融合ランクが誤って設定されると問題が生じ、クロスモーダル関係の歪みやクラスごとの不均衡が生じます。小規模なデータセットでは中程度のランクを維持し、大きなデータセットではランクを上げ、L2正則化を適用することでバランスの取れた融合が保たれます。大きなビデオテンソルによるGPUメモリオーバーフローや学習遅延による計算ボトルネックが生じることがあります。これらの問題は、混合精度(FP16)トレーニング、初期実験中の入力解像度低下、または事前に計算された3D-CNN特徴のキャッシュによって対処可能です。最後に、特に「ドライブ」における戦術的意思決定における自然なクラスの不均衡は、想起率を減らし、AUCの変動を引き起こす可能性があります。クラスバランス損失の適用、少数派行動のオーバーサンプリング、文脈メタデータの充実は、バランスと意思決定の識別を大幅に向上させることができます。この統合されたトラブルシューティングガイダンスにより、研究者や実務者が安定したトレーニング環境を維持し、再現性を向上させ、さまざまなデータセットや環境にまたがってフレームワークを効果的に適応させることが可能になります。

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この設計は、多様なデータ、映像、空間座標、試合の文脈データを単一のチャネルに統合し、パス、ドライブ、ホールディングなどの戦術的行動を予測します。このアプローチは、入力動画から始まり、三次元畳み込みニューラルネットワーク(3D CNN)を用いて検証されます。コンテキスト、ポジション、ビデオストリームの出力は、Low-Rank Fusionモジュールによって融合されます。このアプローチは、融合空間分解を通じてクロスモーダル相関を効果的に得、計算複雑さを最小限に抑えつつ、モダリティ間の本質的な関係性を保持します。最後に、融合したマルチモーダル表現はトランスモーダルエンコーダによってクロスモーダル注意で処理されます。 表3は 提案手法のシミュレーション環境を示しています。

シミュレーション環境仕様
...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ここで紹介するトランスモンダーベースマルチモーダル融合フレームワークは、基礎論文で示されたストループタスクフットボールテスト(STFT)に対する重要な進展を示しています。基礎論文が、色矢印や事前定義されたタスク(運転や追い越し)などの限定的かつ静的な刺激を用いた制御された実験室志向のテストに焦点を当てていたのに対し、新しいモデルは実際のマルチモーダルソースデータを基に、より豊かで自動化された戦術分析パイプラインを促進しています。しかし、リアルマッチのマルチモーダルシーケンスの統合にもかかわらず、制御されたパス/ドライブタスクは完全な生態学的リアリズムに必要な理想的な割合を上回っており、そのためゲームの戦術的多様性を完全に表現するモデルの能力を部分的に制約しています。特に、基礎研究では手動のビデオ注釈、小規模なテスト環境、主観的な人間の専門家評価を用いて意思決定の正確性(DMA)と実行時間(ET)を獲得しました。ベースラインテストには適していますが、スケーラビリティや生態学的妥当性、人工的な刺激依存性に限界があります。

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者には利益相反を主張するものはありません。

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者らは、本研究において資源と制度的支援を提供してくれた北布湾岸大学体育学部および南西財経大学統計学部の支援に感謝申し上げます。この研究は、2023年の国家社会科学基金プロジェクト「左江・幽江旧革命基地区における赤いスポーツ文化資源の有効活用研究」(助成金番号23CTY016)によっても支援されました。

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
3D CNNカスタム実装ビデオからの時空間的特徴抽出
GoPro Hero4GoPro Inc.https://gopro.com/試合のビデオ記録
GPS/IMUセンサーカタパルトスポーツ / Xsenshttps://www.catapultsports.com/プレイヤーのポジション追跡
Intel Core i7-11700K CPUインテルhttps://www.intel.comモデルトレーニングワークステーションCPUです
リブローザlibrosa.orghttps://pypi.org/project/librosa/オーディオ信号処理とリサンプリング
MLPクラシファイアPyTorch / TensorFlow戦術的意思決定分類
NumPyPythonソフトウェア財団https://pypi.org/project/numpy/数値計算と行列演算
NVIDIA RTX 3080 GPUNVIDIAhttps://www.nvidia.comディープラーニングトレーニングと推論
OpenCVOpenCV.orghttps://pypi.org/project/opencv-python/ビデオからのフレーム抽出
パンダPythonソフトウェア財団https://pypi.org/project/pandas/データ操作と表形式の処理
PCA(Scikit-learn)Scikit-learn(シキット学習)https://scikit-learn.org/次元削減
Python 3.9Pythonソフトウェア財団https://www.python.org/downloads/release/python-390/プログラミング言語環境
パイトーチパイトーチ財団https://pytorch.org/ディープラーニングフレームワーク
scikit-learnScikit-Learn 開発者https://pypi.org/project/scikit-learn/クロスバリデーション、ICC計算
テンソルフロー 2.8グーグルhttps://www.tensorflow.org/ディープラーニングフレームワーク
トランスフォーマーエンコーダPyTorch / TensorFlow注意を伴うマルチモーダル特徴量の統合
Ubuntu 20.04 LTSキャノニカル社https://ubuntu.com/モデルトレーニング用のオペレーティングシステム
ワークステーションカスタム/インテル、NVIDIAモデルトレーニング用のCPU、GPU、RAMです

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Calle-Jaramillo, G. A., Franco, R., González, S. R., Forero, L. M., González, H. Design and validation of a test to evaluate the execution time and decision-making in technical–tactical football actions (passing and driving). Behav Sci. 13 (1), 101(2023).
  2. Renshaw, I., Davids, K., O’Sullivan, M., Maloney, M. A., Crowther, R., McCosker, C. An ecological dynamics approach to motor learning in practice: reframing the learning and performing relationship in high performance sport. Asian J Sport Exerc Psychol. 2, 18-26 (2022).
  3. Lamas, L., Senatore, J. V., Fellingham, G. Two steps for scoring a point: creating and converting opportunities in invasion team sports. PLoS ONE. 15, e0240419(2020).
  4. Gonçalves, B., et al. Extracting spatial-temporal features that describe team match demands when considering the effects of the quality of opposition in elite football. PLoS ONE. 14, e0221368(2019).
  5. Cardoso, F. D. S. L., González-Víllora, S., Guilherme, J., Teoldo, I. Young football players with higher tactical knowledge display lower cognitive effort. Percept Mot Skills. 126, 499-514 (2019).
  6. Heilmann, F. Self-report versus neuropsychological tests for examining executive functions in youth soccer athletes—a cross-sectional study. Behav Sci. 12, 346(2022).
  7. Torres-Tejeda, S., Portilla-Fernández, J. A., Mugruza-Vassallo, C. A., Córdoba-Berrios, L. L. Variations of reaction times explained by stimuli changes in size and perspective in 2D and 3D for selective attention. Rev Mex Ing Biomed. 41, 91-104 (2020).
  8. Wilke, J., Vogel, O. Computerized cognitive training with minimal motor component improves lower limb choice-reaction time. J Sports Sci Med. 19, 529(2020).
  9. Da Silva Leite Cardoso, F., Afonso, J., Roca, A., Teoldo, I. The association between perceptual-cognitive processes and response time in decision making in young soccer players. J Sports Sci. 39, 926-935 (2021).
  10. Farahani, J., Soltani, P., Rezlescu, C. Assessing decision-making in elite academy footballers using real-world video clips. Prog Brain Res. 259, Elsevier. 59-70 (2020).
  11. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  12. MM-ViT: multi-modal video transformer for compressed video action recognition. Chen, J., Ho, C. M. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 1910-1921 (2022).
  13. Shi, J., et al. A novel two-stream transformer-based framework for multi-modality human action recognition. Appl Sci. 13, 2058(2023).
  14. Capone, V., Casolaro, A., Camastra, F. Spatio-temporal prediction using graph neural networks: a survey. Neurocomputing. 594, 130400(2025).
  15. Ball trajectory inference from multi-agent sports contexts using set transformer and hierarchical bi-LSTM. Kim, H., et al. Proc 29th ACM SIGKDD Conf Knowl Discov Data Min, , (2023).
  16. Lemes, J. C., et al. Influence of pitch size and age category on the physical and physiological responses of young football players during small-sided games using GPS devices. Res Sports Med. 28, 206-216 (2020).
  17. Coutinho, D., et al. Effects of pitch configuration design on players’ physical performance and movement behaviour during football small-sided games. Res Sports Med. 27, 298-313 (2019).
  18. Clemente, F. M., Sarmento, H. Combining small-sided football games and running-based methods: a systematic review. Biol Sport. 38, 617-627 (2021).
  19. Hu, W., Li, B., Li, C., Zhang, T. An integrated intelligent decision system for physical health evaluation of college students with fuzzy number intuitionistic fuzzy information. J Intell Fuzzy Syst. 44, 611-624 (2023).
  20. Cao, L. Design and optimization of a decision support system for sports training based on data mining technology. Sci Program. 2022, 1846345(2022).
  21. Li, L., Zhang, Z., Zhang, S. Hybrid algorithm based on content and collaborative filtering in recommendation system optimization and simulation. Sci Program. 2021, 4(2021).
  22. Shi, W., Wang, L., Qin, J. User embedding for rating prediction in SVD++-based collaborative filtering. Symmetry. 12, 121(2020).
  23. Hasan, M., Roy, F. An item–item collaborative filtering recommender system using trust and genre to address the cold-start problem. Big Data Cogn Comput. 3, 39(2019).
  24. Duan, R., Jiang, C., Jain, H. K. Combining review-based collaborative filtering and matrix factorization: a solution to rating sparsity. Decis Support Syst. 156, 113748(2022).
  25. Multi-view transformation in recommender systems. Ho, T. L., Le, A. C. Proc 2021 Int Conf Syst Sci Eng (ICSSE), , IEEE. 88-91 (2021).
  26. Detector-free weakly supervised group activity recognition. Kim, D., Lee, J., Cho, M., Kwak, S. Proc IEEE CVF Conf Comput Vis Pattern Recognit (CVPR), , 20083-20093 (2022).
  27. Wensel, J., Ullah, H., Munir, A. ViT-RET: vision and recurrent transformer neural networks for human activity recognition in videos. IEEE Access. 11, 72227-72249 (2023).
  28. Alomar, K., Aysel, H. I., Cai, X. CNNs, RNNs and transformers in human action recognition: a survey and a hybrid model. Artif Intell Rev. 58, 1-44 (2025).
  29. Social adaptive module for weakly supervised group activity recognition. Yan, R., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 224-238 (2020).
  30. Zhang, Y., et al. FairMOT: on the fairness of detection and re-identification in multiple object tracking. Int J Comput Vis. 129, 3069-3087 (2021).
  31. Towards real-time multi-object tracking. Wang, Z., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 22-107 (2020).
  32. Shuvo, M. R., Mekala, M. S., Elyan, E. Deep learning and attention-based methods for human activity recognition and anticipation: a comprehensive review. Cogn Comput. 17, 1-28 (2025).
  33. Alqarafi, A., Almogadwy, B. TAT-SARNet: a transformer-attentive two-stream soccer action recognition network with multi-dimensional feature fusion and hierarchical temporal classification. Mathematics. 13, 3011(2025).
  34. Detection recovery in online multi-object tracking with sparse graph tracker. Hyun, J., Kang, M., Wee, D., Yeung, D. Y. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 4839-4848 (2023).
  35. Mukhtar, H., Khan, M. U. G. STMMOT: advancing multi-object tracking through spatiotemporal memory networks and multi-scale attention pyramids. Neural Netw. 168, 363-379 (2023).
  36. Dataset used for intraclass correlation coefficient reliability analysis. , https://docs.google.com/spreadsheets/d/1c3bZNClvy8TP7RBspwRI0z7R8-n5Wy5H (2021).
  37. Ma, X., et al. feature extraction within a complex urban area with an improved 3D-CNN using airborne hyperspectral data. Remote Sens. 15, 992(2023).
  38. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  39. Wang, X., Guo, Y. Intelligent football players’ motion recognition system based on convolutional neural network and big data. Heliyon. 9, e19822(2023).
  40. Paneru, B., et al. Enhancing soccer pass receiver prediction in broadcast images through advanced deep learning techniques: a comprehensive study on model optimization and performance evaluation. J Soft Comput Explor. 5, 115-121 (2024).
  41. Shot prediction in the attacking third based on spatio-temporal features: a dynamic time-series model approach. Gong, B., et al. Proc 4th Int Conf Inf Technol Contemp Sports (TCS), , IEEE. (2024).
  42. Yang, K. O., Koh, J., Choi, J. W. Unified contrastive fusion transformer for multimodal human action recognition. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Transformer ModelMultimodal FusionTactical Decision AnalysisTeam SportsFootball AnalyticsPlayer PositioningDecision ClassificationFeature ExtractionReal Time PredictionVideo Analysis

Related Articles