축구에서 전술적 의사결정 분류를 개선하기 위해, 본 연구는 시각적, 위치, 음향, 맥락 데이터를 통합한 트랜스포머 기반 다중 모달 융합 모델을 제안합니다. 이 모델은 500개 서열 다중 모달 데이터셋에서 거의 실시간적인 성능을 보이며, 정확도와 압력에 의한 오분류 측면에서 CNN-LSTM, BiLSTM-Attention, GNN 기준선보다 우수합니다.
Research Article
축구에서 전술적 의사결정 분류를 개선하기 위해, 본 연구는 시각적, 위치, 음향, 맥락 데이터를 통합한 트랜스포머 기반 다중 모달 융합 모델을 제안합니다. 이 모델은 500개 서열 다중 모달 데이터셋에서 거의 실시간적인 성능을 보이며, 정확도와 압력에 의한 오분류 측면에서 CNN-LSTM, BiLSTM-Attention, GNN 기준선보다 우수합니다.
현대 축구에서는 빠르고 정확한 전술적 의사결정이 요구된다. 그러나 전술적 의사결정 평가를 위한 전통적인 접근법은 생태학적 타당성이 낮고 확장성이 쉽지 않습니다. 이러한 도전 과제를 해결하기 위해, 본 글에서는 플레이어 포지셔닝, 비디오, 오디오, 맥락 메타데이터를 통합하여 실시간 전술적 의사결정을 분류하는 트랜스포머 기반 멀티모달 퓨전 모델을 소개합니다. 40명의 남성 플레이어와 500개의 다중 모드 플레이 시퀀스로 구성된 데이터셋을 대상으로 실험이 진행되었습니다. 40명 참가자 데이터셋은 초기 검증과 신뢰도 평가를 위해 사용되는 통제된 실험실 스타일의 의사결정 실험을 의미합니다. 그 후 500개의 멀티모달 시퀀스가 확장된 매치 시뮬레이션과 실제 게임 녹화에서 추출되어 멀티모달 트랜스포머 모델 훈련 및 테스트에 사용되는 더 큰 데이터셋을 제공했습니다.
입력을 데이터 수집, 전처리, 특징 추출, 트랜스포머 기반 융합, 의사결정 분류의 다섯 단계로 처리합니다. CNN-LSTM, BiLSTM-Attention, GNN의 기준선과 비교할 때, 제안된 접근법은 의사결정 예측의 정확도를 28% 향상시키고 압력에 의한 오분류를 41% 줄이며, 추론 지연 시간은 52.6ms로 낮아 거의 실시간 응용에 적합합니다. 더 다양한 전술적 맥락과 더 넓은 운동선수 인구통계학적 연구 결과에 대한 일반화 가능성은 단일 지역 출신 젊은 남성 선수들로 구성된 표본 집단의 상대적 규모와 동질성에 의해 제한된다. 이 결과들은 트랜스포머 기반 다중 모드 융합이 자동화된 전술적 의사결정 분석에 기여한다는 점을 강조하며, 더 다양하고 대규모 매치 상황에서 이를 더욱 검증할 필요성을 지적합니다.
축구와 같은 팀 스포츠는 역동적이고 불확실한 환경에서 빠른 전술적 결정을 요구합니다. 선수들은 공, 팀원, 상대의 시각적 정보를 끊임없이 읽고 몇 분의 1초 내에 반응하여 경쟁 우위를 확보해야 합니다. 축구에서 전술적 의사결정은 선수의 움직임, 공의 궤적, 상황에 따른 신호에 대한 빠른 인지에 크게 의존합니다. 반응 시간과 선택적 주의와 같은 일반적인 지각-인지 기술이 수행에 영향을 미치지만, 최근 연구들은 실제 게임 내 전술 인지를 근사할 수 있는 데이터 기반의 맥락 인식 모델을 강조했습니다 1,2,3,4,5. 반응 시간과 인지 능력과 같은 지각 능력도 수행에 중요한 역할을 합니다 6,7,8. 최근 스포츠 인지 연구는 전술적 의사결정이 단지 지각 능력뿐만 아니라 운동선수가 실시간으로 동적 공간 정보, 상대 압력, 그리고 게임 상황에 따른 신호를 통합하는 능력에 의존한다는 것을 밝혀냈습니다. 지각-인지 전문성 연구에 따르면, 전술적으로 더 많은 이해력을 가진 선수들이 신호를 더 빠르게 인식하고, 정보를 더 효율적으로 수집하며, 압박 속에서도 더 안정적인 의사결정 패턴을 보인다고 합니다. 이러한 연구 결과는 스포츠 의사결정 과정의 복잡하고 다층적인 특성을 포착할 수 있는 계산 모델의 필요성을 뒷받침합니다.
전술적 의사결정을 평가하는 고전적 방법은 종종 통제된 실험실 작업과 주관적인 전문가 판단을 사용하여 생태학적 타당성과 확장성에 상당한 제약을 가합니다. 딥러닝의 최근 발전은 비디오, 위치 추적, 컨텍스트 매치 메타데이터와 같은 다중 모달 데이터 소스를 시간 및 교차 모달 의존성 캡처 아키텍처 내에서 자동화할 가능성을 제공합니다. 이러한 발전에도 불구하고, 대부분의 현재 모델은 여전히 합성곱 신경망-장단기 기억 또는 양방향 장단기 기억(CNN-LSTM 또는 BiLSTM) 모델에 기반하고 있으며, 이들은 양상 간 장거리 의존성을 모델링하는 데 한계가 있습니다. 이러한 단점이 트랜스포머 기반 멀티모달 퓨전 모델의 개발을 촉진하는 원동력으로, 축구 시나리오에서 전술적 의사결정을 보다 포괄적이고 안정적으로 모델링할 수 있도록 더 잘 갖춰져 있습니다. 예를 들어, 미식축구라는 팀 스포츠에서는 선수들이 공에 관한 정보를 빠르게 평가해야 하며, 여기에는 팀원, 상대, 필드 내 위치 등이 포함됩니다. 그들의 능력, 코치의 지시, 경기 상황에 따라 최선의 행동 방침을 결정하기 전에 9,10. 조직된 데이터셋과 정의된 전술 구성 요소의 접근성 때문에, 본 연구는 축구에만 집중합니다; 하지만 의사결정을 위한 전술적 원칙은 많은 팀 스포츠에 적용될 수 있습니다.
실제로 이전 연구들은 CNN-LSTM과 BiLSTM이 고정된 수용 필드를 사용하거나 순차적 게이팅 11,12,13에 의해 제한됨으로는 매우 장거리의 시간적 의존성을 포착할 수 없음을 시사합니다. 마찬가지로, 행동 인식과 다중 모달 시간 모델링의 기초 벤치마크 연구는 LSTM 기반 모델 성능이 시퀀스 길이가 증가하거나 맥락적 단서가 몇 프레임 간격으로 나타날 때 감소하며, 이는 역동적인 스포츠 환경에서 생태학적 타당성을 제한할 수 있음을 밝혀냅니다. 더불어, 그래프 신경망(GNN) 기반 모델은 공간 상호작용 모델링에 강력한 도구이지만, 세밀한 시간 추론이 필요한 상황이나 맥락적 압력 단서가 시간에 따라 급격히 변화하는 경우에서는 지속적으로 성능이 떨어져 왔습니다(14,15). 이러한 접근법과 달리, 최근 트랜스포머 기반 프레임워크는 장거리 시간 신호, 공간 관계, 맥락 신호를 단일 전진 패스로 통합하여 스포츠 분석, 인간 활동 인식, 비디오 언어 과제에서 우수한 성과를 입증하며, 이는 전 세계적인 자기 주의를 통해 가능해졌습니다. 이러한 벤치마크 결과는 이번 연구에서 제안된 모델의 기반으로 트랜스포머 기반 아키텍처를 선택하는 것을 정당화합니다.
전술 지식 향상과 전술 원칙 이해는 게임 제약과 문제를 해결하는 데 매우 중요하다는 것이 입증되었습니다16,17. 미식축구 선수들은 기술-전술 훈련을 통해 침투, 공격 보호, 움직임, 시간, 제한, 방어 보호, 균형, 집중 등 다양한 경기 요소를 배웁니다. 선수들이 축구 경험을 쌓을수록 기술적·전술적 기본기에 대한 이해도 높아질 것입니다. 따라서 플레이어들은 관련 신호를 더 쉽게 파악할 수 있어, 특정 상황19에서 각 게임 규칙에 맞는 적절한 의사결정을 용이하게 할 수 있습니다. 이로 인해 선수들은 운동 효율성과 의사결정 능력을 활용해 움직임 패턴에 특화된 재능을 보완할 수 있습니다.
저자는 다기능 의사결정을 사용하여 운동과 습관의 체력 향상 효과를 분석하여, 학생들 사이에서 자격을 갖춘 체육 능력의 효과를 입증했습니다. 효과적인 신체 활동, 건강한 피트니스 습관 개발, 교육 기관에서 스포츠 묘사 방식의 개혁 옹호가 모두 상당한 비중을 차지합니다. 직관주의 퍼지 가중 헤론 평균법(IFWHM)과 퍼지 수 보조가 효과적인 의사결정을 위해 사용됩니다. 이 결과는 대학생들의 인지 성공을 지원했으며, 신체적 건강 문제에 대한 보다 정확한 평가를 보여주었습니다. 데이터 내 잠재적 연관성을 탐지하기 위해 연구자20 은 증강 사전 분석 방법을 사용했습니다. 이 연구의 결론은 고등교육에서 학생들의 신체 건강 평가와 관련이 있습니다. 첫 번째 결과는 다양한 방향의 피로도를 그 빈도에 따라 평가하여 결정됩니다.
이전의 AI 기반 스포츠 분석 연구는 선수 감지, 추적, 그룹 활동 인식 등 컴퓨터 비전 작업에 초점을 맞추어 왔습니다. 최근의 약한 감독 및 검출기 없는 아키텍처는 전술적 행동을 이해하는 데 있어 다중 모달과 맥락 인식 모델링의 중요성을 드러냈습니다. 이러한 발전은 축구에서 전술적 결정을 분류하기 위한 다중 모달 딥러닝의 통합을 필요로 합니다. 행렬 인수분해를 통해 유틸리티 행렬에서 생성된 잠재 특징 벡터를 사용하여, 이 글에서 사용자와 사용자 또는 항목과 항목 간의 코사인 유사도를 계산합니다.
최근 스포츠 분석 연구는 비디오, 위치 데이터, 맥락 단서를 결합해 전술적 행동을 해석하는 다중 모달 및 맥락 인식 딥러닝 프레임워크로 전환되고 있습니다. 다양한 트랜스포머 기반 접근법이 스포츠 환경에서 장거리 시간 구조와 교차 모달 관계를 모델링하는 데 강력한 능력을 보여주었으며, 여기에는 MM-ViT(다중 모달 행동 인식), 통합 대비 융합 변압기(스포츠 맥락 추론), 교차 주의 기반 이벤트 탐지기 등이 포함됩니다21,22. 이러한 접근법은 전술적 의사결정이 단일 모달리티 CNN-LSTM 모델보다는 플레이어, 공간, 움직임 단서, 맥락 정보 간의 상호작용을 포착하는 아키텍처를 통해 가장 잘 표현된다는 점을 강조합니다. 이러한 방향에 따라, 제안된 연구는 또한 트랜스포머 기반 멀티모달 퓨전 프레임워크를 활용하여 시각적, 포지셔널, 맥락적 신호를 공동 처리하여 축구 전술 의사결정을 거의 실시간으로 모델링할 것입니다.
이전의 축구 분석 모델들은 주로 CNN-LSTM 또는 BiLSTM 아키텍처를 중심으로 구축되었으며, 이들은 국소적 시간 패턴을 포착하지만 모달리즘 간 장기 의존성에 어려움을 겪습니다. 트랜스포머는 전역 자기 주의를 적용하여 이 공백을 메워, 모델이 선수의 움직임, 공의 궤적, 상황적 단서를 장시간 창 키(key) 능력에 걸쳐 연관시켜 견고한 전술적 의사결정 분석을 가능하게 합니다. 추천자 시스템의 평가 데이터 불확실 문제를 해결하기 위해, 저자23,24는 리뷰 기반 협업 필터링과 평가 보정을 결합한 리뷰 기반 매트릭스 인수분해 기법을 제안했습니다.
그럼에도 불구하고, 이러한 방법들의 효율성, 확장성 및 적용성은 추론을 위한 경계 상자에 의존하고 데이터 라벨링에 대한 방대한 요구로 인해 심각하게 제한됩니다. 이 문제를 해결하는 한 가지 방법은 경계 상자 라벨을 사용해 플레이어 감지와 그룹 활동 인식을 동시에 학습하는 것입니다25, 26, 27, 28. 학습 데이터에 여전히 액터 수준의 경계 상자 주석이 필요하지만, 제안된 방법은 추론 중 플레이어의 경계 상자를 계산합니다. 학습이나 추론을 위해 행위자 수준의 라벨이 필요하지 않은 약한 감독 그룹 활동 인식(WSGAR) 접근법은 주석 부담을 완화하는 것을 목표로 합니다. 외부 데이터셋에서 사전 학습된 검출기를 사용해 경계 상자 제안을 생성한 후, 관련 없는 탐지를 필터링하는 법을 배웠습니다. 최근29일, 연구진은 WSGAR 챌린지에 대해 토큰 임베딩을 사용해 부분 컨텍스트를 생성하고 플레이어 정보를 수집하는 검출기 없는 접근법을 제시했습니다.
스포츠 분석 분야에서는 멀티모달 및 트랜스포머 기반 아키텍처가 장거리 시간 패턴을 포착하고 이기종 데이터 스트림을 통합할 수 있어 최근 중요성을 얻고 있습니다30,31. 트랜스포머의 변형들은 플레이어의 움직임을 예측하고, 다중 시점 전술 분석을 수행하며, 행동 의도를 인식하는 데 적용되어 CNN-LSTM 모델과 비교했을 때 뛰어난 시간적 추론력을 입증했습니다. 비디오, 위치, 맥락적 단서를 결합한 멀티모달 융합 전략은 실시간 전술 모델링에서 고무적인 초기 결과를 보여주었으며, 게임 내 의사결정 역학 이해에 있어 교차 주의와 시퀀스 간 학습의 중요성을 강조했습니다.
트랜스포머 기반 멀티모달 프레임워크는 다양한 데이터 스트림 통합이 필요한 다양한 분야에서 최근 뛰어난 성과를 입증했습니다. 예를 들어, ViT 기반 다중 모달 융합 모델은 교차 주의 과정을 통해 비디오, 포즈, 오디오 정보를 공동 해석하여 맥락 인식 이벤트 예측, 플레이어 추적, 행동 인식을 위해 사용되었습니다32,33. 더불어, MM-포머와 지각자 기반 아키텍처는 스포츠 분석과 인간활동 분석에서 시공간 단서 융합과 장거리 시간 추론에서 반복 및 합성곱 모델보다 우수한 성능을 보였다. 이 결과들은 트랜스포머가 전역 주의를 통해 모달리티 간 미세한 상호작용을 포착할 수 있음을 나타내며, 트랜스포머 기반 다중 모달 융합 아키텍처의 사용을 뒷받침합니다35. 트랜스포머는 전역 집중력을 통해 모델이 시각적 단서, 위치 데이터, 맥락 신호를 더 긴 시간적 창에 걸쳐 연결할 수 있어 전술 분석에 특히 적합하며, 이는 CNN-LSTM과 BiLSTM 모델이 부족한 기능입니다.
이전 연구들은 주로 수작업으로 작성되고 인증된 평가를 사용해 운전과 추월과 같은 사전 정해진 활동에서 수행 속도와 의사결정 정확도를 평가했으나, 팀 스포츠에서 전술적 의사결정 평가에 대한 관심이 증가하고 있음에도 불구하고36, 37, 38. 이 프레임워크들은 플레이어 행동과 의사결정 우수성에 대한 통찰력 있는 데이터를 제공함에도 불구하고, 확장성, 객관성, 동적 현실 상황에 대한 적합성 측면에서 경계가 있습니다39. 플레이어 행동, 시각적 신호, 오디오 신호, 게임 설정 간의 복잡한 연관성을 포함하는 전술적 의사결정의 다중 모달적 특성을 기록하고 이해할 수 있는 컴퓨터화된 데이터 기반 접근법은 현재의 방법들(40, 41, 42)에 통합되지 않고 있다. 또한, 배경과 시간적 관계를 전환할 수 있는 다면적인 AI 구조는 이러한 방법들에서 종종 간과됩니다. 트랜스포머 기반 멀티모달 융합 프레임워크의 성장은 분명히 부족하며, 비디오 영상과 위치 추적 같은 풍부한 실시간 데이터 소스를 활용하고 팀 스포츠의 의사결정 과정을 통합하고 있습니다. 이 격차를 해소하면 고성능 스포츠 환경에서 전술적 침투성, 확장성, 의사결정의 독립성을 크게 향상시킬 수 있습니다. 현재의 CNN-LSTM 및 BiLSTM 방법론과 달리, 이 트랜스포머 기반 융합은 시각, 공간, 맥락 정보 간의 교차 모달 주의를 의식적으로 모델링합니다. 이러한 새로움은 전술적 표현을 더욱 밀도 있게 만들고, 압력 상황에서 잘못된 분류를 40% 이상 줄이는 데 도움을 줍니다.
본 연구의 주요 목적은 축구에서 전술적 의사결정을 평가하기 위한 트랜스포머 기반 다중 모달 융합 프레임워크를 개발하는 것입니다. 제안된 프레임워크는 다른 팀 스포츠에도 일반화할 수 있지만, 본 연구는 전술적 복잡성과 구조화된 데이터셋의 가용성 때문에 축구에 초점을 맞춥니다. 이 시스템은 전문가 평가를 바탕으로 통제되고 고립된 풋볼 과제에서 전술적 정확성과 대응 타이밍을 체계적으로 평가할 수 있게 합니다. 이 연구는 위치 추적, 영상 자료, 오디오 신호, 게임 맥락 정보 등 다중 모달 데이터 소스를 통합하여 수동 평가 및 정적 테스트 환경의 한계를 해결합니다.
트랜스포머 기반 주의 프로세스를 활용하여 제안된 프레임워크는 멀티모달 링크를 지속적으로 학습하여 플레이어의 실시간 의사결정 방식을 통합적이고 맥락 인식 방식으로 해석할 수 있게 합니다.
이 결정의 주요 목적은 데이터 기반 인사이트를 통해 코치와 분석가에게 선수의 사고와 팀 역학에 대한 더 깊은 이해를 제공함으로써 스포츠에서 지능적인 성과 평가를 촉진하는 것입니다.
제안된 프레임워크는 트랜스포머의 주의 메커니즘을 활용하여 인터모달 관계를 지속적으로 학습하여, 실시간 게임에서 플레이어의 의사결정 전략을 통합적으로 이해할 수 있게 할 것입니다.
이를 통해 표준 평가 방법으로는 특성화하기 어려운 전술적 행동에 대한 실행 가능한 통찰을 제공할 수 있는 능력을 갖추게 됩니다.
목표는 해석 가능성을 높이고 코치와 분석가에게 더 유용한 정보를 제공하는 것입니다.
이 연구의 주요 기여는 다음과 같습니다:
본 연구는 트랜스포머 기반 다중 모드 융합 설계를 활용하여 팀 스포츠에서 전술적 의사결정 분석을 위한 새로운 딥러닝 모델을 제시합니다.
실제 게임 영상에서 추출한 시각적, 포지셔널, 맥락적 데이터 스트림을 통합함으로써, 이 접근법은 단독 패스와 드라이브 행동에 초점을 맞춘 기본 연구에서 도입된 단순한 평가 방법의 범위를 크게 확장합니다.
멀티모달 인코더는 플레이어 추적 데이터, 시각적 프레임, 그리고 주의 메커니즘을 이용한 맥락적 매치 이벤트를 통합하여 정교한 시공간적 관계를 수집합니다.
벤치마크 축구 데이터셋에서의 실험 결과, 이 모델이 CNN 기반 융합 기법과 LSTM 같은 전통적인 기준선보다 우수한 성능을 보였습니다.
CNN-LSTM, BiLSTM-Attention, GNN 기준선과 비교했을 때, 제안된 트랜스포머 기반 다중 모달 핵융합 아키텍처는 상당한 향상을 보였습니다.
Access restricted. Please log in or start a trial to view this content.
이 연구에는 18세에서 24세 사이의 남성 축구 선수 40명(평균 = 20.1 ± 1.2)이 포함되었으며, 이들은 한 지역 리그 내 4개의 아마추어 및 준프로 클럽에서 모집되었습니다. 모든 참가자는 최소 3년의 경쟁 경험을 보유하고 있으며, 현재 체계적인 환경에서 훈련 중이었습니다. 데이터 수집은 두 가지 통제된 환경에서 수행되었습니다: 첫째, 전술적 패스/드라이브 결정 시나리오를 시뮬레이션한 표준화된 훈련장; 둘째, 멀티모달 서열을 추출하는 장시간 매치 시뮬레이션 세션에서 수행했습니다. 모든 절차는 베이부걸프 대학교 기관윤리 위원회(승인 번호: BG-PE-2023-117)의 승인을 받았으며, 데이터 수집 전에 모든 참가자로부터 서면 동의를 받았습니다. 이 조사를 수행하는 데 있어 국제 및 기관의 윤리 기준이 준수되었습니다. 베이부만 대학교 기관윤리 위원회는 인간 대상 대상 모든 절차를 검토하고 승인했습니다(승인 번호: BG-PE-2023-117). 데이터 수집 전에 각 참가자는 서면 동의서를 제출했으며, 수집된 모든 데이터는 분석 전에 익명화되었습니다.
이 작업은 트랜스포머 기반 멀티모달 퓨전 아키텍처를 통해 팀 스포츠 전술적 의사결정 조사를 자동화하고 향상시키는 것을 목표로 합니다. 비디오, 오디오, 공간 위치, 플레이어 메타데이터 등 다양한 데이터 소스를 활용하여 강력한 실시간 예측 모델을 만듭니다. 그림 1 은 제안된 방법의 아키텍처를 보여줍니다. 제안된 작업은 다섯 단계로 구성되어 있습니다. 단계들은 아래에 설명되어 있습니다:

그림 1. 제안된 방법의 아키텍처. 전술적 의사결정을 위한 다중 모달 입력과 분류 요소를 결합한 모델 개략도. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
데이터 수집 및 전처리
비디오 피드, 오디오 해설, GPS/위치 정보, 선수 퍼포먼스 지표 등 경기 녹화에서 다양한 모달리티의 데이터가 수집됩니다. 각 모달리티는 프레임 추출(비디오), 노이즈 필터링(오디오), 정규화(센서 측정)와 같은 기법 형태로 전처리를 거쳐, 시간 단계별 동기화를 보장합니다.
비디오 프레임은 25fps로 추출되어 224× 224 해상도로 다운샘플링되었습니다. 오디오 신호는 300Hz에서 3,400Hz 사이의 밴드패스 필터로 처리되어 대부분의 환경 잡음을 제거했습니다. GPS 센서의 위치 추적 데이터는 10Hz로 기록되었고, 선형 타임스탬프 기반 보간으로 보간하여 25Hz 비디오 타임라인과 일치하도록 했습니다. 모든 입력은 공유 타임스탬프를 사용해 시간적으로 정렬되었고, 그 척도는 z-점수로 정규화되었습니다.
특징 추출
비디오 데이터의 시공간 정보를 수집하기 위해 3D CNN이 사용됩니다. 3D CNN은 비디오 프레임 전반에 걸쳐 공간 및 시간적 정보를 모두 처리하여, 이동 패턴을 감지하고, 집단 행동을 이해하며, 움직임 기반 특징을 추출할 수 있습니다. 이 연산은 동작 시퀀스별로 조밀한 특징 표현을 생성하며, 이는 모델의 시각적 입력으로 사용됩니다. 각 비디오 입력 클립은 2 보폭으로 샘플링된 16개의 연속 프레임을 포함했습니다. 훈련 중에 무작위 크롭, 수평 뒤집기, 밝기 정규화가 적용되었습니다. 3D CNN은 Adam(lr = 0.0001), 배치 크기 16, 교차 엔트로피 손실을 사용하여 최적화되었습니다.
멀티모달 입력의 임베딩과 정렬
그 다음, 다양한 모달리티의 임베딩이 3D CNN 출력과 통합됩니다. 다양한 인코더 분기가 각 모달리티를 처리하는 다중 모달 트랜스포머 모델 아키텍처가 사용됩니다. 교차 주의 계층은 모달리티 융합과 정렬을 위해 사용되어, 모델이 상호의존성(예: 선수 위치와 공 움직임, 해설에서 얻는 맥락 등)을 포착할 수 있게 합니다. 이러한 융합은 현재 전술 선택에 대한 맥락적 이해를 풍부하게 합니다. 또한 모든 임베딩을 PyTorch에 구현했습니다. 비디오 특징은 1,024에서 512차원으로 선형적으로 투영되었고, 오디오 및 위치 특징은 각각 256차원과 128차원으로 투영되었으며, 시간 정렬 전에는 512차원으로 통합되었습니다.
트랜스포머 기반 다중 모달 핵융합
멀티모달 트랜스포머는 모든 출처에서 추출한 특징을 결합하기 위해 사용됩니다. 트랜스포머의 자기 주의 메커니즘은 모델이 모달리티(예: 시각 + 오디오) 간 상호 의존성을 학습하고, 시간적 흐름과 맥락을 포착하며, 전술적으로 중요한 프레임과 사건을 강조할 수 있게 합니다. 이 단계의 결과는 각 결정의 전술적 의도와 상황적 맥락을 포착한 결합된 표현입니다. 멀티모달 트랜스포머는 여덟 개의 어텐션 헤드를 가진 6개의 인코더 레이어로 구성되어 있었습니다. 주의 행렬은 스케일드 드곱 주의를 사용하여 계산되었습니다. 주의 및 피드 포워드 층에는 과적합을 방지하기 위해 p = 0.1의 드롭아웃도 포함되었다.
전술적 의사결정 분류 및 평가
마지막으로, 융합된 표현은 분류 계층 또는 의사결정 분석 블록에 입력되어 전술적 의사결정 유형을 예측하고, 의사결정 품질을 평가하며, 주의력 히트맵이나 활성화 맵을 통해 코치에게 설명 가능한 통찰을 생성하는 데 사용됩니다. 이 단계의 산출물은 매치 플레이 중 팀이나 선수의 의사결정 능력을 정량적, 정성적으로 평가합니다.
분류 헤드는 ReLU 활성화 후 소프트맥스 계층이 이어지는 3층 MLP를 사용했습니다. 모델은 70/15/15 분할과 10배 교차 검증을 통해 학습되었습니다. 사용된 지표는 정확도, 정밀도, 회상율, F1 점수, 지연 시간, AUC 등이 있었습니다.
다섯 단계를 요약한 단순화된 흐름도는 그림 2에 나타난 순차적 과정을 즉시 시각적으로 보여줍니다. 이 그림은 데이터 수집, 전처리, 특징 추출, 다중 모달 융합, 전술적 의사결정 분류를 포함한 전체 연구 파이프라인을 간결하게 나타내며, 각 단계에 대한 상세한 설명이 이어집니다.

그림 2. 연구 과정의 전반적인 워크플로우. 데이터 수집 및 전처리부터 특징 추출, 모델 학습 및 평가에 이르는 연구 파이프라인 개요. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 3 은 제안된 연구 프로세스의 전체 워크플로우를 보여줍니다. 이 과정은 1단계인 데이터 수집 및 전처리에서 시작되며, 비디오, 오디오, 위치 추적, 맥락 메타데이터 등 다중 모달 데이터 소스를 수집하고 동기화합니다. 2단계: 특징 추출에서는 3D 합성곱 신경망(3D CNN)을 사용해 비디오 스트림에서 시공간 정보를 추출하여 플레이어 행동과 전술 흐름을 밀집된 시각적 표현으로 만듭니다. 3단계: 멀티모달 입력의 삽입 및 정렬은 오디오, 비디오, 위치 기능을 시간적 정렬과 교차 모드 정렬을 통해 공유 잠재 공간에 결합합니다. 이 표현들은 이후 4단계: 트랜스포머 기반 다중 모달 융합에서 집계되며, 교차 모달 및 자기 주의 메커니즘을 통해 모델이 모달리티 간 상호 의존성을 학습하고 전술적 의사결정에 대한 더 깊은 맥락적 통찰을 도출할 수 있습니다. 마지막으로 5단계: 전술적 의사결정 분류 및 평가에서는 결합된 표현을 분류 계층에 입력하여 패스, 드라이브, 홀드와 같은 전술적 결정을 감지합니다. 한편, 성과 지표를 활용해 의사결정 정확성과 대응 시간을 추정합니다. 이 흐름도는 단계별 접근법을 명확히 개관하며, 다음 섹션에서 설명한 상세한 텍스트 설명과 함께 제공됩니다.

그림 3. 순차적 처리 파이프라인. 데이터 수집부터 전술적 의사결정 분류 및 모델 출력까지의 단계별 과정을 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
데이터 수집 및 전처리
트랜스포머를 이용한 멀티모달 퓨전 파이프라인을 통해 팀 스포츠에서 고수준의 전술적 의사결정 분석을 가능하게 하기 위해, 구조화되고 고충실도의 데이터 수집 및 전처리 시스템이 구축되었습니다. 이 설정은 비디오 녹화, 선수 위치 추적, 선수-코치 상호작용에서 나오는 오디오 신호, 경기 단계, 팀 구조, 소유권 영역과 같은 맥락적 메타데이터 등 여러 데이터 방식을 융합하는 것을 포함합니다.
연구 대상은 20세 이상 남성 40명으로 구성되었으며, 모두 지역 아마추어 및 준프로 축구 리그에 적극적으로 참여하고 있었습니다. 이들은 모두 체계적인 훈련 프로그램을 가진 네 개의 경쟁 클럽에서 영입되었습니다. 선수들의 평균 나이는 1.2세± 20.1세였으며, 평균 키는 177.5 ± 3.1cm, 평균 체중은 72.6± 2.9kg이었습니다. 그들은 각자의 클럽에서 평균 6.8± 1년 반 동안 뛰었습니다. 모든 참가자는 최소 3년의 경쟁 경험이 있었고 전술적 능력이 있는 것으로 평가받았습니다.
통계적 역량을 보장하기 위해 표본 크기는 95% 신뢰도(Z = 1.96)와 5% 유의수준, 기대 클래스 내 상관계수(ICC)는 0.96, 95% 신뢰구간을 사용하여 거의 완벽한 일치를 반영하여 추정했습니다. 이는 수집된 다중 모달 의사결정 데이터의 신뢰성과 일관성을 검증하는 목적과 일치합니다27.
재현성을 보장하기 위해 획득 설정과 기술 사양이 세션 전반에 걸쳐 표준화되었습니다. 비디오 데이터는 GoPro Hero4 카메라를 사용해 광시야각을 적용해 1,080p 해상도와 초당 25프레임으로 전술 공간을 포착했습니다. 각 녹화는 안정화되어 고정된 높이 2.5m에 설치되었습니다. 오디오 신호는 외부 필드 마이크를 사용해 44.1 kHz 샘플링 속도(모노)로 포착한 후, 300-3,400 Hz 밴드패스 필터로 필터링하여 환경 잡음을 제거했습니다. 위치 추적 데이터는 10Hz 속도로 작동하는 웨어러블 GPS 센서를 사용해 수집되었으며, 제조사 평균 보고된 위치 정확도는 ±0.5m였습니다. 모든 모달리티는 공유 타임스탬프를 사용해 동기화되었고, 선형 보간을 통해 공통 25Hz 타임라인으로 재샘플링되었습니다.
전처리에는 다음과 같은 작업이 포함되었습니다: 224 × 224 해상도로의 비디오 다운샘플링, 스트라이드 2로 16프레임 연속 프레임 샘플링, 무작위 크롭, 수평 뒤집기, 밝기 정규화, 오디오 정규화, 노이즈 필터링, 위치 및 맥락별 변수 z-score 정규화.
재현성을 위해 전처리 스크립트는 다음과 같이 배열됩니다: (i) 프레임 추출; (ii) 오디오 필터링; (iii) GPS 보간; (iv) 25Hz로의 모달리티 재샘플링; (v) z-점수 정규화; 그리고 (vi) 부패, 폐쇄, 드롭아웃에 대한 무결성 테스트. 배치 처리 스크립트를 사용하여 각 단계를 자동으로 완료합니다.
데이터 신뢰성을 유지하기 위해 품질 관리 및 제외 기준에는 i) >20% 플레이어 폐쇄, ii) GPS 드롭아웃 200ms 이상, iii) 손상 또는 편집된 오디오, iv) 심각한 모션 블러 또는 모달리스 간 동기화 불안정이 포함되었습니다. 총 17개의 서열(3.4%)이 이 질환에 대해 제외되었습니다. 표 1은 데이터셋 설명을 보여줍니다.
| 속성 | 세부 사항 |
| 스포츠 | 축구 (축구) |
| 참가자 | 40명의 남자 미식축구 선수 |
| 경기 수준 | ≥5년 경력의 연맹 축구 선수들 |
| 테스트 유형 | 패스 및 드라이빙(볼 컨트롤) 의사결정 및 실행 테스트 |
| 시험 설정 | 표준화된 축구 경기장 구성, 표시된 존, 고정된 포지션 |
| 측정 도구 | GoPro Hero4 카메라, Kinovea 소프트웨어, 스톱워치 타이밍 |
| 수집된 데이터 | 실행 시간(ET), 의사결정(DM) 정확성, 올바른 행동 횟수 |
| 시험 절차 | 선수들은 코치의 시각적 자극에 반응하며 패스나 돌파를 실행했습니다 |
| 재판 반복 | 선수당 10회의 트라이얼 (5패스, 5드라이브) |
| 평가 | 전문가 등급 DM; ET는 타임스탬프/영상으로 측정됩니다 |
| 결과 변수 | 반응 시간, 올바른 의사결정 수, 기술 실행 점수 |
표 1: 데이터셋 설명. 참가자 인구통계, 검사 절차, 측정 도구, 결과 변수를 상세히 설명합니다.
본 연구에서는 관련되었지만 구별되는 두 개의 데이터셋이 사용되었습니다. 첫 번째 데이터셋은 40명의 플레이어가 주로 기본 신뢰도를 확립하고 기본 의사결정 측정 절차를 검증하는 데 사용된 통제된 패스/드라이브 의사결정 과제에 참여했습니다. 두 번째 데이터셋에는 확장 경기 시뮬레이션과 실제 게임 녹화에서 수집된 500개의 멀티모달 전술 시퀀스가 포함되어 있습니다. 이 서열들은 트랜스포머 기반 핵융합 모델의 주요 훈련 및 테스트 데이터셋을 구성하여, 보다 생태적으로 타당한 조건에서 평가할 수 있게 했습니다.
데이터셋은 500개의 다중 모드 시퀀스로 구성되어 있지만, 층별 표본 추출을 통해 전술적 행동(패스, 드라이브, 홀드) 간 균형 잡힌 표현이 보장되었습니다. 시간 자르기나 시퀀스 셔플링과 같은 데이터 증강 접근법도 학습 중 변동성을 높이고 모델 편향을 완화하기 위해 활용되었습니다.
초기 모델 검증 및 신뢰성 테스트에는 40명의 플레이어가 통제된 데이터셋이 사용되었으며, 500개의 멀티모달 서열은 장기간 매치 기록과 조직된 훈련 세션을 통해 프레임워크의 확장성과 생태학적 타당성을 평가하기 위해 수집되었다는 점도 주목할 만합니다. 기초 신뢰도는 소규모 데이터셋을 사용하여 확립되었고, 더 큰 데이터셋은 대규모 모델 훈련 및 테스트를 용이하게 했습니다.
데이터셋 설명
이 실험은 최소 5년 이상의 연맹 선수 경력을 가진 40명의 남성 미식축구 선수를 모집하여 표본 집단이 기본적인 기술적·전술적 역량을 갖추도록 했습니다. 데이터 수집은 표준화된 축구장 배치에서 이루어졌으며, 동일한 테스트 조건을 보장하기 위해 미리 정해진 존과 플레이 포지션이 할당되었습니다. 실험 중 참가자들은 코치의 시각적 신호에 반응하여 패스하거나 드라이브를 시도하며 실제 경기에서 내린 전술적 결정을 재현해야 했습니다. 각 참가자는 총 10회의 시험을 완료했으며, 5회는 통과, 5회는 운전 시험이었습니다. 이 움직임들은 GoPro Hero4 카메라로 촬영되었으며, 성능 데이터는 Kinovea 비디오 분석 소프트웨어와 수동 스톱워치 시간을 이용해 실행 시간(ET)을 측정했습니다. 수집된 주요 데이터 출처는 실행 시간, 경험 많은 코치들이 평가한 DM의 품질, 그리고 올바른 행동 수행 횟수였습니다. 이러한 요인들은 통제된 자극-반응 조건 하에서 플레이어들이 얼마나 빠르고 효과적으로 전술적 결정을 내리고 실행했는지 분석하는 정량적 기반을 제공했습니다. 생성된 데이터셋은 벤치마크 생성이나 지능형 시스템 훈련에 적합하며, 팀 스포츠 맥락에서 전술적 사고와 운동 반응을 모델링하는 데 적합합니다.
표본은 한 지역 리그의 젊은 남성 선수들로 제한되어 있어 연령대, 여성 운동선수 또는 기타 문화권 간 일반화가 제한될 수 있습니다. 향후 연구에서는 더 대표적이고 다양한 표본을 수집하려고 노력할 것입니다.
또 다른 제한은 단일 지역 리그에서 40명의 젊은 남자 선수 표본이 적다는 점입니다. 동질적인 표본은 내부 타당성에 기여하고 연령, 성별, 전술적 배경 차이로 인한 성과 변동을 줄였지만, 연구 결과의 일반화 가능성을 더 넓은 집단에 제한합니다. 따라서 모델이 학습하는 전술 패턴은 보편적인 의사결정 행동보다는 지역별 또는 성별에 따른 플레이 스타일을 반영할 수 있습니다. 본 연구에서는 층별 표본추출과 데이터 증강을 통해 데이터셋의 변동성을 높이려 했습니다; 하지만 여성 선수, 청소년 선수, 프로 선수, 다양한 전술 문화의 참가자들을 대상으로 한 대규모 연구가 다양한 축구 환경에서 이 모델의 견고성을 확인하기 위해 필요합니다. 이 결과들은 강력한 가능성을 보여주지만, 더 다양하고 큰 데이터셋에서의 추가 검증이 필요하다.
주관성을 줄이기 위해 세 명의 프로 미식축구 코치가 전술 선택에 독립적으로 주석을 달았다. 평가자 간 신뢰도는 학급 내 상관계수(ICC = 0.96, 신뢰구간이 0.94-0.98)를 사용하여 거의 완벽한 일치를 나타냈다. 합의된 논의로 이견이 해결되었습니다. 멀티모달 데이터의 경우, 전처리는 모달리티(25fps 비디오와 10Hz 센서 데이터)간의 시간적 동기화와 특성의 z-점수 정규화를 포함하여 모달리티 간 비교를 가능하게 했습니다.
평가자 간 신뢰도는 양측 무작위효과 계수(ICC [2,3])를 사용하여 정량화하였으며, 이는 여러 평가자 간의 절대 일치 평가에 적합하다. ICC 0.96(95% 신뢰구간: 0.94-0.98)은 일반적으로 사용되는 임계값에 근접한 일치를 나타내며, 훈련에 사용된 전술적 의사결정 라벨이 매우 신뢰할 만함을 더욱 입증합니다. 신뢰도는 500개 멀티모달 서열 전원에서 계산되어 통제 및 매칭 시뮬레이션 맥락 모두에 적절하고 일관성 있게 주석이 달렸습니다.
주석 작성 절차 및 라벨링 프로토콜
모든 다중 모달 시퀀스는 구조화된 3단계 프로토콜로 주석이 달렸습니다. 먼저, 세 명의 면허를 가진 풋볼 코치가 타임스탬프 동기화된 주석 인터페이스(Kinovea + 맞춤 태깅 스프레드시트)를 사용해 각 비디오 포지셔널 시퀀스를 독립적으로 검토했습니다. 주석 작성자는 전술적 의사결정 카테고리(추월, 주행, 대기), 맥락적 단서(압력 구역, 추월 차선 가용성), 이벤트 타임스탬프를 표시했습니다. 둘째, 의견 차이 감지 스크립트가 모호하거나 갈등이 있는 사례를 자동으로 식별하고, 이를 공동 합의 회의에서 검토했습니다. 셋째, 이벤트 경계 표시와 모달리스 간 시간적 정렬의 일관성을 보장하기 위해 독립적인 선임 분석가가 최종 검토를 수행했습니다. 이 과정은 이후 모델 학습을 위해 모든 주석이 추적 가능하고 최고 품질을 보장했습니다.
전처리
본 연구는 500개의 멀티모달 서열로 수행되었으나, 전처리 파이프라인은 설계상 대규모 데이터셋을 위해 설정되었습니다. 모든 모달리티는 자동화된 스크립트를 거쳐 병행하여 비디오 프레임을 배치 추출하고, 오디오를 재샘플링하며, 위치 데이터를 보간하고, z-점수 정규화를 적용했습니다. 모듈러 아키텍처의 존재로 각 모달리티는 별도의 GPU/CPU 스레드에서 독립적으로 전처리될 수 있습니다. 이를 통해 대량으로 경기 영상을 수집할 수 있습니다. 이로 인해 워크플로우가 수작업 개입 없이 전체 시즌 데이터셋으로 쉽게 확장될 수 있으며, 전문 분석 환경에서 실제 배포에 적합해집니다.
팀 스포츠에서 전술적 의사결정을 제대로 검토하기 위해서는 비디오 클립, 오디오 신호, 위치 기록 등 다양한 모달리의 원시 데이터를 사전 처리하고 정렬해야 합니다. 다중 모달 입력 일러스트는 다음과 같습니다
(1)
여기서 V는 CNN 인코더에서 추출한 비디오 특성의 연속으로 표기됩니다.
(2)
여기서 A는 wave2vec로 인코딩된 오디오 특성입니다.
(3)
P는 시간 ti에서 플레이어의 좌표 위치를 나타냅니다.
비동기 샘플링 속도를 다루기 위해 각 모달리티는 공유 타임라인에 재샘플링되거나 보간됩니다:
(4)
여기서
, 는 동기화된 특성 f,t는 결합된 프레임의 속도, Xm은 초기 표시입니다.
모달리티 간 균일한 척도를 위해 모든 특징 벡터는 z-점수 정규화됩니다:
(5)
μX와 σX는 훈련 집합 내 특징 차원의 평균과 표준편차를 나타냅니다.
주요 관심사는 패스/드라이브 결정이지만, 음성 신호가 전술 반응에 영향을 미치는 실제 경기 상황을 반영하기 위해 오디오 채널(예: 선수/코치 소통, 환경 경기 신호)이 추가되었습니다. 하이퍼파라미터(예: 학습률, 에포크)는 격자 탐색과 멀티모달 학습의 기존 평가를 통해 선택되어 수렴 안정성과 계산 효율성 사이의 균형을 이루었습니다.
제안된 프레임워크의 하이퍼파라미터인 학습률, 배치 크기, 훈련 시기는 수렴 안정성과 계산 효율성을 모두 달성하기 위해 잘 계획된 체계적 그리드 탐색을 통해 선택되었습니다. Adam 최적화기에서 0.0001의 학습률을 선택하면 진동 없이 안정적으로 그라디언트 업데이트를 제공했고, 배치 크기는 GPU 메모리 용량과 훈련 처리량의 균형을 맞추도록 최적화되었습니다. 50-100 에포크라는 설정은 과적합 없이 적절한 학습을 가능하게 하기 위해 사용되었으며, 이는 검증 손실 추적과 10배 교차 검증으로 확인되었습니다. 이 값들은 임의로 설정된 것이 아니라, 이전 멀티모달 학습 테스트와 현재 데이터셋에서의 실험 실험에 의해 조정되었습니다. 이 엄격한 과정 덕분에 선택된 하이퍼파라미터는 안정적인 모델 훈련과 기본 접근법 대비 성능 향상을 재현 가능하게 했습니다.
분류 과제는 패스/드라이브/홀드 결정에 초점을 맞추지만, 미식축구에서 실제 전술 행동은 선수-코치 소통, 동료 호출 신호, 압박 신호, 환경 소리(예: 공 접촉, 상대 접근)에 크게 영향을 받기 때문에 오디오 정보가 의도적으로 포함되었습니다. 이러한 신호들은 종종 의사결정에 앞서거나 동시에 나타나며, 축구 선수들의 자연스러운 지각 환경의 일부를 이룹니다. 예비 소작 실험에서는 오디오를 제외하면 회상력이 3.8% 감소하는 것으로 나타났으며, 이는 미묘한 음향 신호조차도 맥락 인식에 기여함을 시사합니다. 이 때문에 생태학적 타당성을 유지하고 실제 경기 조건에 대한 일반화 능력을 높이기 위해 오디오가 유지되었습니다.
실제로 이러한 하이퍼파라미터를 지원하기 위해, 학습률을 1e-5에서 5e-4, 배치 크기를 8에서 32, 변압기 층 수를 4에서 8, 주의 헤드 수를 4에서 12로 체계적으로 변화시키는 내부 민감도 분석이 수행되었습니다. 선택한 구성은 학습률 1e-4, 배치 크기 16, 8개의 어텐션 헤드를 가진 6층 인코더를 통해 안정적인 수렴을 지속적으로 제공했고, 검증 손실이 최소화되어 10배 교차 검증에서 과적합을 최소화했습니다. 배치 크기가 클수록 구배 불안정성이 발생했고, 배치가 작을수록 잡음이 증가하고 수렴이 지연되었습니다. 마찬가지로, 8헤드 이상의 변압기 모델은 성능 향상을 보이지 않았지만, 계산 시간을 상당히 늘렸습니다. 얻어진 결과는 본 연구에서 사용된 최종 하이퍼파라미터 설정의 정당성을 입증합니다.
3D 컨볼루션 신경망을 이용한 특징 추출
팀 스포츠 전술적 의사결정을 위한 제안된 트랜스포머 기반 다중 모달 융합 프레임워크에서는 3D 합성곱 신경망(3D CNN)이 원시 비디오 클립에서 시공간적 특징을 추출하는 역할을 합니다.
공간 차원(너비 W와 높이 H)만 고려하는 2D CNN과 달리, 3D CNN은 시간적 차원 R도 고려하여 축구에서 드라이브와 패스 같은 팀 행동을 이해하는 데 중요한 움직임 역학과 순차적 패턴을 감지할 수 있습니다.
3D-CNN28 은 처음으로 비디오 데이터의 공간 및 시간적 정보를 결합하는 데 제안되었습니다. 3D 커널은 열의 일부가 쌓인 프레임으로 구성된 큐브에 대한 3차원 컨볼루션 알고리즘에 사용됩니다. 3차원 합성곱은 식(6)으로 표현할 수 있다
(6)
여기서 :
는 l층의 j번째 특징 맵에서 (x, y, z) 위치의 출력 특징입니다.
는 m 번째 입력 특징 맵에서 위치(h, w, r)의 커널 가중치입니다.
는 이전 레이어로부터 시공간적으로 오프셋된 입력입니다. blj 는 바이어스입니다. f(.)는 활성화 함수(보통 ReLU)입니다. M은 이전 계층에서 입력된 특징 맵의 개수입니다. 이 방정식은 3D CNN이 공간(높이와 너비)과 시간적(프레임 시퀀스) 정보를 병렬로 결합할 수 있게 합니다.

그림 4. 3D CNN 처리 아키텍처. 3D 합성곱 연산을 통해 비디오 시퀀스에서 시공간적 특징을 추출하는 과정을 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 4 는 3D CNN의 작동 과정을 보여줍니다. 파이프라인은 입력 단계에서 시작되며, 미처리 축구 경기의 비디오 스트림이 선수 위치, 경기 통계, 맥락 메타데이터 등 정리된 데이터와 융합됩니다. 이 다중 모달 정보는 시각적 역학과 상황적 맥락을 모두 보존하며, 이는 팀 전술 분석에 매우 중요합니다. 그 후 비디오 스트림은 3D 합성곱신경망(3D CNN)을 통해 라우팅됩니다. 이 경우 입력 프레임에 일련의 3D 컨볼루션 레이어가 사용됩니다. 레이어들은 공간 차원(높이와 너비)과 시간 차원(프레임)을 따라 합성되어, 네트워크가 움직임 패턴, 선수 상호작용, 패스나 드라이브와 같은 순서 기반 전술을 학습할 수 있게 합니다. 그 후, 시공간적 특징이 밀집된 특징 큐브가 형성됩니다. 이 큐브는 중요한 특징을 보존하면서도 치수를 줄이기 위해 풀링 연산을 거칩니다. 풀링 시 특징 부피는 1차원 벡터로 평탄화되어 전술 상황을 간결하게 표현합니다. 이 특징 벡터는 이후 완전 연결된 딥 뉴럴 네트워크(DNN)에 입력됩니다. DNN은 의사결정 블록으로, 융합되고 추출된 특징을 처리하여 패스, 슈팅, 홀딩 등 전술적 결정을 내리는 역할을 합니다. 네트워크의 출력은 실제 게임 상황과 학습된 전략 패턴을 바탕으로 시스템이 최종 전술 결정을 내리는 것입니다.
멀티모달 입력의 임베딩과 정렬
특징 추출 후, 오디오, 비디오, 플레이어의 통계적 위치 등 세 가지 특징이 입력 모달리티로 주어집니다.
이들을 변환기에 입력한 후 학습 가능한 임베딩 함수를 통해 각각을 입력하는 방법:
(7)
여기서 f3DCNN 은 각 시간 단면V t 의 시공간적 특징을 학습하여 이를 d차원 잠재 공간으로 매핑한다.
(8)
여기서 WP 와 bP 는 학습 가능한 가중치입니다.
(9)
모든 임베딩은 시간 차원 T에 의해 정렬됩니다. 모달리티의 빈도가 다르면 보간법이나 다운샘플링을 사용합니다:
(10)
이제 모든 모달리티는 다음과 같이 동기화됩니다:
(11)
변압기에서 시간 순서를 유지하기 위해 모든 벡터에 위치 인코딩도 도입합니다:
(12)
여기서
는 기본 사인파 또는 학습 가능한 위치 부호화를 나타냅니다.
각 모달리티는 PyTorch 선형 계층을 사용하여 512차원 벡터로 연결되고, 위치 인코딩 후 트랜스포머 입력 시퀀스에 입력됩니다. 이는 각 타임 단계에서 교차 주의를 위한 통합 임베딩을 보장합니다.
최종 텐서는 다음과 같습니다.
(13)
이 함수는 트랜스포머 인코더에 입력되며, 자기 주의와 교차 모달 주의 메커니즘을 통해 모델이 모든 모달리티에서 공동으로 추론하여 전술적 의사결정을 할 수 있게 합니다.
트랜스포머 기반 다중 모달 핵융합
제안된 접근법에서는 획득한 다중 모달 데이터 벡터를 적분하기 위해 저랭크 행렬 분해법을 사용합니다. 텐서가 직접 융합될 때 발생하는 고차원 문제는 텐서 융합에 대해 낮은 랭크 분해 인자를 사용하는 이 방법으로 해결됩니다. 각 모달리티는 처음에 벡터로 표현되며, 중요한 상호작용을 보존하는 차원 축소는 저랭크 분해를 통해 달성됩니다. M 모달리티 중 융합 텐서 ZM 은 다음과 같이 구성된다:
(14)
여기서 :
는 m번째 양상의 낮은 랭크 인자,
는 외부 곱, r은 분해 랭크이다.
융합 벡터 h는 다음과 같이 계산됩니다:
(15)
두 가지 모달리티를 단독으로 사용할 경우, 감소된 융합은 다음과 같습니다:
(16)
이로 인해 잠재 수준에서 교차 모달 상호작용을 모델링하는 결합 다중 모달 표현 벡터 h가 생성됩니다.
낮은 랭크 융합 벡터 h를 획득한 후, 트랜스포머 모듈은 의존성을 모델링하고 양측 간 의미 표현을 정렬합니다. 교차 모달 주의는 한 모달리티가 다른 모달리티에 주의를 기울일 수 있도록 특별히 설계되었습니다:
(17)
여기서 Qm은 모달리티 m 쿼리, Kn, Vn은 모달리티 n의 키 벡터와 값 벡터, dk는 키 벡터의 차원입니다. 이 설정은 모달리티별 주의 흐름을 용이하게 하여 각 입력 범주를 서로 상대적으로 처리할 수 있게 합니다(예: 플레이어 움직임을 게임 상황과 비디오 표시기와 동기화하는 등).
교차 참여 벡터는 다층 퍼셉트론(MLP)을 통해 쌓이고 분류됩니다. 출력은 전술적 의사결정 라벨(예: 패스, 구동, 유지)이며, 종단 간 훈련에 최적화된 교차 엔트로피 손실입니다.

그림 5. 트랜스포머 기반 다중 모드 핵융합 아키텍처. 트랜스포머 인코더를 통해 시각적 및 센서 모달리스가 어떻게 통합되어 특징 표현을 향상시키는지 보여줍니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
그림 5에서 볼 수 있듯이, 다중 모드 융합 블록은 시각 입력과 위치 입력을 결합합니다. 전술적 결정은 공간 인식과 움직임 역학을 필요로 하며, 이는 단일 모달리티로 표현할 수 없기 때문에 필수적인 설계입니다.
그림 5 는 트랜스포머 기반 다중 모드 핵융합의 작업 구조를 보여줍니다. 이 설계는 다양한 데이터 비디오, 공간 좌표, 경기 상황 데이터를 하나의 채널에 결합하여 패스, 드라이브, 홀딩 같은 전술적 행동을 예측합니다. 이 접근법은 3D 합성곱신경망(3D CNN)을 사용해 검증하는 영상 입력부터 시작합니다. 이 시스템은 비디오 내 공간 및 시간 구조를 모두 식별하여 시간에 따른 동적 플레이어 활동과 소통을 포착할 수 있습니다. 한편, 맥락 및 위치 정보는 임베딩 레이어를 통해 전달되며, 구조화된 입력을 밀집된 벡터 표현으로 변환합니다. 컨텍스트, 포지셔널, 비디오 스트림은 Low-Rank Fusion 모듈을 통해 출력을 융합할 수 있습니다. 이 접근법은 융합 공간 분해를 통해 교차 모달 상관관계를 효과적으로 얻어 계산 복잡도를 최소화하면서 모달리티 간의 필수 관계를 유지합니다. 마지막으로, 융합된 다중 모달 표현은 교차 모달 주의를 가진 트랜스포머 인코더에 의해 처리됩니다. 이 절차는 모델이 모달리티와 시간 단계에 걸쳐 올바른 특징에 집중할 수 있게 하여 전략적 게임 행동에 대한 이해를 향상시킵니다. 마지막으로, 인코딩된 출력은 결합과 학습된 표현을 전술적 결정에 매핑하는 다중 계층 인식론(MLP) 블록을 통과합니다. 모델 출력은 '패스', '드라이브', '홀드'와 같은 선수 행동을 분류하여 팀 전술을 지능적이고 데이터 기반으로 분석할 수 있게 합니다.
팀 스포츠용 제안된 트랜스포머 기반 다중 모달 융합 전술 분석 시스템에서는 마지막 단계가 전술적 의사결정 분류 및 평가로, 학습된 다중 모달 표현을 의사결정 실행 가능한 라벨로 변환합니다. 비디오, 위치, 맥락 특징을 저랭크 융합으로 융합하고, 트랜스포머 인코더에서 교차 모달 주의를 사용해 미세 조정한 결과, 결과 특징 벡터는 다층 지각론(MLP) 분류기에 입력됩니다. 모든 결정 클래스는 소프트맥스 활성화 함수로 표현되어 모든 가능한 행동에 대한 확률 점수를 산출합니다. 가장 확률 높은 클래스가 모델의 예측 결정으로 선택됩니다. 이 모델은 교차 엔트로피 손실 함수로 학습되며, 이는 올바른 예측에 보상을 주고 네트워크가 전술적 상황에서 유사한 차이를 구분하는 법을 학습하게 합니다. 또한, 실시간 또는 거의 실시간 게임 상황에서의 반응성을 확인하기 위해 시간 영역 평가를 고려할 수 있으며, 이는 분류기가 정확하고 게임과 유사한 시간 제약 하에서 시간 낭비가 없도록 보장합니다. 표 2는 모델 아키텍처와 하이퍼파라미터를 보여줍니다.
| 구성 요소 | 사양 |
| 트랜스포머 인코더 레이어 | 6 |
| 주의 머리 | 8 |
| 숨겨진 차원 | 512 |
| 피드 포워드 레이어 크기 | 2048 |
| 삽입 차원 | 비디오: 1024 → 512, 오디오: 256 → 512, 포지셔널: 128 → 512 |
| 위치 부호화 | 학습 가능 |
| 융합 방법 | 저랭크 다중모달 융합 (랭크 r = 16) |
| 옵티마이저 | 아담 |
| 학습 속도 | 0.0001 |
| 배치 크기 | 16 |
| 훈련 시기 | 50–100 |
| 중도 중도 | 0.1 |
| 손실 함수 | 교차 엔트로피 |
표 2: 모델 아키텍처와 하이퍼파라미터. 제안된 트랜스포머 기반 다중 모달 융합 모델의 훈련 환경과 주요 구성 요소를 나열합니다.
명확성과 재현성을 위해, 멀티모달 트랜스포머는 6층 인코더 스택으로 구현되었으며, 각 스택은 8개의 어텐션 헤드와 512의 숨겨진 차원을 갖추고 있으며, 중간 규모 멀티모달 작업을 위한 전형적인 트랜스포머 설정을 따랐습니다. 각 모달리티는 임베딩 블록을 통과합니다: 3D-CNN 인코더 출력으로 1024-DIM을 통한 비디오; Wave2Vec 기반 인코더(256-DIM)로 오디오를 내고; 그리고 2층 MLP 인코더인 128-DIM을 통해 위치 및 맥락 기능을 제공합니다. 이 모든 임베딩은 학습 가능한 선형 변환을 통해 공유 512차원 잠재 공간에 투영되었습니다. 시간적 정렬을 확립하기 위해 모든 모달리티는 먼저 25Hz 단일 주파수에 보간되고, 그 후 학습된 위치 인코딩을 적용하여 시간 순서를 보존합니다. 교차 모달 정렬은 교차 주의 계층을 사용하여 수행되며, 이 층은 모달리티 간의 상관관계를 명시적으로 학습한 후 자기 주의 인코더 스택에 입력됩니다. 이러한 아키텍처 선택은 모델 용량과 계산 효율성을 균형 있게 유지하기 위해 이루어졌으며, 이를 통해 중간 규모의 데이터셋에서 안정적인 수렴을 보장했습니다.
실용적으로, 제안된 트랜스포머 기반 멀티모달 퓨전 프레임워크는 동기화된 멀티모달 데이터가 제공되는 상황, 예를 들어 구조화된 훈련 세션, 통제된 경기 시뮬레이션, 일관된 비디오 피드 및 위치 추적 시스템이 갖춰진 전문 환경과 같은 상황에 가장 적합합니다. 이 방법에 필요한 네 가지 주요 입력은 (i) 고해상도 비디오, (ii) 위치 추적 데이터(GPS/LPS), (iii) 오디오 스트림, (iv) 점유, 압력 구역, 경기 단계와 같은 맥락 메타데이터입니다. 신뢰할 수 있는 성능을 달성하기 위해 이러한 모달리티들은 최소 드리프트(비디오 ≥25fps, 위치 센서 ≥ 10Hz)를 최소화하는 시간 정렬되어야 하며, 안정적인 시점과 최소한의 신호 잡음을 유지해야 합니다. 이러한 동기화된 입력을 제공하지 못하는 설정들, 예를 들어 불규칙한 카메라 앵글이 있는 아마추어 경기, 지연/압축 아티팩트가 있는 라이브 방송 피드, 위치 추적 인프라가 없는 환경은 프레임워크에서 덜 중요해집니다. 게다가 현재 시스템은 반통제된 조건에서 가장 좋은 성능을 보이지만, 조명 조건, 가림, 동적 관중 소음 등이 데이터 수집 품질에 영향을 미치는 완전히 통제되지 않은 라이브 경기 상황에서는 상당히 덜 견고할 수 있습니다. 이 제약들은 이 시스템이 배포될 수 있는 실질적 경계를 제시하며, 제안된 모델을 적용할 때 다중 모드에서의 일관된 데이터 캡처가 필수적임을 강조합니다.
개조 및 문제 해결
실제 구현에서는 멀티모달 파이프라인 전반에 걸쳐 모델 안정성이나 전반적인 성능을 저하시킬 수 있는 여러 문제가 발생할 수 있습니다. 일반적인 문제 중 하나는 25fps로 녹화된 영상과 10Hz로 캡처된 위치 데이터가 동기화가 어긋나면서 신호가 불일치하여 주의 지도를 불안정하게 만들고 회상력을 감소시키는 시간적 불일치입니다. 이 문제는 타임스탬프 기반 재샘플링, 선형 보간, 그리고 과도한 드리프트가 있는 서열을 자동으로 제거함으로써 해결할 수 있습니다. 오디오 채널은 바람, 군중 소리, 마이크 클리핑으로 인한 노이즈도 발생할 수 있는데, 이로 인해 변압기가 오디오 토큰을 무시하고 정밀도가 약간 저하됩니다. 밴드패스 필터링, 스펙트럼 게이팅, 심하게 손상된 세그먼트를 벡터가 0으로 대체하는 것은 오디오 임베딩 안정성을 유지하는 데 도움이 됩니다. 플레이어 오클루즈나 모션 블러 같은 시각적 품질 문제는 3D-CNN의 시공간적 표현을 약화시키고 패스-드라이브 혼란을 증가시킬 수 있습니다. 이 문제를 완화하려면 심하게 가린 시퀀스를 제외하고, 무작위 크롭, 밝기 정규화, 모션 블러 시뮬레이션 등 보강 전략을 사용합니다. 임베딩 스케일이 모달리티에 따라 다르면 변압기 불안정성이 발생할 수 있으며, 이는 진동성 검증 손실이나 그라디언트 스파이크를 유발할 수 있습니다. 일관된 z-점수 정규화, 워밍업 학습률 일정 사용, 그라디언트 클리핑 적용, 그리고 드롭아웃 증가를 통해 안정적인 훈련을 회복할 수 있습니다. 낮은 랭크 퓨전은 융합 랭크가 잘못 설정될 때 문제가 될 수 있으며, 이는 왜곡된 교차 모달 관계와 클래스별 불균형을 초래할 수 있습니다. 작은 데이터셋에서는 중간 정도의 랭크를 유지하고, 큰 데이터셋에서는 랭크를 올리며, L2 정규화를 적용하면 균형 잡힌 핵융합이 유지됩니다. GPU 메모리 오버플로우나 느린 학습을 유발하는 큰 비디오 텐서 때문에 계산 병목 현상이 발생할 수 있습니다. 이러한 문제들은 혼합정밀도(FP16) 훈련, 초기 실험 중 입력 해상도 저하, 미리 계산된 3D-CNN 특징 캐싱 등을 통해 해결할 수 있습니다. 마지막으로, 특히 "드라이브"의 전술적 결정에서 자연스러운 클래스 불균형이 호출을 줄이고 AUC의 변동을 일으킬 수 있습니다; 클래스 균형 손실 적용, 소수 행동 과잉 샘플링, 맥락 메타데이터 풍부화는 균형과 의사결정 판단을 크게 향상시킬 수 있습니다. 이러한 통합된 문제 해결 지침은 연구자와 실무자가 안정적인 훈련 조건을 유지하고, 재현성을 높이며, 다양한 데이터셋과 환경에 걸쳐 프레임워크를 효과적으로 적응할 수 있도록 보장합니다.
Access restricted. Please log in or start a trial to view this content.
이 설계는 다양한 데이터, 비디오, 공간 좌표, 경기 상황 데이터를 하나의 채널로 결합하여 패스, 드라이브, 홀딩 같은 전술적 행동을 예측합니다. 이 접근법은 3차원 합성곱신경망(3D CNN)을 사용해 검증하는 영상 입력으로 시작됩니다. 컨텍스트, 포지셔널, 비디오 스트림은 Low-Rank Fusion 모듈을 통해 출력을 융합할 수 있습니다. 이 접근법은 융합 공간 분해를 통해 교차 모달 상관관계를 효과적으로 얻어 계산 복잡도를 최소화하면서 모달리티 간의 필수 관계를 유지합니다. 마지막으로, 융합된 다중 모달 표현은 교차 모달 주의를 가진 트랜스포머 인코더에 의해 처리됩니다. 표 3은 제안된 방법의 시뮬레이션 환경을 나타냅니다.
| 시뮬레이션 환경 | 사양 |
Access restricted. Please log in or start a trial to view this content.
여기서 제시된 트랜스포머 기반 멀티모달 퓨전 프레임워크는 기본 논문에서 제시한 스트룹 태스크 풋볼 테스트(STFT)보다 중요한 발전을 나타냅니다. 기본 논문이 색깔 화살표와 미리 정의된 과제(운전 또는 추월) 같은 제한적이고 정적인 자극을 사용하는 통제되고 실험실 중심의 테스트에 집중한 것과 달리, 새로운 모델은 실제 게임 멀티모달 소스 데이터를 기반으로 보다 풍부하고 자동화된 전술 분석 파이프라인을 지원합니다. 하지만 실제 경기 멀티모달 시퀀스의 통합에도 불구하고, 제어된 패스/드라이브 과제는 완전한 생태 현실성을 위해 이상적으로 요구되는 비율보다 높아 게임의 전술적 다양성을 완전히 표현하는 데 부분적으로 제약을 줍니다. 특히, 기본 연구에서는 수동 비디오 주석, 소규모 테스트 환경, 주관적 인간 전문가 평가를 활용하여 의사결정 정확도(DMA)와 실행 시간(ET)을 산출했습니다. 기초 검사에는 잘 작동하지만, 확장성, 생태학적 타당성, 인위적 자극 의존성이 제한적입니...
Access restricted. Please log in or start a trial to view this content.
저자들은 이해 상충을 선언할 필요가 없습니다.
저자들은 이 연구 과정에서 자원과 기관적 지원을 제공해 준 베이부만 대학교 체육학부와 남서부 금융경제대학교 통계학부의 지원에 깊이 감사드립니다. 이 연구는 2023년 국가사회과학기금 프로젝트: 좌강-유강 구혁명거지지역에서 붉은 스포츠 문화자원의 효과적 활용에 관한 연구(보조금 번호 23CTY016)의 지원도 받았습니다.
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| 3D CNN | 맞춤형 구현 | 비디오에서의 시공간적 특징 추출 | |
| 고프로 히어로4 | 고프로 주식회사 | https://gopro.com/ | 경기 영상 녹화 |
| GPS/IMU 센서 | 캐터펄트 스포츠 / 엑센스 | https://www.catapultsports.com/ | 선수 위치 추적 |
| 인텔 코어 i7-11700K CPU | 인텔 | https://www.intel.com | 모델 학습 워크스테이션 CPU |
| 리브로사 | librosa.org | https://pypi.org/project/librosa/ | 오디오 신호 처리 및 리샘플링 |
| MLP 분류기 | 파이토치 / 텐서플로우 | 전술적 의사결정 분류 | |
| 넘버피 | 파이썬 소프트웨어 재단 | https://pypi.org/project/numpy/ | 수치 계산과 행렬 연산 |
| NVIDIA RTX 3080 GPU | 엔비디아 | https://www.nvidia.com | 딥러닝 훈련과 추론 |
| 오픈CV | OpenCV.org | https://pypi.org/project/opencv-python/ | 비디오에서의 프레임 추출 |
| 판다 | 파이썬 소프트웨어 재단 | https://pypi.org/project/pandas/ | 데이터 조작 및 표 처리 |
| PCA (Scikit-learn) | Scikit-learn | https://scikit-learn.org/ | 차원 축소 |
| 파이썬 3.9 | 파이썬 소프트웨어 재단 | https://www.python.org/downloads/release/python-390/ | 프로그래밍 언어 환경 |
| 파이토치 | 파이토치 재단 | https://pytorch.org/ | 딥러닝 프레임워크 |
| 시킷-학습 | Scikit-Learn 개발자 | https://pypi.org/project/scikit-learn/ | 교차 검증, ICC 계산 |
| 텐서플로우 2.8 | 구글 | https://www.tensorflow.org/ | 딥러닝 프레임워크 |
| 트랜스포머 인코더 | 파이토치 / 텐서플로우 | 주의를 이용한 다중 모달 특징 통합 | |
| Ubuntu 20.04 LTS | 캐노니컬 주식회사 | https://ubuntu.com/ | 모델 학습용 운영 체제 |
| 워크스테이션 | 커스텀 / 인텔, NVIDIA | 모델 학습을 위한 CPU, GPU, RAM |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission