Research Article

Uma Estrutura Multimodal Baseada em Transformadores para Análise de Decisão Tática em Esportes Coletivos com Aplicação ao Futebol

DOI:

10.3791/69806

January 27th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para melhorar a categorização de decisões táticas no futebol, este estudo sugere um modelo de fusão multimodal baseado em Transformers que incorpora dados visuais, de localização, acústicos e contextuais. O modelo alcança desempenho quase em tempo real em um conjunto de dados multimodal de 500 sequências, superando as linhas de base CNN-LSTM, BiLSTM-Attention e GNN em termos de precisão e classificação incorreta induzida pela pressão.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A tomada de decisões táticas rápidas e precisas é necessária no futebol moderno. No entanto, abordagens tradicionais para avaliação de decisões táticas têm baixa validade ecológica e não se escalam facilmente. Para enfrentar esses desafios, este artigo apresenta um modelo de Fusão Multimodal Baseada em Transformers que incorpora posicionamento do jogador, vídeo, áudio e metadados contextuais para classificar decisões táticas em tempo real. Experimentos foram realizados com 40 jogadores masculinos e um conjunto de dados que compreende 500 sequências de jogadas multimodais. O conjunto de dados de 40 jogadores refere-se a experimentos de tomada de decisão em laboratório controlado, usados para validação inicial e avaliação de confiabilidade. Em seguida, 500 sequências multimodais foram extraídas de simulações estendidas de partidas e gravações de jogos reais para fornecer o conjunto de dados maior usado no treinamento e teste do modelo multimodal transformer.

Ele processa entradas em cinco estágios: aquisição de dados, pré-processamento, extração de características, fusão baseada em transformador e classificação de decisão. Comparado às linhas de base do CNN-LSTM, BiLSTM-Atenção e GNN, a abordagem proposta melhora a precisão da previsão de decisão em 28% e reduz a classificação errada causada pela pressão em 41%, com baixa latência de inferência de 52,6 ms, tornando-a adequada para aplicações quase em tempo real. A generalização dos achados em contextos táticos mais diversos e para demografia mais ampla de atletas também é limitada pelo tamanho relativamente pequeno e pela homogeneidade dentro da amostra de jovens jogadores masculinos de uma única região. Esses resultados enfatizam a contribuição da fusão multimodal baseada em transformadores para a análise automatizada de decisão tática e apontam a necessidade de sua validação adicional em situações de partida mais diversas e em larga escala.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esportes coletivos, como o futebol americano, exigem decisões táticas rápidas em ambientes dinâmicos e incertos. Os jogadores devem ler constantemente informações visuais da bola, dos companheiros e dos adversários, e responder em frações de segundo para garantir uma vantagem competitiva. A tomada de decisões táticas no futebol depende fortemente da percepção rápida dos movimentos dos jogadores, trajetória da bola e sinais situacionais. Embora habilidades perceptuais-cognitivas gerais, como tempo de reação e atenção seletiva, de fato influenciem o desempenho, pesquisas recentes enfatizaram modelos orientados por dados e conscientes do contexto, que podem aproximar a cognição tática real do jogo 1,2,3,4,5. O tempo de reação e as capacidades perceptivas, como as capacidades cognitivas, também desempenham um papel crucial nodesempenho 6,7,8. Pesquisas recentes em cognição esportiva estabeleceram que a tomada de decisão tática depende não apenas das habilidades perceptivas, mas também da capacidade do atleta de integrar informações espaciais dinâmicas, pressão do adversário e pistas contextuais do jogo em tempo real. Pesquisas sobre expertise perceptivo-cognitiva sugerem que jogadores taticamente mais alfabetizados reconhecem sinais mais rapidamente, captam informações de maneira mais eficiente e apresentam padrões de tomada de decisão mais estáveis sob pressão. Tais descobertas reforçam a necessidade de modelos computacionais capazes de capturar a natureza complexa e multilayer dos processos de tomada de decisão esportiva.

Métodos clássicos para avaliar a tomada de decisão tática frequentemente empregam tarefas laboratoriais controladas e julgamentos subjetivos de especialistas, que impõem restrições significativas à validade ecológica e à escalabilidade. Avanços recentes em deep learning oferecem potencial para automatizar o processo por meio do uso de fontes multimodais de dados — como vídeo, rastreamento posicional e metadados de correspondência contextual — dentro de arquiteturas temporais e de captura de dependências intermodais. Apesar desse avanço, a maioria dos modelos atuais ainda é baseada em modelos de Redes Neurais Convolucionais - Longo-Curto Prazo ou Memória Bidirecional Longo-Curto Prazo (CNN-LSTM ou BiLSTM), que têm capacidade limitada para modelar dependências de longo alcance entre modalidades. Essa limitação é a força motriz por trás do desenvolvimento de modelos multimodais de fusão baseados em transformadores, que são melhor preparados para modelar a tomada de decisão tática de forma mais abrangente e estável em cenários de futebol. No esporte de equipe adversária do futebol, por exemplo, os jogadores devem avaliar rapidamente as informações sobre a bola, incluindo seus companheiros, adversários e posição em campo. Antes de decidir o melhor curso de ação baseado em suas habilidades, nas diretrizes do treinador e nas circunstâncias do jogo 9,10. Devido à acessibilidade de conjuntos de dados organizados e componentes táticos definidos, este estudo foca exclusivamente no futebol; No entanto, princípios táticos para tomar decisões são aplicáveis a diversos esportes coletivos.

De fato, estudos anteriores indicam que CNN-LSTM e BiLSTM não podem capturar dependências temporais de muito longo alcance usando um campo receptivo fixo ou sendo restringidas por gateamentosequencial 11,12,13. De forma semelhante, trabalhos fundamentais de referência em reconhecimento de ações e modelagem temporal multimodal revelam que o desempenho do modelo baseado em LSTM diminui com o aumento do comprimento da sequência ou quando pistas contextuais ocorrem a vários quadros de distância, o que pode limitar a validade ecológica em ambientes esportivos dinâmicos. Além disso, modelos baseados em Redes Neurais de Grafos (GNN) são ferramentas poderosas para modelagem de interação espacial, mas têm consistentemente apresentado desempenho inferior em cenários que exigem raciocínio temporal detalhado ou em casos em que sinais de pressão contextual mudam rapidamente ao longo dotempo 14,15. Em contraste com essas abordagens, frameworks mais recentes baseados em transformers demonstram sua superioridade de desempenho em análise esportiva, reconhecimento de atividades humanas e tarefas de linguagem de vídeo por meio da integração conjunta de pistas temporais de longo alcance, relações espaciais e sinais contextuais em uma única passagem para frente, possibilitada pela autoatenção global. Esses resultados justificam a escolha de uma arquitetura baseada em transformadores como espinha dorsal para o modelo proposto no estudo atual.

Aprimorar o conhecimento tático e compreender os princípios táticos demonstrou ser crucial para resolver limitações e questões do jogo 16,17. Os jogadores de futebol americano aprendem uma variedade de elementos do jogo, incluindo penetração, proteção ofensiva, movimento, tempo, limitação, proteção defensiva, equilíbrio e foco, por meio de treinamentotécnico-tático 18. À medida que os jogadores ganham mais experiência no futebol, sua compreensão dos fundamentos técnicos e táticos deve aumentar. Assim, os jogadores podem ser capazes de discernir sinais pertinentes com mais facilidade, facilitando a tomada de decisão adequada para cada regra de jogo em um cenário específico19. Por causa disso, os jogadores podem utilizar sua eficiência motora e habilidades de tomada de decisão para complementar padrões de movimento com talentos especializados.

O autor utilizou a tomada de decisão por múltiplos atributos para analisar os benefícios do exercício e dos hábitos para a condicionamento físico, ilustrando a eficácia da capacidade de treinamento qualificada na educação física entre estudantes universitários. Atividade física eficaz, desenvolvimento de hábitos saudáveis de condicionamento físico e defesa de reformas na forma como os esportes são retratados nas instituições educacionais recebem considerável peso. A Média Herônica Intuitiva Ponderada em Fozzy (IFWHM) com assistência em números difuses é usada para tomada de decisão eficaz. O resultado apoiou o sucesso cognitivo dos estudantes universitários e demonstrou uma avaliação mais precisa de seus problemas de bem-estar físico. Para detectar os links latentes nos dados, o pesquisador20 utilizou o método Apriori aumentado. As conclusões da pesquisa são pertinentes para avaliações da saúde física dos estudantes no ensino superior. O primeiro resultado é determinado avaliando a fadiga de diferentes orientações de acordo com sua frequência de ocorrência.

Pesquisas anteriores baseadas em IA em análise esportiva focaram em tarefas de visão computacional, incluindo detecção de jogadores, rastreamento e reconhecimento de atividades em grupo. Arquiteturas recentes, pouco supervisionadas e sem detectores, revelaram a importância da modelagem multimodal e consciente do contexto na compreensão de comportamentos táticos. Esses avanços exigem a integração do deep learning multimodal para classificar decisões táticas no futebol. Utilizando vetores de características latentes produzidos a partir da matriz utilitária por meio da fatoração matricial, calcula-se a semelhança cosseno entre usuários e usuários ou entre itens e itens mencionados neste artigo.

Pesquisas recentes em análise esportiva se deslocaram para frameworks de deep learning multimodais e conscientes do contexto que combinam vídeo, dados posicionais e pistas contextuais para interpretar comportamentos táticos. Diversas abordagens baseadas em transformadores demonstraram forte capacidade em modelar estrutura temporal de longo alcance e relações intermodais em ambientes esportivos, incluindo: MM-ViT para reconhecimento multimodal de ações, transformadores de fusão contrastiva unificados para raciocínio em contexto esportivo e detectores de eventos guiados por atençãocruzada 21,22. Essas abordagens indicam que decisões táticas são melhor representadas usando arquiteturas que capturam as interações entre jogadores, espaço, pistas de movimento e informações contextuais, em vez de modelos CNN-LSTM monomodales. Diante dessa direção, o estudo proposto também utilizará uma estrutura de fusão multimodal baseada em transformadores para processar conjuntamente sinais visuais, posicionais e contextuais para modelagem quase em tempo real de decisões táticas de futebol.

Modelos anteriores para análise de futebol eram tipicamente construídos em torno da arquitetura CNN-LSTM ou BiLSTM, que capturam padrões temporais locais, mas enfrentam dificuldades com dependências de longo alcance entre modalidades. Transformers preenchem essa lacuna aplicando autoatenção global, permitindo que um modelo relacione movimentos dos jogadores, trajetórias de bolas e pistas situacionais através de capacidades de janela de tempo estendidas para uma análise robusta de decisões táticas. Para resolver o problema da escassez nos dados de avaliação para sistemas de recomendação, o autorsugeriu uma técnica de Fatoração Matricial Baseada em Revisão que combina filtragem colaborativa baseada em revisões e imputação de avaliação.

No entanto, sua eficácia, escalabilidade e aplicabilidade desses métodos são severamente limitadas pela dependência de caixas delimitadoras para inferência e pela enorme necessidade de rotulagem de dados. Um método para resolver esse problema é usar etiquetas de caixa delimitadora para treinar simultaneamente a detecção de jogadores e o reconhecimento de atividades emgrupo 25,26,27,28. Embora ainda sejam necessárias anotações de caixas delimitadoras em nível de ator para dados de treinamento, o método proposto calcula as caixas delimitadoras dos jogadores durante a inferência. A abordagem de Reconhecimento de Atividades em Grupo Fracamente Supervisionado (WSGAR), que não exige rótulos de nível de ator para treinamento ou inferência, visa aliviar o peso da anotação. Após gerar sugestões de caixas delimitadoras usando um detector pré-treinado em um conjunto de dados externo, aprenderam a filtrar detecções irrelevantes. Recentemente, em 29, os pesquisadores apresentaram uma abordagem sem detectores para o desafio WSGAR que utiliza embeddings de tokens para gerar contextos parciais que coletam informações dos jogadores.

Dentro da análise esportiva, arquiteturas multimodais e baseadas em transformadores ganharam recentemente importância porque conseguem capturar padrões temporais de longo alcance e integrar fluxos de dadosheterogêneos 30,31. Variantes dos transformadores foram aplicadas para prever os movimentos dos jogadores, realizar análises táticas multi-view e reconhecer a intenção de ação, demonstrando um raciocínio temporal excepcional em comparação com o modelo CNN-LSTM. Estratégias de fusão multimodais, que combinam vídeo, posição e pistas contextuais, entregaram resultados iniciais e animadores em modelagem tática em tempo real e destacaram a importância da atenção cruzada e do aprendizado de sequência a sequência na compreensão da dinâmica de decisão durante o jogo.

Frameworks multimodais baseados em transformadores demonstraram recentemente desempenho excepcional em vários setores onde a integração de fluxos de dados diversos é necessária. Por exemplo, modelos multimodais de fusão baseados em ViT têm sido usados para interpretar conjuntamente informações de vídeo, pose e áudio, empregando processos de atenção cruzada para previsão de eventos conscientes do contexto, rastreamento do jogador e reconhecimentode ações 32,33. Além disso, a arquitetura baseada em MM-Former e Perceiver superou modelos recorrentes e convolucionais na fusão de pistas espaço-temporais, bem como em raciocínio temporal de longo alcance, em análises esportivas e análise de atividadehumana 34. Esses resultados apoiam o uso de uma arquitetura de Fusão Multimodal Baseada em Transformadores neste estudo, indicando que transformadores são capazes de capturar interações detalhadas entre modalidades por meio da atençãoglobal 35. Transformers são particularmente adequados para análise tática, pois sua atenção global permite que o modelo relacione pistas visuais, dados posicionais e sinais contextuais em janelas temporais mais longas, capacidades que os modelos CNN-LSTM e BiLSTM não possuem.

Estudos anteriores utilizaram principalmente avaliações manualmente formadas e autenticadas para avaliar a velocidade de desempenho e a precisão das decisões em atividades pré-organizadas, como dirigir e ultrapassar, apesar do crescente interesse em avaliar a tomada de decisão tática em esportescoletivos 36,37,38. Esses frameworks têm limites em termos de escalabilidade, objetividade e adequação para circunstâncias dinâmicas do mundo real, apesar de fornecerem dados perspicazes sobre o comportamento dos jogadores e a excelência na tomadade decisões 39. Abordagens computadorizadas e orientadas por dados, capazes de registrar e compreender a natureza multimodal da tomada de decisão tática, que envolve associações complexas entre ações dos jogadores, sinais visuais, sinais sonoros e configurações de jogo, não são combinadas nos métodosatuais 40,41,42. Além disso, estruturas de IA multifacetadas que podem alternar entre relações de fundo e temporais frequentemente são negligenciadas por esses métodos. O crescimento de um framework de fusão multimodal baseado em Transformer, que utiliza fontes ricas de dados em tempo real, como imagens de vídeo e rastreamento posicional, e incorpora processos de tomada de decisão em esportes coletivos, está claramente ausente. Fechar essa lacuna pode aumentar significativamente a penetração tática, escalabilidade e independência na tomada de decisão em ambientes esportivos de alto desempenho. Em contraste com as metodologias atuais CNN-LSTM e BiLSTM, essa fusão baseada em transformadores modela conscientemente a atenção cruzada entre informações visuais, espaciais e contextuais. Essa novidade promove uma representação tática mais densa e ajuda a minimizar a classificação errada durante cenários de pressão em mais de 40%.

O objetivo principal deste estudo é desenvolver uma estrutura de Fusão Multimodal Baseada em Transformadores para avaliar a tomada de decisão tática no futebol. Embora a estrutura proposta possa ser generalizada para outros esportes coletivos, este estudo foca no futebol devido à sua complexidade tática e à disponibilidade de conjuntos de dados estruturados. O sistema permite uma avaliação estruturada da precisão tática e do tempo de resposta em tarefas controladas e isoladas do futebol, com base em avaliações de especialistas. Este trabalho aborda as limitações de ambientes de avaliação manual e testes estáticos ao integrar fontes de dados multimodais, incluindo rastreamento posicional, imagens de vídeo, sinais de áudio e informações contextuais do jogo.

Empregando processos de atenção baseados em transformadores, a estrutura proposta aprende continuamente links multimodais, permitindo uma interpretação unificada e consciente do contexto dos métodos de tomada de decisão em tempo real dos jogadores.

O principal objetivo dessa determinação é promover uma avaliação inteligente de desempenho no esporte, fornecendo a treinadores e analistas uma compreensão mais profunda do pensamento dos jogadores e da dinâmica das equipes por meio de insights baseados em dados.

A estrutura proposta aprenderá continuamente as relações intermodais ao aproveitar os mecanismos de atenção dos transformers, permitindo obter uma compreensão unificada das estratégias de tomada de decisão dos jogadores em jogos em tempo real.

Assim, ele equipa o sistema com a capacidade de fornecer insights acionáveis sobre comportamentos táticos que, de outra forma, seriam difíceis de caracterizar com métodos padrão de avaliação.

O objetivo é melhorar a interpretabilidade e fornecer aos coaches e analistas informações mais úteis.

A principal contribuição deste trabalho está apresentada abaixo:

Este estudo emprega um design de fusão multimodal baseado em Transformers para apresentar um modelo inovador de deep learning para análise de decisão tática em esportes coletivos.

Ao integrar fluxos visuais, posicionais e contextuais de dados extraídos de imagens reais, essa abordagem amplia significativamente o escopo dos métodos simples de avaliação introduzidos no estudo base, que focou em passes solo e ações de condução.

O codificador multimodal coleta relações espaço-temporais sofisticadas integrando dados de rastreamento do jogador, quadros visuais e eventos contextuais de partidas usando mecanismos de atenção.

Experimentos em um conjunto de dados de referência de futebol revelaram que esse modelo superou linhas de base tradicionais, como métodos de fusão baseados em CNN e LSTM.

Comparado ao CNN-LSTM, BiLSTM-Attention e linhas de base GNN, a arquitetura de fusão multimodal baseada em transformadores sugerida mostra ganhos significativos.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O estudo incluiu 40 jogadores de futebol americano do sexo masculino entre 18 e 24 anos (média = 20,1 ± 1,2), recrutados de quatro clubes amadores e semiprofissionais dentro de uma mesma liga regional. Todos os participantes tinham pelo menos três anos de experiência competitiva e estavam atualmente treinando em um ambiente estruturado. A coleta de dados foi realizada em dois ambientes controlados: primeiro, em exercícios padronizados em campo de treinamento que simulavam cenários táticos de decisão de passe/condução; segundo, em sessões prolongadas de simulação de correspondências das quais sequências multimodais foram extraídas. Todos os procedimentos foram aprovados pelo Comitê de Ética Institucional da Beibu Gulf University (Aprovação nº: BG-PE-2023-117), e consentimento informado por escrito foi obtido de todos os participantes antes da coleta dos dados. Padrões éticos internacionais e institucionais foram seguidos na condução dessa investigação. O Comitê de Ética Institucional da Universidade do Golfo de Beibu examinou e autorizou todos os procedimentos envolvendo sujeitos humanos (Aprovação nº: BG-PE-2023-117). Antes da coleta dos dados, cada participante fornecia consentimento informado por escrito, e todos os dados coletados eram anonimizados antes da análise.

Este trabalho busca automatizar e aprimorar a investigação da tomada de decisão tática em esportes coletivos por meio de uma arquitetura de Fusão Multimodal baseada em Transformers. Ele utiliza uma variedade de fontes de dados, incluindo vídeo, áudio, localização espacial e metadados do jogador para criar um modelo preditivo robusto em tempo real. A Figura 1 mostra a arquitetura do método proposto. A obra proposta consiste em cinco etapas. As etapas são descritas abaixo:

Figura 1
Figura 1. Arquitetura do método proposto. Esquema do modelo que combina entradas multimodais e componentes de classificação para tomada de decisão tática. Por favor, clique aqui para ver uma versão ampliada desta figura.

Aquisição e pré-processamento de dados

Dados de várias modalidades são coletados a partir de gravações das partidas, como transmissões de vídeo, comentários de áudio, informações de GPS/posicionamento e indicadores de desempenho dos jogadores. Cada modalidade passa por pré-processamento na forma de técnicas como extração de quadros (para vídeo), filtragem de ruído (para áudio) e normalização (para leituras de sensores), garantindo sincronização em etapas de tempo.

Os quadros de vídeo eram extraídos a 25 fps, reduzidos para 224 × resolução 224. Os sinais de áudio eram processados com um filtro passa-banda, variando de 300 a 3.400 Hz, para eliminar a maior parte do ruído ambiental. Os dados de rastreamento posicional dos sensores GPS foram registrados a 10 Hz e interpolados usando interpolação linear baseada em carimbo de tempo, garantindo que estejam alinhados com a linha do tempo do vídeo de 25 Hz. Todas as entradas eram alinhadas temporalmente usando carimbos de tempo compartilhados, e suas escalas eram normalizadas com pontuação z.

Extração de características

Para coletar informações espaço-temporais dos dados de vídeo, são usadas CNNs 3D. As CNNs 3D lidam com informações espaciais e temporais entre quadros de vídeo, tornando o modelo capaz de detectar padrões de movimento, entender o comportamento dos grupos e extrair características baseadas em movimento. Essa operação gera uma representação densa de características por sequência de ação, que é usada como entrada visual para o modelo. Cada clipe de entrada de vídeo continha 16 quadros consecutivos amostrados em uma passada de 2. Cortes aleatórios, viradas horizontais e normalização de brilho foram aplicados durante o treinamento. A CNN 3D foi otimizada usando Adam (lr = 0,0001), tamanho de lote 16 e perda de entropia cruzada.

Incorporação e alinhamento de entradas multimodais

Depois disso, incorporações de diferentes modalidades são integradas às saídas da CNN 3D. Uma arquitetura de modelo multimodal de transformador é empregada, com vários ramos de codificadores lidando com cada modalidade. Camadas de atenção cruzada são empregadas para fusão e alinhamento de modalidades, permitindo que o modelo capture interdependências (por exemplo, entre a localização dos jogadores e o movimento da bola, e o contexto dos comentários). Essa fusão permite uma compreensão contextual enriquecida das escolhas táticas atuais. Também implementei todas as incorporações no PyTorch. Os recursos de vídeo foram projetados linearmente de 1.024 para 512 dimensões, e os recursos de áudio e posicionamento foram projetados para 256 e 128 dimensões, respectivamente, unificados para 512 dimensões antes do alinhamento temporal.

Fusão multimodal baseada em transformador

Um Transformador Multimodal é empregado para combinar as características extraídas de todas as fontes. Mecanismos de autoatenção no transformador permitem que o modelo aprenda interdependências entre modalidades (por exemplo, visual + áudio), capture o fluxo temporal e o contexto, e destaque quadros e eventos taticamente importantes. O resultado dessa etapa é uma representação combinada que captura a intenção tática e o contexto situacional de cada decisão tomada. O transformador multimodal consistia em seis camadas codificadoras, cada uma com oito cabeças de atenção. Matrizes de atenção foram calculadas usando atenção escalar escalar de atenção. Camadas de atenção e de avanço também incluíam dropout com p = 0,1 para evitar sobreajuste.

Classificação e avaliação de decisões táticas

Por fim, a representação fundida é alimentada como entrada para uma camada de classificação ou bloco de análise de decisão, que é usado para prever o tipo de decisão tática, avaliar a qualidade da decisão e, opcionalmente, gerar insights explicáveis para os treinadores por meio de heatmaps de atenção ou mapas de ativação. A produção dessa etapa fornece uma avaliação quantitativa e qualitativa das habilidades de decisão de um time ou jogador durante o jogo de partidas.

A cabeça de classificação utilizava uma MLP de três camadas com ativação ReLU, seguida por uma camada softmax. O modelo foi treinado em uma divisão 70/15/15 com validação cruzada de 10 vezes. As métricas usadas foram precisão, exatião, recall, F1-score, latência e AUC.

Um fluxograma simplificado, resumindo as cinco etapas, fornece uma visão visual imediata do processo sequencial, como mostrado na Figura 2. Esta figura representa de forma concisa toda a linha de pesquisa, incluindo aquisição de dados, pré-processamento, extração de características, fusão multimodal e classificação tática de decisões, seguida por descrições detalhadas de cada estágio.

Figura 2
Figura 2. Fluxo de trabalho geral do processo de pesquisa. Visão geral do pipeline de pesquisa, desde a coleta e pré-processamento de dados até extração de características, treinamento de modelos e avaliação. Por favor, clique aqui para ver uma versão ampliada desta figura.

A Figura 3 mostra o fluxo geral do processo de pesquisa sugerido. O processo é iniciado pela Etapa 1: Aquisição e Pré-processamento de Dados, onde fontes de dados multimodais, como vídeo, áudio, rastreamento posicional e metadados contextuais, são coletadas e sincronizadas. Durante a Etapa 2: Extração de Características, Redes Neurais Convolucionais 3D (CNNs 3D) são utilizadas para extrair informações espaço-temporais de fluxos de vídeo, resultando em representações visuais densas das ações dos jogadores e do fluxo tático. Estágio 3: Incorporação e Alinhamento de Entradas Multimodais combina áudio, vídeo e características posicionais em um espaço latente compartilhado, com alinhamento temporal e cruz modal. Essas representações são posteriormente agregadas na Fase 4: Fusão Multimodal baseada em transformadores, onde mecanismos cruzados e de autoatenção permitem que o modelo aprenda interdependências entre modalidades e derive insights contextuais mais profundos sobre decisões táticas. Por fim, na Fase 5: Classificação e Avaliação de Decisão Tática, as representações combinadas são inseridas em uma camada de classificação para detectar decisões táticas, como passe, drive ou hold. Enquanto isso, métricas de desempenho são empregadas para estimar a precisão da tomada de decisão e o tempo de resposta. Este fluxograma oferece uma visão clara da abordagem passo a passo, complementada pelas elaboradas descrições textuais descritas nas seções seguintes.

Figura 3
Figura 3. Pipeline de processamento sequencial. Descreve o fluxo passo a passo da aquisição de dados até a classificação tática de decisões e a saída do modelo. Por favor, clique aqui para ver uma versão ampliada desta figura.

Aquisição e pré-processamento de dados

Para possibilitar análises táticas de decisão de alto nível em esportes coletivos via um pipeline de fusão multimodal usando Transformer, foi formado um sistema estruturado e de alta fidelidade para aquisição e pré-processamento de dados. A configuração envolve a fusão de múltiplas modalidades de dados, incluindo gravações de vídeo, rastreamento posicional dos jogadores, sinais de áudio das interações entre jogador e treinador e metadados contextuais como fase da partida, estrutura do time e áreas de posse.

A amostra do estudo consistiu em 40 homens com 20 anos ou mais, todos ativamente envolvidos em ligas regionais de futebol amador e semiprofissional. Cada um deles foi recrutado de quatro clubes competitivos que possuíam um programa estruturado de treinamento. A idade média dos atletas era de 20,1 ± 1,2 anos, com altura média de 177,5 ± 3,1 cm e peso médio de 72,6 ± 2,9 kg. Eles jogavam por seus respectivos clubes há uma média de 6,8 ± 1,5 anos. Todos os participantes também tinham no mínimo três anos de experiência competitiva e foram considerados taticamente competentes.

Para garantir o poder estatístico, o tamanho da amostra foi aproximado usando um nível de confiabilidade de 95% (Z = 1,96) e um nível de significância de 5%, com um Coeficiente de Correlação Intraclasse (ICC) esperado de 0,96 e um intervalo de confiança de 95% para refletir concordância quase perfeita. Isso é consistente com o objetivo de validar a confiabilidade e consistência dos dados de tomada de decisão multimodaiscoletados 27.

Para garantir reprodutibilidade, configurações de aquisição e especificações técnicas foram padronizadas ao longo das sessões. Os dados de vídeo eram gravados em resolução de 1.080p e 25 quadros por segundo usando câmeras GoPro Hero4 com amplo campo de visão para capturar todo o espaço tático. Cada gravação foi estabilizada e montada a uma altura fixa de 2,5 m. Os sinais de áudio eram capturados usando um microfone de campo externo em uma taxa de amostragem de 44,1 kHz (mono) e posteriormente filtrados usando um filtro passa-banda de 300-3.400 Hz para remover ruído ambiental. Os dados de rastreamento posicional foram coletados usando sensores GPS vestíveis operando a 10 Hz, com uma precisão posicional média relatada pelo fabricante de ±0,5 m. Todas as modalidades foram sincronizadas usando carimbos de tempo compartilhados e reamostradas para uma linha do tempo comum de 25 Hz por interpolação linear.

O pré-processamento então incluiu o seguinte: reamostragem de vídeo para resolução 224 × 224, amostragem de quadros de 16 quadros consecutivos com um passo de 2, corte aleatório, inversão horizontal, normalização de brilho, normalização de áudio e filtragem de ruído, e normalização de escores z para variáveis posicionais e contextuais.

O script de pré-processamento é organizado na seguinte ordem para reprodutibilidade: (i) extração de quadros; (ii) filtragem de áudio; (iii) interpolação por GPS; (iv) reamostragem de modalidade para 25 Hz; (v) normalização do escore z; e (vi) testes de integridade para corrupção, oclusão e abandono. Scripts de processamento em lote são usados para completar automaticamente cada estágio.

Para manter os dados confiáveis, os critérios de controle de qualidade e exclusão incluíam: i) sequências com >20% de oclusão do jogador, ii) queda de GPS superior a 200 ms, iii) áudio corrompido ou cortado, e iv) desfoque de movimento severo ou dessincronização entre modalidades. Um total de 17 sequências (3,4%) foram excluídas para essas condições. A Tabela 1 mostra a descrição do conjunto de dados.

AtributosDetalhes
EsporteFutebol (Soccer)
Participantes40 jogadores de futebol americano masculinos
Nível de JogoJogadores de futebol federado com ≥5 anos de experiência
Tipo de TesteTeste de tomada de decisão e execução de passes e penetrações (controle da bola)
Configuração de TesteConfiguração padronizada dos campos de futebol, zonas marcadas, posições fixas
Ferramentas de MediçãoCâmeras GoPro Hero4, software Kinovea, cronômetro
Dados ColetadosTempo de Execução (TE), Precisão da Tomada de Decisão (DM), Número de Ações Corretas
Procedimento de TesteOs jogadores responderam a estímulos visuais dos treinadores e executaram passes ou penetrações
Repetições de Julgamento10 testes por jogador (5 passes, 5 drives)
AvaliaçãoEspecialistas classificados como DM; ET medido usando carimbos de tempo/vídeo
Variáveis de resultadoTempo de reação, contagem correta de decisões, pontuação técnica de execução

Tabela 1: Descrição do conjunto de dados. Detalha a demografia dos participantes, procedimentos de testagem, ferramentas de medição e variáveis de resultado.

No presente estudo, foram usados dois conjuntos de dados relacionados, porém distintos. O primeiro conjunto de dados compreendia 40 jogadores que participaram de tarefas controladas de tomada de decisão de passe/penetração, usadas principalmente para estabelecer a confiabilidade de referência e validar o procedimento básico de medição de decisão. O segundo conjunto de dados inclui 500 sequências táticas multimodais coletadas a partir de simulações estendidas de partidas e gravações de jogos reais. Essas sequências constituíram o principal conjunto de dados de treinamento e testes para o modelo de fusão baseado em transformadores, permitindo a avaliação sob condições ecologicamente mais válidas.

Embora o conjunto de dados compreenda 500 sequências multimodais, a amostragem estratificada garantiu uma representação equilibrada entre ações táticas (Passar, Conduzir, Segurar). Abordagens de aumento de dados, como corte temporal e embaralhamento de sequências, também foram utilizadas para aumentar a variabilidade e mitigar o viés do modelo durante o treinamento.

Vale ressaltar que o conjunto de dados controlado por 40 jogadores foi usado na validação inicial do modelo e nos testes de confiabilidade, enquanto a coleção maior de 500 sequências multimodais foi compilada a partir de gravações prolongadas de partidas e sessões de treinamento organizadas para avaliar a escalabilidade e validade ecológica do framework. A confiabilidade de base foi estabelecida usando o conjunto de dados menor, enquanto o conjunto maior facilitou o treinamento e testes em grande escala de modelos.

Descrição do conjunto de dados

O experimento recrutou 40 jogadores de futebol americano do sexo masculino, cada um com pelo menos cinco anos de experiência em futebol federado, para garantir que a população amostrada tivesse competências técnicas e táticas básicas. A coleta de dados ocorreu em uma configuração padronizada de campos de futebol, onde zonas e posições de jogo pré-determinadas foram atribuídas para garantir condições idênticas de teste. Durante a experimentação, os participantes precisavam responder a sinais visuais de um treinador, seja para passar ou penetrar, replicando decisões táticas tomadas em um jogo real. Cada participante completou um total de 10 testes, cinco passando e cinco dirigindo. Esses movimentos foram capturados com câmeras GoPro Hero4, e os dados de desempenho foram medidos usando o software de análise de vídeo Kinovea junto com o cronômetro manual para registrar o tempo de execução (ET). A principal fonte de dados coletada foi: tempo de execução, qualidade do DM avaliada por coaches experientes e quantidade de ações corretas executadas. Esses fatores forneceram uma base quantitativa para analisar a rapidez e eficácia com que os jogadores tomaram e executaram decisões táticas sob condições controladas de estímulo-resposta. O conjunto de dados produzido é um recurso estruturado e rotulado, bem adequado para a tarefa de criar referências ou treinar sistemas inteligentes com o objetivo de modelar pensamento tático e respostas motoras em contextos de esportes coletivos.

A amostra é restrita a jovens jogadores do sexo masculino de uma liga regional, o que pode limitar sua generalização entre faixas etárias, atletas femininas ou outras culturas. Estudos futuros tentarão coletar amostras mais representativas e diversas.

Outra limitação é o tamanho da amostra de 40 jovens jogadores masculinos de uma única liga regional. Embora a amostra homogênea tenha contribuído para a validade interna e a redução da variação no desempenho devido a diferenças de idade, gênero e contexto tático, ela também limita a generalização dos achados para uma população mais ampla. Os padrões táticos que o modelo aprende podem, assim, refletir estilos de jogo específicos de regiões ou gêneros, em vez de comportamentos de tomada de decisão universais. Para este estudo, amostragem estratificada e aumento de dados foram empregadas para aumentar a variabilidade do conjunto de dados em questão; No entanto, são necessários estudos de pesquisa em maior escala envolvendo atletas, jovens jogadoras, profissionais e participantes de múltiplas culturas táticas para confirmar a robustez do modelo em diversos ambientes de futebol. Esses resultados demonstram forte potencial, mas precisam de validação adicional em conjuntos de dados mais diversos e maiores antes que uma generalização mais ampla possa ser reivindicada.

Para reduzir a subjetividade, três treinadores profissionais de futebol anotaram independentemente as escolhas táticas. A confiabilidade entre avaliadores foi estimada usando o coeficiente de correlação intraclasse (ICC = 0,96, IC 0,94-0,98), indicando concordância quase perfeita. A discussão de consenso resolveu o desacordo. Para dados multimodais, o pré-processamento envolveu sincronização temporal entre modalidades (vídeo a 25 fps e dados de sensores a 10 Hz) e normalização por escores z das características para permitir comparabilidade entre modalidades.

A confiabilidade entre avaliadores foi quantificada usando um coeficiente de correlação intraclasse (ICC [2,3]) de efeitos aleatórios bidirecionais, pois é adequado para avaliar a concordância absoluta entre múltiplos avaliadores. O ICC de 0,96 (IC 95%: 0,94-0,98) indica uma concordância quase perfeita de acordo com os limiares comumente usados e estabelece ainda que os rótulos de decisão tática usados para treinamento eram altamente confiáveis. A confiabilidade foi calculada em todas as 500 sequências multimodais, garantindo que tanto os contextos controlados quanto os de simulação de correspondência fossem devidamente e consistentemente anotados.

Procedimento de anotação e protocolo de rotulagem

Todas as sequências multimodais eram anotadas usando um protocolo estruturado de três estágios. Primeiro, três treinadores licenciados de futebol revisaram independentemente cada sequência posicional de vídeo usando uma interface de anotação sincronizada com carimbo de tempo (Kinovea + planilha personalizada de marcação). Os anotadores rotulavam a categoria de decisão tática (Passe, Drive, Hold), pistas contextuais (zona de pressão, disponibilidade de rotas de passe) e carimbos de tempo dos eventos. Segundo, um script de detecção de discordâncias identificava automaticamente casos de ambiguidade ou conflito, que eram então revisados em uma reunião conjunta de consenso. Terceiro, para garantir consistência na marcação de limites de eventos e no alinhamento temporal entre modalidades, uma passagem final foi realizada por um analista sênior independente. Esse processo, para fins de treinamento posterior em modelos, garantia que cada anotação fosse rastreável e de alta qualidade.

Pré-processamento

Enquanto o presente estudo foi conduzido com 500 sequências multimodais, o pipeline de pré-processamento foi, por design, configurado para conjuntos de dados em grande escala. Todas as modalidades passaram por scripts automatizados que, em paralelo, extraíam quadros de vídeo em lote, reamostravam áudio, interpolavam dados posicionais e aplicavam normalização de pontuação z. A presença de arquitetura modular permite que cada modalidade seja pré-processada independentemente em threads separados de GPU/CPU. Isso permite a ingestão em alto volume das filmagens da partida. Isso garante que o fluxo de trabalho possa ser facilmente escalado para conjuntos de dados de temporada completa sem intervenção manual e torna o framework adequado para implantação no mundo real em ambientes profissionais de análise.

Para examinar adequadamente a tomada de decisão tática em esportes coletivos, dados brutos de diferentes modalidades — por exemplo, clipes de vídeo, sinais de áudio e gravações posicionais — precisam ser pré-processados e alinhados. A ilustração da entrada multimodal é

Equação 1(1)

Aqui, V é denotado como uma série de características de vídeo extraídas do codificador CNN.

Equação 2(2)

Aqui, A é uma característica de áudio codificada por wave2vec.

Equação 3(3)

P representa a posição coordenada de um jogador no tempo ti.

Para lidar com taxas de amostragem assíncronas, cada modalidade é reamostrada ou interpolada para uma linha do tempo compartilhada:

Equação 4(4)

Aqui Equação 5, é uma característica sincronizada ft , é a taxa de referencial combinado, Xm é uma indicação inicial.

Para escala uniforme entre modalidades, todos os vetores de características são normalizados com escores z:

Equação 8(5)

μX e σX denotam a média e o desvio padrão da dimensão das características no conjunto de treinamento.

Embora as principais preocupações sejam decisões de passe/penetração, canais de áudio (por exemplo, comunicação jogador/treinador, pistas ambientais do jogo) foram adicionados para considerar situações reais de partida em que os sinais de fala afetam a reação tática. Hiperparâmetros (por exemplo, taxa de aprendizado, épocas) foram escolhidos por meio de busca em grade e avaliações existentes em aprendizagem multimodal, encontrando um equilíbrio entre estabilidade de convergência e eficiência computacional.

Os hiperparâmetros do framework sugerido — taxa de aprendizado, tamanho do lote e épocas de treinamento — foram escolhidos por meio de uma busca sistemática em grade bem planejada para alcançar tanto a estabilidade da convergência quanto a eficiência computacional. A escolha de uma taxa de aprendizado de 0,0001 com o otimizador Adam demonstrou fornecer atualizações estáveis do gradiente sem oscilações, enquanto os tamanhos dos lotes foram otimizados para equilibrar a capacidade da memória da GPU com a taxa de treinamento. A configuração de 50-100 épocas foi usada para permitir aprendizado adequado sem overfitting, conforme confirmado pelo rastreamento de perdas de validação e pela validação cruzada 10 vezes. Esses valores não foram definidos arbitrariamente, mas guiados por testes anteriores em aprendizagem multimodal e ajustados por ensaios experimentais no conjunto de dados atual. Esse processo rigoroso garantia que os hiperparâmetros selecionados facilitassem o treinamento estável do modelo e melhorias reprodutíveis no desempenho em relação às abordagens base.

Embora a tarefa de classificação foque em decisões de passe/penetração/detenção, as informações de áudio foram incluídas intencionalmente, já que o comportamento tático real no futebol americano é fortemente influenciado pela comunicação jogador-treinador, sinais de chamadas de companheiros, sinais de pressão e sons ambientais (por exemplo, contato com a bola, abordagem do adversário). Esses sinais frequentemente precedem ou coocorrem com a tomada de decisão e fazem parte do ambiente perceptivo natural dos jogadores de futebol. Experimentos preliminares de ablação mostraram que excluir áudio reduzia a recordação em 3,8%, o que indicou que até mesmo sinais acústicos sutis contribuem para a consciência do contexto. Por essa razão, o áudio foi mantido para preservar a validade ecológica e melhorar a capacidade do modelo de generalizar para condições reais de correspondência.

De fato, para apoiar ainda mais esses hiperparâmetros, foi realizada uma análise interna de sensibilidade variando sistematicamente a taxa de aprendizado de 1e-5 para 5e-4, o tamanho do lote de 8 a 32, o número de camadas transformadoras de 4 a 8 e o número de cabeças de atenção de 4 a 12. A configuração escolhida, com taxa de aprendizado de 1e-4, tamanho de lote de 16 e um codificador de 6 camadas com 8 cabeças de atenção, proporcionava convergência estável continuamente com a menor perda de validação, minimizando o sobreajuste em validação cruzada de 10 vezes. Lotes maiores resultaram em instabilidade de gradiente, enquanto lotes menores aumentaram o ruído e atrasaram a convergência. Da mesma forma, modelos de transformadores com mais de 8 cabeças não apresentaram aumento de desempenho, mas aumentaram consideravelmente o tempo de computação. Os resultados obtidos justificam a definição final dos hiperparâmetros usados neste estudo.

Extração de características usando rede neural convolucional 3D

No framework proposto de Fusão Multimodal Baseada em Transformers para tomada de decisão tática em esportes coletivos, a Rede Neural Convolucional 3D (3D CNN) é responsável por extrair características espaço-temporais de clipes de vídeo brutos.

Em contraste com as CNNs 2D, que consideram apenas dimensões espaciais (largura W e altura H), as CNNs 3D também consideram a dimensão temporal R, permitindo que detectem dinâmicas de movimento e padrões sequenciais cruciais para entender comportamentos de equipe, como penetrações e passes no futebol.

O 3D-CNN28 é proposto inicialmente para combinar a informação espacial e temporal dos dados de vídeo. Um kernel 3D é usado em um algoritmo de convolução 3D para um cubo composto por quadros com parte das colunas empilhadas. A convolução 3D pode ser escrita em Equação (6)

Equação 11(6)

Onde: Equação 12 é a característica de saída na localização (x, y, z) no j-ésimo mapa de características da camada l.Equação 14 é o peso do núcleo na localização (h,w,r) do mapa de características de entrada m. Equação 16 é a entrada no deslocamento espaço-temporal da camada anterior. blj é o viés. f(.) é a função de ativação (geralmente ReLU). M é o número de mapas de características de entrada da camada anterior. Essa equação permite que a CNN 3D combine as informações espaciais (altura e largura) e temporais (sequência de quadros) em paralelo.

Figura 4
Figura 4. Arquitetura de processamento CNN 3D. Ilustra como características espaço-temporais são extraídas de sequências de vídeo usando operações convolucionais 3D. Por favor, clique aqui para ver uma versão ampliada desta figura.

A Figura 4 mostra o processo de funcionamento de uma CNN 3D. O pipeline começa com a fase de entrada, onde fluxos de vídeo não processados de um jogo de futebol americano são fundidos com dados organizados, incluindo localizações dos jogadores, estatísticas do jogo e metadados contextuais. Essas informações multimodais preservam tanto a dinâmica visual quanto o contexto situacional, que são fundamentais para a análise de táticas em equipe. Em seguida, o fluxo de vídeo é roteado por uma Rede Neural Convolucional 3D (CNN 3D). Nesse caso, uma série de camadas convolucionais 3D é usada nos quadros de entrada. As camadas se envolvem ao longo das dimensões espaciais (altura e largura) e da dimensão temporal (quadros), permitindo que a rede aprenda padrões de movimento, interações com jogadores e táticas baseadas em sequências, como passes ou penetrações. Subsequentemente, forma-se um cubo de características que possui características espaço-temporais densas. Este cubo é submetido a operações de pooling para reduzir a dimensão enquanto preserva características significativas. Ao fazer pooling, o volume de características é achatado em um vetor 1D, fornecendo uma representação concisa da situação tática. Esse vetor de características é posteriormente inserido em uma Rede Neural Profunda (DNN) totalmente conectada. A DNN é o bloco de tomada de decisão, que processa as características fundidas e extraídas para tomar decisões táticas, como passes, arremessos ou holdings. A saída da rede é a decisão tática final tomada pelo sistema com base na situação real do jogo em tempo real, bem como nos padrões de estratégia aprendidos.

Incorporação e alinhamento de entradas multimodais

Após a extração das características, as três características, como áudio, vídeo e posição estatística do player, são fornecidas como modalidade de entrada.

Para introduzi-los em um transformador e então alimentar cada um deles por uma função de incorporação aprendível:

Equação 19(7)

onde f3DCNN aprende características espaço-temporais de cada fatia de tempo Vt e as mapeia para um espaço latente de dimensão d.

Equação 22(8)

onde WP e bP são pesos aprendíveis.

Equação 25(9)

Todas as incorporações são alinhadas pela dimensão temporal T. Se as modalidades tiverem frequências díspares, ele usa interpolação ou amostragem descendente:

Equação 26(10)

Agora, todas as modalidades são sincronizadas como:

Equação 27(11)

Para preservar a ordem temporal no transformador, também introduza codificações posicionais para cada vetor:

Equação 28(12)

Onde Equação 29 representa a codificação posicional senoidal padrão ou aprendível.

Cada modalidade é codificada operacionalmente usando uma camada linear PyTorch, concatenada em um vetor 512-d e então alimentada na sequência de entrada do transformador após a codificação posicional. Isso garante que uma incorporação unificada esteja preparada para a atenção cruzada a cada passo de tempo.

O tensor final é

Equação 30(13)

é alimentado no Transformer Encoder, onde os mecanismos de autoatenção e atenção cruzada permitem que o modelo raciocine conjuntamente entre todas as modalidades para a tomada de decisão tática.

Fusão multimodal baseada em transformador

Na abordagem proposta, o método de fatoração matricial de baixo nível é empregado para integrar os vetores de dados multimodais adquiridos. A questão de alta dimensão que ocorre quando tensores são fundidos diretamente é abordada por este método, que utiliza um fator de decomposição de baixa ordem para fusãotensorial 29. Cada modalidade é inicialmente expressa como um vetor, e a redução de dimensionalidade que preserva interações significativas é alcançada usando decomposição de baixo grau. O tensor de fusãoZ M entre as M modalidades é construído como:

Equação 32(14)

Aqui: Equação 33 é o fator de baixo posto da m-ésima modalidade, Equação 60 é o produto externo, e r é o posto de decomposição.

O vetor de fusão h é então calculado como:

Equação 34(15)

Quando duas modalidades são utilizadas isoladamente, a fusão reduzida é:

Equação 35(16)

Isso produz um vetor de representação multimodal conjunta h que modela interações intermodais em nível latente.

Após a aquisição do vetor fundido de baixo nível h, o módulo Transformer modela dependências e alinha representações semânticas entre modalidades. Uma atenção intermodal é especialmente projetada para permitir que uma modalidade preste atenção a outra:

Equação 36(17)

Onde Qm é a consulta da modalidade m, Kn,V n são os vetores chave e valor na modalidade n, dk é a dimensão dos vetores chave. Essa configuração facilita fluxos de atenção específicos de modalidade, permitindo que cada categoria de entrada seja processada em relação às outras (por exemplo, sincronizando o movimento do jogador com o contexto do jogo e indicadores de vídeo).

Os vetores com acompanhamento cruzado são empilhados e classificados por meio de um Perceptron Multicamada (MLP). A saída é um rótulo de decisão tática (por exemplo, passar, conduzir, segurar), perda de entropia cruzada otimizada para treinamento de ponta a ponta.

Figura 5
Figura 5. Arquitetura de fusão multimodal baseada em transformadores. Mostra como as modalidades visuais e sensoriais são integradas por meio de um codificador transformador para melhorar a representação de características. Por favor, clique aqui para ver uma versão ampliada desta figura.

O bloco de fusão multimodal, como demonstrado na Figura 5, combina entradas visuais e posicionais. É um projeto necessário, pois decisões táticas exigem consciência espacial e dinâmica de movimento, que não podem ser representadas por uma única modalidade.

A Figura 5 mostra a estrutura de funcionamento da Fusão Multimodal baseada em Transformadores. Esse design combina diversos dados, vídeo, coordenadas espaciais e dados contextuais do jogo em um único canal para prever ações táticas como ultrapassar, dirigir ou segurar. A abordagem começa com a inserção de vídeos, que são avaliados usando uma Rede Neural Convolucional 3D (CNN 3D). Esse sistema identifica tanto estruturas espaciais quanto temporais em vídeo, permitindo capturar a atividade dinâmica dos jogadores e a comunicação ao longo do tempo. Enquanto isso, informações contextuais e posicionais são transmitidas por camadas de embedding, transformando entradas estruturadas em representações vetoriais densas. Os fluxos contextual, posicional e de vídeo podem então ter suas saídas fundidas por um módulo de Fusão de Baixo Rank. A abordagem obtém efetivamente correlações intermodais por meio da decomposição do espaço de fusão, minimizando a complexidade computacional enquanto preserva as relações essenciais entre modalidades. Finalmente, a representação multimodal fundida é processada por um Codificador Transformador com atenção cruz-modal. Esse procedimento permite que o modelo foque nas características corretas entre modalidades e passos de tempo, ampliando sua compreensão do comportamento estratégico em jogos. Por fim, a saída codificada é passada por uma concatenação e um bloco Multi-Layer Perceptron (MLP) que mapeia a representação aprendida para algumas decisões táticas. A saída do modelo classifica ações dos jogadores como "passe", "drive" ou "hold" para permitir um exame inteligente e baseado em dados das táticas do time.

No sistema de análise tática Transformer-Based Multimodal Fusion sugerido para esportes coletivos, a última fase é a classificação e avaliação tática de decisões, que converte representações multimodais aprendidas em rótulos acionáveis por decisão. Após fundir características de vídeo, posicionais e contextuais por fusão de baixo nível e ajustá-las com atenção cruzada no codificador Transformer, os vetores de características resultantes são alimentados em um classificador Multi-Layer Perceptron (MLP). Cada classe de decisão é representada por uma função softmax de ativação, gerando pontuações de probabilidade para todas as ações possíveis. A classe mais provável é escolhida como a decisão prevista pelo modelo. O modelo é treinado com uma função de perda cruzada de entropia, que recompensa previsões corretas e faz com que a rede aprenda a diferenciar diferenças semelhantes em situações táticas. Além disso, a avaliação no domínio do tempo pode ser considerada para confirmar a resposta em situações de jogo em tempo real ou quase em tempo real, garantindo que o classificador seja preciso e também não desperdiçe tempo sob restrições de tempo semelhantes às de um jogo. A Tabela 2 mostra a arquitetura do modelo e os hiperparâmetros.

ComponenteEspecificação
Camadas de Codificador de Transformador6
Atenção Heads8
Dimensão Oculta512
Tamanho da camada de avanço de alimentação2048
Dimensões de IncorporaçãoVídeo: 1024 → 512, Áudio: 256 → 512, Posicional: 128 → 512
Codificação PosicionalAprendível
Método de FusãoFusão Multimodal de Baixa Patente (classificação r = 16)
OtimizadorAdam
Taxa de Aprendizado0.0001
Tamanho do lote16
Épocas de Treinamento50–100
Desistência0.1
Função de PerdaEntropia cruzada

Tabela 2: Arquitetura do modelo e hiperparâmetros. Lista configurações de treinamento e componentes-chave do modelo proposto de fusão multimodal baseado em transformadores.

Para maior clareza e reprodutibilidade, o transformador multimodal foi implementado com uma pilha de codificadores de 6 camadas, cada uma equipada com 8 cabeças de atenção e uma dimensão oculta de 512, seguindo as configurações típicas dos transformadores para tarefas multimodais de médio porte. Cada modalidade passa por um bloco de incorporação: vídeo por uma saída codificadora 3D-CNN, 1024-dim; áudio por um codificador baseado em Wave2Vec, 256-dim; e características posicionais mais contextuais por um codificador MLP de 2 camadas, 128-dim. Todas essas incorporações foram projetadas para um espaço latente 512-d compartilhado por meio de transformações lineares aprendíveis. Para estabelecer o alinhamento temporal, todas as modalidades são primeiro interpoladas para uma única frequência de 25 Hz, seguidas pela aplicação de codificações posicionais aprendidas para preservar a ordem temporal. O alinhamento multimodal é feito usando as camadas de atenção cruzada, que aprendem explicitamente correlações entre modalidades antes de serem inseridas na pilha de codificadores de autoatenção. Essas escolhas arquitetônicas foram feitas para equilibrar a capacidade do modelo com a eficiência computacional, garantindo assim uma convergência estável em um conjunto de dados de tamanho moderado.

Na prática, o framework proposto de Fusão Multimodal Baseada em Transformers é mais adequado para cenários onde dados multimodais sincronizados estão disponíveis, como sessões de treinamento estruturadas, simulações controladas de partidas ou ambientes profissionais equipados com feeds de vídeo consistentes e sistemas de rastreamento posicional. As quatro principais entradas necessárias para o método são (i) vídeo de alta resolução, (ii) dados de rastreamento posicional (GPS/LPS), (iii) fluxos de áudio e (iv) metadados contextuais — por exemplo, posse, zonas de pressão, fase de correspondência. Para alcançar desempenho confiável, essas modalidades devem ser alinhadas no tempo com desvio mínimo (vídeo ≥ 25 fps e sensores posicionais ≥ 10 Hz), e devem manter pontos de vista estáveis e mínimo ruído de sinal. Aquelas configurações que não conseguem fornecer essas entradas sincronizadas, por exemplo, partidas amadoras com ângulos de câmera irregulares, transmissões ao vivo com artefatos de latência/compressão, ou um ambiente sem infraestrutura de rastreamento posicional, serão menos relevantes para o framework. Além disso, o sistema atual funciona melhor em condições semi-controladas, mas pode ser substancialmente menos robusto em situações de partidas ao vivo completamente descontroladas, onde condições de iluminação, oclusão e ruído dinâmico da multidão afetam a qualidade da aquisição de dados. Essas restrições delineam os limites práticos dentro dos quais esse sistema pode ser implantado e enfatizam que a captura consistente de dados em múltiplos modos é essencial para aplicar o modelo proposto.

Modificações e solução de problemas

Na implementação prática, vários problemas podem surgir ao longo do pipeline multimodal que podem reduzir a estabilidade do modelo ou o desempenho geral. Um problema comum é o desalinhamento temporal entre modalidades, onde vídeo gravado a 25 fps e dados posicionais capturados a 10 Hz ficam fora de sincronia, levando a pistas desalinhadas que desestabilizam os mapas de atenção e reduzem a recordação. Isso pode ser resolvido aplicando reamostragem baseada em carimbo de tempo, interpolação linear e removendo automaticamente sequências com desvio excessivo. Os canais de áudio também podem sofrer com ruído causado pelo vento, sons de multidão ou clipes de microfone, o que faz com que o transformador ignore tokens de áudio e reduza ligeiramente a precisão. Aplicar filtragem passa-banda, gating espectral e substituir segmentos severamente corrompidos por vetores zero ajuda a manter a estabilidade do embedding de áudio. Problemas de qualidade visual, como oclusões do jogador ou desfoque de movimento, podem enfraquecer as representações espaço-temporárias da 3D-CNN e aumentar a confusão entre o drive de passagem. Isso é mitigado ao excluir sequências fortemente ocluídas e empregar estratégias de aumento, incluindo corte aleatório, normalização de brilho e simulação de desfoque de movimento. A instabilidade do transformador pode ocorrer se as escalas de embedding diferem entre as modalidades, produzindo perda de validação oscilante ou picos de gradiente. Garantir a normalização consistente do z-score, usar um cronograma de taxa de aprendizado de aquecimento, aplicar gradient clipping e aumentar o abandono pode restaurar o treinamento estável. A fusão de baixo nível também pode se tornar problemática quando a posição de fusão é incorretamente definida, causando relações intermodais distorcidas e desequilíbrio entre classes. Manter um rank moderado para conjuntos de dados pequenos, aumentar o ranking para conjuntos maiores e aplicar regularização L2 ajuda a preservar a fusão equilibrada. Gargalos computacionais podem surgir devido a grandes tensores de vídeo que causam transbordamento de memória da GPU ou treinamento lento. Essas questões podem ser resolvidas por meio de treinamento de precisão mista (FP16), reduzindo a resolução de entrada durante experimentos iniciais, ou armazenando em cache recursos 3D-CNN pré-computados. Por fim, o desequilíbrio natural de classes nas decisões táticas, especialmente para "Drive", pode reduzir o recall e causar flutuações no AUC; Aplicar perda balanceada por classes, sobreamostrar ações de minorias e enriquecer metadados contextuais podem melhorar substancialmente o equilíbrio e a discriminação por decisão. Essa orientação consolidada de resolução de problemas garante que pesquisadores e profissionais possam manter condições de treinamento estáveis, melhorar a reprodutibilidade e adaptar a estrutura de forma eficaz em diversos conjuntos de dados e ambientes.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esse design combina dados diversos, vídeo, coordenadas espaciais e dados contextuais do jogo em um único canal para prever ações táticas como ultrapassar, conduzir ou segurar. A abordagem começa com a inserção de vídeos, que são avaliados usando uma Rede Neural Convolucional Tridimensional (CNN 3D). Os fluxos contextual, posicional e de vídeo podem então ter suas saídas fundidas por um módulo de Fusão de Baixo Rank. A abordagem obtém efetivamente correlações intermodais por meio da decomposição do espaço de fusão, minimi...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O framework de Fusão Multimodal Baseado em Transformers apresentado aqui representa um desenvolvimento importante em relação ao teste base do Stroop Task Football Test (STFT) descrito no artigo base. Em contraste com o artigo base, que se concentrava em testes controlados e orientados a laboratório com estímulos limitados e estáticos como setas coloridas e tarefas pré-definidas (dirigir ou ultrapassar), o novo modelo trabalha a partir de dados multimodais reais para facilitar um pipeline...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm conflitos de interesse a declarar.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores agradecem com gratidão o apoio da Escola de Educação Física da Beibu Gulf University e da Escola de Estatística da Southwestern University of Finance and Economics, pelo fornecimento de recursos e apoio institucional durante esta pesquisa. Esse trabalho também foi apoiado pelo Projeto do Fundo Nacional de Ciências Sociais 2023: Pesquisa sobre a Utilização Eficaz dos Recursos Culturais Esportivos Vermelhos na Área da Antiga Base Revolucionária Zuo Jiang–You Jiang (Subsídio nº 23CTY016).

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
CNN 3DImplementação personalizadaExtração de características espaço-temporais a partir de vídeo
GoPro Hero4GoPro Inc.https://gopro.com/Gravação em vídeo das partidas
Sensores GPS/IMUCatapult Sports / Xsenshttps://www.catapultsports.com/Acompanhamento posicional do jogador
Intel Core i7-11700K CPUIntelhttps://www.intel.comCPU de estações de trabalho de treinamento de modelos
Librosalibrosa.orghttps://pypi.org/project/librosa/Processamento de sinais de áudio e reamostragem
Classificador MLPPyTorch / TensorFlowClassificação de decisão tática
NumPyFundação de Software Pythonhttps://pypi.org/project/numpy/Computação numérica e operações matriciais
NVIDIA RTX 3080 GPUNVIDIAhttps://www.nvidia.comTreinamento e inferência em aprendizado profundo
OpenCVOpenCV.orghttps://pypi.org/project/opencv-python/Extração de quadros de vídeo
PandasFundação de Software Pythonhttps://pypi.org/project/pandas/Manipulação de dados e manuseio tabular
PCA (Scikit-learn)Scikit-learnhttps://scikit-learn.org/Redução de adimensionalidade
Python 3.9Fundação de Software Pythonhttps://www.python.org/downloads/release/python-390/Ambiente de linguagem de programação
PyTorchFundação PyTorchhttps://pytorch.org/Estrutura de aprendizado profundo
scikit-learnDesenvolvedores scikit-learnhttps://pypi.org/project/scikit-learn/Validação cruzada, cálculo ICC
TensorFlow 2.8Googlehttps://www.tensorflow.org/Estrutura de aprendizado profundo
Codificador de TransformadorPyTorch / TensorFlowIntegração de recursos multimodal com atenção
Ubuntu 20.04 LTSCanonical Ltd.https://ubuntu.com/Sistema operacional para treinamento de modelos
Estação de trabalhoPersonalizado / Intel, NVIDIACPU, GPU, RAM para treinamento de modelos

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Calle-Jaramillo, G. A., Franco, R., González, S. R., Forero, L. M., González, H. Design and validation of a test to evaluate the execution time and decision-making in technical–tactical football actions (passing and driving). Behav Sci. 13 (1), 101(2023).
  2. Renshaw, I., Davids, K., O’Sullivan, M., Maloney, M. A., Crowther, R., McCosker, C. An ecological dynamics approach to motor learning in practice: reframing the learning and performing relationship in high performance sport. Asian J Sport Exerc Psychol. 2, 18-26 (2022).
  3. Lamas, L., Senatore, J. V., Fellingham, G. Two steps for scoring a point: creating and converting opportunities in invasion team sports. PLoS ONE. 15, e0240419(2020).
  4. Gonçalves, B., et al. Extracting spatial-temporal features that describe team match demands when considering the effects of the quality of opposition in elite football. PLoS ONE. 14, e0221368(2019).
  5. Cardoso, F. D. S. L., González-Víllora, S., Guilherme, J., Teoldo, I. Young football players with higher tactical knowledge display lower cognitive effort. Percept Mot Skills. 126, 499-514 (2019).
  6. Heilmann, F. Self-report versus neuropsychological tests for examining executive functions in youth soccer athletes—a cross-sectional study. Behav Sci. 12, 346(2022).
  7. Torres-Tejeda, S., Portilla-Fernández, J. A., Mugruza-Vassallo, C. A., Córdoba-Berrios, L. L. Variations of reaction times explained by stimuli changes in size and perspective in 2D and 3D for selective attention. Rev Mex Ing Biomed. 41, 91-104 (2020).
  8. Wilke, J., Vogel, O. Computerized cognitive training with minimal motor component improves lower limb choice-reaction time. J Sports Sci Med. 19, 529(2020).
  9. Da Silva Leite Cardoso, F., Afonso, J., Roca, A., Teoldo, I. The association between perceptual-cognitive processes and response time in decision making in young soccer players. J Sports Sci. 39, 926-935 (2021).
  10. Farahani, J., Soltani, P., Rezlescu, C. Assessing decision-making in elite academy footballers using real-world video clips. Prog Brain Res. 259, Elsevier. 59-70 (2020).
  11. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  12. MM-ViT: multi-modal video transformer for compressed video action recognition. Chen, J., Ho, C. M. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 1910-1921 (2022).
  13. Shi, J., et al. A novel two-stream transformer-based framework for multi-modality human action recognition. Appl Sci. 13, 2058(2023).
  14. Capone, V., Casolaro, A., Camastra, F. Spatio-temporal prediction using graph neural networks: a survey. Neurocomputing. 594, 130400(2025).
  15. Ball trajectory inference from multi-agent sports contexts using set transformer and hierarchical bi-LSTM. Kim, H., et al. Proc 29th ACM SIGKDD Conf Knowl Discov Data Min, , (2023).
  16. Lemes, J. C., et al. Influence of pitch size and age category on the physical and physiological responses of young football players during small-sided games using GPS devices. Res Sports Med. 28, 206-216 (2020).
  17. Coutinho, D., et al. Effects of pitch configuration design on players’ physical performance and movement behaviour during football small-sided games. Res Sports Med. 27, 298-313 (2019).
  18. Clemente, F. M., Sarmento, H. Combining small-sided football games and running-based methods: a systematic review. Biol Sport. 38, 617-627 (2021).
  19. Hu, W., Li, B., Li, C., Zhang, T. An integrated intelligent decision system for physical health evaluation of college students with fuzzy number intuitionistic fuzzy information. J Intell Fuzzy Syst. 44, 611-624 (2023).
  20. Cao, L. Design and optimization of a decision support system for sports training based on data mining technology. Sci Program. 2022, 1846345(2022).
  21. Li, L., Zhang, Z., Zhang, S. Hybrid algorithm based on content and collaborative filtering in recommendation system optimization and simulation. Sci Program. 2021, 4(2021).
  22. Shi, W., Wang, L., Qin, J. User embedding for rating prediction in SVD++-based collaborative filtering. Symmetry. 12, 121(2020).
  23. Hasan, M., Roy, F. An item–item collaborative filtering recommender system using trust and genre to address the cold-start problem. Big Data Cogn Comput. 3, 39(2019).
  24. Duan, R., Jiang, C., Jain, H. K. Combining review-based collaborative filtering and matrix factorization: a solution to rating sparsity. Decis Support Syst. 156, 113748(2022).
  25. Multi-view transformation in recommender systems. Ho, T. L., Le, A. C. Proc 2021 Int Conf Syst Sci Eng (ICSSE), , IEEE. 88-91 (2021).
  26. Detector-free weakly supervised group activity recognition. Kim, D., Lee, J., Cho, M., Kwak, S. Proc IEEE CVF Conf Comput Vis Pattern Recognit (CVPR), , 20083-20093 (2022).
  27. Wensel, J., Ullah, H., Munir, A. ViT-RET: vision and recurrent transformer neural networks for human activity recognition in videos. IEEE Access. 11, 72227-72249 (2023).
  28. Alomar, K., Aysel, H. I., Cai, X. CNNs, RNNs and transformers in human action recognition: a survey and a hybrid model. Artif Intell Rev. 58, 1-44 (2025).
  29. Social adaptive module for weakly supervised group activity recognition. Yan, R., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 224-238 (2020).
  30. Zhang, Y., et al. FairMOT: on the fairness of detection and re-identification in multiple object tracking. Int J Comput Vis. 129, 3069-3087 (2021).
  31. Towards real-time multi-object tracking. Wang, Z., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 22-107 (2020).
  32. Shuvo, M. R., Mekala, M. S., Elyan, E. Deep learning and attention-based methods for human activity recognition and anticipation: a comprehensive review. Cogn Comput. 17, 1-28 (2025).
  33. Alqarafi, A., Almogadwy, B. TAT-SARNet: a transformer-attentive two-stream soccer action recognition network with multi-dimensional feature fusion and hierarchical temporal classification. Mathematics. 13, 3011(2025).
  34. Detection recovery in online multi-object tracking with sparse graph tracker. Hyun, J., Kang, M., Wee, D., Yeung, D. Y. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 4839-4848 (2023).
  35. Mukhtar, H., Khan, M. U. G. STMMOT: advancing multi-object tracking through spatiotemporal memory networks and multi-scale attention pyramids. Neural Netw. 168, 363-379 (2023).
  36. Dataset used for intraclass correlation coefficient reliability analysis. , https://docs.google.com/spreadsheets/d/1c3bZNClvy8TP7RBspwRI0z7R8-n5Wy5H (2021).
  37. Ma, X., et al. feature extraction within a complex urban area with an improved 3D-CNN using airborne hyperspectral data. Remote Sens. 15, 992(2023).
  38. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  39. Wang, X., Guo, Y. Intelligent football players’ motion recognition system based on convolutional neural network and big data. Heliyon. 9, e19822(2023).
  40. Paneru, B., et al. Enhancing soccer pass receiver prediction in broadcast images through advanced deep learning techniques: a comprehensive study on model optimization and performance evaluation. J Soft Comput Explor. 5, 115-121 (2024).
  41. Shot prediction in the attacking third based on spatio-temporal features: a dynamic time-series model approach. Gong, B., et al. Proc 4th Int Conf Inf Technol Contemp Sports (TCS), , IEEE. (2024).
  42. Yang, K. O., Koh, J., Choi, J. W. Unified contrastive fusion transformer for multimodal human action recognition. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Transformer ModelMultimodal FusionTactical Decision AnalysisTeam SportsFootball AnalyticsPlayer PositioningDecision ClassificationFeature ExtractionReal Time PredictionVideo Analysis

Related Articles