Araştırma makalesi

Futbola Uygulanabilir Takım Sporlarında Taktiksel Karar Analizi için Transformator Tabanlı Multimodal Bir Çerçeve

DOI:

10.3791/69806

27 Ocak 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Futbolda taktik karar kategorilerini geliştirmek için, bu çalışma görsel, konum, akustik ve bağlamsal verileri içeren Transformer tabanlı çok modlu bir füzyon modeli önermektedir. Model, 500 dizili çoklu modal veri setinde neredeyse gerçek zamanlı performans sağlar ve CNN-LSTM, BiLSTM-Attention ve GNN temellerini doğruluk ve basınç kaynaklı yanlış sınıflandırma açısından geride bırakır.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Modern futbolda hızlı ve doğru taktik karar alma gereklidir. Ancak, taktik karar alma değerlendirmesi için geleneksel yaklaşımlar ekolojik geçerliliği zayıf ve kolayca ölçeklenmez. Bu zorlukları ele almak için, bu makale oyuncu konumlandırması, video, ses ve bağlamsal meta verileri içeren Transformator Tabanlı Multimodal Füzyon modelini tanıtarak gerçek zamanlı taktik kararları sınıflandırmaktadır. 40 erkek oyuncu ve 500 multimodal oyun dizisinden oluşan bir veri setiyle deneyler yapıldı. 40 oyunculu veri seti, ilk doğrulama ve güvenilirlik değerlendirmesi için kullanılan kontrollü laboratuvar tarzı karar alma deneylerini ifade eder. Daha sonra, genişletilmiş maç simülasyonlarından ve gerçek oyun kayıtlarından 500 multimodal dizis çıkarılarak multimodal transformatör modelinin eğitimi ve testinde kullanılan daha büyük veri seti sağlandı.

Girdileri beş aşamada işler: veri toplama, ön işleme, özellik çıkarma, transformatör tabanlı füzyon ve karar sınıflandırma. CNN-LSTM, BiLSTM-Attention ve GNN'nin temel alanlarına kıyasla, önerilen yaklaşım karar tahmininin doğruluğunu %28 artırır ve basınç kaynaklı yanlış sınıflandırmayı %41 oranında azaltır; düşük çıkarım gecikmesi 52,6 ms ile neredeyse gerçek zamanlı uygulamalar için uygundur. Bulguların daha çeşitli taktik bağlamlarda ve daha geniş sporcu demografisine genellenebilirliği, tek bir bölgeden genç erkek oyuncuların örneklemindeki nispeten küçük büyüklük ve homojenlikle sınırlıdır. Bu sonuçlar, transformator tabanlı çoklu modal füzyonun otomatik taktik karar analizine katkısını vurgular ve daha çeşitli ve büyük ölçekli eşleşme durumlarında daha fazla doğrulama ihtiyacını vurgular.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Futbol gibi takım sporları, dinamik ve belirsiz ortamlarda hızlı taktik kararlar gerektirir. Oyuncular, topta, takım arkadaşlarından ve rakiplerden sürekli olarak görsel bilgileri okumalı ve rekabet avantajı sağlamak için saniyenin çok kısa süresinde yanıt vermelidir. Futbolda taktiksel karar verme, oyuncu hareketlerinin, top yörüngesinin ve durumsal ipuçlarının hızlı algılanmasına büyük ölçüde bağlıdır. Tepki süresi ve seçici dikkat gibi genel algı-bilişsel beceriler performansı şekillendirse de, son araştırmalar gerçek oyun içi taktiksel bilişi yaklaşık olarak karşılayabilen veri odaklı, bağlama duyarlı modelleri vurgulamıştır 1,2,3,4,5. Tepki süresi ve bilişsel yetenekler gibi algısal yetenekler de performans 6,7,8'de kritik rol oynar. Spor bilişi üzerine yapılan son araştırmalar, taktiksel karar vermenin sadece algısal becerilere değil, aynı zamanda sporcunun dinamik mekansal bilgiyi, rakip baskısını ve bağlamsal oyun ipuçlarını gerçek zamanlı entegre etme yeteneğine de dayandığını ortaya koymuştur. Algı-bilişsel uzmanlık üzerine yapılan araştırmalar, taktiksel olarak daha okuryazar oyuncuların ipuçlarını daha hızlı fark ettiğini, bilgiyi daha verimli bir şekilde kavraydığını ve baskı altında daha istikrarlı karar verme kalıpları sergilediklerini göstermektedir. Bu bulgular, spor karar alma süreçlerinin karmaşık ve çok katmanlı doğasını yakalayabilen hesaplamalı modellere olan ihtiyacı destekler.

Taktik karar alma değerlendirmesi için klasik yöntemler genellikle kontrollü laboratuvar görevleri ve öznel uzman yargıları kullanır; bu da ekolojik geçerlilik ve ölçeklenebilirlik üzerinde önemli kısıtlamalar getirir. Derin öğrenmedeki son gelişmeler, zamansal ve çapraz modal bağımlılık yakalama mimarilerinde video, konumsal takip ve bağlamsal eşleşme metaveri gibi çoklu modal veri kaynaklarının kullanımı yoluyla süreci otomatikleştirme potansiyeli sunmaktadır. Bu ilerlemeye rağmen, günümüzdeki modellerin çoğu, modaliteler arasında uzun süreli bağımlılıkları modelleme kapasitesinin sınırlı olduğu Konvolüsyon Sinir Ağları-Uzun-Kısa Süreli Hafıza veya İki Yönlü Uzun-Kısa Süreli Hafıza (CNN-LSTM veya BiLSTM) modellerine dayanmaktadır. Bu eksiklik, futbol senaryolarında taktiksel karar verme süreçlerini daha kapsamlı ve istikrarlı şekilde modelleyebilen transformatör tabanlı çoklu modal füzyon modellerinin geliştirilmesinin itici gücüdür. Örneğin, rakip takım futbolunda, oyuncular top hakkındaki bilgileri, takım arkadaşlarını, rakiplerini ve sahadaki konumlarını hızla değerlendirmek zorundadır. Yeteneklerine, koçun talimatlarına ve oyunun koşullarına göre en iyi hareket yolunu seçmedenönce, 9,10. Organize veri setlerinin ve tanımlanmış taktik bileşenlerin erişilebilirliği nedeniyle, bu çalışma yalnızca futbola odaklanmaktadır; Ancak, karar verme için taktiksel ilkeler birçok takım sporuna uygulanabilir.

Gerçekten de, önceki çalışmalar, CNN-LSTM ve BiLSTM'nin sabit bir alıcı alan kullanarak veya ardışık kapıtma 11,12,13 ile kısıtlanarak çok uzun vadeli zamansal bağımlılıkları yakalayamayacağını göstermektedir. Benzer şekilde, eylem tanıma ve multimodal zaman modellemedeki temel kıyaslama çalışmaları, LSTM tabanlı model performansının ardışık dizi uzunluğu arttıkça veya bağlamsal ipuçları birkaç kare arayla gerçekleştiğinde azaldığını ve bunun dinamik spor ortamlarında ekolojik geçerliliği sınırladığını ortaya koymaktadır. Ayrıca, Grafik Sinir Ağı (GNN) tabanlı modeller, mekânsal etkileşim modelleme için güçlü araçlardır, ancak ayrıntılı zamansal akıl yürütme gerektiren senaryolarda veya bağlamsal basınç ipuçlarının zaman boyunca hızla değiştiği durumlarda sürekli olarak beklentileri düşüktutmuşlardır 14,15. Bu yaklaşımların aksine, daha yeni transformator tabanlı çerçeveler, küresel öz-dikkat sayesinde uzun menzilli zaman ipuçları, mekânsal ilişkiler ve bağlamsal sinyallerin tek bir ileri pasla ortak entegrasyonu yoluyla spor analizi, insan aktivitesi tanıma ve video-dil görevlerinde performans üstünlüklerini göstermektedir. Bu kıyaslama bulguları, mevcut çalışmada önerilen modelin bel kemiği olarak transformatör tabanlı bir mimarinin seçilmesini haklı çıkarmaktadır.

Taktik bilgiyi geliştirmek ve taktik prensipleri kavramak, oyun kısıtlamaları ve sorunlarının çözümünde kritik olduğugösterilmiştir 16,17. Futbolcular, teknik-taktik eğitim 18 ile penetrasyon, hücum koruması, hareket, zaman, sınırlama, savunma koruması, denge ve odaklanma gibi çeşitli oyun unsurlarınıöğrenirler. Oyuncular daha fazla futbol deneyimi kazandıkça, teknik ve taktik temelleri anlamaları artmalıdır. Böylece oyuncular ilgili sinyalleri daha kolay ayırt edebilir ve belirli bir senaryoda her oyun kuralı için uygun karar vermeyikolaylaştırabilir. 19. Bu nedenle, oyuncular motor verimliliklerini ve karar verme becerilerini hareket kalıplarını özel yeteneklerle tamamlamak için kullanabilirler.

Yazar, egzersiz ve alışkanlıkların fitness faydalarını analiz etmek için çoklu özellikli karar verme yöntemleri kullanarak, üniversite öğrencileri arasında beden eğitiminde nitelikli antrenman kapasitesinin etkinliğini göstermiştir. Etkili fiziksel aktivite, sağlıklı fitness alışkanlıkları geliştirmek ve spor kurumlarında sporun sunulma biçiminde reformlar için savunuculuk önemli bir önem taşır. Sezgisel Bulanık Ağırlıklı Heronian Ortalaması (IFWHM) ve bulanık sayı yardımı etkili karar alma için kullanılır. Sonuç, üniversite öğrencilerinin bilişsel başarısını destekledi ve fiziksel iyilik sorunlarının daha doğru bir değerlendirmesini gösterdi. Verilerdeki gizli bağlantıları tespit etmek içinaraştırmacı 20 artırılmış Apriori yöntemini kullandı. Araştırmanın sonuçları, yükseköğretimde öğrencilerin fiziksel sağlığı değerlendirmeleriyle ilgilidir. İlk sonuç, farklı yönelimlerin yorgunluğunun gerçekleşme sıklığına göre değerlendirilmesiyle belirlenir.

Spor analitiği alanında önceki yapay zeka tabanlı araştırmalar, oyuncu tespiti, takip ve grup aktivitelerini tanıma gibi bilgisayar görüşü görevlerine odaklanmıştı. Son zamanlarda zayıf denetli ve dedektör içermeyen mimariler, taktik davranışları anlamada çok modlu ve bağlam farkında modellemenin önemini ortaya koydu. Bu gelişmeler, futbolda taktiksel kararları sınıflandırmak için çoklu modal derin öğrenmenin entegrasyonunu gerektiriyor. Matris çarpanlarına ayırma yoluyla utility matrisinden üretilen gizli özellik vektörleri kullanılarak, kullanıcılar ile kullanıcılar veya bu makaledeki öğeler ve öğeler arasındaki Kosinüs benzerliğini hesaplar.

Spor analitiği alanındaki son araştırmalar, video, konumsal veriler ve bağlamsal ipuçlarını birleştirerek taktik davranışı yorumlayan çok modlu ve bağlama duyarlı derin öğrenme çerçevelerine doğru kaymıştır. Çeşitli transformator tabanlı yaklaşımlar, spor ortamlarında uzun menzilli zaman yapısı ve çapraz modal ilişkilerin modellemesinde güçlü bir yetenek göstermiştir; bunlar arasında şunlar var: multimodal eylem tanıma için MM-ViT, spor bağlamı akıl yürütme için birleşik kontrastlı füzyon transformatörleri ve çapraz dikkat odaklı olaydedektörleri 21,22. Bu yaklaşımlar, taktik kararların en iyi şekilde oyuncular, mekân, hareket ipuçları ve bağlamsal bilgiler arasındaki etkileşimleri yakalayan mimariler kullanılarak temsil edildiğini vurgular; tek mod CNN-LSTM modelleri yerine. Bu yön doğrultusunda, önerilen çalışma ayrıca futbol taktik kararlarının neredeyse gerçek zamanlı modellemesi için görsel, konumsal ve bağlamsal sinyalleri ortak işleyen transformator tabanlı çok modlu bir füzyon çerçevesi de kullanacaktır.

Futbol analizi için önceki modeller genellikle yerel zamansal kalıpları yakalan, ancak modaliteler arasında uzun vadeli bağımlılıklarla mücadele eden CNN-LSTM veya BiLSTM mimarisi etrafında inşa ediliyordu. Transformers, küresel öz-dikkat uygulayarak bu boşluğu doldurur; böylece bir modelin oyuncu hareketlerini, top yörüngelerini ve durumsal ipuçlarını uzun zaman pencereleri arasındaki anahtar yetenekleri üzerinden ilişkilendirebilmesi ve sağlam taktik karar analizi yapılmasına olanak tanır. Önerici sistemler için derecelendirme verilerindeki seyreklik sorununu çözmek amacıyla, yazar23,24, inceleme temelli işbirlikçi filtreleme ve puanlama atama yöntemini birleştiren İnceleme Tabanlı Matris Faktörleştirme tekniği önermiştir.

Bununla birlikte, bu yöntemlerin etkinliği, ölçeklenebilirliği ve uygulanabilirliği, çıkarım için sınırlayıcı kutulara bağımlılıkları ve veri etiketlemesine olan büyük gereksinimler nedeniyle ciddi şekilde sınırlandırılmıştır. Bu sorunu çözmenin bir yolu, oyuncu algısı ve grup aktivite tanıma (25,26,27,28) aynı anda eğitim vermek için sınırlayıcı kutu etiketleri kullanmaktır. Aktör düzeyinde sınırlayıcı kutu notasyonları eğitim verisi için hâlâ gerekli olsa da, önerilen yöntem çıkarım sırasında oyuncuların sınırlayıcı kutularını hesaplar. Zayıf Denetli Grup Aktivite Tanıma (WSGAR) yaklaşımı, eğitim veya çıkarım için aktör düzeyinde etiket gerektirmez ve açıklama yükünü hafifletmeyi amaçlar. Dış bir veri setinde önceden eğitilmiş bir dedektör kullanarak sınırlayıcı kutu önerileri oluşturduktan sonra, alakasız tespitleri filtrelemeyi öğrendiler. Yakınzamanda 29'da, araştırmacılar WSGAR meydan okuması için dedektör olmadan bir yaklaşım sundular; bu yaklaşım, oyuncu bilgisini toplayan kısmi bağlamlar oluşturmak için token gömülmeleri kullandı.

Spor analitiğinde, çoklu modal ve transformator tabanlı mimariler son zamanlarda önem kazanmıştır; çünkü uzun menzilli zaman desenlerini yakalayabiliyor ve heterojen veri akışlarınıentegre edebiliyorlar 30,31. Transformers varyantları, oyuncuların hareketlerini tahmin etmek, çoklu görüş taktik analizi yapmak ve eylem niyetini tanımak için uygulanmıştır; bu da CNN-LSTM modeline kıyasla üstün zamansal akıl yürütme göstermiştir. Video, konum ve bağlamsal ipuçlarını birleştiren multimodal füzyon stratejileri, gerçek zamanlı taktik modellemede cesaret verici erken sonuçlar vermiş ve oyun içi karar dinamiklerini anlamada çapraz dikkat ve sıradan diziye öğrenmenin önemini vurgulamıştır.

Transformatör tabanlı çok modlu çerçeveler, çeşitli veri akışlarının entegre edilmesinin gerekli olduğu çeşitli sektörlerde son zamanlarda üstün performans göstermiştir. Örneğin, ViT tabanlı çok modlu füzyon modelleri, video, poz ve ses bilgilerini ortak yorumlamak için bağlam farkında olay tahmini, oyuncu takibi ve eylem tanıma için çapraz dikkat süreçleri kullanılarakkullanılmıştır (32,33). Ayrıca, MM-Former ve Algılayıcı tabanlı mimari, mekânsal-zaman ipuçlarını birleştirmede ve uzun menzilli zaman akıl yürütmede spor analitiği ve insan aktivitesi analizinde tekrarlayan ve konvolüsyonel modelleri geridebırakmıştır 34. Bu sonuçlar, bu çalışmada Transformator Tabanlı Çok Modal Füzyon mimarisinin kullanımını desteklemekte, transformatörlerin küresel dikkat35 aracılığıyla modaliteler arasındaki ince taneli etkileşimleri yakalayabildiğini göstermektedir. Transformers, küresel dikkatleri sayesinde modelin görsel ipuçlarını, konumsal verileri ve bağlamsal sinyalleri daha uzun zaman aralıkları boyunca ilişkilendirmesini sağlar; bu yetenekler CNN-LSTM ve BiLSTM modellerinde eksiktir.

Önceki çalışmalar, takım sporlarında taktiksel karar alma alma ilgisinin artmasına rağmen, sürüş ve pas gibi önceden belirlenmiş aktivitelerde performans hızını ve karar doğruluğunu değerlendirmek için ağırlıklı olarak manuel şekillendirilmiş ve doğrulanmış değerlendirmelerkullanmıştır 36,37,38. Bu çerçeveler, oyuncu davranışı ve karar alma mükemmelliği hakkında içgörülü veriler sunmasına rağmen, ölçeklenebilirlik, nesnellik ve dinamik, gerçek dünya koşullarına uygunluk açısındansınırlar taşır. Oyuncu eylemleri, görsel sinyaller, sesli ipuçları ve oyun ayarları arasında karmaşık çağrışımları içeren taktik karar vermenin çok modlu doğasını kaydedip anlayabilen bilgisayarlı veri odaklı yaklaşımlar, mevcutyöntemlerle birleştirilmemiştir 40,41,42. Ayrıca, arka plan ve zaman ilişkileri arasında geçiş yapabilen çok boyutlu yapay zeka yapıları bu yöntemler tarafından sıklıkla göz ardı edilir. Video görüntüleri ve konumsal takibi gibi zengin, gerçek zamanlı veri kaynaklarını kullanan ve takım sporlarında karar alma süreçlerini içeren Transformer tabanlı çok modlu bir füzyon çerçevesinin büyümesi açıkça eksiktir. Bu boşluğu kapatmak, yüksek performanslı spor ortamlarında taktiksel nüfuz, ölçeklenebilirlik ve karar alma bağımsızlığını önemli ölçüde artırabilir. Mevcut CNN-LSTM ve BiLSTM metodolojilerinin aksine, bu transformatör tabanlı füzyon görsel ve mekansal bilgi arasında çapraz modal dikkat bilinçli olarak modellemektedir. Bu tür yenilikler, daha yoğun bir taktik temsil sağlar ve baskı senaryolarında yanlış sınıflandırmayı %40'tan fazla en aza indirir.

Bu çalışmanın temel amacı, futbolda taktiksel karar alma süreçlerini değerlendirmek için Transformator Tabanlı Multimodal Füzyon çerçevesi geliştirmektir. Önerilen çerçeve diğer takım sporlarına genelleştirilebilirken, bu çalışma taktiksel karmaşıklığı ve yapılandırılmış veri setlerinin bulunabilirliği nedeniyle futbola odaklanmaktadır. Sistem, uzman değerlendirmelerine dayanarak kontrol edilen, izole futbol görevlerinde taktik doğruluk ve yanıt zamanlamasının yapılandırılmış bir şekilde değerlendirilmesini sağlar. Bu çalışma, konumsal takibi, video görüntüleri, ses sinyalleri ve bağlamsal oyun bilgileri dahil olmak üzere çoklu modal veri kaynaklarını entegre ederek manuel değerlendirme ve statik test ortamlarının sınırlamalarını ele almaktadır.

Transformer tabanlı dikkat süreçleri kullanılarak, önerilen çerçeve sürekli olarak çoklu modal bağlantıları öğrenir ve böylece oyuncuların gerçek zamanlı karar alma yöntemlerinin birleşik ve bağlama duyarlı bir yorumlanmasını sağlar.

Bu kararın temel amacı, antrenörlere ve analistlere oyuncu düşüncesi ve takım dinamikleri hakkında veri odaklı içgörüler aracılığıyla daha derin bir anlayış sağlayarak sporda akıllı performans değerlendirmesini teşvik etmektir.

Önerilen çerçeve, transformatörlerin dikkat mekanizmalarını kullanarak intermodal ilişkileri sürekli öğrenecek ve böylece oyuncuların gerçek zamanlı oyunlarda karar alma stratejileri hakkında birleşik bir anlayış elde edecek.

Böylece sisteme, standart değerlendirme yöntemleriyle karakterize edilmesi zor olan taktiksel davranışa uygulanabilir bir bakış açısı sunma yeteneği kazandırır.

Amaç, yorumlanabilirliği artırmak ve koçlar ile analistlere daha faydalı bilgiler sağlamaktır.

Bu çalışmanın ana katkısı aşağıda verilmiştir:

Bu çalışma, takım sporlarında taktiksel karar alma analizi için yenilikçi bir derin öğrenme modeli sunmak amacıyla Transformer tabanlı çok modlu bir füzyon tasarımı kullanmaktadır.

Gerçek oyun görüntülerinden elde edilen görsel, konumsal ve bağlamsal veri akışlarını entegre ederek, bu yaklaşım, tek başına pas ve sürüş hareketlerine odaklanan temel çalışmada tanıtılan basit değerlendirme yöntemlerinin kapsamını önemli ölçüde genişletiyor.

Multimodal kodlayıcı, oyuncu takip verilerini, görsel çerçeveleri ve bağlamsal maç olaylarını dikkat mekanizmaları kullanarak entegre ederek gelişmiş uzaylı-zaman ilişkilerini toplar.

Bir kıyaslama futbol veri seti üzerinde yapılan deneyler, bu modelin CNN tabanlı füzyon yöntemleri ve LSTM gibi geleneksel temel değerleri geride bıraktığını ortaya koydu.

CNN-LSTM, BiLSTM-Attention ve GNN temelleriyle karşılaştırıldığında, trafo tabanlı çoklu modal füzyon mimarisi önemli kazançlar gösteriyor.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Çalışma, 18-24 yaş arası 40 erkek futbolçuyu, bir bölgesel ligdeki dört amatör ve yarı profesyonel kulüpten seçilmiş, 18-24 yaş arası (ortalama = 20,1 ± 1,2) dahil edildi. Tüm katılımcıların en az üç yıllık rekabet deneyimi vardı ve şu anda yapılandırılmış bir ortamda eğitim alıyordu. Veri toplama iki kontrollü ortamda gerçekleştirildi: ilki taktiksel geçiş/sürüş karar senaryolarını simüle eden standart eğitim sahası tatbikatlarında; ikincisi, multimodal dizilerin çıkarıldığı uzun süreli maç simülasyonu oturumlarında. Tüm prosedürler Beibu Gulf Üniversitesi Kurumsal Etik Komitesi tarafından onaylandı (Onay No: BG-PE-2023-117) ve veri toplamadan önce tüm katılımcılardan yazılı bilgilendirilmiş onay alındı. Bu soruşturma yürütülürken uluslararası ve kurumsal etik standartlara uyuldu. Beibu Gulf Üniversitesi Kurumsal Etik Komitesi, insan deneklerle ilgili tüm prosedürleri incelemiş ve onay vermiştir (Onay No: BG-PE-2023-117). Veri toplanmadan önce, her katılımcı yazılı bilgilendirilmiş onay verdi ve toplanan tüm veriler analiz öncesinde anonimleştirildi.

Bu çalışma, Transformer tabanlı Multimodal Fusion mimarisi aracılığıyla takım sporu taktik karar alma süreçlerinin incelenmesini otomatikleştirmeyi ve geliştirmeyi amaçlamaktadır. Video, ses, mekansal konum ve oynatıcı meta verileri gibi çeşitli veri kaynaklarını kullanarak sağlam bir gerçek zamanlı tahmin modeli oluşturur. Şekil 1, önerilen yöntemin mimarisini göstermektedir. Önerilen çalışma beş aşamadan oluşmaktadır. Aşamalar aşağıda açıklanmıştır:

Şekil 1
Şekil 1. Önerilen yöntemin mimarisi. Taktik karar alma için çok modlu girdiler ve sınıflandırma bileşenlerini birleştiren modelin şeması. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Veri edinimi ve ön işleme

Çeşitli modalitelerden alınan veriler, video akışları, sesli yorumlar, GPS/konumlandırma bilgileri ve oyuncu performans göstergeleri gibi maç kayıtlarından toplanır. Her modalite, video için çerçeve çıkarma, ses için gürültü filtreleme ve sensör okumaları için normalleştirme gibi teknikler şeklinde ön işlemeden geçer; böylece zaman adımlarında senkronizasyon sağlanır.

Video kareleri 25 fps hızında çıkarıldı, 224 × 224 çözünürlükte aşağı salındı. Ses sinyalleri, çevresel gürültünün çoğunluğunu ortadan kaldırmak için 300 ila 3.400 Hz arasında bir bant geçişli filtre ile işleniyordu. GPS sensörlerinden alınan konumsal takip verileri 10 Hz'de kaydedildi ve lineer zaman damgası tabanlı interpolasyon kullanılarak interpolasyon yapıldı, böylece 25 Hz video zaman çizelgesiyle uyum sağlandı. Tüm girdiler, paylaşılan zaman damgaları kullanılarak zamansal hizalanıyor ve ölçekleri z-puanlama ile normalleştiriliyordu.

Özellik çıkarımı

Video verilerinin mekansal ve zamansal bilgilerini toplamak için 3D CNN'ler kullanılır. 3D CNN'ler, video kareleri boyunca hem mekânsal hem de zamansal bilgileri işleyerek modelin hareket kalıplarını tespit etmesini, grup davranışını anlamasını ve hareket tabanlı özellikleri çıkarmasını sağlar. Bu işlem, her eylem dizisi için yoğun bir özellik temsili oluşturur ve bu temsil modele görsel giriş olarak kullanılır. Her video giriş klibi, 2 adımla örneklenmiş 16 ardışık kare içeriyordu. Eğitim sırasında rastgele kırpma, yatay çevirme ve parlaklık normalizasyonu uygulandı. 3D CNN, Adam (lr = 0.0001), parti boyutu 16 ve çapraz entropi kaybı kullanılarak optimize edildi.

Multimodal girdilerin gömülmesi ve hizalanması

Bundan sonra, farklı modalitelerden gömüler 3D CNN'in çıktılarıyla entegre edilir. Multimodal bir transformatör model mimarisi kullanılır ve her modaliteyi çeşitli kodlayıcı dalları yönetir. Çapraz dikkat katmanları, modalite birleşimi ve hizalanması için kullanılır; bu da modelin oyuncu konumları ile top hareketi arasındaki karşılıklı bağımlılıkları (örneğin, oyuncu konumları ile top hareketi ve yorumdan bağlam arasında) yakalamasını sağlar. Bu birleşme, mevcut taktik seçimlerin zengin bağlamsal bir anlaşılmasını sağlar. Ayrıca tüm gömülemeleri PyTorch'ta uyguladım. Video özellikleri 1.024 ile 512 boyut arasında doğrusal olarak yansıtıldı, ses ve konumsal özellikler ise sırasıyla 256 ve 128 boyuta yansıtıldı; zamansal hizalama öncesi 512 boyuta birleştirildi.

Transformatör tabanlı multimodal füzyon

Tüm kaynaklardan elde edilen özellikleri birleştirmek için Multimodal Transformer kullanılır. Transformatordaki öz-dikkat mekanizmaları, modelin modaliteler (örneğin, görsel + ses) arasındaki karşılıklı bağımlılıkları öğrenmesini, zaman akışını ve bağlamı yakalamasını ve taktiksel olarak önemli çerçeveleri ve olayları vurgulamasını sağlar. Bu adımın sonucu, alınan her kararın taktiksel niyetini ve durumsal bağlamını yakalayan birleşik bir temsildir. Multimodal transformator, her biri sekiz dikkat başlığına sahip altı kodlayıcı katmanından oluşuyordu. Dikkat matrisleri, ölçekli nokta-çarpım dikkat kullanılarak hesaplandı. Dikkat ve ileri besleme katmanları da aşırı uyumu önlemek için p = 0.1 olan dropout içerirdi.

Taktik karar sınıflandırması ve değerlendirmesi

Son olarak, birleşmiş temsil, taktik karar türünü tahmin etmek, karar kalitesini değerlendirmek ve isteğe bağlı olarak dikkat ısı haritaları veya aktivasyon haritaları aracılığıyla antrenörler için açıklanabilir içgörüler oluşturmak için kullanılan sınıflandırma katmanına veya karar analiz bloğuna girdi olarak aktarılır. Bu aşamanın çıktısı, bir takımın veya oyuncunun maç oyunu sırasında karar verme yeteneklerinin nicel ve niteliksel bir değerlendirmesini sağlar.

Sınıflandırma başı, ReLU aktivasyonu ve ardından softmax katmanı içeren üç katmanlı bir MLP kullanıyordu. Model, 10 kat çapraz doğrulama ile 70/15/15 bölünmesiyle eğitildi. Kullanılan metrikler doğruluk, hassasiyet, geri çağırma, F1 puanı, gecikme ve AUC idi.

Beş aşamayı özetleyen basitleştirilmiş bir akış şeması, Şekil 2'de gösterildiği gibi, ardışık sürecin anında görsel bir genel bakış sunar. Bu rakam, veri toplama, ön işleme, özellik çıkarma, çoklu modal füzyon ve taktik karar sınıflandırmasını içeren tüm araştırma hattını kısaca temsil eder ve ardından her aşamanın ayrıntılı açıklamalarını içerir.

Şekil 2
Şekil 2. Araştırma sürecinin genel iş akışı. Veri toplama ve ön işlemeden özellik çıkarma, model eğitimi ve değerlendirmeye kadar araştırma sürecinin genel bakışı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 3 , önerilen araştırma sürecinin genel iş akışını gösterir. Süreç, video, ses, konumsal takip ve bağlamsal meta veriler gibi çoklu modal veri kaynaklarının toplandığı ve senkronize edildiği Aşama 1: Veri Toplama ve Ön İşleme ile başlatılır. Aşama 2: Özellik Çıkarma sırasında, 3D Konvolüsyon Sinir Ağları (3D CNN'ler) kullanılarak video akışlarından uzaylı-zaman bilgisi alınır ve böylece oyuncu eylemlerinin ve taktik akışın yoğun görsel temsilleri elde edilir. Aşama 3: Multimodal Girişlerin Gömülmesi ve Hizalanması Ses, Video ve konumsal özellikleri ortak bir gizli alanda birleştirir; zamansal hizalama ve çapraz modal hizalama içerir. Bu temsiller, daha sonra Aşama 4: Transformator tabanlı Multimodal Füzyon kapsamında toplanmıştır; burada çapraz modal ve öz-dikkat mekanizmaları, modelin modaliteler arasında karşılıklı bağımlılıkları öğrenmesine ve taktik kararlara daha derin bağlamsal içgörüler elde etmesine olanak tanır. Son olarak, 5. Aşama: Taktik Karar Sınıflandırması ve Değerlendirmesi'nde, birleşik temsiller bir sınıflandırma katmanına aktarılır ve taktiksel kararları, örneğin geçiş, sürme veya bekletme gibi taktikleri tespit edilir. Bu arada, karar verme doğruluğunu ve yanıt süresini tahmin etmek için performans metrikleri kullanılır. Bu akış şeması, adım adım yaklaşımın net bir genel görünümünü sunar ve aşağıdaki bölümlerde özetlenen ayrıntılı metin açıklamalarıyla tamamlanır.

Şekil 3
Şekil 3. Ardışık işleme boru hattı. Veri toplamadan taktik karar sınıflandırması ve model çıktısına kadar adım adım akışı tasvir eder. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Veri edinimi ve ön işleme

Transformer kullanılarak çoklu modal bir füzyon boru hattı aracılığıyla takım sporlarında yüksek seviyeli taktik karar alma analizini mümkün kılmak için, yapılandırılmış ve yüksek hassasiyette veri toplama ve ön işleme sistemi oluşturuldu. Kurulum, video kayıtları, oyuncu pozisyon takibi, oyuncu-antrenör etkileşimlerinden gelen ses sinyalleri ve maç aşaması, takım yapısı ve topa sahip olma alanları gibi bağlamsal meta veriler dahil olmak üzere birden fazla veri modalitesinin birleştirilmesini içerir.

Çalışma örneği, bölgesel amatör ve yarı profesyonel futbol liglerinde aktif olarak yer alan 20 yaş ve üzeri 40 erkekten oluşuyordu. Her biri, yapılandırılmış bir antrenman programına sahip dört rekabetçi kulüpten seçildi. Sporcuların ortalama yaşı 20,1 ± 1,2 yıl olup, ortalama boyu 177,5 ± 3,1 cm ve ortalama kiloları 72,6 ± 2,9 kg idi. Kendi kulüplerinde ortalama 6,8 ± 1,5 yıl boyunca oynuyorlardı. Tüm katılımcıların en az üç yıllık rekabet deneyimi vardı ve taktiksel olarak yetkin bulundular.

İstatistiksel gücü sağlamak için, örneklem büyüklüğü %95 güvenilirlik (Z = 1.96) ve %5 anlamlılık seviyesi kullanılarak yaklaşık olarak hesaplandı; beklenen Sınıf İçi Korelasyon Katsayısı (ICC) 0.96 ve %95 güven aralığı neredeyse mükemmel uyumu yansıtmak için kullanıldı. Bu, toplanan çoklu modal karar verme verilerinin güvenilirliğini ve tutarlılığını doğrulamahedefiyle uyumludur 27.

Tekrarlanabilirliği sağlamak için, satın alma ayarları ve teknik spesifikasyonlar oturumlar arasında standartlaştırıldı. Video verileri, geniş görüş alanı ayarıyla GoPro Hero4 kameralarla 1.080p çözünürlükte ve saniyede 25 kare hızında kaydedildi; bu da taktiksel alanın tamamını yakalamak için geniş görüş alanı ayarıyla sağlandı. Her kayıt stabilize edilip sabit 2,5 m yüksekliğe monte edildi. Ses sinyalleri, 44,1 kHz örnekleme hızında (mono) harici bir alan mikrofonu kullanılarak yakalanır ve çevresel gürültüyü gidermek için 300-3.400 Hz bant geçişli filtre kullanılarak filtrelenirdi. Konumsal takip verileri, 10 Hz'de çalışan giyilebilir GPS sensörleri kullanılarak toplandı ve üretici tarafından ortalama olarak bildirilen konumsal doğruluk ±0,5 m'dir. Tüm modaliteler paylaşılan zaman damgaları kullanılarak senkronize edilmiş ve doğrusal interpolasyon yoluyla ortak bir 25 Hz zaman çizelgesine yeniden örneklenmiştir.

Ön işleme daha sonra şunları içeriyordu: video aşağı samplama, 224 × 224 çözünürlüğe düşürme, ardışık 16 kareye 2 adımla kare örnekleme, rastgele kırpma, yatay çevirme, parlaklık normalizasyonu, ses normalizasyonu ve gürültü filtrelenmesi, konumsal ve bağlamsal değişken z-skor normalizasyonu.

Ön işleme beti, tekrarlanabilirlik için şu sırayla düzenlenmiştir: (i) kare çıkarma; (ii) ses filtrelemesi; (iii) GPS interpolasyonu; (iv) modalite yeniden örnekleme ile 25 Hz; (v) z-skor normalizasyonu; ve (vi) bozulma, tıkanma ve okuldan ayrılma için bütünlük testleri. Her aşamayı otomatik olarak tamamlamak için toplu işleme betikleri kullanılır.

Verilerin güvenilir kalması için kalite kontrol ve dışlama kriterleri şunları içeriyordu: i) >%20 oyuncu kapanması, ii) 200 ms'yi aşan GPS kesintisi, iii) bozuk veya kesilen ses ve iv) modaliteler arasında şiddetli hareket bulanıklığı veya senkronizasyon desenkronizasyonu. Bu durumlar için toplam 17 dizi (%3,4) hariç tutuldu. Tablo 1 , veri seti açıklamasını gösterir.

NiteliklerDetaylar
SporFutbol (Futbol)
Katılımcılar40 erkek futbolcu
Oyun Seviyesi≥5 yıllık deneyime sahip federasyon futbolcuları
Test TipiPas ve sürüş (top kontrolü) karar verme ve uygulama testi
Test AyarlarıStandart futbol sahası düzeni, işaretlenmiş bölgeler, sabit pozisyonlar
Ölçüm AraçlarıGoPro Hero4 kameralar, Kinovea yazılımı, kronometre zamanlaması
Toplanan VerilerUygulama Süresi (ET), Karar Verme (DM) Doğruluğu, Doğru Eylem Sayısı
Test ProsedürüOyuncular, koçların görsel uyarılarına yanıt verdi ve paslar veya sürüşler gerçekleştirdi
Dava TekrarlarıOyuncu başına 10 deneme (5 pas, 5 sürüş)
DeğerlendirmeUzmanlar DM; ET, zaman damgaları/video kullanılarak ölçüldü
Sonuç DeğişkenleriTepki süresi, doğru karar sayı, teknik uygulama puanı

Tablo 1: Veri seti açıklaması. Katılımcı demografisi, test prosedürleri, ölçüm araçları ve sonuç değişkenleri hakkında bilgi verir.

Mevcut çalışmada, iki ilgili ancak farklı veri seti kullanılmıştır. İlk veri seti, kontrollü pas/sürüş karar verme görevlerine katılan 40 oyuncudan oluşuyordu; bu görevler öncelikle temel güvenilirliği belirlemek ve temel karar ölçüm prosedürünü doğrulamak için kullanıldı. İkinci veri seti, genişletilmiş maç simülasyonları ve gerçek oyun kayıtlarından toplanan 500 multimodal taktik diziyi içeriyor. Bu diziler, trafo tabanlı füzyon modeli için ana eğitim ve test veri setini oluşturuyordu ve ekolojik olarak daha geçerli koşullarda değerlendirme yapılmasına olanak sağladı.

Veri seti 500 multimodal diziden oluşmasına rağmen, katmanlı örnekleme taktiksel eylemler arasında (Pass, Drive, Hold) dengeli temsil sağladı. Eğitim sırasında değişkenliği artırmak ve model yanlılığını azaltmak için zamansal kırpma ve dizi karıştırma gibi veri artırma yaklaşımları da kullanıldı.

40 oyunculu kontrollü veri setinin ilk model doğrulama ve güvenilirlik testinde kullanıldığını, 500 multimodal diziden oluşan daha büyük koleksiyonun uzun süreli maç kayıtları ve çerçevenin ölçeklenebilirliği ve ekolojik geçerliliğini değerlendirmek için organize eğitim oturumlarından derlendiğini belirtmekte fayda var. Temel güvenilirlik daha küçük veri seti kullanılarak belirlenirken, daha büyük veri seti büyük ölçekli model eğitimi ve testini kolaylaştırdı.

Veri seti açıklaması

Deney, örneklem popülasyonunun temel teknik ve taktik yetkinliklere sahip olmasını sağlamak için her biri en az beş yıl federe dayalı oyun deneyimine sahip 40 erkek futbolçunu işe aldı. Veri toplama, önceden belirlenmiş bölgeler ve oyun pozisyonlarının belirlendiği standart bir futbol sahası düzeninde gerçekleşti; böylece aynı test koşulları sağlandı. Deney sırasında, katılımcılar antrenörün görsel ipuçlarına yanıt vermeleri gerekiyordu; ya pas vermek ya da topu sürmek için, gerçek bir oyunda alınan taktiksel kararları taklit ediyordu. Her katılımcı toplamda 10 deneme tamamladı; beşi geçiş ve beşi sürüş yaptı. Bu hareketler GoPro Hero4 kameralarla kaydedildi ve performans verileri Kinovea video analiz yazılımı ile manuel kronometre süresi kullanılarak ölçüldü ve uygulama süresi (ET) kaydedildi. Toplanan ana veri kaynağı: uygulama süresi, deneyimli koçlar tarafından değerlendirilen DM'nin kalitesi ve doğru eylemlerin sayısı. Bu faktörler, oyuncuların kontrollü uyarıcı-tepki koşullarında taktik kararları ne kadar hızlı ve etkili bir şekilde alıp uyguladıklarını analiz etmek için nicel bir temel sağladı. Üretilen veri seti, takım sporları bağlamında taktiksel düşünce ve motor tepkilerini modellemek amacıyla kıyaslamalar oluşturmak veya akıllı sistemleri eğitmek görevine çok uygun yapılandırılmış ve etiketlenmiş bir kaynaktır.

Örneklem, bir bölgesel ligden genç erkek oyuncularla sınırlıdır ve bu da genellenebilirliğini yaş grupları, kadın sporcular veya diğer kültürler arasında sınırlayabilir. Gelecekteki çalışmalar daha temsilci ve çeşitli örnekler almaya çalışacaktır.

Bir diğer sınırlama ise, tek bir bölgesel ligden 40 genç erkek oyuncudan oluşan örneklem büyüklüğüdür. Homojen örneklem, yaş, cinsiyet ve taktik arka plan farklılıkları nedeniyle iç geçerliliğe ve performansta azalan varyasyonlara katkıda bulunsa da, bulguların genellenebilirliğini daha geniş bir popülasyona sınırlamaktadır. Modelin öğrendiği taktik kalıplar, evrensel karar alma davranışı yerine bölgeye özgü veya cinsiyete özgü oyun tarzlarını yansıtabilir. Bu çalışmada, eldeki veri setinin değişkenliğini artırmak için tabakalı örnekleme ve veri artırma kullanıldı; Ancak, modelin çeşitli futbol ortamlarında sağlamlığını doğrulamak için kadın sporcular, genç oyuncular, profesyonel oyuncular ve katılımcıları içeren daha geniş çaplı araştırma çalışmalarına ihtiyaç vardır. Bu sonuçlar güçlü umut vaat ediyor ancak daha geniş genelleme yapılabilmeden önce daha çeşitli ve daha büyük veri setlerinde daha fazla doğrulama gerektiriyor.

Öznelliği azaltmak için, üç profesyonel futbol antrenörü bağımsız olarak taktik seçimleri açıklama yaptı. Derecelendirmeler arası güvenilirlik, sınıf içi korelasyon katsayısı (ICC = 0.96, CI 0.94-0.98) kullanılarak tahmin edildi; bu da neredeyse mükemmel uyumu gösterdi. Uzlaşı tartışması anlaşmazlığı çözdü. Multimodal veri için, modaliteler arasında zamansal senkronizasyon (25 fps video ve 10 Hz sensör verisi) ve özelliklerin z-puan normalizasyonunu gerektirerek modaliteler arasında karşılaştırılabilirlik sağlanıyordu.

Dereceleyiciler arası güvenilirlik, birden fazla dereceleyici arasında mutlak uyumu değerlendirmek için uygun olduğu için iki yönlü rastgele etkiler sınıf içi korelasyon katsayısı (ICC [2,3]) kullanılarak nicelendirilmiştir. ICC 0.96 (%95 GA: 0.94-0.98), yaygın kullanılan eşiklere göre neredeyse mükemmel uyum gösterir ve eğitim için kullanılan taktik karar etiketlerinin son derece güvenilir olduğunu daha da kanıtlar. Güvenilirlik, tüm 500 multimodal dizide hesaplandı, böylece hem kontrollü hem de maç simülasyonu bağlamlarının uygun ve tutarlı şekilde notlanması sağlandı.

Açıklama prosedürü ve etiketleme protokolü

Tüm multimodal diziler yapılandırılmış, üç aşamalı bir protokolle notlandırıldı. İlk olarak, üç lisanslı futbol antrenörü, her video pozisyon dizisini bağımsız olarak zaman damgası senkronize edilmiş bir açıklama arayüzü (Kinovea + özel etiketleme tablosu) kullanarak inceledi. Annotatörler taktiksel karar kategorisini (Geç, Sür, Bekle), bağlamsal ipuçlarını (baskı bölgesi, geçiş şeridi uygunluğu) ve etkinlik zaman damgalarını etiketledi. İkincisi, bir anlaşmazlık tespit senaryosu belirsizlik veya çatışma vakalarını otomatik olarak tespit eder ve bunlar ortak bir uzlaşma toplantısında incelenirdi. Üçüncü olarak, etkinlik sınırlarının işaretlenmesinde ve modaliteler arasında zamansal hizalanmada tutarlılığı sağlamak için, bağımsız kıdemli bir analist tarafından son bir geçiş gerçekleştirildi. Bu süreç, sonraki model eğitimi için her notasyonun izlenebilir ve en kaliteli olmasını sağladı.

Ön işleme

Mevcut çalışma 500 multimodal dizilimle yürütülmüşken, ön işleme boru hattı tasarım gereği büyük ölçekli veri setleri için kurulmuştur. Tüm modaliteler otomatik betiklerden geçti; paralel olarak video kareleri toplu olarak çıkarıldı, sesi yeniden örnekler aldı, konumsal veriler interpolasyon yapıldı ve z-puan normalizasyonu uygulandı. Modüler mimarinin varlığı, her modutenin ayrı GPU/CPU iş parçacıklarında bağımsız olarak ön işlenmesine olanak tanır. Bu, maç görüntülerinin yüksek sesli alınmasını sağlar. Bu, iş akışının manuel müdahale olmadan tam sezon veri setlerine kolayca ölçeklendirilmesini sağlar ve çerçeveyi profesyonel analiz ortamlarında gerçek dünyada kullanıma uygun hale getirir.

Takım sporlarında taktiksel karar alma süreçlerini doğru şekilde incelemek için, farklı modalitelerden - örneğin video klipleri, ses sinyalleri ve konumsal kayıtlardan - ham verilerin önceden işlenmiş ve hizalanması gerekir. Multimodal giriş örneği şöyle:

Denklem 1(1)

Burada V, CNN kodlayıcısından çıkarılan video özellikler serisi olarak belirtilir.

Denklem 2(2)

Burada, A wave2vec ile kodlanan bir ses karakteristikatıdır.

Denklem 3(3)

P, bir oyuncunun ti zamanındaki koordinat konumunu temsil eder.

Asenkron örnekleme oranlarıyla başa çıkmak için her modalite, paylaşılan bir zaman çizelgesine yeniden örneklenir veya interpolasyon edilir:

Denklem 4(4)

Burada Denklem 5, senkronize bir karakteristik ft, birleşik çerçeve hızıdır, Xm başlangıç göstergesidir.

Modaliteler arasında eşit ölçek için, tüm özellik vektörleri z-puanı normalize edilmiştir:

Denklem 8(5)

μX ve σX, eğitim kümesindeki özellik boyutunun ortalamasını ve standart sapmasını gösterir.

Birincil endişeler pas/sürüş kararları olsa da, konuşma sinyallerinin taktiksel tepkiyi etkilediği gerçek maç durumlarını hesaba katmak için ses kanalları (örneğin oyuncu/koç iletişimi, çevresel oyun ipuçları) eklenmiştir. Hiperparametreler (örneğin, öğrenme hızı, dönemler) ızgara araması ve multimodal öğrenmede mevcut değerlendirmelerle seçilerek yakınsama kararlılığı ile hesaplama verimliliği arasında bir denge sağlanmıştır.

Önerilen çerçevenin hiperparametreleri—öğrenme oranı, parti büyüklüğü ve eğitim dönemleri—hem yakınsama kararlılığı hem de hesaplama verimliliği sağlamak için iyi planlanmış sistematik bir ızgara aramasıyla seçilmiştir. Adam optimizatörüyle 0.0001 öğrenme oranı seçimi, gradyanda salınımsız kararlı güncellemeler sağladığı bulundu; parti boyutları ise GPU bellek kapasitesini eğitim verimliliğiyle dengelemek için optimize edildi. 50-100 dönem ayarı, aşırı uyum olmadan yeterli öğrenmeye izin vermek için kullanıldı; bu, doğrulama kayıp takibi ve 10 kat çapraz doğrulama ile doğrulandı. Bu değerler keyfi olarak belirlenmemiş, daha önceki çoklu modal öğrenme testleriyle yönlendirilmiş ve mevcut veri seti üzerinde deneysel denemelerle ayarlanmıştır. Bu titiz süreç, seçilen hiperparametrelerin kararlı model eğitimini ve temel yaklaşımlara göre tekrarlanabilir performans iyileştirmelerini kolaylaştırdığını garanti etti.

Sınıflandırma görevi pas/sürüş/tutma kararlarına odaklansa da, sesli bilgiler kasıtlı olarak dahil edilmiştir çünkü futbolda gerçek taktik davranış oyuncu-antrenör iletişimi, takım arkadaşı çağrı işaretleri, basın sinyalleri ve çevresel sesler (örneğin top teması, rakip yaklaşımı) tarafından güçlü şekilde etkilenir. Bu ipuçları genellikle karar verme sürecinden önce veya birlikte gerçekleşir ve futbolcuların doğal algısal ortamının bir parçasını oluşturur. Ön ablasyon deneyleri, sesin hariç tutulmasının hatırlamayı %3,8 azalttığını gösterdi ve bu da ince akustik ipuçlarının bile bağlam farkındalığına katkıda bulunduğunu gösterdi. Bu nedenle, ekolojik geçerliliği korumak ve modelin gerçek eşleşme koşullarına genelleme yeteneğini artırmak için ses tutuldu.

Gerçekten de, bu hiperparametreleri daha da desteklemek için, öğrenme hızı sistematik olarak 1e-5'ten 5e-4'e, parti büyüklüğü 8'den 32'ye, transformatör katmanlarının sayısı 4'ten 8'e ve dikkat başlıklarının sayısı 4'ten 12'ye kadar sistematik olarak değiştirilerek iç hassasiyet analizi yapıldı. Seçilen konfigürasyon, 1e-4 öğrenme oranı, 16 parti boyutu ve 8 dikkat başlığına sahip 6 katmanlı kodlayıcı ile sürekli olarak en düşük doğrulama kaybıyla istikrarlı yakınsamaya ulaştı ve 10 kat çapraz doğrulamada aşırı uyumu en aza indirdi. Daha büyük parti büyüklükleri gradyan kararsızlığına yol açarken, küçük partiler gürültüyü artırdı ve yakınsamayı geciktirdi. Benzer şekilde, 8'den fazla kafalı transformatör modelleri performans artışı göstermedi, ancak hesaplama süresini önemli ölçüde artırdı. Elde edilen sonuçlar, bu çalışmada kullanılan hiperparametrelerin nihai ayarlarını haklı çıkarmaktadır.

3D konvolüsyon sinir ağı kullanarak özellik çıkarma

Takım sporu taktik karar alma için önerilen Transformator Tabanlı Multimodal Füzyon çerçevesinde, 3D Konvolüsyon Sinir Ağı (3D CNN), ham video kliplerinden mekansal-zamansal özellikleri çıkarmakla sorumludur.

Sadece uzamsal boyutları (genişlik W ve yükseklik H) dikkate alan 2D CNN'lerin aksine, 3D CNN'ler aynı zamanda zamansal boyut R'yi de dikkate alır; bu da futbolda sürüş ve pas gibi takım davranışlarını anlamak için kritik olan hareket dinamiklerini ve ardışık desenleri tespit etmelerini sağlar.

3D-CNN28 ilk olarak video verilerinin mekansal ve zamansal bilgilerini birleştirmek için önerilmiştir. 3D çekirdek, sütunların bir kısmı üst üste yığılmış çerçevelerden oluşan bir küpe 3D konvolüsyon algoritmasında kullanılır. 3B konvolüsyon Eqn (6) ile yazılabilir

Denklem 11(6)

Burada: Denklem 12 l. katmanın j. özellik haritasında (x, y, z) konumundaki çıkış özelliğidir.Denklem 14 mth giriş özellik haritasından (h,w,r) konumundaki çekirdeğin ağırlığıdır. Denklem 16 önceki katmandan mekansal-zaman ofsetinde girdidir. blj önyargıdır. f(.) aktivasyon fonksiyonudur (genellikle ReLU). M, önceki katmandan gelen giriş özellik haritalarının sayısıdır. Bu denklem, 3D CNN'in mekânsal (yükseklik ve genişlik) ve zamansal (çerçeve dizisi) bilgilerini paralel olarak birleştirmesini sağlar.

Şekil 4
Şekil 4. 3D CNN işlem mimarisi. Uzaylı-zamansal özelliklerin video dizilerinden 3D konvolüsyon işlemlerle nasıl çıkarıldığını gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 4 , 3D CNN'in çalışma sürecini göstermektedir. Boru hattı, bir futbol maçının işlenmemiş video akışlarının oyuncu konumları, maç istatistikleri ve bağlamsal meta veriler dahil olmak üzere organize verilerle birleştirildiği giriş aşamasıyla başlar. Bu çok modlu bilgi, hem görsel dinamikleri hem de durumsal bağlamı korur ve bunlar takım taktik analizi için kritik öneme sahiptir. Daha sonra, video akışı 3D Konvolüsyon Sinir Ağı (3D CNN) üzerinden yönlendirilir. Bu durumda, giriş karelerinde bir dizi 3B konvolüsyon katman kullanılır. Katmanlar, mekânsal boyutlar (yükseklik ve genişlik) ve zamansal boyut (kareler) boyunca birleşerek ağın hareket kalıplarını, oyuncu etkileşimlerini ve paslar veya sürüşler gibi sıraya dayalı taktikleri öğrenmesini sağlar. Sonrasında, yoğun uzaylı-zaman özelliklerine sahip bir özellik küpü oluşur. Bu küp, boyutu azaltmak ve önemli özellikleri korumak için havuzlama işlemlerine tabi tutulur. Havuza alındığında, özellik hacmi 1D bir vektöre düzleştirilir ve taktiksel durumun kısa bir temsili sağlanır. Bu özellik vektör daha sonra tam bağlantılı Derin Sinir Ağı'na (DNN) girilir. DNN, birleştirilmiş ve çıkarılan özellikleri işleyerek pas, şut veya tutma gibi taktiksel kararlar veren karar verme bloğudur. Ağın çıktısı, gerçek zamanlı oyun durumuna ve öğrenilen strateji kalıplarına dayanarak sistemin aldığı nihai taktik karardır.

Multimodal girdilerin gömülmesi ve hizalanması

Özellik çıkardıktan sonra, ses, video ve oyuncunun istatistiksel konumu gibi üç özellik giriş modalitesi olarak verilir.

Bunları bir transformatora girip her birini öğrenilebilir bir gömme fonksiyonu aracılığıyla beslemek için:

Denklem 19(7)

buradaf 3DCNN , her zaman dilimi Vt'nin uzaylı-zamansal özelliklerini öğrenir ve bunu d-boyutlu bir gizli uzaya eşler.

Denklem 22(8)

buradaW P ve bP öğrenilebilir ağırlıklardır.

Denklem 25(9)

Tüm gömmeler, zamansal boyut T ile hizalanmıştır. Modaliteler farklı frekanslara sahipse, interpolasyon veya aşağı sampling kullanılır:

Denklem 26(10)

Şimdi, tüm modaliteler şu şekilde senkronize edilir:

Denklem 27(11)

Transformatör içinde zamansal düzeni korumak için, her vektöre konumsal kodlamalar da eklenin:

Denklem 28(12)

Burada Denklem 29 varsayılan sinüzoidal veya öğrenilebilir konumsal kodlamayı temsil eder.

Her modalite, PyTorch doğrusal katmanı kullanılarak operasyonel olarak kodlanır, 512-d bir vektörle birleştirilir ve konumsal kodlama sonrası transformatör giriş dizisine beslenir. Bu, her zaman adımında çapraz dikkat için birleşik bir gömülme hazırlanmasını garanti eder.

Son tensör

Denklem 30(13)

Öz-dikkat ve çapraz modal dikkat mekanizmaları, modelin tüm modaliteler arasında ortak mantık yürütmesini sağlayan Transformer Encoder'a beslenir.

Transformatör tabanlı multimodal füzyon

Önerilen yaklaşımda, elde edilen çok modlu veri vektörlerini entegre etmek için düşük dereceli matris faktörlendirme yöntemi kullanılır. Tensorların doğrudan birleştirildiğinde ortaya çıkan yüksek boyutlu sorun, tensörfüzyonu 29 için düşük dereceli ayrıştırma faktörü kullanan bu yöntemle ele alınır. Her modalite başlangıçta bir vektör olarak ifade edilir ve önemli etkileşimleri koruyan boyut küçültmesi düşük dereceli ayrıştırma kullanılarak sağlanır. M modaliteleri arasında füzyon tensörü ZM şu şekilde inşa edilmiştir:

Denklem 32(14)

Burada: Denklem 33 m-y-modalitesinin düşük dereceli faktörüdür, Denklem 60 dış çarpımdır ve r ayrıştırma derecesidir.

Füzyon vektörü h daha sonra şu şekilde hesaplanır:

Denklem 34(15)

İki modalite tek başına kullanıldığında, azaltılmış füzyon şudur:

Denklem 35(16)

Bu, gizli bir seviyede modlar arası etkileşimleri modelleyen ortak çok modlu temsil vektörü h oluşturur.

Düşük dereceli füzelenmiş vektör h'nin edinilmesinin ardından, Transformer modülü bağımlılıkları modeller ve modaliteler arasında anlamsal temsilleri hizalar. Çapraz modal dikkat, bir modalitenin diğerine dikkat etmesini sağlamak için özel olarak tasarlanmıştır:

Denklem 36(17)

Qm modalite m sorgusu olduğunda, Kn, Vn modalitedeki anahtar ve değer vektörleri, dk ise anahtar vektörlerin boyutudur. Bu kurulum, modaliteye özgü dikkat akışlarını kolaylaştırır ve her girdi kategorisinin diğerlerine göre işlenmesine olanak tanır (örneğin, oyuncu hareketinin oyun konteksti ve video göstergeleriyle senkronize edilmesi).

Çapraz müdahaleli vektörler, Çok katmanlı Perceptron (MLP) aracılığıyla üst üste yığılır ve sınıflandırılır. Çıktı, uçtan uca eğitim için optimize edilmiş bir çapraz entropi kaybı olan taktik karar etiketidir (örneğin, geç, sür, bekle).

Şekil 5
Şekil 5. Transformatör tabanlı çok modlu füzyon mimarisi. Görsel ve sensör modalitelerinin transformatör kodlayıcı aracılığıyla nasıl entegre edildiğini ve özellik temsilini nasıl artırdığını gösterir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 5'te gösterildiği gibi çok modlu füzyon bloğu, görsel ve konumsal girdileri birleştirir. Bu gerekli bir tasarımdır çünkü taktik kararlar mekânsal farkındalık ve hareket dinamikleri gerektirir ve bu dinamikler tek bir modaliteyle temsil edilemez.

Şekil 5, Transformator tabanlı Multimodal Fusion'un çalışma yapısını göstermektedir. Bu tasarım, çeşitli verileri, video, mekansal koordinatları ve oyun bağlamsal verilerini tek bir kanalda birleştirerek pas, sürüş veya tutma gibi taktiksel eylemleri tahmin eder. Yaklaşım, videoların girmesiyle başlar ve bu videolar 3D Konvolüsyon Sinir Ağı (3D CNN) kullanılarak incelenir. Bu sistem, videoda hem mekânsal hem de zamansal yapıları tanımlayarak dinamik oyuncu aktivitesini ve iletişimini zaman içinde yakalayabilir. Bu arada, bağlamsal ve konumsal bilgiler katmanların gömülüyle iletilir ve yapılandırılmış girdiler yoğun vektör temsillerine dönüştürülür. Bağlamsal, konumsal ve video akışlarının çıkışları Düşük Seviyeli Bir Füzyon modülü tarafından birleştirilebilir. Bu yaklaşım, füzyon uzay ayrıştırması yoluyla çapraz modal korelasyonları etkili bir şekilde elde eder; hesaplama karmaşıklığını en aza indirirken modaliteler arasındaki temel ilişkileri korur. Son olarak, füzelenmiş çok modlu temsil, çapraz modal dikkatle bir Transformer Encoder tarafından işlenir. Bu prosedür, modelin modaliteler ve zaman adımları arasında doğru özelliklere odaklanmasını sağlar ve stratejik oyun davranışını daha iyi anlamasını sağlar. Son olarak, kodlanmış çıktı bir birleştirme ve öğrenilen temsilin bazı taktik kararlara eşlenen Çok Katmanlı Perceptron (MLP) bloğundan geçirilir. Model çıktısı, "pas", "sürüş" veya "tutma" gibi oyuncu eylemlerini sınıflandırarak takım taktiklerinin akıllıca ve veri odaklı incelenmesini sağlar.

Takım sporları için önerilen Transformer Tabanlı Multimodal Füzyon taktik analiz sisteminde, son aşama taktiksel karar sınıflandırması ve değerlendirmesidir; bu aşama, öğrenilen multimodal temsilleri karar uygulanabilir etiketlere dönüştürür. Video, konumsal ve bağlamsal özellikler düşük seviyeli füzyon ile birleştirilip Transformer kodlayıcısında çapraz modal dikkat kullanılarak ince ayar edildikten sonra, ortaya çıkan özellik vektörleri Multi-Layer Perceptron (MLP) sınıflandırıcısına aktarılır. Her karar sınıfı, tüm olası eylemler için olasılık puanları veren softmax aktivasyon fonksiyonuyla temsil edilir. En olası sınıf, modelin tahmin edilen kararı olarak seçilir. Model, doğru tahminleri ödüllendiren ve ağın taktik durumlarda benzer farklılıkları ayırt etmeyi öğrenen çapraz entropi kaybı fonksiyonu üzerine eğitilmiştir. Ayrıca, gerçek zamanlı veya neredeyse gerçek zamanlı oyun durumlarında yanıt verebilirliği doğrulamak için zaman alanı değerlendirmesi düşünülebilir; böylece sınıflandırıcının doğru olmasını ve oyun benzeri zaman kısıtlamaları altında zaman kaybetmemesini sağlar. Tablo 2, Model Mimarisi ve Hiperparametreleri göstermektedir.

BileşenTeknik özellikler
Transformatör Kodlayıcı Katmanları6
Dikkat Kafalar8
Gizli Boyut512
Besleme Katmanı Boyutu2048
Gömme BoyutlarıVideo: 1024 → 512, Ses: 256 → 512, Konumsal: 128 → 512
Pozisyonsal KodlamaÖğrenilebilir
Füzyon YöntemiDüşük Seviye Çok Modlu Füzyon (rütbe r = 16)
OptimizerAdam
Öğrenme Hızı0.0001
Parti Büyüklüğü16
Eğitim Dönemleri50–100
Okuldan Ayrılma0.1
Kayıp FonksiyonuÇapraz Entropi

Tablo 2: Model mimarisi ve hiperparametreler. Önerilen trafo tabanlı çok modlu füzyon modelinin eğitim ayarları ve temel bileşenlerini listeler.

Daha fazla netlik ve tekrarlanabilirlik için, multimodal transformator her biri 8 dikkat başlığı ve 512 gizli boyutla donatılmış 6 katmanlı bir kodlayıcı yığını ile uygulandı; bu boyut orta ölçekli multimodal görevler için tipik transformatör ayarlarına uyguluyordu. Her modalite bir göme bloğundan geçer: video, 3D-CNN kodlayıcı çıkışı ile 1024-dim; ses, Wave2Vec tabanlı bir kodlayıcı ile 256-dim; ve konumsal artı bağlamsal özellikler ile 2 katmanlı bir MLP kodlayıcı olan 128-dim. Tüm bu gömmeler, öğrenilebilir doğrusal dönüşümler yoluyla paylaşılan bir 512-d gizli uzaya yansıtıldı. Zamansal hizalanmayı sağlamak için, tüm modaliteler önce tek bir 25 Hz frekansa interpolasyon edilir, ardından zamansal sıralamayı korumak için öğrenilmiş konumsal kodlamalar uygulanır. Çapraz modal hizalama, modaliteler arasındaki korelasyonları açıkça öğrenen ve sonra öz-dikkat kodlayıcı yığınına aktarılan çapraz dikkat katmanları kullanılarak yapılır. Bu mimari seçimler, model kapasitesiyle hesaplama verimliliği arasında dengelemek için yapıldı; böylece orta büyüklükte bir veri setinde istikrarlı yakınsamayı sağladı.

Pratikte olarak, önerilen Transformator Tabanlı Çok Modal Füzyon çerçevesi, senkronize multimodal verilerin mevcut olduğu senaryolar için en uygundur; örneğin yapılandırılmış eğitim oturumları, kontrollü maç simülasyonları veya tutarlı video akışları ve konumsal takip sistemleriyle donatılmış profesyonel ortamlar. Yöntem için gereken dört ana girdi, (i) yüksek çözünürlüklü video, (ii) konumsal takip verileri (GPS/LPS), (iii) ses akışları ve (iv) bağlamsal meta veriler—örneğin, sahiplik, basınç bölgeleri, maç aşamasıdır. Güvenilir performans elde etmek için, bu modaliteler minimum kayma ile zamanla hizalanmalıdır (video ≥ 25 fps ve konumsal sensörler ≥ 10 Hz), ve sabit bakış açıları ile minimum sinyal gürültüsü korumalıdır. Bu senkronize girişleri sağlamayan ayarlar, örneğin düzensiz kamera açılarına sahip amatör eşleşmeler, gecikme/sıkıştırma artefaktları içeren canlı yayın yayınları veya konumsal takip altyapısı olmayan bir ortam, çerçeve için daha az önemli olacaktır. Ayrıca, mevcut sistem yarı kontrollü koşullarda en iyi performans gösterse de, tamamen kontrolsüz canlı maç ortamlarında aydınlatma koşulları, tıkanma ve dinamik seyirci gürültüsü veri toplama kalitesini etkilediği durumlarda oldukça daha az dayanıklı olabilir. Bu kısıtlamalar, bu sistemin uygulanabileceği pratik sınırları belirler ve önerilen modelin uygulanmasında birden fazla modda tutarlı veri yakalamanın şart olduğunu vurgular.

Modifikasyonlar ve sorun giderme

Pratikte uygulamada, çoklu modal boru hattı boyunca model kararlılığını veya genel performansı azaltabilecek çeşitli sorunlar ortaya çıkabilir. Yaygın bir sorun, 25 fps'de kaydedilen video ile 10 Hz'de alınan konumsal verilerin senkronizasyonun bozulduğu, dikkat haritalarını dengesizleştiren ve hatırlamayı azaltan uyumsuz ipuçlarının oluştuğu modaliteler arasında zamansal hizalanmadır. Bu, zaman damgası tabanlı örnekleme, doğrusal enterpolasyon ve aşırı kayma içeren dizileri otomatik olarak kaldırarak çözülebilir. Ses kanalları ayrıca rüzgar, kalabalık sesleri veya mikrofon kesilmesiyle oluşan gürültüden etkilenebilir; bu da transformatorun ses tokenlarını görmezden gelmesine ve hassasiyetin biraz düşmesine yol açar. Bant geçişli filtreleme, spektral gating ve ciddi şekilde bozulmuş segmentlerin yerine sıfır vektörlerin kullanılması, ses göme kararlılığını korumaya yardımcı olur. Oyuncu tıkanmaları veya hareket bulanıklığı gibi görsel kalite sorunları, 3D-CNN'in mekansal temsillerini zayıflatabilir ve pas-sürüş karışıklığını artırabilir. Bu, ağır şekilde kapatılmış dizilerin hariç tutulması ve rastgele kırpma, parlaklık normalizasyonu ve hareket bulanıklığı simülasyonu gibi artırma stratejileri kullanılarak azaltılır. Gömülü ölçekler modaliteler arasında farklılık gösterirse ve bu da salınımlı doğrulama kaybı veya gradyan artışlarına neden olursa transformatör kararsızlığı meydana gelebilir. Tutarlı z-puan normalizasyonunu sağlamak, ısınma öğrenme hızı programı kullanmak, gradyan kırpımı uygulamak ve bırakılma artışı istikrarlı eğitimi yeniden sağlayabilir. Düşük rütbe füzyon da yanlış ayarlandığında sorun yaratabilir; bu da çarpık modlar arası ilişkilere ve sınıf dengesizliğine yol açabilir. Küçük veri setleri için orta düzeyde sıralama tutmak, daha büyük veri setleri için sıralamayı artırmak ve L2 düzenleme uygulaması dengeli füzyonun korunmasına yardımcı olur. GPU bellek taşmasına veya yavaş eğitime neden olan büyük video tensörleri nedeniyle hesaplamalı darboğazlar ortaya çıkabilir. Bu sorunlar, karma hassasiyet (FP16) eğitimi, erken deneylerde giriş çözünürlüğünü azaltmak veya önceden hesaplanmış 3D-CNN özelliklerinin önbelleğe alınması yoluyla ele alınabilir. Son olarak, özellikle "Drive" için taktik kararlarda doğal sınıf dengesizliği geri çağırmayı azaltabilir ve AUC'de dalgalanmalara yol açabilir; Sınıf dengeli kayıp uygulamak, azınlık eylemlerini aşırı örneklemek ve bağlamsal meta verileri zenginleştirmek, denge ve karar ayrımcılığını önemli ölçüde iyileştirebilir. Bu birleştirilmiş sorun giderme rehberi, araştırmacıların ve uygulayıcıların istikrarlı eğitim koşullarını koruyabilmesini, tekrarlanabilirliği artırmasını ve çerçeveyi çeşitli veri setleri ve ortamlarda etkili şekilde uyarlamasını sağlar.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu tasarım, çeşitli verileri, videoları, mekansal koordinatları ve oyun bağlamsal verilerini tek bir kanalda birleştirerek pas, sürüş veya tutma gibi taktiksel eylemleri tahmin eder. Yaklaşım, videoların girmesiyle başlar ve bu videolar Üç Boyutlu Konvolüsyon Sinir Ağı (3D CNN) kullanılarak incelenir. Bağlamsal, konumsal ve video akışlarının çıkışları Düşük Seviyeli Bir Füzyon modülü tarafından birleştirilebilir. Bu yaklaşım, füzyon uzay ayrıştırması yoluyla çapraz modal korelasyonları etkili bir şekilde elde eder; hesap...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Burada sunulan Transformator Tabanlı Multimodal Füzyon çerçevesi, temel makalede belirtilen temel Stroop Görev Futbol Testi (STFT) üzerinde önemli bir gelişmeyi temsil etmektedir. Temel makalenin aksine, renkli oklar ve önceden tanımlanmış görevler (sürüş veya geçiş) gibi sınırlı ve statik uyarıcılarla kontrollü, laboratuvar odaklı testlere odaklanan temel makalenin aksine, yeni model gerçek oyun, çok modlu kaynak verilerinden yararlanarak daha zengin, otomatik bir taktik analiz hattı ol...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların beyan edecek çıkar çatışmaları yoktur.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, bu araştırma sırasında kaynak ve kurumsal destek sağladıkları için Beibu Gulf Üniversitesi Beden Eğitimi Fakültesi ve Güneybatı Finans ve Ekonomi Üniversitesi İstatistik Fakültesi'nin desteğini minnettarlıkla takdir etmektedir. Bu çalışma ayrıca 2023 Ulusal Sosyal Bilimler Fonu Projesi tarafından desteklendi: Zuo jiang–You Jiang Eski Devrimci Üs Bölgesi'nde Kırmızı Spor Kültürel Kaynaklarının Etkin Kullanımı Araştırması (Hibe No. 23CTY016).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
3D CNNÖzel uygulamaVideodan uzaylı-zamansal özellik çıkarımı
GoPro Hero4GoPro Inc.https://gopro.com/Maçların video kaydı
GPS/IMU SensörleriCatapult Sports / Xsenshttps://www.catapultsports.com/Oyuncu pozisyon takibi
Intel Core i7-11700K CPUIntelhttps://www.intel.comModel eğitim iş istasyonu CPU
Librosalibrosa.orghttps://pypi.org/project/librosa/Ses sinyal işleme ve yeniden örnekleme
MLP SınıflandırıcıPyTorch / TensorFlowTaktik karar sınıflandırması
NumPyPython Yazılım Vakfıhttps://pypi.org/project/numpy/Sayısal hesaplama ve matris işlemleri
NVIDIA RTX 3080 GPUNVIDIAhttps://www.nvidia.comDerin öğrenme eğitimi ve çıkarım
OpenCVOpenCV.orghttps://pypi.org/project/opencv-python/Videodan kare çıkarma
pandalarPython Yazılım Vakfıhttps://pypi.org/project/pandas/Veri işleme ve tablo şeklinde işleme
PCA (Scikit-learn)Scikit-learnhttps://scikit-learn.org/Boyutsal indirgeme
Python 3.9Python Yazılım Vakfıhttps://www.python.org/downloads/release/python-390/Programlama dili ortamı
PyTorchPyTorch Vakfıhttps://pytorch.org/Derin öğrenme çerçevesi
scikit-learnscikit-learn geliştiricilerihttps://pypi.org/project/scikit-learn/Çapraz doğrulama, ICC hesaplaması
TensorFlow 2.8Googlehttps://www.tensorflow.org/Derin öğrenme çerçevesi
Transformör KodlayıcıPyTorch / TensorFlowÇok modlu özellik entegrasyonu dikkatle
Ubuntu 20.04 LTSCanonical Ltd.https://ubuntu.com/Model eğitimi için işletim sistemi
İş IstasyonuÖzel / Intel, NVIDIACPU, GPU, RAM model eğitimi için

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Calle-Jaramillo, G. A., Franco, R., González, S. R., Forero, L. M., González, H. Design and validation of a test to evaluate the execution time and decision-making in technical–tactical football actions (passing and driving). Behav Sci. 13 (1), 101(2023).
  2. Renshaw, I., Davids, K., O’Sullivan, M., Maloney, M. A., Crowther, R., McCosker, C. An ecological dynamics approach to motor learning in practice: reframing the learning and performing relationship in high performance sport. Asian J Sport Exerc Psychol. 2, 18-26 (2022).
  3. Lamas, L., Senatore, J. V., Fellingham, G. Two steps for scoring a point: creating and converting opportunities in invasion team sports. PLoS ONE. 15, e0240419(2020).
  4. Gonçalves, B., et al. Extracting spatial-temporal features that describe team match demands when considering the effects of the quality of opposition in elite football. PLoS ONE. 14, e0221368(2019).
  5. Cardoso, F. D. S. L., González-Víllora, S., Guilherme, J., Teoldo, I. Young football players with higher tactical knowledge display lower cognitive effort. Percept Mot Skills. 126, 499-514 (2019).
  6. Heilmann, F. Self-report versus neuropsychological tests for examining executive functions in youth soccer athletes—a cross-sectional study. Behav Sci. 12, 346(2022).
  7. Torres-Tejeda, S., Portilla-Fernández, J. A., Mugruza-Vassallo, C. A., Córdoba-Berrios, L. L. Variations of reaction times explained by stimuli changes in size and perspective in 2D and 3D for selective attention. Rev Mex Ing Biomed. 41, 91-104 (2020).
  8. Wilke, J., Vogel, O. Computerized cognitive training with minimal motor component improves lower limb choice-reaction time. J Sports Sci Med. 19, 529(2020).
  9. Da Silva Leite Cardoso, F., Afonso, J., Roca, A., Teoldo, I. The association between perceptual-cognitive processes and response time in decision making in young soccer players. J Sports Sci. 39, 926-935 (2021).
  10. Farahani, J., Soltani, P., Rezlescu, C. Assessing decision-making in elite academy footballers using real-world video clips. Prog Brain Res. 259, Elsevier. 59-70 (2020).
  11. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  12. MM-ViT: multi-modal video transformer for compressed video action recognition. Chen, J., Ho, C. M. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 1910-1921 (2022).
  13. Shi, J., et al. A novel two-stream transformer-based framework for multi-modality human action recognition. Appl Sci. 13, 2058(2023).
  14. Capone, V., Casolaro, A., Camastra, F. Spatio-temporal prediction using graph neural networks: a survey. Neurocomputing. 594, 130400(2025).
  15. Ball trajectory inference from multi-agent sports contexts using set transformer and hierarchical bi-LSTM. Kim, H., et al. Proc 29th ACM SIGKDD Conf Knowl Discov Data Min, , (2023).
  16. Lemes, J. C., et al. Influence of pitch size and age category on the physical and physiological responses of young football players during small-sided games using GPS devices. Res Sports Med. 28, 206-216 (2020).
  17. Coutinho, D., et al. Effects of pitch configuration design on players’ physical performance and movement behaviour during football small-sided games. Res Sports Med. 27, 298-313 (2019).
  18. Clemente, F. M., Sarmento, H. Combining small-sided football games and running-based methods: a systematic review. Biol Sport. 38, 617-627 (2021).
  19. Hu, W., Li, B., Li, C., Zhang, T. An integrated intelligent decision system for physical health evaluation of college students with fuzzy number intuitionistic fuzzy information. J Intell Fuzzy Syst. 44, 611-624 (2023).
  20. Cao, L. Design and optimization of a decision support system for sports training based on data mining technology. Sci Program. 2022, 1846345(2022).
  21. Li, L., Zhang, Z., Zhang, S. Hybrid algorithm based on content and collaborative filtering in recommendation system optimization and simulation. Sci Program. 2021, 4(2021).
  22. Shi, W., Wang, L., Qin, J. User embedding for rating prediction in SVD++-based collaborative filtering. Symmetry. 12, 121(2020).
  23. Hasan, M., Roy, F. An item–item collaborative filtering recommender system using trust and genre to address the cold-start problem. Big Data Cogn Comput. 3, 39(2019).
  24. Duan, R., Jiang, C., Jain, H. K. Combining review-based collaborative filtering and matrix factorization: a solution to rating sparsity. Decis Support Syst. 156, 113748(2022).
  25. Multi-view transformation in recommender systems. Ho, T. L., Le, A. C. Proc 2021 Int Conf Syst Sci Eng (ICSSE), , IEEE. 88-91 (2021).
  26. Detector-free weakly supervised group activity recognition. Kim, D., Lee, J., Cho, M., Kwak, S. Proc IEEE CVF Conf Comput Vis Pattern Recognit (CVPR), , 20083-20093 (2022).
  27. Wensel, J., Ullah, H., Munir, A. ViT-RET: vision and recurrent transformer neural networks for human activity recognition in videos. IEEE Access. 11, 72227-72249 (2023).
  28. Alomar, K., Aysel, H. I., Cai, X. CNNs, RNNs and transformers in human action recognition: a survey and a hybrid model. Artif Intell Rev. 58, 1-44 (2025).
  29. Social adaptive module for weakly supervised group activity recognition. Yan, R., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 224-238 (2020).
  30. Zhang, Y., et al. FairMOT: on the fairness of detection and re-identification in multiple object tracking. Int J Comput Vis. 129, 3069-3087 (2021).
  31. Towards real-time multi-object tracking. Wang, Z., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 22-107 (2020).
  32. Shuvo, M. R., Mekala, M. S., Elyan, E. Deep learning and attention-based methods for human activity recognition and anticipation: a comprehensive review. Cogn Comput. 17, 1-28 (2025).
  33. Alqarafi, A., Almogadwy, B. TAT-SARNet: a transformer-attentive two-stream soccer action recognition network with multi-dimensional feature fusion and hierarchical temporal classification. Mathematics. 13, 3011(2025).
  34. Detection recovery in online multi-object tracking with sparse graph tracker. Hyun, J., Kang, M., Wee, D., Yeung, D. Y. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 4839-4848 (2023).
  35. Mukhtar, H., Khan, M. U. G. STMMOT: advancing multi-object tracking through spatiotemporal memory networks and multi-scale attention pyramids. Neural Netw. 168, 363-379 (2023).
  36. Dataset used for intraclass correlation coefficient reliability analysis. , https://docs.google.com/spreadsheets/d/1c3bZNClvy8TP7RBspwRI0z7R8-n5Wy5H (2021).
  37. Ma, X., et al. feature extraction within a complex urban area with an improved 3D-CNN using airborne hyperspectral data. Remote Sens. 15, 992(2023).
  38. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  39. Wang, X., Guo, Y. Intelligent football players’ motion recognition system based on convolutional neural network and big data. Heliyon. 9, e19822(2023).
  40. Paneru, B., et al. Enhancing soccer pass receiver prediction in broadcast images through advanced deep learning techniques: a comprehensive study on model optimization and performance evaluation. J Soft Comput Explor. 5, 115-121 (2024).
  41. Shot prediction in the attacking third based on spatio-temporal features: a dynamic time-series model approach. Gong, B., et al. Proc 4th Int Conf Inf Technol Contemp Sports (TCS), , IEEE. (2024).
  42. Yang, K. O., Koh, J., Choi, J. W. Unified contrastive fusion transformer for multimodal human action recognition. arXiv. , (2023).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Transformer Modeliok Modlu F zyonFutbol Analiti iOyuncu Konumland rmasKarar S n fland rmasznitelik kar mGer ek Zamanl TahminVideo Analizi

İlgili makaleler