Bu çalışma, bir Çok Ölçekli Evrişimli Sinir Ağı (MSCNN) ile Uzun Kısa Süreli Bellek (LSTM) ağını entegre eden, spor videolarındaki eylem tanıma için iki aşamalı bir derin öğrenme çerçevesi kullanmıştır. Model geliştirme ve değerlendirme için UCF11, UCF Sports ve JHMDB adlı halka açık kıyaslama veri setleri kullanılmıştır. İnsan katılımcılardan yeni veri toplanmamış, kişisel olarak tanımlanabilir hiçbir bilgiye erişilmemiş veya bu bilgiler işlenmemiştir. Çalışma, halka açık anonimleştirilmiş veri setlerinin ikincil analizini içerdiğinden ve doğrudan insan katılımı gerektirmediğinden, kurumsal etik onay ve bilgilendirilmiş onam alınmasına gerek duyulmamıştır.
İş akışı, kare örnekleme ve zamansal normalizasyonun ardından MSCNN modülü kullanılarak özellik çıkarımından oluşmuştur. Çıkarılan özellikler daha sonra zamansal modelleme için bir LSTM ağı kullanılarak işlenmiş ve ardından çok sınıflı bir sınıflandırma katmanına aktarılmıştır. Son olarak model, seçilen kıyaslama veri setleri kullanılarak eğitilmiş ve değerlendirilmiştir. Şekil 1 önerilen çerçevenin genel mimarisini göstermektedir.

Şekil 1: Spor videosu aksiyon tanıma için önerilen MSCNN-LSTM çerçevesi. Video ön işleme, çok ölçekli uzamsal özellik çıkarımı, zamansal dizi öğrenimi ve aksiyon sınıflandırmasını gösteren genel iş akışı. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Şekil 1, hibrit MSCNN-LSTM mimarisine dayalı olarak önerilen spor videosu eylem tanıma çerçevesinin iş akışını göstermektedir. Süreç, futbol vuruşu, binicilik ve golf vuruşu gibi çeşitli atletik eylemler içeren spor video klipleriyle başlar. Ham videolar, ön işleme aşamasında tekil karelere ayrılmış; burada kareler kırpılmış, standardize edilmiş ve model girişi için hazırlanmıştır. Ön işlemeden geçen kareler daha sonra özellik çıkarımı için MSCNN modülüne beslenmiştir. Çok ölçekli evrişimli mimari, farklı alıcı alanlardaki uzamsal özellikleri yakalayarak spor videosu karelerinden hem yerel hem de bağlamsal bilgilerin çıkarılmasını sağlar. Çıkarılan özellik vektörleri daha sonra, zamansal bağımlılıkları ve ardışık kareler boyunca hareketin evrimini modellemek üzere LSTM ağı tarafından işlenmiştir. Son olarak, sınıflandırma ve eğitim modülü, her bir video klibi için eylem kategorisini tahmin etmek amacıyla öğrenilen uzay-zamansal temsilleri kullanmıştır. Önerilen çerçeve, UCF11 (YouTube Actions), UCF Sports ve JHMDB kıyaslama veri kümeleri kullanılarak yapılan veri toplama ve ön işlemeyle başlayan dört ardışık adımdan oluşmaktadır. Her bir spor videosu, çevresel varyasyonlara karşı dayanıklılığı artırmak amacıyla yeniden boyutlandırılan, normalize edilen ve döndürme, çevirme ve kırpma yoluyla zenginleştirilen bir dizi kareye dönüştürülmüştür. Ön işlemeden geçen kareler daha sonra, 3 × 3, 5 × 5 ve 7 × 7 çekirdeklere sahip paralel evrişimli dalların tamamlayıcı yerel ve bağlamsal uzamsal özellikleri çıkardığı önerilen Çok Ölçekli Evrişimli Sinir Ağı (MSCNN) tarafından işlenmiştir. Bu çok ölçekli özellikler, kompakt özellik temsilleri oluşturmak için toplu normalizasyon (batch normalization) ve maksimum havuzlama (max pooling) kullanılarak birleştirilmiş ve rafine edilmiştir. Ortaya çıkan kare düzeyindeki özellikler, ardışık kareler arasındaki zamansal bağımlılıkları modellemek için daha sonra bir Uzun Kısa Süreli Bellek (LSTM) ağına aktarılmıştır. Nihai LSTM çıktıları düzleştirilmiş ve ReLU aktivasyonuna sahip tam bağlantılı katmanlardan geçirildikten sonra, eylem kategorisini tahmin etmek için bir Softmax sınıflandırıcıya iletilmiştir. Ağ, aşırı öğrenmeyi azaltmak için çapraz entropi kayıp fonksiyonu ve dropout düzenlemesi ile Adam optimize edici kullanılarak eğitilmiştir. Model performansı son olarak UCF11, UCF Sports ve JHMDB kıyaslama veri kümeleri üzerinde doğruluk, kesinlik, geri çağırma ve F1-skoru kullanılarak değerlendirilmiştir.
1. Veri toplama ve ön işleme
Bu çalışmada, spor ve insan hareketleri için halka açık üç kıyaslama veri seti kullanılmıştır. Bu veri setleri; değişen kamera hareketleri, bakış açıları ve arka plan karmaşıklığına sahip gerçek dünya spor görüntülerini içermektedir. Spesifik olarak çalışma, yaklaşık 25 kişiden kaydedilen 1.168 YouTube videosundan toplanan ve her hareket için birden fazla örnek içeren 11 hareket kategorisine sahip UCF11 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php) veri setini kullanmıştır. Joint-Annotated Human Motion Database (JHMDB)34,35 21 hareket sınıfı ve 928 adet açıklama eklenmiş video içermektedir. UCF Sports veri seti ise yayın kaynaklarından alınan 720 × 480 piksel çözünürlüğe sahip 10 hareket sınıfı ve 150 video dizisinden oluşmaktadır (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).
Kolektif olarak bu veri setleri, hem bireysel hem de takım sporlarını kapsamakta olup, önerilen MSCNN-LSTM eylem tanıma çerçevesini değerlendirmek için zamansal süre ve görsel ölçek bakımından çeşitlilik sağlamaktadır. Veri kalitesi tarama sürecinin bir parçası olarak UCF11, UCF Sports ve JHMDB veri setleri; bozuk videolar, yinelenen dosyalar ve eksik açıklamalı klipler açısından incelenmiştir. Bu dışlama kriterlerini karşılayan herhangi bir örnek belirlenmemiştir; bu nedenle, mevcut tüm videolar sonraki analizler için saklanmıştır. Veri setleri daha sonra, tutarlı bir rastgele bölme stratejisi kullanılarak eğitim (%70), doğrulama (%15) ve test (%15) alt kümelerine ayrılmıştır. Şekil 2, eğitim ve değerlendirme için kullanılan temsili görüntüleri sunmaktadır.

Şekil 2: Karşılaştırmalı spor hareket tanıma veri setlerinden temsili kareler. Paneller (A–D) UCF11 (YouTube Actions) veri setinden, paneller (E–H) UCF Sports veri setinden ve paneller (I–L) JHMDB veri setinden örnekler göstermektedir. Kareler; hareket sınıfları, bakış açıları, arka planlar, aydınlatma koşulları ve hareket karmaşıklığındaki varyasyonları örneklendirmektedir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
Önerilen eylem tanıma modeli, Tablo 3'te özetlendiği üzere UCF11, UCF Sports ve JHMDB kıyaslama veri kümeleri üzerinde değerlendirilmiştir. Bu veri kümeleri, çeşitli hareket modellerini ve zorlayıcı çevresel koşulları temsil etmektedir. UCF11 (YouTube Actions) veri kümesi, farklı aydınlatma, bakış açısı ve arka plan koşulları altında elde edilmiş 11 sınıftan spor eylemlerini içermektedir. UCF Sports veri kümesi, gerçekçi hareket dizilerini içeren, profesyonel yayınlardan alınmış 150 saha sporu videosundan oluşmaktadır. JHMDB veri kümesi, 21 ince taneli eylem kategorisi için ayrıntılı insan hareketi açıklamaları sunmakta ve uzaysal-zamansal eylem tanıma için bir kıyaslama veri kümesi görevi görmektedir. Bu veri kümeleri birlikte, spor ve insan eylemi senaryolarında model performansını değerlendirmek için kullanılmıştır. Ağ, Adam optimize edici kullanılarak 32'lik bir grup boyutu, 0,001'lik başlangıç öğrenme hızı ve bir çapraz entropi kayıp fonksiyonu ile 100 epok boyunca eğitilmiştir. Nihai değerlendirme için en düşük doğrulama kaybına sahip model seçilmiştir. Tüm deneylerde 42'lik sabit bir rastgele tohum kullanılmıştır. Yakınsamayı iyileştirmek için erken durdurma ve platoda öğrenme hızı azaltma uygulanmış; LSTM eğitimi sırasında patlayan gradyanları önlemek için 5,0 eşiğiyle gradyan kırpma kullanılmıştır. Önerilen MSCNN-LSTM modeli yaklaşık 15 milyon eğitilebilir parametre içermektedir. Uygulama için kullanılan donanım ve yazılım yapılandırması Tablo 4'te özetlenmiştir. Sınıf dağılımları yeterince dengeli olduğundan, herhangi bir ek sınıf ağırlıklandırma veya yeniden örnekleme prosedürü uygulanmamıştır. Karşılaştırma modelleri, orijinal çalışmalarında rapor edilen hiperparametreler kullanılarak uygulanmış ve eğitim ayarları mümkün olduğunca uyumlu hale getirilmiştir. Performans değerleri, farklı rastgele başlatmalarla yapılan beş bağımsız çalışmanın ortalaması ± standart sapması olarak rapor edilmiştir. Önerilen model ile karşılaştırma modelleri arasındaki farklar, p < 0,05 anlamlılık eşiğinde eşleştirilmiş t-testleri kullanılarak değerlendirilmiştir.
| Veri Kümesi | Sınıf Sayısı | Video Sayısı | Çözünürlük (px) | Lütfen çevrilecek kaynak metni sağlayın. | Açıklama |
| UCF11 (YouTube İşlemleri) | 11 | 1168 | Değişken (≈ 320×240) | Central Florida Üniversitesi | Sporlardan 11 insan eylemini içerir (örn. basketbol şutu, dalış, golf vuruşu, futbolla sektirme). Videolar, aydınlatma, bakış açısı ve arka plan açısından yüksek varyasyona sahip olacak şekilde YouTube'dan toplanmıştır. |
| UCF Sporları | 10 | 150 | 720×480 | UCF Spor Aksiyonu Veri Seti | Gerçek televizyon yayını görüntülerinden (BBC, ESPN) kaydedilmiş olan dalış, binicilik, golf vuruşu, koşu ve halter gibi spor aktivitelerini içerir. |
| JHMDB | 21 | 928 | 320×240 | Max Planck Akıllı Sistemler Enstitüsü | Hareket ve poz analizi için eklem açıklama notları içeren; yakalama, zıplama, saç tarama, şut çekme ve koşma gibi günlük ve sportif aktiviteleri kapsar. |
Tablo 3: Eğitim ve değerlendirme için kullanılan kıyaslama veri setlerinin özellikleri. Aksiyon sınıfı sayısı, video örnekleri, veri seti özellikleri ve model eğitimi, doğrulama ve test süreçlerindeki rolleri dahil olmak üzere UCF11, UCF Sports ve JHMDB veri setlerinin genel görünümü.
| Kullanılan Parametreler | Açıklama |
| Programlama Dili | Python 3.8.18 [4] |
| Derin Öğrenme Çerçevesi | TensorFlow 2.15.0 [1] |
| GPU Hızlandırıcı | NVIDIA GeForce RTX 3090 (24 GB VRAM) [1] |
| CPU (Merkezi İşlem Birimi) | Intel Core i9 @ 3,5 GHz × 16 Çekirdek |
| İşletim Sistemi | Windows 11 |
| Bellek (RAM) | 64 GB DDR4 |
| Optimize Edici | Adam (öğrenme oranı = 0,001) |
| Yığın Boyutu | 32 |
| Epok Sayısı | 100 |
| Aktivasyon Fonksiyonları | ReLU (CNN katmanları), Softmax (çıkış katmanı) |
| Terk Oranı | 0.5 |
Tablo 4: Önerilen MSCNN-LSTM modelinin simülasyon ortamı ve hiperparametre konfigürasyonu. Donanım özellikleri, yazılım ortamı, optimize edici ayarları, öğrenme oranı, grup boyutu, epok sayısı, giriş boyutları ve model eğitimi ile değerlendirmesi sırasında kullanılan diğer hiperparametreler.
2. Ön işlem
Eğitimden önce, her bir ham video zaman sıralı kare dizilerine dönüştürülmüş; ardından normalize edilmiş, zamansal olarak örneklenmiş ve artırılmıştır. Her bir giriş videosu V önce bir kareler dizisine dönüştürülmüş ve 4B bir tensör olarak temsil edilmiştir V ∈ RT×H×W×C, burada T kare sayısıdır, H × W i kare dizinini belirtir ve C renk kanallarının sayısını ifade eder (RGB için 3). Ön işleme hattı; kare çıkarma, mekansal yeniden boyutlandırma ve ardından sabit bir çözünürlüğe merkezden veya rastgele kırpma işlemlerinden oluşmuştur (H′, W′), piksel başına yoğunluk normalizasyonu ve özellik çıkarımı öncesinde rastgele çevirme, ölçeklendirme ve renk titremesini içeren isteğe bağlı veri artırımı gerçekleştirilmiştir. Somut olarak yoğunluk normalizasyonu, Denklem (1)'de olduğu gibi standart skor normalizasyonu şeklinde uygulanmıştır.
(1)
burada μ, σ eğitim seti üzerinden hesaplanan kanal ortalamaları ve standart sapmalarıdır veya Denklem (2)'deki gibi min–max ölçeklendirmesi şeklinde uygulanır.
(2)
Normalizasyondan sonra, her kare F̃t ∈ RH′×W′×C′ olarak ve sonuçlanan video tensörü V′ ∈ RT×H′×W′×C olarak temsil edilmiştir. Çok ölçekli evrişimli ön uçta, farklı çekirdek boyutlarına sahip birkaç 2-B (veya erken uzay-zamansal evrişimler için 3-B) evrişim uygulanarak birden fazla alıcı alan uzaysal özellik haritası elde edilmiştir; ardından her kare veya kısa video klip için zamansal bir özellik temsili oluşturulmuş ve LSTM modülüne aktarılmıştır. Orijinal makale, zamansal modelleme için önce MobileNetV2 ve ardından Deep BiLSTM uygulamaktadır; yukarıdaki aynı ön işleme hattı, çok ölçekli evrişim + LSTM değişimi ile tam uyumludur.
3. Örnekleme ve zamansal normalizasyon
Video uzunlukları T veri setleri arasında ve kendi içinde farklılık gösterdiğinden, çok ölçekli konvolüsyon + LSTM'e kareler veya kısa kesitler cinsinden sabit bir N giriş uzunluğu sağlamak için kareleri tekdüze örnekliyoruz veya zamansal olarak yeniden örnekliyoruz. Tekdüze kare indisleri Denklem (3)'te olduğu gibi hesaplanabilir,
(3)
böylece, örneklenen kare dizisi Vs = {F̃t0, …, F̃tN−1} şeklindedir. Daha hassas bir zamansal sadakat gerektiğinde, doğrusal zamansal interpolasyon uygularız: Denk. (4)'te hesaplandığı gibi herhangi bir yeniden örneklenmiş kesirli zaman τ ∈ [0, T−1] için.
(4)
böylece yeniden örneklenen Vs dizisi tam olarak N kareye sahip olur ve pürüzsüz hareketi korur. Alternatif olarak, kısa ardışık kliplerle örnekleme (adım aralığı s olan zamansal pencere uzunluğu w), her bir klibin Cj ∈ RT×H′×W′×C ve j = 0, …, ⌊(T − w)/s⌋ olduğu bir klip tensörleri kümesi üretir. Ağ içindeki zamansal normalizasyon için, birden fazla ölçekte basit bir zamansal havuzlama etkilidir: çok ölçekli evrişimler tarafından üretilen bir zamansal özellik dizisi X = {x1, …, xN} verildiğinde, Denklem (5)'te olduğu gibi havuzlanmış özellikler uygulanır.
(5)
burada Sk, k ölçeği için zamansal destek (örneğin, Sk örtüşmeyen bloklar veya genişletilmiş indeksler olabilir) ve mk = |Sk|'dir.
Öznitelik çıkarımı öncesinde, tüm videolar 224 × 224 piksel boyutuna ölçeklenmiş ve saniyede 25 kare hızında örneklenmiştir. Her deneyde 32 karelik sabit bir dizi uzunluğu kullanılmıştır. Veri artırma teknikleri arasında rastgele kırpma (ölçek = 0.8–1.0), rastgele döndürme (±15°), rastgele yatay çevirme (olasılık = 0.5) ve parlaklık modifikasyonu (±20%) yer almıştır. Piksel değerlerini standartlaştırmak için ImageNet ortalama değerleri [0.485, 0.456, 0.406] ve standart sapmaları [0.229, 0.224, 0.225] kullanılmıştır. Her video dizisi için zamansal örneklemede tekdüze kare seçimi uygulanmıştır. Daha uzun videolar, tutarlı bir dizi uzunluğunu korumak için tekdüze şekilde kırpılmış veya örneklenmiş, 32 kareden daha az olan videolar ise sıfır ile doldurulmuştur. Eğitim ve değerlendirme boyunca bu ayarlar sabit olarak kullanılmıştır.
4. MSCNN kullanılarak öznitelik çıkarımı
Spor videolarındaki aksiyonların uzamsal temsilini geliştirmek için Çok Ölçekli Konvolüsyonel Sinir Ağı (MSCNN) kullanılmıştır. Tek bir çekirdek boyutuna dayanan geleneksel konvolüsyonel sinir ağları, özellikleri birden fazla uzamsal ölçekte yakalama konusunda sınırlı kapasiteye sahip olabilir. Bazı spor aksiyonları benzer görsel özellikler sergilediği için, tek ölçekli bir konvolüsyonel mimarinin hem yerel hem de küresel özellikleri aynı anda yakalaması zor olabilir. Bu sınırlamayı gidermek için, önerilen çerçeve, çok ölçekli özellik çıkarımı ve özellik füzyonu gerçekleştirmek üzere farklı boyutlardaki konvolüsyonel çekirdekleri kullanmaktadır.
Önerilen ağ mimarisinde, kanallar arası bilgileri düzenlemek ve giriş özellik haritalarının boyutunu azaltmak için 1 × 1 konvolüsyon çekirdekleri kullanılmıştır. Ayrıca bu katmanlar, ek özellik dönüşümleri ve doğrusal olmayan temsiller getirerek ağın ifade kapasitesini artırmaktadır. Farklı boyutlardaki konvolüsyon çekirdekleri, çoklu ölçeklerde uzamsal bilgilerin çıkarılmasını sağlar. Eğitim stabilitesini artırmak için ağırlıklı çok ölçekli özellik füzyonunu takiben sıralı normalizasyon gerçekleştirilir. Derin ağ eğitimindeki gradyan kaybolması ve gradyan patlaması sorunlarını hafifletmek amacıyla, önerilen mimari rezidüel bağlantılar ve LSTM tabanlı zamansal modelleme kullanmaktadır.
Çok ölçekli tasarım, ağın farklı uzamsal çözünürlüklerdeki özellikleri yakalama yeteneğini artırır ve özellik temsil kapasitesini geliştirir. Ayrıca, geleneksel N × N konvolüsyon çekirdeği, N × 1 ve 1 × N konvolüsyon işlemlerine ayrıştırılmıştır. MSCNN modülünde kullanılan N × 1 ve 1 × N konvolüsyonları, tekil video karelerinden tamamlayıcı yönsel ve çok ölçekli uzamsal özellikler yakalamak için tasarlanmıştır. Bu konvolüsyonel işlemler, farklı alıcı alan ölçeklerindeki kalıpları çıkararak uzamsal özellik temsilini güçlendirir. Ardından, ardışık kareler arasındaki zamansal ilişkiler, eylem tanıma için uzun süreli zamansal bağımlılıkları öğrenmek amacıyla MSCNN tarafından çıkarılan özellik dizisini işleyen LSTM modülü tarafından modellenir.
Her bir spor videosu V = {F1, F2, …, FT} toplam T kareye ayrıştırılır. Örneğin oyuncu pozu, hareket bulanıklığı, top yörüngesi gibi mekansal varyasyonları kodlamak için; 3 × 3, 5 × 5 ve 7 × 7 çekirdek boyutlarına karşılık gelen s ∈ {1, 2, 3} üç farklı ölçekte evrişimsel dallar çalışır. Her bir dal, Denklem (6)'da olduğu gibi özellik haritalarını çıkarır:
(6)
Ws ve bs sırasıyla s ölçeğindeki konvolüsyonel ağırlıklar ve sapmalar, σ ise ReLU aktivasyonudur. Çok ölçekli füzyon katmanı, özellikleri Denklem (7)'de olduğu gibi toplar:
(7)
Bu birleştirilmiş öznitelik tensörü, hem ince taneli hareket ipuçlarını hem de grup etkinlikleri gibi geniş alanlı bağlamsal bilgileri gömer. Şekil 3 yalnızca MSCNN öznitelik çıkarma modülünü göstermektedir. Zamansal modelleme ve sınıflandırma için kullanılan LSTM katmanı (256 gizli birim), yoğun katman (128 nöron) ve dropout katmanı (0,5), Şekil 4'te ayrı olarak sunulmuştur.

Şekil 3: Önerilen Çok Ölçekli Konvolüsyonel Sinir Ağı (MSCNN) özellik çıkarım modülü. 3 × 3, 5 × 5 ve 7 × 7 çekirdek boyutlarına sahip üç paralel konvolüsyonel dal, birbirini tamamlayan çok ölçekli uzamsal özellikleri çıkarır ve bu özellikler LSTM ağı ile zamansal modelleme yapılmadan önce birleştirilir. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

Şekil 4: Spor videolarında eylem tanıma için önerilen LSTM mimarisi. LSTM modülü, ardışık video kareleri boyunca giriş, unutma ve çıkış kapısı işlemleri aracılığıyla zamansal bağımlılıkları modeller. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayınız.
Şekil 3 spor videolarında eylem tanıma için önerilen Çok Ölçekli Evrişimli Sinir Ağı (MSCNN) özellik çıkarma modülünü göstermektedir. Giriş video kareleri; tamamlayıcı ince ve kaba taneli uzamsal özellikleri yakalamak amacıyla, her biri 64 filtre içeren 3 × 3, 5 × 5 ve 7 × 7 çekirdek boyutlarına sahip üç evrişimli dal boyunca paralel olarak işlenmiştir. Çıktılar; Batch Normalization, ReLU aktivasyonu ve 2 × 2 maksimum havuzlama kullanılarak rafine edilmiş, ardından birleştirilmiş ve 128 filtreli 1 × 1'lik bir evrişimle füzyonlanmıştır. Bir rezidüel atlama bağlantısı, düşük seviyeli uzamsal bilgileri korumuş ve gradyan akışını iyileştirmiştir. Füzyonlanmış özellik haritaları düzleştirilmiş ve zamansal modelleme için 256 gizli birimli bir LSTM katmanına; ardından 128 nöronlu tam bağlantılı bir katmana, ReLU aktivasyonuna ve Softmax katmanı kullanılarak yapılan nihai sınıflandırmadan önce 0,5'lik bir dropout oranına aktarılmıştır. Çok ölçekli özellik haritaları (f1Lütfen çevirmemi istediğiniz metni sağlayın., f2Lütfen çevirilecek metni sağlayın.ve f3Lütfen çevirmemi istediğiniz metni paylaşın.) birleştirilerek füzyon temsili oluşturulmuştur (FLütfen çevrilmesini istediğiniz metni sağlayın.), ardından sonraki katman için çıktı özellik haritasını oluşturmak amacıyla 3 × 3'lük bir konvolüsyon ile daha da geliştirilmiştir. Bu hiyerarşik mimari, birden fazla alıcı alanda tamamlayıcı uzamsal özelliklerin öğrenilmesini sağlayarak spor aksiyonu tanıma performansını artırmıştır.
5. LSTM kullanılarak zamansal modelleme
Video kenarları boyunca zamana dayalı evrimi modellemek için, dinamik bağımlılıkları ve hareket sürekliliğini yakalamak amacıyla birleştirilmiş özellik dizisi LSTM sistemine sağlanmıştır. Her bir giriş videosu için, önce kare başına çok ölçekli CNN özellikleri çıkarılmıştır. Video kareleri I1, …, IT olsun. Her bir t karesi ve her bir s ölçeği için, çok ölçekli evrişimli kodlayıcı bir ft(s) ∈ Rd özellik vektörü üretir. Daha sonra, Denklem (8)'de olduğu gibi projeksiyon + birleştirme veya ağırlıklı toplam yoluyla ölçekler tek bir kare tanımlayıcıda birleştirilir:
(8)
Ardından, zamansal dinamikleri modellemek için {xt}tT=1 dizisini bir LSTM'ye besleyin. Standart LSTM notasyonunda, t zamanındaki kapılar ve durumlar Denklem (9) ila (13)'te yer almaktadır:
(9)
(10)
(11)
(12)
(13)
Burada σ sigmoid aktivasyonunu, ⊙ ise eleman bazlı çarpımı temsil eder.) Çift yönlü LSTM mimarileri hem geçmiş hem de gelecek zamansal bağlamı yakalamak için kullanılabilse de, önerilen çerçeve, ardışık video kareleri arasındaki zamansal bağımlılıkları modellemek için standart bir LSTM kullanmaktadır. Bu tasarım seçimi, bu çalışmada sunulan MSCNN-LSTM mimarisi ile tutarlıdır. Klip işlendikten sonra, bir klip temsili elde edilmiştir (örneğin, son gizli durum veya zamansal havuzlama): z = Poolt(vt).
Şekil 4, spor aksiyonu tanıma için önerilen LSTM mimarisinin iş akışını göstermektedir. Ağ, bir dizi video karesi veya CNN ile çıkarılmış özellikleri almış ve bunları ardışık zaman adımları (t−2, t−1 ve t) boyunca işlemiştir. Her bir LSTM hücresi, ağ üzerindeki bilgi akışını düzenleyen bir giriş kapısı, bir unutma kapısı ve bir çıkış kapısından oluşmuştur. Giriş kapısı yeni bilgileri hücre durumuna dahil etmiş, unutma kapısı ilgisiz zamansal bilgileri atmış ve çıkış kapısı bir sonraki zaman adımına aktarılan gizli durumu oluşturmuştur. Hücre durumu uzun vadeli zamansal bağımlılıkları korurken, gizli durum kısa vadeli zamansal bilgileri yakalamıştır. Ardışık işlemenin ardından, LSTM çıktıları zamansal bir özellik temsili oluşturmak için havuzlanmış ve bu temsil, ilgili spor aksiyonunu tahmin etmek üzere tam bağlantılı bir katmana ve bir Softmax sınıflandırıcısına aktarılmıştır. Ağ; 32'lik bir grup boyutu, 0,001 başlangıç öğrenme oranı ve bir çapraz entropi kayıp fonksiyonu ile Adam optimize edici kullanılarak 100 epok boyunca eğitilmiştir. Final değerlendirmesi için en düşük doğrulama kaybına sahip model seçilmiştir. Tekrarlanabilirliği sağlamak adına tüm deneyler 42 sabit rastgele tohum (random seed) kullanılarak yürütülmüştür. Yakınsamayı iyileştirmek için erken durdurma ve platoda öğrenme oranını düşürme yöntemleri uygulanmış ve LSTM eğitimi sırasında gradyan patlamasını önlemek için 5,0 eşik değerli gradyan kırpma işlemi gerçekleştirilmiştir. Önerilen MSCNN-LSTM modeli yaklaşık 15 milyon eğitilebilir parametre içermiştir.
Final sınıf skorları ve olasılıklar, Denk. (14)'te olduğu gibi bir doğrusal katman + softmax kullanır:
(14)
Eq. (15)'te olduğu gibi, etiketli klipler üzerindeki çapraz entropi kaybını minimize ederek eğitin:
(15)
burada Nb grup boyutunu, C sınıf sayısını ve y(n) one-hot gerçek değerini temsil eder. Düzenleme ( xt/LSTM çıktıları üzerinde dropout, ağırlık azalımı) uygulanmıştır. Uzun spor sekansları için kararlılığı artırmak amacıyla gradyan kırpma uygulanır.