$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu çalışma, genellikle video gözden geçirme olarak adlandırılan genel video özetleme kategorisine giren çok modlu denetimli bir video özetleme yöntemi önermektedir. Bu, daha büyük bir videonun önemli bölümlerini bulmaya ve videonun geçici olarak yoğunlaştırılmış bir versiyonunu oluşturmaya odaklanan teknikleri içerir. Bu çalışma, Şekil 1'de gösterildiği gibi, işitsel ve görsel temsilleri içeren 1 saniyelik bölümlerde video akışını analiz etmek için denetimli bir teknik önermektedir. Bu bölümler daha sonra "ilgi çekici olmayan" veya "bilgilendirici" olarak kategorize edilir. Sentetik veya simüle edilmiş verilerin aksine, "gerçek veriler" artık deneyler için kullanılan gerçek video veri kümelerini ifade ediyor. Yüksek hareket, ses veya sahne geçişleri gibi özetleme için gerekli olan önemli görsel-işitsel sinyalleri sağlayan video bölümlerine "bilgilendirici bölümler" denir. "İlginç olmayan" kısımlar, özete yeni bir şey katmayan tekrarlayan veya gereksiz çerçeveler olarak tanımlanır.
Giriş videoları karelere bölünür ve önerilen GARNN modeli kullanılarak her kareden çok modlu özellikler çıkarılır. İşitsel ve görsel özellikler birleştirilir ve gereksiz çerçevelerin daha sonraki işlemler için kaldırıldığı boyut azaltma aşamasına girdi olarak beslenir. Son olarak, önerilen AELSTM, video özetleme için azaltılmış verilere uygulanır. Bunu başarmak için çoklu modaliteler adı verilen görsel, işitsel veya karma modalitelerden özellik temsilleriyle eğitilmiş denetimli bir ikili sınıflandırıcı kullanılır.

Şekil 1: Önerilen video özetleme modeline genel bakış. Ardışık düzen, AELSTM kullanarak çok modlu özellik çıkarma, boyut azaltma ve özet oluşturmayı içerir. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.
Dataset
Önerilen çözümlerin etkinliği, statik video özetlemede bir çift kıyaslama veri kümesi olan VSUMM17 ve SumMe18 veri kümeleri kullanılarak belirlenir. LSTM ile AlexNet kullanılarak oluşturulan CNN özellikleri ve gerçek veriler veri setleri arasında yer almaktadır. Gerçek veriler ve veri kümeleri genel halk tarafından erişilebilir19. VSUMM veri kümesindeki 50 film, YouTube gibi web sitelerinden alınmıştır ve saniyede 30 kare hızında 110 dakika sürer. Çizgi filmler, haberler, spor, reklam, TV dizileri ve ev videoları dahil olmak üzere çeşitli türlerde gelirler. Bunlardan 25'i, tanınmış YouTube sitesinden alınan ve insan tarafından oluşturulan en az 15 özet (toplamda 390) ile etiketlenen tatil, festival ve sporlardan oluşan "SumMe"20 video özeti veri setini oluşturuyor. Videoların süre aralığı 1-6 dakikadır.
Orijinal video, özellik çıkarma için önceden eğitilmiş önerilen GARNN modeline girdi olarak beslenen RGB görüntülerine dönüştürülür. Bu model AlexNet ve kapılı bir RNN'den oluşur. Orijinal özellik sayısı 64'tür ve AlexNet'in özellikleri 4100 özelliğe sahiptir.
Önerilen Geçitli-AlexNet-RNN tabanlı özellik ayıklama
Videoları özetlemek için bilgilerin hem görsel hem de işitsel modları kullanılmıştır. Her iki modalitede de bir özellik temsili elde etmek için, resim alma, video sınıflandırma, işitsel sahne analizi ve müzik bilgisi alma gibi işitsel ve görsel kümeleme ve sınıflandırma görevlerinde sıklıkla kullanılan el yapımı özellikleri belirledik. Amaç, mümkün olduğunca çok sayıda öğretici görsel ve işitsel bileşeni dahil etmekti. Şekil 2 , işitsel ve görsel modaliteler için özellikleri çıkarmak için kullanılan sürecin kavramsal bir gösterimini göstermektedir.

Şekil 2: Önerilen çok modlu GARNN tabanlı özellik çıkarımı. Hem görsel hem de işitsel modalitelerden özellikler AlexNet ve GARNN bileşenleri kullanılarak çıkarılır. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.
Geçitli- AlexNetRNN: (GARNN)
Sanal görüntü analizi için CNN, popüler bir DL modeli21'dir. Genel olarak, CNN görüntüyü bir girdi olarak kullanır ve onu birkaç gruba ayırır. Giriş nöronları, evrişimli havuzlamalı bir katman dizisi, tamamen bağlantılı katmanlar ve normalleştirici katmanlar yapısını oluşturur22. Evrişim katmanının nöronları, dar bir bölge aracılığıyla önceki katmana bağlanır. Altlarındaki katmanlar, tamamen bağlı katmanların aktive edici nöronlarına tamamen bağlıdır. Denklem (1), tamamen bağlı bir fonksiyonun ileri ve geri yayılımını temsil eder.
(1)
(2)
Sol katmandaki inci nöronun aktivasyonu nerede
,
sol katmandakiinci nöronun gradyanı,sol katmandaki inci nöronun ağırlığıdır.
Son araştırma ilerlemelerinin bir sonucu olarak çok sayıda CNN tasarımı ortaya çıktı. Bu çalışmada AlexNet kullanılmıştır.
Şekil 3'te gösterilen AlexNet'in mimarisi, titiz ve iyi yapılandırılmış bir tasarımı yansıtmaktadır. Tamamen birbirine bağlı üç katman ve beş evrişim katmanı, sekiz öğrenme katmanını oluşturur. Sınıf etiketleri, son katmanın sonucunun softmax'ı etkinleştiren fonksiyona beslenmesiyle üretilir. İkinci, dördüncü veya beşinci katman çekirdekler, GPU paylaşımı yoluyla önceki seviyelerine bağlanır. İkinci ve üçüncü katman çekirdekleri birbirine tamamen bağlıdır. Normalleştirme katmanı, birinci ve ikinci seviyelerden sonra maksimum havuzlama katmanlarına bağlanır. ReLU, tüm öğrenme katmanlarıyla bağlantılıdır.

Şekil 3: AlexNet'in mimarisi. Özetleme modelinde görsel verileri işlemek için beş evrişimli katman ve üç tam bağlantılı katman kullanılır. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.
Çalışmanın birincil omurga ağı, yoğun katmanlı bir GARNN'dı. Kalın RNN'de üç katman vardır. İkinci katmanda 80 ve birinci katmanda 170 nöron ile tam bağlı iki (fc) katmandan oluşur. Aşağıdaki katmanlar toplu normalleştirme ve bırakmadır. Son katman olan fc, üç nörondan oluşur ve görüntüyü bölmek için kullanılır. LSTM'den sonra gelen yoğun tabaka, beyin tümörünün etrafındaki alanı böler. AlexNet, LSTM katman özelliklerini verir. Veri kümesi, bildirilen toplam dizi sayısına eşit olan en fazla 20 dilime sahiptir. GARNN'ın ilk katmanı 100 gizli birim içerirken, üçüncü katman 125 gizli birim içerir.
Geçit mekanizması, önerdiğimiz GARNN-AE-LSTM çerçevesinde AlexNet'in yoğun (tamamen bağlantılı) katmanına dahil edilmiştir. Evrişimli özellik haritaları genellikle AlexNet tarafından işlenir ve sınıflandırma için doğrudan tam bağlı katmanlara gönderilir. Gereksiz veya daha az önemli desenler de dahil olmak üzere alınan tüm uzamsal özellikler bu yöntemle eşit olarak ele alınır. Bunu, özellik filtresi olarak işlev gören ve sigmoidi temel alan bir geçit işlevi sunarak ele aldık. Matematiksel açıdan, bir kapı vektörü g = σ(wX) + b, yoğun katmanın çıktısını modüle eder ve σ sigmoid fonksiyonunu temsil eder. Eğitim sırasında bu kapı, 0 ile 1 arasında değişen çeşitli özellik aktivasyon ağırlıkları vermeyi öğrenir. Bunlar: (i) düşük geçit değerleri alakasız özellikleri (örneğin, arka plan gürültüsü veya gereksiz dokular) bastırır. (ii) Daha yüksek geçit değerleri, ayırt edici özellikleri vurgular (önemli nesne bölgeleri veya harekete duyarlı desenler gibi). (iii) Bu geliştirilmiş özellik seti daha sonra RNN bileşeni tarafından kullanılır ve bu, alakasız uzamsal bilgiler tarafından dikkati dağılmadan zamansal bağımlılıkları daha iyi yakalamasını sağlar. (iv) Geri yayılım, AlexNet ve RNN ile birlikte eğitim sırasında geçit parametrelerini değiştirmek için kullanılır. Bu, zaman içinde modelin hangi özelliklerin çıkarılacağına ek olarak özetleme için hangi yönlerin en önemli olduğunu öğrendiği anlamına gelir.
Şekil 4'te, X değişkeni girdi verilerini, C hücreyi ve H gizli durumu belirtir.

Şekil 4: Geçitli Tekrarlayan Sinir Ağı mimarisi (GARNN) modeli. GARNN, etkili dizi modelleme için toplu normalleştirmeyi, bırakmayı ve çoklu yoğun katmanları entegre eder. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.
Her blokta, sırasıyla Iw, Rw ve giriş, tekrarlayan ağırlık ve önyargı olarak adlandırılan önyargı gibi ilgili ağırlıklar, Denklem (3) ila Denklem (5)'te olduğu gibi kullanılmıştır
(3)
(4)
(5)
Belirli bir t zaman damgasında, hücrenin durumu Denklem (6)'daki gibi gösterilir
(6)
Hadamard'ın çarpımı ve gizli birimin durumu Denklem (7)'deki gibi gösterilir
(7)
Bu nedenle, ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23 kullanarak ilgili video dosyasından çıkarılan her ses klibi için segment düzeyinde ses özelliklerini hesaplamak için py Ses Analizi modülünü kullanır. Çıkarılan özellikler Tablo 1'de listelenmiştir. Bu işleme uygun olarak, ses özelliği çıkarma işlemi başlangıçta geçici olarak yapılır. Gösterimin son kısmı, ikinci düzeyde hesaplanan segment düzeyinde özellik istatistiklerinden oluşur. Spesifik olarak, ses sinyalinin her bir bölümü için kısa vadeli bir işlem gerçekleştirilir ve bu, her bölüm düzeyindeki pencere için örtüşen veya örtüşmeyen 68 kısa vadeli özelliğin (34 özellik ve 34 delta) hesaplanmasıyla sonuçlanır. Her videonun ses sinyalinden işitsel öğeleri çıkarmanın yanı sıra görsel bilgilerin içeriğini iletmek için çeşitli görsel özellikler kullandık. Bu yöntemin özet süreci için çok önemli olması beklenmektedir. multimodal_movie_analysis kitaplığı (https://github.com/tyiannak/multimodal_movie_analysis), bu görsel öğeleri çıkarmak için bir videonun görsel yönlerini yansıtan özellikleri ayıklamak için kullanılmıştır. Özellikle, aşağıda listelenen 88 görsel öğe her 0,2 saniyede bir eşleşen çerçeveden alınır. Bunda, çok modlu özellikler birleştirilir ve video özetleme yapılarak videoyu bilgilendirici ve ilgi çekici olmayan olarak sınıflandırmanın daha fazla analizi için toplam 59 özellik kullanılır.
PCA kullanarak özellik azaltma
Bu çalışmadaki özelliklerin boyutu, temel bileşen analizi (PCA) uygulanarak küçültülmüştür. Temel özellikler, önemlerini ve önemlerini artırmak için temel özelliklere dönüştürülür. PCA, çeşitli alanlarda çok sayıda araştırmacı tarafından yaygın olarak kullanılmaktadır24. Özdeğerler, özellikleri belirlemek için kullanılır. En yüksek özdeğer özellikleri seçilirken, en düşük özdeğer özellikleri kaldırılır.
Gereksiz çerçevelerin kaldırılmasının ardından, bu çalışmada isteğe bağlı bir özellik azaltma adımı olarak PCA kullanılmıştır. PCA, GARNN tarafından üretilen yüksek boyutlu özellik vektörlerini küçük bir alt uzaya sıkıştırarak gürültüyü ve gereksiz bilgileri bastırır. Bu, AE-LSTM'nin hesaplama verimliliğini artırırken, ana kare algılamaya en ayırt edici görsel ve işitsel ipuçlarının hakim olmasını garanti eder. Video özetlemede ölçeklenebilirlik ve doğruluğu dengelemek için PCA yararlı bir araç olarak kullanılır. Algoritma (Algoritma 1) Ek Dosya 1 olarak sağlanır.
Önceki çerçeveyle tamamen aynı veya çarpıcı bir şekilde karşılaştırılabilir olan herhangi bir çerçeve gereksiz olarak kabul edilir. Kare hızını değiştirmenin, kaldırılan video karelerinin oranı üzerinde bir etkisi olabileceği açıktır. Daha spesifik olarak, kare hızları arttıkça, ardışık kareler arasındaki benzerlik de artar ve bu da karelerin daha yüksek bir yüzdesinin kaldırılmasına yol açar. Şimdi, çekişmeli AE-LSTM modeli olarak adlandırılan ML modelini eğitmek için boyutluluğu azaltılmış özellikler kullanılıyor.
AELSTM kullanarak eğitim
GAN25 adı verilen bir sinir ağı, iki rakip alt ağdan oluşur: i) bilinmeyen bir dağılıma benzeyen veriler oluşturan bir "jeneratör" ağı (G) ve ii) oluşturulan örnekler ile gerçek gözlemlerden alınanlar arasında ayrım yapan bir "ayırıcı" ağ (D). Amaç, gerçek veri dağılımına uyarken ayrımcının hata yapma olasılığını en üst düzeye çıkaran bir jeneratör bulmaktır.
X'in giriş ve E'nin önceki giriş gürültüsü olduğunu varsayalım, X'= g(E) oluşturulan örnektir. Minimax optimizasyonu kullanılarak öğrenme formüle edilir:
(8)
D'nin sınıflandırmanın doğru olasılığını elde etmeye hak kazandığı yer. Geliştirdiğimiz eğitim modelimizin bileşenleri Şekil 5'te gösterilmektedir. Seçici LSTM, X giriş video dizisinden kareler alt kümesini seçer. Seçilen kareler, kodlayıcı-LSTM kullanılarak sabit uzunluklu E özelliğine dönüştürülür, ardından kod çözücü-LSTM kullanılarak X' video rekonstrüksiyonu yapılır. X'in gerçek video veya özet sınıfına göre sınıflandırılması, ayırıcı-LSTM tarafından gerçekleştirilir. Bu çalışmada, verimli, çeşitli ve yapılandırılmış video özetleri için GAN yapısı ile video özetleme için AE-LSTM kullanılmıştır. AE, gereksiz arka plan değişikliklerini ortadan kaldırabilir ve LSTM, kareleri görüntü olarak ele almak yerine sahne geçişlerini algılayabilir ve GAN, oluşturucu videoyu özetleyebilir ve ayırıcı, özetin çeşitli olmasını sağlar

Şekil 5: AELSTM özetleme modelinin mimarisi. Seçici-LSTM'yi içerir, Kodlayıcı-LSTM, Kod Çözücü-LSTM, ve Ayırıcı-LSTM, çekişmeli eğitim yoluyla video özetlerini optimize etmek için. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.
X adlı
giriş videosundaki her kare için GARNN özelliklerini vererek, özetleyici, kareler alt kümesini seçmek için Seçici LSTM'yi kullanır ve kodlayıcı, kareleri E olarak kodlar ve ardından kod çözücü, videoyu her kare xt'de X' olarak yeniden oluşturur. Seçici, çerçeveyi seçerken önem puanını kullanır. Özellikler, puanlar kullanılarak ağırlık değeri ile verilir ve ardından kodlayıcıya geçilir. Skoru st = 1 olan her kare için, alt küme yalnızca kodlayıcı tarafından alınır. Ayırıcı, X ile X' arasındaki mesafeyi tahmin ederek ve etiketleri atayarak sınıfları orijinal veya özet olarak seçer. Bu durumda, ayırıcı orijinal ve özet videolar arasındaki hatayı hesaplar. Algoritma 2 (Ek Dosya 2), video özetleme için AELSTM eğitiminin özetlenmesini belirtir.
İşlem sonrası – Video özetleme
Video özetleri, eğitildikten sonra segment düzeyinde sınıflandırıcılar tarafından üretilebilir. Bunu başarmak için üç adım söz konusudur: (i) Her video bölümünün sessel, görsel veya harmanlanmış özelliklerini belirleyin. (ii) Uygun ses, görsel veya füzyon sınıflandırıcısını kullanarak her video segmentini sınıflandırın. (iii) Göze çarpan hataları önlemek için, düzenli sınıflandırıcı tahminlerini sonradan işleyin.
Bu talebi karşılamak için, işlem sonrası adım için iki farklı filtreden oluşan bir boru hattı geliştirilmiştir. Giriş dizisi ilk olarak, sıralı sınıflandırıcı tahminlerini yumuşatmak için yerel pencereler kullanılarak N1 uzunluğunda bir medyan filtreye tabi tutulur. Nihai tahminler daha sonra, bu diziye en az N2 segmentleri dahil edilmişse, bir dizi ardışık pozitif tahmini (bilgilendirici segmentler) koruyan basit bir yöntem kullanılarak sert filtreleme ile belirlenir. Başka bir deyişle, bu kriter öğretici bir bölümün en az N2 saniye sürmesini gerektirir.