Araştırma makalesi

GARNN-AE-LSTM: Yüksek Doğrulukta Video Özetleme için Çok Modlu Bir Derin Öğrenme Yaklaşımı

DOI:

10.3791/69097

10 Ekim 2025

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, önceden eğitilmiş GARNN modellerini kullanarak görsel-işitsel özellikleri entegre ederek video özetleme için çok modlu bir derin öğrenme çerçevesi önermektedir. GRU'lardan, AlexNet'ten ve rakip bir LSTM sınıflandırıcısından yararlanan sistem, ana kare algılamayı geliştirir, fazlalığı azaltır ve ortalama 0.985 F puanıyla yüksek özetleme doğruluğu elde eder.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Video özetleme, temel içeriği koruyarak uzun videoların kısa versiyonlarını oluşturmaya odaklanır. Bu çalışma, ses, görüntü ve görsel özellikleri çıkarmak için Geçitli Tekrarlayan Birimler (GRU'lar) ve AlexNet'i birleştiren, GARNN olarak adlandırılan önceden eğitilmiş Geçitli Tekrarlayan Sinir Ağı mimarilerini kullanarak görsel ve işitsel bilgileri bütünleştiren çok modlu bir makine öğrenimi stratejisini ortaya koymaktadır. Anahtar kare algılama, gereksiz kareler kaldırılarak ve hareket telafisi yapılan özellik azaltma ve ardından isteğe bağlı PCA tabanlı boyut azaltma uygulanarak iyileştirilir. Özetlemede yüksek doğruluk elde ederek zamansal modelleme için çekişmeli kodlayıcı tabanlı Uzun Kısa Süreli Bellek (AE-LSTM) sınıflandırıcısı kullanılır. Sonuçlar duyarlılık, F-skorları ve pozitif prediktif değerler kullanılarak değerlendirildi ve yöntem ortalama 0.985 F-skoru elde etti. Geçitli bir AlexNet, hareket telafili PCA tabanlı azaltmanın fazlalığı ortadan kaldırdığı, GRU'ların zamansal ilerlemeyi kaydettiği ve geçitlemenin uzamsal özellik seçimine ince ayar yaptığı çok modlu bir GARNN-AE-LSTM çerçevesinde tanıtılır ve bunların tümü daha doğru ve verimli bir video özetleme sistemine katkıda bulunur. İyileştirilmiş F1 puanı, modelin anlamlı bir video oluşturarak video özetlerinde doğruluk sağlamadaki etkinliğini göstermektedir. Bu yaklaşım, sağlam video analizi ve sıkıştırma için çok modlu özellik çıkarma ve gelişmiş derin öğrenme tekniklerinin potansiyelini vurgulamaktadır.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Öğrencilerin nasıl öğrendiğine dair içgörü sağlamak için ses, video, metin ve sensör verileri gibi çeşitli yöntemleri birleştiren Multimodal Analiz (MMA) sistemleri ortaya çıkmıştır1. Bu teknolojiler, çok modlu verileri değerlendirerek öğrenci davranışı ve katılım düzeylerinin kapsamlı bir şekilde anlaşılmasına yardımcı olabilir2. Bununla birlikte, verimli MMA sistemleri oluşturma söz konusu olduğunda bir takım engeller ve kısıtlamalar vardır3. İnternetin ve güvenlik kameralarının büyümesi nedeniyle bir ton dijital video var. Bu videoların veritabanlarında derlenmesi zorunludur. Bu durumda bir video özeti yardımcı olabilir. Gerçek videonun yararlı bir özetinin oluşturulması, video özetleme olarak bilinir ve etkinlik izleme, anormallik algılama ve video alma4 ile yardımcı olur. Video özeti çeşitli stratejiler kullanılarak gerçekleştirilebilir. Bu yöntemler, çıkarımsal ve soyutlayıcı video özetleme gibiiki kategoriden 5 birine girer.

Video özetleme çok fazla bilgi işlem gerektirdiğinden, verimli yöntemlere ihtiyaç vardır. Bir filmdeki her kare seçim için incelenirse, özet süreci yavaş ve uzun olabilir ve işleme kaynakları aynı veya benzer karelere harcanabilir. Ayrıca, süreci hızlandırmak ve yalnızca önemli özelliklerin dikkate alınmasını sağlamak için, herhangi bir özellik kümesinde alan azaltma yapılmalıdır6. Video özetleme teknikleri, üretilen ve son kullanıcıya gösterilen görsel-işitsel sinyallerin türüne7 veya çıktılarına bağlı olarak dört ana alana ayrılabilir. Daha spesifik olmak gerekirse, video özetleme hesaplamalarının sonuçları şunları içerebilir: (i) genellikle statik özetler olarak bilinen, çıkarılan video karelerinin sırayla görüntülendiği birincil kareler8; (ii) dinamik özetler olarak adlandırılan video kareleri9; (iii) diğer ipuçlarına grafik tabanlı sözdizimi ekleyerek son kullanıcı için özetleri geliştiren görsel sinyaller10; ve (iv) bilgisayarlar tarafından oluşturulan, video bilgilerinin verimli özetlerini sunmak için tasarlanmış metinsel ek açıklamalar11.

Anahtar karelere dayalı özetler genellikle anahtar görüntülere dayalı özetlerden daha küçüktür. Anahtar kare, videodan seçilen tek bir temsili kareyi ifade eder. Keyshot, anahtar kareler etrafında gruplandırılmış kısa ve sürekli bir video karesi segmentini belirtir. Özet sınıfı, sınıflandırıcının çıktı etiketleme çerçevelerini veya bölümlerini bilgilendirici (özete dahil edilecek) veya bilgilendirici olmayan (hariç tutulacak) olarak ifade eder. Bununla birlikte, bu fayda, özetleme sürecinde önemli ayrıntıların atlanması pahasına gelir. Örneğin, anahtar kare tabanlı bir özette önceki karenin bağlamını elde etmek zor olabilir. Ayrıca orijinal sesten yoksundur. Bu sorunları çözmek için, anahtar vuruş tabanlı video özetleme teknikleri bu nedenle sıklıkla seçilir. Anahtar vuruş tabanlı video özetleme teknikleri, uzun biçimli veya kısa biçimli videolar için alt kümeler oluşturmak için kullanılır. Kısa ve uzun biçimli videoların süreleri genellikle sırasıyla 10 dakikadan kısa ve12 dakikadan fazladır 12. Kısa biçimli videolar için keyshot destekli alt kümeler oluşturmak pratik değildir ve zaten kısa olan tekrar uzunlukları nedeniyle başarılı olmayabilir. Ayrıca uzun videoların, özellikle de filmlerin veya spor videolarının oynatma süresi 90 dakikayı aşabilir. Bu tür video kategorileri için, ana vuruş tabanlı özet teknikleri, kullanıcılara kısa bir genel bakış sağlamada daha kullanışlı ve etkilidir.

Video özetinin öznel doğası, onu göz korkutucu bir görev haline getirir. Bunun nedeni, karşılaştırılabilir video içeriği söz konusu olduğunda bile her kullanıcının farklı zevklere sahip olmasıdır. Bu sorun, özel video özetleme yaklaşımı13 yardımıyla kesin olarak çözülebilir. Algoritmanın amacı, her kullanıcıya ilgi alanlarına göre uyarlanmış içerik sağlamaktır. Bununla birlikte, yeni uzun biçimli videolar (spor etkinlikleri gibi) için ideal sürelere sahip uyarlanmış video özetleri hazır değildir. Mevcut yöntemler14,15, gerçek zamanlı olarak kişiselleştirilmiş özetler sağlamak için müşteri tercih verilerini ve video görüntülerini değerlendirmek için büyük bilgisayar kaynakları gerektirir. Gerçek zamanlı, kişiselleştirilmiş video özetleri, merkezi özel sunuculardan elde edilebilir. Babu Veesam ve Satish16, büyük miktarda video verisini etkili bir şekilde sıkıştıran yaygın olarak kullanılan yaklaşımları gösteren tüm önemli video özetleme stratejilerinin kapsamlı bir taksonomik analizini tartıştı. İnceleme, metodolojileri çok modlu entegrasyon stratejilerini, derin öğrenme çerçevelerini ve kümeleme tabanlı yöntemleri içeren temel yaklaşımlarıyla ilişkili olarak sınıflandırır ve değerlendirir. Dikkate değer yöntemler arasında, denetimli özetleme için bilgi damıtmayı kullanan KDAN çerçevesi ve Yapay Alg Algoritması tarafından optimize edilmiş DBSCAN kümelemesini kullanan SVS_MCO yöntemi yer alıyor. Ek olarak, inceleme, dinamik ve çok modlu video özetleme problemlerini yönetmede oldukça etkili olduğu tespit edilen Görsel-İşitsel Tekrarlayan Ağ ve Sorgu Tabanlı Derin Afrika Akbaba Öğrenimi gibi karmaşık modeller sunmaktadır.

Video özetleme için kapılı bir AlexNet Tekrarlayan Sinir Ağı (GARNN-AE-LSTM) çok modlu çerçevesinin dahil edilmesi, bu çalışmayı yeni yapan şeydir. Bu yaklaşım, hareket dengelemeli PCA ile fazlalığı azaltarak, GRU'larla zamansal dinamikleri yakalayarak ve geçitleme yöntemlerini kullanarak mekansal özellik seçimini optimize ederek video özetleme sürecinin doğruluğunu ve verimliliğini artırır. Video özetlemeyi azaltılmış karmaşıklıkla verimli bir şekilde sağlamak için bu makale aşağıdakilere katkıda bulunur: (i) Çok Modlu Video Özetleme: Geçitli RNN'leri ve AlexNet'i birleştiren önceden eğitilmiş bir GARNN modeli kullanarak hem görsel hem de işitsel bilgileri entegre ederek kısa video özetleri oluşturmak için bir çerçeve önerdi. (ii) Özellik İyileştirme için Geçitli AlexNet: Alakasız uzamsal özellikleri filtrelemek için AlexNet'in yoğun katmanına yeni bir geçitli mekanizma (Sigmoid kapısı) eklendi, böylece üst düzey görsel özelliklerin çıkarılması geliştirildi. RNN ile entegrasyon, çerçeveden çerçeveye bağımlılıkların etkili bir şekilde zamansal olarak modellenmesini sağlar. (iii) Gereksiz Çerçeve Eliminasyonu: Anahtar kare algılamadan önce aynı veya benzer kareleri kaldırmak için hareket telafili varyans tabanlı bir yaklaşım geliştirildi ve ardından verimli özellik gösterimi için isteğe bağlı PCA tabanlı boyut azaltma yapıldı. (iv) Doğru Anahtar Kare Algılama: Zamansal modelleme için rakip kodlayıcı tabanlı bir LSTM sınıflandırıcı kullanıldı, ortalama 0.985 F puanı elde edildi ve böylece temel yaklaşımlarla karşılaştırıldığında üstün özetleme doğruluğu gösterildi. (v) Transformatör Modellerine Göre Verimlilik: AlexNet'in uzamsal özellikleri etkili bir şekilde yakaladığı, RNN'nin sıralı bağımlılıkları modellediği ve geçit mekanizmasının önemsiz çerçeveleri filtreleyerek özellik seçimi ve özetlemede transformatör tabanlı alternatiflerden daha iyi performans gösterdiği önerilen GARNN modelinin hesaplama açısından verimli olduğu gösterildi.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, genellikle video gözden geçirme olarak adlandırılan genel video özetleme kategorisine giren çok modlu denetimli bir video özetleme yöntemi önermektedir. Bu, daha büyük bir videonun önemli bölümlerini bulmaya ve videonun geçici olarak yoğunlaştırılmış bir versiyonunu oluşturmaya odaklanan teknikleri içerir. Bu çalışma, Şekil 1'de gösterildiği gibi, işitsel ve görsel temsilleri içeren 1 saniyelik bölümlerde video akışını analiz etmek için denetimli bir teknik önermektedir. Bu bölümler daha sonra "ilgi çekici olmayan" veya "bilgilendirici" olarak kategorize edilir. Sentetik veya simüle edilmiş verilerin aksine, "gerçek veriler" artık deneyler için kullanılan gerçek video veri kümelerini ifade ediyor. Yüksek hareket, ses veya sahne geçişleri gibi özetleme için gerekli olan önemli görsel-işitsel sinyalleri sağlayan video bölümlerine "bilgilendirici bölümler" denir. "İlginç olmayan" kısımlar, özete yeni bir şey katmayan tekrarlayan veya gereksiz çerçeveler olarak tanımlanır.

Giriş videoları karelere bölünür ve önerilen GARNN modeli kullanılarak her kareden çok modlu özellikler çıkarılır. İşitsel ve görsel özellikler birleştirilir ve gereksiz çerçevelerin daha sonraki işlemler için kaldırıldığı boyut azaltma aşamasına girdi olarak beslenir. Son olarak, önerilen AELSTM, video özetleme için azaltılmış verilere uygulanır. Bunu başarmak için çoklu modaliteler adı verilen görsel, işitsel veya karma modalitelerden özellik temsilleriyle eğitilmiş denetimli bir ikili sınıflandırıcı kullanılır.

figure-protocol-1
Şekil 1: Önerilen video özetleme modeline genel bakış. Ardışık düzen, AELSTM kullanarak çok modlu özellik çıkarma, boyut azaltma ve özet oluşturmayı içerir. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Dataset
Önerilen çözümlerin etkinliği, statik video özetlemede bir çift kıyaslama veri kümesi olan VSUMM17 ve SumMe18 veri kümeleri kullanılarak belirlenir. LSTM ile AlexNet kullanılarak oluşturulan CNN özellikleri ve gerçek veriler veri setleri arasında yer almaktadır. Gerçek veriler ve veri kümeleri genel halk tarafından erişilebilir19. VSUMM veri kümesindeki 50 film, YouTube gibi web sitelerinden alınmıştır ve saniyede 30 kare hızında 110 dakika sürer. Çizgi filmler, haberler, spor, reklam, TV dizileri ve ev videoları dahil olmak üzere çeşitli türlerde gelirler. Bunlardan 25'i, tanınmış YouTube sitesinden alınan ve insan tarafından oluşturulan en az 15 özet (toplamda 390) ile etiketlenen tatil, festival ve sporlardan oluşan "SumMe"20 video özeti veri setini oluşturuyor. Videoların süre aralığı 1-6 dakikadır.

Orijinal video, özellik çıkarma için önceden eğitilmiş önerilen GARNN modeline girdi olarak beslenen RGB görüntülerine dönüştürülür. Bu model AlexNet ve kapılı bir RNN'den oluşur. Orijinal özellik sayısı 64'tür ve AlexNet'in özellikleri 4100 özelliğe sahiptir.

Önerilen Geçitli-AlexNet-RNN tabanlı özellik ayıklama
Videoları özetlemek için bilgilerin hem görsel hem de işitsel modları kullanılmıştır. Her iki modalitede de bir özellik temsili elde etmek için, resim alma, video sınıflandırma, işitsel sahne analizi ve müzik bilgisi alma gibi işitsel ve görsel kümeleme ve sınıflandırma görevlerinde sıklıkla kullanılan el yapımı özellikleri belirledik. Amaç, mümkün olduğunca çok sayıda öğretici görsel ve işitsel bileşeni dahil etmekti. Şekil 2 , işitsel ve görsel modaliteler için özellikleri çıkarmak için kullanılan sürecin kavramsal bir gösterimini göstermektedir.

figure-protocol-2
Şekil 2: Önerilen çok modlu GARNN tabanlı özellik çıkarımı. Hem görsel hem de işitsel modalitelerden özellikler AlexNet ve GARNN bileşenleri kullanılarak çıkarılır. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Geçitli- AlexNetRNN: (GARNN)
Sanal görüntü analizi için CNN, popüler bir DL modeli21'dir. Genel olarak, CNN görüntüyü bir girdi olarak kullanır ve onu birkaç gruba ayırır. Giriş nöronları, evrişimli havuzlamalı bir katman dizisi, tamamen bağlantılı katmanlar ve normalleştirici katmanlar yapısını oluşturur22. Evrişim katmanının nöronları, dar bir bölge aracılığıyla önceki katmana bağlanır. Altlarındaki katmanlar, tamamen bağlı katmanların aktive edici nöronlarına tamamen bağlıdır. Denklem (1), tamamen bağlı bir fonksiyonun ileri ve geri yayılımını temsil eder.

figure-protocol-3(1)

figure-protocol-4(2)

Sol katmandaki inci nöronun aktivasyonu neredefigure-protocol-5, figure-protocol-6 sol katmandakiinci nöronun gradyanı,sol katmandaki inci nöronun ağırlığıdır. figure-protocol-7 Son araştırma ilerlemelerinin bir sonucu olarak çok sayıda CNN tasarımı ortaya çıktı. Bu çalışmada AlexNet kullanılmıştır.

Şekil 3'te gösterilen AlexNet'in mimarisi, titiz ve iyi yapılandırılmış bir tasarımı yansıtmaktadır. Tamamen birbirine bağlı üç katman ve beş evrişim katmanı, sekiz öğrenme katmanını oluşturur. Sınıf etiketleri, son katmanın sonucunun softmax'ı etkinleştiren fonksiyona beslenmesiyle üretilir. İkinci, dördüncü veya beşinci katman çekirdekler, GPU paylaşımı yoluyla önceki seviyelerine bağlanır. İkinci ve üçüncü katman çekirdekleri birbirine tamamen bağlıdır. Normalleştirme katmanı, birinci ve ikinci seviyelerden sonra maksimum havuzlama katmanlarına bağlanır. ReLU, tüm öğrenme katmanlarıyla bağlantılıdır.

figure-protocol-8
Şekil 3: AlexNet'in mimarisi. Özetleme modelinde görsel verileri işlemek için beş evrişimli katman ve üç tam bağlantılı katman kullanılır. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Çalışmanın birincil omurga ağı, yoğun katmanlı bir GARNN'dı. Kalın RNN'de üç katman vardır. İkinci katmanda 80 ve birinci katmanda 170 nöron ile tam bağlı iki (fc) katmandan oluşur. Aşağıdaki katmanlar toplu normalleştirme ve bırakmadır. Son katman olan fc, üç nörondan oluşur ve görüntüyü bölmek için kullanılır. LSTM'den sonra gelen yoğun tabaka, beyin tümörünün etrafındaki alanı böler. AlexNet, LSTM katman özelliklerini verir. Veri kümesi, bildirilen toplam dizi sayısına eşit olan en fazla 20 dilime sahiptir. GARNN'ın ilk katmanı 100 gizli birim içerirken, üçüncü katman 125 gizli birim içerir.

Geçit mekanizması, önerdiğimiz GARNN-AE-LSTM çerçevesinde AlexNet'in yoğun (tamamen bağlantılı) katmanına dahil edilmiştir. Evrişimli özellik haritaları genellikle AlexNet tarafından işlenir ve sınıflandırma için doğrudan tam bağlı katmanlara gönderilir. Gereksiz veya daha az önemli desenler de dahil olmak üzere alınan tüm uzamsal özellikler bu yöntemle eşit olarak ele alınır. Bunu, özellik filtresi olarak işlev gören ve sigmoidi temel alan bir geçit işlevi sunarak ele aldık. Matematiksel açıdan, bir kapı vektörü g = σ(wX) + b, yoğun katmanın çıktısını modüle eder ve σ sigmoid fonksiyonunu temsil eder. Eğitim sırasında bu kapı, 0 ile 1 arasında değişen çeşitli özellik aktivasyon ağırlıkları vermeyi öğrenir. Bunlar: (i) düşük geçit değerleri alakasız özellikleri (örneğin, arka plan gürültüsü veya gereksiz dokular) bastırır. (ii) Daha yüksek geçit değerleri, ayırt edici özellikleri vurgular (önemli nesne bölgeleri veya harekete duyarlı desenler gibi). (iii) Bu geliştirilmiş özellik seti daha sonra RNN bileşeni tarafından kullanılır ve bu, alakasız uzamsal bilgiler tarafından dikkati dağılmadan zamansal bağımlılıkları daha iyi yakalamasını sağlar. (iv) Geri yayılım, AlexNet ve RNN ile birlikte eğitim sırasında geçit parametrelerini değiştirmek için kullanılır. Bu, zaman içinde modelin hangi özelliklerin çıkarılacağına ek olarak özetleme için hangi yönlerin en önemli olduğunu öğrendiği anlamına gelir.

Şekil 4'te, X değişkeni girdi verilerini, C hücreyi ve H gizli durumu belirtir.

figure-protocol-9
Şekil 4: Geçitli Tekrarlayan Sinir Ağı mimarisi (GARNN) modeli. GARNN, etkili dizi modelleme için toplu normalleştirmeyi, bırakmayı ve çoklu yoğun katmanları entegre eder. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Her blokta, sırasıyla Iw, Rw ve giriş, tekrarlayan ağırlık ve önyargı olarak adlandırılan önyargı gibi ilgili ağırlıklar, Denklem (3) ila Denklem (5)'te olduğu gibi kullanılmıştır

figure-protocol-10(3)

figure-protocol-11(4)

figure-protocol-12(5)

Belirli bir t zaman damgasında, hücrenin durumu Denklem (6)'daki gibi gösterilir

figure-protocol-13(6)

figure-protocol-14 Hadamard'ın çarpımı ve gizli birimin durumu Denklem (7)'deki gibi gösterilir

figure-protocol-15(7)

Bu nedenle, ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23 kullanarak ilgili video dosyasından çıkarılan her ses klibi için segment düzeyinde ses özelliklerini hesaplamak için py Ses Analizi modülünü kullanır. Çıkarılan özellikler Tablo 1'de listelenmiştir.  Bu işleme uygun olarak, ses özelliği çıkarma işlemi başlangıçta geçici olarak yapılır. Gösterimin son kısmı, ikinci düzeyde hesaplanan segment düzeyinde özellik istatistiklerinden oluşur. Spesifik olarak, ses sinyalinin her bir bölümü için kısa vadeli bir işlem gerçekleştirilir ve bu, her bölüm düzeyindeki pencere için örtüşen veya örtüşmeyen 68 kısa vadeli özelliğin (34 özellik ve 34 delta) hesaplanmasıyla sonuçlanır. Her videonun ses sinyalinden işitsel öğeleri çıkarmanın yanı sıra görsel bilgilerin içeriğini iletmek için çeşitli görsel özellikler kullandık. Bu yöntemin özet süreci için çok önemli olması beklenmektedir. multimodal_movie_analysis kitaplığı (https://github.com/tyiannak/multimodal_movie_analysis), bu görsel öğeleri çıkarmak için bir videonun görsel yönlerini yansıtan özellikleri ayıklamak için kullanılmıştır. Özellikle, aşağıda listelenen 88 görsel öğe her 0,2 saniyede bir eşleşen çerçeveden alınır. Bunda, çok modlu özellikler birleştirilir ve video özetleme yapılarak videoyu bilgilendirici ve ilgi çekici olmayan olarak sınıflandırmanın daha fazla analizi için toplam 59 özellik kullanılır.

PCA kullanarak özellik azaltma
Bu çalışmadaki özelliklerin boyutu, temel bileşen analizi (PCA) uygulanarak küçültülmüştür. Temel özellikler, önemlerini ve önemlerini artırmak için temel özelliklere dönüştürülür. PCA, çeşitli alanlarda çok sayıda araştırmacı tarafından yaygın olarak kullanılmaktadır24. Özdeğerler, özellikleri belirlemek için kullanılır. En yüksek özdeğer özellikleri seçilirken, en düşük özdeğer özellikleri kaldırılır.

Gereksiz çerçevelerin kaldırılmasının ardından, bu çalışmada isteğe bağlı bir özellik azaltma adımı olarak PCA kullanılmıştır. PCA, GARNN tarafından üretilen yüksek boyutlu özellik vektörlerini küçük bir alt uzaya sıkıştırarak gürültüyü ve gereksiz bilgileri bastırır. Bu, AE-LSTM'nin hesaplama verimliliğini artırırken, ana kare algılamaya en ayırt edici görsel ve işitsel ipuçlarının hakim olmasını garanti eder. Video özetlemede ölçeklenebilirlik ve doğruluğu dengelemek için PCA yararlı bir araç olarak kullanılır. Algoritma (Algoritma 1) Ek Dosya 1 olarak sağlanır.

Önceki çerçeveyle tamamen aynı veya çarpıcı bir şekilde karşılaştırılabilir olan herhangi bir çerçeve gereksiz olarak kabul edilir. Kare hızını değiştirmenin, kaldırılan video karelerinin oranı üzerinde bir etkisi olabileceği açıktır. Daha spesifik olarak, kare hızları arttıkça, ardışık kareler arasındaki benzerlik de artar ve bu da karelerin daha yüksek bir yüzdesinin kaldırılmasına yol açar. Şimdi, çekişmeli AE-LSTM modeli olarak adlandırılan ML modelini eğitmek için boyutluluğu azaltılmış özellikler kullanılıyor.

AELSTM kullanarak eğitim
GAN25 adı verilen bir sinir ağı, iki rakip alt ağdan oluşur: i) bilinmeyen bir dağılıma benzeyen veriler oluşturan bir "jeneratör" ağı (G) ve ii) oluşturulan örnekler ile gerçek gözlemlerden alınanlar arasında ayrım yapan bir "ayırıcı" ağ (D). Amaç, gerçek veri dağılımına uyarken ayrımcının hata yapma olasılığını en üst düzeye çıkaran bir jeneratör bulmaktır.

X'in giriş ve E'nin önceki giriş gürültüsü olduğunu varsayalım, X'= g(E) oluşturulan örnektir. Minimax optimizasyonu kullanılarak öğrenme formüle edilir:

figure-protocol-16(8)

D'nin sınıflandırmanın doğru olasılığını elde etmeye hak kazandığı yer. Geliştirdiğimiz eğitim modelimizin bileşenleri Şekil 5'te gösterilmektedir. Seçici LSTM, X giriş video dizisinden kareler alt kümesini seçer. Seçilen kareler, kodlayıcı-LSTM kullanılarak sabit uzunluklu E özelliğine dönüştürülür, ardından kod çözücü-LSTM kullanılarak X' video rekonstrüksiyonu yapılır. X'in gerçek video veya özet sınıfına göre sınıflandırılması, ayırıcı-LSTM tarafından gerçekleştirilir. Bu çalışmada, verimli, çeşitli ve yapılandırılmış video özetleri için GAN yapısı ile video özetleme için AE-LSTM kullanılmıştır. AE, gereksiz arka plan değişikliklerini ortadan kaldırabilir ve LSTM, kareleri görüntü olarak ele almak yerine sahne geçişlerini algılayabilir ve GAN, oluşturucu videoyu özetleyebilir ve ayırıcı, özetin çeşitli olmasını sağlar

figure-protocol-17
Şekil 5: AELSTM özetleme modelinin mimarisi. Seçici-LSTM'yi içerir, Kodlayıcı-LSTM, Kod Çözücü-LSTM, ve Ayırıcı-LSTM, çekişmeli eğitim yoluyla video özetlerini optimize etmek için. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

X adlı figure-protocol-18 giriş videosundaki her kare için GARNN özelliklerini vererek, özetleyici, kareler alt kümesini seçmek için Seçici LSTM'yi kullanır ve kodlayıcı, kareleri E olarak kodlar ve ardından kod çözücü, videoyu her kare xt'de X' olarak yeniden oluşturur. Seçici, çerçeveyi seçerken önem puanını kullanır. Özellikler, puanlar kullanılarak ağırlık değeri ile verilir ve ardından kodlayıcıya geçilir. Skoru st = 1 olan her kare için, alt küme yalnızca kodlayıcı tarafından alınır. Ayırıcı, X ile X' arasındaki mesafeyi tahmin ederek ve etiketleri atayarak sınıfları orijinal veya özet olarak seçer. Bu durumda, ayırıcı orijinal ve özet videolar arasındaki hatayı hesaplar. Algoritma 2 (Ek Dosya 2), video özetleme için AELSTM eğitiminin özetlenmesini belirtir.

İşlem sonrası – Video özetleme
Video özetleri, eğitildikten sonra segment düzeyinde sınıflandırıcılar tarafından üretilebilir. Bunu başarmak için üç adım söz konusudur: (i) Her video bölümünün sessel, görsel veya harmanlanmış özelliklerini belirleyin. (ii) Uygun ses, görsel veya füzyon sınıflandırıcısını kullanarak her video segmentini sınıflandırın. (iii) Göze çarpan hataları önlemek için, düzenli sınıflandırıcı tahminlerini sonradan işleyin.

Bu talebi karşılamak için, işlem sonrası adım için iki farklı filtreden oluşan bir boru hattı geliştirilmiştir. Giriş dizisi ilk olarak, sıralı sınıflandırıcı tahminlerini yumuşatmak için yerel pencereler kullanılarak N1 uzunluğunda bir medyan filtreye tabi tutulur. Nihai tahminler daha sonra, bu diziye en az N2 segmentleri dahil edilmişse, bir dizi ardışık pozitif tahmini (bilgilendirici segmentler) koruyan basit bir yöntem kullanılarak sert filtreleme ile belirlenir. Başka bir deyişle, bu kriter öğretici bir bölümün en az N2 saniye sürmesini gerektirir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Önerilen GARNN tabanlı özellik çıkarma ve uzun videoların AGLSTM tabanlı video özeti, VSUMM ve SumMe olmak üzere iki veri kümesi üzerinde denendi. Bu bölümde deneysel sonuçlar ve geleneksel yaklaşımlarla karşılaştırma tartışılmaktadır. Ayırıcı LSTM için, her katmanda 1024 gizli birime sahip iki katmanlı bir LSTM kullanıyoruz. Sırasıyla encoder_LSTM ve decoder_LSTM için, her katmanda 2048 gizli birime sahip iki adet iki katmanlı LSTM kullanıyoruz. Ters diziyi depolamayı ve sentezlemeyi amaçlayan bir kod çözücü LSTM'nin eğ...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışmada, uzun videoların video özeti, girdi verilerinden üretilen verilerin ses, görüntü ve görsel modalitelerini kullanan verimli bir çok modlu ML ve DL modelleri kullanılarak sunulmuştur. İkili sınıflandırıcı, üretilen özet kısım olan önemli segmentler ile atılan "önemli olmayan" segmentler arasındaki ayrımı öğrenmek için eğitilmiştir. Model, SumMe ve VSUMM gibi veri kümeleri kullanılarak eğitilir ve modelin ölçeklenebilirliği metrikler açısından gösterilir. Başlangıçta, özellikle...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların herhangi bir çıkar çatışması yoktur.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, araştırma çalışmasını yürütmek için laboratuvar olanaklarını sağladığı için Sichuan Film ve Televizyon Üniversitesi Dr. Televizyon Okulu'na müteşekkirdir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
AlexNet (önceden eğitilmiş model)MATLAB / PyTorchPyTorch Hub — AlexNet önceden eğitilmiş modeli: https://pytorch.org/hub/pytorch_vision_alexnet/Görsel özellik ayıklama için kullanılır
FFmpegFFmpeg.orghttps://ffmpeg.org/Videodan ses çıkarma
GRNN tabanlı modelÖzel uygulamaKütüphane " neupy" GRNN'yi uygular: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlÇok modlu özellik füzyonu için kullanılır
LSTM (Uzun Kısa Süreli Bellek)PyTorchhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlSeçici, Kodlayıcı, Kod Çözücüde kullanılır
Multimodal_movie_analysis libGitHubhttps://github.com/tyiannak/multimodal_movie_analysisGörsel özellik ayıklama için
NumPyPython Yazılım Vakfıhttps://pypi.org/project/numpy/Sayısal hesaplama ve matris işlemleri
PCA (Temel Bileşen Analizi)Scikit-öğrenhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlBoyut azaltma
PyAudioAnalysisGitHubhttps://github.com/tyiannak/pyaudioanalysisSes özelliği çıkarma
PyTorchPyTorch Vakfıhttps://pytorch.org/Derin öğrenme çerçevesi
SumMe Veri KümesiGenel veri kümesihttps://gyglim.github.io/me/vsum/index.htmlKarşılaştırmalı video özetleme veri kümesi
VSUMM Veri KümesiGenel veri kümesihttp://www.vision.ime.usp.br/~creativision/vsumm/Karşılaştırmalı video özetleme veri kümesi

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Kap l Yinelemeli BirimlerAnahtar Kare Tespitiznitelik kar mHareket TelafisiPCA ndirgemeeki meli Kodlay cZamansal ModellemeF1 Skoru

İlgili makaleler