Artykuł badawczy

GARNN-AE-LSTM: Multimodalne podejście do głębokiego uczenia się do bardzo dokładnego podsumowania wideo

DOI:

10.3791/69097

10 października 2025

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W tym badaniu zaproponowano multimodalną platformę głębokiego uczenia się do podsumowań wideo poprzez integrację funkcji audiowizualnych przy użyciu wstępnie wytrenowanych modeli GARNN. Wykorzystując GRU, AlexNet i przeciwstawny klasyfikator LSTM, system usprawnia wykrywanie klatek kluczowych, zmniejsza nadmiarowość i osiąga wysoką dokładność podsumowania ze średnim wynikiem F wynoszącym 0,985.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Podsumowanie wideo koncentruje się na tworzeniu zwięzłych wersji długich filmów poprzez zachowanie podstawowych treści. Badanie to ujawnia multimodalną strategię uczenia maszynowego, która integruje informacje wizualne i słuchowe przy użyciu wstępnie przeszkolonych architektur bramkowanych rekurencyjnych sieci neuronowych określanych jako GARNN, łącząc bramkowane jednostki rekurencyjne (GRU) i AlexNet w celu wyodrębnienia funkcji dźwiękowych, graficznych i wizualnych. Wykrywanie klatek kluczowych zostało ulepszone poprzez usunięcie zbędnych klatek i zastosowanie redukcji funkcji z kompensacją ruchu, a następnie opcjonalną redukcję wymiarowości opartą na PCA. Klasyfikator pamięci długotrwałej opartej na koderze przeciwstawnym (AE-LSTM) jest wykorzystywany do modelowania czasowego poprzez osiągnięcie wysokiej dokładności podsumowania. Wyniki zostały ocenione przy użyciu czułości, wyników F i pozytywnych wartości predykcyjnych, a metoda osiągnęła średni wynik F wynoszący 0,985. Bramkowany AlexNet został wprowadzony w multimodalnej strukturze GARNN-AE-LSTM, w której redukcja oparta na PCA z kompensacją ruchu eliminuje nadmiarowość, GRU rejestrują progresję czasową, a bramkowanie dostraja wybór cech przestrzennych, co przyczynia się do dokładniejszego i wydajniejszego systemu podsumowania wideo. Poprawiony wynik F1 pokazuje skuteczność modelu w generowaniu dokładności podsumowań wideo poprzez tworzenie znaczącego filmu. Podejście to podkreśla potencjał multimodalnej ekstrakcji cech i zaawansowanych technik głębokiego uczenia w zakresie niezawodnej analizy i kompresji wideo.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pojawiły się systemy analizy multimodalnej (MMA), łączące kilka modalności, takich jak dane audio, wideo, tekstowe i czujnikowe, aby zapewnić wgląd w to, jak uczą się uczniowie1. Technologie te mogą pomóc w dokładnym zrozumieniu zachowań i poziomów zaangażowania uczniów poprzez ocenę danych multimodalnych2. Istnieje jednak szereg przeszkód i ograniczeń, jeśli chodzi o tworzenie skutecznych systemów MMA3. Istnieje mnóstwo filmów cyfrowych ze względu na rozwój Internetu i kamer bezpieczeństwa. Konieczne jest, aby te filmy zostały skompilowane w bazach danych. Pomocne w tej sytuacji może być podsumowanie wideo. Tworzenie użytecznego streszczenia rzeczywistego filmu jest znane jako podsumowanie wideo i pomaga w śledzeniu aktywności, wykrywaniu anomalii i odzyskiwaniu wideo4. Podsumowanie wideo można zrealizować przy użyciu różnych strategii. Metody te należą do jednej z dwóch kategorii5, takich jak ekstrakcja i abstrakcyjne podsumowanie wideo.

Ponieważ podsumowywanie wideo wymaga dużo obliczeń, potrzebne są wydajne metody. Jeśli każda klatka w filmie jest sprawdzana pod kątem zaznaczenia, proces podsumowania może być powolny i długotrwały, a zasoby przetwarzania mogą być zużywane na identyczne lub podobne klatki. Ponadto, aby przyspieszyć proces i zapewnić, że brane są pod uwagę tylko ważne cechy, należy zmniejszyć ilość miejsca w dowolnym zestawie funkcji6. Techniki podsumowania wideo można podzielić na cztery główne obszary w zależności od rodzaju sygnałów audiowizualnych, które są wytwarzane i pokazywane użytkownikowi końcowemu7, lub ich wyjścia. Mówiąc dokładniej, wyniki obliczeń podsumowania wideo mogą obejmować: (i) klatki podstawowe8, które są sekwencyjnie wyświetlanymi wyodrębnionymi klatkami wideo, powszechnie znanymi jako podsumowania statyczne; (ii) klatki wideo9, które nazywane są podsumowaniami dynamicznymi; (iii) sygnały wizualne10, które wzbogacają podsumowania dla użytkownika końcowego poprzez dodanie składni graficznej do innych wskazówek; oraz (iv) generowane przez komputery, adnotacje tekstowe11, które mają na celu oferowanie skutecznych podsumowań informacji wideo.

Podsumowania oparte na klatkach kluczowych są zwykle mniejsze niż te oparte na wskaźnikach strzałów z klucza. Klatka kluczowa odnosi się do pojedynczej, reprezentatywnej klatki wybranej z filmu. Keyshot oznacza krótki, ciągły segment klatek wideo zgrupowanych wokół klatek kluczowych. Klasa podsumowania odwołuje się do ramek lub segmentów etykietowania danych wyjściowych klasyfikatora jako informacyjnych (do uwzględnienia w podsumowaniu) lub nieinformacyjnych (do wykluczenia). Niemniej jednak korzyść ta odbywa się kosztem pominięcia ważnych szczegółów w procesie podsumowania. Na przykład uzyskanie kontekstu poprzedniej klatki w podsumowaniu opartym na klatce kluczowej może być trudne. Jest również pozbawiony oryginalnego brzmienia. Aby rozwiązać te problemy, często wybierane są techniki podsumowania wideo oparte na strzałach kluczowych. Techniki podsumowywania wideo oparte na strzałach z są wykorzystywane do tworzenia podzbiorów dla długich lub krótkich filmów. Krótkie i długie filmy trwają zazwyczaj krócej i więcej niż 10 minut, czyli12. Generowanie podzbiorów wspomaganych przez dla krótkich filmów jest niepraktyczne i może nie zakończyć się sukcesem ze względu na ich i tak już krótką długość powtórki. Co więcej, czas odtwarzania długich filmów, zwłaszcza filmów lub filmów sportowych, może przekroczyć 90 minut. W przypadku takich kategorii wideo techniki podsumowania oparte na strzałach kluczowych są bardziej przydatne i wydajne, ponieważ zapewniają użytkownikom krótki przegląd.

Subiektywny charakter podsumowania wideo sprawia, że jest to trudne zadanie. Wynika to z faktu, że każdy użytkownik ma inny gust, nawet jeśli chodzi o porównywalne treści wideo. Problem ten można precyzyjnie rozwiązać za pomocą dostosowanego podejścia do podsumowania wideo13. Celem algorytmu jest dostarczanie każdemu użytkownikowi treści, które są dopasowane do jego zainteresowań. Dostosowane podsumowania filmów z idealnymi czasami trwania dla nowych długich filmów (takich jak wydarzenia sportowe) nie są jednak łatwo dostępne. Obecne metody14,15 wymagają ogromnych zasobów komputerowych do oceny danych o preferencjach klientów i nagrań wideo w celu dostarczania zindywidualizowanych podsumowań w czasie rzeczywistym. Spersonalizowane podsumowania wideo w czasie rzeczywistym można uzyskać ze scentralizowanych serwerów dedykowanych. Babu Veesam i Satish16 omówili dokładną analizę taksonomiczną wszystkich głównych strategii podsumowania wideo, które demonstrują szeroko stosowane podejścia skutecznie kompresujące ogromne ilości danych wideo. W przeglądzie sklasyfikowano i oceniono metodologie w odniesieniu do ich podstawowych podejść, które obejmują strategie integracji multimodalnej, ramy głębokiego uczenia się i metody oparte na klastrach. Wśród metod godnych uwagi są framework KDAN, który wykorzystuje destylację wiedzy do nadzorowanego podsumowania, oraz metoda SVS_MCO, która wykorzystuje klastrowanie DBSCAN zoptymalizowane przez algorytm sztucznych glonów. Ponadto w przeglądzie przedstawiono zaawansowane modele, takie jak Audio-Visual Recurrent Network i Deep African Vulture Learning oparte na zapytaniach, które okazały się bardzo skuteczne w radzeniu sobie z dynamicznymi i multimodalnymi problemami z podsumowaniem wideo.

Włączenie bramkowanej multimodalnej sieci neuronowej AlexNet (GARNN-AE-LSTM) do podsumowań wideo sprawia, że to badanie jest nowatorskie. Takie podejście poprawia dokładność i wydajność procesu podsumowania wideo poprzez zmniejszenie nadmiarowości dzięki PCA z kompensacją ruchu, przechwytywanie dynamiki czasowej za pomocą GRU i optymalizację wyboru cech przestrzennych przy użyciu metod bramkowania. Aby skutecznie zapewnić podsumowanie wideo przy zmniejszonej złożoności, niniejszy artykuł przyczynia się do następujących elementów: (i) Multimodalne podsumowanie wideo: Zaproponowano ramy do generowania zwięzłych podsumowań wideo poprzez integrację zarówno informacji wizualnych, jak i słuchowych przy użyciu wstępnie wytrenowanego modelu GARNN, który łączy bramkowane RNN i AlexNet. (ii) Bramkowany AlexNet w celu udoskonalenia funkcji: Wprowadzono nowatorski mechanizm bramkowania (bramka sigmoidalna) do gęstej warstwy AlexNet w celu filtrowania nieistotnych cech przestrzennych, zwiększając w ten sposób ekstrakcję cech wizualnych wysokiego poziomu. Integracja z RNN umożliwia efektywne czasowe modelowanie zależności między klatkami. (iii) Eliminacja nadmiarowych klatek: Opracowano podejście oparte na wariancji z kompensacją ruchu, polegające na usuwaniu identycznych lub podobnych klatek przed wykryciem klatek kluczowych, a następnie opcjonalnej redukcji wymiarów opartej na PCA w celu efektywnej reprezentacji cech. (iv) Dokładne wykrywanie klatek kluczowych: Zastosowano klasyfikator LSTM oparty na koderze przeciwstawnym do modelowania czasowego, osiągając średni wynik F 0,985, wykazując w ten sposób lepszą dokładność podsumowania w porównaniu z podejściami podstawowymi. (v) Wydajność w porównaniu z modelami transformatorowymi: Pokazano, że proponowany model GARNN jest wydajny obliczeniowo, w którym AlexNet skutecznie przechwytuje cechy przestrzenne, RNN modeluje sekwencyjne zależności, a mechanizm bramkowania odfiltrowuje nieistotne ramki, przewyższając alternatywy oparte na transformatorach w wyborze cech i podsumowaniu.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W niniejszym badaniu zaproponowano multimodalną nadzorowaną metodę podsumowania wideo, która należy do kategorii ogólnego podsumowania wideo, powszechnie określanej jako skimming wideo. Obejmuje to techniki, które koncentrują się na znajdowaniu kluczowych segmentów większego filmu w celu stworzenia jego czasowo skondensowanej wersji. Badanie to sugeruje nadzorowaną technikę analizy strumienia wideo w sekcjach 1 s, które obejmują reprezentacje audio i wizualne, jak pokazano na rysunku 1. Segmenty te są następnie klasyfikowane jako "nieciekawe" lub "pouczające". W przeciwieństwie do danych syntetycznych lub symulowanych, "rzeczywiste dane" odnoszą się teraz do rzeczywistych zestawów danych wideo wykorzystywanych w eksperymentach. Segmenty wideo, które dostarczają ważnych sygnałów audiowizualnych niezbędnych do podsumowania – takich jak wysoki ruch, głos lub przejścia scen – są określane jako "segmenty informacyjne". "Nieciekawe" części są definiowane jako powtarzające się lub zbędne ramki, które nie wnoszą nic nowego do streszczenia.

Wejściowe filmy wideo są dzielone na klatki, a funkcje multimodalne są wyodrębniane z każdej klatki przy użyciu proponowanego modelu GARNN. Funkcje dźwiękowe i wizualne są łączone i wprowadzane jako dane wejściowe do fazy redukcji wymiarów, w której zbędne klatki są usuwane do dalszego przetwarzania. Na koniec proponowany AELSTM jest stosowany do zredukowanych danych do podsumowania wideo. Aby to osiągnąć, używany jest nadzorowany klasyfikator binarny wytrenowany przy użyciu reprezentacji funkcji z modalności wizualnych, dźwiękowych lub mieszanych, zwanych multimodalnościami.

figure-protocol-1
Rysunek 1: Omówienie proponowanego modelu podsumowania wideo. Potok obejmuje ekstrakcję cech multimodalnych, redukcję wymiarowości i generowanie podsumowań przy użyciu AELSTM. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Dataset
Skuteczność proponowanych rozwiązań określa się za pomocą zestawów danych VSUMM17 i SumMe18 , pary zestawów danych porównawczych w statycznym podsumowaniu wideo. Wśród zestawów danych znajdują się funkcje CNN stworzone przy użyciu AlexNet z LSTM i rzeczywistymi danymi. Rzeczywiste dane i zbiory danych są dostępne dla ogółu społeczeństwa19. 50 filmów w zestawie danych VSUMM pochodzi ze stron internetowych takich jak YouTube i trwa 110 minut przy 30 klatkach na sekundę. Występują w różnych gatunkach, w tym kreskówkach, wiadomościach, sporcie, reklamach, serialach telewizyjnych i domowych filmach wideo. Wśród nich 25 filmów składa się ze świąt, festiwali i wydarzeń sportowych, które zostały pobrane ze znanej witryny YouTube i oznaczone co najmniej 15 podsumowaniami wygenerowanymi przez człowieka (w sumie 390) tworzą zestaw danych podsumowujących filmy "SumMe"20 . Zakres czasu trwania filmów to 1-6 minut.

Oryginalne wideo jest konwertowane na obrazy RGB, które są wprowadzane jako dane wejściowe do wstępnie wytrenowanego proponowanego modelu GARNN w celu wyodrębnienia funkcji. Ten model składa się z AlexNet i bramkowanego RNN. Oryginalna liczba funkcji to 64, a funkcje z AlexNet mają 4100 funkcji.

Proponowane wyodrębnianie funkcji oparte na Gated-AlexNet-RNN
Do podsumowania filmów wykorzystano zarówno wizualny, jak i dźwiękowy tryb informacji. Aby uzyskać reprezentację cech w obu modalnościach, zidentyfikowaliśmy ręcznie wykonane funkcje, które są często używane w zadaniach grupowania i klasyfikacji dźwięku i obrazu, takich jak wyszukiwanie obrazów, klasyfikacja wideo, analiza scen słuchowych i wyszukiwanie informacji o muzyce. Celem było uwzględnienie jak największej liczby elementów instruktażowych wizualnych i dźwiękowych. Rysunek 2 przedstawia koncepcyjną ilustrację procesu wykorzystywanego do wyodrębniania cech modalności dźwiękowych i wizualnych.

figure-protocol-2
Rysunek 2: Proponowana multimodalna ekstrakcja cech w oparciu o GARNN. Funkcje zarówno z modalności wizualnych, jak i dźwiękowych są wyodrębniane przy użyciu komponentów AlexNet i GARNN. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Bramkowany- AlexNetRNN: (GARNN)
Do analizy obrazu wirtualnego CNN jest popularnym modelem DL21. Ogólnie rzecz biorąc, CNN używa obrazu jako danych wejściowych i dzieli go na kilka grup. Neurony wejściowe, sekwencja warstw z konwolucyjnym łączeniem, warstwami, które są całkowicie połączone, i warstwami normalizującymi tworzą jego strukturę22. Neurony warstwy konwolucyjnej są połączone z poprzednią warstwą za pomocą wąskiego obszaru. Warstwy pod nimi są w pełni połączone z aktywującymi neuronami w pełni połączonych warstw. Równanie (1) reprezentuje propagację do przodu i do tyłu w pełni połączonej funkcji.

figure-protocol-3    (1)

figure-protocol-4    (2)

Gdzie figure-protocol-5 jest aktywacjai-tego neuronuw l tej warstwie, figure-protocol-6 to gradienti-tego neuronu w ltej warstwie, figure-protocol-7 to wagai-tego neuronu w l + 1tej warstwie. W wyniku ostatnich postępów badawczych pojawiło się wiele projektów CNN. W tej pracy wykorzystano AlexNet.

Architektura AlexNet, pokazana na rysunku 3, odzwierciedla skrupulatny i dobrze zorganizowany projekt. Trzy całkowicie połączone warstwy i pięć warstw konwolucyjnych tworzy osiem warstw uczenia się. Etykiety klas są tworzone przez wprowadzenie wyniku ostatniej warstwy do funkcji, która aktywuje softmax. Jądra drugiej, czwartej lub piątej warstwy są połączone ze swoimi poprzednimi poziomami za pośrednictwem udostępniania GPU. Jądra drugiej i trzeciej warstwy są w pełni ze sobą połączone. Warstwa normalizacji jest połączona z maksymalnymi warstwami puli po pierwszym i drugim poziomie. ReLU jest połączony ze wszystkimi warstwami uczenia się.

figure-protocol-8
Rysunek 3: Architektura AlexNet. Pięć warstw konwolucyjnych i trzy w pełni połączone warstwy są używane do przetwarzania danych wizualnych w modelu podsumowującym. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Główną siecią szkieletową dla prac był gęstowarstwowy GARNN. W grubym RNN znajdują się trzy warstwy. Z 80 neuronami w drugiej warstwie i 170 w pierwszej, składa się z dwóch w pełni połączonych warstw (fc). Następujące warstwy to normalizacja wsadowa i zanikanie. FC, ostatnia warstwa, składa się z trzech neuronów i służy do podziału obrazu. Gęsta warstwa, która pojawia się po LSTM, dzieli obszar wokół guza mózgu. AlexNet nadaje warstwie LSTM funkcje. Zestaw danych zawiera maksymalnie 20 wycinków, co jest równe łącznej liczbie zadeklarowanych sekwencji. Pierwsza warstwa GARNN zawiera 100 ukrytych jednostek, podczas gdy trzecia warstwa zawiera 125 ukrytych jednostek.

Mechanizm bramkowania został włączony do gęstej (całkowicie połączonej) warstwy AlexNet w sugerowanym przez nas frameworku GARNN-AE-LSTM. Konwolucyjne mapy cech są często przetwarzane przez AlexNet i wysyłane bezpośrednio do w pełni połączonych warstw w celu klasyfikacji. Wszystkie uzyskane cechy przestrzenne, w tym nadmiarowe lub mniej istotne wzorce, są traktowane jednakowo za pomocą tej metody. Zajęliśmy się tym, wprowadzając funkcję bramkowania, która działa jako filtr funkcji i jest oparta na sigmoidzie. Z matematycznego punktu widzenia wektor bramki g = σ(wX) + b moduluje wyjście gęstej warstwy, przy czym σ reprezentuje funkcję sigmoidalną. Podczas treningu ta bramka uczy się nadawać różne wagi aktywacji funkcji w zakresie od 0 do 1. Są to: (i) niskie wartości bramek tłumią nieistotne cechy (np. szumy tła lub zbędne tekstury). (ii) Wyższe wartości bramek podkreślają cechy dyskryminacyjne (takie jak ważne obszary obiektu lub wzorce wrażliwe na ruch). (iii) Ten ulepszony zestaw funkcji jest następnie używany przez komponent RNN, co umożliwia mu lepsze uchwycenie zależności czasowych bez rozpraszania się przez nieistotne informacje przestrzenne. (iv) Propagacja wsteczna służy do zmiany parametrów bramkowania podczas treningu w tandemie z AlexNet i RNN. Oznacza to, że z biegiem czasu model uczy się, które aspekty są najważniejsze do podsumowania, a także które funkcje należy wyodrębnić.

Na rysunku 4 zmienna X oznacza dane wejściowe, C oznacza komórkę, a H oznacza stan ukryty.

figure-protocol-9
Rysunek 4: Model architektury bramkowanej rekurencyjnej sieci neuronowej (GARNN). GARNN integruje normalizację partii, zanikanie i wiele gęstych warstw w celu efektywnego modelowania sekwencji. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

W każdym bloku odpowiednie wagi, takie jak Iw, Rw i odchylenie zwane odpowiednio wejściem, wagą powtarzającą się i odchyleniem, zostały wykorzystane, jak w równaniu (3) do równania (5)

figure-protocol-10    (3)

figure-protocol-11     (4)

figure-protocol-12     (5)

W określonym czasie stamp t stan komórki jest oznaczony jako w równaniu Eqn (6)

figure-protocol-13    (6)

Gdzie figure-protocol-14 iloczyn Hadamarda i stan jednostki ukrytej jest oznaczony jak w równaniu (7)

figure-protocol-15    (7)

W ten sposób wykorzystuje moduł py Audio Analysis do obliczania charakterystyki dźwięku na poziomie segmentu dla każdego klipu audio, który został wyodrębniony z odpowiedniego pliku wideo, wykorzystując ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. Wyodrębnione funkcje są wymienione w Tabeli 1. Zgodnie z tym procesem, wyodrębnianie funkcji audio jest początkowo wykonywane tymczasowo. Ostatnia część reprezentacji składa się ze statystyk obiektów na poziomie segmentu, które są obliczane na drugim poziomie. W szczególności dla każdego segmentu sygnału audio wykonywane jest krótkoterminowe przetwarzanie, w wyniku czego obliczanych jest 68 krótkoterminowych cech (34 funkcje i 34 różnice) dla każdego okna na poziomie segmentu, które mogą się nakładać lub nie nakładać. Wykorzystaliśmy różne cechy wizualne, aby przekazać treść informacji wizualnych, a także wyodrębnić elementy dźwiękowe z sygnału dźwiękowego każdego filmu. Oczekuje się, że ta modalność będzie miała kluczowe znaczenie dla procesu podsumowania. Biblioteka multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) została użyta do wyodrębnienia funkcji, które odzwierciedlają wizualne aspekty filmu, w celu wyodrębnienia tych elementów wizualnych. W szczególności 88 elementów wizualnych wymienionych poniżej jest pobieranych z pasującej klatki co 0,2 s. W ten sposób funkcje multimodalne są łączone, a łącznie 59 funkcji jest wykorzystywanych do dalszej analizy klasyfikacji filmu jako informacyjnego i nieinteresującego poprzez wykonanie podsumowania wideo.

Redukcja funkcji za pomocą PCA
Wymiar cech w tym badaniu został zmniejszony przez zastosowanie analizy głównych składowych (PCA). Podstawowe cechy są przekształcane w kluczowe cechy w celu zwiększenia ich widoczności i znaczenia. PCA jest szeroko stosowana przez wielu badaczy w różnych dziedzinach24. Wartości własne służą do określenia właściwości. Wybierane są obiekty o najwyższej wartości własnej, a obiekty o najniższej wartości własnej są usuwane.

Po usunięciu zbędnych ramek, PCA jest stosowany w tym badaniu jako opcjonalny etap redukcji funkcji. PCA tłumi szumy i nadmiarowe informacje poprzez kompresję wielowymiarowych wektorów cech wytwarzanych przez GARNN do małej podprzestrzeni. Zwiększa to wydajność obliczeniową AE-LSTM, gwarantując jednocześnie, że wykrywanie klatek kluczowych jest zdominowane przez najbardziej dyskryminujące wskazówki wizualne i dźwiękowe. Aby zrównoważyć skalowalność i dokładność podsumowań wideo, PCA jest wykorzystywane jako przydatne narzędzie. Algorytm (Algorytm 1) jest dostarczany jako plik uzupełniający 1.

Każda klatka, która jest dokładnie taka sama lub uderzająco porównywalna z poprzednią, jest uważana za nadmiarową. Oczywiste jest, że zmiana liczby klatek na sekundę może mieć wpływ na proporcję usuniętych klatek wideo. Mówiąc dokładniej, wraz ze wzrostem liczby klatek na sekundę zwiększa się również podobieństwo między kolejnymi klatkami, co prowadzi do większego odsetka usuwanych klatek. Teraz funkcje o zmniejszonej wymiarowości są używane do trenowania modelu uczenia maszynowego, który jest nazywany przeciwstawnym modelem AE-LSTM.

Szkolenie z wykorzystaniem AELSTM
Sieć neuronowa zwana GAN25 składa się z dwóch rywalizujących ze sobą podsieci: i) sieci "generatora" (G), która tworzy dane przypominające nieznaną dystrybucję, oraz ii) sieci "dyskryminującej" (D), która odróżnia utworzone próbki od tych pochodzących z rzeczywistych obserwacji. Celem jest znalezienie generatora, który zmaksymalizuje prawdopodobieństwo popełnienia błędu przez dyskryminatora, jednocześnie dopasowując go do rzeczywistego rozkładu danych.

Załóżmy, że X jest sygnałem wejściowym, a E jest wcześniejszym szumem wejściowym, X'= g(E) jest wygenerowaną próbką. Korzystając z optymalizacji minimax, uczenie się jest formułowane:

figure-protocol-16    (8)

Gdzie D jest kwalifikowany do uzyskania prawidłowego prawdopodobieństwa klasyfikacji. Elementy składowe opracowanego przez nas modelu szkoleniowego przedstawiono na rysunku 5. Selektor LSTM wybiera podzbiór klatek z wejściowej sekwencji wideo X. Wybrane klatki są konwertowane na cechę o stałej długości E za pomocą kodera-LSTM, a następnie rekonstrukcja wideo X' za pomocą dekodera-LSTM. Klasyfikacja X' do rzeczywistego wideo lub klasy podsumowania jest wykonywana przez dyskryminator-LSTM. W tym badaniu AE-LSTM jest używany do podsumowań wideo ze strukturą GAN w celu uzyskania wydajnych, zróżnicowanych i ustrukturyzowanych podsumowań wideo. AE może wyeliminować niepotrzebne zmiany tła, a LSTM może wykrywać przejścia sceny, zamiast traktować klatki jako obrazy, a GAN, generator może podsumować wideo, a dyskryminator zapewnia, że podsumowanie jest zróżnicowane

figure-protocol-17
Rysunek 5: Architektura modelu podsumowującego AELSTM. Obejmuje Selector-LSTM, Encoder-LSTM, Decoder-LSTM i Discriminator-LSTM w celu optymalizacji podsumowań wideo poprzez szkolenie przeciwstawne. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Dając cechy GARNN dla każdej klatki w wejściowym wideo X o nazwie figure-protocol-18 , podsumowanie wykorzystuje selektor LSTM do wyboru podzbioru klatek, a koder koduje klatki jako E, a następnie dekoder rekonstruuje wideo jako X' w każdej klatce xt. Selektor wykorzystuje ocenę ważności podczas wybierania ramki. Cechy są określane przez wartość wagi za pomocą wyników, a następnie przechodzą do enkodera. Dla każdej klatki z wynikiem st = 1 podzbiór jest odbierany tylko przez enkoder. Dyskryminator wybiera klasy jako oryginalne lub podsumowujące, szacując odległość między X i X' i przypisując etykiety. W takim przypadku dyskryminator oblicza błąd między oryginalnymi filmami a filmami podsumowującymi. Algorytm 2 (plik uzupełniający 2) oznacza podsumowanie szkolenia AELSTM dla podsumowania wideo.

Przetwarzanie końcowe – podsumowanie wideo
Podsumowania wideo mogą być tworzone przez klasyfikatory na poziomie segmentu po ich wytrenowaniu. Aby to osiągnąć, należy wykonać trzy kroki: (i) Określ cechy dźwiękowe, wizualne lub mieszane każdego segmentu wideo. (ii) Sklasyfikuj każdy segment wideo za pomocą odpowiedniego klasyfikatora dźwiękowego, wizualnego lub fuzyjnego. (iii) Aby zapobiec rażącym błędom, należy przetworzyć uporządkowane przewidywania klasyfikatora.

Aby sprostać temu zapotrzebowaniu, opracowano potok składający się z dwóch odrębnych filtrów dla etapu przetwarzania końcowego. Tablica wejściowa jest najpierw poddawana filtrowi mediany o długości N1 przy użyciu okien lokalnych w celu wygładzenia przewidywań klasyfikatora sekwencyjnego. Końcowe przewidywania są następnie określane przez twarde filtrowanie przy użyciu prostej metody, która utrzymuje serię kolejno dodatnich przewidywań (segmentów informacyjnych), jeśli co najmniej segmenty N2 są zawarte w tej sekwencji. Innymi słowy, kryterium to wymaga, aby segment instruktażowy trwał co najmniej N2 sekundy.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Proponowana ekstrakcja funkcji oparta na GARNN i podsumowanie wideo długich filmów oparte na AGLSTM zostały przetestowane na dwóch zestawach danych, a mianowicie VSUMM i SumMe. W tej części omówiono wyniki eksperymentalne i porównanie z konwencjonalnymi podejściami. Do dyskryminatora LSTM używamy dwuwarstwowego LSTM z 1024 ukrytymi jednostkami w każdej warstwie. Odpowiednio dla encoder_LSTM i decoder_LSTM używamy dwóch dwuwarstwowych LSTM z 2048 ukrytymi jednostkami w każdej warstwie. Wykazano, że dekoder LSTM, który sta...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W tym badaniu podsumowanie wideo długich filmów wideo jest prezentowane przy użyciu wydajnych multimodalnych modeli ML i DL, które wykorzystują audio, obrazowe i wizualne modalności danych generowanych na podstawie danych wejściowych. Klasyfikator binarny jest szkolony, aby nauczyć się rozróżniania między ważnymi segmentami, które są utworzoną częścią podsumowania, a "nieistotnymi" segmentami, które są odrzucane. Model jest trenowany przy użyciu zestawów danych, takich jak SumMe i VSUMM, a skalowalność modelu jest demons...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie pozostają w konflikcie interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy są wdzięczni Dr. Television School, Sichuan Film and Television University, za udostępnienie pomieszczeń laboratoryjnych do przeprowadzenia badań.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
AlexNet (wstępnie wytrenowany model)MATLAB / PyTorchCentrum PyTorch — Wstępnie wytrenowany model AlexNet: https://pytorch.org/hub/pytorch_vision_alexnet/Służy do wyodrębniania cech wizualnych
FFmpeg powiedział:FFmpeg.orghttps://ffmpeg.org/Wyodrębnianie dźwięku z wideo
Model oparty na GRNNImplementacja niestandardowaBiblioteka » neupy" wdraża GRNN: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlUżywany do multimodalnej fuzji cech
LSTM (długa pamięć krótkotrwała)Pochodnia PyTorchhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlUżywany w selektorze, enkoderze, dekoderze
Multimodal_movie_analysis libUsługa GitHubhttps://github.com/tyiannak/multimodal_movie_analysisDo wyodrębniania cech wizualnych
NumPyFundacja oprogramowania Pythonhttps://pypi.org/project/numpy/Obliczenia numeryczne i operacje macierzowe
PCA (Analiza Głównych Składowych)Scikit-naucz sięhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlRedukcja wymiarowości
PyAudioAnalysis (PyAudioAnalysis)Usługa GitHubhttps://github.com/tyiannak/pyaudioanalysisWyodrębnianie funkcji audio
Pochodnia PyTorchFundacja PyTorchhttps://pytorch.org/Struktura głębokiego uczenia
Zestaw danych SumMePubliczny zestaw danychhttps://gyglim.github.io/me/vsum/index.htmlZestaw danych podsumowania wideo z testów porównawczych
Zestaw danych VSUMMPubliczny zestaw danychhttp://www.vision.ime.usp.br/~creativision/vsumm/Zestaw danych podsumowania wideo z testów porównawczych

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Bramkowane Jednostki RekurencyjneDetekcja Klatek KluczowychEkstrakcja CechKompensacja RuchuRedukcja PCAEnkoder AdversarialnyModelowanie TemporalneWynik F1

Powiązane artykuły