Onderzoeksartikel

GARNN-AE-LSTM: Een multimodale deep learning-benadering voor zeer nauwkeurige video-samenvattingen

DOI:

10.3791/69097

10 oktober 2025

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie stelt een multimodaal deep learning-raamwerk voor video-samenvatting voor door audiovisuele functies te integreren met behulp van vooraf getrainde GARNN-modellen. Door gebruik te maken van GRU's, AlexNet en een vijandige LSTM-classificatie, verbetert het systeem de detectie van keyframes, vermindert het redundantie en bereikt het een hoge samenvattende nauwkeurigheid met een gemiddelde F-score van 0,985.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Videosamenvatting richt zich op het maken van beknopte versies van lange video's door essentiële inhoud te behouden. Deze studie onthult een multimodale machine learning-strategie die visuele en auditieve informatie integreert door gebruik te maken van vooraf getrainde Gated Recurrent Neural Network-architecturen, ook wel GARNN genoemd, waarbij Gated Recurrent Units (GRU's) en AlexNet worden gecombineerd om audio-, beeld- en visuele functies te extraheren. De keyframedetectie wordt verbeterd door overbodige frames te verwijderen en bewegingsgecompenseerde functiereductie toe te passen, gevolgd door optionele PCA-gebaseerde dimensionaliteitsreductie. Een op adversarial encoder gebaseerde Long Short-Term Memory (AE-LSTM)-classifier wordt gebruikt voor temporele modellering door een hoge nauwkeurigheid bij het samenvatten te bereiken. De resultaten werden geëvalueerd met behulp van gevoeligheid, F-scores en positief voorspellende waarden, en de methode behaalde een gemiddelde F-score van 0,985. Een gated AlexNet wordt geïntroduceerd in een multimodaal GARNN-AE-LSTM-framework, waar bewegingsgecompenseerde PCA-gebaseerde reductie redundantie elimineert, GRU's temporele progressie registreren en gating de ruimtelijke functieselectie verfijnt, wat allemaal bijdraagt aan een nauwkeuriger en efficiënter video-samenvattingssysteem. De verbeterde F1-score toont de effectiviteit van het model aan bij het genereren van nauwkeurigheid in videosamenvattingen door een zinvolle video te maken. Deze benadering benadrukt het potentieel van multimodale functie-extractie en geavanceerde deep learning-technieken voor robuuste video-analyse en compressie.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Er zijn multimodale analysesystemen (MMA) ontstaan, die verschillende modaliteiten zoals audio-, video-, tekst- en sensorgegevens combineren om inzicht te geven in hoe studenten leren1. Deze technologieën kunnen helpen bij het verkrijgen van een grondig begrip van het gedrag en de betrokkenheid van studenten door multimodale gegevens te evalueren2. Er zijn echter een aantal obstakels en beperkingen als het gaat om het creëren van efficiënte MMA-systemen3. Er zijn een heleboel digitale video's vanwege de groei van internet en beveiligingscamera's. Het is absoluut noodzakelijk dat deze video's worden gecompileerd in databases. Een videosamenvatting kan in deze situatie nuttig zijn. Het maken van een nuttige samenvatting van de echte video staat bekend als video-samenvatting, en het helpt bij het volgen van activiteiten, het detecteren van afwijkingen en het ophalen van video's4. Videosamenvatting kan worden bereikt met behulp van verschillende strategieën. Deze methoden vallen in een van de twee categorieën5, zoals extractieve en abstracte videosamenvatting.

Omdat het samenvatten van video's veel rekenwerk vereist, zijn efficiënte methoden nodig. Als elk frame in een film wordt onderzocht voor selectie, kan het samenvattingsproces traag en langdurig zijn en kunnen verwerkingsmiddelen worden besteed aan identieke of vergelijkbare frames. Om het proces te versnellen en ervoor te zorgen dat alleen belangrijke functies in overweging worden genomen, moet bovendien de ruimte worden verkleind voor elke set functies6. Technieken voor het samenvatten van video's kunnen worden onderverdeeld in vier hoofdgebieden op basis van het type audiovisuele signalen dat wordt geproduceerd en getoond aan de eindgebruiker7, of hun output. Om specifieker te zijn, kunnen de resultaten van berekeningen van videosamenvattingen het volgende omvatten: (i) primaire frames8, die opeenvolgend weergegeven geëxtraheerde videoframes zijn die algemeen bekend staan als statische samenvattingen; (ii) videoframes9, die dynamische samenvattingen worden genoemd; (iii) visuele signalen10, die samenvattingen voor de eindgebruiker verbeteren door grafische syntaxis toe te voegen aan andere signalen; en (iv) gegenereerd door computers, tekstuele annotaties11, die zijn ontworpen om efficiënte samenvattingen van video-informatie te bieden.

Samenvattingen op basis van keyframes zijn doorgaans kleiner dan die op basis van keyshots. Keyframe verwijst naar een individueel representatief frame dat uit de video is geselecteerd. Keyshot geeft een kort aaneengesloten segment van videoframes aan die zijn gegroepeerd rond keyframes. Summary class verwijst naar de uitvoer van de classifier die frames of segmenten labelt als informatief (te worden opgenomen in de samenvatting) of niet-informatief (te worden uitgesloten). Desalniettemin gaat dit voordeel ten koste van het weglaten van belangrijke details in het samenvatten. Het kan bijvoorbeeld moeilijk zijn om de context van het voorgaande frame te krijgen in een samenvatting op basis van een keyframe. Het is ook verstoken van het originele geluid. Om deze problemen aan te pakken, wordt daarom vaak gekozen voor technieken voor het samenvatten van video's op basis van keyshots. Op keyshots gebaseerde technieken voor het samenvatten van video's worden gebruikt om subsets te maken voor lange of korte video's. Korte en lange video's hebben doorgaans een duur van respectievelijk minder dan en meer dan 10 minuten12. Het genereren van keyshot-ondersteunde subsets voor korte video's is onpraktisch en is mogelijk niet succesvol vanwege de toch al korte herhalingsduur. Bovendien kan de afspeeltijd van lange video's, met name films of sportvideo's, meer dan 90 minuten bedragen. Voor dergelijke videocategorieën zijn op keyshots gebaseerde samenvattingstechnieken nuttiger en efficiënter om gebruikers een kort overzicht te geven.

De subjectieve aard van de videosamenvatting maakt het een ontmoedigende taak. Dit komt door het feit dat elke gebruiker een eigen smaak heeft, zelfs als het gaat om vergelijkbare video-inhoud. Dit probleem kan nauwkeurig worden opgelost met behulp van de op maat gemaakte video-samenvattingsaanpak13. Het doel van het algoritme is om elke gebruiker inhoud te bieden die is afgestemd op zijn interesses. Aangepaste videosamenvattingen met een ideale duur voor nieuwe lange video's (zoals sportevenementen) zijn echter niet direct beschikbaar. De huidige methoden14,15 vereisen enorme computerbronnen om klantvoorkeursgegevens en videobeelden te evalueren om in realtime geïndividualiseerde samenvattingen te bieden. Realtime, gepersonaliseerde videosamenvattingen kunnen worden verkregen van gecentraliseerde dedicated servers. Babu Veesam en Satish16 bespraken een grondige taxonomische analyse van alle belangrijke strategieën voor het samenvatten van video's die veelgebruikte benaderingen demonstreren die effectief enorme hoeveelheden videogegevens comprimeren. De review classificeert en beoordeelt methodologieën in relatie tot hun fundamentele benaderingen, waaronder multimodale integratiestrategieën, deep learning-frameworks en op clustering gebaseerde methoden. Tot de opmerkelijke methoden behoren het KDAN-framework, dat kennisdestillatie gebruikt voor gesuperviseerde samenvatting, en de SVS_MCO-methode, die gebruikmaakt van DBSCAN-clustering die is geoptimaliseerd door het Artificial Algae Algorithm. Bovendien biedt de review geavanceerde modellen zoals het Audio-Visual Recurrent Network en het Query-based Deep African Vulture Learning, die zeer effectief zijn gebleken bij het beheren van dynamische en multimodale video-samenvattingsproblemen.

De opname van een gated AlexNet Recurrent Neural Network (GARNN-AE-LSTM) multimodaal raamwerk voor video-samenvatting is wat deze studie nieuw maakt. Deze aanpak verbetert de nauwkeurigheid en efficiëntie van het video-samenvattingsproces door redundantie te verminderen met bewegingsgecompenseerde PCA, temporele dynamiek vast te leggen met GRU's en de ruimtelijke functieselectie te optimaliseren met behulp van poortmethoden. Om de videosamenvatting efficiënt te maken met verminderde complexiteit, draagt dit artikel het volgende bij: (i) Multimodale videosamenvatting: Een raamwerk voorgesteld voor het genereren van beknopte videosamenvattingen door zowel visuele als auditieve informatie te integreren met behulp van een vooraf getraind GARNN-model dat Gated RNN's en AlexNet combineert. (ii) Gated AlexNet voor verfijning van functies: Introduceerde een nieuw gated mechanisme (Sigmoid gate) in de dichte laag van AlexNet om irrelevante ruimtelijke kenmerken te filteren, waardoor de extractie van visuele kenmerken op hoog niveau werd verbeterd. De integratie met RNN maakt effectieve temporele modellering van frame-to-frame-afhankelijkheden mogelijk. (iii) Redundante frame-eliminatie: Ontwikkelde een op beweging gecompenseerde variantiegebaseerde benadering om identieke of vergelijkbare frames te verwijderen voorafgaand aan keyframe-detectie, gevolgd door optionele PCA-gebaseerde dimensionaliteitsreductie voor efficiënte functieweergave. (iv) Nauwkeurige keyframe-detectie: Gebruikte een op adversarial encoder gebaseerde LSTM-classificator voor temporele modellering, waarbij een gemiddelde F-score van 0,985 werd behaald, wat een superieure samenvattende nauwkeurigheid aantoont in vergelijking met basislijnbenaderingen. (v) Efficiëntie ten opzichte van transformatormodellen: Aangetoond dat het voorgestelde GARNN-model rekenkundig efficiënt is, waarbij AlexNet effectief ruimtelijke kenmerken vastlegt, RNN sequentiële afhankelijkheden modelleert en het poortmechanisme onbelangrijke frames filtert, waardoor het beter presteert dan op transformatoren gebaseerde alternatieven bij het selecteren en samenvatten van functies.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie stelt een multimodale methode voor het samenvatten van video's onder toezicht voor die valt in de categorie generieke video-samenvatting, gewoonlijk video-skimming genoemd. Dit omvat technieken die zich concentreren op het vinden van belangrijke segmenten van een grotere video om er een tijdelijk verkorte versie van te maken. Deze studie suggereert een gesuperviseerde techniek om de videostream te analyseren in secties van 1 s die audio- en visuele representaties bevatten, zoals weergegeven in figuur 1. Deze segmenten worden vervolgens gecategoriseerd als "oninteressant" of "informatief". In tegenstelling tot synthetische of gesimuleerde gegevens, verwijzen "echte gegevens" nu naar de daadwerkelijke videodatasets die voor experimenten worden gebruikt. Videosegmenten die belangrijke audiovisuele signalen leveren die nodig zijn voor samenvattingen, zoals hoge bewegings-, stem- of scèneovergangen, worden 'informatieve segmenten' genoemd. "Oninteressante" delen worden gedefinieerd als repetitieve of overbodige frames die niets nieuws toevoegen aan de synopsis.

De invoervideo's worden gesegmenteerd in frames en de multimodale functies worden uit elk frame geëxtraheerd met behulp van het voorgestelde GARNN-model. De audio- en visuele functies worden samengevoegd en als invoer ingevoerd in de fase van dimensionaliteitsreductie, waar de overbodige frames worden verwijderd voor verdere verwerking. Ten slotte wordt de voorgestelde AELSTM toegepast op de beperkte gegevens voor videosamenvatting. Een gesuperviseerde binaire classifier die is getraind met functierepresentaties van de visuele, audio- of gemengde modaliteiten, multimodaliteiten genoemd, wordt gebruikt om dit te bereiken.

figure-protocol-1
Figuur 1: Overzicht van het voorgestelde video-samenvattingsmodel. De pijplijn omvat multimodale functie-extractie, dimensionaliteitsreductie en het genereren van samenvattingen met behulp van AELSTM. Klik hier om een grotere versie van deze figuur te bekijken.

Dataset
De effectiviteit van de voorgestelde oplossingen wordt bepaald met behulp van VSUMM17- en SumMe18-datasets, een paar benchmarkdatasets in statische video-samenvatting. CNN-functies die zijn gemaakt met behulp van AlexNet met LSTM en echte gegevens behoren tot de datasets. De echte gegevens en datasets zijn toegankelijk voor het grote publiek19. De 50 films in de VSUMM-dataset zijn afkomstig van websites als YouTube en beslaan 110 minuten met 30 frames per seconde. Ze zijn er in verschillende genres, waaronder tekenfilms, nieuws, sport, reclame, tv-series en homevideo's. Hiervan bestaan 25 video's uit vakanties, festivals en sporten die zijn verkregen van de bekende YouTube-site en getagd met ten minste 15 door mensen gegenereerde samenvattingen (390 in totaal) die de "SumMe"20-videosamenvattingsdataset vormen. De duur van video's is 1-6 minuten.

De originele video wordt geconverteerd naar RGB-afbeeldingen, die als invoer worden ingevoerd in het vooraf getrainde voorgestelde GARNN-model voor functie-extractie. Dit model bestaat uit AlexNet en een gated RNN. Het oorspronkelijke aantal functies is 64 en de functies van AlexNet hebben 4100 functies.

Voorgestelde extractie van functies op basis van Gated-AlexNet-RNN
Zowel de visuele als de audio-informatiemodus zijn gebruikt om de video's samen te vatten. Om een functierepresentatie in beide modaliteiten te bereiken, hebben we handgemaakte functies geïdentificeerd die vaak worden gebruikt bij audio- en visuele clustering- en classificatietaken, zoals het ophalen van afbeeldingen, videoclassificatie, auditieve scèneanalyse en het ophalen van muziekinformatie. Het doel was om zoveel mogelijk educatieve visuele en audiocomponenten op te nemen. Figuur 2 toont een conceptuele illustratie van het proces dat wordt gebruikt om kenmerken voor de audio- en visuele modaliteiten te extraheren.

figure-protocol-2
Figuur 2: Voorgestelde multimodale functie-extractie op basis van GARNN. Functies van zowel visuele als audiomodaliteiten worden geëxtraheerd met behulp van AlexNet- en GARNN-componenten. Klik hier om een grotere versie van deze figuur te bekijken.

Omheind - AlexNetRNN: (GARNN)
Voor virtuele beeldanalyse is CNN een populair DL-model21. Over het algemeen gebruikt CNN de afbeelding als input en verdeelt deze in verschillende groepen. Invoerneuronen, een opeenvolging van lagen met convolutionele pooling, lagen die volledig met elkaar verbonden zijn en normaliserende lagen vormen de structuur22. De neuronen van de convolutielaag zijn via een smal gebied verbonden met de voorgaande laag. De lagen eronder zijn volledig verbonden met de activerende neuronen van de volledig gekoppelde lagen. Eqn (1) staat voor de voorwaartse en achterwaartse voortplanting van een volledig verbonden functie.

figure-protocol-3(1)

figure-protocol-4(2)

Waar figure-protocol-5 is de activering van het ith neuron in le laag, figure-protocol-6 is de gradiënt van ide neuron in le laag, figure-protocol-7 is het gewicht van ie neuron in l + 1e laag. Talloze CNN-ontwerpen zijn naar voren gekomen als gevolg van recente onderzoeksontwikkelingen. AlexNet is in dit werk gebruikt.

De architectuur van AlexNet, weergegeven in figuur 3, weerspiegelt een nauwgezet en goed gestructureerd ontwerp. Drie volledig verbonden lagen en vijf convolutielagen vormen de acht leerlagen. De klasse-etiketten worden geproduceerd door het resultaat van de laatste laag in de functie te voeren die softmax activeert. De kernels van de tweede, vierde of vijfde laag zijn verbonden met hun eerdere niveaus via GPU-deling. De tweede en derde laag kernels zijn volledig met elkaar verbonden. De normalisatielaag is verbonden met de maximale poolinglagen na het eerste en tweede niveau. ReLU is gekoppeld aan alle leerlagen.

figure-protocol-8
Figuur 3: Architectuur van AlexNet. Vijf convolutionele lagen en drie volledig verbonden lagen worden gebruikt om visuele gegevens in het samenvattende model te verwerken. Klik hier om een grotere versie van deze figuur te bekijken.

Het primaire backbone-netwerk voor het werk was een GARNN met een dichte laag. Er zijn drie lagen in de dikke RNN. Met 80 neuronen in de tweede laag en 170 in de eerste, bestaat het uit twee volledig verbonden (fc) lagen. De volgende lagen zijn batchnormalisatie en dropout. De fc, de laatste laag, bestaat uit drie neuronen en wordt gebruikt om het beeld op te delen. De dichte laag, die na de LSTM komt, verdeelt het gebied rond de hersentumor. AlexNet geeft de LSTM-laag functies. De dataset heeft een maximum van 20 segmenten, wat gelijk is aan het totale aantal sequenties dat is gedeclareerd. De eerste laag van de GARNN bevat 100 verborgen eenheden, terwijl de derde laag 125 verborgen eenheden bevat.

Het poortmechanisme werd opgenomen in de dichte (volledig gekoppelde) laag van AlexNet in het door ons voorgestelde GARNN-AE-LSTM-framework. Convolutionele functiekaarten worden vaak verwerkt door AlexNet en rechtstreeks naar volledig verbonden lagen gestuurd voor classificatie. Alle opgehaalde ruimtelijke kenmerken, inclusief redundante of minder significante patronen, worden met deze methode gelijk behandeld. We hebben dit aangepakt door een poortfunctie te introduceren die functioneert als een functiefilter en is gebaseerd op een sigmoïde. In wiskundige termen moduleert een poortvector g = σ(wX) + b de output van de dichte laag, waarbij σ de sigmoïde functie vertegenwoordigt. Tijdens de training leert deze poort om verschillende functieactiveringsgewichten te geven, variërend van 0 tot 1. Dit zijn: (i) lage gate-waarden onderdrukken irrelevante kenmerken (bijv. achtergrondruis of overbodige texturen). (ii) Hogere gate-waarden benadrukken discriminerende kenmerken (zoals belangrijke objectgebieden of bewegingsgevoelige patronen). (iii) Deze verbeterde functieset wordt vervolgens gebruikt door de RNN-component, waardoor deze temporele afhankelijkheden beter kan vastleggen zonder op een zijspoor te raken door irrelevante ruimtelijke informatie. (iv) Backpropagation wordt gebruikt om de gating-parameters tijdens de training te wijzigen in combinatie met AlexNet en de RNN. Dit houdt in dat het model na verloop van tijd leert welke aspecten het belangrijkst zijn om samen te vatten, naast welke kenmerken moeten worden geëxtraheerd.

In Figuur 4 geeft de variabele X de invoergegevens aan, C de cel en H de verborgen toestand.

figure-protocol-9
Afbeelding 4: Gated Recurrent Neural Network architecture (GARNN) model. De GARNN integreert batchnormalisatie, dropout en meerdere dichte lagen voor effectieve sequentiemodellering. Klik hier om een grotere versie van deze figuur te bekijken.

In elk blok zijn de respectievelijke gewichten, zoals Iw, Rw en bias genaamd input, recurrent weight en bias, respectievelijk gebruikt zoals in Eqn (3) tot Eqn (5)

figure-protocol-10(3)

figure-protocol-11(4)

figure-protocol-12(5)

Op een bepaald tijdstip t wordt de toestand van de cel aangeduid als in Eqn (6)

figure-protocol-13(6)

Waar figure-protocol-14 het product van Hadamard en de staat van verborgen eenheid wordt aangeduid zoals in Eqn (7)

figure-protocol-15(7)

Het maakt dus gebruik van de py Audio Analysis-module om audiokenmerken op segmentniveau te berekenen voor elke audioclip die is geëxtraheerd uit het bijbehorende videobestand, met behulp van ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. De geëxtraheerde kenmerken worden vermeld in tabel 1.  In overeenstemming met dit proces wordt de extractie van audiofuncties in eerste instantie op tijdelijke basis uitgevoerd. Het laatste deel van de weergave bestaat uit functiestatistieken op segmentniveau die op een tweede niveau worden berekend. Concreet wordt een kortetermijnverwerking uitgevoerd voor elk segment van het audiosignaal, wat resulteert in de berekening van 68 kortetermijnkenmerken (34 kenmerken en 34 delta's) voor elk venster op segmentniveau, die al dan niet overlappend kunnen zijn. We hebben een verscheidenheid aan visuele kenmerken gebruikt om de inhoud van de visuele informatie over te brengen, naast het extraheren van auditieve elementen uit het geluidssignaal van elke video. Deze modaliteit zal naar verwachting cruciaal zijn voor het samenvattende proces. De multimodal_movie_analysis bibliotheek (https://github.com/tyiannak/multimodal_movie_analysis) is gebruikt om functies te extraheren die visuele aspecten van een video weerspiegelen om deze visuele elementen te extraheren. Concreet worden de 88 onderstaande visuele elementen elke 0,2 s uit het bijpassende frame gehaald. Hierin worden de multimodale functies samengevoegd en worden in totaal 59 functies gebruikt voor verdere analyse van het classificeren van de video als informatief en niet interessant door de video-samenvatting uit te voeren.

Functievermindering met PCA
De dimensie van de kenmerken in deze studie is verminderd door de toepassing van principal component analysis (PCA). De basiskenmerken worden omgezet in sleutelkenmerken om hun bekendheid en belang te vergroten. PCA is op grote schaal gebruikt door tal van onderzoekers in verschillende domeinen24. De eigenwaarden worden gebruikt om de eigenschappen te bepalen. De kenmerken met de hoogste eigenwaarde worden geselecteerd, terwijl de kenmerken met de laagste eigenwaarde worden verwijderd.

Na het verwijderen van overbodige frames wordt PCA in dit onderzoek gebruikt als een optionele stap voor het verminderen van functies. PCA onderdrukt ruis en overbodige informatie door de hoogdimensionale kenmerkvectoren die door GARNN worden geproduceerd, te comprimeren tot een kleine deelruimte. Dit verhoogt de rekenefficiëntie van de AE-LSTM en garandeert tegelijkertijd dat de keyframe-detectie wordt gedomineerd door de meest onderscheidende visuele en auditieve aanwijzingen. Om schaalbaarheid en nauwkeurigheid in videosamenvatting in evenwicht te brengen, wordt PCA gebruikt als een handig hulpmiddel. Het algoritme (algoritme 1) wordt geleverd als aanvullend bestand 1.

Elk frame dat precies hetzelfde is als of opvallend vergelijkbaar is met het voorgaande frame wordt als overbodig beschouwd. Het is duidelijk dat het wijzigen van de framerate van invloed kan zijn op het aandeel verwijderde videoframes. Meer specifiek, naarmate de framesnelheden toenemen, neemt ook de gelijkenis tussen opeenvolgende frames toe, wat leidt tot een hoger percentage frames dat wordt verwijderd. Nu worden de functies met verminderde dimensionaliteit gebruikt om het ML-model te trainen, dat het vijandige AE-LSTM-model wordt genoemd.

Trainen met AELSTM
Een neuraal netwerk dat een GAN25 wordt genoemd, bestaat uit twee rivaliserende subnetwerken: i) een "generator"-netwerk (G) dat gegevens creëert die lijken op een onbekende verdeling, en ii) een "discriminator"-netwerk (D) dat onderscheid maakt tussen de gemaakte monsters en die van daadwerkelijke waarnemingen. Het doel is om een generator te vinden die de kans dat de discriminator een fout begaat maximaliseert en tegelijkertijd past bij de daadwerkelijke gegevensdistributie.

Stel dat X de invoer is en E de voorafgaande invoerruis, X'= g(E) is de gegenereerde steekproef. Aan de hand van de minimax optimalisatie wordt het leren geformuleerd:

figure-protocol-16(8)

Waarbij D gekwalificeerd is om de juiste waarschijnlijkheid van de classificatie te verkrijgen. De onderdelen van ons ontwikkelde trainingsmodel zijn weergegeven in Figuur 5. De selector LSTM kiest de frames-subset uit de invoervideoreeks X. De geselecteerde frames worden geconverteerd naar functie E met een vaste lengte met behulp van de encoder-LSTM, gevolgd door de videoreconstructie X' met behulp van de decoder-LSTM. De classificatie van X' in echte video- of samenvattende klasse wordt uitgevoerd door de discriminator-LSTM. In deze studie wordt AE-LSTM gebruikt voor video-samenvattingen met GAN-structuur voor efficiënte, diverse en gestructureerde video-samenvattingen. De AE kan de onnodige achtergrondveranderingen elimineren, en de LSTM kan de scèneovergangen detecteren in plaats van de frames als afbeeldingen te behandelen, en de GAN, de generator kan de video samenvatten en de discriminator zorgt ervoor dat de samenvatting divers is

figure-protocol-17
Figuur 5: Architectuur van het AELSTM-samenvattingsmodel. Bevat Selector-LSTM, Encoder-LSTM, Decoder-LSTM en Discriminator-LSTM om videosamenvattingen te optimaliseren via adversarial training. Klik hier om een grotere versie van deze figuur te bekijken.

Door de GARNN-functies te geven voor elk frame in de invoervideo X genaamd figure-protocol-18 , gebruikt de summarizer de Selector LSTM om de frames-subset te kiezen, en de encoder codeert de frames als E, gevolgd door de decoder die de video reconstrueert als X' bij elk frame xt. De selector gebruikt de belangrijkheidsscore bij het selecteren van het frame. De functies worden gegeven door de gewichtswaarde met behulp van de scores en gaan vervolgens naar de encoder. Voor elk frame met score st = 1 wordt de subset alleen ontvangen door de encoder. De discriminator kiest de klassen als origineel of samenvattend door de afstand tussen X en X' te schatten en de labels toe te kennen. In dit geval berekent de discriminator de fout tussen de originele en samenvattende video's. Algoritme 2 (aanvullend bestand 2) geeft de samenvatting aan van de training van AELSTM voor videosamenvatting.

Nabewerking – Video-samenvatting
Videosamenvattingen kunnen worden geproduceerd door classificatoren op segmentniveau nadat ze zijn getraind. Om dit te bereiken zijn drie stappen nodig: (i) Bepaal de audio-, visuele of gemengde kenmerken van elk videosegment. (ii) Classificeer elk videosegment met behulp van de juiste audio-, visuele of fusieclassificatie. (iii) Om flagrante fouten te voorkomen, moet u de ordelijke classificatievoorspellingen nabewerken.

Om aan deze vraag te voldoen, is voor de nabewerkingsstap een pijplijn ontwikkeld die bestaat uit twee verschillende filters. De invoerarray wordt eerst onderworpen aan een mediaanfilter met lengte N1 waarbij gebruik wordt gemaakt van lokale vensters om de sequentiële classificatievoorspellingen af te vlakken. De uiteindelijke voorspellingen worden vervolgens bepaald door hard te filteren met behulp van een eenvoudige methode die een reeks opeenvolgende positieve voorspellingen (informatieve segmenten) handhaaft als ten minste N2-segmenten in die reeks zijn opgenomen. Anders gezegd, dat criterium vereist dat een instructief segment minstens N2 seconden duurt.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Er werd geëxperimenteerd met de voorgestelde op GARNN gebaseerde functie-extractie en AGLSTM-gebaseerde video-samenvatting van lange video's op twee datasets, namelijk VSUMM en SumMe. In dit deel worden de experimentele resultaten en de vergelijking met conventionele benaderingen besproken. Voor de discriminator LSTM gebruiken we een tweelaagse LSTM met 1024 verborgen eenheden op elke laag. Voor respectievelijk encoder_LSTM en decoder_LSTM gebruiken we twee tweelaagse LSTM's met 2048 ver...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In deze studie wordt de video-samenvatting van lange video's gepresenteerd met behulp van efficiënte multimodale ML- en DL-modellen, die gebruik maken van audio-, beeld- en visuele modaliteiten van gegevens die zijn gegenereerd op basis van de invoergegevens. De binaire classificator is getraind om het onderscheid te leren tussen de belangrijke segmenten die het geproduceerde samenvattende deel zijn en de "niet-belangrijke" segmenten die worden weggegooid. Het model wordt getraind met be...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hebben geen belangenconflicten.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs zijn Dr. Television School, Sichuan Film and Television University, dankbaar voor het verstrekken van de laboratoriumfaciliteiten om het onderzoek uit te voeren.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
AlexNet (vooraf getraind model)MATLAB / PyTorchPyTorch Hub — AlexNet vooraf getraind model: https://pytorch.org/hub/pytorch_vision_alexnet/Gebaat voor visuele functie-extractie
FFmpegFFmpeg.orghttps://ffmpeg.org/Audio-extractie uit video
GRNN-gebaseerd modelAangepaste implementatieBibliotheek “neupy” implementeert GRNN: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlGebaat voor multimodale functiefusie
LSTM (Long Short-Term Memory)PyTorchhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlGebaat in Selector, Encoder, Decoder
Multimodal_movie_analysis libGitHubhttps://github.com/tyiannak/multimodal_movie_analysisVoor visuele functie-extractie
NumPyPython Software Foundationhttps://pypi.org/project/numpy/Numerieke berekening en matrixbewerkingen
PCA (Principal Component Analysis)Scikit-learnhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlDimensionaliteitsreductie
PyAudioAnalysisGitHubhttps://github.com/tyiannak/pyaudioanalysisAudio-functie-extractie
PyTorchPyTorch Foundationhttps://pytorch.org/Deep learning-framework
SumMe DatasetPubliek datasethttps://gyglim.github.io/me/vsum/index.htmlBenchmark video samenvatting dataset
VSUMM DatasetPubliek datasethttp://www.vision.ime.usp.br/~creativision/vsumm/Benchmark video samenvatting dataset

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Gated Recurrent UnitsKeyframe detectieFeature extractieBewegingscompensatiePCA reductieAdversari le EncoderTemporele ModelleringF1 score

Gerelateerde artikelen