Articolo di ricerca

GARNN-AE-LSTM: un approccio multimodale di deep learning per un riepilogo video ad alta precisione

DOI:

10.3791/69097

10 ottobre 2025

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio propone un framework di deep learning multimodale per il riassunto video integrando funzionalità audiovisive utilizzando modelli GARNN pre-addestrati. Sfruttando GRU, AlexNet e un classificatore LSTM avversario, il sistema migliora il rilevamento dei fotogrammi chiave, riduce la ridondanza e raggiunge un'elevata precisione di riepilogo con un punteggio F medio di 0,985.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il riepilogo video si concentra sulla creazione di versioni concise di video lunghi preservando i contenuti essenziali. Questo studio rivela una strategia di apprendimento automatico multimodale che integra informazioni visive e uditive utilizzando architetture di reti neurali ricorrenti con gate pre-addestrate denominate GARNN, che combinano unità ricorrenti con gate (GRU) e AlexNet, per estrarre audio, immagini e funzionalità visive. Il rilevamento dei fotogrammi chiave è stato migliorato rimuovendo i fotogrammi ridondanti e applicando la riduzione delle funzioni con compensazione del movimento, seguita dalla riduzione della dimensionalità basata su PCA opzionale. Per la modellazione temporale viene utilizzato un classificatore AE-LSTM (Adversarial Encoder-Based Long Short-Term Memory) che consente di ottenere un'elevata precisione nel riepilogo. I risultati sono stati valutati utilizzando sensibilità, punteggi F e valori predittivi positivi e il metodo ha raggiunto un punteggio F medio di 0,985. Un AlexNet gated viene introdotto in un framework multimodale GARNN-AE-LSTM, in cui la riduzione basata su PCA con compensazione del movimento elimina la ridondanza, i GRU registrano la progressione temporale e il gating ottimizza la selezione delle caratteristiche spaziali, tutti elementi che contribuiscono a un sistema di riepilogo video più accurato ed efficiente. Il punteggio F1 migliorato dimostra l'efficacia del modello nel generare precisione nei riepiloghi video creando un video significativo. Questo approccio evidenzia il potenziale dell'estrazione di feature multimodali e delle tecniche avanzate di deep learning per un'analisi e una compressione video affidabili.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sono emersi sistemi di analisi multimodale (MMA), che combinano diverse modalità come audio, video, testo e dati dei sensori per fornire informazioni su come gli studenti apprendono1. Queste tecnologie possono aiutare ad acquisire una comprensione approfondita del comportamento degli studenti e dei livelli di coinvolgimento valutando i dati multimodali2. Tuttavia, ci sono una serie di ostacoli e restrizioni quando si tratta di creare sistemi MMA efficienti3. Ci sono un sacco di video digitali a causa della crescita di Internet e delle telecamere di sicurezza. È imperativo che questi video siano compilati in database. Un video riassuntivo può essere utile in questa situazione. La creazione di un'utile sinossi del video reale è nota come riassunto video e aiuta con il monitoraggio dell'attività, il rilevamento delle anomalie e il recupero video4. Il riepilogo video può essere realizzato utilizzando una varietà di strategie. Questi metodi rientrano in una delle due categorie5, come il riassunto video estrattivo e astratto.

Poiché il riassunto video richiede molto calcolo, sono necessari metodi efficienti. Se ogni fotogramma di un filmato viene esaminato per la selezione, il processo di riepilogo potrebbe essere lento e lungo e le risorse di elaborazione potrebbero essere spese per fotogrammi identici o simili. Inoltre, per accelerare il processo e garantire che vengano prese in considerazione solo le caratteristiche importanti, la riduzione dello spazio dovrebbe essere eseguita su qualsiasi insieme di funzionalità6. Le tecniche per il riassunto video possono essere classificate in quattro aree principali in base al tipo di segnali audiovisivi prodotti e mostrati all'utente finale7, o al loro output. Per essere più specifici, i risultati dei calcoli di riepilogo video potrebbero includere: (i) fotogrammi primari8, che sono fotogrammi video estratti visualizzati in sequenza comunemente noti come riepiloghi statici; (ii) fotogrammi video9, che sono chiamati riassunti dinamici; iii) segnali visivi10, che migliorano i riassunti per l'utente finale aggiungendo una sintassi basata sulla grafica ad altri segnali; e (iv) generate da computer, annotazioni testuali11, progettate per offrire riassunti efficienti delle informazioni video.

I riepiloghi basati sui fotogrammi chiave sono in genere più piccoli di quelli basati sui fotogrammi chiave. Il fotogramma chiave si riferisce a un singolo fotogramma rappresentativo selezionato dal video. Keyshot indica un breve segmento continuo di fotogrammi video raggruppati attorno a fotogrammi chiave. La classe di riepilogo si riferisce ai frame o ai segmenti di etichettatura dell'output del classificatore come informativi (da includere nel riepilogo) o non informativi (da escludere). Tuttavia, questo vantaggio va a scapito dell'omissione di dettagli importanti nel processo di riassunto. Ad esempio, può essere difficile ottenere il contesto del fotogramma precedente in un riepilogo basato su fotogrammi chiave. È anche privo del suono originale. Per risolvere questi problemi, vengono quindi spesso scelte tecniche di riassunto video basate su keyshot. Le tecniche di riassunto video basate su Keyshot vengono utilizzate per creare sottoinsiemi di video lunghi o brevi. I video brevi e lunghi hanno in genere una durata inferiore e superiore a 10 minuti, rispettivamente12. La generazione di sottoinsiemi assistiti da keyshot per i video di breve durata non è pratica e potrebbe non avere successo a causa della loro già breve durata di riproduzione. Inoltre, il tempo di riproduzione dei video di lunga durata, in particolare film o video sportivi, potrebbe superare i 90 minuti. Per queste categorie di video, le tecniche di riepilogo basate su keyshot sono più utili ed efficienti per fornire agli utenti una breve panoramica.

La natura soggettiva del riassunto video lo rende un compito arduo. Ciò è dovuto al fatto che ogni utente ha gusti distinti, anche quando si tratta di contenuti video comparabili. Questo problema può essere risolto con precisione con l'aiuto dell'approccio di riepilogo video su misura13. L'obiettivo dell'algoritmo è fornire a ciascun utente contenuti su misura per i suoi interessi. Tuttavia, i riassunti video adattati con durate ideali per i nuovi video di lunga durata (come gli eventi sportivi) non sono facilmente disponibili. I metodi attuali14,15 richiedono enormi risorse informatiche per valutare i dati sulle preferenze dei clienti e le riprese video al fine di fornire riepiloghi personalizzati in tempo reale. È possibile ottenere riepiloghi video personalizzati in tempo reale da server dedicati centralizzati. Babu Veesam e Satish16 hanno discusso un'analisi tassonomica approfondita di tutte le principali strategie di riepilogo video che dimostrano approcci ampiamente utilizzati che comprimono efficacemente grandi quantità di dati video. La revisione classifica e valuta le metodologie in relazione ai loro approcci fondamentali, che includono strategie di integrazione multimodale, framework di deep learning e metodi basati sul clustering. Tra i metodi degni di nota ci sono il framework KDAN, che utilizza la distillazione della conoscenza per il riepilogo supervisionato, e il metodo SVS_MCO, che utilizza il clustering DBSCAN ottimizzato dall'algoritmo delle alghe artificiali. Inoltre, la revisione fornisce modelli sofisticati come l'Audio-Visual Recurrent Network e il Query-based Deep African Vulture Learning, che si sono rivelati molto efficaci nella gestione di problemi di riassunto video dinamico e multimodale.

L'inclusione di un framework multimodale AlexNet Recurrent Neural Network (GARNN-AE-LSTM) per il riassunto video è ciò che rende questo studio innovativo. Questo approccio migliora l'accuratezza e l'efficienza del processo di riepilogo video riducendo la ridondanza con PCA con compensazione del movimento, acquisendo dinamiche temporali con GRU e ottimizzando la selezione delle caratteristiche spaziali utilizzando metodi di gating. Al fine di fornire il riassunto video in modo efficiente con una complessità ridotta, questo articolo contribuisce a quanto segue: (i) Riassunto video multimodale: Proposto un framework per la generazione di riassunti video concisi integrando informazioni visive e uditive utilizzando un modello GARNN pre-addestrato che combina RNN gate e AlexNet. (ii) Gated AlexNet per il perfezionamento delle funzionalità: Introdotto un nuovo meccanismo gated (Sigmoid gate) nello strato denso di AlexNet per filtrare le caratteristiche spaziali irrilevanti, migliorando così l'estrazione di caratteristiche visive di alto livello. L'integrazione con RNN consente un'efficace modellazione temporale delle dipendenze da fotogramma a fotogramma. (iii) Eliminazione dei fotogrammi ridondanti: Sviluppato un approccio basato sulla varianza con compensazione del movimento per rimuovere fotogrammi identici o simili prima del rilevamento dei fotogrammi chiave, seguito da una riduzione della dimensionalità basata su PCA opzionale per una rappresentazione efficiente delle funzioni. (iv) Rilevamento accurato dei fotogrammi chiave: ha utilizzato un classificatore LSTM basato su encoder avversario per la modellazione temporale, ottenendo un punteggio F medio di 0,985, dimostrando così un'accuratezza di sintesi superiore rispetto agli approcci di base. (v) Efficienza rispetto ai modelli di trasformatori: Ha dimostrato che il modello GARNN proposto è efficiente dal punto di vista computazionale, in cui AlexNet cattura efficacemente le caratteristiche spaziali, RNN modella le dipendenze sequenziali e il meccanismo di gating filtra i frame non importanti, superando le alternative basate su trasformatori nella selezione e nel riepilogo delle funzionalità.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio propone un metodo di riassunto video supervisionato multimodale che rientra nella categoria di riepilogo video generico, comunemente indicato come video skimming. Ciò include tecniche che si concentrano sulla ricerca di segmenti chiave di un video più grande per crearne una versione temporalmente condensata. Questo studio suggerisce una tecnica supervisionata per analizzare il flusso video in sezioni di 1 s che includono rappresentazioni audio e visive, come mostrato nella Figura 1. Questi segmenti vengono quindi classificati come "poco interessanti" o "informativi". A differenza dei dati sintetici o simulati, i "dati reali" ora si riferiscono ai set di dati video effettivi utilizzati per gli esperimenti. I segmenti video che forniscono importanti segnali audiovisivi necessari per il riepilogo, come il movimento elevato, la voce o le transizioni di scena, sono indicati come "segmenti informativi". Le parti "non interessanti" sono definite come fotogrammi ripetitivi o ridondanti che non aggiungono nulla di nuovo alla sinossi.

I video di input vengono segmentati in fotogrammi e le funzionalità multimodali vengono estratte da ciascun fotogramma utilizzando il modello GARNN proposto. Le funzioni audio e video vengono fuse e inserite come input nella fase di riduzione della dimensionalità, in cui i fotogrammi ridondanti vengono rimossi per un'ulteriore elaborazione. Infine, l'AELSTM proposto viene applicato ai dati ridotti per il riepilogo video. A tale scopo, viene utilizzato un classificatore binario supervisionato sottoposto a training con rappresentazioni di funzionalità dalle modalità visive, audio o miste, denominate multimodalità.

figure-protocol-1
Figura 1: Panoramica del modello di riepilogo video proposto. La pipeline include l'estrazione di feature multimodali, la riduzione della dimensionalità e la generazione di riepiloghi tramite AELSTM. Clicca qui per visualizzare una versione più grande di questa figura.

Dataset
L'efficacia delle soluzioni suggerite è determinata utilizzando i set di dati VSUMM17 e SumMe18 , una coppia di set di dati di riferimento in sintesi video statica. Le funzionalità della CNN create utilizzando AlexNet con LSTM e i dati reali sono tra i set di dati. I dati e le serie di dati reali sono accessibili al pubblicoin generale 19. I 50 film nel set di dati VSUMM provengono da siti Web come YouTube e durano 110 minuti a 30 fotogrammi al secondo. Sono disponibili in una varietà di generi, tra cui cartoni animati, notizie, sport, pubblicità, serie TV e home video. Tra questi, 25 video costituiti da festività, festival e sport che sono stati ottenuti dal noto sito YouTube e taggati con almeno 15 riassunti generati dall'uomo (390 in totale) compongono il set di dati di riepilogo video "SumMe"20 . L'intervallo di durata dei video è di 1-6 minuti.

Il video originale viene convertito in immagini RGB, che vengono inserite come input nel modello GARNN proposto pre-addestrato per l'estrazione delle funzionalità. Questo modello è costituito da AlexNet e da un RNN gated RNN. Il numero originale di funzioni è 64 e le funzioni di AlexNet ne hanno 4100.

Proposta di estrazione di funzionalità basata su Gated-AlexNet-RNN
Sia la modalità visiva che quella audio delle informazioni sono state utilizzate per riassumere i video. Per ottenere una rappresentazione delle caratteristiche in entrambe le modalità, abbiamo identificato caratteristiche realizzate a mano che vengono spesso utilizzate in attività di clustering e classificazione audio e video, come il recupero di immagini, la classificazione video, l'analisi di scene uditive e il recupero di informazioni musicali. L'obiettivo era quello di includere il maggior numero possibile di componenti didattici, visivi e audio. La Figura 2 mostra un'illustrazione concettuale del processo utilizzato per estrarre le funzionalità per le modalità audio e video.

figure-protocol-2
Figura 2: Proposta di estrazione di funzionalità multimodale basata su GARNN. Le caratteristiche delle modalità visive e audio vengono estratte utilizzando i componenti AlexNet e GARNN. Clicca qui per visualizzare una versione più grande di questa figura.

Gate- AlexNetRNN: (GARNN)
Per l'analisi delle immagini virtuali, la CNN è un popolare modello DL21. In generale, la CNN utilizza l'immagine come input e la divide in diversi gruppi. I neuroni di input, una sequenza di strati con pooling convoluzionale, strati completamente collegati e strati normalizzanti costituiscono la sua struttura22. I neuroni dello strato di convoluzione sono collegati allo strato precedente tramite una regione stretta. Gli strati sottostanti sono completamente collegati ai neuroni attivanti degli strati completamente collegati. Eqn (1) rappresenta la propagazione in avanti e all'indietro di una funzione completamente connessa.

figure-protocol-3(1)

figure-protocol-4(2)

Dove figure-protocol-5 è l'attivazione dell'i-esimo neuronenell'1-esimo strato è, figure-protocol-6 è il gradiente dell'i-esimo neurone nell'l-esimo strato, figure-protocol-7 è il peso dell'i-esimo neurone nell'l+1° strato. Numerosi progetti di CNN sono emersi come risultato dei recenti progressi della ricerca. AlexNet è stato utilizzato in questo lavoro.

L'architettura di AlexNet, mostrata in Figura 3, riflette un design meticoloso e ben strutturato. Tre livelli completamente collegati e cinque livelli di convoluzione costituiscono i suoi otto livelli di apprendimento. Le etichette di classe vengono prodotte inserendo il risultato dell'ultimo strato nella funzione che attiva softmax. I kernel di secondo, quarto o quinto livello sono connessi ai loro livelli precedenti tramite la condivisione della GPU. I kernel del secondo e del terzo strato sono completamente collegati tra loro. Il livello di normalizzazione è collegato ai livelli di pooling max dopo il primo e il secondo livello. ReLU è collegato a tutti i livelli di apprendimento.

figure-protocol-8
Figura 3: Architettura di AlexNet. Cinque livelli convoluzionali e tre livelli completamente connessi vengono utilizzati per elaborare i dati visivi nel modello di riepilogo. Clicca qui per visualizzare una versione più grande di questa figura.

La rete dorsale primaria per il lavoro era un GARNN a strato denso. Ci sono tre strati nella RNN spessa. Con 80 neuroni nel secondo strato e 170 nel primo, è costituito da due strati completamente connessi (fc). I livelli seguenti sono la normalizzazione batch e l'abbandono. L'fc, l'ultimo strato, è composto da tre neuroni e viene utilizzato per dividere l'immagine. Lo strato denso, che viene dopo l'LSTM, divide l'area intorno al tumore cerebrale. AlexNet offre al livello LSTM le funzionalità. Il set di dati ha un massimo di 20 sezioni, che è uguale al numero totale di sequenze dichiarate. Il primo strato del GARNN contiene 100 unità nascoste, mentre il terzo strato contiene 125 unità nascoste.

Il meccanismo di gating è stato incorporato nello strato denso (completamente collegato) di AlexNet nel nostro framework GARNN-AE-LSTM suggerito. Le mappe delle caratteristiche convoluzionali vengono spesso elaborate da AlexNet e inviate direttamente in livelli completamente connessi per la classificazione. Tutte le caratteristiche spaziali recuperate, compresi i modelli ridondanti o meno significativi, vengono trattate allo stesso modo con questo metodo. Abbiamo risolto questo problema introducendo una funzione di gating che funziona come un filtro di funzionalità e si basa su un sigma. In termini matematici, un vettore di porta g = σ(wX) + b, modula l'output dello strato denso, con σ che rappresenta la funzione sigmoide. Durante l'allenamento, questo gate impara a dare vari pesi di attivazione delle funzioni che vanno da 0 a 1. Sono: (i) bassi valori di gate sopprimono caratteristiche irrilevanti (ad esempio, rumore di fondo o texture ridondanti). (ii) Valori di gate più elevati evidenziano caratteristiche discriminanti (come regioni di oggetti importanti o modelli sensibili al movimento). (iii) Questo set di funzionalità migliorato viene quindi utilizzato dal componente RNN, che gli consente di catturare meglio le dipendenze temporali senza essere distratto da informazioni spaziali irrilevanti. (iv) La retropropagazione viene utilizzata per modificare i parametri di gating durante l'addestramento in tandem con AlexNet e RNN. Ciò implica che nel tempo il modello apprende quali aspetti sono più importanti per il riepilogo oltre a quali caratteristiche estrarre.

Nella Figura 4, la variabile X indica i dati di input, C la cella e H lo stato nascosto.

figure-protocol-9
Figura 4: Modello di architettura GATED Recurrent Neural Network (GARNN). Il GARNN integra la normalizzazione batch, l'abbandono e più strati densi per un'efficace modellazione delle sequenze. Clicca qui per visualizzare una versione più grande di questa figura.

In ogni blocco, i rispettivi pesi, come Iw, Rw e bias chiamati input, peso ricorrente e bias, rispettivamente, sono stati utilizzati come in Eqn (3) a Eqn (5)

figure-protocol-10(3)

figure-protocol-11(4)

figure-protocol-12(5)

Ad un certo timestamp t, lo stato della cella è indicato come in Eqn (6)

figure-protocol-13(6)

Dove figure-protocol-14 il prodotto di Hadamard e lo stato dell'unità nascosta sono indicati come in Eqn (7)

figure-protocol-15(7)

Pertanto, utilizza il modulo di analisi audio py per calcolare le caratteristiche audio a livello di segmento per ogni clip audio estratta dal file video corrispondente, utilizzando ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. Le feature estratte sono elencate nella Tabella 1.  In conformità con questo processo, l'estrazione delle funzioni audio viene inizialmente eseguita su base temporanea. La parte finale della rappresentazione è costituita da statistiche di funzionalità a livello di segmento calcolate a un secondo livello. In particolare, viene eseguita un'elaborazione a breve termine per ogni segmento del segnale audio, con conseguente calcolo di 68 caratteristiche a breve termine (34 funzioni e 34 delta) per ogni finestra a livello di segmento, che può essere sovrapposta o non sovrapposta. Abbiamo utilizzato una varietà di caratteristiche visive per trasmettere il contenuto delle informazioni visive, oltre a estrarre elementi uditivi dal segnale sonoro di ogni video. Si prevede che questa modalità sarà cruciale per il processo di sintesi. La libreria multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) è stata utilizzata per estrarre le funzioni che riflettono gli aspetti visivi di un video al fine di estrarre questi elementi visivi. In particolare, gli 88 elementi visivi elencati di seguito vengono presi dal fotogramma corrispondente ogni 0,2 s. In questo, le funzionalità multimodali sono fuse e un totale di 59 funzionalità vengono utilizzate per un'ulteriore analisi della classificazione del video come informativo e non interessante eseguendo il riepilogo del video.

Riduzione delle funzionalità tramite PCA
La dimensione delle caratteristiche in questo studio è stata ridotta dall'applicazione dell'analisi delle componenti principali (PCA). Le caratteristiche di base vengono trasformate in caratteristiche chiave al fine di aumentarne la prominenza e l'importanza. La PCA è stata ampiamente utilizzata da numerosi ricercatori in una varietà di domini24. Gli autovalori vengono utilizzati per determinare le proprietà. Vengono selezionate le funzioni degli autovalori più alti, mentre vengono rimosse le funzioni degli autovalori più bassi.

Dopo la rimozione dei fotogrammi superflui, la PCA viene utilizzata in questo studio come fase opzionale di riduzione delle funzionalità. La PCA sopprime il rumore e le informazioni ridondanti comprimendo i vettori di caratteristiche ad alta dimensione prodotti da GARNN in un piccolo sottospazio. Ciò aumenta l'efficienza computazionale dell'AE-LSTM, garantendo al contempo che il rilevamento dei fotogrammi chiave sia dominato dagli indizi visivi e uditivi più discriminanti. Al fine di bilanciare scalabilità e precisione nel riepilogo video, la PCA viene utilizzata come strumento utile. L'algoritmo (Algoritmo 1) viene fornito come File supplementare 1.

Qualsiasi frame che sia esattamente uguale o sorprendentemente paragonabile al frame precedente è considerato ridondante. È ovvio che la modifica del framerate può avere un impatto sulla proporzione di fotogrammi video rimossi. Più specificamente, all'aumentare dei frame rate, aumenta anche la somiglianza tra i fotogrammi successivi, portando a una percentuale più elevata di fotogrammi rimossi. Ora, le funzionalità a dimensione ridotta vengono utilizzate per addestrare il modello ML, che è chiamato modello AE-LSTM avversario.

Formazione con AELSTM
Una rete neurale chiamata GAN25 è composta da due sottoreti rivali: i) una rete "generatore" (G) che crea dati che assomigliano a una distribuzione sconosciuta e ii) una rete "discriminante" (D) che distingue tra i campioni creati e quelli provenienti da osservazioni reali. L'obiettivo è quello di trovare un generatore che massimizzi la probabilità che il discriminatore commetta un errore, adattandosi all'effettiva distribuzione dei dati.

Supponiamo che X sia l'input ed E sia il rumore di input precedente, X'= g(E) è il campione generato. Utilizzando l'ottimizzazione minimax, l'apprendimento è formulato:

figure-protocol-16(8)

Dove D è qualificato per ottenere la probabilità corretta della classificazione. I componenti del nostro modello di formazione sviluppato sono mostrati nella Figura 5. Il selettore LSTM sceglie il sottoinsieme di fotogrammi dalla sequenza video di input X. I fotogrammi selezionati vengono convertiti nella funzione E a lunghezza fissa utilizzando l'encoder-LSTM, seguita dalla ricostruzione video X' utilizzando il decoder-LSTM. La classificazione di X' in video reale o classe di riepilogo viene eseguita dal discriminatore-LSTM. In questo studio, AE-LSTM viene utilizzato per il riepilogo video con struttura GAN per riassunti video efficienti, diversificati e strutturati. L'AE può eliminare le modifiche di sfondo non necessarie e l'LSTM può rilevare le transizioni di scena piuttosto che trattare i fotogrammi come immagini, e la GAN, il generatore possono riassumere il video e il discriminatore assicura che il riepilogo sia diversificato

figure-protocol-17
Figura 5: Architettura del modello di sintesi AELSTM. Include Selector-LSTM, Encoder-LSTM, Decoder-LSTM e Discriminator-LSTM per ottimizzare i riepiloghi video tramite l'addestramento contraddittorio. Clicca qui per visualizzare una versione più grande di questa figura.

Fornendo le funzionalità GARNN per ogni fotogramma nel video di input X chiamato figure-protocol-18 , il riassuntore utilizza il selettore LSTM per scegliere il sottoinsieme di fotogrammi e l'encoder codifica i fotogrammi come E seguito dal decodificatore che ricostruisce il video come X' ad ogni fotogramma xt. Il selettore utilizza il punteggio di importanza quando seleziona il fotogramma. Le caratteristiche sono date dal valore del peso utilizzando i punteggi, per poi passare all'encoder. Per ogni fotogramma con punteggio st = 1, il sottoinsieme viene ricevuto solo dall'encoder. Il discriminatore sceglie le classi come originali o riassuntive stimando la distanza tra X e X' e assegnando le etichette. In questo caso, il discriminatore calcola l'errore tra il video originale e quello di riepilogo. L'algoritmo 2 (file supplementare 2) denota il riassunto dell'addestramento di AELSTM per il riepilogo video.

Post-elaborazione – Riassunto video
I riepiloghi video possono essere prodotti dai classificatori a livello di segmento una volta che sono stati addestrati. Per raggiungere questo obiettivo sono necessari tre passaggi: (i) Determinare le caratteristiche audio, visive o miste di ciascun segmento video. (ii) Classificare ogni segmento video utilizzando il classificatore audio, visivo o di fusione appropriato. (iii) Per evitare errori evidenti, post-elaborare le previsioni ordinate del classificatore.

Per soddisfare questa domanda, è stata sviluppata una pipeline composta da due filtri distinti per la fase di post-elaborazione. L'array di input viene prima sottoposto a un filtro mediano di lunghezza N1 utilizzando finestre locali per attenuare le previsioni del classificatore sequenziale. Le previsioni finali vengono quindi determinate mediante filtraggio rigido utilizzando un metodo semplice che mantiene una serie di previsioni consecutivamente positive (segmenti informativi) se almeno N2 segmenti sono inclusi in quella sequenza. Detto in modo diverso, tale criterio richiede che un segmento istruttivo duri almeno N2 secondi.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'estrazione di feature basata su GARNN e il riassunto video di video lunghi basati su AGLSTM sono stati sperimentati su due set di dati, vale a dire VSUMM e SumMe. Questa sezione discute i risultati sperimentali e il confronto con gli approcci convenzionali. Per il discriminatore LSTM, impieghiamo un LSTM a due strati con 1024 unità nascoste ad ogni strato. Per encoder_LSTM e decoder_LSTM, rispettivamente, impieghiamo due LSTM a due strati con 2048 unità nascoste in ogni strato. Un decodificatore LSTM che cerca di memor...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In questo studio, il riassunto video di video lunghi viene presentato utilizzando un efficiente modello ML e DL multimodale, che utilizza modalità audio, immagini e visive di dati generati dai dati di input. Il classificatore binario viene addestrato per apprendere la discriminazione tra i segmenti importanti che sono la parte di riepilogo prodotta e i segmenti "non importanti" che vengono scartati. Il modello viene addestrato utilizzando set di dati come SumMe e VSUMM e la scalabilità d...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno conflitti di interesse.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori sono grati alla Dr. Television School, Sichuan Film and Television University, per aver fornito le strutture di laboratorio per condurre lo studio di ricerca.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
AlexNet (modello pre-addestrato)MATLAB / PyTorchPyTorch Hub — Modello pre-addestrato AlexNet: https://pytorch.org/hub/pytorch_vision_alexnet/Utilizzato per l'estrazione di feature visive
FFmpegFFmpeg.orghttps://ffmpeg.org/Estrazione audio da video
Modello basato su GRNNImplementazione personalizzataBiblioteca " neupy" implementa GRNN: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlUtilizzato per la fusione di feature multimodali
LSTM (memoria a breve termine lunga)PyTorchhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlUtilizzato in selettore, encoder, decodificatore
Multimodal_movie_analysis libGitHubhttps://github.com/tyiannak/multimodal_movie_analysisPer l'estrazione visiva delle feature
NumPyFondazione del software Pythonhttps://pypi.org/project/numpy/Calcolo numerico e operazioni matriciali
PCA (Analisi delle componenti principali)Scikit-learnhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlRiduzione della dimensionalità
PyAudioAnalysisGitHubhttps://github.com/tyiannak/pyaudioanalysisEstrazione delle funzioni audio
PyTorchFondazione PyTorchhttps://pytorch.org/Framework di deep learning
Set di dati SumMeSet di dati pubblicihttps://gyglim.github.io/me/vsum/index.htmlSet di dati di riepilogo video di benchmark
Set di dati VSUMMSet di dati pubblicihttp://www.vision.ime.usp.br/~creativision/vsumm/Set di dati di riepilogo video di benchmark

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Unit Ricorrenti GatedRilevamento dei KeyframeEstrazione delle CaratteristicheCompensazione del MovimentoRiduzione PCAEncoder AvversarialeModellazione TemporalePunteggio F1

Articoli correlati