$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Questo studio propone un metodo di riassunto video supervisionato multimodale che rientra nella categoria di riepilogo video generico, comunemente indicato come video skimming. Ciò include tecniche che si concentrano sulla ricerca di segmenti chiave di un video più grande per crearne una versione temporalmente condensata. Questo studio suggerisce una tecnica supervisionata per analizzare il flusso video in sezioni di 1 s che includono rappresentazioni audio e visive, come mostrato nella Figura 1. Questi segmenti vengono quindi classificati come "poco interessanti" o "informativi". A differenza dei dati sintetici o simulati, i "dati reali" ora si riferiscono ai set di dati video effettivi utilizzati per gli esperimenti. I segmenti video che forniscono importanti segnali audiovisivi necessari per il riepilogo, come il movimento elevato, la voce o le transizioni di scena, sono indicati come "segmenti informativi". Le parti "non interessanti" sono definite come fotogrammi ripetitivi o ridondanti che non aggiungono nulla di nuovo alla sinossi.
I video di input vengono segmentati in fotogrammi e le funzionalità multimodali vengono estratte da ciascun fotogramma utilizzando il modello GARNN proposto. Le funzioni audio e video vengono fuse e inserite come input nella fase di riduzione della dimensionalità, in cui i fotogrammi ridondanti vengono rimossi per un'ulteriore elaborazione. Infine, l'AELSTM proposto viene applicato ai dati ridotti per il riepilogo video. A tale scopo, viene utilizzato un classificatore binario supervisionato sottoposto a training con rappresentazioni di funzionalità dalle modalità visive, audio o miste, denominate multimodalità.

Figura 1: Panoramica del modello di riepilogo video proposto. La pipeline include l'estrazione di feature multimodali, la riduzione della dimensionalità e la generazione di riepiloghi tramite AELSTM. Clicca qui per visualizzare una versione più grande di questa figura.
Dataset
L'efficacia delle soluzioni suggerite è determinata utilizzando i set di dati VSUMM17 e SumMe18 , una coppia di set di dati di riferimento in sintesi video statica. Le funzionalità della CNN create utilizzando AlexNet con LSTM e i dati reali sono tra i set di dati. I dati e le serie di dati reali sono accessibili al pubblicoin generale 19. I 50 film nel set di dati VSUMM provengono da siti Web come YouTube e durano 110 minuti a 30 fotogrammi al secondo. Sono disponibili in una varietà di generi, tra cui cartoni animati, notizie, sport, pubblicità, serie TV e home video. Tra questi, 25 video costituiti da festività, festival e sport che sono stati ottenuti dal noto sito YouTube e taggati con almeno 15 riassunti generati dall'uomo (390 in totale) compongono il set di dati di riepilogo video "SumMe"20 . L'intervallo di durata dei video è di 1-6 minuti.
Il video originale viene convertito in immagini RGB, che vengono inserite come input nel modello GARNN proposto pre-addestrato per l'estrazione delle funzionalità. Questo modello è costituito da AlexNet e da un RNN gated RNN. Il numero originale di funzioni è 64 e le funzioni di AlexNet ne hanno 4100.
Proposta di estrazione di funzionalità basata su Gated-AlexNet-RNN
Sia la modalità visiva che quella audio delle informazioni sono state utilizzate per riassumere i video. Per ottenere una rappresentazione delle caratteristiche in entrambe le modalità, abbiamo identificato caratteristiche realizzate a mano che vengono spesso utilizzate in attività di clustering e classificazione audio e video, come il recupero di immagini, la classificazione video, l'analisi di scene uditive e il recupero di informazioni musicali. L'obiettivo era quello di includere il maggior numero possibile di componenti didattici, visivi e audio. La Figura 2 mostra un'illustrazione concettuale del processo utilizzato per estrarre le funzionalità per le modalità audio e video.

Figura 2: Proposta di estrazione di funzionalità multimodale basata su GARNN. Le caratteristiche delle modalità visive e audio vengono estratte utilizzando i componenti AlexNet e GARNN. Clicca qui per visualizzare una versione più grande di questa figura.
Gate- AlexNetRNN: (GARNN)
Per l'analisi delle immagini virtuali, la CNN è un popolare modello DL21. In generale, la CNN utilizza l'immagine come input e la divide in diversi gruppi. I neuroni di input, una sequenza di strati con pooling convoluzionale, strati completamente collegati e strati normalizzanti costituiscono la sua struttura22. I neuroni dello strato di convoluzione sono collegati allo strato precedente tramite una regione stretta. Gli strati sottostanti sono completamente collegati ai neuroni attivanti degli strati completamente collegati. Eqn (1) rappresenta la propagazione in avanti e all'indietro di una funzione completamente connessa.
(1)
(2)
Dove
è l'attivazione dell'i-esimo neuronenell'1-esimo strato è,
è il gradiente dell'i-esimo neurone nell'l-esimo strato,
è il peso dell'i-esimo neurone nell'l+1° strato. Numerosi progetti di CNN sono emersi come risultato dei recenti progressi della ricerca. AlexNet è stato utilizzato in questo lavoro.
L'architettura di AlexNet, mostrata in Figura 3, riflette un design meticoloso e ben strutturato. Tre livelli completamente collegati e cinque livelli di convoluzione costituiscono i suoi otto livelli di apprendimento. Le etichette di classe vengono prodotte inserendo il risultato dell'ultimo strato nella funzione che attiva softmax. I kernel di secondo, quarto o quinto livello sono connessi ai loro livelli precedenti tramite la condivisione della GPU. I kernel del secondo e del terzo strato sono completamente collegati tra loro. Il livello di normalizzazione è collegato ai livelli di pooling max dopo il primo e il secondo livello. ReLU è collegato a tutti i livelli di apprendimento.

Figura 3: Architettura di AlexNet. Cinque livelli convoluzionali e tre livelli completamente connessi vengono utilizzati per elaborare i dati visivi nel modello di riepilogo. Clicca qui per visualizzare una versione più grande di questa figura.
La rete dorsale primaria per il lavoro era un GARNN a strato denso. Ci sono tre strati nella RNN spessa. Con 80 neuroni nel secondo strato e 170 nel primo, è costituito da due strati completamente connessi (fc). I livelli seguenti sono la normalizzazione batch e l'abbandono. L'fc, l'ultimo strato, è composto da tre neuroni e viene utilizzato per dividere l'immagine. Lo strato denso, che viene dopo l'LSTM, divide l'area intorno al tumore cerebrale. AlexNet offre al livello LSTM le funzionalità. Il set di dati ha un massimo di 20 sezioni, che è uguale al numero totale di sequenze dichiarate. Il primo strato del GARNN contiene 100 unità nascoste, mentre il terzo strato contiene 125 unità nascoste.
Il meccanismo di gating è stato incorporato nello strato denso (completamente collegato) di AlexNet nel nostro framework GARNN-AE-LSTM suggerito. Le mappe delle caratteristiche convoluzionali vengono spesso elaborate da AlexNet e inviate direttamente in livelli completamente connessi per la classificazione. Tutte le caratteristiche spaziali recuperate, compresi i modelli ridondanti o meno significativi, vengono trattate allo stesso modo con questo metodo. Abbiamo risolto questo problema introducendo una funzione di gating che funziona come un filtro di funzionalità e si basa su un sigma. In termini matematici, un vettore di porta g = σ(wX) + b, modula l'output dello strato denso, con σ che rappresenta la funzione sigmoide. Durante l'allenamento, questo gate impara a dare vari pesi di attivazione delle funzioni che vanno da 0 a 1. Sono: (i) bassi valori di gate sopprimono caratteristiche irrilevanti (ad esempio, rumore di fondo o texture ridondanti). (ii) Valori di gate più elevati evidenziano caratteristiche discriminanti (come regioni di oggetti importanti o modelli sensibili al movimento). (iii) Questo set di funzionalità migliorato viene quindi utilizzato dal componente RNN, che gli consente di catturare meglio le dipendenze temporali senza essere distratto da informazioni spaziali irrilevanti. (iv) La retropropagazione viene utilizzata per modificare i parametri di gating durante l'addestramento in tandem con AlexNet e RNN. Ciò implica che nel tempo il modello apprende quali aspetti sono più importanti per il riepilogo oltre a quali caratteristiche estrarre.
Nella Figura 4, la variabile X indica i dati di input, C la cella e H lo stato nascosto.

Figura 4: Modello di architettura GATED Recurrent Neural Network (GARNN). Il GARNN integra la normalizzazione batch, l'abbandono e più strati densi per un'efficace modellazione delle sequenze. Clicca qui per visualizzare una versione più grande di questa figura.
In ogni blocco, i rispettivi pesi, come Iw, Rw e bias chiamati input, peso ricorrente e bias, rispettivamente, sono stati utilizzati come in Eqn (3) a Eqn (5)
(3)
(4)
(5)
Ad un certo timestamp t, lo stato della cella è indicato come in Eqn (6)
(6)
Dove
il prodotto di Hadamard e lo stato dell'unità nascosta sono indicati come in Eqn (7)
(7)
Pertanto, utilizza il modulo di analisi audio py per calcolare le caratteristiche audio a livello di segmento per ogni clip audio estratta dal file video corrispondente, utilizzando ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. Le feature estratte sono elencate nella Tabella 1. In conformità con questo processo, l'estrazione delle funzioni audio viene inizialmente eseguita su base temporanea. La parte finale della rappresentazione è costituita da statistiche di funzionalità a livello di segmento calcolate a un secondo livello. In particolare, viene eseguita un'elaborazione a breve termine per ogni segmento del segnale audio, con conseguente calcolo di 68 caratteristiche a breve termine (34 funzioni e 34 delta) per ogni finestra a livello di segmento, che può essere sovrapposta o non sovrapposta. Abbiamo utilizzato una varietà di caratteristiche visive per trasmettere il contenuto delle informazioni visive, oltre a estrarre elementi uditivi dal segnale sonoro di ogni video. Si prevede che questa modalità sarà cruciale per il processo di sintesi. La libreria multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) è stata utilizzata per estrarre le funzioni che riflettono gli aspetti visivi di un video al fine di estrarre questi elementi visivi. In particolare, gli 88 elementi visivi elencati di seguito vengono presi dal fotogramma corrispondente ogni 0,2 s. In questo, le funzionalità multimodali sono fuse e un totale di 59 funzionalità vengono utilizzate per un'ulteriore analisi della classificazione del video come informativo e non interessante eseguendo il riepilogo del video.
Riduzione delle funzionalità tramite PCA
La dimensione delle caratteristiche in questo studio è stata ridotta dall'applicazione dell'analisi delle componenti principali (PCA). Le caratteristiche di base vengono trasformate in caratteristiche chiave al fine di aumentarne la prominenza e l'importanza. La PCA è stata ampiamente utilizzata da numerosi ricercatori in una varietà di domini24. Gli autovalori vengono utilizzati per determinare le proprietà. Vengono selezionate le funzioni degli autovalori più alti, mentre vengono rimosse le funzioni degli autovalori più bassi.
Dopo la rimozione dei fotogrammi superflui, la PCA viene utilizzata in questo studio come fase opzionale di riduzione delle funzionalità. La PCA sopprime il rumore e le informazioni ridondanti comprimendo i vettori di caratteristiche ad alta dimensione prodotti da GARNN in un piccolo sottospazio. Ciò aumenta l'efficienza computazionale dell'AE-LSTM, garantendo al contempo che il rilevamento dei fotogrammi chiave sia dominato dagli indizi visivi e uditivi più discriminanti. Al fine di bilanciare scalabilità e precisione nel riepilogo video, la PCA viene utilizzata come strumento utile. L'algoritmo (Algoritmo 1) viene fornito come File supplementare 1.
Qualsiasi frame che sia esattamente uguale o sorprendentemente paragonabile al frame precedente è considerato ridondante. È ovvio che la modifica del framerate può avere un impatto sulla proporzione di fotogrammi video rimossi. Più specificamente, all'aumentare dei frame rate, aumenta anche la somiglianza tra i fotogrammi successivi, portando a una percentuale più elevata di fotogrammi rimossi. Ora, le funzionalità a dimensione ridotta vengono utilizzate per addestrare il modello ML, che è chiamato modello AE-LSTM avversario.
Formazione con AELSTM
Una rete neurale chiamata GAN25 è composta da due sottoreti rivali: i) una rete "generatore" (G) che crea dati che assomigliano a una distribuzione sconosciuta e ii) una rete "discriminante" (D) che distingue tra i campioni creati e quelli provenienti da osservazioni reali. L'obiettivo è quello di trovare un generatore che massimizzi la probabilità che il discriminatore commetta un errore, adattandosi all'effettiva distribuzione dei dati.
Supponiamo che X sia l'input ed E sia il rumore di input precedente, X'= g(E) è il campione generato. Utilizzando l'ottimizzazione minimax, l'apprendimento è formulato:
(8)
Dove D è qualificato per ottenere la probabilità corretta della classificazione. I componenti del nostro modello di formazione sviluppato sono mostrati nella Figura 5. Il selettore LSTM sceglie il sottoinsieme di fotogrammi dalla sequenza video di input X. I fotogrammi selezionati vengono convertiti nella funzione E a lunghezza fissa utilizzando l'encoder-LSTM, seguita dalla ricostruzione video X' utilizzando il decoder-LSTM. La classificazione di X' in video reale o classe di riepilogo viene eseguita dal discriminatore-LSTM. In questo studio, AE-LSTM viene utilizzato per il riepilogo video con struttura GAN per riassunti video efficienti, diversificati e strutturati. L'AE può eliminare le modifiche di sfondo non necessarie e l'LSTM può rilevare le transizioni di scena piuttosto che trattare i fotogrammi come immagini, e la GAN, il generatore possono riassumere il video e il discriminatore assicura che il riepilogo sia diversificato

Figura 5: Architettura del modello di sintesi AELSTM. Include Selector-LSTM, Encoder-LSTM, Decoder-LSTM e Discriminator-LSTM per ottimizzare i riepiloghi video tramite l'addestramento contraddittorio. Clicca qui per visualizzare una versione più grande di questa figura.
Fornendo le funzionalità GARNN per ogni fotogramma nel video di input X chiamato
, il riassuntore utilizza il selettore LSTM per scegliere il sottoinsieme di fotogrammi e l'encoder codifica i fotogrammi come E seguito dal decodificatore che ricostruisce il video come X' ad ogni fotogramma xt. Il selettore utilizza il punteggio di importanza quando seleziona il fotogramma. Le caratteristiche sono date dal valore del peso utilizzando i punteggi, per poi passare all'encoder. Per ogni fotogramma con punteggio st = 1, il sottoinsieme viene ricevuto solo dall'encoder. Il discriminatore sceglie le classi come originali o riassuntive stimando la distanza tra X e X' e assegnando le etichette. In questo caso, il discriminatore calcola l'errore tra il video originale e quello di riepilogo. L'algoritmo 2 (file supplementare 2) denota il riassunto dell'addestramento di AELSTM per il riepilogo video.
Post-elaborazione – Riassunto video
I riepiloghi video possono essere prodotti dai classificatori a livello di segmento una volta che sono stati addestrati. Per raggiungere questo obiettivo sono necessari tre passaggi: (i) Determinare le caratteristiche audio, visive o miste di ciascun segmento video. (ii) Classificare ogni segmento video utilizzando il classificatore audio, visivo o di fusione appropriato. (iii) Per evitare errori evidenti, post-elaborare le previsioni ordinate del classificatore.
Per soddisfare questa domanda, è stata sviluppata una pipeline composta da due filtri distinti per la fase di post-elaborazione. L'array di input viene prima sottoposto a un filtro mediano di lunghezza N1 utilizzando finestre locali per attenuare le previsioni del classificatore sequenziale. Le previsioni finali vengono quindi determinate mediante filtraggio rigido utilizzando un metodo semplice che mantiene una serie di previsioni consecutivamente positive (segmenti informativi) se almeno N2 segmenti sono inclusi in quella sequenza. Detto in modo diverso, tale criterio richiede che un segmento istruttivo duri almeno N2 secondi.