$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
In dieser Studie wird eine multimodale überwachte Videozusammenfassungsmethode vorgeschlagen, die in die Kategorie der generischen Videozusammenfassung fällt, die allgemein als Video-Skimming bezeichnet wird. Dazu gehören Techniken, die sich darauf konzentrieren, Schlüsselsegmente eines größeren Videos zu finden, um eine zeitlich komprimierte Version davon zu erstellen. Diese Studie schlägt eine überwachte Technik zur Analyse des Videostreams in 1 s-Abschnitten vor, die audiovisuelle Darstellungen enthalten, wie in Abbildung 1 gezeigt. Diese Segmente werden dann entweder als "uninteressant" oder "informativ" kategorisiert. Im Gegensatz zu synthetischen oder simulierten Daten bezieht sich "reale Daten" nun auf die tatsächlichen Videodatensätze, die für Experimente verwendet werden. Videosegmente, die wichtige audiovisuelle Signale liefern, die für die Zusammenfassung erforderlich sind, wie z. B. hohe Bewegungen, Sprach- oder Szenenübergänge, werden als "informative Segmente" bezeichnet. "Uninteressante" Teile werden als sich wiederholende oder redundante Frames definiert, die der Inhaltsangabe nichts Neues hinzufügen.
Die Eingabevideos werden in Frames segmentiert, und die multimodalen Merkmale werden mit dem vorgeschlagenen GARNN-Modell aus jedem Frame extrahiert. Die akustischen und visuellen Funktionen werden fusioniert und als Input in die Phase der Dimensionalitätsreduktion eingespeist, wo die redundanten Frames für die weitere Verarbeitung entfernt werden. Schließlich wird der vorgeschlagene AELSTM auf die reduzierten Daten für die Videozusammenfassung angewendet. Um dies zu erreichen, wird ein überwachter binärer Klassifikator verwendet, der mit Merkmalsdarstellungen aus den visuellen, akustischen oder gemischten Modalitäten trainiert wurde, die als Multimodalitäten bezeichnet werden.

Abbildung 1: Überblick über das vorgeschlagene Modell zur Videozusammenfassung. Die Pipeline umfasst die multimodale Merkmalsextraktion, die Reduzierung der Dimensionalität und die Generierung von Zusammenfassungen mit AELSTM. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.
Dataset
Die Wirksamkeit der vorgeschlagenen Lösungen wird anhand der Datensätze VSUMM17 und SumMe18 bestimmt, einem Paar von Benchmark-Datensätzen in der statischen Videozusammenfassung. Zu den Datensätzen gehören CNN-Funktionen, die mit AlexNet mit LSTM erstellt wurden, und echte Daten. Die realen Daten und Datensätze sind der breiten Öffentlichkeit zugänglich19. Die 50 Filme im VSUMM-Datensatz stammen von Websites wie YouTube und erstrecken sich über 110 Minuten mit 30 Bildern pro Sekunde. Es gibt sie in einer Vielzahl von Genres, darunter Cartoons, Nachrichten, Sport, Werbung, TV-Serien und Heimvideos. Darunter sind 25 Videos von Feiertagen, Festivals und Sportarten, die von der bekannten YouTube-Seite bezogen und mit mindestens 15 von Menschen erstellten Zusammenfassungen (insgesamt 390) versehen wurden, die den Videozusammenfassungsdatensatz "SumMe"20 bilden. Der Dauerbereich der Videos beträgt 1-6 Minuten.
Das Originalvideo wird in RGB-Bilder konvertiert, die als Eingabe in das vortrainierte vorgeschlagene GARNN-Modell zur Merkmalsextraktion eingespeist werden. Dieses Modell besteht aus AlexNet und einem geschlossenen RNN. Die ursprüngliche Anzahl der Funktionen beträgt 64, und die Funktionen von AlexNet haben 4100 Funktionen.
Vorgeschlagene Gated-AlexNet-RNN-basierte Merkmalsextraktion
Sowohl der visuelle als auch der akustische Informationsmodus wurden verwendet, um die Videos zusammenzufassen. Um eine Merkmalsdarstellung in beiden Modalitäten zu erreichen, haben wir handgefertigte Merkmale identifiziert, die häufig in audiovisuellen Clustering- und Klassifizierungsaufgaben verwendet werden, wie z. B. beim Abrufen von Bildern, bei der Videoklassifizierung, bei der Analyse auditiver Szenen und beim Abrufen von Musikinformationen. Ziel war es, so viele visuelle und akustische Unterrichtskomponenten wie möglich einzubeziehen. Abbildung 2 zeigt eine konzeptionelle Darstellung des Prozesses, der zum Extrahieren von Merkmalen für die audiovisuellen Modalitäten verwendet wird.

Abbildung 2: Vorgeschlagene multimodale GARNN-basierte Merkmalsextraktion. Merkmale sowohl aus visuellen als auch aus akustischen Modalitäten werden mit AlexNet- und GARNN-Komponenten extrahiert. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.
Geschlossen- AlexNetRNN: (GARNN)
Für die virtuelle Bildanalyse ist CNN ein beliebtes DL-Modell21. Im Allgemeinen verwendet CNN das Bild als Eingabe und unterteilt es in mehrere Gruppen. Eingabeneuronen, eine Abfolge von Schichten mit Convolutional Pooling, Schichten, die vollständig miteinander verknüpft sind, und normalisierende Schichten bilden seine Struktur22. Die Neuronen der Faltungsschicht sind über einen schmalen Bereich mit der vorhergehenden Schicht verbunden. Die darunter liegenden Schichten sind vollständig mit den aktivierenden Neuronen der vollständig verknüpften Schichten verbunden. Gln (1) stellt die Vorwärts- und Rückwärtsfortpflanzung einer vollständig verbundenen Funktion dar.
(1)
(2)
Dabei
ist die Aktivierung desi-ten Neurons in derl-ten Schicht,
ist der Gradient desi-ten Neurons in derl-ten Schicht,
ist das Gewicht desi-ten Neurons in der l+1-ten Schicht. Zahlreiche CNN-Designs sind als Ergebnis der jüngsten Forschungsfortschritte entstanden. Bei dieser Arbeit wurde AlexNet verwendet.
Die Architektur von AlexNet, die in Abbildung 3 dargestellt ist, spiegelt ein sorgfältiges und gut strukturiertes Design wider. Drei vollständig miteinander verbundene Schichten und fünf Faltungsschichten bilden die acht Lernschichten. Die Klassenbeschriftungen werden erzeugt, indem das Ergebnis der letzten Schicht in die Funktion eingespeist wird, die softmax aktiviert. Die Kernel der zweiten, vierten oder fünften Ebene sind über GPU-Sharing mit ihren Vorgängerebenen verbunden. Der Kernel der zweiten und dritten Schicht sind vollständig miteinander verbunden. Die Normalisierungsschicht ist mit den Max-Pooling-Schichten nach der ersten und zweiten Ebene verbunden. ReLU ist mit allen Lernschichten verknüpft.

Abbildung 3: Architektur von AlexNet. Fünf Faltungsschichten und drei vollständig verbundene Schichten werden verwendet, um visuelle Daten im Zusammenfassungsmodell zu verarbeiten. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.
Das primäre Backbone-Netzwerk für die Arbeit war ein Dichtschicht-GARNN. Das dicke RNN besteht aus drei Schichten. Mit 80 Neuronen in der zweiten Schicht und 170 in der ersten Schicht besteht es aus zwei vollständig verbundenen (fc) Schichten. Die folgenden Schichten sind Batch-Normalisierung und Dropout. Die fc, die letzte Schicht, besteht aus drei Neuronen und dient zur Unterteilung des Bildes. Die dichte Schicht, die nach dem LSTM kommt, teilt den Bereich um den Hirntumor. AlexNet verleiht dem LSTM-Layer Funktionen. Das Dataset verfügt über maximal 20 Slices, was der Gesamtzahl der deklarierten Sequenzen entspricht. Die erste Schicht des GARNN enthält 100 versteckte Einheiten, während die dritte Schicht 125 versteckte Einheiten enthält.
Der Gating-Mechanismus wurde in die dichte (vollständig verknüpfte) Schicht von AlexNet in unserem vorgeschlagenen GARNN-AE-LSTM-Framework integriert. Convolutional Feature Maps werden häufig von AlexNet verarbeitet und zur Klassifizierung direkt in vollständig verbundene Layer gesendet. Alle abgerufenen räumlichen Merkmale, einschließlich redundanter oder weniger signifikanter Muster, werden von dieser Methode gleich behandelt. Wir haben dies behoben, indem wir eine Gating-Funktion eingeführt haben, die als Merkmalsfilter fungiert und auf einem Sigmoid basiert. Mathematisch ausgedrückt moduliert ein Gate-Vektor g = σ(wX) + b die Ausgabe der dichten Schicht, wobei σ die Sigmoidfunktion darstellt. Während des Trainings lernt dieses Gate, verschiedene Gewichte der Feature-Aktivierung von 0 bis 1 zu vergeben. Sie sind: (i) niedrige Gate-Werte unterdrücken irrelevante Merkmale (z.B. Hintergrundgeräusche oder redundante Texturen). (ii) Höhere Gate-Werte heben diskriminierende Merkmale hervor (z. B. wichtige Objektbereiche oder bewegungsempfindliche Muster). (iii) Dieser verbesserte Funktionsumfang wird dann von der RNN-Komponente verwendet, die es ihr ermöglicht, zeitliche Abhängigkeiten besser zu erfassen, ohne durch irrelevante räumliche Informationen abgelenkt zu werden. (iv) Backpropagation wird verwendet, um die Gating-Parameter während des Trainings zusammen mit AlexNet und dem RNN zu ändern. Dies bedeutet, dass das Modell im Laufe der Zeit lernt, welche Aspekte für die Zusammenfassung am wichtigsten sind und welche Merkmale extrahiert werden sollen.
In Abbildung 4 bezeichnet die Variable X die Eingabedaten, C die Zelle und H den ausgeblendeten Zustand.

Abbildung 4: GARNN-Modell (Gated Recurrent Neural Network architecture). Das GARNN integriert Batch-Normalisierung, Dropout und mehrere dichte Schichten für eine effektive Sequenzmodellierung. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.
In jedem Block wurden die jeweiligen Gewichte, wie z. B. Iw, Rw und Bias, die als Eingabe, wiederkehrende Gewichtung und Bias bezeichnet werden, wie in Gln (3) bis Gl. (5) verwendet
(3)
(4)
(5)
Bei einem bestimmten Zeitstempel t wird der Zustand der Zelle wie in Gln (6) bezeichnet
(6)
Wird
das Produkt aus Hadamard und der Zustand der verborgenen Einheit wie in Gln (7) bezeichnet,
(7)
Daher wird das py-Audioanalysemodul verwendet, um Audioeigenschaften auf Segmentebene für jeden Audioclip zu berechnen, der aus der entsprechenden Videodatei extrahiert wurde, wobei ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23 verwendet wird. Die extrahierten Features sind in Tabelle 1 aufgeführt. In Übereinstimmung mit diesem Verfahren wird die Extraktion von Audiomerkmalen zunächst vorübergehend durchgeführt. Der letzte Teil der Darstellung besteht aus Feature-Statistiken auf Segmentebene, die auf einer zweiten Ebene berechnet werden. Konkret wird für jedes Segment des Audiosignals eine Kurzzeitverarbeitung durchgeführt, was zur Berechnung von 68 Kurzzeitmerkmalen (34 Merkmale und 34 Deltas) für jedes Fenster auf Segmentebene führt, die überlappend oder nicht überlappend sein können. Wir haben eine Vielzahl von visuellen Merkmalen verwendet, um den Inhalt der visuellen Informationen zu vermitteln, zusätzlich zur Extraktion auditiver Elemente aus dem Tonsignal jedes Videos. Es wird erwartet, dass diese Modalität für den zusammenfassenden Prozess von entscheidender Bedeutung sein wird. Die multimodal_movie_analysis-Bibliothek (https://github.com/tyiannak/multimodal_movie_analysis) wurde verwendet, um Merkmale zu extrahieren, die visuelle Aspekte eines Videos widerspiegeln, um diese visuellen Elemente zu extrahieren. Konkret werden die 88 unten aufgeführten visuellen Elemente alle 0,2 s aus dem entsprechenden Frame übernommen. Dabei werden die multimodalen Merkmale verschmolzen, und insgesamt 59 Merkmale werden für die weitere Analyse der Klassifizierung des Videos als informativ und uninteressant verwendet, indem die Videozusammenfassung durchgeführt wird.
Funktionsreduzierung mittels PCA
Die Dimension der Merkmale in dieser Studie wurde durch die Anwendung der Hauptkomponentenanalyse (PCA) reduziert. Die grundlegenden Merkmale werden in Schlüsselmerkmale umgewandelt, um ihre Prominenz und Bedeutung zu erhöhen. PCA wurde von zahlreichen Forschern in einer Vielzahl von Bereichen in großem Umfang eingesetzt24. Die Eigenwerte werden zur Bestimmung der Eigenschaften verwendet. Die Features mit dem höchsten Eigenwert werden ausgewählt, während die Features mit dem niedrigsten Eigenwert entfernt werden.
Nach dem Entfernen überflüssiger Frames wird in dieser Studie PCA als optionaler Schritt zur Merkmalsreduzierung eingesetzt. PCA unterdrückt Rauschen und redundante Informationen, indem es die von GARNN erzeugten hochdimensionalen Merkmalsvektoren in einen kleinen Unterraum komprimiert. Dies erhöht die Recheneffizienz des AE-LSTM und garantiert gleichzeitig, dass die Keyframe-Erkennung von den anspruchsvollsten visuellen und akustischen Hinweisen dominiert wird. Um Skalierbarkeit und Genauigkeit bei der Videozusammenfassung in Einklang zu bringen, wird PCA als nützliches Werkzeug eingesetzt. Der Algorithmus (Algorithmus 1) wird als Ergänzungsdatei 1 zur Verfügung gestellt.
Jeder Frame, der genau mit dem vorhergehenden Frame identisch oder auffallend vergleichbar ist, wird als redundant betrachtet. Es liegt auf der Hand, dass eine Änderung der Framerate einen Einfluss auf den Anteil der entfernten Videoframes haben kann. Genauer gesagt, mit zunehmender Bildrate nimmt auch die Ähnlichkeit zwischen aufeinanderfolgenden Frames zu, was dazu führt, dass ein höherer Prozentsatz der Frames entfernt wird. Jetzt werden die dimensionalitätsreduzierten Merkmale verwendet, um das ML-Modell zu trainieren, das als adversarial AE-LSTM-Modell bezeichnet wird.
Schulung mit AELSTM
Ein neuronales Netzwerk, das als GAN25 bezeichnet wird, besteht aus zwei rivalisierenden Subnetzwerken: i) einem "Generator"-Netzwerk (G), das Daten erzeugt, die einer unbekannten Verteilung ähneln, und ii) einem "Diskriminator"-Netzwerk (D), das zwischen den erstellten Stichproben und denen aus tatsächlichen Beobachtungen unterscheidet. Ziel ist es, einen Generator zu finden, der die Wahrscheinlichkeit, dass der Diskriminator einen Fehler begeht, maximiert und gleichzeitig die tatsächliche Datenverteilung anpasst.
Nehmen wir an, X ist die Eingabe und E ist das vorherige Eingangsrauschen, X'= g(E) ist das generierte Sample. Mit Hilfe der Minimax-Optimierung wird das Lernen formuliert:
(8)
Wobei D qualifiziert ist, die korrekte Wahrscheinlichkeit der Einstufung zu erhalten. Die Komponenten unseres entwickelten Trainingsmodells sind in Abbildung 5 dargestellt. Der Selektor LSTM wählt die Frames-Teilmenge aus der Eingabevideosequenz X aus. Die ausgewählten Frames werden mit dem Encoder-LSTM in das Merkmal E mit fester Länge konvertiert, gefolgt von der Videorekonstruktion X' mit dem Decoder-LSTM. Die Klassifizierung von X' in eine reale Video- oder Zusammenfassungsklasse wird durch den Diskriminator-LSTM durchgeführt. In dieser Studie wird AE-LSTM für die Videozusammenfassung mit GAN-Struktur für effiziente, vielfältige und strukturierte Videozusammenfassungen verwendet. Der AE kann unnötige Hintergrundänderungen eliminieren, und der LSTM kann die Szenenübergänge erkennen, anstatt die Frames als Bilder zu behandeln, und der GAN, der Generator, kann das Video zusammenfassen, und der Diskriminator stellt sicher, dass die Zusammenfassung vielfältig ist

Abbildung 5: Architektur des AELSTM-Zusammenfassungsmodells. Enthält Selector-LSTM, Encoder-LSTM, Decoder-LSTM und Discriminator-LSTM zur Optimierung von Videozusammenfassungen durch Adversarial-Training. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.
Indem die GARNN-Funktionen für jedes Bild in dem Eingabevideo X angegeben
werden, verwendet der Zusammenfassunger den Selektor LSTM, um die Teilmenge der Bilder auszuwählen, und der Encoder codiert die Bilder als E, gefolgt vom Decoder, der das Video bei jedem Bild xt als X' rekonstruiert. Der Selektor verwendet die Wichtigkeitsbewertung bei der Auswahl des Rahmens. Die Merkmale werden durch den Gewichtungswert unter Verwendung der Bewertungen angegeben und dann auf den Encoder verschoben. Für jeden Frame mit score st = 1 wird die Teilmenge nur vom Encoder empfangen. Der Diskriminator wählt die Klassen als Original oder Zusammenfassung aus, indem er den Abstand zwischen X und X' schätzt und die Beschriftungen zuweist. In diesem Fall berechnet der Diskriminator den Fehler zwischen dem Original- und dem Zusammenfassungsvideo. Algorithmus 2 (Ergänzungsdatei 2) bezeichnet die Zusammenfassung des Trainings von AELSTM für die Videozusammenfassung.
Nachbearbeitung – Videozusammenfassung
Videozusammenfassungen können von Klassifikatoren auf Segmentebene erstellt werden, sobald sie trainiert wurden. Um dies zu erreichen, sind drei Schritte erforderlich: (i) Bestimmen Sie die audiovisuellen, visuellen oder gemischten Eigenschaften jedes Videosegments. (ii) Klassifizieren Sie jedes Videosegment mit dem entsprechenden Audio-, Video- oder Fusionsklassifikator. (iii) Um eklatante Fehler zu vermeiden, bearbeiten Sie die Vorhersagen des geordneten Klassifikators nach.
Um dieser Nachfrage gerecht zu werden, wurde für den Nachbearbeitungsschritt eine Pipeline entwickelt, die aus zwei unterschiedlichen Filtern besteht. Das Eingabearray wird zunächst einem Medianfilter der Länge N1 unter Verwendung lokaler Fenster unterzogen, um die sequenziellen Klassifikatorvorhersagen zu glätten. Die endgültigen Vorhersagen werden dann durch hartes Filtern unter Verwendung einer einfachen Methode bestimmt, die eine Reihe von aufeinanderfolgenden positiven Vorhersagen (informative Segmente) beibehält, wenn mindestens N2-Segmente in dieser Sequenz enthalten sind. Anders ausgedrückt verlangt dieses Kriterium, dass ein instruktives Segment mindestens N2 Sekunden dauert.