Forschungsartikel

GARNN-AE-LSTM: Ein multimodaler Deep-Learning-Ansatz für hochpräzise Videozusammenfassungen

DOI:

10.3791/69097

10. Oktober 2025

In diesem Artikel

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Studie schlägt ein multimodales Deep-Learning-Framework für die Videozusammenfassung vor, indem audiovisuelle Funktionen unter Verwendung von vortrainierten GARNN-Modellen integriert werden. Durch die Nutzung von GRUs, AlexNet und einem kontradiktorischen LSTM-Klassifikator verbessert das System die Keyframe-Erkennung, reduziert Redundanzen und erreicht eine hohe Zusammenfassungsgenauigkeit mit einem durchschnittlichen F-Score von 0,985.

Zusammenfassung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Videozusammenfassung konzentriert sich auf die Erstellung prägnanter Versionen langer Videos, indem wichtige Inhalte beibehalten werden. Diese Studie zeigt eine multimodale Strategie des maschinellen Lernens, die visuelle und auditive Informationen integriert, indem vortrainierte Gated Recurrent Neural Network-Architekturen verwendet werden, die als GARNN bezeichnet werden und Gated Recurrent Units (GRUs) und AlexNet kombinieren, um Audio-, Bild- und visuelle Merkmale zu extrahieren. Die Keyframe-Erkennung wird verbessert, indem redundante Frames entfernt und eine bewegungskompensierte Merkmalsreduzierung angewendet wird, gefolgt von einer optionalen PCA-basierten Dimensionalitätsreduzierung. Ein Adversarial Encoder-basierter Long Short-Term Memory (AE-LSTM)-Klassifikator wird für die zeitliche Modellierung eingesetzt, um eine hohe Genauigkeit bei der Zusammenfassung zu erreichen. Die Ergebnisse wurden anhand von Sensitivität, F-Scores und positiven prädiktiven Werten ausgewertet, und die Methode erreichte einen durchschnittlichen F-Score von 0,985. Ein Gated AlexNet wird in einem multimodalen GARNN-AE-LSTM-Framework eingeführt, in dem die bewegungskompensierte PCA-basierte Reduzierung Redundanzen eliminiert, GRUs den zeitlichen Verlauf aufzeichnen und das Gating die Auswahl räumlicher Merkmale fein abstimmt, was zu einem genaueren und effizienteren Videozusammenfassungssystem beiträgt. Die verbesserte F1-Bewertung zeigt die Effektivität des Modells beim Generieren von Genauigkeit in Videozusammenfassungen, indem ein aussagekräftiges Video erstellt wird. Dieser Ansatz unterstreicht das Potenzial der multimodalen Merkmalsextraktion und fortschrittlicher Deep-Learning-Techniken für eine robuste Videoanalyse und -komprimierung.

Einleitung

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Es sind multimodale Analysesysteme (MMA) entstanden, die verschiedene Modalitäten wie Audio-, Video-, Text- und Sensordaten kombinieren, um Einblicke in das Lernen der Schüler zu geben1. Diese Technologien können dazu beitragen, ein gründliches Verständnis des Verhaltens und des Engagements der Schüler zu erlangen, indem sie multimodale Daten auswerten2. Es gibt jedoch eine Reihe von Hindernissen und Einschränkungen, wenn es darum geht, effiziente MMA-Systemezu erstellen 3. Aufgrund des Wachstums des Internets und der Überwachungskameras gibt es eine Menge digitaler Videos. Es ist zwingend erforderlich, dass diese Videos in Datenbanken zusammengestellt werden. Eine Videozusammenfassung kann in dieser Situation hilfreich sein. Die Erstellung einer nützlichen Zusammenfassung des echten Videos wird als Videozusammenfassung bezeichnet und hilft bei der Aktivitätsverfolgung, der Erkennung von Anomalien und dem Abrufen von Videos4. Eine Videozusammenfassung kann mit einer Vielzahl von Strategien erreicht werden. Diese Methoden fallen in eine von zwei Kategorien5, wie z. B. extraktive und abstrakte Videozusammenfassung.

Da die Videozusammenfassung viel Rechenleistung erfordert, sind effiziente Methoden erforderlich. Wenn jedes Bild in einem Film für die Auswahl untersucht wird, kann der Zusammenfassungsprozess langsam und langwierig sein, und Verarbeitungsressourcen können für identische oder ähnliche Bilder aufgewendet werden. Um den Prozess zu beschleunigen und sicherzustellen, dass nur wichtige Merkmale berücksichtigt werden, sollte außerdem eine Platzreduzierung für jede Gruppe von Merkmalenvorgenommen werden 6. Techniken zur Videozusammenfassung können in vier Hauptbereiche eingeteilt werden, basierend auf der Art der audiovisuellen Signale, die erzeugt unddem Endbenutzer 7 angezeigt werden, oder deren Ausgabe. Um genauer zu sein, könnten die Ergebnisse von Videozusammenfassungsberechnungen Folgendes umfassen: (i) primäre Frames8, bei denen es sich um sequenziell angezeigte extrahierte Videoframes handelt, die allgemein als statische Zusammenfassungen bekannt sind; (ii) Videoframes9, die als dynamische Zusammenfassungen bezeichnet werden; iii) visuelle Signale10, die Zusammenfassungen für den Endbenutzer verbessern, indem sie anderen Hinweisen eine grafikbasierte Syntax hinzufügen; und (iv) von Computern erzeugte textuelle Anmerkungen11, die dazu bestimmt sind, effiziente Zusammenfassungen von Videoinformationen zu bieten.

Zusammenfassungen, die auf Keyframes basieren, sind in der Regel kleiner als solche, die auf Keyshots basieren. Keyframe bezieht sich auf ein einzelnes repräsentatives Bild, das aus dem Video ausgewählt wurde. Keyshot bezeichnet ein kurzes, fortlaufendes Segment von Videoframes, die um Keyframes gruppiert sind. Die summary-Klasse bezieht sich auf die Ausgabe des Klassifikators, die Rahmen oder Segmente als informativ (in die Zusammenfassung aufzunehmen) oder nicht informativ (auszuschließen) kennzeichnet. Dieser Vorteil geht jedoch auf Kosten des Weglassens wichtiger Details im Prozess der Zusammenfassung. Zum Beispiel kann es schwierig sein, den Kontext des Vorgänger-Frames in einer Keyframe-basierten Zusammenfassung zu erhalten. Es ist auch frei von dem Originalton. Um diese Probleme zu lösen, werden daher häufig Keyshot-basierte Videozusammenfassungstechniken gewählt. Keyshot-basierte Videozusammenfassungstechniken werden verwendet, um Teilmengen für Lang- oder Kurzvideos zu erstellen. Kurze und lange Videos haben in der Regel eine Dauer von weniger als 10 Minuten bzw.12 Minuten. Das Generieren von Keyshot-gestützten Teilmengen für Kurzvideos ist unpraktisch und aufgrund der ohnehin schon kurzen Wiedergabelänge möglicherweise nicht erfolgreich. Darüber hinaus kann die Wiedergabezeit von langen Videos, insbesondere von Filmen oder Sportvideos, 90 Minuten überschreiten. Für solche Videokategorien sind Keyshot-basierte Zusammenfassungstechniken nützlicher und effizienter, um den Benutzern einen kurzen Überblick zu geben.

Die subjektive Natur der Videozusammenfassung macht sie zu einer entmutigenden Aufgabe. Das liegt daran, dass jeder Nutzer einen eigenen Geschmack hat, auch wenn es um vergleichbare Videoinhalte geht. Dieses Problem kann mit Hilfe des maßgeschneiderten Videozusammenfassungsansatzes13 genau gelöst werden. Ziel des Algorithmus ist es, jedem Nutzer Inhalte zur Verfügung zu stellen, die auf seine Interessen zugeschnitten sind. Angepasste Videozusammenfassungen mit idealer Dauer für neue lange Videos (wie z. B. Sportereignisse) sind jedoch nicht ohne weiteres verfügbar. Die derzeitigen Methoden14,15 erfordern enorme Computerressourcen, um Kundenpräferenzdaten und Videomaterial auszuwerten und so individualisierte Zusammenfassungen in Echtzeit zu liefern. Personalisierte Videozusammenfassungen in Echtzeit können von zentralen dedizierten Servern abgerufen werden. Babu Veesam und Satish16 diskutierten eine gründliche taxonomische Analyse aller wichtigen Strategien zur Zusammenfassung von Videos, die weit verbreitete Ansätze zur effektiven Komprimierung großer Mengen von Videodaten demonstrieren. Die Übersichtsarbeit klassifiziert und bewertet Methoden in Bezug auf ihre grundlegenden Ansätze, zu denen multimodale Integrationsstrategien, Deep-Learning-Frameworks und clustering-basierte Methoden gehören. Zu den bemerkenswerten Methoden gehören das KDAN-Framework, das die Wissensdestillation für die überwachte Zusammenfassung verwendet, und die SVS_MCO-Methode, die DBSCAN-Clustering verwendet, das durch den Artificial Algae Algorithm optimiert wurde. Darüber hinaus bietet der Review ausgefeilte Modelle wie das Audio-Visual Recurrent Network und das Query-based Deep African Vulture Learning, die sich als äußerst effektiv bei der Bewältigung dynamischer und multimodaler Videozusammenfassungsprobleme erwiesen haben.

Die Einbeziehung eines gated AlexNet Recurrent Neural Network (GARNN-AE-LSTM) multimodalen Frameworks für die Videozusammenfassung macht diese Studie neuartig. Dieser Ansatz verbessert die Genauigkeit und Effizienz des Videozusammenfassungsprozesses, indem er die Redundanz mit bewegungskompensierter PCA reduziert, die zeitliche Dynamik mit GRUs erfasst und die räumliche Merkmalsauswahl mithilfe von Gating-Methoden optimiert. Um die Videozusammenfassung effizient und mit reduzierter Komplexität bereitzustellen, trägt dieses Papier Folgendes bei: (i) Multimodale Videozusammenfassung: Vorgeschlagen wurde ein Framework zur Erzeugung prägnanter Videozusammenfassungen durch Integration sowohl visueller als auch auditiver Informationen unter Verwendung eines vortrainierten GARNN-Modells, das Gated RNNs und AlexNet kombiniert. (ii) Gated AlexNet zur Merkmalsverfeinerung: Es wurde ein neuartiger Gated-Mechanismus (Sigmoid-Gate) in die dichte Schicht von AlexNet eingeführt, um irrelevante räumliche Merkmale zu filtern und dadurch die Extraktion von visuellen Merkmalen auf hoher Ebene zu verbessern. Die Integration mit RNN ermöglicht eine effektive zeitliche Modellierung von Frame-to-Frame-Abhängigkeiten. (iii) Eliminierung redundanter Frames: Entwicklung eines bewegungskompensierten Varianz-basierten Ansatzes zur Entfernung identischer oder ähnlicher Frames vor der Keyframe-Erkennung, gefolgt von einer optionalen PCA-basierten Dimensionalitätsreduzierung für eine effiziente Merkmalsdarstellung. (iv) Genaue Keyframe-Erkennung: Verwendete einen Adversarial Encoder-basierten LSTM-Klassifikator für die zeitliche Modellierung, der einen durchschnittlichen F-Score von 0,985 erreichte und damit eine überlegene Zusammenfassungsgenauigkeit im Vergleich zu Baseline-Ansätzen demonstrierte. (v) Effizienz gegenüber Transformatormodellen: Es wurde gezeigt, dass das vorgeschlagene GARNN-Modell rechnerisch effizient ist, wobei AlexNet räumliche Merkmale effektiv erfasst, RNN sequenzielle Abhängigkeiten modelliert und der Gating-Mechanismus unwichtige Frames herausfiltert und transformatorbasierte Alternativen bei der Merkmalsauswahl und Zusammenfassung übertrifft.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dieser Studie wird eine multimodale überwachte Videozusammenfassungsmethode vorgeschlagen, die in die Kategorie der generischen Videozusammenfassung fällt, die allgemein als Video-Skimming bezeichnet wird. Dazu gehören Techniken, die sich darauf konzentrieren, Schlüsselsegmente eines größeren Videos zu finden, um eine zeitlich komprimierte Version davon zu erstellen. Diese Studie schlägt eine überwachte Technik zur Analyse des Videostreams in 1 s-Abschnitten vor, die audiovisuelle Darstellungen enthalten, wie in Abbildung 1 gezeigt. Diese Segmente werden dann entweder als "uninteressant" oder "informativ" kategorisiert. Im Gegensatz zu synthetischen oder simulierten Daten bezieht sich "reale Daten" nun auf die tatsächlichen Videodatensätze, die für Experimente verwendet werden. Videosegmente, die wichtige audiovisuelle Signale liefern, die für die Zusammenfassung erforderlich sind, wie z. B. hohe Bewegungen, Sprach- oder Szenenübergänge, werden als "informative Segmente" bezeichnet. "Uninteressante" Teile werden als sich wiederholende oder redundante Frames definiert, die der Inhaltsangabe nichts Neues hinzufügen.

Die Eingabevideos werden in Frames segmentiert, und die multimodalen Merkmale werden mit dem vorgeschlagenen GARNN-Modell aus jedem Frame extrahiert. Die akustischen und visuellen Funktionen werden fusioniert und als Input in die Phase der Dimensionalitätsreduktion eingespeist, wo die redundanten Frames für die weitere Verarbeitung entfernt werden. Schließlich wird der vorgeschlagene AELSTM auf die reduzierten Daten für die Videozusammenfassung angewendet. Um dies zu erreichen, wird ein überwachter binärer Klassifikator verwendet, der mit Merkmalsdarstellungen aus den visuellen, akustischen oder gemischten Modalitäten trainiert wurde, die als Multimodalitäten bezeichnet werden.

figure-protocol-1
Abbildung 1: Überblick über das vorgeschlagene Modell zur Videozusammenfassung. Die Pipeline umfasst die multimodale Merkmalsextraktion, die Reduzierung der Dimensionalität und die Generierung von Zusammenfassungen mit AELSTM. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Dataset
Die Wirksamkeit der vorgeschlagenen Lösungen wird anhand der Datensätze VSUMM17 und SumMe18 bestimmt, einem Paar von Benchmark-Datensätzen in der statischen Videozusammenfassung. Zu den Datensätzen gehören CNN-Funktionen, die mit AlexNet mit LSTM erstellt wurden, und echte Daten. Die realen Daten und Datensätze sind der breiten Öffentlichkeit zugänglich19. Die 50 Filme im VSUMM-Datensatz stammen von Websites wie YouTube und erstrecken sich über 110 Minuten mit 30 Bildern pro Sekunde. Es gibt sie in einer Vielzahl von Genres, darunter Cartoons, Nachrichten, Sport, Werbung, TV-Serien und Heimvideos. Darunter sind 25 Videos von Feiertagen, Festivals und Sportarten, die von der bekannten YouTube-Seite bezogen und mit mindestens 15 von Menschen erstellten Zusammenfassungen (insgesamt 390) versehen wurden, die den Videozusammenfassungsdatensatz "SumMe"20 bilden. Der Dauerbereich der Videos beträgt 1-6 Minuten.

Das Originalvideo wird in RGB-Bilder konvertiert, die als Eingabe in das vortrainierte vorgeschlagene GARNN-Modell zur Merkmalsextraktion eingespeist werden. Dieses Modell besteht aus AlexNet und einem geschlossenen RNN. Die ursprüngliche Anzahl der Funktionen beträgt 64, und die Funktionen von AlexNet haben 4100 Funktionen.

Vorgeschlagene Gated-AlexNet-RNN-basierte Merkmalsextraktion
Sowohl der visuelle als auch der akustische Informationsmodus wurden verwendet, um die Videos zusammenzufassen. Um eine Merkmalsdarstellung in beiden Modalitäten zu erreichen, haben wir handgefertigte Merkmale identifiziert, die häufig in audiovisuellen Clustering- und Klassifizierungsaufgaben verwendet werden, wie z. B. beim Abrufen von Bildern, bei der Videoklassifizierung, bei der Analyse auditiver Szenen und beim Abrufen von Musikinformationen. Ziel war es, so viele visuelle und akustische Unterrichtskomponenten wie möglich einzubeziehen. Abbildung 2 zeigt eine konzeptionelle Darstellung des Prozesses, der zum Extrahieren von Merkmalen für die audiovisuellen Modalitäten verwendet wird.

figure-protocol-2
Abbildung 2: Vorgeschlagene multimodale GARNN-basierte Merkmalsextraktion. Merkmale sowohl aus visuellen als auch aus akustischen Modalitäten werden mit AlexNet- und GARNN-Komponenten extrahiert. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Geschlossen- AlexNetRNN: (GARNN)
Für die virtuelle Bildanalyse ist CNN ein beliebtes DL-Modell21. Im Allgemeinen verwendet CNN das Bild als Eingabe und unterteilt es in mehrere Gruppen. Eingabeneuronen, eine Abfolge von Schichten mit Convolutional Pooling, Schichten, die vollständig miteinander verknüpft sind, und normalisierende Schichten bilden seine Struktur22. Die Neuronen der Faltungsschicht sind über einen schmalen Bereich mit der vorhergehenden Schicht verbunden. Die darunter liegenden Schichten sind vollständig mit den aktivierenden Neuronen der vollständig verknüpften Schichten verbunden. Gln (1) stellt die Vorwärts- und Rückwärtsfortpflanzung einer vollständig verbundenen Funktion dar.

figure-protocol-3(1)

figure-protocol-4(2)

Dabei figure-protocol-5 ist die Aktivierung desi-ten Neurons in derl-ten Schicht, figure-protocol-6 ist der Gradient desi-ten Neurons in derl-ten Schicht, figure-protocol-7 ist das Gewicht desi-ten Neurons in der l+1-ten Schicht. Zahlreiche CNN-Designs sind als Ergebnis der jüngsten Forschungsfortschritte entstanden. Bei dieser Arbeit wurde AlexNet verwendet.

Die Architektur von AlexNet, die in Abbildung 3 dargestellt ist, spiegelt ein sorgfältiges und gut strukturiertes Design wider. Drei vollständig miteinander verbundene Schichten und fünf Faltungsschichten bilden die acht Lernschichten. Die Klassenbeschriftungen werden erzeugt, indem das Ergebnis der letzten Schicht in die Funktion eingespeist wird, die softmax aktiviert. Die Kernel der zweiten, vierten oder fünften Ebene sind über GPU-Sharing mit ihren Vorgängerebenen verbunden. Der Kernel der zweiten und dritten Schicht sind vollständig miteinander verbunden. Die Normalisierungsschicht ist mit den Max-Pooling-Schichten nach der ersten und zweiten Ebene verbunden. ReLU ist mit allen Lernschichten verknüpft.

figure-protocol-8
Abbildung 3: Architektur von AlexNet. Fünf Faltungsschichten und drei vollständig verbundene Schichten werden verwendet, um visuelle Daten im Zusammenfassungsmodell zu verarbeiten. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Das primäre Backbone-Netzwerk für die Arbeit war ein Dichtschicht-GARNN. Das dicke RNN besteht aus drei Schichten. Mit 80 Neuronen in der zweiten Schicht und 170 in der ersten Schicht besteht es aus zwei vollständig verbundenen (fc) Schichten. Die folgenden Schichten sind Batch-Normalisierung und Dropout. Die fc, die letzte Schicht, besteht aus drei Neuronen und dient zur Unterteilung des Bildes. Die dichte Schicht, die nach dem LSTM kommt, teilt den Bereich um den Hirntumor. AlexNet verleiht dem LSTM-Layer Funktionen. Das Dataset verfügt über maximal 20 Slices, was der Gesamtzahl der deklarierten Sequenzen entspricht. Die erste Schicht des GARNN enthält 100 versteckte Einheiten, während die dritte Schicht 125 versteckte Einheiten enthält.

Der Gating-Mechanismus wurde in die dichte (vollständig verknüpfte) Schicht von AlexNet in unserem vorgeschlagenen GARNN-AE-LSTM-Framework integriert. Convolutional Feature Maps werden häufig von AlexNet verarbeitet und zur Klassifizierung direkt in vollständig verbundene Layer gesendet. Alle abgerufenen räumlichen Merkmale, einschließlich redundanter oder weniger signifikanter Muster, werden von dieser Methode gleich behandelt. Wir haben dies behoben, indem wir eine Gating-Funktion eingeführt haben, die als Merkmalsfilter fungiert und auf einem Sigmoid basiert. Mathematisch ausgedrückt moduliert ein Gate-Vektor g = σ(wX) + b die Ausgabe der dichten Schicht, wobei σ die Sigmoidfunktion darstellt. Während des Trainings lernt dieses Gate, verschiedene Gewichte der Feature-Aktivierung von 0 bis 1 zu vergeben. Sie sind: (i) niedrige Gate-Werte unterdrücken irrelevante Merkmale (z.B. Hintergrundgeräusche oder redundante Texturen). (ii) Höhere Gate-Werte heben diskriminierende Merkmale hervor (z. B. wichtige Objektbereiche oder bewegungsempfindliche Muster). (iii) Dieser verbesserte Funktionsumfang wird dann von der RNN-Komponente verwendet, die es ihr ermöglicht, zeitliche Abhängigkeiten besser zu erfassen, ohne durch irrelevante räumliche Informationen abgelenkt zu werden. (iv) Backpropagation wird verwendet, um die Gating-Parameter während des Trainings zusammen mit AlexNet und dem RNN zu ändern. Dies bedeutet, dass das Modell im Laufe der Zeit lernt, welche Aspekte für die Zusammenfassung am wichtigsten sind und welche Merkmale extrahiert werden sollen.

In Abbildung 4 bezeichnet die Variable X die Eingabedaten, C die Zelle und H den ausgeblendeten Zustand.

figure-protocol-9
Abbildung 4: GARNN-Modell (Gated Recurrent Neural Network architecture). Das GARNN integriert Batch-Normalisierung, Dropout und mehrere dichte Schichten für eine effektive Sequenzmodellierung. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

In jedem Block wurden die jeweiligen Gewichte, wie z. B. Iw, Rw und Bias, die als Eingabe, wiederkehrende Gewichtung und Bias bezeichnet werden, wie in Gln (3) bis Gl. (5) verwendet

figure-protocol-10(3)

figure-protocol-11(4)

figure-protocol-12(5)

Bei einem bestimmten Zeitstempel t wird der Zustand der Zelle wie in Gln (6) bezeichnet

figure-protocol-13(6)

Wird figure-protocol-14 das Produkt aus Hadamard und der Zustand der verborgenen Einheit wie in Gln (7) bezeichnet,

figure-protocol-15(7)

Daher wird das py-Audioanalysemodul verwendet, um Audioeigenschaften auf Segmentebene für jeden Audioclip zu berechnen, der aus der entsprechenden Videodatei extrahiert wurde, wobei ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23 verwendet wird. Die extrahierten Features sind in Tabelle 1 aufgeführt.  In Übereinstimmung mit diesem Verfahren wird die Extraktion von Audiomerkmalen zunächst vorübergehend durchgeführt. Der letzte Teil der Darstellung besteht aus Feature-Statistiken auf Segmentebene, die auf einer zweiten Ebene berechnet werden. Konkret wird für jedes Segment des Audiosignals eine Kurzzeitverarbeitung durchgeführt, was zur Berechnung von 68 Kurzzeitmerkmalen (34 Merkmale und 34 Deltas) für jedes Fenster auf Segmentebene führt, die überlappend oder nicht überlappend sein können. Wir haben eine Vielzahl von visuellen Merkmalen verwendet, um den Inhalt der visuellen Informationen zu vermitteln, zusätzlich zur Extraktion auditiver Elemente aus dem Tonsignal jedes Videos. Es wird erwartet, dass diese Modalität für den zusammenfassenden Prozess von entscheidender Bedeutung sein wird. Die multimodal_movie_analysis-Bibliothek (https://github.com/tyiannak/multimodal_movie_analysis) wurde verwendet, um Merkmale zu extrahieren, die visuelle Aspekte eines Videos widerspiegeln, um diese visuellen Elemente zu extrahieren. Konkret werden die 88 unten aufgeführten visuellen Elemente alle 0,2 s aus dem entsprechenden Frame übernommen. Dabei werden die multimodalen Merkmale verschmolzen, und insgesamt 59 Merkmale werden für die weitere Analyse der Klassifizierung des Videos als informativ und uninteressant verwendet, indem die Videozusammenfassung durchgeführt wird.

Funktionsreduzierung mittels PCA
Die Dimension der Merkmale in dieser Studie wurde durch die Anwendung der Hauptkomponentenanalyse (PCA) reduziert. Die grundlegenden Merkmale werden in Schlüsselmerkmale umgewandelt, um ihre Prominenz und Bedeutung zu erhöhen. PCA wurde von zahlreichen Forschern in einer Vielzahl von Bereichen in großem Umfang eingesetzt24. Die Eigenwerte werden zur Bestimmung der Eigenschaften verwendet. Die Features mit dem höchsten Eigenwert werden ausgewählt, während die Features mit dem niedrigsten Eigenwert entfernt werden.

Nach dem Entfernen überflüssiger Frames wird in dieser Studie PCA als optionaler Schritt zur Merkmalsreduzierung eingesetzt. PCA unterdrückt Rauschen und redundante Informationen, indem es die von GARNN erzeugten hochdimensionalen Merkmalsvektoren in einen kleinen Unterraum komprimiert. Dies erhöht die Recheneffizienz des AE-LSTM und garantiert gleichzeitig, dass die Keyframe-Erkennung von den anspruchsvollsten visuellen und akustischen Hinweisen dominiert wird. Um Skalierbarkeit und Genauigkeit bei der Videozusammenfassung in Einklang zu bringen, wird PCA als nützliches Werkzeug eingesetzt. Der Algorithmus (Algorithmus 1) wird als Ergänzungsdatei 1 zur Verfügung gestellt.

Jeder Frame, der genau mit dem vorhergehenden Frame identisch oder auffallend vergleichbar ist, wird als redundant betrachtet. Es liegt auf der Hand, dass eine Änderung der Framerate einen Einfluss auf den Anteil der entfernten Videoframes haben kann. Genauer gesagt, mit zunehmender Bildrate nimmt auch die Ähnlichkeit zwischen aufeinanderfolgenden Frames zu, was dazu führt, dass ein höherer Prozentsatz der Frames entfernt wird. Jetzt werden die dimensionalitätsreduzierten Merkmale verwendet, um das ML-Modell zu trainieren, das als adversarial AE-LSTM-Modell bezeichnet wird.

Schulung mit AELSTM
Ein neuronales Netzwerk, das als GAN25 bezeichnet wird, besteht aus zwei rivalisierenden Subnetzwerken: i) einem "Generator"-Netzwerk (G), das Daten erzeugt, die einer unbekannten Verteilung ähneln, und ii) einem "Diskriminator"-Netzwerk (D), das zwischen den erstellten Stichproben und denen aus tatsächlichen Beobachtungen unterscheidet. Ziel ist es, einen Generator zu finden, der die Wahrscheinlichkeit, dass der Diskriminator einen Fehler begeht, maximiert und gleichzeitig die tatsächliche Datenverteilung anpasst.

Nehmen wir an, X ist die Eingabe und E ist das vorherige Eingangsrauschen, X'= g(E) ist das generierte Sample. Mit Hilfe der Minimax-Optimierung wird das Lernen formuliert:

figure-protocol-16(8)

Wobei D qualifiziert ist, die korrekte Wahrscheinlichkeit der Einstufung zu erhalten. Die Komponenten unseres entwickelten Trainingsmodells sind in Abbildung 5 dargestellt. Der Selektor LSTM wählt die Frames-Teilmenge aus der Eingabevideosequenz X aus. Die ausgewählten Frames werden mit dem Encoder-LSTM in das Merkmal E mit fester Länge konvertiert, gefolgt von der Videorekonstruktion X' mit dem Decoder-LSTM. Die Klassifizierung von X' in eine reale Video- oder Zusammenfassungsklasse wird durch den Diskriminator-LSTM durchgeführt. In dieser Studie wird AE-LSTM für die Videozusammenfassung mit GAN-Struktur für effiziente, vielfältige und strukturierte Videozusammenfassungen verwendet. Der AE kann unnötige Hintergrundänderungen eliminieren, und der LSTM kann die Szenenübergänge erkennen, anstatt die Frames als Bilder zu behandeln, und der GAN, der Generator, kann das Video zusammenfassen, und der Diskriminator stellt sicher, dass die Zusammenfassung vielfältig ist

figure-protocol-17
Abbildung 5: Architektur des AELSTM-Zusammenfassungsmodells. Enthält Selector-LSTM, Encoder-LSTM, Decoder-LSTM und Discriminator-LSTM zur Optimierung von Videozusammenfassungen durch Adversarial-Training. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzuzeigen.

Indem die GARNN-Funktionen für jedes Bild in dem Eingabevideo X angegeben figure-protocol-18 werden, verwendet der Zusammenfassunger den Selektor LSTM, um die Teilmenge der Bilder auszuwählen, und der Encoder codiert die Bilder als E, gefolgt vom Decoder, der das Video bei jedem Bild xt als X' rekonstruiert. Der Selektor verwendet die Wichtigkeitsbewertung bei der Auswahl des Rahmens. Die Merkmale werden durch den Gewichtungswert unter Verwendung der Bewertungen angegeben und dann auf den Encoder verschoben. Für jeden Frame mit score st = 1 wird die Teilmenge nur vom Encoder empfangen. Der Diskriminator wählt die Klassen als Original oder Zusammenfassung aus, indem er den Abstand zwischen X und X' schätzt und die Beschriftungen zuweist. In diesem Fall berechnet der Diskriminator den Fehler zwischen dem Original- und dem Zusammenfassungsvideo. Algorithmus 2 (Ergänzungsdatei 2) bezeichnet die Zusammenfassung des Trainings von AELSTM für die Videozusammenfassung.

Nachbearbeitung – Videozusammenfassung
Videozusammenfassungen können von Klassifikatoren auf Segmentebene erstellt werden, sobald sie trainiert wurden. Um dies zu erreichen, sind drei Schritte erforderlich: (i) Bestimmen Sie die audiovisuellen, visuellen oder gemischten Eigenschaften jedes Videosegments. (ii) Klassifizieren Sie jedes Videosegment mit dem entsprechenden Audio-, Video- oder Fusionsklassifikator. (iii) Um eklatante Fehler zu vermeiden, bearbeiten Sie die Vorhersagen des geordneten Klassifikators nach.

Um dieser Nachfrage gerecht zu werden, wurde für den Nachbearbeitungsschritt eine Pipeline entwickelt, die aus zwei unterschiedlichen Filtern besteht. Das Eingabearray wird zunächst einem Medianfilter der Länge N1 unter Verwendung lokaler Fenster unterzogen, um die sequenziellen Klassifikatorvorhersagen zu glätten. Die endgültigen Vorhersagen werden dann durch hartes Filtern unter Verwendung einer einfachen Methode bestimmt, die eine Reihe von aufeinanderfolgenden positiven Vorhersagen (informative Segmente) beibehält, wenn mindestens N2-Segmente in dieser Sequenz enthalten sind. Anders ausgedrückt verlangt dieses Kriterium, dass ein instruktives Segment mindestens N2 Sekunden dauert.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die vorgeschlagene GARNN-basierte Merkmalsextraktion und die AGLSTM-basierte Videozusammenfassung langer Videos wurden an zwei Datensätzen, nämlich VSUMM und SumMe, experimentiert. In diesem Abschnitt werden die experimentellen Ergebnisse und der Vergleich mit herkömmlichen Ansätzen diskutiert. Für den Diskriminator LSTM verwenden wir ein zweischichtiges LSTM mit 1024 versteckten Einheiten auf jeder Schicht. Für encoder_LSTM bzw. decoder_LSTM verwenden wir zwei zweischichtige LSTMs mit 2048 versteckten Einheiten in jeder...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In dieser Studie wird die Videozusammenfassung langer Videos unter Verwendung eines effizienten multimodalen ML- und DL-Modells dargestellt, das Audio-, Bild- und visuelle Modalitäten von Daten verwendet, die aus den Eingabedaten generiert werden. Der binäre Klassifikator ist darauf trainiert, die Unterscheidung zwischen den wichtigen Segmenten, die der erzeugte Zusammenfassungsteil sind, und den "unwichtigen" Segmenten, die verworfen werden, zu lernen. Das Modell wird mit Datensätzen wi...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben keine Interessenkonflikte.

Danksagungen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren danken der Dr. Television School der Sichuan Film and Television University für die Bereitstellung der Laboreinrichtungen für die Durchführung der Forschungsstudie.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
AlexNet (vortrainiertes Modell)MATLAB / PyTorchPyTorch Hub – Vortrainiertes Modell von AlexNet: https://pytorch.org/hub/pytorch_vision_alexnet/Wird für die Extraktion visueller Merkmale verwendet
FFmpegFFmpeg.orghttps://ffmpeg.org/Audio-Extraktion aus Video
GRNN-basiertes ModellKundenspezifische ImplementierungBibliothek " neupy" implementiert GRNN: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlWird für die multimodale Merkmalsfusion verwendet
LSTM (Langes Kurzzeitgedächtnis)PyTorchhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlWird in Selektor, Encoder, Decoder verwendet
Multimodal_movie_analysis libGitHub (Englisch)https://github.com/tyiannak/multimodal_movie_analysisFür die visuelle Merkmalsextraktion
NumPyPython-Software-Stiftunghttps://pypi.org/project/numpy/Numerische Berechnung und Matrixoperationen
PCA (Hauptkomponentenanalyse)Scikit-lernenhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlReduzierung der Dimensionalität
PyAudioAnalysisGitHub (Englisch)https://github.com/tyiannak/pyaudioanalysisExtraktion von Audiofunktionen
PyTorchPyTorch Stiftunghttps://pytorch.org/Deep-Learning-Framework
SumMe-DatensatzÖffentlicher Datensatzhttps://gyglim.github.io/me/vsum/index.htmlBenchmark-Datensatz zur Videozusammenfassung
VSUMM-DatensatzÖffentlicher Datensatzhttp://www.vision.ime.usp.br/~creativision/vsumm/Benchmark-Datensatz zur Videozusammenfassung

Referenzen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Gated Recurrent UnitsKeyframe DetektionMerkmalsextraktionBewegungskompensationPCA ReduktionAdversarial EncoderTemporale ModellierungF1 Score

Verwandte Artikel