Article de recherche

GARNN-AE-LSTM : une approche multimodale d’apprentissage profond pour la synthèse vidéo de haute précision

DOI :

10.3791/69097

10 octobre 2025

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude propose un cadre multimodal d’apprentissage profond pour la synthèse vidéo en intégrant des fonctionnalités audio-visuelles à l’aide de modèles GARNN pré-entraînés. Tirant parti de GRU, d’AlexNet et d’un classificateur LSTM antagoniste, le système améliore la détection des images clés, réduit la redondance et atteint une grande précision de synthèse avec un score F moyen de 0,985.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le résumé vidéo se concentre sur la création de versions concises de longues vidéos en préservant le contenu essentiel. Cette étude révèle une stratégie d’apprentissage automatique multimodale qui intègre des informations visuelles et auditives en utilisant des architectures de réseau neuronal récurrent à portes pré-entraînées appelées GARNN, combinant des unités récurrentes à grille (GRU) et AlexNet, pour extraire des caractéristiques audio, d’image et visuelles. La détection des images clés est améliorée en supprimant les images redondantes et en appliquant une réduction des caractéristiques compensée par le mouvement, suivie d’une réduction de dimensionnalité optionnelle basée sur l’ACP. Un classificateur AE-LSTM (Long Short-Term Memory) basé sur un encodeur antagoniste est utilisé pour la modélisation temporelle en atteignant une grande précision dans la synthèse. Les résultats ont été évalués à l’aide de la sensibilité, des scores F et des valeurs prédictives positives, et la méthode a atteint un score F moyen de 0,985. Un AlexNet à grille est introduit dans un cadre multimodal GARNN-AE-LSTM, où la réduction basée sur l’ACP compensée par le mouvement élimine la redondance, les GRU enregistrent la progression temporelle et le gating affine la sélection des caractéristiques spatiales, ce qui contribue à un système de synthèse vidéo plus précis et plus efficace. L’amélioration du score F1 démontre l’efficacité du modèle à générer de la précision dans les résumés vidéo en créant une vidéo significative. Cette approche met en évidence le potentiel de l’extraction multimodale de caractéristiques et des techniques avancées d’apprentissage profond pour l’analyse et la compression vidéo robustes.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les systèmes d’analyse multimodale (MMA) ont vu le jour, combinant plusieurs modalités telles que l’audio, la vidéo, le texte et les données des capteurs pour fournir des informations sur la façon dont les élèves apprennent1. Ces technologies peuvent aider à acquérir une compréhension approfondie du comportement des élèves et des niveaux d’engagement en évaluant les données multimodales2. Cependant, il existe un certain nombre d’obstacles et de restrictions lorsqu’il s’agit de créer des systèmes MMA efficaces3. Il y a une tonne de vidéos numériques en raison de la croissance d’Internet et des caméras de sécurité. Il est impératif que ces vidéos soient compilées dans des bases de données. Un résumé vidéo peut être utile dans cette situation. La création d’un synopsis utile de la vidéo réelle est connue sous le nom de résumé vidéo, et elle aide au suivi d’activité, à la détection d’anomalies et à la récupération vidéo4. Le résumé vidéo peut être réalisé à l’aide d’une variété de stratégies. Ces méthodes entrent dans l’une des deux catégories5, telles que la synthèse vidéo extractive et abstraite.

Étant donné que la synthèse vidéo nécessite beaucoup de calcul, des méthodes efficaces sont nécessaires. Si chaque image d’un film est examinée pour la sélection, le processus de synthèse peut être lent et long, et les ressources de traitement peuvent être consacrées à des images identiques ou similaires. De plus, pour accélérer le processus et s’assurer que seules les caractéristiques importantes sont prises en compte, une réduction de l’espace doit être effectuée pour tout ensemble de fonctionnalités6. Les techniques de synthèse vidéo peuvent être classées en quatre grands domaines en fonction du type de signaux audiovisuels produits et montrés à l’utilisateur final7, ou de leur sortie. Pour être plus précis, les résultats des calculs de synthèse vidéo pourraient inclure : (i) les images primaires8, qui sont affichées séquentiellement des images vidéo extraites, communément appelées résumés statiques ; (ii) les trames vidéo9, appelées résumés dynamiques ; iii) des signaux visuels10, qui améliorent les résumés pour l’utilisateur final en ajoutant une syntaxe graphique à d’autres indices ; et (iv) générées par des ordinateurs, annotations textuelles11, qui sont conçues pour offrir des résumés efficaces de l’information vidéo.

Les résumés basés sur des images clés sont généralement plus petits que ceux basés sur des clichés clés. L’image-clé fait référence à une image représentative individuelle sélectionnée dans la vidéo. Keyshot désigne un court segment continu d’images vidéo regroupées autour d’images clés. La classe Summary fait référence aux cadres ou segments d’étiquetage de sortie du classifieur comme informatifs (à inclure dans le résumé) ou non informatifs (à exclure). Néanmoins, cet avantage se fait au détriment de l’omission de détails importants dans le processus de résumé. Par exemple, il peut être difficile d’obtenir le contexte de l’image précédente dans un résumé basé sur des images clés. Il est également dépourvu du son d’origine. Pour résoudre ces problèmes, des techniques de synthèse vidéo basées sur des keyshots sont donc fréquemment choisies. Les techniques de résumé vidéo basées sur Keyshot sont utilisées pour créer des sous-ensembles pour les vidéos longues ou courtes. Les vidéos courtes et longues ont généralement des durées inférieures à et supérieures à 10 minutes, respectivement12. La génération de sous-ensembles assistés par keyshot pour les vidéos de courte durée n’est pas pratique et peut ne pas réussir en raison de leur durée de relecture déjà courte. De plus, la durée de lecture des vidéos de longue durée, en particulier des films ou des vidéos sportives, peut dépasser 90 minutes. Pour ces catégories de vidéos, les techniques de résumé basées sur les keyshots sont plus utiles et efficaces pour donner aux utilisateurs un bref aperçu.

La nature subjective du résumé vidéo en fait une tâche ardue. Cela est dû au fait que chaque utilisateur a des goûts distincts, même lorsqu’il s’agit de contenu vidéo comparable. Ce problème peut être résolu avec précision à l’aide de l’approche de synthèse vidéo sur mesure13. L’objectif de l’algorithme est de fournir à chaque utilisateur un contenu adapté à ses intérêts. Cependant, il n’est pas facile de trouver des résumés vidéo adaptés avec des durées idéales pour les nouvelles vidéos de longue durée (comme les événements sportifs). Les méthodes actuelles14,15 nécessitent des ressources informatiques massives pour évaluer les préférences des clients, les données et les séquences vidéo afin de fournir des résumés individualisés en temps réel. Des résumés vidéo personnalisés en temps réel peuvent être obtenus à partir de serveurs dédiés centralisés. Babu Veesam et Satish16 ont discuté d’une analyse taxonomique approfondie de toutes les principales stratégies de synthèse vidéo qui démontrent des approches largement utilisées pour compresser efficacement de grandes quantités de données vidéo. L’examen classe et évalue les méthodologies par rapport à leurs approches fondamentales, qui comprennent les stratégies d’intégration multimodale, les cadres d’apprentissage profond et les méthodes basées sur le clustering. Parmi les méthodes notables, citons le cadre KDAN, qui utilise la distillation des connaissances pour la synthèse supervisée, et la méthode SVS_MCO, qui utilise le clustering DBSCAN optimisé par l’algorithme des algues artificielles. De plus, l’examen fournit des modèles sophistiqués tels que le réseau récurrent audiovisuel et l’apprentissage profond des vautours africains basé sur des requêtes, qui se sont avérés très efficaces pour gérer les problèmes de synthèse vidéo dynamique et multimodale.

L’inclusion d’un cadre multimodal de réseau neuronal récurrent AlexNet (GARNN-AE-LSTM) pour la synthèse vidéo est ce qui rend cette étude nouvelle. Cette approche améliore la précision et l’efficacité du processus de synthèse vidéo en réduisant la redondance avec l’ACP compensée en mouvement, en capturant la dynamique temporelle avec les GRU et en optimisant la sélection des caractéristiques spatiales à l’aide de méthodes de contrôle. Afin de fournir la synthèse vidéo efficacement avec une complexité réduite, cet article apporte ce qui suit : (i) Synthèse vidéo multimodale : Proposition d’un cadre pour générer des résumés vidéo concis en intégrant des informations visuelles et auditives à l’aide d’un modèle GARNN pré-entraîné qui combine les RNN à grille et AlexNet. (ii) AlexNet fermé pour l’affinement des fonctionnalités : Introduction d’un nouveau mécanisme de porte (porte sigmoïde) dans la couche dense d’AlexNet pour filtrer les caractéristiques spatiales non pertinentes, améliorant ainsi l’extraction de caractéristiques visuelles de haut niveau. L’intégration avec RNN permet une modélisation temporelle efficace des dépendances d’image à image. (iii) Élimination des images redondantes : Développement d’une approche basée sur la variance compensée en mouvement pour supprimer les images identiques ou similaires avant la détection des images clés, suivie d’une réduction facultative de la dimensionnalité basée sur l’ACP pour une représentation efficace des caractéristiques. (iv) Détection précise des images-clés : Utilisation d’un classificateur LSTM basé sur un encodeur antagoniste pour la modélisation temporelle, obtenant un score F moyen de 0,985, démontrant ainsi une précision de synthèse supérieure par rapport aux approches de base. (v) Efficacité par rapport aux modèles de transformateur : Démonstration que le modèle GARNN proposé est efficace en termes de calcul, où AlexNet capture efficacement les caractéristiques spatiales, les modèles RNN les dépendances séquentielles et le mécanisme de déclenchement filtre les trames sans importance, surpassant les alternatives basées sur le transformateur dans la sélection et la synthèse des caractéristiques.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude propose une méthode de synthèse vidéo supervisée multimodale qui entre dans la catégorie générique de synthèse vidéo, communément appelée écrémage vidéo. Cela inclut des techniques qui se concentrent sur la recherche de segments clés d’une vidéo plus grande pour créer une version condensée dans le temps de celle-ci. Cette étude propose une technique supervisée pour analyser le flux vidéo en sections 1 s qui incluent des représentations audio et visuelles, comme le montre la figure 1. Ces segments sont ensuite classés comme « inintéressants » ou « informatifs ». Contrairement aux données synthétiques ou simulées, les « données réelles » font désormais référence aux ensembles de données vidéo réels utilisés pour les expériences. Les segments vidéo qui fournissent des signaux audiovisuels importants nécessaires à la synthèse, tels que les mouvements élevés, la voix ou les transitions de scène, sont appelés « segments informatifs ». Les parties « inintéressantes » sont définies comme des images répétitives ou redondantes qui n’ajoutent rien de nouveau au synopsis.

Les vidéos d’entrée sont segmentées en images, et les caractéristiques multimodales sont extraites de chaque image à l’aide du modèle GARNN proposé. Les caractéristiques audio et visuelles sont fusionnées et introduites en entrée dans la phase de réduction de la dimensionnalité, où les images redondantes sont supprimées pour un traitement ultérieur. Enfin, l’AELSTM proposé est appliqué aux données réduites pour la synthèse vidéo. Pour y parvenir, un classificateur binaire supervisé entraîné avec des représentations de caractéristiques à partir de modalités visuelles, audio ou mixtes, appelées multimodalités, est utilisé.

figure-protocol-1
Figure 1 : Vue d’ensemble du modèle de synthèse vidéo proposé. Le pipeline comprend l’extraction multimodale de fonctionnalités, la réduction de la dimensionnalité et la génération de résumés à l’aide d’AELSTM. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Jeu de données
L’efficacité des solutions suggérées est déterminée à l’aide des ensembles de données VSUMM17 et SumMe18 , une paire d’ensembles de données de référence dans la synthèse vidéo statique. Les fonctionnalités CNN créées à l’aide d’AlexNet avec LSTM et des données réelles font partie des ensembles de données. Les données et les ensembles de données réels sont accessibles au grand public19. Les 50 films de l’ensemble de données VSUMM proviennent de sites Web comme YouTube et durent 110 minutes à 30 images par seconde. Ils viennent dans une variété de genres, y compris les dessins animés, les actualités, les sports, la publicité, les séries télévisées et les vidéos personnelles. Parmi celles-ci, 25 vidéos sont constituées de vacances, de festivals et de sports qui ont été obtenues à partir du site YouTube bien connu et étiquetées avec au moins 15 résumés générés par l’homme (390 au total) constituent l’ensemble de données de résumé vidéo « SumMe"20 . La durée des vidéos est de 1 à 6 minutes.

La vidéo originale est convertie en images RVB, qui sont introduites en entrée dans le modèle GARNN pré-entraîné proposé pour l’extraction des caractéristiques. Ce modèle se compose d’AlexNet et d’un RNN fermé. Le nombre original de fonctionnalités est de 64, et les fonctionnalités d’AlexNet ont 4100 fonctionnalités.

Proposition d’extraction de caractéristiques basée sur Gated-AlexNet-RNN
Les modes d’information visuel et audio ont été utilisés pour résumer les vidéos. Pour obtenir une représentation des caractéristiques dans les deux modalités, nous avons identifié des caractéristiques artisanales qui sont souvent utilisées dans les tâches de regroupement et de classification audio et visuelle, telles que la récupération d’images, la classification vidéo, l’analyse de scènes auditives et la récupération d’informations musicales. L’objectif était d’inclure autant d’éléments pédagogiques, visuels et audio que possible. La figure 2 montre une illustration conceptuelle du processus utilisé pour extraire les caractéristiques des modalités audio et visuelles.

figure-protocol-2
Figure 2 : Proposition d’extraction de caractéristiques multimodale basée sur GARNN. Les caractéristiques des modalités visuelles et audio sont extraites à l’aide des composants AlexNet et GARNN. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Gated- AlexNetRNN : (GARNN)
Pour l’analyse d’images virtuelles, CNN est un modèle DL21 populaire. En général, CNN utilise l’image comme entrée et la divise en plusieurs groupes. Des neurones d’entrée, une séquence de couches avec un pool convolutif, des couches complètement liées et des couches normalisantes constituent sa structure22. Les neurones de la couche de convolution sont reliés à la couche précédente par une région étroite. Les couches en dessous d’eux sont entièrement connectées aux neurones activateurs des couches entièrement liées. Eqn (1) représente la propagation vers l’avant et vers l’arrière d’une fonction entièrement connectée.

figure-protocol-3(1)

figure-protocol-4(2)

figure-protocol-5 est l’activation duième neurone dans la lème couche est, figure-protocol-6 est le gradient du ième neurone dans la lème couche, figure-protocol-7 est le poids du ième neurone dans l + 1ème couche. De nombreux modèles de CNN ont vu le jour à la suite des récentes avancées de la recherche. AlexNet a été utilisé dans ce travail.

L’architecture d’AlexNet, illustrée à la figure 3, reflète une conception méticuleuse et bien structurée. Trois couches complètement connectées et cinq couches de convolution constituent ses huit couches d’apprentissage. Les étiquettes de classe sont produites en introduisant le résultat de la dernière couche dans la fonction qui active softmax. Les noyaux de deuxième, quatrième ou cinquième niveau sont connectés à leurs niveaux antérieurs via le partage GPU. Les noyaux de la deuxième et de la troisième couche sont entièrement connectés les uns aux autres. La couche de normalisation est connectée aux couches de regroupement maximale après le premier et le deuxième niveau. ReLU est lié à toutes les couches d’apprentissage.

figure-protocol-8
Figure 3 : Architecture d’AlexNet. Cinq couches convolutives et trois couches entièrement connectées sont utilisées pour traiter les données visuelles dans le modèle de synthèse. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Le réseau dorsal principal pour le travail était un GARNN à couche dense. Il y a trois couches dans l’épais RNN. Avec 80 neurones dans la deuxième couche et 170 dans la première, il est composé de deux couches entièrement connectées (fc). Les couches suivantes sont la normalisation par lots et l’abandon. Le fc, la dernière couche, est composé de trois neurones et sert à diviser l’image. La couche dense, qui vient après le LSTM, divise la zone autour de la tumeur cérébrale. AlexNet donne des fonctionnalités à la couche LSTM. Le jeu de données comporte un maximum de 20 tranches, ce qui correspond au nombre total de séquences qui ont été déclarées. La première couche du GARNN contient 100 unités cachées, tandis que la troisième couche contient 125 unités cachées.

Le mécanisme de déclenchement a été incorporé dans la couche dense (complètement liée) d’AlexNet dans le cadre GARNN-AE-LSTM que nous avons suggéré. Les cartes de caractéristiques convolutives sont souvent traitées par AlexNet et envoyées directement dans des couches entièrement connectées pour la classification. Toutes les caractéristiques spatiales récupérées, y compris les motifs redondants ou moins significatifs, sont traitées de la même manière par cette méthode. Nous avons résolu ce problème en introduisant une fonction de contrôle qui fonctionne comme un filtre de caractéristiques et qui est basée sur un sigmoïde. En termes mathématiques, un vecteur de porte g = σ(wX) + b, module la sortie de la couche dense, σ représentant la fonction sigmoïde. Au cours de l’entraînement, ce gate apprend à donner divers poids d’activation de caractéristiques allant de 0 à 1. Il s’agit de : (i) les faibles valeurs de grille suppriment les caractéristiques non pertinentes (par exemple, le bruit de fond ou les textures redondantes). (ii) Des valeurs de porte plus élevées mettent en évidence des caractéristiques discriminantes (telles que des régions d’objet importantes ou des motifs sensibles au mouvement). (iii) Cet ensemble de fonctionnalités amélioré est ensuite utilisé par le composant RNN, ce qui lui permet de mieux saisir les dépendances temporelles sans se laisser distraire par des informations spatiales non pertinentes. (iv) La rétropropagation est utilisée pour modifier les paramètres de déclenchement pendant l’entraînement en tandem avec AlexNet et le RNN. Cela implique qu’au fil du temps, le modèle apprend quels aspects sont les plus importants pour la synthèse en plus des caractéristiques à extraire.

Dans la figure 4, la variable X désigne les données d’entrée, C désigne la cellule et H désigne l’état caché.

figure-protocol-9
Figure 4 : Modèle d’architecture de réseau neuronal récurrent à portes (GARNN). Le GARNN intègre la normalisation par lots, l’abandon et plusieurs couches denses pour une modélisation de séquence efficace. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Dans chaque bloc, les poids respectifs, tels que Iw, Rw et biais appelés respectivement entrée, poids récurrent et biais, ont été utilisés comme dans Eqn (3) à Eqn (5)

figure-protocol-10(3)

figure-protocol-11(4)

figure-protocol-12(5)

À un certain horodatage t, l’état de la cellule est noté comme dans Eqn (6)

figure-protocol-13(6)

figure-protocol-14 le produit de Hadamard et l’état de l’unité cachée est noté comme dans Eqn (7)

figure-protocol-15(7)

Ainsi, il utilise le module d’analyse audio py pour calculer les caractéristiques audio au niveau du segment pour chaque clip audio extrait du fichier vidéo correspondant, en utilisant ffmpeg (https : //github.com/tyiannak/pyaudioanalysis)23. Les fonctionnalités extraites sont répertoriées dans le tableau 1.  Conformément à ce processus, l’extraction des caractéristiques audio se fait initialement de manière temporaire. La dernière partie de la représentation est composée de statistiques de caractéristiques au niveau du segment qui sont calculées à un deuxième niveau. Plus précisément, un traitement à court terme est effectué pour chaque segment du signal audio, ce qui permet de calculer 68 caractéristiques à court terme (34 caractéristiques et 34 deltas) pour chaque fenêtre au niveau du segment, qui peut se chevaucher ou non. Nous avons utilisé une variété de caractéristiques visuelles pour transmettre le contenu de l’information visuelle, en plus d’extraire des éléments auditifs du signal sonore de chaque vidéo. Cette modalité devrait être cruciale pour le processus de résumé. La bibliothèque multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) a été utilisée pour extraire des entités qui reflètent les aspects visuels d’une vidéo afin d’extraire ces éléments visuels. Plus précisément, les 88 éléments visuels énumérés ci-dessous sont extraits du cadre correspondant toutes les 0,2 s. Dans ce cas, les caractéristiques multimodales sont fusionnées, et un total de 59 caractéristiques sont utilisées pour une analyse plus approfondie de la classification de la vidéo comme informative et non intéressante en faisant le résumé de la vidéo.

Réduction des fonctionnalités à l’aide de l’ACP
La dimension des caractéristiques de cette étude a été réduite par l’application de l’analyse en composantes principales (ACP). Les caractéristiques de base sont transformées en caractéristiques clés afin de renforcer leur importance et leur importance. L’ACP a été largement utilisée par de nombreux chercheurs dans divers domaines24. Les valeurs propres sont utilisées pour déterminer les propriétés. Les entités de valeur propre la plus élevée sont sélectionnées, tandis que les entités de valeur propre la plus faible sont supprimées.

Après l’élimination des cadres superflus, l’ACP est utilisée dans cette étude en tant qu’étape facultative de réduction des caractéristiques. L’ACP supprime le bruit et les informations redondantes en compressant les vecteurs de caractéristiques de grande dimension produits par GARNN dans un petit sous-espace. Cela augmente l’efficacité de calcul de l’AE-LSTM tout en garantissant que la détection des images clés est dominée par les indices visuels et auditifs les plus discriminants. Afin d’équilibrer l’évolutivité et la précision de la synthèse vidéo, l’ACP est utilisé comme un outil utile. L’algorithme (algorithme 1) est fourni sous la forme du fichier supplémentaire 1.

Toute trame qui est exactement identique ou étonnamment comparable à la trame précédente est considérée comme redondante. Il est évident que la modification de la fréquence d’images peut avoir un impact sur la proportion d’images vidéo supprimées. Plus précisément, à mesure que les fréquences d’images augmentent, la similitude entre les images successives augmente également, ce qui entraîne un pourcentage plus élevé d’images supprimées. Désormais, les caractéristiques de dimensionnalité réduite sont utilisées pour entraîner le modèle ML, appelé modèle AE-LSTM antagoniste.

Formation à l’aide d’AELSTM
Un réseau neuronal appelé GAN25 est composé de deux sous-réseaux rivaux : i) un réseau « générateur » (G) qui crée des données qui ressemblent à une distribution inconnue, et ii) un réseau « discriminant » (D) qui fait la distinction entre les échantillons créés et ceux provenant d’observations réelles. L’objectif est de trouver un générateur qui maximise la probabilité que le discriminateur commette une erreur tout en ajustant la distribution réelle des données.

Supposons que X est l’entrée et E est le bruit d’entrée précédent, X'= g(E) est l’échantillon généré. À l’aide de l’optimisation minimax, l’apprentissage est formulé comme suit :

figure-protocol-16(8)

Où D est qualifié pour obtenir la probabilité correcte de la classification. Les composants de notre modèle d’entraînement développé sont illustrés à la figure 5. Le sélecteur LSTM choisit le sous-ensemble d’images dans la séquence vidéo d’entrée X. Les images sélectionnées sont converties en fonction E de longueur fixe à l’aide de l’encodeur-LSTM, suivie de la reconstruction vidéo X' à l’aide du décodeur-LSTM. La classification de X' en vidéo réelle ou en classe de résumé est effectuée par le discriminateur-LSTM. Dans cette étude, AE-LSTM est utilisé pour la synthèse vidéo avec une structure GAN pour des résumés vidéo efficaces, diversifiés et structurés. L’AE peut éliminer les changements d’arrière-plan inutiles, et le LSTM peut détecter les transitions de scène plutôt que de traiter les images comme des images, et le GAN, le générateur peut résumer la vidéo, et le discriminateur garantit que le résumé est diversifié

figure-protocol-17
Figure 5 : Architecture du modèle de synthèse AELSMC. Comprend Selector-LSTM, Encoder-LSTM, Decoder-LSTM et Discriminateator-LSTM pour optimiser les résumés vidéo via un entraînement contradictoire. Veuillez cliquer ici pour voir une version agrandie de cette figure.

En donnant les caractéristiques GARNN pour chaque image de la vidéo d’entrée X appelée figure-protocol-18 , le synthétiseur utilise le sélecteur LSTM pour choisir le sous-ensemble d’images, et l’encodeur encode les images comme E suivi par le décodeur reconstruisant la vidéo comme X' à chaque image xt. Le sélecteur utilise le score d’importance lors de la sélection du cadre. Les caractéristiques sont données par la valeur de poids à l’aide des scores, puis passent à l’encodeur. Pour chaque trame avec un score st = 1, le sous-ensemble n’est reçu que par l’encodeur. Le discriminateur choisit les classes comme originales ou sommaires en estimant la distance entre X et X' et en attribuant les étiquettes. Dans ce cas, le discriminateur calcule l’erreur entre la vidéo d’origine et la vidéo de synthèse. L’algorithme 2 (Fichier supplémentaire 2) désigne la synthèse de l’entraînement d’AELSTM pour la synthèse vidéo.

Post-traitement – Synthèse vidéo
Des résumés vidéo peuvent être produits par des classificateurs au niveau des segments une fois qu’ils ont été formés. Pour y parvenir, trois étapes sont nécessaires : (i) Déterminer les caractéristiques audio, visuelles ou mixtes de chaque segment vidéo. (ii) Classifiez chaque segment vidéo à l’aide du classificateur audio, visuel ou de fusion approprié. (iii) Pour éviter les erreurs flagrantes, post-traitez les prédictions ordonnées du classificateur.

Pour répondre à cette demande, un pipeline composé de deux filtres distincts a été développé pour l’étape de post-traitement. Le tableau d’entrée est d’abord soumis à un filtre médian de longueur N1 à l’aide de fenêtres locales afin de lisser les prédictions séquentielles du classificateur. Les prédictions finales sont ensuite déterminées par filtrage dur à l’aide d’une méthode simple qui maintient une série de prédictions positives consécutives (segments informatifs) si au moins N2 segments sont inclus dans cette séquence. En d’autres termes, ce critère exige qu’un segment instructif dure au moins N2 secondes.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’extraction de caractéristiques proposée à partir de GARNN et la synthèse vidéo de longues vidéos à l’aide d’AGLSTM ont été expérimentées sur deux ensembles de données, à savoir VSUMM et SumMe. Cette section traite des résultats expérimentaux et de la comparaison avec les approches conventionnelles. Pour le discriminateur LSTM, nous utilisons un LSTM à deux couches ayant 1024 unités cachées à chaque couche. Pour encoder_LSTM et decoder_LSTM, respectivement, nous utilisons deux LSTM à deux couches ayant 2048 unités caché...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dans cette étude, la synthèse vidéo de longues vidéos est présentée à l’aide d’un modèle multimodal ML et DL efficace, qui utilise des modalités audio, image et visuelle des données générées à partir des données d’entrée. Le classificateur binaire est formé pour apprendre la discrimination entre les segments importants qui sont la partie récapitulative produite et les segments « non importants » qui sont ignorés. Le modèle est formé à l’aide d’ensembles de données tels que SumMe et VSUMM...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun conflit d’intérêts.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs sont reconnaissants à la Dr. Television School de l’Université du film et de la télévision du Sichuan de nous avoir fourni les installations de laboratoire nécessaires à la réalisation de l’étude de recherche.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
AlexNet (modèle pré-entraîné)MATLAB / PyTorchMoyeu PyTorch &mdash ; Modèle pré-entraîné AlexNet : https://pytorch.org/hub/pytorch_vision_alexnet/Utilisé pour l’extraction visuelle de caractéristiques
FFmpegFFmpeg.orghttps://ffmpeg.org/Extraction audio à partir d’une vidéo
Modèle basé sur GRNNMise en œuvre sur mesureBibliothèque » neupy" met en œuvre GRNN : http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlUtilisé pour la fusion de fonctionnalités multimodales
LSTM (mémoire à long terme et à court terme)PyTorchhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlUtilisé dans Sélecteur, Encodeur, Décodeur
Multimodal_movie_analysis libLien avec GitHubhttps://github.com/tyiannak/multimodal_movie_analysisPour l’extraction visuelle de caractéristiques
NumPyFondation du logiciel Pythonhttps://pypi.org/project/numpy/Calcul numérique et opérations matricielles
ACP (Analyse en Composantes Principales)Scikit-apprendrehttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlRéduction de la dimensionnalité
PyAudioAnalysisLien avec GitHubhttps://github.com/tyiannak/pyaudioanalysisExtraction de fonctionnalités audio
PyTorchFondation PyTorchhttps://pytorch.org/Cadre d’apprentissage profond
Ensemble de données SumMeJeu de données publichttps://gyglim.github.io/me/vsum/index.htmlJeu de données de synthèse de vidéos de référence
Jeu de données VSUMMJeu de données publichttp://www.vision.ime.usp.br/~creativision/vsumm/Jeu de données de synthèse de vidéos de référence

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Unit s r currentes porteD tection d images cl sExtraction de caract ristiquesCompensation du mouvementR duction par ACPEncodeur adversaireMod lisation temporelleScore F1

Articles connexes