Artículo de investigación

GARNN-AE-LSTM: Un enfoque de aprendizaje profundo multimodal para el resumen de vídeo de alta precisión

DOI:

10.3791/69097

10 de octubre de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio propone un marco de aprendizaje profundo multimodal para el resumen de video mediante la integración de características audiovisuales utilizando modelos GARNN preentrenados. Aprovechando GRU, AlexNet y un clasificador LSTM adversario, el sistema mejora la detección de fotogramas clave, reduce la redundancia y logra una alta precisión de resumen con una puntuación F promedio de 0.985.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El resumen de video se enfoca en crear versiones concisas de videos largos preservando el contenido esencial. Este estudio revela una estrategia de aprendizaje automático multimodal que integra información visual y auditiva mediante el uso de arquitecturas de redes neuronales recurrentes cerradas preentrenadas denominadas GARNN, que combinan unidades recurrentes cerradas (GRU) y AlexNet, para extraer características de audio, imagen y visuales. La detección de fotogramas clave se mejora eliminando fotogramas redundantes y aplicando una reducción de características con compensación de movimiento, seguida de una reducción de dimensionalidad opcional basada en PCA. Se emplea un clasificador de memoria a corto plazo basado en codificador adversario (AE-LSTM) para el modelado temporal al lograr una alta precisión en el resumen. Los resultados se evaluaron mediante el uso de sensibilidad, puntajes F y valores predictivos positivos, y el método alcanzó un puntaje F promedio de 0,985. Se introduce un AlexNet cerrado en un marco GARNN-AE-LSTM multimodal, donde la reducción basada en PCA con compensación de movimiento elimina la redundancia, los GRU registran la progresión temporal y la compuerta ajusta la selección de características espaciales, todo lo cual contribuye a un sistema de resumen de video más preciso y eficiente. La puntuación F1 mejorada demuestra la eficacia del modelo para generar precisión en los resúmenes de vídeo mediante la creación de un vídeo significativo. Este enfoque destaca el potencial de la extracción de características multimodales y las técnicas avanzadas de aprendizaje profundo para un análisis y compresión de video sólidos.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Han surgido sistemas de análisis multimodal (MMA), que combinan varias modalidades como audio, video, texto y datos de sensores para proporcionar información sobre cómo aprenden los estudiantes1. Estas tecnologías pueden ayudar a obtener una comprensión profunda del comportamiento de los estudiantes y los niveles de participación mediante la evaluación de datos multimodales2. Sin embargo, existen una serie de obstáculos y restricciones cuando se trata de crear sistemas de MMA eficientes3. Hay un montón de videos digitales debido al crecimiento de Internet y las cámaras de seguridad. Es imperativo que estos videos se compilen en bases de datos. Un resumen en video puede ser útil en esta situación. La creación de una sinopsis útil del video real se conoce como resumen de video y ayuda con el seguimiento de la actividad, la detección de anomalías y la recuperación de video4. El resumen en video se puede lograr utilizando una variedad de estrategias. Estos métodos se dividen en una de dos categorías5, como resumen de video extractivo y abstracto.

Debido a que el resumen de video requiere mucha computación, se necesitan métodos eficientes. Si se examina cada fotograma de una película para su selección, el proceso de resumen podría ser lento y largo, y los recursos de procesamiento podrían gastarse en fotogramas idénticos o similares. Además, para acelerar el proceso y garantizar que solo se consideren las características importantes, se debe reducir el espacio en cualquier conjunto de características6. Las técnicas de resumen de vídeo pueden clasificarse en cuatro áreas principales en función del tipo de señales audiovisuales que se producen y muestran al usuario final7, o de su salida. Para ser más específicos, los resultados de los cálculos de resumen de vídeo podrían incluir: i) fotogramas primarios8, que se muestran secuencialmente en fotogramas de vídeo extraídos comúnmente conocidos como resúmenes estáticos; ii) fotogramasde vídeo 9, que se denominan resúmenes dinámicos; (iii) señales visuales10, que mejoran los resúmenes para el usuario final al agregar sintaxis basada en gráficos a otras señales; y iv) generadas por ordenador, anotaciones textuales11, diseñadas para ofrecer resúmenes eficaces de la información de vídeo.

Los resúmenes basados en fotogramas clave suelen ser más pequeños que los basados en tomas de teclas. El fotograma clave se refiere a un fotograma representativo individual seleccionado del vídeo. Keyshot denota un segmento corto y continuo de fotogramas de vídeo agrupados alrededor de fotogramas clave. La clase de resumen se refiere a los marcos o segmentos de etiquetado de salida del clasificador como informativos (que se incluirán en el resumen) o no informativos (que se excluirán). Sin embargo, este beneficio se produce a expensas de omitir detalles importantes en el proceso de resumen. Por ejemplo, puede ser difícil obtener el contexto del fotograma predecesor en un resumen basado en fotogramas clave. También carece del sonido original. Por lo tanto, para abordar estos problemas, con frecuencia se eligen técnicas de resumen de video basadas en keyshots. Las técnicas de resumen de video basadas en Keyshot se utilizan para crear subconjuntos para videos de formato largo o corto. Los videos cortos y largos suelen tener duraciones de menos y más de 10 minutos, respectivamente12. La generación de subconjuntos asistidos por disparos de teclas para videos de formato corto no es práctica y puede no tener éxito debido a su ya breve duración de reproducción. Además, el tiempo de reproducción de videos de formato largo, particularmente películas o videos deportivos, puede superar los 90 minutos. Para tales categorías de video, las técnicas de resumen basadas en tomas de teclas son más útiles y eficientes para brindar a los usuarios una breve descripción general.

La naturaleza subjetiva del resumen de video lo convierte en una tarea desalentadora. Esto se debe al hecho de que cada usuario tiene gustos distintos, incluso cuando se trata de contenido de video comparable. Este problema se puede resolver con precisión con la ayuda del enfoque de resumen de video personalizado13. El objetivo del algoritmo es proporcionar a cada usuario contenido que se adapte a sus intereses. Sin embargo, los resúmenes de video adaptados con duraciones ideales para nuevos videos de formato largo (como eventos deportivos) no están disponibles. Los métodos actuales14,15 requieren recursos informáticos masivos para evaluar los datos de preferencias de los clientes y las secuencias de video con el fin de proporcionar resúmenes individualizados en tiempo real. Se pueden obtener resúmenes de video personalizados en tiempo real desde servidores dedicados centralizados. Babu Veesam y Satish16 discutieron un análisis taxonómico exhaustivo de todas las principales estrategias de resumen de video que demuestran enfoques ampliamente utilizados que comprimen efectivamente grandes cantidades de datos de video. La revisión clasifica y evalúa las metodologías en relación con sus enfoques fundamentales, que incluyen estrategias de integración multimodal, marcos de aprendizaje profundo y métodos basados en agrupación. Entre los métodos más destacados se encuentran el marco KDAN, que utiliza la destilación de conocimiento para el resumen supervisado, y el método SVS_MCO, que utiliza la agrupación DBSCAN optimizada por el algoritmo de algas artificiales. Además, la revisión proporciona modelos sofisticados como la Red Recurrente Audiovisual y el Aprendizaje Profundo de Buitres Africanos basado en Consultas, que han demostrado ser altamente efectivos en la gestión de problemas de resumen de video dinámicos y multimodales.

La inclusión de un marco multimodal de red neuronal recurrente AlexNet (GARNN-AE-LSTM) para el resumen de video es lo que hace que este estudio sea novedoso. Este enfoque mejora la precisión y la eficiencia del proceso de resumen de video al reducir la redundancia con PCA con compensación de movimiento, capturar la dinámica temporal con GRU y optimizar la selección de características espaciales utilizando métodos de compuerta. Con el fin de proporcionar el resumen de video de manera eficiente con complejidad reducida, este documento contribuye de la siguiente manera: (i) Resumen de video multimodal: propuso un marco para generar resúmenes de video concisos mediante la integración de información visual y auditiva utilizando un modelo GARNN preentrenado que combina RNN cerradas y AlexNet. (ii) AlexNet cerrado para el refinamiento de características: Introdujo un novedoso mecanismo cerrado (puerta sigmoide) en la capa densa de AlexNet para filtrar características espaciales irrelevantes, mejorando así la extracción de características visuales de alto nivel. La integración con RNN permite un modelado temporal efectivo de dependencias de cuadro a cuadro. (iii) Eliminación de tramas redundantes: Se desarrolló un enfoque basado en la varianza compensada por movimiento para eliminar fotogramas idénticos o similares antes de la detección de fotogramas clave, seguido de una reducción opcional de la dimensionalidad basada en PCA para una representación eficiente de las características. (iv) Detección precisa de fotogramas clave: Empleó un clasificador LSTM basado en codificador adversario para el modelado temporal, logrando una puntuación F promedio de 0.985, demostrando así una precisión de resumen superior en comparación con los enfoques de referencia. (v) Eficiencia sobre modelos de transformadores: Mostró que el modelo GARNN propuesto es computacionalmente eficiente, donde AlexNet captura de manera efectiva las características espaciales, las dependencias secuenciales de los modelos RNN y el mecanismo de compuerta filtra los fotogramas sin importancia, superando a las alternativas basadas en transformadores en la selección y resumen de características.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio propone un método de resumen de video supervisado multimodal que entra en la categoría de resumen de video genérico, comúnmente conocido como video skimming. Esto incluye técnicas que se concentran en encontrar segmentos clave de un video más grande para crear una versión condensada temporalmente del mismo. Este estudio sugiere una técnica supervisada para analizar el flujo de video en secciones de 1 s que incluyen representaciones de audio y visuales, como se muestra en la Figura 1. Estos segmentos se clasifican como "poco interesantes" o "informativos". A diferencia de los datos sintéticos o simulados, los "datos reales" ahora se refieren a los conjuntos de datos de video reales utilizados para los experimentos. Los segmentos de video que proporcionan señales audiovisuales importantes necesarias para el resumen, como el movimiento alto, la voz o las transiciones de escena, se denominan "segmentos informativos". Las partes "poco interesantes" se definen como marcos repetitivos o redundantes que no agregan nada nuevo a la sinopsis.

Los videos de entrada se segmentan en cuadros y las características multimodales se extraen de cada cuadro utilizando el modelo GARNN propuesto. Las características de audio y video se fusionan y se introducen como entrada en la fase de reducción de dimensionalidad, donde se eliminan los fotogramas redundantes para su posterior procesamiento. Por último, el AELSTM propuesto se aplica a los datos reducidos para el resumen de vídeo. Para lograr esto, se utiliza un clasificador binario supervisado entrenado con representaciones de características de las modalidades visual, auditiva o mixta, llamadas multimodalidades.

figure-protocol-1
Figura 1: Descripción general del modelo de resumen de video propuesto. La canalización incluye la extracción de características multimodales, la reducción de dimensionalidad y la generación de resúmenes mediante AELSTM. Haga clic aquí para ver una versión más grande de esta figura.

Conjunto de datos
La efectividad de las soluciones sugeridas se determina utilizando conjuntos de datos VSUMM17 y SumMe18 , un par de conjuntos de datos de referencia en el resumen de video estático. Las características de CNN creadas con AlexNet con LSTM y datos reales se encuentran entre los conjuntos de datos. Los datos y conjuntos de datos reales son accesibles al público en general19. Las 50 películas en el conjunto de datos de VSUMM son de sitios web como YouTube y abarcan 110 minutos a 30 cuadros por segundo. Vienen en una variedad de géneros, que incluyen dibujos animados, noticias, deportes, publicidad, series de televisión y videos caseros. Entre estos, 25 videos consisten en días festivos, festivales y deportes que se obtuvieron del conocido sitio de YouTube y se etiquetaron con al menos 15 resúmenes generados por humanos (390 en total) conforman el conjunto de datos de resumen de video "SumMe"20 . El rango de duración de los videos es de 1 a 6 minutos.

El video original se convierte en imágenes RGB, que se alimentan como entrada en el modelo GARNN propuesto previamente entrenado para la extracción de características. Este modelo consta de AlexNet y una RNN cerrada. El número original de características es 64 y las características de AlexNet tienen 4100 características.

Extracción de características basada en Gated-AlexNet-RNN propuesta
Se han utilizado los modos de información visual y de audio para resumir los videos. Para lograr una representación de características en ambas modalidades, identificamos características hechas a mano que se utilizan a menudo en tareas de clasificación y agrupación de audio y visual, como recuperación de imágenes, clasificación de video, análisis de escenas auditivas y recuperación de información musical. El objetivo era incluir tantos componentes visuales y de audio instructivos como fuera posible. La Figura 2 muestra una ilustración conceptual del proceso utilizado para extraer características para las modalidades de audio y visual.

figure-protocol-2
Figura 2: Extracción de características multimodal basada en GARNN propuesta. Las características de las modalidades visual y de audio se extraen mediante componentes AlexNet y GARNN. Haga clic aquí para ver una versión más grande de esta figura.

Cerrado- AlexNetRNN: (GARNN)
Para el análisis de imágenes virtuales, CNN es un modelo DL21 popular. En general, CNN usa la imagen como entrada y la divide en varios grupos. Las neuronas de entrada, una secuencia de capas con agrupación convolucional, capas que están completamente vinculadas y capas normalizadoras conforman su estructura22. Las neuronas de la capa de convolución están conectadas a la capa anterior a través de una región estrecha. Las capas debajo de ellos están completamente conectadas a las neuronas activadoras de las capas completamente unidas. La ecuación (1) representa la propagación hacia adelante y hacia atrás de una función completamente conectada.

figure-protocol-3(1)

figure-protocol-4(2)

Donde figure-protocol-5 es la activación de lai-ésima neurona en laenésima capa es, figure-protocol-6 es el gradiente de lai-ésima neurona en la1-ésima capa, figure-protocol-7 es el peso de lai-ésima neurona en la capa l+1. Numerosos diseños de CNN han surgido como resultado de los recientes avances de investigación. AlexNet se ha utilizado en este trabajo.

La arquitectura de AlexNet, que se muestra en la Figura 3, refleja un diseño meticuloso y bien estructurado. Tres capas completamente conectadas y cinco capas de convolución conforman sus ocho capas de aprendizaje. Las etiquetas de clase se producen introduciendo el resultado de la última capa en la función que activa softmax. Los kernels de segundo, cuarto o quinto nivel están conectados a sus niveles anteriores a través del uso compartido de GPU. Los kernels de segunda y tercera capa están completamente conectados entre sí. La capa de normalización está conectada a las capas de agrupación máxima después del primer y segundo nivel. ReLU está vinculado a todas las capas de aprendizaje.

figure-protocol-8
Figura 3: Arquitectura de AlexNet. Se utilizan cinco capas convolucionales y tres capas completamente conectadas para procesar datos visuales en el modelo de resumen. Haga clic aquí para ver una versión más grande de esta figura.

La red troncal principal para el trabajo fue un GARNN de capa densa. Hay tres capas en la RNN gruesa. Con 80 neuronas en la segunda capa y 170 en la primera, se compone de dos capas totalmente conectadas (fc). Las siguientes capas son la normalización por lotes y la eliminación. La fc, la última capa, está formada por tres neuronas y se utiliza para dividir la imagen. La capa densa, que viene después del LSTM, divide el área alrededor del tumor cerebral. AlexNet proporciona las características de la capa LSTM. El conjunto de datos tiene un máximo de 20 segmentos, que es igual al número total de secuencias que se han declarado. La primera capa de GARNN contiene 100 unidades ocultas, mientras que la tercera capa contiene 125 unidades ocultas.

El mecanismo de activación se incorporó a la capa densa (completamente vinculada) de AlexNet en nuestro marco GARNN-AE-LSTM sugerido. Los mapas de características convolucionales a menudo son procesados por AlexNet y enviados directamente a capas completamente conectadas para su clasificación. Todas las características espaciales recuperadas, incluidos los patrones redundantes o menos significativos, se tratan por igual mediante este método. Abordamos esto introduciendo una función de compuerta que funciona como un filtro de características y se basa en un sigmoide. En términos matemáticos, un vector de puerta g = σ(wX) + b, modula la salida de la capa densa, con σ que representa la función sigmoide. Durante el entrenamiento, esta puerta aprende a dar varios pesos de activación de funciones que van de 0 a 1. Son: (i) los valores de puerta bajos suprimen características irrelevantes (por ejemplo, ruido de fondo o texturas redundantes). (ii) Los valores de puerta más altos resaltan características discriminativas (como regiones importantes del objeto o patrones sensibles al movimiento). (iii) Este conjunto de características mejoradas es utilizado por el componente RNN, lo que le permite capturar mejor las dependencias temporales sin desviarse por información espacial irrelevante. iv) La retropropagación se utiliza para cambiar los parámetros de activación durante el entrenamiento en conjunto con AlexNet y la RNN. Esto implica que, con el tiempo, el modelo aprende qué aspectos son más importantes para resumir además de qué características extraer.

En la Figura 4, la variable X denota los datos de entrada, C denota la celda y H denota el estado oculto.

figure-protocol-9
Figura 4: Modelo de arquitectura de red neuronal recurrente cerrada (GARNN). El GARNN integra la normalización por lotes, la eliminación y múltiples capas densas para un modelado de secuencia eficaz. Haga clic aquí para ver una versión más grande de esta figura.

En cada bloque, los pesos respectivos, como Iw, Rw y sesgo llamado entrada, peso recurrente y sesgo, respectivamente, se han utilizado como en la Ecuación (3) a la Ecuación (5)

figure-protocol-10(3)

figure-protocol-11(4)

figure-protocol-12(5)

En una cierta marca de tiempo t, el estado de la celda se denota como en la Ecuación (6)

figure-protocol-13(6)

Donde figure-protocol-14 el producto de Hadamard y el estado de unidad oculta se denotan como en la Ecn (7)

figure-protocol-15(7)

Por lo tanto, utiliza el módulo de análisis de audio py para calcular las características de audio a nivel de segmento para cada clip de audio que se ha extraído del archivo de video correspondiente, utilizando ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. Las características extraídas se enumeran en la Tabla 1.  De acuerdo con este proceso, la extracción de características de audio se realiza inicialmente de forma temporal. La parte final de la representación se compone de estadísticas de características de nivel de segmento que se calculan en un segundo nivel. Específicamente, se realiza un procesamiento a corto plazo para cada segmento de la señal de audio, lo que da como resultado el cálculo de 68 características a corto plazo (34 características y 34 deltas) para cada ventana a nivel de segmento, que puede superponerse o no superponerse. Hemos utilizado una variedad de características visuales para transmitir el contenido de la información visual, además de extraer elementos auditivos de la señal de sonido de cada video. Se prevé que esta modalidad sea crucial para el proceso de sumario. La biblioteca multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) se ha utilizado para extraer características que reflejan aspectos visuales de un video con el fin de extraer estos elementos visuales. En concreto, los 88 elementos visuales que se enumeran a continuación se toman del fotograma correspondiente cada 0,2 s. En esto, las características multimodales se fusionan y se utilizan un total de 59 características para un análisis posterior de la clasificación del video como informativo y no interesante al hacer el resumen del video.

Reducción de características mediante PCA
La dimensión de las características de este estudio se ha reducido mediante la aplicación del análisis de componentes principales (PCA). Las características básicas se transforman en características clave para potenciar su protagonismo e importancia. La ACP ha sido ampliamente utilizada por numerosos investigadores en una variedad de dominios24. Los valores propios se utilizan para determinar las propiedades. Se seleccionan las entidades de valores propios más altos, mientras que se eliminan las entidades de valores propios más bajas.

Después de la eliminación de marcos superfluos, PCA se utiliza en este estudio como un paso opcional de reducción de características. PCA suprime el ruido y la información redundante comprimiendo los vectores de características de alta dimensión producidos por GARNN en un pequeño subespacio. Esto aumenta la eficiencia computacional del AE-LSTM al tiempo que garantiza que la detección de fotogramas clave esté dominada por las pistas visuales y auditivas más discriminativas. Para equilibrar la escalabilidad y la precisión en el resumen de video, PCA se utiliza como una herramienta útil. El algoritmo (Algoritmo 1) se proporciona como Archivo complementario 1.

Cualquier trama que sea exactamente igual o sorprendentemente comparable a la trama anterior se considera redundante. Es obvio que cambiar la velocidad de fotogramas puede tener un impacto en la proporción de fotogramas de video eliminados. Más específicamente, a medida que aumentan las velocidades de fotogramas, también aumenta la similitud entre fotogramas sucesivos, lo que lleva a que se elimine un mayor porcentaje de fotogramas. Ahora, las características de dimensionalidad reducida se utilizan para entrenar el modelo de ML, que se denomina modelo AE-LSTM adversario.

Formación con AELSTM
Una red neuronal llamada GAN25 se compone de dos subredes rivales: i) una red "generadora" (G) que crea datos que se asemejan a una distribución desconocida, y ii) una red "discriminadora" (D) que distingue entre las muestras creadas y las de las observaciones reales. El objetivo es encontrar un generador que maximice la probabilidad de que el discriminador cometa un error mientras se ajusta a la distribución real de los datos.

Suponga que X es la entrada y E es el ruido de entrada anterior, X'= g(E) es la muestra generada. Usando la optimización minimax, el aprendizaje se formula:

figure-protocol-16(8)

Donde D está calificado para obtener la probabilidad correcta de la clasificación. Los componentes de nuestro modelo de entrenamiento desarrollado se muestran en la Figura 5. El selector LSTM elige el subconjunto de fotogramas de la secuencia de vídeo de entrada X. Los fotogramas seleccionados se convierten en la característica de longitud fija E utilizando el codificador-LSTM, seguida de la reconstrucción de vídeo X' utilizando el decodificador-LSTM. La clasificación de X' en video real o clase de resumen se realiza mediante el discriminador-LSTM. En este estudio, AE-LSTM se utiliza para el resumen de video con estructura GAN para resúmenes de video eficientes, diversos y estructurados. El AE puede eliminar los cambios de fondo innecesarios, y el LSTM puede detectar las transiciones de escena en lugar de tratar los fotogramas como imágenes, y la GAN, el generador puede resumir el video y el discriminador garantiza que el resumen sea diverso

figure-protocol-17
Figura 5: Arquitectura del modelo de resumen AELSTM. Incluye Selector-LSTM, Encoder-LSTM, Decoder-LSTM y Discriminator-LSTM para optimizar los resúmenes de video a través del entrenamiento adversario. Haga clic aquí para ver una versión más grande de esta figura.

Al proporcionar las características de GARNN para cada fotograma en el video de entrada X llamado figure-protocol-18 , el resumidor utiliza el selector LSTM para elegir el subconjunto de fotogramas, y el codificador codifica los fotogramas como E seguido por el decodificador que reconstruye el video como X' en cada fotograma xt. El selector utiliza la puntuación de importancia al seleccionar el marco. Las características vienen dadas por el valor de peso utilizando las puntuaciones y, a continuación, pasan al codificador. Para cada fotograma con puntuación st = 1, el subconjunto solo es recibido por el codificador. El discriminador elige las clases como originales o resumen estimando la distancia entre X y X' y asignando las etiquetas. En este caso, el discriminador calcula el error entre los vídeos originales y de resumen. El algoritmo 2 (archivo complementario 2) denota el resumen del entrenamiento de AELSTM para el resumen de vídeo.

Post-procesamiento – Resumen de video
Los clasificadores a nivel de segmento pueden producir resúmenes de video una vez que han sido entrenados. Para lograrlo, hay tres pasos involucrados: (i) Determine las características de audio, visuales o combinadas de cada segmento de video. (ii) Clasifique cada segmento de video utilizando el clasificador de audio, visual o de fusión apropiado. (iii) Para evitar errores evidentes, procese posteriormente las predicciones ordenadas del clasificador.

Para satisfacer esta demanda, se ha desarrollado una tubería que consta de dos filtros distintos para el paso de posprocesamiento. La matriz de entrada se somete primero a un filtro mediano de longitud N1 que utiliza ventanas locales para suavizar las predicciones del clasificador secuencial. Las predicciones finales se determinan mediante un filtrado duro utilizando un método sencillo que mantiene una serie de predicciones consecutivamente positivas (segmentos informativos) si se incluyen al menos N2 segmentos en esa secuencia. Dicho de otra manera, ese criterio requiere que un segmento instructivo dure al menos N2 segundos.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La extracción de características basada en GARNN propuesta y el resumen de video basado en AGLSTM de videos largos se experimentaron en dos conjuntos de datos, a saber, VSUMM y SumMe. Esta sección analiza los resultados experimentales y la comparación con los enfoques convencionales. Para el discriminador LSTM, empleamos un LSTM de dos capas que tiene 1024 unidades ocultas en cada capa. Para encoder_LSTM y decoder_LSTM, respectivamente, empleamos dos LSTM de dos capas que tienen 2048 unidades ocultas en cada capa. Se dem...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En este estudio, el resumen de video de videos largos se presenta utilizando modelos multimodales eficientes de ML y DL, que utilizan modalidades de audio, imagen y visual de datos generados a partir de los datos de entrada. El clasificador binario está entrenado para aprender la discriminación entre los segmentos importantes que son la parte de resumen producida y los segmentos "no importantes" que se descartan. El modelo se entrena con conjuntos de datos como SumMe y VSUMM, y la escala...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de intereses.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen a la Escuela de Televisión Dr. de la Universidad de Cine y Televisión de Sichuan por proporcionar las instalaciones de laboratorio para realizar el estudio de investigación.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
AlexNet (modelo preentrenado)MATLAB / PyTorchPyTorch Hub — Modelo preentrenado de AlexNet: https://pytorch.org/hub/pytorch_vision_alexnet/Se utiliza para la extracción de características visuales
FFmpegFFmpeg.orghttps://ffmpeg.org/Extracción de audio de vídeo
Modelo basado en GRNNImplementación personalizadaBiblioteca " Neupy" implementa GRNN: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlSe utiliza para la fusión de características multimodales
LSTM (memoria a corto plazo)PyTorchhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlUtilizado en selectores, codificadores, decodificadores
Multimodal_movie_analysis libGitHubhttps://github.com/tyiannak/multimodal_movie_analysisPara la extracción de características visuales
NumPyFundación de software Pythonhttps://pypi.org/project/numpy/Cálculo numérico y operaciones matriciales
PCA (Análisis de componentes principales)Scikit-learnhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlReducción de dimensionalidad
Análisis de audio de PyAGitHubhttps://github.com/tyiannak/pyaudioanalysisExtracción de funciones de audio
PyTorchFundación PyTorchhttps://pytorch.org/Marco de aprendizaje profundo
Conjunto de datos SumMeConjunto de datos públicohttps://gyglim.github.io/me/vsum/index.htmlConjunto de datos de resumen de vídeo de referencia
Conjunto de datos VSUMMConjunto de datos públicohttp://www.vision.ime.usp.br/~creativision/vsumm/Conjunto de datos de resumen de vídeo de referencia

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Unidades Recurrentes CompuertasDetecci n de Fotogramas ClaveExtracci n de Caracter sticasCompensaci n de MovimientoReducci n por PCACodificador AdversarioModelado TemporalPuntuaci n F1

Artículos relacionados