$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio propone un método de resumen de video supervisado multimodal que entra en la categoría de resumen de video genérico, comúnmente conocido como video skimming. Esto incluye técnicas que se concentran en encontrar segmentos clave de un video más grande para crear una versión condensada temporalmente del mismo. Este estudio sugiere una técnica supervisada para analizar el flujo de video en secciones de 1 s que incluyen representaciones de audio y visuales, como se muestra en la Figura 1. Estos segmentos se clasifican como "poco interesantes" o "informativos". A diferencia de los datos sintéticos o simulados, los "datos reales" ahora se refieren a los conjuntos de datos de video reales utilizados para los experimentos. Los segmentos de video que proporcionan señales audiovisuales importantes necesarias para el resumen, como el movimiento alto, la voz o las transiciones de escena, se denominan "segmentos informativos". Las partes "poco interesantes" se definen como marcos repetitivos o redundantes que no agregan nada nuevo a la sinopsis.
Los videos de entrada se segmentan en cuadros y las características multimodales se extraen de cada cuadro utilizando el modelo GARNN propuesto. Las características de audio y video se fusionan y se introducen como entrada en la fase de reducción de dimensionalidad, donde se eliminan los fotogramas redundantes para su posterior procesamiento. Por último, el AELSTM propuesto se aplica a los datos reducidos para el resumen de vídeo. Para lograr esto, se utiliza un clasificador binario supervisado entrenado con representaciones de características de las modalidades visual, auditiva o mixta, llamadas multimodalidades.

Figura 1: Descripción general del modelo de resumen de video propuesto. La canalización incluye la extracción de características multimodales, la reducción de dimensionalidad y la generación de resúmenes mediante AELSTM. Haga clic aquí para ver una versión más grande de esta figura.
Conjunto de datos
La efectividad de las soluciones sugeridas se determina utilizando conjuntos de datos VSUMM17 y SumMe18 , un par de conjuntos de datos de referencia en el resumen de video estático. Las características de CNN creadas con AlexNet con LSTM y datos reales se encuentran entre los conjuntos de datos. Los datos y conjuntos de datos reales son accesibles al público en general19. Las 50 películas en el conjunto de datos de VSUMM son de sitios web como YouTube y abarcan 110 minutos a 30 cuadros por segundo. Vienen en una variedad de géneros, que incluyen dibujos animados, noticias, deportes, publicidad, series de televisión y videos caseros. Entre estos, 25 videos consisten en días festivos, festivales y deportes que se obtuvieron del conocido sitio de YouTube y se etiquetaron con al menos 15 resúmenes generados por humanos (390 en total) conforman el conjunto de datos de resumen de video "SumMe"20 . El rango de duración de los videos es de 1 a 6 minutos.
El video original se convierte en imágenes RGB, que se alimentan como entrada en el modelo GARNN propuesto previamente entrenado para la extracción de características. Este modelo consta de AlexNet y una RNN cerrada. El número original de características es 64 y las características de AlexNet tienen 4100 características.
Extracción de características basada en Gated-AlexNet-RNN propuesta
Se han utilizado los modos de información visual y de audio para resumir los videos. Para lograr una representación de características en ambas modalidades, identificamos características hechas a mano que se utilizan a menudo en tareas de clasificación y agrupación de audio y visual, como recuperación de imágenes, clasificación de video, análisis de escenas auditivas y recuperación de información musical. El objetivo era incluir tantos componentes visuales y de audio instructivos como fuera posible. La Figura 2 muestra una ilustración conceptual del proceso utilizado para extraer características para las modalidades de audio y visual.

Figura 2: Extracción de características multimodal basada en GARNN propuesta. Las características de las modalidades visual y de audio se extraen mediante componentes AlexNet y GARNN. Haga clic aquí para ver una versión más grande de esta figura.
Cerrado- AlexNetRNN: (GARNN)
Para el análisis de imágenes virtuales, CNN es un modelo DL21 popular. En general, CNN usa la imagen como entrada y la divide en varios grupos. Las neuronas de entrada, una secuencia de capas con agrupación convolucional, capas que están completamente vinculadas y capas normalizadoras conforman su estructura22. Las neuronas de la capa de convolución están conectadas a la capa anterior a través de una región estrecha. Las capas debajo de ellos están completamente conectadas a las neuronas activadoras de las capas completamente unidas. La ecuación (1) representa la propagación hacia adelante y hacia atrás de una función completamente conectada.
(1)
(2)
Donde
es la activación de lai-ésima neurona en laenésima capa es,
es el gradiente de lai-ésima neurona en la1-ésima capa,
es el peso de lai-ésima neurona en la capa l+1. Numerosos diseños de CNN han surgido como resultado de los recientes avances de investigación. AlexNet se ha utilizado en este trabajo.
La arquitectura de AlexNet, que se muestra en la Figura 3, refleja un diseño meticuloso y bien estructurado. Tres capas completamente conectadas y cinco capas de convolución conforman sus ocho capas de aprendizaje. Las etiquetas de clase se producen introduciendo el resultado de la última capa en la función que activa softmax. Los kernels de segundo, cuarto o quinto nivel están conectados a sus niveles anteriores a través del uso compartido de GPU. Los kernels de segunda y tercera capa están completamente conectados entre sí. La capa de normalización está conectada a las capas de agrupación máxima después del primer y segundo nivel. ReLU está vinculado a todas las capas de aprendizaje.

Figura 3: Arquitectura de AlexNet. Se utilizan cinco capas convolucionales y tres capas completamente conectadas para procesar datos visuales en el modelo de resumen. Haga clic aquí para ver una versión más grande de esta figura.
La red troncal principal para el trabajo fue un GARNN de capa densa. Hay tres capas en la RNN gruesa. Con 80 neuronas en la segunda capa y 170 en la primera, se compone de dos capas totalmente conectadas (fc). Las siguientes capas son la normalización por lotes y la eliminación. La fc, la última capa, está formada por tres neuronas y se utiliza para dividir la imagen. La capa densa, que viene después del LSTM, divide el área alrededor del tumor cerebral. AlexNet proporciona las características de la capa LSTM. El conjunto de datos tiene un máximo de 20 segmentos, que es igual al número total de secuencias que se han declarado. La primera capa de GARNN contiene 100 unidades ocultas, mientras que la tercera capa contiene 125 unidades ocultas.
El mecanismo de activación se incorporó a la capa densa (completamente vinculada) de AlexNet en nuestro marco GARNN-AE-LSTM sugerido. Los mapas de características convolucionales a menudo son procesados por AlexNet y enviados directamente a capas completamente conectadas para su clasificación. Todas las características espaciales recuperadas, incluidos los patrones redundantes o menos significativos, se tratan por igual mediante este método. Abordamos esto introduciendo una función de compuerta que funciona como un filtro de características y se basa en un sigmoide. En términos matemáticos, un vector de puerta g = σ(wX) + b, modula la salida de la capa densa, con σ que representa la función sigmoide. Durante el entrenamiento, esta puerta aprende a dar varios pesos de activación de funciones que van de 0 a 1. Son: (i) los valores de puerta bajos suprimen características irrelevantes (por ejemplo, ruido de fondo o texturas redundantes). (ii) Los valores de puerta más altos resaltan características discriminativas (como regiones importantes del objeto o patrones sensibles al movimiento). (iii) Este conjunto de características mejoradas es utilizado por el componente RNN, lo que le permite capturar mejor las dependencias temporales sin desviarse por información espacial irrelevante. iv) La retropropagación se utiliza para cambiar los parámetros de activación durante el entrenamiento en conjunto con AlexNet y la RNN. Esto implica que, con el tiempo, el modelo aprende qué aspectos son más importantes para resumir además de qué características extraer.
En la Figura 4, la variable X denota los datos de entrada, C denota la celda y H denota el estado oculto.

Figura 4: Modelo de arquitectura de red neuronal recurrente cerrada (GARNN). El GARNN integra la normalización por lotes, la eliminación y múltiples capas densas para un modelado de secuencia eficaz. Haga clic aquí para ver una versión más grande de esta figura.
En cada bloque, los pesos respectivos, como Iw, Rw y sesgo llamado entrada, peso recurrente y sesgo, respectivamente, se han utilizado como en la Ecuación (3) a la Ecuación (5)
(3)
(4)
(5)
En una cierta marca de tiempo t, el estado de la celda se denota como en la Ecuación (6)
(6)
Donde
el producto de Hadamard y el estado de unidad oculta se denotan como en la Ecn (7)
(7)
Por lo tanto, utiliza el módulo de análisis de audio py para calcular las características de audio a nivel de segmento para cada clip de audio que se ha extraído del archivo de video correspondiente, utilizando ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. Las características extraídas se enumeran en la Tabla 1. De acuerdo con este proceso, la extracción de características de audio se realiza inicialmente de forma temporal. La parte final de la representación se compone de estadísticas de características de nivel de segmento que se calculan en un segundo nivel. Específicamente, se realiza un procesamiento a corto plazo para cada segmento de la señal de audio, lo que da como resultado el cálculo de 68 características a corto plazo (34 características y 34 deltas) para cada ventana a nivel de segmento, que puede superponerse o no superponerse. Hemos utilizado una variedad de características visuales para transmitir el contenido de la información visual, además de extraer elementos auditivos de la señal de sonido de cada video. Se prevé que esta modalidad sea crucial para el proceso de sumario. La biblioteca multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) se ha utilizado para extraer características que reflejan aspectos visuales de un video con el fin de extraer estos elementos visuales. En concreto, los 88 elementos visuales que se enumeran a continuación se toman del fotograma correspondiente cada 0,2 s. En esto, las características multimodales se fusionan y se utilizan un total de 59 características para un análisis posterior de la clasificación del video como informativo y no interesante al hacer el resumen del video.
Reducción de características mediante PCA
La dimensión de las características de este estudio se ha reducido mediante la aplicación del análisis de componentes principales (PCA). Las características básicas se transforman en características clave para potenciar su protagonismo e importancia. La ACP ha sido ampliamente utilizada por numerosos investigadores en una variedad de dominios24. Los valores propios se utilizan para determinar las propiedades. Se seleccionan las entidades de valores propios más altos, mientras que se eliminan las entidades de valores propios más bajas.
Después de la eliminación de marcos superfluos, PCA se utiliza en este estudio como un paso opcional de reducción de características. PCA suprime el ruido y la información redundante comprimiendo los vectores de características de alta dimensión producidos por GARNN en un pequeño subespacio. Esto aumenta la eficiencia computacional del AE-LSTM al tiempo que garantiza que la detección de fotogramas clave esté dominada por las pistas visuales y auditivas más discriminativas. Para equilibrar la escalabilidad y la precisión en el resumen de video, PCA se utiliza como una herramienta útil. El algoritmo (Algoritmo 1) se proporciona como Archivo complementario 1.
Cualquier trama que sea exactamente igual o sorprendentemente comparable a la trama anterior se considera redundante. Es obvio que cambiar la velocidad de fotogramas puede tener un impacto en la proporción de fotogramas de video eliminados. Más específicamente, a medida que aumentan las velocidades de fotogramas, también aumenta la similitud entre fotogramas sucesivos, lo que lleva a que se elimine un mayor porcentaje de fotogramas. Ahora, las características de dimensionalidad reducida se utilizan para entrenar el modelo de ML, que se denomina modelo AE-LSTM adversario.
Formación con AELSTM
Una red neuronal llamada GAN25 se compone de dos subredes rivales: i) una red "generadora" (G) que crea datos que se asemejan a una distribución desconocida, y ii) una red "discriminadora" (D) que distingue entre las muestras creadas y las de las observaciones reales. El objetivo es encontrar un generador que maximice la probabilidad de que el discriminador cometa un error mientras se ajusta a la distribución real de los datos.
Suponga que X es la entrada y E es el ruido de entrada anterior, X'= g(E) es la muestra generada. Usando la optimización minimax, el aprendizaje se formula:
(8)
Donde D está calificado para obtener la probabilidad correcta de la clasificación. Los componentes de nuestro modelo de entrenamiento desarrollado se muestran en la Figura 5. El selector LSTM elige el subconjunto de fotogramas de la secuencia de vídeo de entrada X. Los fotogramas seleccionados se convierten en la característica de longitud fija E utilizando el codificador-LSTM, seguida de la reconstrucción de vídeo X' utilizando el decodificador-LSTM. La clasificación de X' en video real o clase de resumen se realiza mediante el discriminador-LSTM. En este estudio, AE-LSTM se utiliza para el resumen de video con estructura GAN para resúmenes de video eficientes, diversos y estructurados. El AE puede eliminar los cambios de fondo innecesarios, y el LSTM puede detectar las transiciones de escena en lugar de tratar los fotogramas como imágenes, y la GAN, el generador puede resumir el video y el discriminador garantiza que el resumen sea diverso

Figura 5: Arquitectura del modelo de resumen AELSTM. Incluye Selector-LSTM, Encoder-LSTM, Decoder-LSTM y Discriminator-LSTM para optimizar los resúmenes de video a través del entrenamiento adversario. Haga clic aquí para ver una versión más grande de esta figura.
Al proporcionar las características de GARNN para cada fotograma en el video de entrada X llamado
, el resumidor utiliza el selector LSTM para elegir el subconjunto de fotogramas, y el codificador codifica los fotogramas como E seguido por el decodificador que reconstruye el video como X' en cada fotograma xt. El selector utiliza la puntuación de importancia al seleccionar el marco. Las características vienen dadas por el valor de peso utilizando las puntuaciones y, a continuación, pasan al codificador. Para cada fotograma con puntuación st = 1, el subconjunto solo es recibido por el codificador. El discriminador elige las clases como originales o resumen estimando la distancia entre X y X' y asignando las etiquetas. En este caso, el discriminador calcula el error entre los vídeos originales y de resumen. El algoritmo 2 (archivo complementario 2) denota el resumen del entrenamiento de AELSTM para el resumen de vídeo.
Post-procesamiento – Resumen de video
Los clasificadores a nivel de segmento pueden producir resúmenes de video una vez que han sido entrenados. Para lograrlo, hay tres pasos involucrados: (i) Determine las características de audio, visuales o combinadas de cada segmento de video. (ii) Clasifique cada segmento de video utilizando el clasificador de audio, visual o de fusión apropiado. (iii) Para evitar errores evidentes, procese posteriormente las predicciones ordenadas del clasificador.
Para satisfacer esta demanda, se ha desarrollado una tubería que consta de dos filtros distintos para el paso de posprocesamiento. La matriz de entrada se somete primero a un filtro mediano de longitud N1 que utiliza ventanas locales para suavizar las predicciones del clasificador secuencial. Las predicciones finales se determinan mediante un filtrado duro utilizando un método sencillo que mantiene una serie de predicciones consecutivamente positivas (segmentos informativos) si se incluyen al menos N2 segmentos en esa secuencia. Dicho de otra manera, ese criterio requiere que un segmento instructivo dure al menos N2 segundos.