$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo propõe um método de resumo de vídeo supervisionado multimodal que se enquadra na categoria de resumo de vídeo genérico, comumente chamada de skimming de vídeo. Isso inclui técnicas que se concentram em encontrar segmentos-chave de um vídeo maior para criar uma versão temporalmente condensada dele. Este estudo sugere uma técnica supervisionada para analisar o fluxo de vídeo em seções de 1 s que incluem representações de áudio e visuais, conforme mostrado na Figura 1. Esses segmentos são então categorizados como "desinteressantes" ou "informativos". Ao contrário de dados sintéticos ou simulados, "dados reais" agora se referem aos conjuntos de dados de vídeo reais utilizados para experimentos. Os segmentos de vídeo que fornecem sinais audiovisuais importantes necessários para o resumo - como alto movimento, voz ou transições de cena - são chamados de "segmentos informativos". Partes "desinteressantes" são definidas como quadros repetitivos ou redundantes que não acrescentam nada de novo à sinopse.
Os vídeos de entrada são segmentados em quadros e os recursos multimodais são extraídos de cada quadro usando o modelo GARNN proposto. Os recursos de áudio e visual são fundidos e alimentados como entrada na fase de redução de dimensionalidade, onde os quadros redundantes são removidos para processamento posterior. Finalmente, o AELSTM proposto é aplicado aos dados reduzidos para resumo de vídeo. Um classificador binário supervisionado treinado com representações de recursos das modalidades visual, de áudio ou mistas, chamadas multimodalidades, é usado para conseguir isso.

Figura 1: Visão geral do modelo de resumo de vídeo proposto. O pipeline inclui extração de recursos multimodais, redução de dimensionalidade e geração de resumo usando AELSTM. Clique aqui para ver uma versão maior desta figura.
Dataset
A eficácia das soluções sugeridas é determinada usando os conjuntos de dados VSUMM17 e SumMe18 , um par de conjuntos de dados de referência em resumo de vídeo estático. Os recursos da CNN criados usando AlexNet com LSTM e dados reais estão entre os conjuntos de dados. Os dados reais e conjuntos de dados são acessíveis ao público em geral19. Os 50 filmes no conjunto de dados VSUMM são de sites como o YouTube e abrangem 110 minutos a 30 quadros por segundo. Eles vêm em uma variedade de gêneros, incluindo desenhos animados, notícias, esportes, publicidade, séries de TV e vídeos caseiros. Entre estes, 25 vídeos consistem em feriados, festivais e esportes que foram obtidos do conhecido site do YouTube e marcados com pelo menos 15 resumos gerados por humanos (390 no total) compõem o conjunto de dados de resumo de vídeo "SumMe"20 . O intervalo de duração dos vídeos é de 1 a 6 minutos.
O vídeo original é convertido em imagens RGB, que são alimentadas como entrada no modelo GARNN proposto pré-treinado para extração de recursos. Este modelo consiste em AlexNet e um RNN fechado. O número original de recursos é 64 e os recursos do AlexNet têm 4100 recursos.
Proposta de extração de recursos baseada em Gated-AlexNet-RNN
Os modos visual e de áudio da informação foram usados para resumir os vídeos. Para obter uma representação de recursos em ambas as modalidades, identificamos recursos artesanais que são frequentemente usados em tarefas de agrupamento e classificação de áudio e visual, como recuperação de imagens, classificação de vídeo, análise de cena auditiva e recuperação de informações musicais. O objetivo era incluir o maior número possível de componentes visuais e de áudio instrucionais. A Figura 2 mostra uma ilustração conceitual do processo usado para extrair recursos para as modalidades de áudio e visual.

Figura 2: Proposta de extração de recursos multimodal baseada em GARNN. Os recursos das modalidades visual e de áudio são extraídos usando os componentes AlexNet e GARNN. Clique aqui para ver uma versão maior desta figura.
Fechado- AlexNetRNN: (GARNN)
Para análise de imagem virtual, a CNN é um modelo DL popular21. Em geral, a CNN usa a imagem como entrada e a divide em vários grupos. Neurônios de entrada, uma sequência de camadas com agrupamento convolucional, camadas que estão completamente ligadas e camadas normalizadoras compõem sua estrutura22. Os neurônios da camada de convolução estão conectados à camada anterior por meio de uma região estreita. As camadas abaixo deles estão totalmente conectadas aos neurônios ativadores das camadas totalmente ligadas. A Eqn (1) representa a propagação para frente e para trás de uma função totalmente conectada.
(1)
(2)
Onde
está a ativação doi-ésimo neurônio na lésima camada,
é o gradiente do iésimo neurônio na lésima camada,
é o peso do iésimo neurônio na l + 1ª camada. Numerosos projetos da CNN surgiram como resultado de recentes avanços de pesquisa. AlexNet foi usado neste trabalho.
A arquitetura do AlexNet, mostrada na Figura 3, reflete um design meticuloso e bem estruturado. Três camadas completamente conectadas e cinco camadas de convolução compõem suas oito camadas de aprendizado. Os rótulos de classe são produzidos alimentando o resultado da última camada na função que ativa o softmax. Os kernels de segunda, quarta ou quinta camada são conectados aos seus níveis antecedentes por meio do compartilhamento de GPU. Os kernels da segunda e terceira camadas estão totalmente conectados uns aos outros. A camada de normalização é conectada às camadas de pool máximo após o primeiro e o segundo níveis. O ReLU está vinculado a todas as camadas de aprendizagem.

Figura 3: Arquitetura do AlexNet. Cinco camadas convolucionais e três camadas totalmente conectadas são usadas para processar dados visuais no modelo de resumo. Clique aqui para ver uma versão maior desta figura.
A rede de backbone primária para o trabalho era um GARNN de camada densa. Existem três camadas no RNN espesso. Com 80 neurônios na segunda camada e 170 na primeira, é composto por duas camadas totalmente conectadas (fc). As camadas a seguir são normalização e abandono em lote. O fc, a última camada, é composta por três neurônios e é usada para dividir a imagem. A camada densa, que vem após o LSTM, divide a área ao redor do tumor cerebral. AlexNet fornece os recursos da camada LSTM. O conjunto de dados tem no máximo 20 fatias, o que é igual ao número total de sequências que foram declaradas. A primeira camada do GARNN contém 100 unidades ocultas, enquanto a terceira camada contém 125 unidades ocultas.
O mecanismo de gating foi incorporado à camada densa (completamente ligada) do AlexNet em nossa estrutura GARNN-AE-LSTM sugerida. Os mapas de feições convolucionais são frequentemente processados pelo AlexNet e enviados diretamente para camadas totalmente conectadas para classificação. Todas as características espaciais recuperadas, incluindo padrões redundantes ou menos significativos, são tratadas igualmente por este método. Abordamos isso introduzindo uma função de gating que funciona como um filtro de recursos e é baseada em um sigmoide. Em termos matemáticos, um vetor de porta g = σ(wX) + b, modula a saída da camada densa, com σ representando a função sigmóide. Durante o treinamento, este portão aprende a dar vários pesos de ativação de recursos que variam de 0 a 1. São eles: (i) valores de porta baixos suprimem recursos irrelevantes (por exemplo, ruído de fundo ou texturas redundantes). (ii) Valores de porta mais altos destacam características discriminativas (como regiões de objetos importantes ou padrões sensíveis ao movimento). (iii) Esse conjunto de recursos aprimorado é então usado pelo componente RNN, o que permite capturar melhor as dependências temporais sem ser desviado por informações espaciais irrelevantes. (iv) A retropropagação é usada para alterar os parâmetros de gating durante o treinamento em conjunto com o AlexNet e o RNN. Isso implica que, com o tempo, o modelo aprende quais aspectos são mais importantes para resumir, além de quais recursos extrair.
Na Figura 4, a variável X denota os dados de entrada, C denota a célula e H denota o estado oculto.

Figura 4: Modelo de arquitetura de rede neural recorrente fechada (GARNN). O GARNN integra normalização em lote, dropout e várias camadas densas para modelagem de sequência eficaz. Clique aqui para ver uma versão maior desta figura.
Em cada bloco, os respectivos pesos, como Iw, Rw e viés chamados de entrada, peso recorrente e viés, respectivamente, foram utilizados como na Eqn (3) a Eqn (5)
(3)
(4)
(5)
Em um determinado carimbo de data/hora t, o estado da célula é denotado como na Eqn (6)
(6)
Onde
o produto de Hadamard e o estado da unidade oculta são denotados como na Eqn (7)
(7)
Assim, ele utiliza o módulo de análise de áudio py para calcular as características de áudio em nível de segmento para cada clipe de áudio extraído do arquivo de vídeo correspondente, utilizando ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. Os recursos extraídos estão listados na Tabela 1. De acordo com esse processo, a extração de recursos de áudio é feita inicialmente temporariamente. A parte final da representação é composta por estatísticas de recursos no nível do segmento que são calculadas em um segundo nível. Especificamente, um processamento de curto prazo é realizado para cada segmento do sinal de áudio, resultando no cálculo de 68 recursos de curto prazo (34 recursos e 34 deltas) para cada janela de nível de segmento, que pode ser sobreposta ou não sobreposta. Usamos uma variedade de características visuais para transmitir o conteúdo das informações visuais, além de extrair elementos auditivos do sinal sonoro de cada vídeo. Prevê-se que esta modalidade seja crucial para o processo de resumo. A biblioteca multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) foi usada para extrair recursos que refletem aspectos visuais de um vídeo para extrair esses elementos visuais. Especificamente, os 88 elementos visuais listados abaixo são retirados do quadro correspondente a cada 0,2 s. Neste, os recursos multimodais são fundidos e um total de 59 recursos são usados para uma análise mais aprofundada da classificação do vídeo como informativo e não interessante, fazendo o resumo do vídeo.
Redução de recursos usando PCA
A dimensão das características deste estudo foi reduzida pela aplicação da análise de componentes principais (PCA). As características básicas são transformadas em características-chave para aumentar sua proeminência e importância. A ACP tem sido amplamente utilizada por inúmeros pesquisadores em uma variedade de domínios24. Os autovalores são usados para determinar as propriedades. Os recursos de valor próprio mais alto são selecionados, enquanto os recursos de valor próprio mais baixo são removidos.
Após a remoção de quadros supérfluos, o PCA é usado neste estudo como uma etapa opcional de redução de recursos. O PCA suprime o ruído e as informações redundantes comprimindo os vetores de recursos de alta dimensão produzidos pelo GARNN em um pequeno subespaço. Isso aumenta a eficiência computacional do AE-LSTM, garantindo que a detecção de quadros-chave seja dominada pelas pistas visuais e auditivas mais discriminativas. Para equilibrar escalabilidade e precisão no resumo de vídeo, o PCA é utilizado como uma ferramenta útil. O algoritmo (Algoritmo 1) é fornecido como Arquivo Suplementar 1.
Qualquer quadro que seja exatamente igual ou surpreendentemente comparável ao quadro anterior é considerado redundante. É óbvio que alterar a taxa de quadros pode ter um impacto na proporção de quadros de vídeo removidos. Mais especificamente, à medida que as taxas de quadros aumentam, a semelhança entre quadros sucessivos também aumenta, levando a uma porcentagem maior de quadros sendo removidos. Agora, os recursos de dimensionalidade reduzida são usados para treinar o modelo de ML, que é chamado de modelo AE-LSTM adversário.
Treinamento usando AELSTM
Uma rede neural chamada GAN25 é composta de duas sub-redes rivais: i) uma rede "geradora" (G) que cria dados que se assemelham a uma distribuição desconhecida e ii) uma rede "discriminadora" (D) que distingue entre as amostras criadas e aquelas de observações reais. O objetivo é encontrar um gerador que maximize a probabilidade de o discriminador cometer um erro enquanto ajusta a distribuição real de dados.
Suponha que X é a entrada e E é o ruído de entrada anterior, X'= g(E) é a amostra gerada. Usando a otimização minimax, o aprendizado é formulado:
(8)
Onde D é qualificado para obter a probabilidade correta da classificação. Os componentes do nosso modelo de treinamento desenvolvido são mostrados na Figura 5. O seletor LSTM escolhe o subconjunto de quadros da sequência de vídeo de entrada X. Os quadros selecionados são convertidos em recurso de comprimento fixo E usando o codificador-LSTM, seguido pela reconstrução de vídeo X' usando o decodificador-LSTM. A classificação de X' em vídeo real ou classe de resumo é realizada pelo discriminador-LSTM. Neste estudo, o AE-LSTM é usado para resumo de vídeo com estrutura GAN para resumos de vídeo eficientes, diversificados e estruturados. O AE pode eliminar as alterações desnecessárias de fundo, e o LSTM pode detectar as transições de cena em vez de tratar os quadros como imagens, e o GAN, o gerador pode resumir o vídeo e o discriminador garante que o resumo seja diversificado

Figura 5: Arquitetura do modelo de resumo AELSTM. Inclui Selector-LSTM, Encoder-LSTM, Decoder-LSTM e Discriminator-LSTM para otimizar resumos de vídeo por meio de treinamento contraditório. Clique aqui para ver uma versão maior desta figura.
Ao fornecer os recursos GARNN para cada quadro no vídeo de entrada X chamado
, o resumidor utiliza o seletor LSTM para escolher o subconjunto de quadros, e o codificador codifica os quadros como E seguido pelo decodificador reconstruindo o vídeo como X' em cada quadro xt. O seletor utiliza a pontuação de importância ao selecionar o quadro. Os recursos são dados pelo valor do peso usando as pontuações e, em seguida, passam para o codificador. Para cada quadro com pontuação st = 1, o subconjunto é recebido apenas pelo codificador. O discriminador escolhe as classes como originais ou resumidas estimando a distância entre X e X' e atribuindo os rótulos. Nesse caso, o discriminador calcula o erro entre os vídeos originais e de resumo. O algoritmo 2 (Arquivo Suplementar 2) denota o resumo do treinamento do AELSTM para resumo de vídeo.
Pós-processamento – Resumo de vídeo
Os resumos em vídeo podem ser produzidos por classificadores em nível de segmento depois de treinados. Três etapas estão envolvidas para conseguir isso: (i) Determine as características de áudio, visual ou combinadas de cada segmento de vídeo. (ii) Classifique cada segmento de vídeo usando o classificador de áudio, visual ou fusão apropriado. (iii) Para evitar erros gritantes, pós-processe as previsões ordenadas do classificador.
Para atender a essa demanda, foi desenvolvido um pipeline composto por dois filtros distintos para a etapa de pós-processamento. A matriz de entrada é primeiro submetida a um filtro mediano de comprimento N1 utilizando janelas locais para suavizar as previsões do classificador sequencial. As previsões finais são então determinadas por filtragem rígida usando um método direto que mantém uma série de previsões consecutivamente positivas (segmentos informativos) se pelo menos N2 segmentos forem incluídos nessa sequência. Dito de outra forma, esse critério exige que um segmento instrutivo dure pelo menos N2 segundos.