Artigo de investigação

GARNN-AE-LSTM: Uma abordagem de aprendizado profundo multimodal para resumo de vídeo de alta precisão

DOI:

10.3791/69097

10 de outubro de 2025

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo propõe uma estrutura de aprendizado profundo multimodal para sumarização de vídeo, integrando recursos audiovisuais usando modelos GARNN pré-treinados. Aproveitando GRUs, AlexNet e um classificador LSTM adversário, o sistema aprimora a detecção de quadros-chave, reduz a redundância e alcança alta precisão de resumo com uma pontuação F média de 0,985.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O resumo de vídeo se concentra na criação de versões concisas de vídeos longos, preservando o conteúdo essencial. Este estudo revela uma estratégia de aprendizado de máquina multimodal que integra informações visuais e auditivas usando arquiteturas de redes neurais recorrentes pré-treinadas conhecidas como GARNN, combinando unidades recorrentes fechadas (GRUs) e AlexNet, para extrair recursos de áudio, imagem e visuais. A detecção de quadros-chave é aprimorada com a remoção de quadros redundantes e a aplicação da redução de recursos com compensação de movimento, seguida pela redução de dimensionalidade baseada em PCA opcional. Um classificador de memória de longo prazo baseado em codificador adversário (AE-LSTM) é empregado para modelagem temporal, alcançando alta precisão no resumo. Os resultados foram avaliados por meio de sensibilidade, escores F e valores preditivos positivos, e o método atingiu um escore F médio de 0,985. Um AlexNet fechado é introduzido em uma estrutura multimodal GARNN-AE-LSTM, onde a redução baseada em PCA com compensação de movimento elimina a redundância, os GRUs registram a progressão temporal e o gating ajusta a seleção de recursos espaciais, o que contribui para um sistema de resumo de vídeo mais preciso e eficiente. A pontuação F1 aprimorada demonstra a eficácia do modelo na geração de precisão em resumos de vídeo, criando um vídeo significativo. Essa abordagem destaca o potencial da extração de recursos multimodais e técnicas avançadas de aprendizado profundo para análise e compactação de vídeo robustas.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os sistemas de Análise Multimodal (MMA) surgiram, combinando várias modalidades como áudio, vídeo, texto e dados de sensores para fornecer insights sobre como os alunos aprendem1. Essas tecnologias podem ajudar a obter uma compreensão completa do comportamento do aluno e dos níveis de engajamento, avaliando dados multimodais2. No entanto, há uma série de obstáculos e restrições quando se trata de criar sistemas MMA eficientes3. Há uma tonelada de vídeos digitais devido ao crescimento da Internet e das câmeras de segurança. É imperativo que esses vídeos sejam compilados em bancos de dados. Um resumo em vídeo pode ser útil nessa situação. A criação de uma sinopse útil do vídeo real é conhecida como resumo de vídeo e ajuda no rastreamento de atividades, detecção de anomalias e recuperação de vídeo4. O resumo em vídeo pode ser realizado usando uma variedade de estratégias. Esses métodos se enquadram em uma das duas categorias5, como resumo de vídeo extrativo e abstrato.

Como o resumo de vídeo requer muita computação, são necessários métodos eficientes. Se cada quadro de um filme for examinado para seleção, o processo de resumo pode ser lento e demorado, e os recursos de processamento podem ser gastos em quadros idênticos ou semelhantes. Além disso, para agilizar o processo e garantir que apenas recursos importantes sejam considerados, a redução de espaço deve ser feita para qualquer conjunto de recursos6. As técnicas de resumo de vídeo podem ser categorizadas em quatro áreas principais com base no tipo de sinais audiovisuais que são produzidos e mostrados ao usuário final7, ou sua saída. Para ser mais específico, os resultados dos cálculos de resumo de vídeo podem incluir: (i) quadros primários8, que são exibidos sequencialmente quadros de vídeo extraídos comumente conhecidos como resumos estáticos; (ii) quadros de vídeo9, que são chamados de resumos dinâmicos; (iii) sinais visuais10, que aprimoram os resumos para o usuário final, adicionando sintaxe baseada em gráficos a outras dicas; e (iv) geradas por computadores, anotações textuais11, que são projetadas para oferecer resumos eficientes de informações de vídeo.

Os resumos baseados em quadros-chave geralmente são menores do que aqueles baseados em fotos-chave. Quadro-chave refere-se a um quadro representativo individual selecionado no vídeo. Keyshot denota um segmento contínuo curto de quadros de vídeo agrupados em torno de quadros-chave. A classe de resumo refere-se aos quadros ou segmentos de rotulagem de saída do classificador como informativos (a serem incluídos no resumo) ou não informativos (a serem excluídos). No entanto, esse benefício vem às custas de omitir detalhes importantes no processo de resumo. Por exemplo, pode ser difícil obter o contexto do quadro predecessor em um resumo baseado em quadro-chave. Também é desprovido do som original. Para resolver esses problemas, técnicas de resumo de vídeo baseadas em keyshot são, portanto, frequentemente escolhidas. As técnicas de resumo de vídeo baseadas em keyshot são utilizadas para criar subconjuntos para vídeos longos ou curtos. Vídeos curtos e longos geralmente têm durações menores e superiores a 10 minutos, respectivamente12. A geração de subconjuntos assistidos por keyshot para vídeos curtos é impraticável e pode não ser bem-sucedida devido à sua já breve duração de repetição. Além disso, o tempo de reprodução de vídeos longos, principalmente filmes ou vídeos esportivos, pode ultrapassar 90 minutos. Para essas categorias de vídeo, as técnicas de resumo baseadas em keyshot são mais úteis e eficientes para fornecer aos usuários uma breve visão geral.

A natureza subjetiva do resumo em vídeo o torna uma tarefa assustadora. Isso se deve ao fato de que cada usuário tem gostos distintos, mesmo quando se trata de conteúdo de vídeo comparável. Esse problema pode ser resolvido com precisão com a ajuda da abordagem de resumo de vídeo personalizada13. O objetivo do algoritmo é fornecer a cada usuário conteúdo adaptado aos seus interesses. No entanto, resumos de vídeo adaptados com durações ideais para novos vídeos longos (como eventos esportivos) não estão prontamente disponíveis. Os métodos atuais14,15 requerem recursos computacionais maciços para avaliar os dados de preferência do cliente e imagens de vídeo, a fim de fornecer resumos individualizados em tempo real. Resumos em vídeo personalizados em tempo real podem ser obtidos em servidores dedicados centralizados. Babu Veesam e Satish16 discutiram uma análise taxonômica completa de todas as principais estratégias de resumo de vídeo que demonstram abordagens amplamente utilizadas que compactam efetivamente grandes quantidades de dados de vídeo. A revisão classifica e avalia as metodologias em relação às suas abordagens fundamentais, que incluem estratégias de integração multimodal, estruturas de aprendizado profundo e métodos baseados em clustering. Entre os métodos que se destacam estão o framework KDAN, que utiliza a destilação do conhecimento para sumarização supervisionada, e o método SVS_MCO, que utiliza o agrupamento DBSCAN otimizado pelo Algoritmo de Algas Artificiais. Além disso, a revisão fornece modelos sofisticados, como a Rede Recorrente Audiovisual e o Aprendizado Abutre Africano Profundo baseado em Consulta, que se mostraram altamente eficazes no gerenciamento de problemas de resumo de vídeo dinâmico e multimodal.

A inclusão de uma estrutura multimodal de Rede Neural Recorrente AlexNet fechada (GARNN-AE-LSTM) para resumo de vídeo é o que torna este estudo novo. Essa abordagem melhora a precisão e a eficiência do processo de resumo de vídeo, reduzindo a redundância com PCA compensado por movimento, capturando a dinâmica temporal com GRUs e otimizando a seleção de recursos espaciais usando métodos de gating. A fim de fornecer o resumo de vídeo de forma eficiente com complexidade reduzida, este artigo contribui com o seguinte: (i) Resumo de vídeo multimodal: Propôs uma estrutura para gerar resumos de vídeo concisos integrando informações visuais e auditivas usando um modelo GARNN pré-treinado que combina RNNs fechados e AlexNet. (ii) Gated AlexNet para refinamento de recursos: Introduziu um novo mecanismo fechado (porta sigmóide) na camada densa do AlexNet para filtrar recursos espaciais irrelevantes, aprimorando assim a extração de recursos visuais de alto nível. A integração com o RNN permite a modelagem temporal eficaz de dependências quadro a quadro. (iii) Eliminação de quadros redundantes: Desenvolveu uma abordagem baseada em variância com compensação de movimento para remover quadros idênticos ou semelhantes antes da detecção de quadros-chave, seguida por redução de dimensionalidade baseada em PCA opcional para representação eficiente de recursos. (iv) Detecção precisa de quadros-chave: Empregou um classificador LSTM baseado em codificador adversário para modelagem temporal, alcançando um F-score médio de 0,985, demonstrando assim uma precisão de resumo superior em comparação com as abordagens de linha de base. (v) Eficiência sobre modelos de transformadores: Mostrou que o modelo GARNN proposto é computacionalmente eficiente, onde o AlexNet captura efetivamente recursos espaciais, dependências sequenciais de modelos RNN e o mecanismo de gating filtra quadros sem importância, superando as alternativas baseadas em transformadores na seleção e resumo de recursos.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo propõe um método de resumo de vídeo supervisionado multimodal que se enquadra na categoria de resumo de vídeo genérico, comumente chamada de skimming de vídeo. Isso inclui técnicas que se concentram em encontrar segmentos-chave de um vídeo maior para criar uma versão temporalmente condensada dele. Este estudo sugere uma técnica supervisionada para analisar o fluxo de vídeo em seções de 1 s que incluem representações de áudio e visuais, conforme mostrado na Figura 1. Esses segmentos são então categorizados como "desinteressantes" ou "informativos". Ao contrário de dados sintéticos ou simulados, "dados reais" agora se referem aos conjuntos de dados de vídeo reais utilizados para experimentos. Os segmentos de vídeo que fornecem sinais audiovisuais importantes necessários para o resumo - como alto movimento, voz ou transições de cena - são chamados de "segmentos informativos". Partes "desinteressantes" são definidas como quadros repetitivos ou redundantes que não acrescentam nada de novo à sinopse.

Os vídeos de entrada são segmentados em quadros e os recursos multimodais são extraídos de cada quadro usando o modelo GARNN proposto. Os recursos de áudio e visual são fundidos e alimentados como entrada na fase de redução de dimensionalidade, onde os quadros redundantes são removidos para processamento posterior. Finalmente, o AELSTM proposto é aplicado aos dados reduzidos para resumo de vídeo. Um classificador binário supervisionado treinado com representações de recursos das modalidades visual, de áudio ou mistas, chamadas multimodalidades, é usado para conseguir isso.

figure-protocol-1
Figura 1: Visão geral do modelo de resumo de vídeo proposto. O pipeline inclui extração de recursos multimodais, redução de dimensionalidade e geração de resumo usando AELSTM. Clique aqui para ver uma versão maior desta figura.

Dataset
A eficácia das soluções sugeridas é determinada usando os conjuntos de dados VSUMM17 e SumMe18 , um par de conjuntos de dados de referência em resumo de vídeo estático. Os recursos da CNN criados usando AlexNet com LSTM e dados reais estão entre os conjuntos de dados. Os dados reais e conjuntos de dados são acessíveis ao público em geral19. Os 50 filmes no conjunto de dados VSUMM são de sites como o YouTube e abrangem 110 minutos a 30 quadros por segundo. Eles vêm em uma variedade de gêneros, incluindo desenhos animados, notícias, esportes, publicidade, séries de TV e vídeos caseiros. Entre estes, 25 vídeos consistem em feriados, festivais e esportes que foram obtidos do conhecido site do YouTube e marcados com pelo menos 15 resumos gerados por humanos (390 no total) compõem o conjunto de dados de resumo de vídeo "SumMe"20 . O intervalo de duração dos vídeos é de 1 a 6 minutos.

O vídeo original é convertido em imagens RGB, que são alimentadas como entrada no modelo GARNN proposto pré-treinado para extração de recursos. Este modelo consiste em AlexNet e um RNN fechado. O número original de recursos é 64 e os recursos do AlexNet têm 4100 recursos.

Proposta de extração de recursos baseada em Gated-AlexNet-RNN
Os modos visual e de áudio da informação foram usados para resumir os vídeos. Para obter uma representação de recursos em ambas as modalidades, identificamos recursos artesanais que são frequentemente usados em tarefas de agrupamento e classificação de áudio e visual, como recuperação de imagens, classificação de vídeo, análise de cena auditiva e recuperação de informações musicais. O objetivo era incluir o maior número possível de componentes visuais e de áudio instrucionais. A Figura 2 mostra uma ilustração conceitual do processo usado para extrair recursos para as modalidades de áudio e visual.

figure-protocol-2
Figura 2: Proposta de extração de recursos multimodal baseada em GARNN. Os recursos das modalidades visual e de áudio são extraídos usando os componentes AlexNet e GARNN. Clique aqui para ver uma versão maior desta figura.

Fechado- AlexNetRNN: (GARNN)
Para análise de imagem virtual, a CNN é um modelo DL popular21. Em geral, a CNN usa a imagem como entrada e a divide em vários grupos. Neurônios de entrada, uma sequência de camadas com agrupamento convolucional, camadas que estão completamente ligadas e camadas normalizadoras compõem sua estrutura22. Os neurônios da camada de convolução estão conectados à camada anterior por meio de uma região estreita. As camadas abaixo deles estão totalmente conectadas aos neurônios ativadores das camadas totalmente ligadas. A Eqn (1) representa a propagação para frente e para trás de uma função totalmente conectada.

figure-protocol-3(1)

figure-protocol-4(2)

Onde figure-protocol-5 está a ativação doi-ésimo neurônio na lésima camada, figure-protocol-6 é o gradiente do iésimo neurônio na lésima camada, figure-protocol-7 é o peso do iésimo neurônio na l + 1ª camada. Numerosos projetos da CNN surgiram como resultado de recentes avanços de pesquisa. AlexNet foi usado neste trabalho.

A arquitetura do AlexNet, mostrada na Figura 3, reflete um design meticuloso e bem estruturado. Três camadas completamente conectadas e cinco camadas de convolução compõem suas oito camadas de aprendizado. Os rótulos de classe são produzidos alimentando o resultado da última camada na função que ativa o softmax. Os kernels de segunda, quarta ou quinta camada são conectados aos seus níveis antecedentes por meio do compartilhamento de GPU. Os kernels da segunda e terceira camadas estão totalmente conectados uns aos outros. A camada de normalização é conectada às camadas de pool máximo após o primeiro e o segundo níveis. O ReLU está vinculado a todas as camadas de aprendizagem.

figure-protocol-8
Figura 3: Arquitetura do AlexNet. Cinco camadas convolucionais e três camadas totalmente conectadas são usadas para processar dados visuais no modelo de resumo. Clique aqui para ver uma versão maior desta figura.

A rede de backbone primária para o trabalho era um GARNN de camada densa. Existem três camadas no RNN espesso. Com 80 neurônios na segunda camada e 170 na primeira, é composto por duas camadas totalmente conectadas (fc). As camadas a seguir são normalização e abandono em lote. O fc, a última camada, é composta por três neurônios e é usada para dividir a imagem. A camada densa, que vem após o LSTM, divide a área ao redor do tumor cerebral. AlexNet fornece os recursos da camada LSTM. O conjunto de dados tem no máximo 20 fatias, o que é igual ao número total de sequências que foram declaradas. A primeira camada do GARNN contém 100 unidades ocultas, enquanto a terceira camada contém 125 unidades ocultas.

O mecanismo de gating foi incorporado à camada densa (completamente ligada) do AlexNet em nossa estrutura GARNN-AE-LSTM sugerida. Os mapas de feições convolucionais são frequentemente processados pelo AlexNet e enviados diretamente para camadas totalmente conectadas para classificação. Todas as características espaciais recuperadas, incluindo padrões redundantes ou menos significativos, são tratadas igualmente por este método. Abordamos isso introduzindo uma função de gating que funciona como um filtro de recursos e é baseada em um sigmoide. Em termos matemáticos, um vetor de porta g = σ(wX) + b, modula a saída da camada densa, com σ representando a função sigmóide. Durante o treinamento, este portão aprende a dar vários pesos de ativação de recursos que variam de 0 a 1. São eles: (i) valores de porta baixos suprimem recursos irrelevantes (por exemplo, ruído de fundo ou texturas redundantes). (ii) Valores de porta mais altos destacam características discriminativas (como regiões de objetos importantes ou padrões sensíveis ao movimento). (iii) Esse conjunto de recursos aprimorado é então usado pelo componente RNN, o que permite capturar melhor as dependências temporais sem ser desviado por informações espaciais irrelevantes. (iv) A retropropagação é usada para alterar os parâmetros de gating durante o treinamento em conjunto com o AlexNet e o RNN. Isso implica que, com o tempo, o modelo aprende quais aspectos são mais importantes para resumir, além de quais recursos extrair.

Na Figura 4, a variável X denota os dados de entrada, C denota a célula e H denota o estado oculto.

figure-protocol-9
Figura 4: Modelo de arquitetura de rede neural recorrente fechada (GARNN). O GARNN integra normalização em lote, dropout e várias camadas densas para modelagem de sequência eficaz. Clique aqui para ver uma versão maior desta figura.

Em cada bloco, os respectivos pesos, como Iw, Rw e viés chamados de entrada, peso recorrente e viés, respectivamente, foram utilizados como na Eqn (3) a Eqn (5)

figure-protocol-10(3)

figure-protocol-11(4)

figure-protocol-12(5)

Em um determinado carimbo de data/hora t, o estado da célula é denotado como na Eqn (6)

figure-protocol-13(6)

Onde figure-protocol-14 o produto de Hadamard e o estado da unidade oculta são denotados como na Eqn (7)

figure-protocol-15(7)

Assim, ele utiliza o módulo de análise de áudio py para calcular as características de áudio em nível de segmento para cada clipe de áudio extraído do arquivo de vídeo correspondente, utilizando ffmpeg (https: //github.com/tyiannak/pyaudioanalysis)23. Os recursos extraídos estão listados na Tabela 1.  De acordo com esse processo, a extração de recursos de áudio é feita inicialmente temporariamente. A parte final da representação é composta por estatísticas de recursos no nível do segmento que são calculadas em um segundo nível. Especificamente, um processamento de curto prazo é realizado para cada segmento do sinal de áudio, resultando no cálculo de 68 recursos de curto prazo (34 recursos e 34 deltas) para cada janela de nível de segmento, que pode ser sobreposta ou não sobreposta. Usamos uma variedade de características visuais para transmitir o conteúdo das informações visuais, além de extrair elementos auditivos do sinal sonoro de cada vídeo. Prevê-se que esta modalidade seja crucial para o processo de resumo. A biblioteca multimodal_movie_analysis (https://github.com/tyiannak/multimodal_movie_analysis) foi usada para extrair recursos que refletem aspectos visuais de um vídeo para extrair esses elementos visuais. Especificamente, os 88 elementos visuais listados abaixo são retirados do quadro correspondente a cada 0,2 s. Neste, os recursos multimodais são fundidos e um total de 59 recursos são usados para uma análise mais aprofundada da classificação do vídeo como informativo e não interessante, fazendo o resumo do vídeo.

Redução de recursos usando PCA
A dimensão das características deste estudo foi reduzida pela aplicação da análise de componentes principais (PCA). As características básicas são transformadas em características-chave para aumentar sua proeminência e importância. A ACP tem sido amplamente utilizada por inúmeros pesquisadores em uma variedade de domínios24. Os autovalores são usados para determinar as propriedades. Os recursos de valor próprio mais alto são selecionados, enquanto os recursos de valor próprio mais baixo são removidos.

Após a remoção de quadros supérfluos, o PCA é usado neste estudo como uma etapa opcional de redução de recursos. O PCA suprime o ruído e as informações redundantes comprimindo os vetores de recursos de alta dimensão produzidos pelo GARNN em um pequeno subespaço. Isso aumenta a eficiência computacional do AE-LSTM, garantindo que a detecção de quadros-chave seja dominada pelas pistas visuais e auditivas mais discriminativas. Para equilibrar escalabilidade e precisão no resumo de vídeo, o PCA é utilizado como uma ferramenta útil. O algoritmo (Algoritmo 1) é fornecido como Arquivo Suplementar 1.

Qualquer quadro que seja exatamente igual ou surpreendentemente comparável ao quadro anterior é considerado redundante. É óbvio que alterar a taxa de quadros pode ter um impacto na proporção de quadros de vídeo removidos. Mais especificamente, à medida que as taxas de quadros aumentam, a semelhança entre quadros sucessivos também aumenta, levando a uma porcentagem maior de quadros sendo removidos. Agora, os recursos de dimensionalidade reduzida são usados para treinar o modelo de ML, que é chamado de modelo AE-LSTM adversário.

Treinamento usando AELSTM
Uma rede neural chamada GAN25 é composta de duas sub-redes rivais: i) uma rede "geradora" (G) que cria dados que se assemelham a uma distribuição desconhecida e ii) uma rede "discriminadora" (D) que distingue entre as amostras criadas e aquelas de observações reais. O objetivo é encontrar um gerador que maximize a probabilidade de o discriminador cometer um erro enquanto ajusta a distribuição real de dados.

Suponha que X é a entrada e E é o ruído de entrada anterior, X'= g(E) é a amostra gerada. Usando a otimização minimax, o aprendizado é formulado:

figure-protocol-16(8)

Onde D é qualificado para obter a probabilidade correta da classificação. Os componentes do nosso modelo de treinamento desenvolvido são mostrados na Figura 5. O seletor LSTM escolhe o subconjunto de quadros da sequência de vídeo de entrada X. Os quadros selecionados são convertidos em recurso de comprimento fixo E usando o codificador-LSTM, seguido pela reconstrução de vídeo X' usando o decodificador-LSTM. A classificação de X' em vídeo real ou classe de resumo é realizada pelo discriminador-LSTM. Neste estudo, o AE-LSTM é usado para resumo de vídeo com estrutura GAN para resumos de vídeo eficientes, diversificados e estruturados. O AE pode eliminar as alterações desnecessárias de fundo, e o LSTM pode detectar as transições de cena em vez de tratar os quadros como imagens, e o GAN, o gerador pode resumir o vídeo e o discriminador garante que o resumo seja diversificado

figure-protocol-17
Figura 5: Arquitetura do modelo de resumo AELSTM. Inclui Selector-LSTM, Encoder-LSTM, Decoder-LSTM e Discriminator-LSTM para otimizar resumos de vídeo por meio de treinamento contraditório. Clique aqui para ver uma versão maior desta figura.

Ao fornecer os recursos GARNN para cada quadro no vídeo de entrada X chamado figure-protocol-18 , o resumidor utiliza o seletor LSTM para escolher o subconjunto de quadros, e o codificador codifica os quadros como E seguido pelo decodificador reconstruindo o vídeo como X' em cada quadro xt. O seletor utiliza a pontuação de importância ao selecionar o quadro. Os recursos são dados pelo valor do peso usando as pontuações e, em seguida, passam para o codificador. Para cada quadro com pontuação st = 1, o subconjunto é recebido apenas pelo codificador. O discriminador escolhe as classes como originais ou resumidas estimando a distância entre X e X' e atribuindo os rótulos. Nesse caso, o discriminador calcula o erro entre os vídeos originais e de resumo. O algoritmo 2 (Arquivo Suplementar 2) denota o resumo do treinamento do AELSTM para resumo de vídeo.

Pós-processamento – Resumo de vídeo
Os resumos em vídeo podem ser produzidos por classificadores em nível de segmento depois de treinados. Três etapas estão envolvidas para conseguir isso: (i) Determine as características de áudio, visual ou combinadas de cada segmento de vídeo. (ii) Classifique cada segmento de vídeo usando o classificador de áudio, visual ou fusão apropriado. (iii) Para evitar erros gritantes, pós-processe as previsões ordenadas do classificador.

Para atender a essa demanda, foi desenvolvido um pipeline composto por dois filtros distintos para a etapa de pós-processamento. A matriz de entrada é primeiro submetida a um filtro mediano de comprimento N1 utilizando janelas locais para suavizar as previsões do classificador sequencial. As previsões finais são então determinadas por filtragem rígida usando um método direto que mantém uma série de previsões consecutivamente positivas (segmentos informativos) se pelo menos N2 segmentos forem incluídos nessa sequência. Dito de outra forma, esse critério exige que um segmento instrutivo dure pelo menos N2 segundos.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A extração de recursos baseada em GARNN proposta e o resumo de vídeo baseado em AGLSTM de vídeos longos foram experimentados em dois conjuntos de dados, VSUMM e SumMe. Esta seção discute os resultados experimentais e a comparação com as abordagens convencionais. Para o LSTM discriminador, empregamos um LSTM de duas camadas com 1024 unidades ocultas em cada camada. Para encoder_LSTM e decoder_LSTM, respectivamente, empregamos dois LSTMs de duas camadas com 2048 unidades ocultas em cada camada. Um decodificador LSTM que bu...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Neste estudo, o resumo de vídeo de vídeos longos é apresentado usando modelos multimodais eficientes de ML e DL, que usam modalidades de áudio, imagem e visual de dados gerados a partir dos dados de entrada. O classificador binário é treinado para aprender a discriminação entre os segmentos importantes que são a parte de resumo produzida e os segmentos "não importantes" que são descartados. O modelo é treinado usando conjuntos de dados como SumMe e VSUMM, e a escalabilidade do modelo é d...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm conflitos de interesse.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores agradecem ao Dr. Television School, Sichuan Film and Television University, por fornecer as instalações do laboratório para conduzir o estudo de pesquisa.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
AlexNet (modelo pré-treinado)MATLAB / PyTorchHub PyTorch — Modelo pré-treinado do AlexNet: https://pytorch.org/hub/pytorch_vision_alexnet/Usado para extração de recursos visuais
FFmpegFFmpeg.orghttps://ffmpeg.org/Extração de áudio de vídeo
Modelo baseado em GRNNImplementação personalizadaBiblioteca " neupy" implementa GRNN: http://neupy.com/apidocs/neupy.algorithms.rbfn.grnn.htmlUsado para fusão de recursos multimodais
LSTM (Memória de Longo Curto Prazo)PyTorchhttps://pytorch.org/docs/stable/generated/torch.nn.LSTM.htmlUsado no seletor, codificador, decodificador
Multimodal_movie_analysis libGitHubhttps://github.com/tyiannak/multimodal_movie_analysisPara extração de recursos visuais
NumPyFundação de Software Pythonhttps://pypi.org/project/numpy/Computação numérica e operações matriciais
PCA (Análise de Componentes Principais)Scikit-aprenderhttps://scikit-learn.org/stable/modules/generated/sklearn.decomposition.PCA.htmlRedução de dimensionalidade
Análise de Áudio PyGitHubhttps://github.com/tyiannak/pyaudioanalysisExtração de recursos de áudio
PyTorchFundação PyTorchhttps://pytorch.org/Estrutura de aprendizado profundo
Conjunto de dados do SumMeConjunto de dados públicoshttps://gyglim.github.io/me/vsum/index.htmlConjunto de dados de resumo de vídeo de referência
Conjunto de dados VSUMMConjunto de dados públicoshttp://www.vision.ime.usp.br/~creativision/vsumm/Conjunto de dados de resumo de vídeo de referência

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Celik, I., Yildirim, B., Soykan, E. Response of learning analytics to the online education challenges during pandemic: Opportunities and key examples in higher education. Policy Futures Educ. 21 (3), 387-404 (2022).
  2. Prieto, L. P., Sharma, K., Dillenbourg, P., Muñoz-Cristóbal, J. J., Rodríguez-Triana, M. J. Multimodal teaching analytics: Automated extraction of orchestration graphs from wearable sensor data. J Comput Assist Learn. 34 (2), 193-203 (2018).
  3. Ouhaichi, H., Spikol, D., Vogel, B. Research trends in multimodal learning analytics: A systematic mapping study. Comput Educ Artif Intell. 4, 100136(2023).
  4. Basavarajaiah, M., Sharma, P. Survey of compressed domain video summarization techniques. ACM Comput Surv. 52 (1), 129(2020).
  5. Subba, T., Roy, B., Pradhan, A. A study on video summarization. Int J Adv Res Comput Commun Eng. 5 (1), 14(2016).
  6. Van der Maaten, L., Postma, E., Van den Herik, J. Dimensionality reduction: A comparative. J Mach Learn Res. 10, 66-71 (2009).
  7. Money, A. G., Agius, H. Video summarisation: A conceptual framework and survey of the state of the art. J Vis Commun Image Represent. 19 (2), 121-143 (2008).
  8. Spyrou, E., Tolias, G., Mylonas, P., Avrithis, Y. Concept detection and keyframe extraction using a visual thesaurus. Multimed Tools Appl. 41 (3), 337-373 (2009).
  9. Li, Y., Merialdo, B., Rouvier, M., Linares, G. Static and dynamic video summaries. Proceedings of the 19th ACM International Conference on Multimedia. , ACM. Scottsdale, AZ. 1573-1576 (2011).
  10. Sen, D., Raman, B. Video skimming: Taxonomy and comprehensive survey. arXiv. , (2019).
  11. Video to text SHORT ABSTRACT:SHORT ABSTRACT: Joint video summarization and captioning with recurrent neural networks. Chen, B. C., Chen, Y. Y., Chen, F. Proceedings of the British Machine Vision Conference (BMVC), , BMVA. London, UK. (2017).
  12. Short form and long form videos. Google Ads Help. , Google. https://support.google.com/google-ads/answer/2382886 (2025).
  13. Babaguchi, N., Kawai, Y., Ogura, T., Kitahashi, T. Personalized abstraction of broadcasted American football video by highlight selection. IEEE Trans Multimedia. 6 (4), 575-586 (2004).
  14. Lei, J., Ren, P., Wang, H., Wang, X., Tian, Q. Action parsing-driven video summarization based on reinforcement learning. IEEE Trans Circuits Syst Video Technol. 29 (7), 2126-2137 (2019).
  15. Thomas, S. S., Gupta, S., Subramanian, V. K. Context driven optimized perceptual video summarization and retrieval. IEEE Trans Circuits Syst Video Technol. 29 (9), 3132-3145 (2019).
  16. Veesam, S. B., Satish, A. R. An empirical taxonomy of video summarization models from a statistical perspective. IEEE Access. 12, 173850-173866 (2024).
  17. Unsupervised video summarization with adversarial LSTM networks. Mahasseni, B., Lam, M., Todorovic, S. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Honolulu, HI. 2982-2991 (2017).
  18. Mujtaba, G., Malik, A., Ryu, E. S. LTC-SUM: Lightweight client-driven personalized video summarization framework using 2D CNN. IEEE Access. 10, 103041-103055 (2022).
  19. DeAvila, S. E. F., Lopes, A. P. B., da Luz, A., de Oliveira, L. P., da Silva Torres, R. VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recognit Lett. 32 (1), 56-68 (2011).
  20. Creating summaries from user videos. Gygli, M., Grabner, H., Riemenschneider, H., Van Gool, L. Proceedings of the European Conference on Computer Vision (ECCV), , Springer. Zurich, Switzerland. 505-520 (2014).
  21. OverFeat: Integrated recognition, localization and detection using convolutional networks. Sermanet, P., Eigen, D., Zhang, X., et al. Proceedings of the International Conference on Learning Representations (ICLR), , ICLR Banff. Canada. (2014).
  22. Deep residual learning for image recognition. He, K., Zhang, X., Ren, S., Sun, J. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), , IEEE. Las Vegas Valley, NV. 770-778 (2016).
  23. Giannakopoulos, T. pyaudioanalysis: An open-source Python library for audio signal analysis. PLoS One. 10 (12), e0144610(2015).
  24. A PCA-based distributed approach for intrusion detection in wireless sensor networks. Livani, M. A., Abadi, M. A. Proceedings of the International Symposium on Computer Networks and Distributed Systems (CNDS '11), , IEEE. Tehran, Iran. 55-60 (2011).
  25. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Advances in Neural Information Processing Systems (NeurIPS), , Curran Associates. 2672-2680 (2014).
  26. Srivastava, N., Mansimov, E., Salakhutdinov, R. Unsupervised learning of video representations using LSTMs. arXiv. , (2015).
  27. Nair, M. S., Mohan, J. Static video summarization using multi-CNN with sparse autoencoder and random forest classifier. Signal Image Video Process. 15 (5), 735-742 (2021).
  28. Issa, O., Shanableh, T. CNN and HEVC video coding features for static video summarization. IEEE Access. 10, 72080-72091 (2022).
  29. Apostolidis, E., Mezaris, V., Patras, I. AC-SUM-GAN: Connecting actor-critic and generative adversarial networks for unsupervised video summarization. IEEE Trans Circuits Syst Video Technol. 31 (7), 3278-3292 (2021).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Unidades Recorrentes Com PortaDetec o de KeyframeExtra o de Caracter sticasCompensa o de MovimentoRedu o por PCACodificador Advers rioModelagem TemporalF1 Score

Artigos relacionados