É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de investigação

Modelo alinhado à âncora semântica para detecção de anomalias de vídeo interpretável sob supervisão fraca intermodal

509 vistas

DOI:

10.3791/69286

14 de novembro de 2025

Neste artigo

Resumo

Este protocolo visa melhorar a detecção de anomalias de vídeo fracamente supervisionada, integrando conhecimento estruturado. Seu objetivo é permitir a classificação de tipos específicos de anomalias e fornecer explicações claras e interpretáveis para os resultados da detecção, indo além de simples decisões binárias e aumentando a transparência.

Resumo

A detecção de anomalias de vídeo fracamente supervisionada é uma técnica essencial que depende exclusivamente de rótulos de nível de vídeo para identificar eventos anômalos. No entanto, os métodos tradicionais de aprendizado de múltiplas instâncias (MIL) dependem da supervisão binária de granularidade grossa. Essa abordagem dificulta a distinção entre categorias de anomalias refinadas. Esses métodos geralmente se concentram apenas nos segmentos mais anômalos, resultando em resultados de detecção que carecem de interpretabilidade. Para superar essas limitações, este estudo propõe uma abordagem de modelagem de recursos que incorpora conhecimento estruturado. Ao utilizar um mecanismo de orientação semântica dinâmica, a detecção de anomalias de vídeo fracamente supervisionada combina informações externas em nível de categoria com prompts que podem ser aprendidos para gerar sinais semânticos dentro do espaço de recursos. Esses sinais são alinhados com as evidências visuais extraídas pelo módulo base de detecção de anomalias, produzindo duas saídas complementares: uma pontuação de anomalias para quantificar a gravidade de eventos anômalos e descrições semânticas alinhadas com conceitos externos, que podem ser usadas para gerar textos explicativos estruturados e interpretáveis por meio de modelos predefinidos. Os resultados experimentais demonstram que o método proposto atinge uma AUC de 88,03% no conjunto de dados UCF-Crime e 98,23% no conjunto de dados ShanghaiTech, atingindo 87,05% de precisão em tarefas de classificação de anomalias refinadas. Além disso, as explicações semânticas geradas estendem a detecção fracamente supervisionada de uma tarefa de classificação binária para uma estrutura de análise de anomalias interpretável e orientada pela semântica.

Introdução

A detecção de anomalias por vídeo (VAD) desempenha um papel essencial em áreas como segurança pública e manufatura inteligente, onde oferece uma solução escalável para as limitações da vigilância manual1. Em particular, a detecção de anomalias de vídeo fracamente supervisionada (WS-VAD) ganhou destaque devido à sua dependência de rótulos de nível de vídeo, reduzindo substancialmente a carga de anotação manual e melhorando a generalização em diversas cenas. Apesar de suas vantagens práticas, os métodos WS-VAD ainda enfrentam desafios significativos na identificação precisa da natureza dos eventos anormais

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Este estudo usa apenas conjuntos de dados disponíveis publicamente (UCF-Crime13 e ShanghaiTech14). Todos os vídeos foram obtidos a partir das versões oficiais dos conjuntos de dados, que anonimizam informações de identificação pessoal na medida em que são fornecidas pelos mantenedores do conjunto de dados. Nenhuma coleta de dados adicional ou interação com seres humanos foi conduzida pelos autores; portanto, nenhuma nova aprovação do IRB foi necessária. O uso de dados está em conformidade com as licenças e termos de uso dos respectivos conjuntos de dados.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Para validar ainda mais a utilidade das âncoras semânticas, um experimento adicional foi conduzido para comparar diferentes modelos de prompt (consulte a Tabela 1). A variante usando protótipos semânticos aumentados pelo Wikidata não apenas alcançou valores de AUC mais altos, mas também levou a melhorias na pontuação BLEU-4 de 16,6 e 14,8 para as explicações geradas. Essas descobertas indicam uma forte ligação entre a riqueza semântica dos prompts e a qualidade das inter.......

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

O protocolo apresentado aqui introduz um avanço significativo na detecção de anomalias de vídeo fracamente supervisionadas, mudando o paradigma da classificação binária simples para uma análise interpretável e semanticamente fundamentada. A importância desse método reside em sua capacidade de não apenas identificar se ocorreu uma anomalia, mas também que tipo de anomalia é e por que o modelo chegou a essa conclusão, abordando uma grande limitação nos sistemas WS-VAD existentes

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores não têm conflitos de interesse.

Agradecimentos

Reconhecemos com gratidão o apoio financeiro fornecido pela Aerospace Hongka Intelligent Technology (Beijing) CO., LTD.

....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários

BLIP Modelo

Pesquisa SalesforceViT-B/16Usado como codificador de texto para criar âncoras semânticas.
GPUNVIDIARTX 4060TiUsado para treinar o modelo
Modelo I3DGoogle DeepMindPré-treinado em Cinética Usado como base para extração de recursos de vídeo.
DormenteA Equipe de Desenvolvimento do NumPy1.21.2Usado para lidar e processar matrizes numéricas de dados, como os recursos de vídeo, antes de serem inseridos no modelo de aprendizado profundo.
PyTorchPesquisa em IA do Facebook1.8.0Usado para definir a arquitetura do modelo, implementar as funções de perda personalizadas e executar a retropropagação para otimização.
PitãoFundação de Software Python3.8.20Usado para escrever todos os scripts para processamento de dados, implementação de modelos, treinamento e avaliação
Conjunto de Dados ShanghaiTechUniversidade ShanghaiTechUsado para treinamento e avaliação em 13 cenas diferentes do campus.
UCF-Crime Dataset & nbsp;Universidade da Flórida CentralUsado para treinamento e avaliação de 13 categorias de anomalias.
WikidataFundação WikimediaUsado como grafo de conhecimento externo para construção de prompts.

Referências

  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. ....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Etiquetas

Orienta o Sem nticaAprendizado de Inst ncias M ltiplasPontua o de AnomaliaClassifica o de Granularidade FinaConhecimento EstruturadoAprendizado Cross ModalDetec o Interpret velEvid ncia Visual