Artigo de investigação

Modelo alinhado à âncora semântica para detecção de anomalias de vídeo interpretável sob supervisão fraca intermodal

DOI:

10.3791/69286

14 de novembro de 2025

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo visa melhorar a detecção de anomalias de vídeo fracamente supervisionada, integrando conhecimento estruturado. Seu objetivo é permitir a classificação de tipos específicos de anomalias e fornecer explicações claras e interpretáveis para os resultados da detecção, indo além de simples decisões binárias e aumentando a transparência.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A detecção de anomalias de vídeo fracamente supervisionada é uma técnica essencial que depende exclusivamente de rótulos de nível de vídeo para identificar eventos anômalos. No entanto, os métodos tradicionais de aprendizado de múltiplas instâncias (MIL) dependem da supervisão binária de granularidade grossa. Essa abordagem dificulta a distinção entre categorias de anomalias refinadas. Esses métodos geralmente se concentram apenas nos segmentos mais anômalos, resultando em resultados de detecção que carecem de interpretabilidade. Para superar essas limitações, este estudo propõe uma abordagem de modelagem de recursos que incorpora conhecimento estruturado. Ao utilizar um mecanismo de orientação semântica dinâmica, a detecção de anomalias de vídeo fracamente supervisionada combina informações externas em nível de categoria com prompts que podem ser aprendidos para gerar sinais semânticos dentro do espaço de recursos. Esses sinais são alinhados com as evidências visuais extraídas pelo módulo base de detecção de anomalias, produzindo duas saídas complementares: uma pontuação de anomalias para quantificar a gravidade de eventos anômalos e descrições semânticas alinhadas com conceitos externos, que podem ser usadas para gerar textos explicativos estruturados e interpretáveis por meio de modelos predefinidos. Os resultados experimentais demonstram que o método proposto atinge uma AUC de 88,03% no conjunto de dados UCF-Crime e 98,23% no conjunto de dados ShanghaiTech, atingindo 87,05% de precisão em tarefas de classificação de anomalias refinadas. Além disso, as explicações semânticas geradas estendem a detecção fracamente supervisionada de uma tarefa de classificação binária para uma estrutura de análise de anomalias interpretável e orientada pela semântica.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A detecção de anomalias por vídeo (VAD) desempenha um papel essencial em áreas como segurança pública e manufatura inteligente, onde oferece uma solução escalável para as limitações da vigilância manual1. Em particular, a detecção de anomalias de vídeo fracamente supervisionada (WS-VAD) ganhou destaque devido à sua dependência de rótulos de nível de vídeo, reduzindo substancialmente a carga de anotação manual e melhorando a generalização em diversas cenas. Apesar de suas vantagens práticas, os métodos WS-VAD ainda enfrentam desafios significativos na identificação precisa da natureza dos eventos anormais2. Os modelos existentes geralmente detectam a presença de anomalias, mas lutam para determinar sua categoria exata ou fornecer informações diagnósticas significativas 3,4. Por exemplo, em ambientes industriais, um modelo pode confundir fumaça de rolamentos superaquecidos com emissões de vapor inofensivas ou acreditar incorretamente em faíscas normais de soldagem como sinais precoces de incêndio, levando a erros de julgamento dispendiosos e desligamentos desnecessários. Essas confusões semânticas surgem das limitações inerentes às abordagens atuais do WS-VAD5. Os rótulos binários de nível de vídeo apenas indicam se existe uma anomalia, sem oferecer informações sobre sua causa, localização e gravidade. Além disso, as principais estruturas de aprendizado de múltiplas instâncias (MIL)6 agregam previsões em nível de clipe usando heurísticas simples7 que não conseguem capturar a semântica diferenciada de diferentes tipos de eventos. Como resultado, o espaço de recursos visuais aprendidos torna-se ambíguo, onde fenômenos visualmente semelhantes, mas semanticamente distintos - como fumaça e vapor - são mapeados muito de perto, borrando os limites da decisão.

Duas direções principais de pesquisa surgiram para lidar com essas limitações. Um se concentra em aprimorar a estrutura MIL por meio de modelagem temporal aprimorada 4,5,8 ou seleção de recursos guiada por saliência3. Embora esses métodos melhorem a localização de anomalias, eles ainda ficam aquém de oferecer clareza semântica e interpretabilidade. A outra direção envolve o alinhamento de representações de visão e linguagem, integrando modelos multimodais pré-treinados, como o VadCLIP9. Embora essa estratégia se mostre promissora, muitas vezes ela não consegue aproveitar totalmente a riqueza semântica da linguagem. Isso leva a associações intermodais fracas e processos de tomada de decisão opacos, resultando em duas deficiências principais. Primeiro, os modelos atuais não podem distinguir consistentemente entre categorias de anomalias devido à semântica de características vagas e conhecimento externo insuficiente. Em segundo lugar, o processo de tomada de decisão contém uma caixa preta, sem uma explicação transparente de por que um determinado evento é classificado como anômalo. Embora alguns métodos incorporem prompts textuais (por exemplo, lutar, atirar), eles são sempre simplistas e vagamente organizados, sem profundidade semântica e compreensão contextual.

Para resolver essas lacunas, é introduzido um novo método WS-VAD que integra conhecimento externo estruturado com mecanismos de decisão interpretáveis, um objetivo central dentro do campo mais amplo da Inteligência Artificial Explicável (XAI)10. Em vez de usar nomes de categorias básicas como prompts, o método constrói representações semânticas ricas - chamadas de nuvens de conceitos semânticos - usando o Wikidata11. Ao contrário dos métodos multimodais existentes, como o VadCLIP9 , que dependem de prompts de texto estático ou rótulos de categoria simples, essas nuvens de conceitos semânticos encapsulam conhecimento contextual abrangente, incluindo entidades relacionadas, atributos e relações causais extraídas de gráficos de conhecimento estruturados. Essas nuvens de conceito são codificadas em âncoras semânticas usando o modelo BLIP12, que permite que o sistema acesse a semântica de eventos refinada. A principal inovação do mecanismo de âncora semântica reside em sua capacidade de criar representações dinâmicas e enriquecidas com conhecimento que se adaptam a contextos de anomalias específicas, enquanto os métodos anteriores baseados em prompt usam descrições textuais fixas que carecem de profundidade contextual e relações semânticas. Para refinar ainda mais o espaço de recursos, um mecanismo de alinhamento guiado por saliência associa seletivamente essas âncoras às evidências visuais mais relevantes. Esse alinhamento direcionado aumenta o poder discriminativo dos recursos enquanto melhora a clareza semântica dos resultados da detecção. Mais importante, o método proposto apóia a interpretação transparente. Depois que uma âncora semântica é alinhada com a evidência visual, o modelo gera explicações estruturadas em linguagem natural usando modelos predefinidos, abordando explicitamente a natureza e a justificativa da anomalia. É importante observar que a implementação desse método depende de pré-requisitos específicos, incluindo o uso de recursos visuais I3D pré-extraídos, acesso a uma base de conhecimento externa (Wikidata) e um codificador BLIP pré-treinado. A estrutura é, portanto, mais benéfica em aplicativos em que é fundamental ir além da simples detecção binária para classificar tipos de anomalias específicos e fornecer justificativas interpretáveis para os resultados.

As principais contribuições são as seguintes. Um novo método WS-VAD é desenvolvido combinando conhecimento externo com interpretabilidade estruturada para melhorar a compreensão semântica e a transparência da decisão. Um método de solicitação baseado em incorporação semântica e um mecanismo de alinhamento sensível ao contexto são introduzidos para superar as limitações dos modelos MIL somente visuais. Um módulo de explicação generativa é incorporado, usando âncoras semânticas como unidades interpretáveis para produzir justificativas textuais coerentes. Experimentos extensivos conduzidos nos conjuntos de dados UCF-Crime e ShanghaiTech demonstram a eficácia do método proposto, alcançando fortes pontuações de AUC (88,03% / 98,23%) e desempenho de reconhecimento refinado superior, com resultados claros e interpretáveis.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo usa apenas conjuntos de dados disponíveis publicamente (UCF-Crime13 e ShanghaiTech14). Todos os vídeos foram obtidos a partir das versões oficiais dos conjuntos de dados, que anonimizam informações de identificação pessoal na medida em que são fornecidas pelos mantenedores do conjunto de dados. Nenhuma coleta de dados adicional ou interação com seres humanos foi conduzida pelos autores; portanto, nenhuma nova aprovação do IRB foi necessária. O uso de dados está em conformidade com as licenças e termos de uso dos respectivos conjuntos de dados.

Preparação de dados e extração de recursos

Preparação do conjunto de dados: Os conjuntos de dados UCF-Crime13 (1.610 trens / 290 vídeos de teste) e ShanghaiTech14 (238 trens / 199 vídeos de teste) foram adotados de acordo com suas divisões padrão. Os vídeos foram pré-processados usando FFmpeg para garantir a reprodutibilidade, recodificados para H.264, reamostrados para 25 fps e redimensionados para resolução de 256 x 256 com o comando: ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset veryfast pre/.

Extração de recursos: Os recursos RGB foram extraídos por um backbone I3D15 pré-treinado no conjunto de dados Kinetics16. Os vídeos foram divididos em clipes de 16 quadros não sobrepostos; Cada clipe foi cortado no centro para 224 x 224 pixels. As penúltimas ativações de camada foram agrupadas em média para obter um recurso 1024-D por clipe. No PyTorch, isso corresponde ao encaminhamento de tensores de forma [B, 3, T, H, W] através do backbone I3D e à aplicação de adaptive_avg_pool3d seguido de nivelamento. Os recursos extraídos foram salvos em arquivos .npy (um por vídeo) junto com carimbos de data/hora do clipe para reprodutibilidade exata (semente = 123). Para cada vídeo, features///

Arquitetura e metodologia do modelo

Detecção básica: fusão de contexto temporal
Dada uma sequência de videoclipe representada por uma matriz de recursos Z figure-protocol-1 RTx1024, o módulo TCF (Temporal Context Fusion) primeiro calculou representações de consulta, chave e valor por meio de três projeções lineares aprendidas:

Q = ZWQ, K = ZWK, V = ZWV (1)

onde WQ, WK, WV figure-protocol-2 RTx1024xd são parâmetros treináveis (PyTorch: três nn. Camadas lineares (1024,d)). A afinidade intersegmentar foi S = figure-protocol-3, uma Incorporação de Relacionalidade Temporal (TRE) foi incorporada, onde cada elemento foi calculado como Rij = α exp (figure-protocol-4) + β . A afinidade com reconhecimento de localização foi figure-protocol-5 = S + R. Um mapa de contexto global A = softmax(figure-protocol-6) agregado V para obter recursos de área ampla G = AV. As características locais L foram calculadas com uma convolução 1-D em profundidade (nn. Conv1d) do tamanho do kernel 3 sobre Z. Uma porta dinâmica g = σ(MLP ([G;L])) misturou os dois: U = gfigure-protocol-7 G + (1 - g) figure-protocol-8 L . Finalmente, a normalização da camada e uma camada linear residual foram aplicadas para produzir Y (Pytorch:LayerNorm+Linear+residual).

Detecção básica: preditor temporal causal

A saída Y foi passada por duas convoluções causais 1-D com GELU e dropout (Pytorch: padding = 'causal' ou conv mascarado) para obter logits de anomalia por clipe. A aplicação da função sigmóide produziu valores figure-protocol-9 de probabilidade [0,1]T.

Aprimoramento semântico: aprendizado imediato com conhecimento externo

Construir âncoras semânticas: Para cada anomalia classe c, Kc os conceitos foram consultados no Wikidata11 e, codificados, cada frase conceitual foi codificada com o codificador detexto 12do BLIP para ei figure-protocol-10 R768. A âncora de classe foi a média normalizada l2 Dc = norm(figure-protocol-11Σiei) . Para reduzir o ruído, os conceitos com semelhança de cosseno com o nome da classe abaixo de 0,2 foram descartados e o top-M pela pontuação TF-IDF foi mantido.

Execute a separação sensível ao contexto: os pesos de primeiro plano αt = softmax(rst) foram calculados a partir das pontuações do detector de base st e os pesos de fundo bt = softmax(r( 1 - st)). As características ponderadas são ffg = Σtαzt e fbg = Σtbzt .

Alinhar recursos visuais e semânticos

Defina o objetivo de alinhamento: Durante a etapa de alinhamento, o objetivo é minimizar a distância entre o recurso visual de primeiro plano e sua âncora semântica correspondente da categoria anômala dentro do espaço do recurso. Crie uma coleção de guias semânticos, figure-protocol-12, compreendendo guias semânticos de categoria anômala C e um guia semântico normal padrão. Determine a verossimilhança, P(Dk|v), que uma característica visual, v, corresponde ao k-ésimo guia semântico, Dk. Calcule isso usando a similaridade de cosseno em escala de temperatura seguida pela normalização Softmax, conforme mostrado na Eq. (2).

figure-protocol-13(2)

A entropia cruzada foi minimizada para unir pares positivos e separar negativos, com τs definido como um parâmetro aprendível e inicializando-o para 10. Realize o alinhamento otimizando a probabilidade de correlacionar pares de amostras positivas e reduzindo a probabilidade de correlacionar pares de amostras negativas.

Módulo de interpretabilidade baseado em modelo

Com base na representação de recursos aprimorada por aprendizado imediato com conhecimento externo (PLE), um classificador linear produz logits por classe, que foram posteriormente normalizados em probabilidades de classe pela função softmax; O tipo de anomalia predita foi determinado como a categoria com maior probabilidade. Enquanto isso, uma pontuação global de anomalias foi calculada a partir da saída do detector. Para determinar o nível de gravidade, essa pontuação foi comparada com três limites predefinidos otimizados por meio de pesquisa em grade no conjunto de validação.

Os limites padrão foram definidos como θalto = 0,8, θmédio = 0,5 e θbaixo = 0,2. Especificamente, se a pontuação fosse maior que θalta, a gravidade era rotulada como alta; se a pontuação estiver entre θmédio e θalto, foi rotulado como médio; se entre θbaixo e θmédio, foi rotulado como baixo; caso contrário, foi marcado como nenhum.

Durante a fase de geração da explicação, um modelo correspondente ao tipo previsto foi selecionado de uma biblioteca de modelos predefinida, Arquivo Suplementar 1. Esta biblioteca contém várias variantes de modelo que foram validadas por vários anotadores17 para aumentar a diversidade do texto gerado. Se o tipo previsto existir na biblioteca de modelos, um modelo correspondente foi selecionado aleatoriamente; caso contrário, um modelo padrão para o tipo Desconhecido foi usado. Por fim, um texto explicativo estruturado foi gerado integrando o tipo previsto, o escore global de anomalias, a descrição da gravidade e o modelo selecionado. O sistema retorna o tipo de anomalia previsto, a pontuação global de anomalias e o texto explicativo gerado como a saída final. Os resultados estão ilustrados na Figura 2.

Todos os parâmetros de limite foram otimizados usando pesquisa de grade no conjunto de validação, e a qualidade das explicações geradas foi avaliada de forma abrangente usando avaliação humana e métricas automatizadas. Os resultados são apresentados na Tabela 1.

Treinamento e avaliação de modelos

Treinamento: O modelo foi treinado de ponta a ponta com Adam (lr 1 x 10-4, decaimento de peso 5 x 10-4), tamanho do lote 128, 50 épocas, recozimento de cosseno para lr. As sementes aleatórias foram definidas como 123 para Python / Numpy / Pytorch e habilitadas torch.backends.cudnn.deterministic=True. Os pontos de verificação foram salvos a cada 5 épocas em checkpoints//epoch_XX.pt, e o melhor modelo foi selecionado por AUC de validação. Todos os experimentos foram conduzidos em um sistema com uma GPU NVIDIA GeForce RTX 4060 Ti (16 GB) executando Windows 11, com Python 3.8.20, PyTorch 1.8.0 e CUDA 11.1. O tempo aproximado de treinamento por época foi de 30 s para o conjunto de dados ShanghaiTech e 3,5 min para o conjunto de dados UCF-Crime.

Perda: O objetivo geral é L = LMIL+ λ • Lalinhar. O hiperparâmetro λ foi varrido pelo conjunto {0,01,0,1,0,5,1,5,10} no conjunto de validação, e o melhor valor foi fixado para o relatório de teste. Consulte a Figura 3 para agregação MIL top-K e a Eq. (3-4) para definições.

figure-protocol-14(3)

figure-protocol-15(4)

Avaliação: A AUC em nível de quadro foi calculada seguindo o protocolo padrão usado por trabalhos anteriores do WS-VAD 2,5. Para reconhecimento de tipo refinado no UCF-Crime, mAP em IoU 0,1-0,5 e AVG mAP foram relatados, conforme resumido na Tabela 2; as AUCs por classe são mostradas na Figura 4 e os resultados gerais na Tabela 3 e na Tabela 4; a separabilidade incorporada e a dinâmica do escore de anomalias estão na Figura 4, Figura 5 e Figura 6.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para validar ainda mais a utilidade das âncoras semânticas, um experimento adicional foi conduzido para comparar diferentes modelos de prompt (consulte a Tabela 1). A variante usando protótipos semânticos aumentados pelo Wikidata não apenas alcançou valores de AUC mais altos, mas também levou a melhorias na pontuação BLEU-4 de 16,6 e 14,8 para as explicações geradas. Essas descobertas indicam uma forte ligação entre a riqueza semântica dos prompts e a qualidade das inter...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O protocolo apresentado aqui introduz um avanço significativo na detecção de anomalias de vídeo fracamente supervisionadas, mudando o paradigma da classificação binária simples para uma análise interpretável e semanticamente fundamentada. A importância desse método reside em sua capacidade de não apenas identificar se ocorreu uma anomalia, mas também que tipo de anomalia é e por que o modelo chegou a essa conclusão, abordando uma grande limitação nos sistemas WS-VAD existentes

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm conflitos de interesse.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Reconhecemos com gratidão o apoio financeiro fornecido pela Aerospace Hongka Intelligent Technology (Beijing) CO., LTD.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários

BLIP Modelo

Pesquisa SalesforceViT-B/16Usado como codificador de texto para criar âncoras semânticas.
GPUNVIDIARTX 4060TiUsado para treinar o modelo
Modelo I3DGoogle DeepMindPré-treinado em Cinética Usado como base para extração de recursos de vídeo.
DormenteA Equipe de Desenvolvimento do NumPy1.21.2Usado para lidar e processar matrizes numéricas de dados, como os recursos de vídeo, antes de serem inseridos no modelo de aprendizado profundo.
PyTorchPesquisa em IA do Facebook1.8.0Usado para definir a arquitetura do modelo, implementar as funções de perda personalizadas e executar a retropropagação para otimização.
PitãoFundação de Software Python3.8.20Usado para escrever todos os scripts para processamento de dados, implementação de modelos, treinamento e avaliação
Conjunto de Dados ShanghaiTechUniversidade ShanghaiTechUsado para treinamento e avaliação em 13 cenas diferentes do campus.
UCF-Crime Dataset & nbsp;Universidade da Flórida CentralUsado para treinamento e avaliação de 13 categorias de anomalias.
WikidataFundação WikimediaUsado como grafo de conhecimento externo para construção de prompts.

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. 13, 70882-70894 (2025).
  3. Dual memory units with uncertainty regulation for weakly supervised video anomaly detection. Zhou, H., Yu, J., Yang, W. Proc AAAI Conf Artificial Intell, 37 (3), 3769-3777 (2023).
  4. Dynamic local aggregation network with adaptive clusterer for anomaly detection. Yang, Z., Wu, P., Liu, J., Liu, X. Proc Eur Conf Comp Vision, 13664, 404-421 (2022).
  5. Pu, Y., Wu, X., Yang, L., Wang, S. Learning prompt-enhanced context features for weakly-supervised video anomaly detection. IEEE Trans. Image Process. 33 (8), 4923-4936 (2024).
  6. Look around for anomalies: Weakly-supervised anomaly detection via context-motion relational learning. Cho, M., et al. Proc Conf Comp Vision Pattern Recognit, , 12137-12146 (2023).
  7. Tian, Y., et al. Weakly-supervised video anomaly detection with robust temporal feature magnitude learning. Proc Int Conf Comp Vision. , 4955-4966 (2021).
  8. Scale-aware spatio-temporal relation learning for video anomaly detection. Li, G., Cai, G., Zeng, X., Zhao, R. Proc Eur Conf Comp Vision, , 333-350 (2022).
  9. Vadclip: Adapting vision-language models for weakly supervised video anomaly detection. Wu, P., et al. Proc Conf Artificial Intell, 38 (6), 6074-6082 (2024).
  10. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications, and challenges. Comp Elect Eng. 117, 109246(2024).
  11. Vrandecic, D., Kroetzsch, M. Wikidata: A free collaborative knowledgebase. Comm ACM. 57 (10), 78-85 (2014).
  12. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. Li, J., Li, D., Xiong, C., Hoi, S. Proc Int Conf Machine Learning, 162, 12888-12900 (2022).
  13. Real-world anomaly detection in surveillance videos. Sultani, W., Chen, C., Shah, M. I. Proc Conf Comp Vision Pattern Recognit, , 6479-6488 (2018).
  14. Future frame prediction for anomaly detection - a new baseline. Liu, W., Luo, W., Lian, D., Gao, S. I. Proc Conf Comp Vision Pattern Recognit, , 6536-6545 (2018).
  15. Quo vadis, action recognition? A new model and the kinetics dataset. Carreira, J., Zisserman, A. Proc Conf Comp Vision Pattern Recognit, , 6299-6308 (2017).
  16. Kay, W., et al. The kinetics human action video dataset. arXiv. , (2017).
  17. Purba, M., et al. Effect of random splitting and cross validation for Indonesian opinion mining using machine learning approach. Int J Adv Comp Sci Appl. 13 (9), 145-151 (2022).
  18. Wu, P., Liu, X., Liu, J. Weakly supervised audio-visual violence detection. Ieee Transact Multimedia. 25, 1674-1685 (2023).
  19. Liu, T., Lam, K. M., Bao, B. K. Injecting text clues for improving anomalous event detection from weakly labeled videos. Ieee Transact Image Proc. 33, 5907-5920 (2024).
  20. Wu, P., Liu, J. Learning causal temporal relation and feature discrimination for anomaly detection. Ieee Transact Image Proc. 30, 3513-3527 (2021).
  21. Assoc Advancement Artificial, I. Self-training multi-sequence learning with transformer for weakly supervised video anomaly detection. Li, S., Liu, F., Jiao, L. Proc Conf Artificial Intell, 36 (2), 1395-1403 (2022).
  22. Normality guided multiple instance learning for weakly supervised video anomaly detection. Park, S., et al. Proc Winter Conf Appl Comp Vision, , 2664-2673 (2023).
  23. Zanella, L., et al. Delving into clip latent space for video anomaly recognition. Comp Vision Image Understanding. 249, 104163(2024).
  24. Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection. Chen, J., et al. Proc Conf Com Vision Pattern Recognit, , 18319-18329 (2024).
  25. Distilling aggregated knowledge for weakly-supervised video anomaly detection. Dalvi, J., Dabouei, A., Dhanuka, G., Xu, M. Proc Winter Conf Appl Comp Vision, , 5439-5448 (2025).
  26. Gods: Generalized one-class discriminative subspaces for anomaly detection. Wang, J., Cherian, A. I. Proc Int Conf Comp Vision, , 8200-8210 (2019).
  27. Biswas, D., Tesic, J. Mmvad: A vision-language model for cross-domain video anomaly detection with contrastive learning and scale-adaptive frame segmentation. Exp Syst Appl. 285, 127857(2025).
  28. Lim, J., Lee, J., Kim, H., Park, E. Vicap-ad: Video caption-based weakly supervised video anomaly detection. Machine Vision Applicat. 36 (3), 61(2025).
  29. Gao, W., Wang, X., Wang, Y., Jing, X. Dual-stream attention-enhanced memory networks for video anomaly detection. Sensors. 25 (17), 5496(2025).
  30. Duong, H. T., Le, V. T., Hoang, V. T. Deep learning-based anomaly detection in video surveillance: A survey. Sensors. 23 (11), 5024(2023).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

Artigos relacionados