Research Article

Modello semantico allineato all'ancoraggio per il rilevamento di anomalie video interpretabili sotto supervisione debole cross-modale

DOI:

10.3791/69286

November 14th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo mira a migliorare il rilevamento delle anomalie video con supervisione debole integrando conoscenze strutturate. L'obiettivo è quello di consentire la classificazione di specifici tipi di anomalie e fornire spiegazioni chiare e interpretabili per i risultati del rilevamento, andando oltre le semplici decisioni binarie e migliorando la trasparenza.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il rilevamento delle anomalie video con supervisione debole è una tecnica chiave che si basa esclusivamente su etichette a livello di video per identificare gli eventi anomali. Tuttavia, i metodi tradizionali di apprendimento a istanze multiple (MIL) si basano sulla supervisione binaria a grana grossa. Questo approccio rende difficile distinguere tra categorie di anomalie con granularità fine. Questi metodi spesso si concentrano esclusivamente sui segmenti più anomali, con conseguenti risultati di rilevamento privi di interpretabilità. Per superare queste limitazioni, questo studio propone un approccio di modellazione delle caratteristiche che incorpora la conoscenza strutturata. Utilizzando un meccanismo di guida semantica dinamica, il rilevamento delle anomalie video con supervisione debole combina informazioni esterne a livello di categoria con prompt apprendibili per generare segnali semantici all'interno dello spazio delle funzionalità. Questi segnali sono allineati con le evidenze visive estratte dal modulo di rilevamento delle anomalie di base, producendo due output complementari: un punteggio di anomalia per quantificare la gravità degli eventi anomali e descrizioni semantiche allineate con concetti esterni, che possono essere utilizzate per generare testi esplicativi strutturati e interpretabili attraverso modelli predefiniti. I risultati sperimentali dimostrano che il metodo proposto raggiunge un'AUC dell'88,03% sul set di dati UCF-Crime e del 98,23% sul set di dati ShanghaiTech, raggiungendo un'accuratezza dell'87,05% nelle attività di classificazione delle anomalie a grana fine. Inoltre, le spiegazioni semantiche generate estendono il rilevamento debolmente supervisionato da un compito di classificazione binaria a un framework di analisi delle anomalie interpretabile e guidato dalla semantica.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il rilevamento delle anomalie video (VAD) svolge un ruolo essenziale in settori come la sicurezza pubblica e la produzione intelligente, dove offre una soluzione scalabile ai limiti della sorveglianza manuale1. In particolare, il rilevamento delle anomalie video con supervisione debole (WS-VAD) ha acquisito importanza grazie alla sua dipendenza dalle etichette a livello video, riducendo sostanzialmente l'onere dell'annotazione manuale e migliorando la generalizzabilità tra scene diverse. Nonostante i suoi vantaggi pratici, i metodi WS-VAD devono ancora affrontare sfide significative nell'identificare con precisione la natura degli eventi anomali2. I modelli esistenti spesso rilevano la presenza di anomalie, ma faticano a determinarne l'esatta categoria o a fornire informazioni diagnostiche significative 3,4. Ad esempio, in ambienti industriali, un modello potrebbe confondere il fumo dei cuscinetti surriscaldati con emissioni di vapore innocue o ritenere erroneamente che le normali scintille di saldatura siano segni precoci di incendio, portando a costosi errori di valutazione e arresti non necessari. Queste confusioni semantiche derivano dalle limitazioni intrinseche degli attuali approcci WS-VAD5. Le etichette binarie a livello di video indicano semplicemente se esiste un'anomalia, senza offrire informazioni dettagliate sulla causa, la posizione e la gravità. Inoltre, i framework MIL (Multiple Instance Learning) tradizionali6 aggregano previsioni a livello di clip utilizzando semplici euristiche7 che non riescono a catturare la semantica sfumata di diversi tipi di eventi. Di conseguenza, lo spazio delle caratteristiche visive apprese diventa ambiguo, in cui fenomeni visivamente simili ma semanticamente distinti, come il fumo e il vapore, sono mappati troppo da vicino, offuscando i confini decisionali.

Sono emerse due principali direzioni di ricerca per affrontare queste limitazioni. Uno si concentra sul miglioramento del framework MIL attraverso una migliore modellazione temporale 4,5,8 o la selezione delle caratteristiche guidata dalla salienza3. Sebbene tali metodi migliorino la localizzazione delle anomalie, non sono ancora in grado di offrire chiarezza semantica e interpretabilità. L'altra direzione prevede l'allineamento delle rappresentazioni della visione e del linguaggio integrando modelli multimodali pre-addestrati, come VadCLIP9. Sebbene questa strategia sia promettente, spesso non riesce a sfruttare appieno la ricchezza semantica del linguaggio. Ciò porta a deboli associazioni intermodali e processi decisionali opachi, con conseguenti due carenze fondamentali. In primo luogo, i modelli attuali non sono in grado di distinguere in modo coerente tra le categorie di anomalie a causa di una semantica vaga delle funzionalità e di una conoscenza esterna insufficiente. In secondo luogo, il processo decisionale contiene una scatola nera, senza una spiegazione trasparente del motivo per cui un particolare evento è classificato come anomalo. Sebbene alcuni metodi incorporino suggerimenti testuali (ad esempio, combattimenti, sparatorie), questi sono sempre semplicistici e poco organizzati, privi sia di profondità semantica che di comprensione contestuale.

Per colmare queste lacune, viene introdotto un nuovo metodo WS-VAD che integra conoscenze esterne strutturate con meccanismi decisionali interpretabili, un obiettivo fondamentale nel più ampio campo dell'Intelligenza Artificiale Spiegabile (XAI)10. Invece di utilizzare i nomi delle categorie di base come suggerimenti, il metodo costruisce ricche rappresentazioni semantiche, denominate nuvole di concetti semantici, utilizzando Wikidata11. A differenza dei metodi multimodali esistenti come VadCLIP9 che si basano su prompt di testo statici o semplici etichette di categoria, queste nuvole concettuali semantiche incapsulano una conoscenza contestuale completa, comprese entità correlate, attributi e relazioni causali estratte da grafi di conoscenza strutturati. Questi cloud concettuali vengono codificati in ancoraggi semantici usando il modello BLIP12, che consente al sistema di accedere alla semantica degli eventi con granularità fine. L'innovazione chiave del meccanismo di ancoraggio semantico risiede nella sua capacità di creare rappresentazioni dinamiche e arricchite di conoscenza che si adattano a specifici contesti di anomalia, mentre i precedenti metodi basati su prompt utilizzano descrizioni testuali fisse che mancano di profondità contestuale e relazioni semantiche. Per perfezionare ulteriormente lo spazio delle funzionalità, un meccanismo di allineamento guidato dalla salienza associa selettivamente questi ancoraggi con le prove visive più rilevanti. Questo allineamento mirato migliora il potere discriminante delle funzionalità, migliorando al contempo la chiarezza semantica dei risultati del rilevamento. Ancora più importante, il metodo proposto supporta un'interpretazione trasparente. Una volta che un'ancora semantica è allineata con l'evidenza visiva, il modello genera spiegazioni strutturate in linguaggio naturale utilizzando modelli predefiniti, affrontando in modo esplicito sia la natura che la giustificazione dell'anomalia. È importante notare che l'implementazione di questo metodo si basa su prerequisiti specifici, tra cui l'uso di funzionalità visive I3D pre-estratte, l'accesso a una base di conoscenza esterna (Wikidata) e un codificatore BLIP pre-addestrato. Il framework è quindi più vantaggioso nelle applicazioni in cui è fondamentale andare oltre il semplice rilevamento binario per classificare invece tipi di anomalie specifici e fornire giustificazioni interpretabili per i risultati.

I contributi principali sono i seguenti. Un nuovo metodo WS-VAD è stato sviluppato combinando conoscenze esterne con un'interpretabilità strutturata per migliorare la comprensione semantica e la trasparenza delle decisioni. Per superare i limiti dei modelli MIL solo visivi, vengono introdotti un metodo di prompt basato sull'incorporamento semantico e un meccanismo di allineamento sensibile al contesto. Viene incorporato un modulo di spiegazione generativa, che utilizza ancore semantiche come unità interpretabili per produrre razionali testuali coerenti. Esperimenti approfonditi condotti sui set di dati UCF-Crime e ShanghaiTech dimostrano l'efficacia del metodo proposto, ottenendo punteggi AUC elevati (88,03% / 98,23%) e prestazioni di riconoscimento granulare superiori, con output chiari e interpretabili.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio utilizza solo set di dati disponibili pubblicamente (UCF-Crime13 e ShanghaiTech14). Tutti i video sono stati ottenuti dalle versioni ufficiali dei set di dati, che rendono anonime le informazioni di identificazione personale nella misura fornita dai manutentori del set di dati. Gli autori non hanno condotto alcuna ulteriore raccolta di dati o interazione tra soggetti umani; pertanto, non è stata richiesta alcuna nuova approvazione dell'IRB. L'utilizzo dei dati è conforme alle licenze e ai termini di utilizzo dei rispettivi set di dati.

Preparazione dei dati ed estrazione delle feature

Preparazione del set di dati: i set di dati UCF-Crime13 (1.610 treni/290 video di test) e ShanghaiTech14 (238 treni/199 video di test) sono stati adottati secondo le loro suddivisioni standard. I video sono stati pre-elaborati utilizzando FFmpeg per garantire la riproducibilità, ricodificati in H.264, ricampionati a 25 fps e ridimensionati a una risoluzione di 256 x 256 con il comando: ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset very fast pre/.

Estrazione delle caratteristiche: le caratteristiche RGB sono state estratte da una dorsale I3D15 pre-addestrata sul set di dati Kinetics16. I video sono stati suddivisi in clip da 16 fotogrammi non sovrapposte; Ogni clip è stata ritagliata al centro a 224 x 224 pixel. Le attivazioni del penultimo livello sono state raggruppate in media per ottenere una funzione 1024-D per clip. In PyTorch, ciò corrisponde all'inoltro dei tensori di forma [B, 3, T, H, W] attraverso la dorsale I3D e all'applicazione di adaptive_avg_pool3d seguito dall'appiattimento. Le funzioni estratte sono state salvate in file .npy (uno per video) insieme ai timestamp delle clip per un'esatta riproducibilità (seed = 123). Per ogni video, features///

Architettura e metodologia del modello

Rilevamento di base: fusione del contesto temporale
Data una sequenza di clip video rappresentata da una matrice di caratteristiche Z figure-protocol-1 RTx1024, il modulo Temporal Context Fusion (TCF) ha prima calcolato le rappresentazioni di query, chiave e valore attraverso tre proiezioni lineari apprese:

Q = ZWQ, K = ZWK, V = ZWV (1)

dove WQ, WK, WV figure-protocol-2 RTx1024xd sono parametri addestrabili (PyTorch: tre nn. Lineari (1024,d) strati). L'affinità intersegmento era S = figure-protocol-3, è stato incorporato un Temporal Relationality Embedding (TRE), in cui ogni elemento è stato calcolato come Rij = α exp (figure-protocol-4) + β . L'affinità con riconoscimento della posizione era figure-protocol-5 = S + R. Una mappa di contesto globale A = softmax(figure-protocol-6) aggregata V per ottenere funzionalità di ampia area G = AV. Le caratteristiche locali L sono state calcolate con una convoluzione 1D in profondità (nn. Conv1d) di dimensione del kernel 3 su Z. Una porta dinamica g = σ(MLP ([G;L])) mescolato i due: U = gfigure-protocol-7 G + (1 - g) figure-protocol-8 L . Infine, la normalizzazione dello strato e uno strato lineare residuo sono stati applicati per produrre Y (Pytorch:LayerNorm+Linear+residual).

Rilevazione di base: predittore temporale causale

L'output Y è stato passato attraverso due convoluzioni causali 1-D con GELU e dropout (Pytorch:padding='causal' o conv. mascherato) per ottenere i logici delle anomalie per clip. L'applicazione della funzione sigmoidale ha prodotto valori figure-protocol-9 di probabilità [0,1]T.

Miglioramento semantico: apprendimento rapido con conoscenze esterne

Costrut ancore semantiche : Per ogni anomalia classe c, Kc i concetti sono stati interrogati da Wikidata11 e codificati ogni frase concettuale è stata codificata con l'encoderdi testo 12di BLIP a eifigure-protocol-10R768. L'ancora di classe era la media l 2-normalizzata Dc = norm(figure-protocol-11Σiei) . Per ridurre il rumore, i concetti con somiglianza del coseno con il nome della classe inferiore a 0,2 sono stati eliminati e il punteggio top-M di TF-IDF è stato mantenuto.  

Eseguire la separazione sensibile al contesto: i pesi in primo piano αt = softmax(rst) sono stati calcolati dai punteggi del rivelatore di base st e dai pesi di fondo bt = softmax(r(1 - st)). Le caratteristiche ponderate sono ffg = Σtαzt e fbg = Σtbzt .

Allineare le funzionalità visive e semantiche

Definire l'obiettivo dell'allineamento: durante la fase di allineamento, l'obiettivo è ridurre al minimo la distanza tra l'elemento visivo in primo piano e il corrispondente ancoraggio semantico della categoria anomala all'interno dello spazio dell'elemento. Crea una raccolta di guide semantiche, figure-protocol-12, comprendente guide semantiche di categoria anomale C e una guida semantica normale standard. Determinare la probabilità, P(Dk|v), che una caratteristica visiva, v, corrisponde alla k-esima guida semantica, Dk. Calcola questo utilizzando la somiglianza del coseno in scala di temperatura seguita dalla normalizzazione Softmax, come mostrato nell'Eq. (2).

figure-protocol-13(2)

L'entropia incrociata è stata minimizzata per unire le coppie positive e separare i negativi, impostando τs come parametro apprendibile e inizializzandolo a 10. Realizzare l'allineamento ottimizzando la probabilità di correlare coppie di campioni positivi e riducendo la probabilità di correlare coppie di campioni negativi.

Modulo di interpretabilità basato su modelli

Sulla base della rappresentazione delle caratteristiche potenziata dall'apprendimento rapido con conoscenza esterna (PLE), un classificatore lineare produce logiti per classe, che sono stati successivamente normalizzati in probabilità di classe dalla funzione softmax; Il tipo di anomalia stimato è stato determinato come categoria con la probabilità più alta. Nel frattempo, è stato calcolato un punteggio di anomalia globale dall'output del rivelatore. Per determinare il livello di gravità, questo punteggio è stato confrontato con tre soglie predefinite ottimizzate tramite la ricerca a griglia sul set di convalida.

Le soglie predefinite sono state impostate su θalto = 0,8, θmedio = 0,5 e θbasso = 0,2. In particolare, se il punteggio era maggiore di θalto, la gravità veniva etichettata come alta; Se il punteggio è compreso tra θmedio e θalto, è stato etichettato come medio; se compreso tra θbasso e θmedio, era etichettato come basso; in caso contrario, è stato contrassegnato come nessuno.

Durante la fase di generazione della spiegazione, è stato selezionato un modello corrispondente al tipo previsto da una libreria di modelli predefinita, File supplementare 1. Questa libreria contiene più varianti di modello che sono state convalidate in modo incrociato da più annotatori17 per migliorare la diversità del testo generato. Se il tipo stimato è presente nella libreria di modelli, è stato selezionato in modo casuale un modello corrispondente. in caso contrario, è stato utilizzato un modello predefinito per il tipo Sconosciuto. Infine, è stato generato un testo esplicativo strutturato integrando il tipo previsto, il punteggio di anomalia globale, la descrizione della gravità e il modello selezionato. Il sistema restituisce il tipo di anomalia stimato, il punteggio di anomalia globale e il testo esplicativo generato come output finale. I risultati sono illustrati nella Figura 2.

Tutti i parametri di soglia sono stati ottimizzati utilizzando la ricerca a griglia sul set di convalida e la qualità delle spiegazioni generate è stata valutata in modo completo utilizzando sia la valutazione umana che le metriche automatizzate. I risultati sono presentati nella Tabella 1.

Formazione e valutazione dei modelli

Formazione: Il modello è stato addestrato end-to-end con Adam (lr 1 x 10-4, decadimento del peso 5 x 10-4), dimensione del lotto 128, 50 epoche, ricottura del coseno per lr. I semi casuali sono stati impostati su 123 per Python/Numpy/Pytorch e abilitati torch.backends.cudnn.deterministic=True. I checkpoint sono stati salvati ogni 5 epoche in checkpoints//epoch_XX.pt e il modello migliore è stato selezionato mediante AUC di convalida. Tutti gli esperimenti sono stati condotti su un sistema con una GPU NVIDIA GeForce RTX 4060 Ti (16 GB) con Windows 11, con Python 3.8.20, PyTorch 1.8.0 e CUDA 11.1. Il tempo di addestramento approssimativo per epoca era di 30 s per il set di dati ShanghaiTech e di 3,5 minuti per il set di dati UCF-Crime.

Perdita: l'obiettivo generale è L = LMIL+ λ • Lalign. L'iperparametro λ è stato analizzato attraverso l'insieme {0,01,0,1,0,5,1,10} sul set di convalida e ha corretto il valore migliore fissato per la segnalazione dei test. Vedere la Figura 3 per l'aggregazione MIL top-K e l'Eq.(3-4) per le definizioni.

figure-protocol-14(3)

figure-protocol-15(4)

Valutazione: L'AUC a livello di frame è stata calcolata seguendo il protocollo standard utilizzato dai precedenti lavori WS-VAD 2,5. Per il riconoscimento granulare del tipo su UCF-Crime, sono stati riportati mAP a IoU 0,1-0,5 e mAP AVG, come riassunto nella Tabella 2; Le AUC per classe sono mostrate nella Figura 4 e i risultati complessivi nella Tabella 3 e nella Tabella 4; l'incorporamento delle dinamiche di separabilità e punteggio di anomalia si trovano nella Figura 4, nella Figura 5 e nella Figura 6.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Per convalidare ulteriormente l'utilità degli ancoraggi semantici, è stato condotto un ulteriore esperimento per confrontare diversi modelli di prompt (vedi Tabella 1). La variante che utilizza prototipi semantici aumentati da Wikidata non solo ha raggiunto valori AUC più elevati, ma ha anche portato a miglioramenti del punteggio BLEU-4 di 16,6 e 14,8 per le spiegazioni generate. Questi risultati indicano un forte legame tra la ricchezza semantica dei suggerimenti e la q...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il protocollo qui presentato introduce un progresso significativo nel rilevamento di anomalie video debolmente supervisionato, spostando il paradigma dalla semplice classificazione binaria a un'analisi semanticamente fondata e interpretabile. Il significato di questo metodo risiede nella sua capacità non solo di identificare se si è verificata un'anomalia, ma anche di che tipo di anomalia si tratta e perché il modello è giunto a tale conclusione, affrontando una delle principali limitazi...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno conflitti di interesse.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Riconosciamo con gratitudine il sostegno finanziario fornito da Aerospace Hongka Intelligent Technology (Beijing) CO., LTD.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments

BLIP Model

Salesforce ResearchViT-B/16Utilizzato come codificatore di testo per creare ancoraggi semantiche.
GPUNVIDIARTX 4060TiUtilizzato per l'addestramento del modello
Modello i3DGoogle DeepMindPre-addestrato su Cinetica Utilizzato come spina dorsale per l'estrazione di contenuti video.
IntorpiditoIl Team di Sviluppo NumPy1.21.2Utilizzato per gestire ed elaborare array di dati numerici, come le funzionalità video, prima che vengano inseriti nel modello di deep learning.
PyTorchRicerca su Facebook AI1.8.0Utilizzato per definire l'architettura del modello, implementare le funzioni di perdita personalizzate ed eseguire la retropropagazione per l'ottimizzazione.
PitonePython Software Foundation3.8.20Utilizzato per scrivere tutti gli script per l'elaborazione dati, l'implementazione dei modelli, l'addestramento e la valutazione
ShanghaiTech DatasetUniversità ShanghaiTechUtilizzato per formazione e valutazione in 13 diverse scene del campus.
UCF-Crime Dataset  Università della Florida CentraleUtilizzato per l'addestramento e la valutazione di 13 categorie di anomalie.
WikidataFondazione WikimediaUtilizzato come grafo di conoscenza esterno per la costruzione di prompt.

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. 13, 70882-70894 (2025).
  3. Dual memory units with uncertainty regulation for weakly supervised video anomaly detection. Zhou, H., Yu, J., Yang, W. Proc AAAI Conf Artificial Intell, 37 (3), 3769-3777 (2023).
  4. Dynamic local aggregation network with adaptive clusterer for anomaly detection. Yang, Z., Wu, P., Liu, J., Liu, X. Proc Eur Conf Comp Vision, 13664, 404-421 (2022).
  5. Pu, Y., Wu, X., Yang, L., Wang, S. Learning prompt-enhanced context features for weakly-supervised video anomaly detection. IEEE Trans. Image Process. 33 (8), 4923-4936 (2024).
  6. Look around for anomalies: Weakly-supervised anomaly detection via context-motion relational learning. Cho, M., et al. Proc Conf Comp Vision Pattern Recognit, , 12137-12146 (2023).
  7. Tian, Y., et al. Weakly-supervised video anomaly detection with robust temporal feature magnitude learning. Proc Int Conf Comp Vision. , 4955-4966 (2021).
  8. Scale-aware spatio-temporal relation learning for video anomaly detection. Li, G., Cai, G., Zeng, X., Zhao, R. Proc Eur Conf Comp Vision, , 333-350 (2022).
  9. Vadclip: Adapting vision-language models for weakly supervised video anomaly detection. Wu, P., et al. Proc Conf Artificial Intell, 38 (6), 6074-6082 (2024).
  10. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications, and challenges. Comp Elect Eng. 117, 109246(2024).
  11. Vrandecic, D., Kroetzsch, M. Wikidata: A free collaborative knowledgebase. Comm ACM. 57 (10), 78-85 (2014).
  12. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. Li, J., Li, D., Xiong, C., Hoi, S. Proc Int Conf Machine Learning, 162, 12888-12900 (2022).
  13. Real-world anomaly detection in surveillance videos. Sultani, W., Chen, C., Shah, M. I. Proc Conf Comp Vision Pattern Recognit, , 6479-6488 (2018).
  14. Future frame prediction for anomaly detection - a new baseline. Liu, W., Luo, W., Lian, D., Gao, S. I. Proc Conf Comp Vision Pattern Recognit, , 6536-6545 (2018).
  15. Quo vadis, action recognition? A new model and the kinetics dataset. Carreira, J., Zisserman, A. Proc Conf Comp Vision Pattern Recognit, , 6299-6308 (2017).
  16. Kay, W., et al. The kinetics human action video dataset. arXiv. , (2017).
  17. Purba, M., et al. Effect of random splitting and cross validation for Indonesian opinion mining using machine learning approach. Int J Adv Comp Sci Appl. 13 (9), 145-151 (2022).
  18. Wu, P., Liu, X., Liu, J. Weakly supervised audio-visual violence detection. Ieee Transact Multimedia. 25, 1674-1685 (2023).
  19. Liu, T., Lam, K. M., Bao, B. K. Injecting text clues for improving anomalous event detection from weakly labeled videos. Ieee Transact Image Proc. 33, 5907-5920 (2024).
  20. Wu, P., Liu, J. Learning causal temporal relation and feature discrimination for anomaly detection. Ieee Transact Image Proc. 30, 3513-3527 (2021).
  21. Assoc Advancement Artificial, I. Self-training multi-sequence learning with transformer for weakly supervised video anomaly detection. Li, S., Liu, F., Jiao, L. Proc Conf Artificial Intell, 36 (2), 1395-1403 (2022).
  22. Normality guided multiple instance learning for weakly supervised video anomaly detection. Park, S., et al. Proc Winter Conf Appl Comp Vision, , 2664-2673 (2023).
  23. Zanella, L., et al. Delving into clip latent space for video anomaly recognition. Comp Vision Image Understanding. 249, 104163(2024).
  24. Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection. Chen, J., et al. Proc Conf Com Vision Pattern Recognit, , 18319-18329 (2024).
  25. Distilling aggregated knowledge for weakly-supervised video anomaly detection. Dalvi, J., Dabouei, A., Dhanuka, G., Xu, M. Proc Winter Conf Appl Comp Vision, , 5439-5448 (2025).
  26. Gods: Generalized one-class discriminative subspaces for anomaly detection. Wang, J., Cherian, A. I. Proc Int Conf Comp Vision, , 8200-8210 (2019).
  27. Biswas, D., Tesic, J. Mmvad: A vision-language model for cross-domain video anomaly detection with contrastive learning and scale-adaptive frame segmentation. Exp Syst Appl. 285, 127857(2025).
  28. Lim, J., Lee, J., Kim, H., Park, E. Vicap-ad: Video caption-based weakly supervised video anomaly detection. Machine Vision Applicat. 36 (3), 61(2025).
  29. Gao, W., Wang, X., Wang, Y., Jing, X. Dual-stream attention-enhanced memory networks for video anomaly detection. Sensors. 25 (17), 5496(2025).
  30. Duong, H. T., Le, V. T., Hoang, V. T. Deep learning-based anomaly detection in video surveillance: A survey. Sensors. 23 (11), 5024(2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

Related Articles