Article de recherche

Modèle sémantique aligné sur l’ancrage pour la détection d’anomalies vidéo interprétables sous supervision faible intermodale

DOI :

10.3791/69286

14 novembre 2025

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole vise à améliorer la détection d’anomalies vidéo faiblement supervisées en intégrant des connaissances structurées. Son objectif est de permettre la classification de types d’anomalies spécifiques et de fournir des explications claires et interprétables pour les résultats de détection, en allant au-delà des simples décisions binaires et en améliorant la transparence.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La détection d’anomalies vidéo faiblement supervisée est une technique clé qui repose uniquement sur des étiquettes de niveau vidéo pour identifier les événements anormaux. Cependant, les méthodes traditionnelles d’apprentissage à instances multiples (MIL) reposent sur une supervision binaire grossière. Cette approche rend difficile la distinction entre les catégories d’anomalies à grain fin. Ces méthodes se concentrent souvent uniquement sur les segments les plus anormaux, ce qui entraîne des résultats de détection qui manquent d’interprétabilité. Pour pallier ces limites, cette étude propose une approche de modélisation des caractéristiques qui intègre des connaissances structurées. En utilisant un mécanisme de guidage sémantique dynamique, la détection d’anomalies vidéo faiblement supervisée combine des informations externes au niveau de la catégorie avec des invites apprenantes pour générer des signaux sémantiques dans l’espace des fonctionnalités. Ces signaux sont alignés avec les preuves visuelles extraites par le module de détection d’anomalies de base, produisant deux sorties complémentaires : un score d’anomalie pour quantifier la gravité des événements anormaux, et des descriptions sémantiques alignées sur des concepts externes, qui peuvent être utilisées pour générer des textes explicatifs structurés et interprétables à travers des modèles prédéfinis. Les résultats expérimentaux démontrent que la méthode proposée atteint une AUC de 88,03 % sur l’ensemble de données UCF-Crime et de 98,23 % sur l’ensemble de données ShanghaiTech, atteignant une précision de 87,05 % dans les tâches de classification des anomalies à grain fin. De plus, les explications sémantiques générées étendent la détection faiblement supervisée d’une tâche de classification binaire à un cadre d’analyse des anomalies interprétable et basé sur la sémantique.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La détection vidéo des anomalies (DAV) joue un rôle essentiel dans des domaines tels que la sécurité publique et la fabrication intelligente, où elle offre une solution évolutive aux limites de la surveillance manuelle1. En particulier, la détection d’anomalies vidéo faiblement supervisée (WS-VAD) a gagné en importance en raison de sa dépendance aux étiquettes de niveau vidéo, réduisant considérablement la charge de l’annotation manuelle tout en améliorant la généralisabilité à diverses scènes. Malgré leurs avantages pratiques, les méthodes WS-VAD sont toujours confrontées à des défis importants pour identifier avec précision la nature des événements anormaux2. Les modèles existants détectent souvent la présence d’anomalies, mais ont du mal à déterminer leur catégorie exacte ou à fournir des informations diagnostiques significatives 3,4. Par exemple, dans les environnements industriels, un modèle peut confondre la fumée des roulements surchauffés avec des émissions de vapeur inoffensives ou croire à tort que les étincelles de soudage normales sont des signes précoces d’incendie, ce qui entraîne des erreurs de jugement coûteuses et des arrêts inutiles. Ces confusions sémantiques proviennent des limites inhérentes aux approches actuelles de WS-VAD5. Les étiquettes binaires au niveau de la vidéo indiquent simplement l’existence d’une anomalie, sans donner d’informations sur sa cause, son emplacement et sa gravité. De plus, les cadres d’apprentissage à instances multiples (MIL) 6 agrégent les prédictions au niveau des clips à l’aide d’heuristiques simples7 qui ne parviennent pas à capturer la sémantique nuancée des différents types d’événements. En conséquence, l’espace des caractéristiques visuelles apprises devient ambigu, où des phénomènes visuellement similaires mais sémantiquement distincts - tels que la fumée et la vapeur - sont cartographiés de trop près, brouillant les frontières de décision.

Deux grandes orientations de recherche ont émergé pour remédier à ces limites. L’un d’eux se concentre sur l’amélioration du cadre MIL par le biais d’une modélisation temporelle améliorée 4,5,8 ou d’une sélection de caractéristiques guidée par la saillance3. Bien que ces méthodes améliorent la localisation des anomalies, elles ne parviennent toujours pas à offrir une clarté sémantique et une interprétabilité. L’autre direction consiste à aligner les représentations de la vision et du langage en intégrant des modèles multimodaux pré-entraînés, tels que VadCLIP9. Bien que cette stratégie soit prometteuse, elle ne parvient souvent pas à exploiter pleinement la richesse sémantique du langage. Cela conduit à de faibles associations intermodales et à des processus de prise de décision opaques, ce qui entraîne deux lacunes fondamentales. Tout d’abord, les modèles actuels ne peuvent pas faire la distinction entre les catégories d’anomalies en raison d’une sémantique de caractéristiques vague et d’une connaissance externe insuffisante. Deuxièmement, le processus de prise de décision contient une boîte noire, sans explication transparente de la raison pour laquelle un événement particulier est classé comme anormal. Bien que certaines méthodes intègrent des invites textuelles (par exemple, se battre, tirer), celles-ci sont toujours simplistes et mal organisées, manquant à la fois de profondeur sémantique et de compréhension contextuelle.

Pour combler ces lacunes, une nouvelle méthode WS-VAD est introduite qui intègre des connaissances externes structurées avec des mécanismes de décision interprétables, un objectif central dans le domaine plus large de l’intelligence artificielle explicable (XAI)10. Au lieu d’utiliser des noms de catégories de base comme invites, la méthode construit des représentations sémantiques riches, appelées nuages de concepts sémantiques, à l’aide de Wikidata11. Contrairement aux méthodes multimodales existantes telles que VadCLIP9 qui reposent sur des invites de texte statiques ou de simples étiquettes de catégorie, ces nuages de concepts sémantiques encapsulent des connaissances contextuelles complètes, y compris des entités associées, des attributs et des relations causales extraites de graphes de connaissances structurés. Ces nuages de concepts sont codés en ancres sémantiques à l’aide du modèle BLIP12, qui permet au système d’accéder à une sémantique d’événement à granularité fine. La principale innovation du mécanisme d’ancrage sémantique réside dans sa capacité à créer des représentations dynamiques, enrichies de connaissances, qui s’adaptent à des contextes d’anomalie spécifiques, alors que les méthodes précédentes basées sur l’invite utilisaient des descriptions textuelles fixes qui manquaient de profondeur contextuelle et de relations sémantiques. Pour affiner davantage l’espace des caractéristiques, un mécanisme d’alignement guidé par la saillance associe sélectivement ces ancres aux preuves visuelles les plus pertinentes. Cet alignement ciblé renforce le pouvoir discriminant des caractéristiques tout en améliorant la clarté sémantique des résultats de détection. Plus important encore, la méthode proposée favorise une interprétation transparente. Une fois qu’un ancrage sémantique est aligné avec des preuves visuelles, le modèle génère des explications structurées en langage naturel à l’aide de modèles prédéfinis, abordant explicitement à la fois la nature et la justification de l’anomalie. Il est important de noter que la mise en œuvre de cette méthode repose sur des prérequis spécifiques, notamment l’utilisation de fonctionnalités visuelles I3D pré-extraites, l’accès à une base de connaissances externe (Wikidata) et un encodeur BLIP pré-entraîné. Le cadre est donc plus avantageux dans les applications où il est essentiel d’aller au-delà de la simple détection binaire pour classer des types d’anomalies spécifiques et fournir des justifications interprétables des résultats.

Les principales contributions sont les suivantes. Une nouvelle méthode WS-VAD est développée en combinant des connaissances externes avec une interprétabilité structurée pour améliorer la compréhension sémantique et la transparence des décisions. Une méthode d’incitation basée sur l’intégration sémantique et un mécanisme d’alignement contextuel sont introduits pour surmonter les limites des modèles MIL uniquement visuels. Un module d’explication générative est incorporé, en utilisant des ancres sémantiques comme unités interprétables pour produire des justifications textuelles cohérentes. Des expériences approfondies menées sur les ensembles de données UCF-Crime et ShanghaiTech démontrent l’efficacité de la méthode proposée, obtenant de solides scores AUC (88,03 % / 98,23 %) et des performances de reconnaissance fine supérieures, avec des résultats clairs et interprétables.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude n’utilise que des ensembles de données accessibles au public (UCF-Crime13 et ShanghaiTech14). Toutes les vidéos ont été obtenues à partir des versions officielles des ensembles de données, qui anonymisent les informations personnellement identifiables dans la mesure fournie par les responsables de l’ensemble de données. Aucune collecte de données supplémentaire ou interaction avec un sujet humain n’a été effectuée par les auteurs ; par conséquent, aucune nouvelle approbation du CISR n’était requise. L’utilisation des données est conforme aux licences et aux conditions d’utilisation des ensembles de données respectifs.

Préparation des données et extraction des caractéristiques

Préparation de l’ensemble de données : Les ensembles de données UCF-Crime13 (1 610 trains/290 vidéos de test) et ShanghaiTech14 (238 trains/199 vidéos de test) ont été adoptés dans le cadre de leurs divisions standard. Les vidéos ont été prétraitées à l’aide de FFmpeg pour assurer la reproductibilité, réencodées en H.264, rééchantillonnées à 25 ips et redimensionnées à une résolution de 256 x 256 avec la commande : ffmpeg -i v.mp4 -vf « fps=25,scale=256:256 » -c :v libx264 -crf 23 -preset veryfast pre/.

Extraction de caractéristiques : Les caractéristiques RVB ont été extraites par un backbone I3D15 pré-entraîné sur le jeu de données Kinetics16. Les vidéos ont été divisées en clips de 16 images qui ne se chevauchaient pas ; Chaque clip a été recadré au centre à 224 x 224 pixels. Les activations de l’avant-dernière couche ont été regroupées en moyenne pour obtenir une caractéristique 1024-D par clip. Dans PyTorch, cela correspond à l’acheminement des tenseurs de forme [B, 3, T, H, W] à travers le squelette I3D et à l’application de adaptive_avg_pool3d suivie d’un aplatissement. Les caractéristiques extraites ont été enregistrées dans des fichiers .npy (un par vidéo) avec les horodatages des clips pour une reproductibilité exacte (graine = 123). Pour chaque vidéo, features///

Architecture du modèle et méthodologie

Détection de base : fusion de contextes temporels
À partir d’une séquence de clip vidéo représentée par une matrice de caractéristiques Z figure-protocol-1 RTx1024, le module TCF (Temporal Context Fusion) a d’abord calculé des représentations de requêtes, de clés et de valeurs à l’aide de trois projections linéaires apprises :

Q =ZW Q, K = ZWK, V = ZWV (1)

WQ, WK, WV figure-protocol-2 RTx1024x d sontdes paramètres pouvant être entraînés (PyTorch : trois nn. Couches linéaires (1024,d)). L’affinité intersegment était S = figure-protocol-3, un plongement de relationnalité temporelle (TRE) a été incorporé, où chaque élément a été calculé comme Rij = α exp (figure-protocol-4) + β . L’affinité sensible à l’emplacement était figure-protocol-5 = S + R. Une carte de contexte global A = softmax(figure-protocol-6) agrégée V pour obtenir des entités à large aire G = AV. Les caractéristiques locales L ont été calculées avec une convolution 1-D en profondeur (nn. Conv1d) de la taille du noyau 3 sur Z. Une porte dynamique g = σ(MLP ([G ;L])) a mélangé les deux : U = gfigure-protocol-7 G + (1 - g) figure-protocol-8 L . Enfin, la normalisation de la couche et une couche linéaire résiduelle ont été appliquées pour produire Y (Pytorch :LayerNorm+Linear+residual).

Détection de base : prédicteur temporel causal

La sortie Y a été transmise à travers deux circonvolutions 1D causales avec GELU et dropout (Pytorch :padding='causal' ou conv masquée) pour obtenir des logits d’anomalie par clip. L’application de la fonction sigmoïde a donné des valeurs figure-protocol-9 de probabilité [0,1]T.

Amélioration sémantique : apprentissage rapide avec des connaissances externes

Construire des ancres sémantiques : Pour chaque anomalie de classe c, les concepts Kc ont été interrogés à partir de Wikidata11, et encodés chaque phrase de concept a été encodé avec l’encodeur de texte12de BLIP à eifigure-protocol-10R768. L’ancre de classe était la moyenne normalisée l2 Dc = norme(figure-protocol-11Σi ei) . Pour réduire le bruit, les concepts dont la similarité cosinus avec le nom de la classe est inférieure à 0,2 ont été abandonnés et le score M supérieur par TF-IDF a été conservé.  

Effectuer une séparation contextuelle : Les poids de premier plan αt = softmax(rst) ont été calculés à partir des scores de détecteur de base st, et des poids d’arrière-plan bt = softmax(r(1 - st)). Les caractéristiques pondérées sont ffg = Σt αzt et fbg = Σtbzt .

Aligner les fonctionnalités visuelles et sémantiques

Définir l’objectif d’alignement : au cours de l’étape d’alignement, l’objectif est de minimiser la distance entre l’élément visuel de premier plan et son ancrage sémantique correspondant de la catégorie anormale dans l’espace des entités. Créez une collection de guides sémantiques, figure-protocol-12comprenant des guides sémantiques de catégorie anormale C et un guide sémantique normal standard. Déterminer la vraisemblance, P(Dk|v), qu’une caractéristique visuelle, v, correspond au k-ième guide sémantique, Dk. Calculez cela en utilisant la similarité cosinus à l’échelle de la température suivie de la normalisation Softmax, comme indiqué dans l’équation (2).

figure-protocol-13(2)

L’entropie croisée a été minimisée pour rapprocher les paires positives et les paires négatives, en fixant τs comme paramètre apprenable et en l’initialisant à 10. Réalisez l’alignement en optimisant la probabilité de corréler des paires d’échantillons positives tout en réduisant la probabilité de corréler des paires d’échantillons négatives.

Module d’interprétabilité basé sur des modèles

Sur la base de la représentation de caractéristiques améliorée par l’apprentissage rapide avec connaissances externes (PLE), un classificateur linéaire produit des logits par classe, qui ont ensuite été normalisés en probabilités de classe par la fonction softmax ; Le type d’anomalie prédit a été déterminé comme étant la catégorie avec la probabilité la plus élevée. Pendant ce temps, un score d’anomalie global a été calculé à partir de la sortie du détecteur. Pour déterminer le niveau de gravité, ce score a été comparé à trois seuils prédéfinis optimisés par la recherche en grille sur l’ensemble de validation.

Les seuils par défaut ont été fixés à θélevé = 0,8, θmoyen = 0,5 et θfaible = 0,2. Plus précisément, si le score était supérieur à θélevé, la gravité était étiquetée comme élevée ; si le score se situe entre θmoyen et θélevé, il a été étiqueté comme moyen ; si entre θfaible et θmoyen, il était étiqueté comme faible ; sinon, il était marqué comme aucun.

Lors de la phase de génération d’explications, un modèle correspondant au type prédit a été sélectionné à partir d’une bibliothèque de modèles prédéfinie, le Fichier Supplémentaire 1. Cette bibliothèque contient plusieurs variantes de modèles qui ont été validées par plusieurs annotateurs17 afin d’améliorer la diversité du texte généré. Si le type prédit existe dans la bibliothèque de modèles, un modèle correspondant a été sélectionné de manière aléatoire ; sinon, un modèle par défaut pour le type Inconnu a été utilisé. Enfin, un texte explicatif structuré a été généré en intégrant le type prédit, le score d’anomalie global, la description de la gravité et le modèle sélectionné. Le système renvoie le type d’anomalie prédit, le score d’anomalie global et le texte explicatif généré en tant que sortie finale. Les résultats sont illustrés à la figure 2.

Tous les paramètres de seuil ont été optimisés à l’aide de la recherche par grille sur l’ensemble de validation, et la qualité des explications générées a été évaluée de manière exhaustive à l’aide d’une évaluation humaine et de mesures automatisées. Les résultats sont présentés dans le tableau 1.

Formation et évaluation du modèle

Formation : Le modèle a été entraîné de bout en bout avec Adam (lr 1 x 10-4, perte de poids 5 x 10-4), taille de lot 128, 50 époques, recuit cosinus pour lr. Les valeurs de départ aléatoires ont été définies à 123 pour Python/Numpy/Pytorch et ont activé torch.backends.cudnn.deterministic=True. Les points de contrôle ont été enregistrés toutes les 5 époques dans checkpoints//epoch_XX.pt, et le meilleur modèle a été sélectionné par AUC de validation. Toutes les expériences ont été menées sur un système équipé d’un GPU NVIDIA GeForce RTX 4060 Ti (16 Go) exécutant Windows 11, avec Python 3.8.20, PyTorch 1.8.0 et CUDA 11.1. Le temps d’entraînement approximatif par époque était de 30 s pour l’ensemble de données ShanghaiTech et de 3,5 minutes pour l’ensemble de données UCF-Crime.

Perte : L’objectif global est L = LMIL+ λ • Lalign. L’hyperparamètre λ a été balayé sur l’ensemble {0.01,0.1,0.5,1,5,1,5,10} sur l’ensemble de validation, et la meilleure valeur a été fixée pour le rapport de test. Voir la figure 3 pour l’agrégation MIL top-K et l’équation (3-4) pour les définitions.

figure-protocol-14(3)

figure-protocol-15(4)

Évaluation : L’AUC au niveau de l’image a été calculée selon le protocole standard utilisé par les travaux précédents de WS-VAD 2,5. Pour la reconnaissance de type à grain fin sur UCF-Crime, mAP à IoU 0,1-0,5 et mAP AVG ont été rapportés, comme résumé dans le tableau 2 ; les ASC par classe sont présentées à la figure 4 et les résultats globaux aux tableaux 3 et 4 ; l’intégration de la séparabilité et de la dynamique du score d’anomalie sont illustrées à la figure 4, à la figure 5 et à la figure 6.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour valider davantage l’utilité des ancres sémantiques, une expérience supplémentaire a été menée pour comparer différents modèles d’invites (voir le tableau 1). La variante utilisant des prototypes sémantiques augmentés par Wikidata a non seulement permis d’obtenir des valeurs AUC plus élevées, mais a également conduit à des améliorations du score BLEU-4 de 16,6 et 14,8 pour les explications générées. Ces résultats indiquent un lien étroit entre la richesse sémantique ...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le protocole présenté ici introduit une avancée significative dans la détection d’anomalies vidéo faiblement supervisée en faisant passer le paradigme d’une simple classification binaire à une analyse interprétable sémantiquement fondée. L’importance de cette méthode réside dans sa capacité à identifier non seulement si une anomalie s’est produite, mais aussi de quel type d’anomalie il s’agit et pourquoi le modèle est parvenu à cette conclusion, en remédiant à une limitation majeure des ...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun conflit d’intérêts.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nous sommes reconnaissants du soutien financier fourni par Aerospace Hongka Intelligent Technology (Beijing) CO., LTD.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires

BLIP Modèle

Salesforce ResearchViT-B/16Utilisé comme encodeur de texte pour créer des ancrages sémantiques.
GPUNVIDIARTX 4060TiUtilisé pour entraîner le modèle
Modèle I3DGoogle DeepMindPré-entraîné en cinétique & nbsp ;Utilisé comme colonne vertébrale pour l’extraction de fonctionnalités vidéo.
EngourdiL’équipe de développement NumPy1.21.2Utilisé pour gérer et traiter des réseaux de données numériques, tels que les fonctionnalités vidéo, avant qu’ils ne soient intégrés au modèle d’apprentissage profond.
PyTorchRecherche sur l’IA sur Facebook1.8.0Utilisé pour définir l’architecture du modèle, implémenter les fonctions de perte personnalisées, et exécuter la rétropropagation pour optimiser.
PythonFondation Python Software3.8.20Utilisé pour écrire tous les scripts de traitement des données, d’implémentation de modèles, d’entraînement et d’évaluation
Jeu de données ShanghaiTechUniversité ShanghaiTechUtilisé pour la formation et l’évaluation dans 13 scènes différentes du campus.
Ensemble de données UCF-Criminalité   ;Université de Central FloridaUtilisé pour la formation et l’évaluation de 13 catégories d’anomalies.
WikidataFondation WikimediaUtilisé comme graphe de connaissances externe pour la construction de prompts.

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. 13, 70882-70894 (2025).
  3. Dual memory units with uncertainty regulation for weakly supervised video anomaly detection. Zhou, H., Yu, J., Yang, W. Proc AAAI Conf Artificial Intell, 37 (3), 3769-3777 (2023).
  4. Dynamic local aggregation network with adaptive clusterer for anomaly detection. Yang, Z., Wu, P., Liu, J., Liu, X. Proc Eur Conf Comp Vision, 13664, 404-421 (2022).
  5. Pu, Y., Wu, X., Yang, L., Wang, S. Learning prompt-enhanced context features for weakly-supervised video anomaly detection. IEEE Trans. Image Process. 33 (8), 4923-4936 (2024).
  6. Look around for anomalies: Weakly-supervised anomaly detection via context-motion relational learning. Cho, M., et al. Proc Conf Comp Vision Pattern Recognit, , 12137-12146 (2023).
  7. Tian, Y., et al. Weakly-supervised video anomaly detection with robust temporal feature magnitude learning. Proc Int Conf Comp Vision. , 4955-4966 (2021).
  8. Scale-aware spatio-temporal relation learning for video anomaly detection. Li, G., Cai, G., Zeng, X., Zhao, R. Proc Eur Conf Comp Vision, , 333-350 (2022).
  9. Vadclip: Adapting vision-language models for weakly supervised video anomaly detection. Wu, P., et al. Proc Conf Artificial Intell, 38 (6), 6074-6082 (2024).
  10. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications, and challenges. Comp Elect Eng. 117, 109246(2024).
  11. Vrandecic, D., Kroetzsch, M. Wikidata: A free collaborative knowledgebase. Comm ACM. 57 (10), 78-85 (2014).
  12. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. Li, J., Li, D., Xiong, C., Hoi, S. Proc Int Conf Machine Learning, 162, 12888-12900 (2022).
  13. Real-world anomaly detection in surveillance videos. Sultani, W., Chen, C., Shah, M. I. Proc Conf Comp Vision Pattern Recognit, , 6479-6488 (2018).
  14. Future frame prediction for anomaly detection - a new baseline. Liu, W., Luo, W., Lian, D., Gao, S. I. Proc Conf Comp Vision Pattern Recognit, , 6536-6545 (2018).
  15. Quo vadis, action recognition? A new model and the kinetics dataset. Carreira, J., Zisserman, A. Proc Conf Comp Vision Pattern Recognit, , 6299-6308 (2017).
  16. Kay, W., et al. The kinetics human action video dataset. arXiv. , (2017).
  17. Purba, M., et al. Effect of random splitting and cross validation for Indonesian opinion mining using machine learning approach. Int J Adv Comp Sci Appl. 13 (9), 145-151 (2022).
  18. Wu, P., Liu, X., Liu, J. Weakly supervised audio-visual violence detection. Ieee Transact Multimedia. 25, 1674-1685 (2023).
  19. Liu, T., Lam, K. M., Bao, B. K. Injecting text clues for improving anomalous event detection from weakly labeled videos. Ieee Transact Image Proc. 33, 5907-5920 (2024).
  20. Wu, P., Liu, J. Learning causal temporal relation and feature discrimination for anomaly detection. Ieee Transact Image Proc. 30, 3513-3527 (2021).
  21. Assoc Advancement Artificial, I. Self-training multi-sequence learning with transformer for weakly supervised video anomaly detection. Li, S., Liu, F., Jiao, L. Proc Conf Artificial Intell, 36 (2), 1395-1403 (2022).
  22. Normality guided multiple instance learning for weakly supervised video anomaly detection. Park, S., et al. Proc Winter Conf Appl Comp Vision, , 2664-2673 (2023).
  23. Zanella, L., et al. Delving into clip latent space for video anomaly recognition. Comp Vision Image Understanding. 249, 104163(2024).
  24. Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection. Chen, J., et al. Proc Conf Com Vision Pattern Recognit, , 18319-18329 (2024).
  25. Distilling aggregated knowledge for weakly-supervised video anomaly detection. Dalvi, J., Dabouei, A., Dhanuka, G., Xu, M. Proc Winter Conf Appl Comp Vision, , 5439-5448 (2025).
  26. Gods: Generalized one-class discriminative subspaces for anomaly detection. Wang, J., Cherian, A. I. Proc Int Conf Comp Vision, , 8200-8210 (2019).
  27. Biswas, D., Tesic, J. Mmvad: A vision-language model for cross-domain video anomaly detection with contrastive learning and scale-adaptive frame segmentation. Exp Syst Appl. 285, 127857(2025).
  28. Lim, J., Lee, J., Kim, H., Park, E. Vicap-ad: Video caption-based weakly supervised video anomaly detection. Machine Vision Applicat. 36 (3), 61(2025).
  29. Gao, W., Wang, X., Wang, Y., Jing, X. Dual-stream attention-enhanced memory networks for video anomaly detection. Sensors. 25 (17), 5496(2025).
  30. Duong, H. T., Le, V. T., Hoang, V. T. Deep learning-based anomaly detection in video surveillance: A survey. Sensors. 23 (11), 5024(2023).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

Articles connexes