Onderzoeksartikel

Semantisch ankeruitgelijnd model voor interpreteerbare detectie van video-anomalieën onder cross-modal zwak toezicht

DOI:

10.3791/69286

14 november 2025

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit protocol is bedoeld om de detectie van zwak gesuperviseerde video-anomalie te verbeteren door gestructureerde kennis te integreren. Het doel is om de classificatie van specifieke anomalietypen mogelijk te maken en duidelijke, interpreteerbare verklaringen te bieden voor detectieresultaten, die verder gaan dan eenvoudige binaire beslissingen en de transparantie vergroten.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Detectie van video-anomalie onder zwak toezicht is een belangrijke techniek die uitsluitend afhankelijk is van labels op videoniveau om afwijkende gebeurtenissen te identificeren. Traditionele methoden voor multiple instance learning (MIL) zijn echter gebaseerd op grofkorrelig binair toezicht. Deze benadering maakt het moeilijk om onderscheid te maken tussen fijnmazige anomaliecategorieën. Deze methoden richten zich vaak uitsluitend op de meest afwijkende segmenten, wat resulteert in detectieresultaten die niet interpreteerbaar zijn. Om deze beperkingen te overwinnen, stelt deze studie een benadering van functiemodellering voor die gestructureerde kennis omvat. Door gebruik te maken van een dynamisch semantisch begeleidingsmechanisme, combineert zwak gesuperviseerde video-anomaliedetectie externe informatie op categorieniveau met leerbare aanwijzingen om semantische signalen te genereren binnen de functieruimte. Deze signalen zijn afgestemd op het visuele bewijs dat wordt geëxtraheerd door de basismodule voor anomaliedetectie, waardoor twee complementaire outputs worden geproduceerd: een anomaliescore voor het kwantificeren van de ernst van afwijkende gebeurtenissen, en semantische beschrijvingen die zijn afgestemd op externe concepten, die kunnen worden gebruikt om gestructureerde en interpreteerbare verklarende teksten te genereren via vooraf gedefinieerde sjablonen. Experimentele resultaten tonen aan dat de voorgestelde methode een AUC van 88,03% behaalt op de UCF-Crime-dataset en 98,23% op de ShanghaiTech-dataset, waarbij een nauwkeurigheid van 87,05% wordt bereikt in fijnmazige anomalieclassificatietaken. Bovendien breiden de gegenereerde semantische verklaringen zwak gesuperviseerde detectie uit van een binaire classificatietaak naar een semantiekgedreven, interpreteerbaar anomalieanalysekader.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Video-anomaliedetectie (VAD) speelt een essentiële rol op gebieden zoals openbare veiligheid en intelligente productie, waar het een schaalbare oplossing biedt voor de beperkingen van handmatige bewaking1. Met name de detectie van video-anomalieën onder zwak toezicht (WS-VAD) heeft aan bekendheid gewonnen vanwege de afhankelijkheid van labels op videoniveau, waardoor de last van handmatige annotatie aanzienlijk wordt verminderd en de generaliseerbaarheid over verschillende scènes wordt verbeterd. Ondanks de praktische voordelen staan WS-VAD-methoden nog steeds voor aanzienlijke uitdagingen bij het nauwkeurig identificeren van de aard van abnormale gebeurtenissen2. Bestaande modellen detecteren vaak de aanwezigheid van afwijkingen, maar hebben moeite om de exacte categorie te bepalen of zinvolle diagnostische informatie te verstrekken 3,4. In industriële omgevingen kan een model bijvoorbeeld rook van oververhitte lagers verwarren met onschadelijke stoomemissies of ten onrechte geloven dat normale lasvonken vroege tekenen van brand zijn, wat beide leidt tot kostbare verkeerde inschattingen en onnodige stilleggingen. Deze semantische verwarringen komen voort uit de inherente beperkingen van de huidige WS-VAD-benaderingen5. Binaire labels op videoniveau geven alleen aan of er sprake is van een anomalie, zonder inzicht te bieden in de oorzaak, locatie en ernst ervan. Bovendien aggregeren mainstream multiple instance learning (MIL)-frameworks6 voorspellingen op clipniveau met behulp van eenvoudige heuristieken7 die er niet in slagen de genuanceerde semantiek van verschillende soorten gebeurtenissen vast te leggen. Als gevolg hiervan wordt de geleerde visuele kenmerkruimte ambigu, waar visueel vergelijkbare maar semantisch verschillende fenomenen - zoals rook en stoom - te nauwkeurig in kaart worden gebracht, waardoor beslissingsgrenzen vervagen.

Er zijn twee belangrijke onderzoeksrichtingen naar voren gekomen om deze beperkingen aan te pakken. De ene richt zich op het verbeteren van het MIL-framework door middel van verbeterde temporele modellering 4,5,8 of saliency-geleide functieselectie3. Hoewel dergelijke methoden de lokalisatie van anomalieën verbeteren, schieten ze nog steeds tekort in het bieden van semantische duidelijkheid en interpreteerbaarheid. De andere richting betreft het op elkaar afstemmen van visie- en taalrepresentaties door vooraf getrainde multimodale modellen, zoals VadCLIP9, te integreren. Hoewel deze strategie veelbelovend is, slaagt ze er vaak niet in om de semantische rijkdom van taal volledig te benutten. Dit leidt tot zwakke intermodale associaties en ondoorzichtige besluitvormingsprocessen, wat resulteert in twee belangrijke tekortkomingen. Ten eerste kunnen de huidige modellen geen consistent onderscheid maken tussen anomaliecategorieën vanwege vage functiesemantiek en onvoldoende externe kennis. Ten tweede bevat het besluitvormingsproces een zwarte doos, zonder een transparante verklaring waarom een bepaalde gebeurtenis als afwijkend wordt geclassificeerd. Hoewel sommige methoden tekstuele aanwijzingen bevatten (bijv. vechten, schieten), zijn deze altijd simplistisch en losjes georganiseerd, zonder zowel semantische diepgang als contextueel begrip.

Om deze lacunes aan te pakken, wordt een nieuwe WS-VAD-methode geïntroduceerd die gestructureerde externe kennis integreert met interpreteerbare beslissingsmechanismen, een kerndoelstelling binnen het bredere veld van Explainable Artificial Intelligence (XAI)10. In plaats van eenvoudige categorienamen als prompts te gebruiken, construeert de methode rijke semantische representaties - ook wel semantische conceptwolken genoemd - met behulp van Wikidata11. In tegenstelling tot bestaande multimodale methoden zoals VadCLIP9 die afhankelijk zijn van statische tekstprompts of eenvoudige categorielabels, bevatten deze semantische conceptwolken uitgebreide contextuele kennis, inclusief gerelateerde entiteiten, attributen en causale relaties die zijn geëxtraheerd uit gestructureerde kennisgrafieken. Deze conceptwolken worden gecodeerd in semantische ankers met behulp van het BLIP-model12, waardoor het systeem toegang heeft tot fijnmazige gebeurtenissemantiek. De belangrijkste innovatie van het semantische ankermechanisme ligt in het vermogen om dynamische, met kennis verrijkte representaties te creëren die zich aanpassen aan specifieke anomaliecontexten, terwijl eerdere prompt-gebaseerde methoden vaste tekstuele beschrijvingen gebruiken die contextuele diepgang en semantische relaties missen. Om de kenmerkruimte verder te verfijnen, associeert een saliency-geleid uitlijningsmechanisme deze ankers selectief met het meest relevante visuele bewijsmateriaal. Deze gerichte uitlijning verbetert de onderscheidende kracht van de kenmerken en verbetert tegelijkertijd de semantische duidelijkheid van de detectieresultaten. Wat nog belangrijker is, de voorgestelde methode ondersteunt een transparante interpretatie. Zodra een semantisch anker is uitgelijnd met visueel bewijs, genereert het model gestructureerde verklaringen in natuurlijke taal met behulp van vooraf gedefinieerde sjablonen, waarbij expliciet zowel de aard als de rechtvaardiging van de anomalie aan de orde komen. Het is belangrijk op te merken dat de implementatie van deze methode afhankelijk is van specifieke vereisten, waaronder het gebruik van vooraf geëxtraheerde I3D visuele functies, toegang tot een externe kennisbank (Wikidata) en een vooraf getrainde BLIP-encoder. Het framework is daarom het meest nuttig in toepassingen waar het van cruciaal belang is om verder te gaan dan eenvoudige binaire detectie om in plaats daarvan specifieke anomalietypen te classificeren en interpreteerbare rechtvaardigingen voor de resultaten te bieden.

De belangrijkste bijdragen zijn de volgende. Een nieuwe WS-VAD-methode wordt ontwikkeld door externe kennis te combineren met gestructureerde interpreteerbaarheid om het semantisch begrip en de transparantie van beslissingen te verbeteren. Een op semantische inbedding gebaseerde promptingmethode en contextbewust uitlijningsmechanisme worden geïntroduceerd om de beperkingen van MIL-modellen met alleen visuals te overwinnen. Er is een generatieve uitlegmodule opgenomen, waarbij semantische ankers worden gebruikt als interpreteerbare eenheden om coherente tekstuele grondslagen te produceren. Uitgebreide experimenten uitgevoerd op de UCF-Crime- en ShanghaiTech-datasets tonen de effectiviteit van de voorgestelde methode aan, met sterke AUC-scores (88,03% / 98,23%) en superieure fijnmazige herkenningsprestaties, met duidelijke en interpreteerbare outputs.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie maakt alleen gebruik van openbaar beschikbare datasets (UCF-Crime13 en ShanghaiTech14). Alle video's zijn verkregen uit de officiële releases van de datasets, die persoonlijk identificeerbare informatie anonimiseren voor zover verstrekt door de beheerders van de dataset. Er is geen aanvullende gegevensverzameling of interactie met menselijke proefpersonen uitgevoerd door de auteurs; daarom was er geen nieuwe IRB-goedkeuring vereist. Het gegevensgebruik voldoet aan de licenties en gebruiksvoorwaarden van de respectieve datasets.

Gegevensvoorbereiding en functie-extractie

Voorbereiding van de dataset: De UCF-Crime13 (1.610 treinen/290 testvideo's) en ShanghaiTech14 (238 treinen/199 testvideo's) datasets werden aangenomen onder hun standaardsplitsingen. Video's werden voorbewerkt met behulp van FFmpeg om reproduceerbaarheid te garanderen, opnieuw gecodeerd naar H.264, opnieuw gesampled naar 25 fps en verkleind naar een resolutie van 256 x 256 met het commando: ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset veryfast pre/.

Functie-extractie: RGB-kenmerken werden geëxtraheerd door een I3D-backbone15 die vooraf was getraind op de Kinetics-dataset16. Video's werden opgesplitst in niet-overlappende clips van 16 frames; Elke clip werd in het midden bijgesneden tot 224 x 224 pixels. De voorlaatste laagactiveringen werden gemiddeld samengevoegd om een 1024-D-functie per clip te verkrijgen. In PyTorch komt dit overeen met het doorsturen van tensoren van vorm [B, 3, T, H, W] door de I3D-ruggengraat en het toepassen van adaptive_avg_pool3d gevolgd door afvlakking. De geëxtraheerde functies werden opgeslagen in .npy-bestanden (één per video) samen met clip-tijdstempels voor exacte reproduceerbaarheid (seed = 123). Voor elke video bevat features///

Modelarchitectuur en methodologie

Basisdetectie: temporele contextfusie
Gegeven een videosequentie die wordt weergegeven door een functiematrix Z figure-protocol-1 RTx1024, berekende de Temporal Context Fusion (TCF)-module eerst query-, sleutel- en waarderepresentaties door middel van drie geleerde lineaire projecties:

Q = ZWQ, K = ZWK, V = ZWV (1)

waarbij WQ, WK, WV figure-protocol-2 RTx1024xd trainbare parameters zijn (PyTorch: drie nn. Lineaire (1024,d) lagen). De intersegmentaffiniteit was S = figure-protocol-3, er werd een Temporal Relationality Embedding (TRE) opgenomen, waarbij elk element werd berekend als Rij = α exp (figure-protocol-4) + β . De locatiebewuste affiniteit was figure-protocol-5 = S + R. Een kaart met een globale context A = softmax(figure-protocol-6) geaggregeerd V om objecten met een groot gebied te verkrijgen G = AV. Lokale kenmerken L werden berekend met een dieptegewijze 1-D convolutie (nn. Conv1d) met een korrelgrootte van 3 over Z. Een dynamische poort g = σ(MLP ([G;L])) mengde de twee: U = gfigure-protocol-7 G + (1 - g) figure-protocol-8 L . Ten slotte werden laagnormalisatie en een resterende lineaire laag toegepast om Y te produceren (Pytorch:LayerNorm+Linear+residueal).

Basisdetectie: causale temporele voorspeller

De output Y werd door twee causale 1D-convoluties geleid met GELU en dropout (Pytorch:padding='causal' of gemaskeerde conv) om anomalielogitons per clip te verkrijgen. Het toepassen van de sigmoïde functie leverde kanswaarden figure-protocol-9 op [0,1]T.

Semantische verbetering: snel leren met externe kennis

Consemantische ankers construeren: Voor elke anomalieklasse c werden Kc-concepten opgevraagd vanuit Wikidata11 en gecodeerd werd elke conceptzin gecodeerd met BLIP's12-tekstencodernaar eifigure-protocol-10R768. Het klasseanker was het l 2-genormaliseerde gemiddelde Dc = norm(figure-protocol-11Σiei) . Om ruis te verminderen, werden concepten met cosinusgelijkenis met de klassenaam onder de 0,2 weggelaten en werd de top-M door TF-IDF-score behouden.  

Contextgevoelige scheiding uitvoeren: Voorgrondgewichten αt = softmax(rst) werden berekend op basis van basisdetectorscores st en achtergrondgewichten bt = softmax(r(1 - st)). De gewogen kenmerken zijn fg = Σtαzt en fbg = Σtbzt .

Visuele en semantische kenmerken op elkaar afstemmen

Definieer het uitlijningsdoel: Tijdens de uitlijningsstap is het doel om de afstand tussen het visuele kenmerk op de voorgrond en het bijbehorende semantische anker van de afwijkende categorie binnen de functieruimte te minimaliseren. Maak een verzameling semantische hulplijnen, figure-protocol-12bestaande uit C afwijkende categorie semantische hulplijnen en één standaard normale semantische gids. Bepaal de waarschijnlijkheid, P(Dk|v), dat een visueel kenmerk, v, overeenkomt met de k-de semantische gids, Dk. Bereken dit met behulp van cosinusgelijkenis op temperatuurschaal gevolgd door Softmax-normalisatie, zoals weergegeven in Eq. (2).

figure-protocol-13(2)

Kruisentropie werd geminimaliseerd om positieve paren samen en negatieven uit elkaar te duwen, waarbij τs werd ingesteld als een leerbare parameter en deze werd geïnitialiseerd tot 10. Bereik de uitlijning door de kans op het correleren van positieve steekproefparen te optimaliseren en tegelijkertijd de kans op het correleren van negatieve steekproefparen te verkleinen.

Module voor interpreteerbaarheid op basis van sjablonen

Op basis van het prompt leren met externe kennis (PLE)-verbeterde kenmerkrepresentatie, produceert een lineaire classificator logits per klasse, die vervolgens door de softmax-functie werden genormaliseerd in klassekansen; Het voorspelde anomalietype werd bepaald als de categorie met de hoogste waarschijnlijkheid. Ondertussen werd een globale anomaliescore berekend op basis van de detectoroutput. Om het ernstniveau te bepalen, werd deze score vergeleken met drie vooraf gedefinieerde drempels die waren geoptimaliseerd via rasterzoekopdrachten op de validatieset.

De standaarddrempels waren ingesteld op θhoog = 0,8, θgemiddeld = 0,5 en θlaag = 0,2. In het bijzonder, als de score groter was dan θhoog, werd de ernst als hoog bestempeld; Als de score tussen θmedium en θhoog valt, werd deze als medium bestempeld; als het tussen θlaag en θmedium lag, werd het als laag gelabeld; Anders werd het gemarkeerd als geen.

Tijdens de fase van het genereren van uitleg werd een sjabloon geselecteerd dat overeenkomt met het voorspelde type uit een vooraf gedefinieerde sjabloonbibliotheek, aanvullend bestand 1. Deze bibliotheek bevat meerdere sjabloonvarianten die zijn gevalideerd door meerdere annotators17 om de diversiteit van de gegenereerde tekst te vergroten. Als het voorspelde type bestaat in de sjabloonbibliotheek, is willekeurig een bijbehorend sjabloon geselecteerd; anders werd een standaardsjabloon voor het type Onbekend gebruikt. Ten slotte werd een gestructureerde verklarende tekst gegenereerd door het voorspelde type, de globale anomaliescore, de ernstbeschrijving en het geselecteerde sjabloon te integreren. Het systeem retourneert het voorspelde anomalietype, de globale anomaliescore en de gegenereerde verklarende tekst als de uiteindelijke uitvoer. De resultaten worden geïllustreerd in figuur 2.

Alle drempelparameters werden geoptimaliseerd met behulp van rasterzoekopdrachten op de validatieset en de kwaliteit van de gegenereerde uitleg werd uitgebreid geëvalueerd met behulp van zowel menselijke beoordeling als geautomatiseerde statistieken. De resultaten zijn weergegeven in tabel 1.

Modeltraining en evaluatie

Training: Het model werd end-to-end getraind met Adam (lr 1 x 10-4, gewichtsverval 5 x 10-4), batchgrootte 128, 50 epochs, cosinusgloeien voor lr. Willekeurige zaden werden ingesteld op 123 voor Python/Numpy/Pytorch en torch.backends.cudnn.deterministic=True ingeschakeld. Controlepunten werden om de 5 epochs opgeslagen in controlepunten//epoch_XX.pt, en het beste model werd geselecteerd op basis van validatie-AUC. Alle experimenten werden uitgevoerd op een systeem met een NVIDIA GeForce RTX 4060 Ti (16 GB) GPU met Windows 11, met Python 3.8.20, PyTorch 1.8.0 en CUDA 11.1. De geschatte trainingstijd per epoch was 30 s voor de ShanghaiTech-dataset en 3,5 min voor de UCF-Crime-dataset.

Verlies: De algemene doelstelling is L = LMIL+ λ • Luitlijnen. De hyperparameter λ werd over de set {0.01,0.1,0.5,1,5,10} op de validatieset geveegd en de beste waarde werd vastgesteld voor testrapportage. Zie figuur 3 voor top-K MIL-aggregatie en Eq.(3-4) voor definities.

figure-protocol-14(3)

figure-protocol-15(4)

Evaluatie: AUC op frameniveau werd berekend volgens het standaardprotocol dat werd gebruikt door eerdere WS-VAD-werken 2,5. Voor fijnmazige typeherkenning op UCF-Crime werden mAP op IoU 0.1-0.5 en AVG mAP gerapporteerd, zoals samengevat in Tabel 2; de AUC's per klasse worden weergegeven in figuur 4 en de algemene resultaten in tabel 3 en tabel 4; het inbedden van scheidbaarheid en anomaliescoredynamiek zijn te vinden in Figuur 4, Figuur 5 en Figuur 6.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Om het nut van semantische ankers verder te valideren, werd een aanvullend experiment uitgevoerd om verschillende promptsjablonen te vergelijken (zie Tabel 1). De variant die gebruik maakt van Wikidata-augmented semantische prototypes behaalde niet alleen hogere AUC-waarden, maar leidde ook tot BLEU-4-scoreverbeteringen van 16,6 en 14,8 voor de gegenereerde verklaringen. Deze bevindingen wijzen op een sterk verband tussen de semantische rijkdom van prompts en de kwalitei...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het hier gepresenteerde protocol introduceert een aanzienlijke vooruitgang in de detectie van zwak gesuperviseerde video-anomalie door het paradigma te verschuiven van eenvoudige binaire classificatie naar een semantisch gefundeerde, interpreteerbare analyse. Het belang van deze methode ligt in het vermogen om niet alleen vast te stellen of er een anomalie is opgetreden, maar ook wat voor soort anomalie het is en waarom het model tot die conclusie is gekomen, waarmee een belangrijke bepe...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hebben geen belangenconflicten.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

We zijn dankbaar voor de financiële steun van Aerospace Hongka Intelligent Technology (Beijing) CO., LTD.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen

BLIP Model

Salesforce ResearchViT-B/16Gebruikt als de tekstencoder voor het creëren van semantische ankers.
GPUNVIDIARTX 4060TiGebruikt voor het trainen van het model
I3D ModelGoogle DeepMindVooraf getraind op Kinetics Gebruikt als de backbone voor video-feature-extractie.
NumpyThe NumPy Development Team1.21.2Gebruikt voor het verwerken en verwerken van numerieke data arrays, zoals de video-features, voordat ze in het deep learning model worden ingevoerd.
PyTorchFacebook AI Research1.8.0Gebruikt voor het definiëren van de modelarchitectuur, het implementeren van de aangepaste verliesfuncties en het uitvoeren van de back-propagation voor optimalisatie.
PythonPython Software Foundation3.8.20Gebruikt om alle scripts voor dataverwerking, modelimplementatie, training en evaluatie te schrijven
ShanghaiTech DatasetShanghaiTech UniversityGebruikt voor training en evaluatie in 13 verschillende campusscènes.
UCF-Crime Dataset University of Central FloridaGebruikt voor training en evaluatie van 13 anomaliecategorieën.
WikidataWikimedia FoundationGebruikt als de externe kennisgraaf voor promptconstructie.

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. 13, 70882-70894 (2025).
  3. Dual memory units with uncertainty regulation for weakly supervised video anomaly detection. Zhou, H., Yu, J., Yang, W. Proc AAAI Conf Artificial Intell, 37 (3), 3769-3777 (2023).
  4. Dynamic local aggregation network with adaptive clusterer for anomaly detection. Yang, Z., Wu, P., Liu, J., Liu, X. Proc Eur Conf Comp Vision, 13664, 404-421 (2022).
  5. Pu, Y., Wu, X., Yang, L., Wang, S. Learning prompt-enhanced context features for weakly-supervised video anomaly detection. IEEE Trans. Image Process. 33 (8), 4923-4936 (2024).
  6. Look around for anomalies: Weakly-supervised anomaly detection via context-motion relational learning. Cho, M., et al. Proc Conf Comp Vision Pattern Recognit, , 12137-12146 (2023).
  7. Tian, Y., et al. Weakly-supervised video anomaly detection with robust temporal feature magnitude learning. Proc Int Conf Comp Vision. , 4955-4966 (2021).
  8. Scale-aware spatio-temporal relation learning for video anomaly detection. Li, G., Cai, G., Zeng, X., Zhao, R. Proc Eur Conf Comp Vision, , 333-350 (2022).
  9. Vadclip: Adapting vision-language models for weakly supervised video anomaly detection. Wu, P., et al. Proc Conf Artificial Intell, 38 (6), 6074-6082 (2024).
  10. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications, and challenges. Comp Elect Eng. 117, 109246(2024).
  11. Vrandecic, D., Kroetzsch, M. Wikidata: A free collaborative knowledgebase. Comm ACM. 57 (10), 78-85 (2014).
  12. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. Li, J., Li, D., Xiong, C., Hoi, S. Proc Int Conf Machine Learning, 162, 12888-12900 (2022).
  13. Real-world anomaly detection in surveillance videos. Sultani, W., Chen, C., Shah, M. I. Proc Conf Comp Vision Pattern Recognit, , 6479-6488 (2018).
  14. Future frame prediction for anomaly detection - a new baseline. Liu, W., Luo, W., Lian, D., Gao, S. I. Proc Conf Comp Vision Pattern Recognit, , 6536-6545 (2018).
  15. Quo vadis, action recognition? A new model and the kinetics dataset. Carreira, J., Zisserman, A. Proc Conf Comp Vision Pattern Recognit, , 6299-6308 (2017).
  16. Kay, W., et al. The kinetics human action video dataset. arXiv. , (2017).
  17. Purba, M., et al. Effect of random splitting and cross validation for Indonesian opinion mining using machine learning approach. Int J Adv Comp Sci Appl. 13 (9), 145-151 (2022).
  18. Wu, P., Liu, X., Liu, J. Weakly supervised audio-visual violence detection. Ieee Transact Multimedia. 25, 1674-1685 (2023).
  19. Liu, T., Lam, K. M., Bao, B. K. Injecting text clues for improving anomalous event detection from weakly labeled videos. Ieee Transact Image Proc. 33, 5907-5920 (2024).
  20. Wu, P., Liu, J. Learning causal temporal relation and feature discrimination for anomaly detection. Ieee Transact Image Proc. 30, 3513-3527 (2021).
  21. Assoc Advancement Artificial, I. Self-training multi-sequence learning with transformer for weakly supervised video anomaly detection. Li, S., Liu, F., Jiao, L. Proc Conf Artificial Intell, 36 (2), 1395-1403 (2022).
  22. Normality guided multiple instance learning for weakly supervised video anomaly detection. Park, S., et al. Proc Winter Conf Appl Comp Vision, , 2664-2673 (2023).
  23. Zanella, L., et al. Delving into clip latent space for video anomaly recognition. Comp Vision Image Understanding. 249, 104163(2024).
  24. Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection. Chen, J., et al. Proc Conf Com Vision Pattern Recognit, , 18319-18329 (2024).
  25. Distilling aggregated knowledge for weakly-supervised video anomaly detection. Dalvi, J., Dabouei, A., Dhanuka, G., Xu, M. Proc Winter Conf Appl Comp Vision, , 5439-5448 (2025).
  26. Gods: Generalized one-class discriminative subspaces for anomaly detection. Wang, J., Cherian, A. I. Proc Int Conf Comp Vision, , 8200-8210 (2019).
  27. Biswas, D., Tesic, J. Mmvad: A vision-language model for cross-domain video anomaly detection with contrastive learning and scale-adaptive frame segmentation. Exp Syst Appl. 285, 127857(2025).
  28. Lim, J., Lee, J., Kim, H., Park, E. Vicap-ad: Video caption-based weakly supervised video anomaly detection. Machine Vision Applicat. 36 (3), 61(2025).
  29. Gao, W., Wang, X., Wang, Y., Jing, X. Dual-stream attention-enhanced memory networks for video anomaly detection. Sensors. 25 (17), 5496(2025).
  30. Duong, H. T., Le, V. T., Hoang, V. T. Deep learning-based anomaly detection in video surveillance: A survey. Sensors. 23 (11), 5024(2023).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

Gerelateerde artikelen