Research Article

Modlar Arası Zayıf Denetim Altında Yorumlanabilir Video Anormallik Tespiti için Anlamsal Çapa Hizalı Model

DOI:

10.3791/69286

November 14th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol, yapılandırılmış bilgiyi entegre ederek zayıf denetimli video anormallik tespitini iyileştirmeyi amaçlamaktadır. Amacı, belirli anormallik türlerinin sınıflandırılmasını sağlamak ve tespit sonuçları için net, yorumlanabilir açıklamalar sağlayarak basit ikili kararların ötesine geçmek ve şeffaflığı artırmaktır.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zayıf denetimli video anormallik tespiti, anormal olayları tanımlamak için yalnızca video düzeyindeki etiketlere dayanan önemli bir tekniktir. Bununla birlikte, geleneksel çoklu örnek öğrenme (MIL) yöntemleri, kaba taneli ikili denetime dayanır. Bu yaklaşım, ayrıntılı anomali kategorileri arasında ayrım yapmayı zorlaştırır. Bu yöntemler genellikle yalnızca en anormal segmentlere odaklanır ve bu da yorumlanabilirlikten yoksun tespit sonuçlarına neden olur. Bu sınırlamaların üstesinden gelmek için bu çalışma, yapılandırılmış bilgiyi içeren bir özellik modelleme yaklaşımı önermektedir. Dinamik bir anlamsal rehberlik mekanizması kullanarak, zayıf denetimli video anormallik tespiti, özellik alanı içinde anlamsal sinyaller oluşturmak için harici kategori düzeyindeki bilgileri öğrenilebilir istemlerle birleştirir. Bu sinyaller, temel anormallik tespit modülü tarafından çıkarılan görsel kanıtlarla hizalanır ve iki tamamlayıcı çıktı üretir: anormal olayların ciddiyetini ölçmek için bir anormallik puanı ve önceden tanımlanmış şablonlar aracılığıyla yapılandırılmış ve yorumlanabilir açıklayıcı metinler oluşturmak için kullanılabilen harici kavramlarla uyumlu anlamsal açıklamalar. Deneysel sonuçlar, önerilen yöntemin UCF-Crime veri setinde %88,03 ve ShanghaiTech veri setinde %98,23'lük bir AUC'ye ulaştığını ve ince taneli anomali sınıflandırma görevlerinde %87,05 doğruluk elde ettiğini göstermektedir. Ayrıca, oluşturulan anlamsal açıklamalar, zayıf denetimli algılamayı ikili sınıflandırma görevinden anlambilim odaklı, yorumlanabilir bir anormallik analizi çerçevesine genişletir.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Video anormallik tespiti (VAD), manuel gözetimin sınırlamalarına ölçeklenebilir bir çözüm sunduğu kamu güvenliği ve akıllı üretim gibi alanlarda önemli bir rol oynar1. Özellikle, zayıf denetimli video anormallik tespiti (WS-VAD), video düzeyindeki etiketlere dayanması nedeniyle ön plana çıkmış olup, çeşitli sahneler arasında genelleştirilebilirliği artırırken manuel açıklama yükünü önemli ölçüde azaltmıştır. Pratik avantajlarına rağmen, WS-VAD yöntemleri anormal olayların doğasını kesin olarak belirlemede hala önemli zorluklarla karşı karşıyadır2. Mevcut modeller genellikle anomalilerin varlığını tespit eder, ancak tam kategorilerini belirlemek veya anlamlı tanısal bilgiler sağlamak için mücadele eder 3,4. Örneğin, endüstriyel ortamlarda bir model, aşırı ısınmış yataklardan çıkan dumanı zararsız buhar emisyonlarıyla karıştırabilir veya normal kaynak kıvılcımlarının yangının erken belirtileri olduğuna yanlış inanabilir, bu da her ikisi de maliyetli yanlış değerlendirmelere ve gereksiz kapatmalara yol açabilir. Bu anlamsal karışıklıklar, mevcut WS-VAD yaklaşımlarının5 doğasında var olan sınırlamalardan kaynaklanmaktadır. İkili video düzeyindeki etiketler, nedeni, konumu ve ciddiyeti hakkında fikir vermeden yalnızca bir anormalliğin var olup olmadığını belirtir. Ayrıca, ana akım çoklu örnek öğrenme (MIL) çerçeveleri, farklı olay türlerinin incelikli semantiğini yakalayamayan basit buluşsal yöntemler7 kullanarak klip düzeyindetahminleri 6 toplar. Sonuç olarak, duman ve buhar gibi görsel olarak benzer ancak anlamsal olarak farklı fenomenlerin çok yakından haritalandığı ve karar sınırlarının bulanıklaştığı öğrenilen görsel özellik alanı belirsiz hale gelir.

Bu sınırlamaları ele almak için iki ana araştırma yönü ortaya çıkmıştır. Biri, geliştirilmiş zamansal modelleme 4,5,8 veya belirginlik kılavuzlu özellik seçimi3 yoluyla MIL çerçevesini geliştirmeye odaklanır. Bu tür yöntemler anormallik lokalizasyonunu iyileştirse de, anlamsal netlik ve yorumlanabilirlik sunma konusunda hala yetersiz kalmaktadır. Diğer yön, VadCLIP9 gibi önceden eğitilmiş çok modlu modelleri entegre ederek vizyon ve dil temsillerini hizalamayı içerir. Bu strateji umut verici olsa da, çoğu zaman dilin anlamsal zenginliğinden tam olarak yararlanmakta başarısız oluyor. Bu, zayıf modlar arası ilişkilere ve şeffaf olmayan karar verme süreçlerine yol açarak iki temel eksikliğe neden olur. İlk olarak, mevcut modeller, belirsiz özellik semantiği ve yetersiz dış bilgi nedeniyle anormallik kategorileri arasında tutarlı bir şekilde ayrım yapamamaktadır. İkincisi, karar verme süreci, belirli bir olayın neden anormal olarak sınıflandırıldığına dair şeffaf bir açıklama olmaksızın bir kara kutu içerir. Bazı yöntemler metinsel yönlendirmeler içerse de (örneğin, dövüşme, ateş etme), bunlar her zaman basit ve gevşek bir şekilde organize edilmiştir, hem anlamsal derinlikten hem de bağlamsal anlayıştan yoksundur.

Bu boşlukları gidermek için, yapılandırılmış dış bilgiyi yorumlanabilir karar mekanizmalarıyla bütünleştiren yeni bir WS-VAD yöntemi tanıtıldı ve bu, daha geniş Açıklanabilir Yapay Zeka (XAI) alanında temel bir hedeftir.10. Yöntem, temel kategori adlarını bilgi istemi olarak kullanmak yerine, Vikiveri11'i kullanarak anlamsal kavram bulutları olarak adlandırılan zengin anlamsal temsiller oluşturur. Statik metin istemlerine veya basit kategori etiketlerine dayanan VadCLIP9 gibi mevcut çok modlu yöntemlerin aksine, bu anlamsal kavram bulutları, yapılandırılmış bilgi grafiklerinden çıkarılan ilgili varlıklar, nitelikler ve nedensel ilişkiler dahil olmak üzere kapsamlı bağlamsal bilgiyi kapsar. Bu kavram bulutları, sistemin ayrıntılı olay semantiğine erişmesini sağlayan BLIP modeli12 kullanılarak anlamsal bağlantılara kodlanır. Anlamsal bağlantı mekanizmasının temel yeniliği, belirli anormallik bağlamlarına uyum sağlayan dinamik, bilgiyle zenginleştirilmiş temsiller oluşturma yeteneğinde yatarken, önceki istem tabanlı yöntemler, bağlamsal derinlik ve anlamsal ilişkilerden yoksun sabit metinsel açıklamalar kullanır. Özellik alanını daha da iyileştirmek için, belirginlik kılavuzlu bir hizalama mekanizması, bu çapaları seçici olarak en alakalı görsel kanıtlarla ilişkilendirir. Bu hedeflenen hizalama, algılama sonuçlarının anlamsal netliğini artırırken özelliklerin ayırt edici gücünü artırır. Daha da önemlisi, önerilen yöntem şeffaf yorumlamayı desteklemektedir. Anlamsal bir çapa görsel kanıtlarla uyumlu hale getirildikten sonra model, önceden tanımlanmış şablonları kullanarak yapılandırılmış doğal dil açıklamaları oluşturur ve anormalliğin hem doğasını hem de gerekçesini açıkça ele alır. Bu yöntemin uygulanmasının, önceden çıkarılmış I3D görsel özelliklerinin kullanımı, harici bir bilgi tabanına (Vikiveri) erişim ve önceden eğitilmiş bir BLIP kodlayıcı dahil olmak üzere belirli ön koşullara dayandığını unutmamak önemlidir. Bu nedenle çerçeve, belirli anormallik türlerini sınıflandırmak ve sonuçlar için yorumlanabilir gerekçeler sağlamak için basit ikili algılamanın ötesine geçmenin kritik olduğu uygulamalarda en faydalıdır.

Temel katkılar aşağıdaki gibidir. Anlamsal anlayışı ve karar şeffaflığını geliştirmek için dış bilgiyi yapılandırılmış yorumlanabilirlikle birleştirerek yeni bir WS-VAD yöntemi geliştirilmiştir. Yalnızca görsel MIL modellerinin sınırlamalarının üstesinden gelmek için anlamsal yerleştirme tabanlı bir yönlendirme yöntemi ve bağlama duyarlı hizalama mekanizması tanıtıldı. Tutarlı metinsel gerekçeler üretmek için anlamsal çapaları yorumlanabilir birimler olarak kullanan üretken bir açıklama modülü dahil edilmiştir. UCF-Crime ve ShanghaiTech veri kümeleri üzerinde gerçekleştirilen kapsamlı deneyler, net ve yorumlanabilir çıktılarla güçlü AUC puanları (%88,03 / %98,23) ve üstün ayrıntılı tanıma performansı elde ederek önerilen yöntemin etkinliğini göstermektedir.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma yalnızca kamuya açık veri kümelerini (UCF-Crime13 ve ShanghaiTech14) kullanmaktadır. Tüm videolar, veri kümesi sorumluları tarafından sağlanan ölçüde kişisel olarak tanımlanabilir bilgileri anonimleştiren veri kümelerinin resmi yayınlarından elde edilmiştir. Yazarlar tarafından herhangi bir ek veri toplama veya insan denek etkileşimi yapılmamıştır; bu nedenle yeni bir IRB onayına gerek duyulmadı. Veri kullanımı, ilgili veri kümelerinin lisanslarına ve kullanım koşullarına uygundur.

Veri hazırlama ve özellik çıkarma

Veri kümesi hazırlama:UCF-Crime13 (1.610 tren/290 test videosu) ve ShanghaiTech14 (238 tren/199 test videosu) veri kümeleri standart bölünmeleri altında benimsenmiştir. Videolar, tekrarlanabilirliği sağlamak için FFmpeg kullanılarak önceden işlendi, H.264'e yeniden kodlandı, 25 fps'ye yeniden örneklendi ve şu komutla 256 x 256 çözünürlüğe yeniden boyutlandırıldı: ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset veryfast pre/.

Özellik çıkarma: RGB özellikleri, Kinetics veri kümesi16 üzerinde önceden eğitilmiş bir I3D omurga15 tarafından çıkarıldı. Videolar üst üste gelmeyen 16 karelik kliplere bölündü; Her klip 224 x 224 piksele ortadan kırpıldı. Sondan bir önceki katman aktivasyonları, klip başına 1024-D özelliği elde etmek için ortalama olarak bir araya getirildi. PyTorch'ta bu, [B, 3, T, H, W] şeklindeki tensörlerin I3D omurgası boyunca iletilmesine ve adaptive_avg_pool3d uygulanmasına ve ardından düzleştirmeye karşılık gelir. Çıkarılan özellikler, tam tekrarlanabilirlik için klip zaman damgalarıyla birlikte .npy dosyalarına (video başına bir tane) kaydedildi (tohum = 123). Her video için features///

Model mimarisi ve metodolojisi

Temel algılama: zamansal bağlam füzyonu
Z figure-protocol-1RTx1024 özellik matrisi ile temsil edilen bir video klip dizisi verildiğinde, Zamansal Bağlam Füzyonu (TCF) modülü ilk olarak öğrenilen üç doğrusal projeksiyon aracılığıyla sorgu, anahtar ve değer temsillerini hesapladı: 

Q = ZWQ, K = ZWK, V = ZWV (1)

burada WQ, WK, WV figure-protocol-2RTx1024xd eğitilebilir parametrelerdir (PyTorch: üç nn. Doğrusal (1024,d) katmanlar). Bölümler arası afinite S = figure-protocol-3idi, her bir öğenin Rij = α exp (figure-protocol-4) + β olarak hesaplandığı bir Zamansal İlişkisellik Gömme (TRE) dahil edildi. Konuma duyarlı afinite = S + R idifigure-protocol-5. Bir küresel bağlam haritası A = softmax(figure-protocol-6), G = AV geniş alan özelliklerini elde etmek için V'yi topladı. Yerel özellikler L, derinlemesine 1 boyutlu bir evrişim (nn. Conv1d) çekirdek boyutu 3 bölü Z. Dinamik bir kapı g = σ(MLP ([G;L])) ikisini karıştırdı: U = gfigure-protocol-7 G + (1 - g) figure-protocol-8 L . Son olarak, Y (Pytorch:LayerNorm+Linear+residi) üretmek için katman normalizasyonu ve artık bir doğrusal katman uygulandı. 

Temel algılama: nedensel zamansal tahmin aracı

Y çıktısı, klip başına anomali logitleri elde etmek için GELU ve bırakma (Pytorch:padding='nedensel' veya maskeli dönş) ile iki nedensel 1 boyutlu evrişimden geçirildi. Sigmoid fonksiyonunun uygulanması olasılık değerleri figure-protocol-9 [0,1]T verdi.

Anlamsal geliştirme: dış bilgi ile hızlı öğrenme

Anlamsal çapalar oluşturun: Her anormallik sınıfı c için, Kc kavramları Vikiveri11'den sorgulandı ve kodlanan her kavram ifadesi BLIP'in12metin kodlayıcısı ile ei figure-protocol-10 R768'e kodlandı. Sınıf çapası lidi 2-normalleştirilmiş ortalama Dc = norm(figure-protocol-11Σiei) . Gürültüyü azaltmak için, sınıf adına kosinüs benzerliği 0,2'nin altında olan kavramlar düşürüldü ve TF-IDF puanına göre en üst M tutuldu.

Bağlama duyarlı ayırma gerçekleştirin: Ön plan ağırlıklarıα t = softmax(rst) temel dedektör puanlarından hesaplandı st ve arka plan ağırlıkları bt = softmax(r(1 - st)). Ağırlıklı özellikler ffg = Σtαzt ve fbg = Σtbzt'dir.

Görsel ve anlamsal özellikleri hizalayın

Hizalama hedefini tanımlayın: Hizalama adımı sırasında amaç, ön plan görsel özelliği ile özellik alanı içindeki anormal kategorinin karşılık gelen anlamsal tutturucusu arasındaki mesafeyi en aza indirmektir. C anormal kategori anlam kılavuzları figure-protocol-12ve bir standart normal anlam kılavuzundan oluşan bir anlam kılavuzları koleksiyonu oluşturun. Olasılığı belirleyin, P(Dk|v), görsel bir özelliğin, v'nin, k'inci anlamsal kılavuza, Dk'ye karşılık geldiğini. Bunu, Denklem'de gösterildiği gibi sıcaklık ölçekli kosinüs benzerliğini ve ardından Softmax normalizasyonunu kullanarak hesaplayın.

figure-protocol-13(2)

Çapraz entropi, pozitif çiftleri bir araya getirmek ve negatifleri birbirinden ayırmak için en aza indirildi, τs öğrenilebilir bir parametre olarak ayarlandı ve 10'a başlatıldı. Negatif örnek çiftlerini ilişkilendirme olasılığını azaltırken pozitif örnek çiftlerini ilişkilendirme olasılığını optimize ederek hizalamayı gerçekleştirin.

Şablon tabanlı yorumlanabilirlik modülü

Dış bilgi (PLE) ile geliştirilmiş özellik gösterimi ile hızlı öğrenmeye dayalı olarak, doğrusal bir sınıflandırıcı, daha sonra softmax işlevi tarafından sınıf olasılıklarına normalleştirilen sınıf başına logitler üretir; Tahmin edilen anomali türü olasılığı en yüksek kategori olarak belirlendi. Bu arada, dedektör çıktısından küresel bir anormallik puanı hesaplandı. Önem düzeyini belirlemek için bu puan, doğrulama kümesinde ızgara araması yoluyla optimize edilmiş önceden tanımlanmış üç eşikle karşılaştırıldı.

Varsayılan eşikler θyüksek = 0,8, θorta = 0,5 ve θdüşük = 0,2 olarak ayarlandı. Spesifik olarak, puan θyüksekten büyükse, şiddet yüksek olarak etiketlendi; puan θorta ile θyüksek arasındaysa, orta olarak etiketlendi; θdüşük ve θorta arasındaysa, düşük olarak etiketlendi; aksi takdirde yok olarak işaretlendi.

Açıklama oluşturma aşamasında, önceden tanımlanmış bir şablon kitaplığı olan Ek Dosya 1'den tahmin edilen türe karşılık gelen bir şablon seçildi. Bu kitaplık, oluşturulan metnin çeşitliliğini artırmak için birden çok açıklayıcı17 tarafından çapraz doğrulanan birden çok şablon çeşidi içerir. Tahmin edilen tip şablon kitaplığında varsa, karşılık gelen bir şablon rastgele seçilmiştir; aksi takdirde, Bilinmeyen türü için varsayılan bir şablon kullanıldı. Son olarak, tahmin edilen tür, genel anomali puanı, önem derecesi açıklaması ve seçilen şablon entegre edilerek yapılandırılmış bir açıklayıcı metin oluşturuldu. Sistem, tahmin edilen anomali türünü, genel anomali puanını ve oluşturulan açıklayıcı metni son çıkış olarak döndürür. Sonuçlar Şekil 2'de gösterilmektedir.

Tüm eşik parametreleri, doğrulama setinde ızgara araması kullanılarak optimize edildi ve oluşturulan açıklamaların kalitesi, hem insan değerlendirmesi hem de otomatik ölçümler kullanılarak kapsamlı bir şekilde değerlendirildi. Sonuçlar Tablo 1'de sunulmuştur.

Model eğitimi ve değerlendirmesi

Eğitim: Model, Adam (lr 1 x 10-4, ağırlık sönümü 5 x 10-4), parti boyutu 128, 50 epok, lr için kosinüs tavlaması ile uçtan uca eğitildi. Python/Numpy/Pytorch için rastgele tohumlar 123 olarak ayarlandı ve torch.backends.cudnn.deterministic=True etkinleştirildi. Kontrol noktaları her 5 dönemde bir checkpoints//epoch_XX.pt'ye kaydedildi ve en iyi model AUC doğrulaması ile seçildi. Tüm deneyler, Windows 11 çalıştıran NVIDIA GeForce RTX 4060 Ti (16 GB) GPU, Python 3.8.20, PyTorch 1.8.0 ve CUDA 11.1 ile bir sistem üzerinde gerçekleştirildi. Dönem başına yaklaşık eğitim süresi, ShanghaiTech veri kümesi için 30 saniye ve UCF-Crime veri kümesi için 3,5 dakika idi.

Kayıp: Genel amaç L = LMIL+ λ • Lhizalamasıdır. Hiperparametre λ, doğrulama setindeki {0.01,01,0.1,0.5,1,5,10} kümesi boyunca süpürüldü ve test raporlaması için en iyi değer düzeltildi. Üst-K MIL toplaması için Şekil 3'e ve tanımlar için Denklem(3-4)'e bakın.

figure-protocol-14(3)

figure-protocol-15(4)

Değerlendirme: Çerçeve düzeyinde AUC, önceki WS-VAD çalışmaları 2,5 tarafından kullanılan standart protokol izlenerek hesaplandı. UCF-Crime'da ayrıntılı tip tanıma için, Tablo 2'de özetlendiği gibi, IoU 0.1-0.5'te mAP ve AVG mAP rapor edilmiştir; sınıf başına EAA'lar Şekil 4'te ve genel sonuçlar Tablo 3 ve Tablo 4'te gösterilmektedir; gömülebilir ayrılabilirlik ve anomali puanı dinamikleri Şekil 4, Şekil 5 ve Şekil 6'dadır.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Anlamsal çapaların faydasını daha da doğrulamak için, farklı bilgi istemi şablonlarını karşılaştırmak için ek bir deney yapıldı (bkz. Vikiveri ile güçlendirilmiş anlamsal prototipleri kullanan varyant, yalnızca daha yüksek AUC değerleri elde etmekle kalmadı, aynı zamanda oluşturulan açıklamalar için 16,6 ve 14,8'lik BLEU-4 puan iyileştirmelerine de yol açtı. Bu bulgular, istemlerin anlamsal zenginliği ile metinsel yorumların kalitesi arasında güçlü bir bağlantı olduğunu ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Burada sunulan protokol, paradigmayı basit ikili sınıflandırmadan anlamsal olarak temellendirilmiş, yorumlanabilir bir analize kaydırarak zayıf denetimli video anomali tespitinde önemli bir ilerleme sağlar. Bu yöntemin önemi, yalnızca bir anormalliğin meydana gelip gelmediğini belirleme yeteneğinde değil, aynı zamanda ne tür bir anormallik olduğunu ve modelin neden bu sonuca ulaştığını ve mevcut WS-VAD sistemlerindeki 9,29 büyük ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların herhangi bir çıkar çatışması yoktur.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aerospace Hongka Intelligent Technology (Beijing) CO., LTD tarafından sağlanan mali desteği minnetle kabul ediyoruz.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments

BLIP Modeli

Salesforce AraştırmasıViT-B/16Anlamsal çapalar oluşturmak için metin kodlayıcısı olarak kullanılır.
GPUNVIDIARTX 4060TiModelin eğitimi için kullanılıyor
I3D ModeliGoogle DeepMindKinetik  üzerine ön eğitim aldım;Video özelliklerinin çıkarılması için omurga olarak kullanıldı.
NumpyNumPy Geliştirme Ekibi1.21.2Video özellikleri gibi sayısal veri dizilerini işlemek ve işlemek, derin öğrenme modeline aktarılmadan önce kullanılır.
PyTorchFacebook AI Araştırması1.8.0Model mimarisini tanımlamak, özel kayıp fonksiyonlarını uygulamak ve optimizasyon için geri yayılımı çalıştırmak için kullanılır.
PitonPython Yazılım Vakfı3.8.20Veri işleme, model uygulaması, eğitim ve değerlendirme için tüm betikleri yazmak için kullanılır
ShanghaiTech Veri SetiShanghaiTech Üniversitesi13 farklı kampüs sahnesinde eğitim ve değerlendirme için kullanıldı.
UCF-Suç Veri Seti Orta Florida Üniversitesi13 anomali kategorisinin eğitimi ve değerlendirilmesi için kullanıldı.
WikidataWikimedia VakfıPrompt oluşturma için harici bilgi grafiği olarak kullanılır.

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. 13, 70882-70894 (2025).
  3. Dual memory units with uncertainty regulation for weakly supervised video anomaly detection. Zhou, H., Yu, J., Yang, W. Proc AAAI Conf Artificial Intell, 37 (3), 3769-3777 (2023).
  4. Dynamic local aggregation network with adaptive clusterer for anomaly detection. Yang, Z., Wu, P., Liu, J., Liu, X. Proc Eur Conf Comp Vision, 13664, 404-421 (2022).
  5. Pu, Y., Wu, X., Yang, L., Wang, S. Learning prompt-enhanced context features for weakly-supervised video anomaly detection. IEEE Trans. Image Process. 33 (8), 4923-4936 (2024).
  6. Look around for anomalies: Weakly-supervised anomaly detection via context-motion relational learning. Cho, M., et al. Proc Conf Comp Vision Pattern Recognit, , 12137-12146 (2023).
  7. Tian, Y., et al. Weakly-supervised video anomaly detection with robust temporal feature magnitude learning. Proc Int Conf Comp Vision. , 4955-4966 (2021).
  8. Scale-aware spatio-temporal relation learning for video anomaly detection. Li, G., Cai, G., Zeng, X., Zhao, R. Proc Eur Conf Comp Vision, , 333-350 (2022).
  9. Vadclip: Adapting vision-language models for weakly supervised video anomaly detection. Wu, P., et al. Proc Conf Artificial Intell, 38 (6), 6074-6082 (2024).
  10. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications, and challenges. Comp Elect Eng. 117, 109246(2024).
  11. Vrandecic, D., Kroetzsch, M. Wikidata: A free collaborative knowledgebase. Comm ACM. 57 (10), 78-85 (2014).
  12. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. Li, J., Li, D., Xiong, C., Hoi, S. Proc Int Conf Machine Learning, 162, 12888-12900 (2022).
  13. Real-world anomaly detection in surveillance videos. Sultani, W., Chen, C., Shah, M. I. Proc Conf Comp Vision Pattern Recognit, , 6479-6488 (2018).
  14. Future frame prediction for anomaly detection - a new baseline. Liu, W., Luo, W., Lian, D., Gao, S. I. Proc Conf Comp Vision Pattern Recognit, , 6536-6545 (2018).
  15. Quo vadis, action recognition? A new model and the kinetics dataset. Carreira, J., Zisserman, A. Proc Conf Comp Vision Pattern Recognit, , 6299-6308 (2017).
  16. Kay, W., et al. The kinetics human action video dataset. arXiv. , (2017).
  17. Purba, M., et al. Effect of random splitting and cross validation for Indonesian opinion mining using machine learning approach. Int J Adv Comp Sci Appl. 13 (9), 145-151 (2022).
  18. Wu, P., Liu, X., Liu, J. Weakly supervised audio-visual violence detection. Ieee Transact Multimedia. 25, 1674-1685 (2023).
  19. Liu, T., Lam, K. M., Bao, B. K. Injecting text clues for improving anomalous event detection from weakly labeled videos. Ieee Transact Image Proc. 33, 5907-5920 (2024).
  20. Wu, P., Liu, J. Learning causal temporal relation and feature discrimination for anomaly detection. Ieee Transact Image Proc. 30, 3513-3527 (2021).
  21. Assoc Advancement Artificial, I. Self-training multi-sequence learning with transformer for weakly supervised video anomaly detection. Li, S., Liu, F., Jiao, L. Proc Conf Artificial Intell, 36 (2), 1395-1403 (2022).
  22. Normality guided multiple instance learning for weakly supervised video anomaly detection. Park, S., et al. Proc Winter Conf Appl Comp Vision, , 2664-2673 (2023).
  23. Zanella, L., et al. Delving into clip latent space for video anomaly recognition. Comp Vision Image Understanding. 249, 104163(2024).
  24. Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection. Chen, J., et al. Proc Conf Com Vision Pattern Recognit, , 18319-18329 (2024).
  25. Distilling aggregated knowledge for weakly-supervised video anomaly detection. Dalvi, J., Dabouei, A., Dhanuka, G., Xu, M. Proc Winter Conf Appl Comp Vision, , 5439-5448 (2025).
  26. Gods: Generalized one-class discriminative subspaces for anomaly detection. Wang, J., Cherian, A. I. Proc Int Conf Comp Vision, , 8200-8210 (2019).
  27. Biswas, D., Tesic, J. Mmvad: A vision-language model for cross-domain video anomaly detection with contrastive learning and scale-adaptive frame segmentation. Exp Syst Appl. 285, 127857(2025).
  28. Lim, J., Lee, J., Kim, H., Park, E. Vicap-ad: Video caption-based weakly supervised video anomaly detection. Machine Vision Applicat. 36 (3), 61(2025).
  29. Gao, W., Wang, X., Wang, Y., Jing, X. Dual-stream attention-enhanced memory networks for video anomaly detection. Sensors. 25 (17), 5496(2025).
  30. Duong, H. T., Le, V. T., Hoang, V. T. Deep learning-based anomaly detection in video surveillance: A survey. Sensors. 23 (11), 5024(2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

Related Articles