Research Article

Model wyrównany z kotwicą semantyczną do wykrywania anomalii wideo pod nadzorem międzymodalnym

DOI:

10.3791/69286

November 14th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Protokół ten ma na celu poprawę wykrywania anomalii wideo pod słabym nadzorem poprzez integrację ustrukturyzowanej wiedzy. Jego celem jest umożliwienie klasyfikacji konkretnych typów anomalii oraz dostarczanie jasnych, interpretowalnych wyjaśnień wyników wykrywania, wykraczając poza proste decyzje binarne i zwiększając przejrzystość.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Słabo nadzorowane wykrywanie anomalii wideo to kluczowa technika, która opiera się wyłącznie na etykietach na poziomie wideo do identyfikacji zdarzeń anomalii. Jednak tradycyjne metody uczenia wielokrotnego instancji (MIL) opierają się na gruboziarnistym nadzorze binarnym. Takie podejście utrudnia rozróżnienie drobnoziarnistych kategorii anomalii. Metody te często koncentrują się wyłącznie na najbardziej anomalicznych segmentach, co skutkuje wynikami pozbawionymi możliwości interpretacji. Aby przezwyciężyć te ograniczenia, badanie proponuje podejście do modelowania cech, które uwzględnia uporządkowaną wiedzę. Dzięki zastosowaniu dynamicznego mechanizmu nawigacji semantycznej, słabo nadzorowane wykrywanie anomalii wideo łączy zewnętrzne informacje na poziomie kategorii z możliwymi do uczenia się promptami, generując sygnały semantyczne w przestrzeni cech. Sygnały te są zgodne z wizualnymi dowodami wyodrębnionymi przez moduł wykrywania anomalii podstawowych, co daje dwa uzupełniające się wyjścia: wynik anomalii do ilościowego określania nasilenia zdarzeń anomalii oraz opisy semantyczne zgodne z zewnętrznymi koncepcjami, które mogą być wykorzystywane do generowania uporządkowanych i interpretowalnych tekstów wyjaśniających za pomocą predefiniowanych szablonów. Wyniki eksperymentalne pokazują, że proponowana metoda osiąga AUC na poziomie 88,03% w zbiorze danych UCF-Crime oraz 98,23% w zbiorze danych ShanghaiTech, osiągając dokładność 87,05% w zadaniach klasyfikacji anomalii o ziarnistości. Co więcej, generowane wyjaśnienia semantyczne rozszerzają słabo nadzorowane wykrywanie z binarnego zadania klasyfikacji na ramy analizy anomalii oparte na semantyce.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wykrywanie anomalii wideo (VAD) odgrywa kluczową rolę w takich dziedzinach jak bezpieczeństwo publiczne i inteligentna produkcja, gdzie oferuje skalowalne rozwiązanie ograniczeń manualnego nadzoru1. W szczególności słabo nadzorowane wykrywanie anomalii wideo (WS-VAD) zyskało na znaczeniu dzięki uzależnieniu od etykiet na poziomie wideo, co znacznie zmniejsza obciążenie ręcznym adnotowaniem i poprawia uogólnialność na różne sceny. Pomimo praktycznych zalet, metody WS-VAD nadal napotykają poważne wyzwania w precyzyjnym określeniu natury nieprawidłowych zdarzeń2. Istniejące modele często wykrywają obecność anomalii, ale mają trudności z określeniem ich dokładnej kategorii lub dostarczaniem istotnych informacji diagnostycznych 3,4. Na przykład w warunkach przemysłowych model może mylić dym z przegrzanych łożysk z nieszkodliwymi emisjami pary lub błędnie uważać zwykłe iskry spawacze za wczesne oznaki pożaru, co prowadzi do kosztownych błędnych ocen i niepotrzebnych wyłączeń. Te semantyczne nieporozumienia wynikają z wrodzonych ograniczeń obecnych podejść WS-VAD5. Binarne etykiety na poziomie wideo jedynie wskazują, czy anomalia istnieje, nie oferując wglądu w jej przyczynę, lokalizację i stopień nasilenia. Co więcej, główneframeworki uczenia się wielu instancji (MIL) agregują przewidywania na poziomie klipów za pomocą prostych heurystyk7, które nie oddają subtelnej semantyki różnych typów zdarzeń. W rezultacie przestrzeń wyuczonych cech wizualnych staje się niejednoznaczna, gdzie wizualnie podobne, lecz semantycznie różne zjawiska – takie jak dym i para – są zbyt blisko mapowane, zacierając granice decyzyjne.

Wyłoniły się dwa główne kierunki badawcze, aby rozwiązać te ograniczenia. Jeden skupia się na ulepszaniu ram MIL poprzez ulepszone modelowanie czasowe 4,5,8 lub wybór cech sterowanych przez wyrazy3. Chociaż takie metody poprawiają lokalizację anomalii, nadal nie zapewniają jasności semantycznej i łatwości interpretacyjnej. Drugi kierunek polega na dopasowywaniu reprezentacji wizji i języka poprzez integrację wcześniej wytrenowanych modeli multimodalnych, takich jak VadCLIP9. Choć ta strategia daje nadzieję, często nie wykorzystuje w pełni semantycznego bogactwa języka. Prowadzi to do słabych skojarzeń międzymodalnych i nieprzejrzystych procesów decyzyjnych, co skutkuje dwoma kluczowymi niedoskonałościami. Po pierwsze, obecne modele nie potrafią konsekwentnie rozróżniać kategorii anomalii ze względu na niejasną semantykę cech i niewystarczającą wiedzę zewnętrzną. Po drugie, proces decyzyjny zawiera czarną skrzynkę, bez przejrzystego wyjaśnienia, dlaczego dane zdarzenie zostało uznane za anomalię. Chociaż niektóre metody zawierają tekstowe podpowiedzi (np. walka, strzelanie), są one zawsze proste i luźno zorganizowane, pozbawione zarówno głębi semantycznej, jak i zrozumienia kontekstu.

Aby wypełnić te luki, wprowadzono nową metodę WS-VAD, która integruje ustrukturyzowaną zewnętrzną wiedzę z interpretowalnymi mechanizmami decyzyjnymi, co jest kluczowym celem w szerszej dziedzinie Wyjaśnialnej Sztucznej Inteligencji (XAI)10. Zamiast używać podstawowych nazw kategorii jako promptów, metoda tworzy bogate reprezentacje semantyczne – zwane chmurami konceptów semantycznych – korzystając z Wikidata11. W przeciwieństwie do istniejących metod multimodalnych, takich jak VadCLIP9 , które opierają się na statycznych promptach tekstowych lub prostych etykietach kategorii, te semantyczne chmury pojęć zawierają kompleksową wiedzę kontekstową, w tym powiązane byty, atrybuty oraz relacje przyczynowe wyodrębnione ze strukturalnych grafów wiedzy. Te chmury koncepcyjne są kodowane w kotwicach semantycznych za pomocą modeluBLIP 12, który umożliwia systemowi dostęp do semantyki zdarzeń szczegółowych. Kluczową innowacją mechanizmu kotwicy semantycznej jest jego zdolność do tworzenia dynamicznych, wzbogaconych o wiedzę reprezentacji dostosowujących się do konkretnych kontekstów anomalii, podczas gdy wcześniejsze metody oparte na promptach wykorzystują stałe opisy tekstowe, które nie mają głębi kontekstowej ani relacji semantycznych. Aby jeszcze bardziej udoskonalić przestrzeń cech, mechanizm wyrównania sterowany przez wyróżnienia selektywnie kojarzy te kotwicy z najbardziej istotnymi dowodami wizualnymi. To ukierunkowane wyrównanie zwiększa dyskryminacyjną moc cech, jednocześnie poprawiając semantyczną klarowność wyników detekcji. Co ważniejsze, proponowana metoda wspiera przejrzystą interpretację. Gdy kotwica semantyczna zostanie wyrównana z dowodami wizualnymi, model generuje uporządkowane wyjaśnienia w języku naturalnym, wykorzystując wcześniej zdefiniowane szablony, wyraźnie odnosząc się zarówno do natury, jak i uzasadnienia anomalii. Ważne jest, aby zauważyć, że wdrożenie tej metody opiera się na konkretnych wymaganiach wstępnych, w tym na wykorzystaniu wstępnie wyodrębnionych cech wizualnych I3D, dostępie do zewnętrznej bazy wiedzy (Wikidata) oraz wstępnie wytrenowanego enkodera BLIP. Ramy te są więc najbardziej przydatne w zastosowaniach, gdzie kluczowe jest wyjście poza proste wykrywanie binarne i klasyfikowanie konkretnych typów anomalii oraz dostarczanie interpretowalnych uzasadnień dla wyników.

Kluczowe wkłady są następujące. Nowatorska metoda WS-VAD została opracowana poprzez połączenie wiedzy zewnętrznej ze strukturalną interpretowalnością, aby poprawić zrozumienie semantyczne i przejrzystość decyzji. Wprowadzono metodę promptingu opartą na semantyce emantycznej oraz mechanizm wyrównania świadomego kontekstu, aby przezwyciężyć ograniczenia modeli MIL opartych wyłącznie na wizualnym wzorze. Włączony jest moduł wyjaśnień generatywnych, wykorzystujący kotwicy semantyczne jako interpretowalne jednostki do tworzenia spójnych racjonalnych argumentów tekstowych. Szerokie eksperymenty przeprowadzone na zbiorach danych UCF-Crime i ShanghaiTech pokazują skuteczność proponowanej metody, osiągając wysokie wyniki AUC (88,03% / 98,23%) oraz lepsze wyniki rozpoznawania szczegółowego, z jasnymi i interpretowalnymi wynikami.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badanie wykorzystuje wyłącznie publicznie dostępne zbiory danych (UCF-Crime13 oraz ShanghaiTech14). Wszystkie filmy pochodzą z oficjalnych wydań zbiorów danych, które anonimizują dane osobowe w zakresie udostępnionym przez opiekunów zbioru. Autorzy nie przeprowadzili dodatkowych danych ani interakcji z ludźmi; dlatego nie było wymagane nowe zatwierdzenie IRB. Korzystanie z danych jest zgodne z licencjami i warunkami użytkowania odpowiednich zbiorów danych.

Przygotowanie danych i ekstrakcja cech

Przygotowanie zestawu danych: Zestawy danych UCF-Crime13 (1 610 filmów pociągowych/290 testowych) oraz ShanghaiTech14 (238 pociągów/199 filmów testowych) zostały przyjęte według standardowych podziałów. Filmy były wstępnie przetwarzane za pomocą FFmpeg, aby zapewnić powtarzalność, ponownie kodowane do H.264, próbkowane do 25 fps i zmniejszone do rozdzielczości 256 x 256 za pomocą polecenia: ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset veryfast pre/.

Ekstrakcja cech: Cechy RGB zostały wyodrębnione przez szkielet I3D15 wstępnie wytrenowany na zbiorze danych Kinetics16. Filmy dzielono na nienakładające się 16-klatkowe klipy; Każdy klip był przycięty centralnie do 224 x 224 pikseli. Przedostatnie aktywacje warstw były uśredniane w puli, aby uzyskać funkcję 1024-D na klip. W PyTorch odpowiada to przesuwaniu tensorów kształtu [B, 3, T, H, W] przez szkielet I3D i stosowaniu adaptive_avg_pool3d a następnie spłaszczeniu. Wyodrębnione cechy były zapisywane w plikach .npy (po jednym na film) wraz ze znacznikami czasu klipów dla dokładnej powtarzalności (seed = 123). Dla każdego wideo features///

Architektura i metodologia modelu

Podstawowe wykrywanie: fuzja kontekstu czasowego
Mając sekwencję klipów wideo reprezentowaną przez macierz cech Z figure-protocol-1 RTx1024, moduł Temporal Context Fusion (TCF) najpierw obliczył reprezentacje zapytań, klucza i wartości za pomocą trzech wyuczonych projekcji liniowych:

Q = ZWQ, K = ZWK, V = ZWV (1)

gdzie WQ, WK, WV figure-protocol-2 RTx1024xd są parametrami trenowalnymi (PyTorch: trzy nn. Warstwy liniowe (1024,d). Powinowactwa międzysegmentowe to S = figure-protocol-3, wprowadzono osadzenie relacyjne czasowe (TRE), gdzie każdy element obliczono jako Rij = α exp (figure-protocol-4) + β . Powinowactwo do lokalizacji wynosiło figure-protocol-5 = S + R. Mapa globalnego kontekstu A = softmax(figure-protocol-6) agregowana V, aby uzyskać cechy szerokiego obszaru G = AV. Lokalne cechy L obliczono za pomocą głęboko-jednowymiarowej konwolucji (nn. Conv1d) o rozmiarze jądra 3 przez Z. Dynamiczna bramka g = σ(MLP ([G;L])) wymieszano oba elementy: U = gfigure-protocol-7 G + (1 - g) figure-protocol-8 L. Na koniec zastosowano normalizację warstw i warstwę liniową resztkową, aby uzyskać Y (Pytorch:LayerNorm+Linear+residual).

Podstawowe wykrywanie: przyczynowy predyktor czasowy

Wyjście Y było przekazywane przez dwie przyczynowe konwolucje jednowymiarowe z GELU i dropout (Pytorch:padding='kauzalne' lub maskowane konw), aby uzyskać logity anomalii na klip. Zastosowanie funkcji sigmoidalnej dało wartości figure-protocol-9 prawdopodobieństwa [0,1]T.

Wzmocnienie semantyczne: uczenie się prompt z wykorzystaniem wiedzy zewnętrznej

Konstruuj kotwicy semantyczne: Dla każdej klasy anomalii c zapytano K koncepcji c z Wikidanych11, a każda fraza pojęciowa została zakodowana za pomocą12-tekstowegokodera BLIP do ei figure-protocol-10 R768. Kotwicą klasy była średnia znormalizowana l-2 Dc = norm(figure-protocol-11Σiei). Aby zmniejszyć szum, pojęcia o współsinusowym podobieństwie do nazwy klasy poniżej 0,2 zostały usunięte, a wynik z najwyższej liczby M według TF-IDF zachowano.

Wykonaj separację kontekstową: wagi pierwszego planu αt = softmax(rst) zostały obliczone na podstawie podstawowych wyników detektorów st, a wagi tła bt = softmax(r(1 - s t)). Cechy ważone to ffg = Σtαzt oraz fbg = Σtbzt .

Zrównanie cech wizualnych i semantycznych

Zdefiniuj cel wyrównania: Podczas etapu wyrównania celem jest minimalizacja odległości między elementem wizualnym na pierwszym planie a odpowiadającym mu semantycznym kotwicą kategorii anomalii w przestrzeni cech. Stwórz kolekcję przewodników semantycznych, figure-protocol-12, obejmującą C przewodniki semantyczne kategorii anomalnych oraz jeden standardowy normalny przewodnik semantyczny. Określ prawdopodobieństwo, P(Dk|v), że cecha wizualna, v, odpowiada k-temu przewodnikowi semantycznemu, Dk. Oblicz to, używając porównania cosinusowego skalowanego temperaturowo, a następnie normalizacji Softmax, jak pokazano w równaniu (2).

figure-protocol-13  (2)

Entropia krzyżowa była minimalizowana tak, aby zbliżać pary dodatnie, a ujemne rozdzielać, ustawiając τs jako parametr uczliwy i inicjalizując go do 10. Osiągnij dopasowanie, optymalizując prawdopodobieństwo korelacji pozytywnych par próbek, jednocześnie zmniejszając prawdopodobieństwo korelacji ujemnych par próbek.

Moduł interpretowalności oparty na szablonach

Na podstawie reprezentacji cech wzmocnionej przez prompt learning z zewnętrzną wiedzą (PLE), liniowy klasyfikator generuje logity dla klas, które następnie zostały znormalizowane na prawdopodobieństwa klas za pomocą funkcji softmax; Przewidywany typ anomalii został określony jako kategoria o najwyższym prawdopodobieństwie. Tymczasem na podstawie wyjścia detektora obliczono globalny wynik anomalii. Aby określić poziom nasilenia, ten wynik porównano z trzema wcześniej zdefiniowanymi progami zoptymalizowanymi za pomocą wyszukiwania siatkowego na zestawie walidacyjnym.

Domyślne progi ustawiono na θwysoki = 0,8, θśredni = 0,5 oraz θniski = 0,2. Konkretnie, jeśli wynik był większy niż θwysoki, nasilenie oznaczano jako wysokie; jeśli wynik mieści się między θśrednim a θwysokim, był oznaczany jako średni; jeśli pomiędzy θniskim a θśrednim, oznaczano go jako niskie; w przeciwnym razie oznaczano go jako brak.

Podczas fazy generowania wyjaśnień wybrano szablon odpowiadający typowi przewidywanemu z wcześniej zdefiniowanej biblioteki szablonów, Plik Uzupełniający 1. Ta biblioteka zawiera wiele wariantów szablonów, które zostały zweryfikowane przez wielu annotatorów17 , aby zwiększyć różnorodność generowanego tekstu. Jeśli przewidywany typ istnieje w bibliotece szablonów, odpowiadający mu szablon został wybrany losowo; w przeciwnym razie stosowano domyślny szablon dla typu Nieznany. Na koniec powstał uporządkowany tekst wyjaśniający poprzez integrację typu przewidywanego, globalnego wyniku anomalii, opisu nasilenia oraz wybranego szablonu. System zwraca przewidywany typ anomalii, globalny wynik anomalii oraz wygenerowany tekst wyjaśniający jako końcowy wynik. Wyniki przedstawiono na Rysunku 2.

Wszystkie parametry progowe zostały zoptymalizowane za pomocą wyszukiwania siatkowego na zbiorze walidacyjnym, a jakość wygenerowanych wyjaśnień została kompleksowo oceniona przy użyciu oceny ludzkiej oraz zautomatyzowanych metryk. Wyniki przedstawiono w Tabeli 1.

Trening i ocena modelu

Trening: Model był trenowany end-to-end z Adamem (lr 1 x 10-4, spadek masy 5 x 10-4), wielkość partii 128, 50 epok, wyżarzanie cosinusowe dla lr. Losowe seedy zostały ustawione na 123 dla Pythona/Numpy/Pytorch i włączone torch.backends.cudnn.deterministic=True. Punkty kontrolne zapisywano co 5 epok do punktów kontrolnych//epoch_XX.pt, a najlepszy model wybierano przez walidację AUC. Wszystkie eksperymenty przeprowadzono na systemie z kartą NVIDIA GeForce RTX 4060 Ti (16GB) z Windows 11, z Pythonem 3.8.20, PyTorch 1.8.0 i CUDA 11.1. Przybliżony czas treningu na epokę wynosił 30 sekund dla zbioru danych ShanghaiTech i 3,5 min dla zbioru danych UCF-Crime.

Strata: Ogólny cel to L = LMIL+ λ • Lwyrównanie. Hiperparametr λ był przesuwany przez zbiór {0.01,0.1,0.5,1,5,10} na zbiorze walidacyjnym i ustalono najlepszą wartość dla raportowania testów. Zobacz Rysunek 3 dla agregacji top-K MIL oraz równanie (3-4) dla definicji.

figure-protocol-14 (3)

figure-protocol-15 (4)

Ocena: AUC na poziomie klatki zostało obliczone zgodnie ze standardowym protokołem używanym przez wcześniejsze prace WS-VAD 2,5. Dla precyzyjnego rozpoznawania typów na UCF-Crime raportowano mAP na IoU 0.1-0.5 oraz AVG mAP, jak podsumowano w Tabeli 2; AUC dla każdej klasy pokazano na Rysunku 4, a wyniki ogólne w Tabeli 3 i Tabeli 4; Dynamika rozdzielności osadzenia i anomalii punktowej przedstawiono na Rysunku 4, Rysunku 5 i Rysunku 6.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aby dodatkowo zweryfikować użyteczność kotwic semantycznych, przeprowadzono dodatkowy eksperyment w celu porównania różnych szablonów promptów (patrz Tabela 1). Wariant wykorzystujący prototypy semantyczne uzupełnione przez Wikidata nie tylko osiągnął wyższe wartości AUC, ale także doprowadził do poprawy wyniku BLEU-4 o 16,6 i 14,8 dla wygenerowanych wyjaśnień. Wyniki te wskazują na silny związek między bogactwem semantycznymi promptów a jakością interpretacji tekstowych, potwierdzając, że proces generow...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przedstawiony tutaj protokół wprowadza istotny postęp w słabo nadzorowanym wykrywaniu anomalii wideo, przesuwając paradygmat z prostej klasyfikacji binarnej na analizę semantycznie ugruntowaną, interpretowalną. Znaczenie tej metody polega nie tylko na tym, czy wystąpiła anomalia, ale także w tym, jakiego rodzaju anomalię to jest i dlaczego model doszedł do takiego wniosku, rozwiązując istotne ograniczenie istniejących systemów WS-VAD 9,29.

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają konfliktu interesów.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Z wdzięcznością dziękujemy za wsparcie finansowe udzielone przez Aerospace Hongka Intelligent Technology (Beijing) CO., LTD.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments

BLIP Model

Salesforce ResearchViT-B/16Używany jako enkoder tekstu do tworzenia kotwic semantycznych.
GPUNVIDIARTX 4060TiUżywany do trenowania modelu
I3D ModelGoogle DeepMindWstępnie przeszkolony na Kinetics Wykorzystywane jako szkielet do ekstrakcji funkcji wideo.
NumpyZespół deweloperski NumPy1.21.2Wykorzystywane do obsługi i przetwarzania numerycznych tablic danych, takich jak funkcje wideo, zanim zostaną wprowadzone do modelu głębokiego uczenia.
PyTorchBadania nad AI na Facebooku1.8.0Używany do definiowania architektury modelu, implementacji niestandardowych funkcji strat oraz uruchamiania propagacji wstecznej w celu optymalizacji.
PytonPython Software Foundation3.8.20Używany do pisania wszystkich skryptów do przetwarzania danych, implementacji modeli, treningu i oceny
ShanghaiTech DatasetUniwersytet ShanghaiTechWykorzystywane do szkoleń i ocen w 13 różnych scenach kampusowych.
UCF - Zbiór Danych Przestępczości Uniwersytet Centralnej FlorydyWykorzystywany do szkolenia i oceny 13 kategorii anomalii.
WikidataFundacja WikimediaWykorzystywane jako zewnętrzny graf wiedzy do konstrukcji promptów.

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. 13, 70882-70894 (2025).
  3. Dual memory units with uncertainty regulation for weakly supervised video anomaly detection. Zhou, H., Yu, J., Yang, W. Proc AAAI Conf Artificial Intell, 37 (3), 3769-3777 (2023).
  4. Dynamic local aggregation network with adaptive clusterer for anomaly detection. Yang, Z., Wu, P., Liu, J., Liu, X. Proc Eur Conf Comp Vision, 13664, 404-421 (2022).
  5. Pu, Y., Wu, X., Yang, L., Wang, S. Learning prompt-enhanced context features for weakly-supervised video anomaly detection. IEEE Trans. Image Process. 33 (8), 4923-4936 (2024).
  6. Look around for anomalies: Weakly-supervised anomaly detection via context-motion relational learning. Cho, M., et al. Proc Conf Comp Vision Pattern Recognit, , 12137-12146 (2023).
  7. Tian, Y., et al. Weakly-supervised video anomaly detection with robust temporal feature magnitude learning. Proc Int Conf Comp Vision. , 4955-4966 (2021).
  8. Scale-aware spatio-temporal relation learning for video anomaly detection. Li, G., Cai, G., Zeng, X., Zhao, R. Proc Eur Conf Comp Vision, , 333-350 (2022).
  9. Vadclip: Adapting vision-language models for weakly supervised video anomaly detection. Wu, P., et al. Proc Conf Artificial Intell, 38 (6), 6074-6082 (2024).
  10. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications, and challenges. Comp Elect Eng. 117, 109246(2024).
  11. Vrandecic, D., Kroetzsch, M. Wikidata: A free collaborative knowledgebase. Comm ACM. 57 (10), 78-85 (2014).
  12. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. Li, J., Li, D., Xiong, C., Hoi, S. Proc Int Conf Machine Learning, 162, 12888-12900 (2022).
  13. Real-world anomaly detection in surveillance videos. Sultani, W., Chen, C., Shah, M. I. Proc Conf Comp Vision Pattern Recognit, , 6479-6488 (2018).
  14. Future frame prediction for anomaly detection - a new baseline. Liu, W., Luo, W., Lian, D., Gao, S. I. Proc Conf Comp Vision Pattern Recognit, , 6536-6545 (2018).
  15. Quo vadis, action recognition? A new model and the kinetics dataset. Carreira, J., Zisserman, A. Proc Conf Comp Vision Pattern Recognit, , 6299-6308 (2017).
  16. Kay, W., et al. The kinetics human action video dataset. arXiv. , (2017).
  17. Purba, M., et al. Effect of random splitting and cross validation for Indonesian opinion mining using machine learning approach. Int J Adv Comp Sci Appl. 13 (9), 145-151 (2022).
  18. Wu, P., Liu, X., Liu, J. Weakly supervised audio-visual violence detection. Ieee Transact Multimedia. 25, 1674-1685 (2023).
  19. Liu, T., Lam, K. M., Bao, B. K. Injecting text clues for improving anomalous event detection from weakly labeled videos. Ieee Transact Image Proc. 33, 5907-5920 (2024).
  20. Wu, P., Liu, J. Learning causal temporal relation and feature discrimination for anomaly detection. Ieee Transact Image Proc. 30, 3513-3527 (2021).
  21. Assoc Advancement Artificial, I. Self-training multi-sequence learning with transformer for weakly supervised video anomaly detection. Li, S., Liu, F., Jiao, L. Proc Conf Artificial Intell, 36 (2), 1395-1403 (2022).
  22. Normality guided multiple instance learning for weakly supervised video anomaly detection. Park, S., et al. Proc Winter Conf Appl Comp Vision, , 2664-2673 (2023).
  23. Zanella, L., et al. Delving into clip latent space for video anomaly recognition. Comp Vision Image Understanding. 249, 104163(2024).
  24. Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection. Chen, J., et al. Proc Conf Com Vision Pattern Recognit, , 18319-18329 (2024).
  25. Distilling aggregated knowledge for weakly-supervised video anomaly detection. Dalvi, J., Dabouei, A., Dhanuka, G., Xu, M. Proc Winter Conf Appl Comp Vision, , 5439-5448 (2025).
  26. Gods: Generalized one-class discriminative subspaces for anomaly detection. Wang, J., Cherian, A. I. Proc Int Conf Comp Vision, , 8200-8210 (2019).
  27. Biswas, D., Tesic, J. Mmvad: A vision-language model for cross-domain video anomaly detection with contrastive learning and scale-adaptive frame segmentation. Exp Syst Appl. 285, 127857(2025).
  28. Lim, J., Lee, J., Kim, H., Park, E. Vicap-ad: Video caption-based weakly supervised video anomaly detection. Machine Vision Applicat. 36 (3), 61(2025).
  29. Gao, W., Wang, X., Wang, Y., Jing, X. Dual-stream attention-enhanced memory networks for video anomaly detection. Sensors. 25 (17), 5496(2025).
  30. Duong, H. T., Le, V. T., Hoang, V. T. Deep learning-based anomaly detection in video surveillance: A survey. Sensors. 23 (11), 5024(2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

Related Articles