Исследовательская статья

Семантическая модель с привязкой для детектируемого обнаружения видеоаномалий в условиях кросс-модального слабого надзора

DOI:

10.3791/69286

14 ноября 2025 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол направлен на улучшение обнаружения аномалий в видео со слабым контролем за счет интеграции структурированных знаний. Его цель состоит в том, чтобы обеспечить классификацию конкретных типов аномалий и предоставить четкие, интерпретируемые объяснения результатов обнаружения, выйдя за рамки простых бинарных решений и повысив прозрачность.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Слабо контролируемое обнаружение аномалий на видео — это ключевой метод, который опирается исключительно на метки на уровне видео для идентификации аномальных событий. Однако традиционные методы многоэкземплярного обучения (MIL) основаны на грубом двоичном контроле. Такой подход затрудняет разграничение категорий мелкозернистых аномалий. Эти методы часто фокусируются исключительно на наиболее аномальных сегментах, что приводит к результатам обнаружения, которые не поддаются интерпретации. Чтобы преодолеть эти ограничения, в данном исследовании предлагается подход к моделированию признаков, который включает в себя структурированные знания. Используя механизм динамического семантического руководства, слабо контролируемое обнаружение видеоаномалий объединяет внешнюю информацию на уровне категории с обучаемыми подсказками для генерации семантических сигналов в пространстве признаков. Эти сигналы согласуются с визуальными доказательствами, извлеченными базовым модулем обнаружения аномалий, создавая два взаимодополняющих выходных данных: оценку аномалий для количественной оценки серьезности аномальных событий и семантические описания, согласованные с внешними концепциями, которые можно использовать для создания структурированных и интерпретируемых пояснительных текстов с помощью предварительно определенных шаблонов. Экспериментальные результаты показывают, что предложенный метод достигает AUC 88,03% на наборе данных UCF-Crime и 98,23% на наборе данных ShanghaiTech, достигая точности 87,05% в задачах тонкой классификации аномалий. Более того, сгенерированные семантические объяснения расширяют слабоконтролируемое обнаружение от задачи двоичной классификации до управляемой семантикой интерпретируемой структуры анализа аномалий.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Обнаружение видеоаномалий (VAD) играет важную роль в таких областях, как общественная безопасность и интеллектуальное производство, где оно предлагает масштабируемое решение для ограничений ручного видеонаблюдения1. В частности, слабо контролируемое обнаружение видеоаномалий (WS-VAD) получило известность благодаря своей зависимости от меток на уровне видео, что значительно снижает нагрузку на ручное аннотирование и улучшает обобщение в различных сценах. Несмотря на свои практические преимущества, методы WS-VAD по-прежнему сталкиваются со значительными проблемами в точной идентификации природы аномальных событий2. Существующие модели часто обнаруживают наличие аномалий, но не могут определить их точную категорию или предоставить значимую диагностическую информацию 3,4. Например, в промышленных условиях модель может спутать дым от перегретых подшипников с безвредными выбросами пара или ошибочно принять обычные сварочные искры за ранние признаки возгорания, что приводит к дорогостоящим ошибкам и ненужным остановкам. Эти семантические путаницы возникают из-за ограничений, присущих современным подходам WS-VAD5. Двоичные метки на уровне видео просто указывают на существование аномалии, не давая понять ее причину, местоположение и серьезность. Более того, основные фреймворки многоэкземплярного обучения (MIL)6 агрегируют прогнозы на уровне клипов с использованием простых эвристик7, которые не могут охватить нюансы семантики различных типов событий. В результате усвоенное пространство визуальных признаков становится неоднозначным, в котором визуально похожие, но семантически разные явления, такие как дым и пар, отображаются слишком близко, размывая границы решений.

Для устранения этих ограничений были выделены два основных направления исследований. Один из них направлен на совершенствование структуры MIL за счет улучшенного временного моделирования 4,5,8 или выбора признаков на основе значимости3. Хотя такие методы улучшают локализацию аномалий, они все еще не обеспечивают семантической ясности и интерпретируемости. Другое направление включает в себя согласование визуального и языкового представлений путем интеграции предварительно обученных мультимодальных моделей, таких как VadCLIP9. Несмотря на то, что эта стратегия выглядит многообещающей, ей часто не удается в полной мере использовать семантическое богатство языка. Это приводит к слабым кросс-модальным ассоциациям и непрозрачным процессам принятия решений, что приводит к двум основным недостаткам. Во-первых, современные модели не могут последовательно различать категории аномалий из-за расплывчатой семантики признаков и недостатка внешних знаний. Во-вторых, процесс принятия решений содержит черный ящик, без прозрачного объяснения, почему то или иное событие классифицируется как аномальное. Хотя некоторые методы включают текстовые подсказки (например, драка, стрельба), они всегда упрощены и слабо организованы, им не хватает как семантической глубины, так и контекстуального понимания.

Для устранения этих пробелов был введен новый метод WS-VAD, который объединяет структурированные внешние знания с интерпретируемыми механизмами принятия решений, что является основной целью в более широкой области объяснимого искусственного интеллекта (XAI)10. Вместо того, чтобы использовать базовые названия категорий в качестве подсказок, метод конструирует богатые семантические представления, называемые облаками семантических концепций, используя Викиданные11. В отличие от существующих мультимодальных методов, таких как VadCLIP9 , которые полагаются на статические текстовые подсказки или простые метки категорий, эти семантические облака понятий инкапсулируют всесторонние контекстуальные знания, включая связанные сущности, атрибуты и причинно-следственные связи, извлеченные из структурированных графов знаний. Эти концептуальные облака кодируются в семантические якоря с помощью модели BLIP12, которая позволяет системе получать доступ к детальной семантике событий. Ключевое новшество механизма семантического якоря заключается в его способности создавать динамичные, обогащенные знаниями представления, которые адаптируются к конкретным контекстам аномалий, в то время как предыдущие методы, основанные на подсказках, используют фиксированные текстовые описания, которым не хватает контекстуальной глубины и семантических отношений. Чтобы еще больше уточнить пространство признаков, механизм выравнивания, управляемый салентностью, выборочно связывает эти привязки с наиболее релевантными визуальными доказательствами. Такое целевое выравнивание усиливает дискриминирующую способность признаков, одновременно повышая семантическую ясность результатов обнаружения. Что еще более важно, предложенный метод поддерживает прозрачную интерпретацию. После того, как семантический якорь согласован с визуальными доказательствами, модель генерирует структурированные объяснения на естественном языке с использованием предопределенных шаблонов, явно обращаясь как к природе, так и к обоснованию аномалии. Важно отметить, что реализация этого метода опирается на определенные предварительные условия, включая использование предварительно извлеченных визуальных функций I3D, доступ к внешней базе знаний (Викиданным) и предварительно обученному кодировщику BLIP. Таким образом, эта среда наиболее полезна в приложениях, где важно выйти за рамки простого двоичного обнаружения, чтобы вместо этого классифицировать конкретные типы аномалий и предоставить интерпретируемые обоснования результатов.

Основные вклады заключаются в следующем. Новый метод WS-VAD разработан путем объединения внешних знаний со структурированной интерпретируемостью для улучшения семантического понимания и прозрачности решений. Для преодоления ограничений моделей MIL, основанных только на визуальном внедрении, введен метод подсказок на основе семантического встраивания и механизм контекстно-зависимого выравнивания. В него включен модуль генеративного объяснения, использующий семантические якоря в качестве интерпретируемых единиц для создания согласованных текстовых обоснований. Обширные эксперименты, проведенные на наборах данных UCF-Crime и ShanghaiTech, демонстрируют эффективность предложенного метода, достигая высоких показателей AUC (88,03% / 98,23%) и превосходной производительности мелкозернистого распознавания с четкими и интерпретируемыми результатами.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании используются только общедоступные наборы данных (UCF-Crime13 и ShanghaiTech14). Все видео были получены из официальных версий наборов данных, которые анонимизируют личную информацию в той мере, в какой это было предоставлено разработчиками наборов данных. Авторы не проводили никакого дополнительного сбора данных или взаимодействия с человеком и субъектом; поэтому новое одобрение IRB не требовалось. Использование данных соответствует лицензиям и условиям использования соответствующих наборов данных.

Подготовка данных и извлечение признаков

Подготовка наборов данных: Наборы данных UCF-Crime13 (1 610 поездов/290 тестовых видео) и ShanghaiTech14 (238 поездов/199 тестовых видео) были приняты в соответствии с их стандартным распределением. Видео было предварительно обработано с помощью FFmpeg для обеспечения воспроизводимости, перекодировано в H.264, передискретизировано до 25 кадров в секунду и изменено до разрешения 256 x 256 с помощью команды: ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset veryfast pre/.

Извлечение признаков: Элементы RGB были извлечены с помощью магистрали I3D15 , предварительно обученной на наборе данныхKinetics 16. Видео были разбиты на неперекрывающиеся 16-кадровые клипы; Каждый клип был обрезан по центру до 224 x 224 пикселей. Активации предпоследнего слоя были усреднены для получения функции 1024-D на клип. В PyTorch это соответствует пересылке тензоров формы [B, 3, T, H, W] через остов I3D и нанесению adaptive_avg_pool3d с последующим сплющиванием. Извлеченные функции были сохранены в файлах .npy (по одному на видео) вместе с временными метками клипов для точной воспроизводимости (seed = 123). Для каждого видео features///

Архитектура и методология моделирования

Базовое обнаружение: слияние временного контекста
Получив последовательность видеоклипов, представленную матрицей признаков Z figure-protocol-1 RTx1024, модуль Temporal Context Fusion (TCF) сначала вычислил представления запросов, ключей и значений с помощью трех изученных линейных проекций:

Q = ZWQ, K = ZWK, V = ZWV (1)

где WQ, WK, WV figure-protocol-2 RTx1024xd — обучаемые параметры (PyTorch: три nn. Линейные (1024,d) слои). Межсегментное сродство было S = figure-protocol-3, было включено вложение временной реляциональности (TRE), где каждый элемент вычислялся как Rij = α exp (figure-protocol-4) + β . Аффинити, зависящая от местоположения, была figure-protocol-5 = S + R. Глобальное контекстное отображение A = softmax(figure-protocol-6) агрегировало V для получения объектов широкой области G = AV. Локальные особенности L были вычислены с помощью глубокой 1-D свертки (nn. Conv1d) размера ядра 3 по Z. Динамический вентиль g = σ(MLP ([G;L])) смешал эти два понятия: U = gfigure-protocol-7 G + (1 - g) figure-protocol-8 L . Наконец, для получения Y были применены нормализация слоя и остаточный линейный слой (Pytorch:LayerNorm+Linear+residual).

Базовое обнаружение: причинно-следственный временной предиктор

Выходной сигнал Y пропускали через две причинные 1-D свертки с GELU и дропаутом (Pytorch:padding='causal' или замаскированная conv) для получения логитов аномалий для каждого клипа. Применение сигмоидной функции дало значения figure-protocol-9 вероятности [0,1]T.

Семантическое улучшение: оперативное обучение на основе внешних знаний

Создание семантических якорей: Для каждого класса аномалий c, Kc понятия были запрошены из Викиданных11, и каждая концептуальная фраза была закодирована с помощью текстового кодировщика BLIP12до eifigure-protocol-10R768. Якорем класса являлось l 2-нормализованное среднее Dc = норма (figure-protocol-11Σiei) . Для снижения шума были отброшены понятия с косинусоидным сходством с названием класса ниже 0,2, а топ-M по баллу TF-IDF были сохранены.  

Выполнение контекстно-зависимого разделения: веса переднего плана αt = softmax(rst) были вычислены на основе оценок детектора st, а веса фона bt = softmax(r(1 - st)). Взвешенные характеристики: ffg = Σtαzt и fbg = Σtbzt .

Выравнивание визуальных и семантических особенностей

Определение цели выравнивания: На этапе выравнивания цель состоит в том, чтобы свести к минимуму расстояние между визуальным элементом переднего плана и соответствующим семантическим якорем аномальной категории в пространстве признаков. Создание коллекции семантических руководств, figure-protocol-12включающей в себя семантические руководства аномальной категории C и одно стандартное нормальное семантическое руководство. Определяем вероятность, P(Dk|v), что визуальный признак v соответствует k-му семантическому руководству Dk. Рассчитайте это с помощью косинусоидального сходства по температурной шкале с последующей нормализацией по Softmax, как показано в уравнении (2).

figure-protocol-13(2)

Перекрестная энтропия была сведена к минимуму, чтобы сдвинуть положительные пары вместе и раздвинуть отрицательные, при этом было установлено τs в качестве обучаемого параметра и инициализировано значением 10. Выполните выравнивание, оптимизировав вероятность корреляции положительных пар образцов при одновременном снижении вероятности корреляции отрицательных пар образцов.

Модуль интерпретируемости на основе шаблонов

На основе быстрого обучения с помощью представления признаков, расширенных внешними знаниями (PLE), линейный классификатор создает логиты для каждого класса, которые впоследствии были нормализованы в вероятности классов с помощью функции softmax; Предсказанный тип аномалии был определен как категория с наибольшей вероятностью. Между тем, на основе выходных данных детектора была вычислена глобальная оценка аномалий. Чтобы определить уровень серьезности, эта оценка сравнивалась с тремя предопределенными пороговыми значениями, оптимизированными с помощью поиска по сетке на проверочном наборе.

Пороговые значения по умолчанию были установлены на θhigh = 0,8, θmedium = 0,5 и θlow = 0,2. В частности, если оценка была выше θвысокой, серьезность помечалась как высокая; если оценка находится междуθ средним иθ высоким, он помечается как средний; если междуθ низким и θсредним, то он обозначался как низкий; в противном случае он помечался как нет.

На этапе генерации пояснений шаблон, соответствующий прогнозируемому типу, был выбран из предопределенной библиотеки шаблонов, Дополнительный файл 1. Эта библиотека содержит несколько вариантов шаблонов, которые были проверены несколькими аннотациями17 для повышения разнообразия генерируемого текста. Если предсказанный тип существует в библиотеке шаблонов, то соответствующий шаблон был выбран случайным образом; в противном случае использовался стандартный шаблон для типа Unknown. Наконец, был сгенерирован структурированный пояснительный текст путем интеграции прогнозируемого типа, глобальной оценки аномалии, описания серьезности и выбранного шаблона. Система возвращает прогнозируемый тип аномалии, глобальную оценку аномалии и сгенерированный пояснительный текст в качестве итоговых выходных данных. Результаты показаны на рисунке 2.

Все пороговые параметры были оптимизированы с помощью поиска по сетке на валидационном наборе, а качество сгенерированных объяснений было всесторонне оценено с использованием как человеческой оценки, так и автоматизированных метрик. Результаты представлены в таблице 1.

Обучение и оценка моделей

Обучение: Модель была обучена сквозному обучению с помощью Adam (lr 1 x 10-4, снижение веса 5 x 10-4), размер партии 128, 50 эпох, косинусный отжиг для lr. Случайные начальные значения были установлены на 123 для Python/Numpy/Pytorch и включены torch.backends.cudnn.deterministic=True. Контрольные точки сохранялись каждые 5 эпох в checkpoints//epoch_XX.pt, а лучшая модель выбиралась путем валидации AUC. Все эксперименты проводились на системе с графическим процессором NVIDIA GeForce RTX 4060 Ti (16 ГБ) под управлением Windows 11, с Python 3.8.20, PyTorch 1.8.0 и CUDA 11.1. Приблизительное время обучения за эпоху составляло 30 с для набора данных ShanghaiTech и 3,5 минуты для набора данных UCF-Crime.

Потери: Общая цель: L = LMIL+ λ • Lвыравнивание. Гиперпараметр λ был проверен по набору {0.01,0.1,0.5,1,5,10} на проверочном наборе, и исправлено лучшее значение, зафиксированное для отчета о тестировании. На рисунке 3 приведена агрегация top-K MIL и определения уравнения (3-4).

figure-protocol-14(3)

figure-protocol-15(4)

Оценка: AUC на уровне кадра была рассчитана в соответствии со стандартным протоколом, используемым в предыдущих работах WS-VAD 2,5. Для детального распознавания типов в UCF-Crime были зарегистрированы mAP при IoU 0,1-0,5 и AVG mAP, как обобщено в таблице 2; AUC для каждого класса показаны на рисунке 4, а общие результаты - в таблице 3 и таблице 4; встраиваемость сепарабельности и динамика оценки аномалий представлены на рисунках 4, 5 и 6.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Для дальнейшей проверки полезности семантических якорей был проведен дополнительный эксперимент по сравнению различных шаблонов подсказок (см. Таблицу 1). Вариант, использующий расширенные Викиданными семантические прототипы, не только достиг более высоких значений AUC, но и привел к улучшению оценки BLEU-4 на 16,6 и 14,8 для сгенерированных объяснений. Эти результаты указывают на тесную связь между семантическим богатством подсказок и качеством текстовых интерпретаций, ...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Представленный здесь протокол представляет собой значительный шаг вперед в обнаружении аномалий видео со слабым контролем, сместив парадигму от простой двоичной классификации к семантически обоснованному, интерпретируемому анализу. Значимость этого метода заключается в его способности не только определить, произошла ли аномалия, но и то, что это за аномалия и почему модель пришла к такому выводу, устраняя основное ограничение в существующих системах WS-VAD 9,...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликта интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Мы выражаем признательность за финансовую поддержку, предоставленную компанией Aerospace Hongka Intelligent Technology (Beijing) CO., LTD.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии

BLIP Model

Salesforce ResearchViT-B/16Используется как текстовый кодировщик для создания семантических якорей.
Графический процессорNVIDIARTX 4060TiИспользуется для обучения модели
Модель i3DПогуглите DeepMindПредварительное обучение по Kinetics Используется как основа для извлечения видеофункций.
NumpyКоманда разработчиков NumPy1.21.2Используется для обработки числовых массив данных, таких как видеофункции, до их внедрения в модель глубокого обучения.
PyTorchFacebook AI Research1.8.0Используется для определения архитектуры модели, реализации пользовательских функций потерь и запуска обратного распространения для оптимизации.
ПитонФонд программного обеспечения Python3.8.20Используется для написания всех скриптов для обработки данных, реализации моделей, обучения и оценки
Набор данных ShanghaiTechШанхайский технологический университетИспользуется для обучения и оценки в 13 различных сценах на кампусе.
Набор данных UCF-Crime  Университет Центральной ФлоридыИспользуется для обучения и оценки 13 категорий аномалий.
ВикиданныеФонд ВикимедиаИспользуется как внешний граф знаний для построения подсказок.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. 13, 70882-70894 (2025).
  3. Dual memory units with uncertainty regulation for weakly supervised video anomaly detection. Zhou, H., Yu, J., Yang, W. Proc AAAI Conf Artificial Intell, 37 (3), 3769-3777 (2023).
  4. Dynamic local aggregation network with adaptive clusterer for anomaly detection. Yang, Z., Wu, P., Liu, J., Liu, X. Proc Eur Conf Comp Vision, 13664, 404-421 (2022).
  5. Pu, Y., Wu, X., Yang, L., Wang, S. Learning prompt-enhanced context features for weakly-supervised video anomaly detection. IEEE Trans. Image Process. 33 (8), 4923-4936 (2024).
  6. Look around for anomalies: Weakly-supervised anomaly detection via context-motion relational learning. Cho, M., et al. Proc Conf Comp Vision Pattern Recognit, , 12137-12146 (2023).
  7. Tian, Y., et al. Weakly-supervised video anomaly detection with robust temporal feature magnitude learning. Proc Int Conf Comp Vision. , 4955-4966 (2021).
  8. Scale-aware spatio-temporal relation learning for video anomaly detection. Li, G., Cai, G., Zeng, X., Zhao, R. Proc Eur Conf Comp Vision, , 333-350 (2022).
  9. Vadclip: Adapting vision-language models for weakly supervised video anomaly detection. Wu, P., et al. Proc Conf Artificial Intell, 38 (6), 6074-6082 (2024).
  10. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications, and challenges. Comp Elect Eng. 117, 109246(2024).
  11. Vrandecic, D., Kroetzsch, M. Wikidata: A free collaborative knowledgebase. Comm ACM. 57 (10), 78-85 (2014).
  12. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. Li, J., Li, D., Xiong, C., Hoi, S. Proc Int Conf Machine Learning, 162, 12888-12900 (2022).
  13. Real-world anomaly detection in surveillance videos. Sultani, W., Chen, C., Shah, M. I. Proc Conf Comp Vision Pattern Recognit, , 6479-6488 (2018).
  14. Future frame prediction for anomaly detection - a new baseline. Liu, W., Luo, W., Lian, D., Gao, S. I. Proc Conf Comp Vision Pattern Recognit, , 6536-6545 (2018).
  15. Quo vadis, action recognition? A new model and the kinetics dataset. Carreira, J., Zisserman, A. Proc Conf Comp Vision Pattern Recognit, , 6299-6308 (2017).
  16. Kay, W., et al. The kinetics human action video dataset. arXiv. , (2017).
  17. Purba, M., et al. Effect of random splitting and cross validation for Indonesian opinion mining using machine learning approach. Int J Adv Comp Sci Appl. 13 (9), 145-151 (2022).
  18. Wu, P., Liu, X., Liu, J. Weakly supervised audio-visual violence detection. Ieee Transact Multimedia. 25, 1674-1685 (2023).
  19. Liu, T., Lam, K. M., Bao, B. K. Injecting text clues for improving anomalous event detection from weakly labeled videos. Ieee Transact Image Proc. 33, 5907-5920 (2024).
  20. Wu, P., Liu, J. Learning causal temporal relation and feature discrimination for anomaly detection. Ieee Transact Image Proc. 30, 3513-3527 (2021).
  21. Assoc Advancement Artificial, I. Self-training multi-sequence learning with transformer for weakly supervised video anomaly detection. Li, S., Liu, F., Jiao, L. Proc Conf Artificial Intell, 36 (2), 1395-1403 (2022).
  22. Normality guided multiple instance learning for weakly supervised video anomaly detection. Park, S., et al. Proc Winter Conf Appl Comp Vision, , 2664-2673 (2023).
  23. Zanella, L., et al. Delving into clip latent space for video anomaly recognition. Comp Vision Image Understanding. 249, 104163(2024).
  24. Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection. Chen, J., et al. Proc Conf Com Vision Pattern Recognit, , 18319-18329 (2024).
  25. Distilling aggregated knowledge for weakly-supervised video anomaly detection. Dalvi, J., Dabouei, A., Dhanuka, G., Xu, M. Proc Winter Conf Appl Comp Vision, , 5439-5448 (2025).
  26. Gods: Generalized one-class discriminative subspaces for anomaly detection. Wang, J., Cherian, A. I. Proc Int Conf Comp Vision, , 8200-8210 (2019).
  27. Biswas, D., Tesic, J. Mmvad: A vision-language model for cross-domain video anomaly detection with contrastive learning and scale-adaptive frame segmentation. Exp Syst Appl. 285, 127857(2025).
  28. Lim, J., Lee, J., Kim, H., Park, E. Vicap-ad: Video caption-based weakly supervised video anomaly detection. Machine Vision Applicat. 36 (3), 61(2025).
  29. Gao, W., Wang, X., Wang, Y., Jing, X. Dual-stream attention-enhanced memory networks for video anomaly detection. Sensors. 25 (17), 5496(2025).
  30. Duong, H. T., Le, V. T., Hoang, V. T. Deep learning-based anomaly detection in video surveillance: A survey. Sensors. 23 (11), 5024(2023).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

Похожие статьи