$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом исследовании используются только общедоступные наборы данных (UCF-Crime13 и ShanghaiTech14). Все видео были получены из официальных версий наборов данных, которые анонимизируют личную информацию в той мере, в какой это было предоставлено разработчиками наборов данных. Авторы не проводили никакого дополнительного сбора данных или взаимодействия с человеком и субъектом; поэтому новое одобрение IRB не требовалось. Использование данных соответствует лицензиям и условиям использования соответствующих наборов данных.
Подготовка данных и извлечение признаков
Подготовка наборов данных: Наборы данных UCF-Crime13 (1 610 поездов/290 тестовых видео) и ShanghaiTech14 (238 поездов/199 тестовых видео) были приняты в соответствии с их стандартным распределением. Видео было предварительно обработано с помощью FFmpeg для обеспечения воспроизводимости, перекодировано в H.264, передискретизировано до 25 кадров в секунду и изменено до разрешения 256 x 256 с помощью команды: ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset veryfast pre/.
Извлечение признаков: Элементы RGB были извлечены с помощью магистрали I3D15 , предварительно обученной на наборе данныхKinetics 16. Видео были разбиты на неперекрывающиеся 16-кадровые клипы; Каждый клип был обрезан по центру до 224 x 224 пикселей. Активации предпоследнего слоя были усреднены для получения функции 1024-D на клип. В PyTorch это соответствует пересылке тензоров формы [B, 3, T, H, W] через остов I3D и нанесению adaptive_avg_pool3d с последующим сплющиванием. Извлеченные функции были сохранены в файлах .npy (по одному на видео) вместе с временными метками клипов для точной воспроизводимости (seed = 123). Для каждого видео features///
Архитектура и методология моделирования
Базовое обнаружение: слияние временного контекста
Получив последовательность видеоклипов, представленную матрицей признаков Z
RTx1024, модуль Temporal Context Fusion (TCF) сначала вычислил представления запросов, ключей и значений с помощью трех изученных линейных проекций:
Q = ZWQ, K = ZWK, V = ZWV (1)
где WQ, WK, WV
RTx1024xd — обучаемые параметры (PyTorch: три nn. Линейные (1024,d) слои). Межсегментное сродство было S =
, было включено вложение временной реляциональности (TRE), где каждый элемент вычислялся как Rij = α exp (
) + β . Аффинити, зависящая от местоположения, была
= S + R. Глобальное контекстное отображение A = softmax(
) агрегировало V для получения объектов широкой области G = AV. Локальные особенности L были вычислены с помощью глубокой 1-D свертки (nn. Conv1d) размера ядра 3 по Z. Динамический вентиль g = σ(MLP ([G;L])) смешал эти два понятия: U = g
G + (1 - g)
L . Наконец, для получения Y были применены нормализация слоя и остаточный линейный слой (Pytorch:LayerNorm+Linear+residual).
Базовое обнаружение: причинно-следственный временной предиктор
Выходной сигнал Y пропускали через две причинные 1-D свертки с GELU и дропаутом (Pytorch:padding='causal' или замаскированная conv) для получения логитов аномалий для каждого клипа. Применение сигмоидной функции дало значения
вероятности [0,1]T.
Семантическое улучшение: оперативное обучение на основе внешних знаний
Создание семантических якорей: Для каждого класса аномалий c, Kc понятия были запрошены из Викиданных11, и каждая концептуальная фраза была закодирована с помощью текстового кодировщика BLIP12до ei
R768. Якорем класса являлось l 2-нормализованное среднее Dc = норма (
Σiei) . Для снижения шума были отброшены понятия с косинусоидным сходством с названием класса ниже 0,2, а топ-M по баллу TF-IDF были сохранены.
Выполнение контекстно-зависимого разделения: веса переднего плана αt = softmax(rst) были вычислены на основе оценок детектора st, а веса фона bt = softmax(r(1 - st)). Взвешенные характеристики: ffg = Σtαzt и fbg = Σtbzt .
Выравнивание визуальных и семантических особенностей
Определение цели выравнивания: На этапе выравнивания цель состоит в том, чтобы свести к минимуму расстояние между визуальным элементом переднего плана и соответствующим семантическим якорем аномальной категории в пространстве признаков. Создание коллекции семантических руководств,
включающей в себя семантические руководства аномальной категории C и одно стандартное нормальное семантическое руководство. Определяем вероятность, P(Dk|v), что визуальный признак v соответствует k-му семантическому руководству Dk. Рассчитайте это с помощью косинусоидального сходства по температурной шкале с последующей нормализацией по Softmax, как показано в уравнении (2).
(2)
Перекрестная энтропия была сведена к минимуму, чтобы сдвинуть положительные пары вместе и раздвинуть отрицательные, при этом было установлено τs в качестве обучаемого параметра и инициализировано значением 10. Выполните выравнивание, оптимизировав вероятность корреляции положительных пар образцов при одновременном снижении вероятности корреляции отрицательных пар образцов.
Модуль интерпретируемости на основе шаблонов
На основе быстрого обучения с помощью представления признаков, расширенных внешними знаниями (PLE), линейный классификатор создает логиты для каждого класса, которые впоследствии были нормализованы в вероятности классов с помощью функции softmax; Предсказанный тип аномалии был определен как категория с наибольшей вероятностью. Между тем, на основе выходных данных детектора была вычислена глобальная оценка аномалий. Чтобы определить уровень серьезности, эта оценка сравнивалась с тремя предопределенными пороговыми значениями, оптимизированными с помощью поиска по сетке на проверочном наборе.
Пороговые значения по умолчанию были установлены на θhigh = 0,8, θmedium = 0,5 и θlow = 0,2. В частности, если оценка была выше θвысокой, серьезность помечалась как высокая; если оценка находится междуθ средним иθ высоким, он помечается как средний; если междуθ низким и θсредним, то он обозначался как низкий; в противном случае он помечался как нет.
На этапе генерации пояснений шаблон, соответствующий прогнозируемому типу, был выбран из предопределенной библиотеки шаблонов, Дополнительный файл 1. Эта библиотека содержит несколько вариантов шаблонов, которые были проверены несколькими аннотациями17 для повышения разнообразия генерируемого текста. Если предсказанный тип существует в библиотеке шаблонов, то соответствующий шаблон был выбран случайным образом; в противном случае использовался стандартный шаблон для типа Unknown. Наконец, был сгенерирован структурированный пояснительный текст путем интеграции прогнозируемого типа, глобальной оценки аномалии, описания серьезности и выбранного шаблона. Система возвращает прогнозируемый тип аномалии, глобальную оценку аномалии и сгенерированный пояснительный текст в качестве итоговых выходных данных. Результаты показаны на рисунке 2.
Все пороговые параметры были оптимизированы с помощью поиска по сетке на валидационном наборе, а качество сгенерированных объяснений было всесторонне оценено с использованием как человеческой оценки, так и автоматизированных метрик. Результаты представлены в таблице 1.
Обучение и оценка моделей
Обучение: Модель была обучена сквозному обучению с помощью Adam (lr 1 x 10-4, снижение веса 5 x 10-4), размер партии 128, 50 эпох, косинусный отжиг для lr. Случайные начальные значения были установлены на 123 для Python/Numpy/Pytorch и включены torch.backends.cudnn.deterministic=True. Контрольные точки сохранялись каждые 5 эпох в checkpoints//epoch_XX.pt, а лучшая модель выбиралась путем валидации AUC. Все эксперименты проводились на системе с графическим процессором NVIDIA GeForce RTX 4060 Ti (16 ГБ) под управлением Windows 11, с Python 3.8.20, PyTorch 1.8.0 и CUDA 11.1. Приблизительное время обучения за эпоху составляло 30 с для набора данных ShanghaiTech и 3,5 минуты для набора данных UCF-Crime.
Потери: Общая цель: L = LMIL+ λ • Lвыравнивание. Гиперпараметр λ был проверен по набору {0.01,0.1,0.5,1,5,10} на проверочном наборе, и исправлено лучшее значение, зафиксированное для отчета о тестировании. На рисунке 3 приведена агрегация top-K MIL и определения уравнения (3-4).
(3)
(4)
Оценка: AUC на уровне кадра была рассчитана в соответствии со стандартным протоколом, используемым в предыдущих работах WS-VAD 2,5. Для детального распознавания типов в UCF-Crime были зарегистрированы mAP при IoU 0,1-0,5 и AVG mAP, как обобщено в таблице 2; AUC для каждого класса показаны на рисунке 4, а общие результаты - в таблице 3 и таблице 4; встраиваемость сепарабельности и динамика оценки аномалий представлены на рисунках 4, 5 и 6.