$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Система
Настройка
Мы развернули предложенную систему обнаружения аномалий трафика в иерархической и распределенной вычислительной среде, используя среду Intel Tiber Cloud. Эта архитектура состоит из трех уровней — периферийного, туманного и облачного — для обеспечения вывода с низкой задержкой, масштабируемого обучения и эффективного распределения ресурсов между вычислительными узлами.
Edge Tier: Обнаружение аномалий в режиме реального времени осуществляется на периферии с помощью легких встраиваемых устройств с поддержкой графических процессоров (например, NVIDIA Jetson Nano или эквивалентных платформ на базе Intel со встроенными графическими процессорами). Эти устройства были размещены рядом с камерами наблюдения и выполняли покадровый вывод с минимальной задержкой, что позволило децентрализованно и быстро отслеживать трафик.
Уровень тумана: более ресурсоемкие задачи, включая пакетный вывод и уточнение модели в режиме реального времени, выполнялись узлами тумана, выделенными в виде выделенных виртуальных машин или экземпляров без операционной системы в облаке Intel Tiber Cloud. Каждый узел тумана был сконфигурирован на базе процессора Intel Xeon с объемом оперативной памяти не менее 16 ГБ и имел доступ к интегрированному или дискретному ускорению графического процессора. Этот промежуточный уровень обеспечивал высокую пропускную способность операций вблизи источника данных, сохраняя при этом автономность от центральных серверов.
Облачный уровень: для крупномасштабного обучения и архивирования облачный уровень использует масштабируемые вычислительные кластеры, предлагаемые в рамках сервисов Intel Tiber, оптимизированных для искусственного интеллекта. Инстансы, оснащенные ускорителями Intel Habana Gaudi или масштабируемыми процессорами Intel Xeon, используются для обучения глубоких нейронных сетей на больших наборах видеоданных, поддержки управления версиями моделей, долгосрочного хранения и оркестрации в масштабах всей системы.
Полный программный стек работал в среде Python 3.8+ с использованием оптимизированных для Intel библиотек для ускорения вычислений. Основными платформами являются PyTorch (с расширением Intel для PyTorch), OpenCV для предварительной обработки изображений и видео и Scikit-learn для оценки. Ускорение на GPU включается с помощью соответствующих наборов инструментов oneAPI и оптимизаций DAAL.
После развертывания мы клонировали репозиторий, содержащий архитектуру dual-EDE, и инициализировали компоненты модели - два энкодера (E1, E2) и два декодера (D1, D2). Использовал метод .to(device) для динамической передачи компонентов на оптимальный процессор (CPU, GPU или ускоритель Gaudi) в зависимости от доступности локальных ресурсов.
В конфигурационном скрипте мы объявили параметры обучения и оценки, в том числе количество эпох, скорость обучения, коэффициенты балансировки потерь (γ, δ) и пороги чувствительности к аномалиям (ω1,ω 2). Для обучения мы следовали двухэтапному протоколу: (1) стандартная автоэнкодировочная реконструкция для обучения нормальному поведению трафика и (2) состязательная латентная реконструкция для усиления аномалий с помощью взаимодействий кросс-ЭДЭ.
Эта модульная и ориентированная на облако системная архитектура обеспечила надежное обнаружение аномалий в режиме реального времени, масштабируемость модели и надежное развертывание в реальных интеллектуальных транспортных средах с помощью облака Intel Tiber.
Набор данных
Для обучения и оценки предложенной системы обнаружения аномалий мы использовали датасет, предоставленный NVIDIA AI City Challenge 2021, Track 4 (Traffic Anomaly). Набор данных состоит из 100 обучающих видео и 150 тестовых видеороликов, каждое из которых в среднем длится 15 минут, записанных со скоростью 30 кадров в секунду и разрешением 410p. Каждое видео представляет собой определенный уровень сложности из-за различий в типах дорог, ракурсах камеры, освещении и погодных условиях. Набор данных охватывает широкий спектр дорожной инфраструктуры (например, многополосные автомагистрали, перекрестки), плотность движения и погодные условия (например, ясность, дождь, сумерки) с нескольких ракурсов камеры. Эти атрибуты делают его идеальным эталоном для оценки обобщаемости моделей обнаружения аномалий.
Предварительная обработка
Для обучения модели в неконтролируемых условиях используйте только обычные (не случайные) сцены дорожного движения, избегая любого воздействия аномальных событий во время обучения. Выполните предварительную обработку видео с помощью OpenCV. Равномерная выборка кадров со скоростью 5 кадров в секунду для обеспечения достаточного временного охвата при одновременном снижении избыточности. Изменяйте размер кадров до 128 x 128 пикселей в соответствии с входными требованиями сети с двойным EDE и уравновешивая визуальную детализацию с вычислительной эффективностью. Нормализуйте значения пикселей в диапазоне [−1, 1] для повышения стабильности тренировки.
Чтобы улучшить обобщение и смоделировать реальную изменчивость, примените следующие методы аугментации к каждому обучающему кадру со случайной вероятностью:
Случайная обрезка и масштабирование: Обрезайте случайные подобласти и масштабируйте их до исходного разрешения, поощряя инвариантность к размеру объекта, частичной видимости и пространственному смещению положения, имитируя эффекты масштабирования и смещение объектов от центра на видео наблюдения.
Модуляция яркости и контрастности: Применяйте линейные преобразования или преобразования на основе гаммы для имитации изменений освещения, таких как тени, блики, изменения восхода/захода солнца и искусственное освещение. Это повышает устойчивость модели к суточным и сезонным колебаниям освещения.
Впрыск гауссова шума и размытие движения: Добавьте гауссов шум с изменяющимися стандартными отклонениями, чтобы смоделировать шум датчика и артефакты сжатия. Моделируйте размытие в движении с помощью сверточных ядер, ориентированных в разных направлениях и величинах, чтобы имитировать эффект движущихся объектов или дрожания камеры, что особенно актуально в быстро меняющихся сценах дорожного движения.
Маскировка случайной окклюзии: Наносите синтетические окклюзии, накладывая на кадр черные или серые прямоугольные пятна случайных размеров и расположений. Это дополнение имитирует реальные препятствия, такие как пешеходы, элементы инфраструктуры или проезжающие транспортные средства, закрывающие поле зрения. Это побуждает модель учиться на основе контекста и оставаться устойчивой к отсутствующим или искаженным областям.
Применяйте эти дополнения динамически во время обучения с помощью конвейеров преобразования PyTorch, гарантируя, что каждая партия содержит разнообразное сочетание дополненных кадров, способствуя воздействию различных шаблонов и уменьшая переобучение.
Загружайте обработанные кадры с помощью DataLoader PyTorch для управления пакетной обработкой, перетасовкой и параллельной загрузкой. Обучайтесь с размерами пакетов от 32 до 64, в зависимости от емкости графического процессора. Для вывода и оценки аномалий обрабатывайте кадры по отдельности (размер пакета = 1), чтобы обеспечить точное обнаружение на уровне кадров.
Этот конвейер предварительной обработки и дополнения повышает надежность и обобщение, позволяя модели эффективно обнаруживать аномальное поведение в разнообразных и зашумленных реальных средах мониторинга дорожного движения.
Предлагаемый метод:
Предлагаемая система EDE изучает двунаправленные отображения между распределениями изображений и скрытыми пространствами. Два энкодера и два декодера обеспечивают надежное извлечение элементов и дифференциацию аномалий. Сети обучаются как на этапе восстановления, так и на этапе противостояния. Контрастивное обучение, регуляризация и штраф за градиент используются для предотвращения сворачивания режима и повышения надежности обучения GAN.
Фреймворк EDE работает следующим образом: Encoder 1 (E1) кодирует объекты изображения в латентное пространство. Первый декодер (D1) восстанавливает изображения из скрытых векторов для минимизации потерь при восстановлении. Затем восстановленные изображения сопоставляются обратно в скрытое пространство, чтобы зафиксировать несоответствия. Второй декодер (D2) генерирует синтетические изображения из второго скрытого пространства, чтобы помочь модели отличить реальные данные от синтетических. Это двунаправленное сопоставление обнаруживает аномалии на основе скрытых несоответствий пространства, а не различий на уровне пикселей.
Фаза 1: Обучение восстановлению: Автоэнкодер обучен реконструировать обычные изображения дорожного движения, поэтому аномальные входные данные приводят к существенным ошибкам реконструкции. Функция потерь учитывает входное изображение, его скрытое кодирование и восстановленное изображение.
Состязательная подготовка: После обучения восстановлению применяется состязательное обучение. Реконструированные латентные векторы пропускаются через альтернативную структуру EDE для получения синтетических изображений и латентных векторов. Цели состоят в том, чтобы максимизировать различия между реальными и синтетическими изображениями; изменять и реконструировать скрытые векторы для улучшения обнаружения аномалий с помощью Encoder 2 (E2); и предотвратить разрушение энкодера.
Обучение разработано таким образом, чтобы избежать сходимости E1 и E2 с идентичными отображениями, что может снизить дискриминирующую способность.
Контрастивное обучение: Функция потерь дифференцирует вещественное и реконструированное представления, при этом гиперпараметр margin контролирует разделение признаков.
Методы регуляризации включают в себя:
Отсева: Случайная дезактивация нейронов для предотвращения переобучения.
Снижение веса: Штрафует большие веса для стабилизации обучения признакам.
Методы предотвращения сворачивания состязательной тренировки20 и предотвращения сворачивания режимов включают:
Штраф за градиент: Регулирует поведение дискриминатора.
Расширение данных: Случайная обрезка, масштабирование и регулируемое освещение для моделирования различных условий.
Впрыск шума: Добавление реалистичного шума, размытия в движении и окклюзии для улучшения генерализации.
Ранняя остановка: Остановка обучения, если потери валидации значительно колеблются, чтобы избежать переобучения.
Эти архитектурные усовершенствования, методы обучения и меры устойчивости обеспечивают надежное обнаружение аномалий трафика.
Сеть обнаружения несчастных случаев без присмотра обучается исключительно на нормальных образцах и тестируется как на нормальных, так и на аварийных образцах. Формально:
Из множества всех нормальных видео и видео происшествий рассмотрим большой обучающий набор данных E только с F нормальными кадрами (E = {x1, x2}). .., xM } и меньший тестовый набор данных Ê, содержащий как нормальные, так и аварийные фотографии (К=[( x̂1,y1), (x̂2,y2), (x̂F*,yF*)]),кадры, где yi
[0, 1] - изображение метки кадра. Для обучения F
F* обучающий набор данных должен быть значительно больше, чем тестовый набор данных. После изучения многообразия набора данных (E) определите кадры аварии в Е как выбросы во время вывода. Модель f вычисляет оценку несчастного случая Acc(x) на основе выученного нормального распределения данных. Тестовое изображение x с высокой оценкой аварии может быть несчастным случаем. Критерии оценки основаны на пороговом значении оценки ДТП (φ), если Acc(x) > φ.
Сетевая архитектура:
Как показано на рисунке 1, модель21 GANomaly содержит два энкодера, один декодер и один дискриминатор. Многие исследователи адаптировали этот метод для различения латентных векторов и обнаружения визуальных аномалий12,22. Два энкодера и один декодер взаимно изменяют картинку и скрытый вектор в модели. Эти аберрантные факты указываются во время трансформации. Дискриминатор отделяет сгенерированные изображения от исходных. GANomaly полагается на кодирование, декодирование и повторное кодирование.

Рисунок 1: Архитектура GANomaly, демонстрирующая поток информации. Архитектура состоит из фреймворка энкодер-декодер-энкодер, интегрированного в генеративно-состязательную сеть. Первый кодировщик сжимает входной видеокадр в представление скрытого пространства, которое затем восстанавливается декодером. Второй кодировщик отображает восстановленный кадр обратно в латентное пространство. Дискриминатор оценивает разницу между входными и восстановленными признаками для вычисления оценки аномалий. Стрелки указывают направленный поток данных по сети. Аббревиатура: GAN = генеративная состязательная сеть. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
На рисунке 2 показана архитектура EDE с двумя кодировщиками и одним декодером. Структура EDE должна постоянно изменять параметры для обнаружения казусов видео. Мы добавили второй декодер в структуру EDE и позволили им совместно использовать энкодеры для создания модели, показанной на рисунке 2 , с двумя сетевыми конфигурациями. Два энкодера имеют четыре сверточных слоя. Мы использовали функции активации LeakyReLU для всех слоев, кроме выходного слоя, который использовал активацию tanh для привязки выходов между -1 и 1. Пакетная нормализация применялась после нескольких сверточных слоев. Декодеры (рис. 3 и рис. 4) аналогичны энкодерам, но используют ConvTranspose и дополнительную пакетную нормализацию вместо каждого слоя.

Рисунок 2: Предлагаемая архитектура на основе EDE с информационным потоком. Проиллюстрирована архитектура EDE, показывающая поток видеокадров через два кодировщика и декодер. Первый энкодер (E1) сжимает входной кадр в латентное представление, которое затем восстанавливается декодером (D1). Восстановленный вывод пропускается через второй энкодер (E2) для получения второго скрытого вектора. Для обнаружения аномалий используются расхождения между латентными векторами и качеством реконструкции, поддерживаемые состязательными и контрастными компонентами потерь. Сокращение: EDE = энкодер-декодер-энкодер. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Детали архитектуры сети:
Модель dual-EDE состоит из двух конвейеров энкодер-декодер-энкодер, каждый из которых имеет одинаковую структуру и совместно оптимизируется во время обучения.
Архитектура энкодера (E1, E2)
Вход: 128×128×3 RGB кадр
Слой 1: Conv2D (64 фильтра, ядро 4×4, шаг 2, заполнение 1) → LeakyReLU (α = 0,2)
Слой 2: Conv2D (128 фильтров, 4×4, stride 2, отступ 1) → BatchNorm → LeakyReLU
Слой 3: Conv2D (256 фильтров, 4×4, шаг 2, отступ 1) → BatchNorm → LeakyReLU
Слой 4: Conv2D (512 фильтров, 4×4, stride 2, отступ 1) → BatchNorm → LeakyReLU
Слой 5: Сглаживание → Плотный до латентного вектора (z
^100)
Архитектура декодера (D1, D2)
Входные данные: z
^100 → Плотная → изменить форму на 8×8×512
Слой 1: TransposedConv2D (256 фильтров, 4×4, шаг 2, отступ 1) → BatchNorm → ReLU
Слой 2: TransposedConv2D (128 фильтров, 4×4, шаг 2, отступ 1) → BatchNorm → ReLU
Слой 3: TransposedConv2D (64 фильтра, 4×4, шаг 2, отступ 1) → BatchNorm → ReLU
Слой 4: TransposedConv2D (3 фильтра, 4×4, шаг 2, отступ 1) → Tanh
Восстановленное изображение повторно кодируется через второй кодировщик для получения латентного представления, а расхождения между исходным и реконструированным латентными векторами используются для оценки аномалий.
Активация и нормализация
Энкодеры используют активацию LeakyReLU и пакетную нормализацию. Декодеры используют активацию ReLU, за исключением последнего слоя, который применяет Tanh для нормализации выходов в диапазоне [−1, 1].
Потеря Функции
Потери при реконструкции изображения: ǀǀ x −ǀǀ2
Скрытая потеря консистенции: ǀǀ z −ǀǀ2
Состязательные потери: Введены на этапе II для максимального расхождения между реальными и синтетическими реконструкциями путем принуждения сети отличать реальные латентные коды от тех, которые генерируются во время реконструкции.
Эта архитектура захватывает неоднородности как в пиксельном, так и в латентном пространстве, позволяя обнаруживать тонкие отклонения, указывающие на аномальное поведение водителя.
Обучение в два этапа
Используется двухступенчатый метод сетевого обучения. Как для реконструкции, так и для реконструкции скрытого вектора обучаются две структуры EDE. На втором этапе кодировщик 2 пытается обмануть кодировщик 1, чтобы тот неправильно классифицировал данные как реальные или восстановленные.
Начальное обучение реконструкции
Структура EDE обучается воспроизводить входное изображение и скрытый вектор. Вход x кодируется в латентный вектор z с помощью энкодера E1. И D1, и D2 декодируют z для получения изображений x1 и x2. Мы получили два латентных вектора (z1 и z2) от энкодера E2 после передачи двух восстановленных картинок (x1 и x2). Этот этап содержит следующие цели обучения:
LEDE1 = γ ǀǀ x −x1ǀǀ2+δ ǀǀ z −z1ǀǀ2 (1)
LEDE2 = γ ǀǀ x−x2ǀǀ2+δ ǀǀ z −z2ǀǀ2 (2)
Эти восстановленные изображения пропускаются через энкодер E2 для получения скрытых векторов z1 и z2. Задачи тренинга:
Весовые коэффициенты (γ, δ) оказывают решающее влияние на влияние компонентов потерь на целевую функцию.
Во-вторых, мы обучили две структуры Encoder-Decoder-Encoder с помощью состязательных методов.
Здесь γ и δ — это параметры, которые оценивают вклад восстановления и скрытых потерь согласованности.
Состязательная подготовка
Две структуры EDE обучаются друг другу. Учится распознавать энкодер 2 по данным. EDE2 должен обманывать EDE1, потому что он противоположен. D1 декодирует z2 с первого шага и реконструирует x1'. Повторение x1' к энкодеру E2 дает z1'. Задачи этапа обучения:
min max γ ǀǀ x −x1'ǀǀ +δ ǀǀ z -z1'ǀǀ 2 (3)
ЭДЭ2 ЭДЭ1
Две структуры EDE имеют следующие функции потерь:
LEDE1 = −γ ǀǀ x -x 1'ǀǀ 2 −δǀǀ z - z1'ǀǀ 2 (4)
LEDE2 = +γ ǀǀ x - x 1'ǀǀ 2+δ ǀǀ z - z1'ǀǀ 2 (5)
Значения γ и δ совпадают с ранее указанными параметрами.

Рисунок 3: Структура энкодера. Сеть кодировщиков, используемая в предлагаемой архитектуре EDE, извлекает пространственно-временные особенности из входных видеокадров. Он состоит из нескольких сверточных слоев, за которыми следует пакетная нормализация и активация ReLU, постепенно уменьшая пространственные размеры и захватывая иерархические представления. Конечный латентный вектор кодирует высокоуровневую семантическую информацию, необходимую для обнаружения аномалий. Сокращения: ReLU = выпрямленный линейный блок, EDE = энкодер-декодер-энкодер. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Каждая EDE предоставляет две функции потерь для предлагаемой структуры. На этапе 1 EDE1 должен снизить потери при реконструкции x и z. EDE1 должен оптимизировать дисперсию фазы 2 между латентными векторами z и z1' и x и x1'. EDE2 и EDE1 уменьшают количество ошибок реконструкции x и z фазы 1. EDE1 должен уменьшать разницу между z и z1' и x и x1' в фазе 2, но должно произойти обратное.

Рисунок 4: Структура декодера. Компонент декодера предлагаемой архитектуры EDE восстанавливает входные кадры из скрытых признаков. Он состоит из ряда транспонированных сверточных слоев, которые постепенно увеличивают разрешение функций до исходного разрешения кадра. Декодер учится точно реконструировать нормальные сцены дорожного движения, что позволяет системе выявлять аномалии на основе ошибок реконструкции. Сокращение: EDE = энкодер-декодер-энкодер. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Каждая цель двойного обучения модели EDE включает функции потерь с весами, которые изменяются со временем:
LEDE1=(γ||х−х1||2+δ||z−z1||2)−(1−)(γ||х−х1''||2+δ||z−z1''||2) (6)
LEDE2=(γ||х−х1||2+δ||z−z1||2)+(1−)(γ||х−х1''||2+δ||z−z1''||2) (7)
Количество периодов обучения равно n.
Алгоритм 1 показывает двухфазное обучение:
Ввод:
Все обычные изображения в наборе данных E = {x1, x2, . . . , xF},
Эпохи N,
Взвешенные параметры γ, δ
Выпуск:
обученный энкодер-декодер-энкодер 1,
Энкодер-Декодер-Энкодер 2
e1, e2, d1, d2 ←инициализация
Веса
n ←1
повторять
для f = 1 до F do
zf←e1(xf)
←d1(zf)
←d2(zf)
←e2(
)
←e2(
)
←d1(
)
←e2(
)»
LEDE1←
(γ||хf−
||2+δ||zf−
||2) −(1−
)(γ||хf−
'||2+ δ||zf−
'||2)
LEDE2←
(γ||хf−
||2+δ||zf−
||2) +(1−
) (γ||хf−
'||2+ δ||zf−
'||2)
E1, E2, D1, D2←Обновить грузы
использование LEDE1и LEDE2
конец для
n ←n + 1
пока n = N
Этапы обучения и критерии обнаружения аномалий
Разделите обучение на два последовательных этапа:
Фаза I - Восстановительное обучение:
Оба конвейера EDE обучаются исключительно на обычных дорожных сценах.
Входные изображения пропускаются через кодировщик 1 → декодер 1 → кодировщик 2 (рис. 5).
Модель сводит к минимуму потери при реконструкции изображения и потерю скрытой согласованности. Эта фаза позволяет сети изучить компактное, согласованное латентное пространство для нормального поведения.
Фаза II - Обучение генеративной конфронтации:
Скрытые векторы, восстановленные из декодера 1, поступают в декодер 2, а затем повторно кодируются с помощью кодера 1. Этот круговой поток помогает модели обнаруживать несоответствия в синтетических узорах. Состязательная потеря добавляется, чтобы преувеличить небольшие отклонения между исходным и реконструированным представлениями. Дискриминатор опционально обучается отличать действительные латентные коды от реконструированных, обеспечивая более четкое различение в латентном пространстве.
Обнаружение аномалий:
Во время вывода пропустите тестовый кадр через конвейер с двойным EDE. Вычислите три метрики: погрешность реконструкции по пикселям, расхождение латентных векторов и оценку состязательного дискриминатора (если используется). Рассчитайте сводный показатель аномалий как взвешенную сумму:

Кадры с оценкой аномалий выше откалиброванного порога помечаются как потенциальные аномальные события. Этот механизм позволяет модели обнаруживать тонкие отклонения в визуальных и латентных пространственных паттернах, не требуя аннотированных меток аномалий.

Рисунок 5: Архитектура состязательной модели GANomaly, объединяющей EDE 1 и EDE 2. На этом рисунке показана структура состязательной модели обнаружения аномалий, которая объединяет две структуры EDE — EDE1 для реконструкции и EDE2 для выравнивания латентных признаков. Модель использует скрытый вектор, потерю согласованности и состязательное обучение с помощью дискриминатора для обеспечения сходства между латентными представлениями входного и восстановленного кадров. Эта архитектура улучшает обнаружение аномалий за счет изучения надежных встроенных функций для обычных шаблонов трафика. Сокращения: EDE1 = Первая структура энкодер-декодер-энкодер для реконструкции; EDE2 = Вторая структура энкодер-декодер-энкодер для выравнивания скрытых признаков. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Во время обнаружения наша модель использовала следующие аномальные оценки:
Acc(x̂) = ω1||z−z2||2+ω2||z−z1'||2 (8)
Изменение весовых параметров (ω1+ ω2= 1) может изменить чувствительность путем регулировки соотношения истинно положительных и ложноположительных результатов. В реальных приложениях изменение этих двух параметров может обнаружить несчастные случаи с различной чувствительностью в одном эксперименте.
Во время обучения каждый входной кадр x пропускается через энкодер E1 для генерации скрытого вектора z. Затем латентный вектор реконструируется с помощью декодера D1, получая изображение x̂1, которое затем пропускается через энкодер E2 для получения реконструированного латентного вектора z. Параллельно z декодируется декодером D2 для получения x̂2, который также перекодируется через E2 для получения z2. Этот двунаправленный процесс сохраняет информацию как на пиксельном, так и на скрытом уровне для обнаружения аномалий.
Алгоритм тестирования модели:
={( x̂1,y 1),( x̂2,y 2),...,( x̂M*,yM*)},
пороговое φ,
Весовые параметры ω1, ω2
Выходные данные: метка прогноза тестового набора данных
Ere = {y1pre, y2pre, ..., yF*pre}
для i =1 до F* do
zi ← e1(xi)
x2i ← d2(zi)
z2i ← e2(x2i)
z1i' ← d1(z2i)
z1i' ← e2(z1i')
Acc(x̂i) ←ω1||zi−z2i||2+ω2||zi−z1i'||2
ifAcc(x̂i) ≥φ то
yipre ←1
еще
yipre ←0
endif
конец
EDE использует дискриминатор в качестве компонента состязательного обучения для повышения точности обнаружения аномалий за счет улучшения способности модели различать нормальные и аномальные события. Это повышает производительность следующим образом:
Обучение различению: Дискриминатор обучается дифференцировать синтетические и двойные представления, реконструированные структурой EDE. Оптимизация этого состязательного процесса наделяет модель высокодискриминантными латентными признаками, улучшая обнаружение аномалий на дорожной сцене.
Устранение плохих реконструкций: Поскольку аномалии так сильно отклоняются от схем движения, они часто вызывают проблемы с реконструкцией. Дискриминатор наказывает за неправильно восстановленные кадры, улучшая обнаружение нормальных/аномальных событий в сети.
Улучшение представления признаков с помощью состязательного обучения: интегрируя состязательное обучение, дискриминатор заставляет сеть EDE генерировать более устойчивые и значимые скрытые внедрения. Это позволяет обнаруживать даже небольшие изменения, такие как резкое торможение, столкновения и поворот автомобиля, улучшая обнаружение аномалий.
Устранение ложных срабатываний: Традиционные автоэнкодеры чрезмерно обобщают и нормализуют аномалии, что приводит к высокому уровню ложных срабатываний. Дискриминатор сохраняет атрибуты аномалий во время реконструкции, выявляя скрытые расхождения между нормальными и аномальными кадрами.
Улучшение классификации с помощью двухэтапного процесса принятия решений: нормальные или аномально восстановленные кадры получают оценки достоверности от дискриминатора. На этом дополнительном этапе проверки уменьшаются ошибки неправильной классификации и потери при восстановлении, что повышает точность обнаружения.
Мы использовали проверенные методы обнаружения ДТП для тестирования стратегии 23,24,25,26. Один класс в многоклассовом наборе данных был нормальным, а все остальные классы несчастных случаев были тщательно изучены с использованием подхода «один против всех». Модель была обучена с использованием только данных нормального класса, в то время как тестовый набор использовал данные об авариях и нормальные данные. Обучающий и тестовый наборы были разделены на два типа.
Мы обучались и тестировались на 80% и 20% данных нормального класса соответственно. Результаты тестов класса несчастного случая были выбраны случайным образом. Оценка была непредвзятой за счет использования тестовых выборок по классу несчастных случаев, которые представляют 20% данных нормального класса, чтобы избежать перекоса модели в сторону большинства нормального класса. Модель может быть протестирована на равном количестве нормальных данных и данных об авариях, представляющих практические условия. Он проверяет обобщение модели беспристрастно путем обучения с 80% нормальных данных и сокрытия 20%. Это также показывает, что в реальной жизни количество обычных происшествий превышает количество несчастных случаев, поэтому важно предоставить модели данные о редких авариях. Случайный выбор образцов для несчастных случаев и тестирование модели на соответствие всем аварийным ситуациям без переобучения повышают надежность. Разделение данных 80/20 широко распространено в машинном обучении. Данные обучения для осмысленных шаблонов и тестовые данные для оценки производительности сбалансированы.
В экспериментах использовались наборы данных для обучения и тестирования. Для валидации и обучения было использовано разделение обучения по нормальному классу. Были проверены тестовые данные всех классов.
Отсечение модели и квантование значительно сокращают размер модели и объем вычислений. Уменьшенная модель имеет ту же точность, но меньшую производительность, так как содержит на 40% меньше параметров. Для периферийных устройств с низкой вычислительной мощностью квантование модели сжимает ее. Эта оптимизация отвечает требованиям к точности видеонаблюдения за дорожным движением в режиме реального времени и потребностям в отзыве.
Облегченные конструкции, такие как MobileNets и EfficientNet, увеличивают количество выводов в режиме реального времени. Благодаря точности компьютерного зрения и минимальным вычислениям, эти типы архитектуры получили широкое распространение. На встраиваемых системах такие модели сокращают обработку кадров на 50%, сохраняя при этом высокие показатели обнаружения аварий F1.
Использование аналогичных параметров для реконструкции изображений и обнаружения несчастных случаев с использованием многозадачного обучения может упростить проектирование. Это снизило время обучения и затраты на вычисления без ущерба для точности модели. Многозадачная система обучения упростила обучение модели обработки видеоданных о дорожном движении.
Контрастное и самоконтролируемое состязательное обучение дало результаты, сопоставимые с базовой моделью обнаружения аномалий, за меньшее время. Данные о дорожно-транспортных происшествиях были собраны и обобщены для повышения надежности на невидимых данных.
Предложенный алгоритм обнаружения аномалий дорожного движения был протестирован на Track-4, одном из пяти наборов данных AI City Challenge2021 года27. Motorways предоставила эти данные в Департамент транспорта штата Айова.
Сравнительная оценка эффективности:
Чтобы проверить нашу модель, мы сравнили ее на наборе данных AI City Challenge Track 4 с современными моделями, включая GANomaly, f-AnoGAN, OCGAN и контролируемый метод ByteDance. В таблице 2 обобщены результаты.
| Модель | Счет Формулы-1 | Точность | Вспоминать | АУК |
| GANomaly | 0.87 | 0.88 | 0.86 | 0.9 |
| ОКГАН | 0.89 | 0.9 | 0.87 | 0.91 |
| ByteDance (Sup.) | 0.91 | 0.93 | 0.89 | 0.92 |
| Предлагается (Dual-EDE) | 0.94 | 0.95 | 0.93 | 0.94 |
Таблица 2: Сравнение методов. В таблице сравниваются методы обнаружения аномалий по баллу F1, точности, полноте и аккуратности. Сравниваются проекты EDE с состязательным обучением и без него. Два EDE плюс состязательная тренировка обошли BADU, ByteDance и WHU во всех категориях. Данные указывают на то, что состязательное обучение повышает обнаружение аномалий.
Модель с двойным EDE превосходит все базовые показатели, особенно по запоминанию, что указывает на более высокую чувствительность к редким аномальным событиям.