Research Article

Codificador-decodificador-codificador dual con entrenamiento adversarial para la detección de accidentes de tráfico sin supervisión en videos de vigilancia

DOI:

10.3791/68731

September 5th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo propone un modelo dual codificador-decodificador-codificador (EDE) para la detección automatizada de accidentes de tráfico. Utilizando un método de entrenamiento de dos fases, aprende patrones de conducción normales e identifica anomalías a través de la confrontación generativa. El modelo detecta eficazmente accidentes en imágenes del mundo real y ofrece información sobre los comportamientos de los conductores mediante la captura de desviaciones sutiles.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para mejorar la seguridad vial y mejorar la respuesta a emergencias, los incidentes de tráfico deben detectarse en imágenes de vigilancia del mundo real lo más rápido posible. Los sistemas existentes dependen en gran medida de la supervisión manual, que requiere mucho tiempo y es propensa a errores. La detección automatizada de accidentes sigue siendo un desafío debido al desequilibrio sustancial de clases: las situaciones normales de conducción están sobrerrepresentadas, mientras que los accidentes son raros y diversos. En tales casos, los sistemas tradicionales de visión por computadora a menudo no pueden diferenciar de manera confiable entre eventos normales y anormales. Este estudio aborda el problema mediante el desarrollo de una arquitectura de aprendizaje profundo basada en un marco dual codificador-decodificador-codificador (EDE). El modelo utiliza dos canalizaciones de codificador-decodificador compartidas para asignar distribuciones de imágenes a distribuciones latentes especificadas en ambas direcciones. Este marco permite que el sistema modele patrones de comportamiento de tráfico comunes y se vuelva más sensible a los cambios que pueden indicar eventos peligrosos o inusuales. Se propone una técnica de entrenamiento en dos fases para mejorar aún más la detección de anomalías. En la primera fase, el modelo aprende a reconstruir imágenes de conducción normal, utilizando la pérdida de reconstrucción para caracterizar el comportamiento normal. En la segunda fase, se introduce un mecanismo generativo antagónico: los vectores latentes reconstruidos de un EDE se pasan al otro, generando imágenes sintéticas y espacios latentes. Este proceso amplifica las diferencias entre los resultados reales y sintéticos, lo que hace que el sistema responda mejor a los signos sutiles de posibles anomalías. La arquitectura de doble EDE y la metodología de entrenamiento adversarial representan un avance sustancial sobre los métodos actuales al modelar el comportamiento normal y patológico. Los resultados experimentales en conjuntos de datos de vigilancia del tráfico en el mundo real demuestran que el método propuesto mejora significativamente la detección de accidentes y comportamientos de conducción inseguros, tanto en términos de precisión como de robustez.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Según la Organización Mundial de la Salud (2023), las lesiones por accidentes de tránsito son la principal causa de muerte entre niños y adultos jóvenes de 5 a 29 años, con aproximadamente 1,3 millones de muertes reportadas en todo el mundo cada año. Esta alarmante estadística subraya la necesidad urgente de sistemas automatizados capaces de monitorear el tráfico rodado1, detectar anomalías en tiempo real y reducir los retrasos en la respuesta de emergencia. La integración de la inteligencia artificial (IA) y el Internet de las cosas (IoT) en la infraestructura de las ciudades inteligentes ha permitido el desarrollo de sistemas de transporte inteligentes. Si bien las redes de circuito cerrado de televisión (CCTV)2,3 proporcionan una vigilancia continua del tráfico urbano, el monitoreo manual no es práctico y es propenso a errores. Por lo tanto, las soluciones escalables y automatizadas para la detección de incidentes de tráfico son esenciales.

Los métodos tradicionales de visión por computadora para el análisis del tráfico, como la detección de vehículos, el seguimiento y la clasificación del comportamiento, a menudo emplean redes neuronales convolucionales (CNN) entrenadas a través del aprendizaje supervisado 4,5. Estos sistemas requieren extensos conjuntos de datos anotados y, a menudo, no logran generalizar en los escenarios raros y variados que caracterizan los accidentes del mundo real. En consecuencia, los investigadores han recurrido a enfoques de detección de anomalías no supervisados, que no dependen de datos de anomalías etiquetados. Entre estos, los autocodificadores (AE) y las redes generativas antagónicas (GAN) se han mostrado prometedores para modelar patrones normales e identificar desviaciones 6,7,8.

Sin embargo, los EA estándar tienden a reconstruir las entradas con demasiada fidelidad, incluso cuando esas entradas son anómalas, lo que lleva a altas tasas de falsos negativos 9,10. Los autocodificadores variacionales (VAE)11 y los modelos basados en GAN como f-AnoGAN12, GANomaly13 y OCGAN14 abordan algunos de estos problemas incorporando el modelado del espacio latente y el aprendizaje adversario. No obstante, estos modelos a menudo se basan en mapeos unidireccionales de la imagen al espacio latente15, lo que limita su capacidad para detectar inconsistencias sutiles o complejas en anomalías de tráfico del mundo real.

Los sistemas supervisados, como los desarrollados para el AI City Challenge por ByteDance16, WHU17 y USF18, logran una alta precisión a través del seguimiento espaciotemporal19y los diseños centrados en objetos. Sin embargo, requieren datos de accidentes etiquetados y canalizaciones de seguimiento complejas, lo que reduce la escalabilidad y la aplicabilidad en tiempo real.

ModeloTipoCaracterísticas principalesLimitacionesRendimiento (descrito)
GANomalyUnsupervisedCodificador-Decodificador-Codificador; Entrenamiento adversarialTiende a reconstruir incluso entradas anómalas demasiado bien, lo que lleva a falsos negativosBueno en general, con alta precisión y recuperación equilibrada
OCGANUnsupervisedGAN de una clase con espacio latente restringidoDificultades para detectar anomalías sutiles o complejasLigeramente mejor que GANomaly, con un mejor equilibrio entre las métricas
f-AnoGANUnsupervisedDetección rápida de anomalías mediante GAN y coincidencia de característicasCapacidad limitada para capturar anomalías complejas en el espacio latenteRendimiento moderado (no se proporcionan puntajes específicos)
ByteDanceSupervisadoSeguimiento espaciotemporal con localización de anomalías a nivel de objetoRequiere datos de entrenamiento etiquetados; escalabilidad limitada en entornos del mundo realMuy alta exactitud y precisión; sensibilidad ligeramente inferior
BADUSupervisadoUtiliza el modelado en segundo plano y el seguimiento de vehículosMenos efectivo en diversas escenas; pasa por alto anomalías sutilesPrecisión sólida; Buen equilibrio pero más bajo que los mejores métodos
WHUSupervisadoTrazado de trayectoria de modalidad dualMala generalización y baja recuperación de anomalíasRendimiento débil en general, especialmente en la detección de anomalías
USFSupervisadoCombina el modelado de fondo con el análisis de similitud estructuralDeficiente para identificar anomalías con precisiónPrecisión y sensibilidad muy bajas
Propuesto (Dual-EDE)UnsupervisedCodificador dual-decodificador-codificador; Mapeo latente bidireccional con pérdida adversaria y contrastivaAlta carga computacional; limitado a entrada RGBExcelente rendimiento; máxima precisión, alta recuperación y fuerte equilibrio en todas las métricas

Tabla 1: Resumen del trabajo relacionado en la detección de anomalías de tráfico basada en video.

La Tabla 1 contrasta los métodos esenciales de detección de anomalías utilizados en la vigilancia del tráfico, destacando sus arquitecturas, ventajas, inconvenientes y rendimiento. Los modelos convencionales basados en GAN como GANomaly y OCGAN pueden realizar una detección efectiva sin supervisión, pero luchan con anomalías sutiles. Los métodos supervisados, aunque son altamente precisos, dependen en gran medida de datos etiquetados y un seguimiento sofisticado. El modelo Dual-EDE propuesto integra la codificación bidireccional del espacio latente con el entrenamiento adversario y contrastivo, lo que le permite detectar anomalías de tráfico raras y sutiles sin datos etiquetados, ofreciendo escalabilidad y robustez.

Brecha e hipótesis de investigación
Aunque los modelos no supervisados mitigan la necesidad de anomalías etiquetadas, todavía tienen dificultades para detectar con precisión eventos de tráfico raros, sutiles y de alto impacto. Los métodos actuales están limitados por la asimetría arquitectónica y la incapacidad de explotar plenamente las inconsistencias del espacio latente. Muchos tampoco distinguen de manera sólida entre el comportamiento normal complejo y las anomalías genuinas en entornos de tráfico altamente dinámicos.

Nuestra hipótesis es que una arquitectura dual codificador-decodificador-codificador (EDE) entrenada exclusivamente en datos de tráfico normales, combinada con una estrategia de entrenamiento de dos fases, puede superar a los modelos de última generación en la detección de anomalías de tráfico diversas y sutiles. Al aplicar la consistencia latente bidireccional e integrar la reconstrucción adversaria, el sistema se vuelve más sensible a las desviaciones mínimas del comportamiento esperado, como frenadas repentinas, desvíos erráticos o colisiones, sin la necesidad de datos de accidentes anotados.

Método propuesto
Proponemos un nuevo marco de detección de anomalías no supervisado construido sobre una arquitectura de doble EDE. A diferencia de los modelos tradicionales que emplean una sola canalización de codificación-decodificación, nuestro sistema utiliza dos vías EDE que realizan un mapeo bidireccional entre imágenes y representaciones latentes. Este diseño permite que el modelo aprenda características ricas de la dinámica normal del tráfico y amplifique las discrepancias cuando ocurren anomalías. El proceso de formación consta de dos fases:

La fase uno utiliza la pérdida de reconstrucción para modelar el comportamiento normal, similar al entrenamiento estándar del autocodificador.

La fase dos introduce un mecanismo generativo de confrontación, donde los vectores latentes de un EDE se pasan al segundo para generar datos sintéticos, lo que obliga al sistema a maximizar las distinciones entre representaciones reales y falsas tanto en la imagen como en los dominios latentes.

Contribuciones clave
Presentamos una arquitectura de doble EDE que captura las inconsistencias latentes a través del mapeo bidireccional para mejorar la detección de anomalías. Desarrollamos un procedimiento de entrenamiento de dos fases que combina la reconstrucción del autocodificador con el aprendizaje adversarial para mejorar la sensibilidad a las desviaciones sutiles. Demostramos, a través de experimentos en el conjunto de datos AI City Challenge (Track 4), que el modelo supera varias líneas de base supervisadas y no supervisadas de última generación, logrando una detección de accidentes robusta y escalable en entornos urbanos del mundo real. En resumen, este trabajo ofrece un enfoque escalable, preciso y sin etiquetas para la detección de anomalías de tráfico, lo que contribuye a sistemas de transporte inteligentes más seguros y receptivos.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sistema

Arreglo
Implementamos el sistema de detección de anomalías de tráfico propuesto dentro de un marco informático jerárquico y distribuido, aprovechando el entorno Intel Tiber Cloud. Esta arquitectura consta de tres niveles: borde, niebla y nube, para garantizar una inferencia de baja latencia, un entrenamiento escalable y una asignación eficiente de recursos en los nodos de proceso.

Nivel de borde: la detección de anomalías en tiempo real se lleva a cabo en el borde utilizando dispositivos integrados livianos y compatibles con GPU (por ejemplo, NVIDIA Jetson Nano o plataformas equivalentes basadas en Intel con GPU integradas). Estas unidades se ubicaron junto con cámaras de vigilancia y ejecutaron inferencia cuadro por cuadro con una latencia mínima, lo que permitió un monitoreo de tráfico descentralizado y receptivo.

Nivel de niebla: las tareas más intensivas en cómputo, incluida la inferencia por lotes y el refinamiento del modelo en tiempo real, fueron manejadas por nodos de niebla aprovisionados como máquinas virtuales dedicadas o instancias sin sistema operativo dentro de Intel Tiber Cloud. Cada nodo de niebla se configuró con un procesador Intel Xeon con al menos 16 GB de RAM y tenía acceso a la aceleración de GPU discreta o integrada por Intel. Esta capa intermedia permitió operaciones de alto rendimiento cerca de la fuente de datos mientras mantenía la autonomía de los servidores centrales.

Nivel de nube: para capacitación y archivo a gran escala, el nivel de nube utiliza clústeres de computación escalables que se ofrecen a través de los servicios optimizados para IA de Intel Tiber. Las instancias equipadas con aceleradores Intel Habana Gaudi o procesadores escalables Intel Xeon se emplean para entrenar redes neuronales profundas en conjuntos de datos de video extensos, lo que admite el control de versiones de modelos, el almacenamiento a largo plazo y la orquestación de todo el sistema.

La pila de software completa operaba en un entorno Python 3.8+ utilizando bibliotecas optimizadas por Intel para computación acelerada. Los marcos principales incluyen PyTorch (con Intel Extension para PyTorch), OpenCV para el preprocesamiento de imágenes y vídeos, y Scikit-learn para la evaluación. La aceleración de GPU se habilita a través de los kits de herramientas oneAPI apropiados y las optimizaciones de DAAL.

Tras la implementación, clonamos el repositorio que contiene la arquitectura de doble EDE e inicializamos los componentes del modelo: dos codificadores (E1, E2) y dos decodificadores (D1, D2). Empleó el método .to(device) para transferir los componentes dinámicamente a la unidad de procesamiento óptima (CPU, GPU o acelerador Gaudi) dependiendo de la disponibilidad de recursos locales.

Declaramos los parámetros de entrenamiento y evaluación, incluido el número de épocas, la tasa de aprendizaje, los coeficientes de equilibrio de pérdidas (γ, δ) y los umbrales de sensibilidad a anomalías (ω1, ω2), en un script de configuración. Para el entrenamiento, seguimos un protocolo de dos fases: (1) reconstrucción estándar del autocodificador para aprender el comportamiento normal del tráfico y (2) reconstrucción latente adversarial para amplificar anomalías utilizando interacciones entre EDE.

Esta arquitectura de sistema modular y nativa de la nube permitió una detección de anomalías sólida y en tiempo real, escalabilidad de modelos e implementación confiable en entornos de transporte inteligente del mundo real a través de Intel Tiber Cloud.

Conjunto de datos
Para entrenar y evaluar el sistema de detección de anomalías propuesto, utilizamos el conjunto de datos proporcionado por NVIDIA AI City Challenge 2021, Track 4 (Traffic Anomaly). El conjunto de datos comprende 100 videos de capacitación y 150 videos de prueba, cada uno con un promedio de 15 minutos de duración, grabados a 30 fps y una resolución de 410 p. Cada video presenta un nivel distinto de dificultad debido a las variaciones en los tipos de carreteras, ángulos de cámara, iluminación y condiciones climáticas. El conjunto de datos captura una amplia gama de infraestructura vial (p. ej., autopistas de varios carriles, intersecciones), densidades de tráfico y condiciones climáticas (p. ej., despejado, lluvioso, anochecer), desde múltiples ángulos de cámara. Estos atributos lo convierten en un punto de referencia ideal para evaluar la generalización de los modelos de detección de anomalías.

Preprocesamiento
Para entrenar el modelo en condiciones no supervisadas, use solo escenas de tráfico normales (sin accidentes), evitando cualquier exposición a eventos anómalos durante el entrenamiento. Realice el preprocesamiento de video usando OpenCV. Muestree tramas uniformemente a 5 fps para garantizar una cobertura temporal suficiente y reducir la redundancia. Cambie el tamaño de los fotogramas a 128 x 128 píxeles, coincidiendo con los requisitos de entrada de la red de doble EDE y equilibrando los detalles visuales con la eficiencia computacional. Normalice los valores de píxeles al rango [−1, 1] para mejorar la estabilidad del entrenamiento.

Para mejorar la generalización y simular la variabilidad del mundo real, aplique las siguientes técnicas de aumento a cada marco de entrenamiento con probabilidad aleatoria:

Recorte y escalado aleatorios: Recorte subregiones aleatorias y vuelva a la resolución original, lo que fomenta la invariancia del tamaño del objeto, la visibilidad parcial y los cambios de posición espacial, imitando los efectos de zoom y los sujetos descentrados en el vídeo de vigilancia.

Modulación de brillo y contraste: Aplique transformaciones lineales o basadas en gamma para imitar variaciones de iluminación como sombras, deslumbramiento, variaciones de salida y puesta del sol e iluminación artificial. Esto mejora la resistencia del modelo a las fluctuaciones de iluminación diurnas y estacionales.

Inyección de ruido gaussiano y desenfoque de movimiento: Agregue ruido gaussiano con diferentes desviaciones estándar para simular el ruido del sensor y los artefactos de compresión. Simule el desenfoque de movimiento utilizando núcleos convolucionales orientados en diferentes direcciones y magnitudes para emular el efecto de los objetos en movimiento o el movimiento de la cámara, lo que es particularmente relevante en escenas de tráfico de ritmo rápido.

Enmascaramiento de oclusión aleatoria: Aplique oclusiones sintéticas superponiendo parches rectangulares negros o grises de tamaños y ubicaciones aleatorios sobre el marco. Este aumento simula obstrucciones del mundo real, como peatones, elementos de infraestructura o vehículos que pasan y que ocluyen el campo de visión. Alienta al modelo a aprender del contexto y seguir siendo robusto a las regiones faltantes o distorsionadas.

Aplique estos aumentos dinámicamente durante el entrenamiento mediante canalizaciones de transformación de PyTorch, asegurando que cada lote contenga una combinación diversa de fotogramas aumentados, promoviendo la exposición a diversos patrones y reduciendo el sobreajuste.

Cargue tramas procesadas con DataLoader de PyTorch para gestionar el procesamiento por lotes, la reproducción aleatoria y la carga paralela. Entrene con tamaños de lote entre 32 y 64, según la capacidad de la GPU. Para la inferencia y la puntuación de anomalías, procese los fotogramas individualmente (tamaño de lote = 1) para permitir una detección precisa a nivel de fotograma.

Esta canalización de preprocesamiento y aumento mejora la solidez y la generalización, lo que permite que el modelo detecte comportamientos anómalos de manera efectiva en entornos de monitoreo de tráfico diversos y ruidosos del mundo real.

El método propuesto:
El sistema EDE propuesto aprende mapeos bidireccionales entre distribuciones de imágenes y espacios latentes. Dos codificadores y dos decodificadores permiten una extracción robusta de características y diferenciación de anomalías. Las redes están entrenadas tanto en la etapa de reconstrucción como en la de confrontación. El aprendizaje contrastivo, la regularización y la penalización de gradiente se utilizan para evitar el colapso del modo y mejorar la solidez del entrenamiento de GAN.

El marco EDE funciona de la siguiente manera: El codificador 1 (E1) codifica las características de la imagen en el espacio latente. El primer decodificador (D1) reconstruye imágenes a partir de vectores latentes para minimizar la pérdida de reconstrucción. Las imágenes reconstruidas se vuelven a mapear en el espacio latente para capturar inconsistencias. El segundo decodificador (D2) genera imágenes sintéticas a partir del segundo espacio latente para ayudar al modelo a distinguir los datos reales de los sintéticos. Este mapeo bidireccional detecta anomalías basadas en discrepancias de espacio latente en lugar de diferencias a nivel de píxeles.

Fase 1: Entrenamiento de reconstrucción: El autocodificador está entrenado para reconstruir imágenes de tráfico normales, por lo que las entradas anómalas producen errores de reconstrucción sustanciales. La función de pérdida considera la imagen de entrada, su codificación latente y la imagen reconstruida.

Entrenamiento adversarial: Después del entrenamiento de reconstrucción, se aplica el aprendizaje adversarial. Los vectores latentes reconstruidos se pasan a través de una estructura EDE alternativa para producir imágenes sintéticas y vectores latentes. Los objetivos son maximizar las diferencias entre imágenes reales y sintéticas; alterar y reconstruir vectores latentes para mejorar la detección de anomalías mediante el codificador 2 (E2); y evitar el colapso del codificador.

El entrenamiento está diseñado para evitar la convergencia de E1 y E2 a asignaciones idénticas, lo que reduciría la capacidad discriminativa.

Aprendizaje contrastivo: Una función de pérdida diferencia las representaciones reales y reconstruidas, con un hiperparámetro de margen que controla la separación de características.
Las técnicas de regularización incluyen:

Abandono escolar: Desactivación aleatoria de neuronas para evitar el sobreajuste.
Disminución de peso: Penaliza los pesos grandes para estabilizar el aprendizaje de características.

Los métodos de prevención de colapso de modo y estabilidad de entrenamiento adversarial20 incluyen:
Penalización de gradiente: Regula el comportamiento discriminatorio.
Aumento de datos: Recorte aleatorio, escalado e iluminación ajustable para simular condiciones variadas.
Inyección de ruido: Agregar ruido realista, desenfoque de movimiento y oclusiones para mejorar la generalización.
Parada temprana: Detener el entrenamiento si la pérdida de validación fluctúa significativamente para evitar el sobreajuste.

Estas mejoras arquitectónicas, métodos de entrenamiento y medidas de resiliencia garantizan una detección fiable de anomalías de tráfico.

La red de detección de accidentes no supervisada se entrena exclusivamente en muestras normales y se prueba tanto en muestras normales como en muestras de accidentes. Formalmente:

Del conjunto de todos los vídeos normales y de accidentes, considere un gran conjunto de datos de entrenamiento E con solo F fotogramas normales (E = {x1, x2}). .., xM } y un conjunto de datos de prueba más pequeño Ê que contiene fotografías normales y de accidentes (Ê=[( x̂1,y1), (x̂2,y2), (x̂F*,yF*)]),fotogramas, donde yi figure-protocol-1[0, 1] es la imagen de la etiqueta del marco. Para el entrenamiento F figure-protocol-2F*, el conjunto de datos de entrenamiento debe ser significativamente mayor que el conjunto de datos de prueba. Después de aprender la variedad del conjunto de datos (E), identifique los marcos de accidentes en Ê como valores atípicos durante la inferencia. El modelo f calcula una puntuación de accidente Acc(x) basada en la distribución de datos normales aprendidas. Una imagen de prueba x con una puntuación alta de accidente puede ser un accidente. Los criterios de juicio se basan en el umbral de puntuación de accidentes (φ) si Acc(x) > φ.

Arquitectura de red:
Como se muestra en la Figura 1, el modelo21 de GANomaly contiene dos codificadores, un decodificador y un discriminador. Muchos investigadores han adaptado este método para distinguir vectores latentes y detectar anomalías visuales12,22. Los dos codificadores y el decodificador único modifican recíprocamente la imagen y el vector latente en el modelo. Estos hechos aberrantes se indican durante la transformación. El discriminador divide las imágenes generadas del original. GANomaly se basa en la codificación, decodificación y recodificación.

figure-protocol-3
Figura 1: Arquitectura GANomaly que demuestra el flujo de información. La arquitectura consiste en un marco codificador-decodificador-codificador integrado dentro de una red generativa adversaria. El primer codificador comprime el fotograma de vídeo de entrada en una representación de espacio latente, que luego es reconstruida por el decodificador. Un segundo codificador asigna el fotograma reconstruido al espacio latente. El discriminador evalúa la diferencia entre las entidades de entrada y las reconstruidas para calcular la puntuación de anomalía. Las flechas indican el flujo direccional de datos a través de la red. Abreviatura: GAN = red generativa antagónica. Haga clic aquí para ver una versión más grande de esta figura.

La Figura 2 ilustra la arquitectura EDE con dos codificadores y un decodificador. La estructura de EDE debe cambiar constantemente los parámetros para detectar percances de video. Agregamos un segundo decodificador a la estructura EDE y les permitimos compartir los codificadores para generar el modelo en la Figura 2 con dos configuraciones de red. Dos codificadores tienen cuatro capas convolucionales. Usamos las funciones de activación de LeakyReLU para todas las capas excepto la capa de salida, que usó una activación tanh para limitar las salidas entre -1 y 1. La normalización por lotes se aplicó después de múltiples capas convolucionales. Los decodificadores (Figura 3 y Figura 4) son similares a los codificadores, pero emplean ConvTranspose y normalización de lotes adicional en lugar de cada capa.

figure-protocol-4
Figura 2: Propuesta de arquitectura basada en EDE con flujo de información. Se ilustra la arquitectura EDE, mostrando el flujo de fotogramas de vídeo a través de dos codificadores y un decodificador. El primer codificador (E1) comprime el marco de entrada en una representación latente, que luego es reconstruida por el decodificador (D1). La salida reconstruida se pasa a través del segundo codificador (E2) para obtener un segundo vector latente. Las discrepancias entre los vectores latentes y la calidad de la reconstrucción se utilizan para la detección de anomalías, respaldadas por componentes de pérdida adversarios y contrastivos. Abreviatura: EDE = codificador-decodificador-codificador. Haga clic aquí para ver una versión más grande de esta figura.

Detalles de la arquitectura de red:
El modelo de doble EDE consta de dos canalizaciones codificador-decodificador-codificador, cada una con la misma estructura y optimizadas conjuntamente durante el entrenamiento.

Arquitectura del codificador (E1, E2)

Entrada: marco RGB 128×128×3

Capa 1: Conv2D (64 filtros, kernel 4×4, zancada 2, relleno 1) → LeakyReLU (α = 0,2)

Capa 2: Conv2D (128 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → LeakyReLU

Capa 3: Conv2D (256 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → LeakyReLU

Capa 4: Conv2D (512 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → LeakyReLU

Capa 5: Aplanar → Vector denso a latente (z figure-protocol-5^100)

Arquitectura del decodificador (D1, D2)

Entrada: z figure-protocol-6^100 → Denso → remodelar a 8×8×512

Capa 1: TransposedConv2D (256 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → ReLU

Capa 2: TransposedConv2D (128 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → ReLU

Capa 3: TransposedConv2D (64 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → ReLU

Capa 4: TransposedConv2D (3 filtros, 4×4, zancada 2, relleno 1) → Tanh

La imagen reconstruida se vuelve a codificar a través del segundo codificador para obtener una representación latente, y las discrepancias entre los vectores latentes originales y reconstruidos se utilizan para la puntuación de anomalías.

Activación y normalización
Los codificadores utilizan la activación de LeakyReLU y la normalización por lotes. Los decodificadores utilizan la activación ReLU, excepto la capa final, que aplica Tanh para normalizar las salidas al rango [−1, 1].

Pérdida Funciones
Pérdida de reconstrucción de imagen: ǀǀ x −ǀǀ2
Pérdida de consistencia latente: ǀǀ z −ǀǀ2

Pérdida adversaria: Introducida en la Fase II para maximizar la divergencia entre las reconstrucciones reales y sintéticas al obligar a la red a distinguir los códigos latentes reales de los generados durante la reconstrucción.

Esta arquitectura captura las irregularidades tanto del espacio de píxeles como del espacio latente, lo que permite la detección de desviaciones sutiles indicativas de un comportamiento de conducción anormal.

Entrenamiento en dos fases
Se emplea un método de entrenamiento de red en dos etapas. Tanto para la reconstrucción de imágenes como para la reconstrucción de vectores latentes, se entrenan dos estructuras EDE. En la segunda fase, el codificador 2 intenta engañar al codificador 1 para que clasifique erróneamente los datos como reales o reconstruidos.

Formación inicial en reconstrucción
La estructura EDE está entrenada para replicar la imagen de entrada y el vector latente. La entrada x se codifica en el vector latente z mediante el codificador E1. Tanto D1 como D2 decodifican z para producir imágenes, x1 y x2. Obtuvimos dos vectores latentes (z1 y z2) del codificador E2 después de pasar dos imágenes reconstruidas (x1 y x2). Esta etapa contiene los siguientes objetivos formativos:

LEDE1 = γ ǀǀ x −x1ǀǀ2+δ ǀǀ z −z1ǀǀ2 (1)
LEDE2 = γ ǀǀ x−x2ǀǀ2+δ ǀǀ z −z2ǀǀ2 (2)

Estas imágenes reconstruidas se pasan a través del codificador E2 para obtener los vectores latentes z1 y z2. Objetivos de la formación:
Los factores de ponderación (γ, δ) influyen de manera crucial en el impacto de los componentes de pérdida en la función objetivo.

En segundo lugar, entrenamos dos estructuras Codificador-Decodificador-Codificador utilizando métodos adversarios.
Aquí, γ y δ son los parámetros que ponderan las contribuciones de la reconstrucción y las pérdidas de consistencia latente.

Entrenamiento adversarial
Dos estructuras EDE se entrenan de forma adversa. Aprende a reconocer el codificador 2 a partir de los datos. EDE2 debe engañar a EDE1 porque es lo contrario. D1 decodifica z2 desde el primer paso y reconstruye x1'. La repetición de x1' al codificador E2 produce z1'. Los objetivos de la formación en el escenario son los siguientes:

min max γ ǀǀ x −x1'ǀǀ +δ ǀǀ z -z1'ǀǀ 2 (3)
EDE2 EDE1

Las dos estructuras EDE tienen estas funciones de pérdida:
LEDE1 = −γ ǀǀ x -x1'ǀǀ 2 −δǀǀ z - z1'ǀǀ 2 (4)
LEDE2 = +γ ǀǀ x - x1'ǀǀ 2+δ ǀǀ z -z 1'ǀǀ 2 (5)

Los valores de γ y δ coinciden con los parámetros especificados anteriormente.

figure-protocol-7
Figura 3: Estructura del codificador. La red de codificadores utilizada en la arquitectura EDE propuesta extrae características espaciotemporales de los fotogramas de vídeo de entrada. Consta de múltiples capas convolucionales seguidas de normalización por lotes y activación de ReLU, lo que reduce progresivamente las dimensiones espaciales y captura representaciones jerárquicas. El vector latente final codifica información semántica de alto nivel esencial para la detección de anomalías. Abreviaturas: ReLU = Unidad lineal rectificada, EDE = codificador-decodificador-codificador. Haga clic aquí para ver una versión más grande de esta figura.

Cada EDE proporciona dos funciones de pérdida para la estructura propuesta. En la fase 1, EDE1 debe reducir las pérdidas de reconstrucción x y z. EDE1 debe optimizar la varianza de fase 2 entre los vectores latentes z y z1' y x y x1'. EDE2 y EDE1 reducen los errores de reconstrucción x y z de la fase 1. EDE1 debe disminuir la diferencia entre z y z1' y x y x1' en la fase 2, pero debe suceder lo contrario.

figure-protocol-8
Figura 4: Estructura del decodificador. El componente decodificador de la arquitectura EDE propuesta reconstruye los marcos de entrada a partir de características latentes. Consiste en una serie de capas convolucionales transpuestas que aumentan progresivamente los mapas de características a la resolución de fotograma original. El decodificador aprende a reconstruir con precisión escenas de tráfico normales, lo que permite que el sistema identifique anomalías basadas en errores de reconstrucción. Abreviatura: EDE = codificador-decodificador-codificador. Haga clic aquí para ver una versión más grande de esta figura.

Cada objetivo de entrenamiento dual del modelo EDE incluye funciones de pérdida con pesos que cambian con el tiempo:

LEDE1=(γ||xx1||2+δ||zz1||2)(1)(γ||xx1''||2+δ||zz1''||2) (6)
LEDE2=(γ||xx1||2+δ||zz1||2)+(1)(γ||xx1''||2+δ||zz1''||2) (7)

El recuento del período de entrenamiento es n.

El algoritmo 1 muestra el entrenamiento en dos fases:
Entrada:
Todas las imágenes normales en el conjunto de datos E = {x1, x2, . . . , xF},
épocas N,
Parámetros ponderados γ, δ
Salida:
Codificador-decodificador-codificador entrenado 1,
Codificador-Decodificador-Codificador 2
e1, e2, d1, d2 ←inicialización
Pesos
n ←1
repetir
para f = 1 a F hacer
zf←e1(xf)
         figure-protocol-9←d1(zf)
         figure-protocol-10←d2 (zf)
         figure-protocol-11←e2(figure-protocol-12)
         figure-protocol-13←e2(figure-protocol-14)
         figure-protocol-15←d1(figure-protocol-16)
         figure-protocol-17←e2(figure-protocol-18)′
LEDE1←(figure-protocol-19γ||xffigure-protocol-20||2+δ||zffigure-protocol-21||2) −(1−figure-protocol-22)(γ||xffigure-protocol-23'||2+ δ||zffigure-protocol-24'||2)
LEDE2←(figure-protocol-25γ||xffigure-protocol-26||2+δ||zffigure-protocol-27||2) +(1−figure-protocol-28) (γ||xffigure-protocol-29'||2+ δ||zffigure-protocol-30'||2)
e1, e2, d1, d2←actualizar ponderaciones
usando LEDE1y LEDE2
fin para
n ←n + 1
hasta n = N

Fases de entrenamiento y criterios de detección de anomalías
Divida la capacitación en dos fases secuenciales:

Fase I - Aprendizaje de la Reconstrucción:
Ambas tuberías EDE se entrenan únicamente en escenas de tráfico normales.

Las imágenes de entrada se pasan a través del codificador 1 → el decodificador 1 → el codificador 2 (figura 5).

El modelo minimiza la pérdida de reconstrucción de imágenes y la pérdida de consistencia latente. Esta fase permite que la red aprenda un espacio latente compacto y consistente para el comportamiento normal.

Fase II - Aprendizaje de confrontación generativa:

Los vectores latentes reconstruidos a partir del decodificador 1 se introducen en el decodificador 2 y luego se vuelven a codificar a través del codificador 1. Este flujo circular ayuda al modelo a detectar inconsistencias en patrones sintéticos. Se agrega una pérdida adversaria para exagerar pequeñas desviaciones entre las representaciones originales y reconstruidas. Un discriminador está entrenado opcionalmente para diferenciar los códigos latentes reales de los reconstruidos, imponiendo una distinción más nítida en el espacio latente.

Detección de anomalías:
En el momento de la inferencia, pase un marco de prueba a través de la canalización de doble EDE. Calcule tres métricas: error de reconstrucción por píxeles, discrepancia vectorial latente y puntuación discriminadora adversaria (si se usa). Calcule una puntuación de anomalía compuesta como una suma ponderada:
figure-protocol-31

Las tramas con puntuaciones de anomalías por encima de un umbral calibrado se marcan como posibles eventos anormales. Este mecanismo permite que el modelo detecte desviaciones sutiles en patrones de espacio visual y latente sin necesidad de etiquetas de anomalías anotadas.

figure-protocol-32
Figura 5: Arquitectura del modelo GANomaly adversario que integra EDE 1 y EDE 2. Esta figura ilustra el diseño del modelo de detección de anomalías adversas, que integra dos estructuras EDE: EDE1 para reconstrucción y EDE2 para alineación de características latentes. El modelo emplea una pérdida de consistencia de vector latente y entrenamiento adversario a través de un discriminador para imponer la similitud entre las representaciones latentes de la entrada y los marcos reconstruidos. Esta arquitectura mejora la detección de anomalías mediante el aprendizaje de incrustaciones de características sólidas para patrones de tráfico normales. Abreviaturas: EDE1 = Primera estructura codificador-decodificador-codificador para la reconstrucción; EDE2 = Segunda estructura codificador-decodificador-codificador para la alineación de características latentes. Haga clic aquí para ver una versión más grande de esta figura.

Durante la detección, nuestro modelo empleó estas puntuaciones anómalas:

Acc(x̂) = ω1||z−z2||22||z−z1'||2 (8)

Cambiar los parámetros de peso (ω1 + ω2 = 1) puede cambiar la sensibilidad ajustando la relación entre verdaderos positivos y falsos positivos. En aplicaciones del mundo real, cambiar estos dos parámetros puede detectar accidentes con sensibilidades variadas en un experimento.

Durante el entrenamiento, cada fotograma de entrada x se pasa a través del codificador E1 para generar un vector z latente. A continuación, el vector latente se reconstruye mediante el decodificador D1, produciendo la imagen x̂1, que posteriormente se pasa a través del codificador E2 para obtener un vector latente z reconstruido. Paralelamente, z es decodificado por el decodificador D2 para producir x̂2, que también se recodifica a través de E2 para producir z2. Este proceso bidireccional conserva la información a nivel de píxel y latente para la detección de anomalías.

Algoritmo de prueba de modelos:
figure-protocol-33={( x̂1,y 1),( x̂2,y 2),...,( x̂M*,yM*)},
Umbral φ,

Parámetros de ponderación ω1, ω2
Salida: etiqueta de predicción del conjunto de datos de prueba
Ere = {y1pre, y2pre, ..., yF*pre}
para i =1to F* do
zi ← e1(xi)
x2i ← d2(zi)
z2i ← e2 (x2i)
z1i' ← d1(z2i)
z1i' ← e2(z1i')
Acc(x̂i) ←ω1||zi−z2i||22||zi−z1i'||número arábigo
ifAcc(x̂i) ≥φ entonces
yipre ←1
más
¿por qué 0?
endif
fin

EDE utiliza el discriminador como un componente de aprendizaje adversario para aumentar la precisión de la detección de anomalías al mejorar la capacidad del modelo para distinguir eventos normales y anormales. Aumenta el rendimiento de la siguiente manera:

Discriminación por aprendizaje: El discriminador está entrenado para diferenciar representaciones reconstruidas con estructura EDE sintética y dual. La optimización de este proceso adversario le da al modelo características latentes altamente discriminativas, lo que mejora la detección de anomalías en la escena del tráfico.

Eliminar las malas reconstrucciones: Debido a que se desvían tanto de los patrones de tráfico, las anomalías a menudo generan problemas de reconstrucción. El discriminador penaliza las tramas reconstruidas incorrectamente, mejorando la detección de eventos normales/anormales de la red.

Mejora de la representación de características con entrenamiento adversario: Al integrar el aprendizaje adversario, el discriminador hace que la red EDE genere incrustaciones latentes más duraderas y significativas. Esto detecta incluso pequeños cambios como frenadas bruscas, colisiones y desvíos del vehículo, lo que mejora la detección de anomalías.

Eliminación de falsos positivos: los autocodificadores tradicionales generalizan en exceso y normalizan las anomalías, lo que da como resultado altas tasas de falsos positivos. El discriminador conserva los atributos de las anomalías durante la reconstrucción identificando discrepancias latentes entre marcos normales y anómalos.

Mejora de la clasificación con un proceso de decisión en dos etapas: los marcos reconstruidos normales o anormales reciben puntajes de confianza del discriminador. Los errores de clasificación errónea y la pérdida de reconstrucción se reducen en esta fase de verificación adicional, lo que mejora la precisión de la detección.

Utilizamos métodos probados de detección de accidentes para probar la estrategia 23,24,25,26. Una clase en un conjunto de datos de varias clases fue normal y todas las demás clases de accidentes se examinaron cuidadosamente utilizando uno versus todos los enfoques. El modelo se entrenó utilizando solo datos de clase normal, mientras que el conjunto de prueba utilizó datos normales y de accidentes. Los conjuntos de entrenamiento y prueba se dividieron de dos maneras.

Entrenamos y probamos con 80% y 20% de datos de clase normal, respectivamente. Los resultados de las pruebas de clase de accidente se seleccionaron al azar. La evaluación fue imparcial mediante el empleo de muestras de prueba de clase de accidente, que representan el 20% de los datos de clase normal, para evitar el sesgo del modelo hacia la clase normal mayoritaria. El modelo se puede probar con el mismo número de datos normales y de accidentes, que representan condiciones prácticas. Prueba la generalización del modelo de manera imparcial entrenando con el 80% de los datos normales y ocultando el 20%. Esto también muestra que las ocurrencias normales superan en número a los accidentes en la vida real, por lo que es importante exponer el modelo a datos de accidentes poco frecuentes. La selección aleatoria de muestras de accidentes y la prueba del modelo frente a todas las situaciones de accidentes sin sobreajuste aumentan la robustez. La división de datos 80/20 es común en el aprendizaje automático. Los datos de entrenamiento para patrones significativos y los datos de prueba para la evaluación del desempeño están equilibrados.

Los experimentos utilizaron conjuntos de datos para entrenamiento y pruebas. Se utilizó la división de entrenamiento de clase normal para la validación y el entrenamiento. Se probaron los datos de prueba de todas las clases.

La poda y cuantificación del modelo reducen en gran medida el tamaño y el cálculo del modelo. El modelo reducido tiene la misma precisión pero un rendimiento menor, ya que comprende un 40% menos de parámetros. Para dispositivos perimetrales con baja potencia de procesamiento, la cuantificación del modelo lo comprime. Esta optimización satisface la precisión de la vigilancia del tráfico en tiempo real y las necesidades de recuperación.

Los diseños ligeros como MobileNets y EfficientNet aumentan las inferencias en tiempo real. Debido a su precisión de visión por computadora y computación mínima, estos tipos arquitectónicos son ampliamente utilizados. En los sistemas integrados, estos modelos reducen el procesamiento de fotogramas en un 50% al tiempo que mantienen fuertes puntuaciones F1 de detección de accidentes.

El uso de parámetros similares para la reconstrucción de imágenes y la detección de accidentes utilizando el aprendizaje multitarea podría simplificar el diseño. Esto redujo el tiempo de entrenamiento y el costo de computación sin afectar la precisión del modelo. El sistema de aprendizaje multitarea simplificó el aprendizaje del modelo de procesamiento de datos de video de tráfico.

El entrenamiento adversario contrastivo y autosupervisado produjo resultados comparables al modelo base de detección de anomalías en menos tiempo. Se recopilaron y generalizaron las características de los accidentes de tráfico para mejorar la solidez de los datos no vistos.

El algoritmo de detección de anomalías de tráfico propuesto se probó en Track-4, uno de los cinco conjuntos de datos del AI City Challenge2021 27. Motorways proporcionó estos datos al Departamento de Transporte de Iowa.

Evaluación comparativa del desempeño:
Para validar nuestro modelo, lo comparamos en el conjunto de datos AI City Challenge Track 4 con modelos de última generación, incluidos GANomaly, f-AnoGAN, OCGAN y el método supervisado de ByteDance. La Tabla 2 resume los resultados.

ModeloPuntuación F1PrecisiónRecordarAUC
GANomaly0.870.880.860.9
OCGAN0.890.90.870.91
ByteDance (Sup.)0.910.930.890.92
Propuesto (Dual-EDE)0.940.950.930.94

Tabla 2: Comparación de métodos. La tabla compara los métodos de detección de anomalías por puntuación F1, precisión, recuperación y exactitud. Se comparan los diseños de EDE con y sin entrenamiento adversario. Dos EDE más entrenamiento adversario vencieron a BADU, ByteDance y WHU en todas las categorías. Los datos indican que el aprendizaje adversario aumenta la detección de anomalías.

El modelo de doble EDE supera todas las líneas de base, especialmente en el recuerdo, lo que indica una mayor sensibilidad a eventos anómalos raros.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para evaluar la eficacia del método de detección de anomalías de tráfico propuesto, implementamos el modelo en un solo videoclip y generamos visualizaciones que ilustran el comportamiento del sistema a lo largo del tiempo y dentro del espacio de características. Aunque se obtuvieron utilizando una canalización EDE simulada, los resultados reflejan de cerca las conclusiones cualitativas que se esperarían de un modelo real.

La línea de tiempo de puntuación de anomalía muestra la confianza cuadro...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta un sistema de detección de anomalías de tráfico basado en el aprendizaje profundo que emplea una arquitectura EDE, entrenada de manera no supervisada para identificar accidentes de uno o varios vehículos en videos de vigilancia del mundo real. Al modelar el comportamiento típico del tráfico, el sistema detecta las desviaciones como anomalías probables sin necesidad de datos de anomalías etiquetados, abordando así los desafíos de escalabilidad y escasez de datos en e...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran no tener conflictos de intereses.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación no recibió financiación externa. Los autores desean agradecer a la Escuela de Computación Amrita, Coimbatore, India, por proporcionar el hardware necesario y el apoyo invaluable para realizar este estudio.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Conjunto de datos de AI City Challenge Track 4Desafío de la ciudad de IA (https://www.aicitychallenge.org)Pista 4, lanzamiento de 2021
Kit de herramientas CUDADesarrollador NVIDIAVersión 11.3
Biblioteca cuDNNDesarrollador NVIDIACompatible con CUDA 11.3
Clúster de estación de trabajo GPU (entrenamiento)Escuela de Computación Amrita
Estación de trabajo local (nodo de niebla)Escuela de Computación Amrita
Matplotlibmatplotlib.orgVersión 3.3+
NVIDIA Jetson Nano (dispositivo perimetral)NVIDIA945-13450-0000-100
GPU NVIDIA RTX 3060 (estación de trabajo)NVIDIAVaría según el fabricante
NumPynumpy.orgVersión 1.19+
Abrir CVOpenCV.orgVersión 4.5+
Pandaspandas.pydata.orgVersión 1.1+
PitónFundación de software PythonVersión 3.8+
PyTorchPyTorch (https://pytorch.org)Versión 1.10+
Scikit-learnscikit-learn.orgVersión 0.24+
Ubuntu Linux (sistema operativo)Canonical Ltd.Versión 20.04 LTS

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Gannina, A. R. K., et al. A new approach to road incident detection leveraging live traffic data: An empirical investigation. Procedia Comput Sci. 235, 2288-2296 (2024).
  2. Khaleghi, A., Moin, M. -S. Improved anomaly detection in surveillance videos based on a deep learning method. IEEE. , 73-81 (2018).
  3. Tripathy, A. K., Sarkar, M., Sahoo, J. P., Li, K. C., Chinara, S. Road accident detection and severity determination from CCTV surveillance. Advances in distributed computing and machine learning. Lect Notes Netw Syst. , Springer. Singapore. (2021).
  4. Pang, G., Shen, C., Cao, L., Van den Hengel, A. Deep learning for anomaly detection: A review. ACM Comput. Surv. 54 (1), 1-38 (2021).
  5. Chalapathy, F., Zhang, L., Liu, H., Wang, Y., Zhao, Y. Deep learning for video anomaly detection: A review. arXiv preprint. , (2024).
  6. Gupta, A., Verma, S. Wave-GANomaly: A GAN-based anomaly detector using multi-feature fusion and wavelet transform. PLoS ONE. 18 (6), 1-18 (2023).
  7. Roy, D., Uddin, M. S., Bappy, S. M. Deep learning-based anomaly detection in video surveillance: A comprehensive review. Sensors. 23 (11), 5024-5047 (2023).
  8. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., et al. Proc 27th Int Conf Neural Inf Process Syst, Montreal, QC, , (2014).
  9. Alzahrani, A. B., et al. Unsupervised video anomaly detection in UAVs: A new approach. Front Sustain. Cities. 5, 1-10 (2023).
  10. Chalapathy, R., Chawla, S. Deep learning for anomaly detection: A survey. , Cornell University. (2019).
  11. Chen, H., Lin, J., Fang, M. Variational autoencoder for anomaly detection: A comparative study. arXiv preprint. , (2024).
  12. Schlegl, T., Seeböck, P., Waldstein, S. M., Langs, G., Schmidt-Erfurth, U. f-AnoGAN: Fast unsupervised anomaly detection with generative adversarial networks. Med Image Anal. 54, 30-44 (2019).
  13. Akcay, S., Atapour-Abarghouei, A., Breckon, T. P. Ganomaly: Semi-supervised anomaly detection via adversarial training. Comput Vis – ACCV 2018, Lect Notes Comput Sci. Jawahar, C., Li, H., Mori, G., Schindler, K. 11363, Springer. Cham. (2019).
  14. Ocgan: One-class novelty detection using GANs with constrained latent representations. Perera, P., Nallapati, R., Xiang, B. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, Long Beach, CA, , 2898-2906 (2019).
  15. Nayak, R., Mishra, S. K., Dalai, A. K., Pati, U. C., Das, S. K. A panoramic review on cutting-edge methods for video anomaly localization. IEEE Access. 12, 186380-186412 (2024).
  16. He, Z., Xu, X., Deng, S. Discovering cluster-based local outliers. Pattern Recognit Lett. 24, 1641-1650 (2003).
  17. Tax, D. M. J., Duin, R. P. W. Support vector data description. Mach Learn. 54, 45-66 (2004).
  18. Anomaly detection with robust deep autoencoders. Zhou, C., Paffenroth, R. C. Proc. 23rd ACM SIGKDD Int Conf Knowl Discov Data Min, Halifax, NS, , 665-674 (2017).
  19. Hojjati, H., Ho, T. K. K., Armanfard, N. Self-supervised anomaly detection in computer vision and beyond: A survey and outlook. Neural Netw. 172, 106106(2024).
  20. Donahue, J., Krähenbühl, P., Darrell, T. Adversarial feature learning. , Cornell University. (2016).
  21. El-Sayed, H. A., El-Horbaty, A. A cutting-edge video anomaly detection method using image quality assessment and attention mechanisms. Alex Eng J. 72, 689-701 (2024).
  22. Kiran, B. R., Thomas, D. M., Parakkal, R. An overview of deep learning-based methods for unsupervised and semi-supervised anomaly detection in videos. J Imaging. 4, 36(2018).
  23. Chow, J. K., Su, Z., Wu, J., Tan, P., Mao, X., Wang, Y. Anomaly detection of defects on concrete structures with the convolutional autoencoder. Autom Constr. 45, 101105(2020).
  24. Siegel, B. Industrial anomaly detection: A comparison of unsupervised neural network architectures. IEEE Sens Lett. 4 (8), 1-4 (2020).
  25. Uchida, M., Ishida, S., Tabaru, T., Miyamoto, H. Anomaly detection of rotary vacuum pump using thin AE sensor and reconstruction error of autoencoder. SICE Trans. 54 (7), 599-605 (2018).
  26. Khan, M. A., Ahmad, T., Siddiqui, N. A. A novel unsupervised video anomaly detection framework based on spatiotemporal features. PLoS ONE. 18 (4), 1-20 (2023).
  27. Iowa DOT anomaly dataset. , https://www.aicitychallenge.org/2021-data-and-evaluation (2021).
  28. Lee, K., Jung, D. Unsupervised video anomaly detection based on similarity with text descriptions. Sensors. 23 (14), 6256(2023).
  29. Kingma, D. P., Welling, M. Auto-encoding variational bayes. arXiv preprint. , (2013).
  30. Masci, J., Meier, U., Cireşan, D., Schmidhuber, J. Stacked convolutional auto-encoders for hierarchical feature extraction. Int Conf Artif Neural Netw. Honkela, T., Duch, W., Girolami, M., Kaski, S. , Springer. Berlin. 52-59 (2011).
  31. Fan, J., Zhang, Q., Zhu, J., Zhang, M., Yang, Z., Cao, H. Robust deep auto-encoding Gaussian process regression for unsupervised anomaly detection. Neurocomputing. 376, 180-190 (2020).
  32. Shvetsova, N., Bakker, B., Fedulova, I., Schulz, H., Dylov, D. V. Anomaly detection in medical imaging with deep perceptual autoencoders. IEEE Access. 9, 118571-118583 (2021).
  33. Unsupervised anomaly detection with generative adversarial networks to guide marker discovery. Schlegl, T., Seeböck, P., Waldstein, S. M., Schmidt-Erfurth, U., Langs, G. Int Conf Inf Process Med Imaging, , Springer. Cham. 146-157 (2017).
  34. Tuluptceva, N., Bakker, B., Fedulova, I., Konushin, A. Perceptual image anomaly detection. arXiv preprint. , (2019).
  35. Chen, C., Yuan, W., Xie, Y., Qu, Y., Tao, Y., Song, H., et al. Novelty detection via non-adversarial generative network. arXiv preprint. , (2020).
  36. Salehi, M., Eftekhar, A., Sadjadi, N., Rohban, M. H., Rabiee, H. R. Puzzle-AE: Novelty detection in images through solving puzzles. arXiv preprint. , (2020).
  37. Support vector method for novelty detection. Schölkopf, B., Williamson, R. C., Smola, A. J., Shawe-Taylor, J., Platt, J. Proc 12th Int Conf Neural Inf Process, Denver, CO, , 582-588 (1999).
  38. Marvasti-Zadeh, S. M., Cheng, L., Ghanei-Yakhdan, H., Kasaei, S. Deep learning for visual tracking: A comprehensive survey. IEEE Trans Intell Transp Syst. , 1-26 (2021).
  39. Van den Oord, A., et al. Conditional image generation with PixelCNN decoders. Adv Neural Inf Process Syst. 29, Barcelona. (2016).
  40. Deep one-class classification. Proc 35th Int Conf Mach Learn. PMLR. Ruff, L., et al. , PMLR. Stockholm. 4393-4402 (2018).
  41. Pidhorskyi, S., Almohsen, R., Doretto, G. Generative probabilistic novelty detection with adversarial autoencoders. Adv Neural Inf Process Syst. 31, Montreal, QC. (2018).
  42. The 5th AI city challenge. Naphade, M., et al. IEEE Conf Comput Vis Pattern Recognit Work, , (2021).
  43. Good practices and a strong baseline for traffic anomaly detection. Zhao, Y., Wu, W., He, Y., Li, Y., Tan, X., Chen, S. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 3993-4001 (2021).
  44. Box-level tube tracking and refinement for vehicles anomaly detection. Wu, J., Wang, X., Xiao, X., Wang, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4112-4118 (2021).
  45. Dual-modality vehicle anomaly detection via bilateral trajectory tracing. Chen, J., et al. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4016-4025 (2021).
  46. An efficient approach for anomaly detection in traffic videos. Doshi, K., Yilmaz, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4236-4244 (2021).
  47. A vision-based system for traffic anomaly detection using deep learning and decision trees. Aboah, A. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4207-4212 (2021).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Traffic Accident DetectionSurveillance VideosUnsupervised Anomaly DetectionDual Encoder DecoderAdversarial TrainingDeep Learning ArchitectureReconstruction LossGenerative Adversarial MechanismTraffic Behavior ModelingEmergency Response

Related Articles