$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Sistema
Arreglo
Implementamos el sistema de detección de anomalías de tráfico propuesto dentro de un marco informático jerárquico y distribuido, aprovechando el entorno Intel Tiber Cloud. Esta arquitectura consta de tres niveles: borde, niebla y nube, para garantizar una inferencia de baja latencia, un entrenamiento escalable y una asignación eficiente de recursos en los nodos de proceso.
Nivel de borde: la detección de anomalías en tiempo real se lleva a cabo en el borde utilizando dispositivos integrados livianos y compatibles con GPU (por ejemplo, NVIDIA Jetson Nano o plataformas equivalentes basadas en Intel con GPU integradas). Estas unidades se ubicaron junto con cámaras de vigilancia y ejecutaron inferencia cuadro por cuadro con una latencia mínima, lo que permitió un monitoreo de tráfico descentralizado y receptivo.
Nivel de niebla: las tareas más intensivas en cómputo, incluida la inferencia por lotes y el refinamiento del modelo en tiempo real, fueron manejadas por nodos de niebla aprovisionados como máquinas virtuales dedicadas o instancias sin sistema operativo dentro de Intel Tiber Cloud. Cada nodo de niebla se configuró con un procesador Intel Xeon con al menos 16 GB de RAM y tenía acceso a la aceleración de GPU discreta o integrada por Intel. Esta capa intermedia permitió operaciones de alto rendimiento cerca de la fuente de datos mientras mantenía la autonomía de los servidores centrales.
Nivel de nube: para capacitación y archivo a gran escala, el nivel de nube utiliza clústeres de computación escalables que se ofrecen a través de los servicios optimizados para IA de Intel Tiber. Las instancias equipadas con aceleradores Intel Habana Gaudi o procesadores escalables Intel Xeon se emplean para entrenar redes neuronales profundas en conjuntos de datos de video extensos, lo que admite el control de versiones de modelos, el almacenamiento a largo plazo y la orquestación de todo el sistema.
La pila de software completa operaba en un entorno Python 3.8+ utilizando bibliotecas optimizadas por Intel para computación acelerada. Los marcos principales incluyen PyTorch (con Intel Extension para PyTorch), OpenCV para el preprocesamiento de imágenes y vídeos, y Scikit-learn para la evaluación. La aceleración de GPU se habilita a través de los kits de herramientas oneAPI apropiados y las optimizaciones de DAAL.
Tras la implementación, clonamos el repositorio que contiene la arquitectura de doble EDE e inicializamos los componentes del modelo: dos codificadores (E1, E2) y dos decodificadores (D1, D2). Empleó el método .to(device) para transferir los componentes dinámicamente a la unidad de procesamiento óptima (CPU, GPU o acelerador Gaudi) dependiendo de la disponibilidad de recursos locales.
Declaramos los parámetros de entrenamiento y evaluación, incluido el número de épocas, la tasa de aprendizaje, los coeficientes de equilibrio de pérdidas (γ, δ) y los umbrales de sensibilidad a anomalías (ω1, ω2), en un script de configuración. Para el entrenamiento, seguimos un protocolo de dos fases: (1) reconstrucción estándar del autocodificador para aprender el comportamiento normal del tráfico y (2) reconstrucción latente adversarial para amplificar anomalías utilizando interacciones entre EDE.
Esta arquitectura de sistema modular y nativa de la nube permitió una detección de anomalías sólida y en tiempo real, escalabilidad de modelos e implementación confiable en entornos de transporte inteligente del mundo real a través de Intel Tiber Cloud.
Conjunto de datos
Para entrenar y evaluar el sistema de detección de anomalías propuesto, utilizamos el conjunto de datos proporcionado por NVIDIA AI City Challenge 2021, Track 4 (Traffic Anomaly). El conjunto de datos comprende 100 videos de capacitación y 150 videos de prueba, cada uno con un promedio de 15 minutos de duración, grabados a 30 fps y una resolución de 410 p. Cada video presenta un nivel distinto de dificultad debido a las variaciones en los tipos de carreteras, ángulos de cámara, iluminación y condiciones climáticas. El conjunto de datos captura una amplia gama de infraestructura vial (p. ej., autopistas de varios carriles, intersecciones), densidades de tráfico y condiciones climáticas (p. ej., despejado, lluvioso, anochecer), desde múltiples ángulos de cámara. Estos atributos lo convierten en un punto de referencia ideal para evaluar la generalización de los modelos de detección de anomalías.
Preprocesamiento
Para entrenar el modelo en condiciones no supervisadas, use solo escenas de tráfico normales (sin accidentes), evitando cualquier exposición a eventos anómalos durante el entrenamiento. Realice el preprocesamiento de video usando OpenCV. Muestree tramas uniformemente a 5 fps para garantizar una cobertura temporal suficiente y reducir la redundancia. Cambie el tamaño de los fotogramas a 128 x 128 píxeles, coincidiendo con los requisitos de entrada de la red de doble EDE y equilibrando los detalles visuales con la eficiencia computacional. Normalice los valores de píxeles al rango [−1, 1] para mejorar la estabilidad del entrenamiento.
Para mejorar la generalización y simular la variabilidad del mundo real, aplique las siguientes técnicas de aumento a cada marco de entrenamiento con probabilidad aleatoria:
Recorte y escalado aleatorios: Recorte subregiones aleatorias y vuelva a la resolución original, lo que fomenta la invariancia del tamaño del objeto, la visibilidad parcial y los cambios de posición espacial, imitando los efectos de zoom y los sujetos descentrados en el vídeo de vigilancia.
Modulación de brillo y contraste: Aplique transformaciones lineales o basadas en gamma para imitar variaciones de iluminación como sombras, deslumbramiento, variaciones de salida y puesta del sol e iluminación artificial. Esto mejora la resistencia del modelo a las fluctuaciones de iluminación diurnas y estacionales.
Inyección de ruido gaussiano y desenfoque de movimiento: Agregue ruido gaussiano con diferentes desviaciones estándar para simular el ruido del sensor y los artefactos de compresión. Simule el desenfoque de movimiento utilizando núcleos convolucionales orientados en diferentes direcciones y magnitudes para emular el efecto de los objetos en movimiento o el movimiento de la cámara, lo que es particularmente relevante en escenas de tráfico de ritmo rápido.
Enmascaramiento de oclusión aleatoria: Aplique oclusiones sintéticas superponiendo parches rectangulares negros o grises de tamaños y ubicaciones aleatorios sobre el marco. Este aumento simula obstrucciones del mundo real, como peatones, elementos de infraestructura o vehículos que pasan y que ocluyen el campo de visión. Alienta al modelo a aprender del contexto y seguir siendo robusto a las regiones faltantes o distorsionadas.
Aplique estos aumentos dinámicamente durante el entrenamiento mediante canalizaciones de transformación de PyTorch, asegurando que cada lote contenga una combinación diversa de fotogramas aumentados, promoviendo la exposición a diversos patrones y reduciendo el sobreajuste.
Cargue tramas procesadas con DataLoader de PyTorch para gestionar el procesamiento por lotes, la reproducción aleatoria y la carga paralela. Entrene con tamaños de lote entre 32 y 64, según la capacidad de la GPU. Para la inferencia y la puntuación de anomalías, procese los fotogramas individualmente (tamaño de lote = 1) para permitir una detección precisa a nivel de fotograma.
Esta canalización de preprocesamiento y aumento mejora la solidez y la generalización, lo que permite que el modelo detecte comportamientos anómalos de manera efectiva en entornos de monitoreo de tráfico diversos y ruidosos del mundo real.
El método propuesto:
El sistema EDE propuesto aprende mapeos bidireccionales entre distribuciones de imágenes y espacios latentes. Dos codificadores y dos decodificadores permiten una extracción robusta de características y diferenciación de anomalías. Las redes están entrenadas tanto en la etapa de reconstrucción como en la de confrontación. El aprendizaje contrastivo, la regularización y la penalización de gradiente se utilizan para evitar el colapso del modo y mejorar la solidez del entrenamiento de GAN.
El marco EDE funciona de la siguiente manera: El codificador 1 (E1) codifica las características de la imagen en el espacio latente. El primer decodificador (D1) reconstruye imágenes a partir de vectores latentes para minimizar la pérdida de reconstrucción. Las imágenes reconstruidas se vuelven a mapear en el espacio latente para capturar inconsistencias. El segundo decodificador (D2) genera imágenes sintéticas a partir del segundo espacio latente para ayudar al modelo a distinguir los datos reales de los sintéticos. Este mapeo bidireccional detecta anomalías basadas en discrepancias de espacio latente en lugar de diferencias a nivel de píxeles.
Fase 1: Entrenamiento de reconstrucción: El autocodificador está entrenado para reconstruir imágenes de tráfico normales, por lo que las entradas anómalas producen errores de reconstrucción sustanciales. La función de pérdida considera la imagen de entrada, su codificación latente y la imagen reconstruida.
Entrenamiento adversarial: Después del entrenamiento de reconstrucción, se aplica el aprendizaje adversarial. Los vectores latentes reconstruidos se pasan a través de una estructura EDE alternativa para producir imágenes sintéticas y vectores latentes. Los objetivos son maximizar las diferencias entre imágenes reales y sintéticas; alterar y reconstruir vectores latentes para mejorar la detección de anomalías mediante el codificador 2 (E2); y evitar el colapso del codificador.
El entrenamiento está diseñado para evitar la convergencia de E1 y E2 a asignaciones idénticas, lo que reduciría la capacidad discriminativa.
Aprendizaje contrastivo: Una función de pérdida diferencia las representaciones reales y reconstruidas, con un hiperparámetro de margen que controla la separación de características.
Las técnicas de regularización incluyen:
Abandono escolar: Desactivación aleatoria de neuronas para evitar el sobreajuste.
Disminución de peso: Penaliza los pesos grandes para estabilizar el aprendizaje de características.
Los métodos de prevención de colapso de modo y estabilidad de entrenamiento adversarial20 incluyen:
Penalización de gradiente: Regula el comportamiento discriminatorio.
Aumento de datos: Recorte aleatorio, escalado e iluminación ajustable para simular condiciones variadas.
Inyección de ruido: Agregar ruido realista, desenfoque de movimiento y oclusiones para mejorar la generalización.
Parada temprana: Detener el entrenamiento si la pérdida de validación fluctúa significativamente para evitar el sobreajuste.
Estas mejoras arquitectónicas, métodos de entrenamiento y medidas de resiliencia garantizan una detección fiable de anomalías de tráfico.
La red de detección de accidentes no supervisada se entrena exclusivamente en muestras normales y se prueba tanto en muestras normales como en muestras de accidentes. Formalmente:
Del conjunto de todos los vídeos normales y de accidentes, considere un gran conjunto de datos de entrenamiento E con solo F fotogramas normales (E = {x1, x2}). .., xM } y un conjunto de datos de prueba más pequeño Ê que contiene fotografías normales y de accidentes (Ê=[( x̂1,y1), (x̂2,y2), (x̂F*,yF*)]),fotogramas, donde yi
[0, 1] es la imagen de la etiqueta del marco. Para el entrenamiento F
F*, el conjunto de datos de entrenamiento debe ser significativamente mayor que el conjunto de datos de prueba. Después de aprender la variedad del conjunto de datos (E), identifique los marcos de accidentes en Ê como valores atípicos durante la inferencia. El modelo f calcula una puntuación de accidente Acc(x) basada en la distribución de datos normales aprendidas. Una imagen de prueba x con una puntuación alta de accidente puede ser un accidente. Los criterios de juicio se basan en el umbral de puntuación de accidentes (φ) si Acc(x) > φ.
Arquitectura de red:
Como se muestra en la Figura 1, el modelo21 de GANomaly contiene dos codificadores, un decodificador y un discriminador. Muchos investigadores han adaptado este método para distinguir vectores latentes y detectar anomalías visuales12,22. Los dos codificadores y el decodificador único modifican recíprocamente la imagen y el vector latente en el modelo. Estos hechos aberrantes se indican durante la transformación. El discriminador divide las imágenes generadas del original. GANomaly se basa en la codificación, decodificación y recodificación.

Figura 1: Arquitectura GANomaly que demuestra el flujo de información. La arquitectura consiste en un marco codificador-decodificador-codificador integrado dentro de una red generativa adversaria. El primer codificador comprime el fotograma de vídeo de entrada en una representación de espacio latente, que luego es reconstruida por el decodificador. Un segundo codificador asigna el fotograma reconstruido al espacio latente. El discriminador evalúa la diferencia entre las entidades de entrada y las reconstruidas para calcular la puntuación de anomalía. Las flechas indican el flujo direccional de datos a través de la red. Abreviatura: GAN = red generativa antagónica. Haga clic aquí para ver una versión más grande de esta figura.
La Figura 2 ilustra la arquitectura EDE con dos codificadores y un decodificador. La estructura de EDE debe cambiar constantemente los parámetros para detectar percances de video. Agregamos un segundo decodificador a la estructura EDE y les permitimos compartir los codificadores para generar el modelo en la Figura 2 con dos configuraciones de red. Dos codificadores tienen cuatro capas convolucionales. Usamos las funciones de activación de LeakyReLU para todas las capas excepto la capa de salida, que usó una activación tanh para limitar las salidas entre -1 y 1. La normalización por lotes se aplicó después de múltiples capas convolucionales. Los decodificadores (Figura 3 y Figura 4) son similares a los codificadores, pero emplean ConvTranspose y normalización de lotes adicional en lugar de cada capa.

Figura 2: Propuesta de arquitectura basada en EDE con flujo de información. Se ilustra la arquitectura EDE, mostrando el flujo de fotogramas de vídeo a través de dos codificadores y un decodificador. El primer codificador (E1) comprime el marco de entrada en una representación latente, que luego es reconstruida por el decodificador (D1). La salida reconstruida se pasa a través del segundo codificador (E2) para obtener un segundo vector latente. Las discrepancias entre los vectores latentes y la calidad de la reconstrucción se utilizan para la detección de anomalías, respaldadas por componentes de pérdida adversarios y contrastivos. Abreviatura: EDE = codificador-decodificador-codificador. Haga clic aquí para ver una versión más grande de esta figura.
Detalles de la arquitectura de red:
El modelo de doble EDE consta de dos canalizaciones codificador-decodificador-codificador, cada una con la misma estructura y optimizadas conjuntamente durante el entrenamiento.
Arquitectura del codificador (E1, E2)
Entrada: marco RGB 128×128×3
Capa 1: Conv2D (64 filtros, kernel 4×4, zancada 2, relleno 1) → LeakyReLU (α = 0,2)
Capa 2: Conv2D (128 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → LeakyReLU
Capa 3: Conv2D (256 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → LeakyReLU
Capa 4: Conv2D (512 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → LeakyReLU
Capa 5: Aplanar → Vector denso a latente (z
^100)
Arquitectura del decodificador (D1, D2)
Entrada: z
^100 → Denso → remodelar a 8×8×512
Capa 1: TransposedConv2D (256 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → ReLU
Capa 2: TransposedConv2D (128 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → ReLU
Capa 3: TransposedConv2D (64 filtros, 4×4, zancada 2, relleno 1) → BatchNorm → ReLU
Capa 4: TransposedConv2D (3 filtros, 4×4, zancada 2, relleno 1) → Tanh
La imagen reconstruida se vuelve a codificar a través del segundo codificador para obtener una representación latente, y las discrepancias entre los vectores latentes originales y reconstruidos se utilizan para la puntuación de anomalías.
Activación y normalización
Los codificadores utilizan la activación de LeakyReLU y la normalización por lotes. Los decodificadores utilizan la activación ReLU, excepto la capa final, que aplica Tanh para normalizar las salidas al rango [−1, 1].
Pérdida Funciones
Pérdida de reconstrucción de imagen: ǀǀ x −ǀǀ2
Pérdida de consistencia latente: ǀǀ z −ǀǀ2
Pérdida adversaria: Introducida en la Fase II para maximizar la divergencia entre las reconstrucciones reales y sintéticas al obligar a la red a distinguir los códigos latentes reales de los generados durante la reconstrucción.
Esta arquitectura captura las irregularidades tanto del espacio de píxeles como del espacio latente, lo que permite la detección de desviaciones sutiles indicativas de un comportamiento de conducción anormal.
Entrenamiento en dos fases
Se emplea un método de entrenamiento de red en dos etapas. Tanto para la reconstrucción de imágenes como para la reconstrucción de vectores latentes, se entrenan dos estructuras EDE. En la segunda fase, el codificador 2 intenta engañar al codificador 1 para que clasifique erróneamente los datos como reales o reconstruidos.
Formación inicial en reconstrucción
La estructura EDE está entrenada para replicar la imagen de entrada y el vector latente. La entrada x se codifica en el vector latente z mediante el codificador E1. Tanto D1 como D2 decodifican z para producir imágenes, x1 y x2. Obtuvimos dos vectores latentes (z1 y z2) del codificador E2 después de pasar dos imágenes reconstruidas (x1 y x2). Esta etapa contiene los siguientes objetivos formativos:
LEDE1 = γ ǀǀ x −x1ǀǀ2+δ ǀǀ z −z1ǀǀ2 (1)
LEDE2 = γ ǀǀ x−x2ǀǀ2+δ ǀǀ z −z2ǀǀ2 (2)
Estas imágenes reconstruidas se pasan a través del codificador E2 para obtener los vectores latentes z1 y z2. Objetivos de la formación:
Los factores de ponderación (γ, δ) influyen de manera crucial en el impacto de los componentes de pérdida en la función objetivo.
En segundo lugar, entrenamos dos estructuras Codificador-Decodificador-Codificador utilizando métodos adversarios.
Aquí, γ y δ son los parámetros que ponderan las contribuciones de la reconstrucción y las pérdidas de consistencia latente.
Entrenamiento adversarial
Dos estructuras EDE se entrenan de forma adversa. Aprende a reconocer el codificador 2 a partir de los datos. EDE2 debe engañar a EDE1 porque es lo contrario. D1 decodifica z2 desde el primer paso y reconstruye x1'. La repetición de x1' al codificador E2 produce z1'. Los objetivos de la formación en el escenario son los siguientes:
min max γ ǀǀ x −x1'ǀǀ +δ ǀǀ z -z1'ǀǀ 2 (3)
EDE2 EDE1
Las dos estructuras EDE tienen estas funciones de pérdida:
LEDE1 = −γ ǀǀ x -x1'ǀǀ 2 −δǀǀ z - z1'ǀǀ 2 (4)
LEDE2 = +γ ǀǀ x - x1'ǀǀ 2+δ ǀǀ z -z 1'ǀǀ 2 (5)
Los valores de γ y δ coinciden con los parámetros especificados anteriormente.

Figura 3: Estructura del codificador. La red de codificadores utilizada en la arquitectura EDE propuesta extrae características espaciotemporales de los fotogramas de vídeo de entrada. Consta de múltiples capas convolucionales seguidas de normalización por lotes y activación de ReLU, lo que reduce progresivamente las dimensiones espaciales y captura representaciones jerárquicas. El vector latente final codifica información semántica de alto nivel esencial para la detección de anomalías. Abreviaturas: ReLU = Unidad lineal rectificada, EDE = codificador-decodificador-codificador. Haga clic aquí para ver una versión más grande de esta figura.
Cada EDE proporciona dos funciones de pérdida para la estructura propuesta. En la fase 1, EDE1 debe reducir las pérdidas de reconstrucción x y z. EDE1 debe optimizar la varianza de fase 2 entre los vectores latentes z y z1' y x y x1'. EDE2 y EDE1 reducen los errores de reconstrucción x y z de la fase 1. EDE1 debe disminuir la diferencia entre z y z1' y x y x1' en la fase 2, pero debe suceder lo contrario.

Figura 4: Estructura del decodificador. El componente decodificador de la arquitectura EDE propuesta reconstruye los marcos de entrada a partir de características latentes. Consiste en una serie de capas convolucionales transpuestas que aumentan progresivamente los mapas de características a la resolución de fotograma original. El decodificador aprende a reconstruir con precisión escenas de tráfico normales, lo que permite que el sistema identifique anomalías basadas en errores de reconstrucción. Abreviatura: EDE = codificador-decodificador-codificador. Haga clic aquí para ver una versión más grande de esta figura.
Cada objetivo de entrenamiento dual del modelo EDE incluye funciones de pérdida con pesos que cambian con el tiempo:
LEDE1=(γ||x−x1||2+δ||z−z1||2)−(1−)(γ||x−x1''||2+δ||z−z1''||2) (6)
LEDE2=(γ||x−x1||2+δ||z−z1||2)+(1−)(γ||x−x1''||2+δ||z−z1''||2) (7)
El recuento del período de entrenamiento es n.
El algoritmo 1 muestra el entrenamiento en dos fases:
Entrada:
Todas las imágenes normales en el conjunto de datos E = {x1, x2, . . . , xF},
épocas N,
Parámetros ponderados γ, δ
Salida:
Codificador-decodificador-codificador entrenado 1,
Codificador-Decodificador-Codificador 2
e1, e2, d1, d2 ←inicialización
Pesos
n ←1
repetir
para f = 1 a F hacer
zf←e1(xf)
←d1(zf)
←d2 (zf)
←e2(
)
←e2(
)
←d1(
)
←e2(
)′
LEDE1←(
γ||xf−
||2+δ||zf−
||2) −(1−
)(γ||xf−
'||2+ δ||zf−
'||2)
LEDE2←(
γ||xf−
||2+δ||zf−
||2) +(1−
) (γ||xf−
'||2+ δ||zf−
'||2)
e1, e2, d1, d2←actualizar ponderaciones
usando LEDE1y LEDE2
fin para
n ←n + 1
hasta n = N
Fases de entrenamiento y criterios de detección de anomalías
Divida la capacitación en dos fases secuenciales:
Fase I - Aprendizaje de la Reconstrucción:
Ambas tuberías EDE se entrenan únicamente en escenas de tráfico normales.
Las imágenes de entrada se pasan a través del codificador 1 → el decodificador 1 → el codificador 2 (figura 5).
El modelo minimiza la pérdida de reconstrucción de imágenes y la pérdida de consistencia latente. Esta fase permite que la red aprenda un espacio latente compacto y consistente para el comportamiento normal.
Fase II - Aprendizaje de confrontación generativa:
Los vectores latentes reconstruidos a partir del decodificador 1 se introducen en el decodificador 2 y luego se vuelven a codificar a través del codificador 1. Este flujo circular ayuda al modelo a detectar inconsistencias en patrones sintéticos. Se agrega una pérdida adversaria para exagerar pequeñas desviaciones entre las representaciones originales y reconstruidas. Un discriminador está entrenado opcionalmente para diferenciar los códigos latentes reales de los reconstruidos, imponiendo una distinción más nítida en el espacio latente.
Detección de anomalías:
En el momento de la inferencia, pase un marco de prueba a través de la canalización de doble EDE. Calcule tres métricas: error de reconstrucción por píxeles, discrepancia vectorial latente y puntuación discriminadora adversaria (si se usa). Calcule una puntuación de anomalía compuesta como una suma ponderada:

Las tramas con puntuaciones de anomalías por encima de un umbral calibrado se marcan como posibles eventos anormales. Este mecanismo permite que el modelo detecte desviaciones sutiles en patrones de espacio visual y latente sin necesidad de etiquetas de anomalías anotadas.

Figura 5: Arquitectura del modelo GANomaly adversario que integra EDE 1 y EDE 2. Esta figura ilustra el diseño del modelo de detección de anomalías adversas, que integra dos estructuras EDE: EDE1 para reconstrucción y EDE2 para alineación de características latentes. El modelo emplea una pérdida de consistencia de vector latente y entrenamiento adversario a través de un discriminador para imponer la similitud entre las representaciones latentes de la entrada y los marcos reconstruidos. Esta arquitectura mejora la detección de anomalías mediante el aprendizaje de incrustaciones de características sólidas para patrones de tráfico normales. Abreviaturas: EDE1 = Primera estructura codificador-decodificador-codificador para la reconstrucción; EDE2 = Segunda estructura codificador-decodificador-codificador para la alineación de características latentes. Haga clic aquí para ver una versión más grande de esta figura.
Durante la detección, nuestro modelo empleó estas puntuaciones anómalas:
Acc(x̂) = ω1||z−z2||2+ω2||z−z1'||2 (8)
Cambiar los parámetros de peso (ω1 + ω2 = 1) puede cambiar la sensibilidad ajustando la relación entre verdaderos positivos y falsos positivos. En aplicaciones del mundo real, cambiar estos dos parámetros puede detectar accidentes con sensibilidades variadas en un experimento.
Durante el entrenamiento, cada fotograma de entrada x se pasa a través del codificador E1 para generar un vector z latente. A continuación, el vector latente se reconstruye mediante el decodificador D1, produciendo la imagen x̂1, que posteriormente se pasa a través del codificador E2 para obtener un vector latente z reconstruido. Paralelamente, z es decodificado por el decodificador D2 para producir x̂2, que también se recodifica a través de E2 para producir z2. Este proceso bidireccional conserva la información a nivel de píxel y latente para la detección de anomalías.
Algoritmo de prueba de modelos:
={( x̂1,y 1),( x̂2,y 2),...,( x̂M*,yM*)},
Umbral φ,
Parámetros de ponderación ω1, ω2
Salida: etiqueta de predicción del conjunto de datos de prueba
Ere = {y1pre, y2pre, ..., yF*pre}
para i =1to F* do
zi ← e1(xi)
x2i ← d2(zi)
z2i ← e2 (x2i)
z1i' ← d1(z2i)
z1i' ← e2(z1i')
Acc(x̂i) ←ω1||zi−z2i||2+ω2||zi−z1i'||número arábigo
ifAcc(x̂i) ≥φ entonces
yipre ←1
más
¿por qué← 0?
endif
fin
EDE utiliza el discriminador como un componente de aprendizaje adversario para aumentar la precisión de la detección de anomalías al mejorar la capacidad del modelo para distinguir eventos normales y anormales. Aumenta el rendimiento de la siguiente manera:
Discriminación por aprendizaje: El discriminador está entrenado para diferenciar representaciones reconstruidas con estructura EDE sintética y dual. La optimización de este proceso adversario le da al modelo características latentes altamente discriminativas, lo que mejora la detección de anomalías en la escena del tráfico.
Eliminar las malas reconstrucciones: Debido a que se desvían tanto de los patrones de tráfico, las anomalías a menudo generan problemas de reconstrucción. El discriminador penaliza las tramas reconstruidas incorrectamente, mejorando la detección de eventos normales/anormales de la red.
Mejora de la representación de características con entrenamiento adversario: Al integrar el aprendizaje adversario, el discriminador hace que la red EDE genere incrustaciones latentes más duraderas y significativas. Esto detecta incluso pequeños cambios como frenadas bruscas, colisiones y desvíos del vehículo, lo que mejora la detección de anomalías.
Eliminación de falsos positivos: los autocodificadores tradicionales generalizan en exceso y normalizan las anomalías, lo que da como resultado altas tasas de falsos positivos. El discriminador conserva los atributos de las anomalías durante la reconstrucción identificando discrepancias latentes entre marcos normales y anómalos.
Mejora de la clasificación con un proceso de decisión en dos etapas: los marcos reconstruidos normales o anormales reciben puntajes de confianza del discriminador. Los errores de clasificación errónea y la pérdida de reconstrucción se reducen en esta fase de verificación adicional, lo que mejora la precisión de la detección.
Utilizamos métodos probados de detección de accidentes para probar la estrategia 23,24,25,26. Una clase en un conjunto de datos de varias clases fue normal y todas las demás clases de accidentes se examinaron cuidadosamente utilizando uno versus todos los enfoques. El modelo se entrenó utilizando solo datos de clase normal, mientras que el conjunto de prueba utilizó datos normales y de accidentes. Los conjuntos de entrenamiento y prueba se dividieron de dos maneras.
Entrenamos y probamos con 80% y 20% de datos de clase normal, respectivamente. Los resultados de las pruebas de clase de accidente se seleccionaron al azar. La evaluación fue imparcial mediante el empleo de muestras de prueba de clase de accidente, que representan el 20% de los datos de clase normal, para evitar el sesgo del modelo hacia la clase normal mayoritaria. El modelo se puede probar con el mismo número de datos normales y de accidentes, que representan condiciones prácticas. Prueba la generalización del modelo de manera imparcial entrenando con el 80% de los datos normales y ocultando el 20%. Esto también muestra que las ocurrencias normales superan en número a los accidentes en la vida real, por lo que es importante exponer el modelo a datos de accidentes poco frecuentes. La selección aleatoria de muestras de accidentes y la prueba del modelo frente a todas las situaciones de accidentes sin sobreajuste aumentan la robustez. La división de datos 80/20 es común en el aprendizaje automático. Los datos de entrenamiento para patrones significativos y los datos de prueba para la evaluación del desempeño están equilibrados.
Los experimentos utilizaron conjuntos de datos para entrenamiento y pruebas. Se utilizó la división de entrenamiento de clase normal para la validación y el entrenamiento. Se probaron los datos de prueba de todas las clases.
La poda y cuantificación del modelo reducen en gran medida el tamaño y el cálculo del modelo. El modelo reducido tiene la misma precisión pero un rendimiento menor, ya que comprende un 40% menos de parámetros. Para dispositivos perimetrales con baja potencia de procesamiento, la cuantificación del modelo lo comprime. Esta optimización satisface la precisión de la vigilancia del tráfico en tiempo real y las necesidades de recuperación.
Los diseños ligeros como MobileNets y EfficientNet aumentan las inferencias en tiempo real. Debido a su precisión de visión por computadora y computación mínima, estos tipos arquitectónicos son ampliamente utilizados. En los sistemas integrados, estos modelos reducen el procesamiento de fotogramas en un 50% al tiempo que mantienen fuertes puntuaciones F1 de detección de accidentes.
El uso de parámetros similares para la reconstrucción de imágenes y la detección de accidentes utilizando el aprendizaje multitarea podría simplificar el diseño. Esto redujo el tiempo de entrenamiento y el costo de computación sin afectar la precisión del modelo. El sistema de aprendizaje multitarea simplificó el aprendizaje del modelo de procesamiento de datos de video de tráfico.
El entrenamiento adversario contrastivo y autosupervisado produjo resultados comparables al modelo base de detección de anomalías en menos tiempo. Se recopilaron y generalizaron las características de los accidentes de tráfico para mejorar la solidez de los datos no vistos.
El algoritmo de detección de anomalías de tráfico propuesto se probó en Track-4, uno de los cinco conjuntos de datos del AI City Challenge2021 27. Motorways proporcionó estos datos al Departamento de Transporte de Iowa.
Evaluación comparativa del desempeño:
Para validar nuestro modelo, lo comparamos en el conjunto de datos AI City Challenge Track 4 con modelos de última generación, incluidos GANomaly, f-AnoGAN, OCGAN y el método supervisado de ByteDance. La Tabla 2 resume los resultados.
| Modelo | Puntuación F1 | Precisión | Recordar | AUC |
| GANomaly | 0.87 | 0.88 | 0.86 | 0.9 |
| OCGAN | 0.89 | 0.9 | 0.87 | 0.91 |
| ByteDance (Sup.) | 0.91 | 0.93 | 0.89 | 0.92 |
| Propuesto (Dual-EDE) | 0.94 | 0.95 | 0.93 | 0.94 |
Tabla 2: Comparación de métodos. La tabla compara los métodos de detección de anomalías por puntuación F1, precisión, recuperación y exactitud. Se comparan los diseños de EDE con y sin entrenamiento adversario. Dos EDE más entrenamiento adversario vencieron a BADU, ByteDance y WHU en todas las categorías. Los datos indican que el aprendizaje adversario aumenta la detección de anomalías.
El modelo de doble EDE supera todas las líneas de base, especialmente en el recuerdo, lo que indica una mayor sensibilidad a eventos anómalos raros.