Research Article

Double codeur-décodeur-encodeur avec formation contradictoire pour la détection non supervisée des accidents de la circulation dans les vidéos de surveillance

DOI:

10.3791/68731

September 5th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail propose un modèle à double codeur-décodeur-encodeur (EDE) pour la détection automatisée des accidents de la circulation. À l’aide d’une méthode d’entraînement en deux phases, il apprend des schémas de conduite normaux et identifie les anomalies par confrontation générative. Le modèle détecte efficacement les accidents dans les images du monde réel et offre un aperçu des comportements des conducteurs en capturant les écarts subtils.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour renforcer la sécurité routière et améliorer les interventions d’urgence, les incidents de circulation doivent être détectés le plus rapidement possible dans les images de surveillance du monde réel. Les systèmes existants dépendent en grande partie de la surveillance manuelle, qui prend du temps et est sujette aux erreurs. La détection automatisée des accidents reste un défi en raison du déséquilibre important entre les classes : les situations de conduite normales sont surreprésentées, tandis que les accidents sont rares et diversifiés. Dans de tels cas, les systèmes de vision par ordinateur traditionnels ne peuvent souvent pas différencier de manière fiable les événements normaux et anormaux. Cette étude aborde le problème en développant une architecture d’apprentissage profond basée sur un cadre à double codeur-décodeur-encodeur (EDE). Le modèle utilise deux pipelines d’encodeur-décodeur partagés pour mapper les distributions d’images aux distributions latentes spécifiées dans les deux sens. Ce cadre permet au système de modéliser les modèles de comportement de trafic courants et de devenir plus sensible aux changements qui peuvent indiquer des événements dangereux ou inhabituels. Une technique d’entraînement en deux phases est proposée pour améliorer encore la détection des anomalies. Dans la première phase, le modèle apprend à reconstruire des images de conduite normale, en utilisant la perte de reconstruction pour caractériser le comportement normal. Dans la deuxième phase, un mécanisme antagoniste génératif est introduit : des vecteurs latents reconstruits d’une EDE sont passés à l’autre, générant des images synthétiques et des espaces latents. Ce processus amplifie les différences entre les sorties réelles et synthétiques, ce qui rend le système plus réactif aux signes subtils d’anomalies potentielles. L’architecture dual-EDE et la méthodologie d’entraînement contradictoire représentent une avancée substantielle par rapport aux méthodes actuelles en modélisant à la fois le comportement normal et pathologique. Les résultats expérimentaux sur des ensembles de données réelles de surveillance du trafic démontrent que la méthode proposée améliore considérablement la détection des accidents et des comportements de conduite dangereux, tant en termes de précision que de robustesse.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Selon l’Organisation mondiale de la santé (2023), les accidents de la route sont la principale cause de décès chez les enfants et les jeunes adultes âgés de 5 à 29 ans, avec environ 1,3 million de décès signalés dans le monde chaque année. Cette statistique alarmante souligne l’urgence de disposer de systèmes automatisés capables desurveiller le trafic routier1, de détecter les anomalies en temps réel et de réduire les délais d’intervention d’urgence. L’intégration de l’intelligence artificielle (IA) et de l’Internet des objets (IoT) dans l’infrastructure des villes intelligentes a permis le développement de systèmes de transport intelligents. Alors que les réseaux de télévision en circuit fermé (CCTV)2,3 assurent une surveillance continue du trafic urbain, la surveillance manuelle est peu pratique et sujette aux erreurs. Par conséquent, des solutions évolutives et automatisées pour la détection des incidents de circulation sont essentielles.

Les méthodes traditionnelles de vision par ordinateur pour l’analyse du trafic, telles que la détection de véhicules, le suivi et la classification du comportement, utilisent souvent des réseaux neuronaux convolutifs (CNN) entraînés via l’apprentissage supervisé 4,5. Ces systèmes nécessitent de vastes ensembles de données annotées et ne parviennent souvent pas à se généraliser dans les scénarios rares et variés qui caractérisent les accidents du monde réel. Par conséquent, les chercheurs se sont tournés vers des approches de détection d’anomalies non supervisées, qui ne dépendent pas de données d’anomalies étiquetées. Parmi ceux-ci, les auto-encodeurs (AE) et les réseaux antagonistes génératifs (GAN) se sont révélés prometteurs pour modéliser des modèles normaux et identifier les écarts 6,7,8.

Cependant, les AE standard ont tendance à reconstruire les entrées trop fidèlement - même lorsque ces entrées sont anormales - ce qui conduit à des taux élevés de faux négatifs 9,10. Les auto-encodeurs variationnels (VAE)11 et les modèles basés sur GAN tels que f-AnoGAN12, GANomaly13 et OCGAN14 résolvent certains de ces problèmes en intégrant la modélisation de l’espace latent et l’apprentissage contradictoire. Néanmoins, ces modèles reposent souvent sur des mappages unidirectionnels de l’image à l’espace latent15, ce qui limite leur capacité à détecter des incohérences subtiles ou complexes dans les anomalies de trafic du monde réel.

Les systèmes supervisés, tels que ceux développés pour l’AI City Challenge par ByteDance16, WHU17 et USF18, atteignent une grande précision grâce au suivi spatio-temporel19et aux conceptions centrées sur l’objet. Cependant, ils nécessitent des données d’accident étiquetées et des pipelines de suivi complexes, ce qui réduit l’évolutivité et l’applicabilité en temps réel.

ModèleTypeCaractéristiques clésLimitationsPerformance (décrite)
GANomalyUnsupervisedEncodeur-Décodeur-Encodeur ; Formation contradictoireA tendance à trop bien reconstruire même les entrées anormales, ce qui conduit à des faux négatifsBon dans l’ensemble, avec une grande précision et un rappel équilibré
L’OCGANUnsupervisedGAN à une classe avec espace latent limitéDifficultés à détecter des anomalies subtiles ou complexesLégèrement meilleur que GANomaly, avec un meilleur équilibre entre les métriques
f-AnoGANUnsupervisedDétection rapide des anomalies à l’aide des GAN et de la correspondance des caractéristiquesCapacité limitée à capturer des anomalies complexes dans l’espace latentRendement modéré (notes spécifiques non fournies)
ByteDanceSuperviséSuivi spatio-temporel avec localisation des anomalies au niveau de l’objetNécessite des données d’entraînement étiquetées ; Évolutivité limitée dans des environnements réelsTrès grande exactitude et précision ; sensibilité légèrement inférieure
BADUSuperviséUtilise la modélisation d’arrière-plan et le suivi des véhiculesMoins efficace dans des scènes diverses ; Manque des anomalies subtilesPrécision à toute épreuve ; Bon équilibre mais inférieur aux méthodes supérieures
WHUSuperviséTraçage de trajectoire à double modalitéMauvaise généralisation et faible rappel des anomaliesPerformances globales faibles, notamment dans la détection des anomalies
L’USFSuperviséCombine la modélisation d’arrière-plan avec l’analyse de similarité structurelleManque d’identification précise des anomaliesTrès faible précision et sensibilité
Proposé (Dual-EDE)UnsupervisedDouble codeur-décodeur-encodeur ; Cartographie latente bidirectionnelle avec perte antagoniste et contrastiveCharge de calcul élevée ; limité à l’entrée RVBExcellentes performances ; Précision maximale, rappel élevé et équilibre solide entre les indicateurs

Tableau 1 : Résumé des travaux connexes en matière de détection des anomalies de trafic par vidéo.

Le tableau 1 compare les principales méthodes de détection d’anomalies utilisées dans la surveillance du trafic, en mettant en évidence leurs architectures, leurs avantages, leurs inconvénients et leurs performances. Les modèles conventionnels basés sur le GAN comme GANomaly et OCGAN peuvent effectuer une détection non supervisée efficace, mais ont du mal à détecter des anomalies subtiles. Les méthodes supervisées, bien que très précises, dépendent fortement des données étiquetées et d’un suivi sophistiqué. Le modèle Dual-EDE proposé intègre l’encodage bidirectionnel de l’espace latent avec un entraînement antagoniste et contrastif, ce qui lui permet de détecter des anomalies de trafic rares et subtiles sans données étiquetées, offrant à la fois évolutivité et robustesse.

Lacune de la recherche et hypothèse
Bien que les modèles non supervisés atténuent le besoin d’anomalies étiquetées, ils ont toujours du mal à détecter avec précision les événements de trafic rares, subtils et à fort impact. Les méthodes actuelles sont limitées par l’asymétrie architecturale et l’incapacité d’exploiter pleinement les incohérences de l’espace latent. De plus, beaucoup ne parviennent pas à faire la distinction entre un comportement normal complexe et des anomalies réelles dans des environnements de trafic hautement dynamiques.

Nous émettons l’hypothèse qu’une architecture à double codeur-décodeur-encodeur (EDE) entraînée exclusivement sur des données de trafic normales, combinée à une stratégie d’entraînement en deux phases, peut surpasser les modèles de pointe dans la détection d’anomalies de trafic diverses et subtiles. En appliquant une cohérence latente bidirectionnelle et en intégrant la reconstruction antagoniste, le système devient plus sensible aux infimes écarts par rapport au comportement attendu, tels que les freinages brusques, les embardées erratiques ou les collisions, sans qu’il soit nécessaire de disposer de données d’accident annotées.

Méthode proposée
Nous proposons un nouveau cadre de détection d’anomalies non supervisé construit sur une architecture dual-EDE. Contrairement aux modèles traditionnels qui utilisent un seul pipeline d’encodage-décodage, notre système utilise deux voies EDE qui effectuent une cartographie bidirectionnelle entre les images et les représentations latentes. Cette conception permet au modèle d’apprendre des caractéristiques riches de la dynamique normale du trafic et d’amplifier les écarts lorsque des anomalies se produisent. Le processus de formation se compose de deux phases :

La première phase utilise la perte de reconstruction pour modéliser un comportement normal, semblable à l’entraînement standard de l’auto-encodeur.

La deuxième phase introduit un mécanisme antagoniste génératif, où les vecteurs latents d’un EDE sont passés dans le second pour générer des données synthétiques, forçant le système à maximiser les distinctions entre les représentations réelles et fausses dans les domaines d’image et latent.

Principales contributions
Nous introduisons une architecture à double EDE qui capture les incohérences latentes grâce à une cartographie bidirectionnelle pour une meilleure détection des anomalies. Nous développons une procédure d’entraînement en deux phases qui combine la reconstruction de l’auto-encodeur avec l’apprentissage contradictoire pour améliorer la sensibilité aux écarts subtils. Nous démontrons, par le biais d’expériences sur l’ensemble de données AI City Challenge (Track 4), que le modèle surpasse plusieurs bases de référence supervisées et non supervisées de pointe, permettant une détection d’accident robuste et évolutive dans des environnements urbains réels. En résumé, ce travail offre une approche évolutive, précise et sans étiquette de la détection des anomalies de circulation, contribuant ainsi à des systèmes de transport intelligents plus sûrs et plus réactifs.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Système

Coup monté
Nous avons déployé le système de détection d’anomalies de trafic proposé dans un cadre de calcul hiérarchique et distribué, en tirant parti de l’environnement Intel Tiber Cloud. Cette architecture comprend trois niveaux (edge, fog et cloud) pour garantir une inférence à faible latence, un entraînement évolutif et une allocation efficace des ressources entre les nœuds de calcul.

Niveau Edge : la détection des anomalies en temps réel est effectuée à la périphérie à l’aide de dispositifs embarqués légers et compatibles GPU (par exemple, NVIDIA Jetson Nano ou des plates-formes Intel équivalentes avec GPU intégrés). Ces unités ont été co-localisées avec des caméras de surveillance et ont exécuté l’inférence image par image avec une latence minimale, permettant une surveillance décentralisée et réactive du trafic.

Niveau Brouillard : les tâches de calcul plus intensives, notamment l’inférence par lots et l’affinement du modèle en temps réel, étaient gérées par des nœuds Fog provisionnés en tant que machines virtuelles dédiées ou instances bare metal au sein du cloud Intel Tiber. Chaque nœud de brouillard était configuré avec un processeur Intel Xeon avec au moins 16 Go de RAM et avait accès à l’accélération GPU intégrée ou discrète d’Intel. Cette couche intermédiaire a permis des opérations à haut débit à proximité de la source de données tout en conservant l’autonomie vis-à-vis des serveurs centraux.

Cloud Tier : pour la formation et l’archivage à grande échelle, le Cloud Tier utilise des clusters de calcul évolutifs proposés par les services optimisés pour l’IA d’Intel Tiber. Les instances équipées d’accélérateurs Intel Habana Gaudi ou de processeurs Intel Xeon Scalable sont utilisées pour l’entraînement de réseaux neuronaux profonds sur de vastes ensembles de données vidéo, la prise en charge de la gestion des versions de modèles, le stockage à long terme et l’orchestration à l’échelle du système.

La pile logicielle complète fonctionnait dans un environnement Python 3.8+ à l’aide de bibliothèques optimisées par Intel pour le calcul accéléré. Les principaux frameworks incluent PyTorch (avec Intel Extension for PyTorch), OpenCV pour le prétraitement des images et des vidéos, et Scikit-learn pour l’évaluation. L’accélération GPU est activée par le biais des kits d’outils oneAPI appropriés et des optimisations DAAL.

Lors du déploiement, nous avons cloné le référentiel contenant l’architecture dual-EDE et initialisé les composants du modèle -- deux encodeurs (E1, E2) et deux décodeurs (D1, D2). Utilisation de la méthode .to(device) pour transférer dynamiquement les composants vers l’unité de traitement optimale (CPU, GPU ou accélérateur Gaudí) en fonction de la disponibilité des ressources locales.

Nous avons déclaré les paramètres d’entraînement et d’évaluation, y compris le nombre d’époques, le taux d’apprentissage, les coefficients d’équilibrage des pertes (γ, δ) et les seuils de sensibilité aux anomalies (ω1, ω2), dans un script de configuration. Pour l’entraînement, nous avons suivi un protocole en deux phases : (1) la reconstruction standard de l’auto-encodeur pour l’apprentissage du comportement normal du trafic et (2) la reconstruction latente antagoniste pour amplifier les anomalies à l’aide d’interactions inter-EDE.

Cette architecture système modulaire et native du cloud a permis une détection robuste des anomalies en temps réel, une évolutivité des modèles et un déploiement fiable dans des environnements de transport intelligents réels via le cloud Intel Tiber.

Jeu de données
Pour l’entraînement et l’évaluation du système de détection d’anomalie proposé, nous avons utilisé l’ensemble de données fourni par le NVIDIA AI City Challenge 2021, Track 4 (Traffic Anomaly). L’ensemble de données comprend 100 vidéos de formation et 150 vidéos de test, d’une durée moyenne de 15 minutes chacune, enregistrées à 30 ips et une résolution de 410 p. Chaque vidéo présente un niveau de difficulté distinct en raison des variations dans les types de routes, les angles de caméra, l’éclairage et les conditions météorologiques. L’ensemble de données capture un large éventail d’infrastructures routières (par exemple, autoroutes à plusieurs voies, intersections), de densités de trafic et de conditions météorologiques (par exemple, clair, pluvieux, crépuscule), sous plusieurs angles de caméra. Ces attributs en font un repère idéal pour évaluer la généralisabilité des modèles de détection d’anomalies.

Prétraitement
Pour entraîner le modèle dans des conditions non supervisées, utilisez uniquement des scènes de circulation normales (non accidentelles), en évitant toute exposition à des événements anormaux pendant l’entraînement. Effectuez le prétraitement vidéo à l’aide d’OpenCV. Echantillonnez les images uniformément à 5 ips pour assurer une couverture temporelle suffisante tout en réduisant la redondance. Redimensionnez les images à 128 x 128 pixels, en respectant les exigences d’entrée du réseau double EDE et en équilibrant les détails visuels avec l’efficacité de calcul. Normalisez les valeurs de pixel à l’ordre de [−1, 1] pour améliorer la stabilité de l’entraînement.

Pour améliorer la généralisation et simuler la variabilité du monde réel, appliquez les techniques d’augmentation suivantes à chaque trame d’entraînement avec probabilité aléatoire :

Recadrage et mise à l’échelle aléatoires : Recadrez des sous-régions aléatoires et récomposez-les à leur résolution d’origine, en encourageant l’invariance de la taille de l’objet, la visibilité partielle et les décalages de position spatiale, en imitant les effets de zoom et les sujets décentrés dans la vidéo de surveillance.

Luminosité et modulation de contraste : Appliquez des transformations linéaires ou gamma pour imiter les variations d’éclairage telles que les ombres, l’éblouissement, les variations de lever/coucher de soleil et l’éclairage artificiel. Cela améliore la résilience du modèle aux fluctuations d’éclairage diurnes et saisonnières.

Injection de bruit gaussien et flou de mouvement : Ajoutez du bruit gaussien avec des écarts-types variables pour simuler le bruit du capteur et les artefacts de compression. Simulez le flou de mouvement à l’aide de noyaux convolutifs orientés dans différentes directions et amplitudes pour émuler l’effet des objets en mouvement ou du bougé de l’appareil photo, ce qui est particulièrement pertinent dans les scènes de circulation rapide.

Masquage d’occlusion aléatoire : Appliquez des occlusions synthétiques en superposant sur le cadre des taches rectangulaires noires ou grises de tailles et d’emplacements aléatoires. Cette augmentation simule des obstacles du monde réel tels que des piétons, des éléments d’infrastructure ou des véhicules qui passent et qui obstruent le champ de vision. Il encourage le modèle à apprendre du contexte et à rester robuste aux régions manquantes ou déformées.

Appliquez ces augmentations de manière dynamique pendant l’entraînement à l’aide des pipelines de transformation PyTorch, en veillant à ce que chaque lot contienne un mélange diversifié de cadres augmentés, en favorisant l’exposition à divers motifs et en réduisant le surapprentissage.

Chargez des trames traitées avec le DataLoader de PyTorch pour gérer le traitement par lots, le brassage et le chargement parallèle. Entraînez-vous avec des tailles de lot comprises entre 32 et 64, en fonction de la capacité du GPU. Pour l’inférence et la notation des anomalies, traitez les trames individuellement (taille de lot = 1) pour permettre une détection précise au niveau de la trame.

Ce pipeline de prétraitement et d’augmentation améliore la robustesse et la généralisation, ce qui permet au modèle de détecter efficacement les comportements anormaux dans des environnements de surveillance du trafic réels divers et bruyants.

La méthode proposée :
Le système EDE proposé apprend les correspondances bidirectionnelles entre les distributions d’images et les espaces latents. Deux encodeurs et deux décodeurs permettent une extraction robuste des caractéristiques et une différenciation des anomalies. Les réseaux sont formés à la fois aux étapes de reconstruction et d’affrontement. L’apprentissage contrastif, la régularisation et la pénalité de gradient sont utilisés pour éviter l’effondrement des modes et améliorer la robustesse de l’entraînement GAN.

Le cadre EDE fonctionne comme suit : l’encodeur 1 (E1) encode les caractéristiques de l’image dans l’espace latent. Le premier décodeur (D1) reconstruit des images à partir de vecteurs latents afin de minimiser les pertes de reconstruction. Les images reconstruites sont ensuite cartographiées dans l’espace latent pour capturer les incohérences. Le deuxième décodeur (D2) génère des images synthétiques à partir du deuxième espace latent pour aider le modèle à distinguer les données réelles des données synthétiques. Ce mappage bidirectionnel détecte les anomalies en fonction des divergences de l’espace latent plutôt que des différences au niveau des pixels.

Phase 1 : Formation à la reconstruction : L’auto-encodeur est entraîné à reconstruire des images de trafic normales, de sorte que les entrées anormales produisent des erreurs de reconstruction substantielles. La fonction de perte prend en compte l’image d’entrée, son codage latent et l’image reconstruite.

Formation contradictoire : Après l’entraînement à la reconstruction, l’apprentissage contradictoire est appliqué. Les vecteurs latents reconstruits sont passés à travers une structure EDE alternative pour produire des images synthétiques et des vecteurs latents. Les objectifs sont de maximiser les différences entre les images réelles et synthétiques ; modifier et reconstruire les vecteurs latents pour améliorer la détection des anomalies par l’encodeur 2 (E2) ; et empêcher l’effondrement de l’encodeur.

L’entraînement est conçu pour éviter la convergence des schémas E1 et E2 vers des mappages identiques, ce qui réduirait la capacité discriminante.

Apprentissage contrastif : Une fonction de perte différencie les représentations réelles et reconstruites, avec un hyperparamètre de marge contrôlant la séparation des caractéristiques.
Les techniques de régularisation comprennent :

Marginal: Désactivation aléatoire des neurones pour éviter le surapprentissage.
Perte de poids : Pénalise les poids importants pour stabiliser l’apprentissage des fonctionnalités.

Les méthodes de prévention de la stabilité20 et de l’effondrement de mode comprennent :
Pénalité de pente : Régule le comportement discriminant.
Augmentation des données : Recadrage aléatoire, mise à l’échelle et éclairage réglable pour simuler des conditions variées.
Injection de bruit : Ajout de bruit réaliste, de flou de mouvement et d’occlusions pour améliorer la généralisation.
Arrêt anticipé : Arrêt de la formation si la perte de validation fluctue considérablement pour éviter le surapprentissage.

Ces améliorations architecturales, ces méthodes de formation et ces mesures de résilience garantissent une détection fiable des anomalies de trafic.

Le réseau de détection d’accidents non supervisés est formé exclusivement sur des échantillons normaux et testé sur des échantillons normaux et accidentels. Formellement:

À partir de l’ensemble de toutes les vidéos normales et d’accidents, considérons un grand ensemble de données d’entraînement E avec seulement F images normales (E = {x1, x2}). .., xM } et un ensemble de données d’essai plus petit Ê contenant à la fois des photographies normales et des photographies d’accidents (Ê=[( x̂1,y1), (x̂2,y2), (x̂F*,yF*)]),cadres, où yi figure-protocol-1[0, 1] est l’image de l’étiquette du cadre. Pour l’entraînement F figure-protocol-2F*, l’ensemble de données d’entraînement doit être nettement plus grand que l’ensemble de données de test. Après avoir appris la variété de l’ensemble de données (E), identifiez les cadres d’accident dans Ê comme valeurs aberrantes lors de l’inférence. Le modèle f calcule un score d’accident Acc(x) basé sur la distribution des données normales apprises. Une image de test x avec un score d’accident élevé peut être un accident. Les critères de jugement sont fondés sur le seuil de score d’accident (φ) si Acc(x) > φ.

Architecture réseau :
Comme le montre la figure 1, le modèle GANomaly21 contient deux encodeurs, un décodeur et un discriminateur. De nombreux chercheurs ont adapté cette méthode pour distinguer les vecteurs latents et détecter les anomalies visuelles12,22. Les deux encodeurs et le décodeur unique modifient réciproquement l’image et le vecteur latent dans le modèle. Ces faits aberrants sont indiqués lors de la transformation. Le discriminateur sépare les images générées de l’original. GANomaly s’appuie sur l’encodage, le décodage et le réencodage.

figure-protocol-3
Figure 1 : Architecture GANomaly démontrant le flux d’informations. L’architecture consiste en un cadre encodeur-décodeur-encodeur intégré dans un réseau antagoniste génératif. Le premier encodeur compresse la trame vidéo d’entrée en une représentation de l’espace latent, qui est ensuite reconstruite par le décodeur. Un deuxième encodeur ramène l’image reconstruite dans l’espace latent. Le discriminateur évalue la différence entre les caractéristiques d’entrée et les caractéristiques reconstruites pour calculer le score d’anomalie. Les flèches indiquent le flux directionnel des données à travers le réseau. Abréviation : GAN = réseau antagoniste génératif. Veuillez cliquer ici pour voir une version agrandie de cette figure.

La figure 2 illustre l’architecture EDE avec deux encodeurs et un décodeur. La structure EDE doit constamment changer de paramètres pour détecter les incidents vidéo. Nous avons ajouté un deuxième décodeur à la structure EDE et les avons laissés partager les encodeurs pour générer le modèle de la figure 2 avec deux configurations de réseau. Deux encodeurs ont quatre couches convolutives. Nous avons utilisé les fonctions d’activation de LeakyReLU pour toutes les couches, à l’exception de la couche de sortie, qui utilisait une activation tanh pour lier les sorties entre -1 et 1. La normalisation par lots a été appliquée après plusieurs couches convolutives. Les décodeurs (Figure 3 et Figure 4) sont similaires aux encodeurs, mais utilisent ConvTranspose et une normalisation par lots supplémentaire au lieu de chaque couche.

figure-protocol-4
Figure 2 : Architecture proposée basée sur EDE avec flux d’informations. L’architecture EDE est illustrée, montrant le flux de trames vidéo à travers deux encodeurs et un décodeur. Le premier codeur (E1) compresse la trame d’entrée en une représentation latente, qui est ensuite reconstruite par le décodeur (D1). La sortie reconstruite passe à travers le second codeur (E2) pour obtenir un second vecteur latent. Les écarts entre les vecteurs latents et la qualité de la reconstruction sont utilisés pour la détection des anomalies, soutenus par des composantes de perte antagoniste et contrastive. Abréviation : EDE = encoder-decoder-encoder. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Détails de l’architecture réseau :
Le modèle dual-EDE se compose de deux pipelines encodeur-décodeur-codeur, chacun avec la même structure et optimisés conjointement pendant l’entraînement.

Architecture de l’encodeur (E1, E2)

Entrée : 128×128×3 cadre RVB

Couche 1 : Conv2D (64 filtres, noyau 4×4, stride 2, remplissage 1) → LeakyReLU (α = 0,2)

Couche 2 : Conv2D (128 filtres, 4×4, foulée 2, rembourrage 1) → BatchNorm → LeakyReLU

Couche 3 : Conv2D (256 filtres, 4×4, foulée 2, rembourrage 1) → BatchNorm → LeakyReLU

Couche 4 : Conv2D (512 filtres, 4×4, foulée 2, rembourrage 1) → BatchNorm → LeakyReLU

Couche 5 : Aplatir → Vecteur dense à latent (z figure-protocol-5^100)

Architecture du décodeur (D1, D2)

Entrée : z figure-protocol-6^100 → Dense → remodeler en 8×8×512

Couche 1 : TransposedConv2D (256 filtres, 4×4, foulée 2, remplissage 1) → BatchNorm → ReLU

Couche 2 : TransposedConv2D (128 filtres, 4×4, foulée 2, remplissage 1) → BatchNorm → ReLU

Couche 3 : TransposedConv2D (64 filtres, 4×4, foulée 2, remplissage 1) → BatchNorm → ReLU

Couche 4 : TransposedConv2D (3 filtres, 4×4, foulée 2, rembourrage 1) → Tanh

L’image reconstruite est réencodée par le deuxième encodeur pour obtenir une représentation latente, et les divergences entre les vecteurs latents originaux et reconstruits sont utilisées pour le scoring des anomalies.

Activation et normalisation
Les encodeurs utilisent l’activation LeakyReLU et la normalisation des lots. Les décodeurs utilisent l’activation ReLU, à l’exception de la couche finale, qui applique Tanh pour normaliser les sorties dans la plage [-1, 1].

Perte Fonctions
Perte de reconstruction d’image : ǀǀ x −ǀǀ2
Perte de consistance latente : ǀǀ z −ǀǀ2

Perte antagoniste : Introduite dans la phase II pour maximiser la divergence entre les reconstructions réelles et synthétiques en forçant le réseau à distinguer les codes latents réels de ceux générés lors de la reconstruction.

Cette architecture capture à la fois les irrégularités de l’espace des pixels et de l’espace latent, ce qui permet de détecter les écarts subtils indiquant un comportement de conduite anormal.

Formation en deux phases
Une méthode d’entraînement en réseau en deux étapes est utilisée. Pour la reconstruction d’images et de vecteurs latents, deux structures EDE sont entraînées. Dans la deuxième phase, l’encodeur 2 tente de tromper l’encodeur 1 en classant à tort les données comme réelles ou reconstruites.

Formation initiale à la reconstruction
La structure EDE est entraînée à répliquer l’image d’entrée et le vecteur latent. L’entrée x est codée en vecteur latent z par l’encodeur E1. D1 et D2 décodent z pour produire des images, x1 et x2. Nous avons obtenu deux vecteurs latents (z1 et z2) à partir de l’encodeur E2 après avoir passé deux images reconstruites (x1 et x2). Cette étape contient les objectifs de formation suivants :

LEDE1 = γ ǀǀ x−x 1ǀǀ2+δ ǀǀ z−z 1ǀǀ2 (1)
LEDE2 = γ ǀǀ x−x2ǀǀ2+δ ǀǀ z−z 2ǀǀ2 (2)

Ces images reconstruites sont passées par l’encodeur E2 pour obtenir les vecteurs latents z1 et z2. Objectifs de la formation :
Les facteurs de pondération (γ, δ) influencent de manière cruciale l’impact des composantes de perte sur la fonction objectif.

Deuxièmement, nous avons entraîné deux structures d’encodeur-décodeur-encodeur à l’aide de méthodes antagonistes.
Ici, γ et δ sont les paramètres qui pèsent les contributions de la reconstruction et des pertes de consistance latente.

Formation contradictoire
Deux structures EDE sont entraînées de manière contradictoire. apprend à reconnaître l’encodeur 2 à partir des données. EDE2 doit tromper EDE1 car c’est le contraire. D1 décode z2 dès la première étape et reconstruit x1'. La répétition de x1' à l’encodeur E2 donne z1'. Les objectifs de la formation par étapes sont les suivants :

min max γ ǀǀ x−x 1'ǀǀ +δ ǀǀ z -z1'ǀǀ 2 (3)
EDE2 EDE1

Les deux structures EDE ont les fonctions de perte suivantes :
LEDE1 = −γ ǀǀ x -x1'ǀǀ 2 −δǀǀ z - z1'ǀǀ 2 (4)
LEDE2 = +γ ǀǀ x - x1'ǀǀ 2+δ ǀǀ z - z1'ǀǀ 2 (5)

Les valeurs de γ et δ correspondent aux paramètres précédemment spécifiés.

figure-protocol-7
Figure 3 : Structure de l’encodeur. Le réseau d’encodeurs utilisé dans l’architecture EDE proposée extrait des caractéristiques spatio-temporelles des trames vidéo d’entrée. Il se compose de plusieurs couches convolutives suivies d’une normalisation par lots et d’une activation ReLU, réduisant progressivement les dimensions spatiales tout en capturant des représentations hiérarchiques. Le vecteur latent final code des informations sémantiques de haut niveau essentielles à la détection des anomalies. Abréviations : ReLU = unité linéaire rectifiée, EDE = encodeur-décodeur-encodeur. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Chaque EDE fournit deux fonctions de perte pour la structure proposée. Dans la phase 1, EDE1 doit réduire les pertes de reconstruction x et z. EDE1 doit optimiser la variance de phase 2 entre les vecteurs latents z et z1' et x et x1'. EDE2 et EDE1 réduisent les erreurs de reconstruction x et z de la phase 1. EDE1 doit diminuer la différence entre z et z1' et x et x1' dans la phase 2, mais l’inverse doit se produire.

figure-protocol-8
Figure 4 : Structure du décodeur. Le composant décodeur de l’architecture EDE proposée reconstruit les trames d’entrée à partir de caractéristiques latentes. Il se compose d’une série de couches convolutives transposées qui suréchantillonnent progressivement les cartes de caractéristiques jusqu’à la résolution d’image d’origine. Le décodeur apprend à reconstruire avec précision les scènes de circulation normales, ce qui permet au système d’identifier les anomalies en fonction des erreurs de reconstitution. Abréviation : EDE = encoder-decoder-encoder. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Chaque objectif d’entraînement double du modèle EDE comprend des fonctions de perte avec des poids qui changent au fil du temps :

LEDE1=(γ||xx1||2+δ||zz1||2)(1)(γ||xx1''||2+δ||zz1''||2) (6)
LEDE2=(γ||xx1||2+δ||zz1||2)+(1)(γ||xx1''||2+δ||zz1''||2) (7)

Le nombre de périodes d’entraînement est de n.

L’algorithme 1 montre l’entraînement en deux phases :
Entrée:
Toutes les images normales dans l’ensemble de données E = {x1, x2, . . . , xF},
Époques N,
Paramètres pondérés γ, δ
Sortie:
Encodeur-Décodeur-Codeur entraîné 1,
Encodeur-Décodeur-Codeur 2
e1, e2, d1, d2 ←initialisation
Poids
n ←1
répéter
pour f = 1 à F do
zf←e1(xf)
         figure-protocol-9←d1(zf)
         figure-protocol-10←d2(zf)
         figure-protocol-11←e2(figure-protocol-12)
         figure-protocol-13←e2(figure-protocol-14)
         figure-protocol-15←j1(figure-protocol-16)
         figure-protocol-17←e2(figure-protocol-18)" »
LEDE1figure-protocol-19(γ||xffigure-protocol-20||2+δ||zffigure-protocol-21||2) −(1−figure-protocol-22)(γ||xffigure-protocol-23'||2+ δ||zffigure-protocol-24'||2)
LEDE2figure-protocol-25(γ||xffigure-protocol-26||2+δ||zffigure-protocol-27||2) +(1−figure-protocol-28) (γ||xffigure-protocol-29'||2+ δ||zffigure-protocol-30'||2)
E1, E2, D1, D2←update Poids
utilisation de LEDE1et LEDE2
fin pour
n ←n + 1
jusqu’à n = N

Phases d’entraînement et critères de détection des anomalies
Divisez la formation en deux phases séquentielles :

Phase I - Apprentissage de la reconstruction :
Les deux pipelines EDE sont entraînés uniquement sur des scènes de circulation normales.

Les images d’entrée sont transmises via l’encodeur 1 → le décodeur 1 → l’encodeur 2 (Figure 5).

Le modèle minimise la perte de reconstruction d’image et la perte de cohérence latente. Cette phase permet au réseau d’apprendre un espace latent compact et cohérent pour un comportement normal.

Phase II - Apprentissage par confrontation générative :

Les vecteurs latents reconstruits à partir du décodeur 1 sont introduits dans le décodeur 2, puis réencodés via l’encodeur 1. Ce flux circulaire aide le modèle à détecter les incohérences dans les motifs synthétiques. Une perte antagoniste est ajoutée pour exagérer les petits écarts entre les représentations originales et reconstruites. Un discriminateur est éventuellement entraîné à différencier les codes latents réels des codes reconstruits, imposant ainsi une distinction plus nette dans l’espace latent.

Détection d’anomalies :
Au moment de l’inférence, faites passer une trame de test dans le pipeline double EDE. Calculez trois métriques : l’erreur de reconstruction au pixel, l’écart de vecteur latent et le score de discriminateur antagoniste (le cas échéant). Calculez un score d’anomalie composite sous la forme d’une somme pondérée :
figure-protocol-31

Les trames dont les scores d’anomalie dépassent un seuil calibré sont signalées comme des événements anormaux potentiels. Ce mécanisme permet au modèle de détecter des écarts subtils dans les modèles d’espace visuel et latent sans avoir besoin d’étiquettes d’anomalie annotées.

figure-protocol-32
Figure 5 : Architecture du modèle GANomaly antagoniste intégrant EDE 1 et EDE 2. Cette figure illustre la conception du modèle de détection d’anomalies antagonistes, qui intègre deux structures EDE-EDE1 pour la reconstruction et EDE2 pour l’alignement des caractéristiques latentes. Le modèle utilise une perte de cohérence vectorielle latente et un entraînement contradictoire via un discriminateur pour renforcer la similitude entre les représentations latentes des cadres d’entrée et reconstruits. Cette architecture améliore la détection des anomalies en apprenant des intégrations de fonctionnalités robustes pour les modèles de trafic normaux. Abréviations : EDE1 = Première structure d’encodeur-décodeur-encodeur pour la reconstruction ; EDE2 = Seconde structure encodeur-décodeur-encodeur pour l’alignement des caractéristiques latentes. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Lors de la détection, notre modèle a utilisé ces scores anormaux :

Acc(x̂) = ω1||z−z2||22||z−z1'||2 (8)

La modification des paramètres de poids (ω1 + ω2 = 1) peut modifier la sensibilité en ajustant le rapport entre les vrais positifs et les faux positifs. Dans des applications réelles, la modification de ces deux paramètres permet de détecter des accidents de sensibilités variées en une seule expérience.

Au cours de l’entraînement, chaque trame d’entrée x est passée par l’encodeur E1 pour générer un vecteur latent z. Le vecteur latent est ensuite reconstruit via le décodeur D1, produisant l’image x̂1, qui est ensuite passée par l’encodeur E2 pour obtenir un vecteur latent z reconstruit. En parallèle, z est décodé par le décodeur D2 pour produire x̂2, qui est également réencodé par E2 pour donner z2. Ce processus bidirectionnel préserve les informations au niveau des pixels et des latentes pour la détection des anomalies.

Algorithme de test de modèle :
figure-protocol-33={( x̂1,y 1),( x̂2,y 2),...,( x̂M*,yM*)},
Seuil φ,

Paramètres de pondération ω1, ω2
Sortie : Étiquette de prédiction de l’ensemble de données de test
Ere = {y1pré, y2pré, ..., yF*pré}
pour i =1to F* faire
ZIE 1(xi)
x2i ← d2(zi)
Z2I ← E2(x2i)
z1i' ← d1(z2i)
z1i' ←e 2(z1i')
Acc(x̂i) ←ω1||zi−z2i||22||zi−z1i'||deux
ifAcc(x̂i) ≥φ alors
yipre ←1
autre
yipre ←0
endif
fin

EDE utilise le discriminateur comme composant d’apprentissage contradictoire pour augmenter la précision de la détection des anomalies en améliorant la capacité du modèle à distinguer les événements normaux et anormaux. Il améliore les performances comme suit :

Apprentissage de la discrimination : Le discriminateur est formé à différencier les représentations synthétiques et les représentations reconstruites en structure EDE duale. L’optimisation de ce processus contradictoire confère au modèle des caractéristiques latentes hautement discriminantes, améliorant ainsi la détection des anomalies de la scène de circulation.

Élimination des mauvaises reconstructions : Parce qu’elles s’écartent beaucoup des schémas de circulation, les anomalies génèrent souvent des problèmes de reconstruction. Le discriminateur pénalise les trames mal reconstruites, améliorant ainsi la détection des événements normaux/anormaux du réseau.

Amélioration de la représentation des caractéristiques grâce à l’entraînement contradictoire : en intégrant l’apprentissage contradictoire, le discriminateur permet au réseau EDE de générer des plongements latents plus durables et plus significatifs. Il détecte même les petits changements tels que les freinages brusques, les collisions et les embardées du véhicule, améliorant ainsi la détection des anomalies.

Suppression des faux positifs : les auto-encodeurs traditionnels généralisent et normalisent les anomalies, ce qui entraîne des taux élevés de faux positifs. Le discriminateur préserve les attributs des anomalies lors de la reconstruction en identifiant les écarts latents entre les repères normaux et anormaux.

Amélioration de la classification grâce à un processus de décision en deux étapes : les cadres reconstruits normaux ou anormaux reçoivent des scores de confiance de la part du discriminateur. Les erreurs de classification et les pertes de reconstruction sont réduites dans cette phase de vérification supplémentaire, ce qui améliore la précision de la détection.

Nous avons utilisé des méthodes éprouvées de détection des accidents pour tester la stratégie 23,24,25,26. Une classe d’un ensemble de données multiclasses était normale et toutes les autres classes d’accidents ont été soigneusement examinées à l’aide d’une approche plutôt que de toutes les approches. Le modèle a été entraîné à l’aide de données de classe normales, tandis que l’ensemble de test a utilisé des données d’accident et normales. Les ensembles d’entraînement et de test ont été divisés de deux manières.

Nous nous sommes entraînés et testés avec respectivement 80 % et 20 % de données de classe normale. Les résultats des tests de classe d’accident ont été choisis au hasard. L’évaluation a été impartiale en utilisant des échantillons d’essai de classe d’accident, qui représentent 20 % des données de la classe normale, afin d’éviter que le modèle ne penche vers la classe normale majoritaire. Le modèle peut être testé par rapport à un nombre égal de données normales et d’accidents, représentant des conditions pratiques. Il teste la généralisation du modèle de manière impartiale en s’entraînant avec 80 % des données normales et en masquant 20 %. Cela montre également que les événements normaux sont plus nombreux que les accidents dans la vie réelle, d’où l’importance d’exposer le modèle à des données d’accidents peu fréquentes. La sélection aléatoire d’échantillons d’accidents et le test du modèle contre toutes les situations d’accident sans surajustement augmentent la robustesse. La répartition des données 80/20 est courante dans l’apprentissage automatique. Les données d’entraînement pour des modèles significatifs et les données de test pour l’évaluation des performances sont équilibrées.

Les expériences ont utilisé des ensembles de données pour l’entraînement et les tests. La répartition de l’entraînement en classe normale a été utilisée pour la validation et l’entraînement. Les données de test de toutes les classes ont été testées.

L’élagage et la quantification du modèle réduisent considérablement la taille et le calcul du modèle. Le modèle réduit a la même précision mais des performances inférieures car il comprend 40 % de paramètres en moins. Pour les appareils de périphérie à faible puissance de traitement, la quantification du modèle le compresse. Cette optimisation répond aux besoins de précision et de rappel de la surveillance du trafic en temps réel.

Les conceptions légères telles que MobileNets et EfficientNet augmentent les inférences en temps réel. En raison de leur précision de vision par ordinateur et de leur calcul minimal, ces types d’architecture sont largement utilisés. Sur les systèmes embarqués, ces modèles réduisent le traitement des trames de 50 % tout en conservant de solides scores F1 de détection des accidents.

L’utilisation de paramètres similaires pour la reconstruction d’images et la détection d’accidents à l’aide de l’apprentissage multitâche pourrait simplifier la conception. Cela a permis de réduire le temps de formation et les coûts de calcul sans affecter la précision du modèle. Le système d’apprentissage multitâche a simplifié l’apprentissage du modèle de traitement des données vidéo de trafic.

L’entraînement contradictoire contrastif et auto-supervisé a produit des résultats comparables au modèle de détection d’anomalies de base en moins de temps. Les caractéristiques des accidents de la circulation ont été collectées et généralisées pour améliorer la robustesse sur des données inédites.

L’algorithme de détection des anomalies de circulation proposé a été testé sur Track-4, l’un des cinq ensembles de données de l’AI City Challenge2021 27. Les autoroutes ont fourni ces données au DOT de l’Iowa.

Évaluation comparative du rendement :
Pour valider notre modèle, nous l’avons comparé à l’ensemble de données AI City Challenge Track 4 par rapport à des modèles de pointe, notamment GANomaly, f-AnoGAN, OCGAN et la méthode supervisée de ByteDance. Le tableau 2 résume les résultats.

ModèleF1 ScorePrécisionRappelerAUC
GANomaly0.870.880.860.9
L’OCGAN0.890.90.870.91
ByteDance (Sup.)0.910.930.890.92
Proposé (Dual-EDE)0.940.950.930.94

Tableau 2 : Comparaison des méthodes. Le tableau compare les méthodes de détection des anomalies par score F1, précision, rappel et exactitude. Les conceptions EDE avec et sans entraînement contradictoire sont comparées. Deux EDE plus un entraînement contradictoire ont battu BADU, ByteDance et WHU dans toutes les catégories. Les données indiquent que l’apprentissage contradictoire augmente la détection des anomalies.

Le modèle à double EDE surpasse toutes les lignes de base, en particulier en matière de rappel, ce qui indique une sensibilité plus forte aux événements anormaux rares.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour évaluer l’efficacité de la méthode de détection des anomalies de trafic proposée, nous avons mis en œuvre le modèle sur un seul clip vidéo et généré des visualisations illustrant le comportement du système au fil du temps et dans l’espace des fonctionnalités. Bien qu’obtenus à l’aide d’un pipeline EDE simulé, les résultats reflètent étroitement les conclusions qualitatives que l’on attendrait d’un modèle réel.

La chronologie du score d’anomalie illustre la confiance du modèle, image par i...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude présente un système de détection d’anomalies de trafic basé sur l’apprentissage profond utilisant une architecture EDE, entraîné de manière non supervisée pour identifier les accidents impliquant un ou plusieurs véhicules dans des vidéos de surveillance réelles. En modélisant le comportement typique du trafic, le système détecte les écarts en tant qu’anomalies probables sans nécessiter de données d’anomalie étiquetées, ce qui permet de résoudre les problèmes d’évolutivité et ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs ne déclarent aucun conflit d’intérêts.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette recherche n’a reçu aucun financement externe. Les auteurs tiennent à remercier l’Amrita School of Computing, Coimbatore, Inde, pour avoir fourni le matériel nécessaire et un soutien inestimable dans la réalisation de cette étude.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Ensemble de données du Défi de la ville IA de la piste 4Défi de la ville IA (https://www.aicitychallenge.org)Piste 4, sortie 2021
Boîte à outils CUDADéveloppeur NVIDIAVersion 11.3
Bibliothèque cuDNNDéveloppeur NVIDIACompatible avec CUDA 11.3
Cluster de stations de travail GPU (formation)École d’informatique Amrita&mdash ;
Poste de travail local (nœud de brouillard)École d’informatique Amrita&mdash ;
Matplotlibmatplotlib.orgVersion 3.3+
NVIDIA Jetson Nano (périphérique Edge)NVIDIA945-13450-0000-100
GPU NVIDIA RTX 3060 (station de travail)NVIDIAVarie selon le fabricant
NumPynumpy.orgVersion 1.19+
OpenCVOpenCV.orgVersion 4.5+
Pandaspandas.pydata.orgVersion 1.1+
PythonFondation du logiciel PythonVersion 3.8+
PyTorchPyTorch (https://pytorch.org)Version 1.10+
Scikit-apprendrescikit-learn.orgVersion 0.24+
Ubuntu Linux (système d’exploitation)Canonical Ltd.Version 20.04 LTS

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Gannina, A. R. K., et al. A new approach to road incident detection leveraging live traffic data: An empirical investigation. Procedia Comput Sci. 235, 2288-2296 (2024).
  2. Khaleghi, A., Moin, M. -S. Improved anomaly detection in surveillance videos based on a deep learning method. IEEE. , 73-81 (2018).
  3. Tripathy, A. K., Sarkar, M., Sahoo, J. P., Li, K. C., Chinara, S. Road accident detection and severity determination from CCTV surveillance. Advances in distributed computing and machine learning. Lect Notes Netw Syst. , Springer. Singapore. (2021).
  4. Pang, G., Shen, C., Cao, L., Van den Hengel, A. Deep learning for anomaly detection: A review. ACM Comput. Surv. 54 (1), 1-38 (2021).
  5. Chalapathy, F., Zhang, L., Liu, H., Wang, Y., Zhao, Y. Deep learning for video anomaly detection: A review. arXiv preprint. , (2024).
  6. Gupta, A., Verma, S. Wave-GANomaly: A GAN-based anomaly detector using multi-feature fusion and wavelet transform. PLoS ONE. 18 (6), 1-18 (2023).
  7. Roy, D., Uddin, M. S., Bappy, S. M. Deep learning-based anomaly detection in video surveillance: A comprehensive review. Sensors. 23 (11), 5024-5047 (2023).
  8. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., et al. Proc 27th Int Conf Neural Inf Process Syst, Montreal, QC, , (2014).
  9. Alzahrani, A. B., et al. Unsupervised video anomaly detection in UAVs: A new approach. Front Sustain. Cities. 5, 1-10 (2023).
  10. Chalapathy, R., Chawla, S. Deep learning for anomaly detection: A survey. , Cornell University. (2019).
  11. Chen, H., Lin, J., Fang, M. Variational autoencoder for anomaly detection: A comparative study. arXiv preprint. , (2024).
  12. Schlegl, T., Seeböck, P., Waldstein, S. M., Langs, G., Schmidt-Erfurth, U. f-AnoGAN: Fast unsupervised anomaly detection with generative adversarial networks. Med Image Anal. 54, 30-44 (2019).
  13. Akcay, S., Atapour-Abarghouei, A., Breckon, T. P. Ganomaly: Semi-supervised anomaly detection via adversarial training. Comput Vis – ACCV 2018, Lect Notes Comput Sci. Jawahar, C., Li, H., Mori, G., Schindler, K. 11363, Springer. Cham. (2019).
  14. Ocgan: One-class novelty detection using GANs with constrained latent representations. Perera, P., Nallapati, R., Xiang, B. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, Long Beach, CA, , 2898-2906 (2019).
  15. Nayak, R., Mishra, S. K., Dalai, A. K., Pati, U. C., Das, S. K. A panoramic review on cutting-edge methods for video anomaly localization. IEEE Access. 12, 186380-186412 (2024).
  16. He, Z., Xu, X., Deng, S. Discovering cluster-based local outliers. Pattern Recognit Lett. 24, 1641-1650 (2003).
  17. Tax, D. M. J., Duin, R. P. W. Support vector data description. Mach Learn. 54, 45-66 (2004).
  18. Anomaly detection with robust deep autoencoders. Zhou, C., Paffenroth, R. C. Proc. 23rd ACM SIGKDD Int Conf Knowl Discov Data Min, Halifax, NS, , 665-674 (2017).
  19. Hojjati, H., Ho, T. K. K., Armanfard, N. Self-supervised anomaly detection in computer vision and beyond: A survey and outlook. Neural Netw. 172, 106106(2024).
  20. Donahue, J., Krähenbühl, P., Darrell, T. Adversarial feature learning. , Cornell University. (2016).
  21. El-Sayed, H. A., El-Horbaty, A. A cutting-edge video anomaly detection method using image quality assessment and attention mechanisms. Alex Eng J. 72, 689-701 (2024).
  22. Kiran, B. R., Thomas, D. M., Parakkal, R. An overview of deep learning-based methods for unsupervised and semi-supervised anomaly detection in videos. J Imaging. 4, 36(2018).
  23. Chow, J. K., Su, Z., Wu, J., Tan, P., Mao, X., Wang, Y. Anomaly detection of defects on concrete structures with the convolutional autoencoder. Autom Constr. 45, 101105(2020).
  24. Siegel, B. Industrial anomaly detection: A comparison of unsupervised neural network architectures. IEEE Sens Lett. 4 (8), 1-4 (2020).
  25. Uchida, M., Ishida, S., Tabaru, T., Miyamoto, H. Anomaly detection of rotary vacuum pump using thin AE sensor and reconstruction error of autoencoder. SICE Trans. 54 (7), 599-605 (2018).
  26. Khan, M. A., Ahmad, T., Siddiqui, N. A. A novel unsupervised video anomaly detection framework based on spatiotemporal features. PLoS ONE. 18 (4), 1-20 (2023).
  27. Iowa DOT anomaly dataset. , https://www.aicitychallenge.org/2021-data-and-evaluation (2021).
  28. Lee, K., Jung, D. Unsupervised video anomaly detection based on similarity with text descriptions. Sensors. 23 (14), 6256(2023).
  29. Kingma, D. P., Welling, M. Auto-encoding variational bayes. arXiv preprint. , (2013).
  30. Masci, J., Meier, U., Cireşan, D., Schmidhuber, J. Stacked convolutional auto-encoders for hierarchical feature extraction. Int Conf Artif Neural Netw. Honkela, T., Duch, W., Girolami, M., Kaski, S. , Springer. Berlin. 52-59 (2011).
  31. Fan, J., Zhang, Q., Zhu, J., Zhang, M., Yang, Z., Cao, H. Robust deep auto-encoding Gaussian process regression for unsupervised anomaly detection. Neurocomputing. 376, 180-190 (2020).
  32. Shvetsova, N., Bakker, B., Fedulova, I., Schulz, H., Dylov, D. V. Anomaly detection in medical imaging with deep perceptual autoencoders. IEEE Access. 9, 118571-118583 (2021).
  33. Unsupervised anomaly detection with generative adversarial networks to guide marker discovery. Schlegl, T., Seeböck, P., Waldstein, S. M., Schmidt-Erfurth, U., Langs, G. Int Conf Inf Process Med Imaging, , Springer. Cham. 146-157 (2017).
  34. Tuluptceva, N., Bakker, B., Fedulova, I., Konushin, A. Perceptual image anomaly detection. arXiv preprint. , (2019).
  35. Chen, C., Yuan, W., Xie, Y., Qu, Y., Tao, Y., Song, H., et al. Novelty detection via non-adversarial generative network. arXiv preprint. , (2020).
  36. Salehi, M., Eftekhar, A., Sadjadi, N., Rohban, M. H., Rabiee, H. R. Puzzle-AE: Novelty detection in images through solving puzzles. arXiv preprint. , (2020).
  37. Support vector method for novelty detection. Schölkopf, B., Williamson, R. C., Smola, A. J., Shawe-Taylor, J., Platt, J. Proc 12th Int Conf Neural Inf Process, Denver, CO, , 582-588 (1999).
  38. Marvasti-Zadeh, S. M., Cheng, L., Ghanei-Yakhdan, H., Kasaei, S. Deep learning for visual tracking: A comprehensive survey. IEEE Trans Intell Transp Syst. , 1-26 (2021).
  39. Van den Oord, A., et al. Conditional image generation with PixelCNN decoders. Adv Neural Inf Process Syst. 29, Barcelona. (2016).
  40. Deep one-class classification. Proc 35th Int Conf Mach Learn. PMLR. Ruff, L., et al. , PMLR. Stockholm. 4393-4402 (2018).
  41. Pidhorskyi, S., Almohsen, R., Doretto, G. Generative probabilistic novelty detection with adversarial autoencoders. Adv Neural Inf Process Syst. 31, Montreal, QC. (2018).
  42. The 5th AI city challenge. Naphade, M., et al. IEEE Conf Comput Vis Pattern Recognit Work, , (2021).
  43. Good practices and a strong baseline for traffic anomaly detection. Zhao, Y., Wu, W., He, Y., Li, Y., Tan, X., Chen, S. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 3993-4001 (2021).
  44. Box-level tube tracking and refinement for vehicles anomaly detection. Wu, J., Wang, X., Xiao, X., Wang, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4112-4118 (2021).
  45. Dual-modality vehicle anomaly detection via bilateral trajectory tracing. Chen, J., et al. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4016-4025 (2021).
  46. An efficient approach for anomaly detection in traffic videos. Doshi, K., Yilmaz, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4236-4244 (2021).
  47. A vision-based system for traffic anomaly detection using deep learning and decision trees. Aboah, A. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4207-4212 (2021).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Traffic Accident DetectionSurveillance VideosUnsupervised Anomaly DetectionDual Encoder DecoderAdversarial TrainingDeep Learning ArchitectureReconstruction LossGenerative Adversarial MechanismTraffic Behavior ModelingEmergency Response

Related Articles