Research Article

Dubbele encoder-decoder-encoder met adversarial training voor het ongecontroleerd detecteren van verkeersongevallen in bewakingsvideo's

DOI:

10.3791/68731

September 5th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit werk stelt een dubbel encoder-decoder-encoder (EDE) model voor voor geautomatiseerde detectie van verkeersongevallen. Met behulp van een trainingsmethode in twee fasen leert het normale rijpatronen en identificeert het afwijkingen via generatieve confrontatie. Het model detecteert effectief ongevallen in real-world beelden en biedt inzicht in het gedrag van de bestuurder door subtiele afwijkingen vast te leggen.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Om de verkeersveiligheid te verbeteren en de reactie op noodsituaties te verbeteren, moeten verkeersincidenten zo snel mogelijk worden gedetecteerd in real-world bewakingsbeelden. Bestaande systemen zijn grotendeels afhankelijk van handmatige monitoring, wat tijdrovend en foutgevoelig is. Geautomatiseerde ongevallendetectie blijft een uitdaging vanwege de aanzienlijke onbalans in de klassen: normale rijsituaties zijn oververtegenwoordigd, terwijl ongevallen zeldzaam en divers zijn. In dergelijke gevallen kunnen traditionele computervisiesystemen vaak geen betrouwbaar onderscheid maken tussen normale en abnormale gebeurtenissen. Deze studie pakt het probleem aan door een deep learning-architectuur te ontwikkelen op basis van een dual encoder-decoder-encoder (EDE) framework. Het model maakt gebruik van twee gedeelde encoder-decoderpijplijnen om beelddistributies toe te wijzen aan gespecificeerde latente distributies in beide richtingen. Dit raamwerk stelt het systeem in staat om veelvoorkomende verkeersgedragspatronen te modelleren en gevoeliger te worden voor veranderingen die kunnen duiden op gevaarlijke of ongebruikelijke gebeurtenissen. Er wordt een trainingstechniek in twee fasen voorgesteld om de detectie van anomalieën verder te verbeteren. In de eerste fase leert het model beelden van normaal rijden te reconstrueren, waarbij reconstructieverlies wordt gebruikt om normaal gedrag te karakteriseren. In de tweede fase wordt een generatief contradictoir mechanisme geïntroduceerd: gereconstrueerde latente vectoren van de ene EDE worden doorgegeven aan de andere, waardoor synthetische beelden en latente ruimtes worden gegenereerd. Dit proces versterkt de verschillen tussen echte en synthetische outputs, waardoor het systeem beter reageert op subtiele tekenen van mogelijke afwijkingen. De dual-EDE-architectuur en adversarial trainingsmethodologie vertegenwoordigen een substantiële vooruitgang ten opzichte van de huidige methoden door zowel normaal als pathologisch gedrag te modelleren. Experimentele resultaten op real-world verkeersbewakingsdatasets tonen aan dat de voorgestelde methode de detectie van ongevallen en onveilig rijgedrag aanzienlijk verbetert, zowel in termen van nauwkeurigheid als robuustheid.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Volgens de Wereldgezondheidsorganisatie (2023) zijn verkeersongevallen de belangrijkste doodsoorzaak onder kinderen en jongvolwassenen van 5-29 jaar, met ongeveer 1,3 miljoen dodelijke slachtoffers wereldwijd per jaar. Deze alarmerende statistiek onderstreept de dringende behoefte aan geautomatiseerde systemen die in staat zijn om het wegverkeer1 te monitoren, afwijkingen in realtime te detecteren en vertragingen bij noodhulp te verminderen. De integratie van kunstmatige intelligentie (AI) en het Internet of Things (IoT) in de infrastructuur van slimme steden heeft de ontwikkeling van intelligente transportsystemen mogelijk gemaakt. Hoewel netwerken met een gesloten televisiecircuit (CCTV)2,3 continu toezicht houden op het stadsverkeer, is handmatige bewaking onpraktisch en foutgevoelig. Daarom zijn schaalbare, geautomatiseerde oplossingen voor het detecteren van verkeersincidenten essentieel.

Traditionele computervisiemethoden voor verkeersanalyse - zoals voertuigdetectie, tracking en gedragsclassificatie - maken vaak gebruik van convolutionele neurale netwerken (CNN's) die zijn getraind via supervised learning 4,5. Deze systemen vereisen uitgebreide geannoteerde datasets en slagen er vaak niet in om te generaliseren over de zeldzame en gevarieerde scenario's die kenmerkend zijn voor ongevallen in de echte wereld. Daarom hebben onderzoekers zich tot benaderingen voor anomaliedetectie zonder toezicht gewend, die niet afhankelijk zijn van gelabelde anomaliegegevens. Hiervan zijn auto-encoders (AE's) en generatieve vijandige netwerken (GAN's) veelbelovend gebleken bij het modelleren van normale patronen en het identificeren van afwijkingen 6,7,8.

Standaard AE's hebben echter de neiging om inputs te getrouw te reconstrueren - zelfs als die inputs afwijkend zijn - wat leidt tot hoge vals-negatieve percentages 9,10. Variationele auto-encoders (VAE's)11 en op GAN gebaseerde modellen zoals f-AnoGAN12, GANomaly13 en OCGAN14 pakken een aantal van deze problemen aan door latent-space modellering en adversarial learning op te nemen. Desalniettemin vertrouwen deze modellen vaak op unidirectionele toewijzingen van beeld naar latente ruimte15, waardoor hun vermogen om subtiele of complexe inconsistenties in verkeersafwijkingen in de echte wereld te detecteren, wordt beperkt.

Gesuperviseerde systemen, zoals die ontwikkeld voor de AI City Challenge door ByteDance16, WHU17 en USF18, bereiken een hoge nauwkeurigheid door middel van spatiotemporele tracking19en objectgerichte ontwerpen. Ze vereisen echter gelabelde ongevalsgegevens en complexe trackingpijplijnen, waardoor de schaalbaarheid en toepasbaarheid in realtime worden verminderd.

ModelTypeBelangrijkste kenmerkenBeperkingenPrestaties (beschreven)
GANomalyZonder toezichtencoder-decoder-encoder; Contradictoire trainingHeeft de neiging om zelfs afwijkende inputs te goed te reconstrueren, wat leidt tot valse negatievenOver het algemeen goed, met hoge precisie en uitgebalanceerde terugroepactie
OCGANZonder toezichtGAN van één klasse met beperkte latente ruimteWorstelt met het detecteren van subtiele of complexe afwijkingenIets beter dan GANomaly, met een verbeterde balans tussen statistieken
f-AnoGANZonder toezichtSnelle anomaliedetectie met behulp van GAN's en feature matchingBeperkt vermogen om complexe anomalieën in de latente ruimte vast te leggenMatige prestaties (specifieke scores niet opgegeven)
ByteDanceBegeleidSpatiotemporele tracering met anomalielokalisatie op objectniveauVereist gelabelde trainingsgegevens; Beperkte schaalbaarheid in de praktijkZeer hoge nauwkeurigheid en precisie; Iets lagere gevoeligheid
BADUBegeleidMaakt gebruik van achtergrondmodellering en voertuigtrackingMinder effectief in diverse scènes; mist subtiele anomalieënSolide nauwkeurigheid; Goede balans, maar lager dan de beste methoden
WHUBegeleidTrajecttracering met dubbele modaliteitSlechte generalisatie en lage anomalie recallZwakke prestaties in het algemeen, vooral bij het detecteren van afwijkingen
USFBegeleidCombineert achtergrondmodellering met structurele gelijkenisanalyseSlecht in het nauwkeurig identificeren van afwijkingenZeer lage nauwkeurigheid en gevoeligheid
Voorgesteld (Dual-EDE)Zonder toezichtDubbele encoder-decoder-encoder; Bidirectionele latente mapping met adversarial en contrastief verliesHoge rekenbelasting; beperkt tot RGB-invoerUitstekende prestaties; Topprecisie, hoge herinnering en sterke balans tussen statistieken

Tabel 1: Samenvatting van gerelateerde werkzaamheden op het gebied van op video gebaseerde detectie van verkeersafwijkingen.

Tabel 1 vergelijkt essentiële methoden voor het detecteren van afwijkingen die worden gebruikt bij verkeersbewaking, waarbij de architectuur, voordelen, nadelen en prestaties worden benadrukt. Conventionele GAN-gebaseerde modellen zoals GANomaly en OCGAN kunnen effectieve detectie zonder toezicht uitvoeren, maar worstelen met subtiele afwijkingen. Gesuperviseerde methoden, hoewel zeer nauwkeurig, zijn sterk afhankelijk van gelabelde gegevens en geavanceerde tracking. Het voorgestelde Dual-EDE-model integreert bidirectionele latente ruimtecodering met adversarial en contrastieve training, waardoor het zeldzame en subtiele verkeersafwijkingen kan detecteren zonder gelabelde gegevens, en zowel schaalbaarheid als robuustheid biedt.

Onderzoekskloof en hypothese
Hoewel modellen zonder toezicht de behoefte aan gelabelde anomalieën verminderen, worstelen ze nog steeds met het nauwkeurig detecteren van zeldzame, subtiele en impactvolle verkeersgebeurtenissen. De huidige methoden worden beperkt door architecturale asymmetrie en het onvermogen om inconsistenties in de latente ruimte volledig te benutten. Velen slagen er ook niet in om een duidelijk onderscheid te maken tussen complex normaal gedrag en echte anomalieën in zeer dynamische verkeersomgevingen.

Onze hypothese is dat een dubbele encoder-decoder-encoder (EDE)-architectuur die uitsluitend is getraind op normale verkeersgegevens, gecombineerd met een tweefasentrainingsstrategie, beter kan presteren dan state-of-the-art modellen bij het detecteren van diverse en subtiele verkeersafwijkingen. Door bidirectionele latente consistentie af te dwingen en vijandige reconstructie te integreren, wordt het systeem gevoeliger voor minieme afwijkingen van het verwachte gedrag - zoals plotseling remmen, grillig uitwijken of botsingen - zonder dat er geannoteerde ongevalsgegevens nodig zijn.

Voorgestelde methode
We stellen een nieuw raamwerk voor anomaliedetectie zonder toezicht voor, gebouwd op een dual-EDE-architectuur. In tegenstelling tot traditionele modellen die gebruikmaken van een enkele coderings-decoderingspijplijn, gebruikt ons systeem twee EDE-routes die bidirectionele mapping uitvoeren tussen afbeeldingen en latente representaties. Dit ontwerp stelt het model in staat om rijke kenmerken van de normale verkeersdynamiek te leren en discrepanties te vergroten wanneer er afwijkingen optreden. Het trainingsproces bestaat uit twee fasen:

Fase één maakt gebruik van reconstructieverlies om normaal gedrag te modelleren, vergelijkbaar met standaard auto-encodertraining.

Fase twee introduceert een generatief vijandig mechanisme, waarbij latente vectoren van de ene EDE worden doorgegeven aan de tweede om synthetische gegevens te genereren, waardoor het systeem gedwongen wordt om het onderscheid tussen echte en valse representaties in zowel beeld- als latente domeinen te maximaliseren.

Belangrijkste bijdragen
We introduceren een dual-EDE-architectuur die latente inconsistenties vastlegt door middel van bidirectionele mapping voor verbeterde anomaliedetectie. We ontwikkelen een trainingsprocedure in twee fasen die auto-encoderreconstructie combineert met adversarial learning om de gevoeligheid voor subtiele afwijkingen te vergroten. We tonen aan, door middel van experimenten met de AI City Challenge (Track 4) dataset, dat het model beter presteert dan verschillende state-of-the-art gesuperviseerde en niet-gesuperviseerde baselines, waardoor robuuste en schaalbare ongevallendetectie in real-world stedelijke omgevingen wordt bereikt. Samenvattend biedt dit werk een schaalbare, nauwkeurige en labelvrije benadering van het detecteren van verkeersafwijkingen, wat bijdraagt aan veiligere en responsievere slimme transportsystemen.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Systeem

Setup
We hebben het voorgestelde detectiesysteem voor verkeersafwijkingen geïmplementeerd binnen een hiërarchisch en gedistribueerd computerkader, waarbij we gebruik hebben gemaakt van de Intel Tiber Cloud-omgeving. Deze architectuur bestaat uit drie niveaus - edge, fog en cloud - om inferentie met lage latentie, schaalbare training en efficiënte toewijzing van resources aan compute nodes te garanderen.

Edge Tier: Real-time anomaliedetectie wordt aan de edge uitgevoerd met behulp van lichtgewicht, GPU-compatibele embedded apparaten (bijv. NVIDIA Jetson Nano of gelijkwaardige Intel-gebaseerde platforms met geïntegreerde GPU's). Deze eenheden werden samen met bewakingscamera's geplaatst en frame-voor-frame inferentie uitgevoerd met minimale latentie, waardoor gedecentraliseerde en responsieve verkeersmonitoring mogelijk was.

Fog Tier: Meer rekenintensieve taken, waaronder batchdeductie en real-time modelverfijning, werden afgehandeld door fog nodes die waren ingericht als toegewezen virtuele machines of bare-metal instances binnen de Intel Tiber Cloud. Elke fog node was geconfigureerd met een Intel Xeon-processor met ten minste 16 GB RAM en had toegang tot Intel-geïntegreerde of discrete GPU-versnelling. Deze tussenlaag maakte high-throughput-bewerkingen in de buurt van de gegevensbron mogelijk, terwijl de autonomie van de centrale servers behouden bleef.

Cloudlaag: Voor grootschalige training en archivering maakt de cloudlaag gebruik van schaalbare rekenclusters die worden aangeboden via de AI-geoptimaliseerde services van Intel Tiber. Instances die zijn uitgerust met Intel Habana Gaudi-versnellers of Intel Xeon Scalable-processors worden gebruikt voor het trainen van diepe neurale netwerken op uitgebreide videodatasets, het ondersteunen van modelversiebeheer, langdurige opslag en systeembrede orkestratie.

De volledige softwarestack werkte in een Python 3.8+-omgeving met behulp van voor Intel geoptimaliseerde bibliotheken voor versnelde berekeningen. De primaire frameworks zijn PyTorch (met Intel Extension voor PyTorch), OpenCV voor het voorbewerken van afbeeldingen en video's en Scikit-learn voor evaluatie. GPU-versnelling wordt mogelijk gemaakt via de juiste oneAPI-toolkits en DAAL-optimalisaties.

Bij de implementatie hebben we de repository met de dual-EDE-architectuur gekloond en de modelcomponenten geïnitialiseerd: twee encoders (E1, E2) en twee decoders (D1, D2). De .to(device)-methode gebruikt om de componenten dynamisch over te dragen naar de optimale verwerkingseenheid (CPU, GPU of Gaudi-versneller), afhankelijk van de beschikbaarheid van lokale bronnen.

We hebben de trainings- en evaluatieparameters, waaronder het aantal epochs, de leersnelheid, de verliesbalanceringscoëfficiënten (γ, δ) en de gevoeligheidsdrempels voor anomalieën (ω1, ω2) in een configuratiescript gedeclareerd. Voor de training volgden we een protocol in twee fasen: (1) standaard auto-encoderreconstructie voor het aanleren van normaal verkeersgedrag en (2) adversarial latente reconstructie om anomalieën te versterken met behulp van cross-EDE-interacties.

Deze modulaire en cloud-native systeemarchitectuur maakte robuuste, real-time anomaliedetectie, schaalbaarheid van het model en betrouwbare implementatie in real-world intelligente transportomgevingen mogelijk via de Intel Tiber Cloud.

Dataset
Voor het trainen en evalueren van het voorgestelde anomaliedetectiesysteem hebben we de dataset gebruikt die is geleverd door de NVIDIA AI City Challenge 2021, Track 4 (Traffic Anomaly). De dataset bestaat uit 100 trainingsvideo's en 150 testvideo's, elk met een gemiddelde duur van 15 minuten, opgenomen met 30 fps en een resolutie van 410 p. Elke video heeft een specifieke moeilijkheidsgraad als gevolg van variaties in wegtypes, camerahoeken, belichting en weersomstandigheden. De dataset legt een breed scala aan wegeninfrastructuur vast (bijv. snelwegen met meerdere rijstroken, kruispunten), verkeersdichtheden en weersomstandigheden (bijv. helder, regenachtig, schemering), vanuit meerdere camerahoeken. Deze eigenschappen maken het een ideale benchmark voor het evalueren van de generaliseerbaarheid van anomaliedetectiemodellen.

Preprocessing
Om het model onder omstandigheden zonder toezicht te trainen, gebruikt u alleen normale (niet-ongevallen) verkeersscènes, waarbij elke blootstelling aan afwijkende gebeurtenissen tijdens de training wordt vermeden. Voer videovoorverwerking uit met behulp van OpenCV. Sample frames uniform met 5 fps om voldoende tijdelijke dekking te garanderen en redundantie te verminderen. Wijzig het formaat van frames naar 128 x 128 pixels, om te voldoen aan de invoervereisten van het dual-EDE-netwerk en visuele details in evenwicht te brengen met rekenefficiëntie. Normaliseer pixelwaarden naar het bereik [−1, 1] om de trainingsstabiliteit te verbeteren.

Om de generalisatie te verbeteren en variabiliteit in de echte wereld te simuleren, past u de volgende augmentatietechnieken toe op elk trainingsframe met gerandomiseerde waarschijnlijkheid:

Willekeurig bijsnijden en schalen: Snijd willekeurige subregio's bij en schaal ze terug naar de oorspronkelijke resolutie, waarbij invariantie in objectgrootte, gedeeltelijke zichtbaarheid en ruimtelijke positieverschuivingen worden aangemoedigd, waarbij zoomeffecten en niet-gecentreerde onderwerpen in bewakingsvideo worden nagebootst.

Modulatie van helderheid en contrast: Pas lineaire of op gamma gebaseerde transformaties toe om lichtvariaties na te bootsen, zoals schaduwen, schittering, variaties in zonsopgang/zonsondergang en kunstmatige verlichting. Dit verbetert de veerkracht van het model tegen dagelijkse en seizoensgebonden lichtschommelingen.

Gaussiaanse ruisinjectie en bewegingsonscherpte: Voeg Gaussiaanse ruis toe met verschillende standaarddeviaties om sensorruis en compressieartefacten te simuleren. Simuleer bewegingsonscherpte met behulp van convolutionele kernels die in verschillende richtingen en grootheden zijn georiënteerd om het effect van bewegende objecten of cameratrilling na te bootsen, wat vooral relevant is in snelle verkeersscènes.

Willekeurige occlusie maskering: Pas synthetische occlusies toe door zwarte of grijze rechthoekige vlakken van willekeurige grootte en locaties over het frame te leggen. Deze vergroting simuleert obstakels uit de echte wereld, zoals voetgangers, infrastructuurelementen of passerende voertuigen die het gezichtsveld afsluiten. Het moedigt het model aan om te leren van de context en robuust te blijven voor ontbrekende of vervormde regio's.

Pas deze augmentaties dynamisch toe tijdens de training met behulp van PyTorch-transformatiepijplijnen, zodat elke batch een diverse mix van augmented frames bevat, waardoor blootstelling aan verschillende patronen wordt bevorderd en overfitting wordt verminderd.

Laad verwerkte frames met de DataLoader van PyTorch om batching, shuffling en parallel laden te beheren. Train met batchgroottes tussen 32 en 64, afhankelijk van de GPU-capaciteit. Voor het scoren van deductie en anomalieën verstaat u frames afzonderlijk (batchgrootte = 1) om nauwkeurige detectie op frameniveau mogelijk te maken.

Deze pijplijn voor voorverwerking en uitbreiding verbetert de robuustheid en generalisatie, waardoor het model afwijkend gedrag effectief kan detecteren in diverse en luidruchtige real-world verkeersbewakingsomgevingen.

De voorgestelde methode:
Het voorgestelde EDE-systeem leert bidirectionele mappings tussen beeldverdelingen en latente ruimtes. Twee encoders en twee decoders maken een robuuste functie-extractie en anomaliedifferentiatie mogelijk. De netwerken worden getraind in zowel wederopbouw- als contradictoire fasen. Contrastief leren, regularisatie en gradiëntstraf worden gebruikt om instorting van de modus te voorkomen en de robuustheid van GAN-training te verbeteren.

Het EDE-framework werkt als volgt: Encoder 1 (E1) codeert beeldkenmerken in de latente ruimte. De eerste decoder (D1) reconstrueert beelden van latente vectoren om het reconstructieverlies te minimaliseren. De gereconstrueerde beelden worden vervolgens weer in kaart gebracht in de latente ruimte om inconsistenties vast te leggen. De tweede decoder (D2) genereert synthetische beelden uit de tweede latente ruimte om het model te helpen echte van synthetische gegevens te onderscheiden. Deze bidirectionele mapping detecteert anomalieën op basis van latente ruimteverschillen in plaats van verschillen op pixelniveau.

Fase 1: Opleiding wederopbouw: De auto-encoder is getraind om normale verkeersbeelden te reconstrueren, dus afwijkende invoer produceert aanzienlijke reconstructiefouten. De verliesfunctie houdt rekening met het invoerbeeld, de latente codering en het gereconstrueerde beeld.

Vijandige training: Na de reconstructietraining wordt adversarial learning toegepast. Gereconstrueerde latente vectoren worden door een alternatieve EDE-structuur geleid om synthetische beelden en latente vectoren te produceren. De doelen zijn om de verschillen tussen echte en synthetische afbeeldingen te maximaliseren; latente vectoren wijzigen en reconstrueren om de detectie van anomalieën door Encoder 2 (E2) te verbeteren; en voorkom dat de encoder instort.

Training is ontworpen om convergentie van E1 en E2 naar identieke toewijzingen te voorkomen, wat het discriminerende vermogen zou verminderen.

Contrastief leren: Een verliesfunctie differentieert reële en gereconstrueerde representaties, waarbij een margehyperparameter de scheiding van kenmerken regelt.
Regularisatietechnieken zijn onder meer:

Voortijdig schoolverlaten: Willekeurige deactivering van neuronen om overfitting te voorkomen.
Gewicht verval: Bestraft grote gewichten om het leren van functies te stabiliseren.

Adversarial training stability20 en mode collapse prevention methoden zijn onder meer:
Helling straf: Reguleert het gedrag van discriminerende personen.
Uitbreiding van gegevens: Willekeurig bijsnijden, schalen en instelbare verlichting om verschillende omstandigheden te simuleren.
Geluid injectie: Realistische ruis, bewegingsonscherpte en occlusies toevoegen om generalisatie te verbeteren.
Vroeg stoppen: Stopzetting van de training als het validatieverlies aanzienlijk fluctueert om overfitting te voorkomen.

Deze architecturale verbeteringen, trainingsmethoden en veerkrachtmaatregelen zorgen voor een betrouwbare detectie van verkeersafwijkingen.

Het ongecontroleerde ongevallendetectienetwerk wordt uitsluitend getraind op normale monsters en getest op zowel normale als ongevalsmonsters. Formeel:

Beschouw uit de set van alle normale en ongevalsvideo's een grote trainingsdataset E met alleen normale F-frames (E = {x1, x2}). .., xM } en een kleinere testdataset Ê met zowel normale foto's als ongevalsfoto's (Ê=[( x̂1,y1), (x̂2,y2), (x̂F*,yF*)]),frames, waarbij yi figure-protocol-1[0, 1] de afbeelding van het framelabel is. Voor F figure-protocol-2F*-training moet de trainingsdataset aanzienlijk groter zijn dan de testdataset. Nadat u de variëteit van de dataset (E) hebt geleerd, identificeert u ongevalsframes in Ê als uitschieters tijdens deductie. Het model f berekent een ongevallenscore Acc(x) op basis van de aangeleerde normale gegevensverdeling. Een testbeeld x met een hoge ongevalsscore kan een ongeluk zijn. Beoordelingscriteria zijn gebaseerd op de drempel voor de ongevalsscore (φ) als Acc(x) > φ.

Netwerk architectuur:
Zoals te zien is in figuur 1, bevat het GANomaly-model21 twee encoders, een decoder en een discriminator. Veel onderzoekers hebben deze methode aangepast om latente vectoren te onderscheiden en visuele afwijkingen te detecteren 12,22. De twee encoders en de enkele decoder wijzigen wederzijds het beeld en de latente vector in het model. Deze afwijkende feiten worden aangegeven tijdens de transformatie. De discriminator scheidt de gegenereerde afbeeldingen van het origineel. GANomaly vertrouwt op coderen, decoderen en opnieuw coderen.

figure-protocol-3
Figuur 1: GANomaly-architectuur die de informatiestroom demonstreert. De architectuur bestaat uit een encoder-decoder-encoder-framework dat is geïntegreerd in een generatief adversarial netwerk. De eerste encoder comprimeert het ingevoerde videoframe tot een latente ruimteweergave, die vervolgens door de decoder wordt gereconstrueerd. Een tweede encoder brengt het gereconstrueerde frame terug in de latente ruimte. De discriminator evalueert het verschil tussen de invoer en gereconstrueerde kenmerken om de anomaliescore te berekenen. Pijlen geven de directionele gegevensstroom door het netwerk aan. Afkorting: GAN = generative adversarial network. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2 illustreert de EDE-architectuur met twee encoders en één decoder. De EDE-structuur moet voortdurend parameters veranderen om video-ongelukken te detecteren. We hebben een tweede decoder toegevoegd aan de EDE-structuur en ze de encoders laten delen om het model in Figuur 2 te genereren met twee netwerkconfiguraties. Twee encoders hebben vier convolutionele lagen. We gebruikten LeakyReLU-activeringsfuncties voor alle lagen, behalve de uitvoerlaag, die een tanh-activering gebruikte om de uitvoer tussen -1 en 1 te binden. Batchnormalisatie werd toegepast na meerdere convolutionele lagen. De decoders (Figuur 3 en Figuur 4) zijn vergelijkbaar met de encoders, maar maken gebruik van ConvTranspose en extra batchnormalisatie in plaats van elke laag.

figure-protocol-4
Figuur 2: Voorgestelde EDE-gebaseerde architectuur met informatiestroom. De EDE-architectuur wordt geïllustreerd en toont de stroom van videoframes door twee encoders en een decoder. De eerste encoder (E1) comprimeert het invoerframe tot een latente weergave, die vervolgens wordt gereconstrueerd door de decoder (D1). De gereconstrueerde output wordt door de tweede encoder (E2) geleid om een tweede latente vector te verkrijgen. Discrepanties tussen latente vectoren en reconstructiekwaliteit worden gebruikt voor het detecteren van anomalieën, ondersteund door adversarial en contrastief verlies componenten. Afkorting: EDE = encoder-decoder-encoder. Klik hier om een grotere versie van deze figuur te bekijken.

Details van de netwerkarchitectuur:
Het dual-EDE-model bestaat uit twee encoder-decoder-encoder-pipelines, elk met dezelfde structuur en gezamenlijk geoptimaliseerd tijdens de training.

Encoder-architectuur (E1, E2)

Ingang: 128×128×3 RGB-frame

Laag 1: Conv2D (64 filters, 4×4 kernel, stride 2, padding 1) → LeakyReLU (α = 0,2)

Laag 2: Conv2D (128 filters, 4×4, stride 2, padding 1) → BatchNorm → LeakyReLU

Laag 3: Conv2D (256 filters, 4×4, stride 2, padding 1) → BatchNorm → LeakyReLU

Laag 4: Conv2D (512 filters, 4×4, stride 2, padding 1) → BatchNorm → LeakyReLU

Laag 5: Afvlakken → Dichte naar latente vector (z figure-protocol-5^100)

Decoder architectuur (D1, D2)

Invoer: z figure-protocol-6^100 → Dense → hervormen naar 8×8×512

Laag 1: TransponeerConv2D (256 filters, 4×4, stride 2, padding 1) → BatchNorm → ReLU

Laag 2: TransponeerConv2D (128 filters, 4×4, stride 2, padding 1) → BatchNorm → ReLU

Laag 3: TransponeerConv2D (64 filters, 4×4, stride 2, padding 1) → BatchNorm → ReLU

Laag 4: TransponeerConv2D (3 filters, 4×4, stap 2, opvulling 1) → Tanh

Het gereconstrueerde beeld wordt opnieuw gecodeerd via de tweede encoder om een latente weergave te verkrijgen, en discrepanties tussen de originele en gereconstrueerde latente vectoren worden gebruikt voor het scoren van anomalieën.

Activering en normalisatie
Encoders maken gebruik van LeakyReLU-activering en batchnormalisatie. Decoders gebruiken ReLU-activering, behalve voor de laatste laag, die Tanh toepast om de output te normaliseren naar het bereik [−1, 1].

Verlies Functies
Verlies van beeldreconstructie: ǀǀ x −ǀǀ2
Latent consistentieverlies: ǀǀ z −ǀǀ2

Adversarial loss: Geïntroduceerd in fase II om de divergentie tussen echte en synthetische reconstructies te maximaliseren door het netwerk te dwingen echte latente codes te onderscheiden van die gegenereerd tijdens de reconstructie.

Deze architectuur legt zowel onregelmatigheden in de pixelruimte als in de latente ruimte vast, waardoor subtiele afwijkingen kunnen worden gedetecteerd die wijzen op abnormaal rijgedrag.

Training in twee fasen
Er wordt gebruik gemaakt van een netwerktrainingsmethode in twee fasen. Voor zowel beeld- als latente vectorreconstructie worden twee EDE-structuren getraind. In de tweede fase probeert Encoder 2 Encoder 1 te misleiden om gegevens verkeerd te classificeren als echt of gereconstrueerd.

Initiële opleiding tot wederopbouw
De EDE-structuur is getraind om het invoerbeeld en de latente vector te repliceren. Invoer x wordt gecodeerd in latente vector z door encoder E1. Zowel D1 als D2 decoderen z om afbeeldingen te produceren, x1 en x2. We hebben twee latente vectoren (z1 en z2) verkregen van encoder E2 na het passeren van twee gereconstrueerde afbeeldingen (x1 en x2). Deze fase bevat de volgende trainingsdoelstellingen:

LEDE1 = γ ǀǀ x −x1ǀǀ2+δ ǀǀ z −z1ǀǀ2 (1)
LEDE2 = γ ǀǀ x−x2ǀǀ2+δ ǀǀ z −z2ǀǀ2 (2)

Deze gereconstrueerde beelden worden door encoder E2 geleid om latente vectoren z1 en z2 te verkrijgen. Doelstellingen van de training:
Wegingsfactoren (γ, δ) hebben een cruciale invloed op de impact van verliescomponenten op de objectieve functie.

Ten tweede hebben we twee Encoder-Decoder-Encoder-structuren getraind met behulp van adversarial methoden.
Hier zijn γ en δ de parameters die de bijdragen van reconstructie en latente consistentieverliezen afwegen.

Contradictoire training
Twee EDE-structuren worden vijandig getraind. Leert encoder 2 herkennen uit data. EDE2 moet EDE1 misleiden omdat het het tegenovergestelde is. D1 decodeert z2 vanaf de eerste stap en reconstrueert x1'. Herhaling van x1' naar encoder E2 levert z1' op. De doelstellingen van de stage training zijn als volgt:

min max γ ǀǀ x −x1'ǀǀ +δ ǀǀ z -z1'ǀǀ 2 (3)
EDE2 EDE1

De twee EDE-structuren hebben de volgende verliesfuncties:
LEDE1 = −γ ǀǀ x -x1'ǀǀ 2 −δǀǀ z - z1'ǀǀ 2 (4)
LEDE2 = +γ ǀǀ x - x1'ǀǀ 2+δ ǀǀ z - z1'ǀǀ 2 (5)

De waarden van γ en δ komen overeen met de eerder opgegeven parameters.

figure-protocol-7
Figuur 3: Structuur van de encoder. Het encodernetwerk dat in de voorgestelde EDE-architectuur wordt gebruikt, extraheert spatiotemporele kenmerken uit de ingevoerde videoframes. Het bestaat uit meerdere convolutionele lagen gevolgd door batchnormalisatie en ReLU-activering, waarbij de ruimtelijke dimensies geleidelijk worden verkleind en hiërarchische representaties worden vastgelegd. De uiteindelijke latente vector codeert semantische informatie op hoog niveau die essentieel is voor het detecteren van anomalieën. Afkortingen: ReLU = Rectified Linear Unit, EDE = encoder-decoder-encoder. Klik hier om een grotere versie van deze figuur te bekijken.

Elke EDE biedt twee verliesfuncties voor de voorgestelde structuur. In fase 1 moet EDE1 de x- en z-reconstructieverliezen verminderen. EDE1 moet de fase 2-variantie tussen latente vectoren z en z1' en x en x1' optimaliseren. EDE2 en EDE1 reduceren fase 1 x en z reconstructiefouten. EDE1 moet in fase 2 het verschil tussen z en z1' en x en x1' verkleinen, maar het tegenovergestelde moet gebeuren.

figure-protocol-8
Figuur 4: Structuur van de decoder. De decodercomponent van de voorgestelde EDE-architectuur reconstrueert invoerframes uit latente kenmerken. Het bestaat uit een reeks getransponeerde convolutionele lagen die geleidelijk functietoewijzingen upsamplen naar de oorspronkelijke frameresolutie. De decoder leert normale verkeersscènes nauwkeurig te reconstrueren, waardoor het systeem anomalieën kan identificeren op basis van reconstructiefouten. Afkorting: EDE = encoder-decoder-encoder. Klik hier om een grotere versie van deze figuur te bekijken.

Elk dubbel trainingsdoel van het EDE-model bevat verliesfuncties met gewichten die in de loop van de tijd veranderen:

LEDE1=(γ||xx1||2+δ||zz1||2)(1)(γ||xx1''||2+δ||zz1''||2) (6)
LEDE2=(γ||xx1||2+δ||zz1||2)+(1)(γ||xx1''||2+δ||zz1''||2) (7)

Het aantal trainingsperioden is n.

Algoritme 1 toont de training in twee fasen:
Invoer:
Alle normale afbeeldingen in dataset E = {x1, x2, . . . , xF},
Tijdperken N,
Gewogen parameters γ, δ
Uitvoer:
opgeleide encoder-decoder-encoder 1,
Encoder-Decoder-Encoder 2
E1, E2, D1, D2 ←Initialiseren
Gewichten
nr. ←1
herhalen
voor f = 1 tot F doen
ZF←E1(xF)
         figure-protocol-9←d1 (zf)
         figure-protocol-10←d2 (zf)
         figure-protocol-11←e2(figure-protocol-12)
         figure-protocol-13←e2(figure-protocol-14)
         figure-protocol-15←d1(figure-protocol-16)
         figure-protocol-17←e2(figure-protocol-18)"
LEDE1figure-protocol-19(γ||xffigure-protocol-20||2+δ||zffigure-protocol-21||2) −(1−figure-protocol-22)(γ||xffigure-protocol-23'||2+ δ||zffigure-protocol-24'||2)
LEDE2figure-protocol-25(γ||xffigure-protocol-26||2+δ||zffigure-protocol-27||2) +(1−figure-protocol-28) (γ||xffigure-protocol-29'||2+ δ||zffigure-protocol-30'||2)
E1, E2, D1, D2←Update Gewichten
met LEDE1en LEDE2
einde voor
n ←n + 1
tot n = N

Trainingsfasen en criteria voor het opsporen van afwijkingen
Verdeel de training in twee opeenvolgende fasen:

Fase I - Reconstructie leren:
Beide EDE-pijpleidingen worden uitsluitend getraind op normale verkeersscènes.

Invoerbeelden worden doorgegeven via Encoder 1 → Decoder 1 → Encoder 2 (Afbeelding 5).

Het model minimaliseert verlies van beeldreconstructie en latent consistentieverlies. Deze fase stelt het netwerk in staat om een compacte, consistente latente ruimte te leren voor normaal gedrag.

Fase II - Generatief confrontatie leren:

Latente vectoren die uit decoder 1 zijn gereconstrueerd, worden ingevoerd in decoder 2 en vervolgens opnieuw gecodeerd via encoder 1. Deze cirkelvormige stroom helpt het model inconsistenties in synthetische patronen te detecteren. Een contradictoir verlies wordt toegevoegd om kleine afwijkingen tussen originele en gereconstrueerde representaties te overdrijven. Een discriminator wordt optioneel getraind om echte latente codes te onderscheiden van gereconstrueerde codes, waardoor een scherper onderscheid in de latente ruimte wordt afgedwongen.

Detectie van afwijkingen:
Geef op het moment van deductie een testframe door de pijplijn met dubbele EDE. Bereken drie metriek: pixelgewijze reconstructiefout, latente vectordiscrepantie en adversarial discriminatorscore (indien gebruikt). Bereken een samengestelde anomaliescore als een gewogen som:
figure-protocol-31

Frames met anomaliescores boven een gekalibreerde drempel worden gemarkeerd als mogelijke abnormale gebeurtenissen. Dit mechanisme stelt het model in staat om subtiele afwijkingen in visuele en latente ruimtepatronen te detecteren zonder dat er geannoteerde anomalielabels nodig zijn.

figure-protocol-32
Figuur 5: Architectuur van het vijandige GANomaly-model waarin EDE 1 en EDE 2 worden geïntegreerd. Deze figuur illustreert het ontwerp van het adversarial anomaly detection model, dat twee EDE-structuren integreert: EDE1 voor reconstructie en EDE2 voor latente functie-uitlijning. Het model maakt gebruik van een latente vectorconsistentieverlies en adversarial training via een discriminator om gelijkenis af te dwingen tussen de latente representaties van de invoer en gereconstrueerde frames. Deze architectuur verbetert de detectie van anomalieën door robuuste functie-inbeddingen te leren voor normale verkeerspatronen. Afkortingen: EDE1 = Eerste encoder-decoder-encoderstructuur voor reconstructie; EDE2 = Tweede encoder-decoder-encoderstructuur voor latente functie-uitlijning. Klik hier om een grotere versie van deze figuur te bekijken.

Tijdens de detectie gebruikte ons model de volgende afwijkende scores:

Acc(x̂) = ω1||z−z2||22||z−z1'||2 (8)

Het wijzigen van gewichtsparameters (ω1+ ω2= 1) kan de gevoeligheid veranderen door de verhouding tussen echte positieven en valse positieven aan te passen. In toepassingen in de echte wereld kan het wijzigen van deze twee parameters ongevallen met verschillende gevoeligheden in één experiment detecteren.

Tijdens de training wordt elk invoerframe x door encoder E1 geleid om een latente vector z te genereren. De latente vector wordt vervolgens gereconstrueerd via decoder D1, waardoor beeld x̂1 ontstaat, dat vervolgens door encoder E2 wordt geleid om een gereconstrueerde latente vector z te verkrijgen. Tegelijkertijd wordt z gedecodeerd door Decoder D2 om x̂2 te produceren, die ook opnieuw wordt gecodeerd via E2 om z2 te verkrijgen. Dit bidirectionele proces bewaart zowel informatie op pixel- als op latent niveau voor het detecteren van afwijkingen.

Algoritme voor het testen van modellen:
figure-protocol-33={( x̂1,y 1),( x̂2,y 2),...,( x̂M*,yM*)},
Drempel φ,

Wegingsparameters ω1, ω2
Uitvoer: Voorspellingslabel van testgegevensset
Ere = {y1pre, y2pre, ..., yF*pre}
want i =1tot F* doen
zi ← e1(xi)
x2i ← d2(zi)
Z2I ← E2(x2I)
z1i' ← d1(z2i)
Z1I' ←E 2(Z1I')
Acc(x̂i) ←ω1||zi−z2i||22||zi−z1i'||Arabisch cijfer
ifAcc(x̂i) ≥φ dan
yipre ←1
anders
yipre ←0
Endif
einde

EDE gebruikt de discriminator als een adversarial learning-component om de nauwkeurigheid van anomaliedetectie te vergroten door het vermogen van het model om normale en abnormale gebeurtenissen te onderscheiden te verbeteren. Het verbetert de prestaties als volgt:

Leerdiscriminatie: De discriminator is getraind om onderscheid te maken tussen synthetische en duale EDE-structuurgereconstrueerde representaties. Door dit vijandige proces te optimaliseren, krijgt het model zeer discriminerende latente kenmerken, waardoor de anomaliedetectie van verkeersscènes wordt verbeterd.

Slechte reconstructies verwijderen: Omdat ze zo veel afwijken van verkeerspatronen, veroorzaken anomalieën vaak reconstructieproblemen. De discriminator bestraft onjuist gereconstrueerde frames, waardoor de detectie van normale/abnormale gebeurtenissen in het netwerk wordt verbeterd.

Verbetering van de representatie van kenmerken met adversarial training: Door adversarial learning te integreren, zorgt de discriminator ervoor dat het EDE-netwerk duurzamere en betekenisvollere latente inbeddingen genereert. Dit detecteert zelfs kleine veranderingen zoals abrupt remmen, botsingen en uitwijken van voertuigen, waardoor de detectie van afwijkingen wordt verbeterd.

Valse positieven verwijderen: Traditionele auto-encoders overgeneraliseren en normaliseren afwijkingen, wat resulteert in hoge percentages vals-positieven. De discriminator behoudt de attributen van anomalieën tijdens de reconstructie door latente discrepanties tussen normale en afwijkende frames te identificeren.

Verbetering van de classificatie met een besluitvormingsproces in twee fasen: Normale of abnormale herbouwde frames ontvangen betrouwbaarheidsscores van de discriminator. Verkeerde classificatiefouten en reconstructieverlies worden in deze extra verificatiefase verminderd, waardoor de detectienauwkeurigheid wordt verbeterd.

We gebruikten bewezen ongevaldetectiemethoden om de strategie 23,24,25,26 te testen. Eén klasse in een dataset met meerdere klassen was normaal en alle andere ongevalsklassen werden zorgvuldig onderzocht met behulp van één versus alle benaderingen. Het model werd getraind met alleen normale klasgegevens, terwijl de testset ongevals- en normale gegevens gebruikte. Trainings- en testsets werden op twee manieren verdeeld.

We hebben getraind en getest met respectievelijk 80% en 20% gegevens van normale klasse. De testresultaten van de ongevalsklasse werden willekeurig gekozen. De evaluatie was onbevooroordeeld door gebruik te maken van teststeekproeven van de ongevalsklasse, die 20% van de gegevens van de normaalklasse vertegenwoordigen, om te voorkomen dat het model scheef zou trekken naar de meerderheidsnormaalklasse. Het model kan worden getest aan de hand van gelijke aantallen normale en ongevalsgegevens, die de praktijkomstandigheden vertegenwoordigen. Het test modelgeneralisatie onpartijdig door te trainen met 80% van de normale gegevens en 20% te verbergen. Dit toont ook aan dat er in het echte leven meer normaal is dan ongevallen, waardoor het belangrijk is om het model bloot te stellen aan onregelmatige ongevallengegevens. Door willekeurig ongevalsmonsters te selecteren en het model te testen op alle ongevalssituaties zonder overfitting wordt de robuustheid verhoogd. De 80/20 dataverdeling is gebruikelijk in machine learning. Trainingsgegevens voor betekenisvolle patronen en testgegevens voor prestatie-evaluatie zijn in evenwicht.

De experimenten gebruikten datasets voor training en testen. De splitsing van de normale klas werd gebruikt voor validatie en training. De testgegevens van alle klassen werden getest.

Het snoeien en kwantificeren van modellen vermindert de modelgrootte en -berekening aanzienlijk. Het gereduceerde model heeft dezelfde nauwkeurigheid, maar lagere prestaties omdat het 40% minder parameters bevat. Voor edge-apparaten met een lage verwerkingskracht wordt het gekwantificeerd door het model te kwantificeren. Deze optimalisatie voldoet aan de behoeften op het gebied van real-time verkeersbewaking en terugroepacties.

Lichtgewicht ontwerpen zoals MobileNets en EfficientNet verhogen de real-time gevolgtrekkingen. Vanwege hun computervisieprecisie en minimale berekeningen worden deze architectuurtypen veel gebruikt. Op embedded systemen verminderen dergelijke modellen de frameverwerking met 50%, terwijl de F1-scores voor ongevallendetectie behouden blijven.

Het gebruik van vergelijkbare parameters voor beeldreconstructie en ongevalsdetectie met behulp van multi-task learning zou het ontwerp kunnen vereenvoudigen. Dit verlaagde de trainingstijd en rekenkosten zonder de nauwkeurigheid van het model aan te tasten. Het multi-task leersysteem vereenvoudigde het leren van het model voor de verwerking van verkeersvideogegevens.

Contrastieve en zelfgesuperviseerde adversarial training leverde in minder tijd resultaten op die vergelijkbaar waren met het basismodel voor anomaliedetectie. Verkeersongevallenkenmerken werden verzameld en gegeneraliseerd om de robuustheid van onzichtbare gegevens te verbeteren.

Het voorgestelde algoritme voor het detecteren van verkeersafwijkingen werd getest op Track-4, een van de vijf 2021 AI City Challenge-datasets27. Snelwegen leverden deze gegevens aan de Iowa DOT.

Vergelijkende prestatiebeoordeling:
Om ons model te valideren, hebben we het op de AI City Challenge Track 4-dataset vergeleken met state-of-the-art modellen, waaronder GANomaly, f-AnoGAN, OCGAN en de gesuperviseerde methode van ByteDance. Tabel 2 geeft een overzicht van de resultaten.

ModelF1 UitslagPrecisieHerinnerenAUC
GANomaly0.870.880.860.9
OCGAN0.890.90.870.91
ByteDance (Sup.)0.910.930.890.92
Voorgesteld (Dual-EDE)0.940.950.930.94

Tabel 2: Vergelijking van de methoden. De tabel vergelijkt methoden voor het detecteren van anomalieën op basis van F1-score, precisie, herinnering en nauwkeurigheid. EDE-ontwerpen met en zonder contradictoire training worden vergeleken. Twee EDE plus vijandige training verslaan BADU, ByteDance en WHU in alle categorieën. De gegevens geven aan dat adversarial learning de detectie van anomalieën verhoogt.

Het dual-EDE-model presteert beter dan alle basislijnen, vooral bij het terugroepen - wat wijst op een sterkere gevoeligheid voor zeldzame afwijkende gebeurtenissen.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Om de doeltreffendheid van de voorgestelde detectiemethode voor verkeersafwijkingen te evalueren, hebben we het model geïmplementeerd op een enkele videoclip en visualisaties gegenereerd die het gedrag van het systeem in de loop van de tijd en binnen de functieruimte illustreren. Hoewel verkregen met behulp van een gesimuleerde EDE-pijplijn, weerspiegelen de resultaten nauw de kwalitatieve conclusies die van een daadwerkelijk model zouden worden verwacht.

De t...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie presenteert een op deep learning gebaseerd detectiesysteem voor verkeersafwijkingen dat gebruikmaakt van een EDE-architectuur, op een niet-gesuperviseerde manier getraind om zowel ongevallen met één als met meerdere voertuigen te identificeren in real-world bewakingsvideo's. Door typisch verkeersgedrag te modelleren, detecteert het systeem afwijkingen als waarschijnlijke anomalieën zonder dat er gelabelde anomaliegegevens nodig zijn, waardoor uitdagingen op het gebied van sch...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren geen belangenconflicten.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit onderzoek ontving geen externe financiering. De auteurs willen Amrita School of Computing, Coimbatore, India, bedanken voor het leveren van de benodigde hardware en onschatbare ondersteuning bij het uitvoeren van dit onderzoek.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AI City Challenge Track 4 DatasetAI City Challenge (https://www.aicitychallenge.org)Track 4, 2021 Release
CUDA ToolkitNVIDIA DeveloperVersie 11.3
cuDNN LibraryNVIDIA DeveloperCompatibel met CUDA 11.3
GPU Workstation Cluster (Training)Amrita School of Computing
Local Workstation (Fog Node)Amrita School of Computing
Matplotlibmatplotlib.orgVersie 3.3+
NVIDIA Jetson Nano (Edge Device)NVIDIA945-13450-0000-100
NVIDIA RTX 3060 GPU (Workstation)NVIDIAVariërend per fabrikant
NumPynumpy.orgVersie 1.19+
OpenCVOpenCV.orgVersie 4.5+
Pandaspandas.pydata.orgVersie 1.1+
PythonPython Software FoundationVersie 3.8+
PyTorchPyTorch (https://pytorch.org)Versie 1.10+
Scikit-learnscikit-learn.orgVersie 0.24+
Ubuntu Linux (besturingssysteem)Canonical Ltd.Versie 20.04 LTS

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Gannina, A. R. K., et al. A new approach to road incident detection leveraging live traffic data: An empirical investigation. Procedia Comput Sci. 235, 2288-2296 (2024).
  2. Khaleghi, A., Moin, M. -S. Improved anomaly detection in surveillance videos based on a deep learning method. IEEE. , 73-81 (2018).
  3. Tripathy, A. K., Sarkar, M., Sahoo, J. P., Li, K. C., Chinara, S. Road accident detection and severity determination from CCTV surveillance. Advances in distributed computing and machine learning. Lect Notes Netw Syst. , Springer. Singapore. (2021).
  4. Pang, G., Shen, C., Cao, L., Van den Hengel, A. Deep learning for anomaly detection: A review. ACM Comput. Surv. 54 (1), 1-38 (2021).
  5. Chalapathy, F., Zhang, L., Liu, H., Wang, Y., Zhao, Y. Deep learning for video anomaly detection: A review. arXiv preprint. , (2024).
  6. Gupta, A., Verma, S. Wave-GANomaly: A GAN-based anomaly detector using multi-feature fusion and wavelet transform. PLoS ONE. 18 (6), 1-18 (2023).
  7. Roy, D., Uddin, M. S., Bappy, S. M. Deep learning-based anomaly detection in video surveillance: A comprehensive review. Sensors. 23 (11), 5024-5047 (2023).
  8. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., et al. Proc 27th Int Conf Neural Inf Process Syst, Montreal, QC, , (2014).
  9. Alzahrani, A. B., et al. Unsupervised video anomaly detection in UAVs: A new approach. Front Sustain. Cities. 5, 1-10 (2023).
  10. Chalapathy, R., Chawla, S. Deep learning for anomaly detection: A survey. , Cornell University. (2019).
  11. Chen, H., Lin, J., Fang, M. Variational autoencoder for anomaly detection: A comparative study. arXiv preprint. , (2024).
  12. Schlegl, T., Seeböck, P., Waldstein, S. M., Langs, G., Schmidt-Erfurth, U. f-AnoGAN: Fast unsupervised anomaly detection with generative adversarial networks. Med Image Anal. 54, 30-44 (2019).
  13. Akcay, S., Atapour-Abarghouei, A., Breckon, T. P. Ganomaly: Semi-supervised anomaly detection via adversarial training. Comput Vis – ACCV 2018, Lect Notes Comput Sci. Jawahar, C., Li, H., Mori, G., Schindler, K. 11363, Springer. Cham. (2019).
  14. Ocgan: One-class novelty detection using GANs with constrained latent representations. Perera, P., Nallapati, R., Xiang, B. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, Long Beach, CA, , 2898-2906 (2019).
  15. Nayak, R., Mishra, S. K., Dalai, A. K., Pati, U. C., Das, S. K. A panoramic review on cutting-edge methods for video anomaly localization. IEEE Access. 12, 186380-186412 (2024).
  16. He, Z., Xu, X., Deng, S. Discovering cluster-based local outliers. Pattern Recognit Lett. 24, 1641-1650 (2003).
  17. Tax, D. M. J., Duin, R. P. W. Support vector data description. Mach Learn. 54, 45-66 (2004).
  18. Anomaly detection with robust deep autoencoders. Zhou, C., Paffenroth, R. C. Proc. 23rd ACM SIGKDD Int Conf Knowl Discov Data Min, Halifax, NS, , 665-674 (2017).
  19. Hojjati, H., Ho, T. K. K., Armanfard, N. Self-supervised anomaly detection in computer vision and beyond: A survey and outlook. Neural Netw. 172, 106106(2024).
  20. Donahue, J., Krähenbühl, P., Darrell, T. Adversarial feature learning. , Cornell University. (2016).
  21. El-Sayed, H. A., El-Horbaty, A. A cutting-edge video anomaly detection method using image quality assessment and attention mechanisms. Alex Eng J. 72, 689-701 (2024).
  22. Kiran, B. R., Thomas, D. M., Parakkal, R. An overview of deep learning-based methods for unsupervised and semi-supervised anomaly detection in videos. J Imaging. 4, 36(2018).
  23. Chow, J. K., Su, Z., Wu, J., Tan, P., Mao, X., Wang, Y. Anomaly detection of defects on concrete structures with the convolutional autoencoder. Autom Constr. 45, 101105(2020).
  24. Siegel, B. Industrial anomaly detection: A comparison of unsupervised neural network architectures. IEEE Sens Lett. 4 (8), 1-4 (2020).
  25. Uchida, M., Ishida, S., Tabaru, T., Miyamoto, H. Anomaly detection of rotary vacuum pump using thin AE sensor and reconstruction error of autoencoder. SICE Trans. 54 (7), 599-605 (2018).
  26. Khan, M. A., Ahmad, T., Siddiqui, N. A. A novel unsupervised video anomaly detection framework based on spatiotemporal features. PLoS ONE. 18 (4), 1-20 (2023).
  27. Iowa DOT anomaly dataset. , https://www.aicitychallenge.org/2021-data-and-evaluation (2021).
  28. Lee, K., Jung, D. Unsupervised video anomaly detection based on similarity with text descriptions. Sensors. 23 (14), 6256(2023).
  29. Kingma, D. P., Welling, M. Auto-encoding variational bayes. arXiv preprint. , (2013).
  30. Masci, J., Meier, U., Cireşan, D., Schmidhuber, J. Stacked convolutional auto-encoders for hierarchical feature extraction. Int Conf Artif Neural Netw. Honkela, T., Duch, W., Girolami, M., Kaski, S. , Springer. Berlin. 52-59 (2011).
  31. Fan, J., Zhang, Q., Zhu, J., Zhang, M., Yang, Z., Cao, H. Robust deep auto-encoding Gaussian process regression for unsupervised anomaly detection. Neurocomputing. 376, 180-190 (2020).
  32. Shvetsova, N., Bakker, B., Fedulova, I., Schulz, H., Dylov, D. V. Anomaly detection in medical imaging with deep perceptual autoencoders. IEEE Access. 9, 118571-118583 (2021).
  33. Unsupervised anomaly detection with generative adversarial networks to guide marker discovery. Schlegl, T., Seeböck, P., Waldstein, S. M., Schmidt-Erfurth, U., Langs, G. Int Conf Inf Process Med Imaging, , Springer. Cham. 146-157 (2017).
  34. Tuluptceva, N., Bakker, B., Fedulova, I., Konushin, A. Perceptual image anomaly detection. arXiv preprint. , (2019).
  35. Chen, C., Yuan, W., Xie, Y., Qu, Y., Tao, Y., Song, H., et al. Novelty detection via non-adversarial generative network. arXiv preprint. , (2020).
  36. Salehi, M., Eftekhar, A., Sadjadi, N., Rohban, M. H., Rabiee, H. R. Puzzle-AE: Novelty detection in images through solving puzzles. arXiv preprint. , (2020).
  37. Support vector method for novelty detection. Schölkopf, B., Williamson, R. C., Smola, A. J., Shawe-Taylor, J., Platt, J. Proc 12th Int Conf Neural Inf Process, Denver, CO, , 582-588 (1999).
  38. Marvasti-Zadeh, S. M., Cheng, L., Ghanei-Yakhdan, H., Kasaei, S. Deep learning for visual tracking: A comprehensive survey. IEEE Trans Intell Transp Syst. , 1-26 (2021).
  39. Van den Oord, A., et al. Conditional image generation with PixelCNN decoders. Adv Neural Inf Process Syst. 29, Barcelona. (2016).
  40. Deep one-class classification. Proc 35th Int Conf Mach Learn. PMLR. Ruff, L., et al. , PMLR. Stockholm. 4393-4402 (2018).
  41. Pidhorskyi, S., Almohsen, R., Doretto, G. Generative probabilistic novelty detection with adversarial autoencoders. Adv Neural Inf Process Syst. 31, Montreal, QC. (2018).
  42. The 5th AI city challenge. Naphade, M., et al. IEEE Conf Comput Vis Pattern Recognit Work, , (2021).
  43. Good practices and a strong baseline for traffic anomaly detection. Zhao, Y., Wu, W., He, Y., Li, Y., Tan, X., Chen, S. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 3993-4001 (2021).
  44. Box-level tube tracking and refinement for vehicles anomaly detection. Wu, J., Wang, X., Xiao, X., Wang, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4112-4118 (2021).
  45. Dual-modality vehicle anomaly detection via bilateral trajectory tracing. Chen, J., et al. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4016-4025 (2021).
  46. An efficient approach for anomaly detection in traffic videos. Doshi, K., Yilmaz, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4236-4244 (2021).
  47. A vision-based system for traffic anomaly detection using deep learning and decision trees. Aboah, A. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4207-4212 (2021).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Traffic Accident DetectionSurveillance VideosUnsupervised Anomaly DetectionDual Encoder DecoderAdversarial TrainingDeep Learning ArchitectureReconstruction LossGenerative Adversarial MechanismTraffic Behavior ModelingEmergency Response

Related Articles