$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Sistema
Apparecchio
Abbiamo implementato il sistema di rilevamento delle anomalie del traffico proposto all'interno di un framework di calcolo gerarchico e distribuito, sfruttando l'ambiente Intel Tiber Cloud. Questa architettura comprende tre livelli: edge, fog e cloud, per garantire inferenza a bassa latenza, training scalabile e allocazione efficiente delle risorse tra i nodi di calcolo.
Livello perimetrale: il rilevamento delle anomalie in tempo reale viene condotto all'edge utilizzando dispositivi integrati leggeri e compatibili con GPU (ad esempio, NVIDIA Jetson Nano o piattaforme equivalenti basate su Intel con GPU integrate). Queste unità sono state collocate insieme alle telecamere di sorveglianza ed hanno eseguito l'inferenza fotogramma per fotogramma con una latenza minima, consentendo un monitoraggio del traffico decentralizzato e reattivo.
Fog Tier: le attività più impegnative in termini di calcolo, tra cui l'inferenza batch e il perfezionamento del modello in tempo reale, sono state gestite da nodi fog di cui è stato eseguito il provisioning come macchine virtuali dedicate o istanze bare metal all'interno di Intel Tiber Cloud. Ogni nodo fog era configurato con un processore Intel Xeon con almeno 16 GB di RAM e aveva accesso all'accelerazione GPU integrata o discreta di Intel. Questo livello intermedio consentiva operazioni ad alta velocità di trasmissione vicino all'origine dati, mantenendo l'autonomia dai server centrali.
Livello cloud: per la formazione e l'archiviazione su larga scala, il livello cloud utilizza cluster di elaborazione scalabili offerti tramite i servizi ottimizzati per l'intelligenza artificiale di Intel Tiber. Le istanze dotate di acceleratori Intel Habana Gaudi o processori scalabili Intel Xeon vengono impiegate per l'addestramento di reti neurali profonde su set di dati video estesi, supportando il controllo delle versioni dei modelli, lo storage a lungo termine e l'orchestrazione a livello di sistema.
L'intero stack software funzionava in un ambiente Python 3.8+ utilizzando librerie ottimizzate per Intel per un calcolo accelerato. I framework principali includono PyTorch (con l'estensione Intel per PyTorch), OpenCV per la pre-elaborazione di immagini e video e Scikit-learn per la valutazione. L'accelerazione GPU è abilitata tramite gli appositi toolkit oneAPI e le ottimizzazioni DAAL.
Al momento della distribuzione, abbiamo clonato il repository contenente l'architettura dual-EDE e inizializzato i componenti del modello: due codificatori (E1, E2) e due decodificatori (D1, D2). Ha impiegato il metodo .to(device) per trasferire dinamicamente i componenti all'unità di elaborazione ottimale (CPU, GPU o acceleratore Gaudì) a seconda della disponibilità di risorse locali.
Abbiamo dichiarato i parametri di addestramento e valutazione, tra cui il numero di epoche, la velocità di apprendimento, i coefficienti di bilanciamento delle perdite (γ, δ) e le soglie di sensibilità alle anomalie (ω1, ω2), in uno script di configurazione. Per l'addestramento, abbiamo seguito un protocollo in due fasi: (1) ricostruzione standard dell'autoencoder per l'apprendimento del normale comportamento del traffico e (2) ricostruzione latente avversaria per amplificare le anomalie utilizzando interazioni cross-EDE.
Questa architettura di sistema modulare e nativa per il cloud ha consentito il rilevamento delle anomalie in tempo reale, la scalabilità dei modelli e l'implementazione affidabile in ambienti di trasporto intelligenti del mondo reale tramite Intel Tiber Cloud.
Dataset
Per l'addestramento e la valutazione del sistema di rilevamento delle anomalie proposto, abbiamo utilizzato il set di dati fornito dalla NVIDIA AI City Challenge 2021, Track 4 (Traffic Anomaly). Il set di dati comprende 100 video di formazione e 150 video di test, ciascuno della durata media di 15 minuti, registrati a 30 fps e risoluzione di 410 p. Ogni video presenta un livello di difficoltà distinto a causa delle variazioni nei tipi di strada, negli angoli di ripresa, nell'illuminazione e nelle condizioni meteorologiche. Il set di dati acquisisce un'ampia gamma di infrastrutture stradali (ad esempio, autostrade a più corsie, incroci), densità di traffico e condizioni meteorologiche (ad esempio, sereno, piovoso, crepuscolo), da più angolazioni della telecamera. Questi attributi lo rendono un punto di riferimento ideale per valutare la generalizzabilità dei modelli di rilevamento delle anomalie.
Preelaborazione
Per addestrare il modello in condizioni non supervisionate, utilizzare solo scene di traffico normali (non incidenti), evitando qualsiasi esposizione a eventi anomali durante l'addestramento. Esegui la pre-elaborazione video utilizzando OpenCV. Campiona i fotogrammi in modo uniforme a 5 fps per garantire una copertura temporale sufficiente riducendo la ridondanza. Ridimensiona i fotogrammi a 128 x 128 pixel, soddisfacendo i requisiti di input della rete dual-EDE e bilanciando i dettagli visivi con l'efficienza computazionale. Normalizza i valori dei pixel nell'intervallo [-1, 1] per migliorare la stabilità dell'allenamento.
Per migliorare la generalizzazione e simulare la variabilità del mondo reale, applicare le seguenti tecniche di aumento a ciascun frame di training con probabilità randomizzata:
Ritaglio e ridimensionamento casuali: Ritaglia sottoregioni casuali e ridimensionale alla risoluzione originale, incoraggiando l'invarianza delle dimensioni dell'oggetto, la visibilità parziale e gli spostamenti di posizione spaziale, imitando gli effetti di zoom e i soggetti decentrati nei video di sorveglianza.
Modulazione della luminosità e del contrasto: Applicate trasformazioni lineari o basate sulla gamma per simulare le variazioni di illuminazione, ad esempio ombre, riflessi, variazioni di alba/tramonto e illuminazione artificiale. Ciò migliora la resilienza del modello alle fluttuazioni dell'illuminazione diurna e stagionale.
Iniezione di rumore gaussiano e motion blur: Aggiungi il rumore gaussiano con deviazioni standard variabili per simulare il rumore del sensore e gli artefatti di compressione. Simula il motion blur utilizzando kernel convoluzionali orientati in diverse direzioni e grandezze per emulare l'effetto degli oggetti in movimento o delle vibrazioni della telecamera, che è particolarmente rilevante nelle scene di traffico frenetiche.
Mascheramento dell'occlusione casuale: Applicare occlusioni sintetiche sovrapponendo macchie rettangolari nere o grigie di dimensioni e posizioni casuali sull'inquadratura. Questo aumento simula gli ostacoli del mondo reale come pedoni, elementi infrastrutturali o veicoli in transito che occludono il campo visivo. Incoraggia il modello ad apprendere dal contesto e a rimanere robusto rispetto alle regioni mancanti o distorte.
Applica questi incrementi in modo dinamico durante l'addestramento utilizzando le pipeline di trasformazione PyTorch, assicurandoti che ogni batch contenga un mix diversificato di frame aumentati, promuovendo l'esposizione a modelli diversi e riducendo l'overfitting.
Carica i frame elaborati con DataLoader di PyTorch per gestire l'invio in batch, lo shuffling e il caricamento parallelo. Esegui il training con dimensioni batch comprese tra 32 e 64, a seconda della capacità della GPU. Per l'inferenza e il punteggio delle anomalie, elabora i frame singolarmente (dimensione batch = 1) per consentire un rilevamento preciso a livello di frame.
Questa pipeline di pre-elaborazione e aumento migliora la robustezza e la generalizzazione, consentendo al modello di rilevare efficacemente comportamenti anomali in ambienti di monitoraggio del traffico del mondo reale diversi e rumorosi.
Il metodo proposto:
Il sistema EDE proposto apprende le mappature bidirezionali tra le distribuzioni delle immagini e gli spazi latenti. Due encoder e due decoder consentono un'efficace estrazione delle caratteristiche e la differenziazione delle anomalie. Le reti sono formate sia nella fase di ricostruzione che in quella contraddittoria. L'apprendimento contrastivo, la regolarizzazione e la penalità del gradiente vengono utilizzati per prevenire il collasso della modalità e migliorare la robustezza dell'addestramento GAN.
Il framework EDE funziona come segue: l'encoder 1 (E1) codifica le caratteristiche dell'immagine nello spazio latente. Il primo decodificatore (D1) ricostruisce le immagini da vettori latenti per ridurre al minimo la perdita di ricostruzione. Le immagini ricostruite vengono quindi mappate nello spazio latente per catturare le incongruenze. Il secondo decodificatore (D2) genera immagini sintetiche dal secondo spazio latente per aiutare il modello a distinguere i dati reali da quelli sintetici. Questa mappatura bidirezionale rileva le anomalie in base alle discrepanze spaziali latenti piuttosto che alle differenze a livello di pixel.
Fase 1: Formazione sulla ricostruzione: L'autoencoder è addestrato a ricostruire le normali immagini del traffico, quindi input anomali producono errori di ricostruzione sostanziali. La funzione di perdita considera l'immagine di input, la sua codifica latente e l'immagine ricostruita.
Addestramento contraddittorio: Dopo la formazione sulla ricostruzione, viene applicato l'apprendimento contraddittorio. I vettori latenti ricostruiti vengono fatti passare attraverso una struttura EDE alternativa per produrre immagini sintetiche e vettori latenti. Gli obiettivi sono massimizzare le differenze tra immagini reali e sintetiche; alterare e ricostruire i vettori latenti per migliorare il rilevamento delle anomalie da parte dell'Encoder 2 (E2); e prevenire il collasso dell'encoder.
L'addestramento è progettato per evitare la convergenza di E1 ed E2 in mapping identici, che ridurrebbe la capacità discriminante.
Apprendimento contrastivo: Una funzione di perdita differenzia le rappresentazioni reali e ricostruite, con un iperparametro di margine che controlla la separazione delle caratteristiche.
Le tecniche di regolarizzazione includono:
Abbandono degli studi: Disattivazione casuale dei neuroni per prevenire l'overfitting.
Decadimento del peso: Penalizza i pesi elevati per stabilizzare l'apprendimento delle funzionalità.
I metodi di prevenzione della stabilità20 e del collasso in modalità dell'allenamento avversario includono:
Penalità gradiente: Regola il comportamento discriminatorio.
Aumento dei dati: Ritaglio casuale, ridimensionamento e illuminazione regolabile per simulare varie condizioni.
Iniezione di rumore: Aggiunta di disturbo realistico, sfocatura del movimento e occlusioni per migliorare la generalizzazione.
Arresto anticipato: Interruzione dell'addestramento se la perdita di convalida fluttua in modo significativo per evitare l'overfitting.
Questi miglioramenti dell'architettura, metodi di formazione e misure di resilienza garantiscono un rilevamento affidabile delle anomalie del traffico.
La rete di rilevamento degli incidenti non presidiata viene addestrata esclusivamente su campioni normali e testata sia su campioni normali che su campioni di incidenti. Formalmente:
Dall'insieme di tutti i video normali e sugli incidenti, si consideri un set di dati di addestramento di grandi dimensioni E con solo F fotogrammi normali (E = {x1, x2}). .., xM } e un set di dati di test più piccolo Ê contenente sia fotografie normali che di incidenti (Ê=[( x̂1,y1), (x̂2,y2), (x̂F*,yF*)]), fotogrammi, dove yi
[0, 1] è l'immagine dell'etichetta del fotogramma. Per l'addestramento F
F*, il set di dati di addestramento deve essere significativamente più grande del set di dati di test. Dopo aver appreso la varietà del set di dati (E), identificare i frame di incidenti in Ê come valori anomali durante l'inferenza. Il modello f calcola un punteggio di incidente Acc(x) in base alla distribuzione normale dei dati appresa. Un'immagine di prova x con un punteggio di incidente elevato può essere un incidente. I criteri di giudizio si basano sulla soglia del punteggio di infortunio (φ) se Acc(x) > φ.
Architettura di rete:
Come mostrato nella Figura 1, il modello21 di GANomaly contiene due codificatori, un decodificatore e un discriminatore. Molti ricercatori hanno adattato questo metodo per distinguere i vettori latenti e rilevare anomalie visive12,22. I due encoder e il singolo decoder modificano reciprocamente l'immagine e il vettore latente nel modello. Questi fatti aberranti sono indicati durante la trasformazione. Il discriminatore divide le immagini generate dall'originale. GANomaly si basa sulla codifica, la decodifica e la ricodifica.

Figura 1: Architettura GANomaly che dimostra il flusso di informazioni. L'architettura è costituita da un framework encoder-decoder-encoder integrato all'interno di una rete generativa avversaria. Il primo codificatore comprime il fotogramma video di input in una rappresentazione dello spazio latente, che viene poi ricostruita dal decodificatore. Un secondo codificatore mappa il fotogramma ricostruito nello spazio latente. Il discriminatore valuta la differenza tra l'input e le funzionalità ricostruite per calcolare il punteggio di anomalia. Le frecce indicano il flusso direzionale di dati attraverso la rete. Abbreviazione: GAN = generative adversarial network. Clicca qui per visualizzare una versione più grande di questa figura.
Nella Figura 2 viene illustrata l'architettura EDE con due codificatori e un decodificatore. La struttura EDE deve cambiare costantemente i parametri per rilevare gli incidenti video. Abbiamo aggiunto un secondo decodificatore alla struttura EDE e abbiamo permesso loro di condividere gli encoder per generare il modello nella Figura 2 con due configurazioni di rete. Due encoder hanno quattro strati convoluzionali. Abbiamo utilizzato le funzioni di attivazione LeakyReLU per tutti i livelli tranne il livello di output, che utilizzava un'attivazione tanh per limitare le uscite tra -1 e 1. La normalizzazione batch è stata applicata dopo più strati convoluzionali. I decodificatori (Figura 3 e Figura 4) sono simili ai codificatori, ma utilizzano ConvTranspose e la normalizzazione batch aggiuntiva invece di ogni livello.

Figura 2: Proposta di architettura basata su EDE con flusso di informazioni. Viene illustrata l'architettura EDE, che mostra il flusso di fotogrammi video attraverso due codificatori e un decoder. Il primo encoder (E1) comprime il frame di input in una rappresentazione latente, che viene poi ricostruita dal decoder (D1). L'output ricostruito viene fatto passare attraverso il secondo encoder (E2) per ottenere un secondo vettore latente. Le discrepanze tra i vettori latenti e la qualità della ricostruzione vengono utilizzate per il rilevamento delle anomalie, supportate da componenti di perdita avversaria e contrastiva. Abbreviazione: EDE = codificatore-decodificatore-codificatore. Clicca qui per visualizzare una versione più grande di questa figura.
Dettagli sull'architettura di rete:
Il modello dual-EDE è costituito da due pipeline encoder-decoder-encoder, ciascuna con la stessa struttura e ottimizzate congiuntamente durante l'addestramento.
Architettura del codificatore (E1, E2)
Ingresso: 128×128×3 cornice RGB
Livello 1: Conv2D (64 filtri, kernel 4×4, stride 2, padding 1) → LeakyReLU (α = 0,2)
Livello 2: Conv2D (128 filtri, 4×4, passo 2, imbottitura 1) → BatchNorm → LeakyReLU
Livello 3: Conv2D (256 filtri, 4×4, passo 2, imbottitura 1) → BatchNorm → LeakyReLU
Livello 4: Conv2D (512 filtri, 4×4, stride 2, padding 1) → BatchNorm → LeakyReLU
Livello 5: Appiattisci → Vettore da denso a latente (z
^100)
Architettura del decodificatore (D1, D2)
Input: z
^100 → Rimodellamento → denso a 8×8×512
Livello 1: TransposedConv2D (256 filtri, 4×4, stride 2, padding 1) → BatchNorm → ReLU
Livello 2: TransposedConv2D (128 filtri, 4×4, stride 2, padding 1) → BatchNorm → ReLU
Livello 3: TransposedConv2D (64 filtri, 4×4, stride 2, padding 1) → BatchNorm → ReLU
Livello 4: TransposedConv2D (3 filtri, 4×4, passo 2, imbottitura 1) → Tanh
L'immagine ricostruita viene ricodificata attraverso il secondo codificatore per ottenere una rappresentazione latente e le discrepanze tra i vettori latenti originali e ricostruiti vengono utilizzate per il punteggio delle anomalie.
Attivazione e normalizzazione
I codificatori utilizzano l'attivazione LeakyReLU e la normalizzazione batch. I decoder utilizzano l'attivazione ReLU, ad eccezione del livello finale, che applica Tanh per normalizzare gli output nell'intervallo [-1, 1].
Perdita Funzioni
Perdita di ricostruzione dell'immagine: ǀǀ x −ǀǀ2
Perdita di consistenza latente: ǀǀ z −ǀǀ2
Perdita avversaria: Introdotta nella Fase II per massimizzare la divergenza tra ricostruzioni reali e sintetiche costringendo la rete a distinguere i codici latenti reali da quelli generati durante la ricostruzione.
Questa architettura acquisisce sia le irregolarità dello spazio dei pixel che quelle dello spazio latente, consentendo il rilevamento di sottili deviazioni indicative di un comportamento di guida anomalo.
Formazione in due fasi
Viene utilizzato un metodo di formazione in rete in due fasi. Sia per la ricostruzione dell'immagine che per quella del vettore latente, vengono addestrate due strutture EDE. Nella seconda fase, l'Encoder 2 tenta di ingannare l'Encoder 1 per classificare erroneamente i dati come reali o ricostruiti.
Formazione iniziale sulla ricostruzione
La struttura EDE viene addestrata per replicare l'immagine di input e il vettore latente. L'input x viene codificato nel vettore latente z dall'encoder E1. Sia D1 che D2 decodificano z per produrre immagini, x1 e x2. Abbiamo ottenuto due vettori latenti (z1 e z2) dall'encoder E2 dopo aver passato due immagini ricostruite (x1 e x2). Questa fase contiene i seguenti obiettivi formativi:
LEDE1 = γ ǀǀ x −x1ǀǀ2+δ ǀǀ z −z1ǀǀ2 (1)
LEDE2 = γ ǀǀ x−x2ǀǀ2+δ ǀǀ z −z2ǀǀ2 (2)
Queste immagini ricostruite vengono passate attraverso l'encoder E2 per ottenere i vettori latenti z1 e z2. Obiettivi formativi:
I fattori di ponderazione (γ, δ) influenzano in modo cruciale l'impatto delle componenti di perdita sulla funzione obiettivo.
In secondo luogo, abbiamo addestrato due strutture Encoder-Decoder-Encoder utilizzando metodi contraddittori.
Qui, γ e δ sono i parametri che pesano i contributi della ricostruzione e le perdite di consistenza latente.
Addestramento contraddittorio
Due strutture EDE vengono addestrate in modo contraddittorio. Impara a riconoscere l'encoder 2 dai dati. EDE2 deve ingannare EDE1 perché è l'opposto. D1 decodifica z2 dal primo passo e ricostruisce x1'. Ripetendo x1' all'encoder E2 si ottiene z1'. Gli obiettivi formativi stage sono i seguenti:
min max γ ǀǀ x −x1'ǀǀ +δ ǀǀ z -z1'ǀǀ 2 (3)
EDE2 EDE1
Le due strutture EDE hanno queste funzioni di perdita:
LEDE1 = −γ ǀǀ x -x1'ǀǀ 2 −δǀǀ z - z1'ǀǀ 2 (4)
LEDE2 = +γ ǀǀ x - x1'ǀǀ 2+δ ǀǀ z - z1'ǀǀ 2 (5)
I valori di γ e δ corrispondono ai parametri specificati in precedenza.

Figura 3: Struttura dell'encoder. La rete di codifica utilizzata nell'architettura EDE proposta estrae le caratteristiche spaziotemporali dai fotogrammi video di input. È costituito da più livelli convoluzionali seguiti dalla normalizzazione batch e dall'attivazione di ReLU, riducendo progressivamente le dimensioni spaziali e catturando rappresentazioni gerarchiche. Il vettore latente finale codifica informazioni semantiche di alto livello essenziali per il rilevamento delle anomalie. Abbreviazioni: ReLU = Unità Lineare Rettificata, EDE = encoder-decoder-encoder. Clicca qui per visualizzare una versione più grande di questa figura.
Ogni EDE fornisce due funzioni di perdita per la struttura proposta. Nella Fase 1, EDE1 deve ridurre le perdite di ricostruzione x e z. EDE1 deve ottimizzare la varianza di fase 2 tra i vettori latenti z e z1' e x e x1'. EDE2 e EDE1 riducono gli errori di ricostruzione x e z della fase 1. EDE1 deve diminuire la differenza tra z e z1' e x e x1' nella fase 2, ma deve accadere il contrario.

Figura 4: Struttura del decoder. Il componente decodificatore dell'architettura EDE proposta ricostruisce i frame di input dalle caratteristiche latenti. È costituito da una serie di livelli convoluzionali trasposti che sovracampionano progressivamente le mappe delle caratteristiche alla risoluzione originale del fotogramma. Il decoder impara a ricostruire con precisione le normali scene di traffico, consentendo al sistema di identificare le anomalie in base agli errori di ricostruzione. Abbreviazione: EDE = codificatore-decodificatore-codificatore. Clicca qui per visualizzare una versione più grande di questa figura.
Ogni obiettivo di allenamento duale del modello EDE include funzioni di perdita con pesi che cambiano nel tempo:
LEDE1=(γ||x−x1||2+δ||z−z1||2)−(1−)(γ||x−x1''||2+δ||z−z1''||2) (6)
LEDE2=(γ||x−x1||2+δ||z−z1||2)+(1−)(γ||x−x1''||2+δ||z−z1''||2) (7)
Il conteggio dei periodi di formazione è n.
L'algoritmo 1 mostra l'addestramento in due fasi:
Immissione:
Tutte le immagini normali nel set di dati E = {x1, x2, . . . , xF},
epoche n,
Parametri ponderati γ, δ
Prodotto:
Addestrato Encoder-Decoder-Encoder 1,
Codificatore-Decoder-Encoder 2
e1, e2, d1, d2 ←inizializzazione
Pesi
n ←1
ripetere
per f = 1 a F do
zf←e1(xf)
←d1(zf)
←d2(zf)
←e2(
)
←e2(
)
←d1(
)
←e2(
)'
LEDE1←
(γ||xf−
||2+δ||zf−
||2) −(1−
)(γ||xf−
'||2+ δ||zf−
'||2)
LEDE2←
(γ||xf−
||2+δ||zf−
||2) +(1−
) (γ||xf−
'||2+ δ||zf−
'||2)
Pesi E1,E 2, D1, D2←Aggiorna
utilizzando LEDE1e LEDE2
fine per
n ←n + 1
fino a n = N
Fasi di addestramento e criteri di rilevamento delle anomalie
Dividi la formazione in due fasi sequenziali:
Fase I - Apprendimento della Ricostruzione:
Entrambe le condutture EDE sono addestrate esclusivamente su normali scene di traffico.
Le immagini di input vengono passate attraverso l'encoder 1 → il decoder 1 → l'encoder 2 (Figura 5).
Il modello riduce al minimo la perdita di ricostruzione dell'immagine e la perdita di coerenza latente. Questa fase consente alla rete di apprendere uno spazio latente compatto e coerente per il comportamento normale.
Fase II - Apprendimento del Confronto Generativo:
I vettori latenti ricostruiti dal decodificatore 1 vengono immessi nel decodificatore 2 e quindi ricodificati tramite l'encoder 1. Questo flusso circolare aiuta il modello a rilevare le incongruenze nei modelli sintetici. Viene aggiunta una perdita contraddittoria per esagerare piccole deviazioni tra le rappresentazioni originali e quelle ricostruite. Un discriminatore è opzionalmente addestrato a differenziare i codici latenti reali da quelli ricostruiti, rafforzando una distinzione più netta nello spazio latente.
Rilevamento anomalie:
Al momento dell'inferenza, passare un frame di test attraverso la pipeline a doppia EDE. Calcola tre metriche: errore di ricostruzione in pixel, discrepanza vettoriale latente e punteggio del discriminatore avversario (se usato). Calcolare un punteggio di anomalia composito come somma ponderata:

I frame con punteggi di anomalia superiori a una soglia calibrata vengono contrassegnati come potenziali eventi anomali. Questo meccanismo consente al modello di rilevare deviazioni sottili nei modelli di spazio visivo e latente senza richiedere etichette di anomalie annotate.

Figura 5: Architettura del modello GANomaly avversario che integra EDE 1 e EDE 2. Questa figura illustra la progettazione del modello di rilevamento delle anomalie avversarie, che integra due strutture EDE: EDE1 per la ricostruzione e EDE2 per l'allineamento delle caratteristiche latenti. Il modello impiega una perdita di coerenza vettoriale latente e l'addestramento contraddittorio tramite un discriminatore per rafforzare la somiglianza tra le rappresentazioni latenti dell'input e i frame ricostruiti. Questa architettura migliora il rilevamento delle anomalie grazie all'apprendimento di incorporamenti di funzionalità affidabili per i normali modelli di traffico. Abbreviazioni: EDE1 = Prima struttura encoder-decoder-encoder per la ricostruzione; EDE2 = Seconda struttura encoder-decoder-encoder per l'allineamento delle caratteristiche latenti. Clicca qui per visualizzare una versione più grande di questa figura.
Durante il rilevamento, il nostro modello ha utilizzato questi punteggi anomali:
Acc(x̂) = ω1||z−z2||2+ω2||z−z1'||2 (8)
La modifica dei parametri di peso (ω1+ ω2= 1) può modificare la sensibilità regolando il rapporto tra veri positivi e falsi positivi. Nelle applicazioni del mondo reale, la modifica di questi due parametri può rilevare incidenti con sensibilità diverse in un esperimento.
Durante l'addestramento, ogni frame di input x viene passato attraverso l'encoder E1 per generare un vettore z latente. Il vettore latente viene quindi ricostruito tramite il decodificatore D1, producendo l'immagine x̂1, che viene successivamente passata attraverso l'encoder E2 per ottenere un vettore latente ricostruito z. In parallelo, z viene decodificato dal decodificatore D2 per produrre x̂2, che viene anche ricodificato tramite E2 per produrre z2. Questo processo bidirezionale conserva le informazioni a livello di pixel e latente per il rilevamento delle anomalie.
Algoritmo di test del modello:
={( x̂1,y 1),( x̂2,y 2),...,(x̂ M*,yM*)},
Soglia φ,
Parametri di ponderazione ω1, ω2
Output: Etichetta di previsione del set di dati di test
Ere = {y1pre, y2pre, ..., yF*pre}
per i =1a F* do
zi ← e1(xi)
x2i ← d2(zi)
z2i ← e2(x2i)
z1i' ← d1(z2i)
z1i' ← e2(z1i')
Acc(x̂i) ←ω1||zi−z2i||2+ω2||zi−z1i'||numero arabo
ifAcc(x̂i) ≥φ allora
yipre ←1
altro
yipre ←0
Fine
fine
EDE utilizza il discriminatore come componente di apprendimento avversario per aumentare l'accuratezza del rilevamento delle anomalie migliorando la capacità del modello di distinguere eventi normali e anomali. Migliora le prestazioni come segue:
Discriminazione nell'apprendimento: il discriminatore viene addestrato a differenziare le rappresentazioni sintetiche e quelle ricostruite con struttura EDE duale. L'ottimizzazione di questo processo contraddittorio offre al modello funzionalità latenti altamente discriminanti, migliorando il rilevamento delle anomalie della scena del traffico.
Rimozione di cattive ricostruzioni: poiché si discostano molto dai modelli di traffico, le anomalie spesso generano problemi di ricostruzione. Il discriminatore penalizza i frame ricostruiti in modo errato, migliorando il rilevamento degli eventi normali/anomali della rete.
Migliorare la rappresentazione delle caratteristiche con l'addestramento avversario: integrando l'apprendimento contraddittorio, il discriminatore fa sì che la rete EDE generi incorporamenti latenti più duraturi e significativi. In questo modo vengono rilevati anche piccoli cambiamenti come frenate brusche, collisioni e sterzate del veicolo, migliorando il rilevamento delle anomalie.
Rimozione dei falsi positivi: gli autoencoder tradizionali generalizzano e normalizzano eccessivamente le anomalie, con conseguenti tassi elevati di falsi positivi. Il discriminatore preserva gli attributi delle anomalie durante la ricostruzione identificando le discrepanze latenti tra frame normali e anomali.
Miglioramento della classificazione con un processo decisionale in due fasi: i frame ricostruiti normali o anormali ricevono punteggi di confidenza dal discriminatore. In questa fase di verifica aggiuntiva si riducono gli errori di classificazione errata e la perdita di ricostruzione, migliorando l'accuratezza del rilevamento.
Abbiamo utilizzato metodi di rilevamento degli incidenti collaudati per testare la strategia 23,24,25,26. Una classe in un set di dati multiclasse era normale e tutte le altre classi di incidenti sono state attentamente esaminate utilizzando approcci uno contro tutti. Il modello è stato addestrato utilizzando solo i normali dati di classe, mentre il set di test ha utilizzato dati di incidente e normali. I set di allenamento e di test sono stati divisi in due modi.
Abbiamo addestrato e testato rispettivamente con l'80% e il 20% di dati di classe normale. I risultati del test della classe di incidente sono stati scelti a caso. La valutazione è stata imparziale utilizzando campioni di test per classe di infortunio, che rappresentano il 20% dei dati di classe normale, per evitare che il modello si inclinasse verso la classe normale maggioritaria. Il modello può essere testato con un numero uguale di dati normali e di incidenti, che rappresentano condizioni pratiche. Testa la generalizzazione del modello in modo imparziale eseguendo il training con l'80% dei dati normali e nascondendo il 20%. Ciò dimostra anche che gli eventi normali superano gli incidenti nella vita reale, il che rende importante esporre il modello a dati sugli incidenti poco frequenti. La selezione casuale dei campioni di incidenti e il test del modello rispetto a tutte le situazioni di incidente senza overfitting aumentano la robustezza. La suddivisione dei dati 80/20 è comune nell'apprendimento automatico. I dati di training per i modelli significativi e i dati di test per la valutazione delle prestazioni sono bilanciati.
Gli esperimenti hanno utilizzato set di dati per l'addestramento e i test. La divisione dell'addestramento di classe normale è stata utilizzata per la convalida e l'addestramento. Sono stati testati i dati dei test di tutte le classi.
La potatura e la quantizzazione del modello riducono notevolmente le dimensioni e il calcolo del modello. Il modello ridotto ha la stessa precisione ma prestazioni inferiori in quanto comprende il 40% in meno di parametri. Per i dispositivi edge con bassa potenza di elaborazione, la quantizzazione del modello lo comprime. Questa ottimizzazione soddisfa le esigenze di precisione e richiamo della sorveglianza del traffico in tempo reale.
I design leggeri come MobileNets ed EfficientNet aumentano le inferenze in tempo reale. Grazie alla loro precisione di visione artificiale e al calcolo minimo, questi tipi di architettura sono ampiamente utilizzati. Sui sistemi embedded, tali modelli riducono l'elaborazione dei frame del 50%, mantenendo al contempo ottimi punteggi F1 di rilevamento degli incidenti.
L'utilizzo di parametri simili per la ricostruzione delle immagini e il rilevamento degli incidenti utilizzando l'apprendimento multi-task potrebbe semplificare la progettazione. Ciò ha ridotto i tempi di formazione e i costi di calcolo senza influire sull'accuratezza del modello. Il sistema di apprendimento multi-task ha semplificato l'apprendimento del modello di elaborazione dei dati video sul traffico.
L'addestramento avversario contrastivo e auto-supervisionato ha prodotto risultati paragonabili al modello di rilevamento delle anomalie di base in meno tempo. Le caratteristiche degli incidenti stradali sono state raccolte e generalizzate per migliorare la robustezza dei dati non visibili.
L'algoritmo di rilevamento delle anomalie del traffico proposto è stato testato su Track-4, uno dei cinque set di dati AI City Challenge2021 27. Le autostrade hanno fornito questi dati al DOT dell'Iowa.
Valutazione comparativa delle prestazioni:
Per convalidare il nostro modello, lo abbiamo confrontato sul set di dati AI City Challenge Track 4 con modelli all'avanguardia, tra cui GANomaly, f-AnoGAN, OCGAN e il metodo supervisionato di ByteDance. La tabella 2 riassume i risultati.
| Modello | Punteggio F1 | Precisione | Ricordare | AUC |
| GANomaly | 0.87 | 0.88 | 0.86 | 0.9 |
| OCGAN | 0.89 | 0.9 | 0.87 | 0.91 |
| ByteDance (Sup.) | 0.91 | 0.93 | 0.89 | 0.92 |
| Proposto (Dual-EDE) | 0.94 | 0.95 | 0.93 | 0.94 |
Tabella 2: Confronto dei metodi. La tabella confronta i metodi di rilevamento delle anomalie in base al punteggio F1, alla precisione, al richiamo e all'accuratezza. Vengono confrontati i progetti EDE con e senza formazione contraddittoria. Due EDE più l'allenamento avversario battono BADU, ByteDance e WHU in tutte le categorie. I dati indicano che l'apprendimento contraddittorio aumenta il rilevamento delle anomalie.
Il modello a doppia EDE supera tutte le linee di base, soprattutto nel richiamo, indicando una maggiore sensibilità a rari eventi anomali.