Research Article

Codificador-Decodificador-Codificador Duplo com Treinamento Contraditório para Detecção de Acidentes de Trânsito Não Supervisionados em Vídeos de Vigilância

DOI:

10.3791/68731

September 5th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabalho propõe um modelo duplo codificador-decodificador-codificador (EDE) para detecção automatizada de acidentes de trânsito. Usando um método de treinamento em duas fases, ele aprende padrões normais de direção e identifica anomalias por meio de confronto generativo. O modelo detecta efetivamente acidentes em imagens do mundo real e oferece informações sobre o comportamento do motorista, capturando desvios sutis.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para aumentar a segurança rodoviária e melhorar a resposta a emergências, os incidentes de trânsito devem ser detectados em imagens de vigilância do mundo real o mais rápido possível. Os sistemas existentes dependem em grande parte do monitoramento manual, que é demorado e propenso a erros. A detecção automatizada de acidentes continua sendo um desafio devido ao grande desequilíbrio de classe: as situações normais de direção estão super-representadas, enquanto os acidentes são raros e diversos. Nesses casos, os sistemas tradicionais de visão computacional geralmente não conseguem diferenciar de forma confiável entre eventos normais e anormais. Este estudo aborda o problema desenvolvendo uma arquitetura de aprendizado profundo baseada em uma estrutura dupla de codificador-decodificador-codificador (EDE). O modelo usa dois pipelines de codificador-decodificador compartilhados para mapear distribuições de imagem para distribuições latentes especificadas em ambas as direções. Essa estrutura permite que o sistema modele padrões comuns de comportamento do tráfego e se torne mais sensível a alterações que podem indicar eventos perigosos ou incomuns. Uma técnica de treinamento em duas fases é proposta para melhorar ainda mais a detecção de anomalias. Na primeira fase, o modelo aprende a reconstruir imagens de condução normal, usando a perda de reconstrução para caracterizar o comportamento normal. Na segunda fase, é introduzido um mecanismo contraditório generativo: vetores latentes reconstruídos de um EDE são passados para o outro, gerando imagens sintéticas e espaços latentes. Esse processo amplifica as diferenças entre as saídas reais e sintéticas, tornando o sistema mais responsivo a sinais sutis de possíveis anomalias. A arquitetura de EDE duplo e a metodologia de treinamento contraditório representam um avanço substancial em relação aos métodos atuais, modelando o comportamento normal e patológico. Resultados experimentais em conjuntos de dados de vigilância de tráfego do mundo real demonstram que o método proposto melhora significativamente a detecção de acidentes e comportamentos de direção inseguros, tanto em termos de precisão quanto de robustez.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De acordo com a Organização Mundial da Saúde (2023), as lesões no trânsito são a principal causa de morte entre crianças e jovens de 5 a 29 anos, com aproximadamente 1,3 milhão de mortes relatadas globalmente a cada ano. Essa estatística alarmante ressalta a necessidade urgente de sistemas automatizados capazes de monitorar o tráfego rodoviário1, detectar anomalias em tempo real e reduzir atrasos na resposta a emergências. A integração da inteligência artificial (IA) e da Internet das Coisas (IoT) na infraestrutura da cidade inteligente permitiu o desenvolvimento de sistemas de transporte inteligentes. Enquanto as redes de circuito fechado de televisão (CCTV)2,3 fornecem vigilância contínua do tráfego urbano, o monitoramento manual é impraticável e propenso a erros. Portanto, soluções escaláveis e automatizadas para detecção de incidentes de trânsito são essenciais.

Os métodos tradicionais de visão computacional para análise de tráfego - como detecção de veículos, rastreamento e classificação de comportamento - geralmente empregam redes neurais convolucionais (CNNs) treinadas por meio de aprendizado supervisionado 4,5. Esses sistemas exigem extensos conjuntos de dados anotados e muitas vezes não conseguem generalizar nos cenários raros e variados que caracterizam os acidentes do mundo real. Consequentemente, os pesquisadores recorreram a abordagens de detecção de anomalias não supervisionadas, que não dependem de dados de anomalias rotuladas. Dentre estes, os autoencoders (AEs) e as redes adversárias generativas (GANs) têm se mostrado promissores na modelagem de padrões normais e na identificação de desvios 6,7,8.

No entanto, os EAs padrão tendem a reconstruir as entradas com muita fidelidade - mesmo quando essas entradas são anômalas - levando a altas taxas de falsos negativos 9,10. Autoencoders variacionais (VAEs)11 e modelos baseados em GAN, como f-AnoGAN12, GANomaly13 e OCGAN14, abordam alguns desses problemas incorporando modelagem de espaço latente e aprendizado contraditório. No entanto, esses modelos geralmente dependem de mapeamentos unidirecionais da imagem para o espaço latente15, limitando sua capacidade de detectar inconsistências sutis ou complexas em anomalias de tráfego do mundo real.

Sistemas supervisionados, como os desenvolvidos para o AI City Challenge pela ByteDance16, WHU17 e USF18, alcançam alta precisão por meio de rastreamento espaço-temporal19e projetos centrados em objetos. No entanto, eles exigem dados de acidentes rotulados e pipelines de rastreamento complexos, reduzindo a escalabilidade e a aplicabilidade em tempo real.

ModeloTipoCaracterísticas principaisLimitaçõesDesempenho (descrito)
GANomalySupervisionadoCodificador-Decodificador-Codificador; Treinamento contraditórioTende a reconstruir até mesmo entradas anômalas muito bem, levando a falsos negativosBom geral, com alta precisão e recall equilibrado
OCGANSupervisionadoGAN de uma classe com espaço latente restritoLuta para detectar anomalias sutis ou complexasUm pouco melhor que o GANomaly, com melhor equilíbrio entre as métricas
f-AnoGANSupervisionadoDetecção rápida de anomalias usando GANs e correspondência de recursosCapacidade limitada de capturar anomalias complexas no espaço latenteDesempenho moderado (pontuações específicas não fornecidas)
ByteDanceSupervisionadoRastreamento espaço-temporal com localização de anomalias no nível do objetoRequer dados de treinamento rotulados; escalabilidade limitada em configurações do mundo realExatidão e precisão muito altas; sensibilidade ligeiramente inferior
BADUSupervisionadoUsa modelagem de fundo e rastreamento de veículosMenos eficaz em cenas diversas; perde anomalias sutisPrecisão sólida; Bom equilíbrio, mas abaixo dos métodos superiores
WHUSupervisionadoTraçado de trajetória de modalidade duplaMá generalização e baixa lembrança de anomaliasDesempenho geral fraco, especialmente na detecção de anomalias
USFSupervisionadoCombina modelagem de fundo com análise de similaridade estruturalRuim em identificar anomalias com precisãoPrecisão e sensibilidade muito baixas
Proposta (EDE duplo)SupervisionadoCodificador-decodificador-codificador duplo; Mapeamento latente bidirecional com perda adversária e contrastivaAlta carga computacional; limitado à entrada RGBExcelente desempenho; Precisão máxima, alta recuperação e forte equilíbrio entre as métricas

Tabela 1: Resumo do trabalho relacionado na detecção de anomalias de tráfego baseada em vídeo.

A Tabela 1 contrasta os métodos essenciais de detecção de anomalias usados na vigilância de tráfego, destacando suas arquiteturas, vantagens, desvantagens e desempenho. Modelos convencionais baseados em GAN, como GANomaly e OCGAN, podem realizar detecção não supervisionada eficaz, mas lutam com anormalidades sutis. Os métodos supervisionados, embora altamente precisos, dependem muito de dados rotulados e rastreamento sofisticado. O modelo Dual-EDE proposto integra codificação de espaço latente bidirecional com treinamento contraditório e contrastivo, permitindo detectar anomalias de tráfego raras e sutis sem dados rotulados, oferecendo escalabilidade e robustez.

Lacuna de pesquisa e hipóteses
Embora os modelos não supervisionados mitiguem a necessidade de anomalias rotuladas, eles ainda lutam para detectar com precisão eventos de tráfego raros, sutis e de alto impacto. Os métodos atuais são limitados pela assimetria arquitetônica e pela incapacidade de explorar totalmente as inconsistências do espaço latente. Muitos também não conseguem distinguir de forma robusta entre comportamento normal complexo e anomalias genuínas em ambientes de tráfego altamente dinâmicos.

Nossa hipótese é que uma arquitetura dupla de codificador-decodificador-codificador (EDE) treinada exclusivamente em dados de tráfego normais, combinada com uma estratégia de treinamento em duas fases, pode superar os modelos de última geração na detecção de anomalias de tráfego diversas e sutis. Ao impor a consistência latente bidirecional e integrar a reconstrução adversária, o sistema se torna mais sensível a desvios minuciosos do comportamento esperado - como frenagem brusca, desvio errático ou colisões - sem a necessidade de dados de acidentes anotados.

Método proposto
Propomos uma nova estrutura de detecção de anomalias não supervisionada construída sobre uma arquitetura EDE dupla. Ao contrário dos modelos tradicionais que empregam um único pipeline de codificação-decodificação, nosso sistema usa duas vias EDE que realizam mapeamento bidirecional entre imagens e representações latentes. Esse design permite que o modelo aprenda recursos avançados da dinâmica normal do tráfego e amplifique as discrepâncias quando ocorrem anomalias. O processo de treinamento consiste em duas fases:

A Fase Um usa a perda de reconstrução para modelar o comportamento normal, semelhante ao treinamento padrão do autoencoder.

A Fase Dois introduz um mecanismo contraditório generativo, onde vetores latentes de um EDE são passados para o segundo para gerar dados sintéticos, forçando o sistema a maximizar as distinções entre representações reais e falsas nos domínios da imagem e latentes.

Principais contribuições
Introduzimos uma arquitetura EDE dupla que captura inconsistências latentes por meio de mapeamento bidirecional para detecção aprimorada de anomalias. Desenvolvemos um procedimento de treinamento em duas fases que combina reconstrução de autoencoder com aprendizado contraditório para aumentar a sensibilidade a desvios sutis. Demonstramos, por meio de experimentos no conjunto de dados AI City Challenge (Track 4), que o modelo supera várias linhas de base supervisionadas e não supervisionadas de última geração, alcançando detecção de acidentes robusta e escalável em ambientes urbanos do mundo real. Em resumo, este trabalho oferece uma abordagem escalável, precisa e sem rótulos para a detecção de anomalias de tráfego, contribuindo para sistemas de transporte inteligentes mais seguros e responsivos.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sistema

Configuração
Implantamos o sistema de detecção de anomalias de tráfego proposto em uma estrutura de computação hierárquica e distribuída, aproveitando o ambiente Intel Tiber Cloud. Essa arquitetura compreende três camadas – borda, neblina e nuvem – para garantir inferência de baixa latência, treinamento escalável e alocação eficiente de recursos entre nós de computação.

Nível de borda: A detecção de anomalias em tempo real é realizada na borda usando dispositivos incorporados leves e compatíveis com GPU (por exemplo, NVIDIA Jetson Nano ou plataformas equivalentes baseadas em Intel com GPUs integradas). Essas unidades foram colocadas junto com câmeras de vigilância e executaram inferência quadro a quadro com latência mínima, permitindo o monitoramento de tráfego descentralizado e responsivo.

Camada de neblina: tarefas mais intensivas em computação, incluindo inferência em lote e refinamento de modelo em tempo real, foram tratadas por nós de névoa provisionados como máquinas virtuais dedicadas ou instâncias bare-metal na Intel Tiber Cloud. Cada nó de neblina foi configurado com um processador Intel Xeon com pelo menos 16 GB de RAM e teve acesso à aceleração de GPU discreta ou integrada à Intel. Essa camada intermediária permitiu operações de alta taxa de transferência perto da fonte de dados, mantendo a autonomia dos servidores centrais.

Camada de nuvem: para treinamento e arquivamento em larga escala, a camada de nuvem utiliza clusters de computação escaláveis oferecidos por meio dos serviços otimizados para IA da Intel Tiber. As instâncias equipadas com aceleradores Intel Habana Gaudi ou processadores Intel Xeon Scalable são empregadas para treinar redes neurais profundas em extensos conjuntos de dados de vídeo, oferecendo suporte ao versionamento de modelos, armazenamento de longo prazo e orquestração em todo o sistema.

A pilha de software completa operava em um ambiente Python 3.8+ usando bibliotecas otimizadas pela Intel para computação acelerada. As estruturas primárias incluem PyTorch (com extensão Intel para PyTorch), OpenCV para pré-processamento de imagem e vídeo e Scikit-learn para avaliação. A aceleração de GPU é habilitada por meio dos kits de ferramentas oneAPI apropriados e otimizações DAAL.

Após a implantação, clonamos o repositório que contém a arquitetura EDE dupla e inicializamos os componentes do modelo - dois codificadores (E1, E2) e dois decodificadores (D1, D2). Empregou o método .to(device) para transferir os componentes dinamicamente para a unidade de processamento ideal (CPU, GPU ou acelerador Gaudi), dependendo da disponibilidade de recursos locais.

Declaramos os parâmetros de treinamento e avaliação, incluindo o número de épocas, taxa de aprendizado, coeficientes de balanceamento de perdas (γ, δ) e limiares de sensibilidade a anomalias (ω1, ω2), em um script de configuração. Para o treinamento, seguimos um protocolo de duas fases: (1) reconstrução de autoencoder padrão para aprender o comportamento normal do tráfego e (2) reconstrução latente adversária para amplificar anomalias usando interações cross-EDE.

Essa arquitetura de sistema modular e nativa da nuvem permitiu detecção robusta de anomalias em tempo real, escalabilidade de modelo e implantação confiável em ambientes de transporte inteligente do mundo real por meio do Intel Tiber Cloud.

Dataset
Para treinar e avaliar o sistema de detecção de anomalias proposto, usamos o conjunto de dados fornecido pelo NVIDIA AI City Challenge 2021, Track 4 (Traffic Anomaly). O conjunto de dados compreende 100 vídeos de treinamento e 150 vídeos de teste, cada um com média de 15 minutos de duração, gravados a 30 fps e resolução de 410 p. Cada vídeo apresenta um nível distinto de dificuldade devido a variações nos tipos de estradas, ângulos de câmera, iluminação e condições climáticas. O conjunto de dados captura uma ampla gama de infraestrutura rodoviária (por exemplo, rodovias com várias faixas, cruzamentos), densidades de tráfego e condições climáticas (por exemplo, claro, chuvoso, crepúsculo), de vários ângulos de câmera. Esses atributos o tornam uma referência ideal para avaliar a generalização de modelos de detecção de anomalias.

Pré-processamento
Para treinar o modelo em condições não supervisionadas, use apenas cenas de tráfego normais (não acidentais), evitando qualquer exposição a eventos anômalos durante o treinamento. Execute o pré-processamento de vídeo usando o OpenCV. Quadros de amostra uniformemente a 5 fps para garantir cobertura temporal suficiente e reduzir a redundância. Redimensione os quadros para 128 x 128 pixels, correspondendo aos requisitos de entrada da rede EDE dupla e equilibrando os detalhes visuais com a eficiência computacional. Normalize os valores de pixel para o intervalo [−1, 1] para melhorar a estabilidade do treinamento.

Para melhorar a generalização e simular a variabilidade do mundo real, aplique as seguintes técnicas de aumento a cada quadro de treinamento com probabilidade aleatória:

Corte e dimensionamento aleatórios: Corte sub-regiões aleatórias e dimensione-as de volta para a resolução original, incentivando a invariância no tamanho do objeto, visibilidade parcial e mudanças de posição espacial, imitando efeitos de zoom e assuntos fora do centro em vídeos de vigilância.

Modulação de brilho e contraste: Aplique transformações lineares ou baseadas em gama para imitar variações de iluminação, como sombras, brilho, variações do nascer / pôr do sol e iluminação artificial. Isso melhora a resiliência do modelo às flutuações de iluminação diurnas e sazonais.

Injeção de ruído gaussiano e desfoque de movimento: Adicione ruído gaussiano com desvios padrão variados para simular o ruído do sensor e os artefatos de compressão. Simule o desfoque de movimento usando núcleos convolucionais orientados em diferentes direções e magnitudes para emular o efeito de objetos em movimento ou trepidação da câmera, o que é particularmente relevante em cenas de tráfego acelerado.

Mascaramento de oclusão aleatória: Aplique oclusões sintéticas sobrepondo manchas retangulares pretas ou cinzas de tamanhos e locais aleatórios sobre o quadro. Esse aumento simula obstruções do mundo real, como pedestres, elementos de infraestrutura ou veículos que passam ocluindo o campo de visão. Ele incentiva o modelo a aprender com o contexto e permanecer robusto para regiões ausentes ou distorcidas.

Aplique esses aumentos dinamicamente durante o treinamento usando pipelines de transformação do PyTorch, garantindo que cada lote contenha uma combinação diversificada de quadros aumentados, promovendo a exposição a diversos padrões e reduzindo o sobreajuste.

Carregue quadros processados com o DataLoader do PyTorch para gerenciar lotes, embaralhamento e carregamento paralelo. Treine com tamanhos de lote entre 32 e 64, dependendo da capacidade da GPU. Para inferência e pontuação de anomalias, processe quadros individualmente (tamanho do lote = 1) para permitir a detecção precisa no nível do quadro.

Esse pipeline de pré-processamento e aumento melhora a robustez e a generalização, permitindo que o modelo detecte comportamentos anômalos de forma eficaz em ambientes de monitoramento de tráfego do mundo real diversos e barulhentos.

O método proposto:
O sistema EDE proposto aprende mapeamentos bidirecionais entre distribuições de imagens e espaços latentes. Dois codificadores e dois decodificadores permitem a extração robusta de recursos e a diferenciação de anomalias. As redes são treinadas tanto nas etapas de reconstrução quanto de contraditório. Aprendizado contrastivo, regularização e penalidade de gradiente são usados para evitar o colapso do modo e melhorar a robustez do treinamento GAN.

A estrutura EDE opera da seguinte maneira: O codificador 1 (E1) codifica recursos de imagem no espaço latente. O primeiro decodificador (D1) reconstrói imagens de vetores latentes para minimizar a perda de reconstrução. As imagens reconstruídas são então mapeadas de volta para o espaço latente para capturar inconsistências. O segundo decodificador (D2) gera imagens sintéticas a partir do segundo espaço latente para ajudar o modelo a distinguir dados reais de dados sintéticos. Esse mapeamento bidirecional detecta anomalias com base em discrepâncias de espaço latentes, em vez de diferenças de nível de pixel.

Fase 1: Treinamento de Reconstrução: O autoencoder é treinado para reconstruir imagens de tráfego normais, de modo que entradas anômalas produzem erros substanciais de reconstrução. A função de perda considera a imagem de entrada, sua codificação latente e a imagem reconstruída.

Treinamento Contraditório: Após o treinamento de reconstrução, o aprendizado contraditório é aplicado. Vetores latentes reconstruídos são passados através de uma estrutura EDE alternativa para produzir imagens sintéticas e vetores latentes. Os objetivos são maximizar as diferenças entre imagens reais e sintéticas; alterar e reconstruir vetores latentes para melhorar a detecção de anomalias pelo Encoder 2 (E2); e evitar o colapso do codificador.

O treinamento é projetado para evitar a convergência de E1 e E2 para mapeamentos idênticos, o que reduziria a capacidade discriminativa.

Aprendizagem contrastiva: Uma função de perda diferencia representações reais e reconstruídas, com um hiperparâmetro de margem controlando a separação de recursos.
As técnicas de regularização incluem:

Abandono escolar: Desativação aleatória de neurônios para evitar sobreajuste.
Deterioração do peso: Penaliza pesos grandes para estabilizar o aprendizado de recursos.

Os métodos de prevenção de estabilidade de treinamento adversário20 e colapso de modo incluem:
Penalidade de gradiente: Regula o comportamento discriminador.
Aumento de dados: Corte aleatório, dimensionamento e iluminação ajustável para simular condições variadas.
Injeção de ruído: Adicionando ruído realista, desfoque de movimento e oclusões para melhorar a generalização.
Parada precoce: Interromper o treinamento se a perda de validação flutuar significativamente para evitar o sobreajuste.

Esses aprimoramentos arquitetônicos, métodos de treinamento e medidas de resiliência garantem a detecção confiável de anomalias de tráfego.

A rede de detecção de acidentes não supervisionada é treinada exclusivamente em amostras normais e testada em amostras normais e de acidentes. Formalmente:

Do conjunto de todos os vídeos normais e de acidentes, considere um grande conjunto de dados de treinamento E com apenas F quadros normais (E = {x1, x2}). .., xM } e um conjunto de dados de ensaio mais pequeno Ê contendo fotografias normais e de acidentes (Ê=[( x̂1,y1], (x̂2,y2), (x̂F*,yF*)]),fotogramas, em que yi figure-protocol-1[0, 1] é a imagem do rótulo da imagem. Para o treinamento F figure-protocol-2F*, o conjunto de dados de treinamento deve ser significativamente maior do que o conjunto de dados de teste. Depois de aprender a variedade do conjunto de dados (E), identifique os quadros de acidentes em Ê como outliers durante a inferência. O modelo f calcula uma pontuação de acidente Acc(x) com base na distribuição de dados normal aprendida. Uma imagem de teste x com uma pontuação alta de acidente pode ser um acidente. Os critérios de julgamento são baseados no limite de pontuação do acidente (φ) se Acc (x) > φ.

Arquitetura de rede:
Conforme mostrado na Figura 1, o GANomaly modelo21 contém dois codificadores, um decodificador e um discriminador. Muitos pesquisadores adaptaram esse método para distinguir vetores latentes e detectar anomalias visuais12,22. Os dois codificadores e o decodificador único modificam reciprocamente a imagem e o vetor latente no modelo. Esses fatos aberrantes são indicados durante a transformação. O discriminador divide as imagens geradas do original. O GANomaly depende de codificação, decodificação e recodificação.

figure-protocol-3
Figura 1: Arquitetura GANomaly demonstrando o fluxo de informações. A arquitetura consiste em uma estrutura codificador-decodificador-codificador integrada em uma rede adversária generativa. O primeiro codificador compacta o quadro de vídeo de entrada em uma representação de espaço latente, que é então reconstruída pelo decodificador. Um segundo codificador mapeia o quadro reconstruído de volta para o espaço latente. O discriminador avalia a diferença entre os recursos de entrada e reconstruídos para calcular a pontuação de anomalia. As setas indicam o fluxo direcional de dados pela rede. Abreviatura: GAN = rede adversária generativa. Clique aqui para ver uma versão maior desta figura.

A Figura 2 ilustra a arquitetura EDE com dois codificadores e um decodificador. A estrutura EDE deve alterar constantemente os parâmetros para detectar contratempos de vídeo. Adicionamos um segundo decodificador à estrutura EDE e permitimos que eles compartilhassem os codificadores para gerar o modelo na Figura 2 com duas configurações de rede. Dois codificadores têm quatro camadas convolucionais. Usamos funções de ativação LeakyReLU para todas as camadas, exceto a camada de saída, que usou uma ativação tanh para vincular as saídas entre -1 e 1. A normalização em lote foi aplicada após múltiplas camadas convolucionais. Os decodificadores (Figura 3 e Figura 4) são semelhantes aos codificadores, mas empregam ConvTranspose e normalização de lote extra em vez de cada camada.

figure-protocol-4
Figura 2: Arquitetura baseada em EDE proposta com fluxo de informações. A arquitetura EDE é ilustrada, mostrando o fluxo de quadros de vídeo através de dois codificadores e um decodificador. O primeiro codificador (E1) comprime o quadro de entrada em uma representação latente, que é então reconstruída pelo decodificador (D1). A saída reconstruída é passada através do segundo codificador (E2) para obter um segundo vetor latente. Discrepâncias entre vetores latentes e qualidade de reconstrução são usadas para detecção de anomalias, apoiadas por componentes de perda contraditórios e contrastivos. Abreviatura: EDE = codificador-decodificador-codificador. Clique aqui para ver uma versão maior desta figura.

Detalhes da arquitetura de rede:
O modelo EDE duplo consiste em dois pipelines de codificador-decodificador-codificador, cada um com a mesma estrutura e otimizado em conjunto durante o treinamento.

Arquitetura do codificador (E1, E2)

Entrada: quadro RGB 128×128×3

Camada 1: Conv2D (64 filtros, kernel 4×4, passo 2, preenchimento 1) → LeakyReLU (α = 0,2)

Camada 2: Conv2D (128 filtros, 4×4, passo 2, preenchimento 1) → BatchNorm → LeakyReLU

Camada 3: Conv2D (256 filtros, 4×4, passo 2, preenchimento 1) → BatchNorm → LeakyReLU

Camada 4: Conv2D (512 filtros, 4×4, passo 2, preenchimento 1) → BatchNorm → LeakyReLU

Camada 5: Achatar → vetor denso a latente (z figure-protocol-5^ 100)

Arquitetura do decodificador (D1, D2)

Entrada: z figure-protocol-6^ 100 → → denso remodelado para 8×8×512

Camada 1: TransposedConv2D (256 filtros, 4×4, passo 2, preenchimento 1) → BatchNorm → ReLU

Camada 2: TransposedConv2D (128 filtros, 4×4, passo 2, preenchimento 1) → BatchNorm → ReLU

Camada 3: TransposedConv2D (64 filtros, 4×4, passo 2, preenchimento 1) → BatchNorm → ReLU

Camada 4: TransposedConv2D (3 filtros, 4×4, passo 2, preenchimento 1) → Tanh

A imagem reconstruída é recodificada através do segundo codificador para obter uma representação latente, e as discrepâncias entre os vetores latentes originais e reconstruídos são usadas para pontuação de anomalias.

Ativação e normalização
Os codificadores usam a ativação do LeakyReLU e a normalização em lote. Os decodificadores usam a ativação ReLU, exceto para a camada final, que aplica Tanh para normalizar as saídas para o intervalo [−1, 1].

Perda Funções
Perda de reconstrução de imagem: ǀǀ x −ǀǀ2
Perda de consistência latente: ǀǀ z −ǀǀ2

Perda contraditória: Introduzida na Fase II para maximizar a divergência entre reconstruções reais e sintéticas, forçando a rede a distinguir códigos latentes reais daqueles gerados durante a reconstrução.

Essa arquitetura captura irregularidades no espaço de pixels e no espaço latente, permitindo a detecção de desvios sutis indicativos de comportamento de direção anormal.

Treinamento em duas fases
Um método de treinamento de rede em dois estágios é empregado. Para a reconstrução de imagens e vetores latentes, duas estruturas EDE são treinadas. Na segunda fase, o Codificador 2 tenta enganar o Codificador 1 para classificar erroneamente os dados como reais ou reconstruídos.

Treinamento inicial de reconstrução
A estrutura EDE é treinada para replicar a imagem de entrada e o vetor latente. A entrada x é codificada no vetor latente z pelo codificador E1. D1 e D2 decodificam z para produzir imagens, x1 e x2. Obtivemos dois vetores latentes (z1 e z2) do codificador E2 após passar duas imagens reconstruídas (x1 e x2). Esta etapa contém estes objetivos de treinamento:

LEDE1 = γ ǀǀ x −x1ǀǀ2+δ ǀǀ z −z1ǀǀ2 (1)
LEDE2 = γ ǀǀ x−x2ǀǀ2+δ ǀǀ z −z2ǀǀ2 (2)

Essas imagens reconstruídas são passadas pelo Encoder E2 para obter os vetores latentes z1 e z2. Objetivos do treinamento:
Os fatores de ponderação (γ, δ) influenciam crucialmente o impacto dos componentes de perda na função objetivo.

Em segundo lugar, treinamos duas estruturas Encoder-Decoder-Encoder usando métodos contraditórios.
Aqui, γ e δ são os parâmetros que pesam as contribuições da reconstrução e as perdas de consistência latente.

Treinamento contraditório
Duas estruturas EDE são treinadas contraditoriamente. Aprende a reconhecer o codificador 2 a partir de dados. EDE2 deve enganar EDE1 porque é o oposto. D1 decodifica z2 desde a primeira etapa e reconstrói x1'. Repetir x1' para o codificador E2 produz z1'. Os objetivos do estágio de treinamento são os seguintes:

min max γ ǀǀ x −x1'ǀǀ +δ ǀǀ z -z1'ǀǀ 2 (3)
EDE2 EDE1

As duas estruturas EDE têm estas funções de perda:
LEDE1 = −γ ǀǀ x -x1'ǀǀ 2 −δǀǀ z - z1'ǀǀ 2 (4)
LEDE2 = +γ ǀǀ x - x1'ǀǀ 2+δ ǀǀ z - z1'ǀǀ 2 (5)

Os valores de γ e δ correspondem aos parâmetros especificados anteriormente.

figure-protocol-7
Figura 3: Estrutura do codificador. A rede de codificadores usada na arquitetura EDE proposta extrai recursos espaço-temporais dos quadros de vídeo de entrada. Consiste em várias camadas convolucionais seguidas de normalização em lote e ativação de ReLU, reduzindo progressivamente as dimensões espaciais enquanto captura representações hierárquicas. O vetor latente final codifica informações semânticas de alto nível essenciais para a detecção de anomalias. Abreviaturas: ReLU = Unidade Linear Retificada, EDE = codificador-decodificador-codificador. Clique aqui para ver uma versão maior desta figura.

Cada EDE fornece duas funções de perda para a estrutura proposta. Na Fase 1, o EDE1 deve reduzir as perdas de reconstrução x e z. EDE1 deve otimizar a variância da fase 2 entre os vetores latentes z e z1' e x e x1'. EDE2 e EDE1 reduzem os erros de reconstrução da fase 1 x e z. EDE1 deve diminuir a diferença entre z e z1' e x e x1' na fase 2, mas o oposto deve acontecer.

figure-protocol-8
Figura 4: Estrutura do decodificador. O componente decodificador da arquitetura EDE proposta reconstrói quadros de entrada a partir de recursos latentes. Ele consiste em uma série de camadas convolucionais transpostas que aumentam progressivamente a resolução de recursos para a resolução do quadro original. O decodificador aprende a reconstruir com precisão as cenas normais de tráfego, permitindo que o sistema identifique anomalias com base em erros de reconstrução. Abreviatura: EDE = codificador-decodificador-codificador. Clique aqui para ver uma versão maior desta figura.

Cada objetivo de treinamento duplo do modelo EDE inclui funções de perda com pesos que mudam com o tempo:

LEDE1=(γ||xx1||2+δ||zz1||2)(1)(γ||xx1''||2+δ||zz1''||2) (6)
LEDE2=(γ||xx1||2+δ||zz1||2)+(1)(γ||xx1''||2+δ||zz1''||2) (7)

A contagem do período de treinamento é n.

O algoritmo 1 mostra o treinamento em duas fases:
Entrada:
Todas as imagens normais no conjunto de dados E = {x1, x2, . . . , xF},
Épocas N,
Parâmetros ponderados γ, δ
Saída:
Codificador-Decodificador-Codificador 1 treinado,
Codificador-Decodificador-Codificador 2
e1, e2, d1, d2 ←inicializando
Pesos
n ←1
repetir
para f = 1 para F do
zf←e1(xf)
         figure-protocol-9←d1 (zf)
         figure-protocol-10←d2 (zf)
         figure-protocol-11←e2(figure-protocol-12)
         figure-protocol-13←e2(figure-protocol-14)
         figure-protocol-15←d1(figure-protocol-16)
         figure-protocol-17←e2(figure-protocol-18)′
LEDE1figure-protocol-19(γ||xffigure-protocol-20||2+δ||zffigure-protocol-21||2) −(1−figure-protocol-22)(γ||xffigure-protocol-23'||2+ δ||zffigure-protocol-24'||2)
LEDE2figure-protocol-25(γ||xffigure-protocol-26||2+δ||zffigure-protocol-27||2) +(1−figure-protocol-28) (γ||xffigure-protocol-29'||2+ δ||zffigure-protocol-30'||2)
E1,E 2, D1, D2←Atualizar pesos
utilizando LEDE1e LEDE2
fim para
n ←n + 1
até n = N

Fases de treinamento e critérios de detecção de anomalias
Divida o treinamento em duas fases sequenciais:

Fase I - Aprendizagem da Reconstrução:
Ambos os dutos EDE são treinados exclusivamente em cenas de tráfego normal.

As imagens de entrada são passadas pelo Codificador 1 → Decodificador 1 → Codificador 2 (Figura 5).

O modelo minimiza a perda de reconstrução de imagem e a perda de consistência latente. Essa fase permite que a rede aprenda um espaço latente compacto e consistente para o comportamento normal.

Fase II - Aprendizagem de Confronto Generativo:

Os vetores latentes reconstruídos a partir do Decodificador 1 são inseridos no Decodificador 2 e, em seguida, recodificados via Codificador 1. Esse fluxo circular ajuda o modelo a detectar inconsistências em padrões sintéticos. Uma perda contraditória é adicionada para exagerar pequenos desvios entre as representações originais e reconstruídas. Um discriminador é opcionalmente treinado para diferenciar códigos latentes reais dos reconstruídos, impondo uma distinção mais nítida no espaço latente.

Detecção de anomalias:
No momento da inferência, passe um quadro de teste pelo pipeline EDE duplo. Calcule três métricas: erro de reconstrução em pixels, discrepância de vetor latente e pontuação discriminatória adversarial (se usada). Calcule uma pontuação composta de anomalias como uma soma ponderada:
figure-protocol-31

Os quadros com pontuações de anomalia acima de um limite calibrado são sinalizados como possíveis eventos anormais. Esse mecanismo permite que o modelo detecte desvios sutis nos padrões de espaço visual e latente sem exigir nenhum rótulo de anomalia anotado.

figure-protocol-32
Figura 5: Arquitetura do modelo GANomaly adversário integrando EDE 1 e EDE 2. Esta figura ilustra o desenho do modelo de detecção de anomalias adversárias, que integra duas estruturas EDE - EDE1 para reconstrução e EDE2 para alinhamento de características latentes. O modelo emprega uma perda de consistência de vetor latente e treinamento contraditório por meio de um discriminador para impor semelhança entre as representações latentes da entrada e dos quadros reconstruídos. Essa arquitetura aprimora a detecção de anomalias aprendendo incorporações de recursos robustos para padrões normais de tráfego. Abreviaturas: EDE1 = Primeira estrutura codificador-decodificador-codificador para reconstrução; EDE2 = Segunda estrutura codificador-decodificador-codificador para alinhamento de recursos latentes. Clique aqui para ver uma versão maior desta figura.

Durante a detecção, nosso modelo empregou estas pontuações anômalas:

Acc(x̂) = ω1||z−z2||22||z−z1'||2 Abr (8)

A alteração dos parâmetros de peso (ω1+ ω2= 1) pode alterar a sensibilidade ajustando a proporção de verdadeiros positivos para falsos positivos. Em aplicações do mundo real, alterar esses dois parâmetros pode detectar acidentes com sensibilidades variadas em um experimento.

Durante o treinamento, cada quadro de entrada x é passado pelo Codificador E1 para gerar um vetor latente z. O vetor latente é então reconstruído via Decodificador D1, produzindo a imagem x̂1, que é posteriormente passada pelo Codificador E2 para obter um vetor latente reconstruído z. Paralelamente, z é decodificado pelo Decodificador D2 para produzir x̂2, que também é recodificado via E2 para produzir z2. Esse processo bidirecional preserva as informações em nível de pixel e latente para detecção de anomalias.

Algoritmo de teste de modelo:
figure-protocol-33={( x̂1,y 1),( x̂2,y 2),...,( x̂M*,yM*)},
Limiar φ,

Parâmetros de ponderação ω1, ω2
Saída: rótulo de previsão do conjunto de dados de teste
Ere = {y1pré, y2pré, ..., yF*pre}
for i =1to F* do
zi ← e1(xi)
x2i ← d2(zi)
z2i ← e2(x2i)
z1i' ← d1(z2i)
z1i' ← e2(z1i')
Acc(x̂i) ←ω1||zi−z2i||22||zi−z1i'||algarismo
ifAcc(x̂i) ≥φ então
eeu ← 1
mais
eeu ← 0
terminar
fim

O EDE usa o discriminador como um componente de aprendizado adversário para aumentar a precisão da detecção de anomalias, melhorando a capacidade do modelo de distinguir eventos normais e anormais. Ele aumenta o desempenho da seguinte maneira:

Discriminação de aprendizagem: O discriminador é treinado para diferenciar representações sintéticas e reconstruídas pela estrutura EDE dual. A otimização desse processo contraditório fornece ao modelo recursos latentes altamente discriminativos, melhorando a detecção de anomalias na cena do tráfego.

Remoção de reconstruções ruins: Por se desviarem muito dos padrões de tráfego, as anomalias geralmente geram problemas de reconstrução. O discriminador penaliza quadros reconstruídos incorretamente, melhorando a detecção de eventos normais/anormais da rede.

Aprimorando a representação de recursos com treinamento adversário: Ao integrar o aprendizado contraditório, o discriminador faz com que a rede EDE gere incorporações latentes mais duráveis e significativas. Isso detecta até mesmo pequenas alterações, como frenagem abrupta, colisões e desvio de veículos, melhorando a detecção de anomalias.

Remoção de falsos positivos: os codificadores automáticos tradicionais generalizam e normalizam anomalias, resultando em altas taxas de falsos positivos. O discriminador preserva os atributos das anomalias durante a reconstrução, identificando discrepâncias latentes entre quadros normais e anômalos.

Melhorando a classificação com processo de decisão em dois estágios: quadros reconstruídos normais ou anormais recebem pontuações de confiança do discriminador. Erros de classificação incorreta e perda de reconstrução são reduzidos nesta fase de verificação adicional, melhorando a precisão da detecção.

Usamos métodos comprovados de detecção de acidentes para testar a estratégia 23,24,25,26. Uma classe em um conjunto de dados multiclasse era normal e todas as outras classes de acidentes foram cuidadosamente examinadas usando uma versus todas as abordagens. O modelo foi treinado usando apenas dados de classe normal, enquanto o conjunto de teste usou dados de acidentes e normais. Os conjuntos de treinamento e teste foram divididos de duas maneiras.

Treinamos e testamos com 80% e 20% de dados de classe normal, respectivamente. Os resultados do teste de classe de acidente foram escolhidos aleatoriamente. A avaliação foi imparcial empregando amostras de teste de classe de acidente, que representam 20% dos dados de classe normal, para evitar a inclinação do modelo para a classe normal majoritária. O modelo pode ser testado em relação a um número igual de dados normais e de acidentes, representando condições práticas. Ele testa a generalização do modelo de forma imparcial, treinando com 80% dos dados normais e ocultando 20%. Isso também mostra que as ocorrências normais superam os acidentes na vida real, tornando importante expor o modelo a dados de acidentes pouco frequentes. A seleção aleatória de amostras de acidentes e o teste do modelo em todas as situações de acidente sem sobreajuste aumentam a robustez. A divisão de dados 80/20 é comum no aprendizado de máquina. Os dados de treinamento para padrões significativos e os dados de teste para avaliação de desempenho são balanceados.

Os experimentos usaram conjuntos de dados para treinamento e teste. A divisão de treinamento de classe normal foi usada para validação e treinamento. Os dados de teste de todas as classes foram testados.

A poda e a quantização do modelo reduzem muito o tamanho e a computação do modelo. O modelo reduzido tem a mesma precisão, mas desempenho inferior, pois compreende 40% menos parâmetros. Para dispositivos de borda com baixo poder de processamento, quantizar o modelo o compacta. Essa otimização atende às necessidades de precisão e recall de vigilância de tráfego em tempo real.

Projetos leves, como MobileNets e EfficientNet, aumentam as inferências em tempo real. Devido à sua precisão de visão computacional e computação mínima, esses tipos de arquitetura são amplamente utilizados. Em sistemas embarcados, esses modelos reduzem o processamento de quadros em 50%, mantendo fortes pontuações F1 de detecção de acidentes.

O uso de parâmetros semelhantes para reconstrução de imagens e detecção de acidentes utilizando aprendizado multitarefa pode simplificar o projeto. Isso reduziu o tempo de treinamento e o custo de computação sem afetar a precisão do modelo. O sistema de aprendizado multitarefa simplificou o aprendizado do modelo de processamento de dados de vídeo de tráfego.

O treinamento contraditório e auto-supervisionado produziu resultados comparáveis ao modelo básico de detecção de anomalias em menos tempo. As características dos acidentes de trânsito foram coletadas e generalizadas para melhorar a robustez dos dados não vistos.

O algoritmo de detecção de anomalias de tráfego proposto foi testado na Track-4, um dos cinco conjuntos de dados do AI City Challenge2021 27. As rodovias forneceram esses dados ao DOT de Iowa.

Avaliação comparativa de desempenho:
Para validar nosso modelo, nós o comparamos no conjunto de dados AI City Challenge Track 4 com modelos de última geração, incluindo GANomaly, f-AnoGAN, OCGAN e o método supervisionado da ByteDance. A Tabela 2 resume os resultados.

ModeloPontuação F1PrecisãoLembrarAUC
GANomaly0.870.880.860.9
OCGAN0.890.90.870.91
ByteDance (Sup.)0.910.930.890.92
Proposta (EDE duplo)0.940.950.930.94

Tabela 2: Comparação de métodos. A tabela compara os métodos de detecção de anomalias por pontuação F1, precisão, recall e exatidão. Os projetos EDE com e sem treinamento contraditório são comparados. Dois EDE mais treinamento adversário venceram BADU, ByteDance e WHU em todas as categorias. Os dados indicam que o aprendizado contraditório aumenta a detecção de anomalias.

O modelo EDE duplo supera todas as linhas de base, especialmente em recall - indicando maior sensibilidade a eventos anômalos raros.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Para avaliar a eficácia do método de detecção de anomalias de tráfego proposto, implementamos o modelo em um único videoclipe e geramos visualizações ilustrando o comportamento do sistema ao longo do tempo e dentro do espaço de recursos. Embora obtidos usando um pipeline EDE simulado, os resultados refletem de perto as conclusões qualitativas que seriam esperadas de um modelo real.

A linha do tempo da pontuação de anomalias descreve a confiança quadro a quadro do modelo na identificação de oco...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo apresenta um sistema de detecção de anomalias de tráfego baseado em deep learning que emprega uma arquitetura EDE, treinado de maneira não supervisionada para identificar acidentes com um ou vários veículos em vídeos de vigilância do mundo real. Ao modelar o comportamento típico do tráfego, o sistema detecta desvios como prováveis anomalias sem exigir dados de anomalias rotulados, abordando assim os desafios de escalabilidade e dispersão de dados no monitoramento inteligente ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram não haver conflitos de interesse.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta pesquisa não recebeu financiamento externo. Os autores gostariam de agradecer à Amrita School of Computing, Coimbatore, Índia, por fornecer o hardware necessário e o suporte inestimável na condução deste estudo.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Conjunto de dados AI City Challenge Track 4Desafio da Cidade da IA (https://www.aicitychallenge.org)Faixa 4, versão de 2021
Kit de ferramentas CUDADesenvolvedor NVIDIAVersão 11.3
Biblioteca cuDNNDesenvolvedor NVIDIACompatível com CUDA 11.3
Cluster de estação de trabalho de GPU (treinamento)Escola de Computação Amrita
Estação de trabalho local (nó de neblina)Escola de Computação Amrita
Matplotlibmatplotlib.orgVersão 3.3+
NVIDIA Jetson Nano (dispositivo de borda)NVIDIA945-13450-0000-100
GPU NVIDIA RTX 3060 (estação de trabalho)NVIDIAVaria de acordo com o fabricante
NumPynumpy.orgVersão 1.19+
OpenCVOpenCV.orgVersão 4.5+
Pandaspandas.pydata.orgVersão 1.1+
PitãoFundação de Software PythonVersão 3.8+
PyTorchPyTorch (https://pytorch.org)Versão 1.10+
Scikit-aprenderscikit-learn.orgVersão 0.24+
Ubuntu Linux (sistema operacional)Canonical Ltda.Versão 20.04 LTS

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Gannina, A. R. K., et al. A new approach to road incident detection leveraging live traffic data: An empirical investigation. Procedia Comput Sci. 235, 2288-2296 (2024).
  2. Khaleghi, A., Moin, M. -S. Improved anomaly detection in surveillance videos based on a deep learning method. IEEE. , 73-81 (2018).
  3. Tripathy, A. K., Sarkar, M., Sahoo, J. P., Li, K. C., Chinara, S. Road accident detection and severity determination from CCTV surveillance. Advances in distributed computing and machine learning. Lect Notes Netw Syst. , Springer. Singapore. (2021).
  4. Pang, G., Shen, C., Cao, L., Van den Hengel, A. Deep learning for anomaly detection: A review. ACM Comput. Surv. 54 (1), 1-38 (2021).
  5. Chalapathy, F., Zhang, L., Liu, H., Wang, Y., Zhao, Y. Deep learning for video anomaly detection: A review. arXiv preprint. , (2024).
  6. Gupta, A., Verma, S. Wave-GANomaly: A GAN-based anomaly detector using multi-feature fusion and wavelet transform. PLoS ONE. 18 (6), 1-18 (2023).
  7. Roy, D., Uddin, M. S., Bappy, S. M. Deep learning-based anomaly detection in video surveillance: A comprehensive review. Sensors. 23 (11), 5024-5047 (2023).
  8. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., et al. Proc 27th Int Conf Neural Inf Process Syst, Montreal, QC, , (2014).
  9. Alzahrani, A. B., et al. Unsupervised video anomaly detection in UAVs: A new approach. Front Sustain. Cities. 5, 1-10 (2023).
  10. Chalapathy, R., Chawla, S. Deep learning for anomaly detection: A survey. , Cornell University. (2019).
  11. Chen, H., Lin, J., Fang, M. Variational autoencoder for anomaly detection: A comparative study. arXiv preprint. , (2024).
  12. Schlegl, T., Seeböck, P., Waldstein, S. M., Langs, G., Schmidt-Erfurth, U. f-AnoGAN: Fast unsupervised anomaly detection with generative adversarial networks. Med Image Anal. 54, 30-44 (2019).
  13. Akcay, S., Atapour-Abarghouei, A., Breckon, T. P. Ganomaly: Semi-supervised anomaly detection via adversarial training. Comput Vis – ACCV 2018, Lect Notes Comput Sci. Jawahar, C., Li, H., Mori, G., Schindler, K. 11363, Springer. Cham. (2019).
  14. Ocgan: One-class novelty detection using GANs with constrained latent representations. Perera, P., Nallapati, R., Xiang, B. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, Long Beach, CA, , 2898-2906 (2019).
  15. Nayak, R., Mishra, S. K., Dalai, A. K., Pati, U. C., Das, S. K. A panoramic review on cutting-edge methods for video anomaly localization. IEEE Access. 12, 186380-186412 (2024).
  16. He, Z., Xu, X., Deng, S. Discovering cluster-based local outliers. Pattern Recognit Lett. 24, 1641-1650 (2003).
  17. Tax, D. M. J., Duin, R. P. W. Support vector data description. Mach Learn. 54, 45-66 (2004).
  18. Anomaly detection with robust deep autoencoders. Zhou, C., Paffenroth, R. C. Proc. 23rd ACM SIGKDD Int Conf Knowl Discov Data Min, Halifax, NS, , 665-674 (2017).
  19. Hojjati, H., Ho, T. K. K., Armanfard, N. Self-supervised anomaly detection in computer vision and beyond: A survey and outlook. Neural Netw. 172, 106106(2024).
  20. Donahue, J., Krähenbühl, P., Darrell, T. Adversarial feature learning. , Cornell University. (2016).
  21. El-Sayed, H. A., El-Horbaty, A. A cutting-edge video anomaly detection method using image quality assessment and attention mechanisms. Alex Eng J. 72, 689-701 (2024).
  22. Kiran, B. R., Thomas, D. M., Parakkal, R. An overview of deep learning-based methods for unsupervised and semi-supervised anomaly detection in videos. J Imaging. 4, 36(2018).
  23. Chow, J. K., Su, Z., Wu, J., Tan, P., Mao, X., Wang, Y. Anomaly detection of defects on concrete structures with the convolutional autoencoder. Autom Constr. 45, 101105(2020).
  24. Siegel, B. Industrial anomaly detection: A comparison of unsupervised neural network architectures. IEEE Sens Lett. 4 (8), 1-4 (2020).
  25. Uchida, M., Ishida, S., Tabaru, T., Miyamoto, H. Anomaly detection of rotary vacuum pump using thin AE sensor and reconstruction error of autoencoder. SICE Trans. 54 (7), 599-605 (2018).
  26. Khan, M. A., Ahmad, T., Siddiqui, N. A. A novel unsupervised video anomaly detection framework based on spatiotemporal features. PLoS ONE. 18 (4), 1-20 (2023).
  27. Iowa DOT anomaly dataset. , https://www.aicitychallenge.org/2021-data-and-evaluation (2021).
  28. Lee, K., Jung, D. Unsupervised video anomaly detection based on similarity with text descriptions. Sensors. 23 (14), 6256(2023).
  29. Kingma, D. P., Welling, M. Auto-encoding variational bayes. arXiv preprint. , (2013).
  30. Masci, J., Meier, U., Cireşan, D., Schmidhuber, J. Stacked convolutional auto-encoders for hierarchical feature extraction. Int Conf Artif Neural Netw. Honkela, T., Duch, W., Girolami, M., Kaski, S. , Springer. Berlin. 52-59 (2011).
  31. Fan, J., Zhang, Q., Zhu, J., Zhang, M., Yang, Z., Cao, H. Robust deep auto-encoding Gaussian process regression for unsupervised anomaly detection. Neurocomputing. 376, 180-190 (2020).
  32. Shvetsova, N., Bakker, B., Fedulova, I., Schulz, H., Dylov, D. V. Anomaly detection in medical imaging with deep perceptual autoencoders. IEEE Access. 9, 118571-118583 (2021).
  33. Unsupervised anomaly detection with generative adversarial networks to guide marker discovery. Schlegl, T., Seeböck, P., Waldstein, S. M., Schmidt-Erfurth, U., Langs, G. Int Conf Inf Process Med Imaging, , Springer. Cham. 146-157 (2017).
  34. Tuluptceva, N., Bakker, B., Fedulova, I., Konushin, A. Perceptual image anomaly detection. arXiv preprint. , (2019).
  35. Chen, C., Yuan, W., Xie, Y., Qu, Y., Tao, Y., Song, H., et al. Novelty detection via non-adversarial generative network. arXiv preprint. , (2020).
  36. Salehi, M., Eftekhar, A., Sadjadi, N., Rohban, M. H., Rabiee, H. R. Puzzle-AE: Novelty detection in images through solving puzzles. arXiv preprint. , (2020).
  37. Support vector method for novelty detection. Schölkopf, B., Williamson, R. C., Smola, A. J., Shawe-Taylor, J., Platt, J. Proc 12th Int Conf Neural Inf Process, Denver, CO, , 582-588 (1999).
  38. Marvasti-Zadeh, S. M., Cheng, L., Ghanei-Yakhdan, H., Kasaei, S. Deep learning for visual tracking: A comprehensive survey. IEEE Trans Intell Transp Syst. , 1-26 (2021).
  39. Van den Oord, A., et al. Conditional image generation with PixelCNN decoders. Adv Neural Inf Process Syst. 29, Barcelona. (2016).
  40. Deep one-class classification. Proc 35th Int Conf Mach Learn. PMLR. Ruff, L., et al. , PMLR. Stockholm. 4393-4402 (2018).
  41. Pidhorskyi, S., Almohsen, R., Doretto, G. Generative probabilistic novelty detection with adversarial autoencoders. Adv Neural Inf Process Syst. 31, Montreal, QC. (2018).
  42. The 5th AI city challenge. Naphade, M., et al. IEEE Conf Comput Vis Pattern Recognit Work, , (2021).
  43. Good practices and a strong baseline for traffic anomaly detection. Zhao, Y., Wu, W., He, Y., Li, Y., Tan, X., Chen, S. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 3993-4001 (2021).
  44. Box-level tube tracking and refinement for vehicles anomaly detection. Wu, J., Wang, X., Xiao, X., Wang, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4112-4118 (2021).
  45. Dual-modality vehicle anomaly detection via bilateral trajectory tracing. Chen, J., et al. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4016-4025 (2021).
  46. An efficient approach for anomaly detection in traffic videos. Doshi, K., Yilmaz, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4236-4244 (2021).
  47. A vision-based system for traffic anomaly detection using deep learning and decision trees. Aboah, A. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4207-4212 (2021).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Traffic Accident DetectionSurveillance VideosUnsupervised Anomaly DetectionDual Encoder DecoderAdversarial TrainingDeep Learning ArchitectureReconstruction LossGenerative Adversarial MechanismTraffic Behavior ModelingEmergency Response

Related Articles