Research Article

감시 비디오에서 감독되지 않은 교통 사고 감지를 위한 적대적 훈련이 포함된 듀얼 인코더-디코더-인코더

DOI:

10.3791/68731

September 5th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 작업은 자동화된 교통 사고 감지를 위한 이중 인코더-디코더-인코더(EDE) 모델을 제안합니다. 2단계 훈련 방법을 사용하여 정상적인 운전 패턴을 학습하고 생성적 대결을 통해 이상 징후를 식별합니다. 이 모델은 실제 영상에서 사고를 효과적으로 감지하고 미묘한 편차를 포착하여 운전자 행동에 대한 통찰력을 제공합니다.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

도로 안전을 강화하고 비상 대응을 개선하려면 실제 감시 영상에서 교통 사고를 가능한 한 빨리 감지해야 합니다. 기존 시스템은 수동 모니터링에 크게 의존하므로 시간이 많이 걸리고 오류가 발생하기 쉽습니다. 자동 사고 감지는 정상적인 운전 상황이 과도하게 대표되는 반면 사고는 드물고 다양하기 때문에 상당한 계급 불균형으로 인해 여전히 어려운 과제로 남아 있습니다. 이러한 경우 기존 컴퓨터 비전 시스템은 정상 이벤트와 비정상 이벤트를 안정적으로 구별할 수 없는 경우가 많습니다. 본 연구는 듀얼 인코더-디코더-인코더(EDE) 프레임워크를 기반으로 딥러닝 아키텍처를 개발하여 문제를 해결한다. 이 모델은 두 개의 공유 인코더-디코더 파이프라인을 사용하여 이미지 분포를 양방향의 지정된 잠재 분포에 매핑합니다. 이 프레임워크를 통해 시스템은 일반적인 교통 행동 패턴을 모델링하고 위험하거나 비정상적인 이벤트를 나타낼 수 있는 변화에 더욱 민감해질 수 있습니다. 이상 탐지를 더욱 개선하기 위해 2단계 훈련 기술이 제안됩니다. 첫 번째 단계에서 모델은 정상적인 행동을 특성화하기 위해 재구성 손실을 사용하여 정상적인 운전 이미지를 재구성하는 방법을 학습합니다. 두 번째 단계에서는 생성적 적대적 메커니즘이 도입됩니다: 한 EDE에서 재구성된 잠재 벡터가 다른 EDE로 전달되어 합성 이미지와 잠재 공간을 생성합니다. 이 프로세스는 실제 출력과 합성 출력 간의 차이를 증폭시켜 시스템이 잠재적인 이상 징후의 미묘한 징후에 더 잘 반응하도록 합니다. 이중 EDE 아키텍처와 적대적 훈련 방법론은 정상 및 병리학적 행동을 모두 모델링함으로써 현재 방법에 비해 상당한 발전을 나타냅니다. 실제 교통 감시 데이터 세트에 대한 실험 결과는 제안된 방법이 정확성과 견고성 측면에서 사고 및 안전하지 않은 운전 행동의 감지를 크게 향상시키는 것을 보여줍니다.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

세계보건기구(WHO)(2023)에 따르면 도로 교통 부상은 5-29세 어린이와 청소년의 주요 사망 원인이며, 매년 전 세계적으로 약 130만 명의 사망자가 보고됩니다. 이 놀라운 통계는도로 교통을 모니터링하고1, 실시간으로 이상 징후를 감지하고, 비상 대응 지연을 줄일 수 있는 자동화 시스템의 시급한 필요성을 강조합니다. 인공지능(AI)과 사물인터넷(IoT)을 스마트시티 인프라에 통합함으로써 지능형 교통 시스템의 개발이 가능해졌습니다. 폐쇄회로 텔레비전(CCTV)2,3 네트워크는 도시 교통에 대한 지속적인 감시를 제공하지만 수동 모니터링은 비실용적이고 오류가 발생하기 쉽습니다. 따라서 교통 사고 감지를 위한 확장 가능한 자동화된 솔루션이 필수적입니다.

차량 감지, 추적 및 행동 분류와 같은 교통 분석을 위한 전통적인 컴퓨터 비전 방법은 종종 지도 학습을 통해 훈련된 컨볼루션 신경망(CNN)을 사용합니다 4,5. 이러한 시스템에는 주석이 달린 광범위한 데이터 세트가 필요하며 실제 사고를 특징짓는 드물고 다양한 시나리오에 걸쳐 일반화하지 못하는 경우가 많습니다. 결과적으로 연구자들은 레이블이 지정된 이상 데이터에 의존하지 않는 감독되지 않은 이상 탐지 접근 방식으로 전환했습니다. 이 중 자동 인코더(AE)와 생성적 적대 신경망(GAN)은 정상 패턴을 모델링하고 편차를 식별하는 데 가능성을 보여주었습니다 6,7,8.

그러나 표준 AE는 입력이 비정상적인 경우에도 입력을 너무 충실하게 재구성하는 경향이 있어 높은 위음성률을 초래합니다 9,10. 변이 자동 인코더(VAE)11 및 f-AnoGAN12, GANomaly13 및 OCGAN14와 같은 GAN 기반 모델은 잠재 공간 모델링 및 적대 학습을 통합하여 이러한 문제 중 일부를 해결합니다. 그럼에도 불구하고 이러한 모델은 종종 이미지에서 잠재 공간15까지의 단방향 매핑에 의존하여 실제 교통 이상에서 미묘하거나 복잡한 불일치를 감지하는 능력을 제한합니다.

ByteDance16, WHU17 및 USF18이 AI City Challenge를 위해 개발한 것과 같은 감독 시스템은 시공간 추적19및 객체 중심 설계를 통해 높은 정확도를 달성합니다. 그러나 레이블이 지정된 사고 데이터와 복잡한 추적 파이프라인이 필요하므로 실시간으로 확장성과 적용 가능성이 떨어집니다.

모델주요 특징들제한성능(설명)
가노멀리자율인코더-디코더-인코더; 적대적 훈련비정상적인 입력도 너무 잘 재구성하여 거짓 부정으로 이어지는 경향이 있습니다.높은 정밀도와 균형 잡힌 재현율로 전반적으로 우수합니다.
옥간자율잠재공간이 제한된 1클래스 GAN미묘하거나 복잡한 이상 징후를 감지하는 데 어려움을 겪습니다.GANomaly보다 약간 우수하며 메트릭 간의 균형이 개선되었습니다.
에프-아노간자율GAN 및 기능 매칭을 사용한 빠른 이상 탐지잠재 공간에서 복잡한 이상 현상을 포착하는 제한된 능력보통 성능(특정 점수는 제공되지 않음)
바이트댄스감독객체 수준 이상 현지화를 통한 시공간 추적레이블이 지정된 학습 데이터가 필요합니다. 실제 환경에서 제한된 확장성매우 높은 정확도와 정밀도; 약간 낮은 감도
바두감독백그라운드 모델링 및 차량 추적 사용다양한 장면에서 덜 효과적입니다. 미묘한 이상 현상을 놓친다견고한 정확도; 균형은 좋지만 상위 방법보다 낮습니다.
WHU감독이중 양식 궤적 추적불량한 일반화 및 낮은 이상 현상률전반적으로 성능이 약함, 특히 이상 징후 감지
USF감독배경 모델링과 구조적 유사성 분석을 결합합니다.이상 징후를 정확하게 식별하는 데 서투른매우 낮은 정확도 및 감도
제안됨(Dual-EDE)자율듀얼 인코더-디코더-인코더; 적대적 및 대조적 손실이 있는 양방향 잠재 매핑높은 계산 부하; RGB 입력으로 제한됨우수한 성능; 최고의 정밀도, 높은 재현율 및 메트릭 전반에 걸친 강력한 균형

표 1: 비디오 기반 트래픽 이상 탐지 관련 작업 요약.

1은 교통 감시에 사용되는 필수 이상 탐지 방법을 대조하여 아키텍처, 장점, 단점 및 성능을 강조합니다. GANomaly 및 OCGAN과 같은 기존 GAN 기반 모델은 효과적인 비지도 감지를 수행할 수 있지만 미묘한 이상으로 인해 어려움을 겪습니다. 지도 방법은 매우 정확하지만 레이블이 지정된 데이터와 정교한 추적에 크게 의존합니다. 제안된 Dual-EDE 모델은 양방향 잠재 공간 인코딩을 적대적 및 대조적 훈련과 통합하여 레이블이 지정된 데이터 없이 드물고 미묘한 트래픽 이상을 감지할 수 있도록 하여 확장성과 견고성을 모두 제공합니다.

연구 격차와 가설
비지도 모델은 레이블이 지정된 이상 징후의 필요성을 완화하지만 여전히 드물고 미묘하며 영향이 큰 교통 이벤트를 정확하게 감지하는 데 어려움을 겪고 있습니다. 현재의 방법은 아키텍처의 비대칭성과 잠재 공간 불일치를 완전히 활용할 수 없다는 점에 의해 제한됩니다. 또한 많은 사람들이 매우 역동적인 교통 환경에서 복잡한 정상적인 동작과 실제 이상 현상을 강력하게 구별하지 못합니다.

우리는 2단계 훈련 전략과 결합된 일반 교통 데이터로만 훈련된 이중 인코더-디코더-인코더(EDE) 아키텍처가 다양하고 미묘한 교통 이상 현상을 감지하는 데 최첨단 모델을 능가할 수 있다는 가설을 세웁니다. 양방향 잠재 일관성을 적용하고 적대적 재구성을 통합함으로써 시스템은 주석이 달린 사고 데이터 없이도 급제동, 불규칙한 방향 전환 또는 충돌과 같은 예상 동작에서 미세한 편차에 더 민감해집니다.

제안된 방법
우리는 이중 EDE 아키텍처를 기반으로 구축된 새로운 비지도 이상 탐지 프레임워크를 제안합니다. 단일 인코딩-디코딩 파이프라인을 사용하는 기존 모델과 달리 우리 시스템은 이미지와 잠재 표현 간의 양방향 매핑을 수행하는 두 개의 EDE 경로를 사용합니다. 이 설계를 통해 모델은 정상적인 교통 역학의 풍부한 기능을 학습하고 이상 현상이 발생할 때 불일치를 증폭시킬 수 있습니다. 교육 프로세스는 두 단계로 구성됩니다.

1단계에서는 재구성 손실을 사용하여 표준 자동 인코더 훈련과 유사한 정상적인 동작을 모델링합니다.

2단계에서는 한 EDE의 잠재 벡터가 두 번째 EDE로 전달되어 합성 데이터를 생성하는 생성적 적대적 메커니즘을 도입하여 시스템이 이미지 영역과 잠재 영역 모두에서 실제 표현과 가짜 표현 간의 구별을 극대화하도록 합니다.

주요 기여
향상된 이상 탐지를 위해 양방향 매핑을 통해 잠재적인 불일치를 포착하는 이중 EDE 아키텍처를 도입합니다. 우리는 미묘한 편차에 대한 민감도를 향상시키기 위해 자동 인코더 재구성과 적대적 학습을 결합한 2단계 훈련 절차를 개발합니다. 우리는 AI City Challenge(트랙 4) 데이터 세트에 대한 실험을 통해 이 모델이 여러 최첨단 지도 및 비지도 기준선을 능가하여 실제 도시 환경에서 강력하고 확장 가능한 사고 감지를 달성한다는 것을 입증했습니다. 요약하자면, 이 작업은 교통 이상 탐지에 대한 확장 가능하고 정확하며 라벨이 없는 접근 방식을 제공하여 보다 안전하고 반응성이 뛰어난 스마트 교통 시스템에 기여합니다.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

체계

설치
우리는 제안된 트래픽 이상 탐지 시스템을 계층적 분산 컴퓨팅 프레임워크 내에 배포하여 인텔 Tiber Cloud 환경을 활용했습니다. 이 아키텍처는 엣지, 포그, 클라우드의 세 가지 계층으로 구성되어 컴퓨팅 노드 전반에 걸쳐 짧은 대기 시간 추론, 확장 가능한 학습 및 효율적인 리소스 할당을 보장합니다.

엣지 계층: 실시간 이상 탐지는 경량의 GPU 지원 임베디드 디바이스(예: NVIDIA Jetson Nano 또는 GPU가 통합된 동급의 Intel 기반 플랫폼)를 사용하여 엣지에서 수행됩니다. 이러한 장치는 감시 카메라와 함께 배치되었으며 대기 시간을 최소화하면서 프레임별 추론을 실행하여 분산되고 반응성이 뛰어난 교통 모니터링을 가능하게 했습니다.

안개 계층: 배치 추론 및 실시간 모델 개선을 포함하여 컴퓨팅 집약적인 작업이 더 많은 작업은 인텔 Tiber Cloud 내에서 전용 가상 머신 또는 베어메탈 인스턴스로 프로비저닝된 포그 노드에 의해 처리되었습니다. 각 포그 노드는 최소 16GB RAM이 있는 Intel Xeon 프로세서로 구성되었으며 Intel 통합 또는 개별 GPU 가속에 액세스할 수 있었습니다. 이 중간 계층은 중앙 서버의 자율성을 유지하면서 데이터 소스 근처에서 처리량이 많은 작업을 가능하게 했습니다.

클라우드 계층: 대규모 교육 및 보관을 위해 클라우드 계층은 Intel Tiber의 AI 최적화 서비스를 통해 제공되는 확장 가능한 컴퓨팅 클러스터를 활용합니다. 인텔 하바나 가우디 가속기 또는 인텔 제온 스케일러블 프로세서가 장착된 인스턴스는 광범위한 비디오 데이터 세트에서 심층 신경망을 훈련하고 모델 버전 관리, 장기 스토리지 및 시스템 전체 오케스트레이션을 지원하는 데 사용됩니다.

전체 소프트웨어 스택은 가속화된 계산을 위해 인텔에 최적화된 라이브러리를 사용하여 Python 3.8+ 환경에서 작동합니다. 기본 프레임워크에는 PyTorch(PyTorch용 Intel 확장 포함), 이미지 및 비디오 전처리를 위한 OpenCV, 평가를 위한 Scikit-learn이 포함됩니다. GPU 가속은 적절한 oneAPI 툴킷 및 DAAL 최적화를 통해 활성화됩니다.

배포 시 듀얼 EDE 아키텍처가 포함된 리포지토리를 복제하고 모델 구성 요소(인코더 2개(E1, E2)와 디코더 2개(D1, D2))를 초기화했습니다. .to(device) 방법을 사용하여 로컬 리소스 가용성에 따라 구성 요소를 최적의 처리 장치(CPU, GPU 또는 Gaudi 가속기)로 동적으로 전송했습니다.

구성 스크립트에서 에포크 수, 학습률, 손실 균형 계수(γ, δ) 및 이상 민감도 임계값(ω1, ω2)을 포함한 훈련 및 평가 매개변수를 선언했습니다. 훈련을 위해 우리는 (1) 정상적인 교통 행동을 학습하기 위한 표준 자동 인코더 재구성과 (2) 교차 EDE 상호 작용을 사용하여 이상 징후를 증폭하기 위한 적대적 잠재 재구성의 2단계 프로토콜을 따랐습니다.

이 모듈식 클라우드 네이티브 시스템 아키텍처는 인텔 Tiber Cloud를 통해 실제 지능형 교통 환경에서 강력한 실시간 이상 탐지, 모델 확장성 및 안정적인 배포를 가능하게 했습니다.

데이터 세트
제안된 이상 탐지 시스템을 훈련하고 평가하기 위해 NVIDIA AI City Challenge 2021, 트랙 4(교통 이상 징후)에서 제공한 데이터 세트를 사용했습니다. 데이터 세트는 100개의 교육 비디오와 150개의 테스트 비디오로 구성되어 있으며 각각 평균 15분 동안 30fps 및 410p 해상도로 녹화됩니다. 각 비디오는 도로 유형, 카메라 각도, 조명 및 기상 조건의 변화로 인해 고유한 난이도를 제시합니다. 이 데이터 세트는 다양한 카메라 각도에서 광범위한 도로 인프라(예: 다차선 고속도로, 교차로), 교통 밀도 및 기상 조건(예: 맑음, 비, 황혼)을 캡처합니다. 이러한 속성은 이상 탐지 모델의 일반화 가능성을 평가하는 데 이상적인 벤치마크가 됩니다.

전처리
감독되지 않은 조건에서 모델을 학습하려면 정상적인(사고가 아닌) 교통 장면만 사용하여 학습 중에 비정상적인 이벤트에 노출되지 않도록 합니다. OpenCV를 사용하여 비디오 전처리를 수행합니다. 5fps에서 균일하게 샘플링 프레임을 사용하여 중복성을 줄이면서 충분한 시간적 범위를 보장합니다. 프레임 크기를 128 x 128 픽셀로 조정하여 듀얼 EDE 네트워크의 입력 요구 사항을 일치시키고 시각적 세부 사항과 계산 효율성의 균형을 맞춥니다. 픽셀 값을 [-1, 1] 범위로 정규화하여 학습 안정성을 향상시킵니다.

일반화를 개선하고 실제 변동성을 시뮬레이션하려면 무작위 확률로 각 훈련 프레임에 다음 증강 기술을 적용합니다.

무작위 자르기 및 크기 조정: 임의의 하위 영역을 자르고 원래 해상도로 다시 축소하여 물체 크기, 부분 가시성 및 공간 위치 이동에 대한 불변성을 장려하고 감시 비디오의 확대/축소 효과 및 중심에서 벗어난 피사체를 모방합니다.

밝기 및 대비 변조: 선형 또는 감마 기반 변환을 적용하여 그림자, 눈부심, 일출/일몰 변화 및 인공 조명과 같은 조명 변화를 모방합니다. 이렇게 하면 주간 및 계절적 조명 변동에 대한 모델의 탄력성이 향상됩니다.

가우스 노이즈 주입 및 모션 블러: 다양한 표준 편차가 있는 가우스 노이즈를 추가하여 센서 노이즈 및 압축 아티팩트를 시뮬레이션합니다. 다양한 방향과 크기를 향하는 컨볼루션 커널을 사용하여 모션 블러를 시뮬레이션하여 움직이는 물체나 카메라 흔들림의 효과를 에뮬레이션하며, 이는 특히 빠르게 변화하는 교통 장면과 관련이 있습니다.

무작위 폐색 마스킹: 프레임 위에 임의의 크기와 위치의 검은색 또는 회색 직사각형 패치를 겹쳐서 합성 폐색을 적용합니다. 이 증강은 보행자, 인프라 요소 또는 시야를 가리는 지나가는 차량과 같은 실제 장애물을 시뮬레이션합니다. 이는 모델이 컨텍스트에서 학습하고 누락되거나 왜곡된 영역에 대해 견고성을 유지하도록 장려합니다.

PyTorch 변환 파이프라인을 사용하여 훈련 중에 이러한 증강을 동적으로 적용하여 각 배치에 증강 프레임의 다양한 조합이 포함되도록 하여 다양한 패턴에 대한 노출을 촉진하고 과적합을 줄입니다.

PyTorch의 DataLoader를 사용하여 처리된 프레임을 로드하여 일괄 처리, 셔플링 및 병렬 로딩을 관리합니다. GPU 용량에 따라 32에서 64 사이의 배치 크기로 학습합니다. 추론 및 이상 징후 점수를 매기기 위해 프레임을 개별적으로 처리(배치 크기 = 1)하여 정확한 프레임 수준 감지를 가능하게 합니다.

이 전처리 및 증강 파이프라인은 견고성과 일반화를 개선하여 모델이 다양하고 시끄러운 실제 트래픽 모니터링 환경에서 비정상적인 동작을 효과적으로 감지할 수 있도록 합니다.

제안된 방법:
제안된 EDE 시스템은 이미지 분포와 잠재 공간 사이의 양방향 매핑을 학습합니다. 2개의 인코더와 2개의 디코더를 통해 강력한 특징 추출 및 이상 구분이 가능합니다. 네트워크는 재구성 단계와 적대적 단계 모두에서 훈련됩니다. 대조 학습, 정규화 및 기울기 페널티는 모드 붕괴를 방지하고 GAN 훈련 견고성을 향상시키는 데 사용됩니다.

EDE 프레임워크는 다음과 같이 작동합니다. 인코더 1(E1)은 이미지 특징을 잠재 공간으로 인코딩합니다. 첫 번째 디코더(D1)는 재구성 손실을 최소화하기 위해 잠재 벡터에서 이미지를 재구성합니다. 그런 다음 재구성된 이미지는 잠재 공간에 다시 매핑되어 불일치를 포착합니다. 두 번째 디코더(D2)는 두 번째 잠재 공간에서 합성 이미지를 생성하여 모델이 실제 데이터와 합성 데이터를 구별하는 데 도움을 줍니다. 이 양방향 매핑은 픽셀 수준 차이가 아닌 잠재 공간 불일치를 기반으로 이상 징후를 감지합니다.

1단계: 재건 교육: 자동 인코더는 정상적인 교통 이미지를 재구성하도록 훈련되었으므로 비정상적인 입력은 상당한 재구성 오류를 생성합니다. 손실 함수는 입력 이미지, 잠재 인코딩 및 재구성된 이미지를 고려합니다.

적대적 훈련: 재건 훈련 후 적대적 학습이 적용됩니다. 재구성된 잠재 벡터는 대체 EDE 구조를 통과하여 합성 이미지와 잠재 벡터를 생성합니다. 목표는 실제 이미지와 합성 이미지 간의 차이를 최대화하는 것입니다. Encoder 2(E2)에 의한 이상 감지를 향상시키기 위해 잠재 벡터를 변경 및 재구성합니다. 인코더 붕괴를 방지합니다.

학습은 E1 및 E2가 동일한 매핑에 수렴되는 것을 방지하도록 설계되어 식별 기능이 감소합니다.

대조 학습: 손실 함수는 실제 표현과 재구성된 표현을 구분하며, 여백 하이퍼파라미터는 특징의 분리를 제어합니다.
정규화 기법에는 다음이 포함됩니다.

드롭아웃: 과적합을 방지하기 위해 뉴런을 무작위로 비활성화합니다.
무게 감소: 기능 학습을 안정화하기 위해 큰 가중치에 페널티를 부과합니다.

적대적 훈련 안정성(20 ) 및 모드 붕괴 방지 방법은:
그라데이션 페널티: 판별자 행동을 규제합니다.
데이터 증강: 다양한 조건을 시뮬레이션하기 위한 무작위 자르기, 크기 조정 및 조정 가능한 조명.
소음 주입: 사실적인 노이즈, 모션 블러 및 오클루전을 추가하여 일반화를 개선합니다.
조기 중지: 과적합을 방지하기 위해 검증 손실이 크게 변동하는 경우 학습을 중지합니다.

이러한 아키텍처 개선 사항, 교육 방법 및 복원력 측정은 안정적인 트래픽 이상 탐지를 보장합니다.

비지도 사고 감지 네트워크는 정상 샘플에 대해서만 훈련되고 정상 샘플과 사고 샘플 모두에서 테스트됩니다. 공식적 으로:

모든 정상 및 사고 비디오 집합에서 F 개의 일반 프레임(E = {x1, x2})만 있는 대규모 훈련 데이터 세트 E를 고려합니다. .., xM } 및 정상 및 사고 사진(Ê=[( x̂1,y1), (x̂2,y2), (x̂F*,yF*)]), 프레임을 모두 포함하는 더 작은 테스트 데이터 세트 Ê, 여기서 yi figure-protocol-1[0, 1]는 프레임 레이블 이미지입니다. F figure-protocol-2F* 훈련의 경우 훈련 데이터 세트는 테스트 데이터 세트보다 훨씬 커야 합니다. 데이터 세트 매니폴드(E)를 학습한 후 추론 중에 Ê의 사고 프레임을 이상치로 식별합니다. 모델 f 는 학습된 정규 데이터 분포를 기반으로 사고 점수 Acc(x)를 계산합니다. 사고 점수가 높은 테스트 이미지 x는 사고일 수 있습니다. 판단 기준은 Acc(x)가 > φ인 경우 사고 점수 임계값(φ)을 기반으로 합니다.

네트워크 아키텍처:
그림 1에서 볼 수 있듯이 GANomaly 모델21에는 2개의 인코더, 1개의 디코더 및 1개의 판별기가 포함되어 있습니다. 많은 연구자들이 잠재 벡터를 구별하고 시각적 이상을 감지하기 위해 이 방법을 채택했습니다12,22. 두 개의 인코더와 단일 디코더는 모델의 그림과 잠재 벡터를 상호 수정합니다. 이러한 비정상적인 사실은 변환 중에 표시됩니다. 판별자는 생성된 이미지를 원본에서 나눕니다. GANomaly는 인코딩, 디코딩 및 재인코딩에 의존합니다.

figure-protocol-3
그림 1: 정보의 흐름을 보여주는 GANomaly 아키텍처. 이 아키텍처는 생성적 적대적 네트워크 내에 통합된 인코더-디코더-인코더 프레임워크로 구성됩니다. 첫 번째 인코더는 입력 비디오 프레임을 잠재 공간 표현으로 압축한 다음 디코더에 의해 재구성됩니다. 두 번째 인코더는 재구성된 프레임을 잠재 공간에 다시 매핑합니다. 판별자는 입력 기능과 재구성된 기능 간의 차이를 평가하여 이상 징후 점수를 계산합니다. 화살표는 네트워크를 통한 데이터의 방향 흐름을 나타냅니다. 약어: GAN = 생성적 적대적 네트워크. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 2 는 2개의 인코더와 1개의 디코더가 있는 EDE 아키텍처를 보여줍니다. EDE 구조는 비디오 사고를 감지하기 위해 매개변수를 지속적으로 변경해야 합니다. EDE 구조에 두 번째 디코더를 추가하고 인코더를 공유하여 두 가지 네트워크 구성으로 그림 2 의 모델을 생성하도록 했습니다. 두 개의 인코더에는 4개의 컨볼루션 레이어가 있습니다. 출력 계층을 제외한 모든 계층에 대해 LeakyReLU 활성화 함수를 사용했으며, 출력 계층은 tanh 활성화를 사용하여 출력을 -1과 1 사이로 바인딩했습니다. 배치 정규화는 여러 컨볼루션 레이어 후에 적용되었습니다. 디코더(그림 3그림 4)는 인코더와 유사하지만 각 계층 대신 ConvTranspose 및 추가 배치 정규화를 사용합니다.

figure-protocol-4
그림 2: 정보 흐름이 있는 제안된 EDE 기반 아키텍처. EDE 아키텍처는 두 개의 인코더와 디코더를 통한 비디오 프레임의 흐름을 보여줍니다. 첫 번째 인코더(E1)는 입력 프레임을 잠재 표현으로 압축한 다음 디코더(D1)에 의해 재구성됩니다. 재구성된 출력은 두 번째 인코더(E2)를 통과하여 두 번째 잠재 벡터를 얻습니다. 잠재 벡터와 재구성 품질 간의 불일치는 적대적 및 대조적 손실 구성 요소에 의해 지원되는 이상 감지에 사용됩니다. 약어: EDE = 인코더-디코더-인코더. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

네트워크 아키텍처 세부 정보:
듀얼 EDE 모델은 두 개의 인코더-디코더-인코더 파이프라인으로 구성되며, 각각 동일한 구조를 가지며 훈련 중에 공동으로 최적화됩니다.

인코더 아키텍처(E1, E2)

입력: 128×128×3 RGB 프레임

계층 1: Conv2D(필터 64개, 커널 4×4, 보폭 2, 패딩 1) → LeakyReLU(α = 0.2)

레이어 2: Conv2D(필터 128개, 4×4, 보폭 2, 패딩 1) → BatchNorm → LeakyReLU

레이어 3: Conv2D(필터 256개, 4×4, 보폭 2, 패딩 1) → BatchNorm → LeakyReLU

계층 4: Conv2D(512개 필터, 4×4, 보폭 2, 패딩 1) → BatchNorm → LeakyReLU

레이어 5: 평탄화→ 조밀한 잠재 벡터(z figure-protocol-5^100)

디코더 아키텍처(D1, D2)

입력: z figure-protocol-6^100 → 밀도 → 8×8×512로 모양 변경

레이어 1: TransposedConv2D(256개 필터, 4×4, 보폭 2, 패딩 1) → BatchNorm → ReLU

레이어 2: TransposedConv2D(128개 필터, 4×4, 보폭 2, 패딩 1) → BatchNorm → ReLU

레이어 3: TransposedConv2D(64개 필터, 4×4, 보폭 2, 패딩 1) → BatchNorm → ReLU

레이어 4: TransposedConv2D(필터 3개, 4×4, 보폭 2, 패딩 1) → Tanh

재구성된 이미지는 두 번째 인코더를 통해 재인코딩되어 잠재 표현을 얻고, 원본 잠재 벡터와 재구성된 잠재 벡터 간의 불일치는 이상 징후 점수에 사용됩니다.

활성화 및 정규화
인코더는 LeakyReLU 활성화 및 일괄 처리 정규화를 사용합니다. 디코더는 Tanh을 적용하여 출력을 [-1, 1] 범위로 정규화하는 최종 계층을 제외하고 ReLU 활성화를 사용합니다.

상실 함수
이미지 재구성 손실: ǀǀ x −ǀǀ2
잠재 일관성 손실: ǀǀ z −ǀǀ2

적대적 손실: 네트워크가 실제 잠재 코드와 재구성 중에 생성된 잠재 코드를 구별하도록 강제하여 실제 재구성과 합성 재구성 간의 차이를 최대화하기 위해 2단계에서 도입되었습니다.

이 아키텍처는 픽셀 공간과 잠재 공간의 불규칙성을 모두 포착하여 비정상적인 운전 행동을 나타내는 미묘한 편차를 감지할 수 있습니다.

두 단계로 구성된 교육
2단계 네트워크 훈련 방법이 사용됩니다. 이미지 및 잠재 벡터 재구성 모두에 대해 두 개의 EDE 구조가 훈련됩니다. 두 번째 단계에서 인코더 2는 인코더 1을 속여 데이터를 실제 또는 재구성된 것으로 잘못 분류하려고 시도합니다.

초기 재건 교육
EDE 구조는 입력 이미지와 잠재 벡터를 복제하도록 훈련됩니다. 입력 x는 인코더 E1에 의해 잠재 벡터 z로 인코딩됩니다. D1과 D2 모두 z를 디코딩하여 이미지, x1 및 x2를 생성합니다. 두 개의 재구성된 그림(x1 및 x2)을 전달한 후 인코더 E2에서 두 개의 잠재 벡터(z1 및 z2)를 얻었습니다. 이 단계에는 다음과 같은 교육 목표가 포함되어 있습니다.

LEDE1 = γ ǀǀ x −x1ǀǀ2+δ ǀǀ z −z1ǀǀ2 (1)
LEDE2 = γ ǀǀ x−x2ǀǀ2+δ ǀǀ z −z2ǀǀ2 (2)

이러한 재구성된 이미지는 인코더 E2를 통과하여 잠재 벡터 z1 및 z2를 얻습니다. 교육 목표:
가중치 계수(γ, δ)는 손실 성분이 목적 함수에 미치는 영향에 결정적인 영향을 미칩니다.

둘째, 적대적 방법을 사용하여 두 개의 Encoder-Decoder-Encoder 구조를 훈련했습니다.
여기서 γ와 δ는 재구성 및 잠재 일관성 손실의 기여도를 평가하는 매개변수입니다.

적대적 훈련
두 개의 EDE 구조가 적대적으로 훈련됩니다. 데이터에서 인코더 2를 인식하는 방법을 배웁니다. EDE2는 그 반대이기 때문에 EDE1을 속여야 합니다. D1은 첫 번째 단계에서 z2를 디코딩하고 x1'을 재구성합니다. 인코더 E2에 x1'을 반복하면 z1'이 생성됩니다. 무대 훈련 목표는 다음과 같습니다.

최소 최대 γ ǀǀ x −x 1'ǀǀ +δ ǀǀ z -z1'ǀǀ 2 (3)
EDE2 EDE1

두 EDE 구조에는 다음과 같은 손실 함수가 있습니다.
LEDE1 = −γ ǀǀ x -x 1'ǀǀ 2 −δǀǀ z - z1'ǀǀ 2 (4)
LEDE2 = +γ ǀǀ x - x 1'ǀǀ 2+δ ǀǀ z - z1'ǀǀ 2 (5)

γ 및 δ 값은 이전에 지정한 매개변수와 일치합니다.

figure-protocol-7
그림 3: 인코더 구조. 제안된 EDE 아키텍처에 사용된 인코더 네트워크는 입력 비디오 프레임에서 시공간 특징을 추출합니다. 이는 배치 정규화 및 ReLU 활성화에 이어 여러 컨볼루션 레이어로 구성되어 계층적 표현을 캡처하면서 공간 차원을 점진적으로 줄입니다. 최종 잠재 벡터는 이상 탐지에 필수적인 높은 수준의 의미 정보를 인코딩합니다. 약어: ReLU = 정류 선형 장치, EDE = 인코더-디코더-인코더. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

각 EDE는 제안된 구조에 대해 두 가지 손실 함수를 제공합니다. 1단계에서 EDE1은 x 및 z 재구성 손실을 줄여야 합니다. EDE1은 잠재 벡터 z와 z1', x와 x1' 사이의 2상 분산을 최적화해야 합니다. EDE2 및 EDE1은 1상 x 및 z 재구성 오류를 줄입니다. EDE1은 2단계에서 z와 z1', x와 x1' 사이의 차이를 줄여야 하지만 그 반대가 발생해야 합니다.

figure-protocol-8
그림 4: 디코더 구조. 제안된 EDE 아키텍처의 디코더 구성 요소는 잠재 기능에서 입력 프레임을 재구성합니다. 이는 원래 프레임 해상도로 기능 맵을 점진적으로 업샘플링하는 일련의 전치된 컨볼루션 레이어로 구성됩니다. 디코더는 정상적인 교통 장면을 정확하게 재구성하는 방법을 학습하여 시스템이 재구성 오류를 기반으로 이상 징후를 식별할 수 있도록 합니다. 약어: EDE = 인코더-디코더-인코더. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

각 EDE 모델 이중 학습 목표에는 시간이 지남에 따라 변경되는 가중치가 있는 손실 함수가 포함됩니다.

LEDE1=(γ||엑스−엑스1||2+δ||zz1||2)(1)(γ||xx1''||2+δ||zz1''||2) (6)
LEDE2=(γ||엑스−엑스1||2+δ||zz1||2)+(1)(γ||xx1''||2+δ||zz1''||2) (7)

학습 기간 수는 n입니다.

알고리즘 1은 2단계 학습을 보여줍니다.
입력:
데이터 세트 E의 모든 일반 이미지 = {x1, x2, . . . , xF},
에포크 N,
가중치 매개변수 γ, δ
출력:
훈련된 인코더-디코더-인코더 1,
인코더-디코더-인코더 2
e1, e2, d1, d2 ←초기화
무게
n ←1
반복하다
f = 1에서 F의 경우 do
zf←e1(xf)
         figure-protocol-9←d1(zf)
         figure-protocol-10←d2(zf)
         figure-protocol-11←e2(figure-protocol-12)
         figure-protocol-13←e2(figure-protocol-14)
         figure-protocol-15←d1(figure-protocol-16)
         figure-protocol-17←e2(figure-protocol-18)'
LEDE1figure-protocol-19(γ||엑스에프figure-protocol-20||2+δ||zffigure-protocol-21||2) −(1−figure-protocol-22)(γ||xffigure-protocol-23'||2+ δ||zffigure-protocol-24'||2)
LEDE2figure-protocol-25(γ||엑스에프figure-protocol-26||2+δ||zffigure-protocol-27||2) +(1−figure-protocol-28) (γ||xffigure-protocol-29'||2+ δ||zffigure-protocol-30'||2)
e1, e2, d1, d2←업데이트 가중치
LEDE1및 LEDE2 사용

n ←n + 1
n = N까지

학습 단계 및 변칙 검색 기준
훈련을 두 개의 순차적 단계로 나눕니다.

1단계 - 재건 학습:
두 EDE 파이프라인 모두 정상적인 교통 장면에서만 훈련됩니다.

입력 이미지는 인코더 1 → 디코더 1 → 인코더 2를 통과합니다(그림 5).

이 모델은 이미지 재구성 손실과 잠재 일관성 손실을 최소화합니다. 이 단계를 통해 네트워크는 정상적인 동작을 위해 콤팩트하고 일관된 잠재 공간을 학습할 수 있습니다.

2단계 - 생성적 대결 학습:

디코더 1에서 재구성된 잠재 벡터는 디코더 2에 입력된 다음 인코더 1을 통해 다시 인코딩됩니다. 이 순환 흐름은 모델이 합성 패턴의 불일치를 감지하는 데 도움이 됩니다. 원래의 표현과 재구성된 표현 사이의 작은 편차를 과장하기 위해 적대적 손실이 추가됩니다. 판별자는 선택적으로 실제 잠재 코드와 재구성된 잠재 코드를 구별하도록 훈련되어 잠재 공간에서 더 선명한 구별을 강제합니다.

이상 탐지:
추론 시 이중 EDE 파이프라인을 통해 테스트 프레임을 통과합니다. 세 가지 메트릭을 계산합니다: 픽셀별 재구성 오류, 잠재 벡터 불일치 및 적대적 판별기 점수(사용되는 경우). 복합 변칙 점수를 가중 합계로 계산합니다.
figure-protocol-31

보정된 임계값을 초과하는 이상 점수가 있는 프레임은 잠재적인 비정상 이벤트로 플래그가 지정됩니다. 이 메커니즘을 통해 모델은 주석이 달린 이상 레이블 없이 시각적 및 잠재 공간 패턴의 미묘한 편차를 감지할 수 있습니다.

figure-protocol-32
그림 5: EDE 1과 EDE 2를 통합하는 적대적 GANomaly 모델의 아키텍처. 이 그림은 재구성을 위한 EDE1과 잠재 특징 정렬을 위한 EDE2라는 두 개의 EDE 구조를 통합하는 적대적 이상 탐지 모델의 설계를 보여줍니다. 이 모델은 잠재 벡터 일관성 손실과 판별자를 통한 적대적 훈련을 사용하여 입력 프레임과 재구성된 프레임의 잠재 표현 간의 유사성을 강화합니다. 이 아키텍처는 정상적인 트래픽 패턴에 대한 강력한 기능 임베딩을 학습하여 이상 탐지를 향상시킵니다. 약어: EDE1 = 재구성을 위한 최초의 인코더-디코더-인코더 구조; EDE2 = 잠재 기능 정렬을 위한 두 번째 인코더-디코더-인코더 구조. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

탐지하는 동안 우리 모델은 다음과 같은 비정상적인 점수를 사용했습니다.

Acc(x̂) = ω1||z−z2||22||z−z1'||2 (8)

가중치 매개변수(ω1+ ω2= 1)를 변경하면 참 긍정 대 거짓 긍정 비율을 조정하여 감도를 변경할 수 있습니다. 실제 응용 분야에서 이 두 매개변수를 변경하면 한 번의 실험에서 다양한 민감도를 가진 사고를 감지할 수 있습니다.

훈련하는 동안 각 입력 프레임 x는 인코더 E1 을 통과하여 잠재 벡터 z를 생성합니다. 그런 다음 잠재 벡터는 디코더 D1을 통해 재구성되어 이미지 x̂1을 생성하고, 이는 이어서 인코더 E2 를 통과하여 재구성된 잠재 벡터 z를 얻습니다. 동시에 z는 디코더 D2 에 의해 디코딩되어 x̂2를 생성하고, 이 또한 E2 를 통해 재인코딩되어 z2를 산출합니다. 이 양방향 프로세스는 이상 탐지를 위해 픽셀 및 잠재 수준 정보를 모두 보존합니다.

모델 테스트 알고리즘:
figure-protocol-33={( x̂1,y 1),( x̂2,y 2),...,( x̂M*,yM*)},
임계값 φ,

가중치 매개변수 ω1, ω2
출력: 테스트 데이터 세트의 예측 레이블
Ere = {y1pre, y2pre, ..., yF*pre}
for i =1에서 F*는
zi ← e1(xi)
엑스2i ← d2(zi)
z2i ← e2(x2i)
z1i' ← d1(z2i)
z1i' ← e2(z1i')
Acc(x̂i) ←ω1||zi−z2i||22||zi−z1i'||2
ifAcc(x̂i) ≥φ
yipre ←1
다른
yipre ←0
엔디프

EDE는 판별자를 적대적 학습 구성 요소로 사용하여 정상 이벤트와 비정상 이벤트를 구별하는 모델의 기능을 개선하여 이상 탐지 정확도를 높입니다. 다음과 같이 성능을 향상시킵니다.

학습 판별: 판별자는 합성 및 이중 EDE 구조 재구성 표현을 구별하도록 훈련됩니다. 이 적대적 프로세스를 최적화하면 모델에 매우 차별적인 잠재 특징이 제공되어 교통 장면 이상 감지가 향상됩니다.

잘못된 재구성 제거: 트래픽 패턴에서 너무 많이 벗어나기 때문에 이상 현상으로 인해 재구성 문제가 발생하는 경우가 많습니다. 판별기는 잘못 재구성된 프레임에 페널티를 부여하여 네트워크의 정상/비정상 이벤트 감지를 개선합니다.

적대적 훈련으로 기능 표현 향상: 적대적 학습을 통합함으로써 판별자는 EDE 네트워크가 보다 지속적이고 의미 있는 잠재 임베딩을 생성하도록 합니다. 급제동, 충돌, 차량 방향 전환과 같은 작은 변화도 감지하여 이상 감지를 개선합니다.

오탐 제거: 기존 오토인코더는 이상 현상을 과도하게 일반화하고 정규화하여 오탐률이 높습니다. 판별기는 정상 프레임과 비정상 프레임 간의 잠재 불일치를 식별하여 재구성 중에 변칙의 속성을 보존합니다.

2단계 결정 프로세스를 통한 분류 개선: 정상 또는 비정상 재구축 프레임은 판별자로부터 신뢰도 점수를 받습니다. 이 추가 검증 단계에서 오분류 오류와 재구성 손실이 줄어들어 검출 정확도가 향상됩니다.

우리는 전략 23,24,25,26을 테스트하기 위해 입증된 사고 감지 방법을 사용했습니다. 다중 클래스 데이터 세트의 한 클래스는 정상이었고 다른 모든 사고 클래스는 하나 대 모든 접근 방식을 사용하여 주의 깊게 조사되었습니다. 모델은 일반 클래스 데이터만 사용하여 훈련된 반면 테스트 세트는 사고 및 일반 데이터를 사용했습니다. 훈련 세트와 테스트 세트는 두 가지 방식으로 나뉘었습니다.

우리는 각각 80%와 20%의 정상 클래스 데이터로 훈련하고 테스트했습니다. 사고 등급 테스트 결과는 무작위로 선택되었습니다. 평가는 대다수 정상 등급으로 모델이 왜곡되는 것을 방지하기 위해 정상 등급 데이터의 20%를 차지하는 사고 등급 테스트 샘플을 사용하여 편향되지 않았습니다. 이 모델은 실제 조건을 나타내는 동일한 수의 정상 및 사고 데이터에 대해 테스트할 수 있습니다. 정규 데이터의 80%로 훈련하고 20%를 숨겨 모델 일반화를 공정하게 테스트합니다. 이는 또한 실제 생활에서 정상적인 사고가 사고보다 많다는 것을 보여주므로 모델을 드물게 발생하는 사고 데이터에 노출시키는 것이 중요합니다. 사고 샘플을 무작위로 선택하고 과적합 없이 모든 사고 상황에 대해 모델을 테스트하면 견고성이 향상됩니다. 80/20 데이터 분할은 기계 학습에서 일반적입니다. 의미 있는 패턴에 대한 학습 데이터와 성능 평가를 위한 테스트 데이터가 균형을 이룹니다.

실험에서는 훈련 및 테스트를 위해 데이터 세트를 사용했습니다. 검증 및 훈련에는 일반 클래스 훈련 분할이 사용되었습니다. 모든 수업의 테스트 데이터를 테스트했습니다.

모델 정리 및 양자화는 모델 크기와 계산을 크게 줄입니다. 축소된 모델은 정확도는 동일하지만 매개변수가 40% 적기 때문에 성능이 낮습니다. 처리 능력이 낮은 에지 장치의 경우 모델을 양자화하면 압축됩니다. 이 최적화는 실시간 교통 감시 정밀도 및 리콜 요구 사항을 충족합니다.

MobileNets 및 EfficientNet과 같은 경량 설계는 실시간 추론을 증가시킵니다. 컴퓨터 비전 정밀도와 최소한의 계산으로 인해 이러한 건축 유형이 널리 사용됩니다. 임베디드 시스템에서 이러한 모델은 강력한 사고 감지 F1 점수를 유지하면서 프레임 처리를 50% 줄입니다.

다중 작업 학습을 활용하여 이미지 재구성 및 사고 감지에 유사한 매개변수를 사용하면 설계를 단순화할 수 있습니다. 이는 모델 정확도에 영향을 주지 않으면서 훈련 시간과 컴퓨팅 비용을 낮췄습니다. 멀티태스킹 학습 시스템은 교통 영상 데이터 처리 모델 학습을 단순화했습니다.

대조 및 자체 지도 적대적 훈련은 더 짧은 시간에 기본 이상 탐지 모델과 비슷한 결과를 생성했습니다. 보이지 않는 데이터에 대한 견고성을 향상시키기 위해 교통 사고 특징을 수집하고 일반화했습니다.

제안된 교통 이상 탐지 알고리즘은 2021년 AI City Challenge 데이터 세트 5개 중 하나인 Track-4에서 테스트되었습니다27. 고속도로는 이러한 데이터를 아이오와 교통부에 제공했습니다.

비교 성능 평가:
모델을 검증하기 위해 AI City Challenge Track 4 데이터 세트에서 GANomaly, f-AnoGAN, OCGAN 및 ByteDance의 지도 방법을 포함한 최첨단 모델에 대해 벤치마킹했습니다. 표 2는 결과를 요약한 것입니다.

모델F1 점수정밀기억AUC
가노멀리0.870.880.860.9
옥간0.890.90.870.91
바이트댄스(Sup.)0.910.930.890.92
제안됨(Dual-EDE)0.940.950.930.94

표 2: 방법 비교. 이 표에서는 F1 점수, 정밀도, 재현율 및 정확도별로 이상 탐지 방법을 비교합니다. 적대적 훈련이 있는 EDE 설계와 없는 EDE 설계를 비교합니다. 두 개의 EDE와 적대적 훈련은 모든 범주에서 BADU, ByteDance 및 WHU를 능가했습니다. 데이터는 적대적 학습이 이상 탐지를 증가시킨다는 것을 나타냅니다.

이중 EDE 모델은 특히 재현율에서 모든 기준선을 능가하며, 이는 희귀한 이상 현상에 대한 민감도가 더 강함을 나타냅니다.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

제안된 교통 이상 탐지 방법의 효율성을 평가하기 위해 단일 비디오 클립에 모델을 구현하고 시간 경과에 따른 기능 공간 내에서 시스템의 동작을 보여주는 시각화를 생성했습니다. 시뮬레이션된 EDE 파이프라인을 사용하여 얻었지만 결과는 실제 모델에서 예상되는 정성적 결론을 밀접하게 반영합니다.

이상 점수 타임라인은 비정상적인 발생을 식별하는 데 있어 모델의 프레임별 신뢰도를 나타냅니다(그림 6). 이상 징후 점수의 피크는 갑작스러운 움직임이나 시각적 왜곡과 같은 이미지 역학의 급격한 변화에 해당하며, 이는 차량 충돌이나 급격한 감속과 같은 실제 사건과 유사합니다. 초기 프레임은 상대적으로 낮은 점수를 보여 원활한 교통 흐름을 나타냅니다. 타임라인에서 눈에 띄는 피크는 잠재적인 트래픽 이상 현상을 암시하며, 이는 정성적 이미지 출력에서 추가로 조사됩니다. 프레임 수준 편차 신호를 활용하여 시스템은 정상 패턴과 비정상 패턴을 효과적으로...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 실제 감시 비디오에서 단일 및 다중 차량 사고를 모두 식별하기 위해 감독되지 않은 방식으로 훈련된 EDE 아키텍처를 사용하는 딥 러닝 기반 교통 이상 감지 시스템을 제시합니다. 일반적인 교통 행동을 모델링함으로써 시스템은 레이블이 지정된 이상 데이터 없이도 편차를 가능한 이상 징후로 감지하여 지능형 교통 모니터링의 확장성 및 데이터 희소성 문제를 해결합니다. 이 연구는 효과적인 시공간 이상 식별을 위해 잠재공간 일관성과 재구성 손실을 결합하여 이 분야를 발전시킵니다.

제한:
이중 EDE 모델은 강력한 성능을 보여주지만 투명성을 보장하고 향후 개발을 알리기 위해 특정 제약 조건을 인식해야 합니다.

입력 양식 제...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자는 이해 상충이 없음을 선언합니다.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 외부 자금 지원을 받지 않았습니다. 저자는 이 연구를 수행하는 데 필요한 하드웨어와 귀중한 지원을 제공한 인도 코임바토르에 있는 Amrita School of Computing에 감사를 표하고 싶습니다.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
AI 시티 챌린지 트랙 4 데이터 세트AI 시티 챌린지 (https://www.aicitychallenge.org)트랙 4, 2021년 발매
CUDA 툴킷NVIDIA 개발자버전 11.3
cuDNN 라이브러리NVIDIA 개발자CUDA 11.3과 호환 가능
GPU 워크스테이션 클러스터(학습)암리타 컴퓨팅 스쿨
로컬 워크스테이션(안개 노드)암리타 컴퓨팅 스쿨
매트로립matplotlib.org버전 3.3+
NVIDIA Jetson Nano(에지 장치)엔비디아945-13450-0000-100
NVIDIA RTX 3060 GPU(워크스테이션)엔비디아제조업체에 따라 다름
넘파이numpy.org버전 1.19+
오픈CVOpenCV.org버전 4.5+
팬더pandas.pydata.org버전 1.1+
파이썬파이썬 소프트웨어 재단버전 3.8+
파이토치파이토치 (https://pytorch.org)버전 1.10+
시킷 학습scikit-learn.org버전 0.24+
Ubuntu Linux(운영 체제)캐노니컬 주식회사버전 20.04 LTS

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Gannina, A. R. K., et al. A new approach to road incident detection leveraging live traffic data: An empirical investigation. Procedia Comput Sci. 235, 2288-2296 (2024).
  2. Khaleghi, A., Moin, M. -S. Improved anomaly detection in surveillance videos based on a deep learning method. IEEE. , 73-81 (2018).
  3. Tripathy, A. K., Sarkar, M., Sahoo, J. P., Li, K. C., Chinara, S. Road accident detection and severity determination from CCTV surveillance. Advances in distributed computing and machine learning. Lect Notes Netw Syst. , Springer. Singapore. (2021).
  4. Pang, G., Shen, C., Cao, L., Van den Hengel, A. Deep learning for anomaly detection: A review. ACM Comput. Surv. 54 (1), 1-38 (2021).
  5. Chalapathy, F., Zhang, L., Liu, H., Wang, Y., Zhao, Y. Deep learning for video anomaly detection: A review. arXiv preprint. , (2024).
  6. Gupta, A., Verma, S. Wave-GANomaly: A GAN-based anomaly detector using multi-feature fusion and wavelet transform. PLoS ONE. 18 (6), 1-18 (2023).
  7. Roy, D., Uddin, M. S., Bappy, S. M. Deep learning-based anomaly detection in video surveillance: A comprehensive review. Sensors. 23 (11), 5024-5047 (2023).
  8. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., et al. Proc 27th Int Conf Neural Inf Process Syst, Montreal, QC, , (2014).
  9. Alzahrani, A. B., et al. Unsupervised video anomaly detection in UAVs: A new approach. Front Sustain. Cities. 5, 1-10 (2023).
  10. Chalapathy, R., Chawla, S. Deep learning for anomaly detection: A survey. , Cornell University. (2019).
  11. Chen, H., Lin, J., Fang, M. Variational autoencoder for anomaly detection: A comparative study. arXiv preprint. , (2024).
  12. Schlegl, T., Seeböck, P., Waldstein, S. M., Langs, G., Schmidt-Erfurth, U. f-AnoGAN: Fast unsupervised anomaly detection with generative adversarial networks. Med Image Anal. 54, 30-44 (2019).
  13. Akcay, S., Atapour-Abarghouei, A., Breckon, T. P. Ganomaly: Semi-supervised anomaly detection via adversarial training. Comput Vis – ACCV 2018, Lect Notes Comput Sci. Jawahar, C., Li, H., Mori, G., Schindler, K. 11363, Springer. Cham. (2019).
  14. Ocgan: One-class novelty detection using GANs with constrained latent representations. Perera, P., Nallapati, R., Xiang, B. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, Long Beach, CA, , 2898-2906 (2019).
  15. Nayak, R., Mishra, S. K., Dalai, A. K., Pati, U. C., Das, S. K. A panoramic review on cutting-edge methods for video anomaly localization. IEEE Access. 12, 186380-186412 (2024).
  16. He, Z., Xu, X., Deng, S. Discovering cluster-based local outliers. Pattern Recognit Lett. 24, 1641-1650 (2003).
  17. Tax, D. M. J., Duin, R. P. W. Support vector data description. Mach Learn. 54, 45-66 (2004).
  18. Anomaly detection with robust deep autoencoders. Zhou, C., Paffenroth, R. C. Proc. 23rd ACM SIGKDD Int Conf Knowl Discov Data Min, Halifax, NS, , 665-674 (2017).
  19. Hojjati, H., Ho, T. K. K., Armanfard, N. Self-supervised anomaly detection in computer vision and beyond: A survey and outlook. Neural Netw. 172, 106106(2024).
  20. Donahue, J., Krähenbühl, P., Darrell, T. Adversarial feature learning. , Cornell University. (2016).
  21. El-Sayed, H. A., El-Horbaty, A. A cutting-edge video anomaly detection method using image quality assessment and attention mechanisms. Alex Eng J. 72, 689-701 (2024).
  22. Kiran, B. R., Thomas, D. M., Parakkal, R. An overview of deep learning-based methods for unsupervised and semi-supervised anomaly detection in videos. J Imaging. 4, 36(2018).
  23. Chow, J. K., Su, Z., Wu, J., Tan, P., Mao, X., Wang, Y. Anomaly detection of defects on concrete structures with the convolutional autoencoder. Autom Constr. 45, 101105(2020).
  24. Siegel, B. Industrial anomaly detection: A comparison of unsupervised neural network architectures. IEEE Sens Lett. 4 (8), 1-4 (2020).
  25. Uchida, M., Ishida, S., Tabaru, T., Miyamoto, H. Anomaly detection of rotary vacuum pump using thin AE sensor and reconstruction error of autoencoder. SICE Trans. 54 (7), 599-605 (2018).
  26. Khan, M. A., Ahmad, T., Siddiqui, N. A. A novel unsupervised video anomaly detection framework based on spatiotemporal features. PLoS ONE. 18 (4), 1-20 (2023).
  27. Iowa DOT anomaly dataset. , https://www.aicitychallenge.org/2021-data-and-evaluation (2021).
  28. Lee, K., Jung, D. Unsupervised video anomaly detection based on similarity with text descriptions. Sensors. 23 (14), 6256(2023).
  29. Kingma, D. P., Welling, M. Auto-encoding variational bayes. arXiv preprint. , (2013).
  30. Masci, J., Meier, U., Cireşan, D., Schmidhuber, J. Stacked convolutional auto-encoders for hierarchical feature extraction. Int Conf Artif Neural Netw. Honkela, T., Duch, W., Girolami, M., Kaski, S. , Springer. Berlin. 52-59 (2011).
  31. Fan, J., Zhang, Q., Zhu, J., Zhang, M., Yang, Z., Cao, H. Robust deep auto-encoding Gaussian process regression for unsupervised anomaly detection. Neurocomputing. 376, 180-190 (2020).
  32. Shvetsova, N., Bakker, B., Fedulova, I., Schulz, H., Dylov, D. V. Anomaly detection in medical imaging with deep perceptual autoencoders. IEEE Access. 9, 118571-118583 (2021).
  33. Unsupervised anomaly detection with generative adversarial networks to guide marker discovery. Schlegl, T., Seeböck, P., Waldstein, S. M., Schmidt-Erfurth, U., Langs, G. Int Conf Inf Process Med Imaging, , Springer. Cham. 146-157 (2017).
  34. Tuluptceva, N., Bakker, B., Fedulova, I., Konushin, A. Perceptual image anomaly detection. arXiv preprint. , (2019).
  35. Chen, C., Yuan, W., Xie, Y., Qu, Y., Tao, Y., Song, H., et al. Novelty detection via non-adversarial generative network. arXiv preprint. , (2020).
  36. Salehi, M., Eftekhar, A., Sadjadi, N., Rohban, M. H., Rabiee, H. R. Puzzle-AE: Novelty detection in images through solving puzzles. arXiv preprint. , (2020).
  37. Support vector method for novelty detection. Schölkopf, B., Williamson, R. C., Smola, A. J., Shawe-Taylor, J., Platt, J. Proc 12th Int Conf Neural Inf Process, Denver, CO, , 582-588 (1999).
  38. Marvasti-Zadeh, S. M., Cheng, L., Ghanei-Yakhdan, H., Kasaei, S. Deep learning for visual tracking: A comprehensive survey. IEEE Trans Intell Transp Syst. , 1-26 (2021).
  39. Van den Oord, A., et al. Conditional image generation with PixelCNN decoders. Adv Neural Inf Process Syst. 29, Barcelona. (2016).
  40. Deep one-class classification. Proc 35th Int Conf Mach Learn. PMLR. Ruff, L., et al. , PMLR. Stockholm. 4393-4402 (2018).
  41. Pidhorskyi, S., Almohsen, R., Doretto, G. Generative probabilistic novelty detection with adversarial autoencoders. Adv Neural Inf Process Syst. 31, Montreal, QC. (2018).
  42. The 5th AI city challenge. Naphade, M., et al. IEEE Conf Comput Vis Pattern Recognit Work, , (2021).
  43. Good practices and a strong baseline for traffic anomaly detection. Zhao, Y., Wu, W., He, Y., Li, Y., Tan, X., Chen, S. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 3993-4001 (2021).
  44. Box-level tube tracking and refinement for vehicles anomaly detection. Wu, J., Wang, X., Xiao, X., Wang, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4112-4118 (2021).
  45. Dual-modality vehicle anomaly detection via bilateral trajectory tracing. Chen, J., et al. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4016-4025 (2021).
  46. An efficient approach for anomaly detection in traffic videos. Doshi, K., Yilmaz, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4236-4244 (2021).
  47. A vision-based system for traffic anomaly detection using deep learning and decision trees. Aboah, A. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4207-4212 (2021).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Traffic Accident DetectionSurveillance VideosUnsupervised Anomaly DetectionDual Encoder DecoderAdversarial TrainingDeep Learning ArchitectureReconstruction LossGenerative Adversarial MechanismTraffic Behavior ModelingEmergency Response

Related Articles