이 프로토콜은 구조화된 지식을 통합하여 약하게 지도된 비디오 이상 감지를 개선하는 것을 목표로 합니다. 그 목표는 특정 이상 유형을 분류하고 탐지 결과에 대한 명확하고 해석 가능한 설명을 제공하여 단순한 이진 결정을 넘어 투명성을 높이는 것입니다.
Research Article
이 프로토콜은 구조화된 지식을 통합하여 약하게 지도된 비디오 이상 감지를 개선하는 것을 목표로 합니다. 그 목표는 특정 이상 유형을 분류하고 탐지 결과에 대한 명확하고 해석 가능한 설명을 제공하여 단순한 이진 결정을 넘어 투명성을 높이는 것입니다.
약하게 감독되는 비디오 이상 탐지는 비디오 수준 레이블에만 의존하여 이상 이벤트를 식별하는 핵심 기술입니다. 그러나 기존의 다중 인스턴스 학습(MIL) 방법은 거친 이진 감독에 의존합니다. 이 접근 방식을 사용하면 세분화된 이상 범주를 구분하기 어렵습니다. 이러한 방법은 종종 가장 비정상적인 세그먼트에만 초점을 맞추기 때문에 해석 가능성이 부족한 탐지 결과를 초래합니다. 이러한 한계를 극복하기 위해 본 연구에서는 구조화된 지식을 통합한 특징 모델링 접근 방식을 제안합니다. 동적 의미론적 안내 메커니즘을 활용하여 약하게 지도된 비디오 이상 탐지는 외부 범주 수준 정보와 학습 가능한 프롬프트를 결합하여 기능 공간 내에서 의미론적 신호를 생성합니다. 이러한 신호는 기본 이상 탐지 모듈에서 추출한 시각적 증거와 정렬되어 두 가지 보완적인 출력, 즉 이상 이벤트의 심각도를 정량화하기 위한 이상 점수와 사전 정의된 템플릿을 통해 구조화되고 해석 가능한 설명 텍스트를 생성하는 데 사용할 수 있는 외부 개념과 일치하는 의미론적 설명을 생성합니다. 실험 결과에 따르면 제안된 방법은 UCF-Crime 데이터 세트에서 88.03%, ShanghaiTech 데이터 세트에서 98.23%의 AUC를 달성하여 세분화된 이상 분류 작업에서 87.05%의 정확도를 달성합니다. 또한 생성된 의미론적 설명은 약하게 지도된 감지를 이진 분류 작업에서 의미론 중심의 해석 가능한 이상 분석 프레임워크로 확장합니다.
비디오 이상 탐지(VAD)는 공공 안전 및 지능형 제조와 같은 분야에서 필수적인 역할을 하며, 수동 감시의 한계에 대한 확장 가능한 솔루션을 제공합니다1. 특히, WS-VAD(약하게 감독된 비디오 이상 탐지)는 비디오 수준 레이블에 의존하여 수동 주석의 부담을 크게 줄이는 동시에 다양한 장면에 걸쳐 일반화 가능성을 향상시켜 주목을 받고 있습니다. 실질적인 이점에도 불구하고 WS-VAD 방법은 여전히 비정상적인 사건의 특성을 정확하게 식별하는 데 중요한 과제에 직면해 있습니다2. 기존 모델은 종종 이상 징후의 존재를 감지하지만 정확한 범주를 결정하거나 의미 있는 진단 정보를 제공하는 데 어려움을 겪습니다 3,4. 예를 들어, 산업 환경에서 모델은 과열된 베어링에서 나오는 연기를 무해한 증기 방출과 혼동하거나 정상적인 용접 스파크를 화재의 초기 징후로 잘못 믿을 수 있으며, 둘 다 비용이 많이 드는 오판과 불필요한 가동 중단으로 이어질 수 있습니다. 이러한 의미론적 혼란은 현재 WS-VAD 접근 방식의 고유한 한계에서 발생합니다5. 바이너리 비디오 수준 레이블은 원인, 위치 및 심각도에 대한 통찰력을 제공하지 않고 이상 징후가 존재하는지 여부를 나타냅니다. 더욱이, 주류 다중 인스턴스 학습(MIL) 프레임워크6는 다양한 이벤트 유형의 미묘한 의미론을 포착하지 못하는 간단한 휴리스틱7을 사용하여 클립 수준 예측을 집계합니다. 결과적으로 학습된 시각적 특징 공간은 모호해지며, 연기와 증기와 같이 시각적으로는 유사하지만 의미상적으로 구별되는 현상이 너무 밀접하게 매핑되어 결정 경계가 모호해집니다.
이러한 한계를 해결하기 위해 두 가지 주요 연구 방향이 등장했습니다. 하나는 개선된 시간적 모델링(4,5,8) 또는 현저성 유도 특징 선택(3)을 통해 MIL 프레임워크를 향상시키는 데 초점을 맞춘다. 이러한 방법은 이상 현지화를 개선하지만 의미론적 명확성과 해석 가능성을 제공하는 데는 여전히 부족합니다. 다른 방향은 VadCLIP9와 같이 사전 훈련된 다중 모드 모델을 통합하여 비전 및 언어 표현을 정렬하는 것입니다. 이 전략은 가능성을 보여주지만 언어의 의미론적 풍부함을 완전히 활용하지 못하는 경우가 많습니다. 이로 인해 약한 교차 모드 연관성과 불투명한 의사 결정 프로세스가 발생하여 두 가지 핵심 결함이 발생합니다. 첫째, 현재 모델은 모호한 특징 의미론과 불충분한 외부 지식으로 인해 이상 범주를 일관되게 구별할 수 없습니다. 둘째, 의사 결정 과정에는 특정 사건이 변칙으로 분류되는 이유에 대한 투명한 설명이 없는 블랙박스가 포함되어 있습니다. 일부 방법에는 텍스트 프롬프트(예: 전투, 총격)가 포함되어 있지만 이러한 방법은 항상 단순하고 느슨하게 구성되어 의미론적 깊이와 문맥적 이해가 모두 부족합니다.
이러한 격차를 해소하기 위해 구조화된 외부 지식을 해석 가능한 의사 결정 메커니즘과 통합하는 새로운 WS-VAD 방법이 도입되었으며, 이는 설명 가능한 인공 지능(XAI)10의 광범위한 분야 내에서 핵심 목표입니다. 기본 범주 이름을 프롬프트로 사용하는 대신 이 방법은 Wikidata11을 사용하여 의미론적 개념 구름이라고 하는 풍부한 의미론적 표현을 구성합니다. 정적 텍스트 프롬프트나 간단한 범주 레이블에 의존하는 VadCLIP9 와 같은 기존 다중 모드 방법과 달리 이러한 의미론적 개념 클라우드는 구조화된 지식 그래프에서 추출된 관련 엔터티, 속성 및 인과 관계를 포함하여 포괄적인 문맥 지식을 캡슐화합니다. 이러한 개념 클라우드는 시스템이 세분화된 이벤트 의미 체계에 액세스할 수 있도록 하는 BLIP 모델12를 사용하여 의미 체계 앵커로 인코딩됩니다. 의미론적 앵커 메커니즘의 핵심 혁신은 특정 이상 맥락에 적응하는 역동적이고 지식이 풍부한 표현을 생성하는 능력에 있는 반면, 이전의 프롬프트 기반 방법은 문맥적 깊이와 의미론적 관계가 부족한 고정된 텍스트 설명을 사용합니다. 특징 공간을 더욱 구체화하기 위해 현저성 유도 정렬 메커니즘은 이러한 앵커를 가장 관련성이 높은 시각적 증거와 선택적으로 연결합니다. 이 표적 정렬은 피처의 식별력을 향상시키는 동시에 감지 결과의 의미론적 명확성을 향상시킵니다. 더 중요한 것은 제안된 방법이 투명한 해석을 지원한다는 것입니다. 의미론적 앵커가 시각적 증거와 정렬되면 모델은 사전 정의된 템플릿을 사용하여 구조화된 자연어 설명을 생성하여 이상 현상의 특성과 정당성을 모두 명시적으로 다룹니다. 이 방법의 구현은 사전 추출된 I3D 시각적 기능 사용, 외부 지식 기반(Wikidata)에 대한 액세스 및 사전 훈련된 BLIP 인코더를 포함한 특정 전제 조건에 의존한다는 점에 유의하는 것이 중요합니다. 따라서 이 프레임워크는 단순한 이진 탐지를 넘어 특정 이상 유형을 분류하고 결과에 대해 해석 가능한 정당성을 제공하는 것이 중요한 애플리케이션에서 가장 유용합니다.
주요 기여는 다음과 같습니다. 새로운 WS-VAD 방법은 의미론적 이해와 의사 결정 투명성을 향상시키기 위해 외부 지식과 구조화된 해석 가능성을 결합하여 개발됩니다. 시각적 전용 MIL 모델의 한계를 극복하기 위해 의미론적 임베딩 기반 프롬프트 방법과 컨텍스트 인식 정렬 메커니즘이 도입되었습니다. 일관된 텍스트 근거를 생성하기 위해 의미론적 앵커를 해석 가능한 단위로 사용하는 생성적 설명 모듈이 통합됩니다. UCF-Crime 및 ShanghaiTech 데이터 세트에 대해 수행된 광범위한 실험은 제안된 방법의 효과를 입증하여 명확하고 해석 가능한 출력과 함께 강력한 AUC 점수(88.03% / 98.23%)와 우수한 세분화된 인식 성능을 달성했습니다.
Access restricted. Please log in or start a trial to view this content.
이 연구는 공개적으로 사용 가능한 데이터 세트(UCF-Crime13 및 ShanghaiTech14)만 사용합니다. 모든 비디오는 데이터 세트 관리자가 제공하는 범위 내에서 개인 식별 정보를 익명화하는 데이터 세트의 공식 릴리스에서 얻었습니다. 저자는 추가 데이터 수집이나 인간 피험자 상호 작용을 수행하지 않았습니다. 따라서 새로운 IRB 승인이 필요하지 않았습니다. 데이터 사용은 각 데이터 세트의 라이선스 및 사용 약관을 준수합니다.
데이터 준비 및 특징 추출
데이터 세트 준비:UCF-Crime13 (열차 1,610개/테스트 비디오 290개) 및 ShanghaiTech14 (열차 238개/테스트 비디오 199개) 데이터 세트가 표준 분할에 따라 채택되었습니다. 비디오는 재현성을 보장하기 위해 FFmpeg를 사용하여 전처리되고, H.264로 다시 인코딩되고, 25fps로 리샘플링되고, ffmpeg -i v.mp4 -vf "fps=256:256" -c:v libx264 -crf 23 -preset veryfast pre/ 명령을 사용하여 256 x 256 해상도로 크기를 조정했습니다.
특징 추출: RGB 특징은 Kinetics 데이터 세트(16)에서 사전 훈련된 I3D 백본(15)에 의해 추출되었다. 비디오는 겹치지 않는 16프레임 클립으로 분할되었습니다. 각 클립은 가운데 224 x 224 픽셀로 잘렸습니다. 끝에서 두 번째 레이어 활성화는 클립당 1024-D 특징을 얻기 위해 평균적으로 풀링되었습니다. PyTorch에서 이는 I3D 백본을 통해 [B, 3, T, H, W] 모양의 텐서를 전달하고 adaptive_avg_pool3d 적용한 다음 평탄화하는 데 해당합니다. 추출된 기능은 정확한 재현성을 위해 클립 타임스탬프와 함께 .npy 파일(비디오당 하나)에 저장되었습니다(시드 = 123). 각 비디오에 대해 features///
모델 아키텍처 및 방법론
기본 감지: 시간적 컨텍스트 융합
기능 행렬 Z
R Tx1024로 표시되는 비디오 클립 시퀀스가 주어지면 TCF(Temporal Context Fusion) 모듈은 먼저 세 가지 학습된 선형 투영을 통해 쿼리, 키 및 값 표현을 계산했습니다.
Q = ZWQ, K = ZWK, V = ZWV (1)
여기서 WQ, WK, WV
RTx1024xd 는 훈련 가능한 매개변수(PyTorch: 3 nn. 선형(1024,d) 레이어). 세그먼트 간 친화도는 S =
, 시간적 관계성 임베딩(TRE)이 통합되었으며, 여기서 각 요소는 Rij = α exp (
) + β로 계산되었습니다. 위치 인식 선호도는 = S + R이었습니다
. 전역 컨텍스트 맵 A = softmax()
집계 V는 광역 기능 G = AV를 얻습니다. 국소 특징 L은 깊이별 1차원 컨볼루션(nn. Conv1d)를 사용하여 Z를 통해 커널 크기 3을 사용합니다. 동적 게이트 g = σ(MLP([G;L]))를 혼합했습니다: U = g
G + (1 - g)
L . 마지막으로 레이어 정규화와 잔차 선형 레이어를 적용하여 Y(Pytorch:LayerNorm+Linear+residual)를 생성했습니다.
기본 감지: 인과적 시간적 예측 변수
출력 Y 는 클립별 이상 로짓을 얻기 위해 GELU 및 드롭아웃(Pytorch:padding='causal' 또는 masked conv)을 사용하여 두 개의 인과 1차원 컨볼루션을 통과했습니다. 시그모이드 함수를 적용하면 확률 값
[0,1]T가 산출되었습니다.
의미 향상: 외부 지식을 통한 신속한 학습
의미론적 앵커 구성 : 각 이상 클래스 c에 대해 Kc 개념은 Wikidata11에서 쿼리되었고 인코딩된 각 개념 구문은 BLIP의12텍스트 인코더로 e i
R768로 인코딩되었습니다. 클래스 앵커는 l2-정규화된 평균 Dc = norm(
Σiei)이었습니다. 노이즈를 줄이기 위해 클래스 이름과 코사인 유사성이 0.2 미만인 개념은 삭제하고 TF-IDF 점수에 의한 상위 M은 유지되었습니다.
상황에 맞는 분리 수행 :전 경 가중치 α t = softmax(rst)는 기본 검출기 점수 st 및 배경 가중치 bt = softmax(r(1 - st))에서 계산되었습니다. 가중 기능은 ffg = Σtαzt 및 fbg = Σtbzt 입니다.
시각적 및 의미 체계 기능 정렬
정렬 목표 정의: 정렬 단계 동안 목표는 전경 시각적 기능과 기능 공간 내에서 변칙 범주의 해당 의미 체계 앵커 사이의 거리를 최소화하는 것입니다. C 변칙 범주 의미 체계 가이드와 하나의 표준 일반 의미 체계 가이드로 구성된 의미 체계 안내서
모음을 만듭니다. 가능성 결정, P(Dk|v), 시각적 특징 v는 k번째 의미 가이드 D k에 해당합니다. 식 (2)와 같이 온도 스케일 코사인 유사성에 이어 Softmax 정규화를 사용하여 이를 계산합니다.
(2)
교차 엔트로피는 양수 쌍을 함께 밀고 음수 쌍을 분리하도록 최소화되었으며, τs 를 학습 가능한 매개변수로 설정하고 10으로 초기화했습니다. 음수 표본 쌍의 상관 관계를 줄이면서 양의 표본 쌍의 상관 관계를 맺을 가능성을 최적화하여 정렬을 수행합니다.
템플릿 기반 해석 가능성 모듈
외부 지식을 통한 프롬프트 학습(PLE) 강화 기능 표현을 기반으로 선형 분류기는 클래스별 로짓을 생성하며, 이는 이후 softmax 함수에 의해 클래스 확률로 정규화됩니다. 예측된 이상 유형은 확률이 가장 높은 범주로 결정되었습니다. 한편, 검출기 출력에서 글로벌 이상 점수가 계산되었습니다. 심각도 수준을 결정하기 위해 이 점수는 검증 세트에서 그리드 검색을 통해 최적화된 세 가지 사전 정의된 임계값과 비교되었습니다.
기본 임계값은 θ높음 = 0.8, θ중간 = 0.5 및 θ낮음 = 0.2로 설정되었습니다. 구체적으로, 점수가 θ높음보다 크면 심각도는 높음으로 표시되었습니다. 점수가 θ중간과 θ높음 사이에 있으면 중간으로 표시되었습니다. θ낮음과 θ중간 사이에 있으면 낮음으로 표시되었습니다. 그렇지 않으면 없음으로 표시되었습니다.
설명 생성 단계에서 예측된 유형에 해당하는 템플릿이 사전 정의된 템플릿 라이브러리인 보충 파일 1에서 선택되었습니다. 이 라이브러리는 생성된 텍스트의 다양성을 향상시키기 위해 다중 주석자(17 )에 의해 교차 검증된 여러 템플릿 변형을 포함한다. 예측된 유형이 템플릿 라이브러리에 있는 경우 해당 템플릿이 임의로 선택되었습니다. 그렇지 않으면 알 수 없는 형식에 대한 기본 템플릿이 사용되었습니다. 마지막으로 예측된 유형, 전반적인 이상 점수, 심각도 설명 및 선택한 템플릿을 통합하여 구조화된 설명 텍스트를 생성했습니다. 시스템은 예측된 이상 유형, 글로벌 이상 점수 및 생성된 설명 텍스트를 최종 출력으로 반환합니다. 결과는 그림 2에 나와 있습니다.
모든 임계값 매개변수는 검증 세트에서 그리드 검색을 사용하여 최적화되었으며, 생성된 설명의 품질은 인간 평가와 자동화된 메트릭을 모두 사용하여 종합적으로 평가되었습니다. 결과는 표 1에 나와 있습니다.
모델 학습 및 평가
훈련: 모델은 Adam(lr 1 x 10-4, 가중치 감쇠 5 x 10-4), 배치 크기 128, 50 epoch, lr에 대한 코사인 어닐링을 사용하여 종단 간 훈련되었습니다. Python/Numpy/Pytorch에 대해 임의 시드가 123으로 설정되고 torch.backends.cudnn.deterministic=True가 활성화되었습니다. 체크포인트는 5에포크마다 checkpoints//epoch_XX.pt에 저장되었고, 검증 AUC를 통해 최상의 모델을 선택했습니다. 모든 실험은 Windows 11, Python 3.8.20, PyTorch 1.8.0 및 CUDA 11.1을 실행하는 NVIDIA GeForce RTX 4060 Ti(16GB) GPU가 탑재된 시스템에서 수행되었습니다. 에포크당 대략적인 훈련 시간은 ShanghaiTech 데이터 세트의 경우 30초, UCF-Crime 데이터 세트의 경우 3.5분이었습니다.
손실: 전체 목표는 L = LMIL+ λ • L정렬입니다. 하이퍼파라미터 λ는 검증 세트의 {0.01,0.1,0.5,1,5,10} 세트를 통해 스윕되었고 테스트 보고를 위해 최적이 고정되었습니다. top-K MIL 집계는 그림 3 을 참조하고 정의는 Eq.(3-4)를 참조하십시오.
(3)
(4)
평가: 프레임 수준 AUC는 이전 WS-VAD 작업에서 사용한 표준 프로토콜에 따라 계산되었습니다 2,5. UCF-Crime에 대한 세분화된 유형 인식의 경우, 표 2에 요약된 바와 같이 IoU 0.1-0.5의 mAP 및 AVG mAP가 보고되었습니다. 클래스별 AUC는 그림 4에 나와 있으며 전체 결과는 표 3 및 표 4에 나와 있습니다. 임베딩 분리 가능성 및 이상 점수 역학은 그림 4, 그림 5 및 그림 6에 나와 있습니다.
Access restricted. Please log in or start a trial to view this content.
의미론적 앵커의 유용성을 추가로 검증하기 위해 다양한 프롬프트 템플릿을 비교하기 위한 추가 실험이 수행되었습니다( 표 1 참조). 위키데이터 증강 의미론적 프로토타입을 사용한 변형은 더 높은 AUC 값을 달성했을 뿐만 아니라 생성된 설명에 대해 BLEU-4 점수가 16.6 및 14.8로 향상되었습니다. 이러한 발견은 프롬프트의 의미론적 풍부함과 텍스트 해석의 품질 사이의 강력한 연관성을 나타내며, 설명 생성 프로세스가 풍부한 의미론적 구조를 활용하여 엄격한 템플릿 채우기를 넘어설 수 있음을 확인합니다.
이상 유형에 대한 우수한 세분화된 인식
프로토콜의 효율성은 UCF-Crime 데이터 세트의 세분화된 이상 인식 작업에서 더욱 입증됩니다. 표 2에서 볼 수 있듯이 이 프레임워크는 모...
Access restricted. Please log in or start a trial to view this content.
여기에 제시된 프로토콜은 패러다임을 단순한 이진 분류에서 의미론적으로 기반이 있고 해석 가능한 분석으로 전환하여 약하게 감독된 비디오 이상 탐지에 상당한 발전을 도입합니다. 이 방법의 중요성은 이상 현상이 발생했는지 여부뿐만 아니라 그것이 어떤 종류의 이상 현상인지, 모델이 왜 그러한 결론에 도달했는지를 식별하여 기존 WS-VAD 시스템의 주요 한계를 해결하는 능력에 있습니다 9,29.
디자인 선택 및 근거
이 방법은 기본 감지 모듈, 의미 향상 모듈 및 템플릿 기반 해석 가능성 모듈의 세 가지 상호 연결된 단계로 구성됩니다. 전체 아키텍처는 그림 1에 나와 있습니다. 근본적인 이상 ...
Access restricted. Please log in or start a trial to view this content.
저자에게는 이해 상충이 없습니다.
Aerospace Hongka Intelligent Technology (Beijing) CO., LTD가 제공한 재정적 지원에 감사드립니다.
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| BLIP 모델 | 세일즈포스 리서치 | ViT-B/16 | 의미론적 앵커를 생성하는 텍스트 인코더로 사용됩니다. |
| GPU | 엔비디아 | RTX 4060Ti | 모델 학습에 사용됨 |
| I3D 모델 | 구글 딥마인드 | Kinetics 사전 교육을 받았고; | 비디오 피처 추출의 중심으로 사용됩니다. |
| 넘피 | 넘파이 개발팀 | 1.21.2 | 비디오 특징과 같은 수치 데이터 배열을 딥러닝 모델에 입력하기 전에 처리하는 데 사용됩니다. |
| 파이토치 | 페이스북 AI 연구 | 1.8.0 | 모델 아키텍처 정의, 맞춤형 손실 함수 구현, 그리고 최적화를 위한 역전파 실행에 사용됩니다. |
| 파이썬 | 파이썬 소프트웨어 재단 | 3.8.20 | 데이터 처리, 모델 구현, 학습 및 평가를 위한 모든 스크립트 작성에 사용됨 |
| 상하이테크 데이터셋 | 상하이공과대학교 | 13개의 캠퍼스 씬에서 훈련과 평가에 사용되었습니다. | |
| UCF-범죄 데이터셋 | 센트럴 플로리다 대학교 | 13개의 이상 현상 범주의 훈련 및 평가에 사용됨. | |
| 위키데이터 | 위키미디어 재단 | 프롬프트 생성을 위한 외부 지식 그래프로 사용됩니다. |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission