$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu çalışma yalnızca kamuya açık veri kümelerini (UCF-Crime13 ve ShanghaiTech14) kullanmaktadır. Tüm videolar, veri kümesi sorumluları tarafından sağlanan ölçüde kişisel olarak tanımlanabilir bilgileri anonimleştiren veri kümelerinin resmi yayınlarından elde edilmiştir. Yazarlar tarafından herhangi bir ek veri toplama veya insan denek etkileşimi yapılmamıştır; bu nedenle yeni bir IRB onayına gerek duyulmadı. Veri kullanımı, ilgili veri kümelerinin lisanslarına ve kullanım koşullarına uygundur.
Veri hazırlama ve özellik çıkarma
Veri kümesi hazırlama:UCF-Crime13 (1.610 tren/290 test videosu) ve ShanghaiTech14 (238 tren/199 test videosu) veri kümeleri standart bölünmeleri altında benimsenmiştir. Videolar, tekrarlanabilirliği sağlamak için FFmpeg kullanılarak önceden işlendi, H.264'e yeniden kodlandı, 25 fps'ye yeniden örneklendi ve şu komutla 256 x 256 çözünürlüğe yeniden boyutlandırıldı: ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preset veryfast pre/.
Özellik çıkarma: RGB özellikleri, Kinetics veri kümesi16 üzerinde önceden eğitilmiş bir I3D omurga15 tarafından çıkarıldı. Videolar üst üste gelmeyen 16 karelik kliplere bölündü; Her klip 224 x 224 piksele ortadan kırpıldı. Sondan bir önceki katman aktivasyonları, klip başına 1024-D özelliği elde etmek için ortalama olarak bir araya getirildi. PyTorch'ta bu, [B, 3, T, H, W] şeklindeki tensörlerin I3D omurgası boyunca iletilmesine ve adaptive_avg_pool3d uygulanmasına ve ardından düzleştirmeye karşılık gelir. Çıkarılan özellikler, tam tekrarlanabilirlik için klip zaman damgalarıyla birlikte .npy dosyalarına (video başına bir tane) kaydedildi (tohum = 123). Her video için features///
Model mimarisi ve metodolojisi
Temel algılama: zamansal bağlam füzyonu
Z
RTx1024 özellik matrisi ile temsil edilen bir video klip dizisi verildiğinde, Zamansal Bağlam Füzyonu (TCF) modülü ilk olarak öğrenilen üç doğrusal projeksiyon aracılığıyla sorgu, anahtar ve değer temsillerini hesapladı:
Q = ZWQ, K = ZWK, V = ZWV (1)
burada WQ, WK, WV
RTx1024xd eğitilebilir parametrelerdir (PyTorch: üç nn. Doğrusal (1024,d) katmanlar). Bölümler arası afinite S =
idi, her bir öğenin Rij = α exp (
) + β olarak hesaplandığı bir Zamansal İlişkisellik Gömme (TRE) dahil edildi. Konuma duyarlı afinite = S + R idi
. Bir küresel bağlam haritası A = softmax(
), G = AV geniş alan özelliklerini elde etmek için V'yi topladı. Yerel özellikler L, derinlemesine 1 boyutlu bir evrişim (nn. Conv1d) çekirdek boyutu 3 bölü Z. Dinamik bir kapı g = σ(MLP ([G;L])) ikisini karıştırdı: U = g
G + (1 - g)
L . Son olarak, Y (Pytorch:LayerNorm+Linear+residi) üretmek için katman normalizasyonu ve artık bir doğrusal katman uygulandı.
Temel algılama: nedensel zamansal tahmin aracı
Y çıktısı, klip başına anomali logitleri elde etmek için GELU ve bırakma (Pytorch:padding='nedensel' veya maskeli dönş) ile iki nedensel 1 boyutlu evrişimden geçirildi. Sigmoid fonksiyonunun uygulanması olasılık değerleri
[0,1]T verdi.
Anlamsal geliştirme: dış bilgi ile hızlı öğrenme
Anlamsal çapalar oluşturun: Her anormallik sınıfı c için, Kc kavramları Vikiveri11'den sorgulandı ve kodlanan her kavram ifadesi BLIP'in12metin kodlayıcısı ile ei
R768'e kodlandı. Sınıf çapası lidi 2-normalleştirilmiş ortalama Dc = norm(
Σiei) . Gürültüyü azaltmak için, sınıf adına kosinüs benzerliği 0,2'nin altında olan kavramlar düşürüldü ve TF-IDF puanına göre en üst M tutuldu.
Bağlama duyarlı ayırma gerçekleştirin: Ön plan ağırlıklarıα t = softmax(rst) temel dedektör puanlarından hesaplandı st ve arka plan ağırlıkları bt = softmax(r(1 - st)). Ağırlıklı özellikler ffg = Σtαzt ve fbg = Σtbzt'dir.
Görsel ve anlamsal özellikleri hizalayın
Hizalama hedefini tanımlayın: Hizalama adımı sırasında amaç, ön plan görsel özelliği ile özellik alanı içindeki anormal kategorinin karşılık gelen anlamsal tutturucusu arasındaki mesafeyi en aza indirmektir. C anormal kategori anlam kılavuzları
ve bir standart normal anlam kılavuzundan oluşan bir anlam kılavuzları koleksiyonu oluşturun. Olasılığı belirleyin, P(Dk|v), görsel bir özelliğin, v'nin, k'inci anlamsal kılavuza, Dk'ye karşılık geldiğini. Bunu, Denklem'de gösterildiği gibi sıcaklık ölçekli kosinüs benzerliğini ve ardından Softmax normalizasyonunu kullanarak hesaplayın.
(2)
Çapraz entropi, pozitif çiftleri bir araya getirmek ve negatifleri birbirinden ayırmak için en aza indirildi, τs öğrenilebilir bir parametre olarak ayarlandı ve 10'a başlatıldı. Negatif örnek çiftlerini ilişkilendirme olasılığını azaltırken pozitif örnek çiftlerini ilişkilendirme olasılığını optimize ederek hizalamayı gerçekleştirin.
Şablon tabanlı yorumlanabilirlik modülü
Dış bilgi (PLE) ile geliştirilmiş özellik gösterimi ile hızlı öğrenmeye dayalı olarak, doğrusal bir sınıflandırıcı, daha sonra softmax işlevi tarafından sınıf olasılıklarına normalleştirilen sınıf başına logitler üretir; Tahmin edilen anomali türü olasılığı en yüksek kategori olarak belirlendi. Bu arada, dedektör çıktısından küresel bir anormallik puanı hesaplandı. Önem düzeyini belirlemek için bu puan, doğrulama kümesinde ızgara araması yoluyla optimize edilmiş önceden tanımlanmış üç eşikle karşılaştırıldı.
Varsayılan eşikler θyüksek = 0,8, θorta = 0,5 ve θdüşük = 0,2 olarak ayarlandı. Spesifik olarak, puan θyüksekten büyükse, şiddet yüksek olarak etiketlendi; puan θorta ile θyüksek arasındaysa, orta olarak etiketlendi; θdüşük ve θorta arasındaysa, düşük olarak etiketlendi; aksi takdirde yok olarak işaretlendi.
Açıklama oluşturma aşamasında, önceden tanımlanmış bir şablon kitaplığı olan Ek Dosya 1'den tahmin edilen türe karşılık gelen bir şablon seçildi. Bu kitaplık, oluşturulan metnin çeşitliliğini artırmak için birden çok açıklayıcı17 tarafından çapraz doğrulanan birden çok şablon çeşidi içerir. Tahmin edilen tip şablon kitaplığında varsa, karşılık gelen bir şablon rastgele seçilmiştir; aksi takdirde, Bilinmeyen türü için varsayılan bir şablon kullanıldı. Son olarak, tahmin edilen tür, genel anomali puanı, önem derecesi açıklaması ve seçilen şablon entegre edilerek yapılandırılmış bir açıklayıcı metin oluşturuldu. Sistem, tahmin edilen anomali türünü, genel anomali puanını ve oluşturulan açıklayıcı metni son çıkış olarak döndürür. Sonuçlar Şekil 2'de gösterilmektedir.
Tüm eşik parametreleri, doğrulama setinde ızgara araması kullanılarak optimize edildi ve oluşturulan açıklamaların kalitesi, hem insan değerlendirmesi hem de otomatik ölçümler kullanılarak kapsamlı bir şekilde değerlendirildi. Sonuçlar Tablo 1'de sunulmuştur.
Model eğitimi ve değerlendirmesi
Eğitim: Model, Adam (lr 1 x 10-4, ağırlık sönümü 5 x 10-4), parti boyutu 128, 50 epok, lr için kosinüs tavlaması ile uçtan uca eğitildi. Python/Numpy/Pytorch için rastgele tohumlar 123 olarak ayarlandı ve torch.backends.cudnn.deterministic=True etkinleştirildi. Kontrol noktaları her 5 dönemde bir checkpoints//epoch_XX.pt'ye kaydedildi ve en iyi model AUC doğrulaması ile seçildi. Tüm deneyler, Windows 11 çalıştıran NVIDIA GeForce RTX 4060 Ti (16 GB) GPU, Python 3.8.20, PyTorch 1.8.0 ve CUDA 11.1 ile bir sistem üzerinde gerçekleştirildi. Dönem başına yaklaşık eğitim süresi, ShanghaiTech veri kümesi için 30 saniye ve UCF-Crime veri kümesi için 3,5 dakika idi.
Kayıp: Genel amaç L = LMIL+ λ • Lhizalamasıdır. Hiperparametre λ, doğrulama setindeki {0.01,01,0.1,0.5,1,5,10} kümesi boyunca süpürüldü ve test raporlaması için en iyi değer düzeltildi. Üst-K MIL toplaması için Şekil 3'e ve tanımlar için Denklem(3-4)'e bakın.
(3)
(4)
Değerlendirme: Çerçeve düzeyinde AUC, önceki WS-VAD çalışmaları 2,5 tarafından kullanılan standart protokol izlenerek hesaplandı. UCF-Crime'da ayrıntılı tip tanıma için, Tablo 2'de özetlendiği gibi, IoU 0.1-0.5'te mAP ve AVG mAP rapor edilmiştir; sınıf başına EAA'lar Şekil 4'te ve genel sonuçlar Tablo 3 ve Tablo 4'te gösterilmektedir; gömülebilir ayrılabilirlik ve anomali puanı dinamikleri Şekil 4, Şekil 5 ve Şekil 6'dadır.