$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تستخدم هذه الدراسة مجموعات البيانات المتاحة للجمهور فقط (UCF-Crime13 و ShanghaiTech14). تم الحصول على جميع مقاطع الفيديو من الإصدارات الرسمية لمجموعات البيانات ، والتي تعمل على إخفاء هوية معلومات التعريف الشخصية إلى الحد الذي يوفره مشرفو مجموعة البيانات. لم يقم المؤلفون بجمع بيانات إضافية أو تفاعل مع الشخص البشري. لذلك ، لم تكن هناك حاجة إلى موافقة IRB جديدة. يتوافق استخدام البيانات مع تراخيص وشروط استخدام مجموعات البيانات المعنية.
إعداد البيانات واستخراج الميزات
إعداد مجموعة البيانات: تم اعتماد مجموعات بيانات UCF-Crime13 (1,610 قطار / 290 مقطع فيديو اختباري) و ShanghaiTech14 (238 قطار / 199 مقطع فيديو اختباري) بموجب تقسيماتها القياسية. تمت معالجة مقاطع الفيديو مسبقا باستخدام FFmpeg لضمان قابلية التكرار ، وإعادة ترميزها إلى H.264 ، وإعادة تشكيل إلى 25 إطارا في الثانية ، وتغيير حجمها إلى دقة 256 × 256 مع الأمر: ffmpeg -i v.mp4 -vf "fps = 25 ، scale = 256: 256" -c: v libx264 -crf 23 -preyfast pre/.
استخراج الميزة: تم استخراج ميزات RGB بواسطة العمود الفقري I3D15 المدرب مسبقا على مجموعة بيانات Kinetics16. تم تقسيم مقاطع الفيديو إلى مقاطع غير متداخلة مكونة من 16 إطارا. تم اقتصاص كل مقطع في المنتصف إلى 224 × 224 بكسل. تم تجميع عمليات تنشيط الطبقة قبل الأخيرة بشكل متوسط للحصول على ميزة 1024-D لكل مقطع. في PyTorch ، يتوافق هذا مع إعادة توجيه موترات الشكل [B ، 3 ، T ، H ، W] من خلال العمود الفقري I3D وتطبيق adaptive_avg_pool3d متبوعا بالتسطيح. تم حفظ الميزات المستخرجة في ملفات .npy (واحدة لكل فيديو) جنبا إلى جنب مع الطوابع الزمنية للمقطع لقابلية التكرار الدقيقة (البذور = 123). لكل مقطع فيديو، تحتوي features///
بنية ومنهجية النموذج
الكشف الأساسي: اندماج السياق الزمني
بالنظر إلى تسلسل مقطع الفيديو الذي يمثله مصفوفة ميزة Z
RTx1024 ، قامت وحدة Temporal Context Fusion (TCF) أولا بحساب الاستعلام والمفتاح وتمثيلات القيمة من خلال ثلاثة إسقاطات خطية مكتسبة:
س = ZWQ ، K = ZWK ، V = ZWV (1)
حيث WQ و WK و WV
R Tx1024xd هي معلمات قابلة للتدريب (PyTorch: ثلاثة nn. طبقات خطية (1024 ، د). كان التقارب بين القطاعات S =
، تم دمج تضمين العلائقية الزمنية (TRE) ، حيث تم حساب كل عنصر على أنه Rij = α exp (
) + β. كان
التقارب المدرك للموقع = S + R. خريطة السياق العالمي A = softmax(
) مجمعة V للحصول على ميزات واسعة النطاق G = AV. تم حساب الميزات المحلية L بالتفاف 1-D عميق (nn. Conv1d) من حجم النواة 3 على Z. بوابة ديناميكية g = σ(MLP ([G;L])) خلط الاثنين: U = g
G + (1 - g)
L . أخيرا ، تم تطبيق تطبيع الطبقة والطبقة الخطية المتبقية لإنتاج Y (Pytorch: LayerNorm + Linear + residual).
الكشف الأساسي: المتنبئ الزمني السببي
تم تمرير الإخراج Y من خلال تلافيف سببي 1-D مع GELU والتسرب (Pytorch: padding = 'سببي' أو مقنع) للحصول على سجلات شذوذ لكل مقطع. أسفر تطبيق الدالة السيني عن قيم
احتمالية [0،1] T.
التعزيز الدلالي: التعلم الفوري بالمعرفة الخارجية
بناء المراسي الدلالية: لكل فئة شذوذ c ، تم الاستعلام عن مفاهيم KC من ويكي بيانات11 ، وتم ترميز كل عبارة مفهوم باستخدام مشفرنص BLIP 12إلى ei
R768. كانت مرساة الفصل هي المتوسط الطبيعي ل2 Dc = المعيار (
Σiei). لتقليل الضوضاء ، تم إسقاط المفاهيم ذات التشابه مع جيب التمام مع اسم الفئة أقل من 0.2 ، وتم الاحتفاظ بأعلى درجة M بواسطة TF-IDF.
إجراء فصل حساس للسياق: تم حساب الأوزان الأمامية αt = softmax (rst) من درجات كاشف القاعدة st ، وأوزان الخلفية bt = softmax (r (1 -s t)). الميزات المرجحة هي ffg = Σtαzt و fbg = Σtbzt .
محاذاة الميزات المرئية والدلالية
تحديد هدف المحاذاة: أثناء خطوة المحاذاة، يتمثل الهدف في تقليل المسافة بين الميزة المرئية الأمامية والمرساة الدلالية المقابلة لها للفئة الشاذة داخل مساحة الميزة. قم بإنشاء مجموعة من الأدلة الدلالية ،
التي تشتمل على أدلة دلالية من الفئة الشاذة C ودليل دلالي عادي قياسي واحد. تحديد الاحتمالية ، P(Dk|v) ، أن الميزة المرئية ، v ، تتوافق مع الدليل الدلالي k-th ، Dk. احسب هذا باستخدام تشابه جيب تمام التمام بدرجة الحرارة متبوعا بتطبيع Softmax ، كما هو موضح في المعادلة.
(2)
تم تقليل الانتروبيا المتقاطعة لدفع الأزواج الموجبة معا والسلبيات بعيدا ، مع تعيين τs كمعلمة قابلة للتعلم وتهيئتها إلى 10. أنجز المحاذاة من خلال تحسين احتمالية ربط أزواج العينات الإيجابية مع تقليل احتمالية ربط أزواج العينات السلبية.
وحدة قابلية التفسير المستندة إلى القالب
استنادا إلى التعلم الفوري مع المعرفة الخارجية (PLE) - تمثيل الميزات المحسنة ، ينتج المصنف الخطي لوجيتات لكل فئة ، والتي تم تطبيعها لاحقا إلى احتمالات الفصل بواسطة وظيفة softmax ؛ تم تحديد نوع الشذوذ المتوقع باعتباره الفئة ذات الاحتمال الأعلى. وفي الوقت نفسه ، تم حساب درجة الشذوذ العالمية من ناتج الكاشف. لتحديد مستوى الخطورة، تمت مقارنة هذه النتيجة بثلاثة عتبات محددة مسبقا تم تحسينها من خلال البحث في الشبكة على مجموعة التحقق من الصحة.
تم تعيين العتبات الافتراضية على θعالية = 0.8 ، و θمتوسط = 0.5 ، و θمنخفض = 0.2. على وجه التحديد ، إذا كانت النتيجة أكبر من θعالية ، فقد تم تصنيف الشدة على أنها عالية. إذا كانت النتيجة تقع بينθ متوسط و θمرتفع ، فقد تم تصنيفها على أنها متوسطة. إذا كان بين θمنخفض و θمتوسط ، فقد تم تصنيفه على أنه منخفض ؛ خلاف ذلك ، تم تمييزه على أنه لا شيء.
أثناء مرحلة إنشاء التفسير ، تم اختيار قالب يتوافق مع النوع المتوقع من مكتبة قوالب محددة مسبقا ، الملف التكميلي 1. تحتوي هذه المكتبة على متغيرات قوالب متعددة تم التحقق من صحتها بواسطة العديد من المعلقينالتوضيحيين 17 لتعزيز تنوع النص الذي تم إنشاؤه. إذا كان النوع المتوقع موجودا في مكتبة القوالب ، تحديد قالب مقابل عشوائيا. وإلا، تم استخدام قالب افتراضي للنوع غير معروف. أخيرا ، تم إنشاء نص توضيحي منظم من خلال دمج النوع المتوقع ، ودرجة الشذوذ العمومي ، ووصف الخطورة ، والقالب المحدد. يقوم النظام بإرجاع نوع الشذوذ المتوقع ودرجة الشذوذ العمومي والنص التوضيحي الذي تم إنشاؤه كإخراج نهائي. النتائج موضحة في الشكل 2.
تم تحسين جميع معلمات العتبة باستخدام البحث الشبكي في مجموعة التحقق من الصحة ، وتم تقييم جودة التفسيرات التي تم إنشاؤها بشكل شامل باستخدام كل من التقييم البشري والمقاييس الآلية. يتم عرض النتائج في الجدول 1.
التدريب والتقييم النموذجي
التدريب: تم تدريب النموذج من طرف إلى طرف مع آدم (lr 1 × 10-4 ، تسوس الوزن 5 × 10-4) ، حجم الدفعة 128 ، 50 حقبة ، تلدين جيب التمام ل lr. تم تعيين البذور العشوائية على 123 ل Python / Numpy / Pytorch وتمكين torch.backends.cudnn.deterministic = True. تم حفظ نقاط التفتيش كل 5 فترات في نقاط التفتيش / / epoch_XX.pt ، وتم اختيار أفضل نموذج عن طريق التحقق من صحة AUC. تم إجراء جميع التجارب على نظام مزود بوحدة معالجة رسومات NVIDIA GeForce RTX 4060 Ti (16 جيجابايت) تعمل بنظام التشغيل Windows 11 ، مع Python 3.8.20 و PyTorch 1.8.0 و CUDA 11.1. كان وقت التدريب التقريبي لكل حقبة 30 ثانية لمجموعة بيانات ShanghaiTech و 3.5 دقيقة لمجموعة بيانات UCF-Crime.
الخسارة: الهدف العام هو L = LMIL+ λ • Lمحاذاة. تم اجتياح المعلمة الفائقة λ عبر المجموعة {0.01,0.1,0.5,1,5,10} على مجموعة التحقق من الصحة، وتم إصلاح أفضل قيمة لإعداد تقارير الاختبار. انظر الشكل 3 لتجميع MIL العلوي K والمعادل (3-4) للتعريفات.
(3)
(4)
التقييم: تم حساب AUC على مستوى الإطار وفقا للبروتوكول القياسي المستخدم من قبل أعمال WS-VAD السابقة2،5. للتعرف على النوع الدقيق على UCF-Crime ، تم الإبلاغ عن mAP في IoU 0.1-0.5 و AVG mAP ، كما هو موضح في الجدول 2 ؛ يتم عرض AUCs لكل فئة في الشكل 4 والنتائج الإجمالية في الجدولين 3 والجدول 4 ؛ التضمين بين قابلية الفصل وديناميكيات الدرجات الشاذة في الشكل 4 والشكل 5 والشكل 6.