Research Article

نموذج محاذاة المرساة الدلالي للكشف عن شذوذ الفيديو القابل للتفسير تحت إشراف ضعيف متعدد الوسائط

DOI:

10.3791/69286

November 14th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يهدف هذا البروتوكول إلى تحسين اكتشاف شذوذ الفيديو الخاضع للإشراف الضعيف من خلال دمج المعرفة المنظمة. هدفها هو تمكين تصنيف أنواع معينة من الحالات الشاذة وتقديم تفسيرات واضحة وقابلة للتفسير لنتائج الكشف ، وتجاوز القرارات الثنائية البسيطة وتعزيز الشفافية.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعد اكتشاف الحالات الشاذة للفيديو الخاضعة للإشراف الضعيف أسلوبا رئيسيا يعتمد فقط على التصنيفات على مستوى الفيديو لتحديد الأحداث الشاذة. ومع ذلك ، تعتمد طرق التعلم التقليدية متعددة المثيلات (MIL) على الإشراف الثنائي الخشن الحبيبات. هذا النهج يجعل من الصعب التمييز بين فئات الشذوذ الدقيقة. غالبا ما تركز هذه الأساليب فقط على الأجزاء الأكثر شذوذا ، مما يؤدي إلى نتائج الكشف التي تفتقر إلى قابلية التفسير. للتغلب على هذه القيود ، تقترح هذه الدراسة نهج نمذجة الميزات الذي يتضمن المعرفة المنظمة. من خلال استخدام آلية التوجيه الدلالي الديناميكية ، يجمع اكتشاف شذوذ الفيديو الخاضع للإشراف الضعيف بين المعلومات الخارجية على مستوى الفئة والمطالبات القابلة للتعلم لإنشاء إشارات دلالية داخل مساحة الميزة. تتماشى هذه الإشارات مع الأدلة المرئية المستخرجة بواسطة وحدة الكشف عن الشذوذ الأساسي ، مما ينتج عنه مخرجين تكميليين: درجة الشذوذ لقياس شدة الأحداث الشاذة ، والأوصاف الدلالية المتوافقة مع المفاهيم الخارجية ، والتي يمكن استخدامها لإنشاء نصوص توضيحية منظمة وقابلة للتفسير من خلال قوالب محددة مسبقا. تظهر النتائج التجريبية أن الطريقة المقترحة تحقق AUC بنسبة 88.03٪ على مجموعة بيانات UCF-Crime و 98.23٪ على مجموعة بيانات ShanghaiTech ، وتحقق دقة 87.05٪ في مهام تصنيف الشذوذ الدقيقة. علاوة على ذلك ، فإن التفسيرات الدلالية التي تم إنشاؤها تمتد إلى الكشف الخاضع للإشراف الضعيف من مهمة التصنيف الثنائي إلى إطار عمل تحليل الشذوذ القائم على الدلالات والقابل للتفسير.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يلعب الكشف عن شذوذ الفيديو (VAD) دورا أساسيا في مجالات مثل السلامة العامة والتصنيع الذكي, حيث يوفر حلا قابلا للتطوير لقيود المراقبة اليدوية1. على وجه الخصوص ، اكتسب اكتشاف شذوذ الفيديو الخاضع للإشراف الضعيف (WS-VAD) مكانة بارزة بسبب اعتماده على الملصقات على مستوى الفيديو ، مما يقلل بشكل كبير من عبء التعليقات التوضيحية اليدوية مع تحسين قابلية التعميم عبر المشاهد المتنوعة. على الرغم من مزاياها العملية ، لا تزال طرق WS-VAD تواجه تحديات كبيرة في تحديد طبيعة الأحداث غير الطبيعية بدقة2. غالبا ما تكتشف النماذج الحالية وجود حالات شاذة ولكنها تكافح لتحديد فئتها الدقيقة أو توفير معلومات تشخيصية ذات مغزى3،4. على سبيل المثال ، في البيئات الصناعية ، قد يخلط النموذج بين الدخان الناتج عن المحامل المحمومة وانبعاثات البخار غير الضارة أو يعتقد بشكل غير صحيح أن شرارات اللحام العادية هي علامات مبكرة للحريق ، وكلاهما يؤدي إلى سوء تقدير مكلف وعمليات إغلاق غير ضرورية. تنشأ هذه الالتباسات الدلالية من القيود المتأصلة في مناهج WS-VAD الحالية5. تشير الملصقات الثنائية على مستوى الفيديو فقط إلى ما إذا كان هناك شذوذ ، دون تقديم نظرة ثاقبة لسببه وموقعه وشدته. علاوة على ذلك ، فإن أطر عمل التعلم متعدد المثيلات (MIL)السائدة 6 تنبؤات مجمعة على مستوى المقطع باستخدام الاستدلالالبسيط 7 التي تفشل في التقاط الدلالات الدقيقة لأنواع الأحداث المختلفة. نتيجة لذلك ، تصبح مساحة الميزة المرئية المكتسبة غامضة ، حيث يتم تعيين ظواهر متشابهة بصريا ولكنها متميزة دلاليا - مثل الدخان والبخار - عن كثب شديد ، مما يؤدي إلى عدم وضوح حدود القرار.

ظهر اتجاهان بحثيان رئيسيان لمعالجة هذه القيود. يركز أحدهما على تعزيز إطار عمل MIL من خلال تحسين النمذجة الزمنية4،5،8 أو اختيار الميزات الموجهة بالبروز3. على الرغم من أن مثل هذه الأساليب تعمل على تحسين توطين الشذوذ ، إلا أنها لا تزال قاصرة في تقديم الوضوح الدلالي وقابلية التفسير. يتضمن الاتجاه الآخر مواءمة تمثيلات الرؤية واللغة من خلال دمج نماذج متعددة الوسائط مدربة مسبقا ، مثل VadCLIP9. في حين أن هذه الإستراتيجية تبشر بالخير ، إلا أنها غالبا ما تفشل في الاستفادة الكاملة من الثراء الدلالي للغة. وهذا يؤدي إلى ضعف الارتباطات عبر الوسائط وعمليات صنع القرار غير الشفافة، مما يؤدي إلى نقصين أساسيين. أولا ، لا يمكن للنماذج الحالية التمييز باستمرار بين فئات الشذوذ بسبب دلالات الميزات الغامضة والمعرفة الخارجية غير الكافية. ثانيا ، تحتوي عملية صنع القرار على صندوق أسود ، دون تفسير شفاف لسبب تصنيف حدث معين على أنه شاذ. على الرغم من أن بعض الطرق تتضمن مطالبات نصية (على سبيل المثال ، القتال ، إطلاق النار) ، إلا أنها دائما ما تكون مبسطة ومنظمة بشكل فضفاض ، وتفتقر إلى العمق الدلالي والفهم السياقي.

لمعالجة هذه الفجوات ، تم تقديم طريقة WS-VAD جديدة تدمج المعرفة الخارجية المنظمة مع آليات القرار القابلة للتفسير ، وهو هدف أساسي في المجال الأوسع للذكاء الاصطناعي القابل للتفسير (XAI) 10. بدلا من استخدام أسماء الفئات الأساسية كمطالبات ، تقوم الطريقة ببناء تمثيلات دلالية غنية - يشار إليها باسم سحب المفاهيم الدلالية - باستخدام ويكي بيانات11. على عكس الأساليب متعددة الوسائط الحالية مثل VadCLIP9 التي تعتمد على مطالبات النص الثابت أو تسميات الفئات البسيطة ، فإن سحب المفاهيم الدلالية هذه تغلف المعرفة السياقية الشاملة ، بما في ذلك الكيانات ذات الصلة والسمات والعلاقات السببية المستخرجة من الرسوم البيانية المعرفية المنظمة. يتم ترميز سحابات المفاهيم هذه في نقاط ارتساء دلالية باستخدام نموذج BLIP12 ، والذي يمكن النظام من الوصول إلى دلالات الأحداث الدقيقة. يكمن الابتكار الرئيسي لآلية المرساة الدلالية في قدرتها على إنشاء تمثيلات ديناميكية غنية بالمعرفة تتكيف مع سياقات شذوذ محددة ، بينما تستخدم الأساليب السابقة المستندة إلى السرعة أوصافا نصية ثابتة تفتقر إلى العمق السياقي والعلاقات الدلالية. لزيادة تحسين مساحة الميزة ، تربط آلية المحاذاة الموجهة بالبارز بشكل انتقائي هذه المراسي بالأدلة المرئية الأكثر صلة. تعمل هذه المحاذاة المستهدفة على تعزيز القوة التمييزية للميزات مع تحسين الوضوح الدلالي لنتائج الكشف. والأهم من ذلك ، أن الطريقة المقترحة تدعم التفسير الشفاف. بمجرد محاذاة المرساة الدلالية مع الأدلة المرئية ، يقوم النموذج بإنشاء تفسيرات منظمة للغة الطبيعية باستخدام قوالب محددة مسبقا ، تتناول صراحة طبيعة وتبرير الشذوذ. من المهم ملاحظة أن تنفيذ هذه الطريقة يعتمد على متطلبات مسبقة محددة، بما في ذلك استخدام الميزات المرئية I3D المستخرجة مسبقا، والوصول إلى قاعدة معارف خارجية (ويكي بيانات)، وبرنامج تشفير BLIP مدرب مسبقا. لذلك يكون إطار العمل أكثر فائدة في التطبيقات حيث يكون من الأهمية بمكان تجاوز الكشف الثنائي البسيط لتصنيف أنواع معينة من الشذوذ بدلا من ذلك وتقديم مبررات قابلة للتفسير للنتائج.

المساهمات الرئيسية هي كما يلي. تم تطوير طريقة WS-VAD جديدة من خلال الجمع بين المعرفة الخارجية وقابلية التفسير المنظم لتحسين الفهم الدلالي وشفافية القرار. تم تقديم طريقة المطالبة القائمة على التضمين الدلالي وآلية المحاذاة المدركة للسياق للتغلب على قيود نماذج MIL المرئية فقط. تم دمج وحدة الشرح التوليدي ، باستخدام المراسي الدلالية كوحدات قابلة للتفسير لإنتاج مبررات نصية متماسكة. تظهر التجارب المكثفة التي أجريت على مجموعات بيانات UCF-Crime و ShanghaiTech فعالية الطريقة المقترحة ، وتحقيق درجات AUC قوية (88.03٪ / 98.23٪) وأداء تعرف دقيق فائق ، مع مخرجات واضحة وقابلة للتفسير.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تستخدم هذه الدراسة مجموعات البيانات المتاحة للجمهور فقط (UCF-Crime13 و ShanghaiTech14). تم الحصول على جميع مقاطع الفيديو من الإصدارات الرسمية لمجموعات البيانات ، والتي تعمل على إخفاء هوية معلومات التعريف الشخصية إلى الحد الذي يوفره مشرفو مجموعة البيانات. لم يقم المؤلفون بجمع بيانات إضافية أو تفاعل مع الشخص البشري. لذلك ، لم تكن هناك حاجة إلى موافقة IRB جديدة. يتوافق استخدام البيانات مع تراخيص وشروط استخدام مجموعات البيانات المعنية.

إعداد البيانات واستخراج الميزات

إعداد مجموعة البيانات: تم اعتماد مجموعات بيانات UCF-Crime13 (1,610 قطار / 290 مقطع فيديو اختباري) و ShanghaiTech14 (238 قطار / 199 مقطع فيديو اختباري) بموجب تقسيماتها القياسية. تمت معالجة مقاطع الفيديو مسبقا باستخدام FFmpeg لضمان قابلية التكرار ، وإعادة ترميزها إلى H.264 ، وإعادة تشكيل إلى 25 إطارا في الثانية ، وتغيير حجمها إلى دقة 256 × 256 مع الأمر: ffmpeg -i v.mp4 -vf "fps = 25 ، scale = 256: 256" -c: v libx264 -crf 23 -preyfast pre/.

استخراج الميزة: تم استخراج ميزات RGB بواسطة العمود الفقري I3D15 المدرب مسبقا على مجموعة بيانات Kinetics16. تم تقسيم مقاطع الفيديو إلى مقاطع غير متداخلة مكونة من 16 إطارا. تم اقتصاص كل مقطع في المنتصف إلى 224 × 224 بكسل. تم تجميع عمليات تنشيط الطبقة قبل الأخيرة بشكل متوسط للحصول على ميزة 1024-D لكل مقطع. في PyTorch ، يتوافق هذا مع إعادة توجيه موترات الشكل [B ، 3 ، T ، H ، W] من خلال العمود الفقري I3D وتطبيق adaptive_avg_pool3d متبوعا بالتسطيح. تم حفظ الميزات المستخرجة في ملفات .npy (واحدة لكل فيديو) جنبا إلى جنب مع الطوابع الزمنية للمقطع لقابلية التكرار الدقيقة (البذور = 123). لكل مقطع فيديو، تحتوي features///

بنية ومنهجية النموذج

الكشف الأساسي: اندماج السياق الزمني
بالنظر إلى تسلسل مقطع الفيديو الذي يمثله مصفوفة ميزة Z figure-protocol-1 RTx1024 ، قامت وحدة Temporal Context Fusion (TCF) أولا بحساب الاستعلام والمفتاح وتمثيلات القيمة من خلال ثلاثة إسقاطات خطية مكتسبة:

س = ZWQ ، K = ZWK ، V = ZWV (1)

حيث WQ و WK و WV figure-protocol-2R Tx1024xd هي معلمات قابلة للتدريب (PyTorch: ثلاثة nn. طبقات خطية (1024 ، د). كان التقارب بين القطاعات S = figure-protocol-3، تم دمج تضمين العلائقية الزمنية (TRE) ، حيث تم حساب كل عنصر على أنه Rij = α exp (figure-protocol-4) + β. كان figure-protocol-5 التقارب المدرك للموقع = S + R. خريطة السياق العالمي A = softmax(figure-protocol-6) مجمعة V للحصول على ميزات واسعة النطاق G = AV. تم حساب الميزات المحلية L بالتفاف 1-D عميق (nn. Conv1d) من حجم النواة 3 على Z. بوابة ديناميكية g = σ(MLP ([G;L])) خلط الاثنين: U = gfigure-protocol-7 G + (1 - g) figure-protocol-8 L . أخيرا ، تم تطبيق تطبيع الطبقة والطبقة الخطية المتبقية لإنتاج Y (Pytorch: LayerNorm + Linear + residual). 

الكشف الأساسي: المتنبئ الزمني السببي

تم تمرير الإخراج Y من خلال تلافيف سببي 1-D مع GELU والتسرب (Pytorch: padding = 'سببي' أو مقنع) للحصول على سجلات شذوذ لكل مقطع. أسفر تطبيق الدالة السيني عن قيم figure-protocol-9 احتمالية [0،1] T.

التعزيز الدلالي: التعلم الفوري بالمعرفة الخارجية

بناء المراسي الدلالية: لكل فئة شذوذ c ، تم الاستعلام عن مفاهيم KC من ويكي بيانات11 ، وتم ترميز كل عبارة مفهوم باستخدام مشفرنص BLIP 12إلى eifigure-protocol-10R768. كانت مرساة الفصل هي المتوسط الطبيعي ل2 Dc = المعيار (figure-protocol-11Σiei). لتقليل الضوضاء ، تم إسقاط المفاهيم ذات التشابه مع جيب التمام مع اسم الفئة أقل من 0.2 ، وتم الاحتفاظ بأعلى درجة M بواسطة TF-IDF.  

إجراء فصل حساس للسياق: تم حساب الأوزان الأمامية αt = softmax (rst) من درجات كاشف القاعدة st ، وأوزان الخلفية bt = softmax (r (1 -s t)). الميزات المرجحة هي ffg = Σtαzt و fbg = Σtbzt .

محاذاة الميزات المرئية والدلالية

تحديد هدف المحاذاة: أثناء خطوة المحاذاة، يتمثل الهدف في تقليل المسافة بين الميزة المرئية الأمامية والمرساة الدلالية المقابلة لها للفئة الشاذة داخل مساحة الميزة. قم بإنشاء مجموعة من الأدلة الدلالية ، figure-protocol-12التي تشتمل على أدلة دلالية من الفئة الشاذة C ودليل دلالي عادي قياسي واحد. تحديد الاحتمالية ، P(Dk|v) ، أن الميزة المرئية ، v ، تتوافق مع الدليل الدلالي k-th ، Dk. احسب هذا باستخدام تشابه جيب تمام التمام بدرجة الحرارة متبوعا بتطبيع Softmax ، كما هو موضح في المعادلة.

figure-protocol-13(2)

تم تقليل الانتروبيا المتقاطعة لدفع الأزواج الموجبة معا والسلبيات بعيدا ، مع تعيين τs كمعلمة قابلة للتعلم وتهيئتها إلى 10. أنجز المحاذاة من خلال تحسين احتمالية ربط أزواج العينات الإيجابية مع تقليل احتمالية ربط أزواج العينات السلبية.

وحدة قابلية التفسير المستندة إلى القالب

استنادا إلى التعلم الفوري مع المعرفة الخارجية (PLE) - تمثيل الميزات المحسنة ، ينتج المصنف الخطي لوجيتات لكل فئة ، والتي تم تطبيعها لاحقا إلى احتمالات الفصل بواسطة وظيفة softmax ؛ تم تحديد نوع الشذوذ المتوقع باعتباره الفئة ذات الاحتمال الأعلى. وفي الوقت نفسه ، تم حساب درجة الشذوذ العالمية من ناتج الكاشف. لتحديد مستوى الخطورة، تمت مقارنة هذه النتيجة بثلاثة عتبات محددة مسبقا تم تحسينها من خلال البحث في الشبكة على مجموعة التحقق من الصحة.

تم تعيين العتبات الافتراضية على θعالية = 0.8 ، و θمتوسط = 0.5 ، و θمنخفض = 0.2. على وجه التحديد ، إذا كانت النتيجة أكبر من θعالية ، فقد تم تصنيف الشدة على أنها عالية. إذا كانت النتيجة تقع بينθ متوسط و θمرتفع ، فقد تم تصنيفها على أنها متوسطة. إذا كان بين θمنخفض و θمتوسط ، فقد تم تصنيفه على أنه منخفض ؛ خلاف ذلك ، تم تمييزه على أنه لا شيء.

أثناء مرحلة إنشاء التفسير ، تم اختيار قالب يتوافق مع النوع المتوقع من مكتبة قوالب محددة مسبقا ، الملف التكميلي 1. تحتوي هذه المكتبة على متغيرات قوالب متعددة تم التحقق من صحتها بواسطة العديد من المعلقينالتوضيحيين 17 لتعزيز تنوع النص الذي تم إنشاؤه. إذا كان النوع المتوقع موجودا في مكتبة القوالب ، تحديد قالب مقابل عشوائيا. وإلا، تم استخدام قالب افتراضي للنوع غير معروف. أخيرا ، تم إنشاء نص توضيحي منظم من خلال دمج النوع المتوقع ، ودرجة الشذوذ العمومي ، ووصف الخطورة ، والقالب المحدد. يقوم النظام بإرجاع نوع الشذوذ المتوقع ودرجة الشذوذ العمومي والنص التوضيحي الذي تم إنشاؤه كإخراج نهائي. النتائج موضحة في الشكل 2.

تم تحسين جميع معلمات العتبة باستخدام البحث الشبكي في مجموعة التحقق من الصحة ، وتم تقييم جودة التفسيرات التي تم إنشاؤها بشكل شامل باستخدام كل من التقييم البشري والمقاييس الآلية. يتم عرض النتائج في الجدول 1.

التدريب والتقييم النموذجي

التدريب: تم تدريب النموذج من طرف إلى طرف مع آدم (lr 1 × 10-4 ، تسوس الوزن 5 × 10-4) ، حجم الدفعة 128 ، 50 حقبة ، تلدين جيب التمام ل lr. تم تعيين البذور العشوائية على 123 ل Python / Numpy / Pytorch وتمكين torch.backends.cudnn.deterministic = True. تم حفظ نقاط التفتيش كل 5 فترات في نقاط التفتيش / / epoch_XX.pt ، وتم اختيار أفضل نموذج عن طريق التحقق من صحة AUC. تم إجراء جميع التجارب على نظام مزود بوحدة معالجة رسومات NVIDIA GeForce RTX 4060 Ti (16 جيجابايت) تعمل بنظام التشغيل Windows 11 ، مع Python 3.8.20 و PyTorch 1.8.0 و CUDA 11.1. كان وقت التدريب التقريبي لكل حقبة 30 ثانية لمجموعة بيانات ShanghaiTech و 3.5 دقيقة لمجموعة بيانات UCF-Crime.

الخسارة: الهدف العام هو L = LMIL+ λ • Lمحاذاة. تم اجتياح المعلمة الفائقة λ عبر المجموعة {0.01,0.1,0.5,1,5,10} على مجموعة التحقق من الصحة، وتم إصلاح أفضل قيمة لإعداد تقارير الاختبار. انظر الشكل 3 لتجميع MIL العلوي K والمعادل (3-4) للتعريفات.

figure-protocol-14(3)

figure-protocol-15(4)

التقييم: تم حساب AUC على مستوى الإطار وفقا للبروتوكول القياسي المستخدم من قبل أعمال WS-VAD السابقة2،5. للتعرف على النوع الدقيق على UCF-Crime ، تم الإبلاغ عن mAP في IoU 0.1-0.5 و AVG mAP ، كما هو موضح في الجدول 2 ؛ يتم عرض AUCs لكل فئة في الشكل 4 والنتائج الإجمالية في الجدولين 3 والجدول 4 ؛ التضمين بين قابلية الفصل وديناميكيات الدرجات الشاذة في الشكل 4 والشكل 5 والشكل 6.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لمزيد من التحقق من فائدة المراسي الدلالية ، تم إجراء تجربة إضافية لمقارنة القوالب السريعة المختلفة (انظر الجدول 1). لم يحقق المتغير الذي يستخدم النماذج الأولية الدلالية المعززة بويكي بيانات قيم AUC أعلى فحسب ، بل أدى أيضا إلى تحسينات في درجات BLEU-4 بنسبة 16.6 و 14.8 للتفسيرات التي تم إنشاؤها. تشير هذه النتائج إلى وجود صلة قوية بين الثراء الدلالي للمطالبات وجودة التفسيرات النصية ، مما يؤكد أن عملية إنشاء التفسير تتجاوز ملء القوالب الصارمة من خلال الاستفادة من البنية الدل...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يقدم البروتوكول المقدم هنا تقدما كبيرا في اكتشاف شذوذ الفيديو الخاضع للإشراف الضعيف عن طريق تحويل النموذج من التصنيف الثنائي البسيط إلى تحليل قائم على أساس دلالي وقابل للتفسير. تكمن أهمية هذه الطريقة في قدرتها ليس فقط على تحديد ما إذا كان هناك شذوذ ولكن أيضا نوع الشذوذ ولماذا توصل النموذج إلى هذا الاستنتاج ، ومعالجة قيود كبيرة في أنظمة WS-VAD الحالية9،29.

خيارات التصميم والأساس المنطقي...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ليس لدى المؤلفين تضارب في المصالح.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

نحن نعرب عن امتناننا للدعم المالي المقدم من شركة Aerospace Hongka Intelligent Technology (Beijing) CO.، LTD.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
<نموذج ب>BLIP

سيلزفورس ريسيرشViT-B/16يستخدم كمشفر نص لإنشاء مراسي دلالية.
الجرافيكNVIDIARTX 4060Tiيستخدم لتدريب النموذج
نموذج I3Dجوجل ديب مايندتدريب مسبق على الكينيتكس يستخدم كعمود فقري لاستخراج ميزات الفيديو.
نومبيفريق تطوير نومبي1.21.2تستخدم للتعامل مع ومعالجة مصفوفات البيانات الرقمية، مثل ميزات الفيديو، قبل إدخالها في نموذج التعلم العميق.
بايتورشأبحاث الذكاء الاصطناعي على فيسبوك1.8.0يستخدم لتعريف بنية النموذج، وتنفيذ دوال الفقدان المخصصة، وتشغيل الانتشار العكسي للتحسين.
بايثونمؤسسة بايثون للبرمجيات3.8.20يستخدم لكتابة جميع السكريبتات لمعالجة البيانات، وتنفيذ النماذج، والتدريب، والتقييم
مجموعة بيانات شنغهاي تكجامعة شنغهاي تكاستخدم للتدريب والتقييم في 13 مشهدا مختلفا في الحرم الجامعي.
مجموعة بيانات الجريمة في UCF جامعة وسط فلوريدااستخدم للتدريب وتقييم 13 فئة من الشذوذ.
ويكيداتامؤسسة ويكيميديايستخدم كرسم بياني للمعرفة الخارجية لبناء السرعة.

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Abdalla, M., Javed, S., Radi, M. A., Ulhaq, A., Werghi, N. Video anomaly detection in 10 years: A survey and outlook. arXiv. , (2024).
  2. Caetano, F., Carvalho, P., Mastralexi, C., Cardoso, J. S. Enhancing weakly-supervised video anomaly detection with temporal constraints. IEEE Access. 13, 70882-70894 (2025).
  3. Dual memory units with uncertainty regulation for weakly supervised video anomaly detection. Zhou, H., Yu, J., Yang, W. Proc AAAI Conf Artificial Intell, 37 (3), 3769-3777 (2023).
  4. Dynamic local aggregation network with adaptive clusterer for anomaly detection. Yang, Z., Wu, P., Liu, J., Liu, X. Proc Eur Conf Comp Vision, 13664, 404-421 (2022).
  5. Pu, Y., Wu, X., Yang, L., Wang, S. Learning prompt-enhanced context features for weakly-supervised video anomaly detection. IEEE Trans. Image Process. 33 (8), 4923-4936 (2024).
  6. Look around for anomalies: Weakly-supervised anomaly detection via context-motion relational learning. Cho, M., et al. Proc Conf Comp Vision Pattern Recognit, , 12137-12146 (2023).
  7. Tian, Y., et al. Weakly-supervised video anomaly detection with robust temporal feature magnitude learning. Proc Int Conf Comp Vision. , 4955-4966 (2021).
  8. Scale-aware spatio-temporal relation learning for video anomaly detection. Li, G., Cai, G., Zeng, X., Zhao, R. Proc Eur Conf Comp Vision, , 333-350 (2022).
  9. Vadclip: Adapting vision-language models for weakly supervised video anomaly detection. Wu, P., et al. Proc Conf Artificial Intell, 38 (6), 6074-6082 (2024).
  10. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications, and challenges. Comp Elect Eng. 117, 109246(2024).
  11. Vrandecic, D., Kroetzsch, M. Wikidata: A free collaborative knowledgebase. Comm ACM. 57 (10), 78-85 (2014).
  12. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. Li, J., Li, D., Xiong, C., Hoi, S. Proc Int Conf Machine Learning, 162, 12888-12900 (2022).
  13. Real-world anomaly detection in surveillance videos. Sultani, W., Chen, C., Shah, M. I. Proc Conf Comp Vision Pattern Recognit, , 6479-6488 (2018).
  14. Future frame prediction for anomaly detection - a new baseline. Liu, W., Luo, W., Lian, D., Gao, S. I. Proc Conf Comp Vision Pattern Recognit, , 6536-6545 (2018).
  15. Quo vadis, action recognition? A new model and the kinetics dataset. Carreira, J., Zisserman, A. Proc Conf Comp Vision Pattern Recognit, , 6299-6308 (2017).
  16. Kay, W., et al. The kinetics human action video dataset. arXiv. , (2017).
  17. Purba, M., et al. Effect of random splitting and cross validation for Indonesian opinion mining using machine learning approach. Int J Adv Comp Sci Appl. 13 (9), 145-151 (2022).
  18. Wu, P., Liu, X., Liu, J. Weakly supervised audio-visual violence detection. Ieee Transact Multimedia. 25, 1674-1685 (2023).
  19. Liu, T., Lam, K. M., Bao, B. K. Injecting text clues for improving anomalous event detection from weakly labeled videos. Ieee Transact Image Proc. 33, 5907-5920 (2024).
  20. Wu, P., Liu, J. Learning causal temporal relation and feature discrimination for anomaly detection. Ieee Transact Image Proc. 30, 3513-3527 (2021).
  21. Assoc Advancement Artificial, I. Self-training multi-sequence learning with transformer for weakly supervised video anomaly detection. Li, S., Liu, F., Jiao, L. Proc Conf Artificial Intell, 36 (2), 1395-1403 (2022).
  22. Normality guided multiple instance learning for weakly supervised video anomaly detection. Park, S., et al. Proc Winter Conf Appl Comp Vision, , 2664-2673 (2023).
  23. Zanella, L., et al. Delving into clip latent space for video anomaly recognition. Comp Vision Image Understanding. 249, 104163(2024).
  24. Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection. Chen, J., et al. Proc Conf Com Vision Pattern Recognit, , 18319-18329 (2024).
  25. Distilling aggregated knowledge for weakly-supervised video anomaly detection. Dalvi, J., Dabouei, A., Dhanuka, G., Xu, M. Proc Winter Conf Appl Comp Vision, , 5439-5448 (2025).
  26. Gods: Generalized one-class discriminative subspaces for anomaly detection. Wang, J., Cherian, A. I. Proc Int Conf Comp Vision, , 8200-8210 (2019).
  27. Biswas, D., Tesic, J. Mmvad: A vision-language model for cross-domain video anomaly detection with contrastive learning and scale-adaptive frame segmentation. Exp Syst Appl. 285, 127857(2025).
  28. Lim, J., Lee, J., Kim, H., Park, E. Vicap-ad: Video caption-based weakly supervised video anomaly detection. Machine Vision Applicat. 36 (3), 61(2025).
  29. Gao, W., Wang, X., Wang, Y., Jing, X. Dual-stream attention-enhanced memory networks for video anomaly detection. Sensors. 25 (17), 5496(2025).
  30. Duong, H. T., Le, V. T., Hoang, V. T. Deep learning-based anomaly detection in video surveillance: A survey. Sensors. 23 (11), 5024(2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Video Anomaly DetectionWeak SupervisionSemantic GuidanceMultiple Instance LearningAnomaly ScoreFine Grained ClassificationStructured KnowledgeCross Modal LearningInterpretable DetectionVisual Evidence

Related Articles