פרוטוקול זה נועד לשפר את זיהוי חריגות הווידאו בפיקוח חלש על ידי שילוב ידע מובנה. מטרתו היא לאפשר סיווג של סוגי אנומליות ספציפיים ולספק הסברים ברורים וניתנים לפירוש לתוצאות הזיהוי, מעבר להחלטות בינאריות פשוטות והגברת השקיפות.
מאמר מחקר
פרוטוקול זה נועד לשפר את זיהוי חריגות הווידאו בפיקוח חלש על ידי שילוב ידע מובנה. מטרתו היא לאפשר סיווג של סוגי אנומליות ספציפיים ולספק הסברים ברורים וניתנים לפירוש לתוצאות הזיהוי, מעבר להחלטות בינאריות פשוטות והגברת השקיפות.
זיהוי חריגות וידאו בפיקוח חלש הוא טכניקת מפתח המסתמכת אך ורק על תוויות ברמת הווידאו כדי לזהות אירועים חריגים. עם זאת, שיטות מסורתיות של למידה מרובת מופעים (MIL) מסתמכות על פיקוח בינארי גס. גישה זו מקשה על ההבחנה בין קטגוריות אנומליה עדינות. שיטות אלו מתמקדות לרוב אך ורק בקטעים החריגים ביותר, וכתוצאה מכך תוצאות זיהוי חסרות יכולת פרשנות. כדי להתגבר על מגבלות אלה, מחקר זה מציע גישת מידול תכונות המשלבת ידע מובנה. על ידי שימוש במנגנון הנחיה סמנטי דינמי, זיהוי אנומליה בווידאו בפיקוח חלש משלב מידע חיצוני ברמת הקטגוריה עם הנחיות הניתנות ללמידה ליצירת אותות סמנטיים בתוך מרחב התכונה. אותות אלה מיושרים עם הראיות החזותיות שחולצו על ידי מודול זיהוי האנומליה הבסיסית, ומייצרים שתי פלטים משלימים: ציון אנומליה לכימות חומרת אירועים חריגים, ותיאורים סמנטיים מיושרים עם מושגים חיצוניים, שניתן להשתמש בהם כדי ליצור טקסטי הסבר מובנים וניתנים לפירוש באמצעות תבניות מוגדרות מראש. תוצאות הניסוי מראות כי השיטה המוצעת משיגה AUC של 88.03% במערך הנתונים UCF-Crime ו-98.23% במערך הנתונים של ShanghaiTech, ומשיגה דיוק של 87.05% במשימות סיווג אנומליות עדינות. יתר על כן, ההסברים הסמנטיים שנוצרו מרחיבים את הזיהוי בפיקוח חלש ממשימת סיווג בינארית למסגרת ניתוח אנומליה מונעת סמנטיקה וניתנת לפרשנות.
זיהוי חריגות וידאו (VAD) ממלא תפקיד חיוני בתחומים כמו בטיחות הציבור וייצור חכם, שם הוא מציע פתרון ניתן להרחבה למגבלות המעקב הידני1. בפרט, זיהוי חריגות וידאו בפיקוח חלש (WS-VAD) זכה לבולטות בשל הסתמכותו על תוויות ברמת הווידאו, מה שמפחית באופן משמעותי את הנטל של הערות ידניות תוך שיפור יכולת ההכללה על פני סצנות מגוונות. למרות היתרונות המעשיים שלה, שיטות WS-VAD עדיין מתמודדות עם אתגרים משמעותיים בזיהוי מדויק של אופי האירועים החריגים2. מודלים קיימים מזהים לעתים קרובות נוכחות של חריגות אך מתקשים לקבוע את הקטגוריה המדויקת שלהם או לספק מידע אבחוני משמעותי 3,4. לדוגמה, במסגרות תעשייתיות, דגם עלול לבלבל עשן ממיסבים מחוממים יתר על המידה עם פליטת קיטור לא מזיקה או להאמין בטעות שניצוצות ריתוך רגילים הם סימנים מוקדמים לשריפה, שניהם מובילים לשיפוט שגוי יקר ולכיבוי מיותר. בלבול סמנטי זה נובע מהמגבלות האינהרנטיות של גישות WS-VAD הנוכחיות5. תוויות בינאריות ברמת הסרטון רק מציינות אם קיימת אנומליה, מבלי להציע תובנה לגבי הסיבה, המיקום והחומרה שלה. יתר על כן, מסגרות למידת מופעים מרובים (MIL) מיינסטרים6 תחזיות מצטברות ברמת הקליפ באמצעות היוריסטיקות פשוטות7 שאינן מצליחות ללכוד את הסמנטיקה הניואנסית של סוגי אירועים שונים. כתוצאה מכך, מרחב התכונות הוויזואליות הנלמד הופך למעורפל, שבו תופעות דומות מבחינה ויזואלית אך נבדלות מבחינה סמנטית - כמו עשן וקיטור - ממופות בצורה הדוקה מדי, ומטשטשות את גבולות ההחלטה.
שני כיווני מחקר עיקריים צצו כדי להתמודד עם מגבלות אלה. האחד מתמקד בשיפור מסגרת MIL באמצעות מודלים זמניים משופרים 4,5,8 או בחירת תכונות מונחות בולטות3. למרות ששיטות כאלה משפרות את לוקליזציה של אנומליה, הן עדיין אינן מציעות בהירות סמנטית ויכולת פרשנות. הכיוון השני כולל יישור ייצוגי חזון ושפה על ידי שילוב מודלים רב-מודאליים מאומנים מראש, כגון VadCLIP9. בעוד שאסטרטגיה זו נראית מבטיחה, לעתים קרובות היא לא מצליחה למנף באופן מלא את העושר הסמנטי של השפה. זה מוביל לאסוציאציות צולבות חלשות ותהליכי קבלת החלטות אטומים, וכתוצאה מכך שני ליקויים מרכזיים. ראשית, המודלים הנוכחיים אינם יכולים להבחין באופן עקבי בין קטגוריות אנומליה בגלל סמנטיקה מעורפלת של תכונות וידע חיצוני לא מספיק. שנית, תהליך קבלת ההחלטות מכיל קופסה שחורה, ללא הסבר שקוף מדוע אירוע מסוים מסווג כחריג. למרות ששיטות מסוימות משלבות הנחיות טקסטואליות (למשל, לחימה, ירי), הן תמיד פשטניות ומסודרות באופן רופף, חסרות הן עומק סמנטי והן הבנה הקשרית
כדי להתמודד עם פערים אלה, מוצגת שיטת WS-VAD חדשה המשלבת ידע חיצוני מובנה עם מנגנוני החלטה הניתנים לפרשנות, יעד ליבה בתחום הרחב יותר של בינה מלאכותית הניתנת להסבר (XAI)10. במקום להשתמש בשמות קטגוריות בסיסיים כהנחיות, השיטה בונה ייצוגים סמנטיים עשירים - המכונים ענני מושגים סמנטיים - באמצעות ויקינתונים11. בניגוד לשיטות רב-מודאליות קיימות כגון VadCLIP9 המסתמכות על הנחיות טקסט סטטיות או תוויות קטגוריות פשוטות, ענני מושגים סמנטיים אלה עוטפים ידע הקשרי מקיף, כולל ישויות קשורות, תכונות וקשרים סיבתיים המופקים מגרפי ידע מובנים. ענני קונספט אלה מקודדים לעוגנים סמנטיים באמצעות מודל BLIP12, המאפשר למערכת לגשת לסמנטיקה של אירועים עדינה. החידוש העיקרי של מנגנון העוגן הסמנטי טמון ביכולתו ליצור ייצוגים דינמיים ומועשרים בידע המותאמים להקשרים אנומליים ספציפיים, בעוד ששיטות קודמות מבוססות הנחיות משתמשות בתיאורים טקסטואליים קבועים חסרי עומק הקשרי ויחסים סמנטיים. כדי לחדד עוד יותר את מרחב התכונות, מנגנון יישור מונחה בולטות משייך באופן סלקטיבי את העוגנים הללו לראיות החזותיות הרלוונטיות ביותר. יישור ממוקד זה משפר את כוח ההבחנה של התכונות תוך שיפור הבהירות הסמנטית של תוצאות הזיהוי. חשוב מכך, השיטה המוצעת תומכת בפרשנות שקופה. ברגע שעוגן סמנטי מיושר עם ראיות חזותיות, המודל מייצר הסברים מובנים בשפה טבעית באמצעות תבניות מוגדרות מראש, המתייחסות במפורש הן לאופי והן להצדקה של האנומליה. חשוב לציין כי יישום שיטה זו מסתמך על תנאים מוקדמים ספציפיים, כולל שימוש בתכונות חזותיות I3D שחולצו מראש, גישה למאגר ידע חיצוני (ויקינתונים) ומקודד BLIP שהוכשר מראש. לכן המסגרת מועילה ביותר ביישומים שבהם קריטי לעבור מעבר לזיהוי בינארי פשוט כדי לסווג במקום זאת סוגי אנומליות ספציפיים ולספק הצדקות ניתנות לפירוש לתוצאות.
התרומות העיקריות הן כדלקמן. שיטת WS-VAD חדשה מפותחת על ידי שילוב של ידע חיצוני עם פרשנות מובנית לשיפור ההבנה הסמנטית ושקיפות ההחלטות. שיטת הנחיה מבוססת הטמעה סמנטית ומנגנון יישור מודע להקשר מוצגים כדי להתגבר על המגבלות של מודלים של MIL חזותיים בלבד. משולב מודול הסבר גנרטיבי, המשתמש בעוגנים סמנטיים כיחידות הניתנות לפירוש כדי לייצר רציונלים טקסטואליים קוהרנטיים. ניסויים נרחבים שנערכו על מערכי הנתונים של UCF-Crime ו-ShanghaiTech מדגימים את היעילות של השיטה המוצעת, השגת ציוני AUC חזקים (88.03% / 98.23%) וביצועי זיהוי עדינים מעולים, עם תפוקות ברורות וניתנות לפרשנות.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
מחקר זה משתמש רק במערכי נתונים זמינים לציבור (UCF-Crime13 ו-ShanghaiTech14). כל הסרטונים התקבלו מהמהדורות הרשמיות של מערכי הנתונים, אשר הופכים מידע המאפשר זיהוי אישי לאנונימי במידה שסופקו על ידי מתחזקי מערכי הנתונים. לא נערך איסוף נתונים נוסף או אינטראקציה אנושית על ידי המחברים; לכן, לא נדרש אישור IRB חדש. השימוש בנתונים תואם את הרישיונות ותנאי השימוש של מערכי הנתונים המתאימים.
הכנת נתונים וחילוץ תכונות
הכנת מערך נתונים: מערכי הנתונים UCF-Crime13 (1,610 רכבות / 290 סרטוני בדיקה) ו- ShanghaiTech14 (238 רכבות / 199 סרטוני בדיקה) אומצו תחת הפיצולים הסטנדרטיים שלהם. הסרטונים עובדו מראש באמצעות FFmpeg כדי להבטיח שחזור, קודדו מחדש ל-H.264, נדגמו מחדש ל-25 פריימים לשנייה ושונו לרזולוציה של 256 x 256 עם הפקודה: ffmpeg -i v.mp4 -vf "fps=25,scale=256:256" -c:v libx264 -crf 23 -preyfast pre/.
חילוץ תכונות: תכונות RGB חולצו על ידי עמוד שדרה I3D15 שהוכשר מראש על מערך הנתונים של Kinetics16. הסרטונים פוצלו לסרטונים לא חופפים של 16 פריימים; כל קליפ נחתך במרכז ל-224 x 224 פיקסלים. הפעלות השכבה הלפני אחרונה היו מאוגדות בממוצע כדי להשיג תכונת 1024-D לכל קליפ. ב-PyTorch, זה מתאים להעברת טנזורים של צורה [B, 3, T, H, W] דרך עמוד השדרה I3D והחלת adaptive_avg_pool3d ואחריו שיטוח. התכונות שחולצו נשמרו בקבצי .npy (אחד לכל סרטון) יחד עם חותמות זמן של קליפ לשחזור מדויק (seed = 123). עבור כל סרטון, features///
ארכיטקטורת מודל ומתודולוגיה
זיהוי בסיסי: היתוך הקשר זמני
בהינתן רצף סרטוני וידאו המיוצג על ידי מטריצת תכונות Z
RTx1024, מודול היתוך הקשר זמני (TCF) חישב לראשונה ייצוגי שאילתות, מפתחות וערכים באמצעות שלוש תחזיות ליניאריות שנלמדו:
Q = ZWQ, K = ZWK, V = ZWV (1)
כאשר WQ, WK, WV
RTx1024xd הם פרמטרים הניתנים לאימון (PyTorch: three nn. שכבות ליניאריות (1024, ד). הזיקה הבין-סגמנטית הייתה S =
, שולבה הטמעת יחסיות זמנית (TRE), כאשר כל אלמנט חושב כ- Rij = α exp (
) + β . הזיקה המודעת למיקום הייתה
= S + R. מפת הקשר גלובלית A = softmax(
) מצטברת V כדי להשיג תכונות שטח רחב G = AV. מאפיינים מקומיים L חושבו בקונבולוציה חד-ממדית לעומק (nn. Conv1d) בגודל גרעין 3 על Z. שער דינמי g = σ(MLP ([G;L])) ערבב את השניים: U = g
G + (1 - g)
L . לבסוף, נורמליזציה של שכבות ושכבה ליניארית שיורית יושמו כדי לייצר Y (Pytorch:LayerNorm+Linear+residual).
זיהוי בסיסי: מנבא זמני סיבתי
הפלט Y הועבר דרך שתי פיתולים חד-ממדיים סיבתיים עם GELU ונשירה (Pytorch:padding='סיבתי' או conv ממוסך) כדי לקבל לוגיטים אנומליים לכל קליפ. יישום הפונקציה הסיגמואידית הניב ערכי
הסתברות [0,1]T.
שיפור סמנטי: למידה מהירה עם ידע חיצוני
בניית עוגנים סמנטיים: עבור כל מחלקה אנומלית c, מושגי Kc נשאלו מוויקינתונים11, וקידוד כל ביטוי מושג קודד עם מקודדהטקסט 12של BLIP ל-e i
R768. עוגן המחלקה היה הממוצע המנורמל l 2 D c = נורמה (
Σiei) . כדי להפחית את הרעש, מושגים עם דמיון קוסינוסי לשם המחלקה מתחת ל-0.2 הושמטו, וציון ה-M העליון על ידי TF-IDF נשמר.
בצע הפרדה תלוית הקשר: משקלי חזית αt = softmax(rst) חושבו מציוני גלאי הבסיס st, ומשקלי רקע bt = softmax(r(1 - st)). התכונות המשוקללות הן ffg = Σtαzt ו- fbg = Σtbzt .
יישור תכונות חזותיות וסמנטיות
הגדר את מטרת היישור: במהלך שלב היישור, המטרה היא למזער את המרחק בין התכונה החזותית הקדמית לבין העוגן הסמנטי המתאים לה של הקטגוריה החריגה בתוך מרחב התכונה. צור אוסף של מדריכים סמנטיים,
הכוללים מדריכים סמנטיים בקטגוריה חריגה C ומדריך סמנטי רגיל סטנדרטי אחד. קבע את הסבירות, P(Dk|v), שתכונה חזותית, v, תואמת את המדריך הסמנטי k-th, Dk. חשב זאת באמצעות דמיון קוסינוס בקנה מידה של טמפרטורה ואחריו נורמליזציה של Softmax, כפי שמוצג ב-Eq. (2).
(2)
אנטרופיה צולבת צולבת צומצמה כדי לדחוף זוגות חיוביים יחד ושליליים זה מזה, עם הגדרת τs כפרמטר הניתן ללמידה ואתחול שלו ל-10. השג את היישור על ידי אופטימיזציה של הסבירות למתאם זוגות מדגם חיוביים תוך הפחתת הסבירות למתאם זוגות מדגם שלילי.
מודול פרשנות מבוסס תבנית
בהתבסס על למידה מהירה עם ייצוג תכונות משופר של ידע חיצוני (PLE), מסווג ליניארי מייצר לוגיטים לכל מחלקה, אשר לאחר מכן נורמלו להסתברויות מחלקה על ידי פונקציית softmax; סוג האנומליה החזוי נקבע כקטגוריה בעלת ההסתברות הגבוהה ביותר. בינתיים, חושב ציון אנומליה גלובלי מפלט הגלאי. כדי לקבוע את רמת החומרה, ניקוד זה הושווה לשלושה ערכי סף מוגדרים מראש הממוטבים באמצעות חיפוש רשת בערכת האימות.
ספי ברירת המחדל נקבעו ל-θגבוה = 0.8, θבינוני = 0.5ו-θ נמוך = 0.2. באופן ספציפי, אם הציון היה גדול מ-θגבוה, החומרה סומנה כגבוהה; אם הציון נופל בין θבינוני ל-θ גבוה, הוא סומן כבינוני; אם בין θנמוך ל-θ בינוני, הוא סומן כנמוך; אחרת, הוא סומן כאין.
במהלך שלב יצירת ההסבר, נבחרה תבנית המתאימה לסוג החזוי מספריית תבניות מוגדרת מראש, קובץ משלים 1. ספרייה זו מכילה גרסאות תבנית מרובות שעברו אימות צולב על ידי מספר ביאורים17 כדי לשפר את הגיוון של הטקסט שנוצר. אם הסוג החזוי קיים בספריית התבניות, נבחרה באופן אקראי תבנית מתאימה; אחרת, נעשה שימוש בתבנית ברירת מחדל עבור הסוג לא ידוע. לבסוף, נוצר טקסט הסבר מובנה על ידי שילוב הסוג החזוי, ציון האנומליה הגלובלי, תיאור החומרה והתבנית שנבחרה. המערכת מחזירה את סוג האנומליה החזוי, ציון האנומליה הגלובלי וטקסט ההסבר שנוצר כפלט הסופי. התוצאות מומחשות באיור 2.
כל פרמטרי הסף עברו אופטימיזציה באמצעות חיפוש רשת בערכת האימות, ואיכות ההסברים שנוצרו הוערכה באופן מקיף באמצעות הערכה אנושית ומדדים אוטומטיים. התוצאות מוצגות בטבלה 1.
הדרכה והערכה של מודלים
אימון: המודל אומן מקצה לקצה עם אדם (lr 1 x 10-4, דעיכת משקל 5 x 10-4), גודל אצווה 128, 50 עידנים, חישול קוסינוס עבור lr. זרעים אקראיים הוגדרו ל-123 עבור Python/Numpy/Pytorch והפעילו torch.backends.cudnn.deterministic=True. נקודות ביקורת נשמרו כל 5 תקופות במחסומים//epoch_XX.pt, והמודל הטוב ביותר נבחר על ידי אימות AUC. כל הניסויים נערכו במערכת עם NVIDIA GeForce RTX 4060 Ti (16GB) GPU המריץ את Windows 11, עם Python 3.8.20, PyTorch 1.8.0 ו-CUDA 11.1. זמן ההכשרה המשוער לתקופה היה 30 שניות עבור מערך הנתונים של ShanghaiTech ו-3.5 דקות עבור מערך הנתונים UCF-Crime.
אובדן: המטרה הכוללת היא L = L MIL+ λ • L align. ההיפרפרמטר λ נסחף על פני הקבוצה {0.01,0.1,0.5,1,5,10} בערכת האימות, ותוקן הערך הטוב ביותר תוקן לדיווח בדיקה. ראה איור 3 עבור צבירת MIL, ו-Eq.(3-4) להגדרות.
(3)
(4)
הערכה: AUC ברמת המסגרת חושב בהתאם לפרוטוקול הסטנדרטי ששימש עבודות קודמות של WS-VAD 2,5. עבור זיהוי סוג עדין ב-UCF-Crime, דווחו mAP ב-IoU 0.1-0.5 ו-AVG mAP, כפי שסוכם בטבלה 2; AUCs לכל מחלקה מוצגים באיור 4 והתוצאות הכוללות בטבלה 3 ובטבלה 4; הטמעת יכולת הפרדה ודינמיקה של ציון אנומליה מופיעות באיור 4, איור 5 ואיור 6.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
כדי לאמת עוד יותר את התועלת של עוגנים סמנטיים, נערך ניסוי נוסף להשוואת תבניות הנחיה שונות (ראה טבלה 1). הגרסה שהשתמשה באבות טיפוס סמנטיים מוגברים של ויקינתונים לא רק השיגה ערכי AUC גבוהים יותר, אלא גם הובילה לשיפורים בציון BLEU-4 של 16.6 ו-14.8 עבור ההסברים שנוצרו. ממצאים אלה מצביעים על קשר חזק בין העושר הסמנטי של ההנחיות לבין איכות הפרשנויות הטקסטואליות, ומאשרים שתהליך יצירת ההסברים חורג ממילוי תבניות נוקשה על ידי מינוף מבנה סמנטי מועשר.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
הפרוטוקול המוצג כאן מציג התקדמות משמעותית בזיהוי אנומליה בווידאו בפיקוח חלש על ידי שינוי הפרדיגמה מסיווג בינארי פשוט לניתוח מבוסס סמנטית וניתן לפרשנות. חשיבותה של שיטה זו טמונה ביכולתה לא רק לזהות אם התרחשה אנומליה אלא גם באיזה סוג של אנומליה מדובר ומדוע המודל הגיע למסקנה זו, תוך התייחסות למגבלה מרכזית במערכות WS-VAD קיימות 9,29.
בחירות ורציונל עיצובי
השיטה ...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
למחברים אין ניגודי אינטרסים.
אנו אסירי תודה על התמיכה הכספית הניתנת על ידי Aerospace Hongka Intelligent Technology (Beijing) Co., LTD.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| <דגם p>BLIP | סיילספורס ריסרץ' | ViT-B/16 | משמש כמקודד טקסט ליצירת עוגנים סמנטיים. |
| GPU | NVIDIA | RTX 4060Ti | משמש לאימון המודל |
| מודל I3D | גוגל דיפמיינד | הכשרה מוקדמת על קינטיקה | משמש כעמוד השדרה להפקת פיצ'רים בווידאו. |
| נאמפי | צוות הפיתוח של NumPy | 1.21.2 | משמש לטיפול ועיבוד מערכי נתונים נומריים, כמו תכונות הווידאו, לפני שהם מוזנים למודל הלמידה העמוקה. |
| פייטורץ' | מחקר בינה מלאכותית של פייסבוק | 1.8.0 | משמש להגדרת ארכיטקטורת המודל, ליישום פונקציות אובדן מותאמות אישית, ולהפעלת ההפצה האחורית לאופטימיזציה. |
| פיתון | קרן התוכנה של פייתון | 3.8.20 | משמש לכתיבת כל הסקריפטים לעיבוד נתונים, יישום מודלים, הדרכה והערכה |
| מערך הנתונים של ShanghaiTech | אוניברסיטת שנגחאי-טק | משמש להכשרה והערכה ב-13 סצנות קמפוס שונות. | |
| UCF-מערך נתונים לפשע | אוניברסיטת מרכז פלורידה | משמש לאימון והערכה של 13 קטגוריות אנומליה. | |
| ויקידאטה | קרן ויקימדיה | משמש כגרף ידע חיצוני לבניית פרומפטים. |
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה