Research Article

מקודד-מפענח-מקודד כפול עם הדרכה יריבה לזיהוי תאונות דרכים ללא פיקוח בסרטוני מעקב

DOI:

10.3791/68731

September 5th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עבודה זו מציעה מודל מקודד-מפענח-מקודד כפול (EDE) לזיהוי אוטומטי של תאונות דרכים. באמצעות שיטת אימון דו-שלבית, הוא לומד דפוסי נהיגה רגילים ומזהה חריגות באמצעות עימות גנרטיבי. המודל מזהה ביעילות תאונות בצילומים מהעולם האמיתי ומציע תובנות לגבי התנהגויות הנהגים על ידי לכידת סטיות עדינות.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כדי לשפר את הבטיחות בדרכים ולשפר את תגובת החירום, יש לזהות אירועי תנועה בצילומי מעקב בעולם האמיתי במהירות האפשרית. מערכות קיימות תלויות במידה רבה בניטור ידני, שגוזל זמן ונוטה לטעויות. זיהוי תאונות אוטומטי נותר מאתגר בשל חוסר האיזון המעמדי המשמעותי: מצבי נהיגה רגילים מיוצגים יתר על המידה, בעוד שתאונות הן נדירות ומגוונות. במקרים כאלה, מערכות ראייה ממוחשבות מסורתיות לרוב אינן יכולות להבדיל באופן אמין בין אירועים רגילים לחריגים. מחקר זה מטפל בבעיה על ידי פיתוח ארכיטקטורת למידה עמוקה המבוססת על מסגרת מקודד-מפענח-מקודד כפול (EDE). המודל משתמש בשני צינורות מקודד-מפענח משותפים כדי למפות את התפלגויות התמונה להתפלגויות סמויות שצוינו בשני הכיוונים. מסגרת זו מאפשרת למערכת למדל דפוסי התנהגות נפוצים בתנועה ולהיות רגישה יותר לשינויים שעשויים להצביע על אירועים מסוכנים או חריגים. טכניקת אימון דו-שלבית מוצעת כדי לשפר עוד יותר את זיהוי החריגות. בשלב הראשון, המודל לומד לשחזר תמונות של נהיגה רגילה, תוך שימוש באובדן שחזור כדי לאפיין התנהגות נורמלית. בשלב השני, מוצג מנגנון יריב גנרטיבי: וקטורים סמויים משוחזרים מ-EDE אחד מועברים לשני, ויוצרים תמונות סינתטיות ומרחבים סמויים. תהליך זה מגביר את ההבדלים בין תפוקות אמיתיות וסינתטיות, מה שהופך את המערכת למגיבה יותר לסימנים עדינים של חריגות פוטנציאליות. ארכיטקטורת ה-EDE הכפולה ומתודולוגיית האימון היריבה מייצגות התקדמות משמעותית לעומת השיטות הנוכחיות על ידי מידול התנהגות נורמלית ופתולוגית כאחד. תוצאות ניסיוניות על מערכי נתונים של מעקב תנועה בעולם האמיתי מראות כי השיטה המוצעת משפרת משמעותית את זיהוי התאונות והתנהגויות נהיגה לא בטוחות, הן מבחינת דיוק והן מבחינת חוסן.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

על פי ארגון הבריאות העולמי (2023), פציעות בדרכים הן סיבת המוות המובילה בקרב ילדים וצעירים בגילאי 5-29 שנים, עם כ-1.3 מיליון הרוגים מדווחים ברחבי העולם מדי שנה. נתון מדאיג זה מדגיש את הצורך הדחוף במערכות אוטומטיות המסוגלות לנטראת התנועה בכבישים, לזהות חריגות בזמן אמת ולהפחית עיכובים בתגובת חירום. השילוב של בינה מלאכותית (AI) והאינטרנט של הדברים (IoT) בתשתיות עיר חכמה איפשר פיתוח של מערכות תחבורה חכמות. בעוד שרשתות טלוויזיה במעגל סגור (CCTV)2,3 מספקות מעקב רציף אחר תנועה עירונית, ניטור ידני אינו מעשי ונוטה לטעויות. לכן, פתרונות אוטומטיים ניתנים להרחבה לזיהוי אירועי תנועה הם חיוניים.

שיטות ראייה ממוחשבת מסורתיות לניתוח תנועה - כגון זיהוי רכב, מעקב וסיווג התנהגות - משתמשות לעתים קרובות ברשתות עצביות קונבולוציוניות (CNNs) שהוכשרו באמצעות למידה מפוקחת 4,5. מערכות אלו דורשות מערכי נתונים נרחבים ומבוארים ולעתים קרובות אינן מצליחות להכליל על פני התרחישים הנדירים והמגוונים המאפיינים תאונות בעולם האמיתי. כתוצאה מכך, חוקרים פנו לגישות זיהוי אנומליות לא מפוקחות, שאינן תלויות בנתוני אנומליה מסומנים. בין אלה, מקודדים אוטומטיים (AEs) ורשתות יריבות גנרטיביות (GANs) הראו הבטחה במידול דפוסים נורמליים וזיהוי סטיות 6,7,8.

עם זאת, AEs סטנדרטיים נוטים לשחזר כניסות בצורה נאמנה מדי - גם כאשר כניסות אלה חריגות - מה שמוביל לשיעורי שלילי כוזב גבוהים 9,10. מקודדים אוטומטיים וריאציונליים (VAEs)11 ומודלים מבוססי GAN כגון f-AnoGAN12, GANomaly13 ו-OCGAN14 מטפלים בחלק מהבעיות הללו על ידי שילוב מודלים של מרחב סמוי ולמידה יריבה. עם זאת, מודלים אלה מסתמכים לעתים קרובות על מיפויים חד-כיווניים מתמונה למרחב סמוי15, מה שמגביל את יכולתם לזהות חוסר עקביות עדין או מורכב בחריגות תעבורה בעולם האמיתי.

מערכות מפוקחות, כמו אלה שפותחו עבור AI City Challenge על ידי ByteDance16, WHU17 ו-USF18 משיגות דיוק גבוה באמצעות מעקב מרחבי-זמני19ועיצובים ממוקדי אובייקטים. עם זאת, הם דורשים נתוני תאונות מתויגים וצינורות מעקב מורכבים, מה שמפחית את המדרגיות והישימות בזמן אמת.

מודלסוגפיצ'רים עיקרייםמגבלותביצועים (מתואר)
גנומליללא השגחהמקודד-מפענח-מקודד; אימון יריבנוטה לשחזר אפילו קלטים חריגים טוב מדי, מה שמוביל לשליליות כוזבותטוב בסך הכל, עם דיוק גבוה וזיכרון מאוזן
אוקגןללא השגחהGAN מחלקה אחת עם שטח סמוי מוגבלמתקשה לזהות אנומליות עדינות או מורכבותמעט טוב יותר מ-GANomaly, עם איזון משופר בין מדדים
פ-אנוגןללא השגחהזיהוי חריגות מהיר באמצעות רשתות GAN והתאמת תכונותיכולת מוגבלת ללכוד אנומליות מורכבות במרחב סמויביצועים בינוניים (לא סופקו ציונים ספציפיים)
בייטדאנסתחת פיקוחמעקב מרחבי-זמני עם לוקליזציה של אנומליה ברמת האובייקטדורש נתוני אימון מסומנים; מדרגיות מוגבלת בהגדרות בעולם האמיתידיוק ודיוק גבוהים מאוד; רגישות מעט נמוכה יותר
באדותחת פיקוחמשתמש במידול רקע ומעקב אחר כלי רכבפחות יעיל בסצנות מגוונות; מפספס אנומליות עדינותדיוק מוצק; איזון טוב אך נמוך יותר משיטות מובילות
WHUתחת פיקוחמעקב אחר מסלול דו-מודאליהכללה לקויה וזיכרון אנומליה נמוךביצועים חלשים באופן כללי, במיוחד בזיהוי חריגות
USFתחת פיקוחמשלב מידול רקע עם ניתוח דמיון מבניגרוע בזיהוי חריגות במדויקדיוק ורגישות נמוכים מאוד
מוצע (Dual-EDE)ללא השגחהמקודד-מפענח-מקודד כפול; מיפוי סמוי דו-כיווני עם אובדן יריב וניגודיותעומס חישובי גבוה; מוגבל לכניסת RGBביצועים מצוינים; דיוק מעולה, זיכרון גבוה ואיזון חזק בין מדדים

טבלה 1: סיכום העבודה הקשורה בזיהוי אנומליות תנועה מבוססות וידאו.

טבלה 1 מנוגדת לשיטות זיהוי אנומליות חיוניות המשמשות במעקב אחר תנועה, ומדגישה את הארכיטקטורות, היתרונות, החסרונות והביצועים שלהן. מודלים קונבנציונליים מבוססי GAN כמו GANomaly ו-OCGAN יכולים לבצע זיהוי יעיל ללא פיקוח אך נאבקים בחריגות עדינות. שיטות מפוקחות, למרות שהן מדויקות ביותר, תלויות במידה רבה בנתונים מסומנים ובמעקב מתוחכם. מודל ה-Dual-EDE המוצע משלב קידוד מרחב סמוי דו-כיווני עם אימון יריב וניגודיות, ומאפשר לו לזהות חריגות תנועה נדירות ועדינות ללא נתונים מסומנים, ומציע מדרגיות וחוסן.

פער מחקרי והשערה
למרות שמודלים לא מפוקחים מפחיתים את הצורך בחריגות מסומנות, הם עדיין מתקשים לזהות במדויק אירועי תנועה נדירים, עדינים ובעלי השפעה רבה. השיטות הנוכחיות מוגבלות על ידי אסימטריה אדריכלית וחוסר היכולת לנצל באופן מלא את חוסר העקביות במרחב הסמוי. רבים גם לא מצליחים להבחין היטב בין התנהגות נורמלית מורכבת לבין אנומליות אמיתיות בסביבות תנועה דינמיות מאוד.

אנו משערים כי ארכיטקטורת מקודד-מפענח-מקודד כפול (EDE) המאומנת אך ורק על נתוני תנועה רגילים, בשילוב עם אסטרטגיית אימון דו-שלבית, יכולה לעלות על מודלים חדישים בזיהוי חריגות תנועה מגוונות ועדינות. על ידי אכיפת עקביות סמויה דו-כיוונית ושילוב שחזור יריב, המערכת הופכת רגישה יותר לסטיות זעירות מההתנהגות הצפויה - כגון בלימה פתאומית, סטייה לא יציבה או התנגשויות - ללא צורך בנתוני תאונות מוערים.

שיטה מוצעת
אנו מציעים מסגרת חדשה לזיהוי אנומליות ללא פיקוח הבנויה על ארכיטקטורת EDE כפולה. בניגוד למודלים מסורתיים המשתמשים בצינור קידוד-פענוח יחיד, המערכת שלנו משתמשת בשני מסלולי EDE המבצעים מיפוי דו-כיווני בין תמונות וייצוגים סמויים. עיצוב זה מאפשר למודל ללמוד תכונות עשירות של דינמיקת תנועה רגילה ולהגביר פערים כאשר מתרחשות חריגות. תהליך ההכשרה מורכב משני שלבים:

שלב ראשון משתמש באובדן שחזור כדי למדל התנהגות נורמלית, בדומה לאימון מקודד אוטומטי סטנדרטי.

שלב שני מציג מנגנון יריב גנרטיבי, שבו וקטורים סמויים מ-EDE אחד מועברים לשני כדי ליצור נתונים סינתטיים, מה שמאלץ את המערכת למקסם את ההבחנות בין ייצוגים אמיתיים ומזויפים הן בתחום התמונה והן בתחום הסמוי.

תרומות עיקריות
אנו מציגים ארכיטקטורת EDE כפולה הלוכדת חוסר עקביות סמוי באמצעות מיפוי דו-כיווני לזיהוי אנומליה משופר. אנו מפתחים הליך אימון דו-שלבי המשלב שחזור מקודד אוטומטי עם למידה יריבה כדי לשפר את הרגישות לסטיות עדינות. אנו מדגימים, באמצעות ניסויים במערך הנתונים של AI City Challenge (מסלול 4), כי המודל עולה על מספר קווי בסיס מפוקחים ובלתי מפוקחים מתקדמים, ומשיג זיהוי תאונות חזק וניתן להרחבה בסביבות עירוניות בעולם האמיתי. לסיכום, עבודה זו מציעה גישה ניתנת להרחבה, מדויקת ונטולת תוויות לזיהוי חריגות תנועה, ותורמת למערכות תחבורה חכמות בטוחות ומגיבות יותר.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מערכת

ההתקנה
פרסנו את מערכת זיהוי חריגות התעבורה המוצעת במסגרת מחשוב היררכית ומבוזרת, תוך מינוף סביבת Intel Tiber Cloud. ארכיטקטורה זו מורכבת משלוש שכבות - קצה, ערפל וענן - כדי להבטיח הסקת מסקנות בהשהיה נמוכה, הדרכה ניתנת להרחבה והקצאת משאבים יעילה על פני צמתי מחשוב.

שכבת קצה: זיהוי חריגות בזמן אמת מתבצע בקצה באמצעות התקנים משובצים קלים התומכים ב-GPU (לדוגמה, NVIDIA Jetson Nano או פלטפורמות מקבילות מבוססות Intel עם GPUs משולבים). יחידות אלה מוקמו יחד עם מצלמות מעקב וביצעו הסקה פריים אחר פריים עם חביון מינימלי, מה שמאפשר ניטור תנועה מבוזר ומגיב.

שכבת ערפל: משימות עתירות מחשוב יותר, כולל הסקת אצווה ושכלול מודל בזמן אמת, טופלו על ידי צמתי ערפל שהוקצו כמכונות וירטואליות ייעודיות או מופעי מתכת חשופים בתוך Intel Tiber Cloud. כל צומת ערפל הוגדר עם מעבד Intel Xeon עם לפחות 16 GB של זיכרון RAM והייתה לו גישה להאצת GPU משולבת או נפרדת של אינטל. שכבת ביניים זו אפשרה פעולות בתפוקה גבוהה ליד מקור הנתונים תוך שמירה על אוטונומיה מהשרתים המרכזיים.

שכבת ענן: עבור הדרכה וארכיון בקנה מידה גדול, שכבת הענן משתמשת באשכולות מחשוב ניתנים להרחבה המוצעים באמצעות השירותים המותאמים לבינה מלאכותית של אינטל טיבר. מופעים המצוידים במאיצי Intel Habana Gaudi או מעבדי Intel Xeon Scalable משמשים לאימון רשתות עצביות עמוקות על מערכי נתונים נרחבים של וידאו, תמיכה בגרסאות מודלים, אחסון לטווח ארוך ותיאום כלל מערכתי.

חבילת התוכנה המלאה פעלה בסביבת Python 3.8+ תוך שימוש בספריות מותאמות לאינטל לחישוב מואץ. המסגרות העיקריות כוללות את PyTorch (עם הרחבת אינטל ל-PyTorch), OpenCV לעיבוד מקדים של תמונות ווידאו, ו-Scikit-learn להערכה. האצת GPU מופעלת באמצעות ערכות הכלים המתאימות של oneAPI ואופטימיזציות DAAL.

עם הפריסה, שיבטנו את המאגר המכיל את ארכיטקטורת ה-EDE הכפולה ואתחלנו את רכיבי המודל - שני מקודדים (E1, E2) ושני מפענחים (D1, D2). השתמש בשיטת .to(device) כדי להעביר את הרכיבים באופן דינמי ליחידת העיבוד האופטימלית (CPU, GPU או מאיץ גאודי) בהתאם לזמינות המשאבים המקומיים.

הכרזנו על פרמטרי ההדרכה וההערכה, כולל מספר התקופות, קצב הלמידה, מקדמי איזון הפסדים (γ, δ) וספי רגישות לאנומליה (ω1, ω2), בתסריט תצורה. לצורך האימון, עקבנו אחר פרוטוקול דו-שלבי: (1) שחזור מקודד אוטומטי סטנדרטי ללימוד התנהגות תנועה רגילה ו-(2) שחזור סמוי יריב להגברת אנומליות באמצעות אינטראקציות חוצות EDE.

ארכיטקטורת מערכת מודולרית ומקורית בענן זו אפשרה זיהוי אנומליה חזק בזמן אמת, מדרגיות מודל ופריסה אמינה בסביבות תחבורה חכמות בעולם האמיתי באמצעות ענן Intel Tiber.

מערך נתונים
לצורך הדרכה והערכה של מערכת זיהוי החריגות המוצעת, השתמשנו במערך הנתונים שסופק על ידי NVIDIA AI City Challenge 2021, מסלול 4 (חריגת תנועה). מערך הנתונים כולל 100 סרטוני הדרכה ו-150 סרטוני בדיקה, כל אחד באורך ממוצע של 15 דקות, שהוקלט ברזולוציה של 30 פריימים לשנייה ו-410 p. כל סרטון מציג רמת קושי מובהקת עקב שינויים בסוגי הכבישים, זוויות המצלמה, התאורה ותנאי מזג האוויר. מערך הנתונים לוכד מגוון רחב של תשתיות כבישים (למשל, כבישים מהירים מרובי נתיבים, צמתים), צפיפות תנועה ותנאי מזג אוויר (למשל, בהיר, גשום, בין ערביים), מזוויות מצלמה מרובות. תכונות אלו הופכות אותו לאמת מידה אידיאלית להערכת יכולת ההכללה של מודלים לזיהוי חריגות.

עיבוד מקדים
כדי לאמן את המודל בתנאים לא מפוקחים, השתמש רק בסצנות תנועה רגילות (ללא תאונה), והימנע מכל חשיפה לאירועים חריגים במהלך האימון. בצע עיבוד מקדים של וידאו באמצעות OpenCV. מסגרות לדוגמה באופן אחיד ב-5 פריימים לשנייה כדי להבטיח כיסוי זמני מספיק תוך הפחתת יתירות. שנה את גודל הפריימים ל-128 x 128 פיקסלים, תוך התאמה לדרישות הקלט של רשת ה-EDE הכפולה ואיזון בין פרטים חזותיים ליעילות חישובית. נרמל את ערכי הפיקסלים לטווח [-1, 1] כדי לשפר את יציבות האימון.

כדי לשפר את ההכללה ולדמות שונות בעולם האמיתי, החל את טכניקות ההגדלה הבאות על כל מסגרת אימון בהסתברות אקראית:

חיתוך ושינוי קנה מידה אקראיים: חתוך תת-אזורים אקראיים ושנה את קנה המידה שלהם בחזרה לרזולוציה המקורית, תוך עידוד השתנות לגודל האובייקט, נראות חלקית ושינויי מיקום מרחביים, תוך חיקוי אפקטי זום ונושאים לא מרכזיים בסרטון מעקב.

אפנון בהירות וניגודיות: החל טרנספורמציות ליניאריות או מבוססות גמא כדי לחקות וריאציות תאורה כגון צללים, בוהק, וריאציות זריחה/שקיעה ותאורה מלאכותית. זה משפר את עמידות הדגם לתנודות תאורה יומיות ועונתיות.

הזרקת רעש גאוס וטשטוש תנועה: הוסף רעש גאוס עם סטיות תקן משתנות כדי לדמות רעשי חיישן וחפצי דחיסה. הדמיה של טשטוש תנועה באמצעות גרעינים קונבולוציוניים המכוונים לכיוונים וגדלים שונים כדי לחקות את האפקט של עצמים נעים או רעידות מצלמה, מה שרלוונטי במיוחד בסצנות תנועה בקצב מהיר.

מיסוך חסימה אקראית: החל חסימות סינתטיות על ידי הצבת טלאים מלבניים שחורים או אפורים בגדלים ובמיקומים אקראיים מעל המסגרת. הגדלה זו מדמה מכשולים בעולם האמיתי כגון הולכי רגל, אלמנטים תשתיתיים או כלי רכב חולפים החוסמים את שדה הראייה. זה מעודד את המודל ללמוד מההקשר ולהישאר חזק לאזורים חסרים או מעוותים.

החל את התוספות הללו באופן דינמי במהלך האימון באמצעות צינורות טרנספורמציה של PyTorch, תוך הבטחה שכל אצווה מכילה תערובת מגוונת של מסגרות מוגברות, מקדמת חשיפה לדפוסים מגוונים ומפחתת התאמת יתר.

טען מסגרות מעובדות עם DataLoader של PyTorch כדי לנהל אצווה, ערבוב וטעינה מקבילה. התאמן עם גדלי אצווה בין 32 ל-64, בהתאם לקיבולת ה-GPU. להסקה וניקוד חריגות, עבד מסגרות בנפרד (גודל אצווה = 1) כדי לאפשר זיהוי מדויק ברמת המסגרת.

צינור עיבוד מקדים והגדלה זה משפר את החוסן וההכללה, ומאפשר למודל לזהות התנהגות חריגה ביעילות בסביבות ניטור תנועה מגוונות ורועשות בעולם האמיתי.

השיטה המוצעת:
מערכת ה-EDE המוצעת לומדת מיפויים דו-כיווניים בין התפלגות תמונה למרחבים סמויים. שני מקודדים ושני מפענחים מאפשרים חילוץ תכונות חזק ובידול חריגות. הרשתות מאומנות הן בשלבי שחזור והן בשלבי יריבות. למידה ניגודית, רגולציה ועונש שיפוע משמשים למניעת קריסת מצב ושיפור חוסן אימון GAN.

מסגרת EDE פועלת באופן הבא: מקודד 1 (E1) מקודד תכונות תמונה לתוך המרחב הסמוי. המפענח הראשון (D1) משחזר תמונות מווקטורים סמויים כדי למזער את אובדן השחזור. התמונות המשוחזרות ממופות בחזרה לחלל הסמוי כדי ללכוד חוסר עקביות. המפענח השני (D2) מייצר תמונות סינתטיות מהמרחב הסמוי השני כדי לעזור למודל להבחין בין נתונים אמיתיים לנתונים סינתטיים. מיפוי דו-כיווני זה מזהה חריגות על סמך פערי מרחב סמויים ולא הבדלים ברמת הפיקסלים.

שלב 1: הכשרה לשיקום: המקודד האוטומטי מאומן לשחזר תמונות תנועה רגילות, כך שכניסות חריגות מייצרות שגיאות שחזור משמעותיות. פונקציית ההפסד לוקחת בחשבון את תמונת הקלט, הקידוד הסמוי שלה והתמונה המשוחזרת.

הכשרה יריבה: לאחר אימון שחזור, מיושמת למידה יריבה. וקטורים סמויים משוחזרים מועברים דרך מבנה EDE חלופי כדי לייצר תמונות סינתטיות ווקטורים סמויים. המטרות הן למקסם את ההבדלים בין תמונות אמיתיות לסינתטיות; לשנות ולשחזר וקטורים סמויים כדי לשפר את זיהוי האנומליות על ידי מקודד 2 (E2); ולמנוע קריסת מקודד.

האימון נועד למנוע התכנסות של E1 ו-E2 למיפויים זהים, מה שיפחית את יכולת ההבחנה.

למידה ניגודית: פונקציית הפסד מבדילה בין ייצוגים אמיתיים ומשוחזרים, עם היפרפרמטר שוליים השולט בהפרדת התכונות.
טכניקות הרגולציה כוללות:

נשירה: השבתה אקראית של נוירונים למניעת התאמת יתר.
ירידה במשקל: מעניש משקלים גדולים כדי לייצב את למידת התכונות.

שיטות יציבות אימון יריבות20 ומניעת קריסת מצב כוללות:
עונש שיפוע: מווסת את התנהגות המפלה.
הגדלת נתונים: חיתוך אקראי, קנה מידה ותאורה מתכווננת כדי לדמות תנאים מגוונים.
הזרקת רעש: הוספת רעש מציאותי, טשטוש תנועה וחסימות כדי לשפר את ההכללה.
עצירה מוקדמת: הפסקת אימון אם אובדן התיקוף משתנה באופן משמעותי כדי למנוע התאמת יתר.

שיפורים ארכיטקטוניים, שיטות הדרכה ואמצעי חוסן אלה מבטיחים זיהוי אמין של חריגות תעבורה.

רשת זיהוי התאונות הבלתי מפוקחת מאומנת אך ורק על דגימות רגילות ונבדקת על דגימות רגילות ותאונות. רשמית:

מתוך הסט של כל סרטוני האימון הרגילים והתאונות, שקול מערך נתוני אימון גדול E עם מסגרות רגילות F בלבד (E = {x1, x2}). .., xM } ומערך נתוני בדיקה קטן יותר Ê המכיל צילומי תאונה רגילים ותצלומי תאונה (Ê=[( x̂1,y1), (x̂2,y2), (x̂F*,yF*)]),מסגרות, כאשר yi figure-protocol-1[0, 1] היא תמונת תווית המסגרת. עבור אימון F figure-protocol-2F*, מערך נתוני האימון חייב להיות גדול משמעותית ממערך הנתונים של הבדיקה. לאחר למידת סעפת מערך הנתונים (E), זהה מסגרות תאונה ב-Ê כחריגות במהלך ההסקה. המודל f מחשב ציון תאונה Acc(x) על סמך התפלגות הנתונים הנורמלית שנלמדה. תמונת מבחן x עם ציון תאונה גבוה עשויה להיות תאונה. קריטריוני השיפוט מבוססים על סף ניקוד התאונה (φ) אם Acc(x) > φ.

ארכיטקטורת רשת:
כפי שמוצג באיור 1, מודל GANomaly21 מכיל שני מקודדים, מפענח אחד ומפלה אחד. חוקרים רבים אימצו שיטה זו כדי להבחין בין וקטורים סמויים ולזהות חריגות חזותיות12,22. שני המקודדים והמפענח היחיד משנים באופן הדדי את התמונה ואת הווקטור הסמוי במודל. עובדות חריגות אלה מצוינות במהלך הטרנספורמציה. המפלה מפריד בין התמונות שנוצרו לבין המקור. GANomaly מסתמך על קידוד, פענוח וקידוד מחדש.

figure-protocol-3
איור 1: ארכיטקטורת GANomaly המדגימה את זרימת המידע. הארכיטקטורה מורכבת ממסגרת מקודד-מפענח-מקודד המשולבת ברשת יריבה גנרטיבית. המקודד הראשון דוחס את מסגרת הווידאו הקלט לייצוג חלל סמוי, אשר משוחזר לאחר מכן על ידי המפענח. מקודד שני ממפה את המסגרת המשוחזרת בחזרה לחלל הסמוי. המפלה מעריך את ההבדל בין הקלט לתכונות המשוחזרות כדי לחשב את ציון האנומליה. החצים מציינים את כיווני הזרימה של הנתונים דרך הרשת. קיצור: GAN = רשת יריבה גנרטיבית. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

איור 2 ממחיש את ארכיטקטורת EDE עם שני מקודדים ומפענח אחד. מבנה ה-EDE חייב לשנות כל הזמן פרמטרים כדי לזהות תקלות בווידאו. הוספנו מפענח שני למבנה EDE ואפשרנו להם לשתף את המקודדים כדי ליצור את המודל באיור 2 עם שתי תצורות רשת. לשני מקודדים יש ארבע שכבות קונבולוציוניות. השתמשנו בפונקציות הפעלה של LeakyReLU עבור כל השכבות למעט שכבת הפלט, שהשתמשה בהפעלת tanh כדי לקשור את היציאות בין -1 ל-1. נורמליזציה של אצווה יושמה לאחר מספר שכבות קונבולוציוניות. המפענחים (איור 3 ואיור 4) דומים למקודדים אך משתמשים ב-ConvTranspose ובנורמליזציה נוספת של אצווה במקום כל שכבה.

figure-protocol-4
איור 2: ארכיטקטורה מוצעת מבוססת-EDE עם זרימת מידע. ארכיטקטורת EDE מודגמת, המציגה את זרימת מסגרות הווידאו דרך שני מקודדים ומפענח. המקודד הראשון (E1) דוחס את מסגרת הקלט לייצוג סמוי, אשר משוחזר לאחר מכן על ידי המפענח (D1). הפלט המשוחזר מועבר דרך המקודד השני (E2) כדי לקבל וקטור סמוי שני. פערים בין וקטורים סמויים לאיכות השחזור משמשים לזיהוי חריגות, הנתמכים על ידי רכיבי אובדן יריבים וניגודיים. קיצור: EDE = מקודד-מפענח-מקודד. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

פרטי ארכיטקטורת רשת:
מודל ה-EDE הכפול מורכב משני צינורות מקודד-מפענח-מקודד, כל אחד עם אותו מבנה ומותאם במשותף במהלך האימון.

ארכיטקטורת מקודד (E1, E2)

קלט: מסגרת RGB 128×128×3

שכבה 1: Conv2D (64 מסננים, 4×4 ליבה, צעד 2, ריפוד 1) → LeakyReLU (α = 0.2)

שכבה 2: Conv2D (128 מסננים, 4×4, צעד 2, ריפוד 1) → BatchNorm → LeakyReLU

שכבה 3: Conv2D (256 מסננים, 4×4, צעד 2, ריפוד 1) →-BatchNorm →-LeakyReLU

שכבה 4: Conv2D (512 מסננים, 4×4, צעד 2, ריפוד 1) → BatchNorm → LeakyReLU

שכבה 5: שיטוח → וקטור צפוף עד סמוי (z figure-protocol-5^100)

ארכיטקטורת מפענח (D1, D2)

קלט: z figure-protocol-6^100 → צפוף → שינוי צורה ל-8×8×512

שכבה 1: TransposedConv2D (256 מסננים, 4×4, צעד 2, ריפוד 1) →-BatchNorm →-ReLU

שכבה 2: TransposedConv2D (128 מסננים, 4×4, צעד 2, ריפוד 1) → BatchNorm → ReLU

שכבה 3: TransposedConv2D (64 מסננים, 4×4, צעד 2, ריפוד 1) → BatchNorm → ReLU

שכבה 4: TransposedConv2D (3 מסננים, 4×4, צעד 2, ריפוד 1) → Tanh

התמונה המשוחזרת מקודדת מחדש באמצעות המקודד השני כדי לקבל ייצוג סמוי, ואי התאמות בין הווקטורים הסמויים המקוריים והמשוחזרים משמשים לניקוד אנומליה.

הפעלה ונורמליזציה
מקודדים משתמשים בהפעלת LeakyReLU ובנורמליזציה של אצווה. מפענחים משתמשים בהפעלת ReLU, למעט השכבה הסופית, המחילה את Tanh כדי לנרמל יציאות לטווח [-1, 1].

אובדן פונקציות
אובדן שחזור תמונה: ǀǀ x −ǀǀ2
אובדן עקביות סמוי: ǀǀ z −ǀǀ2

אובדן יריב: הוצג בשלב II כדי למקסם את הסטייה בין שחזורים אמיתיים וסינתטיים על ידי אילוץ הרשת להבחין בין קודים סמויים אמיתיים לאלה שנוצרו במהלך השחזור.

ארכיטקטורה זו לוכדת הן אי סדרים במרחב הפיקסלים והן במרחב הסמוי, ומאפשרת זיהוי סטיות עדינות המעידות על התנהגות נהיגה חריגה.

הכשרה בשני שלבים
נעשה שימוש בשיטת אימון רשת דו-שלבית. הן לשחזור וקטור תמונה והן לשחזור וקטור סמוי, מאומנים שני מבני EDE. בשלב השני, מקודד 2 מנסה להונות את מקודד 1 לסווג נתונים באופן שגוי כאמיתיים או משוחזרים.

הכשרה ראשונית לשחזור
מבנה ה-EDE מאומן לשכפל את תמונת הקלט ואת הווקטור הסמוי. קלט x מקודד לווקטור סמוי z על ידי מקודד E1. גם D1 וגם D2 מפענחים את z כדי לייצר תמונות, x1 ו-x2. השגנו שני וקטורים סמויים (z1 ו-z2) מהמקודד E2 לאחר שעברנו שתי תמונות משוחזרות (x1 ו-x2). שלב זה מכיל את מטרות ההדרכה הבאות:

LEDE1 = γ ǀǀ x −x1ǀǀ2+δ ǀǀ z−z 1ǀǀ2 (1)
LEDE2 = γ ǀǀ x−x2ǀǀ2+δ ǀǀ z−z 2ǀǀ2 (2)

תמונות משוחזרות אלה מועברות דרך מקודד E2 כדי לקבל וקטורים סמויים z1 ו-z2. מטרות ההכשרה:
גורמי שקלול (γ, δ) משפיעים באופן מכריע על ההשפעה של רכיבי אובדן על הפונקציה האובייקטיבית.

שנית, אימנו שני מבנים של מקודד-מפענח-מקודד בשיטות יריבות.
כאן, γ ו-δ הם הפרמטרים המשקללים את התרומות של שחזור ואובדן עקביות סמוי.

אימון יריב
שני מבני EDE מאומנים באופן יריב. לומד לזהות את מקודד 2 מנתונים. EDE2 חייב לרמות את EDE1 כי זה ההפך. D1 מפענח את z2 מהשלב הראשון ומשחזר את x1'. חזרה על x1' למקודד E2 מניבה z1'. מטרות ההכשרה הבימתיות הן כדלקמן:

מינימום מקסימום γ ǀǀ x−x 1'ǀǀ +δ ǀǀ z -z1'ǀǀ 2 (3)
EDE2 EDE1

לשני מבני ה-EDE יש את פונקציות ההפסד הבאות:
LEDE1 = −γ ǀǀ x -x 1'ǀǀ 2 −δǀǀ z - z1'ǀǀ 2 (4)
LEDE2 = +γ ǀǀ x- x 1'ǀǀ 2+δ ǀǀ z- z 1'ǀǀ 2 (5)

הערכים של γ ו- δ תואמים לפרמטרים שצוינו קודם לכן.

figure-protocol-7
איור 3: מבנה מקודד. רשת המקודדים המשמשת בארכיטקטורת EDE המוצעת מחלצת תכונות מרחביות-זמניות ממסגרות הווידאו הקלט. הוא מורכב משכבות קונבולוציוניות מרובות ואחריהם נורמליזציה אצווה והפעלת ReLU, מה שמפחית בהדרגה את הממדים המרחביים תוך לכידת ייצוגים היררכיים. הווקטור הסמוי הסופי מקודד מידע סמנטי ברמה גבוהה החיוני לזיהוי חריגות. קיצורים: ReLU = יחידה ליניארית מתוקנת, EDE = מקודד-מפענח-מקודד. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

כל EDE מספק שתי פונקציות הפסד עבור המבנה המוצע. בשלב 1, EDE1 חייב להפחית את הפסדי השחזור x ו-z. EDE1 חייב לייעל את השונות של שלב 2 בין וקטורים סמויים z ו-z1' ו-x ו-x1'. EDE2 ו-EDE1 מפחיתים את שגיאות השחזור של שלב 1 x ו-z. EDE1 חייב להקטין את ההפרש בין z ו-z1' ו-x ו-x1' בשלב 2, אבל ההפך חייב לקרות.

figure-protocol-8
איור 4: מבנה מפענח. רכיב המפענח של ארכיטקטורת EDE המוצעת משחזר מסגרות קלט מתכונות סמויות. הוא מורכב מסדרה של שכבות קונבולוציוניות שהוחלפו הדגימה בהדרגה מפות תכונות לרזולוציית המסגרת המקורית. המפענח לומד לשחזר במדויק סצנות תנועה רגילות, מה שמאפשר למערכת לזהות חריגות על סמך שגיאות שחזור. קיצור: EDE = מקודד-מפענח-מקודד. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

כל יעד אימון כפול של מודל EDE כולל פונקציות ירידה עם משקלים המשתנים עם הזמן:

LEDE1=(γ||xx1||2+δ||zz1||2)(1)(γ||xx1''||2+δ||zz1''||2) (6)
LEDE2=(γ||xx1||2+δ||zz1||2)+(1)(γ||xx1''||2+δ||zz1''||2) (7)

ספירת תקופות ההכשרה היא n.

אלגוריתם 1 מציג את האימון הדו-שלבי:
קלט:
כל התמונות הרגילות במערך הנתונים E = {x1, x2, . . . , xF},
תקופות N,
פרמטרים משוקללים γ, δ
פלט:
מקודד-מפענח-מקודד מאומן 1,
מקודד-מפענח-מקודד 2
E1, E2, D1, D2 ←אתחול
משקולות
n ←1
חוזר
עבור f = 1 עד F do
zf←e1(xf)
         figure-protocol-9←d1(zf)
         figure-protocol-10←d2(zf)
         figure-protocol-11←e2(figure-protocol-12)
         figure-protocol-13←ה2(figure-protocol-14)
         figure-protocol-15←ד1(figure-protocol-16)
         figure-protocol-17←e2(figure-protocol-18)′
LEDE1figure-protocol-19(γ||xffigure-protocol-20||2+δ||zffigure-protocol-21||2) −(1−figure-protocol-22)(γ||xffigure-protocol-23'||2+ δ||zffigure-protocol-24'||2)
LEDE2figure-protocol-25(γ||xffigure-protocol-26||2+δ||zffigure-protocol-27||2) +(1−figure-protocol-28) (γ||xffigure-protocol-29'||2+ δ||zffigure-protocol-30'||2)
E1, E2, D1, D2←עדכון משקולות
שימוש ב-LEDE1ו-LEDE2
סוף עבור
n ←n + 1
עד n = N

שלבי הדרכה וקריטריונים לזיהוי חריגות
חלקו את ההדרכה לשני שלבים עוקבים:

שלב א' - למידה משקמת:
שני צינורות EDE מאומנים אך ורק בסצנות תנועה רגילות.

תמונות קלט מועברות דרך מקודד 1 → מפענח 1 → מקודד 2 (איור 5).

המודל ממזער אובדן שחזור תמונה ואובדן עקביות סמוי. שלב זה מאפשר לרשת ללמוד מרחב סמוי קומפקטי ועקבי להתנהגות נורמלית.

שלב II - למידת עימות גנרטיבית:

וקטורים סמויים המשוחזרים ממפענח 1 מוזנים למפענח 2 ולאחר מכן מקודדים מחדש באמצעות מקודד 1. זרימה מעגלית זו עוזרת למודל לזהות חוסר עקביות בדפוסים סינתטיים. אובדן יריב מתווסף כדי להגזים בסטיות קטנות בין ייצוגים מקוריים ומשוחזרים. מבחין מאומן באופן אופציונלי להבדיל בין קודים סמויים אמיתיים לקודים משוחזרים, ולאכוף הבחנה חדה יותר במרחב הסמוי.

זיהוי חריגות:
בזמן ההסקה, העבירו מסגרת בדיקה דרך צינור ה-EDE הכפול. חשב שלושה מדדים: שגיאת שחזור מבחינת פיקסלים, אי התאמה וקטורית סמויה וציון מפלה יריב (אם נעשה בו שימוש). חישוב ציון אנומליה מורכב כסכום משוקלל:
figure-protocol-31

מסגרות עם ציוני אנומליה מעל סף מכויל מסומנות כאירועים חריגים פוטנציאליים. מנגנון זה מאפשר למודל לזהות סטיות עדינות בדפוסי מרחב חזותיים וסמויים מבלי לדרוש תוויות אנומליה מוערות.

figure-protocol-32
איור 5: ארכיטקטורה של מודל GANomaly היריב המשלב EDE 1 ו-EDE 2. איור זה ממחיש את העיצוב של מודל זיהוי האנומליה היריבה, המשלב שני מבני EDE - EDE1 לשחזור ו-EDE2 ליישור תכונות סמויות. המודל משתמש באובדן עקביות וקטורית סמויה ואימון יריב באמצעות מפלה כדי לאכוף דמיון בין הייצוגים הסמויים של הקלט למסגרות המשוחזרות. ארכיטקטורה זו משפרת את זיהוי האנומליות על ידי לימוד הטמעות תכונות חזקות עבור דפוסי תנועה רגילים. קיצורים: EDE1 = מבנה מקודד-מפענח-מקודד ראשון לשחזור; EDE2 = מבנה מקודד-מפענח-מקודד שני ליישור תכונות סמויות. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

במהלך הזיהוי, המודל שלנו השתמש בציונים החריגים הבאים:

Acc(x̂) = ω1||z−z2||22||z−z1'||2 (8)

שינוי פרמטרי משקל (ω1+ ω2= 1) יכול לשנות את הרגישות על ידי התאמת היחס בין החיוביים האמיתיים לחיוביים כוזבים. ביישומים בעולם האמיתי, שינוי שני הפרמטרים הללו יכול לזהות תאונות עם רגישויות שונות בניסוי אחד.

במהלך האימון, כל מסגרת קלט x מועברת דרך מקודד E1 כדי ליצור וקטור סמוי z. לאחר מכן משוחזר הווקטור הסמוי באמצעות מפענח D1, ומייצר תמונה x̂1, אשר מועברת לאחר מכן דרך מקודד E2 כדי לקבל וקטור סמוי משוחזר z. במקביל, z מפוענח על ידי מפענח D2 כדי לייצר x̂2, שגם מקודד מחדש באמצעות E2 כדי להפיק z2. תהליך דו-כיווני זה שומר על מידע ברמת הפיקסלים וברמת הסמוי לזיהוי חריגות.

אלגוריתם בדיקת מודל:
figure-protocol-33={( x̂1,y 1),( x̂2,y 2),...,( x̂M*,yM*)},
סף φ,

פרמטרי שקלול ω1, ω2
פלט: תווית חיזוי של מערך נתונים לבדיקה
Ere = {y1pre, y2pre, ..., yF*pre}
עבור i = 1ל F* do
zi ← e1(xi)
x2i ← d2(zi)
z2i ← e2 (x2i)
z1i' ← d1(z2i)
z1i' ← e2(z1i')
Acc(x̂i) ←ω1||zi−z2i||22||zi−z1i'||2
ifAcc(x̂i) ≥φ אז
yipre ←1
אחר
yipre ←0
אנדיף
קצה

EDE משתמש במפלה כמרכיב למידה יריב כדי להגביר את דיוק זיהוי האנומליות על ידי שיפור יכולת המודל להבחין בין אירועים נורמליים וחריגים. הוא משפר את הביצועים באופן הבא:

אפליית למידה: המפלה מאומן להבדיל בין ייצוגים סינתטיים וכפולים משוחזרים במבנה EDE. אופטימיזציה של תהליך יריב זה מעניקה למודל תכונות סמויות מפלות ביותר, ומשפרת את זיהוי האנומליה של זירת התנועה.

הסרת שחזורים גרועים: מכיוון שהם חורגים כל כך מדפוסי התנועה, חריגות יוצרות לעתים קרובות בעיות שחזור. המפלה מעניש פריימים משוחזרים בצורה שגויה, ומשפר את זיהוי האירועים הרגילים/חריגים של הרשת.

שיפור ייצוג תכונות עם אימון יריב: על ידי שילוב למידה יריבה, המפלה גורם לרשת EDE לייצר הטמעות סמויות עמידות ומשמעותיות יותר. זה מזהה אפילו שינויים קטנים כמו בלימה פתאומית, התנגשויות וסטיית רכב, ומשפר את זיהוי החריגות.

הסרת תוצאות חיוביות כוזבות: מקודדים אוטומטיים מסורתיים מכלילים ומנרמלים חריגות, וכתוצאה מכך שיעורי חיוביים כוזבים גבוהים. המפלה משמר את תכונות האנומליות במהלך השחזור על ידי זיהוי פערים סמויים בין מסגרות נורמליות וחריגות.

שיפור הסיווג עם תהליך החלטה דו-שלבי: מסגרות רגילות או חריגות שנבנו מחדש מקבלות ציוני ביטחון מהמפלה. שגיאות סיווג שגוי ואובדן שחזור מצטמצמים בשלב אימות נוסף זה, ומשפרים את דיוק הזיהוי.

השתמשנו בשיטות מוכחות לזיהוי תאונות כדי לבחון את האסטרטגיה 23,24,25,26. מחלקה אחת במערך נתונים מרובה מחלקות הייתה נורמלית וכל שאר שיעורי התאונות נבדקו בקפידה באמצעות גישה אחת לעומת כולן. המודל אומן באמצעות נתוני כיתה רגילים בלבד, בעוד שערכת המבחן השתמשה בנתונים של תאונות ונתונים רגילים. ערכות האימונים והמבחנים חולקו לשתי דרכים.

התאמנו ובדקנו עם 80% ו-20% נתונים ברמה רגילה, בהתאמה. תוצאות המבחן בכיתת התאונות נבחרו באופן אקראי. ההערכה לא הייתה מוטה על ידי שימוש בדגימות מבחן מסוג תאונות, המייצגות 20% מנתוני המעמד הרגיל, כדי למנוע הטיה של המודל לכיוון הרוב הנורמלי. ניתן לבדוק את המודל מול מספר שווה של נתונים רגילים ותאונות, המייצגים תנאים מעשיים. הוא בודק הכללת מודל ללא משוא פנים על ידי אימון עם 80% מהנתונים הרגילים והסתרת 20%. זה גם מראה שמספר ההתרחשויות הרגילות עולה על מספר התאונות בחיים האמיתיים, ולכן חשוב לחשוף את המודל לנתוני תאונות נדירים. בחירה אקראית של דגימות תאונות ובדיקת הדגם מול כל מצבי התאונה ללא התאמת יתר מגבירים את החוסן. פיצול הנתונים של 80/20 נפוץ בלמידת מכונה. נתוני אימון לדפוסים משמעותיים ונתוני מבחן להערכת ביצועים מאוזנים.

הניסויים השתמשו במערכי נתונים לאימון ובדיקה. פיצול אימונים בכיתה רגילה שימש לאימות ואימון. נתוני המבחן של כל הכיתות נבדקו.

גיזום וקוונטיזציה של מודלים מפחיתים מאוד את גודל המודל והחישוב. למודל המופחת יש את אותו דיוק אך ביצועים נמוכים יותר מכיוון שהוא כולל 40% פחות פרמטרים. עבור מכשירי קצה עם כוח עיבוד נמוך, כימות המודל דוחס אותו. אופטימיזציה זו עונה על צרכי דיוק וזיכרון של מעקב אחר תנועה בזמן אמת.

עיצובים קלים כמו MobileNets ו-EfficientNet מגדילים את המסקנות בזמן אמת. בשל דיוק הראייה הממוחשבת והחישוב המינימלי שלהם, סוגים אדריכליים אלה נמצאים בשימוש נרחב. במערכות משובצות, מודלים כאלה מפחיתים את עיבוד המסגרת ב-50% תוך שמירה על ציוני F1 חזקים לזיהוי תאונות.

שימוש בפרמטרים דומים לשחזור תמונה וזיהוי תאונות תוך שימוש בלמידה מרובת משימות יכול לפשט את התכנון. זה הפחית את זמן ההדרכה ועלות המחשוב מבלי להשפיע על דיוק המודל. מערכת הלמידה מרובת המשימות פשטה את למידת מודל עיבוד נתוני התנועה של סרטוני תנועה.

אימון יריב ניגודי ובפיקוח עצמי הניב תוצאות דומות למודל זיהוי האנומליה הבסיסית בפחות זמן. תכונות תאונות דרכים נאספו והוכללו כדי לשפר את החוסן על נתונים בלתי נראים.

האלגוריתם המוצע לזיהוי חריגות תנועה נבדק במסלול 4, אחד מחמשת מערכי הנתונים של AI City Challenge2021 27. הכבישים המהירים סיפקו את הנתונים הללו ל-Iowa DOT.

הערכת ביצועים השוואתית:
כדי לאמת את המודל שלנו, בדקנו אותו על מערך הנתונים של AI City Challenge Track 4 מול מודלים מתקדמים, כולל GANomaly, f-AnoGAN, OCGAN והשיטה המפוקחת של ByteDance. טבלה 2 מסכמת את התוצאות.

מודלציון F1דיוקזוכרהאוניברסיטה האמריקאית
גנומלי0.870.880.860.9
אוקגן0.890.90.870.91
ByteDance (סופ.)0.910.930.890.92
מוצע (Dual-EDE)0.940.950.930.94

טבלה 2: השוואה בין שיטות. הטבלה משווה שיטות זיהוי אנומליות לפי ציון F1, דיוק, זיכרון ודיוק. עיצובי EDE עם ובלי הכשרה יריבה מושווים. שני אימוני EDE פלוס יריבים ניצחו את BADU, ByteDance ו-WHU בכל הקטגוריות. הנתונים מצביעים על כך שלמידה יריבה מגבירה את זיהוי האנומליה.

מודל ה-EDE הכפול עולה על כל קווי הבסיס, במיוחד בהיזכרות - מה שמעיד על רגישות חזקה יותר לאירועים חריגים נדירים.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כדי להעריך את היעילות של שיטת זיהוי חריגות התנועה המוצעת, יישמנו את המודל על סרטון וידאו יחיד ויצרנו הדמיות הממחישות את התנהגות המערכת לאורך זמן ובתוך מרחב התכונות. למרות שהתקבלו באמצעות צינור EDE מדומה, התוצאות משקפות מקרוב את המסקנות האיכותיות שניתן לצפות ממודל בפועל.

ציר הזמן של ציון האנומליה מתאר את הביטחון של המודל מסגרת אחר מסגרת בזיהוי התרחשויות חריגות (איור 6). שיאים בציון האנומליה תואמים לשינויים פתאומיים בדינמיקת התמונה, כגון תנועה פתאומית או עיוותים חזו...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מציג מערכת לזיהוי אנומליות תנועה מבוססת למידה עמוקה המשתמשת בארכיטקטורת EDE, מאומנת באופן לא מפוקח לזיהוי תאונות של כלי רכב בודדים ומרובים בסרטוני מעקב בעולם האמיתי. על ידי מידול התנהגות תנועה טיפוסית, המערכת מזהה סטיות כחריגות סבירות מבלי לדרוש נתוני אנומליה מסומנים, ובכך מתמודדת עם אתגרי מדרגיות ודלילות נתונים בניטור תעבורה חכם. המחקר מקדם את התחום על ידי הדגמת השימוש המשולב בעקביות חלל סמוי ואובדן שחזור לזיהוי יעיל של אנומליה מרחבית-זמנית.

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים שאין ניגודי אינטרסים.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה לא קיבל מימון חיצוני. המחברים רוצים להודות לבית הספר למחשוב אמריטה, קוימבטור, הודו, על מתן החומרה הדרושה והתמיכה שלא תסולא בפז בביצוע מחקר זה.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
מערך נתונים של AI City Challenge Track 4אתגר עיר AI (https://www.aicitychallenge.org)רצועה 4, מהדורת 2021
ערכת הכלים של CUDAמפתח NVIDIAגירסה 11.3
ספריית cuDNNמפתח NVIDIAתואם ל-CUDA 11.3
אשכול תחנות עבודה של GPU (הדרכה)בית הספר אמריטה למחשבים
תחנת עבודה מקומית (צומת ערפל)בית הספר אמריטה למחשבים
מטפלוטלבmatplotlib.orgגרסה 3.3+
NVIDIA Jetson Nano (התקן קצה)NVIDIA945-13450-0000-100
NVIDIA RTX 3060 GPU (תחנת עבודה)NVIDIAמשתנה בהתאם ליצרן
NumPynumpy.orgגרסה 1.19+
OpenCVOpenCV.orgגרסה 4.5+
פנדהpandas.pydata.orgגרסה 1.1+
פיתוןקרן התוכנה של פייתוןגרסה 3.8+
פייטורץ'פייטורץ' (https://pytorch.org)גרסה 1.10+
Scikit-learnscikit-learn.orgגירסה 0.24+
אובונטו לינוקס (מערכת הפעלה)קנוניקל בע"מגרסה 20.04 LTS

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Gannina, A. R. K., et al. A new approach to road incident detection leveraging live traffic data: An empirical investigation. Procedia Comput Sci. 235, 2288-2296 (2024).
  2. Khaleghi, A., Moin, M. -S. Improved anomaly detection in surveillance videos based on a deep learning method. IEEE. , 73-81 (2018).
  3. Tripathy, A. K., Sarkar, M., Sahoo, J. P., Li, K. C., Chinara, S. Road accident detection and severity determination from CCTV surveillance. Advances in distributed computing and machine learning. Lect Notes Netw Syst. , Springer. Singapore. (2021).
  4. Pang, G., Shen, C., Cao, L., Van den Hengel, A. Deep learning for anomaly detection: A review. ACM Comput. Surv. 54 (1), 1-38 (2021).
  5. Chalapathy, F., Zhang, L., Liu, H., Wang, Y., Zhao, Y. Deep learning for video anomaly detection: A review. arXiv preprint. , (2024).
  6. Gupta, A., Verma, S. Wave-GANomaly: A GAN-based anomaly detector using multi-feature fusion and wavelet transform. PLoS ONE. 18 (6), 1-18 (2023).
  7. Roy, D., Uddin, M. S., Bappy, S. M. Deep learning-based anomaly detection in video surveillance: A comprehensive review. Sensors. 23 (11), 5024-5047 (2023).
  8. Generative adversarial nets. Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., et al. Proc 27th Int Conf Neural Inf Process Syst, Montreal, QC, , (2014).
  9. Alzahrani, A. B., et al. Unsupervised video anomaly detection in UAVs: A new approach. Front Sustain. Cities. 5, 1-10 (2023).
  10. Chalapathy, R., Chawla, S. Deep learning for anomaly detection: A survey. , Cornell University. (2019).
  11. Chen, H., Lin, J., Fang, M. Variational autoencoder for anomaly detection: A comparative study. arXiv preprint. , (2024).
  12. Schlegl, T., Seeböck, P., Waldstein, S. M., Langs, G., Schmidt-Erfurth, U. f-AnoGAN: Fast unsupervised anomaly detection with generative adversarial networks. Med Image Anal. 54, 30-44 (2019).
  13. Akcay, S., Atapour-Abarghouei, A., Breckon, T. P. Ganomaly: Semi-supervised anomaly detection via adversarial training. Comput Vis – ACCV 2018, Lect Notes Comput Sci. Jawahar, C., Li, H., Mori, G., Schindler, K. 11363, Springer. Cham. (2019).
  14. Ocgan: One-class novelty detection using GANs with constrained latent representations. Perera, P., Nallapati, R., Xiang, B. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, Long Beach, CA, , 2898-2906 (2019).
  15. Nayak, R., Mishra, S. K., Dalai, A. K., Pati, U. C., Das, S. K. A panoramic review on cutting-edge methods for video anomaly localization. IEEE Access. 12, 186380-186412 (2024).
  16. He, Z., Xu, X., Deng, S. Discovering cluster-based local outliers. Pattern Recognit Lett. 24, 1641-1650 (2003).
  17. Tax, D. M. J., Duin, R. P. W. Support vector data description. Mach Learn. 54, 45-66 (2004).
  18. Anomaly detection with robust deep autoencoders. Zhou, C., Paffenroth, R. C. Proc. 23rd ACM SIGKDD Int Conf Knowl Discov Data Min, Halifax, NS, , 665-674 (2017).
  19. Hojjati, H., Ho, T. K. K., Armanfard, N. Self-supervised anomaly detection in computer vision and beyond: A survey and outlook. Neural Netw. 172, 106106(2024).
  20. Donahue, J., Krähenbühl, P., Darrell, T. Adversarial feature learning. , Cornell University. (2016).
  21. El-Sayed, H. A., El-Horbaty, A. A cutting-edge video anomaly detection method using image quality assessment and attention mechanisms. Alex Eng J. 72, 689-701 (2024).
  22. Kiran, B. R., Thomas, D. M., Parakkal, R. An overview of deep learning-based methods for unsupervised and semi-supervised anomaly detection in videos. J Imaging. 4, 36(2018).
  23. Chow, J. K., Su, Z., Wu, J., Tan, P., Mao, X., Wang, Y. Anomaly detection of defects on concrete structures with the convolutional autoencoder. Autom Constr. 45, 101105(2020).
  24. Siegel, B. Industrial anomaly detection: A comparison of unsupervised neural network architectures. IEEE Sens Lett. 4 (8), 1-4 (2020).
  25. Uchida, M., Ishida, S., Tabaru, T., Miyamoto, H. Anomaly detection of rotary vacuum pump using thin AE sensor and reconstruction error of autoencoder. SICE Trans. 54 (7), 599-605 (2018).
  26. Khan, M. A., Ahmad, T., Siddiqui, N. A. A novel unsupervised video anomaly detection framework based on spatiotemporal features. PLoS ONE. 18 (4), 1-20 (2023).
  27. Iowa DOT anomaly dataset. , https://www.aicitychallenge.org/2021-data-and-evaluation (2021).
  28. Lee, K., Jung, D. Unsupervised video anomaly detection based on similarity with text descriptions. Sensors. 23 (14), 6256(2023).
  29. Kingma, D. P., Welling, M. Auto-encoding variational bayes. arXiv preprint. , (2013).
  30. Masci, J., Meier, U., Cireşan, D., Schmidhuber, J. Stacked convolutional auto-encoders for hierarchical feature extraction. Int Conf Artif Neural Netw. Honkela, T., Duch, W., Girolami, M., Kaski, S. , Springer. Berlin. 52-59 (2011).
  31. Fan, J., Zhang, Q., Zhu, J., Zhang, M., Yang, Z., Cao, H. Robust deep auto-encoding Gaussian process regression for unsupervised anomaly detection. Neurocomputing. 376, 180-190 (2020).
  32. Shvetsova, N., Bakker, B., Fedulova, I., Schulz, H., Dylov, D. V. Anomaly detection in medical imaging with deep perceptual autoencoders. IEEE Access. 9, 118571-118583 (2021).
  33. Unsupervised anomaly detection with generative adversarial networks to guide marker discovery. Schlegl, T., Seeböck, P., Waldstein, S. M., Schmidt-Erfurth, U., Langs, G. Int Conf Inf Process Med Imaging, , Springer. Cham. 146-157 (2017).
  34. Tuluptceva, N., Bakker, B., Fedulova, I., Konushin, A. Perceptual image anomaly detection. arXiv preprint. , (2019).
  35. Chen, C., Yuan, W., Xie, Y., Qu, Y., Tao, Y., Song, H., et al. Novelty detection via non-adversarial generative network. arXiv preprint. , (2020).
  36. Salehi, M., Eftekhar, A., Sadjadi, N., Rohban, M. H., Rabiee, H. R. Puzzle-AE: Novelty detection in images through solving puzzles. arXiv preprint. , (2020).
  37. Support vector method for novelty detection. Schölkopf, B., Williamson, R. C., Smola, A. J., Shawe-Taylor, J., Platt, J. Proc 12th Int Conf Neural Inf Process, Denver, CO, , 582-588 (1999).
  38. Marvasti-Zadeh, S. M., Cheng, L., Ghanei-Yakhdan, H., Kasaei, S. Deep learning for visual tracking: A comprehensive survey. IEEE Trans Intell Transp Syst. , 1-26 (2021).
  39. Van den Oord, A., et al. Conditional image generation with PixelCNN decoders. Adv Neural Inf Process Syst. 29, Barcelona. (2016).
  40. Deep one-class classification. Proc 35th Int Conf Mach Learn. PMLR. Ruff, L., et al. , PMLR. Stockholm. 4393-4402 (2018).
  41. Pidhorskyi, S., Almohsen, R., Doretto, G. Generative probabilistic novelty detection with adversarial autoencoders. Adv Neural Inf Process Syst. 31, Montreal, QC. (2018).
  42. The 5th AI city challenge. Naphade, M., et al. IEEE Conf Comput Vis Pattern Recognit Work, , (2021).
  43. Good practices and a strong baseline for traffic anomaly detection. Zhao, Y., Wu, W., He, Y., Li, Y., Tan, X., Chen, S. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 3993-4001 (2021).
  44. Box-level tube tracking and refinement for vehicles anomaly detection. Wu, J., Wang, X., Xiao, X., Wang, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4112-4118 (2021).
  45. Dual-modality vehicle anomaly detection via bilateral trajectory tracing. Chen, J., et al. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4016-4025 (2021).
  46. An efficient approach for anomaly detection in traffic videos. Doshi, K., Yilmaz, Y. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4236-4244 (2021).
  47. A vision-based system for traffic anomaly detection using deep learning and decision trees. Aboah, A. Proc IEEE/CVF Conf Comput Vis Pattern Recognit, , 4207-4212 (2021).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Traffic Accident DetectionSurveillance VideosUnsupervised Anomaly DetectionDual Encoder DecoderAdversarial TrainingDeep Learning ArchitectureReconstruction LossGenerative Adversarial MechanismTraffic Behavior ModelingEmergency Response

Related Articles