בייצור תעשייתי מודרני, הבטיחות היא אבן היסוד להבטחת יעילות הייצור ורווחת כח האדם. סביבת קו הייצור כוללת בדרך כלל ציוד מכני במהירות גבוהה, תהליכים טכנולוגיים מורכבים ופעולות שיתופיות הכוללות משימות מרובות. כל סיכון בטיחותי פוטנציאלי, אפילו קטן, עלול להוביל לתאונות ייצור חמורות, שיגרמו להפסדים כלכליים משמעותיים ואפילו למקרי מוות. לפיכך, קריטי להקים מערכת ניטור בטיחות יעילה, חכמה ובזמן אמת כדי לשפר את הבטיחות בייצור התעשייתי1,2.
שיטות מסורתיות לניטור בטיחות מסתמכות בעיקר על מעקב וידאו ידני וחיישנים שונים (כגון חיישני אינפרא-אדום, עשן ורעידות)3. ניטור ידני אינו יעיל בלבד, אלא גם נוטה להשמטות של זיהויים עקב עייפות של אנשי הניטור, ואינו יכול לספק כיסוי רציף ומקיף. למרות שחיישנים יכולים לספק פונקציית התראה מוקדמת מסוימת, טווח הגילוי שלהם מוגבל והם רגישים להפרעות סביבתיות, מה שמוביל לבעיות בולטות של התראות שווא4. מערכות ניטור חכמות הפכו למוקד מחקר גובר. ניתוח בזמן אמת של זרם וידאו באמצעות אלגוריתם למידה עמוקה יכול לזהות באופן אוטומטי אירועים חריגים, התנהגויות לא בטוחות וסיכונים פוטנציאליים, ובכך לשפר משמעותית את רמת האינטליגנציה של מערכת הניטור4,5.
זיהוי אובייקטים הוא טכנולוגיה מרכזית בניטור חכם. כנציגים של גלאי אובייקטים בעלי שלב אחד, אלגוריתמי סדרת You Only Look Once (YOLO) מציגים יתרונות משמעותיים. מ-YOLOv1 ועד YOLOv8, אוסף אלגוריתמים זה עבר פיתוח מתמשך, עם שיפורים בארכיטקטורת הרשת, בפונקציית ההפסד ובמתודולוגיית האימון, בין היתר6,7. YOLOv1, בפרט, השיג דיוק זיהוי גבוה יותר תוך שמירה על קצב פריימים גבוה, במיוחד כאשר הוא מתמודד עם רקעים מורכבים ומטרות צפופות8.
עם זאת, למרות ביצועיו המצוינים במשימות כלליות של זיהוי אובייקטים, YOLOv1 עדיין מתמודד עם אתגרים בתרחישים ספציפיים של ניטור בטיחות בקווי ייצור9. לדוגמה, דיוק הזיהוי של YOLOv1 עלול לרדת כאשר עובדים מוסתרים חלקית על ידי ציוד, או כאשר תמרורי בטיחות הם קטנים ודומים מאוד לצבע הרקע. דבר זה מחייב את המודל להיות בעל יכולות חזקות יותר של חילוץ מאפיינים והבנה סמנטית10.
רשתות עצביות קונבולוציוניות (CNNs) בעלות יכולות עוצמתיות בחילוץ מאפייני תמונה1. באמצעות תכנון ארכיטקטורות רשת עמוקות ומורכבות יותר, CNNs יכולות ללמוד מאפייני תמונה עשירים ומופשטים יותר. שילוב של CNN עם YOLOv1 ממנף את יכולות הזיהוי המהירות של YOLOv1 ואת חילוץ המאפיינים העמוק של ה-CNN, ובכך בונה מערכת ניטור בטיחות חסונה ואינטליגנטית יותר.
על בסיס זה, מאמר זה מציע מערכת לניטור בטיחות בקו ייצור המשתמשת ב-YOLOv1 וב-CNN. ההיבטים החדשניים של מחקר זה כוללים: (1) הצעה לארכיטקטורת היתוך עמוק של YOLOv1 ו-CNN משופר; (2) הצגת היתוך תכונות רב-קנה מידה ומנגנון קשב מורכב כדי לשפר את הזיהוי של מאפייני בטיחות מרכזיים; ו-(3) אימות יתרונות הביצועים של המודל על גבי מערך נתונים של סביבה מורכבת שנבנה באופן עצמאי.
פיתוח אלגוריתמי סדרת YOLO
מאז הצגתו הראשונה על ידי Redmon et al. בשנת 201512, עורר אלגוריתם You Only Look Once (YOLO) עניין רב. בניגוד לגלאים בעלי שני שלבים המסתמכים על הצעות אזורים (region proposals), YOLO מתייחס לזיהוי אובייקטים כמשימת רגרסיה. על ידי חיזוי ישיר של המחלקות והמיקומים של אובייקטים בתמונה, YOLO משפר משמעותית את מהירות הזיהוי, מה שהופך אותו למתאים לשימוש בזמן אמת13.
כעבודה פורצת דרך בסדרה זו, YOLOv1 משיגה זיהוי יעדים מקצה לקצה לראשונה14. YOLOv1 כוללת חלוקה של תמונת הקלט למבנה של רשת, שבה כל תא רשת, המסודר בדרך כלל בפורמט של S × S, מופקד על זיהוי אובייקטים הנופלים בתוך גבולותיו.
באופן ספציפי, הפלט של YOLOv1 הוא טנזור. בין ה- S × S × (B × 5 + C), החיזוי של כל תיבת חסום (bounding box) מכיל 5 איברים: קואורדינטת נקודת המרכז (x,y), רוחב ו', גובה הוביטחון ג'תהליך החישוב מוצג במשוואה (1):
(1)
ביניהם, Pr(אובייקט() מייצג את ההסתברות שקיים מטרה בסריג, ו- IOU מייצג את היחס בין החיתוך לאיחוד (Intersection over Union) בין תיבת החסום החזויה לתיבת האמת (ground-truth box). כל רשת חוזה גם קבוצה של הסתברויות למחלקה, פרוטוקול המייצגת את ההסתברות שהמטרה שייכת ל- i-מחלקה בנוכחות יעד. פונקציית ההפסד של YOLOv1 מורכבת משלושה מרכיבים עיקריים: ההפסד עבור חיזוי קואורדינטות, ההפסד עבור אומדן ביטחון (confidence estimation) וההפסד עבור חיזוי קטגוריה15.
YOLOv2 מציגה Batch Normalization, מסווג ברזולוציה גבוהה ואסטרטגיית אימון רב-קנה מידה, המשפרים את היציבות והדיוק16. YOLOv3 משתמשת ב-Darknet-53 כרשת הבסיס (backbone network) שלה ושואבת השראה מקונספט ה-Feature Pyramid Network (FPN) כדי לשפר את זיהוי המטרה17.
YOLOv4 ביצעה אופטימיזציות רבות המבוסות על YOLOv3, והכניסה טכנולוגיות כגון Cross Stage Partial Network (CSPNet)18, Path Aggregation Network (PANet)19, ושיפור נתונים בשיטת Mosaic כדי לשפר עוד יותר את ביצועי המודל. YOLOv5 תרמה תרומה משמעותית להיבטים ההנדסיים, והציעה מימוש יעיל וקל יותר לשימוש20.
בשנים האחרונות המשיכה סדרת YOLO להתפתח, כאשר גרסאות כגון YOLOv6, YOLOv7 ו-YOLOv8 שוחררו אחת אחרי השנייה. באמצעות הצגת מבנה ה-Extended Efficient Layer Aggregation Network (E-ELAN) וטכניקות של רה-פרמטריזציה של המודל, YOLOv7 משיגה פריצות דרך חדשות הן במהירות והן בדיוק. שיפורים אלו לא רק משפרים את יעילות למידת המאפיינים אלא גם מייעלים את ביצועי ההסקה של הרשת, מה שמאפשר ל-YOLOv7 לעקוף גרסאות קודמות וגלאים מרכזיים רבים במגוון משימות של זיהוי אובייקטים בזמן אמת. YOLOv8 מייעלת עוד יותר את מבנה הרשת, מאמצת תכנון ללא עגנים (anchor-free), מפשטת את המודל ומשפרת את יכולת ההכללה שלו21.
בהתבסס על היתרונות של גרסאות קודמות, YOLOv1, ששימש במחקר זה, עבר אופטימיזציה עבור תרחישים תעשייתיים מורכבים. השיפורים המרכזיים שבו כוללים רשת חילוץ מאפיינים, מודול מיזוג מאפיינים יעיל יותר ועיצוב חסון יותר של פונקציית ההפסד. שיפורים אלו מאפשרים ל-YOLOv1 להפגין ביצועים טובים יותר בטיפול בחסימות, מטרות קטנות ורקעים מורכבים בסביבות ייצור. YOLOv1 הוא גרסה של סדרת YOLO ששוחררה על ידי Ultralytics. בהשוואה ל-YOLOv8, הוא משפר את מודול ה-C3K2 ואת נתיב מיזוג המאפיינים, ומציג אסטרטגיית תיבת עיגון (anchor box) אדפטיבית, ובכך מספק חסינות גבוהה יותר בזיהוי בתרחישים תעשייתיים.
הבסיס וההתקדמות של רשתות נוירונים קונבולוציוניות (CNN)
רשת נוירונים קונבולוציונית (CNN) היא מודל מרכזי שהשפיע עמוקות על הצלחתו של הלמידה העמוקה בתחום הראייה הממוחשבת. היא פועלת על ידי חילוץ מאפיינים מקומיים של התמונה באמצעות פעולות קונבולוציה, ולאחר מכן הפחתת ממדיות המאפיינים באמצעות פעולות pooling, ובכך משיגה הפשטה היררכית של התמונה2.
רשת CNN טיפוסית מורכבת ממספר שכבות קונבולוציה (convolutional), שכבות דגימה (pooling) ושכבות מחוברות במלואן (fully connected). שכבת הקונבולוציה סורקת את תמונת הקלט באמצעות גרעין קונבולוציה, מחשבת מכפלות סקלריות על פני אזורים מקומיים ומייצרת מפת מאפיינים. תהליך החישוב מוצג במשוואה (2):
(2)
היכן נראה ששלחת רק את האות "x". אנא ספק את הטקסט המדעי שברצונך לתרגם מאנגלית לעברית, ואשמח לבצע את התרגום המקצועי עבורך בהתאם להנחיות. היא התמונה הקלטית, וק ו bק הם המשקל וההטיה של גרעין הקונבולוציה, בהתאמה, ו-
האם הערכים של מפת התכונות של הפלט במיקום (i,j). שכבת האיסוף (pooling layer) משתמשת בדרך כלל ב-Max Pooling או ב-Average Pooling. השכבה המחוברת במלואה (fully connected layer) אחראית על חילוץ מאפיינים וניבוי הסתברויות סיווג.
על בסיס זה, מאמר זה מתכנן מודול להגברת תכונות CNN עבור YOLOv11, המורכב משני ענפים מקבילים: ענף קונבולוציה רב-קנה-מידה המשתמש בגרעיני קונבולוציה של 3 × 3 ו-5 × 5 כדי לחלץ תכונות רב-קנה-מידה; וענף קשב (attention) המחבר באופן סדרתי את מודולי קשב הערוץ (Squeeze-and-Excitation) וקשב מרחבי כדי להגביר את התכונות המבדילות של יעדים מרכזיים. הפלטים של שני הענפים ממוזגים באמצעות חיבור אלמנטים (element-wise addition), ופונקציית ההפסד המתאימה להגברת התכונות מוצגת בנוסחה (3):
(3)
Lcoord הוא הפסד רגרסיית קואורדינטות של תיבת התוחם; Lconf הוא הפסד הביטחון של היעד; Lcls הוא הפסד סיווג הקטגוריה; Lfeat הוא הפסד שיפור המאפיינים, המשמש להגבלת המאפיינים המבדילים של יעדים קטנים ויעדים מוסתרים שהוצאו על ידי מודול השיפור של ה-CNN; λcoord, λconf, λcls, λfeat הם מקדמי המשקל של פונקציות ההפסד המתאימות. עבור משימה זו, נקבע λfeat = 0.05, והמשקלים הנותרים אוזנו בהתאם לדרישות משימת הזיהוי.
מבני CNN קלאסיים, כגון VGGNet23 ו-ResNet24, השיגו הצלחה רבה במשימות סיווג תמונות. בין ארכיטקטורות אלו, ResNet מפחית באופן יעיל את בעיית הגרדיאנט הנעלם באימון רשתות עמוקות, ובכך מקל על בניית מבני רשת עמוקים ומורכבים יותר.
במשימות של זיהוי אובייקטים, CNN משמשת בדרך כלל כמחלץ תכונות (backbone). לדוגמה, Darknet, CSPDarknet (cross-stage partial Darknet) ואחרים בסדרת אלגוריתמי YOLO, מבוססים כולם על CNN25. כדי לשפר את יכולות חילוץ התכונות, חוקרים הציעו מבני CNN משופרים רבים. לדוגמה, מודול ה-Inception מחלץ תכונות במקביל באמצעות גרעיני קונבולוציה רב-קנה מידה. DenseNet משפרת את שימוש החוזר בתכונות באמצעות חיבורים צפופים. רשת ה-Squeeze-and-Excitation מתאימה באופן אדפטיבי את חשיבותם של ערוצי התכונות באמצעות מנגנוני קשב (attention mechanisms)26.
במחקר זה, תכננו מודול CNN משופר כדי להגביר את יכולות חילוץ המאפיינים של YOLOv11. מודול זה משלב מיזוג מאפיינים רב-קנה מידה עם מנגנון קשב (attention mechanism) כדי ללכוד באופן יעיל יותר מידע בטיחותי מרכזי בתרחישים של קווי ייצור.
מצב היישום של למידה עמוקה בניטור בטיחות תעשייתית
למידה עמוקה זכתה לתאוצה משמעותית בניטור בטיחות תעשייתית. אלגוריתמים המבוססים על CNN משמשים כדי לקבוע אם עובדים חובשים קסדות בטיחות כראוי, לזיהוי חדירות בלתי מורשות לאזורי סיכון, ולניטור מצבם של ציודים עם תקלות27.
בכל הנוגע לזיהוי התנהגות, רשתות נוירונים קונבולוציוניות תלת-מדיות (3D CNNs) ורשתות נוירונים רקורסיביות משמשות לניתוח ההתנהגות התפעולית של עובדים ולזיהוי פעולות שעלולות להיות לא בטוחות. כך למשל, באמצעות ניתוח רצפי תנוחות של עובדים, ניתן לקבוע האם הם מפרים נהלי תפעול בטיחותיים28.
YOLO ו-Faster R-CNN נמצאים בשימוש נרחב לזיהוי כוח אדם וציוד בסרטוני מעקב בזמן אמת. לדוגמה, בספרות הוצעה מערכת לזיהוי קסדות בזמן אמת המבוססת על YOLOv5, אשר שיפרה ביעילות את האינטליגנציה של ניהול הבטיחות באתרי בנייה29.
אף על פי שנעשה התקדמות מסוימת במחקרים קיימים, נותרו מספר אתגרים. ראשית, סביבות תעשייתיות מאופיינות בדרך כלל בתאורה מורכבת, הסתרה והפרעות רקע, המטילות דרישות מחמירות על החוסן של האלגוריתם. שנית, ביצועים בזמן אמת הם דרישה מרכזית, והאלגוריתם חייב להשיג הסקה במהירות גבוהה תוך שמירה על הדיוק. לבסוף, מחקרים קיימים מתמקדים בעיקר בזיהוי של משימה בודדת וחסרים בהם חקירות של היתוך מידע ממקורות מרובים וניתוח מקיף30.
במחקר זה, מודל מיזוג ה-YOLOv1 וה-CNN המוצע נועד להתמודד עם האתגרים שהוזכרו לעיל ולהשיג ניטור מקיף ובזמן אמת של סיכוני בטיחות בקו הייצור, על ידי שיפור יכולות חילוץ המאפיינים והמיזוג שלהן.