כדי לאמת את יעילותם של מודל ה-YOLOv1 ומודל ה-CNN המוצעים במיזוג לניטור בטיחות בקו ייצור, נבנה מאגר נתונים המכסה תרחישי סיכון בטיחותיים שונים. מאגר נתונים זה מכיל 12,0 תמונות של סצנות מקו ייצור, המחולקות למערכי אימון, תיקוף ובדיקה ביחס של 7:1.5:1.5, עם גרעין אקראי (random seed) קבוע של 42. הוא מכסה תנאי עבודה מגוונים, כולל תאורה סטנדרטית, תאורה חלשה, הסתרה חלקית, הסתרה כבדה, טשטוש תנועה ורקעים מורכבים. סף הביטחון (confidence threshold) להסקה נקבע ל-0.5, וסף הדיכוי הלא-מקסימלי (NMS) נקבע ל-0.45. כל הניסויים חזרו שלוש פעמים, והתוצאות מדווחות כממוצע ± סטיית תקן. קטגוריות התיוג הן עובדים, קסדות בטיחות, זרועות רובוטיות, אזורי סיכון, כלים וכלי רכב, תוך שימוש בפורמט PASCAL Visual Object Classes (VOC). סף החפיפה (IoU) נקבע ל-0.5, ועקביות התיוג אומתה באמצעות תיקוף צולב של שני אנשים. תמונות הקלט הותאמו באופן אחיד לגודל של 640 × 640 והועשרו באמצעות נתוני Mosaic. האימון בוצע באמצעות אופטימיזטור SGD עם קצב למידה ראשוני של 0.01, מומנטום של 0.9, דעיכת משקלים (weight decay) של 0.05 וגודל אצווה (batch size) של 32. האימון נמשך 20 תקופות (epochs), והשתמשה ב-cosine annealing כדי להתאים את קצב הלמידה.
כדי להעריך באופן יסודי את יעילות המודל, נעשה שימוש במגוון מדדי הערכה: דיוק ממוצע מרבי (mAP), מספר פריימים לשנייה (FPS) למדידת קצב עיבוד פריימי התמונה, דיוק (precision) להערכת נכונות התחזיות החיוביות, רגישות (recall) למדידת יכולתו של המודל לזהות חיוביים אמיתיים, ושטח תחת העקומה (AUC) לציון השטח תחת עקומת מאפייני תגובת המקלט (ROC), ובכך לשקף את יכולת הסיווג הכללית של המודל. נוסחאות החישוב מוצגות במשוואות (4), (5), (6), (7), (8), (9), (10), (11):
(4)
(5)
(6)
הסבר (Recall)
(7)
(8)
(9)
(10)
(11)
כאן, mAP@0.5 מציין את הדיוק הממוצע הממוצע (mean average precision) בסף IoU של 0.5; N הוא מספר הקטגוריות; פוספטאזה עישבית (Alkaline Phosphatase)i האם הדיוק הממוצע של ה- i-קטגוריה; ו-mAP@[0.5:0.95] הוא ה-mAP הממוצע שחושב על פני ספי IoU מ-0.5 עד 0.95. TP, FP, FNו- TN מייצגים את מספרי החיוביים האמיתיים, החיוביים השקריים, השליים השקריים והשליים האמיתיים, בהתאמה. פ הוא המספר הכולל של הפריימים שעובדו, T הוא זמן העיבוד הכולל, TPR הוא שיעור החיוביים האמיתיים (true-positive rate), ו- FPR הוא שיעור הפוזיטיביים המדוים.
עבור רכיב הזיהוי של YOLOv1, פונקציית ההפסד מוצגת במשוואה (12):
(12)
איפה Lקואורדינטות מציין את הסטייה בין הפריים החזוי לפריים האמיתי, $L_{conf}$ מודד את שגיאת הביטחון (confidence error) של הפריים החזוי, $L_{class}$ מודד את שגיאת חיזוי הקטגוריה, ו-$\lambda_{coord}$, $\lambda_{conf}$ ו-$\lambda_{class}$ הם מקדמי המשקל המשמשים לאיזון ההפסדים (losses) המתאימים.
ניתוח הנתונים ב-Table 1 מראה כי השיטה המוצעת משיגה mAP@0.5 של 0.91 ו-mAP@0.5:0.95 של 0.82, המייצגים שיפורים של 0.04 ו-0.04, בהתאמה, בהשוואה ל-YOLOv5. מדד ה-F1-score שלה הוא 0.935, הגבוה אף הוא מאלו של מודלי ההשוואה. מהירות הזיהוי היא 120 FPS, פי ארבעה מזו של Faster R-CNN, אך נמוכה מעט מזו של YOLOv10 ו-YOLOv1. מספר הפרמטרים הוא 6.7M, רק 1.5M יותר מ-YOLOv1, עם שיפור של 0.03 ב-mAP@0.5. בהשוואה ל-EfficientDet, בעל עלות חישובית דומה, הדיוק גבוה ב-0.06, בעוד שמספר הפרמטרים נמוך ב-56%. הנתונים מוכיחים כי מנגנון הקשב והמיזוג הרב-סביבתי (multi-scale fusion) שהוצגו משפרים ביעילות את דיוק הזיהוי של מטרות קטנות, ומשיגים איזון טוב בין מהירות לדיוק. לסיכום, השיטה המוצעת שלנו משיגה איזון בין דיוק הזיהוי למהירות. ה-mAP@0.5 גבוה ב-0.02 מזה של המודל השני בטיבו, ה-F1-score מגיע ל-0.935, ו-6.7M הפרמטרים מספיקים לפריסה מעשית. מנגנון הקשב והמיזוג הרב-סביבתי משפר את הזיהוי של מטרות קטנות ומסוות בסביבות מורכבות. המודל מאזן בין דיוק ליעילות, מה שהופך אותו למתאים לתרחישים של זמן אמת, כגון ניטור בטיחות תעשייתית. ראוי לציין כי כל מודלי ההשוואה משתמשים במשקולות מאומנות רשמיות, עם רזולוציית קלט אחידה של 640 × 640, סף NMS של 0.45 וסף ביטחון (confidence threshold) של 0.5.
| שיטה | mAP@0.5 | mAP@0.5:0.95 | מדד F1 | FPS | פרמטרים (M) |
| YOLOv5 | 0.87 | 0.78 | 0.89 | 130 | 7.1 |
| EfficientDet | 0.85 | 0.73 | 0.88 | 50 | 15.3 |
| RetinaNet | 0.82 | 0.68 | 0.85 | 45 | 37.6 |
| Faster R-CNN | 0.84 | 0.7 | 0.87 | 30 | 45.2 |
| YOLOv10 | 0.89 | 0.77 | 0.88 | 135 | 5.3 |
| YOLOv11 | 0.88 | 0.75 | 0.895 | 140 | 5.2 |
| שלנו | 0.91 | 0.82 | 0.935 | 120 | 6.7 |
טבלה 1: טבלת השוואה מקיפה של ביצועי המודלים. ניתוח הנתונים מראה כי השיטה המוצעת משיגה mAP@0.5 של 0.91 ו-mAP@0.5:0.95 של 0.82, המהווים שיפורים של 0.04 ו-0.04, בהתאמה, לעומת YOLOv5. מדד ה-F1-score שלה הוא 0.935, וגם הוא גבוה מאלו של מודלי ההשוואה. מהירות הזיהוי היא 120 FPS, פי ארבעה ממהירותו של Faster R-CNN, אך נמוכה במעט מזו של YOLOv10 ו-YOLOv11. מספר הפרמטרים הוא 6.7M, רק 1.5M יותר מ-YOLOv1, עם שיפור של 0.03 ב-mAP@0.5. בהשוואה ל-EfficientDet, בעל עלות חישובית דומה, הדיוק גבוה ב-0.06, בעוד שמספר הפרמטרים נמוך ב-56%. הנתונים מוכיחים כי מנגנון התשומת לב והמיזוג רב-הקשקיים (multi-scale fusion) שהוצגו משפרים ביעילות את דיוק הזיהוי של מטרות קטנות, ומשיגים איזון טוב בין מהירות לדיוק. לסיכום, השיטה המוצעת שלנו משיגה איזון בין דיוק הזיהוי למהירות. ה-mAP@0.5 גבוה ב-0.02 מזה של המודל השני בטיבו, ה-F1-score מגיע ל-0.935, ו-6.7M הפרמטרים מספיקים לפריסה מעשית. המיזוג רב-הקשקיים ומנגנון התשומת לב משפרים את הזיהוי של מטרות קטנות ומוסתרות בסביבות מורכבות. המודל מאזן בין דיוק ליעילות, מה שהופך אותו למתאים לתרחישים של זמן אמת, כגון ניטור בטיחות תעשייתית. ראוי לציין כי כל מודלי ההשוואה משתמשים במשקולות מאומנות מראש רשמיות, עם רזולוציית קלט אחידה של 640 × 640, סף NMS אחיד של 0.45 וסף ביטחון (confidence threshold) אחיד של 0.5.
איור 2 מספק ניתוח מעמיק של סוגי הזיהוי השגוי של המודל. ל-YOLOv1 + CNN יש את שיעור הזיהוי השגוי הנמוך ביותר ברקע (85 פעמים/10,0 פריימים), כאשר רוב הזיהויים השגויים התרחשו באובייקטים דומים (62 פעמים) ובסצנות עם הסתרה חלקית (48 פעמים). ניתוח עקומת ROC מצביע על כך שה-TPR של המודל הגיע ל-0.9 (AUC = 0.98) ב-FPR של 0.1, והמרווח הצר ביותר בין העקומות תומך באמינות גבוהה של ביטחון הזיהוי. תוצאות ניתוח אלו לא רק תומכות בביצועי המודל, אלא גם מספקות מפת דרכים טכנית ברורה לאופטימיזציה עתידית של זיהויים שגויים, במיוחד על ידי חיזוק יכולתו להבדיל בין אובייקטים דומים.

איור 2ניתוח שגיאות. ניתוח סוגי הזיהוי השגוי של המודל. לשילוב YOLOv1 + CNN יש את שיעור הזיהוי השגוי הנמוך ביותר של הרקע (85 פעמים ל-10,0 פריימים), כאשר מרבית הזיהויים השגויים התרכזו באובייקטים דומים (62 פעמים) ובסצנות עם הסתרות חלקיות (48 פעמים). ניתוח עקומות ROC מצביע על כך שה-TPR של המודל הגיע ל-0.9 (AUC = 0.98) ב-FPR של 0.1, והמרווח הצר ביותר בין העקומות תומך באמינות רמת הביטחון של הזיהוי. תוצאות ניתוח אלו לא רק תומכות בביצועי המודל, אלא מספקות גם מפת דרכים טכנית ברורה לאופטימיזציה עתידית של הזיהויים השגויים, ובמיוחד על ידי חיזוק יכולתו להבחין בין אובייקטים דומים. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.
איור 3 משווה את ביצועי המודל על פלטפורמות חומרה שונות. YOLOv1 + CNN משיג השהיה (latency) נמוכה במיוחד של 18 ms ביחידה לעיבוד טנזורים (TPU) של Edge, עם תנודה של ±2 ms בלבד, וצריכת חשמל הנשלטת ב-15 W. בדיקות תפוקה (throughput) מדגימות כי המודל משיג מהירות עיבוד של 70 FPS במכשירי מחשוב קצה מסוג Jetson Xavier, כאשר השהיית האחוזון ה-9 נשלטת בטווח של 50 ms. מדדי ביצועי הפריסה הללו מאפשרים לו להסתגל לצרכי הפריסה של פלטפורמות מחשוב שונות בתחומים תעשייתיים. ניתוח השגיאות מראה בנוסף כי המודל יכול לשמור על ביצועים יציבים בסביבות עם משאבים מוגבלים, מה שמעיד על הס کاربرיות ההנדסית שלו.

איור 3ביצועי פריסה. השוואה של ביצועי המודל על פלטפורמות חומרה שונות. YOLOv1 + CNN משיג השהיה (latency) נמוכה במיוחד של 18 מילי-שניות ב-Edge TPU (עם תנודה של ±2 מילי-שניות בלבד), וצריכת החשמל נשמרת ברמה של 15 וואט. בדיקות תפוקה (throughput) מדגימות כי המודל משיג מהירות עיבוד של 70 FPS במכשירי מחשוב קצה מסוג Jetson Xavier, כאשר השהיית האחוז ה-9 נשמרת בטווח של 50 מילי-שניות. מדדי ביצועי פריסה אלו מעידים כי המודל יכול להתאים לצרכי הפריסה של פלטפורמות מחשוב שונות בתחומים תעשייתיים. ניתוח השגיאות מראה עוד כי המודל יכול לשמור על ביצועים יציבים בסביבות עם משאבים מוגבלים, מה שמעיד על הסבילות ההנדסית שלו. אנא לחצו כאן כדי להציג גרסה מורחבת של איור זה.
איור 4 משווה את ההבדלים בביצועי הזיהוי של כל מודל לאורך שש קטגוריות מטרה. YOLOv1 + CNN השיג דיוק של 0.96 במשימת זיהוי קסדות בטיחות, ובכך עלה על מודל הייחוס ב-4 נקודות אחוז. התרשים המנוקט מעיד על כך שהמודל מראה תנודות ביצועים מינימליות בין הקטגוריות (±0.05), דבר המשקף את יכולות ההכללה שלו. מטריצת הבלבול, המוצגת כמפת חום, חושפת שיעור של 15% של זיהויים שגויים הדדיים בין האזור המסוכן לזרוע הרובוטית. ממצא זה מספק כיוון ברור לאופטימיזציה עתידית של המודל.

איור 4ניתוח זיהוי קטגוריות. השוואה של ההבדלים בביצועי הזיהוי של כל מודל בשישה קטגוריות מטרה. YOLOv1 + CNN השיג דיוק של 0.96 במשימת זיהוי קסדות בטיחות, ובכך עלה על מודל הייחוס ב-4 נקודות אחוז. תרשים הנקודות מעיד כי המודל מציג תנודות ביצועים מינימליות בין הקטגוריות (±0.05), דבר המשקף את יכולות ההכללה שלו. מטריצת הבלבול, המוצגת כמפת חום, חושפת זיהוי שגוי הדדי של 15% בין אזור מסוכן לבין זרוע רובוטית. ממצא זה מספק כיוון ברור לאופטימיזציה עתידית של המודל. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.
איור 5 מספק תיעוד מקיף של תהליך האימון עבור כל מודל. YOLOv1 + CNN מראה את קצב ההסגירה המהיר ביותר, כאשר ה-loss יורד ל-0.1 בתוך 30 epochs, והפער בין עקומת ה-mAP של קבוצת האימות לבין קבוצת האימון הוא בעקביות פחות מ-1%. ניתוח תרשים רצועות השגיאה מראה כי ה-mAP@0.5 הסופי של המודל בבדיקת אימות יציב ב-0.94 ± 0.01, וטווח תנודות הביצועים שלו הוא רק שליש מזה של RetinaNet. תוצאות אלו תומכות ביעילות של פרוטוקול האימון המשותף. המודל מראה יתרונות ביצועים בשלבים מוקדמים של האימון, מה שמעיד על כך שתכנון הארכיטקטורה שלו מאפשר לו ללמוד מאפיינים במהירות.

איור 5ניתוח תהליך האימון. תיעוד של תהליך האימון עבור כל מודל. YOLOv11 + CNN מציג את קצב ההתכנסות המהיר ביותר (הפסד יורד ל-0.1 בתוך 30 תקופות/epochs), והפער בין עקומת ה-mAP של קבוצת האימות שלו לבין קבוצת האימון הוא תמיד פחות מ-1%. ניתוח תרשים רצועות השגיאה מראה כי ה-mAP@0.5 הסופי של המודל בבדיקת אימות יציב ב-0.94 ± 0.01, וטווח תנודות הביצועים הוא רק שליש מזה של RetinaNet. תוצאות אלו תומכות ביעילות של פרוטוקול האימון המשותף. המודל מראה יתרונות בביצועים בשלבים המוקדמים של האימון, מה שמעיד על כך שעיצוב הארכיטקטורה שלו מאפשר לו ללמוד מאפיינים במהירות. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.
טבלה 2 מציגה תוצאות ביצועים כמותיות עבור מודלי זיהוי שונים בסביבות מורכבות. נתוני הבדיקה בתנאי תאורה סטנדרטיים ובשורה של תרחישים קיצוניים מראים ש-YOLOv1 + CNN שומר על ביצועים אופטימליים תחת כל התנאים. תחת תנאי תאורה סטנדרטיים, ה-mAP@0.5 של מודל זה הגיע ל-0.91, תוצאה טובה משמעותית מזו של YOLOv5 (0.87) ו-Faster R-CNN (0.84). עם ההידרות של תנאי הסביבה, ביצועי כל מודל יורדים במידה משתנה, אך YOLOv1 + CNN מראה את החוסן הסביבתי החזק ביותר: בתנאי תאורה נמוכה (< 50 lux), הביצועים יורדים ב-3% בלבד (ל-0.88), מה שטוב יותר מהפגיעה של 5% במודל ההשוואתי; בתרחישים עם הסתרה משמעותית (> 50%), ה-mAP שלו עדיין נשמר ב-0.78, והירידה בביצועים (13%) קטנה משמעותית מזו של YOLOv5 (15%) ו-Faster R-CNN (16%). תוצאות אלו מוכיחות כי YOLOv1 + CNN משפר את יכולת ההסתגלות של המודל לגורמים מורכבים, כגון שינויי תאורה והסתרות, באמצעות מנגנוני קשב ומיזוג תכונות משופרים, ובכך תומך ביישומים מעשיים בתרחישים תעשייתיים.
| תנאי בדיקה | YOLOv1 + CNN | YOLOv5 | Faster R-CNN | תנודה בביצועים |
| תאורה סטנדרטית | 0.91 | 0.87 | 0.84 | 0.01 |
| תאורה חלשה (< 50 lux) | 0.8 (-3%) | 0.82 (-5%) | 0.79 (-5%) | 0.02 |
| חסיאה חלקית (30%–50%) | 0.85 (-6%) | 0.80 (-7%) | 0.76 (-8%) | 0.03 |
| חסיאה כבדה (> 50%) | 0.78 (-13%) | 0.72 (-15%) | 0.68 (-16%) | 0.04 |
| טשטוש תנועה | 0.83 (-8%) | 0.7 (-10%) | 0.73 (-1%) | 0.05 |
טבלה 2: טבלת ניתוח כמותי של הסתגלות סביבתית. ביצועים של מודלי זיהוי שונים בסביבות מורכבות באמצעות ניתוח כמותי. נתוני בדיקה מתנאי תאורה סטנדרטיים ועד לתרחישים קיצוניים שונים מראים כי YOLOv1 + CNN שומר על הביצועים הגבוהים ביותר תחת כל תנאי הבדיקה. תחת תנאי תאורה סטנדרטיים, ה-mAP@0.5 של מודל זה הגיע ל-0.91, תוצאה טובה משמעותית מ-YOLOv5 (0.87) ומ-Faster R-CNN (0.84). עם ההידרות של התנאים הסביבתיים, ביצועי כל מודל יורדים בדרגות שונות, אך YOLOv1 + CNN מראה את החוסן הסביבתי החזק ביותר מבין המודלים שנבחנו: תחת תנאי תאורה נמוכה (< 50 lux), הביצועים יורדים ב-3% בלבד (ל-0.8), נתון טוב יותר מההפחתה של 5% במודל ההשוואתי; בתרחישים עם הסתרה חמורה (> 50%), ניתן עדיין לשמר את ה-mAP שלו ברמה של 0.78, והירידה בביצועים (13%) קטנה משמעותית מזו של YOLOv5 (15%) ושל Faster R-CNN (16%). תוצאות אלו מדגימות כי YOLOv1 + CNN משפר את יכולת ההסתגלות של המודל לגורמים מורכבים, כגון שינויי תאורה והפרעות של הסתרה, באמצעות מנגנון מיזוג תכונות ועיצוב קשב (attention design) משופרים, ובכך תומך ביישומים מעשיים בתרחישים תעשייתיים.
טבלה 3 מראה כי בניסוי זה נעשה שימוש באופטימייזר SGD, עם מומנטום של 0.9 להאצת ההתכנסות ודיכוי תנודות. נעשה שימוש בקצב למידה ראשוני של 0.01 עם cosine annealing, אשר דעך בהדרגה במהלך האימון כדי לדייק את האופטימיזציה. הוחל weight decay של 0.005 כדי להחיל רגולריזציית L2 ולהפחית overfitting. גודל batch של 32 איזן בין יעילות חישובית לבין יציבות הערכת הגראדיאנט. 20 תקופות אימון (epochs) הבטיחו התכנסות מספקת. הפרמטרים הותאמו למשימת זיהוי בשלב אחד, תוך איזון בין מהירות האימון לבין הדיוק.
| פרמטר | ערך |
| אופטימיזר | SGD |
| קצב למידה ראשוני | 0.01 |
| תנע | 0.9 |
| דעיכת משקלים (Weight decay) | 0.0005 |
| גודל סדרה | 32 |
| איפוקי אימון | 200 |
| תזמון קצב למידה | הסגירה קוסינוסית (Cosine annealing) |
טבלה 3: טבלת היפר-פרמטרים לאימון. בניסוי זה נעשה שימוש באופטימייזר SGD, עם מומנטום של 0.9 להאצת ההתכנסות ודיכוי תנודות. נעשה שימוש בקצב למידה ראשוני של 0.01 עם cosine annealing, שהפחית את הקצב בהדרגה במהלך האימון כדי לדייק את האופטימיזציה. הונהג weight decay של 0.005 כדי להחיל רגולריזציית L2 ולהפחית overfitting. גודל batch של 32 איזן בין יעילות חישובית לבין יציבות של הערכת הגרדיאנט. 20 תקופות אימון (epochs) הבטיחו התכנסות מספקת. הפרמטרים הותאמו למשימת זיהוי שלב אחד (single-stage detection), תוך איזון בין מהירות האימון לדיוק.
טבלה 4 מראה כי בשימוש ב-YOLOv1 כבסיס (baseline), ה-mAP@0.5 הוא 0.89. שילוב של היתוך רב-קנה מידה (multi-scale fusion) לבדו מפחית את הדיוק ל-0.8. הוספה רב-שכבתית של קשב ערוצים (channel attention) וקשב מרחבי (spatial attention) באופן רצופי משפרת את הדיוק ל-0.90 ו-0.89, בהתאמה. הדיוק המשולב של כל המודולים מגיע ל-0.91, שיפור של 0.02 לעומת הבסיס. הנתונים מראים כי קשב ערוצים משפר את הדיוק באופן ישיר, וכי הביצועים המשולבים של רב-קנה מידה וקשב הם האופטימליים.
| תצורה | mAP@0.5 |
| YOLOv1 (baseline) | 0.89 |
| + מיזוג רב-קנימי (Multi-scale fusion) | 0.8 |
| + רב-קנימי + תשומת לב לערוצים (channel attention) | 0.9 |
| + רב-קנימי + תשומת לב מרחבית (spatial attention) | 0.89 |
| מודול מלא (YOLOv1 + CNN) | 0.91 |
טבלה 4: טבלת בדיקת אבלציה. כאשר נעשה שימוש ב-YOLOv1 כבסיס (baseline), ה-mAP@0.5 הוא 0.89. הוספה של מיזוג רב-קנה-מידה (multi-scale fusion) בלבד מפחיתה את הדיוק ל-0.8. הוספה של קשב ערוצי (channel attention) או קשב מרחבי (spatial attention) לאחר מיזוג רב-קנה-מידה משפרת את הדיוק ל-0.90 ו-0.89, בהתאמה. הדיוק המשולב של כל המודולים מגיע ל-0.91, שיפור של 0.02 לעומת הבסיס. הנתונים מראים כי קשב ערוצי מניב רווחים גדולים יותר מאשר קשב מרחבי בהגדרה זו, וכי הביצועים המשולבים של מיזוג רב-קנה-מידה וקשב הם האופטימליים.
איור 6 מעריך באופן שיטתי את ביצועי המודל בסביבות קיצוניות. ה-mAP של YOLOv11 + CNN ירד ב-6% בלבד (ל-0.8) בתנאי תאורה נמוכים, ועדיין שמר על mAP של 0.78 (8% מעל למד הייחוס) בסצנות עם הסתרה משמעותית. תוצאות אלו מוכיחות כי המודל מפגין סתגלנות סביבתית, ומתמודד ביעילות עם שינויי תאורה נפוצים ובעיות הסתרה מקומית בייצור תעשייתי, ובכך תומך בפעולה יציבה של מערכת הזיהוי.

איור 6הסתגלות סביבתית. הערכה שיטתית של ביצועי המודל בסביבות קיצוניות. ה-mAP של YOLOv1 + CNN ירד ב-6% בלבד (ל-0.8) בתנאי תאורה נמוכים, ונותר ברמה של 0.78 (8% מעל למד הייחוס) בסצנות עם הסתרה משמעותית. תוצאות אלו מוכיחות כי המודל מפגין סתגלנות סביבתית, ומטפל ביעילות בשינויים נפוצים בתאורה ובבעיות של הסתרה מקומית בייצור תעשייתי, ובכך תומך בפעולה יציבה של מערכת הגילוי. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.
איור 7 משווה את ההבדלים בפיזור המאפיינים בין YOLOv1 לבין YOLOv1 + CNN עבור שישה סוגים של מטרות תעשייתיות באמצעות הפחתת ממדים ב-t-SNE. האיור משמאל מראה כי המאפיינים של מודל הבסיס YOLOv1 מציגים פיזור תוך-מעמדי משמעותי (מרחק תוך-מעמדי 2.34 ± 0.15), במיוחד ב"Danger Zone" (אדום) וב-"Vehicle" (סגול), שבהם קיימת חפיפה משמעותית, דבר העולה בקנה אחד עם שיעור זיהוי שגוי של 15% בקבוצה הניסויית 3. האיור מימין מראה כי ה-YOLOv1 + CNN המשופר מגביר משמעותית את הדחיסות התוך-מעמדית באמצעות מודול שיפור המאפיינים, ובכך מגדיל את המרחק הממוצע בין מרכזי האשכולות בתוך כל קטגוריה פי 1.8.

איור 7השוואת התפלגות תכונות ב-t-SNE. השוואה של הבדלי התפלגות המאפיינים בין YOLOv1 לבין YOLOv1 + CNN בשישה סוגי מטרות תעשייתיות באמצעות הפחתת ממדים ב-t-SNE. האיור השמאלי מראה כי המאפיינים של מודל הבסיס YOLOv1 מציגים פיזור תוך-מעמדי משמעותי (מרחק תוך-מעמדי 2.34 ± 0.15), במיוחד ב"אזור סכנה" (Danger Zone, באדום) וב"רכב" (Vehicle, בסגול) שבהם קיימת חפיפה ניכרת, דבר התואם את שיעור הגילוי השגוי של 15% בקבוצה הניסיונית 3. האיור הימני מראה כי מודל ה-YOLOv1 + CNN המשופר משפר משמעותית את הדחיסות התוך-מעמדית באמצעות מודול שיפור המאפיינים, והמרחק הממוצע בין מרכזי הצביריים בכל קטגוריה גדל פי 1.8. אנא לחץ כאן כדי לצפות בגרסה מוגדלת של איור זה.
איור 8 מאמת את תרומתו של כל מודול באמצעות ניסויי אבלציה סיסטמטיים. תוצאות האבלציה מראות כי הוספת תשומת לב לערוצים (channel attention) לאחר היתוך רב-קנה מידה מעלה את ה-mAP@0.5 ל-0.90, בעוד שהוספת תשומת לב מרחבית (spatial attention) מעלה את ה-mAP@0.5 ל-0.89. המודול המלא משיג את ה-mAP@0.5 הגבוה ביותר, 0.91. ויזואליזציה באמצעות מפת חום מראה כי מנגנון תשומת לב משולב יכול להגביר בו-זמנית את תגובת הגילוי למרכז האזור המסוכן (ערך אקטיבציה: +0.15) וליעדים קטנים בשוליים (+0.08). הנתונים הניסיוניים מדגימים כי להיתוך תכונות רב-קנה מידה ומנגנוני תשומת לב יש השפעה מצטברת, המאפשרת למודל לעמוד בדרישות זיהוי היעדים בקני מידה שונים.

איור 8ניסוי אבלציה מודולרי. אימות התרומה של כל מודול באמצעות ניסויי אבלציה (ablation) סיסטמטיים. תוצאות האבלציה מראות כי הוספת קשב ערוצי (channel attention) לאחר מיזוג רב-קנימי מעלה את ה-mAP@0.5 ל-0.90, בעוד שהוספת קשב מרחבי (spatial attention) מעלה את ה-mAP@0.5 ל-0.89. המודול המלא משיג את ה-mAP@0.5 הגבוה ביותר, 0.91. ויזואליזציה של מפת חום מראה כי מנגנון הקשב המשולב יכול להגביר בו-זמנית את תגובת הגילוי למרכז האזור המסוכן (ערך אקטיבציה: +0.15) ולמטרות קטנות בשוליים (+0.08). הנתונים הניסויים מדגימים כי למיזוג מאפיינים רב-קנימי ולמנגנוני קשב יש אפקט מצטבר, המאפשר למודל לעמוד בדרישות זיהוי המטרות במקשבים שונים. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.
זמינות נתונים:
תמונות גולמיות מלאות וזרמי וידאו מקו הייצור כפופים להגבלות סודיות תעשייתיות ואינם מפורסמים באופן פתוח. תיאור מערך נתונים משלים (קובץ משלים 1) מספק פרטים על רכישת מערך הנתונים, התפלגויות קטגוריות ותרחישים, מפרטי ההערות (annotations), נהלי בקרת איכות, חלוקת נתונים, עיבוד מקדים ונהלי הגברה (augmentation). מסגרת פסבדו-קוד ושחזור (קובץ משלים 2) מספקת זרימת עבודה ברמת פסבדו-קוד, תיאורי קונפיגורציה והנחיות לשחזור. ניתן לבקש מהמחבר המקשר תת-קבוצה אנונימית וחומרים תומכים נוספים למחקר אקדמי לא מסחרי, בכפוף להגבלות מוסדיות והגבלות סודיות.
קובץ משלים 1. תיאור מערך הנתונים המשלים. קובץ זה מתאר את פרוטוקול רכישת הנתונים, את כיסוי התרחישים, את התפלגות המחלקות, את מפרטי האנוטציה, את נהלי בקרת האיכות, את חלוקת הנתונים לאימון/תיקוף/בדיקה, את עיבוד המקדם ואת נהלי ההרחבה. אנא לחצו כאן להורדת קובץ זה.
קובץ משלים 2. פסאודו-קוד ומסגרת לשחזור. קובץ זה מספק את זרימת העבודה ברמת הפסאודו-קוד ופרטי הגדרה עבור עיבוד מקדים, אימון, הערכה ופריסה, ומתאר הגבלות על חומרי גלם של צילומי תעשייה וגישה לחומרי עזר. אנא לחצו כאן להורדת הקובץ.