$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
מחקר זה לא כלל נבדקים אנושיים, בעלי חוליות או רקמות מפוקחות; לכן, לא נדרשה אישור אתי או אישור ועדת ביקורת מוסדית. מערך הנתונים ששימש במחקר זה התקבל מחברת Longian Tobacco Industry Co., Ltd. תמונות נאספו מחמש אצולות ייצור עצמאיות במשך תקופה של שלושה חודשים. הדגימה בוצעה באקראי בזמנים שונים ביום (בוקר, צהריים ולילה) כדי ללכוד שינויים טבעיים בתנאי הייצור. מערך הנתונים כולל דגימות המכסות טווח לחות טבק של 12%–18%, מהירויות חיתוך של 1.5, 2.0 ו-2.5 מ'/שנייה, ולחצי נשיאה פנאומטיים של 0.4, 0.5 ו-0.6 מגה-פסקל, ובכך מבטיחים כיסוי של תנאי ייצור טיפוסיים.
רכישת והגדרת מאגרי נתונים
תצורת חומרה
מערכת רכישת התמונה הוגדרה כך שתעמוד בדרישות לזיהוי הסדר של טבק חתוך בסיגריות שמחממות ולא נשרפות. הוא כלל בעיקר מצלמה תעשייתית, עדשה תעשייתית, מקור אור ראייה ויחידת בקרה תעשייתית. המערכת השתמשה במצלמת תעשייה MV-CH120-10GC בשילוב עם עדשת תעשייתית MVL-KF0818M-12MP לצילום תמונות באיכות גבוהה של אזור הטבק החתוך על פני מוטות הסיגריות המחולקים. המצלמה הוצבה במרחק עבודה של 150 מ"מ משטח מוט הסיגריה. מקור האור של רצועת LED הותקן קואקסיאלית עם המצלמה במרחק של 80 מ"מ מהמטרה, בזווית פגיעה של 45°. הדמיה בוצעה בתוך מארז שחור-מט כדי למנוע הפרעות אור סביבתי. המארז הוא מכסה מנוע אלומיניום צבוע בשחור מט עם מידות פנימיות של 400 מ"מ (רוחב) × 350 מ"מ (עומק) × 300 מ"מ (גובה), ומשטחים פנימיים מצופים בצבע שחור-מט (החזרות < 5% ב-550 ננומטר) כדי למזער השתקפויות פנימיות ולהבטחת תנאי תאורה עקביים. כדי להבטיח איכות ועקביות של הדמיה, נעשה שימוש במקור אור MV-LRDS-H-95-30-W להקמת סביבת תאורה יציבה, תוך מזעור השפעת שינויים באור הסביבה על הפקת קווי המתאר של חוטי הטבק וזיהוי הכיוון. התמונות שנרכשו התקבלו, עובדו ונשמרו על ידי מחשב תעשייתי PC1010-AX360, שביצע גם אלגוריתמים לזיהוי מאוחר, חישוב תוצאות ופלט ממשק. לא בוצעה כיול או תיקון עיוות מפורש במצלמה, שכן שילוב המצלמה והעדשה התעשייתי הראה עיוות רדיאלי זניח (פחות מ-0.5% בקצוות התמונה) בשדה הראייה של 896 × 1600 פיקסלים. המצלמה ומקור האור הותקנו בקשיחות על פריים קבוע כדי להבטיח יציבות מיקום במהלך צילום התמונה. עוצמת מקור האור נשמרה ברמה קבועה לאורך כל תהליך קבלת התמונה. שדה הראייה עוצב כך שיכסה במלואו את אזור הטבק החתוך החשוף בתוך מבנה התמיכה מפלדה.
הגדרת פרמטר מצלמה
רכישת התמונה הופעלה, והתמונות צולמו לאחר שהדוגמה הונחה וחולקה ואז נשמרה בפורמט JPG. כדי להבטיח עקביות של התמונות שנרכשו, פרמטרי הרכישה נקבעו ידנית. באופן ספציפי, רזולוציית התמונה הוגדרה ל-896 ×-1600. זמן החשיפה נקבע בתחילה ל-4000 מיקרושניות וניתן היה לכוונן אותו בטווח של 3000 עד 6000 מיקרושניות בהתאם לבהירות באתר. כל כוונון הפרמטרים בוצע כאשר הדגימה הונחה בתוך המיכל השחור-מט שתואר לעיל, בתנאי תאורה מבוקרים לחלוטין. לא הייתה אור סביבתי חיצוני במהלך הכיוון, שכן מערכת ההדמיה פעלה בסביבה סגורה לחלוטין עם אורות החדר כבויים. הגיין הוגדר בתחילה ל-2 dB ונשלט בטווח של 0 עד 6 dB בהתבסס על רמות הרעש. ערך הגמא הוגדר ל-0.8, ואיזון הלבן הוגדר עם פרמטרים קבועים. פרמטרי הרכישה הסופיים הוגדרו כך: זמן חשיפה = 4000 מיקרושניות, רווח = 2 dB, גאמה = 0.8, מצב איזון לבן = קבוע, רזולוציית תמונה = 896 × 1600 פיקסלים, ופורמט תמונה = JPG. לאיזון לבן, נעשה שימוש במצב פרמטר קבוע. הכיול בוצע באמצעות כרטיס ייחוס לבן סטנדרטי (X-Rite ColorChecker) שהוצב במיקום הדגימה. הרווחים בערוץ האדום והכחול הותאמו עד שערכי ה-RGB של כרטיס הלבן הושוו בתוך סטייה של ±2%. לאחר הכיול, פרמטרי איזון הלבן נקבעו כך: רווח אדום = 1.2, רווח ירוק = 1.0 (קבוע), ורווח כחול = 1.5. הכיול בוצע פעם אחת לאחר כל הפעלה של מערכת או כאשר מקור האור הראה סימני הזדקנות שעלולים לגרום לסטיית טמפרטורת הצבע. הגדרות אלו סייעו להבטיח גבולות ברורים של טבק חתוך והפצת בהירות יציבה, תוך עמידה בדרישות העיבוד לסגמנטציה של חוטי טבק, חישוב כיוון וניתוח סדר.
אוסף תמונות
איסוף תמונות התמקד באזור הטבק החתוך שנחשף על פני השטח של מוטות סיגריות לחום-לא-שריפה לאחר החתכה. במהלך האיתור, דגימת הסיגריה נמסרה תחילה לתחנת הבדיקה, שם הונחו ונקבעו על ידי מנגנון מיקום הדגימה. מנגנון המיקום מורכב מהדק פנאומטי עם מדריכי יישור בצורת V. המערכת משיגה חזרתיות מיקומית של ±0.5 מ"מ לאורך 1000 מחזורים רצופים, כפי שמאומת על ידי מדידות חיישן תזוזה בלייזר. בהמשך, חומר העטיפה החיצוני חולק באופן יציב על ידי מנגנון החיתוך, וחשף במלואו את הטבק החתוך בשדה הראייה של מערכת הראייה. השתמשו בלהב עגול מסתובב (קוטר 50 מ"מ, עובי 0.3 מ"מ, חומר פלדה מהירה במיוחד). עומק החיתוך נקבע ל-1.5 מ"מ עם מהירות סיבוב של 300 סל"ד. עקביות החיתוך נמדדה באמצעות משוב מקודד ליניארי, תוך שמירה על שונות בעובי של ±0.05 מ"מ. לאחר שמיקום הדגימה היה יציב ואזור ההדמיה הוגדר בבירור, בוצעה רכישת תמונה באמצעות המצלמה התעשייתית תחת תאורה יציבה שסיפקה מקור האור. בסך הכל נאספו 634 תמונות; תמונות טיפוסיות מוצגות באיור 1. מערך הנתונים כולל שלוש רמות צפיפות טבק (נמוכה, בינונית, גבוהה; כ-180, 220 ו-260 מ"ג/סמ"ק), כיווני חוטים בטווח של −180° עד 180°, ותנאי תאורה הנעים מתאורה רגילה ועד תנאי קצה בתאורה נמוכה. האור נמדד באמצעות מד לוקס דיגיטלי מכויל (TA8133, דיוק ±3%) כאשר החיישן ממוקם במיקום משטח הדגימה. טווח התאורה הרגיל הנמדד הוא 200–800 לוקס, המסופק על ידי מקור האור בצורת LED הרצועה בתוך מכסה המנוע הסגור, ללא דליפת אור סביבתי. הערך הנמוך (כ-200 לוקס) מייצג מצב קצה שנוצר על ידי עמעום מקור האור להערכת עמידות המודל. בנוסף, חסימה חלקית של חוטי טבק (הנעים בין 10% ל-50%) קיימת בכ-30% מהתמונות. וריאציות אלו משקפות גיוון אמיתי בקווי הייצור.

איור 1. תמונות גולמיות מייצגות של טבק חתוך שנרכש על ידי מערכת הראייה. (a–h) דוגמאות מייצגות לתמונות גולמיות של טבק חתוך שצולמו בתנאי שדה תעשייתי באמצעות מערכת רכישת התמונה. התמונות התקבלו ברזולוציה של 896 ×-1600 פיקסלים תחת תאורה מבוקרת באמצעות מקור אור רצועה כדי להבטיח בהירות אחידה ולהפחתת הפרעות סביבתיות. תמונות אלו ממחישות שונות בהתפלגות, בצפיפות ובכיוון של חוטי הטבק לפני עיבוד המודלים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
הערות תמונה
באמצעות כלי הקוד הפתוח LabelImg, קופסאות הגבול צוירו סביב תכונות תמיכה של טבק ופלדה שנחתכו לעין. הזווית הנכונה הוקצתה כתווית לכל קופסת גבול. הציר האופקי (0°) הוגדר ככיוון ימינה המקביל לקצה התחתון של התמונה. לכל חוט טבק, פונקציית מדידת הזווית של כלי ההערות שימשה לשרטוט קו לאורך הציר הראשי של החוט. הזווית נרשמה כזווית בין ציר זה לייחוס אופקי (טווח: −180° עד 180°). הערות נשמרו בפורמט זיהוי חד-שלבי סטנדרטי, כאשר קובץ TXT אחד התואם לכל תמונה. כל קובץ .txt מכיל שורות המעוצבות כגובה class_id x_center y_center רוחב. הקואורדינטות מנורמלות ל-[0,1] ביחס לממדי התמונה. מחלקה 0 = רצועת טבק, מחלקה 1 = תמיכה מפלדה. תווית הזווית מאוחסנת כעמודה שישית בקובץ .txt ההערות, ומצורפת לאחר חמשת שדות YOLO הסטנדרטיים. הפורמט המדויק לכל שורה הוא: class_id x_center y_center רוחב זווית גובה. ערך הזווית נשמר במעלות כמספר נקודה צפה הנע בין −180.0 ל-180.0, עם שתי נקודות עשרוניות (למשל, 45.75). שורת דוגמה: 0 0.5230 0.4170 0.0850 0.0620 38.25.
בקרת איכות
מעריך שני סקר 20% שנבחרו באקראי מהתמונות המוערות. הבחירה האקראית בוצעה באמצעות פונקציית random.sample() מספריית Python random עם זרע אקראי קבוע של 2024. נוצרה רשימה של כל שמות קבצי התמונה, ו-20% מהתמונות נדגמו ללא החלפה באמצעות מחולל המספרים האקראיים הזורעים הזה, מה שהבטיח בחירה חוזרת לאורך פרוצדי בקרת איכות חוזרים. כל אי-התאמות נדונו ונפתרו, תוך שמירה על עקביות בתיוג. ההתאמה בין המפרשים הוערכה באמצעות סטייה זוויתית: ההפרש המוחלט הממוצע בין תוויות הזווית של שני המפרשים היה 2.8° (סטיית תקן = 1.5°). נבדקו והתיישבו הערות עם סטייה >5°.
מודל רגרסיה חד-שלבי לזיהוי סדר טבק חיתוך
זיהוי הסדר של יישור הטבק החיתוך הוא קריטי לשיפור תהליך הייצור ואיכות המוצר הסופי בייצור סיגריות. עם זאת, משימת בדיקה זו מתמודדת עם מספר אתגרים, כולל טבק חתוך חופף, גודל מטרות קטן ותאורה לא אחידה, שכולם פוגעים בדיוק הגילוי והעמידות. מודל רגרסיה חד-שלבי משופר המבוסס על YOLOv11n משמש לזיהוי מקוון של סדר טבק חתוך. המסגרת המוצעת מזהה במדויק את המאפיינים המורפולוגיים של טבק חתוך במהלך יצירת מוט הסיגריות, ומאפשרת זיהוי אמין של סדירות היישור תוך שיפור הדיוק, החוסן ויכולת העיבוד בזמן אמת. התצורה הכוללת של מסגרת הרגרסיה החד-שלבית המוצעת מוצגת באיור 2.

איור 2. הארכיטקטורה הכוללת של מודל הרגרסיה החד-שלבי המוצע. התרשים ממחיש את מבנה הרשת המלא, כולל עמוד השדרה, הצוואר וראש הגילוי. עמוד השדרה מחלץ תכונות רב-קניות, ומשלב מודולי דגימה אינטראקטיבית מרובת תדרים (MFID) לשימור מידע על תכונות. הצוואר משלב תכונות באמצעות אסטרטגיית מיזוג משלים משולש (TCF) לשיפור הייצוג הרב-רמטי. ראש הזיהוי מאמץ את מודול DynamicHead, שמשלב מנגנוני קשב מודע לקנה מידה (πL), מודעת למרחב (πS) ומודע למשימה (πC) לשיפור ביצועי לוקליזציה וסיווג. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
מודול דגימת מידע רב-תדרית (MFID)
ברשת עמוד השדרה של YOLOv11, פעולה קונבולוציונית בצעד של 2 מבצעת דגימה קטנה על ידי דילוג על פיקסלים. תהליך זה מבטל ישירות חצי מהמידע המרחבי, מה שמוביל לאובדן פרטים בתדר גבוה (למשל, קצוות ומרקמים של עצמים קטנים) ואובדן מידע משמעותי למטרות קטנות. יתרה מזאת, פעולות האיגוד המקסימלי והממוצע-איגוד בעמוד השדרה גם משליכות מידע מפורט בתוך אזורי האובייקט, תכונות חלקות ומכניסות רעש, שכולם משפיעים לרעה על למידת התכונות.
כדי להתמודד עם סוגיות אלו, מוצג מודול MFID, בהשראת מושג הפירוק היררכי של גל15,16. מודול זה מפרק תחילה תכונות לשני חלקים משלימים באמצעות טרנספורמציית גל האר: מידע רקע בתדר נמוך, המשפר את הסיווג, ופרטים בתדר גבוה עשירים בקצוות ומרקמים, המשפרים זיהוי מטרות קטנות. כדי לחזק עוד יותר את התפיסה של מטרות קטנות, מודול MFID משלב שני ענפים נוספים: ענף מקסימום פולינג שמנצל אי-שינוי תרגום לשימור תכונות מדויקות של מטרות קטנות, וענף קונבולוציה מדורגת המשתמש בפרמטרים ללמידה להשגת יכולת ייצוג חזקה יותר והרכב מידע עשיר יותר. באמצעות מבנה רב-ענפי זה, מודול ה-MFID שומר על מידע מרחבי ותדר מלא יותר במהלך דגימת הורדה. הארכיטקטורה של מודול MFID מוצגת באיור 3.

איור 3. מבנה מודול MFID. מודול ה-MFID מפריד את תכונות הקלט לרכיבים בתדר נמוך וגבוה באמצעות טרנספורמציית גל האר לשימור מידע מבני קריטי במהלך דגימת הורדה. HLL מציין את רכיב הקירוב בתדר נמוך, בעוד HLH, HHL ו-HHH מייצגים רכיבי פרטים בתדר גבוה בכיוונים אופקיים, אנכיים ואלכסוניים, בהתאמה. הסמל 2↓ מציין דגימה כפולה. מפות תכונות ממספר ענפים משולבות באמצעות מנגנוני שרשור ושער כדי לשפר את ייצוג התכונות. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
במהלך דגימת ההורדה, התמונה מפורקת באמצעות טרנספורמציית גל האר, שאומצה בשל פשטותה ויעילותו בפירוק תכונות בתדר נמוך וגבוה, מה שהופך אותה למתאימה למשימות גילוי בזמן אמת. HL ו-HH מסמנים את מסנני הפירוק במעבר נמוך ומעבר גבוה, בהתאמה, ומשמשים להפקת מידע בתדר נמוך וגבוה מהתמונה. פונקציית בסיס הגל ופונקציית הקנה מידה עבור טרנספורמציית האר חד-רמתית חד-ממדית מוגדרות באמצעות משוואה 1 כך:
(1)
פונקציית הבסיס של האר מוגדרת באמצעות משוואה 2 כך:
(2)
כאן, פרמטרים j ו-k מציינים את מקדם הסקיילינג ואת כמות הזיזמה של פונקציית בסיס האר, בהתאמה. באופן ספציפי, פונקציית הבסיס האר מסדר אפס מוגדרת באמצעות משוואה 3 כך:
(3)
באיור 3, הסמל 2↓ מציין דגימה כפולה. פירוק גל האר דו-רמתי מניב ארבעה רכיבים: קירוב בתדר נמוך (HLL) ורכיבי הפרטים בתדר גבוה בכיוונים אופקיים (HLH), אנכי (HHL) ואלכסון (HHH). רכיב HLL נושא מידע על קווי מתאר, רקע וגלובלי, בעוד שהרכיבים בתדר גבוה (HLH, HHL ו-HHH) לוכדים את הקצה, המרקם והמאפיינים הדקים.
הרכיבים בתדר גבוה HLH, HHL ו-HHH שמתקבלים לאחר דגימה כפולה מחוברים על ידי פעולת Concat, ובכך משלמים את המידע המפורט הרב-כיווני ליצירת המידע
המפורט בתדר גבוה משולב, כפי שמוצג במשוואה 4.
(4)
בהמשך, מיזוג מידע משני מתבצע על ענף המקסימום איגוד כדי לשלב תכונות מפורטות עם תכונות גלובליות, וכך ליצור מידע
משוחזר , כפי שמוצג במשוואה 5, הכוללת סט רחב יותר של תכונות בולטות ומשתמשת מחדש במידע מפורט בתדר גבוה לשיפור ייצוג התכונות.
(5)
לאחר מכן, נעשה שימוש במנגנון שער לוויסות דינמי של זרימת המידע, והוא
מנוצל להכוונת זיהוי תכונות יעד קטנות בתוך ה-
, תוך שמירה על תכונות שימושיות תוך דיכוי הפרעות רעש חסרות תועלת מובנות. מנגנון השער מוגדר כך: gating(x) = Linear_2(ReLU(Linear_1(x))), כאשר Linear_1 מפחית את ממד הערוץ בפקטור הפחתה של 4, Linear_2 מחזיר אותו לממד הערוץ המקורי. הפלט של מנגנון השער עובר דרך הפעלה סיגמואיד ליצירת משקלי מודולציה בטווח [0,1]. הפרמטרים הניתנים ללמידה כוללים את מטריצות המשקל ומונחי ההטיה של שתי השכבות הליניאריות, אשר מאותחלים באמצעות אתחול אחיד. דבר זה מבטיח שמידע מפורט וקריטי על תכונות מאוזן ומנוצל כראוי, ומניב תכונה
סופית מפורטת כפי שמוצג במשוואה 6.
(6)
לבסוף, המידע על דגימת צעד-קונבולוציה, וקטור בתדר נמוך, והתכונה המפורטת הסופית מחוברים באמצעות Concat כדי להרחיב את האינטראקציה של דגימת הקטנה על פני ממדים ותחומי תדרים רבים, כפי שמוצג במשוואה 7.
(7)
שלבי פעולה ויישום
הגדרת מודול
מודול PyTorch מותאם אישית בשם MFID צריך להיות מוגדר בתוך קבצי הגדרת המודל של הפרויקט. המימוש של מודול זה מורכב מארבעה מסלולים מקבילים: (1) טרנספורמציית ויבלט: פירוק דו-רמתי מוחל על מפת תכונות הקלט באמצעות מסנני גל האר מוגדרים מראש, היוצר רכיב קירוב בתדר נמוך ורכיבי פרטים בתדר גבוה בכיוונים אופקיים, אנכיים ואלכסוניים, ולאחר מכן שלושת הרכיבים בתדר גבוה מחוברים; (2) איגוד מקסימלי: מקסימום-איגוד מוחל על הקלט לשימור תכונות בולטות; (3) קונבולוציה מקוטעת: דגימה סטנדרטית מתבצעת דרך שכבה קונבולוציונית עם צעד של 2; (4) שחזור תכונות והיתוך: ראשית, המידע בתדר גבוה המתקבל מהטרנספורם של הגל מתמזג עם התכונות מענף האיגוד המקסימלי; בהמשך, מנגנון שער המונחה על ידי מידע בתדר נמוך משמש לסינון תכונות עדינות; לבסוף, מאפיינים מעובדים, רכיבים בתדר נמוך ויציאת קונבולוציה מדורגת מחוברים לקבלת מפת התכונות הסופית שנדגמה למטה.
עריכת קובץ קונפיגורציה
קובץ הקונפיגורציה של מודל הבסיס (config.yaml) צריך להיפתח. כל המקרים של מודולי דגימה סטנדרטיים הן ברשת עמוד השדרה והן ברשת הצוואר צריכים להיות מזוהים באופן שיטתי. כל כניסת מודול דגימה קטנה מזוהה צריכה להיות מוחלפת במודול MFID.
מוטיבציה עיצובית
מודול ה-MFID נועד לצמצם אובדן מידע בפעולות דגימה רגילה, מה שמזיק במיוחד לזיהוי עצמים קטנים. המושג המרכזי שלו מושפע מפירוק היררכי של גל קטן. על ידי הפרדה מפורשת של מידע גלובלי בתדר נמוך ממידע מפורט בתדר גבוה בתמונה ועיבודם בהתאם, המודול מבטיח שתכונות טקסטורה וקצוות קריטיות נשמרות במהלך דגימת ההורדה. השילוב של ענפי מקסימפולינג וקונבולוציה צעדיים לוכד ומשלימה תכונות מנקודות מבט משלימות—במיוחד, אינווריאנטיות תרגום לעומת ייצוג ללמידה. באמצעות מיזוג רב-ענפי, המודול מספק לשכבות רשת הבאות ייצוג תכונות רב-תדרים אינפורמטיבית ועמידה יותר. כל הפרמטרים האדריכליים הלא מוגדרים ותצורות השכבות עוקבים אחרי הגדרות ברירת המחדל של מסגרת YOLOv11n בתוך PyTorch.
מודול מיזוג משולש (TCF)
בשלב מיזוג תכונות הצוואר בארכיטקטורת הרשת YOLOv11, בדרך כלל נעשה שימוש בפעולת שרשור פשוטה למיזוג מפות תכונות בקנה מידה זהה. עם זאת, לגישה ישירה זו יש מגבלות ברורות: ראשית, היא אינה מתפשרת במלואו בהבדלים סמנטיים בין תכונות ברמות שונות; שנית, היעדר מידול מפורש של קורלציות בין-ערוצים הופך תכונות קטנות לנטייה לדילול או אובדן במהלך המיזוג, ובכך פוגע בביצועי הגילוי. כדי להתמודד עם בעיות אלו, הוצגה שיטת היתוך אינטראקטיבית יותר, הנקראת מודול TCF,17. שיטה זו עושה שימוש באסטרטגיית מיזוג פרוגרסיבית רב-רמתית שמכוונת את זרימת המידע לעבר גילוי מטרות קטנות באמצעות העברה חוצת שכבות. הוא גם משלב פעולות לא ליניאריות נוספות לחקר מידע עמוק ברמה גבוהה בקני מידה, ובכך משפר את המיזוג של תכונות רב-קניות. בניגוד למודולים קונבנציונליים המתבססים על חיבור פשוט או היתוך ממוצע, TCF מאמץ גישה של מיזוג משוקלל. דבר זה מאפשר לו ללמוד מידע מפורט באופן אדפטיבי בכל רמה, לייעל באופן דינמי מסלולי חילוץ מידע, ולהתמקד בתכונות המובחנות ביותר, ובסופו של דבר לשפר את דיוק האיתור. הארכיטקטורה של מודול TCF מוצגת באיור 4.

איור 4. מבנה מודול TCF. מודול TCF מבצע מיזוג תכונות רב-רמתי בשכבות רדודות, אמצעיות ועמוקות כדי לשפר את הייצוג של מטרות קטנות. P מייצג מפות תכונות קלט ברמות שונות. Conv מציין פעולות קונבולוציה, Upsample מציין דגימת עלייה בתכונות, ו-AdaptiveAvgPool מייצג איגוד ממוצע אדפטיבי. המודול משלב תכונות מכויילות באמצעות מיזוג משוקלל ואינטראקציה בין שכבות לשיפור השלמה סמנטית ומרחבית של תכונות. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
במשימת זיהוי האובייקטים, המידע הכלול בתכונת השכבה העמוקה Pi+1 ותכונה השכבה הרדוד Pi-1 שונה באופן משמעותי. כדי לשפר את המיזוג של מידע חוצה שכבות, P i בשכבה האמצעית מוצגת כשכבת מיזוג התכונות הסופית כדי לאזן את ההבדלים בין מידע תכונה ברמות שונות.
ראשית, מידע הקלט של השכבות הרדודות, האמצעיות והעמוקות מעובד באמצעות פונקציית ההפעלה של סיגמואיד ליצירת תכונות
משוקללות ,
, ו
-, אשר מחזקות תכונות מפתח ומחלשות תכונות מיותרות, כפי שמוצג במשוואה 8.
(8)
שנית, מידע הקלט של השכבות הרדודות, האמצעית והעמוקה מוכפל לפי אלמנט בתכונות המשוקלות הממופות ליצירת תכונות
מכויילות ,
, ו
-, כפי שמוצג במשוואה 9. חשיבות התכונות מותאמת דינמית באמצעות מנגנון תשומת הלב של המשקל, וכך מושגת בחירה וכיול מחדש של תכונות אדפטיבית.
(9)
בשלב ההיתוך של תכונות השכבה האמצעית, שני ענפי משקל הפוך מנוצלים כדי להתמזג עם תכונות השכבה הרדודה והעמוקה המכוילות, בהתאמה, ומסננים את המידע המפורט השגוי שנגרם מרעש בתכונות השכבה הרדודה ואת המידע הסמנטי המוטה בתכונות השכבה העמוקה. בהמשך, המידע הרב-ענפי משולב, והתכונות המקוריות, התכונות המכויילות והאינטראקטיביות של שכבה זו, כמו גם תכונות השכבה הרדודה והשכבה העמוקה הכוילת, מתאחדות יחד. זה משיג שימור והשלמה של מידע על תכונות רב-קניות, מפחית את בעיות אובדן מידע מטרות קטנות ושגיאות, ולבסוף מניב תכונות
מאוחות בשכבה האמצעית , שמנוסחות באמצעות משוואה 10 כך:
(10)
הקשרים בין השכבה הרדודה, השכבה העמוקה והאמצעית נקבעו בנפרד, כפי שמוצג במשוואות 11 ו-12.
(11)
(12)
לבסוף, הפלטים של שלושת מסלולי המיזוג התכונתיים מחוברים באמצעות פעולת Concat כדי לשמור על עצמאות התכונות של כל מסלול בנפרד. המידע המרכזי מכל מסלול נלמד דינמית בהתבסס על המשקלים α, β ו-γ, המוגדרים כפרמטרים סקלריים ללמידה, מאותחלים ל-1.0 ומותאמים באמצעות התפשטות אחורית במהלך האימון, מה שמאפשר איזון דינמי של תרומות ממסלולי תכונה רדודים, בינוניים ועמוקים. יתרה מזאת, פעולות קונבולוציונליות משמשות לאיסוף מידע הקשרי, ביטול תגובות גבולות תכונות לא עקביות הנגרמות משרשור בין-שכבתי, ואופטימיזציה של רכישת וייצוג מדויק של מידע מפורט למטרות קטנות. התהליך מנוסח באמצעות משוואה 13 כדלקמן:
(13)
שלבי פעולה ויישום
הגדרת מודול
מודול PyTorch מותאם אישית בשם TCF צריך להיות מוגדר בתוך קבצי הגדרת המודל של הפרויקט. מודול זה מקבל כקלט את מפות התכונות בשכבה רדודה, אמצעית ועמוקה שהופקו משלבים שונים של רשת עמוד השדרה. זרימת העיבוד הפנימית שלו מורכבת משלושה שלבים עיקריים: (1) כיול תכונות: פונקציית הסיגמואיד מוחלת על כל אחת משלוש שכבות התכונה הנכנסות ליצירת מפות משקל, אשר מוכפלות לאחר מכן לפי אלמנט עם מפות התכונות המקוריות כדי להעצים תכונות מרכזיות תוך דיכוי תכונות מיותרות; (2) היתוך אינטראקטיבי: בשלב המיזוג של תכונות השכבה האמצעית, שני ענפי משקל הפוך מוכנים למיזוג עם תכונות השכבה הרדודה והעמוקה המכויילות, בהתאמה, ומסננות מידע מפורט שגוי שנגרם מרעש בתכונות השכבה הרדודה ומידע סמנטי מוטה בתכונות השכבה העמוקה; (3) אגרגציה מרובת נתיבים: התכונות המקוריות, התכונות המכויילות, התכונות האינטראקטיביות ותכונות הממוזגות עם מידע רדוד ועמוק משולבות, ולאחר מכן מופעלות פעולות קונבולוציונליות כדי לבטל תגובות גבול תכונות לא קוהרנטיות הנגרמות משרשור בין שכבות, ובסופו של דבר מייצרות תכונות מאוחות עשירות במידע רב-קנה מידה.
עריכת קובץ קונפיגורציה
קובץ קונפיגורציית המודל (config.yaml) צריך להיפתח. יש למקם את מקטעי מיזוג התכונות ברשת הצוואר — ובפרט, השכבות שבהן תכונות משלבים שונים של רשת עמוד השדרה מאוחדות. במיקומים אלו, יש להחליף את שכבות פעולות החיבור הפשוטות המקוריות בקריאה למודול TCF, כדי להבטיח שקלטי המודול מחוברים נכון לתכונות הרדודות, האמצעיות והעמוקות המתאימות.
מוטיבציה עיצובית
עיצוב מודול TCF מונע מהאתגרים של פערי מידע ואובדן מידע במהלך מיזוג תכונות. תכונות רדודות עשירות בפרטים אך מכילה רעש משמעותי, בעוד שתכונות עמוקות מציגות סמנטיקה חזקה אך רזולוציה נמוכה. כדי להתמודד עם זה, מודול TCF מציג תכונה בשכבה האמצעית כמאזן מידע ומשלב מסלולי כיול, אינטראקציה ואגרגציה מתוכננים בקפידה כדי למקסם את היתרונות המשלימים של תכונות חוצות רמות. המוטיבציה הבסיסית היא להקים מנגנון מיזוג יעיל יותר, המסוגל להעריך באופן דינמי את חשיבות התכונות בכל רמה ולשלב מידע באופן סלקטיבי. כתוצאה מכך, הוא מייצר ייצוג תכונות איכותי לראש הגילוי הבא, עשיר בפרטים ובמידע סמנטי, מה שהופך אותו למתאים במיוחד לזיהוי אובייקטים קטנים.
מודול DynamicHead
רכיב ראש הזיהוי משרת את המטרה הבסיסית של ביצוע זיהוי אובייקטים רב-קנה מידה על ייצוגים של תכונות שנוצרות על ידי רשתות עמוד השדרה ומיזוג התכונות. תהליך זה מאפשר מיקום מרחבי מדויק של עצמים שזוהו, הקצאה קטגורית והערכת אמינות של תחזיות קופסאות גבולות. בהינתן השינויים המשמעותיים בקנה המידה של תכונות היעד בנתונים הוויזואליים והריכוז הצפוף של הצעות קופסאות גבול במסגרות מסוימות, זיהוי מדויק של טבק חתך דורש ניתוח של דפוסים רב-קנאליים. כדי להתמודד עם זה, השיטה מאמצת את ארכיטקטורת DynamicHead18 כתחליף לראש הגילוי המקורי ב-YOLOv11n, ומבססת מסגרת תשומת לב עצמית המשלבת מנגנונים מודעים לקנה מידה, מרחבי ומודע למשימות, כדי לשפר הן את יכולת הגילוי והן את היעילות התפעולית. התצורה המבנית של רכיב DynamicHead מוצגת באיור 5.

איור 5. מבנה מודול הגילוי של DynamicHead. מודול DynamicHead משלב שלושה מנגנוני קשב עוקבים: מודע לסקאלה (πL), מודע למרחב (πS), ומודע למשימה (πC). רכיבים אלו מתאימים באופן דינמי את חשיבות התכונות בין קני מידה, אזורים מרחביים ומשימות גילוי. עיצוב זה משפר הן את דיוק הלוקליזציה והן את ביצועי הסיווג על ידי אפשרות שיפור תכונות אדפטיבי בתוך ראש הגילוי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
ארכיטקטורה זו מורכבת משלוש יחידות תשומת לב מיוחדות: רכיבי מודעות בקנה מידה (πL), מודעות למרחב (πS), ומודעות למשימה (πC). מנגנון הקשב המודע לקנה מידה (πL) מאזן תחילה את מפת תכונות הקלט בין ממדים מרחביים וערוציים. התוצאה עוברת דרך שכבת הקרנה ליניארית ואחריה הפעלה של סיגמואיד קשיח ליצירת משקלי סולם, אשר מוכפלים לאלמנט במפת התכונות המקורית. מנגנון הקשב המודע למרחב (πS) משתמש בקונבולוציה מעוותת עם K = 9 נקודות דגימה שנבחרו בדלילות. הוא חוזה וקטורי הזחה Δpk וסקלרי מודולציהΔmk לכל נקודת דגימה, ואז מאגד את התכונות שנדגמו ליצירת משקלי תשומת לב מרחבית. מנגנון הקשב המודע למשימה (πC) מיישם טרנספורמציה ליניארית ללמידה לכל ערוץ באופן עצמאי באמצעות שתי קבוצות פרמטרים (α1, β1 ו-α2, β2). הוא בוחר את התגובה המקסימלית בין שני הייצוגים המומרים כדי להתאים דינמית תכונות למשימות סיווג ורגרסיה. לבסוף, שלושת מנגנוני הקשב הללו מיושמים ברצף על מפת תכונת הקלט כ-F_out = πC(πS(πL(F) · F) · F) · F. מנגנון המודעות לקנה מידה משתמש במשקל תכונות חוצה קנה מידה כדי לשלב באופן אדפטיבי ייצוגים מרובי רזולוצוציה, ובכך לשפר את רגישות המודל לשינויים ממדיים. הרכיב המודע למרחב מיישם משקל דגש אזורי בתוך מיפוי תכונות, ומכוון את המיקוד החישובי לישויות הקדמיות תוך דיכוי הפרעות רקע לא רלוונטיות. במקביל, המודול המודע למשימה מווסת באופן דינמי ייצוגי פלט למטרות ספציפיות, ומשפר הן את תוצאות הסיווג והן את תוצאות הרגרסיה כדי לחזק את דיוק המודל ועמידות תפעולית. ההליך החישובי פורמליזציה במשוואות 14–17.
(14)
(15)
(16)
(17)
כאן, WL(F) מציין ייצוג תכונה מועשר על ידי קשב, בעוד πL(F), π S(F) ו-π C(F) מתאימים לפעולות קשב בקנה מידה, מרחב ומשימה, בהתאמה. הטרנספורמציה f מייצגת שכבת הקרנה ליניארית, σ(x) מציין עיבוד הפעלה קשה-סיגמואיד, K מגדיר את כמות הנקודות המרחביות הנבחרות בדלילות, pk+Δpk מציג התאמות מיקום להדגשת אזורים מבחנים, Δmk מהווה מדד מובהקות ניתן לאימון לנקודה המרחבית pk, ו-α(F) ו-β(F) הן פונקציות פרמטריות ניתנות ללמידה המנהלות את ספי ההפעלה. ביניהם, K מוגדר ל-9 בכל הניסויים, שכן ערך זה מספק כיסוי מרחבי מספק תוך שמירה על יעילות חישובית.
שלבי פעולה ויישום
הגדרת מודול
מודול PyTorch מותאם אישית בשם DynamicHead צריך להיות מוגדר בתוך קבצי הגדרת המודל של הפרויקט. היישום של מודול זה מורכב משלוש יחידות קשב המיושמות ברצף: (1) תשומת לב מודעת לסולם: שכבות התכונות בקני מידה שונים משוקללות דינמית באמצעות פרמטרים ללמידה; (2) תשומת לב מודעת למרחב: בהתבסס על מושג הקונבולוציה המעוותת, יחידה זו מתמקדת במיקומים מרחביים דלילים אך מבחינים בתוך מפות התכונות; (3) תשומת לב מודעת למשימה: ספי הפעלה נלמדים דינמית כדי לייעל ייצוגים של תכונות עבור משימות סיווג ורגרסיה, בהתאמה. שלושת מנגנוני הקשב הללו מיושמים ברצף על פירמידת התכונות הקלט, ובסופו של דבר מייצרים תכונות לחיזוי. כל המודולים יושמו באמצעות פעולות PyTorch סטנדרטיות, כולל שכבות קונבולוציוניות, שכבות ליניאריות, פונקציות הפעלה ומנגנוני קשב כפי שתואר לעיל.
עריכת קובץ קונפיגורציה
קובץ קונפיגורציית המודל (config.yaml) צריך להיפתח. יש לאתר את החלק שמגדיר את ראש הגילוי. תצורת ראש הגילוי המקורית, שכוללת בדרך כלל סדרה של שכבות קונבולוציונליות לסיווג ורגרסיה, יש להחליף בקריאה למודול DynamicHead, כדי להבטיח שהקלט שלו מחובר ליציאת פירמידת התכונות על ידי רשת הצוואר.
מוטיבציה עיצובית
ראשי זיהוי מסורתיים בדרך כלל מיישמים את אותו סט פרמטרים קונבולוציוניים על כל שכבות התכונות, המיקומים המרחביים והמשימות, ללא התאמה ספציפית למשימה. הצגת מודול DynamicHead מונעת מהמורכבות של משימות גילוי, שמטרתה להפריד ולטפל באתגרים אלה באמצעות ארכיטקטורה מאוחדת מבוססת קשב. המוטיבציה העיצובית שלה היא בשלושה מחלקים: (1) להתמקד באופן אדפטיבי בשכבות תכונות המתאימות למטרות בגדלים שונים דרך מודול מודע לקנה מידה; (2) לרכז משאבים חישוביים באזורים קדמיים במקום ברקע דרך מודול המודעות למרחב; ו-(3) לאופטימיזציה דינמית של ייצוגי תכונות למטרות שונות של סיווג ורגרסיה באמצעות מודול מודע למשימות. שילוב זה של ניתוק ואופטימיזציה דינמית משפר את דיוק הלוקליזציה של המודל ואת אמינות הסיווג עבור מטרות מרובות קנה מידה צפופים כמו טבק חתוך.
שיטת הערכה מותאמת אישית לסדר בטבק
תיאור המודול ועקרון העיצוב: הערכה כמותית של סדר יישור הטבק החתוך חיונית להערכת יציבות תהליך הייצור ולחיזוי איכות המוצר הסופי בייצור סיגריות. שיטות הערכה מסורתיות מסתמכות על בדיקה ויזואלית ידנית, שהיא סובייקטיבית, גוזלת זמן, ואינה מסוגלת לספק מדידות כמותיות עקביות. כדי להתמודד עם מגבלות אלו, נעשה שימוש בשיטת חיזוי זווית מותאמת אישית המשולבת עם גלאי רגרסיה חד-שלבי משופר. העיקרון הבסיסי של שיטה זו הוא להקים מסגרת ייחוס מרחבית תוך שימוש במבנה התמיכה הפלדה בתוך מוט הסיגריה כמדד גאומטרי. מכיוון שתמיכת הפלדה שומרת על כיוון קבוע במהלך הייצור, היא משמשת כקו ייחוס אידיאלי לחישוב הכיוון היחסי של טבק חתוך בודד. על ידי מדידת הזוויות המוחלטות של טבק שנחתך ושל תמיכת הפלדה ביחס לקו הייחוס האופקי, ולאחר מכן חישוב ההבדלים הזוויתיים היחסיים ביניהם, השיטה מספקת הערכה כמותית של סדר היישור. זווית יחסית של אפס מצביעה על הקבלה מושלמת בין גדיל לתמיכה, בעוד שסטייה זוויתית הולכת וגדלה מצביעה על יישור ירוד יותר. ציר ההתייחסות האופקי מוגדר כקו המקביל לקצה התחתון של התמונה, מכוון משמאל לימין. ציר זה מתאים ל-0°, כאשר זוויות חיוביות נמדדות נגד כיוון השעון וזוויות שליליות נמדדות עם כיוון השעון מציר זה. מדד הסדר הסופי מתקבל על ידי ממוצע הזוויות היחסיות של כל הגדילים שזוהו בתמונה, מה שמאפשר דירוג איכות עקבי ואובייקטיבי.
שלבי פעולה ויישום
הגדרת מודול חישוב זווית
יישמו מודול עיבוד לאחר עיבוד שמעבד את יציאות הזיהוי ממודל הרגרסיה החד-שלבי המשופר. לכל חפץ שזוהה (טבק חתוך ותמיכה מפלדה), חלקו את קואורדינטות תיבת ההגבלה. חשב את קואורדינטות נקודת המרכז עבור כל עצם שזוהה באמצעות משוואה 18. חשב את קואורדינטות נקודת מרכז התמונה בהתבסס על ממדי התמונה באמצעות משוואה 19.

(18)

(19)
כאשר x₁, x₂, y₁, y₂ מציינים את הקואורדינטות של ארבע הפינות של קופסת הגבול שזוהתה עבור גדיל טבק או תומך הפלדה; cx ו-c y מייצגים את הקואורדינטות של נקודות המרכז שלהן בתוך אזור הגילוי; w ו-h מציינים את רוחב וגובה תמונת הסיגריה; dx ו-d y מגדירים את הקואורדינטות של נקודת מרכז התמונה.
חישוב זווית אבסולוטית
לכל חוט טבק שזוהה ועבור תמיכת הפלדה, חשב את הווקטור ממרכז התמונה למרכז האובייקט. חשב את הזווית המוחלטת ביחס לקו הייחוס האופקי באמצעות פונקציית הארקטנגנטים, כפי שמנוסח במשוואה 20. הזווית מחושבת באמצעות atan2(d_y, d_x), כאשר atan2 היא פונקציית המשיקים ההפוכה בעלת ארבעה רבעים הזמינה בספריית המתמטיקה של פייתון. פונקציה זו מחזירה ערכים בטווח (−π, π] רדיאנים, אשר מומרים לאחר מכן למעלות, ומניבים זוויות יציאה בטווח (−180°, 180°]. טיפול ברבעון הוא אוטומטי עם atan2 בהתבסס על סימני d_y ו-d_x. זה מניב פלדת A לתמיכה פלדה וחיתוך A לכל גדיל טבק.
(20)
חישוב זווית יחסית
לכל גדיל טבק שזוהה, חשב את הזווית היחסית על ידי חיסור הזווית המוחלטת של תומך הפלדה מזווית הגדיל המוחלטת שלו, כפי שמוצג במשוואה 21. הערך המוחלט מבטיח מדידות סטייה זוויתית חיובית.
(21)
יצירת מטריקת סדר
אגד את הזוויות היחסיות של כל הגדילים שזוהו בתוך תמונה אחת. חשב את הזווית היחסית הממוצעת על ידי סכימת כל הזוויות היחסיות T o וחלוקה במספר הכולל של הגדילים שזוהו n, כפי שמנוסח במשוואה 22. ערך ממוצע זה משמש כמדד כמותי לסדר היישור של אותה תמונה.
(22)
יישום דירוג איכות
מימוש פונקציית סיווג שממפה את הערך המחושב לציונים איכותיים בהתבסס על ספים מוגדרים מראש, כפי שמוגדר במשוואה 23. ספי הדירוג (0°–30° = מצוין, 30°–60° = טוב, >60° = גרוע) נקבעו בהתייעצות עם שלושה מומחי בקרת איכות מחברת Longian Tobacco Industry Co., Ltd. מומחים אלו העריכו באופן עצמאי 200 תמונות דגם, וקשרו בין הזוויות היחסיות הממוצעות המחושבות לאיכות היישור הנתפסת, באמצעות סולם בן שלוש קטגוריות (מצוין, טוב וגרוע). הגבולות של 30° ו-60° נבחרו כנקודות חיתוך קונצנזוס שבהם ההסכמה הבין-מומחית עלתה על 90%. דירוג זה מאפשר פרשנות אינטואיטיבית של התוצאות הכמותיות עבור אנשי בקרת האיכות.
(23)
עריכת קובץ קונפיגורציה
קובץ הקונפיגורציה של המודל (config.yaml או model.yaml) צריך להיפתח. יש לאתר את חלק העיבוד לאחר העיבוד או חלק הגדרות ההסקה בתצורה. מודול חישוב הזווית המותאם אישית צריך להיות מיועד ומופעל כראוי. יש לאמת את הגדרות ניתוח היציאה כדי להפיק נכון את קואורדינטות קופסת הגבול הן לטבק החתוך והן לתמיכת הפלדה. אין צורך בהוספת שכבה נוספת לשיטת ההערכה הזו, שכן היא פועלת כמודול עיבוד לאחר שראש הזיהוי מוציא.
מוטיבציה עיצובית
עיצוב שיטת ההערכה המותאמת אישית הזו מונע מהצורך להפוך בדיקה ויזואלית סובייקטיבית למדידות כמותיות אובייקטיביות וניתנות לשחזור. בדיקה ידנית מסורתית סובלת משונות בין צופים ואינה מספקת נתונים מספריים רציפים לאופטימיזציה של תהליכים. על ידי ניצול תמיכת הפלדה כנקודת ייחוס גאומטרית טבעית בתוך מוט הסיגריה, השיטה מבטלת את הצורך בסימני כיול חיצוניים ומבטיחה עקביות מדידה בין תמונות ואצולות ייצור שונות. השימוש בווקטורי נקודת מרכז וחישובי ארקטנגנטים מספק גישה מתמטית חזקה ויעילה חישובית להערכת זווית, מה שהופך אותה למתאימה לפריסה בזמן אמת. חישוב וקטורי זה ממרכז התמונה למרכז האובייקט מתוכנן להיות בלתי משתנה לשדה הראייה של המצלמה ולמיקום מוט הסיגריה בתמונה, ובכך להבטיח עמידות בתנאי צילום משתנים. אסטרטגיית הממוצעת בין מספר גדילים שזוהו מתחשבת בשינויים טבעיים בכיוון הגדילים ומניבה מדד סדר כולל אמין סטטיסטית. מערכת דירוג בת שלוש רמות מתרגמת מדידות נומריות רציפות לקטגוריות איכות ישמות, ומקלה על קבלת החלטות מהירה בבקרת איכות קווי הייצור. בסך הכול, גישה משולבת זו משלבת את יכולות הגילוי של מודל הרגרסיה החד-שלבי המשופר עם חישובים גיאומטריים מדויקים, ומאפשרת הערכה מקיפה ואוטומטית של סדר יישור הטבק החתוך.
הכשרה לדוגמה לזיהוי סדר בטבק
PyTorch 2.1.0, Compute Unified Device Architecture (CUDA) 12.1, וכל התלויות צריכים להיות מותקנים כראוי. המימוש עוקב אחרי צינורות ה-YOLO הסטנדרטיים של PyTorch וניתן לשחזר אותו בהתבסס על תיאורי המודולים המפורטים ושלבי הקונפיגורציה שסופקו.
פיקוד אימונים
לפני אימון מחדש, יש להכין את מערך הנתונים של תמונות מחולק וקבצי הערות בפורמט זיהוי חד-שלבי סטנדרטי (למשל, פורמט YOLO עם קובץ .txt אחד לכל תמונה). קובץ .yaml של תצורת מערך נתונים שמפרט את מסלולי התמונה, מספר המחלקות (תמיכה של טבק ופלדה) ושמות מחלקות. בהתבסס על שיפורי המודל שתוארו קודם, קובץ ההגדרות המקורי של הגלאי .yaml צריך להיות מוחלף בקובץ .yaml המוצע של המודל, הכולל את מודולי MFID, TCF ו-DynamicHead. יש לכתוב או לשנות את סקריפט train.py כדי לייבא את חבילת הגלאי החד-שלבית, לטעון את מודל האימון וקונפיגורציית מערך הנתונים, ולהגדיר את פרמטרי האימון הבאים: imgsz=640, epochs=100, bach=4, workers=0, device='0', optimizer='SGD', close_mosaic=10, וכו'. הזרע האקראי נקבע ל-42, ומשקלי המודל הופעלו באמצעות אסטרטגיית האתחול ברירת המחדל שמספקת מסגרת הלמידה העמוקה. שחזוריות הובטחה על ידי הגדרת torch.backends.cudnn.deterministic = נכון ו-torch.backends.cudnn.benchmark = שקר.
היפרפרמטרים
ההיפרפרמטרים המרכזיים שהוגדרו לאימון הם: רזולוציית תמונה קלט של 896 × 1600 פיקסלים; גודל אצווה של 4, מוגבל על ידי זיכרון GPU; קצב למידה התחלתי של 0.01 עם מתזמן אנילינג קוסינוס לדעיכה הדרגתית; אופטימייזר ירידת גרדיאנט סטוכסטית (SGD) עם תנע של 0.912 להאצת התכנסות; ודעיכת משקל של 0.0004 לצורך רגולריזציה. התמונות נורמלו לפי ממוצע [0.485, 0.456, 0.406] וסטיית תקן [0.229, 0.224, 0.225]. ההרחבה כללה היפוך אופקי אקראי (50%), התאמת בהירות אקראית (±20%), וסיבוב אקראי (±15°). הרחבת פסיפס מתאפשרת כברירת מחדל בתקופות האימון המוקדמות כדי לשפר את עמידות המודל בקני מידה שונים של אובייקטים וסתימות. היא מושבתת בעשרת התקופות האחרונות (close_mosaic = 10) כדי לשפר את דיוק הגילוי.
ניטור הכשרה
במהלך ההכשרה, המסגרת מפיקה מדדים מקיפים בכל תקופה. פונקציית האובדן היא סכום משוקלל של שלושה רכיבים: הפסד סיווג (אנטרופיה חוצה בינארית [BCE] עם לוגיט), אובדן לוקליזציה (חיתוך מלא על אובדן איחוד [IoU]), ואובדן אובייקטיות (BCE). משקלי הירידה הכוללים נקבעו כ-λ_cls = 0.5, λ_box = 0.05, ו-λ_obj = 1.0. יש לעקוב אחר עקומות אובדן האימון והאימות כדי להבטיח התכנסות יציבה ולזהות סימני התאמת יתר. ה-mAP בסף IoU של 0.5 (mAP@0.5) בערכת האימות משמש כמדד ביצועים עיקרי לזיהוי חוטי טבק חתוכים. בהינתן גודל מערך הנתונים ומורכבות המודל, אימון ל-100 אפוקים בדרך כלל מספיק להתכנסות. נקודת הביקורת המודל הטובה ביותר נשמרת אוטומטית בהתבסס על אימות mAP.
הערכת מודל ופריסה
הערכה
לאחר סיום האימון, משקלי המודל האופטימליים נשמרים כ-runs/train/exp/weights/best.pt. המודל המאומן צריך להיות מוערך על מערך האימות הייעודי באמצעות הפקודה הבאה: python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. סקריפט ההערכה מפיק מדדי ביצוע מרכזיים, כולל דיוק, שחזור ו-mAP@0.5, עבור שתי מחלקות הגילוי (תמיכה בטבק ופלדה). יש לאמת את ה-mAP כדי לעמוד בסף הנדרש לפריסה תעשייתית (למשל, >95% לזיהוי גדרים). סף הפריסה (mAP >95% לזיהוי גדרים) מייצג דרישת ביצועים פנימית לסביבה התעשייתית היעדית. התוצאה המדווחת משקפת ביצועים במערך מבחנים מגוון הכולל מקרים מאתגרים במיוחד. ה-mAP של המודל לתנאי ייצור שגרתיים עולה על 96% כאשר הוא מוערך על תת-קבוצה מסוננת לתאורה אידיאלית ומינימום הסתרה. תת-הקבוצה השגרתית של הייצור הוגדרה לפי הקריטריונים הבאים: תאורה בטווח של 500–800 לוקס (תאורה אופטימלית), אחוז הסתרה נמוך מ-10% (חפיפה מינימלית), וללא החזרות ספקולריות נראות לעין. תת-קבוצה זו מכילה 427 תמונות, המייצגות כ-67% מקבוצת הבדיקה. תת-קבוצה זו מתאימה לתנאי ייצור סטנדרטיים בשעות היום תחת תאורה רגילה וסידור חוטים מכוונים היטב.
אימות הסקה
כדי לאמת ויזואלית את ביצועי הגילוי של המודל על תמונות בלתי נראות, מתבצעת הסקה על תמונות בדיקה לדוגמה באמצעות הפקודה הבאה: python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. פקודה זו יוצרת תמונות עם הערות עם קופסאות מסגרות סביב תומכי טבק ופלדה חתוכים שזוהו. מהירות ההסקה נמדדה על כרטיס גרפי NVIDIA GeForce RTX 3080 Ti (12GB VRAM) באמצעות CUDA 12.1 ו-PyTorch 2.1.0. הפריימים המדווחים (FPS) חושבו כממוצע של מעל 100 מעברים קדימה רצופים לאחר 50 חזרות חימום. בנוסף, מהירות ההסקה (בפריימים לשנייה) מדווחת כדי לאשר את התאמתה בזמן אמת לסביבת הפריסה.
פריסת מודלים
כדי לאפשר פריסה בזמן אמת במערכת הבקרה התעשייתית, יש לייצא את מודל PyTorch המאומן (best.pt, כ-7–9 MB) לפורמט הסקה אופטימלי, כמו TensorRT או Open Neural Network Exchange (ONNX). המרה זו משפרת את מהירות ההסקה תוך שמירה על דיוק גילוי. לייצוא ONNX, השתמש: torch.onnx.export(model, dummy_input, "model.onnx", opset_version=11, input_names=["images"], output_names=["outputs"]). להמרת TensorRT, השתמש: trtexec --onnx=model.onnx --saveEngine=model.trt --fp16 --workspace=4096. מצב הדיוק FP16 שימש לאופטימיזציה של מהירות ההסקה. המודל הסופי שמוצב מפיק קואורדינטות קופסאות גבולות, תוויות מחלקות (סיבוב טבק חתוך או תומך פלדה), וציוני ביטחון לכל אובייקט שזוהה, המשמשים כקלט לשיטת הערכת זוויות מותאמת אישית המשמשת לכימות סדר טבק חתוך.