מאמר מחקר

מודל זיהוי עצמים בזמן אמת לזיהוי מותג סיגריות המבוסס על ארכיטקטורת רגרסיה חד-שלבית משופרת

DOI:

10.3791/69657

9 בינואר 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כדי להתמודד עם אתגרים כמו חסימה ושינויים בתאורה במחסנים אוטומטיים, מאמר זה מציג ארכיטקטורת רגרסיה חד-שלבית משופרת לזיהוי מותגי קופסאות סיגריות. על ידי שילוב דגימה אדפטיבית, מנגנון קשב רב-קנה מידה הפוך ויעיל, וראש זיהוי דינמי, המודל המוצע משיג מדידת חכמה מדויקת בזמן אמת.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

זיהוי חזותי למלאי סיגריות אוטומטי מתמודד עם מכשולים משמעותיים, כולל שינויים בתאורה, מידות שונות של הקופסה והסתרת תכונות חלקית, מה שמסבך את אימות המותג ואת זיהוי הקופסאות הלא נכונות. מאמר זה מציע מודל זיהוי בזמן אמת משופר כדי להתמודד עם בעיות זיהוי תמונה ולשיפור הדיוק. ראשית, מודול דגימה קטנה אדפטיבי נפרס כדי להחליף את מודול הקונבולוציה של דגימה נמוכה הן ברשתות עמוד השדרה והן ברשת הצוואר של סדרת YOLO כגלאי בסיסי או גלאי מקורי, מה ששומר על פרטים נוספים ומממש את המשקל הקל של הדגם. שנית, מודול קשב רב-קנה מידה הפוך יעיל ומוצג כדי ללכוד את מידע ההקשר המרחבי של קני מידה שונים וליצור מפת קשב מרחבית מדויקת יותר, המשפרת את דיוק החיזוי של מודל הבסיס עבור תכונות מורכבות ויעדי הסתרה. לבסוף, מודול ראש זיהוי דינמי מחליף את ראש הגילוי המקורי של מודל הבסיס ומבצע זיהוי אובייקטים רב-קנה מידה על מפת התכונות שהופקה מרשתות עמוד השדרה והצוואר כדי להשיג מיקום מדויק וחלוקת קטגוריות של המטרה החזויה. כדי להעריך את ביצועי המודל המשופר בתחום, בנינו מאגר נתונים חזותי של מותג קופסאות הסיגריות. מאגר הנתונים הורחב באמצעות טכניקות העתק-הדבק ספציפיות לאזור ושיטות הרחבה מסורתיות, ומאגר הנתונים שהתקבל כולל רקע מורכב, חסימה וחפיפה, מטרות קטנות וגורמים נוספים. הניסוי מראה כי המודל המשופר המוצג במאמר זה עומד ביעילות בדרישות לגילוי בזמן אמת בשטח. המודל המוצע משיג mAP של 97.9%, עם פרמטרים ו-FLOPs של 1,849,679 ו-5.1 G, בהתאמה. בהשוואה למודל הבסיסי, המודל המוצע משפר את mAP ב-0.9% תוך הפחתת הפרמטרים ב-28.78% ופעולות בנקודה צפה ב-1.4 G. בנוסף, המודל מגיע למהירות הסקה של 38.5 FPS, וממלא את הדרישות לגילוי תעשייתי בזמן אמת.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ייצור ולוגיסטיקה מודרניים מסתמכים במידה רבה על מערכות אחסון ושליפה אוטומטיות (AS/RS)1 כדי להשיג אחסון בצפיפות גבוהה, טיפול יעיל בחומרים וניהול מלאי מדויק. AS/RS הפך לאמצעי חיוני שיכול לסייע לארגונים לשפר את יעילות המחסן ולהפחית עלויות, בזכות היעילות הגבוהה והמאפיינים החכמים שלו. עם בסיס של מדפים רב-שכבתיים, ציוד טעינה ופריקה מגוון, ה-AS/RS הוא מערכת מכטרוניקה מבוקרת מחשב, המשלבת טכנולוגיות שונות כולל מכניקה, אלקטרוניקה, מדעי המחשב, תקשורת, רשתות, חיישנים ובקרה אוטומטית 2,3. ה-AS/RS מממש את האחסון והטיפול היעיל, המדויק והבטוח של סחורות באמצעות שילוב ואופטימיזציה של מדפים, מנופי ערימה, קווי מסוע, מערכות בקרה וציוד נוסף, מה שמעלה משמעותית את יעילות האחסון. השילוב של ראיית מחשב ב-AS/RS, היבט מרכזי בתעשייה 4.0, מאפשר רמות חסרות תקדים של אוטומציה ואינטליגנציה בכך שהוא מאפשר למערכות לראות ולקבל החלטות על בסיס נתונים חזותיים4.

עם היישום הנרחב של AS/RS במפעלי טבק, הוצע דרישת מלאי חדשה למותגי קופסאות סיגריות. שיטות מלאי ידניות מסורתיות סובלות מחוסר יעילות, שיעורי גילוי שגויים גבוהים וסיכוני בטיחות, שאינם עונים על צורכי AS/RS. עם ההתקדמות המתמשכת של טכנולוגיית ראיית מחשב, פתרונות ראיית מכונה מיושמים יותר ויותר בתחומי הבדיקה התעשייתיים 6,7,8. מכיוון שמידע על מותג עם דפוסים וטקסט ייחודיים מודפס על כל קופסה, טכנולוגיית זיהוי תמונה מבוססת ראיית מכונה מאפשרת זיהוי מותג ורישום מלאי.

מאז 2012, אלגוריתמים לזיהוי עצמים מבוססי למידה עמוקה הביאו פריצות דרך משמעותיות בזיהוי תמונות 9,10,11. ממודלים מוקדמים לזיהוי עצמים דו-שלבי כמו R-CNN12 ועד למודלים חד-שלביים עכשוויים של גילוי עצמים שנשלטו על ידי מודלים מסדרת YOLO כבסיס או גלאי מקורי 13,14,15, גישות אלו תרמו תרומה משמעותית לפיתוח אלגוריתמים לזיהוי עצמים. משימות איסוף אינטליגנטיות משתמשות יותר ויותר במודלים לזיהוי עצמים כדי לזהות ולאתר מטרות מרובות במדויק בתמונות או בסרטונים. לי ואח' הציעו שיטת מדידה חכמה המשלבת חיישני שקילה וטכנולוגיית זיהוי תמונה לשיפור יעילות ודיוק המלאי. Wang ואחרים השתמשו במסכה R-CNN כדי לסגמל את מספר מדף הספרים ומיקום הכותרת מתמונת עמוד השדרה של הספר. Sun ואחרים תכננו מערכת זיהוי ויזואלי משולבת, שהשתמשה ב-OpenCV לזיהוי קודים דו-ממדיים על חומרים ומדפים במצב מרובה. הם אופטימיזם את הגלאי המקורי (v5s) על ידי הכנסת מנגנון הקשב C3CBAM והקצאת תוויות SimOTA כדי לשפר את פונקציות האובדן לזיהוי מדויק של חומרים מרובים.

בתחום גילוי עצמים, בעוד שמודלים דו-שלביים — המיוצגים על ידי Faster R-CNN — נהנים מיתרונות מסורתיים בדיוק גילוי, מנגנוני יצירת הצעת האזורים המורכבים שלהם מובילים למהירויות הסקה איטיות יחסית. כתוצאה מכך, הם מתקשים לעמוד בדרישות המחמירות לביצועים בזמן אמת בתרחישים תעשייתיים19,20. לעומת זאת, הארכיטקטורה מבוססת רגרסיה מתייחסת לזיהוי אובייקטים כבעיה של רגרסיה יחידה, המנבאת ישירות מיקומי יעד והסתברויות קטגוריות מתמונות קלט. עיצוב ארכיטקטוני זה מאפשר למודלים להצטיין משמעותית על רוב המודלים הדו-שלביים מבחינת יעילות הסקה, משקל קל וגמישות פריסה, תוך שמירה על דיוק תחרותי. לכן, ארכיטקטורה זו הפכה לפתרון המועדף לגילוי תעשייתי בזמן אמת21.

מערכת המודלים המקורית ממשיכה להתפתח במהירות, כאשר הווריאנטים האחרונים מתמודדים עם אתגרים ספציפיים. לדוגמה, הגלאי המקורי (v12)22 מתמקד בשיפור נוסף של אופטימיזציה בזמן ההכשרה ושיפור הארכיטקטורה לטובת פשרות מדויקות ויעילות. במקביל, הגלאי המקורי (World)23 מציג יכולות גילוי אוצר מילים פתוח, המאפשרות הסקה בזמן אמת של מגוון עצום של אובייקטים מעבר לקטגוריות סט האימון באמצעות מודלים של שפת חזון. בעוד שהתקדמויות אלו דוחפות את גבולות גילוי עצמים כללי, עבודה זו מתמקדת ביישום תעשייתי מיוחד שבו עמידות לאתגרים מסוימים, כגון חסימה חלקית ושונות תאורה, היא קריטית, ומרחב הקטגוריה קבוע ומוכר מראש. כגרסה החמה ביותר במשפחת מודלים זו, דגםהבסיס 24 ירש יתרונות מהגלאי המקורי(v8)25,26; הוא לא רק מפחית את מספר פרמטרי המודל, אלא גם שוקל איזון בין יעילות גילוי לדיוק. בהשוואה למודלים אחרים לזיהוי עצמים, הוא בולט במשימות זיהוי חזותי.

האתגר בזיהוי קופסאות סיגריות קטנות או חלקית מוסתמות הוא ביטוי לבעיה רחבה יותר בראיית מחשב. זיהוי עצמים קטנים נחקר באופן פעיל, עם גישות הנעות משיפורים של רשת פירמידת התכונות(FPN) 27 ועד למנגנוני קשב מודעים להקשר, שמעוררים שילוב של עיבוד תכונות רב-קנה מידה. יתרה מזאת, השאיפה ליעילות תפעולית בסביבה תעשייתית מחייבת עיצוב דגם קל משקל. בהשראת מושגי הארכיטקטורה היעילה שנחקרו ב-MobileNetV328 ו-GhostNet29, מושגים אלו משתמשים בקונבלוציה עמוקה ובטרנספורמציה ליניארית כדי להפחית את המורכבות החישובית תוך שמירה על יכולת ההצגה, ולכן בוחרים מודולים קלים לשיפור המודל. לכן, כדי להתמודד עם מלאי מותגי קופסאות הסיגריות והגורמים המשפיעים על המלאי, כגון שינויים בתאורה, הבדלים בגודל תכונות בין מותגים שונים, והסתרה חלקית בין קופסאות הסיגריות, אנו מציעים במאמר זה מודל זיהוי אובייקטים של ארכיטקטורת רגרסיה חד-שלבית משופרת.

החידושים העיקריים במודל המוצע הם בשלושה תחומים. ראשית, מודול Adaptive Downsampling (ADown)30מופעל כדי להחליף את הדגימה הקונבולוציונית הסטנדרטית הן ברשתות עמוד השדרה והן ברשת הצוואר. עיצוב חדשני זה מפחית אובדן מידע במהלך דחיסת תכונות, דבר קריטי לשימור לוגואים וטקסטים של מותגים קטנים. שנית, מוצג מנגנון קשב רב-קנה מידה יעיל הפוך (iEMA) כדי להעצים את המודל בתפיסה קונטקסטואלית דינמית ורב-קנה מידה, ומעלה משמעותית את ביצועיו על קופסאות סיגריות קטנות וחלקית מוסתרות. שלישית, ראש הגילוי המקורי מוחלף במודול DynamicHead31 , שמאחד תשומת לב בקנה מידה, מרחב ומודעות למשימה, ומאפשר מיקום וסיווג מדויקים יותר בין מטרות בגדלים שונים מאוד. שינויים אדריכליים אלו מעוצבים באופן מגובש כדי להתמודד עם נקודות הכאב הספציפיות של זיהוי מותגי סיגריות בסביבות תעשייתיות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מערך הנתונים ששימש במאמר זה התקבל משדה AS/RS של מחלקת הלוגיסטיקה של תעשיית הטבק לונגיאן בע"מ. מחקר זה לא כלל משתתפים אנושיים או בעלי חיים. לא נדרשה אישור אתי.

רכישת והגדרת מערכי נתונים
תצורת חומרה: התקנת מצלמה תעשייתית (למשל, MV-CA013-A0GM) המצוידת בעדשת אורך מוקד של 8 מ"מ (למשל, MVL-HF0828M-6MPE) על פלטפורמת המטען של מנוף הערבת. חבר את המצלמה למחשב בקרה דרך כבל GigE והתקן נקודת גישה אלחוטי (למשל, BH-ANT5158S-14V, BH-MS-AC1600HWH). מקמו נורת LED רצועה (למשל, MV-LLDS-1002-38-W) סביב המצלמה כדי להבטיח תאורה אחידה.

הגדרת פרמטר מצלמה: הגדר את המצלמה באמצעות תוכנת היצרן (למשל, MVS). הגדר את רזולוציית הרכישה ל-1280 על 1024 פיקסלים. הגדר את מצב ההדק ל-Hardware Trigger וסנכרן אותו עם מערכת המיקום של מנוף הערבים. הגדר את זמן החשיפה ל-100 מילישניות ואת הגיין ל-5 דציבל כדי למזער טשטוש תנועה ורעש. מרחק העבודה בין המצלמה לקופסאות הסיגריות הוא כ-550 מ"מ.

אוסף תמונות: מצלמה תעשייתית עם טריגר לוכדת תמונה אוטומטית בכל פעם שמגש ממוקם במהלך אחסון והשלפת קופסאות סיגריות. לאסוף בסך הכל 4,835 תמונות גולמיות; תמונות טיפוסיות מוצגות באיור 1.

הערות תמונה: השתמשו בכלי הקוד הפתוח LabelImg. לכל תמונה, צייר קופסאות מוגבלות סביב כל תכונה נראית לעין של מותג סיגריות. הקצה את שם המותג הנכון (למשל, הונגג'ואנג, גוטיאן) כתווית המחלקה לכל תיבת גבול. שמור את ההערות בפורמט זיהוי חד-שלבי סטנדרטי, עם קובץ טקסט אחד לכל תמונה.

בקרת איכות: מעריך שני בודק 20% שנבחרו באקראי מהתמונות המוערות. כל אי-התאמה נדונה ונפתרת, כדי להבטיח עקביות בתווית.

אסטרטגיית הגדלת נתונים
סעיף זה מפרט הן את טכניקות ההרחבה המסורתיות והן המתקדמות המיושמות על מערכי הנתונים. הנתונים הראשוניים והנתונים המורחבים משולבים למערך נתונים חדש, שמחולק לאחר מכן לסט אימון, סט אימות וסט מבחן כדי להבטיח הוגנות בהערכה.

הרחבת נתונים מסורתית32: טרנספורמציות אלו מיושמות בזמן אמת על ידי צינור האימון (למשל, באמצעות ספריות Albumentations או PyTorch Transforms) עם הסתברות מוגדרת לכל אצווה.

טרנספורמציות גאומטריות: סיבוב: סיבוב אקראי של תמונות בזווית שבין -45° ל-+45°. קנה מידה: קנה מידה אקראי של תמונות לפי גורם שבין 0.8 ל-1.2. היפוך אופקי: הפוך תמונות באופן אקראי בהסתברות של 100%. חיתוך אקראי: חתוך אקראי קטע בין 80% ל-100% משטח התמונה המקורי.

טרנספורמציות פוטומטריות: בהירות וניגודיות: כוונן בהירות וניגודיות לפי גורם שנבחר באקראי מתוך [0.6, 1.4]. רעש גאוסיאני: מוסיפים רעש גאוסי עם סטיית תקן שנבחרה באקראי מ-[0, 0.01 * 255] ל-10% מהתמונות. טשטוש גאוסיאני: מרח טשטוש גאוסי עם גודל גרעין של 3x3 עד 10% מהתמונות.

סימולציית סתימה: מניחים באקראי 1 עד 3 טלאי חסימה מלבניים (המכסים עד 5% משטח התמונה כל אחד) על התמונות. הפאצ'ים מלאים ברעש אקראי או ערכי פיקסל ממוצעים בתמונה.

הרחבת נתונים מתקדמת: העתק-הדבק ספציפי לאזור
מוטיבציה והשפעה: המוטיבציה העיקרית להרחבה ממוקדת זו הייתה להתמודד עם בעיית נתונים קריטית: כמה מותגי סיגריות הציגו מעט מאוד מקרים (עד תמונה אחת). חלוקת בדיקת אימות רכבת אקראית סטנדרטית יכולה להקצות את כל המופעים של מותג נדיר לקבוצה אחת (למשל, כולם לקבוצת הבדיקה), מה שגורם לכך שלמודל לא תהיה הזדמנות ללמוד או לאמת את המותג הזה. שיטה זו הגדילה באופן מלאכותי את גודל המדגם עבור מותגים שאינם מיוצגים מספיק, והבטיחה שלכל מותג יהיה מספיק מופעים המפוזרים בין ערכות ההדרכה, האימות והבדיקות. שלב יסודי זה מונע כישלון קטסטרופלי בקטגוריות נדירות ומהווה תנאי מוקדם לכל ביצועי מודל משמעותיים והכללה על כל מערך המותגים.

שלב זה דורש מודל בסיס סגמנטלי מאומן מראש על מערך הנתונים הראשוני ועל מודל Segment Anything (SAM)33.

אובייקטים למקור סגמנט: לתמונות קופסאות סיגריות ממותגים שאינם מיוצגים מספיק, השתמשו במודל SAM ליצירת מסכות סגמנטציה מדויקות. השתמשו במצב הנקודה, לחצו על תכונת המותג בקופסת הסיגריות כדי להתחיל סגמנטציה. אימות ושיפור ידני של מסכות שנוצרו כדי להבטיח דיוק. שמור את תמונות קופסת הסיגריות המחולקות עם רקע שקוף כקבצי PNG. זה יוצר ספרייה של מופעי אובייקטים מבודדים.

יצירת מסכות רקע: השתמש במודל הבסיס הסגמנטלי המאומן מראש לביצוע סגמנטציה של מופעים על קבוצת תמונות רקע (תמונות עם שטח פנוי רב או רקעים פשוטים). המודל יפיק מסכות בינאריות המצביעות על האזורים שכבר מאוכלסים על ידי אובייקטים.

מסכות עיבוד ואובייקטים להדביק: לכל מסכת רקע, השתמשו בספריית OpenCV (פונקציית 'cv2.approxPolyDP' עם מקדם אפסילון של 0.02 * פרימטר קונטור) כדי לבצע התאמת עקומות וליניאריזציה של קצוות המסכה, ולקבל ייצוג פוליגוני פשוט של המרחב הפנוי. זהה את שטח הפוליגונים הרציף הגדול ביותר בתוך מסכת הרקע כאזור המשחה המטרה. בחר באקראי אובייקט מקור מחולק לסגמנט מהספרייה. לשנות את גודלו (לשמור על יחס הגובה-רוחב) וליישם טרנספורמציה אפינית (סיבוב קל בין -5° ל-+5°, וגזירה קלה) כדי להתאים באופן טבעי לאזור המטרה, כדי לוודא שהיא לא חופפת לגבולות האובייקטים הקיימים. השתמש במיזוג אלפא כדי להדביק בצורה חלקה את האובייקט שעבר טרנספורמציה על תמונת הרקע במיקום המחושב. המסגרת הכוללת של טכנולוגיית הגדלת הנתונים המבוססת על טכניקת העתקה-הדבקה באזורים מסוימים מוצגת באיור 2. יוצר באופן תכנותי קובץ הערות txt חדש מתאים עבור האובייקט שהודבק, ומעדכן את קואורדינטות תיבת הגבול ותווית המחלקה (class).

מערך נתונים מוגבר סופי: תהליך לא מקוון זה מייצר 600 תמונות סינתטיות חדשות. שלבו אותן עם 4,835 התמונות המקוריות ועוד 1,167 תמונות שנוצרו על ידי יישום טכניקות ההגדלה המסורתיות כפי שתוארו לעיל, כדי ליצור את מערך הנתונים הסופי של 6,602 תמונות. חלק את מערך הנתונים הסופי לקבוצות אימון (70%, 4,621 תמונות), אימות (20%, 1,320 תמונות) ובדיקות (10%, 661 תמונות), כדי להבטיח שתמונות מאותו רצף מקורי נשמרות באותו חלוקה כדי למנוע דליפת נתונים.

שינוי מודל לבניית הגלאי המשופר המוצע
אלגוריתמים אופטימליים לזיהוי עצמים34 השיגו התקדמות משמעותית בבדיקות תעשייתיות בשנים האחרונות. סעיף זה מספק הליך מפורט שלב אחר שלב לשינוי ארכיטקטורת המודל הבסיסי ליצירת המודל המוצע. השינויים מיושמים על ידי עריכת קובץ הקונפיגורציה של המודל (למשל, config.yaml) והבטחת כלולות הגדרות מודולים מותאמות אישית בקוד הבסיס. ההיגיון לכל שינוי מוצג כדי להבהיר את תפקידו בהתמודדות עם אתגרי זיהוי ספציפיים. מבנה המודל המוצע מוצג באיור 3.

החלפת מודולי דגימה קטנה במודול ADown: מודול Convolution-BatchNorm-SiLU (CBS) הסטנדרטי המשמש לדגימה נמוכה משתמש בקונבולוציה חד-צרידית, שיכולה לשמש צוואר בקבוקמידע 35, ופוטנציאלית לוותרת תכונות עדינות החיוניות לזיהוי קופסאות סיגריות קטנות ולוגואים מפורטים של מותגים. מודול ADown נועד להקל על כך על ידי יישום מבנה דו-ענפי שלומד ושומר מערך עשיר יותר של תכונות במהלך הפחתת רזולוציה מרחבית. ענף אחד שם דגש על שימור פרטים מקומיים בתדר גבוה, בעוד שהשני תופס סקירה רחבה ועשירה בהקשר. המיזוג של תכונות משלימות אלו מוביל לייצוג חזק ומעשיר יותר לשכבות הבאות.

שלבי פעולה ויישום
הגדרת מודול: ודא שמודול PyTorch מותאם אישית בשם ADown מוגדר בתוך קבצי הגדרת המודל של הפרויקט. מודול זה חייב להכיל שני ענפים מקבילים. הענף הראשון צריך להיות מורכב משכבת קונבולוציה דו-ממדית עם גרעין 3x3 וצעד של 2. הענף השני צריך להיות ברצף משכבת מקסימום פולינג 2x2 (עם צעד 2) ואחריה שכבת קונבולוציה 1x1. הפלטים של שני הענפים הללו אמורים להיות מחוברים לאורך ממד הערוץ, ומפת התכונות המתקבלת עוברת דרך שכבת קונבולוציה סופית 1x1 כדי לשלב את הערוצים ולהפיק את הפלט. מבנה מודול ADown מוצג באיור 4.

עריכת קובץ קונפיגורציה: פתח את קובץ הקונפיגורציה של המודל הבסיסי (config.yaml). זיהוי שיטתי של כל מופע במודול CBS שמוגדר לדגימה קטנה (כלומר, כאשר פרמטר הצעד מוגדר ל-2). החלף כל אחד מהמודולים הללו במודול ADown החדש.

מוטיבציה עיצובית: עיצוב ADown מונע מהצורך לצמצם אובדן מידע בקונבולוציות סטרייד סטנדרטיות, מה שעלול להזיק לאובייקטים קטנים. המבנה הדו-ענפי שלו מושפע מרעיון העיבוד המקבילי ללכידת פרטים מרחביים בתדר גבוה (באמצעות קונבולוציה) ומידע הקשר בתדר נמוך (באמצעות איגוף), ובכך מספק ייצוג תכונות עשיר ורב-קנה מידה לשכבות הבאות.

אינטגרציה של מודול iEMA
היגיון ועקרון עיצוב: כדי לשפר את יכולת המודל לזהות מטרות קטנות ואלו שמוסתרות חלקית, חיוני לשלב מנגנון שיכול למודל ביעילות הקשר מרחבי רב-קנה מידה. מודול iEMA משיג זאת על ידי הטמעת רכיב Efficient Multi-scale Attention (EMA)36 בתוך מבנה בלוק שאריתי הפוך (iRMB)37 . ה-iRMB מספק בסיס חישובי יעיל באמצעות קונבולוציות מופרדות בעומק, בעוד רכיב ה-EMA לוכד במפורש אינטראקציות מרחביות בסולם רחב באמצעות עיצוב מקביל רב-ענפי. אינטגרציה זו מאפשרת למודל לכייל מחדש דינמית את משקלי התכונות, תוך התמקדות באזורים המרחביים המבחינים ביותר בקני מידה שונים, ובכך לשפר את הזיהוי תחת חסימה ועבור עצמים קטנים.

שלבי פעולה-יישום
הגדרת מודול: ודא שמוגדר מודול PyTorch מותאם אישית בשם iEMA. מודול זה אמור תחילה ליישם בלוק שאריתי הפוך. בלוק זה בדרך כלל מתחיל בקונבולוציה נקודתית להרחבת ערוץ, אחריה קונבולוציה עומקית (למשל, 3x3) להפקת תכונות מרחביות, ולבסוף קונבולוציה נקודתית להקרנת ערוץ. מיד לאחר חסימה זו, יש ליישם את מנגנון תשומת הלב של EMA. מנגנון ה-EMA בדרך כלל עושה שימוש בקונבולוציות מקובצות ואינטראקציות בין-ממדיות כדי ליצור ביעילות מפת תשומת לב מרחבית רב-קנית ללא עומס חישובי מופרז. מבנה מודול iEMA מוצג באיור 5.

עריכת קובץ קונפיגורציה: בקובץ config.yaml, אתר את החלקים שמגדירים את רשת הצוואר, במיוחד השכבות שמגיעות מיד אחרי מודולי C2f. במיקומים אסטרטגיים אלו, הכנס שכבה חדשה שקוראת למודול iEMA.

מוטיבציה עיצובית: מודול iEMA מבוסס על עקרון שיפור יכולת ההבחנה בין תכונות על ידי שילוב חילוץ תכונות מקומי (באמצעות קונבולוציה עומקית) עם מנגנון מידול הקשר גלובלי קל אך יעיל (EMA). גישה היברידית זו מאפשרת למודל להתמקד באופן אדפטיבי באזורים אינפורמטיביים בקני מידה שונים, דבר קריטי לזיהוי לוגואים וטקסטים של מותגים גלויים חלקית.

החלפת ראש הגילוי במודול DynamicHead
היגיון ועקרון עיצוב: ראש הגילוי המקורי עשוי שלא להתמודד בצורה מיטבית עם השונות המשמעותית בקנה המידה של קופסאות הסיגריות והאינטראקציה המורכבת בין משימות לוקליזציה וסיווג. מודול DynamicHead מטפל בכך על ידי איחוד שלוש צורות של תשומת לב למבנה קוהרנטי: מודע לסקאלה, מודע למרחב, ומודע למשימה. הרכיב המודע לקנה מידה ממזג באופן דינמי תכונות מרמות שונות של פירמידת התכונות, ומבטיח שאובייקטים בכל הגדלים מיוצגים ביעילות. הרכיב המודע למרחב משתמש באסטרטגיית דגימה דלילה כדי למקד משאבים חישוביים באזורים המידעיים ביותר במפות התכונות. הרכיב המודע למשימות מתאים את ייצוג התכונות במיוחד למטרות הייחודיות של רגרסיית תיבת הגבולות וסיווג קטגוריות. גישה מאוחדת זו מובילה לתחזיות מדויקות וחזקות יותר.

שלבי פעולה-יישום
הגדרת מודול: זהו מודול מורכב הכולל את שלושת מנגנוני הקשב המתוארים במשוואות (1) עד (4). המבנה הפנימי שלו יכלול שכבות לחישוב משקלים לפי קנה מידה, ביצוע תשומת לב מרחבית מעוותת ויישום טרנספורמציות תכונות ספציפיות למשימה.

משוואה 1(1)

משוואה 2(2)

משוואה 3(3)

משוואה 4(4)

כאשר WL(F) מציין את מיפוי התכונות הסופי המעודכן על ידי תשומת הלב, המתקבלת על ידי יישום סדרי של מנגנוני קשב πL(F), π S(F) מודעת למרחב, ו-C(F) π-מודע למשימה על תכונת הקלט F. בפרט, במשוואה (2), π L(F) מחשב משקל תשומת לב לפי סקאלה על ידי ממוצע ראשוני בין ממדים מרחביים (S) וערוץ (C), מעביר אותו דרך פונקציה ליניארית f(⋅) והפעלה קשה-סיגמואיד σ(⋅). במשוואה (3), π S(F) מבצעת תשומת לב מרחבית דלילה על ידי צבירת תכונות מנקודות מפתח מדוגמות pk, כל אחת עם הסטה ללמידה Δpk להתמקדות באזורים מבחינים וסקלר חשיבותΔmk. במשוואה (4), πC(F) מיישם תשומת לב מודעת למשימה על ידי יישום טרנספורמציה ליניארית (הנשלטת על ידי פרמטרים שנלמדו (α1, β1,α 2,β 2)) על כל ערוץ ובחירת התגובה המרבית, מה שמאפשר לראש להתמחות במשימות סיווג ורגרסיה. מבנה מודול DynamicHead מוצג באיור 6.

עריכת קובץ קונפיגורציה: בקובץ config.yaml, מצא את החלק שמגדיר את ראש המודל, שמכיל במקור את מודול ה-Detect (Detect Module). החליפו אותו בכניסה חדשה שקוראת למודול DynamicHead.

מוטיבציה עיצובית: מודול DynamicHead מבוסס על התצפית שראשי זיהוי עצמים צריכים להיות אדפטיביים לקנה מידה, מיקום מרחבי ומשימה. מסגרת תשומת הלב המאוחדת שלה, שפורמלית ב-Eqs. (1-4), מאפשר למודל לכייל מחדש דינמית את תגובות התכונות בהתבסס על שלושת הממדים הללו, מה שמוביל לחיזויים עמידים יותר מול שונות בקנה מידה ועבוש רקע.

אימון מודלים
ודא ש-PyTorch 2.1.0, CUDA 12.1 וכל התלויות מותקנים.

פיקוד אימונים
לפני אימון מחדש, יש להכין את נתוני התמונה המחולקת ואת נתוני ההערות בפורמט זיהוי חד-שלבי סטנדרטי. צור קובץ .yaml המכיל את נתיב התמונה וקטגוריית הנתונים. לפי שיפור המודל, קובץ ה-.yaml המקורי של הגלאי מוחלף בקובץ .yaml המוצע של המודל. כתוב את קובץ train.py, ייבא את חבילת הגלאי החד-שלבית, טעין את מודל האימון ונתיב הנתונים, והגדר כמה פרמטרי אימון, כולל imgze=640, epochs=100, אצ'ה=4, workers=0, device='0', אופטימיזr='SGD', close_mosaic=10, וכו'.

היפרפרמטרים: הפרמטרים המרכזיים הם: גודל תמונה קלט (640 x 640), גודל אצווה (4), קצב למידה התחלתי (0.01) עם מתזמן אנילינג קוסינוס, אופטימיזר SGD עם תנע (0.937), ודעיכת משקל (0.0005). הגברת פסיפס מופעלת כברירת מחדל.

ניטור ההכשרה: תהליך ההכשרה יפיק מדדים לכל תקופה. עקוב אחרי העקומות לאובדן אימון/אימות ו-mAP ב-0.5 כדי להבטיח התכנסות ולמנוע התאמת יתר. אימון ל-100 אפוקים בדרך כלל מספיק.

הערכת ופריסת מודלים
הערכה: אחרי האימון, המודל הטוב ביותר נשמר כריצות/אימון/ניסיון ניסיון/משקולות/הטוב ביותר.נקודה. העריך את זה על ערכת הערך באמצעות: bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. הסקריפט יפיק דיוק, Recall, mAP ב-0.5 וכו'. וודא שה-mAP עומד בסף הנדרש (למשל, 97.9%).

הסקה לאימות: הרץ הסקה על תמונות דגימות כדי לאמת ויזואלית תוצאות גילוי: bash python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. על ידי אימות ההיגיון, ניתן להשיג את תוצאות הגילוי של כל תמונה ואת מהירות הגילוי של המודל.

פריסה: לפריסה בזמן אמת במערכת מנוף הערם, המרו את מודל PyTorch (best.pt, ~4.7 MB) לפורמט כמו TensorRT או ONNX למהירות הסקה אופטימלית. התוצאה הסופית היא תיבות הגבלה עם תוויות מחלקות (שמות מותגים) וציוני ביטחון.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סביבה ניסיונית והגדרת פרמטרים
ניסויים לאימות ביצועי המודל המוצע נערכו על מסגרת הלמידה העמוקה PyTorch, ופרטי סביבת הניסוי מפורטים בטבלה 1. כאן השתמשנו במאגר נתונים מיוחד שכלל 6,602 תמונות שחולק באקראי לקבוצות אימון, אימות ובדיקות ביחס של 7:2:1. כל הניסויים השתמשו בתמונות קלט ברזולוציה של 640 על 640 עם קצב למידה התחלתי של 0.01, אשר אופטימיזציה על ידי ירידת גרדיאנט סטוכסטית עם תנע של 0.937 כדי למנוע התאמת יתר. במהלך האימונים, נעשה שימוש בהרחבת פסיפס לעיבוד ארבע תמונות בכל איטרציה כדי לגו...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פשרה בין דיוק ליעילות
הישג מרכזי של מודל זה הוא האיזון המעולה בין דיוק ליעילות חישובית. כפי שמודגם בטבלה 2, המודל המוצג משיג את ה-mAP הגבוה ביותר ובו זמנית יש לו את מספר הפרמטרים הנמוך ביותר ואת ה-FLOPs השני הנמוכים ביותר בין מודלי הגלאי החד-שלבי בהשוואה. זה מתורגם ישירות ליתרונות מעשיים: דגם קטן יותר מהיר יותר לפריסת, דורש פחות זיכרון, ויש לו פחות השהיה וצריכה אנרגיה נמוכים יותר הן ב-GPU והן בחומרת הקצה. דבר זה הופך אותו למתאים במיוחד ליישומים בזמן א...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים שאין אינטרסים פיננסיים ישירים מתחרים. מחקר זה נערך בשיתוף פעולה עם חברת לונגיאן טבק תעשייתית, בע"מ, שם עובדים המחברים הונגלי דנג ווונצ'ן לי, ועם מפעל הסיגריות באוג'י, שם עובד הסופר באובין לואו. שיוכים אלו סיפקו את תרחיש הבקשה ואת נתוני השטח למחקר. המחברים האקדמיים (ג'ון ליו, ג'יאנגואנג יי, פנג יאנג, שיאובו ג'או) מצהירים שאין ניגודי עניינים פיננסיים או לא-פיננסיים בנוגע לפרסום עבודה זו.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עבודה זו נתמכה כלכלית על ידי שיטת מדידת הטמפרטורה ליציקת בילט המבוססת על רפלקטור מוקדם ורב-אורך גל (מס' LZY24E050002) במימון קרנות משותפות של קרן המדע הטבעי של מחוז ג'ג'יאנג בסין, ובאמצעות שיטת מדידת שדה הטמפרטורה המקוונת של חלל מצקת לא סגור ולא איזותרמי (מס' 2023K231) במימון פרויקט תכנון המדע והטכנולוגיה של צ'וז'ואו.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
קורא קודיםHikvisionID5050ציוד Hikvision: משמש לקריאת ברקודים על משטחים, צריך לחבר ספק כוח 24V
מצלמה תעשייתיתHikvisionMV-CA013-A0GM, MV-CS016-10GMצריך לחבר ספק כוח 24V
נורת LEDהיקרובוטMV-LLDS-1002-38-Wמקור אור של מטר אחד מספק תנאי תאורה מספקים למצלמה
עדשהHikvisionMVL-HF0828M-6MPEאורך מוקד: 8 מ"מ, טווח צמצם: F2.8~F16, פיקסל: 6 מיליון
MVSHikvisionV4.5.1תוכנת Hikvision: משמשת לניפוי שגיאות במצלמות, הגדרת פרמטרים של מצלמה ואיסוף נתונים
פיצ'ארםJetBrains2020.1.3 x64משמש לאימון מודלים של למידה עמוקה ולפיתוח מערכות גילוי
מספר תושבות מתכתחברת לונגיאן טבק תעשייתית, בע"מ.סגסוגת אלומיניום 7075-T6משמש לתיקון מצלמות וקוראי קודים
מספר כבלי רשתחברת לונגיאן טבק תעשייתית, בע"מ.ראש קריסטל RJ45לחבר את תחנת הבסיס בין המחשב התעשייתי לנקודת הגישה האלחוטית, לחבר את המצלמה והמתג, וכדומה
סוויץ'TP-LinkTL-SH1005ישנם 8 ממשקי כבל Ethernet שדורשים ספק כוח של 220V
ויז'ן מאסטרHikvisionV4.3.0תוכנת Hikvision: משמשת להתאמת תבניות וזיהוי תוצאות תמונה
התקן AP אלחוטישאנדונג חואצ'ואנגשונליאןBH-ANT5158S-14HV, BH-MS-AC1600HWHעקב התנועה בקנה מידה גדול הנדרש על ידי מנוף הסטאקרים, כבל הרשת אינו יכול לחבר את המצלמה למחשב התעשייתי, ונדרש התקן AP אלחוטי כדי להבטיח תפעול חלק של רשת המצלמות

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
הסרטון יגיע בקרוב

מאמרים קשורים