مقالة بحثية

نموذج اكتشاف الكائنات في الوقت الحقيقي لتحديد علامة السجائر بناء على بنية انحدار أحادية المرحلة المحسنة

DOI:

10.3791/69657

يناير 9, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لمعالجة تحديات مثل الإغلاق وتغيرات الإضاءة في المستودعات الآلية، تقدم هذه الورقة بنية انحدار أحادية المرحلة محسنة لاكتشاف علامات علب السجائر. من خلال دمج الأخذ القياسي التكيفي، وآلية انتباه متعددة المقاييس مقلوبة وفعالة، ورأس كشف ديناميكي، يحقق النموذج المقترح جردا دقيقا وذكيا في الوقت الحقيقي.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يواجه التعرف البصري على مخزون السجائر الآلي عقبات كبيرة، بما في ذلك تغييرات في الإضاءة، وتنوع أبعاد الصناديق، وانسداد جزئي للميزات، مما يعقد التحقق من العلامة التجارية واكتشاف الصناديق في أماكن خاطئة. تقترح هذه المقالة نموذجا محسنا للكشف في الوقت الحقيقي للتعامل مع مشاكل التعرف على الصور وتحسين الدقة. أولا، يتم نشر وحدة تقليل العينة التكيفية لتحل محل وحدة الالتفاف في كل من الشبكة العمودية والعنق لسلسلة YOLO ككاشف أساسي أو كاشف أصلي، مما يحتفظ فعليا بمزيد من التفاصيل التفصيلية ويحقق خفة وزن النموذج. ثانيا، يتم تقديم وحدة انتباه متعددة المقاييس مقلوبة وفعالة لالتقاط معلومات السياق المكاني لمقاييس مختلفة وتوليد خريطة انتباه مكانية أكثر دقة، مما يحسن دقة التنبؤ بالنموذج الأساسي للميزات المعقدة وأهداف الإخفاء. أخيرا، تستبدل وحدة رأس الكشف الديناميكي رأس الكشف الأصلي للنموذج الأساسي وتقوم باكتشاف الأجسام متعدد المقاييس على خريطة الميزات المستخرجة من شبكات العمود الفقري والرقبة لتحقيق تحديد دقيق وتقسيم فئات للهدف المتوقع. لتقييم أداء النموذج المحسن في الميدان، أنشأنا مجموعة بيانات بصرية لعلامة علب السجائر. تم تعزيز مجموعة البيانات باستخدام تقنيات النسخ واللصق الخاصة بالمنطقة وتقنيات التعزيز التقليدية، وتشمل مجموعة البيانات التي تم الحصول عليها خلفية معقدة، وحجبها، وتداخلها، وهدف صغير، وعوامل أخرى. تظهر التجربة أن النموذج المحسن المعروض في هذا المقال يلبي بشكل فعال متطلبات الكشف في الوقت الحقيقي في الميدان. يحقق النموذج المقترح mAP بنسبة 97.9٪، مع معاملات وFLOPs تبلغ 1,849,679 و5.1 G على التوالي. مقارنة بالنموذج الأساسي، يحسن النموذج المقترح mAP بنسبة 0.9٪ مع تقليل المعاملات بنسبة 28.78٪ وعمليات الفاصلة العائمة بمقدار 1.4 G. بالإضافة إلى ذلك، يصل النموذج إلى سرعة استدلال تبلغ 38.5 قدما في الثانية، مما يلبي متطلبات الكشف الصناعي في الوقت الحقيقي.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تعتمد التصنيع واللوجستيات الحديثة بشكل كبير على أنظمة التخزين والاسترجاع الآلي (AS/RS)1 لتحقيق تخزين عالي الكثافة، ومعالجة مواد فعالة، وإدارة جرد دقيقة. أصبح AS/RS وسيلة حيوية تساعد المؤسسات على تحسين كفاءة المستودعات وتقليل التكاليف، وذلك بفضل كفاءته العالية وخصائصه الذكية. بفضل أساس من رفوف متعددة الطبقات، ومعدات تحميل وتفريغ متنوعة، يعد نظام AS/RS نظام ميكاترونكس يتحكم فيه الكمبيوتر، ويدمج تقنيات متعددة تشمل الميكانيكا والإلكترونيات وعلوم الحاسوب والاتصالات والشبكات والحساسات والتحكم الآلي 2,3. يحقق AS/RS كفاءة ودقة وسلامة التخزين والتعامل مع البضائع من خلال دمج وتحسين الرفوف، ورافعات التكديس، وخطوط النقل، وأنظمة التحكم، وغيرها من المعدات، مما يعزز كفاءة التخزين بشكل كبير. يتيح دمج الرؤية الحاسوبية في AS/RS، وهو جانب رئيسي من الصناعة 4.0، مستويات غير مسبوقة من الأتمتة والذكاء من خلال تمكين الأنظمة من رؤية واتخاذ قرارات بناء على البيانات البصرية4.

مع انتشار تطبيق AS/RS في مصانع التبغ5، تم اقتراح شرط جديد لجرد العلامات التجارية لصناديق السجائر. تعاني طرق الجرد اليدوي التقليدية من عدم الكفاءة، ومعدلات الكشف الخاطئ العالية، ومخاطر السلامة، والتي لا تلبي احتياجات AS/RS. مع التقدم المستمر لتقنية الرؤية الحاسوبية، يتم تطبيق حلول الرؤية الآلية بشكل متزايد في مجالات الفحص الصناعي 6,7,8. نظرا لأن معلومات العلامة التجارية ذات الأنماط والنصوص الفريدة مطبوعة على كل علبة سيجارة، فإن تقنية التعرف على الصور المعتمدة على الرؤية الآلية تتيح تحديد علامة علب السجائر وتخزينها.

منذ عام 2012، حققت خوارزميات اكتشاف الكائنات القائمة على التعلم العميق اختراقات كبيرة في مجال التعرف على الصور 9,10,11. من نماذج اكتشاف الأجسام ذات المرحلتين المبكرة مثل R-CNN12 إلى نماذج كشف الأجسام أحادية المرحلة المعاصرة التي تهيمن عليها نماذج سلسلة YOLO ككاشف أساسي أو كاشفأصلي 13,14,15، قدمت هذه الأساليب مساهمة كبيرة في تطوير خوارزميات كشف الأجسام. تستخدم مهام الجرد الذكية نماذج اكتشاف الأجسام بشكل متزايد لتحديد وتحديد مواقع عدة أهداف بدقة في الصور أو الفيديوهات. اقترح لي وآخرون طريقة ذكية للجرد تدمج حساسات الوزن وتقنية التعرف على الصور لتحسين كفاءة القياس والدقة. استخدم وانغ وآخرون قناع R-CNN لتقسيم رقم رف الكتب وموقع العنوان من صورة عمود الكتاب. صمم صن وآخرون نظام تعرف بصري متكامل، استخدم OpenCV للتعرف على الرموز ثنائية الأبعاد على المواد والرفوف في وضع متعدد الأوضاع. قاموا بتحسين الكاشف الأصلي (v5s) من خلال إدخال آلية الانتباه C3CBAM وتعيين ملصق SimOTA لتعزيز وظائف الفقدان من أجل الكشف الدقيق عن المواد المتعددة.

في مجال اكتشاف الأجسام، بينما تتمتع النماذج ذات المرحلتين — الممثلة ب Faster R-CNN — بمزايا تقليدية في دقة الكشف، فإن آليات توليد اقتراحات المناطق المعقدة تؤدي إلى سرعات استنتاج بطيئة نسبيا. وبالتالي، تواجه صعوبة في تلبية المتطلبات الصارمة للأداء في الوقت الحقيقي في سيناريوهات الصناعة19,20. على النقيض من ذلك، تعامل بنية الانحدار اكتشاف الكائنات كمشكلة انحدار واحدة، حيث تتنبأ مباشرة بمواقع الأهداف واحتمالات الفئات من الصور المدخلة. يتيح هذا التصميم المعماري للنماذج التفوق بشكل ملحوظ على معظم نماذج المرحلتين من حيث كفاءة الاستدلال، وخفة الوزن، ومرونة النشر، مع الحفاظ على الدقة التنافسية. لذا، أصبحت هذه البنية الحل المفضل للكشف الصناعي في الوقت الحقيقي21.

يستمر النظام البيئي الأصلي للنماذج في التطور بسرعة، مع معالجة النماذج الحديثة لتحديات محددة. على سبيل المثال، يركز الكاشف الأصلي (v12)22 على تعزيز تحسين وقت التدريب وتحسين البنية لتحقيق مفاضلات أفضل بين الدقة والكفاءة. وفي الوقت نفسه، يقدم الكاشف الأصلي (World)23 قدرات كشف المفردات المفتوحة، مما يتيح الاستنتاج في الوقت الحقيقي لمجموعة واسعة من الكائنات خارج فئات مجموعة التدريب من خلال الاستفادة من نمذجة الرؤية واللغات. بينما تدفع هذه التطورات حدود اكتشاف الأجسام العامة، يركز هذا العمل على تطبيق صناعي متخصص حيث تكون المتانة أمام تحديات محددة، مثل الانسداد الجزئي وتباين الإضاءة، أمرا بالغ الأهمية، ويكون فضاء الفئة ثابتا ومعروفا مسبقا. باعتباره النسخة الأكثر سخونة من هذه العائلة النماذجية، يرث الطرازالأساسي 24 مزايا من الكاشف الأصلي (v8)25,26; لا تقلل فقط من عدد معلمات النموذج، بل تأخذ أيضا في الاعتبار التوازن بين كفاءة الكشف والدقة. مقارنة بنماذج اكتشاف الأجسام الأخرى، تبرز في مهام التعرف البصري.

التحدي في اكتشاف صناديق سجائر صغيرة أو مسدودة جزئيا هو تجل لمشكلة أوسع في رؤية الحاسوب. تم البحث بنشاط في اكتشاف الأجسام الصغيرة، مع طرق تتراوح بين تحسينات شبكة هرم الميزات (FPN)27 إلى آليات الانتباه الواعية للسياق، التي تلهم دمج معالجة الميزات متعددة المقاييس. علاوة على ذلك، يتطلب السعي لتحقيق كفاءة تشغيلية في بيئة صناعية تصميم نموذج خفيف الوزن. مستوحاة من مفاهيم العمارة الفعالة التي استكشفها MobileNetV328 وGhostNet29، تستخدم هذه المفاهيم الالتفاف العميق والتحويل الخطي لتقليل تعقيد الحسابات مع الحفاظ على القدرة على العرض، لذا نختار بعض الوحدات الخفيفة لتحسين النموذج. لذلك، للتعامل مع جرد علامات صناديق السجائر والعوامل المؤثرة في المخزون، مثل تغيرات الإضاءة، واختلافات حجم الميزات بين العلامات التجارية المختلفة، والانسداد الجزئي بين صناديق السجائر، نقترح في هذا المقال نموذج محسن لاكتشاف الكائنات في بنية الانحدار أحادية المرحلة.

الابتكارات الرئيسية للنموذج المقترح ثلاثية. أولا، تم نشر وحدة تقليل العينات التكيفية (ADown)30لتحل محل التقليل الالتصافي الالتفافي القياسي في كل من الشبكة العمودية والرقبة. هذا التصميم الجديد يقلل من فقدان المعلومات أثناء ضغط الميزات، وهو أمر بالغ الأهمية للحفاظ على شعارات ونصوص العلامات التجارية الصغيرة. ثانيا، تم تقديم آلية الانتباه الفعال متعدد المقاييس (iEMA) المقلوبة لتمكين النموذج من الإدراك السياقي الديناميكي متعدد المقاييس، مما يعزز بشكل كبير أدائه على علب السجائر الصغيرة والمغلقة جزئيا. ثالثا، تم استبدال رأس الكشف الأصلي بوحدة DynamicHead31 ، التي توحد الانتباه للمقياس والمكان، والانتباه الواعي للمهام، مما يتيح تحديد موقعا وتصنيفا أكثر دقة عبر الأهداف ذات الأحجام المختلفة تماما. تم تصميم هذه التعديلات المعمارية بشكل متماسك لمعالجة نقاط الألم المحددة في تحديد علامات السجائر التجارية في البيئات الصناعية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم الحصول على مجموعة البيانات المستخدمة في هذا المقال من حقل AS/RS في قسم اللوجستيات في شركة لونغيان لصناعة التبغ. لم تشمل هذه الدراسة مشاركين بشريين أو. لم تكن هناك حاجة لموافقة أخلاقية.

جمع وإعداد مجموعة البيانات
تكوين الأجهزة: تركيب كاميرا صناعية (مثل MV-CA013-A0GM) مزودة بعدسة بؤرة 8 مم (مثل MVL-HF0828M-6MPE) على منصة الشحن في رافعة التكديس. قم بتوصيل الكاميرا بجهاز تحكم عبر كابل GigE وجهاز وصول لاسلكي (مثل BH-ANT5158S-14HV، BH-MS-AC1600HWH). ضع ضوء LED شريطي (مثل MV-LLDS-1002-38-W) حول الكاميرا لضمان إضاءة متجانسة.

إعداد معلمات الكاميرا: قم بتكوين الكاميرا باستخدام برنامج الشركة المصنعة (مثل MVS). اضبط دقة الاستحواذ على 1280 × 1024 بكسل. اضبط وضع الزناد على زناد الأجهزة وقم بمزامنها مع نظام تحديد المواقع في رافعة المكدسة. اضبط وقت التعريض إلى 100 مللي ثانية والكسب إلى 5 ديسيبل لتقليل ضبابية الحركة والضوضاء. المسافة بين الكاميرا وعلب السجائر حوالي 550 مم.

مجموعة الصور: تلتقط كاميرا صناعية مزودة بمشغل صورة تلقائيا في كل مرة يتم فيها وضع صينية أثناء تخزين واسترجاع صناديق السجائر. جمع ما مجموعه 4,835 صورة خام؛ تظهر الصور النموذجية في الشكل 1.

تعليق الصورة: استخدم أداة المصدر المفتوح LabelImg. لكل صورة، ارسم صناديق محيطة حول كل ميزة ظاهرة لعلامة السيجارة. تعيين اسم العلامة التجارية الصحيح (مثل هونغتشوانغ، جوتيان) كمسمى فئة لكل صندوق محيط. احفظ التعليقات بصيغة كشف أحادية المرحلة القياسية، مع ملف نص واحد لكل صورة.

مراقبة الجودة: يقوم معلق ثان بمراجعة 20٪ من الصور المشروحة المختارة عشوائيا. يتم مناقشة وحل أي تناقضات، لضمان اتساق التصنيف.

استراتيجية تعزيز البيانات
هذا القسم يوضح تقنيات التعزيز التقليدية والمتقدمة المطبقة على مجموعات البيانات. يتم دمج البيانات الأولية والبيانات المعززة في مجموعة بيانات جديدة، ثم تقسم إلى مجموعة تدريب، مجموعة تحقق، ومجموعة اختبار لضمان العدالة في التقييم.

تعزيز البيانات التقليدي32: يتم تطبيق هذه التحويلات في الوقت الحقيقي بواسطة خط أنابيب التدريب (مثل استخدام مكتبات Albumentations أو PyTorch Transforms) مع احتمال محدد لكل دفعة.

التحويلات الهندسية: الدوران: تدوير الصور عشوائيا بزاوية بين -45° و+45°. التكبير: تكبير الصور عشوائيا بعامل يتراوح بين 0.8 و1.2. الانقلاب الأفقي: قلب الصور عشوائيا أفقيا بنسبة 100٪. القص العشوائي: اقتصاص قسما عشوائيا بين 80٪ و100٪ من مساحة الصورة الأصلية.

التحويلات الضوئية: السطوع والتباين: ضبط السطوع والتباين بواسطة عامل يتم اختياره عشوائيا من [0.6، 1.4]. ضوضاء غاوسي: أضف ضوضاء غاوسية مع انحراف معياري يتم اختياره عشوائيا من [0, 0.01 * 255] إلى 10٪ من الصور. ضباب غاوسي: تطبيق ضباب غاوسي بحجم نواة من 3x3 إلى 10٪ من الصور.

محاكاة الإخفاء: ضع عشوائيا من 1 إلى 3 رقع إخفاء مستطيلة (تغطي كل منها ما يصل إلى 5٪ من مساحة الصورة) على الصور. الرقع مليئة بالضوضاء العشوائية أو متوسط قيم بكسل الصورة.

تعزيز البيانات المتقدم: نسخ ولصق حسب المنطقة
الدافع والأثر: كان الدافع الأساسي لهذا التعزيز المستهدف هو معالجة مشكلة بيانات حاسمة: فقد كان لدى العديد من علامات السجائر حالات قليلة جدا (حتى صورة واحدة). يمكن أن يخصص تقسيم اختبار التحقق العشوائي القياسي من القطار جميع نسخ علامة نادرة إلى مجموعة واحدة (أي جميعها لمجموعة الاختبار)، مما يجعل النموذج لا يحصل على فرصة لتعلم أو التحقق من صحة تلك العلامة التجارية. وقد زادت هذه الطريقة بشكل مصطنع حجم العينة لهذه العلامات التجارية الممثلة تمثيلا ناقصا، لضمان أن كل علامة تجارية لديها عدد كاف من الحالات موزعة عبر مجموعات التدريب والتحقق والاختبار. تمنع هذه الخطوة الأساسية الفشل الكارثي في الفئات النادرة وهي شرط مسبق لأي أداء نموذج ذي معنى وتعميم على مجموعة العلامات التجارية الكاملة.

تتطلب هذه الخطوة نموذج أساس مقطعي مدرب مسبقا على مجموعة البيانات الأولية ونموذج Segment Anything Model (SAM)33.

كائنات مصدر القطاع: لصور صناديق السجائر من العلامات التجارية الممثلة تمثيلا ناقصا، استخدم نموذج SAM لإنشاء أقنعة تقسيم دقيقة. استخدم وضع التوجيه النقطي، وانقر على ميزة العلامة التجارية في صندوق السجائر لبدء التقسيم. تحقق يدويا وقم بتحسين الأقنعة المولدة لضمان الدقة. احفظ صور علبة السجائر المقسمة ذات الخلفيات الشفافة كملفات PNG. هذا ينشئ مكتبة من حالات الكائنات المعزولة.

توليد أقنعة الخلفية: استخدم نموذج الخط الأساسي المقطع المدرب مسبقا لإجراء تقسيم النسخة على مجموعة من صور الخلفية (صور ذات مساحة واسعة أو خلفيات بسيطة). سيخرج النموذج أقنعة ثنائية تشير إلى المناطق التي تشغلها الأجسام بالفعل.

معالجة الأقنعة وكائنات اللصق: لكل قناع خلفية، استخدم مكتبة OpenCV (دالة 'cv2.approxPolyDP' بعامل إبسيلون 0.02 * محيط الكونتور) لإجراء ملاءمة منحنية وخطية حواف القناع، مما يحصل على تمثيل مضلع مبسط للمساحة الحرة. حدد أكبر منطقة مضلعة متجاورة داخل قناع الخلفية كمنطقة المعجون المستهدف. اختر كائن المصدر المقسم عشوائيا من المكتبة. إعادة حجمه (مع الحفاظ على نسبة العرض إلى الارتفاع) وتطبيق تحويل أفيني (دوران بسيط بين -5° و+5°، وقص طفيف) ليتناسب بشكل طبيعي مع منطقة المعجون المستهدفة، لضمان عدم تداخله مع حدود الأجسام الموجودة. استخدم دمج ألفا للصق الكائن المحول بسلاسة على صورة الخلفية في الموقع المحسوب. الإطار العام لتقنية تعزيز البيانات المعتمد على تقنية النسخ واللصق في مجالات محددة موضح في الشكل 2. تولد برمجيا ملف تعليقات txt جديد مقابل للكائن الملصق، مع تحديث إحداثيات صندوق الإحدار وتسمية الفئة.

مجموعة البيانات المعدلة النهائية: هذه العملية غير المتصلة بالإنترنت تولد 600 صورة اصطناعية جديدة. اجمعها مع 4,835 صورة أصلية و1,167 صورة إضافية تم إنشاؤها بتطبيق تقنيات التعزيز التقليدية كما هو موضح أعلاه لتشكيل مجموعة البيانات النهائية التي تضم 6,602 صورة. قسم مجموعة البيانات النهائية إلى مجموعات تدريب (70٪، 4,621 صورة)، التحقق (20٪، 1,320 صورة)، والاختبار (10٪، 661 صورة)، لضمان بقاء الصور من نفس التسلسل الأصلي ضمن نفس التقسيم لمنع تسرب البيانات.

تعديل النموذج لبناء الكاشف المحسن المقترح
حققت خوارزميات الكشف عن الأجسامالمحسنة 34 تقدما ملحوظا في التفتيش الصناعي خلال السنوات الأخيرة. يوفر هذا القسم إجراء مفصلا خطوة بخطوة لتعديل بنية النموذج الأساسي لإنشاء النموذج المقترح. يتم تنفيذ التعديلات عن طريق تحرير ملف تكوين النموذج (مثل config.yaml) والتأكد من تضمين تعريفات الوحدات المخصصة المقابلة في قاعدة الكود. يتم تقديم مبررات كل تعديل لتوضيح دوره في معالجة تحديات الكشف المحددة. هيكل النموذج المقترح موضح في الشكل 3.

استبدال وحدات التقليل من العينات بوحدة ADown: تستخدم وحدة Convolution-BatchNorm-SiLU القياسية المستخدمة في التقليل العينات الالتفافية ذات شريط واحد، والتي يمكن أن تعمل كعنق زجاجة معلومات35، مما قد يتخلى عن الميزات الدقيقة الحبيبية التي يجب التعرف عليها في صناديق السجائر الصغيرة وشعارات العلامات التجارية التفصيلية. تم تصميم وحدة ADown لتخفيف ذلك من خلال تنفيذ هيكل فرعي مزدوج يلتقط ويحافظ على مجموعة أغنى من الميزات أثناء تقليل الدقة المكانية. يركز فرع واحد على الاحتفاظ بالتفاصيل المحلية عالية التردد، بينما يأخذ الآخر نظرة عامة أوسع وغنية بالسياق. يؤدي دمج هذه الميزات التكميلية إلى تمثيل أكثر قوة ومعلوماتية للطبقات التالية.

خطوات التنفيذ
تعريف الوحدة: تأكد من أن وحدة PyTorch مخصصة باسم ADown محددة ضمن ملفات تعريف النموذج الخاصة بالمشروع. يجب أن تحتوي هذه الوحدة على فرعين متوازيين. يجب أن يتكون الفرع الأول من طبقة التفاف ثنائية الأبعاد مع نواة 3x3 وخطوة بحجم 2. يجب أن يتكون الفرع الثاني بشكل تسلسلي من طبقة تجميع قصوى 2x2 (مع خطوة 2) تليها طبقة الالتفاف 1x1. يجب ربط مخرجات هذين الفرعين على طول بعد القناة، ثم تمر خريطة الميزة الناتجة عبر طبقة الالتفاف النهائية 1x1 لتكامل القنوات وإنتاج المخرج. هيكل وحدة ADown موضح في الشكل 4.

تحرير ملف التكوين: افتح ملف تكوين النموذج الأساسي (config.yaml). تحديد كل حالة من وحدة CBS تم تكوينها لتقليل العينات بشكل منهجي (أي حيث يتم تعيين معامل stride على 2). استبدل كل من هذه الإدخالات في وحدة CBS بوحدة ADown الجديدة.

دافع التصميم: تصميم ADown مدفوع بالحاجة إلى تقليل فقدان المعلومات في التفافيات الشرائط القياسية، والتي قد تكون ضارة بالأشياء الصغيرة. هيكله ذو الفرعين مستوحى من فكرة المعالجة المتوازية لالتقاط كل من التفاصيل المكانية عالية التردد (عبر الالتفاف) والمعلومات السياقية منخفضة التردد (عبر التجميع)، مما يوفر تمثيلا أكثر ثراء متعدد المقاييس للميزات للطبقات التالية.

تكامل وحدة iEMA
المبرر ومبدأ التصميم: لتعزيز قدرة النموذج على اكتشاف الأهداف الصغيرة وتلك التي تكون مخفية جزئيا، من الضروري دمج آلية يمكنها نمذجة السياق المكاني متعدد المقاييس بفعالية. تحقق وحدة iEMA ذلك من خلال تضمين مكون الانتباه متعدد المقاييس الفعال (EMA)36 داخل هيكل كتلة متبقية مقلوبة (iRMB)37 . يوفر iRMB أساسا حسابيا فعالا باستخدام الالتفافات القابلة للفصل من حيث الأعماق، بينما يلتقط مكون EMA بشكل صريح التفاعلات المكانية عبر المقاييس من خلال تصميم متعدد الفروع متوازي. يسمح هذا التكامل للنموذج بإعادة معايرة أوزان الميزات ديناميكيا، مركزا الانتباه على المناطق المكانية الأكثر تمييزا عبر مقاييس مختلفة، مما يحسن التعرف تحت الإخفاء وللأجسام الصغيرة.

خطوات التنفيذ
تعريف الوحدة: تأكد من تعريف وحدة PyTorch مخصصة باسم iEMA. يجب أن تؤخذ هذه الوحدة أولا كتلة متبقية مقلوبة. عادة ما يبدأ هذا الكتلة بالتفاف نقطي لتوسيع القناة، يليه التواء عميق (مثل 3x3) لاستخراج الميزات المكانية، وأخيرا الالتفاف نقطي لإسقاط القناة. مباشرة بعد هذا العقب، يجب تنفيذ آلية الانتباه الEMA. عادة ما تستخدم آلية EMA التفافيات مجمعة وتفاعلات عبر الأبعاد لتوليد خريطة انتباه مكانية متعددة المقاييس بكفاءة دون عبء حسابي مفرط. هيكل وحدة iEMA موضح في الشكل 5.

تحرير ملف التكوين: في ملف تكوين config.yaml، حدد الأقسام التي تحدد شبكة الرقبة، وتحديدا الطبقات التي تلي وحدات C2f مباشرة. في هذه المواقع الاستراتيجية، أدرج طبقة جديدة تستدعي وحدة iEMA.

دافع التصميم: تستند وحدة iEMA إلى مبدأ تعزيز التمييز بين الميزات من خلال دمج استخراج الميزات المحلية (عبر التفاف العمق) مع آلية نمذجة السياق العالمية الخفيفة لكنها فعالة. يسمح هذا النهج الهجين للنموذج بالتركيز التكيفية على المناطق المعلوماتية عبر مقاييس مختلفة، وهو أمر بالغ الأهمية للتعرف على شعارات ونصوص العلامات التجارية المرئية جزئيا.

استبدال رأس الكشف بوحدة DynamicHead
المنطق ومبدأ التصميم: قد لا يتعامل رأس الكشف الأصلي بشكل مثالي مع التفاوت الكبير في مقياس صناديق السجائر والتفاعل المعقد بين مهام تحديد الموقع والتصنيف. تعالج وحدة DynamicHead هذا من خلال توحيد ثلاثة أشكال من الانتباه في هيكل متماسك: الانتباه الواعي بالمقياس، والانتباه المكاني، والانتباه الواعي بالمهمة. يقوم المكون الواعي بالمقياس بدمج الميزات من مستويات مختلفة من هرم الميزات بشكل ديناميكي، مما يضمن تمثيل الكائنات من جميع الأحجام بشكل فعال. يستخدم المكون الواعي المكاني استراتيجية أخذ عينات متفرقة لتركيز الموارد الحسابية على أكثر المناطق إفادة المعلومات داخل خرائط الميزات. يقوم المكون الواعي بالمهام بتكييف تمثيل الميزات خصيصا لتحقيق الأهداف المميزة مثل انحدار صندوق الحدود وتصنيف الفئات. يؤدي هذا النهج الموحد إلى توقعات أكثر دقة وقوة.

خطوات التنفيذ
تعريف الوحدة: هذه وحدة معقدة تشمل الآليات الثلاثة للانتباه الموصوفة في المعادلات (1) إلى (4). سيشمل هيكله الداخلي طبقات لحساب الأوزان حسب المقياس، وأداء الانتباه المكاني القابل للتشوه، وتطبيق تحويلات الميزات الخاصة بالمهمة.

المعادلة 1(1)

المعادلة 2(2)

المعادلة 3(3)

المعادلة 4(4)

حيث يشير WL(F) إلى خريطة الميزة النهائية المكررة بالانتباه، والتي يتم الحصول عليها بتطبيق آليات الانتباه الواعية بالمقياس πL(Fو π S(F) الواعية للمكان، وآليات الانتباه الواعية للمهمة πC(F) على ميزة الإدخال F. تحديدا، في المعادلة (2)، πL(F) يحسب وزن انتباه حسب المقياس عن طريق المتوسط أولا عبر أبعاد مكانية (S) وأبعاد القناة (C)، ثم تمريره عبر دالة خطية f(⋅) وتفعيل سيجمويدي صلب σ(⋅). في المعادلة (3)، يقوم π S(F) بتركيز مكاني متفرق من خلال تجميع ميزات من K نقاط رئيسية مأخوذة من عينات pk، كل منها مع إزاحة قابلة للتعلم Δpk للتركيز على المناطق التمييزية وعدد الأهميةΔmk. في المعادلة (4)، ينفذ πC(F) انتباها واعيا بالمهمة من خلال تطبيق تحويل خطي (يحكمه معلمات مكتسبة (α1، β1،α 2،β 2)) على كل قناة ويختار أقصى استجابة، مما يسمح للرأس بالتخصص في مهام التصنيف والانحدار. هيكل وحدة DynamicHead موضح في الشكل 6.

تحرير ملف التكوين: في ملف config.yaml، ابحث عن القسم الذي يحدد رأس النموذج، والذي يحتوي في الأصل على وحدة Detect (Detect module). استبدلته بإدخال جديد يستدعي وحدة DynamicHead.

دوافع التصميم: تستند وحدة DynamicHead إلى الملاحظة بأن رؤوس اكتشاف الأجسام يجب أن تكون قابلة للتكيف مع الحجم والموقع المكاني والمهام. إطار الانتباه الموحد الخاص به، الذي تم تكليفه رسميا في Eqs. (1-4)، يسمح للنموذج بإعادة معايرة استجابات الميزات ديناميكيا بناء على هذه الأبعاد الثلاثة، مما يؤدي إلى توقعات أكثر متانة ضد تباين المقياس والفوضى الخلفية.

تدريب النماذج
تأكد من تثبيت PyTorch 2.1.0 وCUDA 12.1 وجميع التبعيات.

قيادة التدريب
قبل إعادة التدريب، جهز بيانات الصورة المقسمة وبيانات التعليقات التوضيحية بصيغة كشف أحادية المرحلة القياسية. أنشئ ملف .yaml يحتوي على مسار الصورة وفئة البيانات. وفقا لتحسين النموذج، يتم استبدال ملف .yaml الأصلي للكاشف بملف .yaml المقترح. اكتب ملف train.py، واستيراد حزمة الكاشف أحادية المرحلة، وحمل نموذج التدريب ومسار البيانات، وضبط بعض معلمات التدريب، بما في ذلك imgze=640، epochs=100، دفعة=4، العمال=0، الجهاز='0'، المحسن='SGD'، close_mosaic=10، وهكذا.

المعلمات الفائقة: المعلمات الرئيسية هي: حجم الصورة المدخلة (640 × 640)، حجم الدفعة (4)، معدل التعلم الأولي (0.01) مع جدولة التلدين الجيب تمام، محسن SGD مع زخم (0.937)، وتناقص الوزن (0.0005). يتم تفعيل تعزيز الفسيفساء بشكل افتراضي.

مراقبة التدريب: ستنتج عملية التدريب مقاييس لكل حقبة. راقب المنحنيات لفقدان التدريب/التحقق وmAP عند 0.5 لضمان التقارب وتجنب الإفراط في التوافق. التدريب لمدة 100 عصر يكون عادة كافيا.

تقييم النماذج ونشرها
التقييم: بعد التدريب، يتم حفظ أفضل نموذج كجري/تدريب/خبرة/أوزان/أفضل نقطة. قم بتقييمه على مجموعة القيمة باستخدام: bash python val.py --data cigarette_dataset.yaml --weights/train/exp/weights/best.pt. سيقوم السكربت بإخراج الدقة، الاستدعاء، mAP عند 0.5، إلخ. تأكد من أن mAP يحقق الحد المطلوب (مثلا 97.9٪).

الاستدلال للتحقق: قم بتشغيل الاستدلال على عينات الصور للتحقق بصريا من نتائج الكشف: bash python detect.py --weights/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. من خلال التحقق من المنطق، يمكن الحصول على نتائج الكشف لكل صورة وسرعة الكشف للنموذج.

النشر: للنشر في الوقت الحقيقي على نظام رافعة المكدمات، قم بتحويل نموذج PyTorch (best.pt، ~4.7 ميجابايت) إلى صيغة مثل TensorRT أو ONNX لتحسين سرعة الاستدلال. النتيجة النهائية هي صناديق محيطة تحمل ملصقات الفئات (أسماء العلامات التجارية) ودرجات الثقة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

البيئة التجريبية وإعداد المعلمات
أجريت تجارب للتحقق من أداء النموذج المقترح على إطار التعلم العميق PyTorch، وتفاصيل البيئة التجريبية مدرجة في الجدول 1. هنا، استخدمنا مجموعة بيانات خاصة تحتوي على 6,602 صورة تم تقسيمها عشوائيا إلى مجموعات تدريب، وتأكيد، واختبار بنسبة 7:2:1. استخدمت جميع التجارب صورا مدخلة بدقة 640 × 640 مع معدل تعلم ابتدائي 0.01، والذي تم تحسينه بواسطة هبوط التدرج العشوائي بزخم 0.937 لمنع التداخل الزائد. خلال التدريب، تم استخدام تعزيز الفسيفساء لمعالجة أربع صور في كل نس...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

مقايضة الدقة والكفاءة
إنجاز مركزي لهذا النموذج هو توازنه الفائق بين الدقة والكفاءة الحاسوبية. كما هو موضح في الجدول 2، يحقق النموذج المعروض أعلى عدد من المعاملات مع وجود أقل عدد من المعلمات وثاني أدنى عدد من العوامل القابلة للتعامل مع الفروع بين نماذج الكاشف أحادية المرحلة المقارنة. وهذا يترجم مباشرة إلى فوائد عملية: النموذج الأصغر أسرع في النشر، ويتطلب ذاكرة أقل، وله زمن استجابة للاستدلال واستهلاك طاقة أقل على كل من وحدة معالجة الرسومات وأجهزة الحافة...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصرح المؤلفون بعدم وجود مصالح مالية متنافسة مباشرة. أجري هذا البحث بالتعاون مع شركة لونغيان للصناعات الصناعية للتبغ، حيث يعمل المؤلفان هونغلي دينغ ووينكان لي، ومصنع باوجي للسجائر حيث يعمل المؤلف باوبين لو. وفرت هذه الانتماءات سيناريو التطبيق والبيانات الميدانية للدراسة. يعلن المؤلفون الأكاديميون (جون ليو، جيانغوانغ يي، فنغ يانغ، شياوبو تشاو) عدم وجود تضارب مالي أو غير مالي في المصالح فيما يتعلق بنشر هذا العمل.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

وقد تم دعم هذا العمل ماليا من خلال طريقة قياس درجة الحرارة لصب القضيب المبني على العاكس السابق والأطوال الموجية متعددة الأطوال (رقم LZY24E050002) الممولة من الصناديق المشتركة لمؤسسة العلوم الطبيعية في مقاطعة تشجيانغ الصينية، وطريقة قياس الحرارة الميداني عبر الإنترنت لتجويف المغرفة غير المغلقة وغير المتساوية الحرارة (رقم 2023K231) الممولة من مشروع تخطيط العلوم والتكنولوجيا في تشوتشو.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
قارئ الشيفرةHikvisionID5050معدات HikVision: تستخدم لقراءة الباركود على المنصات الموسيقية، تحتاج إلى توصيل مصدر طاقة 24 فولت
كاميرا صناعيةHikvisionMV-CA013-A0GM، MV-CS016-10GMأحتاج لتوصيل مزود طاقة 24 فولت
ضوء LEDHIKROBOTMV-LLDS-1002-38-Wيوفر مصدر ضوء شريطي بقطر متر واحد ظروف إضاءة كافية للكاميرا
العدسةHikvisionMVL-HF0828M-6MPEالبعد البؤري: 8 مم، نطاق الفتحة: F2.8~F16، البكسل: 6 ملايين
MVSHikvisionV4.5.1برنامج Hikvision: يستخدم لتصحيح أخطاء الكاميرات، وضبط معلمات الكاميرا، وجمع البيانات
بايتشارمجيت برينز2020.1.3 x64يستخدم في تدريب نماذج التعلم العميق وتطوير أنظمة الكشف
عدة حوامل معدنيةشركة لونغيان للتبغ الصناعية المحدودة.سبيكة الألمنيوم 7075-T6تستخدم لإصلاح الكاميرات وقراءة الرموز
عدة كابلات شبكيةشركة لونغيان للتبغ الصناعية المحدودة.رأس الكريستال RJ45وصل محطة القاعدة بين الكمبيوتر الصناعي ونقطة الوصول اللاسلكية، ووصل الكاميرا والمفتاح، وهكذا
سويثTP-LinkTL-SH1005هناك 8 واجهات كابل إيثرنت تتطلب مصدر طاقة 220 فولت
سيد الرؤيةHikvisionV4.3.0برنامج Hikvision: يستخدم لمطابقة القوالب واكتشاف نتائج الصور
جهاز نقطة وصول لاسلكيةشاندونغ هواتشوانغشونليانBH-ANT5158S-14HV، BH-MS-AC1600HWHنظرا للحركة واسعة النطاق المطلوبة من رافعة التكديس، لا يمكن لكابل الشبكة توصيل الكاميرا بالحاسوب الصناعي، وهناك حاجة إلى جهاز وصول لاسلكي لضمان التشغيل السلس لشبكة الكاميرات

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
الفيديو قريباً

مقالات ذات صلة