للتحقق من فعالية نموذج دمج YOLOv11 وCNN المقترح في مراقبة السلامة في خطوط الإنتاج، تم إنشاء مجموعة بيانات تغطي سيناريوهات مختلفة لمخاطر السلامة. تحتوي مجموعة البيانات هذه على 12,000 صورة لمشاهد خطوط الإنتاج، مقسمة إلى مجموعات تدريب وتحقق واختبار بنسبة 7:1.5:1.5، مع تثبيت البذرة العشوائية عند 42. وتغطي المجموعة ظروف عمل متنوعة، بما في ذلك الإضاءة القياسية، والإضاءة المنخفضة، والانسداد الجزئي، والانسداد الشديد، والضبابية الحركية، والخلفيات المعقدة. تم ضبط حد الثقة للاستدلال عند 0.5، وحد كبت الحد الأقصى غير المرتبط (NMS) عند 0.45. كُررت جميع التجارب ثلاث مرات، وأبلغت النتائج كمتوسط ± الانحراف المعياري. وتتمثل فئات التعليقات التوضيحية في العمال، وخوذات السلامة، والأذرع الروبوتية، والمناطق الخطرة، والأدوات، والمركبات، وذلك باستخدام تنسيق PASCAL Visual Object Classes (VOC). تم ضبط حد التقاطع فوق الاتحاد (IoU) عند 0.5، وتم التحقق من اتساق التعليقات التوضيحية من خلال التحقق المتقاطع بواسطة شخصين. تم تغيير حجم الصور المدخلة بشكل موحد إلى 640 × 640 وتعزيزها ببيانات Mosaic. أُجري التدريب باستخدام محسن SGD بمعدل تعلم أولي قدره 0.01، وزخم 0.9، واضمحلال في الوزن بمقدار 0.0005، وحجم دفعة قدره 32. استمر التدريب لمدة 200 حقبة (epoch)، واستُخدم التلدين الجيبي لضبط معدل التعلم.
لتقييم فعالية النموذج بشكل شامل، تم استخدام مجموعة متنوعة من مقاييس التقييم: متوسط الدقة المتوسطة (mAP)، وعدد الإطارات في الثانية (FPS) لقياس معدل معالجة إطارات الصور، والدقة (precision) لتقييم صحة التنبؤات الإيجابية، والاستدعاء (recall) لقياس قدرة النموذج على اكتشاف الحالات الإيجابية الحقيقية، والمساحة تحت المنحنى (AUC) للإشارة إلى المساحة تحت منحنى خصائص تشغيل المستقبل (ROC)، مما يعكس القدرة التصنيفية العامة للنموذج. تظهر صيغ الحساب في المعادلات (4)، (5)، (6)، (7)، (8)، (9)، (10)، (11):
(4)
(5)
(6)
تذكر أن
(7)
(8)
(9)
(10)
(11)
هنا، يشير mAP@0.5 إلى متوسط الدقة المتوسطة عند عتبة IoU تبلغ 0.5؛ وN هو عدد الفئات؛ وAPi هو الدقة المتوسطة للفئة i؛ وmAP@[0.5:0.95] هو متوسط mAP المحسوب عبر عتبات IoU من 0.5 إلى 0.95. وتمثل TP وFP وFN وTN أعداد الإيجابيات الصحيحة، والإيجابيات الكاذبة، والسلبيات الكاذبة، والسلبيات الصحيحة، على التوالي. أما F فهو العدد الإجمالي للإطارات التي تمت معالجتها، وT هو إجمالي وقت المعالجة، وTPR هو معدل الإيجابيات الصحيحة، وFPR هو معدل الإيجابيات الكاذبة.
بالنسبة لمكون الكشف YOLOv11، تظهر دالة الخسارة في المعادلة (12):
(12)
حيث يشير Lcoord إلى الانحراف بين الإطار المتوقع والإطار الحقيقي، ويقيس Lconf خطأ الثقة للإطار المتوقع، بينما يقيس Lclass خطأ توقع الفئة، وتمثل λcoord و λconf و λclass معاملات الوزن المستخدمة لموازنة الخسائر المقابلة.
يُظهر تحليل البيانات في الجدول 1 أن الطريقة المقترحة تحقق mAP@0.5 بقيمة 0.91 وmAP@0.5:0.95 بقيمة 0.82، وهو ما يمثل تحسناً بمقدار 0.04 و0.04 على التوالي، مقارنة بـ YOLOv5. وتبلغ قيمة F1-score الخاصة بها 0.935، وهي أيضاً أعلى من قيم نماذج المقارنة. تبلغ سرعة الكشف 120 FPS، وهي أربعة أضعاف سرعة Faster R-CNN، ولكنها أقل قليلاً من YOLOv10 وYOLOv11. ويبلغ عدد المعلمات 6.7M، وهو ما يزيد بمقدار 1.5M فقط عن YOLOv11، مع تحسن قدره 0.03 في mAP@0.5. ومقارنة بـ EfficientDet، الذي يمتلك تكلفة حسابية مماثلة، تزيد الدقة بمقدار 0.06، بينما ينخفض عدد المعلمات بنسبة 56%. وتثبت البيانات أن آلية الانتباه والدمج متعدد المقاييس المقدمة تعزز بشكل فعال دقة الكشف عن الأهداف الصغيرة، مما يحقق توازناً جيداً بين السرعة والدقة. وباختصار، تحقق الطريقة المقترحة توازناً بين دقة الكشف والسرعة؛ حيث تزيد قيمة mAP@0.5 بمقدار 0.02 عن ثاني أفضل نموذج، وتصل قيمة F1-score إلى 0.935، وتُعد المعلمات البالغ عددها 6.7M كافية للنشر العملي. كما تعزز آلية الدمج متعدد المقاييس والانتباه من التعرف على الأهداف الصغيرة والمحجوبة في المشاهد المعقدة. يوازن النموذج بين الدقة والكفاءة، مما يجعله مناسباً لسيناريوهات الوقت الفعلي مثل مراقبة السلامة الصناعية. وجدير بالذكر أن جميع نماذج المقارنة تستخدم أوزانًا مدربة مسبقًا رسمية، مع دقة إدخال موحدة تبلغ 640 × 640، وعتبة NMS تبلغ 0.45، وعتبة ثقة تبلغ 0.5.
| الطريقة | mAP@0.5 | mAP@0.5:0.95 | F1-score | FPS | المعاملات (M) |
| YOLOv5 | 0.87 | 0.78 | 0.89 | 130 | 7.1 |
| EfficientDet | 0.85 | 0.73 | 0.88 | 50 | 15.3 |
| RetinaNet | 0.82 | 0.68 | 0.85 | 45 | 37.6 |
| Faster R-CNN | 0.84 | 0.7 | 0.87 | 30 | 45.2 |
| YOLOv10 | 0.89 | 0.77 | 0.88 | 135 | 5.3 |
| YOLOv11 | 0.88 | 0.75 | 0.895 | 140 | 5.2 |
| طريقتنا | 0.91 | 0.82 | 0.935 | 120 | 6.7 |
الجدول 1: جدول مقارنة شامل لأداء النموذج. يظهر تحليل البيانات أن الطريقة المقترحة تحقق mAP@0.5 بقيمة 0.91 وmAP@0.5:0.95 بقيمة 0.82، وهو ما يمثل تحسناً بمقدار 0.04 و0.04 على التوالي مقارنة بـ YOLOv5. وتبلغ قيمة F1-score الخاصة بها 0.935، وهي أيضاً أعلى من قيم نماذج المقارنة. تبلغ سرعة الكشف 120 FPS، وهي أربعة أضعاف سرعة Faster R-CNN، ولكنها أقل قليلاً من YOLOv10 وYOLOv11. يبلغ عدد المعلمات 6.7M، وهو ما يزيد بمقدار 1.5M فقط عن YOLOv11، مع تحسن بمقدار 0.03 في mAP@0.5. ومقارنة بـ EfficientDet، الذي يتطلب تكلفة حسابية مماثلة، تكون الدقة أعلى بمقدار 0.06، بينما يقل عدد المعلمات بنسبة 56%. وتثبت البيانات أن آلية الانتباه والدمج متعدد المقاييس المقدمة تعزز بفعالية من دقة كشف الأهداف الصغيرة، مما يحقق توازناً جيداً بين السرعة والدقة. وباختصار، تحقق طريقتنا المقترحة توازناً بين دقة الكشف والسرعة؛ حيث أن mAP@0.5 أعلى بمقدار 0.02 من ثاني أفضل نموذج، وتصل قيمة F1-score إلى 0.935، كما أن 6.7M من المعلمات كافية للنشر العملي. وتعزز آلية الدمج متعدد المقاييس والانتباه من التعرف على الأهداف الصغيرة والمحجوبة في المشاهد المعقدة. يوازن النموذج بين الدقة والكفاءة، مما يجعله مناسباً لسيناريوهات الوقت الفعلي مثل مراقبة السلامة الصناعية. ومن الجدير بالذكر أن جميع نماذج المقارنة تستخدم أوزانًا مدربة مسبقاً رسمية، مع دقة إدخال موحدة تبلغ 640 × 640، وعتبة NMS موحدة تبلغ 0.45، وعتبة ثقة موحدة تبلغ 0.5.
الشكل 2 يقدم تحليلاً متعمقاً لأنواع الكشف الخاطئ في النموذج. سجل YOLOv11 + CNN أدنى معدل للكشف الخاطئ في الخلفية (85 مرة/10,000 إطار)، حيث حدثت معظم عمليات الكشف الخاطئ في الأجسام المتشابهة (62 مرة) والمشاهد المحجوبة جزئياً (48 مرة). ويشير تحليل منحنى ROC إلى أن معدل الإيجابيات الصحيحة (TPR) للنموذج وصل إلى 0.9 (AUC = 0.98) عند معدل إيجابيات خاطئة (FPR) قدره 0.1، كما يدعم التباعد الضيق بين المنحنيات الموثوقية العالية لثقة الكشف. لا تدعم نتائج التحليل هذه أداء النموذج فحسب، بل توفر أيضاً خارطة طريق تقنية واضحة لتحسين عمليات الكشف الخاطئ لاحقاً، خاصة من خلال تعزيز قدرته على التمييز بين الأجسام المتشابهة.

الشكل 2. تحليل الخطأ. تحليل أنواع الكشف الخاطئ للنموذج. سجل نموذج YOLOv11 + CNN أدنى معدل كشف خاطئ للخلفية (85 مرة/10,000 إطار)، مع تركز غالبية عمليات الكشف الخاطئ في الأجسام المتشابهة (62 مرة) والمشاهد المحجوبة جزئيًا (48 مرة). ويشير تحليل منحنى ROC إلى أن معدل الإيجابية الحقيقية (TPR) للنموذج وصل إلى 0.9 (AUC = 0.98) عند معدل إيجابية كاذبة (FPR) قدره 0.1، كما أن أضيق مسافة بين المنحنيات تدعم موثوقية الثقة في الكشف. لا تدعم نتائج هذا التحليل أداء النموذج فحسب، بل توفر أيضًا خارطة طريق تقنية واضحة لتحسين عمليات الكشف الخاطئ لاحقًا، خاصة من خلال تعزيز قدرته على تمييز الأجسام المتشابهة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
الشكل 3 يقارن أداء النموذج على منصات أجهزة متنوعة. يحقق YOLOv11 + CNN زمن استجابة منخفض للغاية يبلغ 18 ms على وحدة معالجة الموترات (TPU) الطرفية، مع تذبذب قدره ±2 ms فقط، بينما يتم التحكم في استهلاك الطاقة عند 15 W. وتظهر اختبارات معدل نقل البيانات أن النموذج يحقق سرعة معالجة تبلغ 70 FPS على أجهزة الحوسبة الطرفية Jetson Xavier، مع التحكم في زمن الاستجابة للمئوية التاسعة والتسعين ضمن 50 ms. تمكن مؤشرات أداء النشر هذه النموذج من التكيف مع احتياجات النشر لمختلف منصات الحوسبة في المجالات الصناعية. كما يوضح تحليل الخطأ بشكل أكبر أن النموذج يمكنه الحفاظ على أداء مستقر في البيئات محدودة الموارد، مما يثبت قابليته للتطبيق الهندسي.

الشكل 3. أداء النشر. مقارنة لأداء النموذج على منصات أجهزة مختلفة. يحقق YOLOv11 + CNN زمن استجابة منخفض للغاية يبلغ 18 ms على Edge TPU (بتذبذب قدره ±2 ms فقط)، مع التحكم في استهلاك الطاقة عند 15 W. وتُظهر اختبارات الإنتاجية أن النموذج يحقق سرعة معالجة تبلغ 70 FPS على أجهزة الحوسبة الطرفية Jetson Xavier، مع التحكم في زمن استجابة المئوية 99 ضمن 50 ms. وتشير مؤشرات أداء النشر هذه إلى قدرته على التكيف مع احتياجات النشر لمختلف منصات الحوسبة في المجالات الصناعية. كما يوضح تحليل الخطأ أن النموذج يمكنه الحفاظ على أداء مستقر في البيئات محدودة الموارد، مما يثبت قابليته للتطبيق الهندسي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
يقارن الشكل 4 الاختلافات في أداء الكشف لكل نموذج عبر ست فئات مستهدفة. حقق نموذج YOLOv11 + CNN دقة بلغت 0.96 في مهمة التعرف على خوذة السلامة، متجاوزاً النموذج المرجعي بمقدار 4 نقاط مئوية. ويشير المخطط المنقط إلى أن النموذج يظهر تقلبات طفيفة في الأداء عبر الفئات (±0.05)، مما يعكس قدراته على التعميم. وتكشف مصفوفة الارتباك، المعروضة كخريطة حرارية، عن وجود كشف خاطئ متبادل بنسبة 15% بين المنطقة الخطرة والذراع الروبوتية. توفر هذه النتيجة توجهاً واضحاً لعملية تحسين النموذج لاحقاً.

الشكل 4. تحليل كشف الفئات. مقارنة لاختلافات أداء الكشف لكل نموذج عبر ست فئات مستهدفة. حقق نموذج YOLOv11 + CNN دقة بلغت 0.96 في مهمة التعرف على خوذة السلامة، متفوقاً على النموذج المرجعي بنسبة 4 نقاط مئوية. يشير المخطط النقطي إلى أن النموذج يظهر تقلبات طفيفة في الأداء عبر الفئات (±0.05)، مما يعكس قدراته على التعميم. وتكشف مصفوفة الارتباك، المعروضة كخريطة حرارية، عن نسبة 15% من الكشف الخاطئ المتبادل بين المنطقة الخطرة والذراع الروبوتية. وتوفر هذه النتيجة توجهاً واضحاً لتحسين النموذج في المراحل اللاحقة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
يقدم الشكل 5 سجلاً شاملاً لعملية التدريب لكل نموذج. يُظهر نموذج YOLOv11 + CNN أسرع معدل تقارب، حيث انخفض الفقد إلى 0.1 خلال 30 حقبة تدريبية، كما أن الفجوة بين منحنى mAP لمجموعة التحقق ومجموعة التدريب كانت باستمرار أقل من 1%. ويُظهر تحليل مخطط نطاق الخطأ أن قيمة mAP@0.5 النهائية للتحقق في النموذج مستقرة عند 0.94 ± 0.01، ونطاق تذبذب أدائه يمثل ثلث نطاق تذبذب RetinaNet فقط. وتدعم هذه النتائج فعالية بروتوكول التدريب المشترك. كما يُظهر النموذج مزايا في الأداء في المراحل المبكرة من التدريب، مما يشير إلى أن تصميمه المعماري يُمكّنه من تعلم الميزات بسرعة.

الشكل 5. تحليل عملية التدريب. سجل لعملية التدريب لكل نموذج. يُظهر YOLOv11 + CNN أسرع معدل تقارب (حيث تنخفض قيمة الفقد إلى 0.1 خلال 30 epoch)، والفجوة بين منحنى mAP لمجموعة التحقق ومجموعة التدريب تكون دائماً أقل من 1%. ويُظهر تحليل مخطط نطاق الخطأ أن قيمة mAP@0.5 النهائية للتحقق من النموذج مستقرة عند 0.94 ± 0.01، كما أن نطاق تقلب الأداء يمثل ثلث نطاق تقلب RetinaNet فقط. تدعم هذه النتائج فعالية بروتوكول التدريب المشترك. ويُظهر النموذج مزايا في الأداء في المراحل المبكرة من التدريب، مما يشير إلى أن تصميمه المعماري يُمكّنه من تعلم السمات بسرعة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
الجدول 2 يعرض نتائج الأداء الكمية لنماذج كشف مختلفة في بيئات معقدة. وتظهر بيانات الاختبار عبر ظروف الإضاءة القياسية والسيناريوهات المتطرفة المتنوعة أن YOLOv11 + CNN يحافظ على أداء مثالي تحت جميع الظروف. ففي ظروف الإضاءة القياسية، وصلت قيمة mAP@0.5 لهذا النموذج إلى 0.91، وهو أفضل بكثير من YOLOv5 (0.87) و Faster R-CNN (0.84). ومع تدهور الظروف البيئية، ينخفض أداء كل نموذج بدرجات متفاوتة، ولكن YOLOv11 + CNN يظهر أقوى متانة بيئية: ففي ظروف الإضاءة المنخفضة (< 50 lux)، ينخفض الأداء بنسبة 3% فقط (إلى 0.88)، وهو أفضل من الانخفاض بنسبة 5% في النموذج المقارن؛ وفي سيناريوهات الانسداد الشديد (> 50%)، لا يزال بإمكان mAP الحفاظ على قيمة 0.78، ويكون تدهور الأداء (13%) أقل بكثير من YOLOv5 (15%) و Faster R-CNN (16%). تثبت هذه النتائج أن YOLOv11 + CNN يعزز قدرة النموذج على التكيف مع العوامل المعقدة، مثل تغيرات الإضاءة والانسدادات، من خلال تحسين دمج الميزات وآليات الانتباه، مما يدعم التطبيقات العملية في السيناريوهات الصناعية.
| حالة الاختبار | YOLOv11 + CNN | YOLOv5 | Faster R-CNN | تقلب الأداء |
| إضاءة قياسية | 0.91 | 0.87 | 0.84 | 0.01 |
| إضاءة منخفضة (< 50 lux) | 0.88 (-3%) | 0.82 (-5%) | 0.79 (-5%) | 0.02 |
| انسداد جزئي (30%–50%) | 0.85 (-6%) | 0.80 (-7%) | 0.76 (-8%) | 0.03 |
| انسداد شديد (> 50%) | 0.78 (-13%) | 0.72 (-15%) | 0.68 (-16%) | 0.04 |
| ضبابية الحركة | 0.83 (-8%) | 0.77 (-10%) | 0.73 (-11%) | 0.05 |
الجدول 2: جدول التحليل الكمي للتكيف البيئي. أداء نماذج الكشف المختلفة في البيئات المعقدة من خلال التحليل الكمي. تُظهر بيانات الاختبار، بدءاً من ظروف الإضاءة القياسية وصولاً إلى السيناريوهات القاسية المتنوعة، أن نموذج YOLOv11 + CNN يحافظ على أعلى أداء تحت جميع ظروف الاختبار. ففي ظروف الإضاءة القياسية، بلغت قيمة mAP@0.5 لهذا النموذج 0.91، وهو أداء أفضل بشكل ملحوظ من YOLOv5 (0.87) و Faster R-CNN (0.84). ومع تدهور الظروف البيئية، ينخفض أداء كل نموذج بدرجات متفاوتة، إلا أن YOLOv11 + CNN يُظهر أقوى متانة بيئية بين النماذج التي تم تقييمها: ففي ظروف الإضاءة المنخفضة (< 50 lux)، انخفض الأداء بنسبة 3% فقط (إلى 0.88)، وهو أفضل من انخفاض بنسبة 5% في النموذج المقارن؛ وفي سيناريوهات الحجب الشديد (> 50%)، لا يزال من الممكن الحفاظ على mAP عند 0.78، وكان تدهور الأداء (13%) أصغر بكثير من تدهور YOLOv5 (15%) و Faster R-CNN (16%). تثبت هذه النتائج أن YOLOv11 + CNN يعزز قدرة النموذج على التكيف مع العوامل المعقدة، مثل تغيرات الإضاءة وتداخل الحجب، وذلك من خلال آلية محسنة لدمج الميزات وتصميم الانتباه، مما يدعم التطبيقات العملية في السيناريوهات الصناعية.
يوضح الجدول 3 أنه تم استخدام مُحسِّن SGD في هذه التجربة، مع زخم قدره 0.9 لتسريع التقارب وكبح التذبذبات. كما استُخدم معدل تعلم أولي قدره 0.01 مع تلدين جيب التمام (cosine annealing)، والذي تناقص تدريجياً أثناء التدريب لتدقيق عملية التحسين. وتم تطبيق اضمحلال في الأوزان بمقدار 0.0005 لتطبيق تنظيم L2 والحد من الإفراط في التخصيص (overfitting). وقد وازن حجم الدفعة البالغ 32 بين الكفاءة الحسابية واستقرار تقدير التدرج. كما ضمنت دورات التدريب البالغ عددها 200 دورة تحقيق تقارب كافٍ. وتم تكييف هذه المعاملات لتناسب مهمة الكشف أحادية المرحلة، بما يوازن بين سرعة التدريب والدقة.
| معلمة | القيمة |
| المُحسِّن | النزول الاشتقاقي العشوائي (SGD) |
| معدل التعلم الأولي | 0.01 |
| الزخم | 0.9 |
| اضمحلال الوزن | 0.0005 |
| حجم الدفعة | 32 |
| حقبات التدريب | 200 |
| جدولة معدل التعلم | التلدين الجيبي (Cosine annealing) |
الجدول 3: جدول المعلمات الفائقة للتدريب. تم استخدام محسّن SGD في هذه التجربة، مع زخم قدره 0.9 لتسريع التقارب وكبح التذبذبات. استُخدم معدل تعلم أولي قدره 0.01 مع التلدين الجيبي (cosine annealing)، والذي تناقص تدريجياً أثناء التدريب لتحسين عملية التحسين. تم إدخال اضمحلال للوزن قدره 0.0005 لتطبيق تنظيم L2 وتقليل الإفراط في التخصيص. وقد وازن حجم الدفعة البالغ 32 بين الكفاءة الحسابية واستقرار تقدير التدرج. وضمنت حقبات التدريب البالغ عددها 200 تقارباً كافياً. تم تكييف هذه المعلمات مع مهمة الكشف أحادية المرحلة، لتحقيق التوازن بين سرعة التدريب ودقته.
يوضح الجدول 4 أنه باستخدام YOLOv11 كنموذج أساسي، تبلغ قيمة mAP@0.5 نحو 0.89. ويؤدي إدخال الدمج متعدد المقاييس بمفرده إلى خفض الدقة إلى 0.88. بينما يؤدي إضافة طبقات انتباه القنوات وانتباه المكان بالتتابع إلى تحسين الدقة لتصل إلى 0.90 و 0.89 على التوالي. وتصل الدقة المجمعة لجميع الوحدات إلى 0.91، وهو ما يمثل تحسناً قدره 0.02 عن النموذج الأساسي. وتظهر البيانات أن انتباه القنوات يحسن الدقة بشكل مباشر، وأن الأداء المجمع للدمج متعدد المقاييس وآليات الانتباه هو الأداء الأمثل.
| التكوين | mAP@0.5 |
| YOLOv11 (الأساسي) | 0.89 |
| + دمج متعدد المقاييس | 0.88 |
| + متعدد المقاييس + انتباه القنوات | 0.9 |
| + متعدد المقاييس + الانتباه المكاني | 0.89 |
| الوحدة الكاملة (YOLOv11 + CNN) | 0.91 |
الجدول 4: جدول اختبار الاستئصال. باستخدام YOLOv11 كمرجع أساسي، بلغت قيمة mAP@0.5 0.89. وأدى إدراج دمج متعدد المقاييس وحده إلى خفض الدقة إلى 0.88. بينما أدى إضافة انتباه القنوات أو الانتباه المكاني بعد الدمج متعدد المقاييس إلى تحسين الدقة لتصل إلى 0.90 و0.89 على التوالي. ووصلت الدقة المشتركة لجميع الوحدات إلى 0.91، وهو تحسن قدره 0.02 عن المرجع الأساسي. وتظهر البيانات أن انتباه القنوات يحقق مكاسب أكبر من الانتباه المكاني في هذا الإعداد، وأن الأداء المشترك للدمج متعدد المقاييس والانتباه هو الأفضل.
يقيم الشكل 6 أداء النموذج بشكل منهجي في البيئات القاسية. انخفض متوسط الدقة المتوسطة (mAP) لنموذج YOLOv11 + CNN بنسبة 6% فقط (إلى 0.88) في ظروف الإضاءة المنخفضة، وظل محافظاً على mAP قدره 0.78 (متفوقاً بنسبة 8% على المرجع) في المشاهد التي تعاني من انسداد شديد. وتثبت هذه النتائج أن النموذج يتمتع بقابلية للتكيف البيئي، حيث يعالج بفعالية التغيرات الشائعة في الإضاءة ومشاكل الانسداد الموضعي في الإنتاج الصناعي، مما يدعم التشغيل المستقر لنظام الكشف.

الشكل 6. التكيف البيئي. تقييم منهجي لأداء النموذج في البيئات القاسية. انخفض mAP لنموذج YOLOv11 + CNN بنسبة 6% فقط (إلى 0.88) في ظروف الإضاءة المنخفضة، وظل يحافظ على mAP قدره 0.78 (بزيادة 8% عن المرجع) في المشاهد ذات الانسداد الشديد. تثبت هذه النتائج أن النموذج يظهر تكيفاً بيئياً، حيث يعالج بفعالية تغيرات الإضاءة الشائعة ومشاكل الانسداد الموضعي في الإنتاج الصناعي، مما يدعم التشغيل المستقر لنظام الكشف. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
تقارن الشكل 7 الاختلافات في توزيع السمات بين YOLOv11 و YOLOv11 + CNN على ستة أنواع من الأهداف الصناعية من خلال خفض الأبعاد باستخدام t-SNE. يوضح الشكل الموجود على اليسار أن سمات النموذج الأساسي YOLOv11 تظهر تشتتاً ملحوظاً داخل الفئة الواحدة (المسافة داخل الفئة 2.34 ± 0.15)، وبشكل خاص في "منطقة الخطر" (باللون الأحمر) و"المركبة" (باللون الأرجواني)، حيث يوجد تداخل كبير، وهو ما يتفق مع معدل الكشف الخاطئ البالغ 15% في المجموعة التجريبية 3. ويظهر الشكل الموجود على اليمين أن نموذج YOLOv11 + CNN المطور يعزز بشكل كبير من تماسك الفئة الواحدة عبر وحدة تعزيز السمات، مما يزيد من متوسط المسافة بين مراكز العناقيد داخل كل فئة بمقدار 1.8 مرة.

الشكل 7. مقارنة توزيع الميزات باستخدام t-SNE. مقارنة لاختلافات توزيع الميزات بين YOLOv11 و YOLOv11 + CNN على ستة أنواع من الأهداف الصناعية من خلال خفض الأبعاد بواسطة t-SNE. يوضح الشكل الأيسر أن ميزات النموذج الأساسي YOLOv11 تظهر تشتتًا داخليًا ملحوظًا للفئات (المسافة داخل الفئة 2.34 ± 0.15)، خاصة في "منطقة الخطر" (باللون الأحمر) و"المركبة" (باللون الأرجواني) حيث يوجد تداخل كبير، وهو ما يتوافق مع معدل الكشف الخاطئ بنسبة 15% في المجموعة التجريبية 3. ويظهر الشكل الأيمن أن نموذج YOLOv11 + CNN المطور يحسن بشكل كبير من تماسك الفئات من خلال وحدة تعزيز الميزات، كما زاد متوسط المسافة بين مراكز التجمعات في كل فئة بمقدار 1.8 مرة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
يؤكد الشكل 8 مساهمة كل وحدة من خلال تجارب الاستئصال المنهجية. وتظهر نتائج الاستئصال أن إضافة انتباه القناة (channel attention) بعد الدمج متعدد المقاييس ترفع mAP@0.5 إلى 0.90، بينما ترفع إضافة الانتباه المكاني (spatial attention) mAP@0.5 إلى 0.89. وتحقق الوحدة الكاملة أعلى قيمة mAP@0.5 بلغت 0.91. كما يوضح تصور الخريطة الحرارية أن آلية الانتباه المركبة يمكنها تعزيز استجابة الكشف لمركز المنطقة الخطرة (قيمة التنشيط: +0.15) والأهداف الصغيرة عند الحافة (+0.08) في آن واحد. وتثبت البيانات التجريبية أن دمج السمات متعدد المقاييس وآليات الانتباه لهما تأثير تراكمي، مما يمكن النموذج من تلبية متطلبات كشف الأهداف بمقاييس مختلفة.

الشكل 8. تجربة الاستئصال النمطي. التحقق من مساهمة كل وحدة من خلال تجارب استئصال منهجية. تُظهر نتائج الاستئصال أن إضافة انتباه القنوات بعد الدمج متعدد المقاييس ترفع mAP@0.5 إلى 0.90، بينما ترفع إضافة الانتباه المكاني mAP@0.5 إلى 0.89. وتحقق الوحدة الكاملة أعلى قيمة mAP@0.5 وهي 0.91. ويُظهر التصوير بالخريطة الحرارية أن آلية الانتباه المركبة يمكنها تعزيز استجابة الكشف لمركز المنطقة الخطرة (قيمة التنشيط: +0.15) والأهداف الصغيرة عند الحافة (+0.08) في وقت واحد. وتثبت البيانات التجريبية أن دمج الميزات متعدد المقاييس وآليات الانتباه لهما تأثير تراكمي، مما يمكن النموذج من تلبية متطلبات كشف الأهداف عبر مقاييس مختلفة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
توافر البيانات:
تخضع الصور الكاملة الخام لخط الإنتاج وتدفقات الفيديو لقيود السرية الصناعية ولا يتم إصدارها للعامة. يوفر وصف مجموعة البيانات التكميلية (الملف التكميلي 1) تفاصيل الحصول على مجموعة البيانات، وتوزيعات الفئات والسيناريوهات، ومواصفات التعليق التوضيحي، وإجراءات مراقبة الجودة، وتقسيمات البيانات، والمعالجة المسبقة، وإجراءات التعزيز. يوفر إطار عمل الكود الزائف وقابلية التكرار (الملف التكميلي 2) سير عمل على مستوى الكود الزائف، وأوصاف التكوين، وإرشادات لإعادة الإنتاج. يمكن طلب مجموعة فرعية مجهولة الهوية ومواد داعمة إضافية من المؤلف المسؤول لأغراض البحث الأكاديمي غير التجاري، وذلك وفقاً للقيود المؤسسية وقيود السرية.
الملف التكميلي 1. وصف مجموعة البيانات التكميلية. يصف هذا الملف بروتوكول الحصول على مجموعة البيانات، وتغطية السيناريوهات، وتوزيع الفئات، ومواصفات التعليق التوضيحي، وإجراءات مراقبة الجودة، وتقسيم بيانات التدريب والتحقق والاختبار، وعمليات المعالجة المسبقة، وإجراءات التعزيز. يرجى النقر هنا لتحميل هذا الملف.
الملف التكميلي 2. الرمز الزائف وإطار عمل إعادة الإنتاج. يوفر هذا الملف تفاصيل سير العمل على مستوى الرمز الزائف وتفاصيل التكوين الخاصة بالمعالجة المسبقة، والتدريب، والتقييم، والنشر، كما يصف القيود المفروضة على لقطات الفيديو الصناعية الخام والوصول إلى المواد الداعمة. يرجى النقر هنا لتحميل هذا الملف.