مقالة منهجية

مراقبة سلامة خطوط الإنتاج في الوقت الفعلي باستخدام كشف الأجسام وتعزيز السمات القائم على التعلم العميق

29 مشاهدة

DOI:

10.3791/70968

أغسطس 21, 2026

في هذه المقالة

ملخص

تقترح هذه الورقة طريقة لمراقبة السلامة في خطوط الإنتاج تدمج بين نموذج "أنت تنظر مرة واحدة" الإصدار 11 (YOLOv11) والشبكات العصبية الالتفافية. وقد حققت هذه الطريقة متوسط دقة متوسطة عند عتبة تقاطع فوق الاتحاد 0.5 (mAP@0.5) بلغت 0.91، و mAP@0.5:0.95 بلغت 0.82، وبمعدل 120 إطاراً في الثانية على وحدة معالجة الرسوميات، متفوقة بذلك على النماذج المرجعية التي تم تقييمها.

الملخص

مع تعمق الثورة الصناعية 4.0، تحسنت مستويات الأتمتة والذكاء في خطوط الإنتاج بشكل ملحوظ، مما فرض متطلبات أعلى على الأداء في الوقت الفعلي والدقة والسلامة في عمليات المراقبة. وتعاني أنظمة المراقبة التقليدية، التي تعتمد على الفحوصات اليدوية أو القرارات البسيطة القائمة على العتبات، عمومًا من بطء أوقات الاستجابة، وارتفاع معدلات الإنذارات الكاذبة، ومحدودية الذكاء. لذلك، تقترح هذه الورقة نظامًا لمراقبة سلامة خطوط الإنتاج يدمج إصدار You Only Look Once 11 (YOLOv11) مع شبكة عصبونية تلافيفية (CNN). أولاً، تمت معالجة الصور المكتسبة مسبقًا. ثم استُخدم نموذج YOLOv11 لتحديد العمال والمعدات والمخاطر المحتملة في الوقت الفعلي. بعد ذلك، تم تقديم شبكة CNN محسنة مع دمج الميزات متعددة المقاييس وآليات الانتباه لتحسين قدرات استخراج الميزات للأهداف الصغيرة والمحجوبة. وأخيرًا، دُمجت نتائج الكشف مع الميزات المحسنة بواسطة CNN لتقييم حالة السلامة. أُجريت التجارب باستخدام مجموعة بيانات سلامة خطوط إنتاج تم بناؤها ذاتيًا، مع توظيف محسّن descent gradient stochastic (SGD) بزخم قدره 0.9، ومعدل تعلم أولي قدره 0.01، وتضاؤل للوزن قدره 0.0005، وتعديل معدل التعلم باستخدام cosine-annealed، وحجم دفعة قدره 32، والتدريب لمدة 200 epochs. استُخدمت mAP@0.5 وسرعة الكشف بالإطارات في الثانية (FPS) كمقاييس تقييم للمقارنة مع الخوارزميات المرجعية التي تم تقييمها. وتظهر النتائج أن النظام المقترح حقق mAP@0.5 قدره 0.91 وسرعة كشف بلغت 120 FPS. كما أظهر أداءً قويًا في الظروف المعقدة مثل التظليل والإضاءة المتغيرة، مما يدعم فعاليتة وإمكانية تطبيقه العملي في مراقبة سلامة خطوط الإنتاج.

المقدمة

في الإنتاج الصناعي الحديث، تُعد السلامة حجر الزاوية لضمان كفاءة الإنتاج وسلامة الأفراد. عادةً ما تتضمن بيئة خط الإنتاج معدات ميكانيكية عالية السرعة، وعمليات تكنولوجية معقدة، وعمليات تعاونية تشمل مهام متعددة. ويمكن لأي خطر بسيط محتمل على السلامة أن يؤدي إلى حوادث إنتاج خطيرة، مما يتسبب في خسائر اقتصادية جسيمة بل وحتى وفيات. لذلك، من الضروري إنشاء نظام مراقبة سلامة فعال وذكي وفي الوقت الفعلي لتعزيز السلامة في الإنتاج الصناعي1,2.

تعتمد طرق مراقبة السلامة التقليدية بشكل أساسي على المراقبة اليدوية بالفيديو ومختلف المستشعرات (مثل مستشعرات الأشعة تحت الحمراء والدخان والاهتزاز)3. ولا تقتصر المراقبة اليدوية على كونها غير فعالة فحسب، بل إنها عرضة لفقدان بعض الاكتشافات بسبب إجهاد أفراد المراقبة، كما أنها لا توفر تغطية مستمرة وشاملة. ورغم أن المستشعرات يمكن أن توفر وظيفة إنذار مبكر معينة، إلا أن نطاق اكتشافها محدود، وهي حساسة للتداخلات البيئية، مما يؤدي إلى ظهور مشكلات بارزة تتمثل في الإنذارات الكاذبة4. لذا، أصبحت أنظمة المراقبة الذكية محوراً متزايداً للبحث؛ حيث يمكن للتحليل الفوري لتدفق الفيديو باستخدام خوارزمية التعلم العميق أن يحدد تلقائياً الأحداث غير الطبيعية، والسلوكيات غير الآمنة، والمخاطر المحتملة، مما يؤدي إلى تحسين ذكاء نظام المراقبة بشكل كبير4,5.

يُعد اكتشاف الكائنات تقنية أساسية في المراقبة الذكية. وتُظهر سلسلة خوارزميات You Only Look Once (YOLO)، بصفتها نماذج لمكتشفات الكائنات أحادية المرحلة، مزايا كبيرة. ومنذ YOLOv1 وصولاً إلى YOLOv8، خضعت هذه المجموعة من الخوارزميات لتطوير مستمر، مع تحسينات في بنية الشبكة، ودالة الفقد، ومنهجية التدريب، من بين جوانب أخرى6,7. وقد حققت YOLOv1، على وجه الخصوص، دقة اكتشاف أعلى مع الحفاظ على معدل إطارات مرتفع، لاسيما عند مواجهة الخلفيات المعقدة والأهداف المتكدسة بكثافة8.

ومع ذلك، ورغم أدائه المتميز في مهام الكشف العام عن الكائنات، لا يزال YOLOv1 يواجه تحديات في سيناريوهات محددة لمراقبة السلامة في خطوط الإنتاج9. فعلى سبيل المثال، قد تنخفض دقة الكشف في YOLOv1 عندما يكون العمال محجوبين جزئياً بواسطة المعدات، أو عندما تكون علامات السلامة صغيرة وتشبه لون الخلفية بشكل كبير. وهذا يتطلب أن يمتلك النموذج قدرات أقوى في استخراج الميزات والفهم الدلالي10.

تتمتع الشبكات العصبية التفافية (CNNs) بقدرات قوية في استخراج سمات الصور1. ومن خلال تصميم بنيات شبكية أكثر عمقاً وتعقيداً، يمكن للشبكات العصبية التفافية تعلم سمات صور أغنى وأكثر تجريداً. ويؤدي دمج الشبكات العصبية التفافية مع YOLOv1 إلى الاستفادة من قدرات الكشف السريع لـ YOLOv1 والاستخراج العميق للسمات الخاص بالشبكات العصبية التفافية، مما يساهم في بناء نظام مراقبة سلامة أكثر قوة وذكاءً.

وبناءً على ذلك، تقترح هذه الورقة نظاماً لمراقبة السلامة في خطوط الإنتاج باستخدام YOLOv1 وشبكة عصبية تلافيفية (CNN). وتتضمن الجوانب الابتكارية لهذه الدراسة ما يلي: (1) اقتراح بنية دمج عميقة لـ YOLOv1 وشبكة CNN محسنة؛ (2) تقديم دمج للميزات متعددة المقاييس وآلية انتباه مركبة لتعزيز التعرف على ميزات السلامة الرئيسية؛ و(3) التحقق من المزايا الأدائية للنموذج باستخدام مجموعة بيانات لمشاهد معقدة تم بناؤها ذاتياً.

تطوير سلسلة خوارزميات YOLO
منذ تقديمها لأول مرة من قبل Redmon وآخرين في عام 201512، حظيت خوارزمية You Only Look Once (YOLO) باهتمام كبير. وبخلاف الكواشف ثنائية المرحلة التي تعتمد على مقترحات المناطق، تعامل YOLO عملية اكتشاف الكائنات كمهمة انحدار. ومن خلال التنبؤ المباشر بفئات الكائنات ومواقعها في الصورة، تزيد YOLO سرعة الاكتشاف بشكل ملحوظ، مما يجعلها مناسبة للاستخدام في الوقت الفعلي13.

باعتباره العمل الرائد في هذه السلسلة، حقق YOLOv1 الكشف عن الأهداف من الطرف إلى الطرف لأول مرة14. يتضمن YOLOv1 تقسيم الصورة المدخلة إلى هيكل شبكي، حيث تُكلف كل خلية شبكية، والتي يتم ترتيبها عادةً بتنسيق S × S، بالكشف عن الكائنات التي تقع ضمن حدودها.

تحديدًا، تكون مخرجات YOLOv1 عبارة عن تنسور (tensor). ومن بين الـ S × S × (B × 5 + ج)، يحتوي التنبؤ بكل صندوق إحاطة على 5 عناصر: إحداثيات نقطة المركز (س، ص)، العرض و، الارتفاع هـ، والثقة جتوضح المعادلة (1) عملية الحساب:
صيغة الاحتمالية والتقاطع فوق الاتحاد (IoU) لتحليل كشف الأجسام.   (1)

ومن بينها، Pr(كائن( ) تمثل احتمالية وجود هدف في الشبكة، و تقاطع الاتحاد (IOU) تمثل نسبة التقاطع على الاتحاد بين المربع المحيط المتوقع ومربع الحقيقة الأرضية. كما يتوقع كل مربع شبكي أيضاً مجموعة من احتمالات الفئة، بروتين (Pr) يمثل احتمالية انتماء الهدف إلى الـ i-الفئة في وجود هدف ما. تتكون دالة الخسارة في YOLOv1 من ثلاثة مكونات رئيسية: خسارة التنبؤ بالإحداثيات، وخسارة تقدير الثقة، وخسارة التنبؤ بالفئة.15.

يقدم YOLOv2 تقنية تطبيع الدفعات (Batch Normalization)، ومصنفاً عالي الدقة، واستراتيجية تدريب متعددة المقاييس، مما أدى إلى تحسين الاستقرار والدقة16. أما YOLOv3 فيستخدم Darknet-53 كشبكة أساسية، ويستلهم مفهوم شبكة الهرم الميزاتي (Feature Pyramid Network - FPN) لتعزيز عملية اكتشاف الأهداف17.

لقد أجرى YOLOv4 تحسينات عديدة بناءً على YOLOv3، حيث قدم تقنيات مثل الشبكة الجزئية عبر المراحل (CSPNet)18، وشبكة تجميع المسارات (PANet)19، وتعزيز البيانات بطريقة الموزاييك (Mosaic) لتحسين أداء النموذج بشكل أكبر. أما YOLOv5 فقد قدم مساهمات هندسية كبيرة، حيث وفر تطبيقاً أكثر كفاءة وأسهل في الاستخدام20.

في السنوات الأخيرة، استمرت سلسلة YOLO في التطور، حيث تم إصدار نسخ مثل YOLOv6 وYOLOv7 وYOLOv8 الواحد تلو الآخر. ومن خلال تقديم بنية شبكة تجميع الطبقات الفعالة الموسعة (E-ELAN) وتقنيات إعادة تمثيل معاملات النموذج، حقق YOLOv7 طفرات جديدة في كل من السرعة والدقة. ولا تساهم هذه التحسينات في رفع كفاءة تعلم الميزات فحسب، بل تعمل أيضاً على تحسين أداء الاستدلال للشبكة، مما مكن YOLOv7 من تجاوز الإصدارات السابقة والعديد من الكواشف الرئيسية في مختلف مهام اكتشاف الكائنات في الوقت الفعلي. كما قام YOLOv8 بتحسين بنية الشبكة بشكل أكبر، واعتماد تصميم خالٍ من المراسِي (anchor-free)، وتبسيط النموذج، وتحسين قدرته على التعميم21.

بناءً على مزايا الإصدارات السابقة، تم تحسين YOLOv1 المستخدم في هذه الدراسة للتعامل مع السيناريوهات الصناعية المعقدة. وتشمل تحسيناته الجوهرية شبكة لاستخراج الميزات، ووحدة دمج ميزات أكثر كفاءة، وتصميماً أكثر متانة لدالة الخسارة. تمكن هذه التحسينات YOLOv1 من تقديم أداء أفضل عند التعامل مع حالات الاحتجاب، والأهداف الصغيرة، والخلفيات المعقدة في بيئات الإنتاج. يُعد YOLOv1 إصداراً من سلسلة YOLO التي أصدرتها شركة Ultralytics. ومقارنةً بـ YOLOv8، فإنه يحسن وحدة C3K2 ومسار دمج الميزات، ويقدم استراتيجية صناديق الإرساء التكيفية، مما يوفر متانة أقوى في الكشف ضمن السيناريوهات الصناعية.

أساس وتطور الشبكة العصبية التلافيفية (CNN)
تُعد الشبكة العصبية التلافيفية (CNN) نموذجاً محورياً أثّر بشكل عميق في نجاح التعلم العميق ضمن مجال الرؤية الحاسوبية. وهي تعمل من خلال استخراج سمات الصور المحلية عبر عمليات التلافيف، ثم تقليل أبعاد هذه السمات لاحقاً عبر عمليات التجميع، وبذلك تحقق تجريداً هرمياً للصور2.

تكون الشبكة العصبية التلافيفية (CNN) النموذجية من طبقات تلافيفية، وطبقات تجميع، وطبقات متصلة بالكامل. تقوم الطبقة التلافيفية بمسح الصورة المدخلة باستخدام نواة تلافيفية، وتحسب الضرب النقطي عبر المناطق المحلية، وتنتج خريطة سمات. وتظهر عملية الحساب في المعادلة (2):

مخطط صيغة عملية الالتفاف؛ التدوين الرياضي لنماذج تعلم الآلة.   (2)

أين يرجى تزويدي بالنص المراد ترجمته. هي الصورة المدخلة، وك و bكـ يمثلان الوزن والانحياز لنواة التلافيف، على التوالي، و التعبير الرياضي y_ij^k، والذي قد يكون مرتبطاً بعمليات المصفوفات أو الموترات المستخدمة في الخوارزميات. هل قيم خريطة الميزات الناتجة عند الموضع (i,jتستخدم طبقة التجميع عادةً التجميع الأقصى (Max Pooling) أو التجميع المتوسط (Average Pooling). وتكون الطبقة كاملة الاتصال مسؤولة عن استخراج الميزات والتنبؤ باحتمالات التصنيف.

بناءً على ذلك، تصمم هذه الورقة وحدة تعزيز ميزات CNN لنموذج YOLOv1، والتي تتكون من فرعين متوازيين: فرع تلافيف متعدد المقاييس يستخدم نوى تلافيف 3 × 3 و 5 × 5 لاستخراج ميزات متعددة المقاييس؛ وفرع انتباه يربط بالتتابع وحدات انتباه القنوات (Squeeze-and-Excitation) وانتباه المكان لتعزيز الميزات التمييزية للأهداف الرئيسية. يتم دمج مخرجات الفرعين عن طريق الجمع العنصري، وتظهر دالة فقد تعزيز الميزات المقابلة في الصيغة (3):

 alt="الصيغة الرياضية لتنسيق دالة الخسارة L=λcoordLcoord+λconfLconf+λclsLcls+λfeatLfeat" (3)

Lcoord هي خسارة انحدار إحداثيات الصندوق المحيط؛ وLconf هي خسارة الثقة المستهدفة؛ وLcls هي خسارة تصنيف الفئة؛ وLfeat هي خسارة تعزيز السمات، وتُستخدم لتقييد السمات التمييزية للأهداف الصغيرة والأهداف المحجوبة التي استخرجتها وحدة تعزيز CNN؛ بينما تمثل λcoord وλconf وλcls وλfeat معاملات الوزن لبنود الخسارة المقابلة. وبالنسبة لهذه المهمة، تم تعيين قيمة λfeat = 0.05، وتم موازنة الأوزان المتبقية وفقاً لمتطلبات مهمة الكشف.

حققت هياكل الشبكات العصبية الالتفافية (CNN) الكلاسيكية، مثل VGGNet23 وResNet24، نجاحاً كبيراً في مهام تصنيف الصور. ومن بين هذه البنيات، تعمل ResNet بفعالية على تخفيف مشكلة تلاشي التدرج (vanishing gradient problem) في تدريب الشبكات العميقة، مما يسهل بناء هياكل شبكية أكثر عمقاً وتعقيداً.

في مهام اكتشاف الكائنات، تُستخدم الشبكة العصبية التلافيفية (CNN) عادةً كمستخرج للميزات (backbone). على سبيل المثال، فإن Darknet وcross-stage partial Darknet (CSPDarknet)، وغيرها في سلسلة خوارزميات YOLO، مبنية جميعها على CNN25. ولتعزيز قدرات استخراج الميزات، اقترح الباحثون العديد من هياكل CNN المحسنة؛ حيث تقوم وحدة Inception مثلاً باستخراج الميزات بالتوازي من خلال نوى تلافيفية متعددة المقاييس، بينما تعز DenseNet إعادة استخدام الميزات عبر الاتصالات الكثيفة. كما تقوم شبكة Squeeze-and-Excitation بضبط أهمية قنوات الميزات تكيفياً من خلال آليات الانتباه26.

في هذه الدراسة، قمنا بتصميم وحدة CNN محسنة لتعزيز قدرات استخراج الميزات في YOLOv1. تدمج هذه الوحدة بين دمج الميزات متعددة المقاييس وآلية الانتباه لالتقاط معلومات السلامة الرئيسية في سيناريوهات خطوط الإنتاج بشكل أكثر فعالية.

حالة تطبيق التعلم العميق في مراقبة السلامة الصناعية
اكتسب التعلم العميق زخماً كبيراً في مراقبة السلامة الصناعية. وتُستخدم الخوارزميات القائمة على الشبكات العصبية التلافيفية (CNN) لتحديد ما إذا كان العمال يرتدون خوذات السلامة بشكل صحيح، والكشف عن الاقتحامات غير المصرح بها للمناطق الخطرة، ومراقبة حالة المعدات التي تعاني من أعطال27.

فيما يتعلق بالتعرف على السلوك، تُستخدم الشبكات العصبية التلافيفية ثلاثية الأبعاد (3D CNNs) والشبكات العصبية المتكررة لتحليل السلوك التشغيلي للعمال وتحديد الإجراءات التي قد تكون غير آمنة. فعلى سبيل المثال، يمكن تحديد ما إذا كان العمال ينتهكون إجراءات التشغيل الآمنة من خلال تحليل تسلسل وضعيات أجسامهم28.

يُستخدم كل من YOLO وFaster R-CNN على نطاق واسع للكشف عن الأفراد والمعدات في فيديوهات المراقبة في الوقت الفعلي. فعلى سبيل المثال، تم اقتراح نظام للكشف عن الخوذات في الوقت الفعلي بناءً على YOLOv5 في الأدبيات العلمية، مما ساهم بفعالية في تعزيز ذكاء إدارة السلامة في مواقع البناء29.

على الرغم من إحراز بعض التقدم في الأبحاث الحالية، لا تزال هناك عدة تحديات قائمة. أولاً، تتميز المشاهد الصناعية عادةً بإضاءة معقدة، وحجب للرؤية، وتداخلات في الخلفية، مما يفرض متطلبات صارمة على قوة الخوارزمية. ثانياً، يعد الأداء في الوقت الفعلي مطلباً أساسياً، حيث يجب أن تحقق الخوارزمية سرعة استدلال عالية مع الحفاظ على الدقة. وأخيراً، تركز الأبحاث الحالية بشكل أساسي على الكشف أحادي المهمة، وتفتقر إلى استكشاف دمج المعلومات متعددة المصادر والتحليل الشامل30.

تهدف دراسة هذا البحث، من خلال نموذج الدمج المقترح بين YOLOv11 وCNN، إلى معالجة التحديات المذكورة أعلاه وتحقيق مراقبة شاملة وفورية لمخاطر السلامة في خطوط الإنتاج، وذلك عن طريق تعزيز قدرات استخراج الميزات ودمجها.

البروتوكول

خوارزمية YOLOv1 والشبكات العصبية التلافيفية (CNN)

البنية العامة للنظام
يعتمد نظام مراقبة سلامة خط الإنتاج المقترح في هذه الورقة بنية هجينة تجمع بين YOLOv1 وشبكة عصبية تلافيفية (CNN) محسنة لتحقيق مراقبة سلامة فورية عالية الدقة وعالية السرعة. وكما هو موضح في الشكل 1يتكون النظام بشكل أساسي من وحدة معالجة مسبقة للمدخلات، ووحدة YOLOv1 للكشف عن الأجسام، ووحدة CNN لتعزيز الميزات، ووحدة قرار دمج. أولاً، تقوم وحدة المعالجة المسبقة بتطبيع الصورة المدخلة وزيادتها لتحسين قدرة النموذج على التعميم. بعد ذلك، يتم استخراج الميزات بواسطة العمود الفقري CSPDarknet، ويتم توسيع المجال الاستقبالي بواسطة وحدة التجميع الهرمي المكاني السريع (SPPF). يتم دمج الميزات متعددة المقاييس بعد عملية زيادة العينة، ثم يتم تطبيق انتباه القنوات وانتباه المجال بالتتابع على الميزات المدمجة لتعزيز التمثيل التمييزي للأهداف الرئيسية بشكل أكبر. تم إدراج وحدة CNN لتعزيز الميزات بعد مخرجات الطبقات C3 وC4 وC5 من الشبكة العمودية YOLOv1، حيث تستقبل خرائط ميزات متعددة المقاييس بأحجام 80 × 80 × 256 و40 × 40 × 512 و20 × 20 × 1,024 على التوالي. وتعمل وحدة CNN لتعزيز الميزات على تحسين استخراج الميزات للأهداف الصغيرة والمحجوبة. وأخيراً، تقوم وحدة قرار الدمج بجمع نتائج الكشف الخاصة بـ YOLOv1 مع الميزات المعززة بواسطة CNN وتحسينهما معاً من خلال دالة خسارة مصممة لإخراج الموقع الدقيق، والفئة، ودرجة الثقة للهدف.

إطار عمل الكشف YOLOv1
قدم YOLOv11 عدة تحسينات جوهرية تستفيد من نقاط القوة في إطار عمل الكشف أحادي المرحلة الخاص بسلسلة YOLO. تنقسم بنيته إلى ثلاثة مكونات رئيسية: شبكة العمود الفقري (backbone network)، وشبكة دمج الميزات (feature fusion network)، ورأس الكشف (detection head). وتعتمد شبكة العمود الفقري على بنية CSPDarknet محسنة. أما شبكة دمج الميزات فتتضمن وصلات محلية عبر المراحل وتلافيف قابلة للفصل بعمق (depthwise separable convolutions)، مستمدة الإلهام من شبكات الهرم الميزاتي (feature pyramid networks) وشبكات تجميع المسارات (path aggregation networks) لدمج الميزات متعددة المقاييس بفعالية.

وحدة تعزيز الميزات
تهدف وحدة تحسين السمات إلى تحسين حساسية النموذج تجاه سمات السلامة الرئيسية. وتقوم هذه الوحدة بمعالجة خرائط السمات الناتجة عن كل طبقة من شبكة YOLOv1 الأساسية، مع دمج المعلومات عبر مقاييس مختلفة من خلال عمليات زيادة العينات (upsampling) وتقليل العينات (downsampling). وعلى وجه التحديد، يلتقط الفرع متعدد المقاييس تنوع المقاييس المكانية، بينما يقوم فرع الانتباه بتعزيز القنوات الرئيسية والاستجابات الموضعية ديناميكيًا. ولا يعمل هذان الفرعان بشكل مستقل، بل يكونان متكاملين ويتم دمجهما من خلال الوصلات المتبقية (residual connections) وإعادة معايرة السمات. ويتم تعديل خريطة السمات التي تمت معالجتها بواسطة وحدة التحسين عند كل مقياس لتتطابق مع عدد قنوات خريطة السمات الأصلية عبر عملية تلافيف (convolution) بمقاس 1 × 1، ثم تُدمج مع خريطة سمات YOLOv11 الأصلية عن طريق الجمع العنصري (element-wise addition). بعد ذلك، يتم تمرير خريطة السمات المدمجة إلى شبكة الهرم السماتي (FPN) اللاحقة لدمجها متعدد المقاييس، مما يشكل تمثيلاً هرمياً لسمات السلامة. ولضمان التكامل السلس بين الوحدات، تم اعتماد استراتيجية تدريب مشتركة من الطرف إلى الطرف (end-to-end)، حيث تتكون دالة الخسارة من خسارة الكشف في YOLOv1 وخسارة تحسين السمات في وحدة CNN.

مخطط الشبكة العصبية التلافيفية؛ يتضمن وحدات Conv وELAN وSPPF لعملية اكتشاف الصور.
الشكل 1خوارزمية YOLOv1-CNN. تهدف وحدة تعزيز السمات إلى تضخيم حساسية النموذج تجاه سمات السلامة الحرجة. وتقوم هذه الوحدة بمعالجة خرائط السمات من طبقات مختلفة من العمود الفقري لنموذج YOLOv1، مع دمج سمات بمقاييس مختلفة من خلال عمليات زيادة العينات وتقليل العينات. بالإضافة إلى ذلك، تدمج الوحدة آليات انتباه القنوات والمكان. ولضمان التكامل السلس بين وحدات YOLOv11 والشبكات العصبونية الالتفافية (CNN)، تم استخدام استراتيجية تدريب مشتركة. وأثناء التدريب، يتم تحسين معلمات كلا الوحدتين من الطرف إلى الطرف. وتجمع دالة الخسارة بين خسارة الكشف في YOLOv11 وخسارة تعزيز السمات في وحدة CNN. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

النتائج

للتحقق من فعالية نموذج دمج YOLOv11 وCNN المقترح في مراقبة السلامة في خطوط الإنتاج، تم إنشاء مجموعة بيانات تغطي سيناريوهات مختلفة لمخاطر السلامة. تحتوي مجموعة البيانات هذه على 12,000 صورة لمشاهد خطوط الإنتاج، مقسمة إلى مجموعات تدريب وتحقق واختبار بنسبة 7:1.5:1.5، مع تثبيت البذرة العشوائية عند 42. وتغطي المجموعة ظروف عمل متنوعة، بما في ذلك الإضاءة القياسية، والإضاءة المنخفضة، والانسداد الجزئي، والانسداد الشديد، والضبابية الحركية، والخلفيات المعقدة. تم ضبط حد الثقة للاستدلال عند 0.5، وحد كبت الحد الأقصى غير المرتبط (NMS) عند 0.45. كُررت جميع التجارب ثلاث مرات، وأبلغت النتائج كمتوسط ± الانحراف المعياري. وتتمثل فئات التعليقات التوضيحية في العمال، وخوذات السلامة، والأذرع الروبوتية، والمناطق الخطرة، والأدوات، والمركبات، وذلك باستخدام تنسيق PASCAL Visual Object Classes (VOC). تم ضبط حد التقاطع فوق الاتحاد (IoU) عند 0.5، وتم التحقق من اتساق التعليقات التوضيحية من خلال التحقق المتقاطع بواسطة شخصين. تم تغيير حجم الصور المدخلة بشكل موحد إلى 640 × 640 وتعزيزها ببيانات Mosaic. أُجري التدريب باستخدام محسن SGD بمعدل تعلم أولي قدره 0.01، وزخم 0.9، واضمحلال في الوزن بمقدار 0.0005، وحجم دفعة قدره 32. استمر التدريب لمدة 200 حقبة (epoch)، واستُخدم التلدين الجيبي لضبط معدل التعلم.

لتقييم فعالية النموذج بشكل شامل، تم استخدام مجموعة متنوعة من مقاييس التقييم: متوسط الدقة المتوسطة (mAP)، وعدد الإطارات في الثانية (FPS) لقياس معدل معالجة إطارات الصور، والدقة (precision) لتقييم صحة التنبؤات الإيجابية، والاستدعاء (recall) لقياس قدرة النموذج على اكتشاف الحالات الإيجابية الحقيقية، والمساحة تحت المنحنى (AUC) للإشارة إلى المساحة تحت منحنى خصائص تشغيل المستقبل (ROC)، مما يعكس القدرة التصنيفية العامة للنموذج. تظهر صيغ الحساب في المعادلات (4)، (5)، (6)، (7)، (8)، (9)، (10)، (11):

figure-results-1  (4)
figure-results-2  (5)
figure-results-3  (6)
تذكر أن figure-results-4 (7)
figure-results-5  (8)
figure-results-6  (9)
figure-results-7  (10)
figure-results-8  (11)

figure-results-9  هنا، يشير mAP@0.5 إلى متوسط الدقة المتوسطة عند عتبة IoU تبلغ 0.5؛ وN هو عدد الفئات؛ وAPi هو الدقة المتوسطة للفئة i؛ وmAP@[0.5:0.95] هو متوسط mAP المحسوب عبر عتبات IoU من 0.5 إلى 0.95. وتمثل TP وFP وFN وTN أعداد الإيجابيات الصحيحة، والإيجابيات الكاذبة، والسلبيات الكاذبة، والسلبيات الصحيحة، على التوالي. أما F فهو العدد الإجمالي للإطارات التي تمت معالجتها، وT هو إجمالي وقت المعالجة، وTPR هو معدل الإيجابيات الصحيحة، وFPR هو معدل الإيجابيات الكاذبة.
بالنسبة لمكون الكشف YOLOv11، تظهر دالة الخسارة في المعادلة (12):

figure-results-10     (12)

figure-results-11  حيث يشير Lcoord إلى الانحراف بين الإطار المتوقع والإطار الحقيقي، ويقيس Lconf خطأ الثقة للإطار المتوقع، بينما يقيس Lclass خطأ توقع الفئة، وتمثل λcoord و λconf و λclass معاملات الوزن المستخدمة لموازنة الخسائر المقابلة.

يُظهر تحليل البيانات في الجدول 1 أن الطريقة المقترحة تحقق mAP@0.5 بقيمة 0.91 وmAP@0.5:0.95 بقيمة 0.82، وهو ما يمثل تحسناً بمقدار 0.04 و0.04 على التوالي، مقارنة بـ YOLOv5. وتبلغ قيمة F1-score الخاصة بها 0.935، وهي أيضاً أعلى من قيم نماذج المقارنة. تبلغ سرعة الكشف 120 FPS، وهي أربعة أضعاف سرعة Faster R-CNN، ولكنها أقل قليلاً من YOLOv10 وYOLOv11. ويبلغ عدد المعلمات 6.7M، وهو ما يزيد بمقدار 1.5M فقط عن YOLOv11، مع تحسن قدره 0.03 في mAP@0.5. ومقارنة بـ EfficientDet، الذي يمتلك تكلفة حسابية مماثلة، تزيد الدقة بمقدار 0.06، بينما ينخفض عدد المعلمات بنسبة 56%. وتثبت البيانات أن آلية الانتباه والدمج متعدد المقاييس المقدمة تعزز بشكل فعال دقة الكشف عن الأهداف الصغيرة، مما يحقق توازناً جيداً بين السرعة والدقة. وباختصار، تحقق الطريقة المقترحة توازناً بين دقة الكشف والسرعة؛ حيث تزيد قيمة mAP@0.5 بمقدار 0.02 عن ثاني أفضل نموذج، وتصل قيمة F1-score إلى 0.935، وتُعد المعلمات البالغ عددها 6.7M كافية للنشر العملي. كما تعزز آلية الدمج متعدد المقاييس والانتباه من التعرف على الأهداف الصغيرة والمحجوبة في المشاهد المعقدة. يوازن النموذج بين الدقة والكفاءة، مما يجعله مناسباً لسيناريوهات الوقت الفعلي مثل مراقبة السلامة الصناعية. وجدير بالذكر أن جميع نماذج المقارنة تستخدم أوزانًا مدربة مسبقًا رسمية، مع دقة إدخال موحدة تبلغ 640 × 640، وعتبة NMS تبلغ 0.45، وعتبة ثقة تبلغ 0.5.

الطريقةmAP@0.5mAP@0.5:0.95F1-scoreFPSالمعاملات (M)
YOLOv50.870.780.891307.1
EfficientDet0.850.730.885015.3
RetinaNet0.820.680.854537.6
Faster R-CNN0.840.70.873045.2
YOLOv100.890.770.881355.3
YOLOv110.880.750.8951405.2
طريقتنا0.910.820.9351206.7

الجدول 1: جدول مقارنة شامل لأداء النموذج. يظهر تحليل البيانات أن الطريقة المقترحة تحقق mAP@0.5 بقيمة 0.91 وmAP@0.5:0.95 بقيمة 0.82، وهو ما يمثل تحسناً بمقدار 0.04 و0.04 على التوالي مقارنة بـ YOLOv5. وتبلغ قيمة F1-score الخاصة بها 0.935، وهي أيضاً أعلى من قيم نماذج المقارنة. تبلغ سرعة الكشف 120 FPS، وهي أربعة أضعاف سرعة Faster R-CNN، ولكنها أقل قليلاً من YOLOv10 وYOLOv11. يبلغ عدد المعلمات 6.7M، وهو ما يزيد بمقدار 1.5M فقط عن YOLOv11، مع تحسن بمقدار 0.03 في mAP@0.5. ومقارنة بـ EfficientDet، الذي يتطلب تكلفة حسابية مماثلة، تكون الدقة أعلى بمقدار 0.06، بينما يقل عدد المعلمات بنسبة 56%. وتثبت البيانات أن آلية الانتباه والدمج متعدد المقاييس المقدمة تعزز بفعالية من دقة كشف الأهداف الصغيرة، مما يحقق توازناً جيداً بين السرعة والدقة. وباختصار، تحقق طريقتنا المقترحة توازناً بين دقة الكشف والسرعة؛ حيث أن mAP@0.5 أعلى بمقدار 0.02 من ثاني أفضل نموذج، وتصل قيمة F1-score إلى 0.935، كما أن 6.7M من المعلمات كافية للنشر العملي. وتعزز آلية الدمج متعدد المقاييس والانتباه من التعرف على الأهداف الصغيرة والمحجوبة في المشاهد المعقدة. يوازن النموذج بين الدقة والكفاءة، مما يجعله مناسباً لسيناريوهات الوقت الفعلي مثل مراقبة السلامة الصناعية. ومن الجدير بالذكر أن جميع نماذج المقارنة تستخدم أوزانًا مدربة مسبقاً رسمية، مع دقة إدخال موحدة تبلغ 640 × 640، وعتبة NMS موحدة تبلغ 0.45، وعتبة ثقة موحدة تبلغ 0.5.

الشكل 2 يقدم تحليلاً متعمقاً لأنواع الكشف الخاطئ في النموذج. سجل YOLOv11 + CNN أدنى معدل للكشف الخاطئ في الخلفية (85 مرة/10,000 إطار)، حيث حدثت معظم عمليات الكشف الخاطئ في الأجسام المتشابهة (62 مرة) والمشاهد المحجوبة جزئياً (48 مرة). ويشير تحليل منحنى ROC إلى أن معدل الإيجابيات الصحيحة (TPR) للنموذج وصل إلى 0.9 (AUC = 0.98) عند معدل إيجابيات خاطئة (FPR) قدره 0.1، كما يدعم التباعد الضيق بين المنحنيات الموثوقية العالية لثقة الكشف. لا تدعم نتائج التحليل هذه أداء النموذج فحسب، بل توفر أيضاً خارطة طريق تقنية واضحة لتحسين عمليات الكشف الخاطئ لاحقاً، خاصة من خلال تعزيز قدرته على التمييز بين الأجسام المتشابهة.

figure-results-12
الشكل 2. تحليل الخطأ. تحليل أنواع الكشف الخاطئ للنموذج. سجل نموذج YOLOv11 + CNN أدنى معدل كشف خاطئ للخلفية (85 مرة/10,000 إطار)، مع تركز غالبية عمليات الكشف الخاطئ في الأجسام المتشابهة (62 مرة) والمشاهد المحجوبة جزئيًا (48 مرة). ويشير تحليل منحنى ROC إلى أن معدل الإيجابية الحقيقية (TPR) للنموذج وصل إلى 0.9 (AUC = 0.98) عند معدل إيجابية كاذبة (FPR) قدره 0.1، كما أن أضيق مسافة بين المنحنيات تدعم موثوقية الثقة في الكشف. لا تدعم نتائج هذا التحليل أداء النموذج فحسب، بل توفر أيضًا خارطة طريق تقنية واضحة لتحسين عمليات الكشف الخاطئ لاحقًا، خاصة من خلال تعزيز قدرته على تمييز الأجسام المتشابهة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3 يقارن أداء النموذج على منصات أجهزة متنوعة. يحقق YOLOv11 + CNN زمن استجابة منخفض للغاية يبلغ 18 ms على وحدة معالجة الموترات (TPU) الطرفية، مع تذبذب قدره ±2 ms فقط، بينما يتم التحكم في استهلاك الطاقة عند 15 W. وتظهر اختبارات معدل نقل البيانات أن النموذج يحقق سرعة معالجة تبلغ 70 FPS على أجهزة الحوسبة الطرفية Jetson Xavier، مع التحكم في زمن الاستجابة للمئوية التاسعة والتسعين ضمن 50 ms. تمكن مؤشرات أداء النشر هذه النموذج من التكيف مع احتياجات النشر لمختلف منصات الحوسبة في المجالات الصناعية. كما يوضح تحليل الخطأ بشكل أكبر أن النموذج يمكنه الحفاظ على أداء مستقر في البيئات محدودة الموارد، مما يثبت قابليته للتطبيق الهندسي.

figure-results-13
الشكل 3. أداء النشر. مقارنة لأداء النموذج على منصات أجهزة مختلفة. يحقق YOLOv11 + CNN زمن استجابة منخفض للغاية يبلغ 18 ms على Edge TPU (بتذبذب قدره ±2 ms فقط)، مع التحكم في استهلاك الطاقة عند 15 W. وتُظهر اختبارات الإنتاجية أن النموذج يحقق سرعة معالجة تبلغ 70 FPS على أجهزة الحوسبة الطرفية Jetson Xavier، مع التحكم في زمن استجابة المئوية 99 ضمن 50 ms. وتشير مؤشرات أداء النشر هذه إلى قدرته على التكيف مع احتياجات النشر لمختلف منصات الحوسبة في المجالات الصناعية. كما يوضح تحليل الخطأ أن النموذج يمكنه الحفاظ على أداء مستقر في البيئات محدودة الموارد، مما يثبت قابليته للتطبيق الهندسي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

يقارن الشكل 4 الاختلافات في أداء الكشف لكل نموذج عبر ست فئات مستهدفة. حقق نموذج YOLOv11 + CNN دقة بلغت 0.96 في مهمة التعرف على خوذة السلامة، متجاوزاً النموذج المرجعي بمقدار 4 نقاط مئوية. ويشير المخطط المنقط إلى أن النموذج يظهر تقلبات طفيفة في الأداء عبر الفئات (±0.05)، مما يعكس قدراته على التعميم. وتكشف مصفوفة الارتباك، المعروضة كخريطة حرارية، عن وجود كشف خاطئ متبادل بنسبة 15% بين المنطقة الخطرة والذراع الروبوتية. توفر هذه النتيجة توجهاً واضحاً لعملية تحسين النموذج لاحقاً.

figure-results-14
الشكل 4. تحليل كشف الفئات. مقارنة لاختلافات أداء الكشف لكل نموذج عبر ست فئات مستهدفة. حقق نموذج YOLOv11 + CNN دقة بلغت 0.96 في مهمة التعرف على خوذة السلامة، متفوقاً على النموذج المرجعي بنسبة 4 نقاط مئوية. يشير المخطط النقطي إلى أن النموذج يظهر تقلبات طفيفة في الأداء عبر الفئات (±0.05)، مما يعكس قدراته على التعميم. وتكشف مصفوفة الارتباك، المعروضة كخريطة حرارية، عن نسبة 15% من الكشف الخاطئ المتبادل بين المنطقة الخطرة والذراع الروبوتية. وتوفر هذه النتيجة توجهاً واضحاً لتحسين النموذج في المراحل اللاحقة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

يقدم الشكل 5 سجلاً شاملاً لعملية التدريب لكل نموذج. يُظهر نموذج YOLOv11 + CNN أسرع معدل تقارب، حيث انخفض الفقد إلى 0.1 خلال 30 حقبة تدريبية، كما أن الفجوة بين منحنى mAP لمجموعة التحقق ومجموعة التدريب كانت باستمرار أقل من 1%. ويُظهر تحليل مخطط نطاق الخطأ أن قيمة mAP@0.5 النهائية للتحقق في النموذج مستقرة عند 0.94 ± 0.01، ونطاق تذبذب أدائه يمثل ثلث نطاق تذبذب RetinaNet فقط. وتدعم هذه النتائج فعالية بروتوكول التدريب المشترك. كما يُظهر النموذج مزايا في الأداء في المراحل المبكرة من التدريب، مما يشير إلى أن تصميمه المعماري يُمكّنه من تعلم الميزات بسرعة.

figure-results-15
الشكل 5. تحليل عملية التدريب. سجل لعملية التدريب لكل نموذج. يُظهر YOLOv11 + CNN أسرع معدل تقارب (حيث تنخفض قيمة الفقد إلى 0.1 خلال 30 epoch)، والفجوة بين منحنى mAP لمجموعة التحقق ومجموعة التدريب تكون دائماً أقل من 1%. ويُظهر تحليل مخطط نطاق الخطأ أن قيمة mAP@0.5 النهائية للتحقق من النموذج مستقرة عند 0.94 ± 0.01، كما أن نطاق تقلب الأداء يمثل ثلث نطاق تقلب RetinaNet فقط. تدعم هذه النتائج فعالية بروتوكول التدريب المشترك. ويُظهر النموذج مزايا في الأداء في المراحل المبكرة من التدريب، مما يشير إلى أن تصميمه المعماري يُمكّنه من تعلم السمات بسرعة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الجدول 2 يعرض نتائج الأداء الكمية لنماذج كشف مختلفة في بيئات معقدة. وتظهر بيانات الاختبار عبر ظروف الإضاءة القياسية والسيناريوهات المتطرفة المتنوعة أن YOLOv11 + CNN يحافظ على أداء مثالي تحت جميع الظروف. ففي ظروف الإضاءة القياسية، وصلت قيمة mAP@0.5 لهذا النموذج إلى 0.91، وهو أفضل بكثير من YOLOv5 (0.87) و Faster R-CNN (0.84). ومع تدهور الظروف البيئية، ينخفض أداء كل نموذج بدرجات متفاوتة، ولكن YOLOv11 + CNN يظهر أقوى متانة بيئية: ففي ظروف الإضاءة المنخفضة (< 50 lux)، ينخفض الأداء بنسبة 3% فقط (إلى 0.88)، وهو أفضل من الانخفاض بنسبة 5% في النموذج المقارن؛ وفي سيناريوهات الانسداد الشديد (> 50%)، لا يزال بإمكان mAP الحفاظ على قيمة 0.78، ويكون تدهور الأداء (13%) أقل بكثير من YOLOv5 (15%) و Faster R-CNN (16%). تثبت هذه النتائج أن YOLOv11 + CNN يعزز قدرة النموذج على التكيف مع العوامل المعقدة، مثل تغيرات الإضاءة والانسدادات، من خلال تحسين دمج الميزات وآليات الانتباه، مما يدعم التطبيقات العملية في السيناريوهات الصناعية.

حالة الاختبارYOLOv11 + CNNYOLOv5Faster R-CNNتقلب الأداء
إضاءة قياسية0.910.870.840.01
إضاءة منخفضة (< 50 lux)0.88 (-3%)0.82 (-5%)0.79 (-5%)0.02
انسداد جزئي (30%–50%)0.85 (-6%)0.80 (-7%)0.76 (-8%)0.03
انسداد شديد (> 50%)0.78 (-13%)0.72 (-15%)0.68 (-16%)0.04
ضبابية الحركة0.83 (-8%)0.77 (-10%)0.73 (-11%)0.05

الجدول 2: جدول التحليل الكمي للتكيف البيئي. أداء نماذج الكشف المختلفة في البيئات المعقدة من خلال التحليل الكمي. تُظهر بيانات الاختبار، بدءاً من ظروف الإضاءة القياسية وصولاً إلى السيناريوهات القاسية المتنوعة، أن نموذج YOLOv11 + CNN يحافظ على أعلى أداء تحت جميع ظروف الاختبار. ففي ظروف الإضاءة القياسية، بلغت قيمة mAP@0.5 لهذا النموذج 0.91، وهو أداء أفضل بشكل ملحوظ من YOLOv5 (0.87) و Faster R-CNN (0.84). ومع تدهور الظروف البيئية، ينخفض أداء كل نموذج بدرجات متفاوتة، إلا أن YOLOv11 + CNN يُظهر أقوى متانة بيئية بين النماذج التي تم تقييمها: ففي ظروف الإضاءة المنخفضة (< 50 lux)، انخفض الأداء بنسبة 3% فقط (إلى 0.88)، وهو أفضل من انخفاض بنسبة 5% في النموذج المقارن؛ وفي سيناريوهات الحجب الشديد (> 50%)، لا يزال من الممكن الحفاظ على mAP عند 0.78، وكان تدهور الأداء (13%) أصغر بكثير من تدهور YOLOv5 (15%) و Faster R-CNN (16%). تثبت هذه النتائج أن YOLOv11 + CNN يعزز قدرة النموذج على التكيف مع العوامل المعقدة، مثل تغيرات الإضاءة وتداخل الحجب، وذلك من خلال آلية محسنة لدمج الميزات وتصميم الانتباه، مما يدعم التطبيقات العملية في السيناريوهات الصناعية.

يوضح الجدول 3 أنه تم استخدام مُحسِّن SGD في هذه التجربة، مع زخم قدره 0.9 لتسريع التقارب وكبح التذبذبات. كما استُخدم معدل تعلم أولي قدره 0.01 مع تلدين جيب التمام (cosine annealing)، والذي تناقص تدريجياً أثناء التدريب لتدقيق عملية التحسين. وتم تطبيق اضمحلال في الأوزان بمقدار 0.0005 لتطبيق تنظيم L2 والحد من الإفراط في التخصيص (overfitting). وقد وازن حجم الدفعة البالغ 32 بين الكفاءة الحسابية واستقرار تقدير التدرج. كما ضمنت دورات التدريب البالغ عددها 200 دورة تحقيق تقارب كافٍ. وتم تكييف هذه المعاملات لتناسب مهمة الكشف أحادية المرحلة، بما يوازن بين سرعة التدريب والدقة.

معلمةالقيمة
المُحسِّنالنزول الاشتقاقي العشوائي (SGD)
معدل التعلم الأولي0.01
الزخم0.9
اضمحلال الوزن0.0005
حجم الدفعة32
حقبات التدريب200
جدولة معدل التعلمالتلدين الجيبي (Cosine annealing)

الجدول 3: جدول المعلمات الفائقة للتدريب. تم استخدام محسّن SGD في هذه التجربة، مع زخم قدره 0.9 لتسريع التقارب وكبح التذبذبات. استُخدم معدل تعلم أولي قدره 0.01 مع التلدين الجيبي (cosine annealing)، والذي تناقص تدريجياً أثناء التدريب لتحسين عملية التحسين. تم إدخال اضمحلال للوزن قدره 0.0005 لتطبيق تنظيم L2 وتقليل الإفراط في التخصيص. وقد وازن حجم الدفعة البالغ 32 بين الكفاءة الحسابية واستقرار تقدير التدرج. وضمنت حقبات التدريب البالغ عددها 200 تقارباً كافياً. تم تكييف هذه المعلمات مع مهمة الكشف أحادية المرحلة، لتحقيق التوازن بين سرعة التدريب ودقته.

يوضح الجدول 4 أنه باستخدام YOLOv11 كنموذج أساسي، تبلغ قيمة mAP@0.5 نحو 0.89. ويؤدي إدخال الدمج متعدد المقاييس بمفرده إلى خفض الدقة إلى 0.88. بينما يؤدي إضافة طبقات انتباه القنوات وانتباه المكان بالتتابع إلى تحسين الدقة لتصل إلى 0.90 و 0.89 على التوالي. وتصل الدقة المجمعة لجميع الوحدات إلى 0.91، وهو ما يمثل تحسناً قدره 0.02 عن النموذج الأساسي. وتظهر البيانات أن انتباه القنوات يحسن الدقة بشكل مباشر، وأن الأداء المجمع للدمج متعدد المقاييس وآليات الانتباه هو الأداء الأمثل.

التكوينmAP@0.5
YOLOv11 (الأساسي)0.89
+ دمج متعدد المقاييس0.88
+ متعدد المقاييس + انتباه القنوات0.9
+ متعدد المقاييس + الانتباه المكاني0.89
الوحدة الكاملة (YOLOv11 + CNN)0.91

الجدول 4: جدول اختبار الاستئصال. باستخدام YOLOv11 كمرجع أساسي، بلغت قيمة mAP@0.5‏ 0.89. وأدى إدراج دمج متعدد المقاييس وحده إلى خفض الدقة إلى 0.88. بينما أدى إضافة انتباه القنوات أو الانتباه المكاني بعد الدمج متعدد المقاييس إلى تحسين الدقة لتصل إلى 0.90 و0.89 على التوالي. ووصلت الدقة المشتركة لجميع الوحدات إلى 0.91، وهو تحسن قدره 0.02 عن المرجع الأساسي. وتظهر البيانات أن انتباه القنوات يحقق مكاسب أكبر من الانتباه المكاني في هذا الإعداد، وأن الأداء المشترك للدمج متعدد المقاييس والانتباه هو الأفضل.

يقيم الشكل 6 أداء النموذج بشكل منهجي في البيئات القاسية. انخفض متوسط الدقة المتوسطة (mAP) لنموذج YOLOv11 + CNN بنسبة 6% فقط (إلى 0.88) في ظروف الإضاءة المنخفضة، وظل محافظاً على mAP قدره 0.78 (متفوقاً بنسبة 8% على المرجع) في المشاهد التي تعاني من انسداد شديد. وتثبت هذه النتائج أن النموذج يتمتع بقابلية للتكيف البيئي، حيث يعالج بفعالية التغيرات الشائعة في الإضاءة ومشاكل الانسداد الموضعي في الإنتاج الصناعي، مما يدعم التشغيل المستقر لنظام الكشف.

figure-results-16
الشكل 6. التكيف البيئي. تقييم منهجي لأداء النموذج في البيئات القاسية. انخفض mAP لنموذج YOLOv11 + CNN بنسبة 6% فقط (إلى 0.88) في ظروف الإضاءة المنخفضة، وظل يحافظ على mAP قدره 0.78 (بزيادة 8% عن المرجع) في المشاهد ذات الانسداد الشديد. تثبت هذه النتائج أن النموذج يظهر تكيفاً بيئياً، حيث يعالج بفعالية تغيرات الإضاءة الشائعة ومشاكل الانسداد الموضعي في الإنتاج الصناعي، مما يدعم التشغيل المستقر لنظام الكشف. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تقارن الشكل 7 الاختلافات في توزيع السمات بين YOLOv11 و YOLOv11 + CNN على ستة أنواع من الأهداف الصناعية من خلال خفض الأبعاد باستخدام t-SNE. يوضح الشكل الموجود على اليسار أن سمات النموذج الأساسي YOLOv11 تظهر تشتتاً ملحوظاً داخل الفئة الواحدة (المسافة داخل الفئة 2.34 ± 0.15)، وبشكل خاص في "منطقة الخطر" (باللون الأحمر) و"المركبة" (باللون الأرجواني)، حيث يوجد تداخل كبير، وهو ما يتفق مع معدل الكشف الخاطئ البالغ 15% في المجموعة التجريبية 3. ويظهر الشكل الموجود على اليمين أن نموذج YOLOv11 + CNN المطور يعزز بشكل كبير من تماسك الفئة الواحدة عبر وحدة تعزيز السمات، مما يزيد من متوسط المسافة بين مراكز العناقيد داخل كل فئة بمقدار 1.8 مرة.

figure-results-17
الشكل 7. مقارنة توزيع الميزات باستخدام t-SNE. مقارنة لاختلافات توزيع الميزات بين YOLOv11 و YOLOv11 + CNN على ستة أنواع من الأهداف الصناعية من خلال خفض الأبعاد بواسطة t-SNE. يوضح الشكل الأيسر أن ميزات النموذج الأساسي YOLOv11 تظهر تشتتًا داخليًا ملحوظًا للفئات (المسافة داخل الفئة 2.34 ± 0.15)، خاصة في "منطقة الخطر" (باللون الأحمر) و"المركبة" (باللون الأرجواني) حيث يوجد تداخل كبير، وهو ما يتوافق مع معدل الكشف الخاطئ بنسبة 15% في المجموعة التجريبية 3. ويظهر الشكل الأيمن أن نموذج YOLOv11 + CNN المطور يحسن بشكل كبير من تماسك الفئات من خلال وحدة تعزيز الميزات، كما زاد متوسط المسافة بين مراكز التجمعات في كل فئة بمقدار 1.8 مرة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

يؤكد الشكل 8 مساهمة كل وحدة من خلال تجارب الاستئصال المنهجية. وتظهر نتائج الاستئصال أن إضافة انتباه القناة (channel attention) بعد الدمج متعدد المقاييس ترفع mAP@0.5 إلى 0.90، بينما ترفع إضافة الانتباه المكاني (spatial attention) mAP@0.5 إلى 0.89. وتحقق الوحدة الكاملة أعلى قيمة mAP@0.5 بلغت 0.91. كما يوضح تصور الخريطة الحرارية أن آلية الانتباه المركبة يمكنها تعزيز استجابة الكشف لمركز المنطقة الخطرة (قيمة التنشيط: +0.15) والأهداف الصغيرة عند الحافة (+0.08) في آن واحد. وتثبت البيانات التجريبية أن دمج السمات متعدد المقاييس وآليات الانتباه لهما تأثير تراكمي، مما يمكن النموذج من تلبية متطلبات كشف الأهداف بمقاييس مختلفة.

figure-results-18
الشكل 8. تجربة الاستئصال النمطي. التحقق من مساهمة كل وحدة من خلال تجارب استئصال منهجية. تُظهر نتائج الاستئصال أن إضافة انتباه القنوات بعد الدمج متعدد المقاييس ترفع mAP@0.5 إلى 0.90، بينما ترفع إضافة الانتباه المكاني mAP@0.5 إلى 0.89. وتحقق الوحدة الكاملة أعلى قيمة mAP@0.5 وهي 0.91. ويُظهر التصوير بالخريطة الحرارية أن آلية الانتباه المركبة يمكنها تعزيز استجابة الكشف لمركز المنطقة الخطرة (قيمة التنشيط: +0.15) والأهداف الصغيرة عند الحافة (+0.08) في وقت واحد. وتثبت البيانات التجريبية أن دمج الميزات متعدد المقاييس وآليات الانتباه لهما تأثير تراكمي، مما يمكن النموذج من تلبية متطلبات كشف الأهداف عبر مقاييس مختلفة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

توافر البيانات:
تخضع الصور الكاملة الخام لخط الإنتاج وتدفقات الفيديو لقيود السرية الصناعية ولا يتم إصدارها للعامة. يوفر وصف مجموعة البيانات التكميلية (الملف التكميلي 1) تفاصيل الحصول على مجموعة البيانات، وتوزيعات الفئات والسيناريوهات، ومواصفات التعليق التوضيحي، وإجراءات مراقبة الجودة، وتقسيمات البيانات، والمعالجة المسبقة، وإجراءات التعزيز. يوفر إطار عمل الكود الزائف وقابلية التكرار (الملف التكميلي 2) سير عمل على مستوى الكود الزائف، وأوصاف التكوين، وإرشادات لإعادة الإنتاج. يمكن طلب مجموعة فرعية مجهولة الهوية ومواد داعمة إضافية من المؤلف المسؤول لأغراض البحث الأكاديمي غير التجاري، وذلك وفقاً للقيود المؤسسية وقيود السرية.

الملف التكميلي 1. وصف مجموعة البيانات التكميلية. يصف هذا الملف بروتوكول الحصول على مجموعة البيانات، وتغطية السيناريوهات، وتوزيع الفئات، ومواصفات التعليق التوضيحي، وإجراءات مراقبة الجودة، وتقسيم بيانات التدريب والتحقق والاختبار، وعمليات المعالجة المسبقة، وإجراءات التعزيز. يرجى النقر هنا لتحميل هذا الملف.

الملف التكميلي 2. الرمز الزائف وإطار عمل إعادة الإنتاج. يوفر هذا الملف تفاصيل سير العمل على مستوى الرمز الزائف وتفاصيل التكوين الخاصة بالمعالجة المسبقة، والتدريب، والتقييم، والنشر، كما يصف القيود المفروضة على لقطات الفيديو الصناعية الخام والوصول إلى المواد الداعمة. يرجى النقر هنا لتحميل هذا الملف.

المناقشة

تظهر النتائج التجريبية أن نموذج دمج YOLOv11–CNN المقترح يحسن دقة الكشف والأداء في الوقت الفعلي لمراقبة السلامة في خط الإنتاج. ومن خلال الاستفادة من الكشف الفعال أحادي المرحلة لـ YOLOv11 وتعزيز الميزات في وحدة CNN، تمكن النظام من تحديد العمال والمعدات والمناطق الخطرة في ظل ظروف إضاءة معقدة وحالات حجب الرؤية. كما ساهم دمج الميزات متعددة المقاييس وآليات الانتباه في تعزيز القدرة على التركيز على عناصر السلامة الرئيسية، مما وفر أدلة بصرية قابلة للتفسير للإنذار المبكر.

يتمتع النظام بقيمة عملية لخطوط الإنتاج في بيئات مثل تصنيع السيارات وتجميع الإلكترونيات، حيث يمكن للمراقبة في الوقت الفعلي تقليل الاعتماد على الفحص اليدوي وتقصير أوقات الاستجابة للمخاطر الأمنية المحتملة. وبالنسبة للأهداف الصغيرة، مثل البراغي والأدوات، ولأهداف العمال المحجوبة جزئياً بواسطة الأذرع الروبوتية أو المعدات الأخرى، تعمل آليات دمج الميزات متعددة المقاييس والانتباه على تحسين قدرة النموذج على استخراج وإبراز الميزات المتعلقة بالسلامة. وتعد هذه التحسينات ذات صلة ببيئات الإنتاج التي تختلف فيها الأهداف من حيث الحجم ومدى الرؤية.

ومع ذلك، لا تزال هذه الدراسة تعاني من قيود واضحة. ففي حالات الانسداد الشديد أو الإضاءة المنخفضة جداً، قد يتراجع أداء النموذج لأن معلومات سمات الهدف تصبح غير مكتملة، وقد تكون السمات التلافيفية الموجودة غير كافية. كما أن وحدة تعزيز سمات CNN المضافة حديثاً تُدخل 1.5M من المعلمات الإضافية، مما قد يزيد من العبء الحسابي على أجهزة الحافة منخفضة التكلفة ويحد من إمكانية النشر في البيئات ذات الموارد المحدودة. وتستخدم هذه الدراسة بيانات صور الضوء المرئي ولا تدمج معلومات المستشعرات متعددة الأنماط، مثل التصوير الحراري بالأشعة تحت الحمراء أو رادار الموجات المليمترية؛ وبناءً على ذلك، قد يكون الأداء محدوداً في المشاهد الصناعية القاسية مثل الظلام التام أو الدخان.

ستركز الأبحاث المستقبلية على التوجهات التالية: تخفيف وزن النموذج بناءً على التشذيب الهيكلي وتقطير المعرفة لتقليل عبء المعلمات مع الحفاظ على أداء الكشف؛ وبناء إطار عمل للكشف بالدمج متعدد الوسائط بين الأشعة تحت الحمراء والمرئية لتحسين قدرة الكشف في ظروف الإضاءة القاسية وبيئات الدخان؛ وإدخال وحدة Transformer خفيفة الوزن لاستبدال جزء من الطبقات الالتفافية وتعزيز استخراج ميزات السياق بعيدة المدى؛ وتطوير نظام فرعي للتعرف على السلوك غير الطبيعي من الطرف إلى الطرف لدعم سير العمل الكامل بدءاً من كشف الهدف وصولاً إلى الإنذار المبكر بالسلوك.

في الختام، تركز هذه الدراسة على نظام مراقبة سلامة خطوط الإنتاج الذي يدمج خوارزميتي YOLOv11 وCNN لتمكين الكشف في الوقت الفعلي والإنذار المبكر للمخاطر الأمنية المحتملة في البيئات الصناعية المعقدة. ومن خلال التحقق التجريبي، أظهر نموذج الدمج مزايا في الأداء من حيث دقة اكتشاف الأجسام وسرعة الاستدلال. وبفضل بنية الكشف ذات المرحلة الواحدة الفعالة واستخراج الميزات المحسّن، أدى YOLOv11 أداءً جيداً في التعرف السريع على العمال والمعدات والمناطق الخطرة، والتقط بدقة عناصر السلامة الرئيسية في سيناريوهات خطوط الإنتاج. وفي الوقت ذاته، ساهم إدخال وحدة CNN المطورة في تعزيز التقاط الميزات واكتشاف الأهداف المحجوبة. وفي مراقبة سلامة خطوط الإنتاج، يركز النموذج تلقائياً على مناطق السلامة الرئيسية في الصورة من خلال التحليل البصري، مما يوفر أساساً قابلاً للتفسير لتحذيرات السلامة. وقد أظهر نموذج الدمج قدرة عالية على التكيف والاستقرار عبر مختلف سيناريوهات خطوط الإنتاج، بما في ذلك التشغيل الميكانيكي، والتجميع، والتخزين. وتتمثل الأعمال الرئيسية لهذه الورقة فيما يلي:

(1) تم تصميم بنية دمج عميق لـ YOLOv11 وCNN لتحقيق التوازن بين سرعة الكشف ودقته.
(2) تم بناء آلية لدمج الميزات متعددة المقاييس وتحسين الانتباه لتعزيز القدرة على التركيز على عناصر السلامة الرئيسية في السيناريوهات المعقدة.
(3) أظهرت التجارب على مجموعة بيانات سلامة خط الإنتاج التي تم بناؤها ذاتياً أن النموذج حقق mAP@0.5 بلغت 0.91 وسرعة كشف وصلت إلى 120 FPS. وفي اختبارات السيناريوهات المتقاطعة، أظهر النموذج أداءً مستقراً.

أظهرت دراسات الحالة النموذجية أنه في ظل ظروف الإضاءة القياسية، تم اكتشاف خوذة سلامة بنسبة ظهور 40% فقط بدقة بواسطة الدمج متعدد المقاييس والانتباه القنوي (بثقة قدرها 0.93)، بينما أخطأ النموذج المرجعي في تحديدها واعتبرها جزءاً من الخلفية. أما في سيناريوهات الإضاءة المنخفضة، فعند دخول عامل إلى منطقة خطرة، نجح الانتباه المكاني في تحديد الهدف بخطوط توجيهية، بينما فشلت طريقة المقارنة في اكتشافه. وشملت الإخفاقات الكشف الخاطئ عن مفتاح ربط كأداة بسبب تشابه ملمسه مع الخلفية في حالات الانسداد الشديد، وعدم اكتشاف خوذة سلامة بسبب انخفاض نسبة الإشارة إلى الضجيج عند المسافات البعيدة في ظروف الإضاءة المنخفضة، مما كشف عن قصور في تمثيل السمات تحت الظروف القاسية. وتشير هذه النتائج إلى أن النموذج يتمتع بالقوة في السيناريوهات العادية والمتوسطة التعقيد، ولكنه لا يزال بحاجة إلى تحسين في الظروف القاسية.

الإفصاحات

ليس لدى المؤلفين أي تضارب في المصالح للإعلان عنه.

شكر وتقدير

تم تمويل هذا العمل جزئياً من قبل مؤسسة جامعة تايتشو للبحوث العلمية للمواهب المتقدمة ضمن مشروع "البحث في التقنيات الرئيسية للكشف الدقيق للتصنيع الذكي" (TZXY2020QDJJ006).

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
COCO API   غير متاحأداة تقييم مستخدمة لتحليل الإحصائيات وتقييم دقة اكتشاف الأهداف.
CUDA 11.4NVIDIAغير متاحمنصة حوسبة متوازية مستخدمة مع إطار عمل PyTorch 1.12.
Edge TPU   غير متاحمنصة نشر مستخدمة لاختبار استهلاك الطاقة وزمن الاستجابة؛ وكان زمن الاستجابة المسجل 18 ms واستهلاك الطاقة 15 W.
جهاز Jetson Xavier للحوسبة الطرفيةNVIDIA   جهاز حوسبة طرفية مستخدم لاختبار إنتاجية البيانات؛ وكانت سرعة المعالجة المسجلة 70 FPS مع زمن استجابة للمئوية 99 ضمن 50 ms.
وحدة معالجة الرسوميات NVIDIA Tesla V100 GPUNVIDIA   وحدة معالجة الرسوميات المستخدمة في خادم التدريب والتقييم.
PyTorch 1.12   غير متاحإطار عمل للتعلم العميق مستخدم لتدريب النموذج وتقييمه.
scikit-learn    غير متاحأداة تحليل إحصائي وتقييم مستخدمة لتقييم النموذج.
مجموعة بيانات سلامة خط الإنتاج المُعدة ذاتياًغير متاحغير متاحمجموعة بيانات تضم 12,000 صورة لمشاهد خط الإنتاج بتنسيق VOC، تغطي ظروف الإضاءة القياسية، والإضاءة المنخفضة، والانسداد الجزئي، والانسداد الشديد، وضبابية الحركة، والخلفيات المعقدة؛ وتتضمن ست فئات من التعليقات التوضيحية: العمال، وخوذات السلامة، والأذرع الروبوتية، والمناطق الخطرة، والأدوات، والمركبات.
خادم التدريب       خادم مجهز بوحدة معالجة الرسوميات NVIDIA Tesla V100 GPU ونظام تشغيل Ubuntu 20.04.
نظام التشغيل Ubuntu 20.04     غير متاحنظام التشغيل المستخدم في خادم التدريب والتقييم.
تنسيق التعليقات التوضيحية VOCغير متاحغير متاحتنسيق التعليقات التوضيحية المستخدم لمجموعة بيانات سلامة خط الإنتاج المُعدة ذاتياً.
نموذج YOLOv11 لاكتشاف الكائناتUltralyticsغير متاحنموذج لاكتشاف الكائنات مستخدم للكشف عن العمال والمعدات والمخاطر المحتملة في الوقت الفعلي.

المراجع

  1. Ramadan MNA, Ali MAH, Jaber H, Alkhedher M. Blockchain-secured IoT-federated learning for industrial air pollution monitoring: a mechanistic approach to exposure prediction and environmental safety. Ecotoxicol Environ Saf. 2025;300:118442.
  2. Ahn J, et al. SafeFac: video-based smart safety monitoring for preventing industrial work accidents. Expert Syst Appl. 2023;215:119397.
  3. Natha S, et al. A scalable and generalized deep ensemble model for road anomaly detection in surveillance videos. Comput Mater Contin. 2024;81(3):3707-3729.
  4. Diallo AR, Homri L, Dantan JY. Reducing false alarms in fault detection: a comparative analysis between conformal prediction and classical methods applied to PCA and autoencoders. J Process Control. 2025;152:103495.
  5. Cheng X, Han Y, Zhang W. Development of intelligent monitoring system for soil erosion in pipeline engineering based on deep learning. Comput Electr Eng. 2025;126:110432.
  6. Yan H, et al. A global feature fusion and adaptive optimization method to enhance detection accuracy and computational efficiency based on YOLOv8. Alexandria Eng J. 2025;129:538-552.
  7. Samma H, Al-Azani S, El-Ferik S. UAV-based real-time face detection using YOLOv7. Transp Res Procedia. 2025;84:331-338.
  8. Gong X, Yu J, Zhang H, Dong X. AED-YOLO11: a small object detection model based on YOLO11. Digit Signal Process. 2025;166:105411.
  9. Li R, Xiao K, Lin S, Wu Z. Enhancing aquatic ecosystem monitoring through fish jumping behavior analysis and YOLOv5: applications in freshwater fish identification. J Environ Manage. 2025;391:126413.
  10. Zhang D, Gao Q, Chen Z, Lin Z. Semantic feature refinement of YOLO for human mask detection in dense crowded. J Vis Commun Image Represent. 2025;107:104399.
  11. Choi MJ, Ku DG, Lee SJ. Integrated YOLO and CNN algorithms for evaluating degree of walkway breakage. KSCE J Civ Eng. 2022;26(8):3570-3577.
  12. Li Y, et al. Underwater acoustic intelligent spectrum sensing with multimodal data fusion: an Mul-YOLO approach. Future Gener Comput Syst. 2025;173:107880.
  13. Jiang D, et al. Real-time tracker of chicken for poultry based on attention mechanism-enhanced YOLO-Chicken algorithm. Comput Electron Agric. 2025;237:110640.
  14. Yang X, et al. Automated concrete bridge damage detection using an efficient Vision Transformer-enhanced anchor-free YOLO. Engineering. 2025;51:311-326.
  15. Fuertes D, et al. People detection with omnidirectional cameras using a spatial grid of deep learning foveatic classifiers. Digit Signal Process. 2022;126:103473.
  16. Deepak GD, Bhat SK. Maximizing YOLOv2 efficiency: a study on multiclass detection of indoor objects. Results Eng. 2025;26:105405.
  17. Zhang C, et al. Personnel target detection in infrared environment based on YOLOv3-tinier network and its FPGA implementation. Infrared Phys Technol. 2025;150:106015.
  18. Zhou Y. A YOLO-NL object detector for real-time detection. Expert Syst Appl. 2024;238:122256.
  19. Asadollahpour E, Rahmannejad R, Asghari A, Abdollahipour A. Back analysis of closure parameters of Panet equation and Burger's model of Babolak water tunnel conveyance. Int J Rock Mech Min Sci. 2014;68:159-166.
  20. Anguchamy KK, Palanisamy V. Real-time object detection using improvised YOLOv4 and feature mapping technique for autonomous driving. Expert Syst Appl. 2025;280:127452.
  21. Khan AT, Jensen SM, Khan AR. Advancing precision agriculture: a comparative analysis of YOLOv8 for multi-class weed detection in cotton cultivation. Artif Intell Agric. 2025;15(2):182-191.
  22. Raushan R, Singhal V, Jha RK. Damage detection in concrete structures with multi-feature backgrounds using the YOLO network family. Autom Constr. 2025;170:105887.
  23. Zarboubi M, Bellout A, Chabaa S, Dliou A. CustomBottleneck-VGGNet: advanced tomato leaf disease identification for sustainable agriculture. Comput Electron Agric. 2025;232:110066.
  24. Xie F, et al. Wine variety traceability by data fusion of near-infrared spectroscopy and mid-infrared spectroscopy combined with GAF and ResNet. Chemom Intell Lab Syst. 2025;264:105468.
  25. Huang J, et al. Estimation of the orientation of potatoes and detection bud eye position using potato orientation detection you only look once with fast and accurate features for the movement strategy of intelligent cutting robots. Eng Appl Artif Intell. 2025;142:109923.
  26. Huang Y, et al. Human intrusion detection with distributed fiber optic data based on Squeeze-Excitation and hierarchical connection enhancement network. Opt Fiber Technol. 2025;94:104297.
  27. Qi R, et al. Mechanical fault diagnosis of on-load tap changers using time-frequency vibration analysis and a lightweight YOLO model. Measurement. 2025;256:118441.
  28. Yan J, Wang Z. YOLO V3+VGG16-based automatic operations monitoring and analysis in a manufacturing workshop under Industry 4.0. J Manuf Syst. 2022;63:134-142.
  29. Nazli NANM, et al. A real-time system for detecting personal protective equipment compliance using deep learning model YOLOv5. Procedia Comput Sci. 2024;245:647-656.
  30. Xiao Y, et al. The prediction of kiwi quality attributes based on multi-source data fusion comprehensive analysis model using HSI and FHSI. J Food Compos Anal. 2025;144:107645.

إعادة الطباعة والأذونات

الوسوم

YOLOv11