في الإنتاج الصناعي الحديث، تُعد السلامة حجر الزاوية لضمان كفاءة الإنتاج وسلامة الأفراد. عادةً ما تتضمن بيئة خط الإنتاج معدات ميكانيكية عالية السرعة، وعمليات تكنولوجية معقدة، وعمليات تعاونية تشمل مهام متعددة. ويمكن لأي خطر بسيط محتمل على السلامة أن يؤدي إلى حوادث إنتاج خطيرة، مما يتسبب في خسائر اقتصادية جسيمة بل وحتى وفيات. لذلك، من الضروري إنشاء نظام مراقبة سلامة فعال وذكي وفي الوقت الفعلي لتعزيز السلامة في الإنتاج الصناعي1,2.
تعتمد طرق مراقبة السلامة التقليدية بشكل أساسي على المراقبة اليدوية بالفيديو ومختلف المستشعرات (مثل مستشعرات الأشعة تحت الحمراء والدخان والاهتزاز)3. ولا تقتصر المراقبة اليدوية على كونها غير فعالة فحسب، بل إنها عرضة لفقدان بعض الاكتشافات بسبب إجهاد أفراد المراقبة، كما أنها لا توفر تغطية مستمرة وشاملة. ورغم أن المستشعرات يمكن أن توفر وظيفة إنذار مبكر معينة، إلا أن نطاق اكتشافها محدود، وهي حساسة للتداخلات البيئية، مما يؤدي إلى ظهور مشكلات بارزة تتمثل في الإنذارات الكاذبة4. لذا، أصبحت أنظمة المراقبة الذكية محوراً متزايداً للبحث؛ حيث يمكن للتحليل الفوري لتدفق الفيديو باستخدام خوارزمية التعلم العميق أن يحدد تلقائياً الأحداث غير الطبيعية، والسلوكيات غير الآمنة، والمخاطر المحتملة، مما يؤدي إلى تحسين ذكاء نظام المراقبة بشكل كبير4,5.
يُعد اكتشاف الكائنات تقنية أساسية في المراقبة الذكية. وتُظهر سلسلة خوارزميات You Only Look Once (YOLO)، بصفتها نماذج لمكتشفات الكائنات أحادية المرحلة، مزايا كبيرة. ومنذ YOLOv1 وصولاً إلى YOLOv8، خضعت هذه المجموعة من الخوارزميات لتطوير مستمر، مع تحسينات في بنية الشبكة، ودالة الفقد، ومنهجية التدريب، من بين جوانب أخرى6,7. وقد حققت YOLOv1، على وجه الخصوص، دقة اكتشاف أعلى مع الحفاظ على معدل إطارات مرتفع، لاسيما عند مواجهة الخلفيات المعقدة والأهداف المتكدسة بكثافة8.
ومع ذلك، ورغم أدائه المتميز في مهام الكشف العام عن الكائنات، لا يزال YOLOv1 يواجه تحديات في سيناريوهات محددة لمراقبة السلامة في خطوط الإنتاج9. فعلى سبيل المثال، قد تنخفض دقة الكشف في YOLOv1 عندما يكون العمال محجوبين جزئياً بواسطة المعدات، أو عندما تكون علامات السلامة صغيرة وتشبه لون الخلفية بشكل كبير. وهذا يتطلب أن يمتلك النموذج قدرات أقوى في استخراج الميزات والفهم الدلالي10.
تتمتع الشبكات العصبية التفافية (CNNs) بقدرات قوية في استخراج سمات الصور1. ومن خلال تصميم بنيات شبكية أكثر عمقاً وتعقيداً، يمكن للشبكات العصبية التفافية تعلم سمات صور أغنى وأكثر تجريداً. ويؤدي دمج الشبكات العصبية التفافية مع YOLOv1 إلى الاستفادة من قدرات الكشف السريع لـ YOLOv1 والاستخراج العميق للسمات الخاص بالشبكات العصبية التفافية، مما يساهم في بناء نظام مراقبة سلامة أكثر قوة وذكاءً.
وبناءً على ذلك، تقترح هذه الورقة نظاماً لمراقبة السلامة في خطوط الإنتاج باستخدام YOLOv1 وشبكة عصبية تلافيفية (CNN). وتتضمن الجوانب الابتكارية لهذه الدراسة ما يلي: (1) اقتراح بنية دمج عميقة لـ YOLOv1 وشبكة CNN محسنة؛ (2) تقديم دمج للميزات متعددة المقاييس وآلية انتباه مركبة لتعزيز التعرف على ميزات السلامة الرئيسية؛ و(3) التحقق من المزايا الأدائية للنموذج باستخدام مجموعة بيانات لمشاهد معقدة تم بناؤها ذاتياً.
تطوير سلسلة خوارزميات YOLO
منذ تقديمها لأول مرة من قبل Redmon وآخرين في عام 201512، حظيت خوارزمية You Only Look Once (YOLO) باهتمام كبير. وبخلاف الكواشف ثنائية المرحلة التي تعتمد على مقترحات المناطق، تعامل YOLO عملية اكتشاف الكائنات كمهمة انحدار. ومن خلال التنبؤ المباشر بفئات الكائنات ومواقعها في الصورة، تزيد YOLO سرعة الاكتشاف بشكل ملحوظ، مما يجعلها مناسبة للاستخدام في الوقت الفعلي13.
باعتباره العمل الرائد في هذه السلسلة، حقق YOLOv1 الكشف عن الأهداف من الطرف إلى الطرف لأول مرة14. يتضمن YOLOv1 تقسيم الصورة المدخلة إلى هيكل شبكي، حيث تُكلف كل خلية شبكية، والتي يتم ترتيبها عادةً بتنسيق S × S، بالكشف عن الكائنات التي تقع ضمن حدودها.
تحديدًا، تكون مخرجات YOLOv1 عبارة عن تنسور (tensor). ومن بين الـ S × S × (B × 5 + ج)، يحتوي التنبؤ بكل صندوق إحاطة على 5 عناصر: إحداثيات نقطة المركز (س، ص)، العرض و، الارتفاع هـ، والثقة جتوضح المعادلة (1) عملية الحساب:
(1)
ومن بينها، Pr(كائن( ) تمثل احتمالية وجود هدف في الشبكة، و تقاطع الاتحاد (IOU) تمثل نسبة التقاطع على الاتحاد بين المربع المحيط المتوقع ومربع الحقيقة الأرضية. كما يتوقع كل مربع شبكي أيضاً مجموعة من احتمالات الفئة، بروتين (Pr) يمثل احتمالية انتماء الهدف إلى الـ i-الفئة في وجود هدف ما. تتكون دالة الخسارة في YOLOv1 من ثلاثة مكونات رئيسية: خسارة التنبؤ بالإحداثيات، وخسارة تقدير الثقة، وخسارة التنبؤ بالفئة.15.
يقدم YOLOv2 تقنية تطبيع الدفعات (Batch Normalization)، ومصنفاً عالي الدقة، واستراتيجية تدريب متعددة المقاييس، مما أدى إلى تحسين الاستقرار والدقة16. أما YOLOv3 فيستخدم Darknet-53 كشبكة أساسية، ويستلهم مفهوم شبكة الهرم الميزاتي (Feature Pyramid Network - FPN) لتعزيز عملية اكتشاف الأهداف17.
لقد أجرى YOLOv4 تحسينات عديدة بناءً على YOLOv3، حيث قدم تقنيات مثل الشبكة الجزئية عبر المراحل (CSPNet)18، وشبكة تجميع المسارات (PANet)19، وتعزيز البيانات بطريقة الموزاييك (Mosaic) لتحسين أداء النموذج بشكل أكبر. أما YOLOv5 فقد قدم مساهمات هندسية كبيرة، حيث وفر تطبيقاً أكثر كفاءة وأسهل في الاستخدام20.
في السنوات الأخيرة، استمرت سلسلة YOLO في التطور، حيث تم إصدار نسخ مثل YOLOv6 وYOLOv7 وYOLOv8 الواحد تلو الآخر. ومن خلال تقديم بنية شبكة تجميع الطبقات الفعالة الموسعة (E-ELAN) وتقنيات إعادة تمثيل معاملات النموذج، حقق YOLOv7 طفرات جديدة في كل من السرعة والدقة. ولا تساهم هذه التحسينات في رفع كفاءة تعلم الميزات فحسب، بل تعمل أيضاً على تحسين أداء الاستدلال للشبكة، مما مكن YOLOv7 من تجاوز الإصدارات السابقة والعديد من الكواشف الرئيسية في مختلف مهام اكتشاف الكائنات في الوقت الفعلي. كما قام YOLOv8 بتحسين بنية الشبكة بشكل أكبر، واعتماد تصميم خالٍ من المراسِي (anchor-free)، وتبسيط النموذج، وتحسين قدرته على التعميم21.
بناءً على مزايا الإصدارات السابقة، تم تحسين YOLOv1 المستخدم في هذه الدراسة للتعامل مع السيناريوهات الصناعية المعقدة. وتشمل تحسيناته الجوهرية شبكة لاستخراج الميزات، ووحدة دمج ميزات أكثر كفاءة، وتصميماً أكثر متانة لدالة الخسارة. تمكن هذه التحسينات YOLOv1 من تقديم أداء أفضل عند التعامل مع حالات الاحتجاب، والأهداف الصغيرة، والخلفيات المعقدة في بيئات الإنتاج. يُعد YOLOv1 إصداراً من سلسلة YOLO التي أصدرتها شركة Ultralytics. ومقارنةً بـ YOLOv8، فإنه يحسن وحدة C3K2 ومسار دمج الميزات، ويقدم استراتيجية صناديق الإرساء التكيفية، مما يوفر متانة أقوى في الكشف ضمن السيناريوهات الصناعية.
أساس وتطور الشبكة العصبية التلافيفية (CNN)
تُعد الشبكة العصبية التلافيفية (CNN) نموذجاً محورياً أثّر بشكل عميق في نجاح التعلم العميق ضمن مجال الرؤية الحاسوبية. وهي تعمل من خلال استخراج سمات الصور المحلية عبر عمليات التلافيف، ثم تقليل أبعاد هذه السمات لاحقاً عبر عمليات التجميع، وبذلك تحقق تجريداً هرمياً للصور2.
تكون الشبكة العصبية التلافيفية (CNN) النموذجية من طبقات تلافيفية، وطبقات تجميع، وطبقات متصلة بالكامل. تقوم الطبقة التلافيفية بمسح الصورة المدخلة باستخدام نواة تلافيفية، وتحسب الضرب النقطي عبر المناطق المحلية، وتنتج خريطة سمات. وتظهر عملية الحساب في المعادلة (2):
(2)
أين يرجى تزويدي بالنص المراد ترجمته. هي الصورة المدخلة، وك و bكـ يمثلان الوزن والانحياز لنواة التلافيف، على التوالي، و
هل قيم خريطة الميزات الناتجة عند الموضع (i,jتستخدم طبقة التجميع عادةً التجميع الأقصى (Max Pooling) أو التجميع المتوسط (Average Pooling). وتكون الطبقة كاملة الاتصال مسؤولة عن استخراج الميزات والتنبؤ باحتمالات التصنيف.
بناءً على ذلك، تصمم هذه الورقة وحدة تعزيز ميزات CNN لنموذج YOLOv1، والتي تتكون من فرعين متوازيين: فرع تلافيف متعدد المقاييس يستخدم نوى تلافيف 3 × 3 و 5 × 5 لاستخراج ميزات متعددة المقاييس؛ وفرع انتباه يربط بالتتابع وحدات انتباه القنوات (Squeeze-and-Excitation) وانتباه المكان لتعزيز الميزات التمييزية للأهداف الرئيسية. يتم دمج مخرجات الفرعين عن طريق الجمع العنصري، وتظهر دالة فقد تعزيز الميزات المقابلة في الصيغة (3):
(3)
Lcoord هي خسارة انحدار إحداثيات الصندوق المحيط؛ وLconf هي خسارة الثقة المستهدفة؛ وLcls هي خسارة تصنيف الفئة؛ وLfeat هي خسارة تعزيز السمات، وتُستخدم لتقييد السمات التمييزية للأهداف الصغيرة والأهداف المحجوبة التي استخرجتها وحدة تعزيز CNN؛ بينما تمثل λcoord وλconf وλcls وλfeat معاملات الوزن لبنود الخسارة المقابلة. وبالنسبة لهذه المهمة، تم تعيين قيمة λfeat = 0.05، وتم موازنة الأوزان المتبقية وفقاً لمتطلبات مهمة الكشف.
حققت هياكل الشبكات العصبية الالتفافية (CNN) الكلاسيكية، مثل VGGNet23 وResNet24، نجاحاً كبيراً في مهام تصنيف الصور. ومن بين هذه البنيات، تعمل ResNet بفعالية على تخفيف مشكلة تلاشي التدرج (vanishing gradient problem) في تدريب الشبكات العميقة، مما يسهل بناء هياكل شبكية أكثر عمقاً وتعقيداً.
في مهام اكتشاف الكائنات، تُستخدم الشبكة العصبية التلافيفية (CNN) عادةً كمستخرج للميزات (backbone). على سبيل المثال، فإن Darknet وcross-stage partial Darknet (CSPDarknet)، وغيرها في سلسلة خوارزميات YOLO، مبنية جميعها على CNN25. ولتعزيز قدرات استخراج الميزات، اقترح الباحثون العديد من هياكل CNN المحسنة؛ حيث تقوم وحدة Inception مثلاً باستخراج الميزات بالتوازي من خلال نوى تلافيفية متعددة المقاييس، بينما تعز DenseNet إعادة استخدام الميزات عبر الاتصالات الكثيفة. كما تقوم شبكة Squeeze-and-Excitation بضبط أهمية قنوات الميزات تكيفياً من خلال آليات الانتباه26.
في هذه الدراسة، قمنا بتصميم وحدة CNN محسنة لتعزيز قدرات استخراج الميزات في YOLOv1. تدمج هذه الوحدة بين دمج الميزات متعددة المقاييس وآلية الانتباه لالتقاط معلومات السلامة الرئيسية في سيناريوهات خطوط الإنتاج بشكل أكثر فعالية.
حالة تطبيق التعلم العميق في مراقبة السلامة الصناعية
اكتسب التعلم العميق زخماً كبيراً في مراقبة السلامة الصناعية. وتُستخدم الخوارزميات القائمة على الشبكات العصبية التلافيفية (CNN) لتحديد ما إذا كان العمال يرتدون خوذات السلامة بشكل صحيح، والكشف عن الاقتحامات غير المصرح بها للمناطق الخطرة، ومراقبة حالة المعدات التي تعاني من أعطال27.
فيما يتعلق بالتعرف على السلوك، تُستخدم الشبكات العصبية التلافيفية ثلاثية الأبعاد (3D CNNs) والشبكات العصبية المتكررة لتحليل السلوك التشغيلي للعمال وتحديد الإجراءات التي قد تكون غير آمنة. فعلى سبيل المثال، يمكن تحديد ما إذا كان العمال ينتهكون إجراءات التشغيل الآمنة من خلال تحليل تسلسل وضعيات أجسامهم28.
يُستخدم كل من YOLO وFaster R-CNN على نطاق واسع للكشف عن الأفراد والمعدات في فيديوهات المراقبة في الوقت الفعلي. فعلى سبيل المثال، تم اقتراح نظام للكشف عن الخوذات في الوقت الفعلي بناءً على YOLOv5 في الأدبيات العلمية، مما ساهم بفعالية في تعزيز ذكاء إدارة السلامة في مواقع البناء29.
على الرغم من إحراز بعض التقدم في الأبحاث الحالية، لا تزال هناك عدة تحديات قائمة. أولاً، تتميز المشاهد الصناعية عادةً بإضاءة معقدة، وحجب للرؤية، وتداخلات في الخلفية، مما يفرض متطلبات صارمة على قوة الخوارزمية. ثانياً، يعد الأداء في الوقت الفعلي مطلباً أساسياً، حيث يجب أن تحقق الخوارزمية سرعة استدلال عالية مع الحفاظ على الدقة. وأخيراً، تركز الأبحاث الحالية بشكل أساسي على الكشف أحادي المهمة، وتفتقر إلى استكشاف دمج المعلومات متعددة المصادر والتحليل الشامل30.
تهدف دراسة هذا البحث، من خلال نموذج الدمج المقترح بين YOLOv11 وCNN، إلى معالجة التحديات المذكورة أعلاه وتحقيق مراقبة شاملة وفورية لمخاطر السلامة في خطوط الإنتاج، وذلك عن طريق تعزيز قدرات استخراج الميزات ودمجها.