هدف هذا البروتوكول هو توفير دليل خطوة بخطوة لتطوير نموذج محسن قائم على YOLOv11n لاكتشاف معدات الحماية الشخصية. يوضح التعديلات المعمارية والتدريبية التي تؤدي إلى كاشف خفيف الوزن في الوقت الحقيقي بدقة متطورة تبلغ 90.1٪ mAP وقابلية تفسير متأصلة.
يتطلب اشتراك JoVE لعرض هذا المحتوى. تسجيل الدخول أو ابدأ نسخة تجريبية مجانية
مقالة بحثية
هدف هذا البروتوكول هو توفير دليل خطوة بخطوة لتطوير نموذج محسن قائم على YOLOv11n لاكتشاف معدات الحماية الشخصية. يوضح التعديلات المعمارية والتدريبية التي تؤدي إلى كاشف خفيف الوزن في الوقت الحقيقي بدقة متطورة تبلغ 90.1٪ mAP وقابلية تفسير متأصلة.
في فحص خطوط النقل الذكي، تواجه أجهزة الحوسبة الطرفية تحديا حاسما في تحقيق التوازن بين الأداء اللحظي ودقة الكشف للتعرف على معدات الحماية الشخصية في سيناريوهات تشغيلية معقدة. تقترح هذه الدراسة WTLS-YOLOv11n، وهي خوارزمية كشف خفيفة الوزن وقابلة للتفسير بطبيعتها. تدمج المنهجية ثلاث ابتكارات تآزرية في بنية YOLOv11n. وحدة C3K2-WTConv التي تستخدم تحويل مويجات منفصلة تقوم بتفكيك الميزات إلى مكونات ترددية ذات معنى فيزيائي، مما يمكن استخراج ميزات متعدد المقاييس قوي مع قابلية تفسير متأصلة. يحقق رأس الكشف المركب المشترك خفيف الوزن تقليلا كبيرا في المعلمات من خلال تقاسم الوزن الاستراتيجي مع الحفاظ على قدرات الاندماج متعدد المقاييس. تعمل وظيفة فقدان MPDIoU على تحسين دقة تحديد المواقع للأهداف الصغيرة وغير المنتظمة الشكل. يظهر التحقق التجريبي أن النموذج المقترح يحقق دقة كشف أعلى مع معاملات أقل بشكل كبير وتعقيد حسابي مقارنة بالخط الأساسي، مع الحفاظ على أداء الاستدلال في الوقت الحقيقي على منصات الأجهزة الحافية. يكشف تحليل قابلية التفسير الكمي أن قرارات الكشف تعتمد بشكل رئيسي على ميزات هيكلية منخفضة التردد بدلا من التفاصيل النسيجية عالية التردد، مما يوفر رؤية شفافة لعملية التفكير في النموذج. تؤكد التجارب المقارنة مع نماذج الكشف الرئيسية المعادلة بين الدقة والكفاءة الفائقة في النهج المقترح. يؤسس هذا العمل حلا شفافا وفعالا وجديرا بالثقة للإشراف الآلي على السلامة في عمليات الطاقة الكهربائية، مع تطبيق أوسع على مهام الكشف الحرجة للسلامة التي تتطلب نشر الحواف واتخاذ قرارات قابلة للتفسير.
لقد غير التعلم العميق بروتوكولات السلامة الصناعية وقدم أساليب جديدة لإدارة المخاطر المهنية. يظهر هذا التحول بشكل خاص في القطاعات عالية المخاطر مثل هندسة أنظمة الطاقة. تعتمد أنظمة الإشراف الذكية القائمة على الرؤية الآن من بنية YOLO (تنظر مرة واحدة فقط)1 لتمكين الكشف التلقائي عن معدات الحماية الشخصية (PPE)2,3 في الوقت الفعلي. برزت هذه الأنظمة كتقنية حيوية لمراقبة سلامة مكان العمل، حيث تقدم تحسينات كبيرة في دقة الكشف وسرعة الاستجابة مقارنة بالطرق التقليدية.
تراقب هذه الأنظمة الامتثال المستمر لمعايير السلامة، مما يقلل من الأخطاء البشرية ويحسن الرقابة في مواقع تشغيل الطاقة المعقدة. ومع ذلك، تشكل الشبكات العصبية العميقة التي تقوم عليها هذه الأنظمة تحديا كبيرا: حيث تظل عمليات اتخاذ القرار فيها غير واضحة. يمثل هذا النقص في قابلية التفسير العقبة الرئيسية أمام تبني الصناعة بشكل أوسع، خاصة في التطبيقات الحيوية للسلامة حيث يعد فهم منطق النظام أمرا ضروريا لبناء الثقة وضمان المساءلة.
عندما ينتج النموذج حكما خاطئا، أو يفوته عامل غير ملتزم، أو يتسبب في إغلاقات تشغيلية غير ضرورية، فإن عملية اتخاذ القرار الغامضة لا توفر معلومات قابلة للتنفيذ لمديري السلامة. بدون القدرة على تشخيص الأخطاء، وفهم منطق النظام، أو التحقق من القرارات، لا يمكن لهذه الأنظمة تلبية معايير الموثوقية المطلوبة في البيئات التي تكون فيها سلامة الإنسان على المحك. وقد أدى هذا الفجوة إلى زيادة الطلب على أساليب الذكاء الاصطناعي القابل للتفسير (XAI)4,5,6 التي توفر دقة وشفافية معا. الهدف هو تطوير أنظمة يمكن لموظفي السلامة فهمها والتحقق منها والثقة بها في السياقات التشغيلية الحرجة.
تظل الشفافية ضرورية، ومع ذلك يجب أن تبنى على نماذج تؤدي أداء موثوقا في ظروف التشغيل الصعبة. توفر مواقع تشغيل الطاقة متطلبات تقنية مميزة تتطلب قدرات كشف قوية. تشهد هذه البيئات تغيرات شديدة في الإضاءة تتراوح بين ضوء النهار الشديد إلى الظلام الدامس. غالبا ما تعيق الآلات المعقدة المجال البصري، مما يخلق تحديات في الانسداد تكافح نماذج الكشف القياسية لمعالجتها. تضيف ظروف الطقس مزيدا من التغيرات، مما يؤثر على الرؤية وجودة الصورة عبر سيناريوهات تشغيلية مختلفة. يتطلب مواجهة هذه التحديات نماذج تحافظ على أداء ثابت رغم هذا التعقيد البيئي.
اتبع الباحثون عدة طرق لتحسين أداء YOLO لتطبيقات مواقع الطاقة. تمثل التعديلات المعمارية أحد الاتجاهات البحثية المهمة. عززت عدة دراسات شبكة YOLOv57 من خلال دمج رؤوس كشف إضافية داخل هيكل الرقبة. يعالج هذا التعديل تحديا مستمرا في اكتشاف معدات الحماية الشخصية: صعوبة التعرف على الأجسام الصغيرة عن بعد أو في الحقول البصرية المزدحمة. تمكن طبقات الكشف الإضافية النموذج من التقاط تفاصيل مكانية أدق قد تغفل عنها البنى المعمارية القياسية.
يركز اتجاه بحثي رئيسي ثان على تحسين النماذج لبيئات النشر. غالبا ما تتطلب مواقع تشغيل الطاقة أنظمة كشف للعمل على أجهزة حافة ذات موارد حسابية محدودة. وقد دفع هذا القيد الجهود في ضغط النماذج وتحسين الكفاءة. طور الباحثون تقنيات لتقليل حجم النموذج ووقت الاستدلال مع الحفاظ على دقة الكشف، مما يتيح الأداء اللحظي على الأجهزة ذات القدرات المعالجة المحدودة 8,9.
أدخلت جهود التحسين الحديثة عدة تقنيات واعدة لتقليل تعقيد النموذج. قام الباحثون بدمج شبكات عمود فقري فعالة مثل MobileNetv310 في هياكل مثل YOLO-M11. وقد طبق آخرون تقليم النماذج وتقطير المعرفة لتطوير نسخ مدمجة منها Light-YOLOv412. وقد أظهرت هذه الأساليب تحسينات ملموسة في الكفاءة الحاسوبية وإمكانية النشر.
ومع ذلك، تواجه هذه الطرق قيدا أساسيا متأصلا في البنى الالتفافية التقليدية. تتطلب عمليات الالتفاف القياسية طبقات شبكة أعمق متزايدا أو حجم نواة أكبر13 لتوسيع مجال الاستقبال، وهو أمر ضروري لالتقاط المعلومات السياقية عبر الصورة. هذا المطلب المعماري يخلق مقايضة لا مفر منها. مع اكتساب النماذج القدرة على استخراج ميزات أغنى وفهم السياق المكاني الأوسع، تزداد أعداد المعلمات ومتطلبات الحاسوبية بشكل كبير. غالبا ما تتجاوز النماذج الناتجة قدرات معالجة الأجهزة الطرفية، مما يحد من تطبيقها العملي في بيئات التشغيل في الوقت الحقيقي.
يمثل هذا التوتر بين قدرة استخراج الميزات والكفاءة الحاسوبية تحديا منهجيا كبيرا لم تحله الأساليب الحالية بالكامل. يتطلب هذا المجال نهجا مختلفا جذريا لاستخراج الميزات يمكنه التقاط ميزات متعددة المقاييس هرمية دون الزيادة النسبية في المعايير التي تفرضها الطرق التقليدية. مثل هذا النهج سيمكن النماذج من الحفاظ على أداء الكشف المطلوب للتطبيقات الحيوية للسلامة والكفاءة اللازمة لنشر الحواف. يمثل معالجة هذه الفجوة أولوية بحثية حاسمة لتطوير أنظمة الكشف العملية عن معدات الحماية الشخصية في بيئات تشغيل الطاقة.
تستخدم طرق التفسير الحالية لاكتشاف الأجسام بشكل رئيسي أساليب التحليل بعد الوقوع14 مثل Grad-CAM. بينما توفر هذه الطرق تصورات مفيدة، إلا أنها تعمل بشكل مستقل عن عملية تعلم النموذج. نهج بديل هو تصميم مكونات معمارية توفر شفافية من خلال آلياتها التشغيلية. يوفر استخراج الميزات المعتمد على المويجات طريقة مباشرة لفهم أي مكونات التردد تساهم في الكشف، رغم أن هناك حاجة لمزيد من الأبحاث لقياس هذه القابلية للتفسير بالكامل.
تتناول هذه الدراسة ثلاثة تحديات مترابطة في أنظمة كشف معدات الحماية الشخصية: دقة الكشف، الكفاءة الحاسوبية، وقابلية تفسير النماذج. يقوم العمل بتعديل بنية YOLOv11n15 من خلال ثلاثة تغييرات تصميمية مستهدفة.
التعديل الأول يقدم وحدة C3K2-WTConv، التي تستبدل الالتفاف القياسي بعملية استخراج ميزات مستوحاة من المويجات. يفصل هذا النهج المعلومات البصرية إلى مكونات ترددية: الإشارات منخفضة التردد تحتوي على معلومات عن الشكل والمنحن، بينما الإشارات عالية التردد ترمز تفاصيل النسيج والحواف. هذا الفصل يحسن جودة الميزات ويجعل عملية الاستخراج أكثر شفافية من عمليات الالتفاف التقليدية.
التعديل الثاني يطبق رأس كشف مركب مشترك خفيف الوزن (LSCD) لتقليل المتطلبات الحاسوبية. يستخدم هذا المكون مشاركة المعلمات عبر مقاييس الكشف، مما يقلل من حجم النموذج مع الحفاظ على قدرات الكشف متعددة المقاييس. يستهدف هذا التصميم قيود الموارد النموذجية لأجهزة الحافة المستخدمة في مواقع تشغيل الطاقة.
التعديل الثالث يستبدل دالة الخسارة القياسية بخسارة MPDIoU16 لتحسين دقة صندوق الإطار. يعالج هذا التغيير تحديات تحديد الموقع المرتبطة بعناصر معدات الحماية الشخصية الصغيرة وذات الأشكال المختلفة من خلال توفير استقرار تدرج أفضل أثناء التدريب.
تظهر الاختبارات أن النموذج المعدل يحقق متوسط دقة أعلى بنسبة 3.8٪ من الخط الأساسي مع استخدام معلمات أقل بنسبة 11.5٪. تشير هذه النتائج إلى أن النهج يلبي المتطلبات العملية لنشر الحافة مع تحسين أداء الكشف. يوفر العمل حلا وظيفيا لمراقبة السلامة في عمليات الطاقة، رغم أن التحقق الإضافي في ظروف التشغيل المتنوعة لا يزال ضروريا لتقييم موثوقية النظام بالكامل.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
تم جمع بيانات الصور لهذه الدراسة من بيئات تشغيل الطاقة مع الأذونات اللازمة. تم إخفاء هوية جميع الصور دون الاحتفاظ بأي معلومات شخصية يمكن التعرف عليها. تركز هذه الدراسة على اكتشاف معدات الحماية الشخصية بدلا من تحديد الأفراد. وبما أن البحث يتضمن فقط تطوير خوارزميات باستخدام بيانات مجهولة، لم تكن هناك حاجة للموافقة الأخلاقية.
يوضح البروتوكول التالي إجراء شاملا لتصميم وتدريب وتقييم نموذج كشف الأجسام خفيف الوزن عالي الأداء وقابل للتفسير بطبيعته، يسمى WTLS-YOLOv11n، لاكتشاف معدات الحماية الشخصية (PPE). البرنامج المستخدم في هذه الدراسة مدرج في جدول المواد.
الإطار المعماري العام
النموذج المقترح WTLS-YOLOv11n مبني على خط الأساس YOLOv11n. تتضمن المنهجية الأساسية استبدال أو تحسين الوحدات الرئيسية بشكل منهجي في العمود الفقري والرأس لتحسين الأداء والكفاءة وقابلية التفسير.
النموذج المقترح WTLS-YOLOv11n مبني على خط الأساس YOLOv11n. تتضمن المنهجية الأساسية استبدال أو تحسين الوحدات الرئيسية بشكل منهجي في العمود الفقري والرأس لتحسين الأداء والكفاءة وقابلية التفسير. تم الاحتفاظ بالنموذج المعماري العام ل YOLOv11n، الذي يتكون من عمود فقري وعنق ورأس، في النموذج المقترح. في العمود الفقري، تم استبدال وحدات C3K2 المحددة بوحدات C3K2-WTConv المقترحة لتعزيز استخراج الميزات. في الرأس، تم استبدال رأس الكشف الأصلي برأس الكشف المركب المشترك الخفيف المقترح (LSCD) لتقليل تعقيد النموذج. يتم توضيح البنية الكاملة لنموذج WTLS-YOLOv11n المقترح، مقارنة بالخط الأساسي، في الشكل 1.
تصميم وحدة C3K2-WTConv
تم تصميم هذه الوحدة لتحل محل الوحدات الالتفافية القياسية داخل العمود الفقري ل YOLOv11n. يسترشد تصميمه بهدفين رئيسيين: (أ) توسيع مجال استقبال النموذج بكفاءة لالتقاط المعلومات السياقية متعددة المقاييس دون زيادة كبيرة في عدد المعلمات أو تعقيد الحاسوب، و(ب) تعلم تمثيلات ميزات أكثر قوة وقابلية للتفسير بطبيعتها من خلال تفكيك خرائط الميزات بشكل صريح إلى مجال التردد.
تصميم طبقة WTConv الأساسية
الطبقة الأساسية WTConv (الالتفاف تحويل المويجات) مصممة لتنفيذ تحويل مويجات هار المنفصلة ثنائية الأبعاد. يتم تنفيذ هذه العملية من خلال مجموعة من نوى المويجات المحددة:
نوى المويجات: يتم تنفيذ التحويل عبر أربع نوى الالتفاف ثابتة وغير قابلة للتدريب من حيث العمق (F_LL، F_LH، F_HL، F_HH)، والتي تتوافق مع دوال أساس مويجات هار. هذه النوى مسؤولة عن تفكيك خريطة ميزات الإدخال إلى مكوناتها منخفضة وعالية التردد.
التحليل وتقليل العينة: تطبق هذه النوى على خريطة الميزات المدخلة (X) بخطوة 2. تؤدي هذه العملية الواحدة بكفاءة كل من تحليل الميزات وتقليل العينة المكانية، مما يقسم المدخل إلى أربعة نطاقات فرعية مميزة.
التفسير الفيزيائي لمكونات الإخراج
الأربعة نطاقات الفرعية المميزة الناتجة عن تفكيك المويجات تمتلك تفسيرا فيزيائيا واضحا. كما هو موضح في الشكل 2، تقوم طبقة WTConv بتفكيك المدخل بشكل متكرر إلى المكونات التالية:
المكون منخفض التردد (LL): يحافظ هذا المكون على البنية الكلية، والمنحنية، والمعلومات العالمية الأخرى للهدف عند نصف الدقة المكانية. يعمل هذا النموذج كأساس لفهم "شكل" الهدف.
المكونات عالية التردد (LH، HL، HH): تلتقط هذه المكونات الثلاثة تفاصيل دقيقة مثل الحواف والأنسجة الأفقية والعمودية والمائلة على التوالي. تمكن النموذج من التركيز على "تفاصيل" الهدف.
التكامل في هيكل وحدة C3K2
تم دمج طبقة WTConv المصممة بسلاسة في هيكل عنق الزجاجة C3K2 في YOLOv11n.
استراتيجية الاستبدال: داخل وحدة C3K2 الأصلية، تم استبدال طبقة الالتفاف القياسية 3x3 بطبقة WTConv. يحافظ هذا النهج على آلية إعادة استخدام الميزات الفعالة في بنية C3K2 مع تقديم مزايا تحويل المويجات، مما ينتج عنه الوحدة النهائية C3K2-WTConv (الهيكل التفصيلي موضح في الشكل 3).
توسع المجال المستقبلي المتسلسل: يمكن تطبيق عملية WTConv بشكل تكراري على خرج التردد المنخفض (LL) للمرحلة السابقة. تسمح آلية التحليل المتسلسلة هذه للنموذج بتحليل الميزات عبر حقل استقبال متزايد بشكل أسي مع عبء حسابي ضئيل، مما يخلق مسار تفكيك ترددي متعدد المستويات فعال.
تصميم رأس الكشف المركب المشترك خفيف الوزن (LSCD)
تم تصميم هذه الوحدة لتحل محل رأس الكشف الأصلي YOLOv11n، بهدف أساسي هو تقليل تعقيد النموذج والعبء الحسابي بشكل كبير لنشر فعال على أجهزة الحافة المحدودة الموارد. يعالج التصميم التكرار الكبير للمعلمات الموجود في رؤوس الكشف متعددة المقاييس القياسية (الهيكل التفصيلي موضح في الشكل 4).
المنطق وأهداف التصميم
أدت فروع التنبؤ المستقلة لكل مقياس ميزة (P3-P5) في رأس YOLOv11 الأصلي إلى عدد معلمات عالي. يقدم LSCD استراتيجية هجينة لمشاركة المعلمات لتحقيق كفاءة متفوقة مع الحفاظ على قدرات دمج الميزات متعددة المقاييس الحرجة.
مشاركة المعلمات وآلية دمج الميزات
تكمن جوهر LSCD في خط معالجة الميزات المكون من مرحلتين:
معالجة مسبقة حسب المقياس: لكل خريطة ميزات إدخال من العنق (P3، P4، P5)، يتم تطبيق التفاف 1x1 غير مشترك تليها طبقة تطبيع المجموعة (GN). تسمح هذه الخطوة الأولية للشبكة بتعلم تحويلات القنوات الخاصة بالمقياس، مما يضمن الحفاظ على الخصائص الفريدة لكل مستوى ميزة قبل الاندماج.
دمج فعال عبر المقاييس: بعد المعالجة المسبقة، يتم استخدام سلسلة من وحدات Convolution-GN المشتركة 3x3 لتنفيذ دمج الميزة الأساسية عبر مقاييس مختلفة. من خلال مشاركة الأوزان، تتعلم هذه الوحدات نمط دمج الميزات المعمم، وهو المصدر الأساسي لتقليل المعاملات. يجبر هذا التصميم النموذج على تعلم تمثيلات اندماج أكثر متانة وعالمية.
التكيف الديناميكي على المقياس وتحسين الفروع
لتعويض أي فقدان محتمل للمعلومات نتيجة مشاركة الوزن وتحسين دقة التنبؤ، تم إدخال آليتين إضافيتين:
طبقة المقياس القابل للتعلم: تضاف طبقة مقياس قابل للتعلم لكل مقياس كشف. تقدم هذه الطبقة معياريا قابلا للتعلم لكل مقياس يعيد وزن الميزات المدمجة ديناميكيا، مما يسمح للنموذج بإبراز أو قمع الميزات بشكل تكيفي بناء على أحجام الكائنات المستهدفة السائدة على ذلك المقياس.
فرع التصنيف المحسن: يتم تعزيز فرع التصنيف باستخدام دالة تفعيل Softmax لتوزيع الاحتمالات ودمج طبقة تطبيع المجموعة (GN). هذا يثبت تدريب مهمة التصنيف ويحسن من متانة توقعات الثقة، وهي تقنية أثبتت فعاليتها في هياكل مثل FCOS.
تصميم دالة الفقدان المحسن (MPDIoU)
تمت إعادة هندسة دالة الخسارة لمعالجة تحديات الانحدار الدقيق لصندوق الإحاطات للأهداف الصغيرة والممزدحمة وغير المنتظمة الشكل، وهي شائعة في سيناريوهات كشف معدات الحماية الشخصية.
الدوافع والقيود لفقدان IoU التقليدي
تعاني الخسائر القائمة على IoU القياسية من عدة عيوب حرجة في هذا السياق:
التدرجات المتلاشية: عندما لا تتداخل صناديق الحقيقة المتوقعة والصندوق، يكون IoU صفرا، ويختفي تدرج الفقدان، مما يوقف عملية التعلم.
عدم الحساسية للمحاذاة: يمكن أن تؤدي تكوينات صناديق الحدود المتعددة إلى نفس درجة IoU، مما يجعل دالة الفقدان غير حساسة لجودة المحاذاة (مثل انحراف نقطة المركز مقابل عدم تطابق الشكل).
الأداء الضعيف على الأجسام الصغيرة: بالنسبة للأهداف الصغيرة، حتى الانحرافات الطفيفة في البكسلات قد تكون كبيرة، لكنها غالبا ما تؤدي إلى تغييرات طفيفة في قيمة IoU، مما يؤدي إلى تحديد موقع غير دقيق.
اعتماد فقدان المسافة النقطية الأدنى (MPDIoU)
لتجاوز القيود المذكورة أعلاه، يستبدل البروتوكول الخسارة القياسية بخسارة IoU المسافة الدنيا للنقطة (MPDIoU). يعزز MPDIoU مقياس IoU القياسي من خلال دمج مصطلح عقوبة يعاقب مباشرة المسافة بين صناديق الحقيقة المتوقعة وصناديق الحقيقة الأرضية، حتى عندما لا تتداخل.
آلية النواة: مصطلح العقوبة مشتق من المسافة الإقليدية بين نقاط الزوايا المقابلة للصندوق المتوقع (pred) وصندوق الحقيقة الأرضية (gt). تحديدا، يتم حساب المسافات المربعة للزوايا
العلوية-اليسرى ) والزوايا السفلية اليمنى (
) التالية:
(1)
(2)
لضمان ثبات العقوبة بالمقياس، يتم تطبيع هذه المسافة بأبعاد أصغر صندوق مغلق يغطي كل من مربع الحقيقة المتوقعة والصندوق. لتكن w و h هما عرض وارتفاع هذا الصندوق المحيط، على التوالي. ثم يصاغ مقياس MPDIoU كالتالي:
(3)
أخيرا، تعرف دالة فقدان MPDIoU (LMPDIoU) بأنها:
LMPDIoU = 1 - MPDIoU (4)
المزايا الرئيسية: يعالج هذا المصطلح الهندسي العقوبات مباشرة القضايا المذكورة أعلاه من خلال: 1) توفير تدرج غير صفري ذو معنى حتى عندما لا تتداخل الصناديق، مما يمنع اختفاء التدرج ويضمن تحسين النموذج المستمر، 2) توفير حساسية متزايدة للانحراف في الموقع والحجم ونسبة العرض، وهو أمر حاسم لتحديد مواقع العناصر الصغيرة والمتنوعة، 3) تقديم إشارات تدرج أكثر استقرارا واتساقا طوال فترة التدريب، مما يعزز التقارب الأسرع وينتج عنه دقة تحديد موضع متفوقة.
مجموعات البيانات وإعداد التجارب
مجموعة بيانات اكتشاف معدات الحماية الشخصية الذاتية
أنشأنا مجموعة بيانات لاكتشاف معدات الحماية الشخصية تحتوي على 5,000 صورة عالية الدقة من عمليات خطوط نقل الطاقة، مع تعليقات توضيحية باستخدام LabelImg وتحويلها إلى صيغة YOLO TXT. تتضمن مجموعة البيانات خمس فئات: خوذات السلامة (1,245 حالة)، أحزمة الأمان (1,128 حالة)، أساور الذراع (892 حالة)، حالة العمل على ارتفاع (1,056 حالة)، وحالة الأرض (1,124 حالة). تنقسم البيانات إلى مجموعات تدريب (4000 صورة)، والتحقق من الصحة (500 صورة)، ومجموعات اختبار (500 صورة). تتميز الصور بظروف صعبة، بما في ذلك إضاءة شديدة، وانسداد شديد (23٪ مع تغطية >50٪)، وخلفيات صناعية معقدة. تم تطبيق تقنيات التعزيز القياسية (التقليب العشوائي، الدوران، اهتزاز الألوان، الفسيفساء) خلال التدريب.
مجموعة بيانات PASCAL VOC لاختبار التعميم
لتقييم قدرة النموذج على التعميم خارج سيناريوهات تشغيل الطاقة، استخدمنا مجموعة بيانات PASCAL VOC، التي تجمع بين VOC2007 و VOC2012 ليصل إجمالي 21,503 صورة. وفقا للممارسة القياسية، استخدمنا 11,540 صورة من VOC2012 للتدريب والتحقق، و9,963 صورة من VOC2007 للاختبار. تحتوي مجموعة بيانات المركبات العضوية المتطايرة على 20 فئة كائنات في سيناريوهات واقعية متنوعة. بينما تختلف الكائنات المحددة عن فئات معدات الحماية الشخصية لدينا، فإن تحديات الكشف (تغير المقياس، الحجب، الخلفيات المعقدة) متشابهة، مما يجعله مناسبا لتقييم قدرات النموذج العامة على الكشف وقابلية النقل.
تفاصيل التنفيذ
يحدد هذا البروتوكول إجراءات تدريب وتقييم النموذج. يفترض أن المستخدم لديه وصول إلى الشيفرة المصدرية، وبيئة بايثون مناسبة، ومجموعات البيانات المحضرة.
تحضير النظام والبيئة
تم استخدام محطة عمل مزودة بوحدة معالجة رسومات NVIDIA تحتوي على ما لا يقل عن 24 جيجابايت من ذاكرة VRAM لضمان ذاكرة كافية للتدريب (مثل NVIDIA GeForce RTX 4090). تم تثبيت إطار عمل التعلم العميق PyTorch (الإصدار 1.12.0 أو أعلى) مع مجموعة أدوات CUDA المقابلة له على محطة العمل. تم التحقق من التثبيت بفتح محطة طرفية وتنفيذ الأمر "python -c 'import torch; print(torch.cuda.is_available())'"، وكان من المتوقع أن تعود "صحيح". تم تثبيت حزم بايثون المطلوبة عن طريق الانتقال إلى مجلد جذر المشروع وتنفيذ الأمر "pip install -r requirements.txt". يقوم هذا الأمر بتثبيت تبعيات تلقائيا مثل numpy، opencv-python، pyyaml، tensorboard، وtorchvision. تم التحقق من إعداد مجموعة البيانات لضمان وجود صور التدريب في /data/train/images/ وملفات التعليقات التوضيحية بصيغة /data/train/labels/ بصيغة YOLO (ارتفاع عرض الفئة x_center y_center). تم تطبيق نفس عملية التحقق على مجموعات بيانات التحقق (/data/val/) والاختبار (/data/test/).
تكوين التدريب
تم فتح ملف التكوين config/wtls_yolov11n.yaml باستخدام محرر نصوص لإعداد معلمات التدريب. تم تكوين مسارات البيانات عن طريق تحديد موقع معامل 'المسار' وتعيينه في مجلد الجذر الخاص بمجموعة البيانات، بينما تم التحقق من معلمات 'train' و'val' و'test' لتشير إلى المجلدات الفرعية الصحيحة. تم تأكيد تطابق معامل 'nc' (عدد الفئات) مع مجموعة البيانات، وتم ضبطه على 5 لاكتشاف معدات الحماية الشخصية. تم تكوين معلمات التدريب الفائقة بحيث يتم تعيين عدد الفترات على 300 للتدريب الكامل وحجم الدفعة إلى 16، مع الفهم بأن هذه القيمة يمكن تعديلها بناء على توفر ذاكرة وحدة معالجة الرسومات وتقليلها إلى 8 إذا حدثت أخطاء نفاد الذاكرة. تم ضبط حجم الصورة المدخلة (imgsz) على 640، وتم تأكيد أن المحسن هو SGD بمعدل تعلم ابتدائي (lr0) يبلغ 0.01. تم التحقق من تراجع الوزن إلى 0.0005 وتم ضبط الزخم إلى 0.937. تم تمكين تقنيات تعزيز البيانات باستخدام الإعدادات الافتراضية المكونة، والتي شملت تعزيز الفسيفساء (فسيفساء: 1.0)، الانقلاب الأفقي العشوائي باحتمال 50٪، وتذبذب الألوان مع معايير hsvh: 0.015، hsvs: 0.7، و hsvv : 0.4. تم تكوين معلمات استخدام الأجهزة بحيث يتم تعيين عدد العمال إلى 8 لخيوط المعالج المستخدمة في تحميل البيانات، ومعامل الجهاز على 0 لاستخدام أول وحدة معالجة رسومية، مع خيار ضبطه على "0,1" لتدريب عدة وحدات معالجة رسومات إذا لزم الأمر.
تنفيذ تدريب النماذج
كان تدريب النماذج يهيئ من سطر الأوامر عن طريق تنفيذ الأمر "python train.py --cfg config/wtls_yolov11n.yaml --weights ''--data data.yaml"، حيث يحدد معامل --cfg ملف تكوين النموذج، ويتم تعيين معامل --weights على سلسلة فارغة للتدريب من الصفر (بدلا من ذلك، يمكن استخدام yolov11n.pt لتعلم النقل)، ومعلمة --data تحدد تكوين مجموعة البيانات. خلال التدريب، لوحظت مؤشرات التقارب لتتبع أداء النموذج. في أول 50 حقبة، لوحظ انخفاض سريع في الفقد مع انخفاض box_loss من حوالي 1.5 إلى 0.8. بين العصور 50 و150، لوحظ تحسن مستمر حيث انخفض box_loss من حوالي 0.8 إلى 0.5. خلال العصور من 150 إلى 300، حدثت مرحلة الضبط الدقيق مع استقرار box_loss حول 0.4 إلى 0.5. كان من المتوقع أن يصل مقياس التحقق mAP@0.5 إلى أكثر من 85٪ بحلول فترة 200. تم التحقق من حفظ نقاط التحقق لضمان أن التدريب يحفظ نقاط التحقق تلقائيا كل 10 فترات إلى الأدلة التي تسجل التشغيل/التدريب/الخبرة/الأوزان/. تم تأكيد وجود last.pt (نقطة تفتيش أحدث) و best.pt (أعلى نقطة تفتيش mAP)، حيث كان من المتوقع أن يكون حجم كل ملف نقاط تفتيش حوالي 5 إلى 6 ميجابايت. يمكن مراقبة تقدم التدريب اختياريا باستخدام TensorBoard عن طريق فتح محطة جديدة وتنفيذ الأمر "tensorboard --logdir runs/train"، ثم التنقل عبر المتصفح لعرض مخططات زمنية http://localhost:6006 لمنحنيات الفقد، وجدول معدل التعلم، واتجاهات mAP. تم معالجة المشكلات الشائعة من خلال إجراءات استكشاف المشكلات، حيث تم حل أخطاء نفاد الذاكرة في CUDA عن طريق تقليل حجم الدفعة إلى 8 أو 4، ومعالجة قيم فقدان NaN بخفض معدل التعلم إلى 0.005، وتم التحقيق في مستويات mAP أقل من 80٪ من خلال التحقق من صحة التعليقات وزيادة فترات التدريب إلى 400.
بروتوكول تقييم النموذج
تم إجراء إجراء تقييم متعدد الجوانب للتحقق بشكل شامل من فعالية وكفاءة وقابلية تفسير النموذج المقترح.
تقييم الأداء الكمي
مقاييس الأداء
تقييم دقة النموذج باستخدام متوسط الدقة المتوسطة (mAP) عند عتبة IoU تبلغ 0.5 (mAP@0.5)، والدقة، والاستدعاء. تقييم كفاءة النموذج بقياس العدد الكلي للمعاملات (M) وعمليات الفاصلة العائمة (FLOPs، G). قم بقياس سرعة الاستدلال بوحدة الإطارات في الثانية (FPS) على كل من وحدة معالجة رسومات من مستوى الخادم وجهاز الطرف. لاختبار الأجهزة الحافية، اضبط وضع الطاقة على أقصى أداء وقم بتسخين النموذج ب 100 استنتاج وهمي قبل تسجيل معدل إطارات يزيد عن 500 صورة اختبار.
مقارنة مع النماذج المتطورة: قم بمقارنة نموذج WTLS-YOLOv11n المقترح مقابل خط الأساس المباشر (YOLOv11n) ومجموعة متنوعة من الكواشف، بما في ذلك نماذج YOLO المعتمدة على CNN السائدة (YOLOv5n، YOLOv8n، YOLOv9s)، كاشف ذو مرحلتين (Faster R-CNN)، وكاشف قائم على المحول (RT-DETR). درب جميع النماذج ل 300 عصر باستخدام المعلمات الفائقة الافتراضية الموصى بها. سجل جميع المقاييس المعرفة في قسم مقاييس الأداء لكل نموذج على كل من مجموعة بيانات PPE التي تم بناؤها ذاتيا ومجموعة بيانات PASCAL VOC. لتقييم المركبات العضوية المتطايرة، تدرب على مجموعات القطار VOC2012 و VOC2007 المجمعة، ثم اختبر على مجموعة اختبار VOC2007 وفقا للبروتوكول القياسي.
دراسات الاستئصال: إجراء دراسة استئصال منهجية لتحليل المساهمات الفردية للمكونات المقترحة.
تحليل فعالية المكونات: بدءا من نموذج YOLOv11n الأساسي، قم بدمج وحدة C3K2-WTConv تدريجيا، ورأس LSCD، وفقدان MPDIoU. لكل تكوين، أعد تدريب النموذج ل 300 عصر باستخدام معلمات فائقة متطابقة (حجم الدفعة 16، معدل التعلم 0.01، محسن SGD). سجل التغيرات في mAP، الدقة، الاستدعاء، المعاملات، FLOPs، وFPS للتحقق من فعالية كل مكون. احسب نسبة التحسن بالنسبة للخط الأساسي لكل مقياس.
تحليل الموقع: لتحديد الوضع الأمثل لوحدة C3K2-WTConv، دمجها في أجزاء مختلفة من بنية الشبكة. اختبر ثلاثة تكوينات: (1) تكامل العمود الفقري فقط، (2) التكامل مع الرقبة فقط، و(3) التكامل الكامل في كل من العمود الفقري والرقبة. تدريب كل تكوين لمدة 300 عصر وقارن الدرجات الناتجة mAP@0.5 لتحديد أكثر استراتيجية تكامل فعالية. اختر التكوين الأمثل لجميع التجارب اللاحقة.
التقييم النوعي للأداء
تصور نتائج الكشف: اختر 12-15 صورة تمثيلية من مجموعة الاختبار تتميز بسيناريوهات واقعية صعبة، بما في ذلك الإضاءة الخلفية القوية، وانسداد الأجسام بشكل كبير، وخلفيات معقدة، وزوايا كاميرا غير تقليدية. لكل نموذج مقارنة (خط الأساس، YOLOv5n، YOLOv8n، YOLOv9s، وWTLS-YOLOv11n)، أجر الاستدلال على هذه الصور باستخدام عتبة ثقة 0.25 وعتبة IoU 0.45. قم بتوليد وعرض مخرجات الكشف (صناديق الربط مع تسميات الفئات ودرجات الثقة) على هذه الصور. رتب التصورات بصيغة شبكة حيث تمثل الصفوف سيناريوهات مختلفة والأعمدة تمثل نماذج مختلفة.
تحليل المتانة: قارن بصريا مخرجات الكشف المعروضة من نماذج مختلفة. قيم متانة وتفوق النموذج المقترح من خلال عد وتعليم حالات السلبيات الكاذبة (الأجسام المفقودة)، والإيجابيات الكاذبة (الاكتشافات غير الصحيحة)، والاكتشافات المكررة (عدة صناديق لجسم واحد مع IoU > 0.7 بين التوقعات). استخدم الدوائر الحمراء لتسليط الضوء على الاكتشافات الإشكالية في شكل التصور. احسب معدلات السلبية الكاذبة لكل نموذج وعدد الإيجابيات الكاذبة عبر صور الاختبار المختارة. استخلاص ومقارنة متوسط درجات الثقة للاكتشافات الإيجابية الحقيقية عبر النماذج.
تحليل قابلية التفسير
للتحقق من قابلية التفسير الجوهرية التي توفرها وحدة C3K2-WTConv، تم إجراء إجراء تصور على صور إدخال مختارة. تم تحميل نموذج WTLS-YOLOv11n المدرب وتسجيل خطاف أمامي على وحدة C3K2-WTConv عند الطبقة الرابعة من العمود الفقري. تم إجراء الانتشار الأمامي على صورة الإدخال، وتم التقاط موتر ميزة الإخراج. من موتر الميزة الملتقطة ذو الشكل [دفعة، قنوات، ارتفاع، عرض]، تم فصل القنوات المقابلة لمكونات تردد مختلفة. تم تعيين أول 25٪ من القنوات كمكون منخفض التردد (LL)، وال75٪ المتبقية كمكونات عالية التردد (LH، HL، HH). لكل نوع من مكون التردد، تم حساب المتوسط عبر جميع القنوات داخل ذلك المكون لإنشاء خرائط تفعيل قناة واحدة. تم تطبيق معيار اللغة الثانية عبر الأبعاد المكانية عند الحاجة لتأكيد التنشيط القوي. تم تطبيع خرائط التفعيل إلى النطاق [0, 1] وتم تطبيق خريطة ألوان (مثل خريطة الألوان 'النفاثة'). تم تغيير حجم خرائط الحرارة لتتناسب مع دقة الصورة الأصلية باستخدام الاستيفاء الثنائي. تم تراكب خريطة الحرارة منخفضة التردد وخريطة الحرارة عالية التردد على الصورة الأصلية بشفافية 40٪ لإنشاء تصورات قابلة للتفسير توضح أين يركز النموذج على الميزات الهيكلية مقابل النسيجية.
للتحقق بدقة من اعتماد قرارات الكشف على ميزات مجال التردد، تم إجراء تحليل كمي. تم اختيار مجموعة فرعية من 200 إلى 300 صورة من مجموعة الاختبار التي احتوت على اكتشافات ناجحة (درجة ثقة أكبر من 0.5). تم ضمان تمثيل هذه المجموعة الفرعية لتمثيل سيناريوهات متنوعة لتجنب تحيز العينة. لكل صورة في المجموعة الفرعية، تم إجراء الانتشار للأمام، وتم استخراج مخرج وحدة C3K2-WTConv عند الطبقة الرابعة للعمود الفقري. تم تقسيم موتر الميزة إلى مكونات منخفضة التردد (LL، أول 25٪ من القنوات) وعالية التردد (HF، بقية 75٪ من القنوات). لكل صورة، تم حساب متوسط قوة التفعيل المطلقة عبر أبعاد مكانية (الارتفاع والعرض) لكلا مكوني التردد. تم حساب قوة LL كمتوسط القيمة المطلقة لميزات LL عبر جميع المواقع المكانية، وتم حساب قوة HF كمتوسط القيمة المطلقة لميزات HF عبر جميع المواقع المكانية. تم تسجيل هذه القيم مع أعلى درجة ثقة في الكشف لتلك الصورة. باستخدام البيانات المجمعة (LL_strength، HF_strength، confidence_score) عبر جميع الصور، تم حساب معاملات ارتباط بيرسون. تم حساب العلاقة بين قوة ال LL ودرجة الثقة، وكذلك العلاقة بين قوة HF ودرجة الثقة. تم استخدام برنامج إحصائي أو دالة scipy.stats.pearsonr من بايثون للحصول على كل من معاملات الارتباط (r) وقيم p. تم تقييم الدلالة الإحصائية باستخدام عتبة قيمة p مقدارها 0.05، حيث أشارت قيمة p أقل من 0.05 إلى أن الارتباط ذو دلالة إحصائية. تمت مقارنة مقدار معاملات الارتباط لتحديد أي مكون ترددي له ارتباط أقوى بثقة الكشف. تم تسجيل المقاييس التالية بصيغة منظمة: معامل ارتباط LL (rLL) وقيمة p (pLL)، معامل ارتباط HF (rHF) وقيمة p (pHF)، متوسط قوة التنشيط (meanLL، meanHF)، وحجم العينة (عدد الصور المحللة). كانت النتائج المتوقعة أن الميزات منخفضة التردد ستظهر ارتباطا إيجابيا أقوى مع درجات الثقة (rLL أكبر من 0.60، p أقل من 0.001) مقارنة بالميزات عالية التردد (rHF تقريبا 0.40 إلى 0.50، p أقل من 0.01)، مما يشير إلى أن قرارات الكشف كانت مدفوعة بشكل رئيسي بالمعلومات الهيكلية الملتقطة في مكون LL.
وقد أثبت هذا التحليل الكمي قابلية التفسير إلى ما هو أبعد من حدود التصور النوعي. قدم الجمع بين تحليل الارتباط (الذي يثبت الارتباط الإحصائي) والتصوير في مجال التردد (إظهار الانتباه المكاني) أدلة تجريبية صارمة على أن اتخاذ قرارات النموذج اعتمد فعليا على ميزات هيكلية منخفضة التردد كما هو مقصود في التصميم.
النتائج المتوقعة: يجب أن تظهر الميزات منخفضة التردد ارتباطا إيجابيا أقوى مع درجات الثقة (rLL > 0.60، p < 0.001) مقارنة بالميزات عالية التردد (rHF≈ 0.40-0.50، p < 0.01)، مما يشير إلى أن قرارات الكشف مدفوعة بشكل رئيسي بالمعلومات الهيكلية الملتقطة في مكون LL.
يؤسس هذا التحليل الكمي قابلية التفسير إلى ما هو أبعد من التصور النوعي. يوفر الجمع بين تحليل الارتباط (الذي يثبت الارتباط الإحصائي) والتصوير في مجال التردد (يظهر الانتباه المكاني) دليلا تجريبيا صارما على أن اتخاذ القرار في النموذج يعتمد فعليا على ميزات هيكلية منخفضة التردد كما هو مقصود في التصميم.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
لتقييم أداء نموذج WTLS-YOLOv11n المقترح، أجرينا تجارب على مجموعة بيانات PPE التي بنيناها بأنفسنا ومجموعة بيانات PASCAL VOC 2007+2012. يتم الإبلاغ عن جميع المقاييس في مجموعات الاختبار المعنية ما لم يذكر خلاف ذلك.
مقارنة مع أحدث النماذج
قمنا بمقارنة WTLS-YOLOv11n مع كواشف الأجسام التقليدية عبر ثلاثة نماذج معمارية: نماذج YOLO المعتمدة على CNN (YOLOv5n، YOLOv8n، YOLOv9t، YOLOv11n)، كاشف ذو مرحلتين (Faster R-CNN)، وكاشف قائم على المحول (RT-DETR مع عمود ...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
تظهر نتائج التجارب أن WTLS-YOLOv11n يحقق 90.1٪ mAP مع تقليل المعاملات بنسبة 11.5٪ مقارنة بخط الأساس ل YOLOv11n. ينبع هذا التحسن في الدقة والكفاءة من التكامل التآزري بين ثلاثة مكونات: استخراج الميزات المعتمد على المويجات، تصميم رأس الكشف الخفيف، وتحسين فقدان التوطين.
تكشف دراسة الاستئصال أن وحدة C3K2-WTConv توفر أكبر مكاسب أداء فردية، حيث تزيد mAP من 86.3٪ إلى 89.1٪. يشير هذا إلى أن تحليل ميزات مجال التردد يقدم مزايا لاكتشاف معدات الحماية الشخصية من خلال فصل ال...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
يعلن المؤلفون عدم وجود تضارب مصالح.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| مجموعة أدوات CUDA | شركة NVIDIA | مجموعة أدوات CUDA الإصدار 11.7 | |
| إطار التعلم العميق | مؤسسة بايتورش | إصدار PyTorch 1.12.0 | |
| وحدة معالجة الرسومات | شركة NVIDIA | GeForce RTX 4090 | |
| نومباي | مطورو نومبي | نومباي | |
| OpenCV | فريق OpenCV | opencv-python | |
| نظام التشغيل | كانونيكال المحدودة. | أوبونتو 22.04 LTS (أو حدد نظام التشغيل الخاص بك) | |
| بايثون | مؤسسة بايثون للبرمجيات | بايثون الإصدار 3.8 أو أعلى | |
| لوحة التنسور | مؤلفو TensorFlow | لوحة التنسور | |
| تورشفيجن | مؤسسة بايتورش | تورشفيجن |
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.