يعتمد تقييم أداء إطار التصنيف المطور على مقاييس التقييم التقليدية المستمدة من مصفوفة الارتباك. تتيح مصفوفة الارتباك الحصول على فهم كامل لأداء المصنف من خلال تمثيل عدد التصنيفات الصحيحة والخاطئة التي تمت لكل فئة محددة. وبهذه الطريقة، يمكن تحليل جميع أنواع الأخطاء. على سبيل المثال، تكتسب كل من الإيجابيات الكاذبة والسلبيات الكاذبة أهمية خاصة في تشخيص الأمراض؛ فقد تشير القيم العالية للإيجابيات الكاذبة إلى حساسية عالية للمصنف، ولكن في الوقت ذاته، تشير الكميات الكبيرة من السلبيات الكاذبة إلى انخفاض حساسيته وتطرح مخاطر صحية محتملة. تم استخدام مقاييس الأداء التالية في هذا البحث، وهي: الدقة (Accuracy)، والضبط (Precision)، والاسترجاع (Recall)، ومقياس F1-score، والنوعية (Specificity)، ومعدل الإيجابيات الصحيحة (TPR)، ومعدل الإيجابيات الكاذبة (FPR). وترد صيغ هذه المقاييس أدناه:
الدقة=(TP+TN)/(TP+TN+FP+FN) (3)
الدقة = TP/(TP+FP) (4)
(5)
(6)
(7)
(8)
في هذه الحالة، تمثل TP عدد سرطانات الجلد الخبيثة التي اكتشفها إطار العمل، بينما تشير TN إلى عدد الآفات الحميدة. وفي المقابل، توضح FP عدد القرارات الخاطئة عندما يتم تصنيف الآفات على أنها خبيثة رغم كونها حميدة في الواقع. أما FN فتعكس عدد العينات الحميدة التي تم التعرف عليها بشكل خاطئ. وفيما يتعلق بتصنيف سرطان الجلد، فإن تقليل السلبيات الكاذبة (false negatives) أمر بالغ الأهمية نظرًا للآثار السلبية المحتملة الناتجة عن ذلك.
أداء النماذج المرجعية
أُجريت جميع التجارب الحسابية في بيئة Google Colab القائمة على السحابة. ومن الجدير بالذكر أن هذه المنصة تتيح تشغيل مثيلات من الأجهزة الافتراضية باستخدام نظام التشغيل Ubuntu 20.04 المحدد مسبقاً. ولتدريب النماذج المرجعية، استُخدم إصدار Python 3.9 وإطار عمل PyTorch إصدار 2.3.1. بالإضافة إلى ذلك، كانت جميع عقد الحوسبة ذات مواصفات متطابقة، وهي: وحدة معالجة مركزية Intel Xeon بتردد 2.2 GHz، ووحدة معالجة رسوميات NVIDIA Tesla T4، وذاكرة وصول عشوائي بسعة 16 GB، وسعة تخزين تبلغ 70 GB. وبذلك، سمح هذا الإعداد التجريبي بتقليل التباين الناتج عن اختلاف المنصات العتادية وزيادة موثوقية النتائج وقابلية تكرارها. ويمكن العثور على ملخص كامل للبيئة التجريبية في الجدول 3.
يوضح الشكل 4 منحنيات التعلم المقابلة لـ 100 حقبة تدريب لبنية ResNet-50. تم إجراء التدريب بناءً على مجموعة بيانات تحتوي على 2,110 صورة، بينما بلغ حجم مجموعة بيانات التحقق 660 صورة. وكما هو ملاحظ، فقد ارتفعت الدقة باستمرار أثناء التدريب لتصل إلى ما يقرب من 90.0%. وفي الوقت ذاته، لُوحظ تحسن في الدقة خلال أول 50 حقبة؛ وبعد هذه النقطة، أصبحت الدقة ثابتة تقريبًا، وهو ما يمكن اعتباره علامة على تقارب النموذج. وبالنسبة للتحقق، أظهر النموذج قيمة AUC تساوي 86.0%، مما يثبت امتلاكه خصائص تمييزية معقولة.
توضح مصفوفة الارتباك المعروضة في الشكل 5 أداء نموذج ResNet-50 من حيث دقة التصنيف في حالة مجموعة اختبار تحتوي على 660 صورة. وأثناء التقييم، تعرّف النموذج بشكل صحيح على 310 من أصل 360 عينة حميدة، و239 من أصل 300 عينة خبيثة. ومع ذلك، تم تصنيف عدد كبير نسبياً من العينات الخبيثة بشكل خاطئ، مما أدى إلى قيمة عالية نسبياً للسلبيات الكاذبة. ويجب النظر في هذه النتيجة بمزيد من التفصيل نظراً للتداعيات الخطيرة لهذا النوع من الأخطاء عند استخدام المصنف في الممارسة العملية. وبشكل إجمالي، حقق النموذج دقة بلغت 83.0%، مع دقة تحديد (precision) بنسبة 83.3%، ومعدل استدعاء (recall) بنسبة 83.3%، ودرجة F1-score بلغت 83.3%.
الجدول 4 يحتوي على وصف تفصيلي لخصائص أداء نموذج ResNet-50 بالنسبة لكلا الفئتين. أظهر المصنف سلوكاً متوازناً نسبياً من حيث الدقة (precision)، حيث بلغت قيمتها 83.0% للعينات الحميدة، بينما سجلت العينات الخبيثة دقة بلغت 84.0%. وبالمثل، وصلت قيم الاستدعاء (recall) إلى 88.0% للآفات الحميدة و78.0% للآفات الخبيثة. يمثل الدعم (Support) في الجدول عدد العينات المقابلة لكل فئة.
نموذج EDLF-SLC المقترح
توضح الشكل 6 المساحة تحت المنحنى (AUC) للتدريب والتحقق للنموذج المقترح على مدار 300 حقبة (epochs). يعكس مقياس AUC قدرة النموذج على التمييز بين الفئات الحميدة والخبيثة، حيث تشير القيم الأعلى إلى أداء تمييزي أفضل. وكما هو ملاحظ، تزداد قيمة AUC للتدريب بشكل مطرد طوال عملية التدريب، لتصل إلى قيمة قصوى تبلغ 1.00 عند الحقبة 200 تقريباً. كما تتحسن قيمة AUC للتحقق تدريجياً خلال مراحل التدريب الأولية؛ ومع ذلك، تبدأ في الثبات بعد حوالي 150 حقبة، مما يشير إلى تقارب النموذج. وتُظهر قيمة AUC النهائية للتحقق البالغة 0.95 قدرة قوية على التعميم وفصلاً فعالاً بين الفئات.
تُظهر مصفوفة الارتباك للنموذج المقترح، والموضحة في الشكل 7، أن النموذج قد صنف بشكل صحيح 299 عينة حميدة و272 عينة خبيثة، بينما أخطأ في تصنيف 28 حالة حميدة على أنها خبيثة و61 حالة خبيثة على أنها حميدة. وفي المجمل، حقق النموذج 571 تنبؤاً صحيحاً و89 تصنيفاً خاطئاً. والجدير بالذكر أن العدد المرتفع من السلبيات الكاذبة (الحالات الخبيثة التي صُنفت خطأً على أنها حميدة) يسلط الضوء على قصور حرج، حيث قد تترتب على مثل هذه الأخطاء تداعيات سريرية جسيمة. ومع ذلك، يظل أداء التصنيف العام قوياً. وبخلاف مناهج اختيار الميزات التي تعمل عمداً على إزالة الأبعاد قبل عملية التصنيف، يحافظ الإطار المقترح على التمثيل العميق المدمج الكامل الناتج عن بنيات CNN غير متجانسة ومتعددة. وقد تم اعتماد هذا التصميم لأن كل هيكل أساسي يستخلص خصائص تكميلية للآفة، كما أن الاحتفاظ بالتمثيل الكامل يتيح لمصنف SVM استغلال المعلومات التمييزية المدمجة دون استبعاد ميزات قد تكون غنية بالمعلومات. وبناءً على ذلك، تعطي استراتيجية دمج الميزات المعتمدة الأولوية لتعلم التمثيل التكميلي مع الحفاظ على الجدوى الحسابية.
يقدم الشكل 8 أمثلة نموذجية لنتائج التصنيف التي أنتجها النموذج المقترح. وتظهر النتائج أن النموذج يمنح درجات ثقة عالية للحالات المصنفة بشكل صحيح. وبالتحديد، تظهر الحالات الحميدة احتمالات تنبؤ عالية (على سبيل المثال، 99.84% و 99.85%)، بينما تظهر الحالات الخبيثة أيضًا مستويات ثقة قوية (على سبيل المثال، 99.98% و 99.96%). وتشير هذه النتائج إلى أن النموذج يمكنه التمييز بفعالية بين الآفات الحميدة والخبيثة، حتى في السيناريوهات الصعبة بصريًا. ولتعزيز القابلية للتفسير، تم استخدام إطار عمل LIME لتوليد تفسيرات موضعية لتنبؤات النموذج، كما هو موضح في الشكل 9A–D. يقوم LIME بتقريب حدود القرار المعقدة للنموذج باستخدام نموذج خطي قابل للتفسير محليًا. وبالنسبة لكل صورة مدخلة، تقوم هذه الطريقة بتوليد عينات مضطربة عن طريق حجب البكسلات الفائقة (superpixels) بشكل انتقائي وتقييم التنبؤات المقابلة. ثم يتم ملاءمة نموذج خطي مرجح لهذه العينات، حيث يتم تحديد الأوزان بناءً على القرب من المدخلات الأصلية باستخدام نواة دالة الأساس الشعاعي. وتمثل المعاملات الناتجة مساهمة كل بكسل فائق في التنبؤ النهائي وتُعرف على أنها:
(9)
حيث يمثل Xj ∈ {0, 1} وجود أو غياب السوبر بكسل (superpixel) رقم j، ويمثل Bj وزن المساهمة المقابل، بينما يمثل B0 التنبؤ المرجعي. تشير المعاملات الموجبة (Bj > 0) إلى المناطق التي تساهم في تصنيف الحالة كخبيثة، بينما تقابل المعاملات السالبة (Bj < 0) السمات الحميدة. وتبرز التصورات القائمة على LIME، الموضحة في الشكل 9B, D، أكثر المناطق تأثيرًا والتي تساهم في كل قرار تصنيف. فبالنسبة للآفات الحميدة، يركز النموذج على المناطق التي تتميز بتصبغ موحد وحدود واضحة المعالم. وفي المقابل، بالنسبة للحالات الخبيثة، تقابل المناطق المظللة سمات ذات أهمية سريرية مثل الحدود غير المنتظمة، وعدم تجانس اللون، والأنسجة غير النمطية. وتعكس كثافة المناطق المظللة مقدار المعاملات Bj المقابلة لها.
توضح هذه النتائج أن نموذج EDLF-SLC يركز على سمات ذات دلالة سريرية تتماشى مع المعايير الجلدية المعتمدة، مثل قاعدة ABCD. ويعزز هذا التوافق من قابلية تفسير النموذج وموثوقيته، مما يجعله أكثر ملاءمة لدعم اتخاذ القرارات السريرية. علاوة على ذلك، يعرض الشكل 10 نتائج التصور المقارنة التي تم الحصول عليها باستخدام تقنيات إضافية للتفسير، بما في ذلك Grad-CAM وHiResCAM وGradCAM++ وXGradCAM وLayerCAM وEigenGradCAM وEigenCAM، مما يؤكد بشكل أكبر اتساق المناطق البارزة المحددة عبر الطرق المختلفة. وفيما يتعلق بأداء نموذج EDLF-SLC المقترح وسبعة نماذج أساسية بعد التدريب لمدة 100 epoch، يمكن الاطلاع على مقارنة في الجدول 5. حقق نموذج EDLF-SLC أداءً تنافسياً بلغ 0.88 في كل مقياس تم تقييمه مقارنة بالبنى الأساسية التي تم تقييمها بناءً على السياق التجريبي. كما حقق نموذجا EfficientNetB0 وResNet50 نتائج جيدة أيضاً، بدقة بلغت 0.85 و0.83 على التوالي. وفي المقابل، سجل نموذج Inception-ResNetV2 أسوأ أداء تصنيفي بين النماذج التي تم تقييمها. ومن ناحية أخرى، وبالرغم من انخفاض دقة التصنيف نسبياً، إلا أن كفاءته الحسابية ظلت قابلة للمقارنة مع النماذج الأساسية. وقد أظهر نموذج EDLF-SLC المقترح أداءً تنافسياً بالنسبة للنماذج الأساسية التي تم تقييمها في ظل الظروف التجريبية المعتمدة.
لتقييم أداء الإطار المقترح مقارنة بالنهج الحالية، يعرض الجدول 6 مقارنة مع طرق ممثلة لأحدث التقنيات في تصنيف الآفات الجلدية. على سبيل المثال، سجلت الدراسة47 دقة بلغت 0.86، بينما استخدمت الدراسة48 نموذجًا قائمًا على التعلم التجميعي حقق دقة مماثلة ولكن بدقة (precision) واستدعاء (recall) ومقياس F1-score أقل. وأفادت الدراسات الحديثة القائمة على التعلم التجميعي وبنيات CNN المتعددة25,49 عن دقة تصل إلى 0.87. وفي ظل الظروف التجريبية المعتمدة، حقق إطار EDLF-SLC المقترح دقة بلغت 0.88 باستخدام بنية موحدة قابلة للتفسير دون الحاجة إلى مكونات إضافية مثل نماذج تقسيم الآفات.
توفر البيانات
البيانات التي تدعم نتائج هذه الدراسة متاحة بشكل مفتوح في Kaggle على الرابط https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign.

الشكل 1: صور تمثيلية بالتنظير الجلدي من مجموعة بيانات ISIC توضح الفئتين التشخيصيتين المستخدمتين في هذه الدراسة. تم تصنيف العينات إلى حميدة (0) وخبيثة (1)، مما يبرز التباين في شكل الآفة ولونها وملمسها عبر مجموعة البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: سير العمل الكامل لإطار عمل EDLF-SLC المقترح. يبدأ البروتوكول بالحصول على صور ISIC 2020، يليه المعالجة المسبقة، وتعزيز البيانات، وتقسيم مجموعة البيانات، واستخراج الميزات العميقة باستخدام أربع بنيات CNN مُدربة مسبقاً، ودمج الميزات، وتصنيف SVM، وتقييم الأداء، وتوليد التفسيرات القائمة على LIME. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3: أمثلة لصور آفات جلدية معززة تم توليدها باستخدام تقنيات تعزيز البيانات. ويشمل ذلك القلب الأفقي والرأسي، والتدوير، وتغيير المقياس، وتعديل السطوع. تعمل هذه التحويلات على زيادة تنوع مجموعة البيانات، وتحسين متانة النموذج، وتقليل مخاطر فرط التخصيص أثناء التدريب. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4: المساحة تحت منحنى خصائص تشغيل المستقبل (ROC-AUC) للتدريب والتحقق لنموذج ResNet-50 على مدار 100 حقبة تدريبية. يمثل المنحنى الأزرق AUC التدريب، بينما يمثل المنحنى البرتقالي AUC التحقق. وتظهر المنحنيات تقارباً سريعاً خلال حقب التدريب الأولية، يليه تحسين مستقر مع أداء تحقق مرتفع باستمرار، مما يشير إلى تعلم فعال وتعميم مرضٍ على مجموعة بيانات التحقق. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5: مصفوفة الارتباك لنموذج ResNet-50 على مجموعة بيانات الاختبار. تمثل الصفوف تسميات الفئات الحقيقية (0 = حميدة، 1 = خبيثة)، بينما تمثل الأعمدة تسميات الفئات المتوقعة. تشير العناصر القطرية إلى العينات المصنفة بشكل صحيح (310 حميدة و239 خبيثة)، بينما تمثل العناصر خارج القطر العينات المصنفة بشكل خاطئ، بما في ذلك 50 حالة إيجابية كاذبة و61 حالة سلبية كاذبة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 6: المساحة تحت منحنى خصائص تشغيل المستقبل (ROC-AUC) للتدريب والتحقق لنموذج EDLF-SLC المقترح على مدار 300 حقبة تدريبية. يمثل المنحنى الأزرق قيمة AUC للتدريب، بينما يمثل المنحنى البرتقالي قيمة AUC للتحقق. يظهر النموذج تقارباً سريعاً خلال حقب التدريب الأولية، يليه تحسين مستقر مع قيم AUC عالية وثابتة للتدريب والتحقق طوال الحقب المتبقية. ويدل استقرار أداء التحقق على قدرة تعميم جيدة وسلوك تعلم مستقر لإطار عمل EDLF-SLC المقترح على مجموعة بيانات التحقق. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 7: مصفوفة الارتباك لنموذج EDLF-SLC المقترح على مجموعة بيانات الاختبار. تمثل الصفوف تسميات الفئات الحقيقية (0 = حميدة، 1 = خبيثة)، بينما تمثل الأعمدة تسميات الفئات المتوقعة. تشير العناصر القطرية إلى العينات التي تم تصنيفها بشكل صحيح (299 حميدة و 272 خبيثة)، بينما تشير العناصر خارج القطر إلى العينات المصنفة خطأً، بما في ذلك 61 حالة إيجابية كاذبة و 28 حالة سلبية كاذبة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 8: عينات من التنبؤات التي أنتجها نموذج EDLF-SLC المقترح. يوضح هذا الشكل مستويات الثقة في تصنيف الآفات الحميدة والخبيثة، ويبرز القدرة التمييزية للنموذج. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 9: تفسيرات محلية قائمة على LIME لنموذج EDLF-SLC المقترح. يسلط الشكل الضوء على مناطق البكسلات الفائقة (superpixel) الأكثر تأثيراً والتي ساهمت في قرارات التصنيف الخاصة بالنموذج. (A) صورة تنظيرية جلدية أصلية لآفة جلدية حميدة. (B) تفسير LIME للآفة الحميدة، حيث تشير البكسلات الفائقة المظللة إلى المناطق التي ساهمت بشكل أكبر في التنبؤ بأنها حميدة. (C) صورة تنظيرية جلدية أصلية لآفة جلدية خبيثة. (D) تفسير LIME للآفة الخبيثة، يوضح مناطق البكسلات الفائقة التمييزية التي أثرت بشكل غالب على التصنيف كخبيثة. تحدد الحدود الصفراء البكسلات الفائقة المؤثرة التي حددها LIME، بينما تمثل المناطق الرمادية المساحات ذات المساهمة الضئيلة في التنبؤ. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 10: مقارنة بين طرق القابلية للتفسير القائمة على تخطيط تنشيط الفئات (CAM) المطبقة على نموذج EDLF-SLC المقترح. يقارن الشكل خرائط التحديد الموضعي التي أنتجتها كل من GradCAM وHiResCAM وGradCAM++ وXGradCAM وLayerCAM وEigenGradCAM وEigenCAM لنفس الصورة الجلدية. يظهر اللوح الأول صورة الإدخال الأصلية، تليها خرائط التنشيط الخام المقابلة وتراكبات الخرائط الحرارية التي أنتجتها كل طريقة من طرق القابلية للتفسير. توضح هذه التصورات الاختلافات في التحديد الموضعي المكاني وتسلط الضوء على مناطق الصورة التي تساهم بقوة أكبر في قرار التصنيف الخاص بإطار عمل EDLF-SLC المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
| المرجع | السنة | مجموعة البيانات | حجم البيانات | استخلاص الميزات | الطريقة | الدقة |
| 9 | 2022 | HAM10000 dataset | 10015 صورة لآفات جلدية | ميزات اللون والشكل | خوارزميات ML ونماذج Convolutional NN | 95.1% |
| 19 | 2023 | PH2 dataset | 200 صورة مشروحة | ميزات عدم التماثل، والخطوط، والنقاط/الحبيبات، ومناطق التراجع | نماذج ML | 94.0% |
| 30 | 2024 | HAM10000 dataset | 10000 صورة | ميزات اللون والشكل | S-MobileNet | 97.7% |
| 28 | 2025 | مجموعات بيانات ISIC2020 وHAM10000 | ISIC2020 (12,670 صورة) وHAM10000 (10,015 صورة) | اللون والشكل | الشبكة المتبقية-الذاكرة طويلة قصيرة المدى (R-LSTM50) | 95.7% (ISIC2020)؛ 94.2% (HAM10000) |
| 32 | 2026 | Monkeypox Skin Lesion Dataset (MSLD) | 770 صورة | السياق والملمس | DenseNet121 وXception وInceptionV3 وCBAM | 88% (DenseNet121) |
| 39 | 2025 | HAM10000 | 38,569 صورة | السياق والملمس | MobileNet وResNet50 وInceptionV3 وEfficientNet | 93.6% (MobileNet) |
| 40 | 2025 | ISIC 2019 | 2357 صورة | السياق والميزات المكانية | DL متعدد الوسائط يعتمد على CNN-transformer | 98.71% |
| 41 | 2026 | ISIC 2019 | 25,000 صورة | السياق والملمس | TransXV2S | 95.26% |
| 42 | 2025 | HAM10000 | 10,015 صورة | اللون والشكل | ViT مع YOLOv8 | 93% |
الجدول 1: مقارنة أدبية. ملخص لبعض الأعمال المنشورة حديثًا التي تستخدم خوارزميات التعلم العميق لتصنيف الآفات الجلدية.
| مجموعة البيانات | حميد | خبيث | إجمالي |
| بيانات التدريب | 1440 | 1197 | 2637 |
| بيانات الاختبار | 360 | 300 | 660 |
| إجمالي البيانات | 1800 | 1497 | 3297 |
الجدول 2: توزيع مجموعة البيانات. توزيع العينات الحميدة والخبيثة في مجموعة بيانات ISIC 2020، بما في ذلك تقسيمات التدريب والاختبار.
| مكوّن | المواصفات |
| نظام التشغيل | Ubuntu 20.04 |
| لغة برمجة | Python 3.9 |
| إطار عمل التعلم العميق | PyTorch 2.3.1 |
| المُحسِّن | آدم |
| جدولة معدل التعلم | 1e−3 |
| عدد الدورات التدريبية | 100/300 |
| وحدة المعالجة المركزية | وحدتا معالجة مركزية افتراضيتان (2 vCPU) بتردد 2.2 جيجاهرتز |
| وحدة معالجة الرسومات | Tesla T4 (16 GB) × 1 |
| ذاكرة الوصول العشوائي | 16 جيجابايت |
| المعلمات القابلة للتدريب | ٢,٤٣٠,٣٥٣ (٩.٢٧ ميجابايت) |
| المعلمات غير القابلة للتدريب | 133,434,397 (509.01 ميجابايت) |
الجدول 3: مواصفات النظام. المواصفات التفصيلية للبيئة الحسابية، بما في ذلك أطر البرمجيات وموارد الأجهزة المستخدمة في تدريب النموذج وتقييمه.
| الفئة | الدقة (Precision) | الاستدعاء (Recall) | مقياس F1 | الدعم (Support) |
| الفئة الحميدة | 0.83 | 0.88 | 0.85 | 360 |
| الفئة الخبيثة | 0.84 | 0.78 | 0.81 | 300 |
| الدقة الإجمالية (Accuracy) | - | - | 0.832 | 660 |
| المتوسط الكلي (Macro avg) | 0.84 | 0.83 | 0.83 | 660 |
| المتوسط المرجح (Weighted avg) | 0.84 | 0.83 | 0.83 | 660 |
الجدول 4: تقرير التصنيف. أداء التصنيف لنموذج ResNet-50 على مجموعة بيانات الاختبار، بما في ذلك الدقة (precision)، والاستدعاء (recall)، ومقياس F1-score، والدعم (support) لكل فئة.
| النموذج | الدقة (Accuracy) | الضبط (Precision) | الاستدعاء (Recall) | مقياس F1 | الزمن (s) |
| NASNetLarge | 0.77 | 0.76 | 0.77 | 0.76 | 2002.47 |
| EfficientNetB0 | 0.85 | 0.85 | 0.85 | 0.85 | 734.8 |
| Xception | 0.8 | 0.81 | 0.8 | 0.8 | 732.23 |
| ResNetV2 | 0.63 | 0.64 | 0.63 | 0.611 | 1072.34 |
| MobileNet | 0.79 | 0.8 | 0.79 | 0.79 | 629.29 |
| MobileNetV2 | 0.77 | 0.79 | 0.77 | 0.77 | 660.5 |
| ResNet50 | 0.83 | 0.83 | 0.83 | 0.83 | 749.77 |
| EDLF-SLC | 0.88 | 0.89 | 0.87 | 0.88 | 3279.77 |
الجدول 5: مقارنة أداء النموذج. الأداء المقارن لنموذج EDLF-SLC المقترح ونماذج التعلم العميق المرجعية من حيث الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1-score، والوقت الحسابي.
| النموذج | الدقة (Accuracy) | الضبط (Precision) | الاسترجاع (Recall) | مقياس F1 (F1-Score) |
| ResNet-18 [25] | 0.85 | 0.85 | 0.85 | 0.85 |
| ResNet-50 مع SVM [50] | 0.87 | 0.88 | 0.98 | 0.93 |
| نماذج DL الهجينة + SVM [48] | 0.86 | 0.84 | 0.8 | 0.84 |
| نماذج DL الهجينة + SVM [49] | 0.86 | 0.8 | 0.6 | 0.68 |
| نموذج EDLF-SLC المقترح | 0.88 | 0.89 | 0.87 | 0.88 |
الجدول 6: مقاييس مقارنة النماذج. مقارنة الأداء بين إطار عمل EDLF-SLC المقترح والنهج الحديثة الأكثر تطوراً لتصنيف آفات الجلد.
الملف التكميلي 1: الخوارزمية 1. سير عمل إطار عمل EDLF-SLC المقترح، والذي يوضح المعالجة المسبقة للبيانات، واستخراج الميزات العميقة باستخدام بنيات CNN متعددة، والتصنيف القائم على SVM، والقابلية للتفسير القائمة على LIME للتنبؤ بالآفات الجلدية. يرجى النقر هنا لتحميل هذا الملف.
الملف التكميلي 2: الخوارزمية 2. سير عمل عملية التفسير المحلي القائمة على LIME، والتي توضح إنشاء البكسلات الفائقة (superpixels)، وأخذ عينات الاضطراب، وبناء النموذج البديل، وتصور مناطق الصورة الأكثر مساهمة في قرار التصنيف. يرجى النقر هنا لتنزيل هذا الملف.