مقالة مراجعة

الذكاء الاصطناعي القابل للتفسير للفحص البصري: تحليل ومراجعة مقارنة

DOI:

10.3791/69440

أكتوبر 10, 2025

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تجمع هذه المراجعة طرق الذكاء الاصطناعي القابلة للتفسير (XAI) للفحص البصري في المجالات الصناعية والطبية. حدد البحث الموجه ب PRISMA 75 دراسة ، وبلغ تصنيف خاص بالمجال وتحليل مقارن باستخدام مقاييس موحدة. نحن نساهم في تصنيف مدعوم بالأدلة وسير عمل موجه نحو الممارس لاختيار الأدوات.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تتيح تقنيات الذكاء الاصطناعي القابلة للتفسير (XAI) الشفافية والثقة في أنظمة الفحص البصري الآلية من خلال جعل نماذج التعلم الآلي للصندوق الأسود مفهومة. بينما تم تطبيق XAI على نطاق واسع ، لم تعالج المراجعات السابقة المتطلبات المحددة لمهام التفتيش الصناعي والطبي. تستعرض هذه الورقة الدراسات التي تطبق تقنيات XAI على الفحص البصري عبر المجالات الصناعية والطبية. تم إجراء بحث منهجي في IEEE Xplore و Scopus و PubMed و arXiv و Web of Science للدراسات المنشورة بين عامي 2014 و 2025 ، مع معايير التضمين التي تتطلب تطبيق XAI في مهام التفتيش باستخدام مجموعات البيانات العامة أو الخاصة بالمجال. من مجموعة أولية من الدراسات ، تم تضمين 75 دراسة وتصنيفها إلى مرحلة لاحقة وجوهرية ، والتي تم تقييمها بعد ذلك فيما يتعلق بالدقة والمتانة والتعقيد ودقة التوطين. تظهر النتائج أن الطرق القائمة على التدرج والانتشار تقدم تفسيرات بصرية فعالة مناسبة للفحص في الوقت الفعلي تقريبا ، على الرغم من التوطين الخشن ، بينما توفر طرق النماذج القائمة على الاضطراب والنماذج البديلة إسنادات أكثر تفصيلا بتكلفة حسابية أعلى ولكن مع متانة منخفضة. بالإضافة إلى ذلك ، توضح الشبكات القائمة على النموذج الأولي ومعماريات الاهتمام الذاتي المقايضات بين قابلية التفسير والأداء التنبؤي. اختيار طريقة XAI الأكثر فعالية ليس مقاس واحد يناسب الجميع. يعتمد ذلك على مجموعة البيانات وزمن الوصول واحتياجات التفسير. تقدم هذه المراجعة تصنيفا موحدا لطرق XAI للفحص البصري ، وتقارن الأساليب المختلفة في كل من المجالين الصناعي والطبي باستخدام مقاييس موحدة ، وتقترح سير عمل اختيار قائم على المهام لتوجيه الممارسين في اختيار الطريقة المثلى. بالمقارنة مع المراجعات السابقة ، يقدم هذا العمل تحليلا مقارنا عبر المجالات يرتكز على معايير كمية ويحدد اتجاهات التقييم الموحد والتحقق من الصحة المتمحور حول المستخدم.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

من الضروري لصناعات مثل التصنيع والسيارات وتغليف المواد الغذائية والأدوية والرعاية الصحية التحقق من أن المنتجات والأنظمة تعمل بشكل كاف وآمن. أدوات الأتمتة والتعلم الآلي ، التي تتجاوز الفحص البصري التقليدي الذي يقوم به المشغلون البشريون أو الأنظمة البدائية القائمة على الكاميرا ، تعمل على تحسين الدقة وسرعة الإنتاج والاتساق1. يسمح فحص الذكاء الاصطناعي بالمراقبةفي الوقت الفعلي 2 واكتشاف العيوب في البيئات عالية الإنتاجية3 ، مما يقلل من الخطأ البشري والتكاليف التشغيلية4. أدى استخدام الذكاء الاصطناعي ، لا سيما مع التقدم في التعلم الآلي (ML) والتعلم العميق (DL) ، إلى تمكين الأنظمة المستقلة التي تكتشف العيوب5 ، وتصنف الكائنات ، وتحدد الأنماط المرئية المعقدة6. في الآونة الأخيرة ، تجاوزت الشبكات العصبية التلافيفية (CNNs) 7 والشبكات المتكررة ومحولات الرؤية (ViTs) الأنظمة القائمة على القواعد في المهام التي تمتد عبر اكتشاف عيوب السطح إلى توطين الشذوذ في التصوير الطبي. تحول الفحص من العمليات المستندة إلى القواعد إلى النماذج المستندة إلى البيانات المدربة على مجموعات البيانات الكبيرة8.

تعمل العديد من نماذج الذكاء الاصطناعي ك "صناديق سوداء" ، مما يعني أنه لا توجد نظرة ثاقبة لكيفية اتخاذ هذه النماذج للقرارات. هذا الافتقار إلى الشفافية ينطوي على مخاطر. على سبيل المثال ، في التصنيع ، يمكن أن تؤدي التنبؤات الخاطئة إلى زيادة الهدر وإعادة العمل وسحب المنتجات وعدم رضا العملاء. في التصوير الطبي ، تكون التصنيفات الخاطئة أكثر أهمية لأنها قد تؤخر التشخيص أو تضر بخطط العلاج. حتى مطوري هذه النماذج في كثير من الأحيان لا يستطيعون شرح مخرجاتهم بشكل كامل ، مما يحد من الثقة والتبني.

هذا هو المكان الذي يصبح فيه الذكاء الاصطناعي القابل للتفسير (XAI) ضروريا. XAI هي مجموعة من الأساليب والأدوات التي تهدف إلى جعل قرارات نموذج التعلم الآلي قابلة للتفسير من قبل البشر9. هدفها هو تحويل تنبؤات الصندوق الأسود إلى أنظمة "صندوق زجاجي" شفافة من خلال توفير مبررات يمكن للإنسان قراءتها لمخرجاتها. من الناحية العملية ، فإن نظام الفحص الذي يدعم XAI سيتجاوز اكتشاف العيوب ليس فقط من خلال وضع علامة على جزء معيب ولكن أيضا شرح سبب وضع علامة عليه.

على الرغم من الأدبيات المتزايدة ، لا تزال الدراسات الاستقصائية الحالية حول XAI في رؤية الكمبيوتر محدودة النطاق. يركز العديد منها بشكل ضيق على التصوير الطبي أو التفتيش الصناعي ، ويقدم تصنيفات مفيدة ولكنه يعتمد بشكل أساسي على المقارنات النوعية بدون معايير موحدة. توفر المراجعات الأوسع ، مثل Nauta et al.10 ، لمحات عامة غير محددة للمجال ولكنها لا تصل إلى حد تقديم أطر اختيار موجهة للممارسين. حتى مسح رؤية الكمبيوتر الأكثر شمولا حتى الآن من قبل Cheng et al.11 يطور التصنيف ويناقش مقاييس مثل الدقة ودقة الترجمة ، لكنه يظل عاما عبر مهام الرؤية ولا يتناول على وجه التحديد الفحص البصري أو النشر عالي الإنتاجية أو التحقق من صحة الإنسان في الحلقة. وبالمثل ، تتبنى المراجعات الصناعية ل XAI للتنبؤات وإدارة الأصول إطار عمل PRISMA ولكنها تركز على التوقعات وإدارة الصحة (PHM) بدلا من مهام الفحص البصري.

ولمعالجة هذه الثغرات، تساهم هذه المراجعة بما يلي:

التصنيف المنهجي: مراجعة موجهة ب PRISMA ل 75 دراسة عبر كل من الفحص البصري الصناعي والطبي.

التحليل المقارن: قياس أداء طرق XAI المتعددة (GradCAM و LRP و SHAP و LIME و RISE) على مجموعات بيانات الفحص البصري العام (على سبيل المثال ، MVTec AD و PCB) مع مقاييس موحدة بما في ذلك الحذف / الإدراج AUC ودقة لعبة التأشير والاستقرار وزمن الوصول.

إطار مقاييس التقييم: التعريفات والمعادلات الرسمية للإخلاص والمتانة وقابلية التفسير والمقاييس الخاصة بالمهمة المستخدمة في تقييم طرق XAI.

التوجيه العملي: دراسات الحالة وسير عمل الاختيار الموجه نحو الممارس الذي يربط نوع المهمة وزمن الوصول واحتياجات الشرح بطرق محددة.

تؤسس هذه المساهمات معا التوليف الأكثر تحديدا للمجال والمستند إلى المعايير ل XAI للفحص البصري ، والذي يستهدف كل من الباحثين والممارسين الذين يبحثون عن إرشادات موثوقة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

مراجعة ومنظور

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

2. إطار XAI

غالبا ما يتم التعامل مع معظم نماذج الذكاء الاصطناعي الحديثة - وخاصة الشبكات العصبية العميقة - على أنها صناديق سوداء. هناك القليل من الرؤية حول كيفية اتخاذهم للقرارات12. هذا الافتقار إلى الشفافية هو عائق أمام الثقة وقابلية التفسير في التطبيقات المتنوعة. نتيجة لذلك ، أصبح XAI جزءا لا غنى عنه من الذكاء الاصطناعي الجدير بالثقة. لا يوجد نهج واحد يناسب جميع السيناريوهات: تفترض بعض الطرق الوصول الكامل إلى الأجزاء الداخلية للنموذج ، بينما يتعامل البعض الآخر مع النموذج على أنه صندوق أسود غير قابل للتغيير. يعطي البعض الأولوية للتفسيرات المحلية للتنبؤات الفردية ، بينما يوفر البعض الآخر نظرة ثاقبة عالمية لسلوك النموذج. كما هو موضح في الشكل 1 ، أدت هذه الاعتبارات إلى فئتين عريضتين من تقنيات XAI بناء على وقت تقديم قابلية التفسير: طرق التفسير اللاحقة وطرق التفسير الجوهرية13. يتم تصنيف طرق ما بعد النموذج إلى14 نموذجا وخاصا بالنموذج.

figure-protocol-1
الشكل 1: إطار عمل XAI للفحص البصري. الرجاء النقر هنا لعرض نسخة أكبر من هذا الشكل.

  1. Post-hoc explanation methods
    تولد الطرق اللاحقة تفسيرات بعد تدريب النموذج ، دون تغيير بنيته أو معلماته15. هذه الأساليب شائعة لأنها تسمح للممارسين بالاستفادة من النماذج عالية الأداء ثم شرح مخرجاتهم بأثر رجعي16. ومع ذلك ، نظرا لأن النموذج الأساسي لا يزال دون تغيير ، يجب أن تقرب التفسيرات اللاحقة أو تستنتج منطق النموذج ، مما قد يؤدي إلى خطأ تقريب وعدم استقرار17. في الأقسام التالية ، يتم شرح كل من الطرق الخاصة بالنموذج واللاأدرية.
    1. طراز خاص
      تستغل هذه الأساليب المعرفة بهيكل النموذج أو آلية التدريب لتقديم تفسيرات مصممة خصيصا لهذا النموذج. وخير مثال على ذلك هو الإسناد القائم على التدرج للشبكات العصبية العميقة. تستخدم طرق مثل GradCAM (رسم خرائط تنشيط الفئة المرجحة بالتدرج) التدرجات الداخلية لشبكات CNN المدربة لإنتاج "خرائط حرارية" مرئية تسلط الضوء على مناطق صورة الإدخال الأكثر أهمية لتنبؤ معين17. يحسب GradCAM تدرج درجة الفئة المستهدفة فيما يتعلق بخرائط المعالم في الطبقة التلافيفية النهائية ويعرض هذه التدرجات على الصورة ، مما ينتج عنه خريطة توطين تمييزية للفئة. تعمم طرق انتشار التدرج الأخرى على معماريات الشبكات المختلفة. وتقوم التدرجات المتكاملة (IG)18 بتجميع التدرجات على طول المسير من مدخلات خط الأساس (مثل صورة فارغة) إلى الدخل الفعلي، وتفي بالبديهيات المستصوبة لإسناد الميزات. وبالمثل ، ينشر DeepLIFT19 الاختلافات من التنشيط المرجعي عبر كل طبقة لتقدير مساهمة كل ميزة إدخال. ينشر انتشار الملاءمة على أساس الطبقة (LRP) درجة التنبؤ طبقة تلو الأخرى ، ويوزع "الصلة" على كل بكسل إدخال أو معلم20. باختصار ، تستفيد الطرق الخاصة بالنموذج من التدرجات الداخلية أو التنشيط أو الاهتمام لإنتاج تفسيرات مقترنة بإحكام بهيكل النموذج.
    2. نموذج محايد
      في المقابل ، تتعامل طرق النموذج المحايدة مع النموذج على أنه صندوق أسود يمكن الاستعلام عنه عن المخرجات. تقدم هذه التقنيات الحد الأدنى من الافتراضات ، وعادة ما تتطلب فقط أن يتمكن المرء من الحصول على تنبؤ النموذج للمدخلات المضطربة. تشمل الأمثلة LIME (التفسيرات المحايدة للنموذج المحلي القابل للتفسير) ، والذي يستخدم نموذجا بسيطا وقابلا للتفسير (مثل نموذج خطي متناثر أو شجرة قرار) لتقليد سلوك النموذج المعقد بالقرب من مدخلات معينة21. بالنسبة للتنبؤ المحدد ، يولد LIME العديد من الإصدارات المضطربة من المدخلات ، ويحصل على تنبؤات نموذج الصندوق الأسود لكل منها ، ثم يتعلم الانحدار الخطي المرجح الذي يقترب من علاقات المدخلات والمخرجات المحلية22. تعمل معاملات هذا النموذج الخطي البديل كتفسير ، يشير إلى الميزات التي تقود التنبؤ بقوة23. تكمن جاذبية LIME في مرونتها (يمكن استخدامها مع أي مصنف) ومخرجاتها البديهية (على سبيل المثال ، مجموعة صغيرة من الميزات المرجحة). SHapley Additive exPlanations (SHAP) هي طريقة أخرى شائعة تعتمد على نظرية الألعاب24. يشرح SHAP تنبؤا فرديا عن طريق حساب إسنادات الميزات التي تقترب من قيم Shapley من نظرية الألعاب التعاونية ، مما يضمن خصائص مثل الإضافة والاتساق25. بالإضافة إلى إسناد الميزة ، تتضمن الأساليب غير الحيادية للنموذج أيضا طرق الاضطراب البصري لنماذج الصور. يقوم RISE (أخذ عينات الإدخال العشوائية للشرح) بإنشاء خرائط أهمية عن طريق إخفاء أجزاء من صورة الإدخال بشكل عشوائي ومراقبة كيفية تغير مخرجات النموذج26. من خلال أخذ عينات من العديد من هذه الأقنعة ، يبني RISE خريطة بارزة احتمالية تشير إلى وحدات البكسل أو المناطق التي كانت أكثر تأثيرا على التنبؤ26. والجدير بالذكر أن RISE لا يتطلب أي وصول إلى الأجزاء الداخلية للنموذج ولا يتطلب سوى القدرة على تقييم النموذج على المدخلات المعدلة ، مما يجعله صندوقا أسود حقا. أخيرا ، تركز منطقة متنامية من XAI غير النموذجي على التفسيرات المضادة للواقع. لا يعدد التفسير المضاد للواقع أهمية الميزة ولكنه يجيب بدلا من ذلك على السؤال: "ما هو الحد الأدنى من التغيير في المدخلات الذي كان سيغير تنبؤ النموذج؟" 27. عادة ما تقوم الخوارزميات لإنشاء الحقائق المضادة بإجراء بحث في مساحة الإدخال (أو مساحة كامنة مكتسبة) عن أقرب مثال ينتج عنه المخرجات المطلوبة ، مع فرض الواقعية والتناثر في التغييرات. باختصار ، يتم اعتماد طرق XAI اللاحقة على نطاق واسع لأنه يمكن تطبيقها على النماذج عالية الأداء بعد التدريب ، والجمع بين القوة التنبؤية ودرجة من الشفافية.
  2. طرق التفسير الجوهرية
    تتخذ الأساليب الجوهرية نهجا مختلفا اختلافا جوهريا: بدلا من شرح الصندوق الأسود بعد الحقيقة ، تجعل هذه الأساليب النموذج قابلا للتفسير حسب التصميم. الشبكات العصبية ذاتية الشرح (SENN) هي مثال بارز. في إطار عمل SENN الذي اقترحه Alvarez-Melis و Jaakola28 ، تم تنظيم الشبكة العصبية لحساب مجموعة من عمليات تنشيط المفاهيم الوسيطة أولا ثم إنشاء تنبؤ كوظيفة بسيطة وقابلة للتفسير لتلك المفاهيم. ProtoPNet (شبكة الأجزاء النموذجية) هي شبكة عميقة تصنف المدخلات من خلال مقارنتها بمجموعة من تمثيلات النماذج الأولية المكتسبة لكل فئة. على سبيل المثال ، في مهمة تصنيف الصور ، قد يتعلم ProtoPNet تصحيحات النموذج الأولي ويتخذ القرارات من خلال العثور على النماذج الأولية التي يتم تنشيطها بشكل أكبر بواسطة الإدخال29. في مجال نماذج التسلسل والمحولات ، تم الاستفادة من آليات الانتباه من أجل قابلية التفسير الجوهرية أيضا. يتم تدريب بعض النماذج بهدف محاذاة الانتباه ، مما يشجع أوزان انتباه النموذج على التوافق مع الميزات المهمة المعروفة أو مع المناطق ذات الصلة التي يصنفها الإنسان. من خلال توجيه الانتباه إلى أن يكون "صحيحا للأسباب الصحيحة"30 ، تنتج هذه الأساليب نماذج لا تعمل بشكل جيد فحسب ، بل تحتوي أيضا على توزيعات انتباه يمكن تفسيرها مباشرة على أنها تفسيرات. علاوة على ذلك ، تقدم هذه النماذج تفسيرات عادة ما تكون مخلصة عن طريق البناء ، نظرا لأن التفسير يتم إنشاؤه من الهيكل القابل للتفسير الخاص بالنموذج ، وليس من تقريب خارجي لاحق31.

3. تصنيف XAI

لتوفير توليفة منظمة لحالة البحث ، تم إجراء مراجعة منهجية للأدبيات باستخدام إرشادات PRISMA (الشكل 2). تضمنت العملية قواعد بيانات أكاديمية متعددة (Scopus و Web of Science و IEEE Xplore و SpringerLink و PubMed و arXiv و MDPI) وتم الاسترشاد بمجموعة من مصطلحات البحث التي تجمع بين "الذكاء الذكاء الاصطناعي القابل للتفسير" و "قابلية التفسير" و "الفحص البصري" و "اكتشاف العيوب" و "اكتشاف الشذوذ" و "التصنيع" و "التصوير الطبي". تطلبت معايير التضمين أن تطبق الأوراق أو تقيم صراحة طرق XAI في سياقات الفحص البصري (الصناعية أو الطبية) وتبلغ عن تفاصيل منهجية كافية. أزالت معايير الاستبعاد المقترحات النظرية البحتة دون التنفيذ ، وكذلك الأعمال خارج الفحص البصري. استرجع البحث في البداية 483 سجلا. بعد إزالة التكرارات وفحص العناوين والملخصات ، بقي 147 لمراجعة النص الكامل. أسفر تطبيق معايير الشمول/الاستبعاد عن 75 دراسة أولية، والتي تشكل أساس هذه المراجعة.

figure-protocol-2
الشكل 2: مخطط تدفق PRISMA لعملية المراجعة المنهجية باتباع إرشادات PRISMA. يوضح الشكل السجلات التي تم تحديدها وفحصها واستبعادها في كل مرحلة ، مما أسفر عن 75 دراسة أولية مدرجة في المراجعة النهائية. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

  1. التصنيف التطبيقي للدراسات التي تمت مراجعتها
    بناء على الإطار المفاهيمي المقدم في القسم 2 (النهج اللاحقة والجوهرية) ، قمنا بتحسين تصنيف خاص بالمجال مشتق من هذه الدراسات ال 75. يميز هذا التصنيف المطبق الطرق وفقا لتنفيذها في مهام الفحص البصري كما هو موضح في الشكل 3.
  2. توزيع الدراسات عبر التصنيف
    ويرد في الجدول 1 ملخص للتوزيع الكامل للدراسات ال 75. يتم تعيين كل دراسة وفقا لفئتها المنهجية ومجال التطبيق. يوفر هذا أساسا تجريبيا للتحليل المقارن المقدم في القسم 4.
  3. تركيب
    تظهر العديد من الاتجاهات الواضحة من هذه المراجعة المنهجية. أولا ، تظل طرق التدرج اللاحقة القائمة على التدرج هي الأكثر اعتمادا على نطاق واسع في مهام التفتيش الصناعي والطبي نظرا لكفاءتها وسهولة تكاملها. ثانيا ، توفر الطرق القائمة على الاضطراب إسنادات ميزات أكثر ثراء ولكنها أقل شيوعا في البيئات الصناعية عالية الإنتاجية بسبب المتطلبات الحسابية. ثالثا ، تكتسب الطرق الجوهرية زخما ولكنها لا تزال ممثلة تمثيلا ناقصا ، حيث تنفذها أقل من 15٪ من الدراسات.
    من خلال ترسيخ هذا التصنيف في مراجعة موجهة ب PRISMA قابلة للتكرار وربطها بقاعدة بيانات منظمة من 75 دراسة ، يؤسس هذا القسم قاعدة أدلة تم التحقق من صحتها. مهدت هذه النتائج الطريق للتحليل المقارن في القسم 4 ، حيث يتم قياس الطرق التمثيلية عبر المقاييس المعيارية (الدقة والمتانة وزمن الوصول ودقة التوطين).

figure-protocol-3
الشكل 3: التصنيف المقترح لطرق XAI في مهام الفحص البصري. الرجاء النقر هنا لعرض نسخة أكبر من هذا الشكل.

طريقة XAIنهج XAIدرسصناعةسنة
الجوهريهالنماذج الخطية والقائمة على القواعد32,33طبي عام2015–2019
قائم على النموذج الأولي (ProtoPNet ، قائم على الحالة ، ProtoPNet قابل للتشوه)29،34،35،36طبي ، صناعي ، عام2018–2024
مدفوع بالمفهوم (عنق الزجاجة في المفهوم، الحق في الأسباب الصحيحة) 30,31,37 تطبيقات علمية عامة2020–2021
الشبكات العصبية ذاتية الشرح (SENN)28عام2018–2020
التمثيل غير المتشابك (β-VAE) ، SOXAI38,39عام2018
محولات الرؤية (قابلية التفسير الجوهري عن طريق الانتباه)40،41،42،43،44،45رؤية الحاسب الآلي والتصنيع2020–2024
بعد الإعداد ، خاص بالنموذجعائلة CAM46،47،48،49،50،51،52 ، 53،54،55،56،57،58التصوير الطبي, تصنيع, السيارات, الزراعة, الإلكترونيات2018–2025
LRP (انتشار الملاءمة حسب الطبقة)20،59،60،61،62التصوير الطبي العام2015–2024
طرق التدرج والبارزة (التدرجات المتكاملة ، IG Smooth DeepLIFT ، DeconvNet ، T-Explainer ، معايير البارزة)18،19،63،64،65 ،
66,67,68,69,70
التصوير الطبي العام2013–2025
الإسناد في النماذج المتخصصة (SNNs ، إسناد انتباه المحولات) 71,72,73 علم الأعصاب ، محولات الرؤية2023–2025
ما بعد الإعداد ، النموذج غير المحددالجير والمتغيرات (الجير ، إليمي ، ماسالا) ، شاب والمتغيرات (شجرة SHAP) ،المالية ، التوقعات والإدارة الصحية ، الأمن السيبراني ، المركبات ذاتية القيادة ، التفتيش الصناعي.2016–2025
الوقائع المضادة21،22،23،24،25،27،74 ،
75،76،77،78،79،80،81 ،
82,83,84,85,86
التفسيرات
الطرق الهجينةدمج طرق XAI متعددة بما في ذلك (GradCAM ، SHAP ، LRP ، LIME)58،87،88،89،90،91،92التفتيش الصناعي والرعاية الصحية والتصنيع.2021–2025

الجدول 1: تصنيف 75 دراسة تمت مراجعتها حسب طريقة XAI والسنة والصناعة والنهج.

4. مقاييس التقييم ل XAI

يتم الحكم على أداء نموذج رؤية الكمبيوتر من خلال مقاييس راسخة مثل الدقة والدقة والاستدعاء. ومع ذلك ، فإن تقييم قابلية تفسير قرارات النموذج أقل وضوحا بكثير. على عكس الأداء التنبؤي القياسي ، لا يوجد مقياس مقبول عالميا لجودة تفسيرات الذكاء الاصطناعي66. بمعنى آخر ، بينما يمكن قياس دقة المصنف بدقة ، لا يوجد مقياس متفق عليه لتحديد مدى "جودة" التفسير لتصنيف صورة معين93. يسلط هذا التباين الضوء على فجوة أساسية في مجال XAI: كيفية تقييم التفسير.

أثبت تطوير معايير تقييم XAI الموحدة تحديا استثنائيا. أحد الأسباب هو أن قابلية التفسير وجودة التفسير متعددة الأوجه وتعتمد على السياق وبالتالي تقاوم مقياسا عالمياواحدا 10. يعتمد تقييم التفسير بشكل فعال على عدة عوامل ، بما في ذلك مجال التطبيق وطبيعة التفسير الذي تم إنتاجه وخلفية المستخدم النهائي. على سبيل المثال ، قد يتم تقييم تقنية الشرح المناسبة لتشخيص الصورة الطبية بشكل مختلف عن تلك المستخدمة في مهمة الفحص البصريالصناعي 10.

من الناحية العملية ، أدى عدم وجود مقاييس قياسية إلى قيام الباحثين بالاعتماد على مجموعة متنوعة من مناهج التقييم. لا تزال العديد من الدراسات تلجأ إلى التقييم النوعي القصصي لطرق XAI94،95. من الشائع أن نرى المؤلفين يقدمون بعض خرائط البروز أو خرائط الحرارة ويجادلون بأنها تبدو معقولة (ما يسمى باختبار "صحة الوجه") 96. يمكن أن يكون هذا الفحص البصري مقنعا بالمعنى السردي ، لكنه يظل ذاتيا وغير كاف للمقارنة الصارمة97. يوضح هذا صعوبة توحيد مقاييس XAI. في حالة عدم وجود معايير متفق عليها ، يقترح الباحثون مقاييس مصممة خصيصا لكل مجموعة بيانات أو حالة استخدام.

نتيجة لذلك ، تزخر الأدبيات الآن بمقاييس تقييم XAI المتنوعة التي تهدف إلى سد هذه الفجوة98. تم طرح العديد من الأطر والتدابير ، كل منها يستهدف جانبا معينا مما يجعل التفسير مفيدا99. بشكل عام ، يمكن تصنيف المقاييس بناء على تركيزها الأساسي. تحكم المقاييس القائمة على الإخلاص على التفسير من خلال مدى انعكاسه لعملية اتخاذ القرار في النموذج100. في المقابل ، تقيم المقاييس التي تركز على قابلية التفسير مدى فهم وإقناع التفسير للمراقب البشري101. الفئة الثالثة هي المقاييس القائمة على المهام ، حيث يعتمد تقييم التفسير على تأثيره على أداء المستخدم النهائي102. الفئة الرابعة هي المقاييس الموجهة نحو المتانة التي تقيم اتساق النتائج103. أخيرا ، تجمع المقاييس المختلطة بين أبعاد متعددة104.

يشير هذا التنوع في المقاييس إلى جوانب قابلية التفسير التي يعتبرها الباحثون مهمة ولكنه يسلط الضوء أيضا على عدم وجود معيار واحد: يلتقط كل مقياس زاوية واحدة فقط من جودة التفسير105. في ما يلي ، يتم تجميع مجموعة من مقاييس التقييم ل XAI في أربع فئات رئيسية ويتم تلخيصها في الجدول 2.

النوع المتريمتريالصيغة / التعريف
إخلاصمنطقة الحذف تحت المنحنى (AUC)26figure-protocol-4
هي ميزات مهمة من أعلى K ; أقل = أكثر إخلاصا
منطقة الإدراج تحت المنحنى (AUC)26figure-protocol-5
أعلى = أكثر إخلاصا
درجة الخيانة الزوجية103figure-protocol-6
أقل = أفضل
روار:106تنخفض الدقة بعد إعادة التدريب بدون ميزات "مهمة"
متانهمؤشر الاستقرار107figure-protocol-7
أعلى = أكثر اتساقا
درجة ليبشيتز103figure-protocol-8
أقل = أكثر قوة
قابلية التفسيررباعي79figure-protocol-9
أقل = أبسط
عمق البديل79عمق البديل القابل للتفسير (على سبيل المثال ، شجرة القرار) ؛
ضحل = أبسط
مهمة محددةتقاطع فوق الاتحاد (IoU)108figure-protocol-10
تداخل القناع M والحقيقة الأرضية G
لعبة التأشير108الدقة = #hits / #samples
أعلى = أفضل
هجينالنتيجة المركبة: 104مزيج مرجح من الدقة والتناثر والمتانة

الجدول 2: مقاييس تقييم XAI في الفحص البصري مجمعة في أربع فئات رئيسية.

5. التحليل المقارن

في هذا القسم، تتم مقارنة الأساليب عبر مجموعات البيانات العامة مثل MVTec AD109 (>5,000 صورة عيوب مع أقنعة على مستوى البكسل) و DeepPCB110 (1,500 صورة ثنائي الفينيل متعدد الكلور مع ست فئات عيوب) و CheXpert111 و ImageNet112 وتقييمها عبر المقاييس التالية: AUC الحذف/الإدراج (الإخلاص) ودقة لعبة التأشير (الترجمة) ودرجات الاستقرار (المتانة في ظل الاضطرابات) وزمن الوصول (تكلفة وقت التشغيل).

بالنسبة للطرق المستندة إلى CAM (GradCAM و GradCAM++) تظهر النتائج على MVTec AD و DeepPCB أن GradCAM يحقق دقة تتراوح بين 0.83-0.87 (الإدراج AUC ~ 0.68 ؛ <انخفاض الدقة بنسبة 15٪ تحت الحذف) ، والحساسية (0.80 - 0.85) ، ووقت التشغيل <100 مللي ثانية (~39 إطارا في الثانية (FPS)). لا يزال التوطين معتدلا (متوسط IoU ≈0.28 @ δ = 0.25 ؛ دقة التأشير 86-87٪). يعمل GradCAM++ على تحسين الترجمة متعددة المثيلات (متوسط IoU = 0.38) مع الحفاظ على زمن انتقال مماثل (<120 مللي ثانية) وثقة أعلى للمستخدم (109.69/250 مقابل 56.08/250 ل GradCAM). هذه الأساليب فعالة ولكنها خشنة مكانيا47،113.

بالنسبة للطرق القائمة على الاضطراب (LIME وSHAP وRISE)، يختلف الأداء عبر مجموعات البيانات. في MVTec AD ، يصل LIME إلى الدقة المحلية R² = 0.70-0.80 ولكنه يظهر متانة منخفضة (مؤشر الاستقرار <0.5) ، وزمن انتقال 3-5 ثوان / صورة ، وتوطين معتدل (IoU = 0.25-0.35). يحقق SHAP المطبق على تصنيف عيوب ثنائي الفينيل متعدد الكلور إسنادات متسقة (احتمالات Δ log-odds = 0.2-0.3) مع محاذاة بشرية قوية (70-80٪) ولكنه أبطأ (>1 ثانية / صورة) وله توطين ضعيف (IoU ≈0.02-0.03). RISE ، التي تم قياسها على MS-COCO وتكرارها ل MVTec AD ، يبلغ متوسطها 4,000-8,000 تمريرة أمامية مقنعة ، مما ينتج عنه متانة عالية (الاستقرار >0.7) ، والإخلاص (0.78-0.82 AUC) ، والتوطين الفائق (لعبة التأشير = 62.9٪ مقابل 48.3٪ ل GradCAM) ، ولكن عند زمن انتقال 1-2 ثانية / شرح26،74،79،114.

بالنسبة لطرق انتشار الملاءمة (LRP ، DeepLIFT) ، تشير التقييمات على DeepPCB و CheXpert إلى أن LRP يحقق دقة من 0.82-0.90 ، وحساسية ~ 0.85 ، وتوطين IoU من 0.40-0.50. وقت التشغيل هو 100-200 مللي ثانية لكل صورة، وهو أبطأ من برامج إدارة المحتوى (CAM) ولكنه ممكن للفحص في الوقت الفعلي تقريبا. في مهام CheXpert للأشعة ، تظهر دراسات الخبراء تداخلا بنسبة >70٪ بين خرائط الحرارة LRP والمناطق ذات الصلة سريريا ، مما يدل على قابلية التفسير عبر المجالات60.

بالنسبة للطرق القائمة على الانتباه (المحولات) ، نتائج نماذج ViT المدربة على ImageNet و CheXpert ، تنتج خرائط الانتباه الأولية دقة تتراوح من 0.75-0.85 ولكنها غير مستقرة تحت الاضطرابات ، مع حساسية 0.70-0.75 وتوطين متواضع (IoU = 0.30-0.45). ثقة الإنسان ~ 60-70٪. تعمل الأساليب المكيفة (تدفق الانتباه ، Transformer-LRP) على تحسين المقاييس السببية ، متفوقة على الاهتمام الخام في الحذف / الإدراج ودرجات لعبة التأشير40،115،116.

بالنسبة للطرق القائمة على النموذج الأولي والواقع المضاد ، تسلط التقييمات n MVTec AD الضوء على أن ProtoPNet يحقق تفسيرات قائمة على النماذج حيث يتم تبرير التنبؤات من خلال حالات عيوب مماثلة ، مما يساعد على اتخاذ قرارات المشغل. تضع الأساليب المستندة إلى SOM ميزات عيوب الكتلة على الخرائط ثنائية الأبعاد ، مما يحافظ على العلاقات الطوبولوجية. توفر الطرق المضادة للواقع ، التي تم اختبارها على كل من صور عيوب ثنائي الفينيل متعدد الكلور و CheXpert ، تفكيرا قابلا للتنفيذ ("إذا كان طول الكراك أقل من 1 مم ، فإن التنبؤ ينتقل إلى الوضع الطبيعي") ولكنها تتطلب تحسينا مكلفا وتكافح مع مدخلات عالية الدقة. تتوافق هذه الأساليب بقوة مع المنطق البشري ولكنها تتسع بشكل سيئ117،118،119.

أخيرا ، عند التفكير في المقايضات والاختيار العملي ، تهيمن CAMs على سير العمل الحرج لزمن الوصول ولكنها تظل خشنة. يوازن LRP بين الدقة ووقت التشغيل ، ويتفوق في التحليل على مستوى البكسل. يوفر RISE أقوى إخلاص سببي وتوطين ولكن بزمن انتقال على مستوى الثواني. يعزز SHAP و LIME قابلية التفسير ولكنهما بطيان وغير مستقرين. تعمل النماذج الأولية والحقائق المضادة على زيادة المحاذاة البشرية إلى الحد الأقصى ولكنها تتوسع بشكل سيئ في التفتيش عالي الدقة. تتطلب النماذج القائمة على المحولات تعديلات متخصصة تتجاوز الاهتمام الخام. وبالتالي ، لا توجد طريقة واحدة تتفوق عالميا على الآخرين. بدلا من ذلك، يجب أن يعكس اختيار الطريقة احتياجات مجموعة البيانات والمهمة وزمن الانتقال والميزانية وقابلية التفسير. كما هو موضح في الشكل 4 ، يدمج سير عمل التحديد ثلاثة من هذه المعايير (المهمة ، زمن الوصول ، قابلية التفسير) في دليل موجه نحو المهام لاختيار طرق XAI في الفحص البصري.

figure-protocol-11
الشكل 4: سير عمل التحديد لاعتماد طريقة XAI. هذا مخطط انسيابي للقرار يوجه اختيار طرق XAI المناسبة في الفحص البصري. يأخذ سير العمل في الاعتبار نوع المهمة (التصنيف والتجزئة واكتشاف الحالات الشاذة والانحدار) وقيود زمن الانتقال وتفاصيل الشرح ويربطها بالطرق التمثيلية. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

6. مناقشة

  1. النتائج المقارنة
    يظهر تحليلنا أن الأساليب القائمة على التدرج مثل GradCAM وانتشار الملاءمة للطبقة (LRP) تتفوق في تسليط الضوء على مناطق الصورة المحددة الأكثر تأثيرا في قرارات الشبكة التلافيفية ، مما يجعلها أدوات بديهية لمهام مثل توطين العيوب أو تصنيف الصور الطبية. هذه الأساليب فعالة لأنها تعمل في مسار واحد للخلف ، لكن تفسيراتها غالبا ما تكون خشنة وقد تصبح غير واضحة في المناطق المعقدة. في المقابل ، توفر تقنيات إسناد الميزات غير الحيادية للنموذج ، مثل SHAP و LIME ، رؤى كمية أكثر في مساهمات الميزات من خلال استكشاف النموذج بمدخلات مضطربة أو تركيب بدائل محلية ، ولكن بتكلفة حسابية أعلى من GradCAM.
    تستفيد الأساليب القائمة على الانتباه من الأوزان الداخلية للنموذج لتسليط الضوء على مناطق التركيز داخل النموذج115. من ناحية أخرى ، يمثل RISE استراتيجية قائمة على التوزيع العشوائي تخفي وعينات من المدخلات لإنتاج خرائط بارزة مرنة ، على الرغم من أنها تتطلب الآلاف من التمريرات الأمامية. مجتمعة ، تتفوق هذه التقنيات في ظل ظروف محددة ، لكن لا يتفوق أي منها عالميا على الآخرين26. بدلا من ذلك ، يعتمد اختيار الطريقة على بنية النموذج ومهمة الفحص البصري ومتطلبات زمن الوصول ونوع المعلومات التي يحتاجها صانعو القرار.
  2. دراسات الحالة
    فيما يلي دراسات حالة في العالم الحقيقي تنفذ XAI في كل من القطاعين الطبي والصناعي: في الرعاية الصحية ، تم شرح نماذج الكشف عن الالتهاب الرئوي و COVID-19 المدربة على الأشعة السينية للصدر والتصوير المقطعي المحوسب باستخدام GradCAM و LIME ، وفضل أخصائيو الأشعة في دراسات المستخدم باستمرار GradCAM لأن مناطقه المميزة تتماشى مع علم الأمراض المتوقع مثل تسلل الرئة120. وبالمثل ، في علم الأمراض الرقمي لسرطان الرأس والرقبة ، سلطت تنبؤات CNN المدعومة من GradCAM و CAM عالي الدقة الضوء على مجموعات الخلايا الخبيثة التي أكد علماء الأمراض أنها ذات صلة سريريا ، مما يدل على أن التفسيرات عززت الدقة السريرية والثقة121.
    في خط قطاع التصنيع ، أحدثت XAI فرقا تحويليا في الدقة وقابلية التفسير. أحد التطبيقات الرئيسية هو اكتشاف الأجسام الغريبة على صور الأشعة السينية للإطارات التي تستخدم شبكة عصبية تلافيفية تعتمد على بنية Xception. من خلال تضمين رسم خرائط تنشيط الفئة المرجحة بالتدرج (GradCAM) ، حقق النظام دقة تصنيف أكبر من 99٪ وأنتج خرائط حرارية تشير إلى المناطق الدقيقة داخل الصورة المسؤولة عن التنبؤات. سمحت هذه التفسيرات المرئية لمهندسي ضمان الجودة بالتحقق من أن انتباه النموذج كان على الحالات الشاذة المشروعة داخل الدعم الهيكلي للإطار وليس القطع الأثرية غير ذات الصلة ، مما أدى إلى تحسين الثقة بشكل كبير وتسهيل النشر في إعدادات الإنتاج عالية المخاطر48.
    في صناعة الإلكترونيات ، يظهر نهج SolderNet دمج XAI في فحص العيوب على مستوى البكسل. تم تطوير الطريقة المستندة إلى CNN لفحص وصلات اللحام على لوحات الدوائر المطبوعة ، وهي مهمة تكون فيها الدقة العالية وقابلية التفسير إلزامية. مع تطبيق GradCAM وانتشار الملاءمة للطبقة (LRP) ، استخرجت الطريقة خرائط البروز التي سلطت الضوء على وحدات البكسل المسؤولة عن تصنيفات عيوب محددة. من خلال هذه التفسير ، تمكن المشغل من التمييز بين الإيجابيات الحقيقية والخاطئة واستخلاص رؤى حول أوضاع الفشل التي كانت في السابق مخرجات الصندوق الأسود39. تظهر هذه الحالات أن XAI يتم تقييمها عندما تتوافق تفسيراتها مع تفكير الخبراء ، ولكنها غير مستغلة بشكل كاف عندما تكون التفسيرات غير مستقرة أو خشنة أو غير عملية من الناحية الحسابية.
  3. قيود البينات الحالية
    على الرغم من هذه التطورات ، لا تزال هناك العديد من القيود. أولا ، تعتمد معظم الدراسات التجريبية على مجموعات البيانات العامة مثل MVTec AD للتفتيش الصناعي أو VinDR-CXR122 للتصوير الطبي ، والتي قد لا تمثل بشكل كامل بيئات العالم الحقيقي للمصانع أو المستشفيات. ثانيا، لا يزال التقييم مجزأ: يتم قياس الدقة والمتانة وقابلية التفسير بشكل غير متسق عبر الدراسات، وغالبا ما يكون ذلك بتعريفات مخصصة وبدون عتبات موحدة. ثالثا ، تفتقر العديد من الأعمال إلى التحقق من صحة الإنسان. في حين أن المقاييس مثل حذف AUC أو دقة اللعبة أو الترجمة IoU توفر نتائج كمية ، إلا أنها لا تؤكد أن هذه التفسيرات تعمل بالفعل على تحسين عملية صنع القرار للمستخدم. أخيرا ، فقط ~ 8٪ من دراسات ضمان الجودة القائمة على الذكاء الاصطناعي في التصنيع تدمج XAI في سير عملها123. وهذا يسلط الضوء على فجوة التبني العملي، على الرغم من أن هذه الإحصائية تختلف حسب القطاع والمنهجية وقد لا تكون دقيقة.
  4. الآثار العملية على الممارسين
    بالنسبة للممارسين ، تظهر العديد من الآثار. تظل الطرق المستندة إلى التدرج هي الخيار الأكثر عملية لمهام الفحص في الوقت الفعلي ، حيث تقدم تفسيرات بزمن انتقال منخفض (~ 100 مللي ثانية لكل صورة) ويسهل نشرها. تتمتع الأساليب القائمة على الاضطراب ، مثل SHAP أو RISE ، بزمن انتقال أعلى من الطرق القائمة على التدرج ولكنها أكثر ملاءمة للمجالات التي يفوق فيها الإسناد الدقيق زمن الوصول ، مثل الرعاية الصحية ، حيث تكون الدقة لها الأسبقية على السرعة. تعتبر الأساليب القائمة على الانتباه مفيدة مع معماريات المحولات ، لكنها تتطلب تفسيرا دقيقا لأن الاهتمام الخام لا يقدم دائما تفسيرا واضحا. بالإضافة إلى المقايضات التقنية ، يعتمد التبني الناجح بشكل كبير على التكامل وتدريب المستخدم وإظهار القيمة السريرية لقابلية التفسير. كما تظهر دراسات الحالة ، تكتسب التفسيرات قيمة فقط عندما تتوافق بوضوح مع خبرة المجال وتساعد الممارسين على التحقق من تنبؤات الذكاء الاصطناعي أو تحديها.
  5. اتجاهات البحث المستقبلية
    يجب أن تعطي البحوث المستقبلية الأولوية لعدة اتجاهات قابلة للتنفيذ:
    توحيد بروتوكولات التقييم: إنشاء إرشادات إعداد تقارير قابلة للتكرار للمقاييس الرئيسية، بما في ذلك AUC للحذف/الإدراج ودقة اللعبة ومؤشرات الاستقرار وزمن الوصول.
    مجموعات البيانات المعيارية الخاصة بالمجال: تطوير مجموعات بيانات منسقة للفحص البصري الصناعي والطبي مع التعليقات التوضيحية للحقيقة الأساسية لتقليل الاعتماد المفرط على مجموعات البيانات العامة الضيقة.
    التحقق من الصحة المتمحور حول الإنسان: توسيع الدراسات التي تقيس ما إذا كانت تفسيرات XAI تعمل على تحسين جودة القرار وثقة المستخدم والتعاون بين الإنسان الذكاء الاصطناعي بما يتجاوز مقاييس الوكيل
    تحليل التكلفة والفائدة: إجراء دراسات نشر صارمة لتحديد قيمة الأعمال والسريرية لدمج XAI في مهام سير عمل الفحص البصري.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الاستنتاجات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

فحصت هذه المراجعة 75 دراسة عن XAI في الفحص البصري ، مما أدى إلى تصنيف للطرق اللاحقة والجوهرية وتحليل مقارن قائم على المعايير. تؤكد النتائج أنه لا توجد طريقة واحدة تتفوق عالميا على غيرها: الأساليب القائمة على التدرج مثل GradCAM و LRP فعالة لتوطين العيوب في الوقت الفعلي ، لكن تفسيراتها يمكن أن تكون خشنة في المناطق المعقدة. توفر الطرق القائمة على الاضطراب مثل SHAP و LIME و RISE تفاصيل أدق ودقة قوية ولكنها غالبا ما تفشل في الممارسة بسبب زمن الوصول العالي والتكلفة الحسابية. تستفيد الأساليب ال...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون أنه لا يوجد تضارب في المصالح فيما يتعلق بنشر هذا العمل.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلف (المؤلفون) أن هذا العمل لم يتلق أي منحة محددة من أي وكالة تمويل في القطاعات العامة أو التجارية أو غير الهادفة للربح.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Alzarooni, A., et al. Anomaly detection for industrial applications, its challenges, solutions, and future directions: a review. IEEE Sens J. XX. (1), 1(2025).
  2. Hardan, F., Almusawi, A. R. J. Developing an automated vision system for maintaing social distancing to cure the pandemic. Al-Khwarizmi Eng J. 18 (1), 38-50 (2022).
  3. Terasaki, N., Fujio, Y. Mechanoluminescent visualization of crack propagation for joint evaluation. J Vis Exp. (191), e64118(2023).
  4. Al-Hamadani, S., Al-Darraji, I. Warehouse in Industry 4.0 based drone, computer vision, and artificial intelligence technologies: a literature review. Proc Eng Sci. 7 (1), 517-526 (2025).
  5. Al-Jubori, H. N., Izzat, A. D., Jerbi, H. Defect detection using thermography camera techniques: a review. Al-Khwarizmi Eng J. 20 (4), 70-88 (2024).
  6. Al-Hamadani, S., Al-Darraji, I., Jerbi, H. Improving barcode vision scanning process using a drone-based tracking PID controller for warehouse in Industry 4.0. Al-Khwarizmi Eng J. 21 (2), 72-92 (2025).
  7. Al-Jubori, H. N., Al-Darraji, I. Tools and process of defect detection in automated manufacturing systems. EAI Endorsed Trans Scalable Inf Syst. 10 (6), e4000(2023).
  8. Alaa, T., et al. Automated detection of defects on metal surfaces using vision transformers. , Published online October 6, 2024. Accessed August 1 (2025).
  9. Moosavi, S., et al. Explainable AI in manufacturing and industrial cyber-physical systems: a survey. Electronics. 13 (17), 3497(2024).
  10. Nauta, M., et al. From anecdotal evidence to quantitative evaluation methods: a systematic review on evaluating explainable AI. ACM Comput Surv. 55 (13), 1-42 (2023).
  11. Cheng, Z., et al. A comprehensive review of explainable artificial intelligence (XAI) in computer vision. Sensors. 25 (13), 4166(2025).
  12. Barredo Arrieta, A., et al. Explainable artificial intelligence (XAI): concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 58, 82-115 (2020).
  13. Kouchaki, S., et al. Survey of explainable AI techniques in healthcare. Sensors. 23 (2), 634(2023).
  14. Laugel, T., et al. The dangers of post-hoc interpretability: unjustified counterfactual explanations. Proc Int Joint Conf Artif Intell. , 2801-2807 (2019).
  15. Slack, D., et al. Reliable post hoc explanations: modeling uncertainty in explainability. Adv Neural Inf Process Syst. 33, 9391-9404 (2020).
  16. Cesarini, M., et al. Explainable AI for text classification: lessons from a comprehensive evaluation of post hoc methods. Cognit Comput. 16 (6), 3077-3095 (2024).
  17. Mohamed Musthafa, M., et al. Enhancing brain tumor detection in MRI images through explainable AI using Grad-CAM with ResNet-50. BMC Med Imaging. 24 (1), 1-19 (2024).
  18. Sundararajan, M., Taly, A., Yan, Q. Axiomatic attribution for deep networks. Proc Int Conf Mach Learn. 70, 5109-5118 (2017).
  19. Shrikumar, A., Greenside, P., Kundaje, A. Learning important features through propagating activation differences. Proc Int Conf Mach Learn. 70, 4844-4866 (2017).
  20. Bassi, P. R. A. S., et al. Improving deep neural network generalization and robustness to background bias via layer-wise relevance propagation optimization. Nat Commun. 15, 44371(2024).
  21. Knab, P., et al. Which LIME should I trust? Concepts, challenges, and solutions. arXiv preprint. , (2025).
  22. Garreau, D., von Luxburg, U. Explaining the explainer: a first theoretical analysis of LIME. Proc Mach Learn Res. 108, 1287-1296 (2020).
  23. Qian, J., et al. ELIME: exact local interpretable model-agnostic explanation. Eur J Artif Intell. , (2024).
  24. Salih, A. M., et al. A perspective on explainable artificial intelligence methods:SHAP and LIME . Adv Intell Syst. , (2024).
  25. Hermosilla, P., et al. Explainable AI for forensic analysis: a comparative study of SHAP and LIME in intrusion detection models. Appl Sci. 15 (13), 7329(2025).
  26. Petsiuk, V., Das, A., Saenko, K. RISE: randomized input sampling for explanation of black-box models. arXiv preprint. , (2018).
  27. Dandl, S., et al. Multi-objective counterfactual explanations. Lect Notes Comput Sci. 12269, 448-469 (2020).
  28. Alvarez-Melis, D., Jaakkola, T. S. Towards robust interpretability with self-explaining neural networks. Adv Neural Inf Process Syst. 31, 7775-7784 (2018).
  29. Donnelly, J., Barnett, A. J., Chen, C. Deformable ProtoPNet: an interpretable image classifier using deformable prototypes. Proc IEEE Conf Comput Vis Pattern Recognit. , 10255-10265 (2022).
  30. Ross, A. S., Hughes, M. C., Doshi-Velez, F. Right for the right reasons: training differentiable models by constraining their explanations. Proc Int Joint Conf Artif Intell. , 2662-2670 (2017).
  31. Schramowski, P., et al. Making deep neural networks right for the right scientific reasons by interacting with their explanations. Nat Mach Intell. 2 (8), 476-486 (2020).
  32. Rudin, C. Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead. Nat Mach Intell. 1 (5), 206-215 (2019).
  33. Letham, B., et al. Interpretable classifiers using rules and Bayesian analysis: building a better stroke prediction model. Ann Appl Stat. 9 (3), 1350-1371 (2015).
  34. Barnett, A. J., et al. Interpretable mammographic image classification using case-based reasoning and deep learning. arXiv preprint. , (2021).
  35. Narayanan, A., Bergen, K. J. Prototype-based methods in explainable AI and emerging opportunities in the geosciences. arXiv preprint. , (2024).
  36. Chen, C., et al. This looks like that: deep learning for interpretable image recognition. Adv Neural Inf Process Syst. 32, 8928-8939 (2019).
  37. Koh, P. W., et al. Concept bottleneck models. Proc Int Conf Mach Learn. 119, 5294-5304 (2020).
  38. Burgess, C. P., et al. Understanding disentangling in β-VAE. arXiv preprint. , (2018).
  39. Gunraj, H., et al. SolderNet: towards trustworthy visual inspection of solder joints in electronics manufacturing using explainable artificial intelligence. Proc AAAI Conf Artif Intell. 37, 15668-15674 (2023).
  40. Dosovitskiy, A., et al. An image is worth 16×16 words: transformers for image recognition at scale. arXiv preprint. , (2020).
  41. Khan, S., et al. Transformers in vision: a survey. ACM Comput Surv. 54 (10), 1-41 (2021).
  42. Yu, L., et al. eX-ViT: a novel explainable vision transformer for weakly supervised semantic segmentation. Pattern Recognit. 142, 109666(2023).
  43. Alber, M., et al. Evaluating vision transformer models for visual quality control in industrial manufacturing. Lect Notes Comput Sci. Bifet, A., et al. 14950, 1-15 (2024).
  44. Stassin, S., et al. Explainability and evaluation of vision transformers: an in-depth experimental study. Electronics. 13 (1), 175(2024).
  45. Zhai, Y., et al. A lightweight transformer with linear self-attention for defect recognition. Electron Lett. 60 (17), e13292(2024).
  46. Dhore, V., et al. Enhancing explainable AI: a hybrid approach combining Grad-CAM and LRP for CNN interpretability. arXiv preprint. , (2024).
  47. Chattopadhay, A., et al. Grad-CAM++: generalized gradient-based visual explanations for deep convolutional networks. Proc IEEE Winter Conf Appl Comput Vis. , 839-847 (2018).
  48. Saleh, R. A. A., et al. Advancing tire safety: explainable artificial intelligence-powered foreign object defect detection with Xception networks and Grad-CAM interpretation. Appl Sci. 14 (10), 4267(2024).
  49. Meister, S., et al. Investigations on explainable artificial intelligence methods for the deep learning classification of fibre layup defect in the automated composite manufacturing. Compos Part B Eng. 224, 109160(2021).
  50. Luo, X., Alzahrani, M. Automated tomato defect detection using CNN feature fusion for enhanced classification. Processes. 13 (1), 115(2025).
  51. Rahimunnisa, K. Textile fabric defect detection. J Innov Image Process. 4 (3), 165-172 (2022).
  52. Shin, H., et al. Visualization for explanation of deep learning-based defect detection model using class activation map. Comput Mater Contin. 75 (3), 4753-4766 (2023).
  53. Yue, H., et al. ASOD: attention-based salient object detector for strip steel surface defects. Electronics. 14 (5), 831(2025).
  54. Saleh, R. A. A., Ertunç, H. M. Explainable attention-based fused convolutional neural network (XAFCNN) for tire defect detection: an industrial case study. Eng Res Express. 6 (1), 015027(2024).
  55. Leem, S., Seo, H. Attention guided CAM: visual explanations of vision transformer guided by self-attention. Proc AAAI Conf Artif Intell. 38 (4), 2956-2964 (2024).
  56. Ibrahim, R., Shafiq, M. O. Augmented Score-CAM: high-resolution visual interpretations for deep neural networks. Knowl Based Syst. 252, 109287(2022).
  57. Clement, T., et al. XAI-enhanced semantic segmentation models for visual quality inspection. Proc IEEE Int Conf Consumer Electron. , 1-4 (2024).
  58. Riedel, H., et al. Automated quality control of vacuum insulated glazing by convolutional neural network image classification. Autom Constr. 135, 104144(2022).
  59. Böhle, M., et al. Layer-wise relevance propagation for explaining deep neural network decisions in MRI-based Alzheimer's disease classification. Front Aging Neurosci. 10, 194(2019).
  60. Bach, S., et al. On pixel-wise explanations for non-linear classifier decisions by layer-wise relevance propagation. PLoS One. 10 (7), e0130140(2015).
  61. Dieter, T. R., Zisgen, H. Evaluation of the explanatory power of layer-wise relevance propagation using adversarial examples. Neural Process Lett. 55 (7), 8531-8550 (2023).
  62. Hoefler, M. A., et al. XAI-guided insulator anomaly detection for imbalanced datasets. arXiv. , (2024).
  63. Kares, F., et al. What makes for a good saliency map? Comparing strategies for evaluating saliency maps in explainable AI (XAI). arXiv preprint. , (2025).
  64. Yona, G., Greenfeld, D. Revisiting sanity checks for saliency maps. arXiv preprint. , (2021).
  65. Zeiler, M. D., Fergus, R. Visualizing and understanding convolutional networks. Eur Conf Comput Vis. 8689, 818-833 (2014).
  66. Xu-Darme, R., et al. On the stability, correctness and plausibility of visual explanation methods based on feature importance. ACM Int Conf Proc Ser. , 119-125 (2023).
  67. Ortigossa, E. S., et al. T-Explainer: a model-agnostic explainability framework based on gradients. arXiv preprint. , (2024).
  68. Singh, M., et al. Attributional robustness training using input-gradient spatial alignment. Lect Notes Comput Sci. 12372, 515-533 (2019).
  69. Cerekci, E., et al. Quantitative evaluation of saliency-based explainable artificial intelligence methods in deep learning-based mammogram analysis. Eur J Radiol. 173, 111356(2024).
  70. Meister, S., et al. Cross-evaluation of a parallel operating SVM-CNN classifier for reliable internal decision-making processes in composite inspection. J Manuf Syst. 60, 620-639 (2021).
  71. Bitar, A., et al. Gradient-based feature-attribution explainability methods for spiking neural networks. Front Neurosci. 17, 1153999(2023).
  72. Qiang, Y., et al. Interpretability-aware vision transformer. arXiv preprint. , (2023).
  73. Bousselham, W., et al. LeGrad: an explainability method for vision transformers via feature formation sensitivity. arXiv preprint. , (2025).
  74. Lundberg, S. M., Lee, S. I. A unified approach to interpreting model predictions. Adv Neural Inf Process Syst. 30, (2017).
  75. Khan, F. S., et al. Model-agnostic explainable artificial intelligence methods in finance: a systematic review, recent developments, limitations, challenges and future directions. Artif Intell Rev. 58, 1-65 (2025).
  76. Nazim, S., et al. Advancing malware imagery classification with explainable deep learning: a state-of-the-art approach using SHAP LIME and Grad-CAM. PLoS One. 20 (5), e0318542(2025).
  77. Solís-Martín, D., et al. On the soundness of XAI in prognostics and health management (PHM). Information. 14 (5), 256(2023).
  78. Biecek, P., Burzykowski, T. Local interpretable model-agnostic explanations (LIME). In:Explanatory Model Analysis. , 107-123 (2021).
  79. Ribeiro, M. T., Singh, S., Guestrin, C. 34;Why should I trust you?" Explaining the predictions of any classifier. Proc ACM SIGKDD Int Conf Knowl Discov Data Min. , 1135-1144 (2016).
  80. Tahir, H. A., et al. A novel hybrid XAI solution for autonomous vehicles: real-time interpretability through LIME-SHAP integration. Sensors. 24 (21), 6776(2024).
  81. Goldman, C. V., et al. Explaining learning models in manufacturing processes. Procedia Comput Sci. 180, 259-268 (2021).
  82. Emmanouilidis, C., Rica, E. Visual quality control via explainable AI and the case of human in the AI loop. In: Lect Notes Mech Eng. , 252-260 (2023).
  83. Huang, M., et al. An interpretable approach using hybrid graph networks and explainable AI for intelligent diagnosis recommendations in chronic disease care. Biomed Signal Process Control. 91, 105913(2024).
  84. Dardouillet, P., et al. Explainability of image semantic segmentation through SHAP values. Data. 7 (8), 255(2022).
  85. Saifullah, S., et al. The privacy-explainability trade-off: unraveling the impacts of differential privacy and federated learning on attribution methods. Front Artif Intell. 7, 1236947(2024).
  86. Velmurugan, M., et al. Developing guidelines for functionally-grounded evaluation of explainable artificial intelligence using tabular data. Eng Appl Artif Intell. 141, 109772(2025).
  87. Wells, L., Bednarz, T. Explainable AI and reinforcement learning-a systematic review of current approaches and trends. Front Artif Intell. 4, 550030(2021).
  88. Rožanec, J. M., et al. Adaptive explainable artificial intelligence for visual defect inspection. Procedia Comput Sci. 232, 3034-3043 (2024).
  89. Nguyen, H. T. T., et al. XEdgeAI: a human-centered industrial inspection framework with data-centric explainable edge AI approach. Inf Fusion. 116, 102782(2025).
  90. Han, C., et al. Visual coating inspection framework via self-labeling and multi-stage deep learning strategies. J Intell Manuf. 35, 1-18 (2024).
  91. Kotsiopoulos, T., et al. Revolutionizing defect recognition in hard metal industry through AI explainability, human-in-the-loop approaches and cognitive mechanisms. Expert Syst Appl. 255, 124839(2024).
  92. Forcher, B., et al. Evaluation of explainable AI methods for classification tasks in visual inspection. Proc XAI Workshop (Late-Breaking Work, Demos, Doctoral Consortium). , 77-82 (2023).
  93. Miller, T. Explanation in artificial intelligence: insights from the social sciences. Artif Intell. 267, 1-38 (2019).
  94. Jacovi, A., Goldberg, Y. Towards faithfully interpretable NLP systems: how should we define and evaluate faithfulness. Proc Annu Meet Assoc Comput Linguist. 58, 4198-4205 (2020).
  95. Adebayo, J., et al. Sanity checks for saliency maps. Adv Neural Inf Process Syst. 31, 9505-9515 (2018).
  96. Doshi-Velez, F., Kim, B. Considerations for evaluation and generalization in interpretable machine learning. Proc Explainable and Interpretable Models in Computer Vision and Machine Learning. , 3-17 (2018).
  97. Lage, I., et al. An evaluation of the human-interpretability of explanation. arXiv preprint. , (2019).
  98. Theunissen, M., Browning, J. Putting explainable AI in context: institutional explanations for medical AI. Ethics Inf Technol. 24 (2), 1-10 (2022).
  99. Hoffman, R. R., et al. Measures for explainable AI: explanation goodness, user satisfaction, mental models, curiosity, trust, and human-AI performance. Front Comput Sci. 5, 1096257(2023).
  100. Hedström, A., et al. Quantus: an explainable AI toolkit for responsible evaluation of neural network explanations and beyond. J Mach Learn Res. 24, 1-11 (2023).
  101. Mohseni, S., et al. A multidisciplinary survey and framework for design and evaluation of explainable AI systems. ACM Trans Interact Intell Syst. 11 (3-4), 1-45 (2021).
  102. Finzel, B., et al. Domain-specific evaluation of visual explanations for application-grounded facial expression recognition. Lect Notes Comput Sci. 14065, 31-44 (2023).
  103. Yeh, C. K., et al. On the (in)fidelity and sensitivity for explanations. Adv Neural Inf Process Syst. 32, 10967-10978 (2019).
  104. Better metrics for evaluating explainable artificial intelligence. Rosenfeld, A. Proc Int Conf Autonomous Agents Multiagent Syst, , 45-53 (2021).
  105. Evaluation metrics for XAI: a review, taxonomy, and practical applications. Kadir, M. A., et al. Proc IEEE Int Conf Intell Eng Syst, , 111-124 (2023).
  106. Sankaran, K. Data science principles for interpretable and explainable AI. J Data Sci. 22, 1-27 (2024).
  107. Alvarez-Melis, D., Jaakkola, T. S. On the robustness of interpretability methods. arXiv preprint. , (2018).
  108. Zhang, Y., et al. Saliency-Bench: a comprehensive benchmark for evaluating visual explanations. arXiv preprint. , (2025).
  109. Bergmann, P., et al. The MVTec anomaly detection dataset: a comprehensive real-world dataset for unsupervised anomaly detection. Int J Comput Vis. 129 (4), 1038-1059 (2021).
  110. Tang, S., et al. Online PCB defect detector on a new PCB defect dataset. arXiv preprint. , (2019).
  111. CheXpert: a large chest radiograph dataset with uncertainty labels and expert comparison. Irvin, J., et al. Proc AAAI Conf Artif Intell, 33, 590-597 (2019).
  112. ImageNet: a large-scale hierarchical image database. Deng, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 248-255 (2009).
  113. Selvaraju, R. R., et al. Grad-CAM: visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 128 (2), 336-359 (2020).
  114. Black-box explanation of object detectors via saliency maps. Petsiuk, V., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 11438-11447 (2020).
  115. Attention is not explanation. Jain, S., Wallace, B. C. Proc Conf North Am Chapter Assoc Comput Linguist, , 3543-3556 (2019).
  116. Transformer interpretability beyond attention visualization. Chefer, H., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 782-791 (2021).
  117. Wachter, S., et al. Counterfactual explanations without opening the black box: automated decisions and the GDPR. SSRN Electron J. , (2017).
  118. Deep learning for case-based reasoning through prototypes: a neural network that explains its predictions. Li, O., et al. Proc AAAI Conf Artif Intell, 32, 3530-3537 (2018).
  119. Counterfactuals in explainable artificial intelligence (XAI): evidence from human reasoning. Byrne, R. M. J. Proc Int Joint Conf Artif Intell, , 6276-6282 (2019).
  120. Ihongbe, I. E., et al. Evaluating explainable artificial intelligence (XAI) techniques in chest radiology imaging through a human-centered lens. PLoS One. 19 (10), e0308758(2024).
  121. Dörrich, M., et al. Explainable convolutional neural networks for assessing head and neck cancer histopathology. Diagn Pathol. 18 (1), 121(2023).
  122. Nguyen, H. Q., et al. VinDr-CXR: an open dataset of chest X-rays with radiologist's annotations. Sci Data. 9, 429(2022).
  123. Lee, D. J., et al. A systematic literature review on artificial intelligence and explainable artificial intelligence for visual quality assurance in manufacturing. Electronics. 12 (22), 4572(2023).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

مقالات ذات صلة