מאמר סקירה

בינה מלאכותית ניתנת להסבר לבדיקה חזותית: ניתוח וסקירה השוואתית

DOI:

10.3791/69440

10 באוקטובר 2025

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סקירה זו מסנתזת שיטות AI (XAI) הניתנות להסבר לבדיקה חזותית בתחומים תעשייתיים ורפואה. חיפוש מונחה PRISMA זיהה 75 מחקרים, המספקים טקסונומיה ספציפית לתחום וניתוח השוואתי באמצעות מדדים סטנדרטיים. אנו תורמים טקסונומיה מגובה ראיות וזרימת עבודה מוכוונת מתרגל לבחירת כלים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

טכניקות בינה מלאכותית הניתנות להסבר (XAI) מאפשרות שקיפות ואמון במערכות בדיקה חזותית אוטומטיות על ידי הפיכת מודלים של למידת מכונה של קופסה שחורה למובנים. בעוד ש-XAI יושם באופן נרחב, סקירות קודמות לא התייחסו לדרישות הספציפיות של משימות בדיקה תעשייתיות ורפואיות. מאמר זה סוקר מחקרים המיישמים טכניקות XAI לבדיקה חזותית בתחומים תעשייתיים ורפואיים. חיפוש שיטתי נערך ב-IEEE Xplore, Scopus, PubMed, arXiv ו-Web of Science עבור מחקרים שפורסמו בין 2014 ל-2025, עם קריטריונים להכללה המחייבים יישום XAI במשימות בדיקה באמצעות מערכי נתונים ציבוריים או ספציפיים לתחום. מתוך מאגר ראשוני של מחקרים, 75 נכללו וסווגו לפוסט-הוק ופנימי, אשר הוערכו לאחר מכן ביחס לנאמנות, חוסן, מורכבות ודיוק לוקליזציה. התוצאות מראות ששיטות מבוססות שיפוע והתפשטות מציעות הסברים חזותיים יעילים המתאימים לבדיקה כמעט בזמן אמת, אם כי עם לוקליזציה גסה, בעוד ששיטות מבוססות הפרעות ומודל חלופי מספקות ייחוסים מפורטים יותר בעלות חישובית גבוהה יותר אך עם חוסן מופחת. בנוסף, רשתות מבוססות אב-טיפוס וארכיטקטורות תשומת לב עצמית ממחישות פשרות בין יכולת פרשנות לביצועים חזויים. בחירת שיטת ה-XAI היעילה ביותר אינה מידה אחת שמתאימה לכולם; זה תלוי בצרכי מערך הנתונים, ההשהיה והפרשנות. סקירה זו מציגה טקסונומיה מאוחדת של שיטות XAI לבדיקה חזותית, משווה גישות שונות בתחומים תעשייתיים ורפואיים באמצעות מדדים סטנדרטיים, ומציעה זרימת עבודה מבוססת משימות כדי להנחות את העוסקים בבחירת השיטה האופטימלית. בהשוואה לסקירות קודמות, עבודה זו מציעה ניתוח השוואתי חוצה תחומים המבוסס על אמות מידה כמותיות ומתווה כיוונים להערכה סטנדרטית ואימות ממוקד משתמש.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

חיוני לתעשיות כמו ייצור, רכב, אריזות מזון, תרופות ובריאות לוודא שמוצרים ומערכות פועלים בצורה נאותה ובטוחה. כלי אוטומציה ולמידת מכונה, החורגים מבדיקה ויזואלית מסורתית המבוצעת על ידי מפעילים אנושיים או מערכות מבוססות מצלמה בסיסיות, משפרים את הדיוק, מהירות הייצור והעקביות1. בדיקת בינה מלאכותית מאפשרת ניטור בזמן אמת2 וזיהוי פגמים בסביבות בעלות תפוקה גבוהה3, מה שמפחית טעויות אנוש ועלויות תפעול4. השימוש בבינה מלאכותית, במיוחד עם ההתקדמות בלמידת מכונה (ML) ולמידה עמוקה (DL), איפשר מערכות אוטונומיות המזהות פגמים5, מסווגות אובייקטים ומזהות דפוסים חזותיים מורכבים6. לאחרונה, רשתות עצביות קונבולוציוניות (CNNs)7, רשתות חוזרות ושנאי ראייה (ViTs) עלו על מערכות מבוססות כללים במשימות המשתרעות על זיהוי פגמים על פני השטח ועד ללוקליזציה של אנומליה בהדמיה רפואית. הפיקוח עבר מתהליכים מבוססי כללים למודלים מונעי נתונים שהוכשרו על מערכי נתונים גדולים8.

מודלים רבים של בינה מלאכותית מתפקדים כ"קופסאות שחורות", כלומר אין תובנה לגבי האופן שבו מודלים אלה מקבלים החלטות. חוסר שקיפות זה טומן בחובו סיכונים. לדוגמה, בייצור, תחזיות שגויות עלולות להוביל לבזבוז מוגבר, עיבוד מחדש, החזרות מוצרים וחוסר שביעות רצון של לקוחות. בהדמיה רפואית, סיווגים שגויים הם קריטיים יותר מכיוון שהם עלולים לעכב אבחונים או לפגוע בתוכניות הטיפול. אפילו מפתחי המודלים הללו לרוב אינם יכולים להסביר באופן מלא את התפוקות שלהם, מה שמגביל את האמון והאימוץ.

זה המקום שבו בינה מלאכותית ניתנת להסבר (XAI) הופכת להיות חיונית. XAI היא קבוצה של שיטות וכלים שמטרתם להפוך החלטות מודל למידת מכונה לניתנות לפירוש על ידי בני אדם9. מטרתו היא להפוך את מנבאי הקופסה השחורה למערכות "קופסאות זכוכית" שקופות על ידי מתן הצדקות קריאות לבני אדם לתפוקות שלהם. בפועל, מערכת בדיקה התומכת ב-XAI תעבור מעבר לזיהוי פגמים בכך שלא רק תסמן חלק כפגום אלא גם תסביר מדוע הוא סומן.

למרות הספרות ההולכת וגדלה, הסקרים הקיימים על XAI בראייה ממוחשבת נותרו מוגבלים בהיקפם. רבים מתרכזים בצמצום בהדמיה רפואית או בבדיקה תעשייתית, ומציעים טקסונומיות שימושיות אך מסתמכים בעיקר על השוואות איכותיות ללא אמות מידה סטנדרטיות. סקירות רחבות יותר, כגון Nauta et al.10, מספקות סקירות אגנוסטיות אך אינן מציעות מסגרות בחירה מוכוונות מתרגלים. אפילו סקר הראייה הממוחשבת המקיף ביותר עד כה על ידי Cheng et al.11 מקדם את הטקסונומיה ודן במדדים כמו נאמנות ודיוק לוקליזציה, אך הוא נשאר כללי בכל משימות הראייה ואינו מתייחס באופן ספציפי לבדיקה חזותית, פריסה בתפוקה גבוהה או אימות אנושי בלולאה. באופן דומה, סקירות תעשייתיות של XAI עבור פרוגנוסטיקה וניהול נכסים מאמצות מסגרת PRISMA אך מתמקדות בפרוגנוסטיקה וניהול בריאות (PHM) ולא במשימות בדיקה חזותית.

כדי להתמודד עם פערים אלה, סקירה זו תורמת את הדברים הבאים:

טקסונומיה שיטתית: סקירה מונחית PRISMA של 75 מחקרים בבדיקות חזותיות תעשייתיות ורפואיות כאחד.

ניתוח השוואתי: השוואת ביצועים של שיטות XAI מרובות (GradCAM, LRP, SHAP, LIME ו-RISE) על מערכי נתונים של בדיקה חזותית ציבורית (למשל, MVTec AD, PCB) עם מדדים סטנדרטיים כולל מחיקה/הכנסה AUC, דיוק משחק הצבעה , יציבות וחביון.

מסגרת מדדי הערכה: הגדרות ומשוואות פורמליות לנאמנות, חוסן, פרשנות ומדדים ספציפיים למשימה המשמשים להערכת שיטות XAI.

הדרכה מעשית: מקרי בוחן וזרימת עבודה מוכוונת בחירה מוכוונת מתרגל המקשרת בין סוג המשימה, ההשהיה וצרכי ההסבר לשיטות ספציפיות.

יחד, תרומות אלה מבססות את הסינתזה הספציפית ביותר לתחום ומבוססת אמת מידה של XAI לבדיקה חזותית, המכוונת הן לחוקרים והן לעוסקים במקצוע המחפשים הדרכה אמינה.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

סקירה ופרספקטיבה

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

2. מסגרת XAI

רוב מודלי הבינה המלאכותית המתקדמים - במיוחד רשתות עצביות עמוקות - מטופלים לעתים קרובות כקופסאות שחורות; יש מעט נראות לגבי האופן שבו הם מקבלים החלטות12. חוסר השקיפות הזה הוא מחסום לאמון ויכולת הסבר ביישומים מגוונים. כתוצאה מכך, XAI הפך לחלק הכרחי מבינה מלאכותית אמינה. אין גישה אחת שמתאימה לכל התרחישים: שיטות מסוימות מניחות גישה מלאה לפנימיות המודל, בעוד שאחרות מתייחסות למודל כאל קופסה שחורה בלתי ניתנת לשינוי; חלקם נותנים עדיפות להסברים מקומיים לתחזיות בודדות, בעוד שאחרים מספקים תובנה גלובלית לגבי התנהגות המודל. כפי שמתואר באיור 1, שיקולים אלה הובילו לשתי קטגוריות רחבות של טכניקות XAI המבוססות על מועד הצגת יכולת ההסבר: שיטות הסבר פוסט-הוק ושיטות פרשנות מהותיות13. שיטות פוסט הוק מסווגות עוד יותר למודל אגנוסטי וספציפי למודל14.

figure-protocol-1
איור 1: מסגרת XAI עבור בדיקה חזותית. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

  1. Post-hoc explanation methods
    שיטות פוסט-הוק מייצרות הסברים לאחר אימון המודל, מבלי לשנות את הארכיטקטורה או הפרמטרים שלו15. גישות אלו פופולריות מכיוון שהן מאפשרות למתרגלים לנצל מודלים בעלי ביצועים גבוהים ולאחר מכן להסביר בדיעבד את התפוקות שלהם16. עם זאת, מכיוון שהמודל הבסיסי נותר ללא שינוי, הסברים פוסט-הוק חייבים להעריך או להסיק את ההיגיון של המודל, מה שעלול להציג שגיאת קירוב וחוסר יציבות17. בסעיפים הבאים מוסברות שיטות ספציפיות למודל ואגנוסטיות.
    1. ספציפי לדגם
      שיטות אלו מנצלות ידע על מבנה המודל או מנגנון האימון כדי לספק הסברים המותאמים למודל זה. דוגמה מצוינת היא ייחוס מבוסס שיפוע לרשתות עצביות עמוקות. שיטות כמו GradCAM (מיפוי הפעלת מחלקה משוקלל שיפוע) משתמשות בשיפועים הפנימיים של CNNs מאומנים כדי לייצר "מפות חום" חזותיות המדגישות את האזורים של תמונת קלט החשובים ביותר לחיזוי נתון17. GradCAM מחשב את השיפוע של ציון מחלקת היעד ביחס למפות תכונות בשכבה הקונבולוציונית הסופית ומקרין את השיפועים הללו על התמונה, ומניב מפת לוקליזציה מבחינה מעמדית. שיטות התפשטות שיפוע אחרות מכלילות לארכיטקטורות רשת שונות. שיפועים משולבים (IG)18 צוברים שיפועים לאורך הנתיב מקלט בסיסי (למשל, תמונה ריקה) לקלט בפועל, ועונה על אקסיומות רצויות לייחוס תכונות. DeepLIFT19 מפיץ באופן דומה הבדלים מהפעלת ייחוס דרך כל שכבה כדי להעריך את התרומה של כל תכונת קלט. התפשטות רלוונטיות לפי שכבה (LRP) מפיצה לאחור ניקוד חיזוי שכבה אחר שכבה, ומפיצה "רלוונטיות" לכל פיקסל קלט או תכונה20. לסיכום, שיטות ספציפיות למודל מנצלות שיפועים פנימיים, הפעלות או תשומת לב כדי לייצר הסברים המחוברים היטב למבנה המודל.
    2. מודל-אגנוסטי
      לעומת זאת, שיטות אגנוסטיות למודל מתייחסות למודל כקופסה שחורה שניתן לבצע שאילתות עבור פלטים. טכניקות אלה מניחות הנחות מינימליות, בדרך כלל דורשות רק שניתן לקבל את חיזוי המודל עבור תשומות מופרעות. דוגמאות כוללות LIME (Local Interpretable Model-Agnostic Explanations), המשתמש במודל פשוט וניתן לפירוש (כגון מודל ליניארי דליל או עץ החלטות) כדי לחקות את התנהגות המודל המורכב בקרבת קלט נתון21. עבור חיזוי ספציפי, LIME מייצר גרסאות מופרעות רבות של הקלט, מקבל את התחזיות של מודל הקופסה השחורה עבור כל אחת מהן, ולאחר מכן לומד רגרסיה ליניארית משוקללת שמקרבת את יחסי הקלט-פלט המקומיים22. המקדמים של מודל ליניארי חלופי זה משמשים כהסבר, המציינים אילו תכונות מניעות את החיזוי23. המשיכה של LIME טמונה בגמישות שלה (הניתנת לשימוש עם כל מסווג) והפלט האינטואיטיבי שלה (למשל, קבוצה קטנה של תכונות משוקללות). SHapley Additive exPlanations (SHAP) היא שיטה פופולרית נוספת המבוססת על תורת המשחקים24. SHAP מסביר חיזוי אינדיבידואלי על ידי חישוב ייחוסי תכונות המקרבים את ערכי שפלי מתורת המשחקים השיתופית, ומבטיחים תכונות כמו תוספות ועקביות25. מעבר לייחוס תכונות, גישות אגנוסטיות למודלים כוללות גם שיטות הפרעה חזותית עבור מודלים של תמונה. RISE (דגימת קלט אקראית להסבר) מייצרת מפות חשיבות על ידי מיסוך אקראי של חלקים מתמונת הקלט והתבוננות כיצד פלט המודל משתנה26. על ידי דגימה של מסכות רבות כאלה, RISE בונה מפת בולטות הסתברותית המציינת אילו פיקסלים או אזורים היו המשפיעים ביותר על התחזית26. יש לציין כי RISE אינו דורש גישה לפנימיות המודל ודורש רק את היכולת להעריך את המודל על תשומות ששונו, מה שהופך אותו לקופסה שחורה באמת. לבסוף, תחום הולך וגדל של XAI אגנוסטי למודלים מתמקד בהסברים נגדיים. הסבר נגדי אינו מונה את חשיבות התכונה אלא עונה על השאלה: "איזה שינוי מינימלי בקלט היה משנה את חיזוי המודל?" 27. אלגוריתמים ליצירת עובדות נגדיות מבצעים בדרך כלל חיפוש במרחב קלט (או במרחב סמוי נלמד) אחר הדוגמה הקרובה ביותר שמניבה את הפלט הרצוי, תוך אכיפת ריאליזם ודלילות בשינויים. לסיכום, שיטות XAI פוסט-הוק מאומצות באופן נרחב מכיוון שניתן ליישם אותן על מודלים בעלי ביצועים גבוהים לאחר אימון, המשלבות כוח ניבוי עם מידה של שקיפות.
  2. שיטות פרשנות מהותיות
    שיטות מהותיות נוקטות בגישה שונה מהותית: במקום להסביר קופסה שחורה לאחר מעשה, שיטות אלה הופכות את המודל לניתן לפירוש על ידי תכנון. רשתות עצביות מסבירות את עצמן (SENN) הן דוגמה בולטת. במסגרת SENN שהוצעה על ידי אלוורז-מליס וג'אקולה28, הרשת העצבית בנויה לחשב תחילה קבוצה של הפעלות מושגי ביניים ולאחר מכן ליצור חיזוי כפונקציה פשוטה וניתנת להסבר של מושגים אלה. ProtoPNet (רשת חלקים אב-טיפוסית) היא רשת עמוקה המסווגת קלטים על ידי השוואתם לקבוצה של ייצוגי אב-טיפוס נלמדים של כל מחלקה. לדוגמה, במשימת סיווג תמונה, ProtoPNet עשוי ללמוד תיקוני אב-טיפוס ולקבל החלטות על ידי מציאת אבות הטיפוס המופעלים ביותר על ידי קלט29. בתחום של מודלים רצפים ושנאים, מנגנוני קשב מונפו גם לפרשנות מהותית. מודלים מסוימים מאומנים עם יעד יישור קשב, המעודד את משקלי הקשב של המודל להתאים לתכונות חשובות ידועות או לאזורים רלוונטיים המסומנים על ידי בני אדם. על ידי הנחיית תשומת הלב להיות "נכונה מהסיבות הנכונות"30, גישות אלה מייצרות מודלים שלא רק מתפקדים היטב אלא גם בעלי התפלגות קשב שניתן לפרש ישירות כהסברים. יתר על כן, מודלים כאלה מספקים הסברים שבדרך כלל נאמנים לבנייה, מכיוון שההסבר נוצר מהמבנה הניתן לפירוש של המודל עצמו, ולא מקירוב פוסט-הוק חיצוני31.

3. טקסונומיה XAI

כדי לספק סינתזה מובנית של מצב המחקר, נערכה סקירת ספרות שיטתית תוך שימוש בהנחיות PRISMA (איור 2). התהליך כלל מספר מאגרי מידע אקדמיים (Scopus, Web of Science, IEEE Xplore, SpringerLink, PubMed, arXiv ו-MDPI) והונחה על ידי קבוצה של מונחי חיפוש המשלבים "בינה מלאכותית ניתנת להסבר", "פרשנות", "בדיקה חזותית", "זיהוי פגמים", "זיהוי חריגות", "ייצור" ו "הדמיה רפואית". קריטריוני ההכללה דרשו שהמאמרים יישמו או העריכו במפורש שיטות XAI בהקשרי בדיקה חזותית (תעשייתיים או רפואיים) ודיווחו על פירוט מתודולוגי מספיק. קריטריונים להחרגה הסירו הצעות תיאורטיות בלבד ללא יישום, כמו גם עבודות מחוץ לבדיקה חזותית. החיפוש שלף בתחילה 483 רשומות. לאחר הסרת כפילויות והקרנת כותרות ותקצירים נותרו 147 לבדיקת טקסט מלא. יישום קריטריוני הכללה/אי הכללה הניב 75 מחקרים ראשוניים, המהווים את הבסיס לסקירה זו.

figure-protocol-2
איור 2: דיאגרמת זרימת PRISMA של תהליך הסקירה השיטתית בהתאם להנחיות PRISMA. האיור ממחיש רשומות שזוהו, נבדקו והוצאו בכל שלב, והניב 75 מחקרים ראשוניים שנכללו בסקירה הסופית. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

  1. טקסונומיה יישומית של מחקרים שנסקרו
    בהתבסס על המסגרת המושגית שהוצגה בסעיף 2 (גישות פוסט-הוק ופנימיות), חידדנו טקסונומיה ספציפית לתחום הנגזרת מ-75 המחקרים הללו. טקסונומיה יישומית זו מבדילה שיטות על פי יישומן במשימות בדיקה חזותית כפי שמוצג באיור 3.
  2. התפלגות המחקרים על פני טקסונומיה
    ההתפלגות המלאה של 75 המחקרים מסוכמת בטבלה 1. כל מחקר ממופה לקטגוריה המתודולוגית ולתחום היישום שלו. זה מספק בסיס אמפירי לניתוח ההשוואתי המוצג בסעיף 4.
  3. סינתזה
    מספר מגמות ברורות עולות מסקירה שיטתית זו. ראשית, שיטות פוסט-הוק מבוססות שיפוע נותרו המאומצות ביותר במשימות פיקוח תעשייתי ורפואי בשל יעילותן וקלות האינטגרציה שלהן. שנית, שיטות מבוססות הפרעות מספקות ייחוסי תכונות עשירים יותר אך פחות נפוצות במסגרות תעשייתיות בעלות תפוקה גבוהה עקב דרישות חישוביות. שלישית, שיטות מהותיות צוברות אחיזה אך עדיין לא מיוצגות, כאשר פחות מ-15% מהמחקרים מיישמים אותן.
    על ידי עיגון טקסונומיה זו בסקירה מונחית PRISMA הניתנת לשחזור וקישורו למסד נתונים מובנה של 75 מחקרים, סעיף זה מבסס בסיס ראיות מאומת. ממצאים אלה מכינים את הקרקע לניתוח ההשוואתי בסעיף 4, שבו שיטות מייצגות נמדדות על פני מדדים סטנדרטיים (נאמנות, חוסן, חביון ודיוק לוקליזציה).

figure-protocol-3
איור 3: טקסונומיה מוצעת של שיטות XAI במשימות בדיקה חזותית. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

שיטת XAIגישת XAIמחקרתעשייהשנה
הפנימיתמודלים מבוססי חוקים וליניאריים32,33רפואה כללי2015–2019
מבוסס אב-טיפוס (ProtoPNet, מבוסס מקרה, ניתן לעיוות) 29,34,35,36 רפואי, תעשייתי, כללי2018–2024
מונחה-קונספט (צוואר בקבוק של מושגים, סיבות נכונות לזכות)30,31,37כללי, יישומים מדעיים2020–2021
רשתות עצביות מסבירות את עצמן (SENN)28כללי2018–2020
ייצוג לא שזור (β-VAE),SOXAI38,39כללי2018
שנאי ראייה (פרשנות פנימית באמצעות קשב) 40,41,42,43,44,45 ראייה ממוחשבת, ייצור2020–2024
פוסט-הוק, ספציפי לדגםמשפחת CAM 46,47,48,49,50,51,52, 53,54,55,56,57,58 הדמיה רפואית, ייצור, רכב, חקלאות, אלקטרוניקה2018–2025
LRP (התפשטות רלוונטיות לפי שכבה) 20,59,60,61,62 כללי, הדמיה רפואית2015–2024
שיטות שיפוע ובולטות (שיפועים משולבים, IG DeepLIFT חלק, DeconvNet, T-Explainer, מדדי בולטות) 18,19,63,64,65,
66,67,68,69,70
כללי, הדמיה רפואית2013–2025
ייחוס במודלים מיוחדים (SNNs, ייחוס קשב רובוטריקים) 71,72,73 מדעי המוח, שנאי ראייה2023–2025
פוסט-הוק, מודל-אגנוסטיLIME & Variants (LIME, ELIME, MASALA), SHAP & Variants (Tree SHAP),פיננסים, תחזיות וניהול בריאות, אבטחת סייבר, רכבים אוטונומיים, פיקוח תעשייתי.2016–2025
עובדות נגדיות 21,22,23,24,25,27,74,
75,76,77,78,79,80,81,
82,83,84,85,86
הסברים
שיטות היברידיותאינטגרציה של מספר שיטות XAI כולל (GradCAM, SHAP, LRP, LIME) 58,87,88,89,90,91,92 פיקוח תעשייתי, בריאות, ייצור.2021–2025

טבלה 1: סיווג של 75 מחקרים שנסקרו לפי שיטת XAI, שנה, תעשייה וגישה.

4. מדדי הערכה עבור XAI

הביצועים של מודל ראייה ממוחשבת נשפטים על ידי מדדים מבוססים היטב כגון דיוק, דיוק וזיכרון. עם זאת, הערכת יכולת ההסבר של החלטות המודל היא הרבה פחות פשוטה. בניגוד לביצועי חיזוי סטנדרטיים, אין מדד מקובל אוניברסלי לאיכות הסברי הבינה המלאכותית66. במילים אחרות, בעוד שניתן למדוד במדויק את הדיוק של מסווג, אין סולם מוסכם לכמת עד כמה הסבר "טוב" לסיווג תמונה נתון93. פער זה מדגיש פער מהותי בתחום XAI: כיצד להעריך הסבר.

פיתוח קריטריונים סטנדרטיים להערכת XAI הוכח כמאתגר במיוחד. סיבה אחת היא שיכולת הפרשנות ואיכות ההסבר הן רב-פנים ותלויות הקשר ולכן מתנגדות למדד אוניברסלייחיד 10. הערכת הסבר מסתמכת למעשה על מספר גורמים, כולל תחום היישום, אופי ההסבר המופק והרקע של משתמש הקצה. לדוגמה, טכניקת הסבר המתאימה לאבחון תמונה רפואית עשויה להיות מוערכת באופן שונה מזו המשמשת במשימת בדיקה חזותית תעשייתית10.

בפועל, היעדר מדדים סטנדרטיים הוביל את החוקרים להסתמך על מגוון גישות הערכה. מחקרים רבים עדיין פונים להערכה איכותית ואנקדוטלית של שיטות XAI 94,95. מקובל לראות מחברים מציגים כמה מפות בולטות או מפות חום וטוענים שהן נראות סבירות (מה שמכונה מבחן "תוקף הפנים")96. בחינה חזותית כזו יכולה להיות משכנעת במובן הנרטיבי, אך היא נותרת סובייקטיבית ואינה מספיקה להשוואה קפדנית97. זה ממחיש את הקושי בסטנדרטיזציה של מדדי XAI; בהיעדר קריטריונים מוסכמים, החוקרים מציעים מדדים המותאמים לכל מערך נתונים או מקרה שימוש.

כתוצאה מכך, הספרות שופעת כעת במדדי הערכת XAI מגוונים שנועדו למלא את הפער הזה98. מסגרות ואמצעים רבים הוצעו, שכל אחד מהם מכוון להיבט מסוים של מה שהופך את ההסבר לשימושי99. באופן כללי, ניתן לסווג מדדים על סמך המיקוד העיקרי שלהם. מדדים מבוססי נאמנות שופטים הסבר לפי עד כמה הוא משקף את תהליך ההחלטה של מודל100. לעומת זאת, מדדים ממוקדי פרשנות מעריכים עד כמה ההסבר מובן ומשכנע לצופה אנושי101. קטגוריה שלישית היא מדדים מבוססי משימות, כאשר הערכת ההסבר תלויה בהשפעתו על ביצועי משתמש הקצה102. קטגוריה רביעית היא מדדים מוכווני חוסן המעריכים את עקביות התוצאות103. לבסוף, מדדים היברידיים משלבים ממדים מרובים104.

מגוון מדדים זה מצביע על היבטי ההסבר שהחוקרים מחשיבים כחשובים, אך גם מדגיש את היעדר תקן אחד: כל מדד לוכד רק זווית אחת של איכות ההסבר105. בהמשך, מגוון מדדי הערכה עבור XAI מקובצים לארבע קטגוריות עיקריות ומסוכמים בטבלה 2.

סוג מטרימטרינוסחה / הגדרה
נאמנותשטח מחיקה מתחת לעקומה (AUC)26figure-protocol-4
הם תכונות חשובות למעלה ; נמוך = נאמן יותר
אזור הכנסה מתחת לעקומה (AUC)26figure-protocol-5
גבוה יותר = נאמן יותר
ציון בגידה: 103figure-protocol-6
נמוך יותר = טוב יותר
שאגה106הדיוק יורד לאחר אימון מחדש ללא תכונות 'חשובות'
חוסןמדד יציבות107figure-protocol-7
גבוה יותר = עקבי יותר
ליפשיץ ציון103figure-protocol-8
נמוך = חזק יותר
פרשנותסדירות79figure-protocol-9
נמוך = פשוט יותר
עומק פונדקאית79עומק הפונדקאית הניתנת לפירוש (למשל, עץ החלטות);
רדוד יותר = פשוט יותר
ספציפי למשימההצטלבות-על-איחוד (IoU)108figure-protocol-10
חפיפה של מסכה M ואמת קרקעית G
משחק הצבעה108דיוק = #hits / #samples
גבוה יותר = טוב יותר
היברידיתציון משולב104שילוב משוקלל של נאמנות, דלילות וחוסן

טבלה 2: מדדי הערכה עבור XAI בבדיקה חזותית מקובצים לארבע קטגוריות עיקריות.

5. ניתוח השוואתי

בחלק זה, השיטות מושווים על פני מערכי נתונים ציבוריים כגון MVTec AD109 (>5,000 תמונות פגמים עם מסכות ברמת הפיקסלים) ו-DeepPCB110 (1,500 תמונות PCB עם שש מחלקות פגמים), CheXpert111 ו-ImageNet112 ומוערכות על פני המדדים הבאים: מחיקה/הכנסה AUC (נאמנות), דיוק משחק הצבעה (לוקליזציה), ציוני יציבות (חוסן תחת הפרעות) וחביון (עלות זמן ריצה).

עבור שיטות מבוססות CAM (GradCAM, GradCAM++) תוצאות ב-MVTec AD ו-DeepPCB מראות ש-GradCAM משיג נאמנות של 0.83-0.87 (הכנסה AUC ~0.68; <ירידת דיוק של 15% תחת מחיקה), רגישות (0.80 - 0.85) וזמן ריצה <100 אלפיות השנייה (~39 פריימים לשנייה (FPS)). הלוקליזציה נשארת מתונה (ממוצע IoU ≈0.28 @ δ=0.25; דיוק הצבעה 86-87%). GradCAM++ משפר לוקליזציה של מופעים מרובים (ממוצע IoU = 0.38) תוך שמירה על השהיה דומה (<120 אלפיות השנייה) ואמון משתמשים גבוה יותר (109.69/250 לעומת 56.08/250 עבור GradCAM). שיטות אלה יעילות אך גסות מבחינה מרחבית 47,113.

עבור שיטות מבוססות הפרעות (LIME, SHAP, RISE), הביצועים משתנים בין מערכי נתונים. ב-MVTec AD, LIME מגיע לנאמנות מקומית R² = 0.70-0.80 אך מראה חוסן נמוך (מדד יציבות <0.5), חביון של 3-5 שניות לתמונה ולוקליזציה מתונה (IoU = 0.25-0.35). SHAP המיושם על סיווג פגמים ב-PCB משיג ייחוסים עקביים (Δ log-odds = 0.2-0.3) עם יישור אנושי חזק (70-80%) אך הוא איטי יותר (>1 שניות לתמונה) ובעל לוקליזציה חלשה (IoU ≈0.02-0.03). RISE, שנמדד על MS-COCO ושוכפל עבור MVTec AD, ממוצע של 4,000-8,000 מסירות קדימה מוסוות, המניב חוסן גבוה (יציבות >0.7), נאמנות (0.78-0.82 AUC) ולוקליזציה מעולה (משחק הצבעה = 62.9% לעומת 48.3% עבור GradCAM), אך בהשהיה של 1-2 שניות/הסבר 26,74,79,114.

עבור שיטות התפשטות רלוונטיות (LRP, DeepLIFT), הערכות על DeepPCB ו-CheXpert מצביעות על כך ש-LRP משיג נאמנות של 0.82-0.90, רגישות ~0.85 ו-IoU לוקליזציה של 0.40-0.50. זמן הריצה הוא 100-200 אלפיות השנייה לתמונה, איטי יותר מ-CAMs אך אפשרי לבדיקה כמעט בזמן אמת. במשימות רדיולוגיה של CheXpert, מחקרי מומחים מראים חפיפה של >70% בין מפות חום של LRP לאזורים רלוונטיים מבחינה קלינית, מה שמדגים יכולת פרשנות בין תחומים60.

עבור שיטות מבוססות קשב (רובוטריקים), תוצאות עבור מודלים של ViT שהוכשרו על ImageNet ו-CheXpert, מפות קשב גולמיות מניבות נאמנות של 0.75-0.85 אך אינן יציבות תחת הפרעות, עם רגישות של 0.70-0.75 ולוקליזציה צנועה (IoU = 0.30-0.45). אמון אנושי הוא ~60-70%. גישות מותאמות (זרימת קשב, Transformer-LRP) משפרות מדדים סיבתיים, ועולות על תשומת הלב הגולמית במחיקה/הוספה וציונים במשחקי הצבעה 40,115,116.

עבור שיטות מבוססות אב-טיפוס ועובדות נגדיות, הערכות n MVTec AD מדגישות כי ProtoPNet משיג הסברים מבוססי דוגמה כאשר התחזיות מוצדקות על ידי מקרי פגמים דומים, ומסייעים בקבלת החלטות של המפעיל. גישות מבוססות SOM מקבצות תכונות פגמים במפות דו-ממדיות, תוך שמירה על יחסים טופולוגיים. שיטות נגדיות, שנבדקו הן על תמונות פגמים ב-PCB והן על CheXpert, מספקות הנמקה מעשית ("אם אורך הסדק קטן מ-1 מ"מ, החיזוי עובר לנורמה") אך דורשות אופטימיזציה יקרה ונאבקות עם כניסות ברזולוציה גבוהה. שיטות אלה מתיישבות היטב עם ההיגיון האנושי אך בקנה מידה גרוע 117,118,119.

לבסוף, כאשר בוחנים פשרות ובחירה מעשית, CAMs שולטים בתהליכי עבודה קריטיים להשהיה אך נשארים גסים. LRP מאזן בין נאמנות לזמן ריצה, ומצטיין בניתוח ברמת הפיקסלים. RISE מספק את הנאמנות הסיבתית והלוקליזציה החזקות ביותר, אך בהשהיה ברמת שניות. SHAP ו-LIME משפרים את יכולת הפרשנות אך הם איטיים ולא יציבים. אבות טיפוס ועובדות נגדיות ממקסמים את היישור האנושי אך מתרחבים בצורה גרועה בבדיקה ברזולוציה גבוהה. מודלים מבוססי שנאים דורשים התאמות מיוחדות מעבר לתשומת לב גולמית. לפיכך, אין שיטה אחת שעולה באופן אוניברסלי על אחרות; במקום זאת, בחירת השיטה חייבת לשקף את צרכי מערך הנתונים, המשימה, ההשהיה, התקציב והפרשנות. כפי שמוצג באיור 4, זרימת העבודה של הבחירה משלבת שלושה מהמדדים הללו (משימה, חביון, פרשנות) במדריך מוכוון-משימה לבחירת שיטות XAI בבדיקה חזותית.

figure-protocol-11
איור 4: זרימת עבודה לבחירה עבור אימוץ שיטת XAI. זהו תרשים זרימה של החלטות המנחה את בחירת שיטות XAI המתאימות בבדיקה חזותית. זרימת העבודה לוקחת בחשבון את סוג המשימה (סיווג, פילוח, זיהוי חריגות, רגרסיה), אילוצי השהיה ופרטי הסבר, ומקשרת אותם לשיטות מייצגות. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

6. דיון

  1. ממצאים השוואתיים
    הניתוח שלנו מראה ששיטות מבוססות שיפוע כגון GradCAM ו-Layer-wise Relevance Propagation (LRP) מצטיינות בהדגשת אזורי התמונה הספציפיים המשפיעים ביותר על החלטות של רשת קונבולוציונית, מה שהופך אותם לכלים אינטואיטיביים למשימות כגון לוקליזציה של פגמים או סיווג תמונה רפואית. גישות אלה יעילות מכיוון שהן פועלות במעבר אחד לאחור, אך ההסברים שלהן לרוב גסים ועשויים להיות לא ברורים באזורים מורכבים. לעומת זאת, טכניקות ייחוס תכונות אגנוסטיות למודל, כגון SHAP ו-LIME, מספקות תובנות כמותיות יותר לגבי תרומות תכונות על ידי בדיקת המודל עם תשומות מופרעות או התאמת פונדקאיות מקומיות, אך בעלות חישובית גבוהה יותר מאשר GradCAM.
    שיטות מבוססות קשב ממנפות את המשקולות הפנימיות של המודל כדי להדגיש את אזורי המיקוד בתוך מודל115. RISE, לעומת זאת, מייצגת אסטרטגיה מבוססת אקראיות שמסווה ודוגמת קלטים כדי לייצר מפות בולטות גמישות, אם כי היא דורשת אלפי מסירות קדימה. יחד, טכניקות אלה מצטיינות בנסיבות ספציפיות, אך אף אחת מהן אינה עולה באופן אוניברסלי על האחרות26. במקום זאת, בחירת השיטה תלויה בארכיטקטורת המודל, במשימת הבדיקה החזותית, בדרישות ההשהיה ובסוג המידע הדרוש למקבלי ההחלטות.
  2. מקרי בוחן
    להלן מקרי בוחן מהעולם האמיתי המיישמים XAI הן במגזר הרפואי והן במגזר התעשייתי: בתחום הבריאות, מודלים לזיהוי דלקת ריאות ו-COVID-19 שהוכשרו בצילומי רנטגן בחזה וסריקות CT הוסברו עם GradCAM ו-LIME, ורדיולוגים במחקרי משתמשים העדיפו באופן עקבי את GradCAM מכיוון שהאזורים המודגשים שלו תואמים לפתולוגיה הצפויה כגון חדירת ריאות120. באופן דומה, בפתולוגיה דיגיטלית לסרטן ראש וצוואר, תחזיות CNN הנתמכות על ידי GradCAM ו-CAM ברזולוציה גבוהה הדגישו אשכולות תאים ממאירים שהפתולוגים אישרו כרלוונטיים מבחינה קלינית, והראו כי ההסברים חיזקו הן את הדיוק הקליני והן את האמון121.
    בקו מגזר הייצור, XAI עשתה הבדל טרנספורמטיבי בדיוק וביכולת ההסבר. אחד היישומים העיקריים הוא זיהוי עצמים זרים בתמונות רנטגן של צמיגים המשתמשים ברשת עצבית קונבולוציונית המבוססת על ארכיטקטורת Xception. באמצעות הכללת מיפוי הפעלת מחלקה משוקלל שיפוע (GradCAM), המערכת השיגה דיוק סיווג של יותר מ-99% והפיקה מפות חום המציינות את האזורים המדויקים בתמונה האחראים לתחזיות. הסברים חזותיים אלה אפשרו למהנדסי QA לוודא שתשומת הלב של הדגם הייתה על חריגות לגיטימיות בתוך התמיכה המבנית של הצמיג ולא על חפצים לא רלוונטיים, מה ששיפר מאוד את האמון והקל על הפריסה בהגדרות ייצור בעלות סיכון גבוה48.
    בתעשיית האלקטרוניקה, גישת SolderNet מציגה את השילוב של XAI בבדיקת פגמים ברמת הפיקסלים. השיטה מבוססת CNN פותחה לבדיקת חיבורי הלחמה במעגלים מודפסים, משימה שבה דיוק גבוה ויכולת הסבר הם חובה. עם היישום של GradCAM ו-Layer-wise Relevance Propagation (LRP), השיטה חילצה מפות בולטות שהדגישו את הפיקסלים האחראים לסיווגי פגמים ספציפיים. באמצעות יכולת הסבר כזו, המפעיל הצליח להבדיל בין תוצאות חיוביות אמיתיות ושגויות ולהסיק תובנות לגבי מצבי כשל שבעבר היו יציאות קופסה שחורה39. מקרים אלה מראים ש-XAI מוערך כאשר ההסברים שלו עולים בקנה אחד עם ההיגיון של המומחים, אך לא נעשה בו שימוש כאשר ההסברים אינם יציבים, גסים או לא מעשיים מבחינה חישובית.
  3. מגבלות הראיות הנוכחיות
    למרות התקדמות זו, מספר מגבלות נותרו בעינן. ראשית, רוב המחקרים האמפיריים מסתמכים על מערכי נתונים ציבוריים כגון MVTec AD לבדיקה תעשייתית או VinDR-CXR122 להדמיה רפואית, שאולי אינם מייצגים באופן מלא סביבות בעולם האמיתי של מפעלים או בתי חולים. שנית, ההערכה נותרה מקוטעת: נאמנות, חוסן ופרשנות נמדדים באופן לא עקבי בין מחקרים, לעתים קרובות עם הגדרות אד-הוק וללא סף סטנדרטי. שלישית, יצירות רבות חסרות תוקף אנושי. בעוד שמדדים כגון AUC מחיקה, דיוק משחק הצבעה או לוקליזציה IoU מספקים תוצאות כמותיות, הם אינם מאשרים שהסברים אלה אכן משפרים את קבלת ההחלטות של המשתמשים. לבסוף, רק ~8% ממחקרי אבטחת איכות מבוססי בינה מלאכותית בייצור משלבים XAI בזרימת העבודה שלהם123. זה מדגיש את פער האימוץ המעשי, למרות שנתון זה משתנה לפי מגזר ומתודולוגיה וייתכן שאינו מדויק.
  4. השלכות מעשיות על העוסקים במקצוע
    עבור העוסקים בתחום, עולות מספר השלכות. שיטות מבוססות שיפוע נותרו הבחירה המעשית ביותר למשימות בדיקה בזמן אמת, מכיוון שהן מספקות הסברים עם חביון נמוך (~100 אלפיות השנייה לתמונה) וקלות לפריסה. לגישות מבוססות הפרעות, כגון SHAP או RISE, יש חביון גבוה יותר משיטות מבוססות שיפוע, אך הן מתאימות יותר לתחומים שבהם ייחוס עדין עולה על השהיה, כגון שירותי בריאות, שבהם הדיוק מקבל עדיפות על פני המהירות. גישות מבוססות קשב שימושיות בארכיטקטורות שנאים, אך הן דורשות פרשנות זהירה מכיוון שתשומת לב גולמית לא תמיד מספקת הסבר ברור. מעבר לפשרות טכניות, אימוץ מוצלח תלוי במידה רבה באינטגרציה, הדרכת משתמשים והדגמת הערך הקליני של יכולת הפרשנות. כפי שמראים מקרי המקרה, הסברים מקבלים ערך רק כאשר הם מתיישרים בבירור עם מומחיות בתחום ועוזרים למתרגלים לאמת או לאתגר תחזיות בינה מלאכותית.
  5. כיווני מחקר עתידיים
    מחקר עתידי צריך לתת עדיפות למספר כיוונים מעשיים:
    סטנדרטיזציה של פרוטוקולי הערכה: קבע הנחיות דיווח הניתנות לשחזור עבור מדדי מפתח, כולל AUC מחיקה/הכנסה, דיוק משחק הצבעה, מדדי יציבות והשהיה.
    מערכי נתונים של בנצ'מרק ספציפיים לתחום: פתח ערכות נתונים שנאספו לבדיקה חזותית תעשייתית ורפואית עם ביאורי אמת קרקעית כדי להפחית הסתמכות יתר על מערכי נתונים ציבוריים צרים.
    תיקוף ממוקד באדם: הרחב את המחקרים המודדים אם הסברי XAI משפרים את איכות ההחלטה, אמון המשתמשים ושיתוף הפעולה בין אדם לבינה מלאכותית מעבר למדדי Proxy
    ניתוח עלות-תועלת: בצע מחקרי פריסה קפדניים כדי לכמת את הערך העסקי והקליני של שילוב XAI בתהליכי עבודה של בדיקה חזותית.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

מסקנות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

סקירה זו בחנה 75 מחקרים של XAI בבדיקה חזותית, וכתוצאה מכך טקסונומיה של שיטות פוסט-הוק ומהותיות וניתוח השוואתי מונחה בנצ'מרק. הממצאים מאשרים כי אף שיטה אחת אינה עולה על אחרות: גישות מבוססות שיפוע כגון GradCAM ו-LRP יעילות ללוקליזציה של פגמים בזמן אמת, אך ההסברים שלהן יכולים להיות גסים באזורים מורכבים. שיטות מבוססות הפרעות כגון SHAP, LIME ו-RISE מספקות פרטים עדינים יותר ונאמנות חזקה אך לעתים קרובות נכשלות בפועל עקב חביון גבוה ועלות חישובית. שיטות מבוססות קשב ממנפות את הפנימיות של השנאי אך ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים כי אין ניגודי אינטרסים בנוגע לפרסום עבודה זו.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מצהירים כי עבודה זו לא קיבלה מענק ספציפי מכל סוכנות מימון במגזר הציבורי, המסחרי או ללא מטרות רווח.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Alzarooni, A., et al. Anomaly detection for industrial applications, its challenges, solutions, and future directions: a review. IEEE Sens J. XX. (1), 1(2025).
  2. Hardan, F., Almusawi, A. R. J. Developing an automated vision system for maintaing social distancing to cure the pandemic. Al-Khwarizmi Eng J. 18 (1), 38-50 (2022).
  3. Terasaki, N., Fujio, Y. Mechanoluminescent visualization of crack propagation for joint evaluation. J Vis Exp. (191), e64118(2023).
  4. Al-Hamadani, S., Al-Darraji, I. Warehouse in Industry 4.0 based drone, computer vision, and artificial intelligence technologies: a literature review. Proc Eng Sci. 7 (1), 517-526 (2025).
  5. Al-Jubori, H. N., Izzat, A. D., Jerbi, H. Defect detection using thermography camera techniques: a review. Al-Khwarizmi Eng J. 20 (4), 70-88 (2024).
  6. Al-Hamadani, S., Al-Darraji, I., Jerbi, H. Improving barcode vision scanning process using a drone-based tracking PID controller for warehouse in Industry 4.0. Al-Khwarizmi Eng J. 21 (2), 72-92 (2025).
  7. Al-Jubori, H. N., Al-Darraji, I. Tools and process of defect detection in automated manufacturing systems. EAI Endorsed Trans Scalable Inf Syst. 10 (6), e4000(2023).
  8. Alaa, T., et al. Automated detection of defects on metal surfaces using vision transformers. , Published online October 6, 2024. Accessed August 1 (2025).
  9. Moosavi, S., et al. Explainable AI in manufacturing and industrial cyber-physical systems: a survey. Electronics. 13 (17), 3497(2024).
  10. Nauta, M., et al. From anecdotal evidence to quantitative evaluation methods: a systematic review on evaluating explainable AI. ACM Comput Surv. 55 (13), 1-42 (2023).
  11. Cheng, Z., et al. A comprehensive review of explainable artificial intelligence (XAI) in computer vision. Sensors. 25 (13), 4166(2025).
  12. Barredo Arrieta, A., et al. Explainable artificial intelligence (XAI): concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 58, 82-115 (2020).
  13. Kouchaki, S., et al. Survey of explainable AI techniques in healthcare. Sensors. 23 (2), 634(2023).
  14. Laugel, T., et al. The dangers of post-hoc interpretability: unjustified counterfactual explanations. Proc Int Joint Conf Artif Intell. , 2801-2807 (2019).
  15. Slack, D., et al. Reliable post hoc explanations: modeling uncertainty in explainability. Adv Neural Inf Process Syst. 33, 9391-9404 (2020).
  16. Cesarini, M., et al. Explainable AI for text classification: lessons from a comprehensive evaluation of post hoc methods. Cognit Comput. 16 (6), 3077-3095 (2024).
  17. Mohamed Musthafa, M., et al. Enhancing brain tumor detection in MRI images through explainable AI using Grad-CAM with ResNet-50. BMC Med Imaging. 24 (1), 1-19 (2024).
  18. Sundararajan, M., Taly, A., Yan, Q. Axiomatic attribution for deep networks. Proc Int Conf Mach Learn. 70, 5109-5118 (2017).
  19. Shrikumar, A., Greenside, P., Kundaje, A. Learning important features through propagating activation differences. Proc Int Conf Mach Learn. 70, 4844-4866 (2017).
  20. Bassi, P. R. A. S., et al. Improving deep neural network generalization and robustness to background bias via layer-wise relevance propagation optimization. Nat Commun. 15, 44371(2024).
  21. Knab, P., et al. Which LIME should I trust? Concepts, challenges, and solutions. arXiv preprint. , (2025).
  22. Garreau, D., von Luxburg, U. Explaining the explainer: a first theoretical analysis of LIME. Proc Mach Learn Res. 108, 1287-1296 (2020).
  23. Qian, J., et al. ELIME: exact local interpretable model-agnostic explanation. Eur J Artif Intell. , (2024).
  24. Salih, A. M., et al. A perspective on explainable artificial intelligence methods:SHAP and LIME . Adv Intell Syst. , (2024).
  25. Hermosilla, P., et al. Explainable AI for forensic analysis: a comparative study of SHAP and LIME in intrusion detection models. Appl Sci. 15 (13), 7329(2025).
  26. Petsiuk, V., Das, A., Saenko, K. RISE: randomized input sampling for explanation of black-box models. arXiv preprint. , (2018).
  27. Dandl, S., et al. Multi-objective counterfactual explanations. Lect Notes Comput Sci. 12269, 448-469 (2020).
  28. Alvarez-Melis, D., Jaakkola, T. S. Towards robust interpretability with self-explaining neural networks. Adv Neural Inf Process Syst. 31, 7775-7784 (2018).
  29. Donnelly, J., Barnett, A. J., Chen, C. Deformable ProtoPNet: an interpretable image classifier using deformable prototypes. Proc IEEE Conf Comput Vis Pattern Recognit. , 10255-10265 (2022).
  30. Ross, A. S., Hughes, M. C., Doshi-Velez, F. Right for the right reasons: training differentiable models by constraining their explanations. Proc Int Joint Conf Artif Intell. , 2662-2670 (2017).
  31. Schramowski, P., et al. Making deep neural networks right for the right scientific reasons by interacting with their explanations. Nat Mach Intell. 2 (8), 476-486 (2020).
  32. Rudin, C. Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead. Nat Mach Intell. 1 (5), 206-215 (2019).
  33. Letham, B., et al. Interpretable classifiers using rules and Bayesian analysis: building a better stroke prediction model. Ann Appl Stat. 9 (3), 1350-1371 (2015).
  34. Barnett, A. J., et al. Interpretable mammographic image classification using case-based reasoning and deep learning. arXiv preprint. , (2021).
  35. Narayanan, A., Bergen, K. J. Prototype-based methods in explainable AI and emerging opportunities in the geosciences. arXiv preprint. , (2024).
  36. Chen, C., et al. This looks like that: deep learning for interpretable image recognition. Adv Neural Inf Process Syst. 32, 8928-8939 (2019).
  37. Koh, P. W., et al. Concept bottleneck models. Proc Int Conf Mach Learn. 119, 5294-5304 (2020).
  38. Burgess, C. P., et al. Understanding disentangling in β-VAE. arXiv preprint. , (2018).
  39. Gunraj, H., et al. SolderNet: towards trustworthy visual inspection of solder joints in electronics manufacturing using explainable artificial intelligence. Proc AAAI Conf Artif Intell. 37, 15668-15674 (2023).
  40. Dosovitskiy, A., et al. An image is worth 16×16 words: transformers for image recognition at scale. arXiv preprint. , (2020).
  41. Khan, S., et al. Transformers in vision: a survey. ACM Comput Surv. 54 (10), 1-41 (2021).
  42. Yu, L., et al. eX-ViT: a novel explainable vision transformer for weakly supervised semantic segmentation. Pattern Recognit. 142, 109666(2023).
  43. Alber, M., et al. Evaluating vision transformer models for visual quality control in industrial manufacturing. Lect Notes Comput Sci. Bifet, A., et al. 14950, 1-15 (2024).
  44. Stassin, S., et al. Explainability and evaluation of vision transformers: an in-depth experimental study. Electronics. 13 (1), 175(2024).
  45. Zhai, Y., et al. A lightweight transformer with linear self-attention for defect recognition. Electron Lett. 60 (17), e13292(2024).
  46. Dhore, V., et al. Enhancing explainable AI: a hybrid approach combining Grad-CAM and LRP for CNN interpretability. arXiv preprint. , (2024).
  47. Chattopadhay, A., et al. Grad-CAM++: generalized gradient-based visual explanations for deep convolutional networks. Proc IEEE Winter Conf Appl Comput Vis. , 839-847 (2018).
  48. Saleh, R. A. A., et al. Advancing tire safety: explainable artificial intelligence-powered foreign object defect detection with Xception networks and Grad-CAM interpretation. Appl Sci. 14 (10), 4267(2024).
  49. Meister, S., et al. Investigations on explainable artificial intelligence methods for the deep learning classification of fibre layup defect in the automated composite manufacturing. Compos Part B Eng. 224, 109160(2021).
  50. Luo, X., Alzahrani, M. Automated tomato defect detection using CNN feature fusion for enhanced classification. Processes. 13 (1), 115(2025).
  51. Rahimunnisa, K. Textile fabric defect detection. J Innov Image Process. 4 (3), 165-172 (2022).
  52. Shin, H., et al. Visualization for explanation of deep learning-based defect detection model using class activation map. Comput Mater Contin. 75 (3), 4753-4766 (2023).
  53. Yue, H., et al. ASOD: attention-based salient object detector for strip steel surface defects. Electronics. 14 (5), 831(2025).
  54. Saleh, R. A. A., Ertunç, H. M. Explainable attention-based fused convolutional neural network (XAFCNN) for tire defect detection: an industrial case study. Eng Res Express. 6 (1), 015027(2024).
  55. Leem, S., Seo, H. Attention guided CAM: visual explanations of vision transformer guided by self-attention. Proc AAAI Conf Artif Intell. 38 (4), 2956-2964 (2024).
  56. Ibrahim, R., Shafiq, M. O. Augmented Score-CAM: high-resolution visual interpretations for deep neural networks. Knowl Based Syst. 252, 109287(2022).
  57. Clement, T., et al. XAI-enhanced semantic segmentation models for visual quality inspection. Proc IEEE Int Conf Consumer Electron. , 1-4 (2024).
  58. Riedel, H., et al. Automated quality control of vacuum insulated glazing by convolutional neural network image classification. Autom Constr. 135, 104144(2022).
  59. Böhle, M., et al. Layer-wise relevance propagation for explaining deep neural network decisions in MRI-based Alzheimer's disease classification. Front Aging Neurosci. 10, 194(2019).
  60. Bach, S., et al. On pixel-wise explanations for non-linear classifier decisions by layer-wise relevance propagation. PLoS One. 10 (7), e0130140(2015).
  61. Dieter, T. R., Zisgen, H. Evaluation of the explanatory power of layer-wise relevance propagation using adversarial examples. Neural Process Lett. 55 (7), 8531-8550 (2023).
  62. Hoefler, M. A., et al. XAI-guided insulator anomaly detection for imbalanced datasets. arXiv. , (2024).
  63. Kares, F., et al. What makes for a good saliency map? Comparing strategies for evaluating saliency maps in explainable AI (XAI). arXiv preprint. , (2025).
  64. Yona, G., Greenfeld, D. Revisiting sanity checks for saliency maps. arXiv preprint. , (2021).
  65. Zeiler, M. D., Fergus, R. Visualizing and understanding convolutional networks. Eur Conf Comput Vis. 8689, 818-833 (2014).
  66. Xu-Darme, R., et al. On the stability, correctness and plausibility of visual explanation methods based on feature importance. ACM Int Conf Proc Ser. , 119-125 (2023).
  67. Ortigossa, E. S., et al. T-Explainer: a model-agnostic explainability framework based on gradients. arXiv preprint. , (2024).
  68. Singh, M., et al. Attributional robustness training using input-gradient spatial alignment. Lect Notes Comput Sci. 12372, 515-533 (2019).
  69. Cerekci, E., et al. Quantitative evaluation of saliency-based explainable artificial intelligence methods in deep learning-based mammogram analysis. Eur J Radiol. 173, 111356(2024).
  70. Meister, S., et al. Cross-evaluation of a parallel operating SVM-CNN classifier for reliable internal decision-making processes in composite inspection. J Manuf Syst. 60, 620-639 (2021).
  71. Bitar, A., et al. Gradient-based feature-attribution explainability methods for spiking neural networks. Front Neurosci. 17, 1153999(2023).
  72. Qiang, Y., et al. Interpretability-aware vision transformer. arXiv preprint. , (2023).
  73. Bousselham, W., et al. LeGrad: an explainability method for vision transformers via feature formation sensitivity. arXiv preprint. , (2025).
  74. Lundberg, S. M., Lee, S. I. A unified approach to interpreting model predictions. Adv Neural Inf Process Syst. 30, (2017).
  75. Khan, F. S., et al. Model-agnostic explainable artificial intelligence methods in finance: a systematic review, recent developments, limitations, challenges and future directions. Artif Intell Rev. 58, 1-65 (2025).
  76. Nazim, S., et al. Advancing malware imagery classification with explainable deep learning: a state-of-the-art approach using SHAP LIME and Grad-CAM. PLoS One. 20 (5), e0318542(2025).
  77. Solís-Martín, D., et al. On the soundness of XAI in prognostics and health management (PHM). Information. 14 (5), 256(2023).
  78. Biecek, P., Burzykowski, T. Local interpretable model-agnostic explanations (LIME). In:Explanatory Model Analysis. , 107-123 (2021).
  79. Ribeiro, M. T., Singh, S., Guestrin, C. 34;Why should I trust you?" Explaining the predictions of any classifier. Proc ACM SIGKDD Int Conf Knowl Discov Data Min. , 1135-1144 (2016).
  80. Tahir, H. A., et al. A novel hybrid XAI solution for autonomous vehicles: real-time interpretability through LIME-SHAP integration. Sensors. 24 (21), 6776(2024).
  81. Goldman, C. V., et al. Explaining learning models in manufacturing processes. Procedia Comput Sci. 180, 259-268 (2021).
  82. Emmanouilidis, C., Rica, E. Visual quality control via explainable AI and the case of human in the AI loop. In: Lect Notes Mech Eng. , 252-260 (2023).
  83. Huang, M., et al. An interpretable approach using hybrid graph networks and explainable AI for intelligent diagnosis recommendations in chronic disease care. Biomed Signal Process Control. 91, 105913(2024).
  84. Dardouillet, P., et al. Explainability of image semantic segmentation through SHAP values. Data. 7 (8), 255(2022).
  85. Saifullah, S., et al. The privacy-explainability trade-off: unraveling the impacts of differential privacy and federated learning on attribution methods. Front Artif Intell. 7, 1236947(2024).
  86. Velmurugan, M., et al. Developing guidelines for functionally-grounded evaluation of explainable artificial intelligence using tabular data. Eng Appl Artif Intell. 141, 109772(2025).
  87. Wells, L., Bednarz, T. Explainable AI and reinforcement learning-a systematic review of current approaches and trends. Front Artif Intell. 4, 550030(2021).
  88. Rožanec, J. M., et al. Adaptive explainable artificial intelligence for visual defect inspection. Procedia Comput Sci. 232, 3034-3043 (2024).
  89. Nguyen, H. T. T., et al. XEdgeAI: a human-centered industrial inspection framework with data-centric explainable edge AI approach. Inf Fusion. 116, 102782(2025).
  90. Han, C., et al. Visual coating inspection framework via self-labeling and multi-stage deep learning strategies. J Intell Manuf. 35, 1-18 (2024).
  91. Kotsiopoulos, T., et al. Revolutionizing defect recognition in hard metal industry through AI explainability, human-in-the-loop approaches and cognitive mechanisms. Expert Syst Appl. 255, 124839(2024).
  92. Forcher, B., et al. Evaluation of explainable AI methods for classification tasks in visual inspection. Proc XAI Workshop (Late-Breaking Work, Demos, Doctoral Consortium). , 77-82 (2023).
  93. Miller, T. Explanation in artificial intelligence: insights from the social sciences. Artif Intell. 267, 1-38 (2019).
  94. Jacovi, A., Goldberg, Y. Towards faithfully interpretable NLP systems: how should we define and evaluate faithfulness. Proc Annu Meet Assoc Comput Linguist. 58, 4198-4205 (2020).
  95. Adebayo, J., et al. Sanity checks for saliency maps. Adv Neural Inf Process Syst. 31, 9505-9515 (2018).
  96. Doshi-Velez, F., Kim, B. Considerations for evaluation and generalization in interpretable machine learning. Proc Explainable and Interpretable Models in Computer Vision and Machine Learning. , 3-17 (2018).
  97. Lage, I., et al. An evaluation of the human-interpretability of explanation. arXiv preprint. , (2019).
  98. Theunissen, M., Browning, J. Putting explainable AI in context: institutional explanations for medical AI. Ethics Inf Technol. 24 (2), 1-10 (2022).
  99. Hoffman, R. R., et al. Measures for explainable AI: explanation goodness, user satisfaction, mental models, curiosity, trust, and human-AI performance. Front Comput Sci. 5, 1096257(2023).
  100. Hedström, A., et al. Quantus: an explainable AI toolkit for responsible evaluation of neural network explanations and beyond. J Mach Learn Res. 24, 1-11 (2023).
  101. Mohseni, S., et al. A multidisciplinary survey and framework for design and evaluation of explainable AI systems. ACM Trans Interact Intell Syst. 11 (3-4), 1-45 (2021).
  102. Finzel, B., et al. Domain-specific evaluation of visual explanations for application-grounded facial expression recognition. Lect Notes Comput Sci. 14065, 31-44 (2023).
  103. Yeh, C. K., et al. On the (in)fidelity and sensitivity for explanations. Adv Neural Inf Process Syst. 32, 10967-10978 (2019).
  104. Better metrics for evaluating explainable artificial intelligence. Rosenfeld, A. Proc Int Conf Autonomous Agents Multiagent Syst, , 45-53 (2021).
  105. Evaluation metrics for XAI: a review, taxonomy, and practical applications. Kadir, M. A., et al. Proc IEEE Int Conf Intell Eng Syst, , 111-124 (2023).
  106. Sankaran, K. Data science principles for interpretable and explainable AI. J Data Sci. 22, 1-27 (2024).
  107. Alvarez-Melis, D., Jaakkola, T. S. On the robustness of interpretability methods. arXiv preprint. , (2018).
  108. Zhang, Y., et al. Saliency-Bench: a comprehensive benchmark for evaluating visual explanations. arXiv preprint. , (2025).
  109. Bergmann, P., et al. The MVTec anomaly detection dataset: a comprehensive real-world dataset for unsupervised anomaly detection. Int J Comput Vis. 129 (4), 1038-1059 (2021).
  110. Tang, S., et al. Online PCB defect detector on a new PCB defect dataset. arXiv preprint. , (2019).
  111. CheXpert: a large chest radiograph dataset with uncertainty labels and expert comparison. Irvin, J., et al. Proc AAAI Conf Artif Intell, 33, 590-597 (2019).
  112. ImageNet: a large-scale hierarchical image database. Deng, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 248-255 (2009).
  113. Selvaraju, R. R., et al. Grad-CAM: visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 128 (2), 336-359 (2020).
  114. Black-box explanation of object detectors via saliency maps. Petsiuk, V., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 11438-11447 (2020).
  115. Attention is not explanation. Jain, S., Wallace, B. C. Proc Conf North Am Chapter Assoc Comput Linguist, , 3543-3556 (2019).
  116. Transformer interpretability beyond attention visualization. Chefer, H., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 782-791 (2021).
  117. Wachter, S., et al. Counterfactual explanations without opening the black box: automated decisions and the GDPR. SSRN Electron J. , (2017).
  118. Deep learning for case-based reasoning through prototypes: a neural network that explains its predictions. Li, O., et al. Proc AAAI Conf Artif Intell, 32, 3530-3537 (2018).
  119. Counterfactuals in explainable artificial intelligence (XAI): evidence from human reasoning. Byrne, R. M. J. Proc Int Joint Conf Artif Intell, , 6276-6282 (2019).
  120. Ihongbe, I. E., et al. Evaluating explainable artificial intelligence (XAI) techniques in chest radiology imaging through a human-centered lens. PLoS One. 19 (10), e0308758(2024).
  121. Dörrich, M., et al. Explainable convolutional neural networks for assessing head and neck cancer histopathology. Diagn Pathol. 18 (1), 121(2023).
  122. Nguyen, H. Q., et al. VinDr-CXR: an open dataset of chest X-rays with radiologist's annotations. Sci Data. 9, 429(2022).
  123. Lee, D. J., et al. A systematic literature review on artificial intelligence and explainable artificial intelligence for visual quality assurance in manufacturing. Electronics. 12 (22), 4572(2023).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

XAI

מאמרים קשורים