$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
2. מסגרת XAI
רוב מודלי הבינה המלאכותית המתקדמים - במיוחד רשתות עצביות עמוקות - מטופלים לעתים קרובות כקופסאות שחורות; יש מעט נראות לגבי האופן שבו הם מקבלים החלטות12. חוסר השקיפות הזה הוא מחסום לאמון ויכולת הסבר ביישומים מגוונים. כתוצאה מכך, XAI הפך לחלק הכרחי מבינה מלאכותית אמינה. אין גישה אחת שמתאימה לכל התרחישים: שיטות מסוימות מניחות גישה מלאה לפנימיות המודל, בעוד שאחרות מתייחסות למודל כאל קופסה שחורה בלתי ניתנת לשינוי; חלקם נותנים עדיפות להסברים מקומיים לתחזיות בודדות, בעוד שאחרים מספקים תובנה גלובלית לגבי התנהגות המודל. כפי שמתואר באיור 1, שיקולים אלה הובילו לשתי קטגוריות רחבות של טכניקות XAI המבוססות על מועד הצגת יכולת ההסבר: שיטות הסבר פוסט-הוק ושיטות פרשנות מהותיות13. שיטות פוסט הוק מסווגות עוד יותר למודל אגנוסטי וספציפי למודל14.

איור 1: מסגרת XAI עבור בדיקה חזותית. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.
- Post-hoc explanation methods
שיטות פוסט-הוק מייצרות הסברים לאחר אימון המודל, מבלי לשנות את הארכיטקטורה או הפרמטרים שלו15. גישות אלו פופולריות מכיוון שהן מאפשרות למתרגלים לנצל מודלים בעלי ביצועים גבוהים ולאחר מכן להסביר בדיעבד את התפוקות שלהם16. עם זאת, מכיוון שהמודל הבסיסי נותר ללא שינוי, הסברים פוסט-הוק חייבים להעריך או להסיק את ההיגיון של המודל, מה שעלול להציג שגיאת קירוב וחוסר יציבות17. בסעיפים הבאים מוסברות שיטות ספציפיות למודל ואגנוסטיות.
- ספציפי לדגם
שיטות אלו מנצלות ידע על מבנה המודל או מנגנון האימון כדי לספק הסברים המותאמים למודל זה. דוגמה מצוינת היא ייחוס מבוסס שיפוע לרשתות עצביות עמוקות. שיטות כמו GradCAM (מיפוי הפעלת מחלקה משוקלל שיפוע) משתמשות בשיפועים הפנימיים של CNNs מאומנים כדי לייצר "מפות חום" חזותיות המדגישות את האזורים של תמונת קלט החשובים ביותר לחיזוי נתון17. GradCAM מחשב את השיפוע של ציון מחלקת היעד ביחס למפות תכונות בשכבה הקונבולוציונית הסופית ומקרין את השיפועים הללו על התמונה, ומניב מפת לוקליזציה מבחינה מעמדית. שיטות התפשטות שיפוע אחרות מכלילות לארכיטקטורות רשת שונות. שיפועים משולבים (IG)18 צוברים שיפועים לאורך הנתיב מקלט בסיסי (למשל, תמונה ריקה) לקלט בפועל, ועונה על אקסיומות רצויות לייחוס תכונות. DeepLIFT19 מפיץ באופן דומה הבדלים מהפעלת ייחוס דרך כל שכבה כדי להעריך את התרומה של כל תכונת קלט. התפשטות רלוונטיות לפי שכבה (LRP) מפיצה לאחור ניקוד חיזוי שכבה אחר שכבה, ומפיצה "רלוונטיות" לכל פיקסל קלט או תכונה20. לסיכום, שיטות ספציפיות למודל מנצלות שיפועים פנימיים, הפעלות או תשומת לב כדי לייצר הסברים המחוברים היטב למבנה המודל.
- מודל-אגנוסטי
לעומת זאת, שיטות אגנוסטיות למודל מתייחסות למודל כקופסה שחורה שניתן לבצע שאילתות עבור פלטים. טכניקות אלה מניחות הנחות מינימליות, בדרך כלל דורשות רק שניתן לקבל את חיזוי המודל עבור תשומות מופרעות. דוגמאות כוללות LIME (Local Interpretable Model-Agnostic Explanations), המשתמש במודל פשוט וניתן לפירוש (כגון מודל ליניארי דליל או עץ החלטות) כדי לחקות את התנהגות המודל המורכב בקרבת קלט נתון21. עבור חיזוי ספציפי, LIME מייצר גרסאות מופרעות רבות של הקלט, מקבל את התחזיות של מודל הקופסה השחורה עבור כל אחת מהן, ולאחר מכן לומד רגרסיה ליניארית משוקללת שמקרבת את יחסי הקלט-פלט המקומיים22. המקדמים של מודל ליניארי חלופי זה משמשים כהסבר, המציינים אילו תכונות מניעות את החיזוי23. המשיכה של LIME טמונה בגמישות שלה (הניתנת לשימוש עם כל מסווג) והפלט האינטואיטיבי שלה (למשל, קבוצה קטנה של תכונות משוקללות). SHapley Additive exPlanations (SHAP) היא שיטה פופולרית נוספת המבוססת על תורת המשחקים24. SHAP מסביר חיזוי אינדיבידואלי על ידי חישוב ייחוסי תכונות המקרבים את ערכי שפלי מתורת המשחקים השיתופית, ומבטיחים תכונות כמו תוספות ועקביות25. מעבר לייחוס תכונות, גישות אגנוסטיות למודלים כוללות גם שיטות הפרעה חזותית עבור מודלים של תמונה. RISE (דגימת קלט אקראית להסבר) מייצרת מפות חשיבות על ידי מיסוך אקראי של חלקים מתמונת הקלט והתבוננות כיצד פלט המודל משתנה26. על ידי דגימה של מסכות רבות כאלה, RISE בונה מפת בולטות הסתברותית המציינת אילו פיקסלים או אזורים היו המשפיעים ביותר על התחזית26. יש לציין כי RISE אינו דורש גישה לפנימיות המודל ודורש רק את היכולת להעריך את המודל על תשומות ששונו, מה שהופך אותו לקופסה שחורה באמת. לבסוף, תחום הולך וגדל של XAI אגנוסטי למודלים מתמקד בהסברים נגדיים. הסבר נגדי אינו מונה את חשיבות התכונה אלא עונה על השאלה: "איזה שינוי מינימלי בקלט היה משנה את חיזוי המודל?" 27. אלגוריתמים ליצירת עובדות נגדיות מבצעים בדרך כלל חיפוש במרחב קלט (או במרחב סמוי נלמד) אחר הדוגמה הקרובה ביותר שמניבה את הפלט הרצוי, תוך אכיפת ריאליזם ודלילות בשינויים. לסיכום, שיטות XAI פוסט-הוק מאומצות באופן נרחב מכיוון שניתן ליישם אותן על מודלים בעלי ביצועים גבוהים לאחר אימון, המשלבות כוח ניבוי עם מידה של שקיפות.
- שיטות פרשנות מהותיות
שיטות מהותיות נוקטות בגישה שונה מהותית: במקום להסביר קופסה שחורה לאחר מעשה, שיטות אלה הופכות את המודל לניתן לפירוש על ידי תכנון. רשתות עצביות מסבירות את עצמן (SENN) הן דוגמה בולטת. במסגרת SENN שהוצעה על ידי אלוורז-מליס וג'אקולה28, הרשת העצבית בנויה לחשב תחילה קבוצה של הפעלות מושגי ביניים ולאחר מכן ליצור חיזוי כפונקציה פשוטה וניתנת להסבר של מושגים אלה. ProtoPNet (רשת חלקים אב-טיפוסית) היא רשת עמוקה המסווגת קלטים על ידי השוואתם לקבוצה של ייצוגי אב-טיפוס נלמדים של כל מחלקה. לדוגמה, במשימת סיווג תמונה, ProtoPNet עשוי ללמוד תיקוני אב-טיפוס ולקבל החלטות על ידי מציאת אבות הטיפוס המופעלים ביותר על ידי קלט29. בתחום של מודלים רצפים ושנאים, מנגנוני קשב מונפו גם לפרשנות מהותית. מודלים מסוימים מאומנים עם יעד יישור קשב, המעודד את משקלי הקשב של המודל להתאים לתכונות חשובות ידועות או לאזורים רלוונטיים המסומנים על ידי בני אדם. על ידי הנחיית תשומת הלב להיות "נכונה מהסיבות הנכונות"30, גישות אלה מייצרות מודלים שלא רק מתפקדים היטב אלא גם בעלי התפלגות קשב שניתן לפרש ישירות כהסברים. יתר על כן, מודלים כאלה מספקים הסברים שבדרך כלל נאמנים לבנייה, מכיוון שההסבר נוצר מהמבנה הניתן לפירוש של המודל עצמו, ולא מקירוב פוסט-הוק חיצוני31.
3. טקסונומיה XAI
כדי לספק סינתזה מובנית של מצב המחקר, נערכה סקירת ספרות שיטתית תוך שימוש בהנחיות PRISMA (איור 2). התהליך כלל מספר מאגרי מידע אקדמיים (Scopus, Web of Science, IEEE Xplore, SpringerLink, PubMed, arXiv ו-MDPI) והונחה על ידי קבוצה של מונחי חיפוש המשלבים "בינה מלאכותית ניתנת להסבר", "פרשנות", "בדיקה חזותית", "זיהוי פגמים", "זיהוי חריגות", "ייצור" ו "הדמיה רפואית". קריטריוני ההכללה דרשו שהמאמרים יישמו או העריכו במפורש שיטות XAI בהקשרי בדיקה חזותית (תעשייתיים או רפואיים) ודיווחו על פירוט מתודולוגי מספיק. קריטריונים להחרגה הסירו הצעות תיאורטיות בלבד ללא יישום, כמו גם עבודות מחוץ לבדיקה חזותית. החיפוש שלף בתחילה 483 רשומות. לאחר הסרת כפילויות והקרנת כותרות ותקצירים נותרו 147 לבדיקת טקסט מלא. יישום קריטריוני הכללה/אי הכללה הניב 75 מחקרים ראשוניים, המהווים את הבסיס לסקירה זו.

איור 2: דיאגרמת זרימת PRISMA של תהליך הסקירה השיטתית בהתאם להנחיות PRISMA. האיור ממחיש רשומות שזוהו, נבדקו והוצאו בכל שלב, והניב 75 מחקרים ראשוניים שנכללו בסקירה הסופית. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
- טקסונומיה יישומית של מחקרים שנסקרו
בהתבסס על המסגרת המושגית שהוצגה בסעיף 2 (גישות פוסט-הוק ופנימיות), חידדנו טקסונומיה ספציפית לתחום הנגזרת מ-75 המחקרים הללו. טקסונומיה יישומית זו מבדילה שיטות על פי יישומן במשימות בדיקה חזותית כפי שמוצג באיור 3.
- התפלגות המחקרים על פני טקסונומיה
ההתפלגות המלאה של 75 המחקרים מסוכמת בטבלה 1. כל מחקר ממופה לקטגוריה המתודולוגית ולתחום היישום שלו. זה מספק בסיס אמפירי לניתוח ההשוואתי המוצג בסעיף 4.
- סינתזה
מספר מגמות ברורות עולות מסקירה שיטתית זו. ראשית, שיטות פוסט-הוק מבוססות שיפוע נותרו המאומצות ביותר במשימות פיקוח תעשייתי ורפואי בשל יעילותן וקלות האינטגרציה שלהן. שנית, שיטות מבוססות הפרעות מספקות ייחוסי תכונות עשירים יותר אך פחות נפוצות במסגרות תעשייתיות בעלות תפוקה גבוהה עקב דרישות חישוביות. שלישית, שיטות מהותיות צוברות אחיזה אך עדיין לא מיוצגות, כאשר פחות מ-15% מהמחקרים מיישמים אותן.
על ידי עיגון טקסונומיה זו בסקירה מונחית PRISMA הניתנת לשחזור וקישורו למסד נתונים מובנה של 75 מחקרים, סעיף זה מבסס בסיס ראיות מאומת. ממצאים אלה מכינים את הקרקע לניתוח ההשוואתי בסעיף 4, שבו שיטות מייצגות נמדדות על פני מדדים סטנדרטיים (נאמנות, חוסן, חביון ודיוק לוקליזציה).

איור 3: טקסונומיה מוצעת של שיטות XAI במשימות בדיקה חזותית. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.
| שיטת XAI | גישת XAI | מחקר | תעשייה | שנה |
| הפנימית | מודלים מבוססי חוקים וליניאריים | 32,33 | רפואה כללי | 2015–2019 |
| מבוסס אב-טיפוס (ProtoPNet, מבוסס מקרה, ניתן לעיוות) | 29,34,35,36 | רפואי, תעשייתי, כללי | 2018–2024 |
| מונחה-קונספט (צוואר בקבוק של מושגים, סיבות נכונות לזכות) | 30,31,37 | כללי, יישומים מדעיים | 2020–2021 |
| רשתות עצביות מסבירות את עצמן (SENN) | 28 | כללי | 2018–2020 |
| ייצוג לא שזור (β-VAE),SOXAI | 38,39 | כללי | 2018 |
| שנאי ראייה (פרשנות פנימית באמצעות קשב) | 40,41,42,43,44,45 | ראייה ממוחשבת, ייצור | 2020–2024 |
| פוסט-הוק, ספציפי לדגם | משפחת CAM | 46,47,48,49,50,51,52, 53,54,55,56,57,58 | הדמיה רפואית, ייצור, רכב, חקלאות, אלקטרוניקה | 2018–2025 |
| LRP (התפשטות רלוונטיות לפי שכבה) | 20,59,60,61,62 | כללי, הדמיה רפואית | 2015–2024 |
| שיטות שיפוע ובולטות (שיפועים משולבים, IG DeepLIFT חלק, DeconvNet, T-Explainer, מדדי בולטות) | 18,19,63,64,65,
66,67,68,69,70 | כללי, הדמיה רפואית | 2013–2025 |
| ייחוס במודלים מיוחדים (SNNs, ייחוס קשב רובוטריקים) | 71,72,73 | מדעי המוח, שנאי ראייה | 2023–2025 |
| פוסט-הוק, מודל-אגנוסטי | LIME & Variants (LIME, ELIME, MASALA), SHAP & Variants (Tree SHAP), | | פיננסים, תחזיות וניהול בריאות, אבטחת סייבר, רכבים אוטונומיים, פיקוח תעשייתי. | 2016–2025 |
| עובדות נגדיות | 21,22,23,24,25,27,74,
75,76,77,78,79,80,81,
82,83,84,85,86 |
| הסברים | |
| שיטות היברידיות | אינטגרציה של מספר שיטות XAI כולל (GradCAM, SHAP, LRP, LIME) | 58,87,88,89,90,91,92 | פיקוח תעשייתי, בריאות, ייצור. | 2021–2025 |
טבלה 1: סיווג של 75 מחקרים שנסקרו לפי שיטת XAI, שנה, תעשייה וגישה.
4. מדדי הערכה עבור XAI
הביצועים של מודל ראייה ממוחשבת נשפטים על ידי מדדים מבוססים היטב כגון דיוק, דיוק וזיכרון. עם זאת, הערכת יכולת ההסבר של החלטות המודל היא הרבה פחות פשוטה. בניגוד לביצועי חיזוי סטנדרטיים, אין מדד מקובל אוניברסלי לאיכות הסברי הבינה המלאכותית66. במילים אחרות, בעוד שניתן למדוד במדויק את הדיוק של מסווג, אין סולם מוסכם לכמת עד כמה הסבר "טוב" לסיווג תמונה נתון93. פער זה מדגיש פער מהותי בתחום XAI: כיצד להעריך הסבר.
פיתוח קריטריונים סטנדרטיים להערכת XAI הוכח כמאתגר במיוחד. סיבה אחת היא שיכולת הפרשנות ואיכות ההסבר הן רב-פנים ותלויות הקשר ולכן מתנגדות למדד אוניברסלייחיד 10. הערכת הסבר מסתמכת למעשה על מספר גורמים, כולל תחום היישום, אופי ההסבר המופק והרקע של משתמש הקצה. לדוגמה, טכניקת הסבר המתאימה לאבחון תמונה רפואית עשויה להיות מוערכת באופן שונה מזו המשמשת במשימת בדיקה חזותית תעשייתית10.
בפועל, היעדר מדדים סטנדרטיים הוביל את החוקרים להסתמך על מגוון גישות הערכה. מחקרים רבים עדיין פונים להערכה איכותית ואנקדוטלית של שיטות XAI 94,95. מקובל לראות מחברים מציגים כמה מפות בולטות או מפות חום וטוענים שהן נראות סבירות (מה שמכונה מבחן "תוקף הפנים")96. בחינה חזותית כזו יכולה להיות משכנעת במובן הנרטיבי, אך היא נותרת סובייקטיבית ואינה מספיקה להשוואה קפדנית97. זה ממחיש את הקושי בסטנדרטיזציה של מדדי XAI; בהיעדר קריטריונים מוסכמים, החוקרים מציעים מדדים המותאמים לכל מערך נתונים או מקרה שימוש.
כתוצאה מכך, הספרות שופעת כעת במדדי הערכת XAI מגוונים שנועדו למלא את הפער הזה98. מסגרות ואמצעים רבים הוצעו, שכל אחד מהם מכוון להיבט מסוים של מה שהופך את ההסבר לשימושי99. באופן כללי, ניתן לסווג מדדים על סמך המיקוד העיקרי שלהם. מדדים מבוססי נאמנות שופטים הסבר לפי עד כמה הוא משקף את תהליך ההחלטה של מודל100. לעומת זאת, מדדים ממוקדי פרשנות מעריכים עד כמה ההסבר מובן ומשכנע לצופה אנושי101. קטגוריה שלישית היא מדדים מבוססי משימות, כאשר הערכת ההסבר תלויה בהשפעתו על ביצועי משתמש הקצה102. קטגוריה רביעית היא מדדים מוכווני חוסן המעריכים את עקביות התוצאות103. לבסוף, מדדים היברידיים משלבים ממדים מרובים104.
מגוון מדדים זה מצביע על היבטי ההסבר שהחוקרים מחשיבים כחשובים, אך גם מדגיש את היעדר תקן אחד: כל מדד לוכד רק זווית אחת של איכות ההסבר105. בהמשך, מגוון מדדי הערכה עבור XAI מקובצים לארבע קטגוריות עיקריות ומסוכמים בטבלה 2.
| סוג מטרי | מטרי | נוסחה / הגדרה |
| נאמנות | שטח מחיקה מתחת לעקומה (AUC)26 |  הם תכונות חשובות למעלה ; נמוך = נאמן יותר |
| אזור הכנסה מתחת לעקומה (AUC)26 |  גבוה יותר = נאמן יותר |
| ציון בגידה: 103 |  נמוך יותר = טוב יותר |
| שאגה106 | הדיוק יורד לאחר אימון מחדש ללא תכונות 'חשובות' |
| חוסן | מדד יציבות107 |  גבוה יותר = עקבי יותר |
| ליפשיץ ציון103 |  נמוך = חזק יותר |
| פרשנות | סדירות79 |  נמוך = פשוט יותר |
| עומק פונדקאית79 | עומק הפונדקאית הניתנת לפירוש (למשל, עץ החלטות); רדוד יותר = פשוט יותר |
| ספציפי למשימה | הצטלבות-על-איחוד (IoU)108 |  חפיפה של מסכה M ואמת קרקעית G |
| משחק הצבעה108 | דיוק = #hits / #samples גבוה יותר = טוב יותר |
| היברידית | ציון משולב104 | שילוב משוקלל של נאמנות, דלילות וחוסן |
טבלה 2: מדדי הערכה עבור XAI בבדיקה חזותית מקובצים לארבע קטגוריות עיקריות.
5. ניתוח השוואתי
בחלק זה, השיטות מושווים על פני מערכי נתונים ציבוריים כגון MVTec AD109 (>5,000 תמונות פגמים עם מסכות ברמת הפיקסלים) ו-DeepPCB110 (1,500 תמונות PCB עם שש מחלקות פגמים), CheXpert111 ו-ImageNet112 ומוערכות על פני המדדים הבאים: מחיקה/הכנסה AUC (נאמנות), דיוק משחק הצבעה (לוקליזציה), ציוני יציבות (חוסן תחת הפרעות) וחביון (עלות זמן ריצה).
עבור שיטות מבוססות CAM (GradCAM, GradCAM++) תוצאות ב-MVTec AD ו-DeepPCB מראות ש-GradCAM משיג נאמנות של 0.83-0.87 (הכנסה AUC ~0.68; <ירידת דיוק של 15% תחת מחיקה), רגישות (0.80 - 0.85) וזמן ריצה <100 אלפיות השנייה (~39 פריימים לשנייה (FPS)). הלוקליזציה נשארת מתונה (ממוצע IoU ≈0.28 @ δ=0.25; דיוק הצבעה 86-87%). GradCAM++ משפר לוקליזציה של מופעים מרובים (ממוצע IoU = 0.38) תוך שמירה על השהיה דומה (<120 אלפיות השנייה) ואמון משתמשים גבוה יותר (109.69/250 לעומת 56.08/250 עבור GradCAM). שיטות אלה יעילות אך גסות מבחינה מרחבית 47,113.
עבור שיטות מבוססות הפרעות (LIME, SHAP, RISE), הביצועים משתנים בין מערכי נתונים. ב-MVTec AD, LIME מגיע לנאמנות מקומית R² = 0.70-0.80 אך מראה חוסן נמוך (מדד יציבות <0.5), חביון של 3-5 שניות לתמונה ולוקליזציה מתונה (IoU = 0.25-0.35). SHAP המיושם על סיווג פגמים ב-PCB משיג ייחוסים עקביים (Δ log-odds = 0.2-0.3) עם יישור אנושי חזק (70-80%) אך הוא איטי יותר (>1 שניות לתמונה) ובעל לוקליזציה חלשה (IoU ≈0.02-0.03). RISE, שנמדד על MS-COCO ושוכפל עבור MVTec AD, ממוצע של 4,000-8,000 מסירות קדימה מוסוות, המניב חוסן גבוה (יציבות >0.7), נאמנות (0.78-0.82 AUC) ולוקליזציה מעולה (משחק הצבעה = 62.9% לעומת 48.3% עבור GradCAM), אך בהשהיה של 1-2 שניות/הסבר 26,74,79,114.
עבור שיטות התפשטות רלוונטיות (LRP, DeepLIFT), הערכות על DeepPCB ו-CheXpert מצביעות על כך ש-LRP משיג נאמנות של 0.82-0.90, רגישות ~0.85 ו-IoU לוקליזציה של 0.40-0.50. זמן הריצה הוא 100-200 אלפיות השנייה לתמונה, איטי יותר מ-CAMs אך אפשרי לבדיקה כמעט בזמן אמת. במשימות רדיולוגיה של CheXpert, מחקרי מומחים מראים חפיפה של >70% בין מפות חום של LRP לאזורים רלוונטיים מבחינה קלינית, מה שמדגים יכולת פרשנות בין תחומים60.
עבור שיטות מבוססות קשב (רובוטריקים), תוצאות עבור מודלים של ViT שהוכשרו על ImageNet ו-CheXpert, מפות קשב גולמיות מניבות נאמנות של 0.75-0.85 אך אינן יציבות תחת הפרעות, עם רגישות של 0.70-0.75 ולוקליזציה צנועה (IoU = 0.30-0.45). אמון אנושי הוא ~60-70%. גישות מותאמות (זרימת קשב, Transformer-LRP) משפרות מדדים סיבתיים, ועולות על תשומת הלב הגולמית במחיקה/הוספה וציונים במשחקי הצבעה 40,115,116.
עבור שיטות מבוססות אב-טיפוס ועובדות נגדיות, הערכות n MVTec AD מדגישות כי ProtoPNet משיג הסברים מבוססי דוגמה כאשר התחזיות מוצדקות על ידי מקרי פגמים דומים, ומסייעים בקבלת החלטות של המפעיל. גישות מבוססות SOM מקבצות תכונות פגמים במפות דו-ממדיות, תוך שמירה על יחסים טופולוגיים. שיטות נגדיות, שנבדקו הן על תמונות פגמים ב-PCB והן על CheXpert, מספקות הנמקה מעשית ("אם אורך הסדק קטן מ-1 מ"מ, החיזוי עובר לנורמה") אך דורשות אופטימיזציה יקרה ונאבקות עם כניסות ברזולוציה גבוהה. שיטות אלה מתיישבות היטב עם ההיגיון האנושי אך בקנה מידה גרוע 117,118,119.
לבסוף, כאשר בוחנים פשרות ובחירה מעשית, CAMs שולטים בתהליכי עבודה קריטיים להשהיה אך נשארים גסים. LRP מאזן בין נאמנות לזמן ריצה, ומצטיין בניתוח ברמת הפיקסלים. RISE מספק את הנאמנות הסיבתית והלוקליזציה החזקות ביותר, אך בהשהיה ברמת שניות. SHAP ו-LIME משפרים את יכולת הפרשנות אך הם איטיים ולא יציבים. אבות טיפוס ועובדות נגדיות ממקסמים את היישור האנושי אך מתרחבים בצורה גרועה בבדיקה ברזולוציה גבוהה. מודלים מבוססי שנאים דורשים התאמות מיוחדות מעבר לתשומת לב גולמית. לפיכך, אין שיטה אחת שעולה באופן אוניברסלי על אחרות; במקום זאת, בחירת השיטה חייבת לשקף את צרכי מערך הנתונים, המשימה, ההשהיה, התקציב והפרשנות. כפי שמוצג באיור 4, זרימת העבודה של הבחירה משלבת שלושה מהמדדים הללו (משימה, חביון, פרשנות) במדריך מוכוון-משימה לבחירת שיטות XAI בבדיקה חזותית.

איור 4: זרימת עבודה לבחירה עבור אימוץ שיטת XAI. זהו תרשים זרימה של החלטות המנחה את בחירת שיטות XAI המתאימות בבדיקה חזותית. זרימת העבודה לוקחת בחשבון את סוג המשימה (סיווג, פילוח, זיהוי חריגות, רגרסיה), אילוצי השהיה ופרטי הסבר, ומקשרת אותם לשיטות מייצגות. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
6. דיון
- ממצאים השוואתיים
הניתוח שלנו מראה ששיטות מבוססות שיפוע כגון GradCAM ו-Layer-wise Relevance Propagation (LRP) מצטיינות בהדגשת אזורי התמונה הספציפיים המשפיעים ביותר על החלטות של רשת קונבולוציונית, מה שהופך אותם לכלים אינטואיטיביים למשימות כגון לוקליזציה של פגמים או סיווג תמונה רפואית. גישות אלה יעילות מכיוון שהן פועלות במעבר אחד לאחור, אך ההסברים שלהן לרוב גסים ועשויים להיות לא ברורים באזורים מורכבים. לעומת זאת, טכניקות ייחוס תכונות אגנוסטיות למודל, כגון SHAP ו-LIME, מספקות תובנות כמותיות יותר לגבי תרומות תכונות על ידי בדיקת המודל עם תשומות מופרעות או התאמת פונדקאיות מקומיות, אך בעלות חישובית גבוהה יותר מאשר GradCAM.
שיטות מבוססות קשב ממנפות את המשקולות הפנימיות של המודל כדי להדגיש את אזורי המיקוד בתוך מודל115. RISE, לעומת זאת, מייצגת אסטרטגיה מבוססת אקראיות שמסווה ודוגמת קלטים כדי לייצר מפות בולטות גמישות, אם כי היא דורשת אלפי מסירות קדימה. יחד, טכניקות אלה מצטיינות בנסיבות ספציפיות, אך אף אחת מהן אינה עולה באופן אוניברסלי על האחרות26. במקום זאת, בחירת השיטה תלויה בארכיטקטורת המודל, במשימת הבדיקה החזותית, בדרישות ההשהיה ובסוג המידע הדרוש למקבלי ההחלטות.
- מקרי בוחן
להלן מקרי בוחן מהעולם האמיתי המיישמים XAI הן במגזר הרפואי והן במגזר התעשייתי: בתחום הבריאות, מודלים לזיהוי דלקת ריאות ו-COVID-19 שהוכשרו בצילומי רנטגן בחזה וסריקות CT הוסברו עם GradCAM ו-LIME, ורדיולוגים במחקרי משתמשים העדיפו באופן עקבי את GradCAM מכיוון שהאזורים המודגשים שלו תואמים לפתולוגיה הצפויה כגון חדירת ריאות120. באופן דומה, בפתולוגיה דיגיטלית לסרטן ראש וצוואר, תחזיות CNN הנתמכות על ידי GradCAM ו-CAM ברזולוציה גבוהה הדגישו אשכולות תאים ממאירים שהפתולוגים אישרו כרלוונטיים מבחינה קלינית, והראו כי ההסברים חיזקו הן את הדיוק הקליני והן את האמון121.
בקו מגזר הייצור, XAI עשתה הבדל טרנספורמטיבי בדיוק וביכולת ההסבר. אחד היישומים העיקריים הוא זיהוי עצמים זרים בתמונות רנטגן של צמיגים המשתמשים ברשת עצבית קונבולוציונית המבוססת על ארכיטקטורת Xception. באמצעות הכללת מיפוי הפעלת מחלקה משוקלל שיפוע (GradCAM), המערכת השיגה דיוק סיווג של יותר מ-99% והפיקה מפות חום המציינות את האזורים המדויקים בתמונה האחראים לתחזיות. הסברים חזותיים אלה אפשרו למהנדסי QA לוודא שתשומת הלב של הדגם הייתה על חריגות לגיטימיות בתוך התמיכה המבנית של הצמיג ולא על חפצים לא רלוונטיים, מה ששיפר מאוד את האמון והקל על הפריסה בהגדרות ייצור בעלות סיכון גבוה48.
בתעשיית האלקטרוניקה, גישת SolderNet מציגה את השילוב של XAI בבדיקת פגמים ברמת הפיקסלים. השיטה מבוססת CNN פותחה לבדיקת חיבורי הלחמה במעגלים מודפסים, משימה שבה דיוק גבוה ויכולת הסבר הם חובה. עם היישום של GradCAM ו-Layer-wise Relevance Propagation (LRP), השיטה חילצה מפות בולטות שהדגישו את הפיקסלים האחראים לסיווגי פגמים ספציפיים. באמצעות יכולת הסבר כזו, המפעיל הצליח להבדיל בין תוצאות חיוביות אמיתיות ושגויות ולהסיק תובנות לגבי מצבי כשל שבעבר היו יציאות קופסה שחורה39. מקרים אלה מראים ש-XAI מוערך כאשר ההסברים שלו עולים בקנה אחד עם ההיגיון של המומחים, אך לא נעשה בו שימוש כאשר ההסברים אינם יציבים, גסים או לא מעשיים מבחינה חישובית.
- מגבלות הראיות הנוכחיות
למרות התקדמות זו, מספר מגבלות נותרו בעינן. ראשית, רוב המחקרים האמפיריים מסתמכים על מערכי נתונים ציבוריים כגון MVTec AD לבדיקה תעשייתית או VinDR-CXR122 להדמיה רפואית, שאולי אינם מייצגים באופן מלא סביבות בעולם האמיתי של מפעלים או בתי חולים. שנית, ההערכה נותרה מקוטעת: נאמנות, חוסן ופרשנות נמדדים באופן לא עקבי בין מחקרים, לעתים קרובות עם הגדרות אד-הוק וללא סף סטנדרטי. שלישית, יצירות רבות חסרות תוקף אנושי. בעוד שמדדים כגון AUC מחיקה, דיוק משחק הצבעה או לוקליזציה IoU מספקים תוצאות כמותיות, הם אינם מאשרים שהסברים אלה אכן משפרים את קבלת ההחלטות של המשתמשים. לבסוף, רק ~8% ממחקרי אבטחת איכות מבוססי בינה מלאכותית בייצור משלבים XAI בזרימת העבודה שלהם123. זה מדגיש את פער האימוץ המעשי, למרות שנתון זה משתנה לפי מגזר ומתודולוגיה וייתכן שאינו מדויק.
- השלכות מעשיות על העוסקים במקצוע
עבור העוסקים בתחום, עולות מספר השלכות. שיטות מבוססות שיפוע נותרו הבחירה המעשית ביותר למשימות בדיקה בזמן אמת, מכיוון שהן מספקות הסברים עם חביון נמוך (~100 אלפיות השנייה לתמונה) וקלות לפריסה. לגישות מבוססות הפרעות, כגון SHAP או RISE, יש חביון גבוה יותר משיטות מבוססות שיפוע, אך הן מתאימות יותר לתחומים שבהם ייחוס עדין עולה על השהיה, כגון שירותי בריאות, שבהם הדיוק מקבל עדיפות על פני המהירות. גישות מבוססות קשב שימושיות בארכיטקטורות שנאים, אך הן דורשות פרשנות זהירה מכיוון שתשומת לב גולמית לא תמיד מספקת הסבר ברור. מעבר לפשרות טכניות, אימוץ מוצלח תלוי במידה רבה באינטגרציה, הדרכת משתמשים והדגמת הערך הקליני של יכולת הפרשנות. כפי שמראים מקרי המקרה, הסברים מקבלים ערך רק כאשר הם מתיישרים בבירור עם מומחיות בתחום ועוזרים למתרגלים לאמת או לאתגר תחזיות בינה מלאכותית.
- כיווני מחקר עתידיים
מחקר עתידי צריך לתת עדיפות למספר כיוונים מעשיים:
סטנדרטיזציה של פרוטוקולי הערכה: קבע הנחיות דיווח הניתנות לשחזור עבור מדדי מפתח, כולל AUC מחיקה/הכנסה, דיוק משחק הצבעה, מדדי יציבות והשהיה.
מערכי נתונים של בנצ'מרק ספציפיים לתחום: פתח ערכות נתונים שנאספו לבדיקה חזותית תעשייתית ורפואית עם ביאורי אמת קרקעית כדי להפחית הסתמכות יתר על מערכי נתונים ציבוריים צרים.
תיקוף ממוקד באדם: הרחב את המחקרים המודדים אם הסברי XAI משפרים את איכות ההחלטה, אמון המשתמשים ושיתוף הפעולה בין אדם לבינה מלאכותית מעבר למדדי Proxy
ניתוח עלות-תועלת: בצע מחקרי פריסה קפדניים כדי לכמת את הערך העסקי והקליני של שילוב XAI בתהליכי עבודה של בדיקה חזותית.