מסגרת ה-XAI המוצעת יושמה באמצעות מערך הנתונים Pima Indians Diabetes כסמון למערך נתונים בתחום הבריאות. מערך הנתונים Pima Indians Diabetes שימש כמערך הנתונים היחיד לתיקוף ניסויי. כל תוצאות הניבוי, ההסביריות, הסטטיסטיקה והשחזור שדווחו הופקו ממערך נתונים זה. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10, OhioT1DM ו-BraTS 2021 לא הוערכו באופן ניסויי ונכללו רק כדוגמאות הממחישות את ישימות הפרוטוקול הכללי על פני מודליות שונות של נתוני בריאות. מערך הנתונים המלא היה בשימוש לאחר הסרת רשומות לא תקינות וכפולות, וביצוע פעולות עיבוד מקדים מוגדרות לפני פיתוח המודל. מערך הנתונים חולק לתתי-קבוצות בלתי תלויות של אימון, תיקוף ובדיקה באמצעות אסטרטגיית פיצול רב-שכבתית (stratified splitting) שהוגדרה מראש. עצמאות הדגימות בין שלוש תתי-הקבוצות נשמרה כדי למזער את האפשרות של דליפת נתונים (data leakage).
המודל החיזוי הוגדר באמצעות הארכיטקטורה וההיפר-פרמטרים שהוגדרו מראש. המודל אומן באמצעות אופטימייזר Adam עם קצב הלמידה וגודל ה-batch שהוגדרו מראש למשך עד 10 epochs. הופעל מנגנון עצירה מוקדמת (Early stopping) בהתבס על הפסד התיקוף (validation loss), והמודל שהתאים לביצועי התיקוף הטובים ביותר נשמר. נקודות התחלה אקראיות (Random seeds) הוגדרו עבור חלוקת מערך הנתונים, אתחול המודל וניסויים חוזרים כדי לשפר את השחזוריות.
המודל המאומן הוערך על קבוצת הבדיקה העצמאית באמצעות מדדי דיוק (accuracy), דיוק חיובי (precision), רגישות (recall), סגוליות (specificity), F1-score, מקדם המתיוס (MCC), השטח תחת עקומת מאפייני המקלט (AUC-ROC) ודיוק ממוצע (AP). המודל המוצע הושווה למודלי הבסיס שהוגדרו מראש תוך שימוש בהליכי עיבוד מקדים, חלוקות נתונים ופרוטוקולי הערכה זהים. עקומות מאפייני המקלט (ROC), עקומות דיוק-רגישות (precision-recall) ומטריצת בלבול הופקו מניבויי קבוצת הבדיקה העצמאית.
בוצעה וולידציה צולבת של חמישה קיפולים (Five-fold cross-validation) על נתוני האימון כדי להעריך את יציבות הביצועים. מרווחי סמך של 95% הוערכו עבור מדדי הביצועים העיקריים, ונערכו השוואות סטטיסטיות שהוגדרו מראש בין המודל המוצע למודלי הבסיס.
אישור צולב (cross-validation) של חמישה קיפולים הניב דיוק של 93.01 ± 0.48%, AUC-ROC של 0.954 ± 0.007, דיוק חיזוי (precision) של 92.42 ± 0.87%, רגישות (recall) של 93.02 ± 0.45%, ומד F1-score של 92.72 ± 0.62%. מרווחי סמך של 95% בשיטת bootstrap, שהוערכו מ-1,00 דגימות חוזרות, היו 0.897–0.973 עבור הדיוק, 0.890–0.970 עבור הדיוק בחיזוי, 0.80–0.963 עבור הרגישות, 0.87–0.965 עבור מדד ה-F1-score, ו-0.931–0.984 עבור ה-AUC-ROC. השוואות סטטיסטיות עם מודלי הבסיס CNN, Random Forest ו-SVM בוצעו באמצעות מבחן McNemar's עבור הדיוק, מבחן DeLong's עבור ה-AUC-ROC, ובדיקות bootstrap מזווגות עם 1,00 דגימות חוזרות עבור מדד ה-F1-score.
הליך האימון וההערכה המלא חזר על עצמו ב-10 הרצות עצמאיות תוך שימוש בגרעיני אקראיות (random seeds) שונים. ההרצות החוזרות הניבו AUC-ROC של 0.957 ± 0.08, דיוק של 93.24 ± 0.74%, ומד F1-score של 92.35 ± 0.92%, מה שמעיד על שונות נמוכה יחסית בין ההרצות החוזרות. מדדי הביצועים שהתקבלו לאורך ההרצות החוזרות סוכמו באמצעות ממוצע וסטיית תקן. השונות בין ההרצות נבדקה כדי לקבוע אם ביצועי הניבוי נותרו יציבים תחת הרצה חוזרת.
תיקוף חיצוני לא בוצע בדוגמה המעשית הנוכחית מכיוון שלא נעשה שימוש במערך נתונים חיצוני בלתי תלוי. בהתאם לכך, כל תוצאות הניבוי, הסטטיסטיקה והשחזור שדווחו התקבלו מתוך ה-Pima Indians Diabetes Dataset תוך שימוש במחיצות האימון, התיקוף והבדיקה הבלתי תלויות שהוגדרו מראש. התיקוף החיצוני נשמר בפרוטוקול כהליך אופציונלי עבור יישומים שבהם זמין מערך נתונים בלתי תלוי ממוסד, אוכלוסייה, אזור גיאוגרפי או תקופה שונים.
הסברי מודל הופקו באמצעות טכניקות להסברות (explainability) הישימות למסד הנתונים הטבלאי Pima Indians Diabetes Dataset, כולל SHAP ו-LIME. בוצע הערכה של חשיבות מאפיינים גלובלית, והופקו הסברים מקומיים ספציפיים למטופלים באמצעות דגימות בדיקה ששמרו בנפרד. פלטי ההסברים תועדו יחד עם תחזיות המודל התואמות וערכי המאפיינים כדי להקל על השחזור ועל הפרשנות העוקבת.
למען הבהירות, דוגמה מעשית זו כללה את תשעת שלבי זרימת העבודה המרכזיים שזוהו ב-טבלה 1. תיקוף חיצוני והערכה של מומחים קליניים נשמרו כמודולי תיקוף אופציונליים של הפרוטוקול הכללי. תיקוף חיצוני לא בוצע מכיוון שלא נעשה שימוש במערך נתונים חיצוני עצמאי, והערכה של מומחים קליניים לא בוצעה מכיוון שלא נכלל פאנל הערכה רשמי של מומחים בדוגמה מעשית זו. בהתאם לכך, מודולים אופציונליים אלה אינם נחשבים לחלק מזרימת העבודה הניסויית בתשעה השלבים ואינם מדווחים כתוצאות ניסיוניות.
הליכי עיבוד המקדמים וחלוקת מערך הנתונים הניבו מערך נתונים סטנדרטי המתאים לפיתוח המודל. רשומות כפולות ובלתי עקביות הוסרו, ערכים חסרים טופלו בהתאם לאסטרטגיה שהוגדרה מראש, מאפיינים מספריים עברו סטנדרטיזציה, ומערך הנתונים חולק לתתי-קבוצות נפרדות של אימון, תיקוף ובדיקה. מאפייני מערך הנתונים שהתקבל והליכי עיבוד המקדמים מסוכמים בטבלה 2. זרימת העבודה הכללית להכנה ועיבוד מקדים של מערך נתונים בתחום הבריאות מוצגת באיור 2, בעוד שזרימת העבודה של ההכנה הניסויית, העיבוד המקדים, החלוקה והערכת האיכות שיושמה באופן ספציפי על מערך הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset) מוצגת באיור 3. סביבת המחשוב הסופית, ארכיטקטורת המודל ותצורת ההיפר-פרמטרים ששימשו להפקת התוצאות המדווחות מסוכמות בטבלה 3.
ביצוע סעיפים 3 ו-4 הניב סט נתונים רפואי סטנדרטי המתאים לפיתוח מודלים. הליכי עיבוד המקדמים הסירו רשומות כפולות ובלתי עקביות, ביצעו השלמה של ערכים חסרים (imputation), נרמלו מאפיינים מספריים, קידדו משתנים קטגוריאליים במידת הצורך, וחילקו את סט הנתונים לתתי-קבוצות של אימון, תיקוף ובדיקה. הנתונים שהתקבלו סיפקו את הקלט הסטנדרטי הנדרש לפיתוח המודל בהמשך.
לאחר השלמת סעיפים 5 ו-6, המודל שהוגדר הפגין התכנסות יציבה במהלך האימון. עקומות הלמידה הראו ירידה סימולטנית בהפסדי האימון והוולידציה, ועלייה בדיוק האימון והוולידציה. אופטימיזציה של ההיפר-פרמטרים שיפרה את הכללה של המודל, ללא עדות לאובוורפיטינג (overfitting) משמעותי. לתמיכה בהדירות (reproducibility), המודל המופטימיזציה הגונה יחד עם הארכיטקטורה הסופית, הגדרות ההיפר-פרמטרים, גרסאות התוכנה, ה-random seeds ומשקולות המודל המאומן. מפרטי אימון המודל ותוצאות האופטימיזציה מסוכמים בטבלה 4, ועקומות הלמידה המתאימות של האימון והוולידציה מוצגות באיור 4.
סעיף 7 העריך את ביצועי הניבוי של המודל באמצעות מדדי ביצועים סטנדרטיים. מדדי הסיווג שהוערכו כללו accuracy, precision, recall, specificity, F1-score, MCC, AUC-ROC ו-AP. המודל המוצע הושווה למודלי הבסיס שהוגדרו מראש תוך שימוש באותן חלוקות של מערך הנתונים, נהלי עיבוד מקדים ופרוטוקול הערכה. השוואת ביצועי הניבוי מוצגת ב-טבלה 5, בעוד שעקומות ROC, עקומות precision-recall, מטריצת בלבול ומדדי ביצועים השוואתיים מוצגים ב-איור 5.
בהמשך לסעיף 8, הופקו הסברים גלובליים ומקומיים לתחזיות המודל כדי להעריך את יכולת הפרשנות שלו. הסברי המודל הופקו באמצעות SHAP ו-LIME עבור מערך הנתונים הטבלאי Pima Indians Diabetes, והופק הסבר קוּנטר-פקטיבי (counterfactual) ספציפי למטופל כדי להדגים שינוי בתחזית. SHAP שימש ליצירת ויזואליזציות של חשיבות תכונות גלובלית, תרשים מפל (waterfall) ספציפי למטופל ותלות תכונות, בעוד ש-LIME שימש להפקת הסברים מקומיים מדגימות בדיקה שהוצאו מהמדגם. פלטי יכולת ההסבר התואמים מוצגים ב-איור 6.
השלב הסופי של הפרוטוקול העריך את המהימנות הסטטיסטית ואת השחזוריות של תהליך העבודה. תהליך העבודה המלא חזר על עצמו ב-10 הרצות עצמאיות תוך שימוש בזרעים אקראיים (random seeds) שונים, תוך שמירה על אותה אסטרטגיה של חלוקת הנתונים, פרמטרי עיבוד מקדים, ארכיטקטורת מודל, היפר-פרמטרים, סביבת תוכנה ונהלי הערכה. ההרצות החוזרות הניבו AUC-ROC של 0.957 ± 0.008, דיוק של 93.24 ± 0.74% ו-F1-score של 92.35 ± 0.92%, מה שמעיד על שונות נמוכה יחסית בין ההרצות החוזרות.
יציבות ההסברים לא הוערכה באופן כמותי בתהליך התיקוף הנוכחי. למרות שהופקו הסברים באמצעות SHAP ו-LIME עבור ה-Pima Indians Diabetes Dataset, לא בוצע ניתוח נפרד של מתאם דרגות (rank-correlation) או חפיפת מאפיינים בין הרצות. לפיכך, לא מדווחים מדדים כמותיים של יציבות הסברים או הסכמת שיוך (attribution-agreement). הערכה כמותית של יציבות ההסברים נשמרה בפרוטוקול הכללי כהליך שחזור אופציונלי עבור יישומים שבהם פלטי הסבר חוזרים זמינים.
השוואות סטטיסטיות הוערכו באמצעות סף מובהקות שהוגדר מראש של p < 0.05. במקומות הרלוונטיים נעשה שימוש במבחנים סטטיסטיים דו-זנביים, והסטטיסטיקות של המבחן המתאימות, ערכי ה-p ומרווחי סמך של 95% דווחו כדי לכמת את המובהקות הסטטיסטית ואת אי-הוודאות של ההבדלים בביצועים שנצפו. תוצאות התיקוף הסטטיסטי והשחזוריות הניסיוניות, כולל ביצועי תיקוף צולב, מרווחי סמך, השוואות סטטיסטיות ושונות בין הרצות חוזרות, מסוכמות ב-טבלה 6. הבדיקות הסטטיסטיות וניתוחי השחזוריות המתאימים מוצגים ב-איור 7.
תוצאות אלו סיפקו ראיה ניסויית ליציבות ניבויית ולשחזוריות תחת תנאי החישוב ומערך הנתונים שנבחנו. סביבת החישוב, מאפייני מערך הנתונים, נהלי עיבוד מקדמי, תצורת המודל, הניתוחים הסטטיסטיים והגדרות ההסברות הנדרשות לשחזור עצמאי תועדו בהתאם לרשימת הבדיקה לשחזוריות המוצגת ב- טבלה 7בדוגמת התיקוף המעשית של העבודה הנוכחית לא בוצעו הערכות של מומחים קליניים עבור פלטי ה-XAI שהופקו.
באופן כללי, יישום הפרוטוקול הניב מערך נתונים רפואי סטנדרטי המתאים לפיתוח מודלי AI ומודל מותאם באמצעות הגדרות היפר-פרמטרים שנקבעו מראש. זרימת העבודה אפשרה הערכה שיטתית של ביצועי הניבוי, יצירת הסברים למודל באמצעות טכניקות XAI רלוונטיות, והערכה סטטיסטית של חוסנו ויכולת השחזור של המודל. יחד, התוצאות הדגימו את היישום ואת יכולת השחזור של זרימת עבודת ה-XAI המוצעת תחת התנאים הניסיוניים שנבחנו בדוגמת התיקוף המעשית.

איור 1: זרימת עבודה מרכזית בתשעה שלבים לפיתוח מודלי AI הניתנים לשחזור ולהסבר במגזר הבריאות. זרימת העבודה כוללת (1) הגדרת משימת חיזוי בתחום הבריאות, (2) הגדרת סביבה חישובית, (3) רכישה ותיקוף של מערכי נתונים, (4) עיבוד מקדמי של נתונים, (5) חלוקת מערך הנתונים, (6) אימון מודל חיזוי, (7) הערכת ביצועי חיזוי, (8) ניתוח יכולת הסבר, ו-(9) תיקוף סטטיסטי והערכת יכולת שחזור. תיקוף חיצוני והערכה של מומחים קליניים נחשבים להרחבות אופציונליות של הפרוטוקול ואינם כלולים בזרימת העבודה המרכזית בתשעה השלבים. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 2: תהליך עבודה להכנה ועיבוד מקדים של מערכי נתונים בתחום הבריאות. (Aרכישת נתוני בריאות מרשומות קליניות, דימות רפואי, אותות פיזיולוגיים ומקורות נתונים מולטי-מודליים.Bאינטגרציה ועיבוד מקדים של נתונים, כולל טיפול בערכים חסרים, נורמליזציה, הסרת רעשים והעשרה (augmentation).Cחלוקת מערך הנתונים לתתי-קבוצות של אימון, תיקוף ובדיקה.ד') הערכת איכות המציגה את התפלגות המחלקות, נורמליזציה של מאפיינים ותוצרי עיבוד מקדים לפני פיתוח המודל. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 3: זרימת העבודה הניסויית להכנה, עיבוד מקדים, חלוקה והערכת איכות של מאגר הנתונים של סוכרת בקרב אינדיאנים מפונימה (Pima Indians Diabetes Dataset). זרימת העבודה כוללת רכישת מאגר נתונים, הערכת איכות הנתונים, טיפול בערכים לא תקינים וחסרים, סטנדרטיזציה של מאפיינים מספריים, חלוקת מאגר הנתונים לתתי-קבוצות של אימון, תיקוף ובדיקה עצמאית, ואימות איכות סופי לפני פיתוח המודל. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 4: עקומות למידה של אימון ניסויי ותיקוף של המודל המוצע באמצעות מערך הנתונים של סוכרת באינדיאנים פימה (Pima Indians Diabetes Dataset). (A) הפסד האימון והתיקוף לאורך כל תקופת האימון. (B) דיוק האימון והתיקוף לאורך תקופת האימון המלאה. (C) תצוגה מורחבת של ההפסד (loss) במהלך תקופות (epochs) 50–10. (ד') תצוגה מוגדלת של הדיוק במהלך תקופות (epochs) 50–10. ביצועי האימות הטובים ביותר התקבלו בתקופה 78, עם הפסד אימות (validation loss) של 0.142 ודיוק אימות של 94.6%. עצירה מוקדמת (Early stopping) הופעלה בתקופה 8 תוך שימוש בסבלנות (patience) של 10 תקופות. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 5: הערכה ניסויית של ביצועי הניבוי של מסגרת ה-XAI המוצעת באמצעות סט הבדיקה הבלתי תלוי (n = 154). (A) עקומת מאפייני תפעול של מקלט (ROC), המראה את ביצועי ההבחנה של מודל ה-XAI המוצע ומודלי הבסיס. (B(עקומות דיוק-החזר (PR) המראות את ביצועי הדיוק וההחזר של מודל ה-XAI המוצע ומודלי הבסיס. (C) מטריצת בלבול של מודל ה-XAI המוצע על קבוצת הבדיקה העצמאית, עם הדיוק (accuracy), הרגישות (recall) והספציפיות המתאימים. (ד) השוואה בין הדיוק (accuracy), הדיוק החזוי (precision), הזיכרון (recall), הסגוליות (specificity), מדד F1, מקדם המתיוס (MCC), השטח תחת העקומה של ROC (AUC) והדיוק הממוצע (AP) בין המודלים שנבדקו. כל התוצאות הכמותיות המוצגות באיור זה מתייחסות לניסוי התיקוף על מאגר הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset). אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.

איור 6: פלטי הסבירות (explainability) שהופקו מניבויים של סט בדיקה בלתי תלוי של המודל המוצע, שאומן על מאגר הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset). (A(תרשים סיכום SHAP גלובלי המראה את התפלגות תרומות המאפיינים על פני סט הבדיקה. (B) תרשים חשיבות מאפיינים של SHAP המבוס על ערכי SHAP מוחלטים ממוצעים. (C) תרשים מפל (waterfall plot) של SHAP ספציפי למטופל, המראה את תרומתם של מאפיינים בודדים להסתברות החזויה לסוכרת. (ד'(E) הסבר מקומי של LIME המראה את תרומות המאפיינים עבור חולה בדיקה מס' 125. (F) תרשים תלות של SHAP המראה את הקשר בין ערכי הגלוקוז לבין תרומות ה-SHAP שלהם. (G) הסבר נגדי (counterfactual) ספציפי למטופל המראה את השינויים המינימליים במאפיינים הקשורים לשינוי בניבוי המודל. קיצורים: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 7: תיקוף סטטיסטי ניסיוני ואנליזת הדירות של המודל המוצע באמצעות מערך הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset). (A(ביצועי אימות צולב של חמישה קיפולים על קבוצת האימון. (B(רווחי סמך bootstrap של 95% עבור ביצועי סט בדיקה בלתי תלוי. (C(השוואות סטטיסטיות מול מודלי בסיס, כולל המבחן הסטטיסטי, סטטיסטי המבחן, ערך ה-p והמובהקות.)דעקביות ביצועים לאורך 10 הרצות עצמאיות תוך שימוש בגרעיני אקראיות שונים. מבחן McNemar שימש לבדיקת דיוק סיווג מזווג, מבחן DeLong לבדיקת ROC-AUC מתואם, ובדיקת bootstrap מזווגת עם 1,0 דגימות חוזרות להשוואת מדד F1. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.
| שלב | פעילות הפרוטוקול | פלט צפוי | סטטוס יישום |
| 1 | בחירה ותיקוף של מערך נתוני שירותי הבריאות | סט נתונים מאומת, יעד חיזוי, התפלגות מחלקות ומידע על איכות הנתונים | בוצע |
| 2 | הגדרת סביבת המחשוב | חומרה, תוכנה, ספריות, גרסאות ותצורה חישובית מאומתים | בוצע |
| 3 | עיבוד מקדים ובקרת איכות של נתוני שירותי הבריאות | סט נתונים מנוקה, מעובד ומנורמל | בוצע |
| 4 | חלק את מערך הנתונים | מאגרי נתונים עצמאיים לאימון, לתיקוף ולבדיקה | בוצע |
| 5 | פיתוח ואופטימיזציה של מודל החיזוי/XAI | ארכיטקטורת המודל וההיפר-פרמטרים הסופיים | בוצע |
| 6 | אימון ושימור המודל | מודל מאומן, נקודת ביקורת (checkpoint), תצורת אימון ולוגים | בוצע |
| 7 | הערכת ביצועים חיזויים וחישוביים | מדדי ביצועים של סט הבדיקה והשוואות ביצועים | בוצע |
| 8 | הפקה והערכה של פלטי הסבריות | SHAP/LIME ופלטי הסבר רלוונטיים | בוצע |
| 9 | בצעו תיקוף סטטיסטי והערכת הדירות | רווחי סמך, מבחנים סטטיסטיים, תוצאות של הרצות חוזרות ומדדי הדירות | בוצע |
טבלה 1: סיכום של זרימת העבודה של פרוטוקול הליבה בן תשעת השלבים שיושם בתהליך התיקוף באמצעות מערך הנתונים של סוכרת בקרב אינדיאנים מפמי (Pima Indians Diabetes Dataset). הטבלה מבדילה בין תשעת השלבים שיושמו בדוגמה המעשית של מערך הנתונים של סוכרת בקרב אינדיאנים מפמי לבין תיקוף חיצוני והערכה של מומחים קליניים, אשר נשמרים כמרכיבים אופציונליים של הפרוטוקול הכללי.
| סט נתונים | מקור הנתונים | יישום קליני | מודליות נתונים | נבדקים/רשומות | דגימות | מחלקות | התפלגות מחלקות | אימון/תיקוף/בדיקה | תפקיד במחקר הנוכחי | סטטוס תיקוף | כתובת מקור (URL) |
| Pima Indians Diabetes Dataset | UCI Machine Learning Repository | ניבוי סוכרת | טבלאי קליני | 768 רשומות | 768 | 2 | 50 לא סוכרתיים; 268 סוכרתיים | 60% / 20% / 20% | סט נתונים עיקרי לתיקוף ניסיוני | בוצע – זרימת עבודה ליבלית מלאה בתשעה שלבים | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI Genomic Data Commons (GDC), פרויקט TCGA-BRCA | סיווג סרטן השד | קליני + היסטופתולוגיה | 1,098 מקרים | תלוי בסט הנתונים לפי סוג הנתונים | תלוי בנקודת קצה | אין התפלגות מחלקות אחת עבור כל סט הנתונים | לא רלוונטי – לא בוצע פיצול ניסיוני | דוגמה ליישום הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomic Data Commons (GDC), פרויקט TCGA-UCEC | סיווג סרטן הרחם | קליני + היסטופתולוגיה | קוהורט הפרויקט; הגודל תלוי בסוג הנתונים ובמסננים שנבחרו | תלוי בסט הנתונים לפי סוג הנתונים | תלוי בנקודת קצה | אין התפלגות מחלקות אחת עבור כל סט הנתונים | לא רלוונטי – לא בוצע פיצול ניסיוני | דוגמה ליישום הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, MIMIC-III Clinical Database v1.4 | ניבוי תוצאה קלינית | סדרות זמן קליניות | 46,520 חולים | 58,976 אשפוזים ביחידה לטיפול נמרץ (ICU) | תלוי במשימה | אין התפלגות מחלקות אחת עבור כל מסד הנתונים | לא רלוונטי – לא בוצע פיצול ניסיוני | דוגמה ליישום הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | International Skin Imaging Collaboration (ISIC) Challenge | סיווג נגעים בעור | תמונות דרמוסקופיות | לא רלוונטי – סט נתוני תמונות | 25,31 תמונות אימון | 8 קטגוריות אימון | AKIEC 867; BCC 3,323; BKL 2,624; DF 239; MEL 4,52; NV 12,875; VASC 253; SCC 628 | לא רלוונטי – לא בוצע פיצול ניסיוני | דוגמה ליישום הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://challenge.isic-archive.com/landing/2019/ |
| HAM10 | Harvard Dataverse / ISIC Archive | סיווג נגעים בעור | תמונות דרמוסקופיות | 7,470 נגעים ייחודיים | 10,015 תמונות | 7 | AKIEC 327; BCC 514; BKL 1,09; DF 15; MEL 1,13; NV 6,705; VASC 142 | לא רלוונטי – לא בוצע פיצול ניסיוני | דוגמה ליישום הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | סט נתוני OhioT1DM, הופץ באופן ציבורי למחקר | ניטור/ניבוי סוכרת | סדרות זמן קליניות | 12 משתפים | 24 קבצי XML על פני נתוני אימון/פיתוח ובדיקה | ניבוי גלוקוז רציף; איננו משימת סיווג קבועה | לא רלוונטי | קבצי אימון/פיתוח ובדיקה המוגדרים על ידי סט הנתונים; לא בוצע פיצול ניסיוני כאן | דוגמה ליישום הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://pmc.ncbi.nlm.nih.gov/articles/PMC781904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021; CBICA/University of Pennsylvania | סגמנטציה/סיווג של גידולי מוח | MRI | 2,040 מקרים בקוהורט התחרות | 1,251 מקרי אימון מתויגים; ארבע מודליות MRI לכל מקרה | תלוי במשימה | אין התפלגות מחלקות אחת עבור כל סט הנתונים | קוהורטים המוגדרים על ידי התחרות; לא בוצע פיצול ניסיוני כאן | דוגמה ליישום הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://www.med.upenn.edu/cbica/brats2021/ |
טבלה 2: מאפייני מערכי נתונים של שירותי בריאות והתאמת הפרוטוקול המוצע. הטבלה מסכמת את מקורות הנתונים, היישומים הקליניים, המודליות, מאפייני הדגימות, התפלגויות המחלקות, אסטרטגיות חלוקת מערכי הנתונים, סטטוס התיקוף ומידע על המקור עבור מערכי הנתונים של שירותי הבריאות שנבחנו בפרוטוקול. מערך הנתונים Pima Indians Diabetes משמש כדוגמה המרכזית לתיקוף הפרוטוקול.
| פריט הגדרה | הגדרת תיקוף מעשית** | סטטוס / פרשנות |
| ערכת נתונים | Pima Indians Diabetes Dataset | ערכת נתונים לתיקוף ניסיוני מעשי |
| אלגוריתם / מודל | מודל חיזוי טבלאי לסיווג בינארי של סוכרת | השתמש בשם הארכיטקטורה המדויק מתיעוד הניסוי אם תועד בנפרד |
| קצב למידה | 0.01 | הגדרה ניסיונית |
| אופטימייזר | Adam | הגדרה ניסיונית |
| גודל אצווה (Batch Size) | 32 | הגדרה ניסיונית |
| מספר תקופות (Epochs) מקסימלי | 10 | הגדרה ניסיונית |
| פונקציית הפסד | Cross-Entropy | הגדרה ניסיונית |
| פונקציית אקטיבציה | ReLU | הגדרה ניסיונית |
| Dropout | 0.5 | הגדרה ניסיונית |
| דעיכת משקולות (Weight Decay) | 1e-4 | הגדרה ניסיונית |
| נורמליזציה של אצווה (Batch Normalization) | מופעל | הגדרה ניסיונית |
| העשרת נתונים / איזון מחלקות | מופעל | ציין SMOTE רק אם הוא הופעל בפועל בהרצה המדווחת |
| אסטרטגיית תיקוף | 5-fold cross-validation | הגדרה ניסיונית |
| עצירה מוקדמת | Patience = 10 epochs | הגדרה ניסיונית |
| זרע אקראי (Random Seed) | 42 | השתמש בהגדרת הזרע המדויקת שתועדה עבור הניסוי |
| הרצות חוזרות | 10 הרצות עצמאיות באמצעות זרעים אקראיים שונים | ניתוח שחזוריות ניסיונית |
| גודל תמונת קלט | לא רלוונטי | ערכת נתוני Pima היא טבלאית |
| מימד תכונות | 512 | השתמש רק אם זהו ייצוג התכונות הסופי שיושם |
| ניתנות להסבר | SHAP + LIME; הסבר קונטרפקטואלי מוצג באיור 6 | ניתוח XAI מדווח מעשי |
| מדדי הערכה | Accuracy, precision, recall, specificity, F1-score, MCC, AUC-ROC, AP | מדדי הערכה ניסיוניים מדווחים |
| חומרה | NVIDIA GPU | החל בדגם ה-GPU המדויק אם תועד |
| תוכנה / מסגרת עבודה (Framework) | Python 3.1; Scikit-learn; רכיבי מסגרת עבודה ששימשו את המימוש | השתמש בגרסאות חבילה מדויקות אם תועדו |
טבלה 3: סביבה חישובית, ארכיטקטורת מודל ותצורת היפר-פרמטרים ששימשה ליישום הפרוטוקול. הטבלה מפרטת את הפלטפורמה החישובית, סביבת התוכנה, ארכיטקטורת המודל, תצורת הקלט, פרמטרי האופטימיזציה, הגדרות הרגולריזציה ופרמטרי השחזור ששימשו ליישום תהליך העבודה המוצע של XAI.
| פרמטר | מפרט / תוצאה מייצגים |
| אופטימייזר | אדם |
| קצב למידה | 0.001 |
| גודל סדרה | 32 |
| מספר תקופות מקסימלי | 100 |
| סבלנות לעצירה מוקדמת | 10 תקופות (epochs) |
| האיפוק (epoch) המיטבי | 78 |
| עידן עצירה מוקדמת (Early-stopping epoch) | 88 |
| הפסד האימות הנמוך ביותר | 0.142 |
| דיוק האימות הטוב ביותר | 94.6% |
| פלט אימון | ההפסד של האימון והתיקוף פחתו והתכנסו |
| פלט תיקוף | דיוק האימון והתיקוף עלו והתייצבו |
| תוצאת האופטימיזציה | ביצועי המודל הטובים ביותר הושגו באפוקה 78 |
| בקרת התאמת-יתר | עצירה מוקדמת (Early stopping) מנעה אופטימיזציה נוספת מעבר לאפוק (epoch) הטוב ביותר שנבחר |
טבלה 4: מפרטי אימון המודל ותוצאות האופטימיזציה. הטבלה מסכמת את האופטימייזר, קצב הלמידה, גודל האצווה (batch size), מספר תקופות האימון המקסימלי (epochs), ביצועי התיקוף, התכנסות האימון, תוצאת האופטימיזציה ואסטרטגיית הבקרת overfitting ששימשו במהלך פיתוח המודל.
| מודל | דיוק (%) | דיוק חיזוי (%) | רגישות (%) | סגוליות (%) | מדד F1 (%) | MCC | AUC (ROC) | AP (PR) |
| מודל XAI המוצע | 93.5 | 94.5 | 92.4 | 94.6 | 93.4 | 0.87 | 0.96 | 0.94 |
| למידה עמוקה (CNN) | 89.1 | 89.8 | 8.1 | 90 | 8.9 | 0.78 | 0.92 | 0.9 |
| Random Forest | 84.3 | 85 | 83.2 | 85.7 | 84.1 | 0.67 | 0.86 | 0.81 |
| מכונת וקטורים תומכים (SVM) | 78.6 | 79.3 | 7.1 | 80 | 78.2 | 0.54 | 0.79 | 0.72 |
| קו בסיס (מחלקה דומיננטית) | 62.1 | 62.1 | 10 | 0 | 76.6 | 0 | 0.5 | 0.5 |
טבלה 5: השוואת ביצועים חיזויים של המודלים שהוערכו. הטבלה משווה בין מודל ה-XAI המוצע לבין מודלי הבסיס שהוערכו באמצעות דיוק (accuracy), ערך ניבוי חיובי (precision), רגישות (recall), סגוליות (specificity), מדד F1, מקדם המתיוס (Matthews correlation coefficient), השטח תחת עקומת ה-ROC, ודיוק ממוצע (average precision).
| ניתוח תיקוף | השוואה / מדד | מבחן סטטיסטי | סטטיסטי המבחן | pערך-p | תוצאה ניסויית / רווח בר-סמך של 95% |
| ולידציה צולבת חמיש-מגלית (Five-fold cross-validation) | דיוק | תיאורי (ממוצע ± סטיית תקן (SD) | — | — | 93.01 ± 0.48% |
| ולידציה צולבת חמיש-מגלה (Five-fold cross-validation) | AUC-ROC | תיאורי (ממוצע ± סטיית תקן (SD) | — | — | 0.954 ± 0.007 |
| valida-צלב חמיש-מגלי (Five-fold cross-validation) | דיוק | תיאורי (ממוצע ± סטיית תקן (SD) | — | — | 92.42 ± 0.87% |
| ולידציה צולבת של חמישה קיפולים (Five-fold cross-validation) | הסליקה (Recall) | תיאורי (ממוצע ± סטיית תקן (SD) | — | — | 93.02 ± 0.45% |
| validaציה צולבת חומשית (Five-fold cross-validation) | מדד F1 (F1-score) | תיאורי (ממוצע ± סטיית תקן (SD) | — | — | 92.72 ± 0.62% |
| רווח סמך בוטסטראפ של 95% | דיוק | בוטסטראפ (1,0 דגימות חוזרות) | — | — | 0.935 [0.897, 0.973] |
| רווח בר סמך בוטסטראפ של 95% | דיוק | בוטסטראפ (1,0 דגימות חוזרות) | — | — | 0.930 [0.890, 0.970] |
| רווח בר-סמך של 95% בשיטת בוטסטראפ (bootstrap) | רגישות (Recall) | בוטסטראפ (1,0 דגימות חוזרות) | — | — | 0.922 [0.880, 0.963] |
| רווח בר סמך בוטסטראפ של 95% | מדד F1 | בוטסטראפ (1,0 דגימות חוזרות) | — | — | 0.926 [0.887, 0.965] |
| רווח בר סמך בוטסטראפ של 95% | AUC-ROC | בוטסטראפ (1,0 דגימות חוזרות) | — | — | 0.958 [0.931, 0.984] |
| המודל המוצע לעומת CNN | דיוק (%) | מבחן מקנמר (McNemar's test) | 9.32 | 0.0023 | מובהק (α = 0.05) |
| המודל המוצע לעומת CNN | AUC-ROC | מבחן דלונג (DeLong's test) | 3.87 | 0.0001 | מובהק (α = 0.05) |
| המודל המוצע לעומת CNN | מדד F1 | בוטסטראפ מזווג (1,0 דגימות חוזרות) | 2.81 | 0.0044 | מובהק (α = 0.05) |
| המודל המוצע לעומת יער אקראי (Random Forest) | דיוק (%) | מבחן מקנמר (McNemar's test) | 14.27 | 0.0002 | מובהק (α = 0.05) |
| המודל המוצע לעומת Random Forest | AUC-ROC | מבחן דלונג (DeLong's test) | 5.86 | <0.0001 | מובהק (α = 0.05) |
| המודל המוצע לעומת יער אקראי (Random Forest) | מדד F1 (F1-score) | בוטסטראפ מזווג (1,0 דגימות חוזרות) | 4.03 | 0.0003 | מובהק (α = 0.05) |
| המודל המוצע לעומת SVM | דיוק (%) | מבחן מקנמר (McNemar's test) | 16.08 | <0.0001 | מובהק (α = 0.05) |
| המודל המוצע לעומת SVM | AUC-ROC | מבחן דלונג (DeLong's test) | 6.95 | <0.0001 | מובהק (α = 0.05) |
| המודל המוצע לעומת SVM | מדד F1 | בוטסטראפ מזווג (1,0 דגימות חוזרות) | 4.62 | <0.0001 | מובהק (α = 0.05) |
| שחזוריות בריצות חוזרות (10 ריצות עצמאיות) | AUC-ROC | תיאורי (ממוצע ± סטיות תקן (SD) | — | — | 0.957 ± 0.008 |
| שחזוריות בריצות חוזרות (10 ריצות עצמאיות) | דיוק (%) | תיאורי (ממוצע ± סטיות תקן (SD) | — | — | 93.24 ± 0.74% |
| שחזוריות בריצות חוזרות (10 ריצות עצמאיות) | מדד F1 (%) | תיאורי (ממוצע ± סטיית תקן (SD) | — | — | 92.35 ± 0.92% |
טבלה 6: תוצאות תיקוף סטטיסטי ושחזור שהתקבלו מהיישום הניסויי באמצעות מערך הנתונים של סוכרת באינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset). הטבלה מסכמת ביצועי תיקוף צולב של חמישה קיפולים (five-fold cross-validation), רווחי סמך של 95% מבוססי Bootstrap, השוואות סטטיסטיות של המודל המוצע מול מודלי הבסיס, ושחזור של הרצות חוזרות על פני 10 זרעים (seeds) אקראיים ועצמאיים. תיקוף חיצוני והערכה של מומחים קליניים לא בוצעו בתיקוף הנוכחי.
| לא. | פריט ברשימת הבדיקה | תיעוד נדרש | הקלטה / אימות מומלצים |
| 1 | סביבת תוכנה | מערכת הפעלה, שפת תכנות וסביבת תוכנה | יש לתעד את הגרסאות המדויקות של מערכת ההפעלה ושפת התכנות. |
| 2 | גרסאות תוכנה וספריות | גרסאות של ספריות תוכנה וחבילות עיקריות | יש לתעד את השמות המדויקים של החבילות/ספריות ואת גרסאותיהן. |
| 3 | מפרט חומרה | מפרטי CPU, GPU, RAM, אחסון ומאיצים | יש לתעד את החומרה המחשובית ששימשה לניסוי. |
| 4 | זיהוי מערכי נתונים | שם מערך הנתונים, מקור, גרסה ומידע על גישה | יש לתעד את מקור מערך הנתונים/הגרסה המדויקת ואת תאריך הגישה, במידה ורלוונטי. |
| 5 | מאפייני מערך הנתונים | גודל המדגם והתפלגות המחלקות | יש לתעד את סך הדגימות ואת התפלגות המחלקות עבור כל פיצול. |
| 6 | חלוקת מערכי נתונים | אסטרטגיה של אימון, תיקוף ומערך בדיקה עצמאי | תעד את פרופורציות/מספרי הפיצול ואת השכוב (stratification). |
| 7 | מניעת דליפת נתונים | נוהל למניעת דליפת מידע | הפרדת מסמכים/דגימות והערכת פרמטרי עיבוד מקדים עבור אימון בלבד. |
| 8 | פרמטרים של עיבוד מקדים | הגדרות ניקוי, טיפול בערכים חסרים, נורמליזציה, קידוד וטרנספורמציה | יש לתעד את כל פעולות העיבוד המקדים ואת ערכי הפרמטרים. |
| 9 | העשרת נתונים | שיטות הרחבה והגדרות פרמטרים, במידה ורלוונטי | תעד שיטות, הסתברויות וטווחים של פרמטרים. |
| 10 | ארכיטקטורת המודל | ארכיטקטורה ותצורה סופיות של המודל | תעד את סוג המודל, השכבות/רכיבים, הממדים ופונקציות ההפעלה. |
| 11 | היפר-פרמטרים | היפר-פרמטרים של אימון ואופטימיזציה | יש לתעד את קצב הלמידה (learning rate), גודל האצווה (batch size), האופטימייזר (optimizer), מספר האיטרציות (epochs), עצירה מוקדמת (early stopping) ואת הפרמטרים שעברו כוונון. |
| 12 | זרעים אקראיים | זרעים אקראיים ששימשו להרצה הניתנת לשחזור | תעדו את הגרעינים (seeds) עבור פיצול, אתחול והרצות חוזרות. |
| 13 | תצורת אימון | הליך האימון ואסטרטגיית בחירת מודל | תיקוף מסמכים, נקודות ביקורת וקריטריונים לבחירת מודל. |
| 14 | מדדי הערכה | מדדי הערכה סטטיסטיים וחיזויים שהוגדרו מראש | יש לתעד את כל מדדי הביצועים שדווחו. |
| 15 | רווחי סמך | מרווחי אי-ודאות עבור מדדי ביצועים | יש לתעד את נוהל הערכת רווחי הסמך (CI) ואת דגימות ה-bootstrap החוזרות במידה והן רלוונטיות. |
| 16 | מבחנים סטטיסטיים | פרוצדורות סטטיסטיות להשוואת מודלים | תעד את המבחן, את הסטטיסטיקה, את ערך ה-p, את סף המובהקות ואת ההנחות. |
| 17 | ניתוח הרצות חוזרות | הרצות עצמאיות באמצעות זרעים אקראיים שונים | יש לרשום את מספר ההרצות ואת הממוצע ± סטיית תקן של מדדי מפתח. |
| 18 | תצורת הניתנות להסבר (Explainability configuration) | שיטות להסברתיות והגדרות פרמטרים | תעד את SHAP, LIME, Grad-CAM, תשומת לב (attention), סיטואציות נגדיות (counterfactual) או הגדרות רלוונטיות אחרות. |
| 19 | הערכת יכולת ההסבר (Explainability assessment) | הערכה אובייקטיבית של מהימנות ותועלת ההסבר | תיעוד של נאמנות, יציבות, חוסר נאמנות, לוקליזציה והערכת מומחים במידת הרלוונטיות. |
| 20 | ארטיפקטים של המודל | משקולות של מודל מאומן וקבצי הגדרה | ארכוב של המודל המאומן הסופי, הארכיטקטורה/התצורה ומידע על הברירה. |
| 21 | זמינות הקוד | הקוד הנדרש לעיבוד מקדים, אימון, הערכה ויצירת הסברים | מאגר רשומות או מידע על גישה מבוקרת לקוד, במידה ורלוונטי. |
| 22 | תיעוד ביצוע | פקודות, סקריפטים, קבצי הגדרה והוראות | יש לתעד את הפקודות ואת התצורה הדרושים לשחזור של זרימת העבודה. |
| 23 | תיעוד פלט | תחזיות, תוצאות הערכה, איורים ופלטי הסבר | ארכבו את הפלטים שהופקו וקשרו אותם לניסוי/להרצה המתאימים. |
| 24 | אימות הדירות (Reproducibility verification) | אימות עקביות בין הרצות עצמאיות | השוו את תוצאות ההרצות החוזרות ודווחו על מדדי שונות שהוגדרו מראש. |
טבלה 7: רשימת תיוג לשחזור לצורך שכפול עצמאי של תהליך העבודה המוצע ב-XAI. רשימת התיוג מפרטת את הדרישות החישוביות, דרישות מערך הנתונים, עיבוד מקדים, פיתוח מודל, הערכה, תיקוף סטטיסטי, יכולת הסבר ותיעוד הדרושים כדי לשחזר את תהליך העבודה הניסויי.