מסגרת ה-XAI המוצעת הוטמעה באמצעות מערך הנתונים Pima Indians Diabetes כמעערך נתונים מייצג של שירותי בריאות. מערך הנתונים Pima Indians Diabetes שימש כמערך הנתונים היחיד לתיקוף ניסיוני. כל תוצאות הניבוי, ההסביריות, הסטטיסטיקה והשחזור שדווחו הופקו ממערך נתונים זה. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10000, OhioT1DM ו-BraTS 2021 לא הוערכו באופן ניסיוני ונכללו רק כדוגמאות הממחישות את התשמישיות של הפרוטוקול הכללי על פני מודליות שונות של נתוני בריאות. מערך הנתונים המלא שימש לאחר הסרת רשומות לא תקינות וכפולות, וביצוע פעולות עיבוד מקדים מוגדרות לפני פיתוח המודל. מערך הנתונים חולק לתתי-קבוצות נפרדות של אימון, תיקוף ובדיקה באמצעות אסטרטגיית חלוקה שכבתית (stratified splitting) שהוגדרה מראש. עצמאות הדגימות בין שלוש תתי-הקבוצות נשמרה כדי למזער את האפשרות לדליפת נתונים.
המודל החזוי הוגדר באמצעות הארכיטקטורה וההיפר-פרמטרים שהוגדרו מראש. המודל אומן באמצעות אופטימייזר Adam עם קצב למידה וגודל אצווה (batch size) שהוגדרו מראש למשך עד 100 תקופות (epochs). הוחלה עצירה מוקדמת (Early stopping) בהתבסס על הפסד תיקוף (validation loss), והמודל המקביל לביצועי התיקוף הטובים ביותר נשמר. נקודות התחלה אקראיות (Random seeds) הוגדרו עבור חלוקת מערך הנתונים, אתחול המודל וניסויים חוזרים כדי לשפר את השחזוריות.
המודל המאומן הוערך על קובץ הבדיקה העצמאי באמצעות מדדי דיוק (accuracy), דיוק חיובי (precision), רגישות (recall), סגוליות (specificity), מדד F1, מקדם המתיוס (MCC), שטח תחת עקומת מאפיין תגובה של מקלט (AUC-ROC) ודיוק ממוצע (AP). המודל המוצע הושווה למודלי הבסיס שהוגדרו מראש תוך שימוש בהליכי עיבוד מקדים, חלוקת נתונים ופרוטוקולי הערכה זהים. עקומות מאפיין תגובה של מקלט (ROC), עקומות דיוק-רגישות ומטריצת בלבול הופקו מניבוי המודל על קובץ הבדיקה העצמאי.
ביצועי וולידציה צולבת של חמישה קיפולים (Five-fold cross-validation) בוצעו על נתוני האימון כדי להעריך את יציבות הביצועים. מרווחי סמך של 95% הוערכו עבור מדדי הביצועים המרכזיים, והשוואות סטטיסטיות שהוגדרו מראש בוצעו בין המודל המוצע למודלי הבסיס.
תיקוף צולב חומש (Five-fold cross-validation) הניב דיוק של 93.01 ± 0.48%, AUC-ROC של 0.954 ± 0.007, דיוק חזוי (precision) של 92.42 ± 0.87%, רגישות (recall) של 93.02 ± 0.45%, ומדד F1 של 92.72 ± 0.62%. רווחי הסמך של 95% בשיטת bootstrap שהוערכו מ-1,000 דגימות חוזרות היו 0.897–0.973 עבור הדיוק, 0.890–0.970 עבור הדיוק החזוי, 0.880–0.963 עבור הרגישות, 0.887–0.965 עבור מדד F1, ו-0.931–0.984 עבור AUC-ROC. השוואות סטטיסטיות מול מודלי הבסיס CNN, Random Forest ו-SVM בוצעו באמצעות מבחן McNemar עבור הדיוק, מבחן DeLong עבור AUC-ROC, ובדיקת bootstrap מזווגת עם 1,000 דגימות חוזרות עבור מדד F1.
תהליך האימון וההערכה המלא חזר על עצמו ב-10 הרצות עצמאיות תוך שימוש בגרעיני אקראיות (random seeds) שונים. ההרצות החוזרות הניבו AUC-ROC של 0.957 ± 0.008, דיוק של 93.24 ± 0.74%, וציון F1 של 92.35 ± 0.92%, המעידים על שונות נמוכה יחסית בין ההרצות החוזרות. מדדי הביצועים שהתקבלו לאורך ההרצות החוזרות סוכמו באמצעות הממוצע וסטיית התקן. השונות בין ההרצות נבחנה כדי לקבוע האם ביצועי הניבוי נותרו יציבים תחת הרצה חוזרת.
בדוגמה מעשית זו לא בוצע תיקוף חיצוני כיוון שלא נעשה שימוש במערך נתונים חיצוני בלתי תלוי. בהתאם לכך, כל תוצאות הניבוי, הסטטיסטיקה והשחזור שדווחו הושגו מתוך מערך הנתונים של סוכרת בקרב אינדיאנים פימה (Pima Indians Diabetes Dataset) תוך שימוש בחלוקות שהוגדרו מראש לאימון, תיקוף ובדיקה עצמאית. תיקוף חיצוני נשאר בפרוטוקול כהליך אופציונלי עבור יישומים שבהם זמין מערך נתונים בלתי תלוי ממוסד, אוכלוסייה, אזור גיאוגרפי או תקופת זמן שונים.
הסברי מודלים הופקו באמצעות טכניקות הסבריות הישימות למסד הנתונים הטבלאי Pima Indians Diabetes, כולל SHAP ו-LIME. חשיבות תכונות גלובלית הוערכה, והסברים מקומיים ספציפיים לחולה הופקו באמצעות דגימות בדיקה שנשמרו בנפרד. פלטי ההסברים תועדו יחד עם תחזיות המודל וערכי התכונות המתאימים, כדי להקל על השחזור ועל הפרשנות העוקבת.
למען הבהירות, הדוגמה המעשית הנוכחית כללה את תשעת שלבי זרימת העבודה המרכזיים שזוהו בטבלה 1. תיקוף חיצוני והערכה של מומחה קליני נשמרו כמודולי תיקוף אופציונליים של הפרוטוקול הכללי. תיקוף חיצוני לא בוצע כיוון שלא נעשה שימוש במערך נתונים חיצוני עצמאי, והערכה של מומחה קליני לא בוצעה כיוון שלא נכלל פאנל רשמי להערכת מומחים בדוגמה המעשית הנוכחית. בהתאם לכך, מודולים אופציונליים אלה אינם נחשבים כחלק מזרימת העבודה הניסויית בתשעת השלבים ואינם מדווחים כתוצאות ניסוייות.
פרוצדורות העיבוד המקדים וחלוקת מערך הנתונים הניבו מערך נתונים סטנדרטי המתאים לפיתוח המודל. רשומות כפולות ובלתי עקביות הוסרו, ערכים חסרים טופלו בהתאם לאסטרטגיה שהוגדרה מראש, מאפיינים מספריים נסנדרו (standardized), ומערך הנתונים חולק לתתי-קבוצות בלתי תלויות של אימון, תיקוף ובדיקה. מאפייני מערך הנתונים שהתקבל ופרוצדורות העיבוד המקדים מסוכמים בטבלה 2. זרימת העבודה הכללית להכנה ועיבוד מקדים של מערך נתוני שירותי בריאות מומחשת באיור 2, בעוד שזרימת העבודה של ההכנה הניסויית, העיבוד המקדים, החלוקה והערכת האיכות שיושמה ספציפית על מערך נתוני הסוכרת של ඉנדיינים פימה (Pima Indians Diabetes Dataset) מוצגת באיור 3. סביבת החישוב הסופית, ארכיטקטורת המודל ותצורת ההיפר-פרמטרים ששימשו להפקת התוצאות המדווחות מסוכמים בטבלה 3.
ביצוע סעיפים 3 ו-4 הניב מערך נתונים סטנדרטי של שירותי בריאות המתאים לפיתוח מודל. הליכי עיבוד המקדם הסירו רשומות כפולות ובלתי עקביות, השלימו ערכים חסרים, תיקננו מאפיינים מספריים, קידדו משתנים קטגוריאליים במידת הצורך, וחילקו את מערך הנתונים לתתי-קבוצות של אימון, תיקוף ובדיקה. הנתונים שהתקבלו סיפקו את הקלט הסטנדרטי הנדרש לפיתוח המודל בהמשך.
לאחר השלמת סעיפים 5 ו-6, המודל שהוגדר הפגין התכנסות יציבה במהלך האימון. עקומות הלמידה הראו ירידה מקבילה בהפסדי האימון והתיקוף (validation losses) ועלייה בדיוק האימון והתיקוף. אופטימיזציה של ההיפר-פרמטרים שיפרה את הכללה של המודל, ללא עדויות להתאמת-יתר (overfitting) משמעותית. כדי להבטיח שחזור, המודל האופטימלי ארכב יחד עם הארכיטקטורה הסופית, הגדרות ההיפר-פרמטרים, גרסאות התוכנה, הזרעים האקראיים (random seeds) ומשקולות המודל המאומן. מפרטי אימון המודל ותוצאות האופטימיזציה מסוכמים ב- טבלה 4, ועקומות הלמידה של האימון והתיקוף המתאימות מוצגות ב- איור 4.
בסעיף 7 הוערה ביצועי הניבוי של המודל באמצעות מדדי ביצועים סטנדרטיים. מדדי הסיווג שהוערכו כללו דיוק (accuracy), דיוק חיובי (precision), רגישות (recall), סגוליות (specificity), מדד F1, מקדם המתאם של מתיוס (MCC), שטח תחת עקומת ROC (AUC-ROC) ותوسطי דיוק (AP). המודל המוצע הושווה למודלי הבסיס שהוגדרו מראש תוך שימוש באותן חלוקות של מערכי הנתונים, נהלי עיבוד מקדמי ופרוטוקול הערכה. השוואת ביצועי הניבוי מוצגת ב- טבלה 5, בעוד שעקומות ה-ROC, עקומות דיוק- recall (precision-recall), מטריצת בלבול (confusion matrix) ומדדי ביצועים השוואתיים מוצגים ב- איור 5.
בהמשך לסעיף 8, הופקו הסברים גלובליים ומקומיים לתחזיות המודל כדי להעריך את יכולת הפרשנות שלו. הסברים למודל הופקו באמצעות SHAP ו-LIME עבור מערך הנתונים הטבולרי Pima Indians Diabetes, והופק הסבר קונטרפקטואלי (counterfactual) ספציפי למטופל כדי להמחיש שינוי בתחזית. SHAP שימש להפקת ויזואליזציות של חשיבות תכונות גלובלית, תרשימי מפל (waterfall) ספציפיים למטופל ותלות של תכונות, בעוד ש-LIME שימש להפקת הסברים מקומיים מדגימות בדיקה שהושארו בחוץ. פלטי הניתנות להסבר המתאימים מוצגים ב-איור 6.
השלב הסופי של הפרוטוקול העריך את המהימנות הסטטיסטית ואת השחזוריות של זרימת העבודה. זרימת העבודה המלאה חוזרה ב-10 הרצות עצמאיות תוך שימוש בזרעים אקראיים (random seeds) שונים, תוך שמירה על אותה אסטרטגיה לחלוקת מערך הנתונים, פרמטרי עיבוד מקדמי, ארכיטקטורת מודל, היפר-פרמטרים, סביבת תוכנה ונהלי הערכה. ההרצות החוזרות הניבו AUC-ROC של 0.957 ± 0.008, דיוק של 93.24 ± 0.74% ו-F1-score של 92.35 ± 0.92%, מה שמעיד על שונות נמוכה יחסית בין ההרצות החוזרות.
יציבות ההסברים לא הוערכה באופן כמותי בתהליך התיקוף הנוכחי. למרות שהופקו הסברי SHAP ו-LIME עבור מערך הנתונים Pima Indians Diabetes, לא בוצע ניתוח נפרד של מתאם דרגות (rank-correlation) או חפיפת מאפיינים בין הרצות שונות. לפיכך, לא מדווחים מדדים מספריים של יציבות ההסברים או של הסכמת ייחוס (attribution-agreement). הערכה כמותית של יציבות ההסברים נשמרת בפרוטוקול הכללי כהליך שחזור אופציונלי עבור יישומים שבהם פלטי הסברים חוזרים זמינים.
השוואות סטטיסטיות הוערכו באמצעות סף מובהקות שנקבע מראש של p < 0.05. במקרים המתאימים נעשה שימוש במבחנים סטטיסטיים דו-צדדיים, והסטטיסטיקות של המבחנים, ערכי ה-p ורווחי סמך של 95% תואמים דווחו כדי לכמת את המובהקות הסטטיסטית ואת חוסר הוודאות של הפרשים שנצפו בביצועים. תוצאות התיקוף הסטטיסטי הניסויי והשחזוריות, כולל ביצועי תיקוף צולב, רווחי סמך, השוואות סטטיסטיות ושונות בין הרצות חוזרות, מסוכמות ב-טבלה 6. בדיקות הסטטיסטיקה ואנליזות השחזוריות התואמות מוצגות ב-איור 7.
תוצאות אלו סיפקו ראיה ניסיונית ליציבות חיזויית ולשחזוריות תחת התנאים החישוביים ומערך הנתונים שנבדקו. הסביבה החישובית, מאפייני מערך הנתונים, הליכי עיבוד מקדימה, תצורת המודל, הניתוחים הסטטיסטיים והגדרות ההסביריות הנדרשות לשחזור עצמאי תועדו בהתאם לרשימת הבדיקה לשחזוריות המוצגת ב-טבלה 7. הערכה של מומחה קליני עבור פלטי ה-XAI שהופקו לא בוצעה בדוגמת התיקוף המעשית של העבודה הנוכחית.
באופן כללי, יישום הפרוטוקול הניב סט רהיטים של נתוני בריאות סטנדרטיים המתאימים לפיתוח מודל AI ומודל מותאם באמצעות הגדרות היפר-פרמטרים שהוגדרו מראש. זרימת העבודה אפשרה הערכה סיסטמטית של ביצועי הניבוי, יצירת הסברים למודל באמצעות טכניקות XAI רלוונטיות, והערכה סטטיסטית של חוסן המודל והיכולת לשחזר את תוצאותיו. יחד, התוצאות הדגימו את היישום והשחזור של זרימת עבודת ה-XAI המוצעת תחת התנאים הניסיוניים שנבחנו בדוגמת התיקוף המעשית.

איור 1: זרימת עבודה מרכזית בתשעה שלבים לפיתוח מודלים של בינה מלאכותית שניתנים לשחזור ולהסבר בתחום הבריאות. זרימת העבודה מורכבת מ- (1) הגדרת משימת ניבוי רפואית, (2) הגדרת סביבה חישובית, (3) רכישת נתונים ותיקוף, (4) עיבוד מקדים של נתונים, (5) חלוקת מערך הנתונים, (6) אימון מודל ניבוי, (7) הערכת ביצועי הניבוי, (8) ניתוח יכולת הסבר, ו-(9) תיקוף סטטיסטי והערכת יכולת שחזור. תיקוף חיצוני והערכה על ידי מומחים קליניים נחשבים כהרחבות אופציונליות לפרוטוקול ואינם כלולים בזרימת העבודה המרכזית בתשעה השלבים. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 2: זרימת עבודה להכנה ועיבוד מקדים של מערך נתונים רפואי. (A) רכישת נתונים רפואיים מרשומות קליניות, דימות רפואי, אותות פיזיולוגיים ומקורות נתונים מולטי-מודאליים. (B) אינטגרציה ועיבוד מקדים של נתונים, כולל טיפול בערכים חסרים, נורמליזציה, הסרת רעשים והגברה. (C) חלוקת מערך הנתונים לתתי-קבוצות של אימון, תיקוף ובדיקה. (D) הערכת איכות המציגה התפלגות מחלקות, נורמליזציה של מאפיינים ותוצרי עיבוד מקדים לפני פיתוח המודל. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 3: תהליך עבודה ניסיוני להכנה, עיבוד מקדים, חלוקה והערכת איכות של מערך הנתונים של סוכרת בקרב אינדיאנים מפומא (Pima Indians Diabetes Dataset). תהליך העבודה כולל רכישת קובץ נתונים, הערכת איכות הנתונים, טיפול בערכים לא תקינים ובערכים חסרים, סטנדרטיזציה של מאפיינים מספריים, חלוקת קובץ הנתונים לתתי-קבוצות של אימון, תיקוף ובדיקה עצמאית, ואימות איכות סופי לפני פיתוח המודל. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.

איור 4: עקומות למידה של אימון ותיקוף ניסיוניים של המודל המוצע באמצעות מערך הנתונים של סוכרת בקרב אינדיאנים מפנתימה (Pima Indians Diabetes Dataset). (A) הפסד אימון ותיקוף לאורך תקופת האימון המלאה. (B) דיוק האימון והתיקוף לאורך כל תקופת האימון. (C) תצוגה מוגדלת של ההפסד (loss) במהלך תקופות (epochs) 50–100. (ד׳) תצוגה מוגדלת של הדיוק במהלך תקופות (epochs) 50–100. ביצועי התיקוף (validation) הטובים ביותר הושגו בתקופה 78, עם הפסד תיקוף של 0.142 ודיוק תיקוף של 94.6%. עצירה מוקדמת הופעלה בתקופה 88 תוך שימוש בסבלנות (patience) של 10 תקופות. אנא לחצו כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 5: הערכה ניסויית של ביצועי הניבוי של מסגרת ה-XAI המוצעת באמצעות קבוצת הבדיקה העצמאית (n = 154). (A) עקומת מאפייני תפעול המקלט (ROC) המראה את ביצועי ההבחנה של מודל ה-XAI המוצע ומודלי הבסיס. (B) עקומות דיוק-recall (PR) המראות את ביצועי הדיוק וה-recall של מודל ה-XAI המוצע ומודלי הבסיס. (C) מטריצת בלבול של מודל ה-XAI המוצע על קבוצת הבדיקה העצמאית, עם הדיוק, הרגישות (recall) והסגוליות התואמות. (D) השוואה של הדיוק, הדיוק (precision), ה-recall, הסגוליות, מדד F1, מקדם המתאם של מטיוס (MCC), השטח תחת העקומה (AUC) של ROC והדיוק הממוצע (AP) בין המודלים שהוערכו. כל התוצאות הכמותיות המוצגות באיור זה תואמות את ניסוי התיקוף על מערך הנתונים של סוכרת בקרב אינדיאנים מפארמה (Pima Indians Diabetes Dataset). אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 6: תוצרי הסבריות שהופקו מניבויים של סט בדיקה בלתי תלוי עבור המודל המוצע, שאומן על מערך הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset). (A(תרשים סיכום SHAP גלובלי המראה את התפלגות תרומות המאפיינים על פני סט הבדיקה.)B) תרשים חשיבות מאפיינים של SHAP המבוסס על ערכי SHAP מוחלטים ממוצעים. (C) תרשים מפל (waterfall plot) של SHAP ספציפי למטופל, המראה את התרומות של מאפיינים בודדים להסתברות החזויה לסוכרת. (ד'(LIME) הסבר מקומי המציג את תרומות המאפיינים עבור חולה בדיקה מס' 125. (E) תרשים תלות של SHAP המראה את הקשר בין ערכי הגלוקוז לבין תרומות ה-SHAP שלהם. (F) הסבר נגדי-עובדתי (counterfactual) ספציפי למטופל, המציג את השינויים המינימליים במאפיינים הקשורים לשינוי בניבוי המודל. קיצורים: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 7: תיקוף סטטיסטי ניסיוני וניתוח הדירות של המודל המוצע באמצעות מערך הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset). (A) ביצועי אימות צולב של חמישה קיפולים על קבוצת האימון. (Bרווחי סמך bootstrap של 95% עבור ביצועי מערכת בדיקה בלתי תלויה.Cהשוואות סטטיסטיות מול מודלי בסיס, כולל המבחן הסטטיסטי, סטטיסטי המבחן, ערך p ורמת המובהקות.ד'עקביות ביצועים לאורך 10 הרצות עצמאיות באמצעות זרעי אקראיות (random seeds) שונים. לצורך בדיקת דיוק סיווג מזדווג נעשה שימוש במבחן מקנימר (McNemar's test), לבדיקת ROC-AUC במקרה של מתאם נעשה שימוש במבחן דלונג (DeLong's test), ולהשוואת מדד F1 נעשה שימוש בבדיקת בוטסטראפ (bootstrap) מזדווגת עם 1,000 דגימות חוזרות. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.
| שלב | פעילות הפרוטוקול | תוצאה צפויה | סטטוס ביצוע |
| 1 | בחירה ותיקוף של מערך הנתונים הבריאותי | מערך נתונים מאומת, יעד חיזוי, התפלגות מחלקות ומידע על איכות הנתונים | בוצע |
| 2 | הגדרת הסביבה החישובית | חומרה, תוכנה, ספריות, גרסאות ותצורה חישובית מאומתים | בוצע |
| 3 | עיבוד מקדים ובקרת איכות של הנתונים הבריאותיים | מערך נתונים נקי, מעובד וסטנדרטי | בוצע |
| 4 | חלוקת מערך הנתונים | מערכי נתונים עצמאיים לאימון, תיקוף ובדיקה | בוצע |
| 5 | פיתוח ואופטימיזציה של מודל חיזוי/XAI | ארכיטקטורת מודל והיפר-פרמטרים סופיים | בוצע |
| 6 | אימון ושמירת המודל | מודל מאומן, נקודת שמירה (checkpoint), תצורת אימון ולוגים | בוצע |
| 7 | הערכת ביצועים חיזויים וחישוביים | מדדי ביצועים של מערך הבדיקה והשוואות ביצועים | בוצע |
| 8 | הפקה והערכה של פלטי הסבר | פלטי SHAP/LIME ופלטי הסבר רלוונטיים | בוצע |
| 9 | ביצוע תיקוף סטטיסטי והערכת שחזור | רווחי סמך, מבחנים סטטיסטיים, תוצאות של הרצות חוזרות ומדדי שחזור | בוצע |
טבלה 1: סיכום של זרימת העבודה של פרוטוקול הליבה בן תשעת השלבים, כפי שיושם בוולידציה המעשית באמצעות מערך הנתונים של סוכרת בקרב אינדיאנים מפאימה (Pima Indians Diabetes Dataset). הטבלה מבדילה בין תשעת השלבים שיושמו בדוגמה המעשית של מערך הנתונים של סוכרת בקרב אינדיאנים מפאימה, לבין וולידציה חיצונית והערכה של מומחה קליני, אשר נשמרים כרכיבים אופציונליים של הפרוטוקול הכללי.
| מערך נתונים | מקור הנתונים | יישום קליני | מודליות נתונים | נבדקים/רשומות | דגימות | מחלקות | התפלגות מחלקות | אימון/תיקוף/בדיקה | תפקיד במחקר הנוכחי | סטטוס תיקוף | URL של המקור |
| Pima Indians Diabetes Dataset | UCI Machine Learning Repository | חיזוי סוכרת | טבלאי קליני | 768 רשומות | 768 | 2 | 500 לא סוכרתיים; 268 סוכרתיים | 60% / 20% / 20% | מערך נתונים עיקרי לתיקוף ניסיוני | בוצע – זרימת עבודה מרכזית מלאה בתשעה שלבים | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI Genomic Data Commons (GDC), פרויקט TCGA-BRCA | סיווג סרטן השד | קליני + היסטופתולוגיה | 1,098 מקרים | תלוי במערך הנתונים לפי סוג הנתונים | תלוי בנקודת הקצה | אין התפלגות מחלקות אחידה לכל מערך הנתונים | לא רלוונטי – לא בוצע פיצול ניסיוני | דוגמה ליישומיות הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomic Data Commons (GDC), פרויקט TCGA-UCEC | סיווג סרטן רירית הרחם | קליני + היסטופתולוגיה | קוהורט הפרויקט; הגודל תלוי בסוג הנתונים ובמסננים שנבחרו | תלוי במערך הנתונים לפי סוג הנתונים | תלוי בנקודת הקצה | אין התפלגות מחלקות אחידה לכל מערך הנתונים | לא רלוונטי – לא בוצע פיצול ניסיוני | דוגמה ליישומיות הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, MIMIC-III Clinical Database v1.4 | חיזוי תוצאה קלינית | סדרות זמן קליניות | 46,520 חולים | 58,976 אשפוזים ביחידה לטיפול נמרץ | תלוי במשימה | אין התפלגות מחלקות אחידה לכל בסיס הנתונים | לא רלוונטי – לא בוצע פיצול ניסיוני | דוגמה ליישומיות הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | International Skin Imaging Collaboration (ISIC) Challenge | סיווג נגעים בעור | תמונות דרמוסקופיות | לא רלוונטי – מערך נתוני תמונות | 25,331 תמונות אימון | 8 קטגוריות אימון | AKIEC 867; BCC 3,323; BKL 2,624; DF 239; MEL 4,522; NV 12,875; VASC 253; SCC 628 | לא רלוונטי – לא בוצע פיצול ניסיוני | דוגמה ליישומיות הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://challenge.isic-archive.com/landing/2019/ |
| HAM10000 | Harvard Dataverse / ISIC Archive | סיווג נגעים בעור | תמונות דרמוסקופיות | 7,470 נגעים ייחודיים | 10,015 תמונות | 7 | AKIEC 327; BCC 514; BKL 1,099; DF 115; MEL 1,113; NV 6,705; VASC 142 | לא רלוונטי – לא בוצע פיצול ניסיוני | דוגמה ליישומיות הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | מערך נתוני OhioT1DM, הופץ באופן פומבי למחקר | ניטור/חיזוי סוכרת | סדרות זמן קליניות | 12 משתתפים | 24 קובצי XML לאורך נתוני אימון/פיתוח ובדיקה | חיזוי גלוקוז רציף; לא משימת סיווג קבועה | לא רלוונטי | קבצי אימון/פיתוח ובדיקה המוגדרים במערך הנתונים; לא בוצע פיצול ניסיוני כאן | דוגמה ליישומיות הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://pmc.ncbi.nlm.nih.gov/articles/PMC7881904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021; CBICA/University of Pennsylvania | סגמנטציה/סיווג של גידולי מוח | MRI | 2,040 מקרים בקוהורט האתגר | 1,251 מקרי אימון מתויגים; ארבע מודליות MRI למקרה | תלוי במשימה | אין התפלגות מחלקות אחידה לכל מערך הנתונים | קוהורטים המוגדרים על ידי האתגר; לא בוצע פיצול ניסיוני כאן | דוגמה ליישומיות הפרוטוקול בלבד | לא שימש לתיקוף ניסיוני | https://www.med.upenn.edu/cbica/brats2021/ |
טבלה 2: מאפייני מערכי נתונים של שירותי בריאות והשמישות של הפרוטוקול המוצע. הטבלה מסכמת את מקורות הנתונים, היישומים הקליניים, המודליות, מאפייני הדגימות, התפלגויות המחלקות, אסטרטגיות חלוקת מערכי הנתונים, סטטוס התיקוף ומידע על המקור עבור מערכי הנתונים של שירותי הבריאות שנבחנו בפרוטוקול. מערך הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset) משמש כדוגמה המרכזית לתיקוף הפרוטוקול.
| פריט תצורה | סביבת תיקוף מעשית | סטטוס / פרשנות |
| מערך נתונים | ערכה של נתוני סוכרת בקרב אינדיאנים מפמאי (Pima Indians Diabetes Dataset) | סט נתונים ממשי לתיקוף ניסיוני |
| אלגוריתם / מודל | מודל חיזוי טבלאי לסיווג בינארי של סוכרת | השתמש בשם הארכיטקטורה המדויק מתוך תיעוד הניסוי, אם הוא מתועד בנפרד |
| קצב למידה | 0.001 | הסדרה הניסיונית |
| אופטימייזר | אדם | הסגול הניסיוני |
| גודל סדרה | 32 | הגדרות ניסיוניות |
| מספר תקופות (Epochs) מרבי | 100 | הסדרה הניסויית |
| פונקציית הפסד | אנבלו-אנטירופיה (Cross-Entropy) | הסדרה הניסויית |
| פונקציית הפעלה | ReLU (יחידה ליניארית מוכתרת) | הסדרה ניסיונית |
| נשירה | 0.5 | הסדרה הניסויית |
| דעיכת משקל (Weight Decay) | 1e-4 | הסגירה הניסויית |
| נורמליזציה של אצוות (Batch Normalization) | הופעל | הגדרות הניסוי |
| העשרת נתונים / איזון מחלקות | מופעל | ציינו SMOTE רק אם הוא אכן יושם בהרצה המדווחת |
| אסטרטגיית תיקוף | valida-צלב 5-פעמים (5-fold cross-validation) | הגדרות הניסוי |
| עצירה מוקדמת | סבלנות (Patience) = 10 תקופות (epochs) | הסדרה הניסויית |
| זרע אקראי | 42 | השתמשו בתצורת ה-seed המדויקת שנרשמה עבור הניסוי |
| הרצות חוזרות | 10 הרצות עצמאיות תוך שימוש בגרעיני אקראיות שונים | ניתוח הדירות ניסויית |
| גודל תמונת הקלט | לא רלוונטי | ערכת הנתונים Pima היא טבולאית |
| מימד התכונה | 512 | השתמש בכך רק אם זהו ייצוג המאפיין הסופי המיושם |
| הסביריות | SHAP + LIME; הסבר קונטרהקטואלי המוצג באיור 6 | ניתוח XAI (בינה מלאכותית ניתנת להסבר) כפי שדווח בפועל |
| מדדי הערכה | דיוק (Accuracy), דיוק חזרתי (Precision), רגישות (Recall), סגוליות (Specificity), מדד F1 (F1-score), מקדם מתאם מאטיוס (MCC), שטח תחת עקומת ROC (AUC-ROC), דיוק ממוצע (AP) | מדדי הערכה ניסיונייםים שדווחו |
| חומרה | NVIDIA GPU | החלף בדגם ה-GPU המדויק אם תועד |
| תוכנה / מסגרת עבודה | Python 3.11; Scikit-learn; רכיבי מסגרת העבודה שבהם נעשה שימוש במימוש | השתמשו בגרסאות מדויקות של החבילות אם הן תועדו |
טבלה 3: סביבת חישוב, ארכיטקטורת מודל ותצורת היפר-פרמטרים ששימשה ליישום הפרוטוקול. הטבלה מפרטת את פלטפורמת החישוב, סביבת התוכנה, ארכיטקטורת המודל, תצורת הקלט, פרמטרי אופטימיזציה, הגדרות רגולריזציה ופרמטרי הדירות (reproducibility) ששימשו ליישום תהליך העבודה של ה-XAI המוצע.
| פרמטר | מפרט / תוצאה מייצגים |
| אופטימייזר | אדם |
| קצב למידה | 0.001 |
| גודל סדרה | 32 |
| מספר תקופות (epochs) מקסימלי | 100 |
| סבלנות לעצירה מוקדמת | 10 תקופות (epochs) |
| האיפוכ (Epoch) הטוב ביותר | 78 |
| איטרציה של עצירה מוקדמת | 88 |
| ההפסד המינימלי בתיקוף (Best validation loss) | 0.142 |
| דיוק האימות הטוב ביותר | 94.6% |
| פלט אימון | ההפסד של האימון והתיקוף פחתו והתכנסו |
| פלט אימות | דיוק האימון והתיקוף עלו והתייצבו |
| תוצאת האופטימיזציה | ביצועי המודל הטובים ביותר הושגו באיפוק (epoch) 78 |
| בקרת התאמת-יתר | עצירה מוקדמת מנעה אופטימיזציה נוספת מעבר לאפוק (epoch) הטוב ביותר שנבחר |
טבלה 4: מפרטי אימון המודל ותוצאות האופטימיזציה. הטבלה מסכמת את האופטימייזר, קצב הלמידה, גודל האשורה (batch size), מספר תקופות האימון (epochs) המקסימלי, ביצועי התיקוף, התבדרות האימון, תוצאת האופטימיזציה ואסטרטגיית הבקרת ההתאמת-יתר ששימשו במהלך פיתוח המודל.
| מודל | דיוק (%) | דיוק (%) | רגישות (Recall) (%) | סגוליות (%) | מדד F1 (%) | MCC | AUC (ROC) | AP (PR) |
| מודל XAI מוצע | 93.5 | 94.5 | 92.4 | 94.6 | 93.4 | 0.87 | 0.96 | 0.94 |
| למידה עמוקה (CNN) | 89.1 | 89.8 | 88.1 | 90 | 88.9 | 0.78 | 0.92 | 0.9 |
| יער אקראי (Random Forest) | 84.3 | 85 | 83.2 | 85.7 | 84.1 | 0.67 | 0.86 | 0.81 |
| מכונת וקטורים תומכים (SVM) | 78.6 | 79.3 | 77.1 | 80 | 78.2 | 0.54 | 0.79 | 0.72 |
| קו בסיס (מחלקת הרוב) | 62.1 | 62.1 | 100 | 0 | 76.6 | 0 | 0.5 | 0.5 |
טבלה 5: השוואת ביצועי חיזוי של המודלים שהוערכו. הטבלה משווה את מודל ה-XAI המוצע אל מול מודלי הבסיס שהוערכו באמצעות מדדי דיוק (accuracy), דיוק חיובי (precision), רגישות (recall), סגוליות (specificity), מדד F1, מקדם המתיוס (Matthews correlation coefficient), שטח שמתחת לעקומת מאפייני ת operating receiver (AUC-ROC) ודיוק ממוצע (average precision).
| ניתוח תיקוף | השוואה / מדד | מבחן סטטיסטי | סטטיסטי המבחן | p-value | תוצאה ניסויית / 95% CI |
| ולידציה צולבת חמיש-פעמים (Five-fold cross-validation) | דיוק (Accuracy) | תיאורי (mean ± SD) | — | — | 93.01 ± 0.48% |
| ולידציה צולבת חמיש-פעמים (Five-fold cross-validation) | AUC-ROC | תיאורי (mean ± SD) | — | — | 0.954 ± 0.007 |
| ולידציה צולבת חמיש-פעמים (Five-fold cross-validation) | דיוק חיזוי (Precision) | תיאורי (mean ± SD) | — | — | 92.42 ± 0.87% |
| ולידציה צולבת חמיש-פעמים (Five-fold cross-validation) | רגישות (Recall) | תיאורי (mean ± SD) | — | — | 93.02 ± 0.45% |
| ולידציה צולבת חמיש-פעמים (Five-fold cross-validation) | F1-score | תיאורי (mean ± SD) | — | — | 92.72 ± 0.62% |
| רווח סמך bootstrap של 95% | דיוק (Accuracy) | Bootstrap (1,000 דגימות חוזרות) | — | — | 0.935 [0.897, 0.973] |
| רווח סמך bootstrap של 95% | דיוק חיזוי (Precision) | Bootstrap (1,000 דגימות חוזרות) | — | — | 0.930 [0.890, 0.970] |
| רווח סמך bootstrap של 95% | רגישות (Recall) | Bootstrap (1,000 דגימות חוזרות) | — | — | 0.922 [0.880, 0.963] |
| רווח סמך bootstrap של 95% | F1-score | Bootstrap (1,000 דגימות חוזרות) | — | — | 0.926 [0.887, 0.965] |
| רווח סמך bootstrap של 95% | AUC-ROC | Bootstrap (1,000 דגימות חוזרות) | — | — | 0.958 [0.931, 0.984] |
| המודל המוצע מול CNN | דיוק (% Accuracy) | מבחן מקנימאר (McNemar's test) | 9.32 | 0.0023 | מובהק (α = 0.05) |
| המודל המוצע מול CNN | AUC-ROC | מבחן דה-לונג (DeLong's test) | 3.87 | 0.0001 | מובהק (α = 0.05) |
| המודל המוצע מול CNN | F1-score | Bootstrap מצומד (1,000 דגימות חוזרות) | 2.81 | 0.0044 | מובהק (α = 0.05) |
| המודל המוצע מול Random Forest | דיוק (% Accuracy) | מבחן מקנימאר (McNemar's test) | 14.27 | 0.0002 | מובהק (α = 0.05) |
| המודל המוצע מול Random Forest | AUC-ROC | מבחן דה-לונג (DeLong's test) | 5.86 | <0.0001 | מובהק (α = 0.05) |
| המודל המוצע מול Random Forest | F1-score | Bootstrap מצומד (1,000 דגימות חוזרות) | 4.03 | 0.0003 | מובהק (α = 0.05) |
| המודל המוצע מול SVM | דיוק (% Accuracy) | מבחן מקנימאר (McNemar's test) | 16.08 | <0.0001 | מובהק (α = 0.05) |
| המודל המוצע מול SVM | AUC-ROC | מבחן דה-לונג (DeLong's test) | 6.95 | <0.0001 | מובהק (α = 0.05) |
| המודל המוצע מול SVM | F1-score | Bootstrap מצומד (1,000 דגימות חוזרות) | 4.62 | <0.0001 | מובהק (α = 0.05) |
| שחזור בהרצות חוזרות (10 הרצות בלתי תלויות) | AUC-ROC | תיאורי (mean ± SD) | — | — | 0.957 ± 0.008 |
| שחזור בהרצות חוזרות (10 הרצות בלתי תלויות) | דיוק (% Accuracy) | תיאורי (mean ± SD) | — | — | 93.24 ± 0.74% |
| שחזור בהרצות חוזרות (10 הרצות בלתי תלויות) | F1-score (%) | תיאורי (mean ± SD) | — | — | 92.35 ± 0.92% |
טבלה 6: תוצאות תיקוף סטטיסטי ושחזור שהתקבלו מהיישום הניסויי באמצעות מאגר הנתונים של סוכרת באינדיאנים של פימה (Pima Indians Diabetes Dataset). הטבלה מסכמת ביצועי תיקוף צולב (cross-validation) של חמישה קיפולים, רווחי סמך של 95% מבוססי bootstrap, השוואות סטטיסטיות של המודל המוצע מול מודלי הבסיס, ושחזור ריצות חוזרות על פני 10 זרעים אקראיים עצמאיים. תיקוף חיצוני והערכה של מומחים קליניים לא בוצעו בתיקוף הנוכחי.
| לא. | פריט ברשימת תבדיקה | תיעוד נדרש | הקלטה / אימות מומלצים |
| 1 | סביבת תוכנה | מערכת הפעלה, שפת תכנות וסביבת תוכנה | יש לרשום את הגרסאות המדויקות של מערכת ההפעלה ושפת התכנות. |
| 2 | גרסאות תוכנה וספריות | גרסאות של ספריות תוכנה וחבילות מרכזיות | יש להקליט את השמות המדויקים והגרסאות של החבילות/ספריות. |
| 3 | מפרט חומרה | מפרטי CPU, GPU, RAM, אחסון ומאיצים | תעד את החומרה החשובנית ששימשה למחקר. |
| 4 | זיהוי מערכי נתונים | שם מערך הנתונים, מקור, גרסה ומידע על הגישה | תעד את מקור הנתונים/הגרסה המדויקת ואת תאריך הגישה, במידה והדבר רלוונטי. |
| 5 | מאפייני מערך הנתונים | גודל מדגם והתפלגות מחלקות | יש להירשום את סך הדגימות ואת התפלגות המחלקות עבור כל חלוקה. |
| 6 | חלוקת מערכי נתונים | אסטרטגיה של אימון, תיקוף ומערך בדיקה עצמאי | תעד את פרופורציות/מספרי הפיצול ואת הריבוד. |
| 7 | מניעת דליפת נתונים | פרוצדורה למניעת דליפת מידע | הפרדת דגימות/מסמכים ותיקוף פרמטרי עיבוד מקדימה עבור האימון בלבד. |
| 8 | פרמטרי עיבוד מקדם | הגדרות ניקוי, טיפול בערכים חסרים, נרמול, קידוד והמרה | תעדו את כל פעולות העיבוד המקדים ואת ערכי הפרמטרים. |
| 9 | הגדלת נתונים (Data augmentation) | שיטות הרחבה והגדרות פרמטרים, במידה ורלוונטי | תעד שיטות, הסתברויות וטווחי פרמטרים. |
| 10 | ארכיטקטורת המודל | ארכיטקטורה וקונפיגורציה סופיות של המודל | תעד את סוג המודל, השכבות/רכיבים, הממדים ופונקציות ההפעלה. |
| 11 | היפר-פרמטרים | אימון והיפר-פרמטרים של אופטימיזציה | תעד את קצב הלמידה, גודל האשורה (batch size), את האופטימייזר, את מספר האיטרציות (epochs), את העצירה המוקדמת (early stopping) ואת הפרמטרים שעברו כיוונון. |
| 12 | זרעים אקראיים | גרעינים אקראיים (Random seeds) ששימשו להרצה הדירה | תעדו את הגרעינים (seeds) לצורך פיצול, אתחול והרצות חוזרות. |
| 13 | תצורת אימון | הליך האימון ואסטרטגיית בחירת מודל | תיקוף מסמכים, יצירת נקודות השבחה (checkpointing) וקריטריונים לבחירת מודל. |
| 14 | מדדי הערכה | מדדי הערכה סטטיסטיים וניבויים שנקבעו מראש | יש לתעד את כל מדדי הביצועים שדווחו. |
| 15 | רווחי סמך | מרווחי אי-ודאות עבור מדדי ביצועים | תעד את הליך הערכת רווחי הביטחון (CI) ואת דגימות החזרה (bootstrap resamples) במידת הרלוונטיות. |
| 16 | מבחנים סטטיסטיים | פרוצדורות סטטיסטיות להשוואת מודלים | תעד את הבדיקה, את הסטטיסטיקה, את ערך ה-p, את סף המובהקות ואת ההנחות. |
| 17 | ניתוח הרצות חוזרות | הרצות עצמאיות באמצעות זרעי אקראיות שונים | יש לתעד את מספר ההרצות ואת הממוצע ± סטיית תקן (SD) של מדדי מפתח. |
| 18 | הגדרת יכולת ההסבר (Explainability configuration) | שיטות להסברות והגדרות פרמטרים | תעד את SHAP, LIME, Grad-CAM, attention, counterfactual, או הגדרות רלוונטיות אחרות. |
| 19 | הערכת יכולת הסבר (Explainability assessment) | הערכה אובייקטיבית של מהימנות ותועלת ההסבר | תיעוד של נאמנות, יציבות, חוסר נאמנות, לוקליזציה והערכת מומחים במידת הצורך. |
| 20 | ארטיפקטים של מודל | משקלי מודל מאומנים וקבצי קונפיגורציה | ארחב את המודל המאומן הסופי, את הארכיטקטורה/התבנית ואת מידע הבחירה. |
| 21 | זמינות הקוד | קוד נדרש לעיבוד מקדים, אימון, הערכה ויצירת הסברים | מאגר רשומות או מידע על גישה מבוקרת לקוד, במידה ורלוונטי. |
| 22 | תיעוד ביצוע | פקודות, סקריפטים, קבצי הגדרה והוראות | תעד את הפקודות ואת התצורה הדרושים לשחזור זרימת העבודה. |
| 23 | תיעוד פלט | תחזיות, תוצאות הערכה, איורים ופלטי הסבר | ארכוב פלטי תהליך (outputs) וקישורם לניסוי/הרצה המתאימים. |
| 24 | אימות שחזוריות | אימות עקביות בין הרצות עצמאיות | השוו את תוצאות ההרצות החזורות ודווחו על מדדי שונות שהוגדרו מראש. |
טבלה 7: רשימת בדיקה לשחזור עבור שכפול עצמאי של זרימת העבודה המוצעת של XAI. רשימת הבדיקה מפרטת את הדרישות החשובניות, של מערך הנתונים, עיבוד מקדימה, פיתוח המודל, ההערכה, התיקוף הסטטיסטי, יכולת ההסבר והתיעוד הדרושות כדי לשחזר את זרימת העבודה הניסוית.