מאמר שיטה

פרוטוקול ניסויי הניתן לשחזור לפיתוח ולהערכה של מודלים של בינה מלאכותית ניתנת להסבר במערכות בריאות

2 צפיות

DOI:

10.3791/73848

15 בספטמבר 2026

במאמר זה

סיכום

פרוטוקול זה מציג תהליך עבודה הניתן לשחזור לפיתוח, הערכה ופירוש של מודלים של בינה מלאכותית ניתנת להסבר (explainable artificial intelligence) בתחום הבריאות. הוא משלב הכנה סטנדרטית של נתונים, פיתוח מודלים, טכניקות להסברתיות, הערכה כמותית ופרקטיקות לשחזור, במטרה לשפר את השקיפות, האמינות וההיתכנות הקלינית.

תקציר

בינה מלאכותית (AI) מאומצת יותר ויותר ככלי בעל ערך לקבלת החלטות קליניות, לניבוי מחלות, לאבחון רפואי ולטיפול רפואי מותאם אישית. עם זאת, מחסור בשקיפות, יישום לא עקבי של שיטות בינה מלאכותית הניתנת להסבר (XAI) ויכולת שחזור מוגבלת נותרים מחסומים מרכזיים לפריסה מהימנה של מודלי AI במסגרות קליניות. מאמר זה מציע פרוטוקול סיסטמטי, שחזיר ושקוף לפיתוח, הערכה ופירוש של מודלי XAI ליישומים בתחום הבריאות. זרימת העבודה מתחילה בהגדרת סביבת המחשוב, ולאחריה רכישת נתונים ואפיון, עיבוד מקדימ (preprocessing), הנדסת תכונות, פיתוח מודל, אופטימיזציה של היפר-פרמטרים, הערכת ביצועי ניבוי, ניתוח יכולת הסבר, תיקוף סטטיסטי והערכת יכולת שחזור. הפרוטוקול משלב שיטות XAI כגון SHapley Additive exPlanations (SHAP), Local Interpretable Model-agnostic Explanations (LIME), Gradient-weighted Class Activation Mapping (Grad-CAM), Integrated Gradients, ויזואליזציה של קשב (attention visualization) והסברים נגדיים (counterfactual explanations) כדי להפיק פרשנויות של המודל הן ברמה הגלובלית והן ברמה המקומית. הפרוטוקול שם דגש על מספר מרכיבים מרכזיים, כולל הכנת מאגרי נתונים רפואיים סטנדרטיים, פיתוח מודלי למידת מכונה יציבים, הערכת ביצועי ניבוי, הפקת הסברים רלוונטיים מבחינה קלינית והערכה סטטיסטית של יכולת השחזור בניסויים חוזרים. על ידי שילוב פיתוח מודלים, יכולת הסבר, הערכה כמותית ואיכותית, תיקוף סטטיסטי והערכת יכולת שחזור לתוך זרימת עבודה מאוחדת, פרוטוקול זה מספק מסגרת מקיפה לפיתוח מודלי AI שקופים ושחזירים ליישומים בתחום הבריאות.

מבוא

הבינה המלאכותית (AI) הפכה למרכיב בלתי נפרד מהטיפול הרפואי המודרני, בכך שהיא מאפשרת ניתוח חכם של נתונים קליניים מורכבים ותומכת בקבלת החלטות רפואיות מבוסות ראיות1. הדיגיטציה המהירה של מערכות הבריאות באמצעות רשומות רפואיות אלקטרוניות, מערכות דימות רפואי, מכשירים לבישים וטכנולוגיות גנומיקה, ייצרה נפחים גדולים של נתונים הטרוגניים הדורשים גישות חישוביות מתקדמות לצורך פרשנות יעילה2.

אלגוריתמים של למידת מכונה (ML) ולמידה עמוקה (DL) הדגימו יכולות מרשימות במיצוי תבניות משמעותיות מתוך מאגרי נתונים רב-ממדיים של שירותי בריאות, ובכך שיפרו את דיוק האבחון, את חיזוי המחלה ואת הערכת תוצאות הטיפול במטופלים3. מודלים מבוססי בינה מלאכותית (AI) יושמו בהצלחה ברדיולוגיה, פתולוגיה, קרדיולוגיה, אונקולוגיה, אופתלמולוגיה והתמחויות רפואיות אחרות כדי לסייע לקלינאים בזיהוי מחלות בשלבים מוקדמים יותר ובהמלצה על אסטרטגיות טיפול מותאמות אישית4. טכנולוגיות אלו תרמו גם לאופטימיזציה של זרימת העבודה, להפחתת השונות באבחון ולשיפור בניצול משאבי הבריאות5.

התפתחויות אחרונות בחומרת מחשוב, במחשוב ענן ובמסגרות AI בקוד פתוח האיצו את הפיתוח והפריסה של יישומים חכמים לבריאות6. כתוצאה מכך, AI הפכה לטכנולוגיה מאפשרת מרכזית לרפואה מותאמת אישית ומערכות לתמיכה בקבלת החלטות קליניות7. למרות התקדמויות אלו, האימוץ הנרחב של AI בפרקטיקה קלינית שגרתית נותר מוגבל, מכיוון שדגמים בעלי ביצועים גבוהים רבים מספקים תובנה מועטה לגבי האופן שבו התחזיות שלהם נוצרות8.

מרבית אלגוריתמי הלמידה העמוקה פועלים כמודלים מורכבים של "קופסה שחורה", שבהם תהליך קבלת ההחלטות הפנימי קשה להבנה עבור קלינאים וחוקרים9. למרות שמודלים אלו משיגים לעיתים קרובות ביצועים חיזויים מצוינים, חסרון השקיפות שלהם פוגע באמון המשתמש ומציב אתגרים בתהליכי תיקוף קליני, אישור רגולטורי ובטיחות המטופל10. אנשי מקצוע בתחום הבריאות חייבים להיות מסוגלים לנמק החלטות הנתמכות על ידי בינה מלאכותית לפני שילובן בפרקטיקה קלינית שגרתית, במיוחד בסביבות רפואיות בסיכון גבוה1.

XAI הגיחה כגישה יעילה לשיפור השקיפות והיכולת להסבר (interpretability) של מודלים של למידה מכונה12. במקום להתייחס למודלים של חיזוי כמערכות אטומות, טכניקות של XAI מספקות מידע על המאפיינים, אזורי התמונה או המשתנים הקליניים התורמים לחיזויים בודדים13. הסברים אלו מאפשרים לקלינאים להבין טוב יותר את התנהגות המודל, לזהות הטיות פוטנציאליות ולקבוע אם החלטות שנוצרו על ידי AI עקביות עם ידע רפואי מבוס14.

מספר טכניקות להסברתיות (explainability) הוצגו עבור יישומים בתחום הבריאות. SHapley Additive explanations (SHAP) מודדות את תרומתו של כל מאפיין לניבוי המודל על בסיס תורת המשחקים השיתופית15. Local Interpretable Model-agnostic Explanations (LIME) יוצרות מודל מפושט ומסבירות את הניבויים של מודל "הקופסה השחורה"16. עבור משימות של דימות רפואי המשתמשות במודלים של למידה עמוקה, Gradient-weighted activation maps (Grad-CAM) יוצרות מפות חום המצביעות באופן ויזואלי על אזורי התמונה התורמים להחלטות הסיווג17. השילוב של שיטות אלו שיפר באופן דרמטי את השקיפות של מערכות בינה מלאכותית בתחומי בריאות שונים18.

למרות התשומת הלב הגוברת לשיטות הסביריות (explainability) במסגרות של שירותי בריאות, השימוש בהן נותר מגוון בספרות המקצועית. חוקרים נבדלים לא רק בשימוש באסטרטגיות עיבוד מקדים, אלא גם בתכנון ארכיטקטורת המודל, במדדי ההערכה ואפילו בטכניקות ההסבר19. כמו כן, מאמרים רבים מדווחים על דיוק חיזוי גבוה אך נכשלים במתן הערכה מעמיקה של איכות ההסברים או של יכולת השחזור שלהם20.

שחזוריות היא אחד מצווארי הבקבוק המרכזיים במדעי הבינה המלאכותית (AI) המודרניים. מאמרים רבים אינם חושפים את גרסת התוכנה, סביבת החישוב, צינור העיבוד המקדים (preprocessing pipeline), הגדרות ההיפר-פרמטרים, אתחול הזרע האקראי (random seed) ותצורות החומרה21. בשל כך, חוקרים עצמאיים נכשלים לעיתים קרובות בשחזור תוצאות שפורסמו או באימות השיטות שפורסמו באמצעות מערכי נתונים או פלטפורמות תוכנה אחרות2. היעדר תיעוד מפורט הוא אחד הגורמים המעכבים מחקרי השוואה (benchmarking), מחקר שיתופי ותרגום קליני של מערכות AI23.

בשל אתגרים אלו, מספר ארגונים וסוכנויות רגולטוריות הדגישו את החשיבות של בינה מלאכותית (AI) שקופה, מהימנה וניתנת לשחזור עבור יישומים בתחום הבריאות24. הנחיות הדיווח הקיימות שיפרו את הדיווח המתודולוגי, אך הן מתארות בעיקר מה יש לדווח במקום לספק פרוצדורות ניסיוניות סטנדרטיות שחוקרים יכולים ליישם באופן ישיר25. כתוצאה מכך, נותר צורך בפרוטוקול מקיף המשלב הכנת מערכי נתונים, פיתוח מודלים, ניתוח יכולת הסבר (explainability), הערכה סטטיסטית ופרקטיקות לשחזור, בתוך זרימת עבודה ניסיונית אחת26.

פרוטוקול ניסיוני סטנדרטי מציע מספר יתרונות עבור קהילת ה-AI בתחום הבריאות. יתרה מכך, הוא מקדם עקביות מתודולוגית, מקל על השוואה בין מחקרים עצמאיים, מגביר את השקיפות של ניסויים חישוביים, ומאפשר תיקוף מהימן של תוצאות שפורסמו27. זרימות עבודה סטנדרטיות מסייעות גם לחינוך/הכשרה, למחקר שיתופי ולהערכה רגולטורית באמצעות נהלים מתועדים בבירור שניתן לשחזר אותם במעבדות ובמוסדות בריאות שונים28.

פותח ונבדק פרוטוקול ניסויי הדיר לביצוע אימון והערכה של מודלי AI במערכות בריאות. הפרוטוקול מתווה סטנדרטים להגדרת הסביבה החישובית, עיבוד מקדים של מאגרי נתוני בריאות, פיתוח מודלים של למידת מכונה, יישום שיטות XAI, הערכת ביצועים חיזויים, ביצוע תיקוף סטטיסטי והערכת הדירות29. שילוב של רכיבים אלו למסלול עבודה קוהרנטי צפוי להגביר את השקיפות, האמינות וההדירות של מחקרי AI בתחום הבריאות, וכן לסייע בפיתוח מערכות בריאות חכמות ומהימנות30.

פרוטוקול

ניסוי התיקוף שבוצע השתמש במאגר הנתונים Pima Indians Diabetes, הזמין לציבור ומנופה מפרטים מזהים, ולא כלל רשומות מטופלים שניתן לזהותם או גיוס מטופלים חדשים. לפיכך, לא נדרשו הסכמה מדעת או אישור IRB/ועדת אתיקה מוסדית, וכל הניתוחים בוצעו בהתאם לתנאי השימוש הרלוונטיים של מאגר הנתונים ולמדיניות המחקר המוסדית.

דוגמת התיקוף המעשית משתמשת במאגר הנתונים Pima Indians Diabetes Dataset הזמין לציבור, המכיל 768 רשומות לחיזוי בינארי של סוכרת. זרימת העבודה הליבתית המלאה בתשעה שלבים יושמה על מאגר נתונים זה. תשעת שלבי הליבה כללו בחירת מאגר נתונים ותיקופו, הגדרת סביבת מחשוב, עיבוד מקדמי של הנתונים, חלוקת מאגר הנתונים, פיתוח ואימון מודל, הערכת ביצועים חיזוית וחישובית, ניתוח יכולת הסבר, תיקוף סטטיסטי והערכת שחזוריות. תיקוף חיצוני והערכה של מומחים קליניים נשמרו כמודולי תיקוף אופציונליים ולא בוצעו בדוגמה המעשית הנוכחית. איור 1 ממחיש את זרימת העבודה של הפרוטוקול המרכזי, ו טבלה 1 מסכם אך ורק את תשעת שלבי הליבה שיושמו בתיקוף הנוכחי; תיקוף חיצוני אופציונלי והערכה של מומחים קליניים מתוארים בנפרד במסגרת הפרוטוקול ואינם נכללים בין תשעת השלבים הניסיוניים.

1. בחירה ותיקוף של מערך נתוני הבריאות

  1. בחר את מערך הנתונים Pima Indians Diabetes כמאגר הנתונים הראשי עבור דוגמת התיקוף המעשית. ודא את מקור הנתונים, גודל המדגם, יעד הניבוי, התפלגות המחלקות ומבנה הנתונים.
  2. החל את קריטריוני ההכללה, ההדרה ואיכות הנתונים שהוגדרו מראש. הסר רשומות כפולות ורשומות לא תקינות לפני פיתוח המודל.
  3. תעד את מקור הנתונים, המאפיינים, משימת הניבוי, התפלגות המחלקות, קריטריוני ההכללה וההדרה, ואת אסטרטגיית החלוקה בטבלה 2.
  4. החל קריטריוני החלטה לבחירת מאגר הנתונים והמודל
    1. הגדר את מטרת הניבוי לפני בחירת מאגר הנתונים, ארכיטקטורת המודל, אסטרטגיית העיבוד המקדים או שיטת ההסביריות.
    2. התאם את מודליות הנתונים למטרת הניבוי. בחר בנתונים טבלאיים עבור משתנים קליניים מובנים, בנתוני דימות עבור תמונות רפואיות, בנתוני סדרות זמן עבור אותות פיזיולוגיים, בנתוני טקסט עבור תיאורים קליניים, או בנתונים מולטי-מודאליים כאשר קיימות מודליות משלימות עבור אותו מטופל או יחידת מחקר.
    3. הערך מאגרי נתונים מועמדים על פי גודל המדגם, זמינות התוצאות, התפלגות המחלקות, נתונים חסרים, איכות האנוטציה, רלוונטיות קלינית, שלמות הנתונים ונגישות. בחר במאגר הנתונים העומד בדרישות שהוגדרו מראש.
    4. בחר מודלים קונבנציונליים של למידת מכונה עבור נתונים טבלאיים מובנים כאשר גודל המדגם, המשאבים החישובים או דרישות הפרשנות מגבילים את השימוש בארכיטקטורות מורכבות. בחר ארכיטקטורות של למידה עמוקה כאשר זמינים נתוני אימון מספיקים וקלטים רב-מדיים, כגון תמונות רפואיות, אותות פיזיולוגיים או טקסט קליני.
    5. בחר ארכיטקטורות מולטי-מודאליות רק כאשר קיימות מספר מודליות עבור אותו מטופל או יחידת מחקר, וניתן לסנכרן ביניהן באופן מהימן מבלי לגרום לדליפת מידע. בחר פעולות עיבוד מקדים בהתאם למאפייני מודליות הנתונים שנבחרה.
    6. בחר שיטות הסביריות בהתאם למודל ולמודליות הנתונים. השתמש בשיטות שאינן תלויות מודל (model-agnostic) כגון SHAP או LIME עבור מודלים טבלאיים מתאימים, ובשיטות ספציפיות למודליות כגון Grad-CAM עבור מודלים מבוססי תמונה, במידה ורלוונטי.
    7. תעד את הרציונל לבחירת מאגר הנתונים, אסטרטגיית העיבוד המקדים, המודל ושיטת ההסביריות. שמור החלטות אלו כחלק מתיעוד השחזור.

2. הגדרת הסביבה החישובית לפיתוח מודל XAI

  1. הגדירו את מערכת ההפעלה, המעבד (CPU), הזיכרון (RAM), האחסון ומעבד הגרפי (GPU) בהתאם לדרישות המודל שנבחר. צרו סביבת Python מבודדת והתקינו את הספריות הנדרשות ללמידת מכונה, למידה עמוקה, סטטיסטיקה, ויזואליזציה ובינה מלאכותית ניתנת להסבר (XAI).
  2. תעד את סביבת החישוב בפועל, את ארכיטקטורת המודל ואת ההיפר-פרמטרים ששימשו לצורך התיקוף המעשי ב- טבלה 3פרטו את האופטימייזר (optimizer), קצב הלמידה (learning rate), גודל האצווה (batch size), מספר האיפוכים (epochs) המקסימלי, פונקציית ההפסד (loss function), פרמטרי רגולריזציה, אסטרטגיית התיקוף (validation strategy), הגדרות עצירה מוקדמת (early-stopping), הגדרות גרעין אקראי (random-seed), שיטות להסברתיות (explainability methods), חומרה, מערכת הפעלה, גרסת Python וגרסאות של ספריות תוכנה רלוונטיות. הפרידו בין הגדרות אלו, ששימשו בניסוי, לבין הגדרות פרוטוקול כלליות או מומלצות.
  3. השתמשו בתצורה שדווחה ב- טבלה 3 בעת שחזור התיקוף של מערך הנתונים של סוכרת באינדיאנים מפيمه (Pima Indians Diabetes Dataset) והתוצאות התואמות של הניבוי, ההסביריות, הסטטיסטיקה והשחזור.
  4. הריצו סקריפט אימות כדי לאשר ייבוא מוצלח של חבילות, טעינת מערך נתונים, הרצת מודל ויצירת פלט. שמרו את הגדרות הסביבה הסופיות לצורך שחזור.

3. הכנה ואפיון של מערכי נתונים רפואיים לפיתוח מודלי XAI

  1. בחירה והשגה של מערך נתוני שירותי הבריאות
    1. בחרו מערך נתונים רפואי המתאים למשימת הניבוי הקליני שהוגדרה. העריכו מערכי נתונים מועמדים בהתאם למטרת המחקר, סוג הנתונים, גודל המדגם, איכות התיעוד (annotation), האיזון בין המחלקות והרלוונטיות הקלינית.
    2. העדף שימוש במאגרי נתוני ייחוס (benchmark datasets) הזמינים לציבור כאשר הם נותנים מענה הולם למשימת הניבוי ומאפשרים תיקוף עצמאי.
    3. יש להשיג את האישורים האתיים הנדרשים, את ההיתרים המוסדיים ואת האישור לגישה לנתונים לפני רכישת מאגרי נתונים מוסדיים או פנימיים. יש להשיג את מאגר הנתונים הנבחר ממאגר מאומת או ממאגר נתונים מוסדי מורשה.
    4. שמרו את קבצי מערך הנתונים המקוריים ללא שינוי, ותעדו את ספק מערך הנתונים, הגרסה, מידע על הרכישה, תנאי הרישוי, קריטריוני הכללה, קריטריוני החרגה ומטא-נתונים נלווים. ארגנו את מערך הנתונים בספריות נפרדות עבור נתונים גולמיים, הערות (annotations), מטא-נתונים ומידע משלים.
  2. אפיינו את מערך הנתונים של שירותי הבריאות
    1. זהו את משתני הניבוי, תוויות התוצאה, סוגי המאפיינים, מודליות הנתונים והתפלגויות המחלקות. קבע את מספר הנבדקים, הדגימות, ממדי המאפיינים וההערות הזמינות.
    2. יש לוודא שמאפייני מערך הנתונים תואמים לשיטת ה-AI שנבחרה.
    3. השתמשו במאגר הנתונים של סוכרת בקרב אינדיאנים מפמיי (Pima Indians Diabetes Dataset) כמאגר הנתונים הניסיוי המעובד היחיד לתיקוף הפרוטוקול המרכזי בן תשעת השלבים. כללו את מאגרי הנתונים הנוספים המפורטים ב- טבלה 2 רק כדי להדגים את ישימותו של הפרוטוקול הכללי על פני נתונים טבלאיים קליניים, רשומות בריאות אלקטרוניות, תמונות דרמוסקופיות, נתוני סדרות עתיות פיזיולוגיות ודימות רפואי. אין להשתמש במאגרי נתונים נוספים אלו לאימון מודלים, לבדיקה, לתיקוף סטטיסטי או להפקת התוצאות הניסיוניות המדווחות.
  3. הערכת איכות מערך הנתונים
    1. יש לבחון את מערך הנתונים לאיתור רשומות כפולות, קבצים פגומים, ערכים חסרים, שגיאות באנוטציה ורשומות נתונים לא תקינות. יש להסיר רשומות כפולות מאושרות ולתקן אי-סדירויות מאומתות בפורמט. יש לתעד את כל נהלי בקרת האיכות של מערך הנתונים.
    2. יש לאמת את ההתאמה בין נתוני דימות, נתונים קליניים, נתוני מעבדה ונתונים פיזיולוגיים באמצעות מזהי נבדקים בעת שימוש במאגרי נתונים רב-מודאליים (multimodal datasets).
    3. הסר רשומות כפולות או שאינן עקביות, טפל בערכים חסרים, בצע סטנדרטיזציה של מאפיינים מספריים, קידד משתנים קטגוריאליים והחל עיבוד מקדים ספציפי למודליות. חלק את מערך הנתונים לקבוצות אימון, תיקוף ובדיקה בלתי תלויות. פנה אל איור 2 עבור זרימת העבודה של הכנת מערכי נתונים של שירותי בריאות, עיבוד מקדים, חלוקה והערכת איכות.
  4. הבטחת פרטיות נתונים ועמידה בכללי האתיקה
    1. הסר מזהים ישירים מנתוני שירותי בריאות. החל נהלי אנונימיזציה או פסאודונימיזציה בעת הצורך. טפל במידע בריאותי של מטופלים בהתאם לדרישות האתיקה, הגנת הפרטיות, ההסכמה המודעת והדרישות המוסדיות הרלוונטיות.
    2. יש לתעד את האישור האתי הרלוונטי, את הפטור, את נהלי ממשל הנתונים, את שיטות האנונימיזציה ואת זרימת העבודה להכנת מערך הנתונים.
    3. העריכו הטיה אלגוריתמית פוטנציאלית על ידי השוואת ביצועי המודל בין תתי-קבוצות דמוגרפיות או קליניות רלוונטיות, כאשר מידע זה זמין ומותר מבחינה אתית.
    4. יש לתעד את השימוש המיועד, את אוכלוסיית היעד, את מגבלות המודל, את מצבי הכשל הפוטנציאליים, את דרישות הפיקוח האנושי, ואת הדרישות החלות בנושאי אתיקה, הגנת נתונים ורגולציה של שירותי בריאות.
    5. תעדו מגבלות הוגנות שזוהו ושיקולי בינה מלאכותית אחראית כחלק מהתיעוד הסופי של המודל.
      הערה: השג מערך נתונים רפואי סטנדרטי ומתועד שמתאים לפיתוח מודל AI, תואם את הכללים האתיים ונקי מסתירות משמעותיות שזוהו.

4. עיבוד מקדים וחלוקה של נתוני בריאות לאימון מודל AI

  1. בצע בקרת איכות
    1. בדוק את מערך הנתונים לאיתור רשומות כפולות, ערכים חסרים, ערכים לא תקינים, תוויות שאינן עקביות, ערכי קיצון (outliers) וקבצים פגומים.
    2. הסר או תקן תצפיות לא תקינות בהתאם לקריטריונים שהוגדרו מראש ותיעד את כל ההחרגות. ודא את העקביות של משתני הניבוי ותוויות התוצאה.
  2. טיפול בנתונים חסרים
    1. כמת את מידת החסר עבור כל משתנה. החל את אסטרטגיית ההשלמה (imputation) או ההחרגה שהוגדרה מראש.
    2. אמד את פרמטרי ההשלמה באמצעות נתוני האימון בלבד, והחל את הטרנספורמציה שהתאימה על נתוני האימות והבדיקה.
  3. נורמליזציה וטרנספורמציה של נתונים
    1. החל סקלינג של מאפיינים (feature scaling), נורמליזציה, קידוד (encoding), הפחתת ממדיות או טרנספורמציות אחרות הנדרשות על ידי המודל שנבחר. התאם את כל הטרנספורמציות התלויות בנתונים באמצעות נתוני האימון בלבד.
    2. החל את הטרנספורמציות המותאמות ללא שינוי על נתוני האימות והבדיקה.
  4. כמת את חוסר האיזון בין המחלקות (class imbalance) בנתוני האימון. החל שקלול מחלקות, SMOTE, דגימה יתר (oversampling) או הרחבת נתונים (augmentation) על מערך נתוני האימון בלבד. שמור על ההתפלגות המקורית של מערכי נתוני האימות והבדיקה.
  5. ודא ששום נבדק, תצפית כפולה, דגימה מורחבת, סטטיסטיקה של עיבוד מקדים, קריטריון בחירת מאפיינים או דגימה סינתטית אינם משותפים בין חלוקות האימון להערכה.

5. פיתוח והגדרת מודל ה-XAI

  1. הגדירו את ארכיטקטורת המודל על ידי פירוט מודליות נתוני הקלט, פעולות עיבוד מקדמי, מקודדי תכונות ספציפיים למודליות, מנגנון מיזוג תכונות, שכבת ניבוי ומודול להסבריות.
  2. בחרו את ארכיטקטורת הלמידה המכונה או הלמידה העמוקה בהתאם למשימת הניבוי ולאופן קלט הנתונים (modality). הגדירו את שכבת הקלט, רכיבי מיצוי המאפיינים, השכבות החבויות, שכבת הפלט ופונקציות ההפעלה. הגדירו את האופטימיזר, קצב הלמידה, גודל האצווה (batch size), פונקציית ההפסד, מספר האיטרציות (epochs), הרגולריזציה, ה-dropout, העצירה המוקדמת (early stopping) ואת לוח הזמנים של קצב הלמידה (learning-rate schedule).
  3. בצעו אופטימיזציה של ההיפר-פרמטרים באמצעות נתוני האימון והתיקוף בלבד.
  4. תעד את הארכיטקטורה הסופית ואת הגדרות ההיפר-פרמטרים ב- טבלה 3.
  5. יש לוודא תאימות ממדית בין הקלט לפלט לפני האימון.
    הערה: הגדירו מודל XAI המוגדר במלאו, הכולל ארכיטקטורה מתאימה, היפר-פרמטרים מוגדרים וטכניקות הסביריות (explainability) משולבות.

6. אימון, אופטימיזציה ושימור של מודל ה-XAI

  1. טען את מערכי הנתונים להדרכה ולאימות שהוגדרו מראש ואת תצורת המודל הסופית. אתחל את המודל באמצעות זרע אקראי (random seed) ופרמטרי הדרכה שהוגדרו מראש.
  2. הדרך את המודל באמצעות האופטימייזר, פונקציית ההפסד (loss function), גודל האצווה (batch size) וקריטריוני העצירה שצוינו.
  3. נטר את ביצועי האימות ושמור את נקודת הבקרה (checkpoint) התואמת לקריטריון בחירת המודל שהוגדר מראש. העरक את נקודת הבקרה שנבחרה על מערך נתוני הבדיקה העצמאי ללא אופטימיזציה נוספת.
  4. שמור את המודל המודרך, את תצורת עיבוד המקדימה, את ההיפר-פרמטרים, את הזרע האקראי ואת יומן ההדרכה.
    הערה: השג מודל XAI אופטימלי שעבר הדרכה ואימות באמצעות מערך נתוני הבריאות שהוכן. שמור את המודל בעל הביצועים הטובים ביותר, את ההיפר-פרמטרים, את יומני ההדרכה, את תצורת עיבוד המקדימה ואת הסביבה החישובית לצורך שחזור התוצאות.

7. הערכת ביצועים חיזויים וחישוביים

  1. הערכת ביצועים חיזויים
    1. טענו את המודל המותאם ואת מערך הנתונים העצמאי לבדיקה לאחר השלמת אימון המודל ואופטימיזציית ההיפר-פרמטרים. השאירו את פרמטרי המודל המאומן ואת צינור העיבוד המקדים ללא שינוי במהלך הבדיקה.
    2. הפיקו תחזיות עבור כל הדגימות במערך הנתונים לבדיקה. השוו את הפלטים החזויים לתוויות האמת (ground-truth) המתאימות.
  2. חישוב מדדי ביצועים
    1. בחרו מדדי הערכה בהתאם לסוג משימת החיזוי.
    2. חשבו דיוק (accuracy), ערך ניבוי חיובי (precision), רגישות (recall), סגוליות (specificity), מדד F1, דיוק מאוזן (balanced accuracy), מקדם המתיוס (MCC), ושטח תחת העקומה של מאפיין פעולת המקלט (AUC-ROC) עבור משימות סיווג, ככל שרלוונטי. חשבו טעות מוחלטת ממוצעת (MAE), שורש טעות ריבועית ממוצעת (RMSE), מקדם דטרמינציה (R2), ומדדים רלוונטיים אחרים עבור משימות רגרסיה, ככל שרלוונטי.
  3. הערכת הכללה וחוסן של המודל
    1. העריצו את המודל באמצעות מערך נתונים חיצוני שנאסף באופן עצמאי ממערך הנתונים לפיתוח, בכל פעם שנתונים כאלו זמינים.
    2. העדיפו מערכי נתונים חיצוניים שמקורם במוסד רפואי, אזור גיאוגרפי אוכלוסיית חולים שונה, כדי להעריך את יכולת ההעברה (transportability).
    3. בצעו תיקוף זמני (temporal validation) באמצעות נתונים שנאספו בתקופה מאוחרת יותר, כאשר קיימים מערכי נתונים ארוכי טווח (longitudinal).
    4. בצעו תיקוף רב-מרכזי על ידי הערכת המודל הסופי בנפרד בין המוסדות המשתתפים, כאשר זמינים נתונים רב-מרכזיים.
    5. בצעו תיקוף גיאוגרפי באמצעות אוכלוסייה עצמאית מאזור גיאוגרפי שונה, במידה והדבר אפשרי.
    6. דווחו על הבדלי ביצועים ורווחי סמך בין מערך הנתונים לפיתוח לבין מערכי הנתונים החיצוניים.
  4. הערכת ביצועים חישוביים
    1. מדדו את זמן אימון המודל תחת הסביבה החישובית שהוגדרה מראש, את זמן ההסקה (inference) והבדיקה תחת תנאים חישוביים זהים, וכן את צריכת הזיכרון, גודל המודל וניצול החומרה.
    2. חזרו על המדידות החישוביות לאורך הרצות עצמאיות.
    3. חשבו את זמן הביצוע הממוצע כדי להפחית את השפעת השונות הניסויית.
  5. השוואת ביצועי מודלים
    1. בחרו שיטות למידת מכונה קונבנציונליות או שיטות למידה עמוקה מתאימות לצורך הערכה השוואתית.
    2. העריצו את מודל ה-XAI המוצע ואת מודלי ההשוואה באמצעות אותו מערך נתונים. החילו נהלי עיבוד מקדים ומדדי הערכה זהים על כל מודלי ההשוואה.
    3. בצעו את כל ניסויי ההשוואה בתוך אותה סביבה חישובית.
      הערה: השיגו ראיות ניסוייות ליציבות חיזויית וליכולת שחזור תחת התנאים החישוביים ומערך הנתונים שנבדקו.

8. יצירה והערכה של פלטי XAI

  1. יצירת הסברים למודל
    1. טען את מודל ה-XAI שעבר אופטימיזציה. בחר דגימות להערכה שלא שימשו לאימון המודל. החל את שיטות ההסבריות שהוגדרו מראש מבלי לשנות את המודל המאומן או את צינור העיבוד המקדים (preprocessing pipeline).
    2. יצירת הסברים גלובליים ומקומיים למודל
      1. צור הסברים גלובליים כדי לאפיין את ההתנהגות הכללית של המודל החזוי.
      2. צור הסברים מקומיים כדי לאפיין תחזיות בודדות של המודל.
      3. החל את שיטת SHAP על מערך הנתונים של סוכרת באינדיאנים פימה (Pima Indians Diabetes Dataset) כדי ליצור הסברים גלובליים ומקומיים לתחזיות המודל הטבלאי.
      4. צור תרשים סיכום (summary plot) של SHAP להמחשה ויזואלית של הכיוון והעוצמה הכלליים של תרומות המאפיינים.
      5. צור תרשים חשיבות מאפיינים (feature-importance plot) של SHAP באמצעות ערכי SHAP מוחלטים ממוצעים כדי לדרג את המאפיינים לפי תרומתם הכללית לתחזיות המודל.
      6. צור תרשים מפל (waterfall plot) של SHAP עבור תחזית מייצגת ממערך הבדיקה כדי להמחיש תרומות מאפיינים ספציפיות למטופל.
      7. צור תרשים תלות מאפיינים (feature-dependence plot) של SHAP כדי לבחון את הקשר בין מאפיין נבחר לבין תרומתו לפלט המודל.
      8. החל את שיטת LIME על תחזיות מייצגות ממערך הבדיקה כדי ליצור הסברים מקומיים לתחזיות בודדות של המודל.
      9. צור הסבר נגדי (counterfactual explanation) ספציפי למטופל כדי להמחיש את השינויים במאפיינים הקשורים לשינוי בתוצאה החזויה.
      10. בחר טכניקות הסבריות נוספות בהתאם למודליות הנתונים ולארכיטקטורת המודל.
      11. השתמש ב-Grad-CAM או במפות סליאנסי (saliency maps) עבור מודלים תואמים מבוססי תמונה, בוויזואליזציות של קשב (attention visualizations) עבור ארכיטקטורות מבוסות Transformer, וב-Integrated Gradients עבור מודלים גזירים, במידה ורלוונטי.
      12. התייחס ל-Grad-CAM, למיפוי סליאנסי, לוויזואליזציית קשב ול-Integrated Gradients כאפשרויות פרוטוקול כלליות התלויות במודליות, ואל תפרש או תדווח עליהן כתוצאות ניסיוניות מתוך תיקוף מערך נתוני סוכרת באינדיאנים פימה, אלא אם הניתוחים התואמים בוצעו בפועל.
    3. החלת שיטות הסבריות על תיקוף פימה המעשי
      1. החל את SHAP ו-LIME על מערך הנתונים של סוכרת באינדיאנים פימה כדי ליצור הסברים גלובליים ומקומיים לתחזיות המודל הטבלאי.
      2. צור ויזואליזציות סיכום, חשיבות מאפיינים, מפל ותלות מאפיינים של SHAP מתוך תוצאות תיקוף הפימה.
      3. צור הסבר מקומי של LIME עבור תחזיות מייצגות ממערך הבדיקה.
      4. צור הסבר נגדי ספציפי למטופל כדי להמחיש את השינויים במאפיינים הקשורים לשינוי בתחזית המודל.
      5. התייחס ל-Grad-CAM, לוויזואליזציית קשב, למיפוי סליאנסי ול-Integrated Gradients כאפשרויות הסבריות התלויות במודליות עבור סוגי נתוני בריאות וארכיטקטורות מודל אחרים.
      6. אל תדווח על Grad-CAM, ויזואליזציית קשב, מיפוי סליאנסי או Integrated Gradients כממצאים ניסיוניים מתוך תיקוף פימה המעשי, אלא אם הניתוחים התואמים בוצעו בפועל.
  2. הערכת איכות ההסברים
    1. בחן האם ההסברים שנוצרו משקפים את תהליך התחזית של המודל. הערך את יציבות ההסברים לאורך הרצות ניסיוניות חוזרות, ואת עקביות פלטי ההסברים תחת תנאים חישוביים זהים.
    2. הערך את הרגישות של פלטי ההסברים לשינויים בנתוני הקלט במידת הצורך. השווה את ההסברים שנוצרו עם ידע מקצועי זמין או פרשנויות של מומחים.
    3. זהה מאפיינים חזויים או אזורים אנטומיים התואמים לידע רפואי מבוס כאשר השוואות כאלה זמינות.
    4. תעד את רמת ההסכמה או אי-ההסכמה בין ההסברים שנוצרו לבין הפרשנות הקלינית הזמינה.
  3. כימות אי-ודאות של התחזית
    1. צור הערכות ביטחון-תחזית עבור הדגימות שנבחנו באמצעות שיטת הערכת אי-ודאות המתאימה לארכיטקטורת המודל הנבחרת וליישום הבריאותי.
    2. החל Monte Carlo dropout, תחזית מבוססת אנסמבל (ensemble), הסקה בייסיאנית (Bayesian inference), תחזית קונפורמלית (conformal prediction) או גישה מאומת אחרת להערכת אי-ודאות כאשר הדבר מתאים.
    3. חזור על מעברי תחזית סטוכסטיים בעת שימוש ב-Monte Carlo dropout וחשב את ממוצע התחזית ואת השונות החזויה עבור כל דגימת הערכה.
    4. דווח על ביטחון התחזית או על רווחי אי-ודאות יחד עם תחזיות המודל התואמות.
    5. הערך האם הערכות אי-ודאות מזהות תחזיות הקשורות לאמינות נמוכה יותר או לשגיאת תחזית מוגברת. שמור את שיטת הערכת אי-הודאות, הפרמטרים, הזרעים האקראיים (random seeds) ופלטי אי-הודאות שנוצרו כדי להבטיח שחזור.
  4. תיעוד ושימור פלטי הסבריות
    1. שמור את כל ציוני חשיבות המאפיינים, מפות החום, מפות הסליאנסי, ויזואליזציות הקשב והפרשנויות הספציפיות למטופל שנוצרו. אחסן את פלטי ההסבריות בפורמטים סטנדרטיים של קבצים. ארכב את הפלטים יחד עם המודל המאומן ותצורת העיבוד המקדים.
    2. תעד את ההגדרות החישוביות, פרמטרי ההסבר, זמן הביצוע וגרסאות התוכנה ששימשו ליצירת ההסברים. שמור את תיעוד ההסבריות המלא כדי לאפשר ביקורת עצמאית ושחזור.
  5. הערכה כמותית של איכות ההסברים
    1. הערך את נאמנות ההסבר (faithfulness) על ידי הפרעה (perturbation) סיסטמטית או מיסוך של המאפיינים שזוהו כחשובים ומדידת השינוי התואם בפלט המודל. חשב ציון נאמנות-הסבר על ידי השוואת עוצמת הייחוס (attribution) לשינוי שנוצר בתחזית המודל.
    2. הערך את יציבות ההסבר על ידי יצירת הסברים עבור הרצות חוזרות, קלטים עם הפרעות או דגימות דומות קלינית, וחישוב הדמיון בין דפוסי הייחוס שנוצרו. חשב חוסר-נאמנות (infidelity) על ידי מדידת הפער בין שינוי הפלט החזוי לבין השינוי המוערך מייחוס ההסבר תחת הפרעות קלט מבוקרות.
    3. עבור הסברים של תמונות רפואיות, הערך את דיוק הלוקליזציה באמצעות אזור עניין (ROI) שהוגדר על ידי מומחה כאשר זמינות הערות ייחוס. הערך את התועלת הקלינית על ידי קבלת הערכות עצמאיות ממומחים קליניים מוסמכים באמצעות קריטריוני פרשנות שהוגדרו מראש.
    4. חשב את מדד Cohen's kappa או Fleiss' kappa כאשר מספר מומחים מעריכים באופן עצמאי את רלוונטיות ההסבר או את ההסכמה ביניהם.
      הערה: צור הסברים גלובליים ומקומיים המאפיינים את התנהגות התחזית של מודל ה-AI המאומן. שמור את פלטי ההסבריות והתצורות התואמות לצורך פרשנות שקופה והערכה ניתנת לשחזור.

9. ביצוע תיקוף סטטיסטי והערכת שחזור

  1. בצע תיקוף סטטיסטי
    1. בחרו שיטות סטטיסטיות בהתאם למטרת המחקר, לתכנון הניסוי, להתפלגות הנתונים ולמאפייני המשתנים הנבדקים.
    2. דווח על משתנים רציפים כממוצע ± סטיית תקן או כחציון וטווח בין-רבעוני, לפי העניין, ומשתנים קטגוריאליים כשכיחויות ואחוזים.
    3. בצעו אימות צולב של חמישה קיפולים (five-fold cross-validation) על קבוצת האימון כדי להעריך את יציבות ביצועי המודל, ודווחו על הדיוק (accuracy), ה-AUC-ROC, הדיוק החזוי (precision), הרגישות (recall) ומדד F1 כערך ממוצע. ± סטיית תקן בין הקיפולים (folds). העריכו רווחי סמך של 95% עבור מדדי הביצועים של סט הבדיקה העצמאי באמצעות 1,0 דגימות חוזרות בשיטת הבוטסטראפ (bootstrap resamples).
    4. השוו את המודל המוצע למודלי הבסיס CNN, Random Forest ו-SVM באמצעות מבחן מקנמר (McNemar's test) להשוואות דיוק מזווגות, מבחן דלונג (DeLong's test) להשוואות AUC-ROC מתואמות, ובדיקת בוטסטרפ מזווגת עם 1,0 דגימות חוזרות להשוואות של מדד F1.
    5. דווחו על סטטיסטי המבחן המתאים ועל ערך p מדויק עבור כל השוואה, והשתמשו ברמת מובהקות דו-זנבית של α = 0.05.
  2. השוואה סטטיסטית של ביצועי מודלים
    1. השוו את מודל ה-AI ההסברי המוצע עם מודלי הבסיס שנבחרו מתוך ה-state-of-the-art בלמידה חישובית (machine learning) ולמידה עמוקה (deep learning).
    2. החל את מבחן t של Student ט-בדיקה או במבחן Mann-Whitney U בעת השוואה בין שתי קבוצות, לפי העניין. יש להשתמש במבחן ANOVA חד-כיווני להשוואות פרמטריות רלוונטיות הכוללות יותר משתי קבוצות. יש להשתמש במבחן Kruskal-Wallis להשוואות לא-פרמטריות רלוונטיות הכוללות יותר משתי קבוצות.
    3. שקול p < 0.05 מובהק סטטיסטית, כפי שצוין בכתב היד המקורי.
    4. השתמש ברמת מובהקות דו-זנבית של α = 0.05 עבור כל ההשוואות הסטטיסטיות שהוגדרו מראש, ודווחו על הסטטיסטיקות של המבחן ועל ערכי ה-p המתאימים.
    5. דווחו על רווחי סמך של 95% עבור מדדי ביצועי הניבוי העיקריים.
    6. השתמשו בדגימה חוזרת בשיטת bootstrap להערכת רווחי סמך עבור מדדי ביצועים כאשר הדבר מתאים. השתמשו במבחן DeLong להשוואת ערכי ROC-AUC מתואמים כאשר אותם נבדקים מוערכים על ידי שני מודלים. השתמשו במבחן McNemar להשוואת תוצאות סיווג קטגוריות מזווגות שנוצרו עבור אותם נבדקים. השתמשו בהליכי bootstrap מזווגים להשוואת מדד F1 או מדדי ביצועים נגזרים אחרים כאשר הדבר מתאים.
    7. הערך את הכיול באמצעות גרפי כיול, שיפוע/נקודת חיתוך של הכיול ומדד ברייר (Brier score) כאשר זמינות תחזיות הסתברותיות.
    8. עבור תיקוף מערך הנתונים של סוכרת באינדיאנים מפيمه (Pima Indians Diabetes Dataset) שעובד, השתמש בהשוואה הסטטיסטית הזוגית שהוגדרה מראש עבור המודל המוצע ומודלי הבסיס. החל את המבחן שנבחר באופן עקבי על תחזיות קבוצת הבדיקה הזוגיות או על מדידות הביצועים של הרצות חוזרות, בהתאם לסוג ההשוואה. השתמש ברמת מובהקות דו-זנבית של α = 0.05 ודווחו על הסטטיסטיקה של המבחן ועל ערך ה-p המדויק. אין לדווח על מבחנים סטטיסטיים חלופיים כאילו בוצעו, אלא אם תוצאותיהם מוצגות בפרק התוצאות.
    9. יש להחיל מבחנים דו-זנביים ולפרש מובהקות סטטיסטית באמצעות סף שנקבע מראש של p < 0.05.
  3. הערכת חוסן המודל
    1. חזור על הליך האימון וההערכה המלא 10 פעמים תוך שימוש בגרעיני אקראיות (random seeds) שונים, תוך שמירה על חלוקת מערך הנתונים, נהלי העיבוד המקדימים, ארכיטקטורת המודל, ההיפר-פרמטרים, סביבת התוכנה ופרוטוקול ההערכה שהוגדרו מראש.
    2. רשמו את ערכי ה-AUC-ROC, הדיוק (accuracy) ומד ה-F1 עבור כל הרצה עצמאית ודווחו על הממוצע ± סטיית תקן לאורך 10 ההרצות.
    3. השוו את ערכי הביצועים שהתקבלו בין הרצות חוזרות כדי להעריך את היציבות החיזויית ואת השחזוריות תחת אתחולים אקראיים שונים.
  4. הערכת שחזוריות של יכולת ההסבר (Explainability Reproducibility)
    1. ייצרו ייחוסים של מאפיינים (feature attributions), מפות קשב (attention maps) או פלטי הסבר אחרים על פני מספר הרצות ניסוייות כאשר נכללת הערכת יציבות של ההסבר. השוו כמותית את פלטי ההסבר בין הרצות חוזרות באמצעות מדד דמיון מתאים או מדד הסכמה מבוס דירוג.
    2. עבור תיקוף נתוני ה-Pima Indians Diabetes Dataset הנוכחי, אין לדווח על מדדי יציבות של הסברים כמותיים, אלא אם בוצעו הפלטים והניתוחים התואמים של הסברים חוזרים.
    3. העריכו את מידת ההסכמה בין ההסברים שהפיק המודל לבין פרשנויות של קלינאים, כאשר הערכות קליניות מתאימות זמינות. חשבו את מקדם קאפא של כהן (Cohen's kappa) או את מקדם קאפא של פלייס (Fleiss' kappa), לפי העניין, כדי להעריך את מידת ההסכמה בין המדרגים.
  5. שחזוריות מסמכים
    1. שמרו את נתוני הגלם, את נהלי העיבוד המקדים, את קוד המקור, את המודלים המאומנים, את הגדרות ההיפר-פרמטרים, את פלטי ההסבריות, את סקריפטים של הניתוח הסטטיסטי ואת התוצאות שהופקו.
    2. תעד את סביבת התוכנה ואת תצורת החומרה ששימשו לאורך תזרים העבודה. בצע מחדש את תזרים העבודה המלא באופן עצמאי תוך שימוש בקבצים ובתצורות שנשמרו בארכיון.
    3. השוו את ביצועי הניבוי המשוכפלים עם התוצאות הניסיוניות המקוריות, ואת הסברי המודל המשוכפלים עם פלטי הניתנות להסבר המקוריים.
    4. יש לתעד כל הבדל שנצפה במהלך השחזור. יש לעדכן את התיעוד הניסויי כדי לשקף את התצפיות בנוגע לשחזוריות שזוהו במהלך הביצוע העצמאי.
      הערה: השג תוצאות ביצועים חיזויים ותוצאות יכולת הסבר (explainability) המהוות תיקוף סטטיסטי וניתנות להערכה לאורך ניסויים חוזרים. שמור תיעוד חישובי, אנליטי ומתודולוגי מספיק כדי לאפשר אימות עצמאי של כלל תהליך העבודה.
  6. רשימת תבדיקה לשחזוריות
    1. רשמו את שם מערך הנתונים, הגרסה, תאריך הרכישה, המקור, קריטריוני ההכללה, קריטריוני ההדרה ומספר הדגימות הסופי. רשמו את כל פעולות עיבוד המקדמים, פרמטרי הטרנספורמציה, הגדרות הנורמליזציה, נהלי בחירת המאפיינים וכללי חלוקת הנתונים.
    2. יש לתעד את מערכת ההפעלה, המעבד (CPU), המעבד הגרפי (GPU), הזיכרון (RAM), גרסת ה-Python, גרסאות המסגרות (frameworks) וגרסאות הספריות. יש לתעד את כל מפרטי ארכיטקטורת המודל ואת ההיפר-פרמטרים.
    3. תעדו את האופטימייזר, קצב הלמידה, גודל האצווה (batch size), מספר האיפוכים (epochs), פונקציית ההפסד, הרגולריזציה וקריטריוני העצירה המוקדמת. תעדו את כל הגרעינים האקראיים (random seeds) ואת הגדרות מחולל המספרים האקראיים.
    4. שמור את משקולות המודל המאומן ואת תצורות העיבוד המקדים. שמור את יומני האימון, את סקריפטי ההערכה, את סקריפטי הניתוח הסטטיסטי ואת פלטי ההסביריות. רשום את גרסאות המודל והתוכנה ששימשו את הניסויים הסופיים.
    5. שמר את סביבת המחשוב המלאה הנדרשת לשחזור עצמאי.
    6. יש לתעד את זמינותם של קוד המקור, מערכי הנתונים, משקולות המודל וחומרי העזר, בכפוף למגבלות אתיות, משפטיות, רישיוניות ומגבלות פרטיות.
    7. בצעו מחדש את זרימת העבודה (workflow) שנשמרה באופן עצמאי והשוו את התוצאות המשוכפלות לתוצאות המקוריות.
    8. תעד את דרישות השחזוריות המלאות באמצעות רשימת הבדיקה הסטנדרטית.

תוצאות

מסגרת ה-XAI המוצעת יושמה באמצעות מערך הנתונים Pima Indians Diabetes כסמון למערך נתונים בתחום הבריאות. מערך הנתונים Pima Indians Diabetes שימש כמערך הנתונים היחיד לתיקוף ניסויי. כל תוצאות הניבוי, ההסביריות, הסטטיסטיקה והשחזור שדווחו הופקו ממערך נתונים זה. TCGA-BRCA, TCGA-UCEC, MIMIC-III, ISIC 2019, HAM10, OhioT1DM ו-BraTS 2021 לא הוערכו באופן ניסויי ונכללו רק כדוגמאות הממחישות את ישימות הפרוטוקול הכללי על פני מודליות שונות של נתוני בריאות. מערך הנתונים המלא היה בשימוש לאחר הסרת רשומות לא תקינות וכפולות, וביצוע פעולות עיבוד מקדים מוגדרות לפני פיתוח המודל. מערך הנתונים חולק לתתי-קבוצות בלתי תלויות של אימון, תיקוף ובדיקה באמצעות אסטרטגיית פיצול רב-שכבתית (stratified splitting) שהוגדרה מראש. עצמאות הדגימות בין שלוש תתי-הקבוצות נשמרה כדי למזער את האפשרות של דליפת נתונים (data leakage).

המודל החיזוי הוגדר באמצעות הארכיטקטורה וההיפר-פרמטרים שהוגדרו מראש. המודל אומן באמצעות אופטימייזר Adam עם קצב הלמידה וגודל ה-batch שהוגדרו מראש למשך עד 10 epochs. הופעל מנגנון עצירה מוקדמת (Early stopping) בהתבס על הפסד התיקוף (validation loss), והמודל שהתאים לביצועי התיקוף הטובים ביותר נשמר. נקודות התחלה אקראיות (Random seeds) הוגדרו עבור חלוקת מערך הנתונים, אתחול המודל וניסויים חוזרים כדי לשפר את השחזוריות.

המודל המאומן הוערך על קבוצת הבדיקה העצמאית באמצעות מדדי דיוק (accuracy), דיוק חיובי (precision), רגישות (recall), סגוליות (specificity), F1-score, מקדם המתיוס (MCC), השטח תחת עקומת מאפייני המקלט (AUC-ROC) ודיוק ממוצע (AP). המודל המוצע הושווה למודלי הבסיס שהוגדרו מראש תוך שימוש בהליכי עיבוד מקדים, חלוקות נתונים ופרוטוקולי הערכה זהים. עקומות מאפייני המקלט (ROC), עקומות דיוק-רגישות (precision-recall) ומטריצת בלבול הופקו מניבויי קבוצת הבדיקה העצמאית.

בוצעה וולידציה צולבת של חמישה קיפולים (Five-fold cross-validation) על נתוני האימון כדי להעריך את יציבות הביצועים. מרווחי סמך של 95% הוערכו עבור מדדי הביצועים העיקריים, ונערכו השוואות סטטיסטיות שהוגדרו מראש בין המודל המוצע למודלי הבסיס.

אישור צולב (cross-validation) של חמישה קיפולים הניב דיוק של 93.01 ± 0.48%, AUC-ROC של 0.954 ± 0.007, דיוק חיזוי (precision) של 92.42 ± 0.87%, רגישות (recall) של 93.02 ± 0.45%, ומד F1-score של 92.72 ± 0.62%. מרווחי סמך של 95% בשיטת bootstrap, שהוערכו מ-1,00 דגימות חוזרות, היו 0.897–0.973 עבור הדיוק, 0.890–0.970 עבור הדיוק בחיזוי, 0.80–0.963 עבור הרגישות, 0.87–0.965 עבור מדד ה-F1-score, ו-0.931–0.984 עבור ה-AUC-ROC. השוואות סטטיסטיות עם מודלי הבסיס CNN, Random Forest ו-SVM בוצעו באמצעות מבחן McNemar's עבור הדיוק, מבחן DeLong's עבור ה-AUC-ROC, ובדיקות bootstrap מזווגות עם 1,00 דגימות חוזרות עבור מדד ה-F1-score.

הליך האימון וההערכה המלא חזר על עצמו ב-10 הרצות עצמאיות תוך שימוש בגרעיני אקראיות (random seeds) שונים. ההרצות החוזרות הניבו AUC-ROC של 0.957 ± 0.08, דיוק של 93.24 ± 0.74%, ומד F1-score של 92.35 ± 0.92%, מה שמעיד על שונות נמוכה יחסית בין ההרצות החוזרות. מדדי הביצועים שהתקבלו לאורך ההרצות החוזרות סוכמו באמצעות ממוצע וסטיית תקן. השונות בין ההרצות נבדקה כדי לקבוע אם ביצועי הניבוי נותרו יציבים תחת הרצה חוזרת.

תיקוף חיצוני לא בוצע בדוגמה המעשית הנוכחית מכיוון שלא נעשה שימוש במערך נתונים חיצוני בלתי תלוי. בהתאם לכך, כל תוצאות הניבוי, הסטטיסטיקה והשחזור שדווחו התקבלו מתוך ה-Pima Indians Diabetes Dataset תוך שימוש במחיצות האימון, התיקוף והבדיקה הבלתי תלויות שהוגדרו מראש. התיקוף החיצוני נשמר בפרוטוקול כהליך אופציונלי עבור יישומים שבהם זמין מערך נתונים בלתי תלוי ממוסד, אוכלוסייה, אזור גיאוגרפי או תקופה שונים.

הסברי מודל הופקו באמצעות טכניקות להסברות (explainability) הישימות למסד הנתונים הטבלאי Pima Indians Diabetes Dataset, כולל SHAP ו-LIME. בוצע הערכה של חשיבות מאפיינים גלובלית, והופקו הסברים מקומיים ספציפיים למטופלים באמצעות דגימות בדיקה ששמרו בנפרד. פלטי ההסברים תועדו יחד עם תחזיות המודל התואמות וערכי המאפיינים כדי להקל על השחזור ועל הפרשנות העוקבת.

למען הבהירות, דוגמה מעשית זו כללה את תשעת שלבי זרימת העבודה המרכזיים שזוהו ב-טבלה 1. תיקוף חיצוני והערכה של מומחים קליניים נשמרו כמודולי תיקוף אופציונליים של הפרוטוקול הכללי. תיקוף חיצוני לא בוצע מכיוון שלא נעשה שימוש במערך נתונים חיצוני עצמאי, והערכה של מומחים קליניים לא בוצעה מכיוון שלא נכלל פאנל הערכה רשמי של מומחים בדוגמה מעשית זו. בהתאם לכך, מודולים אופציונליים אלה אינם נחשבים לחלק מזרימת העבודה הניסויית בתשעה השלבים ואינם מדווחים כתוצאות ניסיוניות.

הליכי עיבוד המקדמים וחלוקת מערך הנתונים הניבו מערך נתונים סטנדרטי המתאים לפיתוח המודל. רשומות כפולות ובלתי עקביות הוסרו, ערכים חסרים טופלו בהתאם לאסטרטגיה שהוגדרה מראש, מאפיינים מספריים עברו סטנדרטיזציה, ומערך הנתונים חולק לתתי-קבוצות נפרדות של אימון, תיקוף ובדיקה. מאפייני מערך הנתונים שהתקבל והליכי עיבוד המקדמים מסוכמים בטבלה 2. זרימת העבודה הכללית להכנה ועיבוד מקדים של מערך נתונים בתחום הבריאות מוצגת באיור 2, בעוד שזרימת העבודה של ההכנה הניסויית, העיבוד המקדים, החלוקה והערכת האיכות שיושמה באופן ספציפי על מערך הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset) מוצגת באיור 3. סביבת המחשוב הסופית, ארכיטקטורת המודל ותצורת ההיפר-פרמטרים ששימשו להפקת התוצאות המדווחות מסוכמות בטבלה 3.

ביצוע סעיפים 3 ו-4 הניב סט נתונים רפואי סטנדרטי המתאים לפיתוח מודלים. הליכי עיבוד המקדמים הסירו רשומות כפולות ובלתי עקביות, ביצעו השלמה של ערכים חסרים (imputation), נרמלו מאפיינים מספריים, קידדו משתנים קטגוריאליים במידת הצורך, וחילקו את סט הנתונים לתתי-קבוצות של אימון, תיקוף ובדיקה. הנתונים שהתקבלו סיפקו את הקלט הסטנדרטי הנדרש לפיתוח המודל בהמשך.

לאחר השלמת סעיפים 5 ו-6, המודל שהוגדר הפגין התכנסות יציבה במהלך האימון. עקומות הלמידה הראו ירידה סימולטנית בהפסדי האימון והוולידציה, ועלייה בדיוק האימון והוולידציה. אופטימיזציה של ההיפר-פרמטרים שיפרה את הכללה של המודל, ללא עדות לאובוורפיטינג (overfitting) משמעותי. לתמיכה בהדירות (reproducibility), המודל המופטימיזציה הגונה יחד עם הארכיטקטורה הסופית, הגדרות ההיפר-פרמטרים, גרסאות התוכנה, ה-random seeds ומשקולות המודל המאומן. מפרטי אימון המודל ותוצאות האופטימיזציה מסוכמים בטבלה 4, ועקומות הלמידה המתאימות של האימון והוולידציה מוצגות באיור 4.

סעיף 7 העריך את ביצועי הניבוי של המודל באמצעות מדדי ביצועים סטנדרטיים. מדדי הסיווג שהוערכו כללו accuracy, precision, recall, specificity, F1-score, MCC, AUC-ROC ו-AP. המודל המוצע הושווה למודלי הבסיס שהוגדרו מראש תוך שימוש באותן חלוקות של מערך הנתונים, נהלי עיבוד מקדים ופרוטוקול הערכה. השוואת ביצועי הניבוי מוצגת ב-טבלה 5, בעוד שעקומות ROC, עקומות precision-recall, מטריצת בלבול ומדדי ביצועים השוואתיים מוצגים ב-איור 5.

בהמשך לסעיף 8, הופקו הסברים גלובליים ומקומיים לתחזיות המודל כדי להעריך את יכולת הפרשנות שלו. הסברי המודל הופקו באמצעות SHAP ו-LIME עבור מערך הנתונים הטבלאי Pima Indians Diabetes, והופק הסבר קוּנטר-פקטיבי (counterfactual) ספציפי למטופל כדי להדגים שינוי בתחזית. SHAP שימש ליצירת ויזואליזציות של חשיבות תכונות גלובלית, תרשים מפל (waterfall) ספציפי למטופל ותלות תכונות, בעוד ש-LIME שימש להפקת הסברים מקומיים מדגימות בדיקה שהוצאו מהמדגם. פלטי יכולת ההסבר התואמים מוצגים ב-איור 6.

השלב הסופי של הפרוטוקול העריך את המהימנות הסטטיסטית ואת השחזוריות של תהליך העבודה. תהליך העבודה המלא חזר על עצמו ב-10 הרצות עצמאיות תוך שימוש בזרעים אקראיים (random seeds) שונים, תוך שמירה על אותה אסטרטגיה של חלוקת הנתונים, פרמטרי עיבוד מקדים, ארכיטקטורת מודל, היפר-פרמטרים, סביבת תוכנה ונהלי הערכה. ההרצות החוזרות הניבו AUC-ROC של 0.957 ± 0.008, דיוק של 93.24 ± 0.74% ו-F1-score של 92.35 ± 0.92%, מה שמעיד על שונות נמוכה יחסית בין ההרצות החוזרות.

יציבות ההסברים לא הוערכה באופן כמותי בתהליך התיקוף הנוכחי. למרות שהופקו הסברים באמצעות SHAP ו-LIME עבור ה-Pima Indians Diabetes Dataset, לא בוצע ניתוח נפרד של מתאם דרגות (rank-correlation) או חפיפת מאפיינים בין הרצות. לפיכך, לא מדווחים מדדים כמותיים של יציבות הסברים או הסכמת שיוך (attribution-agreement). הערכה כמותית של יציבות ההסברים נשמרה בפרוטוקול הכללי כהליך שחזור אופציונלי עבור יישומים שבהם פלטי הסבר חוזרים זמינים.

השוואות סטטיסטיות הוערכו באמצעות סף מובהקות שהוגדר מראש של p < 0.05. במקומות הרלוונטיים נעשה שימוש במבחנים סטטיסטיים דו-זנביים, והסטטיסטיקות של המבחן המתאימות, ערכי ה-p ומרווחי סמך של 95% דווחו כדי לכמת את המובהקות הסטטיסטית ואת אי-הוודאות של ההבדלים בביצועים שנצפו. תוצאות התיקוף הסטטיסטי והשחזוריות הניסיוניות, כולל ביצועי תיקוף צולב, מרווחי סמך, השוואות סטטיסטיות ושונות בין הרצות חוזרות, מסוכמות ב-טבלה 6. הבדיקות הסטטיסטיות וניתוחי השחזוריות המתאימים מוצגים ב-איור 7.

תוצאות אלו סיפקו ראיה ניסויית ליציבות ניבויית ולשחזוריות תחת תנאי החישוב ומערך הנתונים שנבחנו. סביבת החישוב, מאפייני מערך הנתונים, נהלי עיבוד מקדמי, תצורת המודל, הניתוחים הסטטיסטיים והגדרות ההסברות הנדרשות לשחזור עצמאי תועדו בהתאם לרשימת הבדיקה לשחזוריות המוצגת ב- טבלה 7בדוגמת התיקוף המעשית של העבודה הנוכחית לא בוצעו הערכות של מומחים קליניים עבור פלטי ה-XAI שהופקו.

באופן כללי, יישום הפרוטוקול הניב מערך נתונים רפואי סטנדרטי המתאים לפיתוח מודלי AI ומודל מותאם באמצעות הגדרות היפר-פרמטרים שנקבעו מראש. זרימת העבודה אפשרה הערכה שיטתית של ביצועי הניבוי, יצירת הסברים למודל באמצעות טכניקות XAI רלוונטיות, והערכה סטטיסטית של חוסנו ויכולת השחזור של המודל. יחד, התוצאות הדגימו את היישום ואת יכולת השחזור של זרימת עבודת ה-XAI המוצעת תחת התנאים הניסיוניים שנבחנו בדוגמת התיקוף המעשית.

figure-results-1
איור 1: זרימת עבודה מרכזית בתשעה שלבים לפיתוח מודלי AI הניתנים לשחזור ולהסבר במגזר הבריאות. זרימת העבודה כוללת (1) הגדרת משימת חיזוי בתחום הבריאות, (2) הגדרת סביבה חישובית, (3) רכישה ותיקוף של מערכי נתונים, (4) עיבוד מקדמי של נתונים, (5) חלוקת מערך הנתונים, (6) אימון מודל חיזוי, (7) הערכת ביצועי חיזוי, (8) ניתוח יכולת הסבר, ו-(9) תיקוף סטטיסטי והערכת יכולת שחזור. תיקוף חיצוני והערכה של מומחים קליניים נחשבים להרחבות אופציונליות של הפרוטוקול ואינם כלולים בזרימת העבודה המרכזית בתשעה השלבים. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-2
איור 2: תהליך עבודה להכנה ועיבוד מקדים של מערכי נתונים בתחום הבריאות. (Aרכישת נתוני בריאות מרשומות קליניות, דימות רפואי, אותות פיזיולוגיים ומקורות נתונים מולטי-מודליים.Bאינטגרציה ועיבוד מקדים של נתונים, כולל טיפול בערכים חסרים, נורמליזציה, הסרת רעשים והעשרה (augmentation).Cחלוקת מערך הנתונים לתתי-קבוצות של אימון, תיקוף ובדיקה.ד') הערכת איכות המציגה את התפלגות המחלקות, נורמליזציה של מאפיינים ותוצרי עיבוד מקדים לפני פיתוח המודל. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-3
איור 3: זרימת העבודה הניסויית להכנה, עיבוד מקדים, חלוקה והערכת איכות של מאגר הנתונים של סוכרת בקרב אינדיאנים מפונימה (Pima Indians Diabetes Dataset). זרימת העבודה כוללת רכישת מאגר נתונים, הערכת איכות הנתונים, טיפול בערכים לא תקינים וחסרים, סטנדרטיזציה של מאפיינים מספריים, חלוקת מאגר הנתונים לתתי-קבוצות של אימון, תיקוף ובדיקה עצמאית, ואימות איכות סופי לפני פיתוח המודל. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-4
איור 4: עקומות למידה של אימון ניסויי ותיקוף של המודל המוצע באמצעות מערך הנתונים של סוכרת באינדיאנים פימה (Pima Indians Diabetes Dataset). (A) הפסד האימון והתיקוף לאורך כל תקופת האימון. (B) דיוק האימון והתיקוף לאורך תקופת האימון המלאה. (C) תצוגה מורחבת של ההפסד (loss) במהלך תקופות (epochs) 50–10. (ד') תצוגה מוגדלת של הדיוק במהלך תקופות (epochs) 50–10. ביצועי האימות הטובים ביותר התקבלו בתקופה 78, עם הפסד אימות (validation loss) של 0.142 ודיוק אימות של 94.6%. עצירה מוקדמת (Early stopping) הופעלה בתקופה 8 תוך שימוש בסבלנות (patience) של 10 תקופות. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-5
איור 5: הערכה ניסויית של ביצועי הניבוי של מסגרת ה-XAI המוצעת באמצעות סט הבדיקה הבלתי תלוי (n = 154). (A) עקומת מאפייני תפעול של מקלט (ROC), המראה את ביצועי ההבחנה של מודל ה-XAI המוצע ומודלי הבסיס. (B(עקומות דיוק-החזר (PR) המראות את ביצועי הדיוק וההחזר של מודל ה-XAI המוצע ומודלי הבסיס. (C) מטריצת בלבול של מודל ה-XAI המוצע על קבוצת הבדיקה העצמאית, עם הדיוק (accuracy), הרגישות (recall) והספציפיות המתאימים. (ד) השוואה בין הדיוק (accuracy), הדיוק החזוי (precision), הזיכרון (recall), הסגוליות (specificity), מדד F1, מקדם המתיוס (MCC), השטח תחת העקומה של ROC (AUC) והדיוק הממוצע (AP) בין המודלים שנבדקו. כל התוצאות הכמותיות המוצגות באיור זה מתייחסות לניסוי התיקוף על מאגר הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset). אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.

figure-results-6
איור 6: פלטי הסבירות (explainability) שהופקו מניבויים של סט בדיקה בלתי תלוי של המודל המוצע, שאומן על מאגר הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset). (A(תרשים סיכום SHAP גלובלי המראה את התפלגות תרומות המאפיינים על פני סט הבדיקה. (B) תרשים חשיבות מאפיינים של SHAP המבוס על ערכי SHAP מוחלטים ממוצעים. (C) תרשים מפל (waterfall plot) של SHAP ספציפי למטופל, המראה את תרומתם של מאפיינים בודדים להסתברות החזויה לסוכרת. (ד'(E) הסבר מקומי של LIME המראה את תרומות המאפיינים עבור חולה בדיקה מס' 125. (F) תרשים תלות של SHAP המראה את הקשר בין ערכי הגלוקוז לבין תרומות ה-SHAP שלהם. (G) הסבר נגדי (counterfactual) ספציפי למטופל המראה את השינויים המינימליים במאפיינים הקשורים לשינוי בניבוי המודל. קיצורים: SHAP = Shapley Additive exPlanations; LIME = Local Interpretable Model-agnostic Explanations. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-7
איור 7: תיקוף סטטיסטי ניסיוני ואנליזת הדירות של המודל המוצע באמצעות מערך הנתונים של סוכרת בקרב אינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset). (A(ביצועי אימות צולב של חמישה קיפולים על קבוצת האימון. (B(רווחי סמך bootstrap של 95% עבור ביצועי סט בדיקה בלתי תלוי. (C(השוואות סטטיסטיות מול מודלי בסיס, כולל המבחן הסטטיסטי, סטטיסטי המבחן, ערך ה-p והמובהקות.)דעקביות ביצועים לאורך 10 הרצות עצמאיות תוך שימוש בגרעיני אקראיות שונים. מבחן McNemar שימש לבדיקת דיוק סיווג מזווג, מבחן DeLong לבדיקת ROC-AUC מתואם, ובדיקת bootstrap מזווגת עם 1,0 דגימות חוזרות להשוואת מדד F1. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

שלבפעילות הפרוטוקולפלט צפויסטטוס יישום
1בחירה ותיקוף של מערך נתוני שירותי הבריאותסט נתונים מאומת, יעד חיזוי, התפלגות מחלקות ומידע על איכות הנתוניםבוצע
2הגדרת סביבת המחשובחומרה, תוכנה, ספריות, גרסאות ותצורה חישובית מאומתיםבוצע
3עיבוד מקדים ובקרת איכות של נתוני שירותי הבריאותסט נתונים מנוקה, מעובד ומנורמלבוצע
4חלק את מערך הנתוניםמאגרי נתונים עצמאיים לאימון, לתיקוף ולבדיקהבוצע
5פיתוח ואופטימיזציה של מודל החיזוי/XAIארכיטקטורת המודל וההיפר-פרמטרים הסופייםבוצע
6אימון ושימור המודלמודל מאומן, נקודת ביקורת (checkpoint), תצורת אימון ולוגיםבוצע
7הערכת ביצועים חיזויים וחישובייםמדדי ביצועים של סט הבדיקה והשוואות ביצועיםבוצע
8הפקה והערכה של פלטי הסבריותSHAP/LIME ופלטי הסבר רלוונטייםבוצע
9בצעו תיקוף סטטיסטי והערכת הדירותרווחי סמך, מבחנים סטטיסטיים, תוצאות של הרצות חוזרות ומדדי הדירותבוצע

טבלה 1: סיכום של זרימת העבודה של פרוטוקול הליבה בן תשעת השלבים שיושם בתהליך התיקוף באמצעות מערך הנתונים של סוכרת בקרב אינדיאנים מפמי (Pima Indians Diabetes Dataset). הטבלה מבדילה בין תשעת השלבים שיושמו בדוגמה המעשית של מערך הנתונים של סוכרת בקרב אינדיאנים מפמי לבין תיקוף חיצוני והערכה של מומחים קליניים, אשר נשמרים כמרכיבים אופציונליים של הפרוטוקול הכללי.

סט נתוניםמקור הנתוניםיישום קלינימודליות נתוניםנבדקים/רשומותדגימותמחלקותהתפלגות מחלקותאימון/תיקוף/בדיקהתפקיד במחקר הנוכחיסטטוס תיקוףכתובת מקור (URL)
Pima Indians Diabetes DatasetUCI Machine Learning Repositoryניבוי סוכרתטבלאי קליני768 רשומות768250 לא סוכרתיים; 268 סוכרתיים60% / 20% / 20%סט נתונים עיקרי לתיקוף ניסיוניבוצע – זרימת עבודה ליבלית מלאה בתשעה שלביםhttps://archive.ics.uci.edu/dataset/34/pima+indians+diabetes
TCGA-BRCANCI Genomic Data Commons (GDC), פרויקט TCGA-BRCAסיווג סרטן השדקליני + היסטופתולוגיה1,098 מקריםתלוי בסט הנתונים לפי סוג הנתוניםתלוי בנקודת קצהאין התפלגות מחלקות אחת עבור כל סט הנתוניםלא רלוונטי – לא בוצע פיצול ניסיונידוגמה ליישום הפרוטוקול בלבדלא שימש לתיקוף ניסיוניhttps://portal.gdc.cancer.gov/projects/TCGA-BRCA
TCGA-UCECNCI Genomic Data Commons (GDC), פרויקט TCGA-UCECסיווג סרטן הרחםקליני + היסטופתולוגיהקוהורט הפרויקט; הגודל תלוי בסוג הנתונים ובמסננים שנבחרותלוי בסט הנתונים לפי סוג הנתוניםתלוי בנקודת קצהאין התפלגות מחלקות אחת עבור כל סט הנתוניםלא רלוונטי – לא בוצע פיצול ניסיונידוגמה ליישום הפרוטוקול בלבדלא שימש לתיקוף ניסיוניhttps://portal.gdc.cancer.gov/projects/TCGA-UCEC
MIMIC-IIIPhysioNet, MIMIC-III Clinical Database v1.4ניבוי תוצאה קליניתסדרות זמן קליניות46,520 חולים58,976 אשפוזים ביחידה לטיפול נמרץ (ICU)תלוי במשימהאין התפלגות מחלקות אחת עבור כל מסד הנתוניםלא רלוונטי – לא בוצע פיצול ניסיונידוגמה ליישום הפרוטוקול בלבדלא שימש לתיקוף ניסיוניhttps://physionet.org/content/mimiciii/1.4/
ISIC 2019International Skin Imaging Collaboration (ISIC) Challengeסיווג נגעים בעורתמונות דרמוסקופיותלא רלוונטי – סט נתוני תמונות25,31 תמונות אימון8 קטגוריות אימוןAKIEC 867; BCC 3,323; BKL 2,624; DF 239; MEL 4,52; NV 12,875; VASC 253; SCC 628לא רלוונטי – לא בוצע פיצול ניסיונידוגמה ליישום הפרוטוקול בלבדלא שימש לתיקוף ניסיוניhttps://challenge.isic-archive.com/landing/2019/
HAM10Harvard Dataverse / ISIC Archiveסיווג נגעים בעורתמונות דרמוסקופיות7,470 נגעים ייחודיים10,015 תמונות7AKIEC 327; BCC 514; BKL 1,09; DF 15; MEL 1,13; NV 6,705; VASC 142לא רלוונטי – לא בוצע פיצול ניסיונידוגמה ליישום הפרוטוקול בלבדלא שימש לתיקוף ניסיוניhttps://doi.org/10.7910/DVN/DBW86T
OhioT1DMסט נתוני OhioT1DM, הופץ באופן ציבורי למחקרניטור/ניבוי סוכרתסדרות זמן קליניות12 משתפים24 קבצי XML על פני נתוני אימון/פיתוח ובדיקהניבוי גלוקוז רציף; איננו משימת סיווג קבועהלא רלוונטיקבצי אימון/פיתוח ובדיקה המוגדרים על ידי סט הנתונים; לא בוצע פיצול ניסיוני כאןדוגמה ליישום הפרוטוקול בלבדלא שימש לתיקוף ניסיוניhttps://pmc.ncbi.nlm.nih.gov/articles/PMC781904/
BraTS 2021RSNA-ASNR-MICCAI BraTS 2021; CBICA/University of Pennsylvaniaסגמנטציה/סיווג של גידולי מוחMRI2,040 מקרים בקוהורט התחרות1,251 מקרי אימון מתויגים; ארבע מודליות MRI לכל מקרהתלוי במשימהאין התפלגות מחלקות אחת עבור כל סט הנתוניםקוהורטים המוגדרים על ידי התחרות; לא בוצע פיצול ניסיוני כאןדוגמה ליישום הפרוטוקול בלבדלא שימש לתיקוף ניסיוניhttps://www.med.upenn.edu/cbica/brats2021/

טבלה 2: מאפייני מערכי נתונים של שירותי בריאות והתאמת הפרוטוקול המוצע. הטבלה מסכמת את מקורות הנתונים, היישומים הקליניים, המודליות, מאפייני הדגימות, התפלגויות המחלקות, אסטרטגיות חלוקת מערכי הנתונים, סטטוס התיקוף ומידע על המקור עבור מערכי הנתונים של שירותי הבריאות שנבחנו בפרוטוקול. מערך הנתונים Pima Indians Diabetes משמש כדוגמה המרכזית לתיקוף הפרוטוקול.

פריט הגדרההגדרת תיקוף מעשית**סטטוס / פרשנות
ערכת נתוניםPima Indians Diabetes Datasetערכת נתונים לתיקוף ניסיוני מעשי
אלגוריתם / מודלמודל חיזוי טבלאי לסיווג בינארי של סוכרתהשתמש בשם הארכיטקטורה המדויק מתיעוד הניסוי אם תועד בנפרד
קצב למידה0.01הגדרה ניסיונית
אופטימייזרAdamהגדרה ניסיונית
גודל אצווה (Batch Size)32הגדרה ניסיונית
מספר תקופות (Epochs) מקסימלי10הגדרה ניסיונית
פונקציית הפסדCross-Entropyהגדרה ניסיונית
פונקציית אקטיבציהReLUהגדרה ניסיונית
Dropout0.5הגדרה ניסיונית
דעיכת משקולות (Weight Decay)1e-4הגדרה ניסיונית
נורמליזציה של אצווה (Batch Normalization)מופעלהגדרה ניסיונית
העשרת נתונים / איזון מחלקותמופעלציין SMOTE רק אם הוא הופעל בפועל בהרצה המדווחת
אסטרטגיית תיקוף5-fold cross-validationהגדרה ניסיונית
עצירה מוקדמתPatience = 10 epochsהגדרה ניסיונית
זרע אקראי (Random Seed)42השתמש בהגדרת הזרע המדויקת שתועדה עבור הניסוי
הרצות חוזרות10 הרצות עצמאיות באמצעות זרעים אקראיים שוניםניתוח שחזוריות ניסיונית
גודל תמונת קלטלא רלוונטיערכת נתוני Pima היא טבלאית
מימד תכונות512השתמש רק אם זהו ייצוג התכונות הסופי שיושם
ניתנות להסברSHAP + LIME; הסבר קונטרפקטואלי מוצג באיור 6ניתוח XAI מדווח מעשי
מדדי הערכהAccuracy, precision, recall, specificity, F1-score, MCC, AUC-ROC, APמדדי הערכה ניסיוניים מדווחים
חומרהNVIDIA GPUהחל בדגם ה-GPU המדויק אם תועד
תוכנה / מסגרת עבודה (Framework)Python 3.1; Scikit-learn; רכיבי מסגרת עבודה ששימשו את המימושהשתמש בגרסאות חבילה מדויקות אם תועדו

טבלה 3: סביבה חישובית, ארכיטקטורת מודל ותצורת היפר-פרמטרים ששימשה ליישום הפרוטוקול. הטבלה מפרטת את הפלטפורמה החישובית, סביבת התוכנה, ארכיטקטורת המודל, תצורת הקלט, פרמטרי האופטימיזציה, הגדרות הרגולריזציה ופרמטרי השחזור ששימשו ליישום תהליך העבודה המוצע של XAI.

פרמטרמפרט / תוצאה מייצגים
אופטימייזראדם
קצב למידה0.001
גודל סדרה32
מספר תקופות מקסימלי100
סבלנות לעצירה מוקדמת10 תקופות (epochs)
האיפוק (epoch) המיטבי78
עידן עצירה מוקדמת (Early-stopping epoch)88
הפסד האימות הנמוך ביותר0.142
דיוק האימות הטוב ביותר94.6%
פלט אימוןההפסד של האימון והתיקוף פחתו והתכנסו
פלט תיקוףדיוק האימון והתיקוף עלו והתייצבו
תוצאת האופטימיזציהביצועי המודל הטובים ביותר הושגו באפוקה 78
בקרת התאמת-יתרעצירה מוקדמת (Early stopping) מנעה אופטימיזציה נוספת מעבר לאפוק (epoch) הטוב ביותר שנבחר

טבלה 4: מפרטי אימון המודל ותוצאות האופטימיזציה. הטבלה מסכמת את האופטימייזר, קצב הלמידה, גודל האצווה (batch size), מספר תקופות האימון המקסימלי (epochs), ביצועי התיקוף, התכנסות האימון, תוצאת האופטימיזציה ואסטרטגיית הבקרת overfitting ששימשו במהלך פיתוח המודל.

מודלדיוק (%)דיוק חיזוי (%)רגישות (%)סגוליות (%)מדד F1 (%)MCCAUC (ROC)AP (PR)
מודל XAI המוצע93.594.592.494.693.40.870.960.94
למידה עמוקה (CNN)89.189.88.1908.90.780.920.9
Random Forest84.38583.285.784.10.670.860.81
מכונת וקטורים תומכים (SVM)78.679.37.18078.20.540.790.72
קו בסיס (מחלקה דומיננטית)62.162.110076.600.50.5

טבלה 5: השוואת ביצועים חיזויים של המודלים שהוערכו. הטבלה משווה בין מודל ה-XAI המוצע לבין מודלי הבסיס שהוערכו באמצעות דיוק (accuracy), ערך ניבוי חיובי (precision), רגישות (recall), סגוליות (specificity), מדד F1, מקדם המתיוס (Matthews correlation coefficient), השטח תחת עקומת ה-ROC, ודיוק ממוצע (average precision).

ניתוח תיקוףהשוואה / מדדמבחן סטטיסטיסטטיסטי המבחןpערך-pתוצאה ניסויית / רווח בר-סמך של 95%
ולידציה צולבת חמיש-מגלית (Five-fold cross-validation)דיוקתיאורי (ממוצע ± סטיית תקן (SD)93.01 ± 0.48%
ולידציה צולבת חמיש-מגלה (Five-fold cross-validation)AUC-ROCתיאורי (ממוצע ± סטיית תקן (SD)0.954 ± 0.007
valida-צלב חמיש-מגלי (Five-fold cross-validation)דיוקתיאורי (ממוצע ± סטיית תקן (SD)92.42 ± 0.87%
ולידציה צולבת של חמישה קיפולים (Five-fold cross-validation)הסליקה (Recall)תיאורי (ממוצע ± סטיית תקן (SD)93.02 ± 0.45%
validaציה צולבת חומשית (Five-fold cross-validation)מדד F1 (F1-score)תיאורי (ממוצע ± סטיית תקן (SD)92.72 ± 0.62%
רווח סמך בוטסטראפ של 95%דיוקבוטסטראפ (1,0 דגימות חוזרות)0.935 [0.897, 0.973]
רווח בר סמך בוטסטראפ של 95%דיוקבוטסטראפ (1,0 דגימות חוזרות)0.930 [0.890, 0.970]
רווח בר-סמך של 95% בשיטת בוטסטראפ (bootstrap)רגישות (Recall)בוטסטראפ (1,0 דגימות חוזרות)0.922 [0.880, 0.963]
רווח בר סמך בוטסטראפ של 95%מדד F1בוטסטראפ (1,0 דגימות חוזרות)0.926 [0.887, 0.965]
רווח בר סמך בוטסטראפ של 95%AUC-ROCבוטסטראפ (1,0 דגימות חוזרות)0.958 [0.931, 0.984]
המודל המוצע לעומת CNNדיוק (%)מבחן מקנמר (McNemar's test)9.320.0023מובהק (α = 0.05)
המודל המוצע לעומת CNNAUC-ROCמבחן דלונג (DeLong's test)3.870.0001מובהק (α = 0.05)
המודל המוצע לעומת CNNמדד F1בוטסטראפ מזווג (1,0 דגימות חוזרות)2.810.0044מובהק (α = 0.05)
המודל המוצע לעומת יער אקראי (Random Forest)דיוק (%)מבחן מקנמר (McNemar's test)14.270.0002מובהק (α = 0.05)
המודל המוצע לעומת Random ForestAUC-ROCמבחן דלונג (DeLong's test)5.86<0.0001מובהק (α = 0.05)
המודל המוצע לעומת יער אקראי (Random Forest)מדד F1 (F1-score)בוטסטראפ מזווג (1,0 דגימות חוזרות)4.030.0003מובהק (α = 0.05)
המודל המוצע לעומת SVMדיוק (%)מבחן מקנמר (McNemar's test)16.08<0.0001מובהק (α = 0.05)
המודל המוצע לעומת SVMAUC-ROCמבחן דלונג (DeLong's test)6.95<0.0001מובהק (α = 0.05)
המודל המוצע לעומת SVMמדד F1בוטסטראפ מזווג (1,0 דגימות חוזרות)4.62<0.0001מובהק (α = 0.05)
שחזוריות בריצות חוזרות (10 ריצות עצמאיות)AUC-ROCתיאורי (ממוצע ± סטיות תקן (SD)0.957 ± 0.008
שחזוריות בריצות חוזרות (10 ריצות עצמאיות)דיוק (%)תיאורי (ממוצע ± סטיות תקן (SD)93.24 ± 0.74%
שחזוריות בריצות חוזרות (10 ריצות עצמאיות)מדד F1 (%)תיאורי (ממוצע ± סטיית תקן (SD)92.35 ± 0.92%

טבלה 6: תוצאות תיקוף סטטיסטי ושחזור שהתקבלו מהיישום הניסויי באמצעות מערך הנתונים של סוכרת באינדיאנים מהשבט פימה (Pima Indians Diabetes Dataset). הטבלה מסכמת ביצועי תיקוף צולב של חמישה קיפולים (five-fold cross-validation), רווחי סמך של 95% מבוססי Bootstrap, השוואות סטטיסטיות של המודל המוצע מול מודלי הבסיס, ושחזור של הרצות חוזרות על פני 10 זרעים (seeds) אקראיים ועצמאיים. תיקוף חיצוני והערכה של מומחים קליניים לא בוצעו בתיקוף הנוכחי.

לא.פריט ברשימת הבדיקהתיעוד נדרשהקלטה / אימות מומלצים
1סביבת תוכנהמערכת הפעלה, שפת תכנות וסביבת תוכנהיש לתעד את הגרסאות המדויקות של מערכת ההפעלה ושפת התכנות.
2גרסאות תוכנה וספריותגרסאות של ספריות תוכנה וחבילות עיקריותיש לתעד את השמות המדויקים של החבילות/ספריות ואת גרסאותיהן.
3מפרט חומרהמפרטי CPU, GPU, RAM, אחסון ומאיציםיש לתעד את החומרה המחשובית ששימשה לניסוי.
4זיהוי מערכי נתוניםשם מערך הנתונים, מקור, גרסה ומידע על גישהיש לתעד את מקור מערך הנתונים/הגרסה המדויקת ואת תאריך הגישה, במידה ורלוונטי.
5מאפייני מערך הנתוניםגודל המדגם והתפלגות המחלקותיש לתעד את סך הדגימות ואת התפלגות המחלקות עבור כל פיצול.
6חלוקת מערכי נתוניםאסטרטגיה של אימון, תיקוף ומערך בדיקה עצמאיתעד את פרופורציות/מספרי הפיצול ואת השכוב (stratification).
7מניעת דליפת נתוניםנוהל למניעת דליפת מידעהפרדת מסמכים/דגימות והערכת פרמטרי עיבוד מקדים עבור אימון בלבד.
8פרמטרים של עיבוד מקדיםהגדרות ניקוי, טיפול בערכים חסרים, נורמליזציה, קידוד וטרנספורמציהיש לתעד את כל פעולות העיבוד המקדים ואת ערכי הפרמטרים.
9העשרת נתוניםשיטות הרחבה והגדרות פרמטרים, במידה ורלוונטיתעד שיטות, הסתברויות וטווחים של פרמטרים.
10ארכיטקטורת המודלארכיטקטורה ותצורה סופיות של המודלתעד את סוג המודל, השכבות/רכיבים, הממדים ופונקציות ההפעלה.
11היפר-פרמטריםהיפר-פרמטרים של אימון ואופטימיזציהיש לתעד את קצב הלמידה (learning rate), גודל האצווה (batch size), האופטימייזר (optimizer), מספר האיטרציות (epochs), עצירה מוקדמת (early stopping) ואת הפרמטרים שעברו כוונון.
12זרעים אקראייםזרעים אקראיים ששימשו להרצה הניתנת לשחזורתעדו את הגרעינים (seeds) עבור פיצול, אתחול והרצות חוזרות.
13תצורת אימוןהליך האימון ואסטרטגיית בחירת מודלתיקוף מסמכים, נקודות ביקורת וקריטריונים לבחירת מודל.
14מדדי הערכהמדדי הערכה סטטיסטיים וחיזויים שהוגדרו מראשיש לתעד את כל מדדי הביצועים שדווחו.
15רווחי סמךמרווחי אי-ודאות עבור מדדי ביצועיםיש לתעד את נוהל הערכת רווחי הסמך (CI) ואת דגימות ה-bootstrap החוזרות במידה והן רלוונטיות.
16מבחנים סטטיסטייםפרוצדורות סטטיסטיות להשוואת מודליםתעד את המבחן, את הסטטיסטיקה, את ערך ה-p, את סף המובהקות ואת ההנחות.
17ניתוח הרצות חוזרותהרצות עצמאיות באמצעות זרעים אקראיים שוניםיש לרשום את מספר ההרצות ואת הממוצע ± סטיית תקן של מדדי מפתח.
18תצורת הניתנות להסבר (Explainability configuration)שיטות להסברתיות והגדרות פרמטריםתעד את SHAP, LIME, Grad-CAM, תשומת לב (attention), סיטואציות נגדיות (counterfactual) או הגדרות רלוונטיות אחרות.
19הערכת יכולת ההסבר (Explainability assessment)הערכה אובייקטיבית של מהימנות ותועלת ההסברתיעוד של נאמנות, יציבות, חוסר נאמנות, לוקליזציה והערכת מומחים במידת הרלוונטיות.
20ארטיפקטים של המודלמשקולות של מודל מאומן וקבצי הגדרהארכוב של המודל המאומן הסופי, הארכיטקטורה/התצורה ומידע על הברירה.
21זמינות הקודהקוד הנדרש לעיבוד מקדים, אימון, הערכה ויצירת הסבריםמאגר רשומות או מידע על גישה מבוקרת לקוד, במידה ורלוונטי.
22תיעוד ביצועפקודות, סקריפטים, קבצי הגדרה והוראותיש לתעד את הפקודות ואת התצורה הדרושים לשחזור של זרימת העבודה.
23תיעוד פלטתחזיות, תוצאות הערכה, איורים ופלטי הסברארכבו את הפלטים שהופקו וקשרו אותם לניסוי/להרצה המתאימים.
24אימות הדירות (Reproducibility verification)אימות עקביות בין הרצות עצמאיותהשוו את תוצאות ההרצות החוזרות ודווחו על מדדי שונות שהוגדרו מראש.

טבלה 7: רשימת תיוג לשחזור לצורך שכפול עצמאי של תהליך העבודה המוצע ב-XAI. רשימת התיוג מפרטת את הדרישות החישוביות, דרישות מערך הנתונים, עיבוד מקדים, פיתוח מודל, הערכה, תיקוף סטטיסטי, יכולת הסבר ותיעוד הדרושים כדי לשחזר את תהליך העבודה הניסויי.

דיון

התוצאות מדגימות את התועלת של הפרוטוקול המוצע כסב עבודה סטנדרטי וניתן לשחזור לפיתוח והערכה של מערכות XAI על פני מאגרי נתונים מגוונים בתחום הבריאות. כפי שמוצג ב-טבלה 2 וב-איור 3, עיבוד מקדים סיסטמטי הניב נתונים סטנדרטיים ושיפר את איכות הנתונים באמצעות טיפול בערכים חסרים, נורמליזציה של נתונים, סקיילינג של מאפיינים (feature scaling) וחלוקה של מאגר הנתונים. שלבי עיבוד מקדים אלו הם קריטיים מכיוון ששונות בהכנת הנתונים עלולה להוביל להטיה, להפחית את ביצועי הניבוי ולפגוע באמינות של ניתוחי ההסביריות. לכן, יש להחיל נהלי עיבוד מקדים עקביים על מאגרי הנתונים לאימון, לתיקוף ולבדיקה כדי לקדם שחזור ולמנוע דליפת נתונים (data leakage)19,20.

תוצאות אימון המודל המוצגות באיור 4 ובטבלה 4 מדגימות התנהגות למידה עקבית ויציבה. ירידות מקבילות בהפסדי האימון והתיקוף, לצד עליות בדיוק החיזוי, מעידות על התכנסות תקינה של המודל ללא התאמת-יתר (overfitting) משמעותית. אופטימיזציה של היפר-פרמטרים, עצירה מוקדמת (early stopping), dropout ורגולריזציה תורמים עוד יותר לאימון מודל יציב וניתן לשחזור. חוסר יציבות בעקומות הלמידה עשוי להצביע על קצב למידה לא מתאים, נתוני אימון לא מספיקים או מורכבות יתר של המודל. לפיכך, יש לנטר את התכנסות המודל לאורך כל האימון כדי לזהות ולטפל בבעיות פוטנציאליות אלו.

טבלה 5 ו-איור 5 מדגימים ביצועים חיזויים באמצעות מדדי הערכה מרובים, הכוללים accuracy, precision, recall, specificity, F1-score, מקדם המתיו (Matthews correlation coefficient) ושטח תחת עקומת מאפיין תפעול המקלט (ROC). עקומות ה-ROC וה-precision-recall מספקות מדדים לביצועי הבחנה, בעוד שמטריצת הבלבול (confusion matrix) ממחישה את התפלגות הסיווגים הנכונים והשגויים בין המחלקות. הערכה באמצעות מדדי ביצועים מרובים חשובה במיוחד עבור מאגרי נתונים רפואיים לא מאוזנים, מכיוון שדיוק כללי (overall accuracy) לבדו עשוי שלא לאפיין באופן מספק את ביצועי המודל.

איור 6 ממחיש את תוצאות ההסביריות שהופקו ממאגר הנתונים של סוכרת בקרב אינדיאנים מפונימה (Pima Indians Diabetes Dataset) ומדגים את התפקידים המשלימים של שיטות ההסביריות שיושמו בתיקוף המקרה. ניתוח SHAP גלובלי מאפיין את התרומה הכוללת ואת החשיבות היחסית של תכונות הקלט לניבויים של המודל, בעוד שתרשימי מפל (waterfall) ותלות (dependence) של SHAP מספקים פרשנויות להתנהגות המודל ברמת המטופל וברמת התכונה. LIME מספק הסבר מקומי נוסף על ידי זיהוי התכונות התורמות לניבוי בודד בסט הבדיקה. ההסבר הקונטר-פקטואלי (counterfactual) הספציפי למטופל ממחיש עוד יותר את השינויים המינימליים בתכונות הקשורים לשינוי בתוצאה הנחזית. יחד, גישות אלו מספקות פרספקטיבות גלובליות ומקומיות משלימות על התנהגות המודל ומשפרות את השקיפות והיכולת לפרש את המודל הנבואי הטבלאי. Grad-CAM, ויזואליזציה של קשב (attention visualization), מיפוי בולטות (saliency mapping) וגרדיאנטים אינטגרליים (Integrated Gradients) לא יושמו בתיקוף המקרה של Pima ונשמרו רק כאפשרויות התלויות במודליות במסגרת הפרוטוקול הכללי.

תיקוף סטטיסטי (טבלה 6 ו-איור 7>) והערכות הדירות מדגימים את היציבות של ביצועי הניבוי לאורך הרצות ניסוייות שונות. השילוב של אימות צולב (cross-validation), הערכת רווחי סמך, בדיקת השערות והערכת הדירות של הרצות חוזרות מספק מסגרת שיטתית להערכת חוסנו של המודל. תיקוף כזה חשוב במיוחד ביישומים בתחום הבריאות, כיוון שהדירות לאורך ניסויים בלתי תלויים מספקת ראיות לאמינותם וליכולת ההכללה של מודלי AI לפני הטמעתם בסביבות קליניות21,23.

מספר שלבים הם קריטיים ליישום מוצלח של פרוטוקול זה. בצעו ניקוי נתונים לפני חילוץ המאפיינים ואימון המודל כדי למזער הטיות פוטנציאליות הנובעות מנתונים חסרים, לא עקביים או שגויים. בצעו אופטימיזציה של היפר-פרמטרים באמצעות נתוני האימון והתיקוף בלבד, והשאירו את מערך נתוני הבדיקה עצמאי לאורך כל תהליכי פיתוח ואופטימיזציית המודל. תיעדו בבירור את מצבי מחולל המספרים הפסאודו-אקראיים, גרסאות התוכנה, תצורות החומרה והגדרות העיבוד המקדים כדי להקל על השחזור בין פלטפורמות חישוביות שונות. בנוסף, בחרו שיטות הסבר (explainability methods) בהתבס על המודל החיזוי ועל סוג נתוני הבריאות כדי להשיג הסברים הניתנים לפירוש ובעלי רלוונטיות קלינית20,29,30.

לפרוטוקול מספר מגבלות. הדיוק והמהימנות של תחזיות המודל וההסברים שלו תלויים במידה רבה בזמינותם של מאגרי נתונים של שירותי בריאות שהם גדולים מספיק, מייצגים ובאיכות גבוהה. תת-ייצוג של אוכלוסיות חולים ספציפיות, שגיאות מדידה, משתנים חסרים והטרוגניות בין מקורות הנתונים עלולים להשפיע לרעה הן על ביצועי הניבוי והן על היציבות של הסברי המודל. יתרה מכך, גישות הסביריות הנוכחיות יכולות לאפיין את התנהגות המודל אך אינן מבסות בהכרח מנגנונים סיבתיים. לפיכך, יש לפרש את תוצרי ה-XAI בשילוב עם מומחיות קלינית רלוונטית.

באופן כללי, פרוטוקול זה מספק גישה סטנדרטית לפיתוח מודלים הניתן לשחזור, להערכתם ולניתוח יכולת ההסבר שלהם בתחומים שונים של שירותי הבריאות. באמצעות שילוב של עיבוד מקדים סטנדרטי, אופטימיזציה של היפר-פרמטרים, הערכה באמצעות מדדי ביצועים מרובים, גישות משלימות להסבריות ותיקוף סטטיסטי, זרימת העבודה מספקת מסגרת שקופה ועקבית למחקר בינה מלאכותית בתחום הבריאות.

התוצאות מצביעות עוד על כך שניתן לתמוך בפיתוח שקוף ועקבי של מודלי AI על ידי שילוב של עיבוד מקדים סיסטמטי של נתונים, נהלי פיתוח מודלים סטנדרטיים, הערכת ביצועים מקיפה, שיטות הסברתיות מרובות ותיקוף סטטיסטי קפדני. ניתן להתאים את הפרוטוקול למסדי נתונים קליניים, לדימויים רפואיים, לאות פיזיולוגיים ולנתוני בריאות רב-מודאליים, תוך שמירה על מסגרת לניסויים ניתנים לשחזור בסביבות חישוביות שונות. באמצעות יישום סטנדרטי, טכניקות הסברתיות משלימות והערכת שחזור, הפרוטוקול מספק מסגרת לפיתוח מודלי AI ניתנים להסברה ומהימנים, ועשוי לשמש כבסיס מתודולוגי למחקרי ביו-רפואה עתידיים ולתיקוף חיצוני וקליני עוקב.

גילויים

המחברים מצהירים כי אין להם ניגודי אינטרסים כספיים, קשרים מסחריים או קשרים אישיים שעלולים היו להשפיע על העבודה המדווחת במחקר זה. למחברים אין ניגודי אינטרסים להצהיר עליהם.

תודות

המחברים מודים על התמיכה המוסדית שניתנה על ידי המוסדות השלוחים אליהם במהלך הפיתוח והתיקוף הניסויי של פרוטוקול XAI זה לבריאות. המחברים מודים גם על המתקנים המחשובים ומשאבי התוכנה ששימשו לביצוע הניתוחים הניסוייים. מחקר זה לא קיבל מימון חיצוני. המחברים מודים על השימוש ב-Python 3.1, Matplotlib 3.9 ו-SciPy 1.13 לצורך ניתוח חישובי, ויזואליזציה של נתונים ויצירת האיורים המוצגים במחקר זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
CaptumMeta AIהגרסה היציבה האחרונההסבירות של PyTorch
CUDA ToolkitNVIDIA12.2האצה באמצעות GPU
cuDNNNVIDIA9.xbackend ללמידה עמוקה
GitGit SCMהגרסה היציבה האחרונהבקרת גרסאות
GitHubGitHub Inc.פלטפורמת אינטרנטמאגר קוד מקור
Grad-CAMג'קובגילמהדורה אחרונהויזואליזציה של CNN
Jupyter Notebookפרויקט Jupyterהגרסה היציבה האחרונהפיתוח אינטראקטיבי
LightGBMMicrosoft4.xהגברת גרדיאנט (Gradient boosting)
LIMEקהילת LIME0.2.0ניתנות הסבר מקומית
Matplotlibמפתחי Matplotlib3.9ויזואליזציה
Microsoft ExcelMicrosoftMicrosoft 365ארגון נתונים
NumPyמפתחי NumPy1.26מיחשוב נומרי
מעבד גרפי NVIDIA RTX 4090NVIDIA24 GB VRAMאימון מודל
OpenCVארגון OpenCV4.10עיבוד מקדים של תמונות
Pandasצוות הפיתוח של Pandas2.2עיבוד מקדים של נתונים
Pillow (PIL)ספריית עיבוד התמונות של Python10.xעיבוד תמונות
PlotlyPlotly Technologies5.xויזואליזציה אינטראקטיבית
PythonPython Software Foundation3.11סביבת תכנות
PyTorchPyTorch Foundation2.3למידה עמוקה
Scikit-learnמפתחי Scikit-learn1.5למידת מכונה
SciPyמפתחי SciPy1.13מיחשוב מדעי
Seabornמפתחי Seaborn0.13תרשימים סטטיסטיים
SHAPקהילת SHAP0.46הסבירות הגלובלית
SimpleITKקונסורציום תוכנת Insight2.xעיבוד תמונות רפואיות
Statsmodelsמפתחי Statsmodels0.14ניתוח סטטיסטי
זיכרון RAM של המערכתכל יצרן32 GB או יותרזיכרון
TensorBoardגוגל2.15ניטור אימון
TensorFlowגוגל2.15למידה עמוקה
Ubuntu Linux / Windows 1Canonical / Microsoft2.04 LTS / 1מערכת הפעלה
Visual Studio CodeMicrosoftהגרסה היציבה האחרונהפיתוח קוד
XGBoostמפתחי XGBoost2.1הגברת גרדיאנט (Gradient boosting)

מקורות

  1. Acosta JN, Falcone GJ, Rajpurkar P, Topol EJ. Multimodal biomedical AI. Nat Med. 2022;28(9):1773-1784.
  2. Tang AS, et al. Harnessing EHR data for health research. Nat Med. 2024;30(7):1847-1855.
  3. Zhang A, Xing L, Zou J, Wu JC. Shifting machine learning for healthcare from development to deployment and from models to data. Nat Biomed Eng. 2022;6(11):1330-1345.
  4. Bera K, et al. Predicting cancer outcomes with radiomics and artificial intelligence in radiology. Nat Rev Clin Oncol. 2022;19(2):132-146.
  5. Wenderott K, Krups J, Zaruchas F, Weigl M. Effects of artificial intelligence implementation on efficiency in medical imaging—a systematic literature review and meta-analysis. NPJ Digit Med. 2024;7(1):265.
  6. Kaissis GA, Makowski MR, Rückert D, Braren RF. Secure, privacy-preserving and federated machine learning in medical imaging. Nat Mach Intell. 2020;2(6):305-311.
  7. He J, et al. The practical implementation of artificial intelligence technologies in medicine. Nat Med. 2019;25(1):30-36.
  8. Antoniadi AM, et al. Current challenges and future opportunities for XAI in machine learning-based clinical decision support systems: A systematic review. Appl Sci (Basel). 2021;11(11):5088.
  9. Samek W, et al. Explaining deep neural networks and beyond: A review of methods and applications. Proc IEEE. 2021;109(3):247-278.
  10. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. WIREs Data Min Knowl Discov. 2019;9(4).
  11. Markus AF, Kors JA, Rijnbeek PR. The role of explainability in creating trustworthy artificial intelligence for health care: A comprehensive survey of the terminology, design choices, and evaluation strategies. Nat Biomed Eng. 2021;5(9):996-1011.
  12. Arrieta AB, et al. Explainable Artificial Intelligence (XAI): Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  13. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization [conference paper]. Presented at: IEEE International Conference on Computer Vision (ICCV); Venice, Italy; 2017:618-626. https://openaccess.thecvf.com/content_iccv_2017/html/Selvaraju_Grad-CAM_Visual_Explanations_ICCV_2017_paper.html
  14. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(12):572-584.
  15. Sundararajan M, Taly A, Yan Q. Axiomatic attribution for deep networks [conference paper]. Presented at: 34th International Conference on Machine Learning; Sydney, Australia; 2017;70:3319-3328. https://proceedings.mlr.press/v70/sundararajan17a.html
  16. Ribeiro MT, Singh S, Guestrin C. “Why should I trust you?”: Explaining the predictions of any classifier [conference paper]. Presented at: 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; San Francisco, CA; 2016:1135-1144.
  17. Desai S, Ramaswamy HG. Ablation-CAM: Visual explanations for deep convolutional network via gradient-free localization [conference paper]. Presented at: IEEE/CVF Winter Conference on Applications of Computer Vision (WACV); 2020:983-991.
  18. Belle V, Papantonis I. Principles and practice of explainable machine learning. Front Big Data. 2021;4:688969.
  19. Vilone G, Longo L. Notions of explainability and evaluation approaches for explainable artificial intelligence. Inf Fusion. 2021;76:89-106.
  20. Ali S, et al. Explainable artificial intelligence (XAI): What we know and what is left to attain trustworthy artificial intelligence. Inf Fusion. 2023;99:101805.
  21. Gundersen OE, Kjensmo S. State of the art: Reproducibility in artificial intelligence [conference paper]. Presented at: Thirty-Second AAAI Conference on Artificial Intelligence; New Orleans, LA; 2018:1644-1651. https://ojs.aaai.org/index.php/AAAI/article/view/11503
  22. Hutson M. Artificial intelligence faces reproducibility crisis. Science. 2018;359(6377):725-726.
  23. Pineau J, et al. Improving reproducibility in machine learning research: A report from the NeurIPS 2019 reproducibility program. J Mach Learn Res. 2021;22(164):1-20.
  24. U.S. Food and Drug Administration, Health Canada, Medicines and Healthcare products Regulatory Agency. Good Machine Learning Practice for Medical Device Development: Guiding Principles. 2021.
  25. Liu X, et al. Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: The CONSORT-AI extension. Nat Med. 2020;26(9):1364-1374.
  26. Mongan J, Moy L, Kahn CE Jr. Checklist for Artificial Intelligence in Medical Imaging (CLAIM): A guide for authors and reviewers. Radiol Artif Intell. 2020;2(2).
  27. Peng RD. Reproducible research in computational science. Science. 2011;334(6060):1226-1227.
  28. Collins GS, et al. Protocol for development of the TRIPOD-AI and PROBAST-AI reporting and risk-of-bias tools for studies developing, validating, or updating prediction models based on artificial intelligence. BMJ Open. 2021;11.
  29. Kapoor S, Narayanan A. Leakage and the reproducibility crisis in machine-learning-based science. Patterns. 2023;4(9):100804.
  30. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-1340.

הדפסות חוזרות והרשאות

תגיות

בינה מלאכותית הניתנת להסברמודלי בינה מלאכותית לבריאותפרשנות מודליםפרוטוקול הניתן לשחזורביצועים חיזוייםהנדסת מאפייניםתיקוף סטטיסטיהסברי SHAPהסברי LIMEהסברים נגדיים