ניתוח ביצועים חיזואיים
FedMediFormer-XAI הפגין ביצועי חיזוי משופרים בהשוואה למודלים החד-מודאליים (unimodal) ולמודלי הבסיס הקונבנציונליים שנבחנו. הרחבה מבוססת דיפוזיה (Diffusion-based augmentation) שיפרה את הייצוג של מחלקת המיעוט, וביצועי החיזוי שהתקבלו מסוכמים ב- טבלה 3הערכת ההרצות החוזרות הדגימה ביצועי ניבוי יציבים בכל המודלים שנבחנו. FedMediFormer-XAI השיג את הביצועים הכוללים הגבוהים ביותר, עם דיוק (accuracy) של 94.20 ± 0.34% (רווח בר-סמך של 95%: 93.78–94.62), דיוק חיובי (precision) של 93.10 ± 0.30% (רווח בר-סמך של 95%: 92.73–93.47), רגישות (recall) של 92.80 ± 0.28% (רווח בר-סמך של 95%: 92.45–93.15), ומדד F1 של 92.90 ± 0.28% (רווח בר-סמך של 95%: 92.55–93.25). המודל השיג MCC של 0.88 ± 0.02 (רווח בר-סמך של 95%: 0.86–0.90) ו-AUC-ROC של 0.96 ± 0.01 (רווח בר-סמך של 95%: 0.95–0.97). הטרנספורמר הרב-מודאלי המרוכז סיפק את הביצועים הכוללים הטובים הבאים, בעוד שהמודלים החד-מודאליים ומודלי הלמידה המכונה הקונבנציונליים הראו ביצועי ניבוי נמוכים יותר באופן יחסי. תוצאות אלו מצביעות על כך שלמידת ייצוג רב-מודאלית, בשילוב עם אופטימיזציה פדרטיבית, מניבה ביצועי סיווג של סוכרת משופרים ויציבים יותר.
ניתוח אבלה (Ablation study)
הסרה מדורגת של רכיבים (Component-wise ablation) שימשה להערכת התרומה של הגברה באמצעות דיפוזיה (diffusion augmentation), למידה פדרטיבית (federated learning), המלצת תרופות מבוססת GraphSAGE ומיזוג רב-מודאלי (multimodal fusion). מסגרת ה-FedMediFormer-XAI המלאה השיגה דיוק (accuracy) של 94.20 ± 0.34%, דיוק חזוי (precision) של 93.10 ± 0.30%, רגישות (recall) של 92.80 ± 0.28%, ציון F1 של 92.90 ± 0.28%, MCC של 0.88 ± 0.02 ו-AUC-ROC של 0.96 ± 0.01 על פני חמש הרצות עצמאיות. הסרת ההגברה באמצעות דיפוזיה הפחיתה את הדיוק ל-91.80 ± 0.42%, המקבילה לירידה של 2.40 נקודות אחוז, בעוד שציון ה-F1 וה-AUC-ROC ירדו ל-90.30 ± 0.38% ו-0.94 ± 0.01, בהתאמה. הפחיתה זו מעידה על תרומת ההגברה מבוססת הדיפוזיה לייצוג מחלקות מיעוט ולחוסן החזוי.
הסרת הלמידה הפדרטיבית (federated learning) הביאה לדיוק של 93.10 ± 0.37%, המהווה ירידה של 1.10 נקודות אחוז ביחס למסגרת המלאה. הדיוק (Precision), הרגישות (recall), מדד F1, מדד MCC ו-AUC-ROC פחתו אף הם ל-92.20 ± 0.34%, 91.80 ± 0.32%, 92.00 ± 0.33%, 0.86 ± 0.02 ו-0.95 ± 0.01, בהתאמה. השוואה זו מדגימה את תרומת התבניות הפדרטיביות לביצועים החזויים.
הסרת רכיב ההמלצה המותאמת אישית על תרופות המבוסס על GraphSAGE הובילה לשינוי קטן יחסית בביצועי חיזוי הסוכרת, כאשר הדיוק ירד ל-93.80 ± 0.35% ומדד ה-F1-score ירד ל-92.60 ± 0.30%. ערכי ה-MCC וה-AUC-ROC התואמים היו 0.87 ± 0.02 ו-0.96 ± 0.01, בהתאמה. תוצאה זו מעידה על כך ש-GraphSAGE תורם בעיקר להמלצה מותאמת אישית על תרופות ולא לקביעת ביצועי סיווג הסוכרת באופן ישיר.
ההפחתה הגדולה ביותר נצפתה כאשר הוסר מיזוג רב-מודאלי (multimodal fusion). הדיוק (Accuracy) ירד ל-87.60 ± 0.55%, המהווה ירידה של 6.60 נקודות אחוז, בעוד שהדיוק החזוי (precision), הרגישות (recall), מדד F1, מדד MCC ו-AUC-ROC ירדו ל-86.80 ± 0.51%, 85.90 ± 0.54%, 86.30 ± 0.52%, 0.76 ± 0.03, ו-0.91 ± 0.01, בהתאמה. ממצא זה מדגיש את החשיבות של מידול משותף של מידע משלים ממודליות קליניות, CGM ורשתית.
ניתוח למידה פדרטיבית
מסגרת הלמידה הפדרטיבית אפשרה אימון שיתופי של המודל על פני לקוחות מבוזרים, תוך שמירה על טיפול מבוזר בנתוני המטופלים הגולמיים. במהלך האימון, המודל המקומי של כל לקוח עבר כוונון עדין (fine-tuning) באופן פרטני ושולב באמצעות שיטת הממוצע הפדרטיבי (Federated Averaging). לאחר 100 סבבי תקשורת, המודל הגלובלי התכנס, וביצועיו החזויים נותרו עקביים עם למידה מרכזית. מסגרת הלמידה הפדרטיבית הפגינה התכנסות יציבה לאורך סבבי התקשורת למרות התפלגויות נתונים הטרוגניות של הלקוחות. חילופי פרמטרים מוגנים שימרו על טיפול מבוזר בנתונים, בעוד שהמודל הגלובלי שמר על ביצועי חיזוי תחרותיים ביחס לקו הבסיס המרכזי. טבלה 4 משווה בין המימושים המרכזיים והפדרטיביים. למידה פדרטיבית דרשה זמן אימון נוסף עקב עומסי תקשורת, תוך שמירה על ביצועי חיזוי המשתווים ללמידה מרכזית.
ניתוח ביצועים ברמת מערך הנתונים
כדי להעריך את יכולת ההכללה בין מודליות שונות של שירותי בריאות, הערכנו את הביצועים עבור כל מערך נתונים בנפרד. מודל ה-FedMediFormer-XAI הרב-מודאלי הפגין ביצועים חזקים ותחרותיים באופן כללי בכל מערכי הנתונים שנבחנו. הוא השיג דיוק של 91.8%, 93.1%, 92.4% ו-94.2% במערכי הנתונים Pima Indians Diabetes, CDC Diabetes Health Indicators, OhioT1DM ו-APTOS 2019, בהתאמה. למרות שמערך הנתונים APTOS 2019 השיג דיוק (94.7%) ודיוק חיובי (precision) (93.9%) גבוהים מעט יותר מהמודל הרב-מודאלי, הגישה הרב-מודאלית המוצעת שמרה על ביצועים תחרותיים בכל מערכי הנתונים והשיגה AUC-ROC של 0.96, ערך שדומה ל-AUC-ROC הגבוה ביותר ברמת מערך הנתונים. התוצאות הכוללות ברמת מערך הנתונים מוצגות ב-טבלה 5. עבור מערכי נתונים בודדים, ניתוח תמונות רשתית השיג את הביצועים הטובים ביותר כאשר נעשה בו שימוש לבדו, בעוד שמיזוג רב-מודאלי הניב את התחזיות היציבות והמאוזנות ביותר.
ניתוח המלצות תרופות מותאמות אישית
רכיב ההמלצות המבוסס על רשת גרפית עצבית הוערך באמצעות מידע על יעילות תרופות ונתוני אינטראקציות בין תרופות, כאשר תרופות מועמדות דורגו לפי ציוני התאמה של מטופל-תרופה שנלמדו, ושילובי תרופות המהווים התוויית נגד הוצאו מהתהליך במהלך יצירת ההמלצות. השימוש בפורמט גרף הטרוגני ומידול האינטראקציות בין מטופל לתרופה ובין תרופה לתרופה בוצעו באופן יסודי, ובכך נתמכו בחירות תרופות מותאמות אישית והערכת בטיחות. מודל ההמלצות GraphSAGE לכד באופן יעיל קשרים מורכבים בין מטופלים, מחלות, ממצאים מעבדתיים ותרופות. המלצות מותאמות אישית הראו ביצועי דירוג גבוהים תוך שמירה על הסברים בעלי משמעות קלינית באמצעות ניתוח סביבת הגרף ושיוך מאפיינים.
בהתאם לטבלה 6, מודול ההמלצה המותאמת אישית לתרופות הוערך באמצעות Precision@5, Recall@5 ו-NDCG@5. מדדים אלו מכמתים את הרלוונטיות ואת איכות הדירוג של חמש ההמלצות המובילות לתרופות מותאמות אישית שנוצרו על ידי מודול ההמלצות המבוסס על GraphSAGE. מערכת ההמלצות השיגה ביצועי דירוג חזקים, עם precision = 0.89, recall = 0.84 ו-NDCG = 0.91.
ניתוח יכולת הסבר (Explainability analysis)
המסגרת משלבת את SHAP, Integrated Gradients, ויזואליזציה של קשב (attention visualization) והסברים קונטרפקטואליים (counterfactual explanations) כדי לתמוך בפירוש של תחזיות רב-מודאליות. SHAP שימש לכימות תרומות ברמת התכונה, Integrated Gradients לייחוס תחזיות לתכונות הקלט, ויזואליזציה של קשב לבחינת מיקוד המודל בין המודאליות השונות, והסברים קונטרפקטואליים לזיהוי שינויים בתכונות הקשורים לתחזיות חלופיות. איור 8 מציג תרשים סיכום SHAP מייצג שהופק ממודל FedMediFormer-XAI המאומן, בעוד שאיור 9 מציג ויזואליזציות קשב מייצגות שהופקו מהטרנספורמר המאומן. איורים אלה מייצגים פלטים שהתקבלו מהערכת המודל ולא איורים סכמתיים של הארכיטקטורה המוצעת.
באיור 8, מוצגים הדירוגים של חשיבות המאפיינים ברמת המקביץ. למאפיינים בעלי ערכי SHAP מוחלטים גבוהים יותר הייתה השפעה רבה יותר על תחזיות המודל, והם תאמו היטב את הידע הקליני הקיים.
איור 9 מציג ויזואליזציות תשומת לב (attention) מייצגות שהופקו ישירות ממודל FedMediFormer-XAI המאומן עבור דגימת מבחן אקראית שנשמרה בנפרד. הוויזואליזציות כוללות תשומת לב למאפיינים קליניים, תשומת לב זמנית ל-CGM, תשומת לב מרחבית לרשתית, ותשומת לב חוצת-מודליות (cross-modal) בין שלוש המודליות. ויזואליזציית תשומת הלב הדגימה עוד את הקצאת תשומת הלב שנלמדה על ידי המודל על פני מודליות מרובות. הדגימה שנבחרה הראתה תשומת לב קרובה יותר יחסית ל-HbA1c, למשך מחלת הסוכרת ולגיל בין המאפיינים הקליניים, בעוד שמפת תשומת הלב של ה-CGM הדגישה מספר תקופות עם שונות גלוקוז בולטת. מפת תשומת הלב של הרשתית זיהתה אזורי תמונה ספציפיים התורמים לייצוג של המודל, ומטריצת התשומת לב חוצת-המודליות הדגימה דפוסי תשומת לב תוך-מודליים וחוצי-מודליות. כפי שמוצג ב-איור 9, מפות תשומת הלב המייצגות שנגזרו מהמודל מדגישות דפוסי גלוקוז זמניים נבחרים, משתנים קליניים משפיעים ואזורי תמונת רשתית רלוונטיים לאבחנה בדגימת מבחן שנשמרה בנפרד.
תוצאות הערכה ממוקדת-אדם
פרוטוקול הערכה פרוספקטיבי ממוקד-אדם תוכנן כדי להעריך את רמת האמון של הקלינאי, את יכולת הפרשנות, את השמישות, את התועלת הקלינית ואת הרלוונטיות של ההסבר תחת תנאים של חיזוי בלבד לעומת חיזוי בתוספת הסבר. ההערכה המוצעת תכלול אנדוקרינולוגים, מומחים לסוכרת ופארמקולוגים קליניים, באישור מתאים מוועדת האתיקה המוסדית ובהסכמה מדעת. מכיוון שהערכה זו מיועדת ליישום פרוספקטיבי עתידי, ציוני התוצאות ברמת הקלינאי אינם מדווחים בפרוטוקול הנוכחי.
טבלה 7 מסכמת את תכנון ההערכה הפרוספקטיבית המוצע על ידי קלינאים ואת הקריטריונים שנקבעו מראש להערכת השפעות ההסברים על אמון הקלינאי, יכולת הפירוש והתועלת הנתפסת. ההערכה הפרוספקטיבית תשווה בין הערכות קלינאיות של תחזיות המודל עם ובלי הסברים נלווים, באמצעות קריטריונים מוגדרים מראש בסולם ליקרט (Likert-scale). מסגרת הערכת הפירושיות הממוקדת-באדם המוצעת מוצגת באיור 10

איור 1: ארכיטקטורת המסגרת הכוללת של FedMediFormer-XAI. סקירה סכמטית של מסגרת FedMediFormer-XAI, המציגה רכישה ועיבוד מקדימ של נתונים רב-מודאליים, הגברה מבוססת דיפוזיה (diffusion), למידת טרנספורמר ספציפית למודאליות, אימון מודל פדרטיבי, המלצת תרופות מותאמת אישית מבוססת GraphSAGE, וניתוח יכולת הסבר (explainability). המסגרת מייצרת תחזית לסוכרת, המלצות לתרופות מותאמות אישית ופלטי מודל ניתנים לפירוש. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 2: צינור רכישה ועיבוד מקדים של מערכי נתונים רב-מודליים. תרשים זרימה של תהליך הרכישה והעיבוד המקדים של מערכי הנתונים הרב-מודליים המשמשים ב-FedMediFormer-XAI. נתונים קליניים ונתוני בריאות אוכלוסייה, רישומי CGM, תמונות רשתית ומידע פרמקולוגי עוברים בקרת איכות ספציפית למודאליות, עיבוד מקדים, נורמליזציה, קידוד והגדלה (augmentation) לפני שהם מומרים לייצוגים מוכנים למודל לצורך ניתוח המשכי. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 3: זרימת עבודה להעשרת נתונים מבוססת דיפוזיה. תרשים זרימה להעשרה מבוססת דיפוזיה של נתוני אימון טבלאיים מובנים באמצעות TabDDPM. דגימות שנוצרו עוברות הערכות איכות ודמיון בהתפלגות לפני שילובן עם נתוני האימון המקוריים לשיפור האיזון בין המחלקות. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 4: ארכיטקטורה של מסגרת הטרנספורמר המולטי-מודלית המוצעת. ארכיטקטורה סכמטית הכוללת (A) מקודד TabTransformer עבור נתונים קליניים, (B) מקודד טרנספורמר זמני עבור נתוני CGM, ו(C) מקודד Vision Transformer עבור תמונות רשתית. (D) ייצוגים ספציפיים למודליות משולבים באמצעות תשומת לב חוצת-מודליות (cross-modal attention) כדי להפיק ייצוג מולטי-מודלי מאוחד. (E) ראשי חיזוי ספציפיים למשימה מפיקים את פלטי המודל. (F) רכיבי רגולריזציה ואופטימיזציה תומכים באימון המודל, ו (G) הפסדי סיווג, רגרסיה ועקביות חוצת-מודליות מנחים את תהליך האופטימיזציה. הייצוג המולטי-מודלי המתקבל תומך במשימות חיזוי, המלצה והסבירות (explainability) במורד הזרם. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 5: מסגרת תקשורת ללמידה פדרטיבית. סכימה של זרימת העבודה לאימון פדרטיבי על פני לקוחות בבתי חולים מבוזרים. מודלים מולטי-מודאליים מקומיים מאומנים באמצעות נתונים ספציפיים ללקוח, ועדכוני מודל מוגנים מועברים לשרת מרכזי לצורך ביצוע Federated Averaging. המודל הגלובלי המאוחד מופץ מחדש בין הלקוחות לסבבי תקשורת עוקבים. המסגרת מדגימה גם חילוף פרמטרים מאובטח והערכה של דרישות הפרטיות, התקשורת והחישוב. נא ללחוץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 6תהליך עבודה להמלצה מותאמת אישית על תרופות מבוסס גרפים. תרשים זרימה סכמטי להמלצה מותאמת אישית על תרופות מבוססת GraphSAGE. נתוני ייצוג פרמקולוגיים ונתוני מטופלים מאורגנים בגרף הטרוגני הכולל ישויות וקשרי בריאות רלוונטיים. GraphSAGE לומד ייצוגים של מטופלים ותרופות, המשמשים לחישוב מדדי התאמה בין מטופל לתרופה ולדירוג תרופות מועמדות. שילובי תרופות אסורים (Contraindicated) או לא בטוחים מסוננים לפני יצירת K ההמלצות המובילות (Top-K), כאשר מידע מבוסס גרף תומך בפירוש ההמלצות. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 7: מסגרת להערכת יכולת הסבר. סקירה סכמטית של זרימת העבודה של יכולת ההסבר. (A) ניתוח SHAP מעריך תרומות גלובליות ומקומיות של מאפיינים; (B) גרדיאנטים משולבים (Integrated Gradients) מספקים הסברים מבוססי שיוך (attribution); (C) ויזואליזציה של קשב (attention) מזהה מאפיינים משפיעים ואינטראקציות בין מודליות; ו (D) ניתוח נגדי (counterfactual analysis) מזהה שינויים במאפיינים הקשורים לשינויים בתחזיות. פלטי ההסבר הנובעים מכך תומכים בפירוש תחזיות המודל ובהמלצות מותאמות אישית. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 8: ניתוח חשיבות מאפיינים באמצעות SHAP המופק מהמודל, כסימון למודל FedMediFormer-XAI המאומן. תרשים הסיכום של SHAP מציג את התפלגות ערכי ה-SHAP על פני הדגימות שנבחנו, כאשר המאפיינים מדורגים לפי תרומת ה-SHAP המוחלטת הממוצעת שלהם. ערכי SHAP חיוביים מעידים על תרומה לסיכון גבוה יותר לסוכרת לפי התחזית, בעוד שערכים שליליים מעידים על תרומה לסיכון נמוך יותר. הצבע מייצג את ערך המאפיין התואם, כאשר ערכים גבוהים יותר מוצגים באדום וערכים נמוכים יותר מוצגים בכחול. התרשים מייצג פלט הסברי ממשי המופק מהמודל ולא איור סכמטי. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 9: פלטי קשב מייצגים שהופקו על ידי מודל FedMediFormer-XAI המאומן עבור דגימת מבחן אחת שנבחרה באופן אקראי מקבוצת הבדיקה. (A) קשב למאפיינים קליניים שהתקבל מרأس קשב של הטרנספורמר הרב-מודאלי, המראה את משקלי הקשב היחסיים שהוקצו למאפיינים קליניים. (B) קשב זמני לאורך רצף ה-CGM, הממחיש את פרקי הזמן שקיבלו קשב גבוה יותר מהמודל. (C) קשב מרחבי עבור תמונת קרקית הרשתית, כולל התמונה המקורית, מפת חום של הקשב והחלה של מפת הקשב על התמונה. (D) קשב חוצה-מודליות בין טוקנים של מודליות קליניות, CGM ורשתית, המראה שקלול מידע תוך-מודאלי וחוצה-מודליות. הוויזואליזציות המוצגות הן פלטים שנגזרו מהמודל המאומן. משקלי הקשב מוצגים עבור דגימת המבחן הנבחרת ויש לפרשם כדפוסי קשב של המודל ולא כמדדים עצמאיים של סיבתיות קלינית. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.
| סט נתונים | סוג נתונים | דגימות/רשומות | מאפיינים/תוכן | מטרה | זמינות לציבור |
| ערכת נתוני סוכרת של אינדיאנים מפומא | טבלה קלינית | 768 חולים | 8 משתנים קליניים | ניבוי סיכון לסוכרת | ציבורי |
| מדדי בריאות לסוכרת של ה-CDC | בריאות האוכלוסייה | 253,680 רשומות | דמוגרפיה, אורח חיים, מדדי בריאות | ניתוח סיכוני אוכלוסייה | ציבורי |
| מאגר הנתונים OhioT1DM | סדרות זמן של CGM | 12 נבדקים | גלוקוז, אינסולין, ארוחות, פעילות גופנית, שינה | מידול סוכרת זמני | ציבורי |
| זיהוי עיוורון APTOS 2019 | דימויי רשתית | 3,662 תמונות | צילומי קרקית העין עם תוויות חומרה | ניתוח רטינופתיה סוכרתית | ציבורי |
| מאגר נתונים של ביקורות על תרופות | פרמקולוגי | 215,063 ביקורות | יעילות תרופות, דירוגים, ביקורות | המלצה על תרופה | ציבורי |
| נתוני פתוחים של DrugBank | גרף ידע של תרופות | אלפי תרופות | אינטראקציות בין תרופות, מטרות, מסלולים | בניית גרף | גישה ציבורית/אקדמית |
טבלה 1: מאפייני מערכי הנתונים. סיכום של מערכי נתונים הזמינים לציבור ששימשו במחקר זה, כולל סוג מערך הנתונים, גודל המדגם, מודאליות הנתונים, תוכן המאפיינים, המטרה המיועדת והזמינות.
| סט של נתונים | מודליות | מטרת החיזוי | רמת מיזוג |
| Pima Indians Diabetes | קלינית | סיווג סוכרת | שיכון מאפיינים (Feature embedding) |
| CDC Diabetes Health Indicators | בריאות אוכלוסייה | חיזוי סיכון לסוכרת | שיכון מאפיינים (Feature embedding) |
| OhioT1DM | ניטור גלוקוז רציף | חיזוי מגמת גלוקוז | שיכון מאפיינים (Feature embedding) |
| APTOS 2019 | תמונות קרקית הרשתית | ניתוח רטינופתיה סוכרתית | שיכון מאפיינים (Feature embedding) |
| Drug Review + DrugBank | פרמקולוגית | המלצה על תרופות | שיכון גרף (Graph embedding) |
טבלה 2: אסטרטגיית אינטגרציה של מערכי נתונים רב-מודאליים. סיכום של מערכי הנתונים ששימשו לבינה מלאכותית רב-מודאלית לסוכרת, כולל מודליות הנתונים, יעד הניבוי, והרמה שבה משולבים הייצוגים הספציפיים למודליות. נתונים קליניים, נתוני בריאות אוכלוסייה, ניטור גלוקוז רציף ונתוני תמונות רשת מיוצגים כשיבוצי מאפיינים (feature embeddings), בעוד שמידע פרמקולוגי משולב באמצעות שיבוצי גרפים (graph embeddings) לצורך המלצה מותאמת אישית על תרופות.
| מודל | דיוק, ממוצע ± סטיית תקן (רווח בר סמך של 95%) | דיוק, ממוצע ± סטיית תקנית (רווח בר סמך של 95%) | הסחב (Recall), ממוצע ± סטיית תקן (רווח ברחב של 95%) | מדד F1, ממוצע ± סטיית תקן (רווח ברካה של 95%) | MCC, ממוצע ± סטיית תקן (רווח בר-סמיכות 95%) | AUC-ROC, ממוצע ± סטיית תקן (95% CI) |
| יער אקראי (Random Forest) | 83.60 ± 0.74 (82.68–84.52) | 82.70 ± 0.60 (81.96–83.44) | 81.90 ± 0.56 (81.21–82.59) | 82.30 ± 0.56 (81.61–82.99) | 0.67 ± 0.03 (0.63–0.71) | 0.88 ± 0.01 (0.87–0.89) |
| XGBoost | 85.30 ± 0.71 (84.42–86.18) | 84.70 ± 0.60 (83.96–85.44) | 83.80 ± 0.56 (83.11–84.49) | 84.20 ± 0.56 (83.51–84.89) | 0.70 ± 0.03 (0.66–0.74) | 0.90 ± 0.01 (0.89–0.91) |
| TabTransformer | 87.50 ± 0.52 (86.85–88.15) | 87.00 ± 0.60 (86.26–87.74) | 86.20 ± 0.56 (85.51–86.89) | 86.60 ± 0.56 (85.91–87.29) | 0.75 ± 0.03 (0.71–0.79) | 0.92 ± 0.01 (0.91–0.93) |
| Vision Transformer | 88.80 ± 0.50 (88.18–89.42) | 88.20 ± 0.60 (87.46–88.94) | 87.60 ± 0.56 (86.91–88.29) | 87.90 ± 0.56 (87.21–88.59) | 0.78 ± 0.03 (0.74–0.82) | 0.93 ± 0.01 (0.92–0.94) |
| טרנספורמר זמני | 87.20 ± 0.51 (86.57–87.83) | 86.60 ± 0.60 (85.86–87.34) | 85.90 ± 0.56 (85.21–86.59) | 86.20 ± 0.56 (85.51–86.89) | 0.74 ± 0.03 (0.70–0.78) | 0.91 ± 0.01 (0.90–0.92) |
| CNN-LSTM | 86.90 ± 0.58 (86.18–87.62) | 86.30 ± 0.60 (85.56–87.04) | 85.60 ± 0.55 (84.92–86.28) | 85.90 ± 0.56 (85.21–86.59) | 0.73 ± 0.03 (0.69–0.77) | 0.91 ± 0.01 (0.90–0.92) |
| טרנספורמר רב-מודאלי מרכזי | 91.30 ± 0.12 (91.15–91.45) | 90.70 ± 0.60 (89.96–91.44) | 90.10 ± 0.56 (89.41–90.79) | 90.40 ± 0.56 (89.71–91.09) | 0.83 ± 0.03 (0.79–0.87) | 0.95 ± 0.01 (0.94–0.96) |
| FedMediFormer-XAI | 94.20 ± 0.34 (93.78–94.62) | 93.10 ± 0.30 (92.73–93.47) | 92.80 ± 0.28 (92.45–93.15) | 92.90 ± 0.28 (92.55–93.25) | 0.88 ± 0.02 (0.86–0.90) | 0.96 ± 0.01 (0.95–0.97) |
טבלה 3: ביצועי חיזוי לסוכרת. ביצועי חיזוי השוואתיים של FedMediFormer-XAI לעומת מודלי בסיס של למידה חישובית (machine learning) ולמידה עמוקה (deep learning) באמצעות מדדי דיוק (accuracy), רגישות (precision), recall, F1-score, MCC ו-AUC-ROC.
| מדד | למידה ריכוזית | למידה פדרטיבית (Federated Learning) |
| דיוק (%) | 94.7 | 94.2 |
| AUC-ROC | 0.97 | 0.96 |
| שימור פרטיות | לא | כן |
| נדרשת שיתוף נתוני גלם | כן | לא |
| סבבי תקשורת | לא רלוונטי | 100 |
| זמן אימון (שעות) | 4.8 | 5.6 |
| ציות רגולטורי | בינוני | גבוה |
טבלה 4: ביצועי למידה פדרטיבית לעומת למידה מרכזית. השוואה בין מימושי למידה מרכזית ולמידה פדרטיבית ביחס לביצועים חיזויים, דרישות לשיתוף נתוני גלם, סבבי תקשורת וזמן אימון.
| סט נתונים | דיוק (%) | דיוק (%) | רגישות (%) | AUC-ROC |
| מערך נתוני סוכרת של אינדיאנים מפאימה | 91.8 | 90.5 | 89.8 | 0.93 |
| מדדי בריאות לסוכרת של ה-CDC | 93.1 | 92.2 | 91.6 | 0.95 |
| מאגר הנתונים OhioT1DM | 92.4 | 91.8 | 91.1 | 0.94 |
| זיהוי עיוורון APTOS 2019 | 94.7 | 93.9 | 93.5 | 0.96 |
| היתוך רב-מודאלי (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
טבלה 5: תוצאות ברמת מערך הנתונים. ניתוח ביצועים על פני מערכי נתונים בודדים והגדרות מיזוג רב-מודאליות. התוצאות ממחישות את התרומה של מודליות נתונים שונות לביצועי הניבוי הכוללים.
| מדד | ערך |
| דיוק@5 | 0.89 |
| Recall@5 | 0.84 |
| NDCG@5 | 0.91 |
| דיוק בזיהוי אינטראקציות בין תרופות | 0.95 |
| כיסוי המלצות | 0.88 |
| דירוג הדדי ממוצע (Mean Reciprocal Rank - MRR) | 0.86 |
| מדד ציות לבטיחות | 0.94 |
טבלה 6: ביצועי המלצות תרופות מותאמות אישית. הערכה של המלצות תרופות מותאמות אישית מבוססות גרף באמצעות מדדי דירוג, דיוק זיהוי אינטראקציות, כיסוי המלצות והערכת בטיחות תרופתית.
| קריטריון הערכה | מערך ההערכה המוצע |
| אמון קלינאיים | הערכה באמצעות סולם ליקרט בן חמש נקודות |
| פרשנות (Interpretability) | הערכה באמצעות סולם ליקרט בעל חמישה נקודות |
| רלוונטיות קלינית | הערכה באמצעות סולם ליקרט בן חמש נקודות |
| תועלת ההסבר | הערכה באמצעות סולם ליקרט בן חמש נקודות |
| תועלת נתפסת | הערכה באמצעות סולם ליקרט בעל חמש נקודות |
| הסכמה בין מעריכים | מדד קאפה של פלייס (Fleiss' kappa), שיחושב לאחר הערכה פרוספקטיבית |
| השוואה סטטיסטית | מבחן סטטיסטי מזווג, בהתאם לצורך לאחר איסוף הנתונים |
| משתתפים | 12 קליניקאים, בכפוף לאישור ועדת אתיקה והסכמה מדעת |
| סטטוס הערכה | הערכה פרוספקטיבית/עתידית |
טבלה 7: קריטריוני הערכה מוצעים ממוקדי-אדם. מסגרת הערכה פרוספקטיבית מוצעת ממוקדת-קלינאי להערכת התועלת, הרלוונטיות הקלינית, יכולת הפירוש, המהימנות ויכולת השמישות של הסברים מ-FedMediFormer-XAI. ההערכה כוללת הערכה סטנדרטית במדד ליקרט (Likert) של חמש נקודות, הסכמה בין מעריכים באמצעות Fleiss' kappa, השוואה סטטיסטית בין תנאי של חיזוי בלבד לתנאי של חיזוי בתוספת הסבר, ומרווחי סמך של 95%. יש לבצע את הערכת הקלינאי רק לאחר קבלת אישור מוועדת האתיקה המוסדית המתאימה והסכמה מדעת.
טבלה נלווית 1: אסטרטגיית תיקוף מערך הנתונים. חלוקת מערך הנתונים, נהלי תיקוף, אסטרטגיות לאיזון מחלקות ואמצעי בקרת איכות הוטמעו כדי להבטיח שחזור והערכה מהימנה של המודל. אנא לחצו כאן להורדת הקובץ.
טבלה משלימה 2: פרמטרים של מודל הדיפוזיה. הגדרות תצורה עבור מודל הדיפוזיה TabDDPM, כולל פרמטרי אימון, הגדרות אופטימיזציה, ממדי מרחב חבוי (latent dimensions), אסטרטגיית תזמון רעש ומפרטי יצירת דגימות סינתטיות. אנא לחצו כאן להורדת קובץ זה.
טבלה משלימה 3: הגדרות הטרנספורמר הרב-מודאלי. הגדרות של ארכיטקטורת הטרנספורמר הרב-מודאלית, הכוללות את מקודדי הנתונים הקליניים, הזמניים והתמונה, ממדי השקיול (embedding) והמיזוג, ראשי קשב (attention heads), האופטימייזר, קצב הלמידה, גודל אצווה (batch size), תקופות אימון (epochs), קריטריון עצירה מוקדמת, והפסד אימון משולב. אנא לחצו כאן להורדת הקובץ.
טבלה משלימה 4: הגדרת למידה פדרטיבית. פרמטרים ששימשו לאימון פדרטיבי השומר על פרטיות, כולל מספר בתי החולים המשתתפים, סבבי תקשורת, עידני (epochs) אימון מקומיים, שיעור השתתפות לקוחות, אלגוריתם אגרגציה, אופטימייזר, קצב למידה, שיטת הצפנה, פרוטוקול תקשורת ומדיניות שיתוף נתונים גולמיים. אנא לחצו כאן להורדת קובץ זה.
טבלה משלימה 5: הגדרות GraphSAGE. הגדרות של מודול המלצות תרופות מותאמות אישית המבוסס על GraphSAGE הטרוגני, כולל סוג הגרף, ממדי השכבות הנסתרות והשיכון (embedding), מספר שכבות הגרף, גודל דגימת השכנות, האופטימייזר, קצב הלמידה, גודל אצווה (batch size), מספר תקופות אימון (epochs), הפסד Bayesian Personalized Ranking, ומספר המלצות התרופות המובילות. אנא לחצו כאן להורדת קובץ זה.
טבלה משלימה 6: מדדי הערכה של יכולת ההסבר. מדדים כמותיים וממוקדי-אדם המשמשים להערכת יכולת ההסבר של מסגרת ה-FedMediFormer-XAI. המדדים בוחנים את נאמנות ההסבר, יציבות, עקביות, דלילות, שלמות, רגישות, חוסר נאמנות, הסכמה בין מעריכים ואיכות ההסבר כפי שנתפסת על ידי קלינאיים. אנא לחצו כאן להורדת הקובץ.
טבלה נלווית 7: מדדי הערכה. מדדי חיזוי, למידה פדרטיבית, המלצה והסבירות (explainability) משמשים להערכת ביצועי המסגרת, החסינות, איכות הדירוג והיכולת לניתוח פרשני (interpretability). אנא לחצו כאן להורדת קובץ זה.
טבלה משלימה 8: תכנון הערכה ממוקדת-אדם. תכנון מחקר ההערכה הממוקד-קלינאי, הכולל קבוצות משתתפים, תנאי הערכה, קריטריונים להערכה והליכי ניתוח סטטיסטי. אנא לחץ כאן להורדת קובץ זה.
טבלה משלימה 9: נכס שחזוריותסיכום של מערכי הנתונים, מפרטי המימוש, קבצי התצורה, נהלי ההערכה, התיעוד והרישומים הניסויים הנדרשים כדי לתמוך בחזרתיות של מסגרת ה-FedMediFormer-XAI המוצעת. אנא לחצו כאן כדי להוריד קובץ זה.