מאמר זה שואף להעריך את השפעת משקל זמני, הסקה סיבתית וייחוס היררכי על אופטימיזציה של פרשנות.
מאמר מחקר
מאמר זה שואף להעריך את השפעת משקל זמני, הסקה סיבתית וייחוס היררכי על אופטימיזציה של פרשנות.
בשנים האחרונות, הצורך בשקיפות ובפרשנות התגבר בעקבות התקדמות משמעותית במודלים מונחי נתונים, שהובילו להופעת הבינה המלאכותית הניתנת להסבר (XAI). כמה גישות XAI מסורתיות נפוצות; עם זאת, לאלה יש יכולת מוגבלת בפרשנות יחסים דינמיים. המחקר הנוכחי שואף להתמודד עם מגבלה זו על ידי הצעת מסגרת חדשנית של Ensemble SHapley Additive exPlanations (SHAP) המתמקדת במשקל זמן, הסקה סיבתית, ייחוס היררכי ואופטימיזציה של פרשנות המכונה TCHSHAP. TCHSHAP מעדיף מידע עדכני על פני מידע היסטורי על ידי שקילת זמן דרך דעיכה מעריכית. יתרה מזאת, הסקה סיבתית מפרידה בין קורלציה לסיבתיות כדי להשיג תובנות מעשיות. בנוסף, ייחוס היררכי מאפשר תובנות ברמות גרגריות (רמת אזור) וברמות מצטברות (השפעות קבוצות תכונות). גישות אלו משולבות כדי להשיג מודל שקל לפרשנות והסבר יותר. כדי לאמת את יעילות המודל המוצע, אנו מבצעים ניסוי על מאגר נתוני יבול הגידולים שנאסף מקאגל. לפני ההערכה הניסויית, מתבצע עיבוד נתונים מוקדם באמצעות קידוד חד-חם. נרמול הנתונים מתבצע באמצעות קנה מידה מינימלי, וחריגים מוסרים דרך טווח ה-Interquartile. לצורך הערכה ניסויית, המחברים השתמשו במודל SHAP XAI ליער אקראי. בעת הערכת היעילות של מודל TCHSHAP המוצע, נצפה כי בעוד שהתחזית הממוצעת ל-SHAP המסורתי היא 161.137, היא עולה ל-161.506 לאחר שילוב משקל זמני והסקה סיבתית, הממליצה על יעילות השימוש במובהקות זמנית וסיבתית. בנוסף, במהלך שיוך היררכי, נצפה כי לתכונות חקלאיות יש את הדומיננטיות החזקה ביותר על המשתנה המטרה. דומיננטיות זו מלווה בגורמים גאוגרפיים וסביבתיים לפי הסדר. לכן, התוצאות שהושגו מאשרות את יעילות הגישה המוצעת לשיפור הפרשנות הגלובלית והמקומית, ומחזקות את אמון המשתמש בתחזיות המודלים. העבודה הנוכחית מציעה דרכים לשיפור השקיפות והפרשנות מבלי להשפיע על ביצועי המודלים. המודל המוצע מאפשר גם מידול רגרסיה יעיל וניתן לפרשנות ביישומים מורכבים מונחי נתונים, ומאפשר את יישומו הנרחב בסביבות אמיתיות.
רגרסיה ממלאת תפקיד מרכזי באנליטיקה חזויה, הכוללת מספר תחומים כולל מידול אקלים, תחזיות פיננסיות, אבחון רפואי והערכת תפוקה חקלאית 1,2. עם זאת, התוצאות הבלתי מוסברות של מודלים של רגרסיה, במיוחד מודלים לא ליניאריים ובעלי קיבולת גבוהה כמו מכונות הגברת גרדיאנט (GBMs), יערות אקראיים ורשתות עצביות עמוקות (DNNs), מציבות אתגרים משמעותיים, במיוחד עבור יישומים הדורשים שקיפות ותובנות מעשיות. פער הפירוש הזה ניתן לגשר על ידי שימוש ב-Explainable Artificial Intelligence (XAI), טכניקה שעדיין בראשיתה. כיום, מסגרות XAI קונבנציונליות כמו SHAP ו-Local Interpretable Model Agnostic Explanation (LIME) מספקות רק הסברים סטטייםלתכונות 3. טכניקות XAI אלו כיום אינן מסבירות את המורכבות של משימות רגרסיה הכוללות תלות זמנית, מבני תכונות היררכיים וסיבתיות, ויוצרות מסלול מחקר 4,5. עקב אי-התחשבות בגורמים אלו, XAI עלול לעיתים להסיק מסקנות שגויות. לדוגמה, SHAP המסורתי מתחשב רק בקורלציה של תכונות עם המשתנה היעד מבלי להתחשב בסיבתיות. בואו נבחן מאגר נתונים עם שתי תכונות בינאריות קלט, כלומר צריכת טבק ושיניים מוכתמות. המשתנה היעד במאגר נתונים זה הוא ההסתברות לסרטן. בתרחיש כזה, אם מתקבלת קורלציה בין תכונות הקלט למשתנה היעד, הסרטן יהיה קשור מאוד לשתי התכונות (צריכת טבק ושיניים מוכתמות). כעת, זה די מטעה להסיק ששיניים מוכתמות גורמות לסרטן, שכן זה נגרם מצריכת טבק סדירה. לכן, ניתן לסכם שלמרות התקדמות משמעותית בתחום XAI, הנושאים המרכזיים שיש לטפל בהן בהקשרי רגרסיה כוללים:
חוסר היכולת לשקול תלות זמנית מוביל רק להסברים סטטיים שעשויים לא לעבוד בהקשרים עם נתונים דינמיים.
אי-הכללת הסקה סיבתית בהתאמות SHAP מסורתיות גורמת לקורלציות שגויות במקום תובנות סיבתיות יקרות ערך.
חוסר תשומת לב לפרשנות היררכית מוביל לחוסר מספיק הסברים מצטברים ברמה גבוהה יותר.
כדי להתמודד עם סוגיות אלו, עבודת המחקר הנוכחית שואפת להציע מסגרת XAI חדשנית, TCHSHAP, הכוללת משקל זמני, הסקה סיבתית וייחוס היררכי, במטרה לשפר את יכולת הפרשנות והיעילות החישובית של מודלי XAI הנוכחיים. לשם כך, המסגרת המוצעת בוחנת גורם משקל זמני wt שמקצה משקלים גבוהים יותר לתרומת התכונה האחרונה בהשוואה לערכים קודמים. גורם המשקל הזה נועד להבטיח שהפרשנות תואמת את המשמעות הזמנית של תכונות קריטיות בבעיות רגרסיה דינמית כגון תחזית תשואות וחיזוי מכירות. יתרה מזאת, מודלים מסורתיים של רגרסיה אינם מציגים קשרים סיבתיים, מה שמוביל לייחוס עמום6. כדי להתמודד עם אתגר זה, המסגרת המוצעת מאמצת מודלים סיבתיים מבניים (SCMs) להערכת ההשפעה הסיבתית של תכונה Fi על התוצאה. בנוסף, מערכי הנתונים בזמן אמת מראים לעיתים קרובות יחסים היררכיים (מרחביים או קטגוריים) בין תכונות, שלרוב לא מוצגים במסגרות XAI קיימות 4,5,6. להפך, מסגרת XAI המוצעת מאגדת תכונות בודדות (Fi) כדי לקבל תכונות ברמה גבוהה יותר (Hj), כדי להשיג פירוט של ההסברים.
מלבד שילוב משמעות זמנית, סיבתית והיררכית, האנסמבל המוצע שואף גם לשפר את יכולת הפרשנות וההסבר. מטרה כזו היא מאמץ לקבוע את הפשרה בין פרשנות לדיוק, כדי להבטיח שההסברים המתקבלים מ-TCHSHAP מדויקים וניתנים לפרשנות4. מסגרת ה-XAI המוצעת ניתנת לתיאור מתמטי כך, בעוד שתיאור המשתנים שבהם השתמשו מוצג בטבלה 1. ערך SHAP המסורתי עבור התכונה מחושב כמשוואה (1)5,6.
(1)
הנוסחה המסורתית של SHAP מצטברת תרומות מבלי להתחשב בהתאמות זמניות, סיבתיות או היררכיות.
| משתנה | הגדרה |
| Fi | תכונה שערך ה-Shap שלה מחושב |
| שאפאי | ערך ה-Shap של התכונה |
| S | מערך התכונות הכולל |
| M | תת-קבוצה של כל התכונות |
| FT | סך כל המאפיינים |
| P(M) | חיזוי מודל כאשר משתמשים רק בתכונות ב-M |
| λ > 0 | קצב דעיכה |
| T | זמן חיזוי ייחוס |
| Y | פלט |
טבלה 1: תיאור המשתנים בשימוש. טבלה זו מתארת את חשיבות המשתנים השונים בהם השתמשו.
הנוסחה המסורתית של SHAP מותאמת להתמודד עם תלות דינמית על ידי הוספת משקל טמפורלי. משקל זמן זה משולב על ידי הכנסת מקדם המשקל wt = e-λ |t - T| כאשר λ מייצג את גורם הדעיכה (λ > 0). כפי שנדון קודם, משקל מעריכי זה מעניק משקל רב יותר לערכים האחרונים בהשוואה לערכים קודמים. דעיכה מעריכית זו כלולה בהבנה שערכי תכונות עדכניים הם בעלי משמעות גבוהה יותר מערכי עבר. ערך SHAP המותאם (לאחר שילוב מובהקות זמנית) ניתן במשוואה (2).
(2)
מידע זמני זה חשוב למשימות רגרסיה דינמית כמו חיזוי תשואות או מניות.
יתרה מזאת, כדי להפוך את ההסברים לחזקים יותר, SCM מיושם להערכת ההשפעה הסיבתית של התכונה Fi על התפוקה Y. הניסוח המתמטי ל-SHAP הסיבתי ניתן במשוואה (3)
(3)
כאן do(Fi) מייצג את התכונה שתרמה לשינוי. באמצעות שימוש בכך, המודל משיג את היכולת להסביר את הסיבתיות ולא את המתאמ. ראוי לציין שחישוב מבוסס SCM של השפעות סיבתיות מבטיח שרק תכונות עם השפעה סיבתית ישירה מקבלות קרדיט, ובכך מבטלים קורלציות שגויות.
יתרה מזאת, ההיררכיה מוצעת במודל המוצע לאיחוד תכונות ברמות שונות. הניסוח המתמטי של SHAP ההיררכי ניתן במשוואה (4).
(4)
שילוב היררכיה במודל המוצע מבטיח השגת פירוט ההסברים. המסגרת המוצעת מוצגת באיור 1.

איור 1: איור ציורי של אלמנטים שונים במסגרת המוצעת. איור זה מציג המחשה ציורית של אלמנטים שונים במסגרת המוצעת TCHSHAP, הכוללים משקל זמני, הסקה סיבתית וייחוס היררכי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
החידוש של המודל המוצע TCHSHAP טמון בטיפול בשלוש האי-עקביות הללו באמצעות שימוש במשקל זמני (כדי לתת משקל רב יותר למידע הנוכחי), מודלים סיבתיים מבניים (SCM; להערכת השפעות סיבתיות), ואגרגציה היררכית של ערכי SHAP (לקבלת תובנות רב-רמתיות). כך, האנסמבל המוצע מרחיב את SHAP מעבר למגבלות הסטטיות שלו, ומספק מסגרת הסברה מותאמת לרגרסיה.
ל-TCHSHAP המוצע יש פוטנציאל להשיג משמעות רבה ליישומים בזמן אמת בתרחישים הדורשים קבלת החלטות טובה יותר, שכן הוא מזהה את ההסברים המפורטים של התוצר במודלים רגרסיה, ומחבר בצורה חלקה מודלים עם קבלת החלטות. לסיכום, התרומה המרכזית של כתב יד זה היא עיצוב מסגרת חדשנית המשלבת משקל זמני, הסקה סיבתית ויחסים היררכיים כדי להעצים את ההסברים המעשיים של מודל SHAP המסורתי.
עבודות קשורות
XAI משלבת מתודולוגיות שונות שנועדו במיוחד לשיפור השקיפות והפרשנות של מודלים שונים של למידת מכונה. אסטרטגיות XAI אלו מבססות ביטחון בתוצאות על ידי מתן התובנות הנדרשות מהתוצאות. לדוגמה, מתודולוגיות XAI בולטות כמו LIME ו-SHAP משפרות את הפרשנות והשקיפות של מודלים שהיו בדרך כלל קופסה שחורה בתחומים שונים, בעיקר פיננסים, חינוךומגזר הבריאות. כמו כן, טכניקות XAI מיושמות במשימות הקשורות לניתוח תוכנה, זיהוי שיבוטים וחיזוי פגמים ב-Just-in-Time8. בנוסף, אוואל ורוי גם הדגישו את הפערים והפגינו אמינות פחותה ביצירת ההסברים8. כאן, המחברים יישמו מדדי הערכת רמת גרן להפחתת עקביות בהערכה. XAI שימש גם באופן נרחב בתחום הרפואה להבנת הגורמים הבולטים ביותר המשפיעים על תוצאות משימת הסיווג, ובכך לטפח את האמון בקרב אנשי מקצוע בתחום הבריאות להשתמש באבחונים מבוססי בינה מלאכותית 9,10,11,12. יתרה מזאת, במגזרים כמו חיזוי שכר דירה למגורים בבלגיה, גישות XAI מסייעות בפרשנות של מודלים מורכבים, ובכך משפרות את בקרת האיכות וממזערות טעויות ייצור13. Bommer ואחרים הראו כי שילוב שיטות XAI עם גרדיאנטים משפר את ביצועי שיטות XAI מבחינת עמידות, נאמנות, מורכבות ואקראיות במדעי האקלים14. חוקרים רבים ניסו ליצור טכניקות קבוצתיות והיברידיות. בנוסף להצעת טכניקות קבוצתיות, החוקרים גם הראו את יעילות הטכניקות ההיברידיות הללו במתן תובנות מקיפות למודלים מורכבים15,16. סקירה מפורטת של הטכניקות, האופטימיזציות והיישומים השונים מוצגת בטבלה 2, שמציינת בבירור שהטכניקות הנפוצות ביותר הן LIME ו-SHAP. כיוון המחקר העתידי מצביע על חקר אופטימיזציה בשיטות אלו כדי לשפר את יכולת הפרשנות של מודלים אלו. בהמשך לקו המחקר, המחברים במחקר הנוכחי מתמקדים באופטימיזציה של SHAP על ידי הוספת הסקה סיבתית, ייחוס היררכי ומשקל זמן.
| צִטּוּט | טכניקות XAI | אופטימיזציה | תובנות | יישומים | כיווני מחקר עתידיים |
| (אנושרי ואח', 2024) | ליים | לא סופק | שיפור הפרשנות והשקיפות של מודלים של קופסה שחורה ביישומים שונים במגזר הפיננסים, החינוך והבריאות. | · פשרה בין דיוק ויכולת פרשנות במגזר הפיננסים, החינוך והבריאות | · צריך לפתח רשימה של מדדים מפורטים להערכת מודלים שונים של XAI |
| שאפ | |||||
| מנגנוני הפרעות | |||||
| מנגנונים מבוססי קשב | |||||
| (אוואל & רוי, 2024) | PyExplainer | מדדי הערכת רמת גרגיר להפחתת עקביות בהערכה. | מדגיש את הפערים ומראה אמינות פחותה ביצירת ההסברים. | · משימות הקשורות לניתוח תוכנה | · נדרשות שיטות מחקר מתקדמות לשיפור אמינות מודלי XAI למשימות הקשורות לניתוח תוכנה |
| ליים | · זיהוי שיבוטים | ||||
| · חיזוי פגמים בדיוק בזמן | |||||
| (בומר ואח', 2024) | גרדיאנטים משולבים | אינטגרציה של שיטות XAI עם גרדיאנטים | שילוב שיטות XAI עם גרדיאנטים משפר את הביצועים מבחינת עמידות, נאמנות, מורכבות ואקראיות במדעי האקלים. | · תחזית מדעי האקלים | · התמקדו בהערכה ייעודית למשימה של מדעי האקלים. |
| הפצת רלוונטיות לפי שכבה | · תחזית מפות טמפרטורה ממוצעת שנתיות | ||||
| גרדיאנטים של זמני קלט | |||||
| שיטות רגישות כמו גרדיאנט, SmoothGrad, NoiseGrad ו-FusionGrad | |||||
| (בהאטנגר ואגרוואל, 2024) | ליים | אנסמבל טכניקות XAI | אנסמבל מספק תובנות מקיפות ומשפיר את יכולת הפרשנות וההסבר של מודלים מורכבים. | · מיושם על מאגר נתונים מוסרי לשיפור יכולת הפרשנות של התוצאות | · חקור שיטות XAI היברידיות על ידי שילוב טכניקות מרובות |
| שאפ | · התאמת אלגוריתמים שונים של XAI לדגמים ספציפיים המותאמים לצרכים השונים של המשתמשים | ||||
| (דיאס, 2024) | ליים | שילוב טכניקות XAI | שיפור בפרשנות ודיוק | · סיווג תגובות רעילות | · חיזוק החוזק למטרות סיווג. |
| הסבר פשוט לילד בן 5 | |||||
| (Hajare ואח', 2024) | שאפ | לא סופק | SHAP מציע תובנות מפורטות לגבי גורמי הסיכון בחיזוי תסמונת הכליליים החריפות. | · תסמונת כלילית חריפה (ACS) | · כדי לגלות גורמי סיכון חדשים בחיזוי ACS. |
| (חמידה ואח', 2024) | סקירה מקיפה של טכניקות XAI שונות | לא סופק | מספק תובנות על יישומי XAI במגזר הבריאות, ומדגיש את חשיבות ההסבר של החלטות AI כדי להבין את התוצאות שמספק הבינה המלאכותית. | · תובנות מעשיות בתחום הבריאות | · שיפור רכיבי XAI כגון הבנה, שקיפות, פרשנות והסבר. |
| · טכניקות XAI מותאמות אישית לתחום הבריאות לתובנות מפורטות בתחום הבריאות | |||||
| (איהונגבה ואח', 2024) | Grad-CAM (מיפוי הפעלת מחלקות משוקלל לפי גרדיאנט) | מיפוי הפעלת מחלקות משוקלל לפי גרדיאנט | דיוק טוב יותר באבחון דלקת ריאות וקורונה. | · שיפור הדיוק באבחון רפואי | להעלות את המודעות לשימושיות של טכניקות XAI ליישומים אמיתיים |
| (לנארס, & דה מור, 2023). | 6 טכניקות XAI | אנסמבל של 6 טכניקות XAI במודל CatBoost | טכניקות רבות משפרות את יכולת הפרשנות של XAI לחיזוי שכר דירה. | · תחזית שכר דירה למגורים בבלגיה | ניתן להשתמש ב-XAI לקבלת החלטות |
| (מקומבורה ואח', 2024) | שאפ | הרכב RF, LightGBM, XGBoost עם SHAP | SHAP חושף את הגורמים השונים האחראים להערכת וחיזוי איכות המים. | · הערכה וחיזוי איכות המים | ניתן להשתמש בו לקבלת החלטות |
| (שלגל & קים, 2023). | טכניקות XAI עם ניתוח הפרעות | ניתוח הפרעות | ניתן להשתמש בו ביעילות למשימות סיווג של נתוני סדרות זמן | · נתוני סדרות זמן של פיננסים, בריאות, מדעי האקלים | לשלב מספר טכניקות XAI לשיפור יכולת הפרשנות. |
| (סילבה & קלר, 2023) | XAI | לא סופק | למודלים XAI יש מגבלה להסביר את התוצאות במקרה של תכונות מתואמות. ניתן לשמש במדעי כדור הארץ והאטמוספירה. | · מדעי האטמוספירה | יש לאופטם את XAI לתכונות מתואמות כדי למנוע הסברים שגויים. |
| קצב תגובה ביומולקולרית | · כימיה אטמוספרית | ||||
| (י, ס., & צ'אלה, מ. 2023) | שאפ | לא סופק | כאן, מודלים של XAI מושווים מבחינת פרשנות והבנת תכונות חשובות, והסיקו ש-SHAP ו-LIME הם היעילים ביותר. | · יישומים רפואיים | לשפר את הפרשנות ליישומים רפואיים מתקדמים |
| ליים | |||||
| PDP | |||||
| גאם |
טבלה 2: סקירה מקיפה של אופטימיזציות שונות שבוצעו בטכניקות XAI. טבלה זו מציגה סקירה מקיפה של טכניקות אופטימיזציה שונות שהוצעו על ידי חוקרים שונים.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
הערה: סעיף זה דן בשיטת האנסמבל המוצעת, כולל כל התיקונים המוצעים כפי שמוצג באיור 1.
הכנת נתונים
כדי לאמת את יעילות המסגרת המוצעת, המחברים ערכו ניסוי על מאגר נתוני תפוקת הגידולים שנאסף מ-Kaggle17. מערך נתונים זה כולל נתונים חקלאיים בהודו עבור גידולים שונים בין השנים 1997 ל-2020 ונפתח במרץ 2025. מאגר נתונים זה כולל תכונות רבות, כגון עונה, crop_year, דשן, חומרי הדברה, גידול ותפוקה (משתנה יעד) ועוד. מערך הנתונים שנבחן מעובד מראש לשיפור היעילות באמצעות קידוד חד-חם לטיפול בערכים קטגוריים. התכונות הקטגוריות כמו עונה, יבול ומצב מקודדות ב-one-hot. קנה מידה של MinMax משמש גם להרחבת המאפיינים המספריים כמו שטח, ייצור, annual_rainfall, דשן וחומרי הדברה לטווח [0,1]. כדי להתמודד עם החריגים, השתמשנו בכלל טווח בין-רבעוני עם סף Q1 - 1.5 • IQR17. זרע אקראי של 42 הוחל בכל שלבי העיבוד המוקדם כדי לקבל את השחזוריות של התוצאות. בנוסף, מערך הנתונים חולק לאימון (80%) ומערך נתונים לבדיקה (20%) לאחר עיבוד מוקדם.
סידור ניסיוני
הניסוי בוצע באמצעות Python 3.10 על שרת GPU מדגם A100 עם מעבד: Dual AMD Rome 7742, 128 ליבות, זיכרון RAM בנפח 1TB. הספריות שיובאו לסימולציה הן scikit-learn 1.3.0, XGBoost 1.7.6, TensorFlow 2.13, SHAP 0.41.0, LIME 0.2.0.1, ו-ELI5 0.13.0.
הערכת מודלים של למידת מכונה
כאן, המחברים השתמשו במודלים שונים של רגרסיה, ביניהם LinearRegression(), Ridge(alpha=1,random_state=42), Lasso(alpha=0.1,מצב אקראי = 42), Decision TreeRegressor(max_depth = 10, random_state = 42), RandomForestRegressor(max_depth = 15random_state = 42), GradientBoostingRegressor(n_estimators = 200, learning_rate = 0.1, random_state = 42), XGBoost ו-CNN כדי לקבוע את השפעת משתנים שונים על תפוקת המשתנה היעד18. XGBoost משתמש ב-300 אומדנים וקצב למידה של 0.05. במודל CNN משתמשים בשתי שכבות נסתרות, הפעלה של ReLU ואופטימייזר אדם, עם קצב למידה של 0.001. היעילות של מודלים אלו מושווית באמצעות מדדי ביצועים שונים. מודלים אלה מבצעים גם כיוונון היפרפרמטרים. לדוגמה, רגרסיית רידג' ורגרסיית לאסו מאומנים כאשר אלפא שווה 1.0 ואלפא שווה 0.1, בהתאמה. ב-Decision Tree ו-Random Forest, העומק המקסימלי הוגדר ל-10 ו-15, בהתאמה. הגברת גרדיאנט משתמשת ב-200 אומדנים וקצב למידה של 0.1. ביצועי המודלים הללו הוערכו באמצעות אימות צולב של 5 פעמים במונחים של שגיאת ממוצעת בריבוע (MSE) וריבוע R2.
הערכת מודלים של XAI
כפי שנדון, העבודה הנוכחית עושה שימוש במודלים שונים של XAI כדי להשוואת התוצאות. כאן, המחברים משתמשים ב-shap. TreeExplainer (model,data = crop_yield) למודלים מבוססי עץ (יער אקראי, הגברת גרדיאנט ו-XGBoost). נבחר מערך נתונים רקע של 100 מקרים שנבחרו באקראי מתוך מאגר ההדרכה כדי לייצב את הייחוסים. בנוסף, שאפ. KernelExplainer() שימש למודלים שאינם עצים (ליניארי, רידג', לאסו ו-CNN) עם 1000 הפרעות כדי להתקרב לערכי SHAP. הסבר טבולרי (lime.lime_tabular. LimeTabularExplainer) שימש עם 5000 הפרעות לכל מופע כדי להריץ את LIME על אותו מאגר נתונים רקע ולהבטיח שההסברים המקומיים יציבים. רוחב הגרעין נקבע על פי מאפיינים, ופונקציית החיזוי של המודל שימשה להסקת הסברים. הסברים מקומיים נוצרו על ידי קריאה ל-explainer.explain_instance(x,model.predict). ELI5 שימשה כחשוב פרמוטציה עם 10 חזרות על חלוקת האימות כדי למנוע התאמת יתר של נתוני הבדיקה, והיא דומה באמצעות eli5.sklearn.PermutationImportant(estimator,random_state = 42). החשיבות של ממוצע ושונות בין חזרות הוצגה במהלך הניסוי. לבסוף, המודל המותאם שימש לפיצול האימות לקבלת מגרשי תלות חלקית (PDPs), שיושמו באמצעות PartialDependencyDisplay.from_estimator (model,X_val,features = [תכונה]),
הגדרת מסגרת TCHSHAP
בהמשך, TCHSHAP יושם על ידי יישום שלבים שונים ברצף. השלב הראשון ברצף היה משקל זמני המשתמש בפונקציית דעיכה אקספוננציאלית עם קצב דעיכה λ = 0.85, שנבחר בהתבסס על מחקר אבלציה על פני λ
[0.7.0.95]. זמן ההתייחסות (T_current) נבחר כשנת הגידול האחרונה במאגר הנתונים. זה מבטיח שההסברים במודל מתחשבים בדינמיקה של תחזית התפוקה החקלאית, שבה מאפיינים אחרונים (גשמים, שימוש בדשנים או חומרי הדברה) נושאים משמעות רבה יותר לקבלת החלטות. משקל זמני הוחלף על ידי SCM כדי לאמץ הסקות סיבתיות. המתודולוגיה המוצעת משתמשת באופרטור הנקודה כדי לדמות התערבויות ולחשב את ההשפעה הסיבתית הממוצעת. ההסקה הסיבתית יושמה באמצעות ספריית פייתון doWhy 0.13. זה מסייע להקל על קשרים מטעים הנובעים מקלטים מתואם כמו ייצור ושטח, ובכך משיג קשרי סיבה ותוצאה אמיתיים. השלב האחרון בצינור היה ייחוס היררכי, שבו תכונות אורגנו לתחומים ברמה גבוהה יותר. למאגר הנתונים הנוכחי קיימות 3 תכונות היררכיות: קלטים חקלאיים (דשנים, חומרי הדברה), גורמים גאוגרפיים (מדינה, שטח, Crop_Year) וגורמים סביבתיים (Annual_Rainfall, עונה). באמצעות סיכום מנורמל לנתוני SHAP קבוצתיים, ניתן לקבל הסברים בשתי הרמות (מפורטים וכלליים).
לסיכום, צינור TCHSHAP משלב שלושה שלבים - התאמה זמנית, ייחוס סיבתי וקיבוץ היררכי לתהליך אחד. כאן, SHAP הבסיסי קודם מסביר, ואחר כך מוסיפים שלושה שיפורים. צינור הייצור המובנה הזה מבטיח שהפלטים של TCHSHAP יהיו עקביים, ניתנים לשכפול, ומספקים הסברים מקומיים וגלובליים. התיאור שלב אחר שלב של המסגרת המוצעת ניתן בקוד הפסאודוגרפי למטה.
קלט:
X: מערך נתונים עם תכונות X1,X 2,X 3,........,Xn.
t: משתנה זמני במאגר הנתונים
T current: זמן ייחוס
λ: קצב דעיכה
G: קבוצות תכונה
חישוב משקלים זמניים
לכל דוגמה, i
X, העריכו wt = e-λ|t-T|,
חישוב ערכי Shapשאפ i
חשב ShapTempral = Shapi * wt
חישובי הסקה סיבתית
לכל תכונה, Xi
X
חשב שאפסיבתי = שאפi * אפקט סיבתי (Xj →Y)
ייחוס היררכי
לכל תכונה, Xi
X
חישוב ערכי Shapשאפ i
לכל Gi
G

פלט: קבוצת ערכי SHAP המצטברים היררכית
נקודת הביקורת הכמותית להקלה על פתרון תקלות מוצגת להלן: יער אקראי מניב את ה-MSE הנמוך ביותר ואתה-R2 הגבוה ביותר בכל מודלי ה-ML. החשיבות התכונה שהושגה הייתה שטח > חומרי הדברה > דשנים, עם עונה ו-Crop_Year מינימלית. תחזית הבסיס העולמית ל-SHAP הייתה 161.137. יתרה מזאת, לאחר יישום λ = 0.85, התרומה של Crop_year והעונה עולה. תרומות ברמת הקבוצה עוקבות אחרי הסדר Agricultural Inputs>Geographic Factors> Environmental Factors.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
סעיף זה דן בתוצאות שהושגו באמצעות יישום שיטות שונות ששימשו במהלך מחקר הניסוי, הכוללות תת-סעיפים שונים כדלקמן:
איסוף נתונים ועיבוד מוקדם
כדי לבצע הערכה ניסיונית של המסגרת המוצעת, נאסף מאגר נתונים לגבי תפוקת הגידולים מקגל19. הנתונים שנאספו עובדו מראש, כולל שלבים כמו קידוד תוויות, קנה מידה והסרת חר...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
המטרה העיקרית של המחקר הנוכחי היא לשלב משקל זמני, הסקה סיבתית ומשמעות היררכית במודל SHAP המסורתי, מה שמניב את מודל TCHSHAP. המניע מאחורי הכללת רכיבים אלו בטכניקות XAI הוא לשפר את יכולת הפרשנות של התוצאות. לצורך שקילול זמן, שקלנו טכניקת דעיכה מעריכית, שמעניקה משקל רב יותר לערכים האחרונים בהשוואה לערכים הישנים. במשמעות סיבתית, המחברים מנסים להעריך את ההשפעה הישירה של תכונות שונות על משתנה המנבא. יתרה מזאת, פרמטרי הקלט מסווגים גם לתכונות היררכיות שונות כדי להבין טוב יותר את התוצאות. כדי לאמ...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
המחברים מצהירים שאין ניגודי עניינים.
עבודה זו ממומנת על ידי קרנות לאומיות דרך FCT – Fundação para a Ciência e a Tecnologia, I.P., תחת חוזה התכנית UID/05105/2025.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| הסבר פשוט לילד בן 5 | 0.13.0 | PyPI | |
| ליים | 0.2.0.1 | PyPI | |
| שרת GPU של Nvidia DGX A100 | מעבד כפול AMD Rome 7742, 128 ליבות בסך הכל | Nvidia | |
| זיכרון מערכת 1TB | |||
| פיתון | 3.1 | פיתון | |
| שאפ | 0.41.0 | PyPI | |
| סקיקיט-לרן | 1.3.0 | PyPI | |
| TensorFlow | 2.13 | זרימת טנזור | |
| XGBoost | 1.7.6 | PyPI |
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה