מחקר זה לא כלל משתתפים אנושיים או בעלי חיים בעלי חוליות, ולא נדגמו רקמות. כל הנתונים ששימשו למחקר זה נוצרו באופן סינתטי באמצעות מודלים של התפשטות פיזיקלית ופרמטרים מטאורולוגיים הזמינים לציבור. לפיכך, לא נדרש אישור אתי מוועדה לביקורת מוסדית (IRB) או מוועדה מוסדית לטיפול ובקרת בעלי חיים (IACUC).
יצירת מערך נתונים המבוססת על תאוריית ההתפשטות הפיזיקלית. מערך הנתונים נבנה כדי לדמות תנאים אטמוספריים שעתיים עבור מערכת תקשורת אופטית במרחב חופשי למשך שנה קלנדרית שלמה (2024) עבור תנאים אטמוספריים עיראקיים. יצרנו מאגר נתונים סינתטי עם 1,500 דגימות לשעה.
ראשית, תנאי מזג האוויר הוקצו באופן אקראי בהתבסס על מגמות אזוריות: שמיים בהירים (54.3%), אבק (24.9%), ערפל (10.5%), גשם (7.4%) ושלג (2.8%). שנית, מודל הנח attenuation פיזיקלי תואם הוחל על כל דגימה בהתבסס על תנאי מזג האוויר, כלומר חוק ביר-למברט (Beer-Lambert law) עבור שמיים בהירים, מודל קים (Kim model) עבור ערפל, תיאוריית קרבונו (Carbonneau theory) עבור גשם ותיאוריית פיזור מי (Mie scattering theory) עבור סופות אבק. שלישית, פרמטרי מערכת ה-FSO נקבעו באופן הבא: הספק שידור של 20 dBm, אורך גל של 1550 nm, מרחק שידור של 3 km, מפתח שידור של 2.5 cm ומפתח קליטה של 20 cm. רביעית, הנח attenuation חושבה ב-dB/km עבור כל דגימה. לבסוף, מערך הנתונים המלא חולק באופן אקראי ל-1,200 דגימות אימון (80%) ו-300 דגימות בדיקה (20%). התנאים המסומולקים כוללים ריכוזי אבק גבוהים הקשורים לסופות חול, סופות גשם ושינויי טמפרטורה מ-−4.89°C עד 47.99°C. תנאי מזג האוויר והתפלגויות הפרמטרים נבחרו בהתבסס על רשומות האקלים של עיראק לתקופה 2020–2024. חמישה משטרי מזג אוויר (שמיים בהירים, ערפל, גשם, סופות אבק ושלג) נבחרו כיוון שהם מכסים את מלוא הספקטרום של תנאי האטמוספירה המשפיעים על הנח attenuation ב-FSO בעיראק, כאשר סופות אבק נפוצות במיוחד במזרח התיכון. נתונים היסטוריים על מטאורולוגיה שנאספו ברחבי אזורי עיראק שימשו ליצירת התפלגות ההסתברות עבור כל תנאי מזג אוויר. ההתפלגות שהתקבלה הייתה כדלקמן: 54.3% מהשמיים בהירים (המצב הדומיננטי), 24.9% אבק (המייצג את בעיית סופות החול של עיראק), 10.5% ערפל (שכיח בחורפים בצפון עיראק), 7.4% גשם (כמויות משקעים נמוכות האופייניות לעיראק), ו-2.8% שלג (לעיתים באזורים הרריים בצפון). הפרמטרים המטאורולוגיים הרלוונטיים מודלו באמצעות התפלגויות הסתברות עבור כל תנאי מזג אוויר באופן הבא: הטמפרטורה מודלה באמצעות התפלגות נורמלית (ממוצע 28.55±11.18°C) בין −4.89°C ל-47.99°C בהתבסס על קיצוניים עונתיים בעיראק; הלחות מודלה באמצעות התפלגות אחידה (ממוצע 42.01±25.56%) מ-0% עד 100%; הנראות מודלה באמצעות התפלגות לוג-נורמלית בין 0.05 km ל-29.99 km (ממוצע 13.10±10.91 km) כדי להביא בחשבון אירועי נראות נמוכה שכיחים במהלך סופות אבק; ריכוז האבק מודל באמצעות התפלגות מעריכית בין 0 ל-4.96 mg/m3 (ממוצע 0.74±1.30 mg/m3) עם הסתברויות גבוהות יותר עבור ריכוזים נמוכים וזנבות ארוכים עבור אירועי אבק קיצוניים.
מערכת התקשורת תוכננה עם הספק שידור של 20 dBm, אורך גל של 1550 nm, מרחק שידור של עד 3 km, מפתח שידור של 2.5 cm, ומפתח קליטה של 20 cm כדי לפצות על הפסדי הפיזור. הפרמטרים של מערכת ה-FSO חולקו לשתי קבוצות: פרמטרים קבועים שלא השתנו עבור כל הדגימות, ופרמטרים משתנים ששונו במהלך יצירת מערך הנתונים. עבור כל 1,500 הדגימות, הפרמטרים הבאים היו קבועים: הספק שידור (20 dBm), אורך גל תפעולי (1550 nm), מפתח שידור (קוטר 2.5 cm, נצילות 0.7) ומפתח קליטה (קוטר 20 cm, נצילות 0.7). פרמטרים אלו היו קבועים מכיוון שהם המפרטים הפיזיים של חומרת מערכת ה-FSO והם אינם משתנים בהתאם לתנאי מזג האוויר. מערך הנתונים נוצר עם 1,500 דגימות שבהן השתנו הפרמטרים הבאים: טמפרטורה (−4.89°C עד 47.99°C), לחות (0% עד 100%), ראות (0.05 km עד 29.99 km), ריכוז אבק (0 עד 4.96 mg/m3) ותנאי מזג אוויר (שמיים בהירים, ערפל, גשם, אבק, שלג). פרמטרים אלו שונו בהתאם להתפלגויות הסתברותיות שנגזרו מנתוני האקלים של עיראק לשנים 2020–2024. עבור כל דגימה, ערך הניחות (dB/km) חושב באמצעות מודל הניחות הפיזי המתאים, בהתאם לשילוב הספציפי של תנאי מזג האוויר והפרמטרים המשתנים.
ניחות פיזיקלי מודל באמצעות מודל Carbonneau עבור גשם, חוק Beer–Lambert עבור שמיים בהירים, תאוריית פיזור Mie עבור אבק, ומודל Kim עבור ערפל24. חוק Beer-Lambert תקף לתנאי שמיים בהירים שבהם הניחות נשלט על ידי פיזור מולקולרי ובליעה, אשר פוחתים באופן מעריכי עם המרחק25. מקדם ההכחדה α באורך גל של 1550 nm נובע מפיזור Rayleigh על ידי מולקולות אוויר ומבליעה על ידי גזים אטמוספריים26. מודל Kim הוא מודל ייעודי לערפל הקושר בין הניחות לנראות באמצעות מקדמים אמפיריים הנגזרים מהתפלגות גודל טיפות הערפל. המעריך q, התלוי באורך הגל, מייצג את פיזור Mie27. הפרמטר המרכזי במודל Carbonneau הוא קצב הגשם R, שכן ניחות הגשם תלוי בגודל ובצפיפות טיפות הגשם, והמקדמים נגזרים באופן אמפירי ב-1550 nm ומכויילים ספציפית עבור אורכי גל אופטיים28. תאוריית פיזור Mie ישימה לתנאי אבק, מכיוון שגודל חלקיקי האבק (רדיוס של 0.1–100 μm) בר השוואה לאורך הגל (1550 nm), ומדד השבירה המורכב m = 1.55–0.005i עבור אבק מהמזרח התיכון כולל הן פיזור והן בליעה29. מודלי הניחות הפיזיקלי הבאים הוטמעו עם המשוואות והגדרות הפרמטרים המתאימות להם.
עבור תנאי שמיים בהירים, נעשה שימוש בחוק ביר-למברט:
Aclear = 10×log₁₀(e(α×d)) (1)
כאשר α הוא מקדם ההכחדה (שהשתנה באמצעות התפלגות נורמלית המרוכזת ב-0.02 dB/km עם סטייה של ±0.005 dB/km ב-1550 nm בתנאי ראות צלולה), ו-d הוא מרחק השידור (שנקבע על 3 km). עבור תנאי ערפל, מודל Kim יושם באמצעות המשוואה:
Afog = 10×ln(10)/V×(λ/550)−q (2)
כאשר V היא הנראות בקילומטרים (שנויה בין 0.05km ל-10km), λ הוא אורך הגל בננומטרים (קבוע על 1550nm), ו-q הוא מקדם התפלגות גודל החלקיקים המחושב כך: q=1.6 עבור V>50 km, q=1.3 עבור 6<V<50 km, q=0.585×V(1/3) עבור 1 <V<6km, q=0 עבור 0.5<V<1km, ו-q=0.5 עבור V<0.5km. עבור תנאי גשם, נעשה שימוש במודל Carbonneau:
Arain=0.023×R0.93 (3)
כאשר R הוא קצב הגשם ב-mm/h (שנע בין 0.25 ל-50mm/h בהתאם לרישומי הגשמים בעיראק). קשר יעילות ההכחדה שימש עבור נסיבות של סערת אבק באמצעות פיזור Mie:
Adust=10×log₁₀(e(τ×L)) (4)
כאשר τ=∫₀^∞ πr2Qext(r,λ,m)N(r)dr, r הוא רדיוס החלקיק (0.1–100μm בהתאם להרכב אבק עיראקי), Qext הוא נצילות הכיליון שחושבה באמצעות תאוריית Mie, λ=1550nm, m=1.55–0.005i הוא מקדם השבירה המרוכב עבור אבק ממזרח התיכון, ו-N(r) הוא התפלגות גודל החלקיקים שמודלה באמצעות התפלגות לוג-נורמלית עם רדיוס ממוצע גיאומטרי של 2.5 μm וסטיית תקן של 2.0. מודל הניחות הוטמע עבור תנאי שלג באופן הבא:
Asnow = 0.1×S0.75 (5)
כאשר S הוא קצבe שלג ב-mm/h (0.5–15 mm/h). משוואה אמפירית זו נבחרה בהתבסס על עבודות בספרות30, שבהן פותחו מודלים של ניחות להגברה אופטית דרך שלג באמצעות תאוריית פיזור Mie המיושמת על התפלגויות גודל של פתיתי שלג. המשוואה תקפה לקצבי שלג שבין 0.5 ל-15 mm/h ומניחה תנאי שלג יבש עם קטרי פתיתי שלג טיפוסיים של 1–10 mm. המקדם 0.1 והמעריך 0.75 התקבלו מהתאמת עקומה לחישובי פיזור Mie30 עבור שלג ב-1550 nm. המשוואה אינה מתאימה לשלג רטוב או למשקעים משולבים, שעשויים להיות בעלי תכונות ניחות משתנות, למרות שהיא מספקת הערכה סבירה עבור שלג יבש. מכיוון שהגישה יעילה מבחינה חישובית, מצוטטת לעיתים קרובות בפרסומי FSO, ומתאימה לנסיבות השלג החזויות בצפון עיראק (חבל כורדיסטן בינואר ובפברואר), היא נבחרה למחקר זה. כל המודלים הוטמעו ב-Python 3.9 תוך שימוש ב-Numpy לחישובים מספריים. המודל התואם הוחל על תנאי מזג האוויר שנבחרו באופן אקראי ועל נתוני סביבה נדגמים כדי לחשב את ערך הניחות עבור כל דגימה. התפלגות מזג האוויר שהתקבלה כללה 814 תנאי שמיים בהירים (54.27%), 375 אירועי אבק (25.00%), 157 אירועי ערפל (10.47%), 111 אירועי גשם (7.40%) ו-43 אירועי שלג (2.87%).
בחינה של מידע מטאורולוגי היסטורי שנאסף מתחנות מטאורולוגיות עיראקיות במספר אזורים (בגדאד, בצרה, מוסול ורמדי) בין 2020 ל-2024 שימשה לקביעת הפרופורציות של מצבי מזג האוויר. משרד התחבורה העיראקי והארגון המטאורולוגי והסייסמולוגי של עיראק (IMOS) סיפקו את הנתונים המקוריים. בנתונים נכללו רשומות מזג אוויר יומיות שתיעדו את התנאים האטמוספריים השוטפים עבור כל יום. טמפרטורה (מינימום, מקסימום וממוצע יומי), לחות יחסית, ראות, כמות משקעים והתרחשויות של סערות אבק היו בין המאפיינים הספציפיים שהופקו מרשומות אלו. פורטל הנתונים הפתוחים של ממשלת עיראק (https://www.motrans.gov.iq/) מספק גישה לחלק מנתוני IMOS; עם זאת, הרשומות הספציפיות ששימשו במחקר זה אינן מאוחסנות באופן ציבורי במאגר מרכזי. מידע האקלים ששימש לחישוב האחוזים של תנאי מזג האוויר וערכי הפרמטרים מסוכם בטבלה 1. ימי שמיים בהירים הוגדרו כימים ללא משקעים, ראות הגדולה מ-10 km וללא פעילות אבק, והם היוו 54.27% מתוך 1,825 הימים שתועדו. ימי סערת אבק (כולל סערת אבק מלאה (ראות < 1 km) ואבק רחף (ראות 1–5 km)) היוו 25.00% מהימים, מה שמעיד על השכיחות הגבוהה של אירועי סערות חול באקלים הצחיח והחצי-צחיח של עיראק. ימים שבהם הראות הייתה נמוכה מ-1 km עקב רחף של טיפות מים (למעט ירידה בראות הנגרמת מאבק) סווגו כימי ערפל. אחוז ימי הערפל היה 10.47%, וימי ערפל התרחשו בעיקר בחורף באזורי צפון עיראק. ימי גשם, ימים עם משקעים מדידים של >0.1 mm, היוו 7.40%, נתון העולה בקנה אחד עם הממוצע הנמוך של משקעים שנתיים בעיראק של 150–200 mm לשנה. ימי שלג (ימים עם הצטברות של משקעים קפואים) היוו 2.87% מהימים והתרכזו באזורים הרריים בצפון (חבל כורדיסטן) בינואר ובפברואר. פרופורציות אלו שימשו מאוחר יותר כמשקולות הסתברות לדגימה אקראית ביצירת מערך הנתונים. לפיכך, מערך הנתונים הסינתטי משקף את השכיחות בעולם האמיתי של כל תנאי מזג אוויר בסביבה העיראקית.
שיקולי הטיות ביצירת נתונים סינתטיים
כדי לצמצם הטיות אפשריות, ננקטו מספר צעדים:
(1) בחירת ההתפלגות: התכונות הסטטיסטיות של נתוני האקלים מהמקור שימשו לבחירת התפלגויות ההסתברות. הטמפרטורה הייתה בעלת התפלגות נורמלית עם ממוצע וסטיית תקן כפי שתועדו על ידי ה-IMOS. הלחות הייתה בעלת התפלגות אחידה על פני כל הטווח שנצפה (0-100%). לגבי הראות, הונח כי היא עוקבת אחר התפלגות לוג-נורמלית כדי להביא בחשבון את השכיחות הגבוהה של אירועי ראות נמוכה במהלך סופות אבק. ריכוז האבק עקב אחר התפלגות מעריכית, שבה היו הסתברויות גבוהות יותר בריכוזים נמוכים וזנבות ארוכים באירועי אבק קיצוניים31. ממצא זה היה עקבי עם השכיחות שנצפתה של אירועי אבק בעיראק32.
(2) פרופורציות של תנאי מזג אוויר: ניתוח של רשומות IMOS לשנים 2020–2024, הכולל 1,825 תצפיות יומיות בארבעת האזורים, הניב את הפרופורציות הבאות: 54.3% שמיים בהירים, 24.9% אבק, 10.5% ערפל, 7.4% גשם ו-2.8% שלג. ימים ללא משקעים, עם ראות >10 km וללא פעילות אבק הוגדרו כימים של שמיים בהירים. ימים עם סופות אבק כללו הן סופות אבק מלאות (ראות <1 km) והן אבק תלוי (ראות 1–5 km). יום ערפל הוגדר כיום שבו הראות הייתה פחות מ-1 km והגורם היה תלייה של טיפות מים (לא אבק). ימי גשם הוגדרו כימים עם משקעים מדידים >0.1 mm. ימי שלג הוגדרו כימים עם הצטברות של משקעים קפואים33.
(3) טווחים של פרמטרים: טווחי הפרמטרים התבססו על ערכי הקיצון שנצפו ברישומי ה-IMOS: הטמפרטורה נעה בין −4.89 °C (מוסול, חורף) ל-47.99 °C (בצרה, קיץ), הנראות נעה בין 0.05 km (סופות אבק חמורות) ל-29.99 km (תנאים צלולים), וריכוז האבק נע בין 0 ל-4.96 mg/m3 (על בסיס ריכוז האבק המקסימלי שנצפה במהלך אירועי חבוּב חמורים)34.
(4) הנחות עצמאות: הנחנו כי הפרמטרים הסביבתיים נדגמו באופן עצמאי, דבר המהווה פישוט של תנאי העולם האמיתי שבהם משתנים אטמוספריים נמצאים במתאם (למשל, ריכוז אבק גבוה נמצא לעיתים קרובות במתאם עם ראות נמוכה). על מנת לספק סביבת סימולציה מבוקרת להשוואה שיטתית של מודלים, אומצה הנחת עצמאות זו 35. השלכות הנחות אלו נסקרות בפרק הדיון.
(5) פיצול שכובתי: הפיצול למערכות אימון ובדיקה בוצע באופן שכובתי על בסיס קטגוריית תנאי מזג האוויר (שמיים בהירים, ערפל, גשם, אבק, שלג) כדי להבטיח שהפרופורציה של כל תנאי מזג אוויר במערכי האימון והבדיקה תואמת את ההתפלגות של מערך הנתונים המקורי. בדרך זו, מערך הבדיקה אינו איסונסיבי ביחס לתנאי מזג אוויר נדירים (במיוחד שלג, העומד על 2.87%)36.
אישור על יצירה דטרמיניסטית של מטרה
חשוב לציין כי ביצועי החיזוי הטובים שנצפו כאן עשויים לנבוע בחלקם מכך שהמודל למד או קירב את המשוואות הפיזיקליות הדטרמיניסטיות ששימשו ליצירת ערכי המטרה הסינתטיים37. בניגוד למדידות ניסיוניות בעולם האמיתי, המכילות רעשי מדידה, שגיאות מכשירים ותופעות פיזיקליות שלא נכללו במודל, מערך הנתונים הסינתטי מספק קשר נקי וללא רעשים בין מאפייני הקלט לבין מטרה הניחות. זאת משום שערכי הניחות חושבו ישירות ממודלים פיזיקליים של התפשטות (חוק ביר-למברט, מודל Kim, מודל Carbonneau ותאוריית פיזור Mie) בהתבסס על פרמטרי הקלט. לפיכך, מדדי הביצועים הכמותיים (R2, RMSE, MAE) מייצגים ביצועים על נתונים סינתטיים המופקים ממשוואות, ואין לפרשם כביצועים צפויים על נתונים תצפיתיים או ניסיוניים רועשים. יש להתבונן בתוצאות בעיקר כהערכה השוואית של מתודולוגיות מידול בסביבת סימולציה מבוקרת38.
סט מאפיינים מלא לאימון מודל
סט הנתונים לאימון הכיל 10 מאפייני קלט לאימון המודל:
1. טמפרטורה (°C)
2. לחות (%)
3. ראות (km)
4. ריכוז אבק (mg/m3)
5. קצב משקעים (mm/h)
6. קצב הצטברות השלג (mm/h)
7. מהירות רוח (m/s)
8. לחץ ברומטרי (hPa)
9. חודש (מספרי, 1–12)
10. עונה (קידוד one-hot: אביב, קיץ, סתיו, חורף)
הבהרה חשובה: תנאי מזג האוויר (שמיים בהירים, ערפל, גשם, אבק, שלג) שימשו כמשתנה קטגוריאלי לצורך שכיבה (stratification) במהלך פיצול מערך הנתונים, ולא נכללו כמאפייני קלט עבור אף מודל. ניתוח ה-SHAP כולל רק את 10 המאפיינים המפורטים לעיל. משתנה העונה עבר קידוד one-hot (4 קטגוריות: אביב, קיץ, סתיו, חורף), ועבור ניתוח ה-SHAP, התרומות של משתני העונה שקודדו ב-one-hot סוכמו על פני כל העונות כדי להפיק ערך תרומה יחיד עבור העונה. ערך משולב זה מייצג את התרומה הכוללת של כל המשתנים הקשורים לעונה לחיזוי הנחיתה (attenuation). לפני יצירת דמות הסיכום, זוהו ארבעת עמודי העונה שקודדו ב-one-hot, וערכי ה-SHAP שלהם סוכמו עבור כל דגימה. שיטה זו מבטיחה שהשימוש של המודל בעונה כמשתנה קטגוריאלי מורכב עקבי עם ניתוח ה-SHAP.
הגורמים הסביבתיים העיקריים שהשפיעו באופן ישיר על הניחות האופטי באמצעות מנגנונים פיזיקליים היו מאפיינים 1–6. להוספת מאפיינים 7 ו-8 (מהירות רוח ולחץ) כגורמים מטאורולוגיים משלימים עשויה להיות השפעה עקיפה על הניחות על ידי השפעה על יציבות האוויר ופיזור אירוסולים. כדי להתחשב בשינויים עונתיים בתנאי האטמוספירה, מאפיינים 9–10 (חודש ועונה) נכללו כמתארי זמן. ערך הניחות (dB/km) שימש כמשתנה המטרה עבור כל המודלים. נתוני מפתח סטטיסטיים של מערך הנתונים כללו טמפרטורה (28.55°C ± 11.18°C), לחות (42.01% ± 25.56%), ראות (13.10 ± 10.91 km; טווח: 0.05–29.99 km), ריכוז אבק (0.74 ± 1.30 mg/m3; מקסימום: 4.96 mg/m3), ניחות (4.80 ± 7.20 dB/km; טווח: 0.09–50.93 dB/km), טווח פעולה (5.74 ± 1.97 km), ויחס אות לרעש (64.88 ± 15.07 dB). טווח הפעולה וה-SNR חושבו מערכי הניחות באמצעות משוואות תקציב קישור FSO סטנדרטיות.
חישוב טווח העבודה
טווח הפעולה (ב-km) חושב באמצעות משוואת תקציב הקישור (link budget):
Prx=Ptx×Gt×Gr×(λ/(4πR))2×10(−A×R/10) (6)
שם: Pמרשם = הספק התקבל (הוגדר לרגישות מינימלית של −30 dBm); Pתרגום = הספק שידור (קבוע על 20 dBm); Gת = הבחנה של המשדר (מחושבת ממימדי המפתח); Gנא לספק את הטקסט המקור באנגלית לתרגום. = הגבר מקלט (מחושב על סמך גדלי המפתח); λ = אורך גל (1550 ננומטר); R = טווח בק"מ; A = בלימה אטמוספרית ב-dB/km (חושבה על סמך המודלים הפיזיקליים).
הגברים של המשדר והמקלט: הגבר המשדר (Gt) חושב באופן הבא: Gt = 10×log₁₀[0.7×(π×0.025/1.55×10⁻6)2] ≈ 44.2 dBi. הגבר המקלט (Gr) חושב באופן הבא: Gr = 10×log₁₀[0.7×(π×0.20/1.55×10⁻6)2] ≈ 62.3 dBi. מפתח השידור היה בקוטר 2.5 cm, עם נצילות של 0.7. מפתח הקליטה היה בקוטר 20 cm, עם נצילות של 0.7. המשוואה נפתרה באופן איטרטיבי עבור R כדי לקבוע את מרחק הקישור המקסימלי שניתן להשיג עבור כל ערך ניחות.
חישוב יחס אות לרעש
ה-SNR (יחס אות לרעש) ב-dB חושב באמצעות המשוואה:
SNR=Prx−10×log₁₀(kTB)−NF (7)
כאשר: Prx = ההספק שהתקבל ב-dBm (חושב מתוך תקציב הקישור); k = 1.38×10⁻23 J/K (קבוע בולצמן); T = 290 K (טמפרטורת המקלט); B = 109 Hz (רוחב פס של המקלט, 1 GHz); NF = 3 dB (מספר הרעש של המקלט). רצפת הרעש חושבה כך:
10 × log10(kTB) ≈ −84 dBm (8)
עבור כל דגימה, לאחר חישוב הניחות A באמצעות המודל הפיזי המתאים, נגזר טווח הפעולה (Operating Range) על ידי פתרון תקציב הקישור עבור R, וה-SNR חושב מההספק שהתקבל Prx באותו טווח.
ערכי טווח פעולה תלויי מזג אוויר: טווח הפעולה השתנה בהתאם לתנאי מזג האוויר: שמיים בהירים (7.12 ± 1.85 km), ערפל (5.81 ± 1.92 km), שלג (5.42 ± 1.56 km), גשם (3.81 ± 0.98 km), ואבק (3.72 ± 1.08 km). שולי ביטחון של 3 dB לא יושמו בחישובים הנוכחיים; טווח הפעולה מייצג את הטווח המקסימלי התאורטי ללא שולי ביטחון של המערכת. טווח הפעולה המדווח (5.74 ± 1.97 km) הוא הממוצע הכללי על פני כל תנאי מזג האוויר39.
מרחק שידור קבוע: מרחק השידור במודלים של ניחות פיזיקלי נקבע ל-3 km. זהו מרחק התקשורת שעבורו בוצעו חישובי הניחות. טווח הפעולה המדווח הוא המרחק המקסימלי התאורטי שחושב באמצעות משוואת תקציב התקשורת (link budget equation), אשר עשוי להיות שונה ממרחק השידור הקבוע של 3 km. ערכי ניחות ספציפיים למזג האוויר נרשמו עבור תנאי שקיפות (0.27±0.06 dB/km), ערפל (1.88±1.92 dB/km), שלג (6.45±2.54 dB/km), גשם (13.58±6.32 dB/km), ואבק (13.10±7.32 dB/km). כל הערכים הכמותיים המדווחים בכתב יד זה מוצגים כממוצע ± סטיית תקן (SD), אלא אם צוין אחרת40.
ערך ה-R2 של תיקוף צולב (Cross-validation) עבור Random Forest דווח כ-0.960±0.007. במקרים מסוימים, כגון טמפרטורה (−4.89 עד 47.99°C), ראות (0.05 עד 29.99km), ריכוז אבק (0 עד 4.96 mg/m3) ונחיתה (0.09 עד 50.93dB/km), הטווח (מהנמוך לגבוה) מצוין במילים. מערך הנתונים פולח לתתי-קבוצות עבור בדיקה (300 דגימות; 20%) ואימון (1,200 דגימות; 80%). כדי לבצע את פיצול האימון-בדיקה, נעשה שימוש בדגימה אקראית מרובדת (Stratified random sampling). כדי להבטיח שהאחוז של כל תנאי מזג אוויר במערכת האימון (80%) ובמערכת הבדיקה (20%) תואם את התפלגות מערך הנתונים המקורי, נעשה שימוש בריבוד על בסיס קטגוריית תנאי מזג האוויר (שמיים בהירים, ערפל, גשם, אבק ושלג). באופן ספציפי, 1,200 (80%) מתוך 1,500 הדגימות הוקצו למערכת הלמידה ו-300 (20%) למערכת הבדיקה. דגימות נבחרו באופן אקראי עבור כל קטגוריה של תנאים מטאורולוגיים תוך שמירה על הפרופורציות המקוריות: מתוך 814 דגימות של שמיים בהירים (54.27%), 651 הוקצו לאימון ו-163 לבדיקה; מתוך 375 דגימות אבק (25.00%), 300 לאימון ו-75 לבדיקה; מתוך 157 דגימות ערפל (10.47%), 126 לאימון ו-31 לבדיקה; מתוך 111 דגימות גשם (7.40%), 89 לאימון ו-22 לבדיקה; מתוך 43 דגימות שלג (2.87%), 34 לאימון ו-9 לבדיקה. דגימה אקראית בתוך כל רבדה בוצעה באמצעות גרעין אקראי (random seed) של 42 כדי להבטיח שחזוריות. גישה מרובדת זו נבחרה כדי למנוע ייצוג לא מאוזן של תנאי מזג אוויר נדירים (במיוחד שלג ב-2.87%) במערכת הבדיקה, מה שעלול היה להוביל להערכת ביצועים לא אמינה עבור תנאים אלו.
הערכת מודל למידת מכונה
שש שיטות למידת מכונה נבחנו, כולל רגרסיית וקטורים תומכים (SVR) עם גרעין פונקציית בסיס רדיאלית (C = 100), K-שכנים קרובים (KNN; k = 10, שקלול מרחקים), RF (200 עצים, עומק מקסימלי = 20), Extreme Gradient Boosting (XGBoost; 200 אומדנים, עומק מקסימלי = 10, קצב למידה = 0.1), Light Gradient Boosting Machine (LightGBM; 200 אומדנים, עומק מקסימלי = 10, קצב למידה = 0.1), ורגרסיה ליניארית כבסיס להשוואה. עבור כל מודלי הלמידה של מכונות ולמידה עמוקה, בוצע כוונון היפר-פרמטרים עבור הפרמטרים הקריטיים ביותר, בעוד שערכי ברירת המחדל נשמרו עבור פרמטרים שלא צוינו. עבור מודלי למידת מכונה, הפרמטרים הבאים כווננו במפורש באמצעות חיפוש רשת (grid search) עם תיקוף צולב של 5 קיפולים (5-fold cross-validation) על קבוצת האימון: 1) יער אקראי (Random Forest): מספר עצים (נבדקו: 50, 100, 150, 200, 250) ועומק מקסימלי (נבדקו: 10, 15, 20, 25, ללא הגבלה), כאשר נבחרו ערכים אופטימליים של 200 עצים ועומק 20. 2) XGBoost: מספר אומדנים (נבדקו: 100, 150, 200, 250), עומק מקסימלי (נבדקו: 6, 8, 10, 12), וקצב למידה (נבדקו: 0.05, 0.1, 0.2), כאשר נבחרו ערכים אופטימליים של 200 אומדנים, עומק 10, וקצב למידה 0.1. 3) LightGBM: נעשה שימוש בטווחי כוונון זהים, מה שהוביל ל-200 אומדנים, עומק 10, וקצב למידה 0.1. 4) SVR: פרמטר הרגולריזציה C (נבדקו: 1, 10, 50, 100) ומקדם הגרעין gamma (נבדקו: ‘scale’, ‘auto’, 0.1, 0.01) כווננו, כאשר נבחרו C = 100 אופטימלי וגרעין RBF. 5) KNN: מספר השכנים k (נבדקו: 3, 5, 7, 10, 15) כוונן, כאשר נבחר k = 10 אופטימלי והופעלה הצבעה משוקללת מרחקים.
כל שאר הפרמטרים עבור מודלים אלה הושארו בערכי ברירת המחדל שלהם כפי שהוגדרו ב-scikit-learn (ראה טבלת חומרים עבור הגרסה; לדוגמה, Random Forest: bootstrap=True, min_samples_split=2, min_samples_leaf=1; XGBoost: subsample=1.0, colsample_bytree=1.0, gamma=0). עבור מודלים של למידה עמוקה, הארכיטקטורה (מספר השכבות ומספר היחידות בכל שכבה) ושיעור הנשירה (dropout rate; 20%) כווננו ידנית באמצעות ניסויים חזרתיים על קבוצת האימות, בעוד שהאופטימייזר (Adam), קצב הלמידה הראשוני (0.001), סבילות העצירה המוקדמת (early stopping patience; 20 תקופות/epochs), ופרמטרי הפחתת קצב הלמידה (מקדם 0.5, סבילות 10) נקבעו על פי פרקטיקות סטנדרטיות בספרות ונשמרו קבועים בכל ניסויי הלמידה העמוקה.
מקורות נתונים אקלימיים
מידע מטאורולוגי היסטורי שנאסף מתחנות מזג אוויר עיראקיות במספר מקומות (בגדאד, בצרה, מוסול ורמדי) בין השנים 2020 ל-2024 שימש לחישוב הפרופורציות של מצבי מזג האוויר והתפלגויות המשתנים. הנתונים הגולמיים סופקו על ידי משרד התחבורה העיראקי והארגון המטאורולוגי והסייסמולוגי של עיראק (IMOS). רשומות מזג אוויר יומיות המפרטות את המצב האטמוספרי השולט בכל יום נכללו בנתונים. משתנים ספציפיים שהושגו מרשומות אלו כללו טמפרטורה (מינימום, מקסימום וממוצע יומי), לחות יחסית, ראות, כמות משקעים והתרחשויות של סופות אבק. נתוני ה-IMOS זמינים חלקית דרך פורטל הנתונים הפתוחים של ממשלת עיראק (https://www.motrans.gov.iq/), אם כי הרשומות הספציפיות ששימשו במחקר זה אינן מאורכבות באופן ציבורי במאגר מרכזי. סיכום של נתוני האקלים ששימשו לקביעת הפרופורציות של תנאי מזג האוויר וטווח הפרמטרים מוצג ב-טבלה 1.
נעשה שימוש באימות צולב חמיש-מגלה (Fivefold cross-validation) על קבוצת האימון (1,200 דגימות) כדי לכייל היפר-פרמטרים ולהעריך ביצועים עבור כל מודלי הלמידה המכונה. כל משתני הקלט (טמפרטורה, לחות, נראות, ריכוז אבק, קצב משקעים של גשם, קצב משקעים של שלג, מהירות רוח, לחץ) עברו נרמול מאפיינים באמצעות סטנדרטיזציה (נרמול Z-score): x_scaled = (x − μ)/σ, כאשר μ ו-σ הם הממוצע וסטיית התקן של קבוצת האימון. ביצענו סטנדרטיזציה בתוך כל קיפול של האימות הצולב תוך שימוש בסטטיסטיקות מקיפול האימון בלבד כדי למנוע זליגת נתונים. מודלים מבוססי עץ (Random Forest, XGBoost, LightGBM) הם חסינים לשינויי קנה מידה (scale-invariant), אך אותה סטנדרטיזציה הוחלה לצורך עקביות בין כל מודלי הלמידה המכונה. נרמול Min-max שימש עבור מודלי למידה עמוקה: x_scaled = (x−x_min)/(x_max−x_min), אשר מנרמל מאפיינים לטווח [0, 1] בהתבסס על ערכי המינימום והמקסימום מקבוצת האימון. קלטים חסומים מובילים להתכנסות מהירה יותר של רשתות נוירונים, וזו הסיבה שנבחרו. קבוצת הבדיקה נורמלה באמצעות הפרמטרים שהתקבלו מקבוצת האימון, ולא שימשה לבחירת מודל או לכיוונון היפר-פרמטרים.
מדדי ביצועים מלאים נרשמו, כולל מקדם דטרמינציה של הבדיקה (R2), שגיאת השורש הממוצעת של הריבועים (RMSE), השגיאה המוחלטת הממוצעת (MAE), R2 של תיקוף צולב (cross-validation) וזמן אימון. זמני האימון עבור כל מודלי הלמידה המכונה והלמידה העמוקה דווחו בשניות (s) עבור המודלים המהירים יותר (Linear Regression, KNN, SVR, Random Forest, XGBoost, LightGBM) ובדקות (min) עבור המודלים האיטיים יותר (ארכיטקטורות למידה עמוקה). כל המודלים אומנו בסביבה חישובית זהה כדי להבטיח השוואה הוגנת41.
זמן האימון נמדד באמצעות מודול time של Python, כלומר, זמן השעון שחלף מתחילת פונקציית התאמת המודל ועד לסיומה, ללא הזמן הנדרש לטעינת נתונים ולעיבוד מקדמי. זמן האימון עבור מודל למידה עמוקה הוא הזמן שלקח להשלים את כל האיפוכים (epochs) עד לעצירה מוקדמת. זה כולל הפצה קדימה (forward propagation), הפצה לאחור (backward propagation) ובדיקות תיקוף. כל הניסויים בוצעו כאשר במערכת לא רצו תהליכים אינטנסיביים אחרים מבחינה חישובית, וזאת כדי להשיג מדידות זמן עקביות. הזמנים הם ממוצע של 5 הרצות עצמאיות (סטיות תקן)42.
הערכת מודל למידה עמוקה
שש ארכיטקטורות של למידה עמוקה הוערכו באמצעות האצה של GPU, כולל פרספטרון רב-שכבתי (MLP; 64-32-16), רשת עצבית עמוקה (DNN) עם נורמליזציית אצוות (batch normalization) (128-64-32-16), רשת זיכרון לטווח קצר ארוך (LSTM; 64-32 יחידות, אורך רצף = 10), רשת עצבית קונבולוציונית חד-ממדית (1D-CNN), מודל היברידי של CNN–LSTM, ורשת מבוססת קשב (attention-based network). כל מודלי הלמידה העמוקה הוטמעו באמצעות TensorFlow עם ה-API של Keras והורצו עם האצת GPU (ראה טבלת חומרים עבור גרסאות חומרה/תוכנה). ארכיטקטורת ה-1D-CNN כללה שלוש שכבות קונבולוציה (64, 128 ו-256 מסננים, גודל גרעין 3, אקטיבציית ReLU, padding='same'), שתי שכבות MaxPooling1D (גודל בריכה 2), שכבת GlobalAveragePooling1D, שכבת Dense עם 128 יחידות ואקטיבציית ReLU, שכבת Dropout (0.2), ושכבת Dense פלט (יחידה אחת, אקטיבציה ליניארית), ובסך הכל כ-245,000 פרמטרים הניתנים לאימון. הארכיטקטורה ההיברידית של CNN-LSTM קיבלה רצפי קלט של 10 שלבי זמן עם 5 מאפיינים, תוך שימוש בשתי שכבות Conv1D (64 ו-128 מסננים, גודל גרעין 3, ReLU, padding='same'), שכבת MaxPooling1D (גודל בריכה 2), שתי שכבות LSTM (64 ו-32 יחידות, return_sequences=False), שכבות Dropout (0.2), שכבת Dense (32 יחידות, ReLU), ושכבת Dense פלט (יחידה אחת, אקטיבציה ליניארית), ובסך הכל כ-198,000 פרמטרים הניתנים לאימון. הרשת מבוססת הקשב השתמשה במנגנון קשב רב-ראשי (multi-head attention) עם 4 ראשים (מימדי מפתח וערך של 64), שבו הקלט הוקרן ל-64 מימדים, ולאחריו קשב של מכפלה סקלרית רשומית (נוסחה: Attention(Q, K, V) = softmax(QKT/√d_k)V), חיבורים שאריתיים (residual connections), נורמליזציית שכבות, רשת הזנה קדימה (128→64 יחידות), איסוף ממוצע גלובלי (global average pooling), Dropout (0.2), שכבת Dense (32 יחידות, ReLU), ושכבת Dense פלט (יחידה אחת, אקטיבציה ליניארית), ובסך הכל כ-167,000 פרמטרים הניתנים לאימון43.
כל המודלים השתמשו בעצירה מוקדמת (patience = 20), הפחתת קצב למידה (factor = 0.5, patience = 10), dropout (20%), ואופטימייזר Adam (learning rate = 0.001). עבור כל מודלי הלמידה העמוקה, גודל האצווה (batch size) נקבע ל-32 דגימות, מספר תקופות האימון (epochs) המקסימלי היה 200 עם עצירה מוקדמת (patience = 20, שחזור המשקולות הטובות ביותר), ופונקציית ההפסד הייתה טעות ריבועית ממוצעת (MSE). הפיצול בין אימון לוולידציה היה כדלקמן: מתוך 1,200 דגימות האימון המקוריות (לאחר פיצול אימון-בדיקה של 80/20), 80% (960 דגימות) שימשו לאימון ו-20% (240 דגימות) לוולידציה. ביצענו שכיבה (stratification) של פיצול האימון-וולידציה לפי תנאי מזג האוויר כדי לשמר את ההתפלגות. קבוצת הוולידציה שימשה אך ורק לעצירה מוקדמת, דעיכת קצב הלמידה וניטור התאמת-יתר (overfitting); היא לא שימשה לבחירת מודל או לכיוונון היפר-פרמטרים מעבר להליכים אוטומטיים אלו. לא שמרנו קבוצת וולידציה נפרדת עבור מודלי הלמידה המכונה; במקום זאת, השתמשנו בוולידציה צולבת של חמישה קיפולים (five-fold cross-validation) על 1,200 דגימות האימון כדי לכוונן היפר-פרמטרים ולהעריך ביצועים44.
הצדקה להערכת ארכיטקטורת LSTM ו-CNN–LSTM
מערך הנתונים המרכזי מורכב מדגימות מזג אוויר שנוצרו באופן בלתי תלוי, אך בחנו גם ארכיטקטורות LSTM ו-CNN–LSTM מהסיבות הבאות: (1) תנאים אטמוספריים בעולם האמיתי הם בעלי מתאם עצמי זמני (temporally autocorrelated), ובחינת מודלים מבוססי רצפים מאפשרת לנו לקבוע האם לכידה של תלויות כאלה עשויה לשפר את דיוק התחזית; (2) מחקרים עדכניים בתחום התחזיות האטמוספריות הדגימו את הערך הפוטנציאלי של ארכיטקטורות רצפיות למידול האבולוציה הזמנית של פרמטרים מטאורולוגיים34; (3) בחינה של מגוון רחב של ארכיטקטורות מבטיחה השוואה מקיפה של גישות מתודולוגיות, המהווה תרומה מרכזית של מחקר זה; ו-(4) ארכיטקטורת ההיבריד CNN–LSTM משלבת חילוץ מאפיינים מרחביים עם מידול זמני, דבר שעשוי להועיל ללכידת האינטראקציות המורכבות בין משתנים אטמוספריים מרובים45.
עיצוב נתונים עבור קלט של מודל סדרתי
עבור הארכיטקטורות הסקוונציאליות (LSTM ו-CNN–LSTM), נתוני הקלט אורגנו מחדש מדגימות עצמאיות לרצפים פסאודו-סקוונציאליים באמצעות גישת חלון נחלק (sliding-window). באופן ספציפי, 1,200 דגימות האימון קובצו תחילה לקטגוריות של תנאי מזג אוויר כדי לשמר עקביות פיזיקלית. בתוך כל קטגוריית מזג אוויר, הדגימות סודרו לפי חותמות הזמן שנוצרו עבורן (תצפיות שעתיות סימולטיביות לשנת לוח 2024). לאחר מכן, הוחל חלון נחלק באורך 10 כדי להפיק רצפי קלט של 10 שלבי זמן רצופים (כל אחד עם 5 מאפיינים: טמפרטורה, לחות, ראות, ריכוז אבק וקצב משקעים) לצורך חיזוי הנחלישה בשלב הזמן ה-11th. שיטה זו שומרת על הסדר הכרונולוגי של התצפיות הסימולטיביות, תוך שהיא מאפשרת למודלים סקוונציאליים ללמוד תלויות זמניות. מבנה מערכת הבדיקה היה זהה, למעט שימוש באותו גודל חלון ומערכת מאפיינים. אנו מכירים בכך שמבנה פסאודו-סקוונציאלי זה הוא פישוט מתודולוגי ואינו משקף דינמיקה זמנית מהעולם האמיתי. ציינו זאת כמגבלה בפרק הדיון.
הערכת גישות היברידיות
נבחנו שלוש גישות היברידיות. הגישה הראשונה הייתה Voting Ensemble שביצע ממוצע של תחזיות ממודלי Random Forest, XGBoost ו-Deep Neural Network תוך שימוש במשקל שווה (לכל מודל הוקצה משקל של 1/3), כאשר התחזית הסופית חושבה באופן הבא:
ŷensemble=(1/3)ŷRF+(1/3)ŷXGB+(1/3)ŷDNN (9)
נבחר שקלול שווה כדי להימנע מהחדרת היפר-פרמטרים נוספים וכדי להעריך את ביצועי הבסיס של האנסמבל ללא הטיה כלפי מודל בודד. הגישה השנייה השתמשה בערמה (stacking) של מטא-לומד מסוג Ridge. הלומדים הבסיסיים היו Random Forest, XGBoost, ורשת עצבית עמוקה (המבוססת על Attention). תהליך הערמה כלל שני שלבים: ראשית, כל לומד בסיסי אומן על סט האימון המלא של 1,200 דגימות באמצעות 5-fold cross-validation כדי לייצר תחזיות מחוץ-לקיפול (out-of-fold), ובכך נוצרה מטריצת מטא-מאפיינים חדשה בגודל 1,200×3 (תחזית אחת לכל מודל בסיס עבור כל דגימה). שנית, מטא-לומד של רגרסיית Ridge (פרמטר רגולריזציית L2 alpha=1.0) אומן על מטא-מאפיינים אלו, תוך שימוש בערכי הניחות המקוריים כמטרה, כדי ללמוד את משקולות השילוב האופטימליות עבור הלומדים הבסיסיים. תחזית הערמה הסופית הייתה:
ŷstacking=wRF×ŷRF+wXGB×ŷXGB+wDNN×ŷDNN (10)
כאשר המשקלות w נלמדו על ידי ה-Ridge meta-learner. הגישה השלישית הייתה רשת נוירונים מודרכת פיזיקה (Physics-Informed Neural Network) ששילבה 70% מהתחזיות של הרשת הנוירונית עם 30% ממודל Kim עבור דגימות בתנאי ערפל. השילוב בוצע באמצעות ממוצע משוקלל קבוע לפי הנוסחה הבאה:
ŷhybrid=0.7×ŷneural+0.3×ŷKim (11)
כאשר ŷneural הוא הפלט של הרשת העצבית מבוססת ה-Attention, ו-ŷKim הוא הניחות שחושב ממודל הערפל של Kim על בסיס קלט של נראות. עבור דגימות ללא ערפל, החלק הפיזיקלי נקבע כ-0, והמודל הופעל כרשת עצבית טהורה. המשקולות (70% רשת עצבית ו-30% פיזיקה) נקבעו על בסיס ניסויים מקדימים בסט הוולידציה (לא בסט הבדיקה), שבהם בחנו שילובי משקלות של 90:10, 80:20, 70:30, 60:40 ו-50:50. חלוקה של 70/30 נבחרה כיוון שהיא סיפקה את ה-R2 הטוב ביותר בוולידציה ועדיין שמרה על אילוץ פיזיקלי מספיק ממודל Kim כדי לבצע רגולריזציה לתחזיות ולמנוע פלטים שאינם סבירים פיזיקלית, במיוחד במצבי ערפל שבהם מודל Kim מספק גבולות ניחות תיאורטיים מבוססים.
ניתוח חשיבות תכונות ופרשנות
מודל Random Forest עם חשיבות מאפיינים מבוססת אי-ניקיון (הפחתת שונות) שימש להפקת דירוגי חשיבות עבור כל 10 מאפייני הקלט. הניתוח הראה כי ריכוז האבק (67.3%) והראות (21.2%) היו החזאים החשובים ביותר, המסבירים יחד 88.5% מסך החשיבות החיזויית. המאפיין החשוב השלישי היה קצב הגשם (6.0%), ואחריו מהירות הרוח (2.1%), טמפרטורה (1.5%), לחות (0.9%), חודש (0.5%), עונה (0.3%), קצב הצטברות שלג (0.1%) ולחץ אטמוספרי (0.1%). ציוני החשיבות הנמוכים עבור המאפיינים הזמניים (חודש ועונה) מעידים כי השונות העונתית בניחות אטמוספרי נלכדת בעיקר על ידי פרמטרים סביבתיים בסיסיים ולא על ידי דפוסים מבוססי זמן בלבד.
ניתוח SHAP (Shapley Additive exPlanations) בוצע כדי להעריך את הקשרים בין גורמים סביבתיים לבין הנחתה. מימוש ה-SHAP שנעשה בו שימוש היה מודול ה-TreeExplainer מספריית SHAP, המותאם במיוחד למודלים מבוססי עצים, כולל Random Forest, XGBoost ו-LightGBM (ראו טבלת חומרים עבור גרסה). הגדרות ניתוח ה-SHAP היו כדלקמן: מודל ה-Random Forest המאומן הועבר ל-TreeExplainer, שחישב ערכי SHAP באמצעות גישת ייחוס מאפיינים התערבותית (שולית) המבוססת על התוחלת המותנית של פלט המודל. ערכי SHAP חושבו עבור כל 300 דגימות קבוצת הבדיקה, מה שיצר מטריצה בגודל 300 × 10 (ערך SHAP אחד לכל מאפיין לכל דגימה). עבור כל מאפיין, ערך ה-SHAP ייצג את תרומתו לתחזית ביחס לבסיס (ממוצע התחזיות של המודל). ערכי SHAP שליליים הצביעו על סטייה כלפי מטה, בעוד שערכי SHAP חיוביים הראו כי המאפיין העלה את תחזית ההנחתה. עוצמת התרומה הובאה לידי ביטוי בגודל ערך ה-SHAP. התפלגות ערכי ה-SHAP עבור כל מאפיין (באמצעות beeswarm plots), כיוון ההשפעה (המתאם בין ערכי המאפיין לערכי ה-SHAP) ודירוגי חשיבות המאפיינים הוצגו ויזואלית באמצעות תרשימי סיכום (summary plots). פונקציות השרטוט המובנות של ספריית SHAP — הפונקציה shap.summary_plot() עבור ה-beeswarm plot והפונקציה shap.bar_plot() עבור חשיבות מאפיינים גלובלית — שימשו ליצירת כל ויזואליזציות ה-SHAP.
טיפול במשתנים בקידוד One-Hot: ארבעה עמודות בינאריות (אביב, קיץ, סתיו וחורף) שימשו תחילה לקידוד של משתנה העונה. כדי ליצור ערך תרומה יחיד של "עונה" עבור כל דגימה לצורך ניתוח SHAP, שולבו התרומות של ארבעת המשתנים המקודדים ב-one-hot על ידי חיבור ערכי ה-SHAP עבור כל קטגוריית עונה. כדי לבצע קיבוץ זה, אותרו כל העמודות שהתאימו לקבוצות העונה בקידוד one-hot, חולצו ערכי ה-SHAP שלהן עבור כל דגימה, ולאחר מכן הם סוכמו ברמה האיברית. ערכי ה-SHAP המשולבים שמתקבלים מייצגים את התרומה הכוללת של העונה לחיזוי הניחות. שיטה זו מאפשרת הצגת שורה אחת של "עונה" בתרשים סיכום ה-SHAP ומבטיחה עקביות עם השימוש של המודל בעונה כמשתנה קטגורי מורכב. מכיוון שהמספר המשולב מספק תיאור מובן יותר של התרומה הכוללת של העונה, ערכי ה-SHAP של העונה לא הוצגו בנפרד עבור כל קטגוריית עונה.