لم تتضمن هذه الدراسة مشاركين بشريين أو حيوانات فقارية، أو أخذ عينات من الأنسجة. تم توليد جميع البيانات المستخدمة في هذا البحث اصطناعياً باستخدام نماذج الانتشار الفيزيائي والمعايير الميتيورولوجية المتاحة علنياً. وبناءً على ذلك، لم تكن هناك حاجة للحصول على موافقة أخلاقية من مجلس مراجعة مؤسسي (IRB) أو لجنة مؤسسية لرعاية واستخدام الحيوانات (IACUC).
توليد مجموعة البيانات بناءً على نظرية الانتشار الفيزيائي. تم بناء مجموعة البيانات لمحاكاة الظروف الجوية الساعية لنظام اتصالات بصرية في الفضاء الحر على مدار عام تقويمي كامل (2024) للظروف الجوية العراقية. وقد أنشأنا قاعدة بيانات اصطناعية تحتوي على 1,500 عينة لكل ساعة.
أولاً، تم تعيين الظروف الجوية عشوائياً بناءً على الاتجاهات الإقليمية: سماء صافية (54.3%)، غبار (24.9%)، ضباب (10.5%)، مطر (7.4%)، وثلج (2.8%). ثانياً، طُبِّق نموذج التوهين الفيزيائي المقابل على كل عينة بناءً على الحالة الجوية، أي قانون Beer-Lambert للسماء الصافية، ونموذج Kim للضباب، ونظرية Carbonneau للمطر، ونظرية تشتت Mie للعواصف الغبارية. ثالثاً، تم ضبط معاملات نظام FSO كما يلي: قدرة إرسال 20 dBm، وطول موجي 1550 nm، ومسافة إرسال 3 km، وفتحة إرسال 2.5 cm، وفتحة استقبال 20 cm. رابعاً، تم حساب التوهين بوحدة dB/km لكل عينة. وأخيراً، قُسمت مجموعة البيانات الكاملة عشوائياً إلى 1,200 عينة تدريب (80%) و300 عينة اختبار (20%). تشمل الظروف المحاكاة تركيزات غبار عالية مرتبطة بالعواصف الرملية، والعواصف المطرية، وتغيرات في درجة الحرارة من −4.89°C إلى 47.99°C. وقد تم اختيار الظروف الجوية وتوزيعات المعاملات بناءً على السجلات المناخية العراقية للفترة 2020–2024. تم اختيار الأنظمة الجوية الخمسة (سماء صافية، ضباب، مطر، عواصف غبارية، وثلج) لأنها تغطي كامل نطاق الظروف الجوية التي تؤثر على توهين FSO في العراق، مع انتشار العواصف الغبارية بشكل خاص في الشرق الأوسط. واستُخدمت البيانات التاريخية للأرصاد الجوية التي جُمعت من مختلف المناطق العراقية لإنشاء توزيع احتمالي لكل حالة جوية. وكانت النتيجة كما يلي: 54.3% سماء صافية (الحالة السائدة)، 24.9% غبار (تمثل مشكلة العواصف الرملية في العراق)، 10.5% ضباب (متكرر في شتاء شمال العراق)، 7.4% مطر (كميات هطول منخفضة نموذجية للعراق)، و2.8% ثلج (يحدث أحياناً في المناطق الجبلية الشمالية). كما تمت نمذجة المعاملات الميتيورولوجية ذات الصلة باستخدام توزيعات احتمالية لكل حالة جوية على النحو التالي: نُمذِجت درجة الحرارة باستخدام توزيع طبيعي (متوسط 28.55±11.18°C) بين −4.89°C و 47.99°C بناءً على التطرفات الموسمية العراقية؛ ونُمذِجت الرطوبة باستخدام توزيع منتظم (متوسط 42.01±25.56%) من 0% إلى 100%؛ ونُمذِجت الرؤية باستخدام توزيع لوغاريتمي طبيعي بين 0.05 km و 29.99 km (متوسط 13.10±10.91 km) لمراعاة أحداث انخفاض الرؤية المتكررة أثناء العواصف الغبارية؛ ونُمذِج تركيز الغبار باستخدام توزيع أسي بين 0 و 4.96 mg/m3 (متوسط 0.74±1.30 mg/m3) مع احتمالات أعلى للتركيزات المنخفضة والذيول الطويلة لأحداث الغبار الشديدة.
صُمم نظام الاتصالات بقدرة إرسال تبلغ 20 dBm، وطول موجي قدره 1550 nm، ومسافة إرسال تصل إلى 3 km، وفتحة إرسال بقطر 2.5 cm، وفتحة استقبال بقطر 20 cm لتعويض فقدان التباعد. تم تقسيم معايير نظام الاتصالات الضوئية في الفضاء الحر (FSO) إلى مجموعتين: معايير ثابتة لم تتغير لجميع العينات، ومعايير متغيرة تم تعديلها أثناء إنشاء مجموعة البيانات. بالنسبة لجميع العينات البالغ عددها 1,500 عينة، تم تثبيت المعايير التالية: قدرة الإرسال (20 dBm)، وطول الموجة التشغيلي (1550 nm)، وفتحة الإرسال (القطر 2.5 cm، والكفاءة 0.7)، وفتحة الاستقبال (القطر 20 cm، والكفاءة 0.7). وقد ثبتت هذه المعايير لأنها تمثل المواصفات الفيزيائية للأجهزة الصلبة لنظام FSO ولا تتغير بتغير الظروف الجوية. أُنشئت مجموعة البيانات من 1,500 عينة مع تغيير المعايير التالية: درجة الحرارة (−4.89°C إلى 47.99°C)، والرطوبة (0% إلى 100%)، والرؤية (0.05 km إلى 29.99 km)، وتركيز الغبار (0 إلى 4.96 mg/m3)، والحالة الجوية (سماء صافية، ضباب، مطر، غبار، ثلج). تم تعديل هذه المعايير وفقاً لتوزيعات احتمالية مستمدة من سجلات المناخ العراقية للأعوام 2020–2024. ولكل عينة، تم حساب قيمة التوهين (dB/km) باستخدام نموذج التوهين الفيزيائي المقابل، وفقاً للمزيج المحدد من الظروف الجوية والمعايير المتغيرة.
تمت نمذجة التوهين الفيزيائي باستخدام نموذج Carbonneau للمطر، وقانون Beer–Lambert للسماء الصافية، ونظرية تشتت Mie للغبار، ونموذج Kim للضباب24. ينطبق قانون Beer-Lambert في ظروف السماء الصافية حيث يهيمن التشتت الجزيئي والامتصاص على التوهين، واللذان يتناقصان أسيًا مع المسافة25. يعود معامل الخمود α عند 1550 nm إلى تشتت Rayleigh بواسطة جزيئات الهواء والامتصاص بواسطة الغازات الجوية26. يُعد نموذج Kim نموذجًا خاصًا بالضباب يربط التوهين بالرؤية من خلال معاملات تجريبية مشتقة من توزيعات أحجام قطرات الضباب. ويأخذ الأس q المعتمد على الطول الموجي في الاعتبار تشتت Mie27. المعلمة الرئيسية لنموذج Carbonneau هي معدل هطول الأمطار R، حيث يعتمد توهين المطر على حجم وكثافة قطرات المطر، وقد تم اشتقاق المعاملات تجريبيًا عند 1550 nm ومعايرتها خصيصًا للأطوال الموجية البصرية28. وتعتبر نظرية تشتت Mie قابلة للتطبيق في ظروف الغبار، بما أن حجم جسيمات الغبار (نصف قطر 0.1–100 μm) يكون قابلاً للمقارنة مع الطول الموجي (1550 nm)، كما أن معامل الانكسار المركب m = 1.55–0.005i لغبار الشرق الأوسط يشمل كلًا من التشتت والامتصاص29. وقد تم تنفيذ نماذج التوهين الفيزيائي التالية بمعادلاتها وإعدادات معلماتها الخاصة.
بالنسبة لظروف السماء الصافية، استُخدم قانون بير-لامبرت:
Aclear = 10×log₁₀(e(α×d)) (1)
حيث تمثل α معامل الخمود (الذي تم تنويعه باستخدام توزيع طبيعي مركزه 0.02 dB/km مع تفاوت قدره ±0.005 dB/km عند 1550 nm في الظروف الصافية)، وتمثل d مسافة الإرسال (المثبتة عند 3 km). أما بالنسبة لظروف الضباب، فقد تم تطبيق نموذج Kim باستخدام المعادلة التالية:
Afog = 10×ln(10)/V×(λ/550)−q (2)
حيث تمثل V الرؤية بالكيلومتر (تراوحت من 0.05km إلى 10km)، وλ الطول الموجي بالنانومتر (ثابت عند 1550nm)، وq معامل توزيع حجم الجسيمات الذي يتم حسابه كالتالي: q=1.6 عندما تكون V>50 km، وq=1.3 عندما تكون 6<V<50 km، وq=0.585×V(1/3) عندما تكون 1 <V<6km، وq=0 عندما تكون 0.5<V<1km، وq=0.5 عندما تكون V<0.5km. وبالنسبة لظروف المطر، تم استخدام نموذج Carbonneau:
Arain=0.023×R0.93 (3)
حيث تمثل R معدلات هطول الأمطار بـ mm/h (والتي تراوحت بين 0.25 و 50mm/h وفقاً لسجلات الأمطار العراقية). وقد استُخدمت علاقة كفاءة الخمود لظروف العواصف الغبارية باستخدام تشتت Mie:
Adust=10×log₁₀(e(τ×L)) (4)
حيث τ=∫₀^∞ πr2Qext(r,λ,m)N(r)dr، و r هو نصف قطر الجسيم (0.1–100μm وفقاً لتكوين الغبار العراقي)، و Qext هي كفاءة الخمود المحسوبة باستخدام نظرية Mie، و λ=1550nm، و m=1.55–0.005i هو معامل الانكسار المركب للغبار في الشرق الأوسط، و N(r) هو توزيع حجم الجسيمات الذي تم نمذجته باستخدام توزيع لوغاريتمي طبيعي بمتوسط هندسي لنصف القطر يبلغ 2.5 μm وانحراف معياري قدره 2.0. وقد تم تطبيق نموذج التوهين لظروف الثلوج على النحو التالي:
Asnow = 0.1×S0.75 (5)
حيث يمثل S معدل تساقط الثلوج بوحدة mm/h (من 0.5 إلى 15 mm/h). وقد تم اختيار هذه المعادلة التجريبية بناءً على الدراسات المنشورة في الأدبيات العلمية30، حيث تم تطوير نماذج التوهين للانتشار البصري عبر الثلوج باستخدام نظرية تشتت Mie المطبقة على توزيعات أحجام رقاقات الثلج. هذه المعادلة صالحة لمعدلات تساقط الثلوج التي تتراوح بين 0.5 و15 mm/h، وتفترض ظروف الثلوج الجافة مع أقطار نموذجية لرقاقات الثلج تتراوح بين 1 و10 mm. وقد تم الحصول على المعامل 0.1 والأس 0.75 من خلال مطابقة المنحنى لحسابات تشتت Mie30 للثلوج عند طول موجي 1550 nm. ولا تأخذ هذه المعادلة في الاعتبار الثلوج الرطبة أو الهطول المشترك، والتي قد تمتلك خصائص توهين متغيرة، رغم أنها تقدم تقديراً مقبولاً للثلوج الجافة. وبسبب فعالية هذا النهج حاسوبياً، وكثيراً ما يتم الاستشهاد به في منشورات FSO، وملاءمته لظروف الثلوج المتوقعة في شمال العراق (إقليم كردستان في شهري يناير وفبراير)، فقد تم اختياره لهذا البحث. تم تنفيذ جميع النماذج باستخدام لغة Python 3.9، مع الاعتماد على مكتبة Numpy للحسابات العددية. واستُخدم النموذج المطابق مع حالة الطقس المختارة عشوائياً وبيانات المحيط التي تم أخذ عينات منها لحساب قيمة التوهين لكل عينة. وقد شمل توزيع الطقس الذي تم الحصول عليه 814 حالة سماء صافية (54.27%)، و375 حالة غبار (25.00%)، و157 حالة ضباب (10.47%)، و111 حالة مطر (7.40%)، و43 حالة ثلوج (2.87%).
استُخدم فحص المعلومات الأرصادية التاريخية التي جُمعت من محطات الأرصاد الجوية العراقية في عدة مناطق (بغداد، والبصرة، والموصل، والرمادي) بين عامي 2020 و2024 لتحديد نسب حالات الطقس. وقد وفرت وزارة النقل العراقية والهيئة العامة للأنواء الجوية والرصد الزلزالي العراقية (IMOS) البيانات الأصلية. تضمنت البيانات سجلات الطقس اليومية التي رصدت الظروف الجوية الحالية لكل يوم. ومن بين الخصائص المحددة المستخرجة من هذه السجلات: درجة الحرارة (الحد الأدنى والحد الأقصى والمتوسط اليومي)، والرطوبة النسبية، والمدى البصري، وكمية الأمطار، وحالات العواصف الغبارية. وتوفر بوابة البيانات المفتوحة للحكومة العراقية (https://www.motrans.gov.iq/) إمكانية الوصول إلى جزء من بيانات IMOS؛ ومع ذلك، فإن السجلات المحددة المستخدمة في هذه الدراسة ليست مخزنة علناً في مستودع مركزي. وتلخص الجدول 1 المعلومات المناخية المستخدمة لحساب النسب المئوية لظروف الطقس وقيم المعلمات. عُرّفت أيام السماء الصافية بأنها الأيام التي لا يوجد فيها هطول، ويكون المدى البصري فيها أكبر من 10 km، مع عدم وجود نشاط غباري، وشكلت 54.27% من إجمالي 1,825 يوماً مسجلاً. أما أيام العواصف الغبارية (بما في ذلك العواصف الغبارية الكاملة (مدى بصري < 1 km) والغبار العالق (مدى بصري 1–5 km)) فقد شكلت 25.00% من الأيام، مما يشير إلى التكرار العالي لحالات العواصف الرملية في المناخ القاحل وشبه القاحل في العراق. وصُنفت الأيام التي يكون فيها المدى البصري أقل من 1 km بسبب تعليق قطرات الماء (باستثناء انخفاض الرؤية الناتج عن الغبار) على أنها أيام ضباب. بلغت نسبة أيام الضباب 10.47%، وكانت هذه الأيام تتركز بشكل أساسي في فصل الشتاء في المناطق الشمالية من العراق. وكانت أيام المطر، وهي الأيام التي شهدت هطولاً قابلاً للقياس >0.1 mm، بنسبة 7.40%، وهو ما يتوافق مع المتوسط المنخفض لهطول الأمطار السنوي في العراق الذي يتراوح بين 150 و200 mm سنوياً. وشكلت أيام الثلوج (الأيام التي شهدت تراكم هطول متجمد) نسبة 2.87% من الأيام وكانت مقتصرة على المناطق الشمالية الجبلية (إقليم كردستان) في شهري يناير وفبراير. استُخدمت هذه النسب لاحقاً كأوزان احتمالية لأخذ عينات عشوائية في عملية توليد مجموعة البيانات. وبذلك، تعكس مجموعة البيانات الاصطناعية التكرار الواقعي لكل حالة طقس في البيئة العراقية.
اعتبارات الانحياز في توليد البيانات الاصطناعية
لتقليل الانحياز المحتمل، تم اتخاذ عدة خطوات:
(1) اختيار التوزيع: استُخدمت الخصائص الإحصائية لبيانات المناخ المصدر لاختيار توزيعات الاحتمالية. كانت درجة الحرارة موزعة توزيعاً طبيعياً بمتوسط وانحراف معياري وفقاً لما سجله IMOS. أما الرطوبة فقد كانت موزعة توزيعاً منتظماً على كامل النطاق المرصود (0-100%). واُفترض أن الرؤية تتبع توزيعاً لوغاريتمياً طبيعياً لتفسير التكرار العالي لحالات انخفاض الرؤية أثناء العواصف الغبارية. وتبع تركيز الغبار توزيعاً أسياً حيث كانت هناك احتمالات أعلى عند التركيزات المنخفضة وذيول طويلة عند أحداث الغبار الشديدة31، وهو ما يتوافق مع التكرار المرصود لأحداث الغبار في العراق32.
(2) نسب الظروف الجوية: أسفر تحليل سجلات IMOS للفترة 2020–2024، والتي شملت 1,825 ملاحظة يومية في جميع المناطق الأربع، عن النسب التالية: 54.3% سماء صافية، 24.9% غبار، 10.5% ضباب، 7.4% مطر و 2.8% ثلوج. عُرِّفت أيام السماء الصافية بأنها الأيام التي لا تسود فيها هطولات مطرية، وتكون فيها الرؤية >10 km مع عدم وجود نشاط غباري. وشملت أيام العواصف الغبارية كلاً من العواصف الغبارية الكاملة (الرؤية <1 km) والغبار العالق (الرؤية 1–5 km). وعُرِّف يوم الضباب بأنه اليوم الذي تكون فيه الرؤية أقل من 1 km ويكون السبب هو تعلق قطيرات الماء (وليس الغبار). أما أيام المطر فقد عُرِّفت بأنها الأيام التي شهدت هطولات مطرية قابلة للقياس >0.1 mm، وعُرِّفت أيام الثلوج بأنها الأيام التي شهدت تراكم هطولات متجمدة33.
(3) نطاقات المعاملات: استندت نطاقات المعاملات إلى القيم القصوى المرصودة في سجلات IMOS: حيث تراوحت درجة الحرارة من −4.89 °C (الموصل، شتاءً) إلى 47.99 °C (البصرة، صيفاً)، وتراوحت الرؤية من 0.05 km (العواصف الغبارية الشديدة) إلى 29.99 km (الأجواء الصحوة)، وتراوح تركيز الغبار من 0 إلى 4.96 mg/m3 (بناءً على أقصى تركيز غبار مرصود خلال أحداث الهبوب الشديدة)34.
(4) افتراضات الاستقلالية: افترضنا أن المعلمات البيئية قد تم أخذ عينات منها بشكل مستقل، وهو ما يعد تبسيطاً للظروف الواقعية حيث تكون المتغيرات الجوية مترابطة (على سبيل المثال، غالباً ما يرتبط تركيز الغبار العالي بانخفاض الرؤية). ومن أجل توفير بيئة محاكاة محكومة للمقارنة المنهجية بين النماذج، تم اعتماد افتراض الاستقلالية هذا 35. وقد تمت تغطية تداعيات هذه الافتراضات في قسم المناقشة.
(5) التقسيم الطبقي: تم إجراء تقسيم بيانات التدريب والاختبار بشكل طبقي بناءً على فئة الحالة الجوية (سماء صافية، ضباب، مطر، غبار، ثلج) لضمان أن تكون نسبة كل حالة جوية في مجموعتي التدريب والاختبار مطابقة لتوزيع مجموعة البيانات الأصلية. وبهذه الطريقة، لا تكون مجموعة الاختبار غير متوازنة فيما يتعلق بالحالات الجوية النادرة (خاصة الثلوج بنسبة 2.87%)36.
الإقرار بتوليد الهدف الحتمي
من المهم الإشارة إلى أن أداء التنبؤ الجيد الملحوظ هنا قد يعود جزئياً إلى تعلم النموذج أو تقريبه للمعادلات الفيزيائية الحتمية المستخدمة لتوليد قيم الهدف الاصطناعية37. وبخلاف القياسات التجريبية في العالم الحقيقي، التي تحتوي على ضوضاء القياس وأخطاء الأجهزة وظواهر فيزيائية غير منمذجة، توفر مجموعة البيانات الاصطناعية علاقة نظيفة وخالية من الضوضاء بين الميزات المدخلة وهدف التوهين. ويرجع ذلك إلى أن قيم التوهين تم حسابها مباشرة من نماذج الانتشار الفيزيائية (قانون Beer-Lambert، ونموذج Kim، ونموذج Carbonneau، ونظرية تشتت Mie) بناءً على المعلمات المدخلة. لذلك، فإن مقاييس الأداء الكمية (R2، وRMSE، وMAE) تمثل الأداء على بيانات اصطناعية مشتقة من معادلات، ولا ينبغي تفسيرها على أنها الأداء المتوقع للبيانات الرصدية أو التجريبية المشوبة بالضوضاء. ويجب النظر إلى النتائج في المقام الأول كتقييم مقارن لمنهجيات النمذجة في بيئة محاكاة مضبوطة38.
مجموعة الميزات الكاملة لتدريب النموذج
احتوت مجموعة بيانات التدريب على 10 ميزات إدخال لتدريب النموذج:
1. درجة الحرارة (°C)
2. الرطوبة (%)
3. الرؤية (km)
4. تركيز الغبار (mg/m3)
5. معدل هطول الأمطار (mm/h)
6. معدل تساقط الثلوج (mm/h)
7. سرعة الرياح (m/s)
8. الضغط الجوي (hPa)
9. الشهر (رقمي، 1–12)
10. الموسم (ترميز أحادي السخونة: الربيع، الصيف، الخريف، الشتاء)
توضيح هام: استُخدمت الظروف الجوية (سماء صافية، ضباب، مطر، غبار، ثلج) كمتغير فئوي للتقسيم الطبقي أثناء تقسيم مجموعة البيانات، ولم تُدرج كميزات إدخال لأي نموذج. يتضمن تحليل SHAP فقط الميزات العشر المذكورة أعلاه. تم ترميز متغير الموسم بنظام الترميز الأحادي الساخن (4 فئات: الربيع، الصيف، الخريف، الشتاء)، وبالنسبة لتحليل SHAP، جُمعت مساهمات متغيرات الموسم المرمزة أحاديًا عبر الفصول لإنتاج قيمة مساهمة موسمية واحدة. تمثل هذه القيمة المجمعة المساهمة الإجمالية لجميع المتغيرات المتعلقة بالموسم في التنبؤ بالتوهين. وقبل إنشاء الشكل الملخص، تم تحديد الأعمدة الأربعة للموسم المرمزة أحاديًا، وجمعت قيم SHAP الخاصة بها لكل عينة. تضمن هذه الطريقة أن استخدام النموذج للموسم كمتغير فئوي مركب يتوافق مع تحليل SHAP.
كانت العوامل البيئية الرئيسية التي أثرت بشكل مباشر على التوهين البصري عبر الآليات الفيزيائية هي السمات 1-6. وقد يكون لإضافة السمتين 7 و8 (سرعة الرياح والضغط) كعوامل أرصاد جوية تكميلية تأثير غير مباشر على التوهين من خلال التأثير على استقرار الهواء وتشتت الهباء الجوي. ومن أجل مراعاة التباينات الموسمية في الظروف الجوية، تم تضمين السمتين 9-10 (الشهر والفصل) كواصفات زمنية. واستُخدمت قيمة التوهين (dB/km) كمتغير مستهدف لجميع النماذج. وشملت الإحصائيات الرئيسية لمجموعة البيانات درجة الحرارة (28.55°C ± 11.18°C)، والرطوبة (42.01% ± 25.56%)، والرؤية (13.10 ± 10.91 km؛ المدى: 0.05–29.99 km)، وتركيز الغبار (0.74 ± 1.30 mg/m3؛ الحد الأقصى: 4.96 mg/m3)، والتوهين (4.80 ± 7.20 dB/km؛ المدى: 0.09–50.93 dB/km)، ونطاق التشغيل (5.74 ± 1.97 km)، ونسبة الإشارة إلى الضوضاء (64.88 ± 15.07 dB). وقد تم حساب نطاق التشغيل ونسبة الإشارة إلى الضوضاء (SNR) من قيم التوهين باستخدام معادلات ميزانية وصلة FSO القياسية.
حساب نطاق التشغيل
تم حساب نطاق التشغيل (بالكيلومتر km) باستخدام معادلة ميزانية الوصلة:
Prx=Ptx×Gt×Gr×(λ/(4πR))2×10(−A×R/10) (6)
حيث: Pوصفة طبية = القدرة المستقبلة (مُعدَّلة على أدنى حساسية تبلغ 30− ديسيبل مللي واط)؛ Pيرجى تزويد النص المراد ترجمته. = قدرة الإرسال (ثابتة عند 20 ديسيبل مللي واط (dBm)؛ Gيرجى تقديم النص المصدر المراد ترجمته. = كسب المرسل (يُحسب من أحجام الفتحة)؛ Gيرجى تزويدي بالنص المراد ترجمته. = كسب المستقبل (المحسوب من أحجام الفتحة)؛ λ = طول موجي (1550 نانومتر)؛ R = المدى بالكيلومتر؛ A = التوهين الجوي بوحدة ديسيبل/كم (محسوب بناءً على النماذج الفيزيائية).
كسب جهاز الإرسال والاستقبال: تم حساب كسب جهاز الإرسال (Gt) وفقاً للمعادلة التالية: Gt = 10×log₁₀[0.7×(π×0.025/1.55×10⁻6)2] ≈ 44.2 dBi. وتم حساب كسب جهاز الاستقبال (Gr) وفقاً للمعادلة التالية: Gr = 10×log₁₀[0.7×(π×0.20/1.55×10⁻6)2] ≈ 62.3 dBi. وبلغ قطر فتحة الإرسال 2.5 cm، بكفاءة قدرها 0.7. بينما بلغ قطر فتحة الاستقبال 20 cm، بكفاءة قدرها 0.7. تم حل المعادلة تكرارياً بالنسبة لـ R لتحديد أقصى مسافة وصل ممكن تحقيقها لكل قيمة من قيم التوهين.
حساب نسبة الإشارة إلى الضوضاء
تم حساب نسبة الإشارة إلى الضوضاء (SNR) بوحدة dB باستخدام المعادلة التالية:
نسبة الإشارة إلى الضوضاء (SNR)=Prx−10×log₁₀(kTB)−NF (7)
حيث: Pوصفة طبية = القدرة المستقبلة بوحدة dBm (محسوبة من ميزانية الوصلة)؛ k = 1.38×10⁻23 ج/ك (ثابت بولتزمان)؛ T = 290 K (درجة حرارة المستقبل)؛ B = 109 هرتز (عرض نطاق المستقبل، 1 جيجاهرتز)؛ NF = 3 ديسيبل (رقم ضوضاء المستقبل). وقد حُسبت أرضية الضوضاء على النحو التالي:
10 × log10(kTB) ≈ −84 dBm (8)
لكل عينة، وبعد حساب التوهين A باستخدام النموذج الفيزيائي المناسب، تم اشتقاق نطاق التشغيل (Operating Range) عن طريق حل ميزانية الوصلة (link budget) لإيجاد R، ثم تم حساب نسبة الإشارة إلى الضوضاء SNR من قدرة الاستقبال Prx الناتجة عند ذلك النطاق.
قيم نطاق التشغيل المحددة حسب حالة الطقس: تباين نطاق التشغيل وفقاً للظروف الجوية: السماء الصافية (7.12 ± 1.85 km)، والضباب (5.81 ± 1.92 km)، والثلج (5.42 ± 1.56 km)، والمطر (3.81 ± 0.98 km)، والغبار (3.72 ± 1.08 km). لم يتم تطبيق هامش قدره 3 dB في الحسابات الحالية؛ حيث يمثل نطاق التشغيل المدى الأقصى النظري دون هامش للنظام. ويمثل نطاق التشغيل المذكور (5.74 ± 1.97 km) المتوسط العام لجميع الظروف الجوية39.
مسافة الإرسال الثابتة: تم تعيين مسافة الإرسال في نماذج التوهين الفيزيائية لتكون 3 km. وهذه هي مسافة الوصلة التي أُجريت بناءً عليها حسابات التوهين. أما نطاق التشغيل المذكور فهو المسافة القصوى النظرية التي تم حسابها باستخدام معادلة ميزانية الوصلة، والتي قد تختلف عن مسافة الإرسال الثابتة البالغة 3 km. وقد سُجلت قيم التوهين الخاصة بكل حالة طقس للظروف الصافية (0.27±0.06 dB/km)، والضباب (1.88±1.92 dB/km)، والثلج (6.45±2.54 dB/km)، والمطر (13.58±6.32 dB/km)، والغبار (13.10±7.32 dB/km). جميع القيم الكمية الواردة في هذه المخطوطة معروضة كمتوسط ± الانحراف المعياري (SD) ما لم يُنص على خلاف ذلك40.
تم تسجيل قيمة R2 للتحقق المتقاطع لنموذج الغابة العشوائية (Random Forest) عند 0.960±0.007. وفي حالات معينة، مثل درجة الحرارة (−4.89 إلى 47.99°C)، والمدى الرؤي (0.05 إلى 29.99km)، وتركيز الغبار (0 إلى 4.96 mg/m3)، والتوهين (0.09 إلى 50.93dB/km)، تم ذكر النطاق (من الأدنى إلى الأعلى) نصياً. قُسمت مجموعة البيانات إلى مجموعات فرعية للاختبار (300 عينة؛ 20%) والتدريب (1,200 عينة؛ 80%). واستُخدم أخذ العينات العشوائية الطبقية لتنفيذ عملية تقسيم التدريب والاختبار. ولضمان تطابق نسبة كل حالة جوية في مجموعة التدريب (80%) ومجموعة الاختبار (20%) مع توزيع مجموعة البيانات الأصلية، استُخدمت الطبقية بناءً على فئة الحالة الجوية (السماء الصافية، والضباب، والمطر، والغبار، والثلج). وبشكل محدد، تم تخصيص 1,200 (80%) من أصل 1,500 عينة لمجموعة التعلم و 300 (20%) لمجموعة الاختبار. واختيرت العينات عشوائياً لكل فئة من الظروف الأرصادية مع الحفاظ على النسب الأصلية: فمن أصل 814 عينة للسماء الصافية (54.27%)، تم تخصيص 651 للتدريب و 163 للاختبار؛ ومن أصل 375 عينة للغبار (25.00%)، تم تخصيص 300 للتدريب و 75 للاختبار؛ ومن أصل 157 عينة للضباب (10.47%)، تم تخصيص 126 للتدريب و 31 للاختبار؛ ومن أصل 111 عينة للمطر (7.40%)، تم تخصيص 89 للتدريب و 22 للاختبار؛ ومن أصل 43 عينة للثلج (2.87%)، تم تخصيص 34 للتدريب و 9 للاختبار. وأُجري أخذ العينات العشوائية داخل كل طبقة باستخدام بذرة عشوائية (random seed) بقيمة 42 لضمان إمكانية تكرار النتائج. وقد اختير هذا النهج الطبقي لمنع التمثيل غير المتوازن للحالات الجوية النادرة (خاصة الثلج بنسبة 2.87%) في مجموعة الاختبار، وهو ما قد يؤدي بخلاف ذلك إلى تقييم غير موثوق للأداء في تلك الظروف.
تقييم نموذج تعلم الآلة
تم تقييم ست طرق للتعلم الآلي، بما في ذلك انحدار ناقل الدعم (SVR) مع نواة دالة القاعدة الشعاعية (C = 100)، والجيران الأقرب (KNN؛ k = 10، موزونة بالمسافة)، والغابات العشوائية (RF؛ 200 شجرة، الحد الأقصى للعمق = 20)، وتعزيز التدرج المتطرف (XGBoost؛ 200 مقدّر، الحد الأقصى للعمق = 10، معدل التعلم = 0.1)، وآلة تعزيز التدرج الخفيفة (LightGBM؛ 200 مقدّر، الحد الأقصى للعمق = 10، معدل التعلم = 0.1)، والانحدار الخطي المرجعي. وبالنسبة لجميع نماذج التعلم الآلي والتعلم العميق، تم إجراء ضبط للمعلمات الفائقة للمعلمات الأكثر أهمية، بينما تم الاحتفاظ بالقيم الافتراضية للمعلمات غير المحددة. وفيما يخص نماذج التعلم الآلي، تم ضبط المعلمات التالية صراحةً باستخدام البحث الشبكي مع التحقق المتقاطع خماسي الطيات على مجموعة التدريب: 1) الغابات العشوائية: عدد الأشجار (تم اختبار: 50، 100، 150، 200، 250) والحد الأقصى للعمق (تم اختبار: 10، 15، 20، 25، بلا حد)، مع اختيار القيم المثلى وهي 200 شجرة وعمق 20. 2) XGBoost: عدد المقدرات (تم اختبار: 100، 150، 200، 250)، والحد الأقصى للعمق (تم اختبار: 6، 8، 10، 12)، ومعدل التعلم (تم اختبار: 0.05، 0.1، 0.2)، مع قيم مثلى بلغت 200 مقدّر، وعمق 10، ومعدل تعلم 0.1. 3) LightGBM: تم استخدام نطاقات ضبط مماثلة، مما أدى إلى 200 مقدّر، وعمق 10، ومعدل تعلم 0.1. 4) SVR: تم ضبط معامل التنظيم C (تم اختبار: 1، 10، 50، 100) ومعامل النواة gamma (تم اختبار: ‘scale’، ‘auto’، 0.1، 0.01)، مع قيمة مثلى C = 100 ونواة RBF. 5) KNN: تم ضبط عدد الجيران k (تم اختبار: 3، 5، 7، 10، 15)، مع قيمة مثلى k = 10 مع تفعيل التصويت الموزون بالمسافة.
تُرِكت جميع المعلمات الأخرى لهذه النماذج عند قيمها الافتراضية كما هي محددة في scikit-learn (انظر جدول المواد بالنسبة للإصدار؛ على سبيل المثال، Random Forest: bootstrap=True, min_samples_split=2, min_samples_leaf=1؛ وXGBoost: subsample=1.0, colsample_bytree=1.0, gamma=0). أما بالنسبة لنماذج التعلم العميق، فقد تم ضبط البنية (عدد الطبقات والوحدات في كل طبقة) ومعدل الإسقاط (dropout rate) بنسبة (20%) يدويًا من خلال التجريب التكراري على مجموعة التحقق، بينما تم تحديد المُحسِّن (Adam)، ومعدل التعلم الأولي (0.001)، وصبر التوقف المبكر (20 حقبة/epoch)، ومعاملات خفض معدل التعلم (المعامل 0.5، والصبر 10) بناءً على الممارسات القياسية في الأدبيات العلمية وبقيت ثابتة في جميع تجارب التعلم العميق.
مصادر بيانات المناخ
استُخدمت المعلومات الأرصادية التاريخية التي جُمعت من محطات الرصد الجوي العراقية في عدة مواقع (بغداد، والبصرة، والموصل، والرمادي) بين عامي 2020 و2024 لحساب نسب حالات الطقس وتوزيعات المتغيرات. وقد وفرت وزارة النقل العراقية والهيئة العامة للأنواء الجوية والرصد الزلزالي (IMOS) البيانات الخام. تضمنت البيانات سجلات طقس يومية تفصل الحالة الجوية السائدة لكل يوم. وشملت المتغيرات المحددة المستخرجة من هذه السجلات درجة الحرارة (الدنيا، والعظمى، والمتوسط اليومي)، والرطوبة النسبية، ومدى الرؤية، وكمية الأمطار، وحالات حدوث العواصف الغبارية. تتوفر بيانات IMOS جزئياً من خلال بوابة البيانات المفتوحة للحكومة العراقية (https://www.motrans.gov.iq/)، رغم أن السجلات المحددة المستخدمة في هذه الدراسة ليست مؤرشفة علناً في مستودع مركزي. ويوجد ملخص لبيانات المناخ المستخدمة لتحديد نسب الظروف الجوية ونطاقات المعاملات في الجدول 1.
استُخدم التحقق المتقاطع خماسي الطيات (Fivefold cross-validation) على مجموعة التدريب (1,200 عينة) لضبط المعلمات التشعبية وتقدير الأداء لجميع نماذج تعلم الآلة. خضعت جميع متغيرات الإدخال (درجة الحرارة، الرطوبة، الرؤية، تركيز الغبار، معدل هطول الأمطار، معدل تساقط الثلوج، سرعة الرياح، الضغط) لتغيير مقياس السمات عن طريق التقييس (Standardization) (تطبيع درجة Z): x_scaled = (x − μ)/σ، حيث تمثل μ و σ المتوسط والانحراف المعياري لمجموعة التدريب. وقد أجرينا التقييس داخل كل طية من طيات التحقق المتقاطع باستخدام الإحصائيات المستمدة من طية التدريب فقط لتجنب تسرب البيانات. وتعد النماذج القائمة على الأشجار (Random Forest، XGBoost، LightGBM) غير متأثرة بمقياس البيانات (scale-invariant)، ولكن تم تطبيق التقييس نفسه لضمان الاتساق عبر جميع نماذج تعلم الآلة. أما بالنسبة لنماذج التعلم العميق، فقد استُخدم تطبيع الحد الأدنى والأقصى (Min-max normalization): x_scaled = (x−x_min)/(x_max−x_min)، والذي يقوم بضبط مقياس السمات لتصبح في النطاق [0, 1] بناءً على قيم الحد الأدنى والأقصى من مجموعة التدريب. وقد تم اختيار هذا الأسلوب لأن المدخلات المقيدة تؤدي إلى تقارب أسرع للشبكات العصبية. كما تم تغيير مقياس مجموعة الاختبار باستخدام المعلمات التي تم الحصول عليها من مجموعة التدريب، ولم تُستخدم هذه المجموعة في اختيار النموذج أو ضبط المعلمات التشعبية.
تم تسجيل مقاييس الأداء الكاملة، بما في ذلك معامل تحديد الاختبار (R2)، وجذر متوسط مربع الخطأ (RMSE)، ومتوسط الخطأ المطلق (MAE)، وR2 للتحقق المتقاطع، ووقت التدريب. وقد تم تسجيل أوقات التدريب لجميع نماذج تعلم الآلة والتعلم العميق بالثواني (s) للنماذج الأسرع (Linear Regression، وKNN، وSVR، وRandom Forest، وXGBoost، وLightGBM) وبالدقائق (min) للنماذج الأبطأ (بنى التعلم العميق). تم تدريب جميع النماذج في نفس البيئة الحسابية لضمان المقارنة العادلة41.
تم قياس وقت التدريب باستخدام وحدة time في لغة Python، أي الوقت الفعلي المنقضي من بداية دالة ملاءمة النموذج حتى نهايتها، باستثناء الوقت المطلوب لتحميل البيانات ومعالجتها مسبقاً. ويُعرف وقت التدريب لنموذج التعلم العميق بأنه الوقت المستغرق لإكمال جميع العصور (epochs) حتى حدوث التوقف المبكر، وهذا يشمل الانتشار الأمامي، والانتشار العكسي، وعمليات التحقق من الصحة. وقد أُجريت جميع التجارب بينما كان النظام يعمل دون أي عمليات أخرى كثيفة الحوسبة للحصول على قياسات زمنية متسقة. وتمثل الأوقات المذكورة متوسط 5 تشغيلات مستقلة (الانحرافات المعيارية)42.
تقييم نموذج التعلم العميق
تم تقييم ست بنيات للتعلم العميق باستخدام تسريع وحدة معالجة الرسوميات (GPU)، بما في ذلك البيرسيبترون متعدد الطبقات (MLP; 64-32-16)، وشبكة عصبية عميقة (DNN) مع تطبيع الدفعات (128-64-32-16)، وشبكة الذاكرة طويلة قصيرة المدى (LSTM; 64-32 وحدة، طول التسلسل = 10)، وشبكة عصبية تلافيفية أحادية الأبعاد (1D-CNN)، ونموذج هجين من CNN-LSTM، وشبكة قائمة على آلية الانتباه. تم تنفيذ جميع نماذج التعلم العميق باستخدام TensorFlow مع واجهة برمجة تطبيقات Keras وتم تشغيلها بتسريع GPU (راجع جدول المواد لمعرفة إصدارات الأجهزة والبرامج). تألفت بنية 1D-CNN من ثلاث طبقات تلافيفية (64 و128 و256 مرشحاً، وحجم النواة 3، وتنشيط ReLU، والحشوة 'same')، وطبقتين MaxPooling1D (حجم التجميع 2)، وطبقة GlobalAveragePooling1D، وطبقة Dense بـ 128 وحدة وتنشيط ReLU، وطبقة Dropout (0.2)، وطبقة Dense مخرجات (وحدة واحدة، تنشيط خطي)، بإجمالي حوالي 245,000 معلمة قابلة للتدريب. أما البنية الهجينة CNN-LSTM فقد قبلت تسلسلات مدخلات مكونة من 10 خطوات زمنية بـ 5 سمات، باستخدام طبقتين Conv1D (64 و128 مرشحاً، وحجم النواة 3، وReLU، والحشوة 'same')، وطبقة MaxPooling1D (حجم التجميع 2)، وطبقتين LSTM (64 و32 وحدة، return_sequences=False)، وطبقات Dropout (0.2)، وطبقة Dense (32 وحدة، ReLU)، وطبقة Dense مخرجات (وحدة واحدة، تنشيط خطي)، بإجمالي حوالي 198,000 معلمة قابلة للتدريب. واستخدمت الشبكة القائمة على الانتباه آلية انتباه متعددة الرؤوس بـ 4 رؤوس (أبعاد المفتاح والقيمة 64)، حيث تم إسقاط المدخلات إلى 64 بُعداً، متبوعة بانتباه حاصل الضرب النقطي المقاس (المعادلة: Attention(Q, K, V) = softmax(QKT/√d_k))، ووصلات متبقية، وتطبيع الطبقات، وشبكة تغذية أمامية (128→64 وحدة)، وتجميع متوسط عام، وDropout (0.2)، وطبقة Dense (32 وحدة، ReLU)، وطبقة Dense مخرجات (وحدة واحدة، تنشيط خطي)، بإجمالي حوالي 167,000 معلمة قابلة للتدريب43.
استخدمت جميع النماذج التوقف المبكر (patience = 20)، وخفض معدل التعلم (factor = 0.5، patience = 10)، والإسقاط (dropout) بنسبة (20%)، ومحسن Adam (learning rate = 0.001). وبالنسبة لجميع نماذج التعلم العميق، تم تعيين حجم الدفعة (batch size) على 32 عينة، وكان الحد الأقصى لعدد دورات التدريب (epochs) 200 مع تفعيل التوقف المبكر (patience = 20، مع استعادة أفضل الأوزان)، وكانت دالة الخسارة هي متوسط مربع الخطأ (MSE). وكان تقسيم بيانات التدريب والتحقق كما يلي: من أصل 1,200 عينة تدريب أصلية (بعد تقسيم بيانات التدريب والاختبار بنسبة 80/20)، تم استخدام 80% (960 عينة) للتدريب و 20% (240 عينة) للتحقق. وقد أجرينا تقسيم التدريب والتحقق بطريقة طبقية وفقاً للحالة الجوية للحفاظ على التوزيع. واستُخدمت مجموعة التحقق فقط للتوقف المبكر، وتناقص معدل التعلم، ومراقبة الإفراط في التخصيص (overfitting)؛ ولم تُستخدم أبداً لاختيار النموذج أو ضبط المعلمات الفائقة (hyperparameters) خارج هذه الإجراءات المؤتمتة. ولم نخصص مجموعة تحقق منفصلة لنماذج التعلم الآلي؛ وبدلاً من ذلك، استخدمنا التحقق المتقاطع خماسي الطيات (five-fold cross-validation) على 1,200 عينة تدريب لضبط المعلمات الفائقة وتقدير الأداء44.
تبرير تقييم بنية LSTM وبنية CNN–LSTM
تتكون مجموعة البيانات الرئيسية من عينات طقس تم توليدها بشكل مستقل، ولكننا قمنا أيضاً باختبار بنيات LSTM و CNN–LSTM للأسباب التالية: (1) الظروف الجوية في العالم الحقيقي مرتبطة ذاتياً زمنياً، واختبار النماذج القائمة على التسلسل يتيح لنا تحديد ما إذا كان التقاط هذه التبعيات يمكن أن يحسن دقة التنبؤ؛ (2) أظهرت الأبحاث الحديثة في التنبؤ الجوي القيمة المحتملة للبنيات التسلسلية في نمذجة التطور الزمني للمؤشرات الميتيورولوجية34؛ (3) يضمن اختبار مجموعة متنوعة من البنيات إجراء مقارنة شاملة للمناهج المنهجية، وهو ما يمثل مساهمة رئيسية لهذه الدراسة؛ و(4) تجمع البنية الهجينة CNN–LSTM بين استخراج الميزات المكانية والنمذجة الزمنية، وهو ما قد يكون مفيداً في التقاط التفاعلات المعقدة بين المتغيرات الجوية المتعددة45.
تنسيق البيانات لإدخال النموذج التسلسلي
بالنسبة للبنيات التسلسلية (LSTM وCNN–LSTM)، تمت إعادة هيكلة بيانات الإدخال من عينات مستقلة إلى تسلسلات وهمية باستخدام منهجية النافذة المنزلقة. وبشكل أدق، جُمعت عينات التدريب البالغ عددها 1,200 عينة أولاً في فئات حسب الظروف الجوية للحفاظ على الاتساق الفيزيائي. وضمن كل فئة جوية، رُتبت العينات وفقاً للطوابع الزمنية المُنشأة لها (ملاحظات ساعية محاكاة للسنة التقويمية 2024). بعد ذلك، طُبقت نافذة منزلقة بطول 10 لإنتاج تسلسلات إدخال مكونة من 10 خطوات زمنية متتالية (تتضمن كل خطوة 5 سمات: درجة الحرارة، والرطوبة، ومدى الرؤية، وتركيز الغبار، ومعدل هطول الأمطار) للتنبؤ بالوهن عند الخطوة 11.th خطوة زمنية. تحافظ هذه الطريقة على الترتيب الزمني للملاحظات التي تمت محاكاتها، بينما تسمح للنماذج التسلسلية بتعلم الاعتمادات الزمنية. كانت بنية مجموعة الاختبار هي نفسها، باستثناء استخدام نفس حجم النافذة ومجموعة الميزات. ونحن نقر بأن هذه البنية التسلسلية الزائفة هي تبسيط منهجي ولا تعكس الديناميكيات الزمنية في العالم الحقيقي، وقد أشرنا إلى ذلك كأحد القصور في قسم المناقشة.
تقييم النهج الهجينة
تم فحص ثلاثة نهج هجينة. كان النهج الأول عبارة عن "مجموعة تصويت" (Voting Ensemble) قامت بحساب متوسط التنبؤات من نماذج Random Forest وXGBoost وDeep Neural Network باستخدام أوزان متساوية (حيث تم تخصيص وزن 1/3 لكل نموذج)، مع حساب التنبؤ النهائي وفقاً لما يلي:
ŷensemble=(1/3)ŷRF+(1/3)ŷXGB+(1/3)ŷDNN (9)
تم اختيار التوزين المتساوي لتجنب إدخال معاملات فائقة إضافية ولتقييم أداء التجميع المرجعي دون انحياز لأي نموذج فردي. أما النهج الثاني فقد استخدم تكديس المتعلم الفائق من نوع Ridge. وكانت المتعلمات الأساسية هي Random Forest وXGBoost وشبكة عصبية عميقة (قائمة على Attention). تضمنت عملية التكديس مرحلتين: أولاً، تم تدريب كل متعلم أساسي على مجموعة التدريب الكاملة المكونة من 1,200 عينة باستخدام التحقق المتقاطع خماسي الطيات (5-fold cross-validation) لتوليد تنبؤات خارج الطي، مما أدى إلى إنشاء مصفوفة ميزات فائقة جديدة بحجم 1,200×3 (تنبؤ واحد لكل نموذج أساسي لكل عينة). ثانياً، تم تدريب متعلم فائق من نوع Ridge regression (معامل تنظيم L2 alpha=1.0) على هذه الميزات الفائقة، باستخدام قيم التوهين الأصلية كهدف، لتعلم أوزان الدمج المثلى للمتعلمات الأساسية. وكان التنبؤ النهائي للتكديس هو:
ŷstacking=wRF×ŷRF+wXGB×ŷXGB+wDNN×ŷDNN (10)
حيث تم تعلّم الأوزان w بواسطة متعلم Ridge الفائق. وكان النهج الثالث عبارة عن شبكة عصبية مستنيرة بالفيزياء (Physics-Informed Neural Network) دمجت 70% من تنبؤات الشبكة العصبية مع 30% من نموذج Kim لعينات ظروف الضباب. وقد تم الدمج عن طريق المتوسط المرجح الثابت باستخدام الصيغة التالية:
ŷhybrid=0.7×ŷneural+0.3×ŷKim (11)
حيث تمثل ŷneural مخرجات الشبكة العصبية القائمة على آلية الانتباه (Attention-based neural network)، وتمثل ŷKim التوهين المحسوب من نموذج Kim للضباب بناءً على مدخلات الرؤية. وبالنسبة للعينات غير الضبابية، تم ضبط الجزء الفيزيائي على 0، وتم تشغيل النموذج كشبكة عصبية بحتة. تم تثبيت الأوزان (70% للشبكة العصبية و30% للفيزياء) بناءً على تجارب أولية على مجموعة التحقق (وليس مجموعة الاختبار)، حيث اختبرنا تركيبات أوزان بنسب 90:10، و80:20، و70:30، و60:40، و50:50. وقد تم اختيار تقسيم 70/30 لأنه حقق أفضل قيمة R2 للتحقق، وظل يحافظ على قيود فيزيائية كافية من نموذج Kim لتنظيم التنبؤات وتجنب المخرجات غير المعقولة فيزيائياً، خاصة في حالات الضباب حيث يوفر نموذج Kim حدود توهين نظرية معتمدة.
تحليل أهمية الميزات وقابلية التفسير
تم استخدام نموذج الغابة العشوائية (Random Forest) مع أهمية الميزات القائمة على الشوائب (تقليل التباين) لاستخراج تصنيفات أهمية جميع الميزات العشر المدخلة. وأظهر التحليل أن تركيز الغبار (67.3%) والرؤية (21.2%) كانا أهم المتنبئات، حيث يفسران معاً 88.5% من إجمالي الأهمية التنبؤية. وكانت الميزة الثالثة من حيث الأهمية هي معدل هطول الأمطار (6.0%)، تليها سرعة الرياح (2.1%)، ودرجة الحرارة (1.5%)، والرطوبة (0.9%)، والشهر (0.5%)، والفصل (0.3%)، ومعدل تساقط الثلوج (0.1%)، والضغط الجوي (0.1%). وتشير درجات الأهمية المنخفضة للميزات الزمنية (الشهر والفصل) إلى أن التباين الموسمي في التوهين الجوي يتم استيعابه بشكل أساسي من خلال المعلمات البيئية الأساسية بدلاً من الأنماط القائمة على الوقت وحدها.
تم إجراء تحليل SHAP (تفسيرات شابلّي المضافة) لتقييم العلاقات بين العوامل البيئية والوهن. وقد استخدم تنفيذ SHAP وحدة TreeExplainer من مكتبة SHAP، وهي وحدة مُحسَّنة خصيصاً للنماذج القائمة على الأشجار، بما في ذلك Random Forest وXGBoost وLightGBM (راجع جدول المواد لمعرفة الإصدار). وكانت تهيئة تحليل SHAP كما يلي: تم تمرير نموذج Random Forest المدرب إلى TreeExplainer، الذي قام بحساب قيم SHAP باستخدام نهج إسناد الميزات التدخلي (الهامشي) بناءً على التوقع الشرطي لمخرجات النموذج. تم حساب قيم SHAP لجميع عينات مجموعة الاختبار البالغ عددها 300 عينة، مما أنتج مصفوفة بحجم 300 × 10 (قيمة SHAP واحدة لكل ميزة لكل عينة). وبالنسبة لكل ميزة، مثلت قيمة SHAP مساهمتها في التنبؤ بالنسبة إلى الخط المرجعي (متوسط تنبؤ النموذج). وأشارت قيم SHAP السالبة إلى إزاحة نحو الأسفل؛ بينما أظهرت قيم SHAP الموجبة أن الميزة عززت التنبؤ بالوهن. وقد دلت قيمة SHAP من حيث المقدار على قوة هذه المساهمة. وتم تصور توزيع أرقام SHAP لكل ميزة (باستخدام مخططات beeswarm)، واتجاه التأثير (الارتباط بين قيم الميزات وقيم SHAP)، وتصنيفات أهمية الميزات، وذلك باستخدام مخططات ملخصة. واستُخدمت وظائف الرسم المدمجة في مكتبة SHAP — وهي shap.summary_plot() لمخطط beeswarm وshap.bar_plot() لأهمية الميزات العالمية — لإنشاء جميع تصورات SHAP.
التعامل مع المتغيرات المرمزة بنظام الترميز الأحادي (One-Hot Encoding): استُخدمت في البداية أربعة أعمدة ثنائية (الربيع، والصيف، والخريف، والشتاء) لترميز متغير الفصل. ومن أجل إنشاء قيمة مساهمة واحدة لـ "الفصل" لكل عينة في تحليل SHAP، تم دمج مساهمات هذه المتغيرات الأربعة المرمزة بنظام الترميز الأحادي عن طريق جمع قيم SHAP لكل فئة من فئات الفصول. ولإتمام عملية التجميع هذه، تم تحديد جميع الأعمدة المقابلة لمجموعات الفصول المرمزة بنظام الترميز الأحادي، واستخراج قيم SHAP الخاصة بها لكل عينة، ثم جمعها عنصرًا تلو الآخر. وتمثل قيم SHAP المجمعة الناتجة المساهمة الإجمالية للفصل في التنبؤ بالوهن. تسمح هذه الطريقة بظهور صف واحد لـ "الفصل" في مخطط ملخص SHAP وتضمن الاتساق مع استخدام النموذج للفصل كمتغير فئوي مركب. ونظرًا لأن الرقم المجمع يقدم وصفًا أكثر وضوحًا للمساهمة الإجمالية للفصل، لم يتم عرض قيم SHAP الخاصة بالفصول بشكل منفصل لكل فئة فصل.