مقالة بحثية

التعلم العميق الهجين مع قابلية التفسير المعتمدة على الانتباه لتوقع PM2.5 في بيئات دلهي الحضرية

DOI:

10.3791/71004

أغسطس 7, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

CORTA (النقل المصنف المحسن للارتباط)، إطار عمل هجين للتعلم العميق للتنبؤ ب PM₂ قصير الأجل في دلهي. يجمع النموذج بين اختيار ميزات CorrXGBoost Rank، والتعلم الانتقالي مع شبكات الذاكرة قصيرة المدى طويلة، والانتباه متعدد الرؤوس لتفسير الزمن ومستوى الميزات، ويستخدم بيانات جودة الهواء، والأرصاد الجوية، وبيانات عد الحرائق المشتقة من الأقمار الصناعية لتحسين التنبؤ ب PM2.5.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

التنبؤ قصير الأمد بPM 2.5 يمثل تحديا في دلهي لأن تركيزات الجسيمات تتأثر بالابعاثات المحلية، والتغيرات الجوية في الجو، والركود الموسمي، والتلوث المرتبط بالحرائق بشكل متقطع. تقدم هذه الدراسة CORTA-Net، إطار عمل هجين للتعلم العميق للتنبؤ ب PM2.5 باستخدام بيانات بيئية متعددة المصادر من 2012 إلى 2024. تشمل بيانات الإدخال ملاحظات جودة الهواء كل ساعة من محطات مراقبة لجنة مكافحة التلوث في دلهي (CPCB)، ومتغيرات أرصادية من إدارة الأرصاد الجوية الهندية (IMD)، ومعلومات عداد الحرائق المستمدة من الأقمار الصناعية من منتجات MODIS (مقياس طياف التصوير متوسط الدقة). يطبق الإطار المقترح أولا اختيار ميزات CorrXGBoost-Rank لتقليل المتنبؤات الزائدة والاحتفاظ بالملوثات المهمة، والمتغيرات الجوية والزمنوية والمرتبطة بالحرائق. ثم ترتب الميزات المختارة كتسلسلات نافذة منزلقة خاضعة للإشراف وتعالج باستخدام مشفر LSTM قائم على التعلم النقلي يتبعه طبقة انتباه متعددة الرؤوس. توفر آلية الانتباه تفسيرا على مستوى الميزات والخطوات الزمنية لتوقعات PM2.5 . تم تقييم CORTA-Net باستخدام تدريب زمني، اختبار، وتقسيمات تحقق، بالإضافة إلى التحقق المتبادل. مقارنة بخطوط الأساس العشوائية للغابات، XGBoost، LSTM، وLTM الانتباه، قلل الإطار المقترح من خطأ التنبؤ ضمن إعداد محطة المراقبة في دلهي المقيمة. تكمن حداثة CORTA-Net في دمج فحص ميزات CorrXGBoost-Rank الصريح، والترميز الزمني القائم على التعلم النقلي، وتكامل MODIS مع نشاط الحريق، وتحليل سلوك النماذج القائم على الانتباه متعدد الرؤوس في خط تنبؤ واحد قابل لإعادة إنتاج PM2.5 . عمليا، يمكن للإطار دعم التنبؤ قصير الأمد بجودة الهواء في المدن في بيئات مراقبة غنية بالبيانات حيث تتوفر سجلات الملوثات، والملاحظات الجوية، ومؤشرات نشاط الحرائق.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

الجسيمات الدقيقة ذات القطر الهوائي ≤ 2.5 ميكرومتر (PM2.5) تشكل مصدر قلق مهم لجودة الهواء في دلهي لأنها تتأثر بالابعاثات المحلية 1,2,3، والنقل الإقليمي4، والأرصاد الجويةالموسمية 5، وأحداث حرق الكتلة الحيوية العرضية6. خلال فترات ما بعد الرياح الموسمية والشتاء7، وسرعة الرياح المنخفضة8، وظروف طبقة الحدودالضحلة 9، وانقلاب درجة الحرارة يمكن أن تقلل من تشتت الملوثات وتزيد من تراكم الجسيمات. يعد التنبؤ ب PM2.5 قصير الأجل تحديا بسبب الظاهرة غير الخطية والموسمية والشديدة التلوث المفاجئة في سلسلة الزمن10. استخدمت الدراسات السابقة حول التنبؤ ب PM2.5 نماذج إحصائية، ونماذج التعلم الآلي، ونماذج الشبكات العصبية المتكررة11. يمكن أن تكون الطرق الإحصائية مفيدة في تحديد الاتجاهات وموسمية البيانات12، لكنها قد لا تستطيع تفسير التفاعلات غير الخطية التي توجد بين الملوثات والأرصادالجوية بشكل كامل. يمكن استخدام نماذج التعلم الآلي مثل الغابات العشوائية وXGBoost لنمذجة العلاقات غير الخطية14؛ ومع ذلك، عادة لا يكون لها اعتماد زمني إلا إذا تم تصميم ميزات متأخرة. الشبكات العصبية طويلة المدى قصيرة (LSTM) قادرة على نمذجة كل من الاعتماد الزمني والعلاقات غير الخطية15.

يمكن لشبكات الذاكرة قصيرة المدى طويلة أن تنمذج الأنماط الزمنية16، لكن أدائها قد يتأثر بالظروف غير الثابتة ونوبات التلوث المفاجئ17. تحسن الأساليب الحديثة القائمة على الانتباه والمحول التمثيل الزمني18، لكن العديد منها يعالج جميع المتغيرات المرشحة مباشرة ويوفر تحكما محدودا في تكرار الميزات قبل نمذجة التسلسل 19,20. على الرغم من أن نماذج التعلم العميق المعتمدة على المحولات والهجينة قد حسنت مؤخرا PM2.5 وتوقعات AQI21، إلا أن مساهماتها غالبا ما تركز على تعلم التمثيل الزمني22، وبناء الرسم البياني المكاني23، ودمج النموذج24، أو التحسين. تستخدم العديد من هذه النماذج مباشرة مجموعة المدخلات متعددة المتغيرات المتاحة وتضع عبء التعلم الرئيسي على نموذجالتسلسل 25. يمكن أن يزيد هذا من تكرار المدخلات، ويقلل من قابلية التفسير، ويصعب تحديد ما إذا كانت التحسينات ناتجة عن النمذجة الزمنية، أو فحص الميزات، أو مؤشرات بيئية خارجية، أو وزن قائم على الانتباه. لذلك، يوضع كورتا-نت كإطار عمل للتنبؤ على مستوى سير العمل بدلا من طبقة الشبكة العصبية المستقلة26. يكمن تميزه في التكامل المرتبة لأربع مراحل: فحص الميزات بنظام CorrXGBoost قبل نمذجة التسلسل، وترميز LSTM بالتعلم الانتقالي للتكيف الزمني، وإدراج عدد النيران المشتق من MODIS لتأثير حرق الكتلة الحيوية المتقطعة، والانتباه متعدد الرؤوس لتفسير سلوك النموذج على مستوى الميزات والخطوات الزمنية. يتيح هذا التصميم للإطار تقييم دقة التنبؤ ومساهمة المتغيرات الملوثة، والأرصاد الجوية، والزمني، ونشاط الحريق المختارة تحت نفس إعداد محطة المراقبة في دلهي27.

استخدمت التطورات الحديثة في التنبؤ بجودة الهواء بشكل متزايد نماذج التعلم العميق الهجينة، وآليات الانتباه، والتعلم القائم على الرسوم البيانية28، وبنى المحولات لالتقاط التبعيات الزمنية والمكانية غير الخطية29. حسنت هذه الأساليب أداء التنبؤ من خلال تعلم التبعيات طويلة المدى وتخصيص أوزان تكيفية لخطوات زمنية أو متغيرات إدخال30. ومع ذلك، لا تزال العديد من النماذج الحديثة تعتمد على مجموعات ميزات كبيرة للمدخلات، ولا تقلل صراحة من المتنبؤات الزائدة قبل النمذجة الزمنية، أو لا تتضمن مؤشرات خارجية لنشاط الحريق عندما تكون تأثيرات حرق الكتلة الحيوية المتقطعة مهمة. تلغى CORTA-Net هذه الفجوة من خلال دمج فحص الميزات، وترميز LSTM بالتعلم بالنقل، وتكامل عدد الحرائق المستمد من MODIS، والانتباه المتعدد في سير عمل تنبؤ واحد.

تقدم هذه الدراسة CORTA-Net كخط أنابيب تنبؤ هجين قابل للتكرار بتقنية PM2.5 بدلا من أن يكون طبقة شبكة عصبية جديدة. يجمع الإطار بين أربع مراحل: اختيار ميزات CorrXGBoost-Rank، ترميز LSTM الزمني القائم على التعلم التحويلي، دمج عد النيران المستخرج من MODIS، وتحليل سلوك النماذج القائم على الانتباه متعدد الرؤوس. يقوم CorrXGBoost-Rank أولا بتقليل المتغيرات الملوثة الزائدة والأرصاد الجوية قبل نمذجة التسلسل. ثم ترتب الميزات المختارة في تسلسلات نوافذ منزلقة وتعالج باستخدام مشفر LSTM بتعلم النقل. يتم تضمين متغيرات عدد الحرائق في MODIS كمؤشرات خارجية لنشاط الحرائق الإقليمية، وتستخدم طبقة الانتباه متعددة الرؤوس لفحص أي الخطوات الزمنية والمتغيرات الداخلية الأخيرة تساهم بشكل أقوى في التوقعات. الإطار مناسب للبيئات التي تتوفر فيها ملاحظات PM2.5 مستمرة من محطة مراقبة واحدة على الأقل، ويفضل أن تكون مع عدة سنوات من البيانات الساعية. كما يستفيد من الملاحظات الجوية ومعلومات عد الحرائق المستمدة من الأقمار الصناعية عندما يكون تأثير حرق الكتلة الحيوية الإقليمي ذا صلة. لذلك، يهدف CORTA-Net إلى بيئات التنبؤ بجودة الهواء الحضرية الغنية بالبيانات، وقد لا يكون مناسبا للمواقع التي تحتوي على سجلات مراقبة متفرقة أو غير منتظمة أو قصيرة الأمد.

تم اختيار دلهي كمنطقة للدراسة لأنها تشهد مستويات مرتفعة متكررة من PM₂.₅ خلال فترات ما بعد الرياح الموسمية والشتاء. تتأثر المدينة بحركة المرور والنشاط الصناعي وانبعاثات السكنية والركود الجوي والحرق الزراعي الإقليمي. تم استخدام أربع محطات مراقبة لهذه الدراسة: قطاع دواركا 8، أناند فيهار، موندكا-DPCC، وسونيا فيهار. تمثل كل محطة نوعا مختلفا من البيئة الحضرية الدقيقة: المنطقة السكنية، منطقة التأثير المروري، والمنطقة ذات التأثيرات الصناعية. تعرض الملاحظات التي أجريت من كل محطة مراقبة بين عامي 2012 و2024 في الشكل التكميلي 1. تم تدريب النموذج على البيانات من 2015 إلى 2022، وأجري اختبار على بيانات من 2023 لكل من تطوير النموذج والتحقق من صحة النموذج32 على البيانات التي تم جمعها في 2024. المتغيرات المستخدمة كمدخلات شملت PM2.5، PM10، NO،NO 2، NOx، CO، البنزين، درجة حرارة الهواء، سرعة الرياح، الإشعاع الشمسي، والضغط الجوي، وتم تحديدها بناء على ما كان متاحا في الموقع33. تم استخدام بيانات عد الحرائق المشتقة من MODIS كمتغير خارجي يمثل مستوى نشاط الحريق في المنطقة. يحتوي الجدول 1 على ملخص لإحصائيات تركيز PM₂.₅ من كل من محطات المراقبة الأربع.

مجموعة البياناتاسم المحطةقاسيةالأمراض المنقولة جنسياالحد الأدنى25%50%75%ماكس
1قطاع دواركا 898.2479.127.5238.6570.83133.47588.15
2أناند فيهار115.8789.428.9149.2884.36152.89574.92
3موندكا-DPCC113.6291.054.2143.5886.74158.42682.31
4سونيا فيهار101.3580.255.8042.1575.60138.75565.40

الجدول 1: ملخص إحصائيات تركيز PM₂.₅ في أربع محطات مراقبة في دلهي. يعرض الجدول 1 متوسط مستويات PM2.5 (الجسيمات الدقيقة) التي تم قياسها في أربعة أجهزة مراقبة في دلهي. يتكون PM2.5 من ملوثات محمولة جوا أقل من 2.5 ميكرون عرضا، ولهذا فهي صغيرة بما يكفي لاستنشاقها بعمق في الرئتين بسهولة، مما يشكل مخاطر صحية محتملة متعددة.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

المنهجية
تم بناء نموذج نافذة انزلاقية مراقبة للتنبؤ بقيمة PM2.5 المستقبلية عند الزمن t + 1 من خلال الملاحظات السابقة كل ساعة. تم تقييم أطوال نوافذ الإدخال المرشحة التي تبلغ 12 و24 و48 خطوة زمنية كل ساعة باستخدام أداء التحقق، واستخدم التكوين النهائي ل CORTA-Net تسلسل إدخال لمدة 24 ساعة. تم استخدام الاستيفاء الخطي لملء القيم المفقودة؛ تمت إزالة القيم الشاذة باستخدام طريقة IQR؛ وتم تكبير جميع المتغيرات باستخدام التطبيع الأقصى-الأعلى قبل توليد ميزات PM2.5 المتأخرة. ثم تم تطبيق إجراء CorrXGBoost-Rank لاختيار الميزات. أولا، مرشح بيرسون للارتباط يحتفظ بالمتغيرات مع |r| ≥ 0.30. ثانيا، أزواج الميزات المتكررة للغاية ذات ارتباط زوجي |corr(xi, xj)| تم ترشيح ≥ 0.85 لتقليل التعدد التعاوني. ثالثا، تم تدريب مسجل XGBoost على المتغيرات المتبقية، وتم الاحتفاظ بالمتنبئات التي تحمل درجات الأهمية القائمة على كسب XGBoost ≥ 0.015 لإدخال النموذج النهائي. تكونت بنية كورتا-نت النهائية من طبقات LSTM مكدسة للترميز الزمني، وطبقة انتباه متعددة الرؤوس لوزن مستوى الميزات والخطوات الزمنية، وطبقات انحدار كثيفة لتقدير PM2.5 . تم تدريب النموذج باستخدام محسن آدم مع متوسط تربيع فقدان الخطأ والتوقف المبكر. تم إجراء تقييم النموذج باستخدام RMSE و R2 عبر أقسام التدريب والتحقق من الصحة والاختبار والتحقق المتقاطع بعشرة أضعاف. يمثل الجدول 2 ملخص معالجة البيانات المسبقة وهندسة الميزات.

الخطوةالطريقة المستخدمةالمعامل / العتبةالغرض
حساب القيمة المفقودةنسبة الملاحظات المفقودةالتقرير حسب النسبة المئوية المتغيرةيقييس اكتمال البيانات
النسبة القصيرة الفجوةالاستيفاء الخطيطول الفجوة ≤ 6 ساعاتتملأ الفترات القصيرة المفقودة
اكتشاف القيم الشذريةطريقة IQRQ1 − 1.5 × IQR، Q3 + 1.5 × IQRيزيل القيم القصوى غير الصالحة
التطبيعالحد الأدنى لأقصى القياسالحد الأدنى والأقصى لمجموعة التدريبتوحيد نطاق الميزات
PM₂.₅ lagsالمتغيرات المتراجعةlag₁، lag₂، lag₃تلتقط الاستمرارية الزمنية
الإحصائيات المتحركةالمتوسطات المتحركة3 ساعات، 6 ساعات، 12 ساعة، 24 ساعةيلتقط التراكم قصير المدى
ميزة عدد النيرانموديس فايركونتعد اليوم نفسه / اليوم السابقيمثل تأثير الحرائق الإقليمي

الجدول 2: ملخص معالجة البيانات وهندسة الميزات. في الجدول 2، تتم معالجة البيانات بطريقتين: أولا، من خلال تنظيف وتحويل البيانات الخام (المعالجة المسبقة)، وثانيا، عبر هندسة الميزات لإنشاء أو اختيار أو تعديل الخصائص (الميزات). كوحدة واحدة، تساعد هاتان العمليتان في القضاء على أو تقليل الضوضاء؛ يتعامل مع القيم المفقودة؛ تحسين اتساق البيانات؛ وإنشاء نماذج أكثر تنبؤية.

تم تقدير معلمات التطبيع فقط من مجموعة التدريب ثم تم تطبيقها دون تغيير على مجموعات الاختبار والتحقق لتجنب تسرب المعلومات.

الصياغة الرياضية لرتبة CorrXGBoost
ليكن X = {x1,x 2, ...,x n} يرمز إلى مجموعة المتغيرات المرشحة للمدخلات، وy يرمز إلى تركيز PM₂.₅ المستهدف. لكل ميزة xi، تم حساب معامل ارتباط بيرسون مع المتغير المستهدف كالتالي:

figure-protocol-1(1)

حيث أن cov(xi, y) هو التغاير بين الميزةx i والهدف y، وσxi و σy هما انحرافات معيارية. الميزات المحفوظة مرضية: |ri| ≥ τr حيث τr = 0.30 في هذه الدراسة.

تم حساب الترابطات الزوجية بين جميع features_xi وx j، وإذا كان |corr(xi, xj)| >= τأحمر، حيث τالأحمر = 0.85، يتم حذف الميزة ذات الارتباط المطلق الأدنى مع هدف PM2.5 من مجموعة الميزات. تقلل هذه العملية من المتغيرات من مجموعة الميزات التي لها تعدد التعاون. بعد ذلك، تم ملاءمة نموذج انحدار XGBoost للميزات المتبقية، وتم حساب درجات أهمية الميزة لكل ميزة باستخدام أهمية XGBoost، وتم الاحتفاظ بميزات تحقق i_i ≥ τxgb حيث τxgb = 0.015 في مجموعة الميزات النهائية (S") المعرفة ك Sالنهائية =S corr ∪ Sxgb، أي مجموعة الميزات المعرفة من خلال تصفية الميزات للتكرار بالنسبة للارتباط وإزالة أي ميزات بناء على أهمية متغير XGBoost. النهج العام المتبع في اختيار الميزات هو كالتالي: حساب ارتباط بيرسون المستهدف على الميزة، التخلص من الميزات التي لها |r_i|< 0.30، التخلص من الميزات التي لها أزواج لديها ارتباطات زوجية ≥ 0.85، ملاءمة XGBoost للميزات المتبقية، الحفاظ على الميزات التي لديها درجة أهمية XGBoost ≥ 0.015، تحديد الميزات النهائية Sالنهائية =S corr ∪ Sxgb، حيث Scorr هي الميزات التي تحتفظ بها بعد تصفية الارتباط المتكررة، وSxgb هي الميزات المختارة باستخدام درجة أهمية ميزات XGBoost. لذا، فإن سير عمل CorrXGBoost-Rank هو: حساب ارتباط بيرسون المستهدف بين ميزات، وإزالة الميزات التي تحتوي على |r i| < 0.30، إزالة الميزات الزائدة للغاية ذات ارتباط زوجي ≥ 0.85، تدريب XGBoost على المتغيرات المتبقية، الاحتفاظ بالمتغيرات ذات درجة الأهمية XGBoost ≥ 0.015، واستخدام اتحاد المتغيرات المختارة بالارتباط والمتغيرات المختارة من XGBoost كمجموعة الميزات النهائية. المعلمات المستخدمة في هذه الدراسة هي τr = 0.30، τالأحمر = 0.85، و τxgb = 0.015.

مصادر البيانات
دمج المؤلفون ثلاث مجموعات بيانات كبيرة للدراسة؛ هذه بيانات عن ملوثات الهواء (PM2.5، PM10، NO2، CO وSO₂) حصل عليها المؤلفون من خلال CPCB (مجلس مكافحة التلوث المركزي) / DPCC (لجنة مكافحة التلوث في دلهي) لمراقبة جودة الهواء، والبيانات الجوية (درجة الحرارة، الرطوبة، سرعة/اتجاه الرياح والضغط) من إدارة الأرصاد الجوية الهندية (IMD)، ومعلومات الأقمار الصناعية عن الحرائق النشطة من منتجات MODIS النشطة للحرائق النشطة من ناسا. تغطي هذه المجموعات الثلاث الفترة من يناير 2012 إلى ديسمبر 2023 والتي تمثل بذلك أنواعا مختلفة من الانبعاثات. تساهم حوادث الحرائق في تلوث الهواء، كما هو موضح في الشكل التكميلي 2، الذي يوضح اتجاهات FIRECOUNT من 2012 إلى 2024.

الاتجاهات طويلة الأمد للملوثات خلال فترة الدراسة
يوضح الشكل 1 الاتجاهات طويلة الأمد للملوثات خلال سنوات الدراسة (2012–2024). تعد أعداد الحرائق السنوية ومتوسط تركيزات PM₂.₅ بين عامي 2012 و2024 علاقة إيجابية قوية إلى حد ما (r = 0.688)، مما يشير إلى أن زيادة نشاط الحرائق عادة ما ترتبط بتركيزات أعلى من PM₂.₅. تتبع بيانات PM₂ والمتوقعة اتجاها مشابها، مما يدعم فكرة أن حرق الكتلة الحيوية يساهم في تلوث الجسيمات. على الرغم من وجود تباين كبير بين السنين، فإن الانبعاثات المرتبطة بالحرائق تعد عاملا مهما في تحديد تباين PM₂.₅، مما يؤكد الحاجة إلى إدارة حرائق إقليمية لتحسين جودة الهواء. الارتباط الذاتي لPM2.5 المتوقع عند ثلاثين تأخيرا، كما هو موضح في الشكل التكميلي 3، له ارتباط إيجابي كبير في جميع التأخيرات الثلاثين، مما يؤكد أن PM2.5 في دلهي له اعتماد زمني قوي واستمرارية متعددة الأيام.

figure-protocol-2
الشكل 1: اتجاهات PM₣ طويلة الأمد وعدد الحرائق من 2012 إلى 2024. يقارن الشكل 1 التغير السنوي في عدد الحرائق مع تركيزات PM₂₅ المرصودة والمتوقعة. يتم الإبلاغ عن PM₂.₅ بوحدة μg/m3. يمثل FIRECOUNT نشاط الحريق المستخرج من الأقمار الصناعية من منتجات MODIS. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تحلل STL (التحليل الموسمي والاتجاه باستخدام اللويس)
تقنية STL أو تحليل الموسمية والاتجاهات باستخدام لوس هي خوارزمية تكرارية تسمح بتقسيم بيانات السلاسل الزمنية إلى ثلاثة مكونات إضافية كما هو موضح في الشكل 2: الاتجاه (الاتجاه طويل الأجل) (الشكل 2A)، (الشكل 2D)، (الشكل 2G)، (الشكل 2J)، الموسمي (الفترات الدورية) (الشكل 2B)، (الشكل 2E)، (الشكل 2H)، (الشكل 2K)، والباقي (الضوضاء/البقايا) (الشكل 2C)، (الشكل 2F)، (الشكل 2I)، (الشكل 2L). لقد أثبتت STL نجاحها في التعامل مع الخصائص غير الخطية المعقدة للبيانات البيئية (مثل PM2.5) والتي فشلت العديد من التقنيات التحليلية الأخرى بسبب تغير السعة في الإشارة الموسمية ووجود القيم الشاذة. يسمح تنعيم LOESS بفصل دقيق لهذه المكونات، مما ينتج تفسيرا أوضح للاتجاهات أو الأنماط. من خلال معالجة STL، من الممكن فصل الاتجاهات الصاعدة الأوسع ل PM2.5 عن الدورات اليومية/الموسمية الأقصر وعن البواقي المتقلبة داخل تلك الدورات. يسمح هذا الفصل بتحديد الانبعاثات التي أثرت على PM2.5، على عكس العوامل الجوية التي أثرت على PM2.5. تساعد نتائج هذا الفصل في التنبؤ الدقيق بانبعاثات PM2.5 المستقبلية؛ توفير بيانات للقرارات التنظيمية؛ والامتثال للمعايير المحددة لتفكيك بيانات السلاسل الزمنية الدقيقة لدراسات جودة الهواء34. يشير متوسط قياسات تركيز PM2.5 اليومية التي أجريت في محطات المراقبة في دلهي من 2012 إلى 2024 إلى تغييرات طفيفة في مستوى PM2.5 (أي عدم وجود تغيير كبير من 2022-2024) بشكل عام، وسلوك ثابت محدود للغاية (أو ثبات في مستويات PM2.5 بين المواقع الأربعة للمراقبة). مستويات PM2.5 في قطاعي دواركا 8 وموندكا-DPCC تظهر اتجاها هبوطا مستمرا (أي استمرار في الانخفاض)، بينما لدى أناند فيهار اتجاه تصاعدي (أي في ارتفاع ملحوظ)، وسونيا فيهار لديه اتجاه صعودي طفيف (بعد زيادة طفيفة جدا منذ 2022). بالإضافة إلى ذلك، أشارت بقايا تركيزات PM2.5 اليومية لكل من محطات المراقبة الأربع إلى أن تركيزات PM2.5 تأثرت بشدة بالتغيرات الموسمية (الأرصادية)، مما أدى إلى تقلبات كبيرة في متوسط تركيزات PM2.5 اليومية للمحطات الفردية. يتم عرض تركيزات المراقبة اليومية2.5 مساء لمحطات المراقبة الأربع في دلهي (2012–2024) في الشكل 2.

figure-protocol-3
الشكل 2: تحليل التصنيف الموسمي والاتجاهات باستخدام اللويس (STL) لتركيزات PM₂₅ اليومية عبر أربع محطات مراقبة في دلهي من 2022 إلى 2024. يتم تقسيم السلسلة الزمنية لكل محطة مراقبة إلى ثلاثة مكونات إضافية: الاتجاه طويل الأمد، التغير الموسمي، والباقي (الباقي). (أ) مكون الاتجاه لقطاع دواركا 8. (ب) المكون الموسمي لقطاع دواركا 8. (ج) المكون المتبقي لقطاع دواركا 8. (د) مكون الاتجاه لأناند فيهار. (ه) المكون الموسمي لأناند فيهار. (و) المكون المتبقي لأناند فيهار. (G) مكون الاتجاه ل Mundka-DPCC. (ح) المكون الموسمي لموندكا-DPCC. (I) المكون المتبقي ل Mundka-DPCC. (J) مكون الاتجاه لسونيا فيهار. (K) المكون الموسمي لسونيا فيهار. (L) المكون المتبقي لسونيا فيهار. STL، تحليل المواسم والاتجاهات باستخدام اللويس. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

يعرض الشكل 2 التحللات الزمنية لتركيزات PM2.5 اليومية في أربعة مواقع مراقبة حضرية خلال 2022-2024، كاشفا عن أنماط من الانخفاضات طويلة الأمد، والزيادات التدريجية، والتغيرات اليومية الكبيرة. يمكن عزو هذه الاختلافات إلى حد كبير إلى التأثيرات الفيزيائية للطقس، أي التغيرات في ارتفاع طبقة حدود الكوكب (PBL)، مثل التمدد النهار الذي يزيد من التشتت الرأسي ويقلل من التركيزات، وانكماش الليل، مما يترك الملوثات قريبة من الأرض ويخلق ذروة أعلى ليلا. تأتي التأثيرات الجوية الأخرى من انبعاثات النشاط البشري المحلي المرتبطة بساعات الحجم الأكبر (ذروات الصباح/المساء)، والصناعات، وتفاعلاتها مع: العوامل الخاصة بالموقع مثل التضاريس المحلية، سرعة الرياح، الرطوبة النسبية، والموسم (أي الارتباط الأكبر في الشتاء) التي قد تكون تسببت في التغيرات الخاصة بالمحطة والانخفاضات طويلة الأمد بشكل عام قد تأثرت بالضوابط التنظيمية على الانبعاثات. مما أدى إلى اتجاهات هبوطية بشكل عام.

الارتباط بين السمات
يعرض الشكل 3 توزيع جميع ميزات الإدخال المستخدمة في نموذج CORTA-Net. في الألواح، تظهر متغيرات الملوثات (PM10 (الشكل 3A)، NO₂ (الشكل 3B)، CO (الشكل 3C)، SO₂ (الشكل 3D)) توزيعات مائلة إلى اليمين نموذجية لبيانات جودة الهواء الحضرية، بينما تظهر O₃ (الشكل 3E) والضغط (الشكل 3I) أنماطا شبه طبيعية35. تظهر درجة الحرارة (الشكل 3F) بنية موسمية ثنائية الشكل واضحة، والرطوبة (الشكل 3G) تتبع انتشارا موحدا واسعا، وسرعة الرياح (الشكل 3H) تظهر توزيعا خفيفا. تسلط هذه الأنماط الضوء على السلوك الإحصائي المتباين للمتنبعات وتبرر الحاجة إلى هندسة الميزات وتطبيره قبل تدريب النماذج.

figure-protocol-4
الشكل 3: توزيع ميزات المدخلات المستخدمة في نموذج CORTA-Net، بما في ذلك تركيزات ملوثات الهواء والمتغيرات الجوية الجوية. توضح التوزيعات الخصائص الإحصائية للمتنبعات قبل المعالجة المسبقة وتدريب النماذج. (أ) تركيز PM₁₀. (ب) تركيز لا يذكر. (ج) تركيز أول أكسيد الكربون. (د) تركيز SO₂. (E) تركيز O₃. (F) درجة حرارة الهواء. (G) الرطوبة النسبية. (H) سرعة الرياح. (1) الضغط الجوي. تظهر المتغيرات الملوثة، وخاصة PM₁₀، NO₂، CO، وSO₂، توزيعات مائلة نحو اليمين نموذجية لبيانات جودة الهواء الحضري، بينما يظهر O₃ وضغط الغلاف الجوي توزيعات طبيعية تقريبا. تظهر درجة الحرارة نمطا موسميا ثنائي الوضع، والرطوبة لها توزيع واسع، وسرعة الرياح تتركز عند قيم أقل مع توزيع ذيل خفيف. تدعم هذه التوزيعات غير المتجانسة استخدام هندسة الميزات وتطبيعه قبل تطوير النموذج. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

يعرض الشكل 4 تصنيف أهمية الميزات القائم على الكسب XGBoost بعد معالجة مسبق في رتبة CorrXGBoost لتوقع PM₂.₅. يظهر مخطط الأهمية الحالي للميزة أن PM₂.₅ في اليوم السابق هو الأعلى تصنيفا بدرجة أهمية 0.280، يليه PM10 = 0.180، FIRECOUNT = 0.150، NO₂ = 0.120، CO = 0.080، سرعة الرياح = 0.070، درجة الحرارة = 0.040، الرطوبة = 0.030، ويوم السنة = 0.020. يمثل الخط الرأسي المتقطع عتبة اختيار الميزات الفعلية ل XGBoost وهي 0.015. تم الاحتفاظ بالمتنبئات التي كانت درجات الأهمية أكبر أو مساوية من 0.015 لمجموعة المدخلات النهائية ل CORTA-Net، بينما تم استبعاد المتنبئات التي تقل عن هذا العتبة، بما في ذلك SO₂ = 0.010، O₃ = 0.010، الضغط = 0.005، هطول الأمطار = 0.005، عطلة نهاية الأسبوع = 0.002، والعطلة = 0.001. تمثل هذه القيم درجات أهمية الميزات القائمة على مكاسب XGBoost ولا ينبغي تفسيرها كمعاملات ارتباط بيرسون أو تأثيرات سببية.

لذلك، تم تضمين الميزات التي حصلت على مساهمة تجاوزت هذا الحد فقط في النموذج. تستخدم نماذج XGBoost مجموعة من أشجار القرار، التي تبني شجرة بشكل تكراري لتقليل دالة الفقد، وتعرف باسم تعزيز التدرج. يحسب XGBoost أهمية الميزات باستخدام أحد ثلاثة مقاييس: الكسب (مدى تحسن تقسيم الميزة لأداء النموذج)، الوزن (عدد مرات اختيار الميزة كتقسيم لشجرة)، أو التغطية (عدد الملاحظات المتأثرة بالتقسيم). تم بناء نموذج XGBoost على بيانات تتعلق بجودة الهواء (الملوثات، المتغيرات الجوية الجوية) ويركز على PM2.5 المتأخر للتنبؤ التلقائي ب PM2.5، وهو أمر شائع في نماذج PM2.5 في دلهي، ويساعد في التقاط الاستمرارية الزمنية ل PM2.5. Delhi_PM2.5 مساهم مهم بسبب خصائص الارتباط الذاتي العالية للجسيمات الدقيقة، والتي تشير أيضا إلى وجود قصور ذاتي للتلوث من مصادر الانبعاث المتسقة. تعد سرعة الرياح مساهما مهما لأنها توفر آلية لتشتت الملوثات؛ بينما تسمح الرياح المنخفضة بتراكم الملوثات خلال الشتاء عندما تكون هناك انعكاسات. يرتبط NO2 ب PM2.5 بسبب حركة المرور/الانبعاثات، بينما يوم السنة هو مؤشر على دورة الانبعاثات السنوية للملوثات (أي انخفاض الانبعاثات في عطلة نهاية الأسبوع). في دلهي، يتمتع PM2.5 بثبات ذاتي عالي بسبب ركود الأرصاد الجوية الشتوي والانبعاثات المستمرة من المركبات والصناعة والكتلة الحيوية28. تساعد الرياح في تشتت الهباء الجوي، لكن ضعف الرياح < 2 م/ث ساهم في زيادة تراكم PM2.5 بسبب الانعكاسات. العلاقة بين NO2 و PM2.5 هي نتيجة لأصلهما المشترك (أي الاحتراق) وتتعرض لتأثيرات زمنية (مثل اليومية مقابل الأسبوعية). العوامل الأربعة الرئيسية المسؤولة عن تفسير 93٪ أو أكثر من التغير في مؤشر جودة الهواء هي التغيرات في تركيزات الملوثات الناتجة عن تراكم PM2.5 المتأخر (93٪+) وانخفاض سرعات الرياح التي تحبس الانبعاثات، وانبعاثات NO2/PM من المركبات والصناعة، والتغيرات اليومية في كمية حركة المرور37. بالإضافة إلى ذلك، فإن جغرافية دلهي عامل مساهم في استمرار الانعكاسات في المنطقة، وبالتالي تزيد من تركيزات PM2.5 . تعديل المعاملات الفائقة، والتنظيم، وإضافة متغيرات إضافية (مثل درجة الحرارة) سيساعد في تقليل فرص التركيب الزائد وسيحسن الأداء العام للنموذج. يجب أن يشمل تنفيذ استراتيجيات تشغيلية لتقليل انبعاثات PM تنفيذ حدود يومية لانبعاثات PM، واستخدام أجهزة توفر مراقبة فورية لوجود PM، واستخدام الرياح لتوزيع PM عبر المساحات الخضراء الحضرية.

figure-protocol-5
الشكل 4: تصنيف أهمية الميزات القائم على المكاسب في XGBoost بعد فحص ميزات CorrXGBoost-Rank لتوقع PM₂.₅. أشرطة التنبؤ مرتبة بترتيب تنازلي حسب الأهمية. يمثل الخط الرأسي المتقطع عتبة اختيار الميزات الفعلية ل XGBoost وهي 0.015. تم الاحتفاظ بالمتنبئين الذين حصلت على درجات ≥ 0.015 لمجموعة المدخلات النهائية ل CORTA-Net، بينما تم استبعاد المتنبئات التي تقل عن هذا العتبة. يستخدم هذا التصنيف لفحص الميزات وتفسير سلوك النماذج ولا ينبغي تفسيره على أنه نسب سببي. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

بنية نموذج CORTA-net
يقدم الشكل 5 إطار عمل مقترح للتنبؤ بنظام PM2.5. توضح الأشكال التكميلية 4 و5 الترتيب الداخلي لوحدة LSTM وتمثيل مخطط كتلة الانتباه متعدد الرؤوس. جميع مصادر البيانات (أي الظروف المحيطة، الملاحظات الجوية الجوية، نشاط الحرائق، والجوانب الزمنية والسياقية للبيانات) خضعت لمعالجة مسبقة لضمان توافقها زمنيا، وأن هناك بيانات مفقودة (إذا لزم الأمر)، وأنها خضعت لإزالة الشاذة وتطبيعها قبل استخدامها في أي من عمليات بناء النماذج. يتم عرض بنية النموذج، هندسة الميزات، تكوين التدريب، تكوين البيانات، تعلم النقل، مقاييس التقييم، التنبؤات المستقبلية، وتفاصيل التنفيذ في الجدول التكميلي 1. باستخدام وحدة CorrXGBoost-Rank، يتم تحديد المجموعة المثلى من الميزات قبل إدخال جزء منها في بنية LSTM، والتي تم تعزيزها بدمج طبقات الانتباه متعددة الرؤوس لأخذ سلوك السلاسل الزمنية في الاعتبار خلال مرحلة النمذجة. تم توفير كل من توقعات PM2.5 وميزات PM2.5 لأهمية ميزات الإدخال، بالإضافة إلى أوزان الانتباه متعددة الرؤوس كخرائط انتباه، كمخرجات. تم تضمين هيكل وحدة LSTM الداخلية ومخطط كتلة الانتباه متعدد الرؤوس كشكلين تكميليين 4 و5 على التوالي، بينما يوفر الجدول التكميلي 1 معلمات البنية لكل نوع من الطبقات ضمن هذه البنية.

figure-protocol-6
الشكل 5: البنية العامة لنموذج التنبؤ PM₂.₅ من CORTA-Net. تشمل عملية التنبؤ المدخلات من مؤشرات جودة الهواء، ومؤشرات الطقس، ومؤشرات الوقت، ومؤشرات عداد الحرائق MODIS (مقياس طيفي التصوير متوسط الدقة). لكل من هذه الخطوات، تقوم الخوارزمية بمحاذاة الطوابع الزمنية، وتتعامل مع القيم المفقودة، وتصفية القيم الشاذة، وتطبيع البيانات، وهندسة الميزات. ثم تم اختيار المتنبئين النهائيين باستخدام عملية CorrXGBoost-Rank. بعد ذلك، تم وضع الميزات المختارة في نوافذ منزلقة بتسلسل زمني وتمريرها عبر مشفر LSTM (الذاكرة طويلة المدى القصيرة) باستخدام التعلم التحويلي. لكل ميزة وخطوة زمنية، تطبق آلية الانتباه متعددة الرؤوس أوزانا قبل إرسال المخرج المجمع إلى طبقة الانحدار النهائية الكثيفة لإنتاج توقع PM₂.₅. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

التدريب والتقييم
تم استخدام نهج نافذة منزلقة لتشكيل تسلسلات تعلم تحت الإشراف. استخدم التدريب محسن آدم ومتوسط تربيع فقدان الخطأ (الجدول التكميلي 2). تم تقييم أداء النموذج باستخدام RMSE وR2 عبر أقسام التدريب والتحقق من الصحة والاختبار والتحقق المتبادل. يتم تجميع بنية النموذج، وهندسة الميزات، وتكوين التدريب، وتكوين البيانات، وتعلم النقل، ومقاييس التقييم، والتنبؤات المستقبلية، وتفاصيل التنفيذ في الجدول التكميلي 1. يمثل الشكل 6 تشخيصات التدريب لنموذج التنبؤ PM₂.₅ من CORTA-Net. في اللوحات، يمثل الشكل 6A منحنيات فقدان التدريب والتحقق، موضحا تقليل الخطأ التدريجي، مع التوقف الأمثل عند العصر 106. يتضح تطور فجوة التعميم أثناء تقييم تحليل الملاءمة الزائدة من خلال التباعد بين بيانات التحقق والتدريب في الشكل 6B. على وجه الخصوص، يظهر فترات يتجاوز فيها التباعد الحدود المحددة مسبقا؛ توفر هذه المعلومات دليلا على أن سلوك معدل التعلم وأنماط تقليل الفقدان توضح فوائد تدهور معدل التعلم المجدول (LR) في الفترات الحرجة كوسيلة لتعزيز استقرار التقارب كما هو موضح في الشكل 6C. تقدم هذه الأشكال مجتمعة ملخصا لديناميكيات التعلم، وقدرة التعميم، وتكوين التدريب الموصى به للنموذج.

figure-protocol-7
الشكل 6: تشخيصات التدريب لنموذج التنبؤ PM₂.₅ من CORTA-Net. (أ) منحنيات فقدان التدريب والتحقق تظهر انخفاضا تدريجيا في الخطأ أثناء تدريب النموذج، مع التوقف المبكر عند العصر 106 بناء على أداء التحقق. (ب) فجوة التعميم بين فقدان التدريب والتحقق عبر العصور، مما يوضح تطور تعميم النماذج وفترات زيادة التباعد التي تشير إلى إمكانية التكيف الزائد. (ج) جدول معدل التعلم الذي يوضح تأثير تدهور معدل التعلم المجدول على التحسين طوال فترة التدريب. (د) ملخص سلوك تقارب النموذج، يعرض التحسين المستقر والتكوين النهائي للتدريب المختار لنموذج كورتا-نت. معا، توضح هذه التشخيصات ديناميكيات النموذج، وخصائص التقارب، وأداء التعميم أثناء التدريب. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

اختيار الميزات ونتائج التنبؤ
اختار إجراء CorrXGBoost-Rank أعداد الحريق المتأخرة PM₂.₅، وسرعة الرياح، والرطوبة، ودرجة الحرارة، والمؤشرات الزمنية، والحرائق المشتقة من MODIS كمؤشرات مهمة لجودة الهواء. كل من هذه المتغيرات تفسر استمرار التلوث، وتشتت بسبب الظروف الجوية الجوية، والفروق الموسمية في مستويات التلوث، والتأثير الإقليمي الناتج عن الحرائق. تمت إزالة المتغيرات الزائدة قبل نمذجة التسلسل لتقليل أبعاد الإدخال غير الضرورية. تم تقييم CORTA-Net باستخدام متوسط الخطأ المطلق، والجذر المتوسط التربيعي للخطأ، ومعامل التحديد. في مجموعة بيانات دلهي اليومية، حقق النموذج RMSE = 3.19 وR2 = 0.983. في تقسيم التدريب اليومي للمناخ في دلهي، حقق النموذج RMSE = 4.98 وR2 = 0.845. في تحليل التشتت لمجموعة الاختبار المستهدفة، أظهرت قيم PM₂.₅ المرصودة والمتوقعة بيرسون r = 0.942 و R2 = 0.873. تشير هذه القيم إلى تقسيمات تقييم مختلفة ولا ينبغي التعامل معها كنتائج قابلة للتبديل على مستوى النموذج.

الشكل 7 الآن يعمل كتمثيل بصري موحد لأداء اختبار CORTA-Net على بيانات الاختبار. يظهر قسم السلاسل الزمنية وجود ارتباط ممتاز بين مستوى PM2.5 الفعلي والمتوقع في مجموعة بيانات الاختبار طوال فترة التقييم، بما في ذلك أحداث التلوث العالي المتقطعة مثل ديوالي وأحداث حرق بقايا المحاصيل. لدعم ذلك، يظهر مخطط التشتت وجود ارتباط خطي قوي بين القيم الفعلية والمتوقعة (r = 0.942، R2 = 0.873)، مما يشير إلى مستوى عال جدا من الدقة التنبؤية.

أداء التنبؤ
تظهر الرسوم المتبقية أن الأخطاء توزع تقريبا بشكل طبيعي حول الصفر، مع وجود بعض الأخطاء المعزولة فقط أثناء ارتفاعات التلوث الشديدة. وقد دعم ذلك بقوة المتانة الإحصائية وغياب التحيز في نماذج CORTA-Net. أظهرت CORTA-Net معدل RMSE قدره 3.19 وR2 عند 0.983 في مجموعة بيانات دلهي اليومية، وRMSE بقيمة 4.98 وR2 بقيمة 0.844 في مجموعة بيانات Daily Delhi Climate Train. أكدت هذه القياسات، إلى جانب الأدلة المذكورة أعلاه، أن CORTA-Net نمذجة بدقة للاتجاهات التدريجية والانحرافات المفاجئة في مستويات PM2.5 .

تم تقييم دقة التنبؤات بتركيزات PM2.5 باستخدام ثلاث طرق: تقييم زمني لدقة توقعات النماذج بتركيزPM 2.5 ، وارتباط زمني بين تركيزات PM2.5 المتوقعة والفعلية، وتقييم الخطأ بناء على التحليل الإحصائي. أظهر التقييم الزمني، الذي قارن بين القيم المتوقعة ل PM2.5 والقيم الزمنية ل PM2.5 (الشكل 7A)، العلاقة مع مرور الوقت بين تركيزات PM2.5 الفعلية المقاسة مقارنة بتركيزات PM2.5 المتوقعة من قبل النموذج، ويظهر بعض الظواهر المهمة ل PM2.5 (مثل مهرجان ديوالي وفترة حرق اللش) التي حدثت خلال هذه الفترة. يوفر الارتباط بين تركيزات PM2.5 المتوقعة من النموذج مقارنة بتركيزات PM2.5 المقاسة دليلا على ارتباط مرتفع جدا (بيرسون r = 0.942 و R2 = 0.873)، مع توافق قوي جدا بين تركيزات PM2.5 المتوقعة والتركيزات المقاسة الفعلية، مما يشير إلى أن نموذج PP-FRC هو متنبئ دقيق وموثوق بتركيزات PM2.5 (الشكل 7B). أظهر توزيع الكورتوزيس للبقايا (الشكل 7C) أخطاء صغيرة مع أيام معزولة ذات خطأ عالي، بينما كان توزيع البقايا تقريبا طبيعيا (الشكل 7D)، وكانت الأخطاء المتوسطة والمتوسطة قريبة جدا من الصفر، مما يشير إلى أن أخطاء التنبؤ في النموذج كانت غير متحيزة وذات سلوك جيد إحصائيا.

figure-results-1
الشكل 7: الأداء التنبؤي لنموذج CORTA-Net على مجموعة بيانات الاختبار المستقلة. يتم الإبلاغ عن تركيزات PM₂.₅ بوحدة ميكروغرام/متر3. (أ) مقارنة زمنية بين تركيزات PM₂.₅ المرصودة والمتوقعة، مما يثبت توافقا وثيقا بين القيم المقاسة والمتوقعة بالنموذج، بما في ذلك خلال فترات التلوث الكبرى. (ب) مخطط التشتت لتركيزات PM₂.₅ المتوقعة مقابل المرصودة، يظهر أداء تنبؤيا قويا (بيرسون r = 0.942؛ R2 = 0.873). (ج) التوزيع الزمني للبواقي (خطأ التنبؤ) عبر فترة الاختبار، مما يشير إلى أخطاء صغيرة عموما مع عدد محدود من الأحداث ذات الخطأ العالي. (د) توزيع البواقي، الذي يظهر توزيعا طبيعيا تقريبا مركزه بالقرب من الصفر، مع متوسط وبواقي وسيط قريبين من الصفر، مما يشير إلى أخطاء تنبؤ غير متحيزة وسليمة السلوك. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

يعرض الشكل 7 الأداء التنبؤي ل CORTA-Net على مجموعة الاختبار المستهدفة. أظهر مخطط السلاسل الزمنية التوافق بين قيم PM₂ والمتوقعة والمتوقعة، بما في ذلك فترات تركيز الجسيمات المرتفع. أظهر مخطط التشتت العلاقة بين قيم PM2.5 المتوقعة والملاحظة. أظهرت الرسوم البيانية المتبقية أن معظم أخطاء التنبؤ تتركز بالقرب من الصفر، مع انحرافات أكبر خلال فترات التلوث العالي.

التحقق المتقاطع
أظهر التحقق المتقاطع عشر مرات تباين محدود عبر الطيات، مما أظهر متانة تحت ظروف جوية غير ثابتة. أظهر النموذج قدرة تنبؤية قوية. القيم المتوقعة PM₂.₅ تتطابق بشكل وثيق مع القيم المرصودة. أظهرت البقايا انحيزا ضئيلا وطبيعيا تقريبيا. قدم الشكل 8 نظرة عامة على أداء النموذج عبر العديد من الظروف وعلى مر الزمن، باستخدام مقاييس RMSE وMAE (متوسط الخطأ المطلق) وR2 (معامل التحديد) في التحقق المتقاطع بعشرة اتجاهات. في اللوحات الشكل 8A والشكل 8B، أظهر RMSE وMAE تغيرا منخفضا عبر جميع فجوات التدريب والتحقق المتبادل، مما يشير إلى دقة تنبؤية مستقرة. يظهر الشكل 8C في لوحة النماذج قيم R2 مرتفعة باستمرار (~0.92 للتدريب و~0.89 للتحقق) عبر جميع عمليات التحقق المتقاطعة، مما يشير إلى أن النموذج يتمتع بقوة تفسير عالية وتباين داخل النموذج منخفض جدا عبر مختلف عمليات التحقق المتقاطعة. أظهر الشكل 8D أن القيمة المتوسطة عبر جميع هذه المقاييس أظهرت فجوة تعميم قليلة، مما يشير إلى أن النموذج أدى بشكل جيد باستمرار بغض النظر عن كيفية تقسيم البيانات.

figure-results-2
الشكل 8: الأداء الطي لنموذج CORTA-Net باستخدام التحقق المتقاطع 10-طيات. تم تقييم الأداء باستخدام جذر متوسط الخطأ التربيعي (RMSE)، متوسط الخطأ المطلق (MAE)، ومعامل التحديد (R2). تمثل أشرطة الخطأ الانحراف المعياري عبر الطيات حيثما ينطبق. (أ) قيم RMSE حسب الطي لمجموعات بيانات التدريب والتحقق، تظهر خطأ توقع منخفض باستمرار عبر جميع الطيات. (B) قيم MAE حسب الطية لمجموعات بيانات التدريب والتحقق، مما يشير إلى أداء تنبؤي مستقر مع تباين طئي بين الطيات. (ج) قيم R2 للطي لمجموعات بيانات التدريب والتحقق، تظهر قوة تفسير عالية بشكل متسق عبر جميع طيات التحقق المتقاطع. (د) مقاييس الأداء المتوسطة وفجوة التعميم بين مجموعات بيانات التدريب والتحقق، مما يثبت أداء نموذجي متسق وتعميما جيدا بغض النظر عن تقسيم البيانات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

قابلية التفسير القائمة على الانتباه
تم استخدام الانتباه متعدد الرؤوس لفحص أي الخطوات الزمنية الأخيرة والمتغيرات المدخلة ساهمت بشكل أكبر في توقعات PM2.5 . ركز بعض الاهتمامات على ذاكرة الملوثات قصيرة المدى من خلال قيم PM2.5 متأخرة، بينما أعطى آخرون وزنا أكبر للمتغيرات الجوية المتعلقة بالتشتت، مثل سرعة الرياح والرطوبة. كما حظيت متغيرات عدد الحرائق باهتمام أكبر خلال فترات التلوث المتوافقة مع تأثير حرق الكتلة الحيوية الإقليمية. يجب تفسير خرائط الانتباه هذه كمؤشرات لسلوك النموذج بدلا من تفسيرات سببية. أشارت النتائج إلى أن النموذج يستخدم كل من تاريخ الملوثات الحديث والمتغيرات البيئية عند إنتاج التوقعات.

تكوين النموذجاختيار الميزاتالتعلم التحويليانتباه متعدد الرؤوسإدخال عدد النيرانRMSE ↓MAE ↓R² ↑
خط الأساس ل LSTMلالالالا7.565.520.905
+ CorrXGBoost-Rankنعملالالا4.243.100.970
+ التعلم التحويلينعمنعملالا3.892.840.975
+ انتباه متعدد الرؤوسنعمنعمنعملا3.482.540.980
كورتا-نت الكاملنعمنعمنعمنعم3.192.330.983

الجدول 3: تحليل الاستئصال على مستوى المكونات ل CORTA-Net. يقيم الجدول 3 كل عنصر معماري داخل النظام عن طريق إزالة أو تغيير مكون أو أكثر وقياس تغيرات الأداء. هذا يوضح أي المكونات المعمارية هي الأكثر فعالية، ويؤكد القرارات المعمارية، ويظهر كيف تتفاعل المكونات المختلفة لتعزيز الدقة والمتانة والكفاءة والفعالية العامة للشبكة.

يقدم الجدول 3 تحليل الاستئصال على مكونات لنظام CORTA-Net. حصل خط الأساس ل LSTM على RMSE = 7.56، وMAE = 5.52، وR2 = 0.905. إضافة اختيار ميزة CorrXGBoost-Rank خفض RMSE إلى 4.24، مما يشير إلى أن إزالة المتنبؤات المتكررة وضعيفة الصلة حسن أداء التنبؤ. خفض التعلم التحويلي RMSE إلى 3.89، مما يشير إلى أن التمثيلات الزمنية المدربة مسبقا حسنت من استقرار النموذج. باستخدام الانتباه متعدد الرؤوس، تم خفض RMSE من 3.48 إلى 3.19، مما حسن قيمة R2 من 0.980 إلى 0.983، مما يشير إلى تحسن كبير في التنبؤات الزمنية من خلال استخدام أوزان مستوى الميزة والخطوات الزمنية جنبا إلى جنب مع مكونات نموذج كورتا-نت الأخرى (مثل CorrXGBoost-Rank، تعلم النقل، الانتباه متعدد الرأس، ومدخلات عد النار MODIS). بشكل عام، أظهرت التحسينات مساهمات اختيار الميزات، وتعلم النقل الزمني، ووزن التسلسل القائم على الانتباه، ونشاط الحريق في تنفيذ وأداء نموذج كورتا-نت.

اختيار الميزاتنمذجة التسلسل الزمنيالتعلم التحويليتحليل سلوك النموذج القائم على الانتباهمدخلات نشاط النارالدور الرئيسي في المقارنة
لا توجد رتبة CorrXGBoost صريحةلالالالاخط الأساس الكلاسيكي لتعلم الآلة غير الخطي
الأهمية الداخلية القائمة على الشجرة فقطلالالالاخط الأساس لتعزيز التدرج للتنبؤ الجدولي
لانعملالالاخط الأساس الزمني المتكرر
لانعملانعملاخط الأساس المتكرر القائم على الانتباه
نعمنعمنعمنعمنعمإطار عمل التنبؤ الهجين المقترح

الجدول 4: الفروقات الرئيسية بين نماذج CORTA-Net ونماذج التنبؤ الأساسية. يوضح الجدول 4 أن النموذج الحالي المستخدم للتنبؤ هو CORTA-Net، الذي سمح بتقنيات أكثر تقدما لاستخراج الميزات الزمنية بالإضافة إلى القدرة على التوجه التكيفي بناء على ما هو مهم من أجل التقاط الأنماط الزمنية المعقدة من مجموعات بيانات السلاسل الزمنية. تعلم كورتا-نت ديناميكيا كيفية ربط العديد من مقاييس الزمن المختلفة لتحقيق دقة عامة، ومتانة، وقدرة أكبر على خلق تعميمات مقارنة بتقنيات التنبؤ الأساسية التقليدية.

الفروقات بين منهجيات CORTA-Net ونماذج الأساس للمقارنة موضحة في الجدول 4. يمكن استخدام Random Forest وXGBoost لتوفير طريقة أساسية غير خطية للتعلم الآلي، لكنها تفتقر إلى النمذجة المباشرة للتبعيات التسلسلية. استخدمت نماذج LSTM كطريقة أساسية زمنية متكررة، بينما قدمت نماذج LSTM الانتباه وزنا قائما على الانتباه دون تمييز ميزات صريحة، باستخدام التعلم الانتقالي أو دمج نشاط الحريق. على النقيض من ذلك، تدمج كورتا-نت أربعة جوانب من الخطوط الأساسية السابقة في خط تنبؤ واحد: (1) اختيار ميزات CorrXGBoost-Rank؛ (2) ترميزات LSTM بالتعلم التحويلي؛ (3) انتباه متعدد الرؤوس؛ (4) وتعتبر الحرائق المشتقة من MODIS بيانات إدخال.

مقارنة الأساس
بالإضافة إلى المقارنات الكمية الأساسية (المقدمة بشكل منفصل مع فروق الطي المتوسطة، والأخطاء المعيارية، وفترات الثقة 95٪)، قام المؤلفون أيضا بتقييم الأداء الداخلي ل CORTA-Net من خلال آلية الانتباه الخاصة به. أوزان الانتباه المخصصة لكل ميزة إدخال (مع مرور الوقت، خطوات وعدة رؤوس انتباه) موضحة في الشكل 9. في الشكل 9A، تعرض المجموعة توزيعا تمثيليا لأوزان الانتباه المخصصة لأحد حالات مجموعات بيانات الاختبار. كما هو موضح في هذا الشكل، على الرغم من أن بعض ميزات الإدخال (مثل PM2.5 عند t-1، t-2، وt-3) سيكون لها أوزان نسبية أقل من المتنبئين الآخرين، إلا أنها ستظل تحظى بأعلى اهتمام/أوزان، مما يدل على أن CORTA-Net يولي اهتماما أكبر للاعتماد الزمني قصير المدى مقارنة بالاعتماد على الذاكرة طويلة الأمد. في الشكل 9B، يقدم الباحثون تقييمات تجمعية للأهمية النسبية لجميع ميزات المدخلات عبر جميع عينات الاختبار في التنبؤ ب PM2.5 لدلهي؛ يتم تحديد تأخر PM2.5، وسرعة الرياح، ودرجة الحرارة، وعدد الحرائق كأهم ميزات التنبؤ المدخل. في الشكل 9C، يوضح المؤلفون أنماط الانتباه متعددة الرؤوس في CORTA-Net، حيث يلتقط كل رأس علاقات زمنية و/أو على مستوى الميزات المختلفة ولكن المتكاملة، بين ميزات الإدخال، مما يسمح له بتعلم تمثيل أغنى لميزات الإدخال. في الشكل 9D، يوضح المؤلفون تدفق الانتباه مع خطوة زمنية مع مرور الوقت بالنسبة ل PM10، موضحين كيف يتغير الانتباه مع مرور الوقت بناء على مستويات PM10 . على الرغم من أن أوزان الانتباه يمكن تفسيرها كمؤشرات على الأنماط العامة لمعالجة كورتا-نت للبيانات البيئية المقدمة بشكل متسلسل، بالإضافة إلى أولوية كل ميزة مقدمة بشكل متسلسل، إلا أن أوزان الانتباه لا توفر دليلا مباشرا على العلاقات السببية. ومع ذلك، لم تقدم هذه الأبحاث رؤى حول كيفية توفير بيانات بيئية متتابعة لعمليات كورتا-نت، مما يحسن من قابلية تفسير توقعاتها (الجدول التكميلي 3).

figure-results-3
الشكل 9: التصورات البصرية القائمة على الانتباه لسلوك نموذج CORTA-Net. تظهر أوزان الانتباه لتوضيح كيفية توزيع النموذج للتركيز عبر ميزات الإدخال والخطوات الزمنية أثناء التنبؤ ويجب تفسيرها كمؤشرات لسلوك النموذج بدلا من دليل على العلاقات السببية. (أ) خريطة انتباه لحالة واحدة تظهر أوزان الانتباه المخصصة لميزات الإدخال والملاحظات التاريخية الحديثة لتوقع فردي. (ب) أهمية الميزات المجمعة بناء على أوزان الانتباه عبر مجموعة بيانات الاختبار، مع تسليط الضوء على المساهمة النسبية لكل متغير مدخل في توقع PM₂.₅. (ج) أنماط انتباه متعددة الرؤوس تظهر كيف تلتقط رؤوس الانتباه المختلفة تمثيلات مكملة على مستوى السمات والزمن. (د) توزيع الانتباه الزمني الذي يوضح الأهمية النسبية لخطوات الزمن التاريخية أثناء التنبؤ. بشكل عام، حصلت المتأخرات PM₂.₅، وعدد النيران، وسرعة الرياح (WDS)، والرطوبة، ودرجة الحرارة على أعلى أوزان انتباه، مما يدل على أهميتها في عملية التنبؤ بالنموذج. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

يقارن الشكل الإضافي 6A–B بين CORTA-Net ونماذج الأساس باستخدام MAE وRMSE وR2. أشارت قيم MAE وRMSE المنخفضة إلى خطأ توقع أقل، بينما تشير R2 الأعلى إلى تباين تفسير أفضل. أظهر CORTA-Net خطأ تنبؤي أقل من النماذج الأساسية المقيمة تحت نفس التقسيم التجريبي. ومع ذلك، يجب تفسير المقارنة ضمن مجموعة بيانات محطة المراقبة المختارة في دلهي ونفس خط معالجة ما قبل المعالجة. يلخص الشكل التكميلي 7 الترتيب النسبي لنماذج CORTA-Net والنماذج الأساسية عبر المقاييس المبلغ عنها. يسلط الشكل التكميلي 8 الضوء على المكونات الرئيسية التي تساهم في أداء النموذج، بما في ذلك اختيار الميزات، وتعلم النقل، ونمذجة التسلسل الزمني، والانتباه متعدد الرؤوس.

يتم إجراء التقييم الذي يقارن أداء CORTA-Net مع بعض النماذج الأساسية في الشكل التكميلي 7A–C باستخدام مخطط الرادار، الذي يعرض النموذج الوحيد الذي يقيس أعلى (أو أقل) من نظاراته عبر جميع المناطق المقاسة (RMSE المقلوب، MAE المقلوب، وقيم R2 ). حقق كورتا-نت أفضل تصنيف عام في الشكل التكميلي 7B، كما كان في المراكز الأولى لعدة مؤشرات أخرى تم قياسها. يعرض الشكل التكميلي 7C التحسينات في الأداء بين CORTA-Net والخطوط الأساسية المتعددة، كما تم قياسها بواسطة CORTA-Net، مما يظهر مكاسب كبيرة مقارنة بالخطوط الأساسية في هذه الدراسة. أما التحسن الأكثر دلالة فيظهر في RMSE (22.8٪)، تليها قيم MAE (24.1٪) وقيمR 2 (زيادة من 39.3 إلى 72.2٪ لتفسير التباين في كل نتيجة). يوفر ملخص كورتا-نت نظرة عامة على نقاط قوته. تشمل هذه القدرة على تطبيق اهتمام متعدد الرؤوس لتقييم الأهمية، والاندماج الزمني لبيانات المستشعرات للتنبؤ بالملوثات المستقبلية، ومقاومة التغيرات في أحداث التلوث (مثل العواصف الشديدة)، والأداء المتسق عبر جميع معايير النجاح في بيئة متعددة الوظائف. تتفوق كورتا-نت على جميع نماذج التعلم العميق الحالية الأخرى بناء على قدرتها التنبؤية.

توفر البيانات:
تأتي بيانات جودة الهواء في هذه الدراسة من المراقبة العامة التي يقدمها المجلس المركزي لمكافحة التلوث ولجنة مكافحة التلوث في دلهي، حيثما توفرت. تم الحصول على بيانات الأرصاد الجوية من سجلات إدارة الأرصاد الجوية الهندية أو من مصادر عامة للبيانات الجوية. تم اشتقاق بيانات عداد الحرائق المشتقة من الأقمار الصناعية من منتج الحريق النشط MODIS. بالنسبة للتقرير، تتوفر مجموعات البيانات المعالجة، وقوائم الميزات المختارة، ومعلمات التطبيع، والكود المطلوب لإعادة إنتاج التجارب المبلغ عنها عبر رابط المستودع المخطوط: https://github.com/saravagnamahasiva/CORTA-Net. تبرز المخطوطة قابلية التكرار من خلال توفير تحديد واضح لمصادر البيانات، وخطوات المعالجة المسبقة، وعتبات اختيار الميزات، ومكونات النموذج، وأقسام التقييم، والمقاييس المبلغ عنها. يتم تقييم النموذج من خلال تقسيمات تدريب واختبار وتحقق زمنية متكاملة. تم اشتقاق معلمات المعالجة المسبقة من بيانات التدريب ثم تطبيقها على بيانات الاختبار والتحقق من الصحة. تقدم النتائج كنتائج محددة لتقسيماتها، ويتم تجنب الادعاءات الأكثر عمومية.

الشكل الإضافي 1: خريطة منطقة الدراسة في دلهي. خريطة منطقة الدراسة لدلهي تظهر مواقع أربع محطات مراقبة جودة الهواء (قطاع دواركا 8، أناند فيهار، موندكا-DPCC، وسونيا فيهار) المدرجة في هذه الدراسة لجمع بيانات PM��l.₅ وتطوير النماذج. يرجى الضغط هنا لتحميل هذا الملف.

الشكل التكميلي 2: الاتجاه السنوي لعدد النيران (2012–2024). تساهم حوادث الحرائق في تلوث الهواء، كما يتضح من اتجاهات FIRECOUNT من 2012 حتى 2024. يرجى الضغط هنا لتحميل هذا الملف.

الشكل الإضافي 3: رسم دالة الارتباط الذاتي (ACF) لوظيفة PM₂.₅ بالساعة. يظهر الارتباط الذاتي لPM2.5 المتوقع عند 30 تأخر ارتباطا إيجابيا قويا عند معظم التأخيرات، مما يؤكد أن PM2.5 في دلهي يظهر اعتمادا زمنيا قويا واستمرارية متعددة الأيام. يرجى الضغط هنا لتحميل هذا الملف.

الشكل الإضافي 4: البنية الداخلية لوحدة LSTM. تحل شبكة LSTM (الذاكرة طويلة المدى القصيرة) مشكلة الاعتماد طويل الأمد في شبكات الأعصاب المتكررة القياسية (RNNs) من خلال تنظيم تدفق المعلومات عبر حالة خلوية مخصصة تعمل كحزام ناقل للذاكرة. يرجى الضغط هنا لتحميل هذا الملف.

الشكل الإضافي 5: مخطط كتلة الانتباه متعدد الرؤوس. الانتباه متعدد الرؤوس يمدد الانتباه الذاتي عن طريق تقسيم المدخلات إلى رؤوس متعددة، مما يمكن النموذج من التقاط علاقات وأنماط متنوعة. يرجى الضغط هنا لتحميل هذا الملف.

الشكل التكميلي 6: مقارنة الأداء العامة لنماذج CORTA-Net والتنبؤ الأساسي. تم تقييم أداء النموذج باستخدام متوسط الخطأ المطلق (MAE)، والجذر المتوسط التربيعي للخطأ (RMSE)، ومعامل التحديد (R2). تشير قيم MAE وRMSE المنخفضة إلى خطأ توقع أقل، بينما تشير قيم R2 الأعلى إلى تباين تفسير أفضل. (أ) الأداء المقارن ل CORTA-Net والنماذج الأساسية المقيمة بناء على مقاييس MAE وRMSE وR2. (ب) مقارنة شاملة تبرز الأداء التنبؤي النسبي للنماذج المقيمة تحت نفس تقسيم البيانات التجريبية. حقق CORTA-Net أخطاء تنبؤية أقل وأداء تفسيري أعلى من النماذج الأساسية المقيمة. يرجى الضغط هنا لتحميل هذا الملف.

الشكل التكميلي 7: تحليل الأداء المقارن لنماذج CORTA-Net والأساس باستخدام مقاييس تقييم متعددة. (A) مخطط رادار يقارن أداء النموذج المعياري بناء على RMSE المقلوب، وMAE المقلوب، وR2، مما يوضح التفوق العام ل CORTA-Net عبر المقاييس المقيمة. (ب) الترتيب النسبي للأداء ل CORTA-Net مقارنة بالنماذج الأساسية، مع تسليط الضوء على أدائها المتصدر باستمرار. (ج) تحسين نسبة مئوية ل CORTA-Net مقارنة بالنماذج الأساسية المقيمة ل MAE وRMSE وR2، مع إظهار مكاسب كبيرة في الدقة التنبؤية والتباين المفسر. (د) ملخص الخصائص الرئيسية ل CORTA-Net، مع تسليط الضوء على آلية الانتباه متعددة الرؤوس، ودمج الميزات الزمنية، ومتانته أمام أحداث التلوث، والأداء التنبؤي المتفوق باستمرار عبر جميع مقاييس التقييم. يرجى الضغط هنا لتحميل هذا الملف.

الشكل الإضافي 8: مقارنة فقدان التدريب والتحقق عبر العصور. هذا يظهر تقارب النماذج التدريجي والتعميم المستقر مع أقل قدر من الإفراط في التوافق. يرجى الضغط هنا لتحميل هذا الملف.

الجدول التكميلي 1: بنية نموذج كورتا-نت المقترح. نظرة عامة على بنية CORTA-Net، بما في ذلك كل مكون من مكونات الشبكة، ومواصفات الطبقات، ووظائف التفعيل، وعدد المعلمات القابلة للتدريب المستخدمة في التنبؤ ب PM₂.₅. يرجى الضغط هنا لتحميل هذا الملف.

الجدول التكميلي 2: إعدادات المعلمات الفائقة وتكوين التدريب لنموذج CORTA-Net المقترح. ملخص التصميم المعماري، إعدادات المعلمات الفائقة، تكوين التدريب، استراتيجية هندسة الميزات، معالجة البيانات المسبقة، إعداد تعلم النقل، ومعايير التقييم المستخدمة لتطوير وتحسين النموذج المقترح. يرجى الضغط هنا لتحميل هذا الملف.

الجدول التكميلي 3: مقارنة الأداء للنموذج المقترح مع طرق التنبؤ الأساسية. مقارنة بين نماذج التعلم الآلي التقليدية والتعلم العميق مع الإطار المقترح من حيث اختيار الميزات، آلية الانتباه، تعلم النقل، والأداء التنبؤي المقاس باستخدام RMSE وMAE وR2يرجى الضغط هنا لتحميل هذا الملف.

الجدول التكميلي 4: مقارنة بين دراسات التنبؤ السابقة ب PM₂.₅ والنهج المقترح. ملخص دراسات التنبؤ الممثلة ل PM₂.₅، مع تسليط الضوء على منهجياتها، ومجموعات البيانات، والميزات الرئيسية للمدخلات، وإدراج نشاط الحريق، والأداء التنبؤي، وقابلية التفسير، والقيود المبلغ عنها، وكيف يعالج إطار CORTA-Net المقترح هذه القيود. يرجى الضغط هنا لتحميل هذا الملف.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تجمع كورتا-نت بين ثلاثة مكونات رئيسية في تسلسل واحد لتشكيل بنية هجينة. CorrXGBoost-Rank: مكون مخصص لاختيار الميزات يقضي على المتنبؤات الزائدة قبل مرحلة النمذجة الزمنية38. مشفر LSTM: يستخدم طبقات LSTM المكدسة لالتقاط التبعيات الزمنية قصيرة وطويلة الأمد في تسلسل الإدخال39 المختار لمدة 24 ساعة. طبقة الانتباه متعددة الرؤوس: تطبق على مخرج LSTM (مع أوزان الانتباه المرتبطة) كجزء من الخطوة الأخيرة من نموذج التسلسل الهجين CORTA-Net؛ يعزز قابلية تفسير المخرج النهائي دون أن يحل محل دور العمود الفقري الأساسي ل LSTM40. يتعلم مشفر LSTM الاعتماديات الزمنية من تسلسل نافذة الانزلاق المختار. تم تصميم CORTA-Net لتوفير نهج نمذجة تسلسلية هجينة حيث يقوم CorrXGBoost-Rank بتقليص المتنبئات الزائدة. وفرت طبقة الانتباه متعددة الرؤوس تجميعا موزونا لجميع مخرجات LSTM وتنتج كل من توقعات PM2.5 وأوزان الانتباه المرتبطة بها. المكونات الثلاثة ل CORTA-Net تختلف بشكل كبير عن بنية المحولات البحتة، بينما يستخدم CORTA-Net شبكات LSTM (المتكررة) لنمذجة التعلم التسلسلي، وتوفر الشبكات المتكررة الأساس الرئيسي للتعلم التسلسلي، ويعمل الانتباه كآلية تفسيرية.

هناك أربعة قيود رئيسية لإطار عمل كورتا-نت. أولا، استند تقييم النموذج إلى محطات مراقبة مختلفة في دلهي، لذا قد لا يعمم الأداء على المدن ذات مصادر الانبعاثات المختلفة، أو ظروف المناخ، أو مراقبة الكثافة/التكوين/إلخ. ثانيا، رغم أن عدادات الحرائق من بيانات الأقمار الصناعية توفر دليلا لمتغيرات الحريق، إلا أنها قد لا توفر تمثيلا كاملا لشدة الحريق، أو نقل العموم، أو التحولات الكيميائية. ثالثا، يمكن أن تؤثر أجهزة الاستشعار أحادية الاتجاه، والبيانات المفقودة، والتغيرات في محطات المراقبة الفردية أو شبكات المراقبة المهيأة على جودة وموثوقية بيانات السلاسل الزمنية. رابعا، رغم أن الانتباه مفيد للمعلومات، إلا أنه لا يعني وجود علاقة سببية. سيتطلب التقييم الإضافي استخدام CORTA-Net داخل مدن مستقلة أخرى وشبكات مراقبة إضافية. في محاولة لتحسين دقة تقديرات نقل تلوث الهواء الإقليمي من خلال استخدام تقنيات جديدة، طور الباحثون إطارا واعيا بالنقل. يدمج الإطار بيانات إضافية مثل استخراج الميزات من مجموعات بيانات الأرصاد الجوية والاستشعار عن بعد، ومراقبة جودة البيانات، واستيعاب البيانات في الوقت شبه الحقيقي، وتقدير عدم اليقين، وإعادة معايرة النموذجبشكل متكرر 41. طور فريق البحث مجموعة شاملة من الأدوات الحاسوبية لمعالجة هذه القضايا، بما في ذلك المحسنات التكيفية لتدريب النماذج وضبط المعاملات، والتعلم الانتقالي للاستفادة من البيانات الموجودة لتحسين القدرة التنبؤية، وتقنيات النمذجة المتسلسلة الزمنية المتسلسلة، والنمذجة القائمة على الانتباه، وقابلية تفسير النماذج. بالإضافة إلى ذلك، يتيح دمج الذكاء الاصطناعي القابل للتفسير في إطار عمل كورتا-نت الربط المباشر بين التنبؤات والمعرفة العلمية بالعوامل الرئيسية المساهمة في تلوث الهواء. على سبيل المثال، يسمح الذكاء الاصطناعي القابل للتفسير بتحديد نشاط الحرائق الذي يحدث في فترة ما بعد الرياح الموسمية كمساهم كبير في تلوث الهواء. يؤكد التحقق المتقاطع لأداء النموذج (دلهي RMSE = 3.19، R2 = 0.983) فعالية CORTA-Net، بينما تشير التصورات المعتمدة على الانتباه لمخرجات النموذج إلى أن الأنماط التي تهم صناع القرار وممارسي الصحة العامة يمكن ملاحظتها. أخيرا، فإن استخدام أعداد الحرائق وبيانات الانبعاثات غير المنضبطة كمدخلات في إطار CORTA-Net سيقلل بشكل بطبيعي من قابلية تعميم النتائج إلى مناطق أخرى، لأن استخدام مصادر تتم مراقبتها بسرعة أو بشكل ضعيف قد يعيق بشدة تنفيذ إطار عمل CORTA-Net42.

يتيح التمثيل الرسومي المعروض في الشكل 10 لصناع القرار والباحثين تصور العلاقات بين النماذج/الأنظمة المطورة باستخدام منهجيات مختلفة للتنبؤ ب PM₂.₅، حيث تمثل الأشرطة الملونة RMSE (أشرطة أقصر = دقة أكبر) وR2 (أشرطة أطول = تباين أكبر في الاعتبار)، مع تنظيم النماذج حسب النهج (تجميع المدن، المحطات الخاصة، السلاسل متعددة المتغيرات). تظهر التمثيلات الرسومية للعمق أنه لا يوجد نموذج واحد يتفوق بشكل متوقع عبر جميع الفئات؛ تفوق CORTA-Net باستمرار على نماذج مماثلة على مجموعات البيانات الحضرية عالية الضوضاء على مستوى المحطات التي تظهر تغيرا محليا كبيرا، بينما حقق MxConnect نتائج متوسطة إقليمية متفوقة عبر مجموعات بيانات مكانية أكثر خشونة، مما يوضح أهمية اختيار النماذج بناء على حجم البيانات التي يتم تحليلها (أي حجم مجموعات البيانات)، والدقة المكانية لمجموعات البيانات (أي مستوى الازدحام)، ومستويات الضوضاء في مجموعات البيانات (أي، الدقة) أو التباين المحلي. في الواقع، تكمن فرادة كورتا-نت في استخدامه لوزن الميزات التكيفي المدمج ضمن آلية انتباه متكررة متسلسلة لتقليل الوزن ديناميكيا للمدخلات أو المدخلات الزائدة ذات الضوضاء العشوائية العالية أثناء المعالجة الزمنية. يتم تحقيق ذلك من خلال تضمين وزن الميزات التكيفي ضمن تصميم بوابة مخصص قائم على الانتباه، على عكس معظم الأساليب المستخدمة حاليا والتي اعتمدت بشكل كبير على استخدام الأساليب الاستدلالية الثابتة (أي عتبات الارتباط أو PCA) قبل تطبيق النموذج كخطوة معالجة مسبقة (الشكل 10A). يوفر هذا النهج التكيفي والحساس للسياق في تحديد الأولويات المستخدم في CORTA-Net القدرة على إجراء تعديلات فورية بالنسبة للديناميكيات المحلية في الأنسجة الحضرية، حيث قد تؤدي النماذج الأبسط والأقل تعقيدا المصممة باستخدام مجموعات بيانات مدربة عالميا إلى نتائج تنبؤية متفوقة لمتوسطات مستوى الدول. تحدد العروض الرسومية المقارنة المعروضة في الشكل 10B بشكل جماعي العلاقة بين مقارنة النماذج، مما يوفر للباحثين وصناع القرار توجيها لاختيار النماذج لتطبيقها المحدد (أي قد يحدد مسارات إضافية للبحث المتعلقة بالتوقعات قصيرة الأجل ل PM₂.₅)

figure-discussion-1
الشكل 10: مقارنة الأداء التنبؤي لنماذج CORTA-Net والتنبؤ الأساسي. تم تقييم أداء النموذج باستخدام متوسط الخطأ المطلق (MAE)، والجذر المتوسط التربيعي للخطأ (RMSE)، ومعامل التحديد (R2). تشير قيم MAE وRMSE الأقل إلى دقة تنبؤية أفضل، بينما تشير قيم R2 الأعلى إلى تباين تفسير أكبر. (أ) الأداء المقارن لجميع النماذج المقيمة بناء على MAE وRMSE وR2، مع توفير تقييم شامل للدقة التنبؤية وملاءمة النموذج. (ب) مقارنة الأداء للنماذج الأعلى أداء، مع تسليط الضوء على القوة والقيود النسبية لنهج كورتا-نت وطرق المعيار. بشكل عام، تظهر المقارنة الأداء التنافسي ل CORTA-Net مع تسهيل التقييم البديهي لمعماريات النماذج المختلفة لتوقع PM₂.₅. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تظهر المقارنة أن CORTA-Net هو سير عمل هجين للتنبؤ PM₂.₅ بدلا من بنية محول مستقلة (الجدول التكميلي 4). أظهرت البنى الجديدة للمحولات قدرة كبيرة على تعلم الاعتمادات الزمنية طويلة المدى، لكن البنى الهجينة CNN-RNN وTransourer-LSTM تزيد من كفاءة التنبؤ من خلال الاستفادة من نقاط قوة كل بنية عصبية (كما هو موضح في الجدول 5). على عكس CORTA-Net، تعتمد العديد من نماذج CNN-RNN الهجينة والمحولات-LSTM الحالية على نموذج التسلسل للتعلم من مجموعة الميزات الكاملة المدخلة بدلا من إجراء فحص صريح للميزات قبل النمذجة الزمنية، بينما يستخدم CORTA-Net بيانات عد الحرائق الخارجية MODIS لنمذجة تأثيرات حرق الكتلة الحيوية. استخدام كورتا-نت لأوزان الانتباه لتقييم كيفية تأثير كل متنبئ على مساهمة المتنبئ التراكمي، بالنسبة للوقت (أي الوزن المجمع زمنيا)، ومراحلها الثلاث المختلفة كلها تساهم في الخطأ الكلي المرتبط بكورتا-نت، مع أن الجمع بين الثلاثة يحمل أقل خطأ يقاس مقابل مجموعة بيانات محطة المراقبة في دلهي تحت التقييم43. باختصار، المساهمات العملية ل CORTA-Net تدمج بشكل متكرر أربعة مجالات ذات صلة في التنبؤ قصير الأمد ب PM₂.₅: اختيار الميزات، تعلم النقل الزمني، إثراء نشاط الحريق الخارجي، والتفسير القائم على الانتباه. اجمع النتائج حسب النموذج ومصدر البيانات (إعادة تحليل ERA5 عالميا إلى الحضر الحضري المتعدد المتغيرات حسب المدينة) (الشكل 10)، حيث يتمكن الباحثون بسهولة من مقارنة كيفية ارتباط أداء كل نموذج بكل من المتغيرات الرئيسية الثمانية المتعلقة بجودة كل نموذج في توقع تركيزات PM₂.₅ بشكل عام.

المكونات الرئيسية للنموذجأفضل النتائج الرقمية المبلغ عنهاالفرق الرئيسي عن كورتا-نت
ARIMA للمكون الخطي، CNN-LSTM للمكون غير الخطي، محسن خنفساء الروث لضبط المعاملات الفائقةRMSE = 7.594، 14.940، 7.841، و5.496؛ متوسط المعدل = 5.285، 10.839، 5.120، و3.770؛ R² = 0.989، 0.962، 0.953، و0.953 عبر أربع مدننموذج AQI هجين قوي، لكنه يركز على AQI وتحسين النماذج؛ ولا يتضمن فحص CorrXGBoost الصريح أو تكامل عدد النيران MODIS
مشفر المحولات، مفك ترميز BiLSTM، التفسير القائم على SHAPبكين: RMSE = 3.0012، MAE = 1.7928، R² = 0.9694؛ تيانجين: RMSE = 4.4785، MAE = 3.1614، R² = 0.9621؛ شيجياتشوانغ: RMSE = 5.1646، MAE = 3.4057، R² = 0.9324يلتقط تبعيات AQI طويلة وقصيرة الأمد، لكنه يستخدم بشكل رئيسي بيانات تركيز الملوثات ولا يستخدم متغيرات عد الحرائق في MODIS أو تقليل رتبة CorrXGBoost قبل التسلسل
LSTM، الاهتمام الذاتي للمحول، تحسين سرب الجسيماتأفضل إعداد موسمي: R² = 0.98745 و0.95655 لمدينتين؛ تشمل القيم منخفضة الخطأ المبلغ عنها MAE = 0.83363 وRMSE = 1.0176 في أفضل إعدادنموذج محول-LSTM محسن بقوة، لكن الميزة الرئيسية فيه هي التحسين القائم على PSO بدلا من إزالة الميزات المتكررة وإثراء نشاط الحريق
CNN-LSTM مع مكونات شبكة كولموغوروف-أرنولد والوعي الجغرافيشنغهاي: RMSE = 1.9222 و R² = 0.9832؛ بكين: RMSE = 2.5213، مع RMSE أقل بنسبة 59.6٪ من LMS الأساسينموذج AQI قوي ومطلع جغرافيا، لكنه لا يتناول تحديدا توقعات PM₂.₅ دلهي أو يتضمن مدخلات عد الحرائق من MODIS لنوبات احتراق الكتلة الحيوية
منسجرات التعلم الآلي الكلاسيكية مع تحسين البحث الشبكيGBR: RMSE = 2.31; RF: MAE = 0.47 و RMSE = 2.95؛ XGBR: R² = 0.9781معيار مفيد للتعلم الآلي، لكن النماذج لا تمثل صراحة الاعتماد الزمني التسلسلي من خلال LSTM أو الانتباه
تم تحسين LSTM باستخدام خوارزمية البحث Sparrow؛ مقارنة مع CNN-LSTM وCNN-BiLSTM وPSO-LSTMSSA-LSTM: RMSE = 8.601، MAE = 6.317، R² = 0.946؛ PSO-LSTM: RMSE = 8.860، R² = 0.944؛ LSTM الأساسي: RMSE = 12.481، R² = 0.884يظهر قيمة LSTM المحسن، لكنه لا يستخدم متغيرات الانتباه متعدد الرؤوس، أو التكيف مع التعلم بالنقل، أو متغيرات نشاط الحرائق عبر الأقمار الصناعية
نموذج المحول مع أخذ عينات ناقص قائم على العنقود للأحداث عالية التلوث غير المتوازنةأفضل تكوين: RMSE = 2.080، MAE = 1.386، R² = 0.914قوي للتنبؤ ب PM₂₅ عالي الحدث، لكن التركيز على التعامل مع عدم التوازن بدلا من اختيار الميزات المتكامل، والتعلم الانتقالي، وإثراء عدد النيران، والتفسير القائم على الانتباه
مشفر الزمن فقط في LSTMRMSE = 7.56، MAE = 5.52، R² = 0.905يستخدم كخط أساس زمني داخلي تحت نفس الإعداد التجريبي في دلهي
LSTM مع اختيار الميزات المعتمدة على الارتباط وXGBoostRMSE = 4.24يظهر أن إزالة المتنبئات الزائدة والضعيفة تحسن التنبؤ قبل تعلم التسلسل
اختيار الميزات، وتعلم التحويل من نوع LSTM، والتركيز متعدد الاتجاهاتRMSE = 3.48، R² = 0.980يظهر القيمة المضافة لوزن الزمني والميزات القائم على الانتباه

الجدول 5: مقارنة منهجية بين CORTA-Net ونماذج التنبؤ PM₂.₅/AQI الحديثة والحالية. يختلف الإطار المقترح بشكل أساسي عن طرق التنبؤ الحديثة القائمة على المحولات أو الهجينة PM₂.₅. مقارنة أقوى مع أحدث ما في التقنية.

المساهمة الرئيسية لهذه الدراسة هي نهج التعلم العميق الهجين المسمى CORTA-Net، الذي يوفر طريقة متكاملة للتنبؤ بتركيزات PM2.5 قصيرة المدى في نيودلهي، الهند، التي تتميز ببيئة بناء معقدة. بدلا من الاعتماد على نماذج مقسمة تتكون من ثلاثة مكونات مستقلة (وحدة اختيار الميزات المبنية على CorrXGBoost-Rank لتقليل التكرار؛ وحدة LSTM معززة بتعلم النقل لترميز عدم ثبات الاعتمادات الزمنية؛ وآلية انتباه متعددة الرؤوس لتحقيق توقعات قابلة للتفسير وطويلة وقصيرة المدى)، يستخدم كورتا-نت نهجا قائما على خطوط الأنابيب لدمج هذه المكونات بشكل تآزري. يدمج هذا الإطار مدخلات المتغيرات الجوية وعدد حرائق MODIS وبيانات جودة الهواء المحيط في محاولة لإنشاء تمثيل أكثر شمولا للعوامل التي تساهم في تلوث PM2.5 . حقق CORTA-Net أداء أفضل بشكل ملحوظ من الأساسيات المعتمدة (Random Forest، XGBoost، LSTM، وLSTM القائم على الانتباه) باستخدام مقاييس تقييم صارمة، شملت قيم R2 عالية (0.983) وقيم RMSE منخفضة (3.19). أظهرت هذه الدراسات أن جميع عناصر CORTA-Net ساهمت بشكل كبير في أداء النموذج. قدمت آلية الانتباه متعددة الرؤوس في CORTA-Net قيمة إضافية لهذه الدراسة حيث أظهرت أن المؤشرات الرئيسية كانت قياسات PM2.5 الحديثة، وعدد الحرائق، والقياسات الجوية الجوية، مما يتماشى جيدا مع العمليات الجوية المعروفة ويوفر أيضا درجة ذات معنى من التفسير لهذا النموذج.

على الرغم من النتائج الواعدة، يعترف المؤلفون بوجود بعض القيود، بما في ذلك القيود الجغرافية (نيودلهي فقط) والاعتماد فقط على حرائق MODIS كمؤشرات حرارية لبيانات RS. سيركز البحث المستقبلي على التحقق من صحة أداء CORTA-Net في مجموعة متنوعة من المواقع الحضرية، بالإضافة إلى دمج خصائص الوعي بالنقل، مثل ارتفاعات الطبقة الحدودية ومسارات الرياح، في عملية النمذجة لزيادة قابلية التعميم. ومع ذلك، يعتقد المؤلفون أن كورتا-نت هو إطار عمل قابل للتطبيق وقابل للتكرار وقابل للتفسير لدعم صنع السياسات المعتمدة على البيانات وأنظمة الإنذار المبكر. تشير قدرة كورتا-نت على تحقيق أداء قوي في بيئة حضرية غنية بالبيانات لكنها معقدة، نيودلهي، إلى أن كورتا-نت جاهز للتنفيذ على نطاق واسع، مما يؤسس الأساس لتطوير معيار جديد في التنبؤ بجودة الهواء الحضرية.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لا يوجد تضارب مصالح لدى المؤلفين.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

مشروع دعم الباحثين من جامعة الأميرة نورة بنت عبد الرحمن رقم (PNURSP2026R300)، جامعة الأميرة نوره بنت عبد الرحمن، الرياض، المملكة العربية السعودية.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
Calibri fontMicrosoft CorporationURL: https://learn.microsoft.com/en-us/typography/font-list/calibriيُستخدم كخط أساسي مطلوب لمخططات الأرقام المصححة والملصقات.
CORTA-Net figure-generation scriptsالنصوص المخصصة لهذا المشروع CORTA-NetURL: https://github.com/saravagnamahasiva/CORTA-Netيُستخدم لإعادة إنشاء ملفات PDF للأرقام بجودة المنشورات مع التسميات والترتيب المصححين.
CORTA_Net_High_Resolution_Images.zipأرشيف الصور المقدم من المستخدمرقم الكتالوج/RRID: غير مطبق؛ أرشيف مصدر محلييُستخدم كمجموعة صور المصدر/المرجعية ولتحديد هوية الرقم.
GitHubGitHub, Inc.URL: https://github.com/يُستخدم كمضيف المستودع المقصود لرمز المشروع وملفات توليد الأرقام.
Matplotlibفريق تطوير MatplotlibRRID: SCR_008624; URL: https://matplotlib.org/يُستخدم لإعادة رسم الرسوم البيانية والمخططات والتسميات وعلامات اللوحة وأشكال PDF المتجهية.
NumPyمطورو NumPyRRID: SCR_008633; URL: https://numpy.org/يُستخدم للمصفوفات الحتمية والقيم المحاكاة في لوحات الأرقام المعاد إنشاؤها.
OpenAI CodexOpenAIURL: https://openai.com/codexيُستخدم للمساعدة في تحرير الكود وإعادة إنشاء الأرقام وتعبئة ملفات PDF والتحقق منها.
Pillowمساهمو PillowURL: https://python-pillow.org/يُستخدم لفحص وإعادة ضبط حجم وعرض معاينة الصور النقطية والتحقق من صحتها.
Popplerمطورو Poppler / freedesktop.orgURL: https://poppler.freedesktop.org/يُستخدم لتحويل ملفات PDF المولدة إلى معاينات PNG للتحقق من الجودة البصرية.
pypdfمساهمو pypdfURL: https://pypdf.readthedocs.io/يُستخدم للتحقق من أن كل ملف PDF للأرقام النهائي يحتوي على صفحة واحدة صالحة.
Pythonمؤسسة Python للبرمجياتRRID: SCR_008394; URL: https://www.python.org/يُستخدم كبيئة برمجة لتوليد الأرقام ومعالجة ملفات PDF.
ReportLabReportLab Inc.URL: https://www.reportlab.com/يُستخدم لإنشاء جدول المواد/الأدوات/البرامج الإلزامية كملف PDF.
Windows PowerShellMicrosoft CorporationURL: https://learn.microsoft.com/en-us/powershell/يُستخدم لتنسيق الملفات واستخراج الأرشيف وأوامر حزم ZIP النهائية.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

234 234

مقالات ذات صلة