Methodik
Ein überwachtes Schiebefenstermodell wurde erstellt, um den zukünftigen PM2,5-Wert zum Zeitpunkt t + 1 aus vorherigen stündlichen Beobachtungen vorherzusagen. Kandidaten-Eingabefensterlängen von 12, 24 und 48 Stunden-Zeitschritten wurden mittels Validierungsleistung bewertet, und die endgültige CORTA-Net-Konfiguration verwendete eine 24-stündige Eingabesequenz. Lineare Interpolation wurde verwendet, um fehlende Werte zu füllen; Ausreißer wurden mit der IQR-Methode entfernt; und alle Variablen wurden mittels Min-Max-Normalisierung skaliert, bevor verzögerte PM2.5-Features erzeugt wurden. Das CorrXGBoost-Rank-Verfahren wurde dann für die Auswahl der Funktionen angewendet. Erstens Pearson-Korrelationsfilterung behaltener Variablen mit |r| ≥ 0,30. Zweitens: hochredundante Merkmalspaare mit paarweise Korrelation |corr(xi, xj)| ≥ 0,85 wurden gefiltert, um die Multikollinearität zu reduzieren. Drittens wurde ein XGBoost-Regressor auf den verbleibenden Variablen trainiert, und Prädiktoren mit XGBoost-Gewinn-basierten Wichtigkeitswerten ≥ 0,015 wurden für die endgültige Modelleingabe beibehalten. Die endgültige CORTA-Net-Architektur bestand aus gestapelten LSTM-Schichten für temporale Codierung, einer Mehrkopf-Aufmerksamkeitsschicht für Feature- und Zeitstufen-Gewichtung sowie dichten Regressionsschichten für diePM-2.5-Schätzung . Das Modell wurde mit dem Adam-Optimierer trainiert, mit mittlerem quadratischem Fehlerverlust und frühem Stoppen. Die Modellbewertung wurde mittels RMSE und R2 über Training, Validierung, Tests und 10-fache Cross-Validierungspartitionen durchgeführt. Tabelle 2 stellt die Datenvorverarbeitung und die Feature-Engineering Zusammenfassung dar.
| Schritt | Verwendete Methode | Parameter / Schwellenwert | Zweck |
| Berechnung fehlender Werte | Prozentsatz fehlender Beobachtungen | Berichte variabel prozentual | Quantifiziert die Datenvollständigkeit |
| Kurz-Gap-Imputation | Lineare Interpolation | Lückenlänge ≤ 6 Stunden | Füllt kurze fehlende Intervalle aus |
| Ausreißererkennung | IQR-Methode | Q1 − 1,5 × IQR, Q3 + 1,5 × IQR | Entfernt ungültige Extremwerte |
| Normalisierung | Min-Max-Skalierung | Trainings-Set Min und Maximum | Standardisiert den Funktionsumfang |
| PM₂.₅ laggt | Verzögerte Variablen | lag₁, lag₂, lag₃ | Erfasst zeitliche Persistenz |
| Laufende Statistiken | Gleitende Durchschnitte | 3 Stunden, 6 Stunden, 12 Stunden, 24 Stunden | Erfasst kurzfristige Akkumulation |
| Feuerzahl-Merkmal | MODIS-FEUERZÄHLUNG | Gleichtags- / Vortagszählung | Repräsentiert den Einfluss des regionalen Feuers |
Tabelle 2: Datenvorverarbeitung und Zusammenfassung der Feature-Engineering. In Tabelle 2 erfolgt die Datenverarbeitung auf zwei Arten: Erstens durch die Reinigung und Transformation der Rohdaten (Vorverarbeitung) und zweitens durch Feature Engineering zur Erstellung/Auswahl bzw. Änderung von Eigenschaften (Features). Als Einheit helfen diese beiden Prozesse, Rauschen zu eliminieren oder zu reduzieren; fehlende Werte zu handhaben; Verbesserung der Datenkonsistenz; und mehr prädiktive Modelle zu erstellen.
Die Normalisierungsparameter wurden nur aus dem Trainingssatz geschätzt und dann unverändert auf die Test- und Validierungssets angewendet, um Informationslecks zu vermeiden.
Mathematische Formulierung des CorrXGBoost-Rangs
Sei X = {x1, x2, ...,x n} die Menge der Kandidaten-Eingabevariablen und y die Zielkonzentration PM₂.₅. Für jedes Merkmal xi wurde der Pearson-Korrelationskoeffizient mit der Zielvariablen wie folgt berechnet:
(1)
wobei cov(xi, y) die Kovarianz zwischen Merkmal xi und Ziel y ist und σxi sowie σy ihre Standardabweichungen sind. Beibehaltene Funktionen erfüllen: |ri| ≥ τr , wobei τr = 0,30 in dieser Studie gilt.
Paarweise Korrelationen wurden unter allen erhaltenen features_xi, xj berechnet, und wenn |corr(xi, xj)| > = τRot, wobei τRot = 0,85 gilt, wird das Merkmal mit der niedrigeren absoluten Korrelation zumPM-Ziel von 2,5 aus dem Merkmalset gestrichen. Dieser Prozess reduziert Variablen aus dem Funktionssatz, die Multikollinearität haben. Anschließend wurde ein XGBoost-Regressormodell an die verbleibenden Features angepasst, und für jedes Feature wurden Feature-Importance Scores mit XGBoost Importance berechnet; Features, die den i_i ≥ τxgb bei τxgb = 0,015 entsprechen, wurden im endgültigen Feature-Set (S") behalten, definiert als Sfinal = Scorr ∪ Sxgb, d. h. der Feature-Set, der durch das Filtern von Features auf Redundanz in Bezug auf Korrelation und das Entfernen aller Features auf Basis der XGBoost-Variablen-Importance definiert wird. Der Gesamtansatz bei der Merkmalsauswahl lautet wie folgt: Berechnen Sie die Feature-Ziel-Paarson-Paarson-Korrelation, verwerfen Sie Merkmale mit |r_i|< 0,30, verwerfen Sie Merkmale mit Paaren mit paarweisen Korrelationen ≥ 0,85, passen Sie XGBoost an die verbleibenden Merkmale an, behalten Sie Merkmale mit dem XGBoost Importance Score ≥ 0,015, definieren Sie die endgültig gewünschten Merkmale Sfinal=SKorr ∪ Sxgb, wobei Scorr die Features sind, die nach redundanter Korrelationsfilterung erhalten bleiben, und Sxgb die mit dem XGBoost Feature Importance Score ausgewählten Features. Der CorrXGBoost-Rank-Workflow ist daher: Berechnen Sie Feature-Target Pearson-Korrelation, entfernen Sie Features mit |ri| < 0,30, entfernen Sie hochgradig redundante Merkmale mit paarweiser Korrelation ≥ 0,85, trainieren Sie XGBoost auf die verbleibenden Variablen, behalten Sie Variablen mit dem XGBoost-Wichtigkeitswert ≥ 0,015 und verwenden Sie die Vereinigung der korrelationsselektierten und XGBoost-ausgewählten Variablen als endgültiges Merkmalsset. Die in dieser Studie verwendeten Parameter sind τr = 0,30, τrot = 0,85 und τxgb = 0,015.
Datenquellen
Die Autoren integrierten drei große Datensätze für die Studie; Dies sind Daten zu Luftschadstoffen (PM2,5, PM10, NO2, CO und SO₂), die die Autoren über CPCB (Central Pollution Control Board) / DPCC (Delhi Pollution Control Committee) zur Überwachung der Luftqualität, meteorologische Daten (Temperatur, Luftfeuchtigkeit, Windgeschwindigkeit/-richtung und Druck) vom indischen Meteorologischen Amt (IMD) sowie Satelliteninformationen zu aktiven Bränden von den MODIS Active Fire Products der NASA erhalten haben. Diese drei Datensätze decken den 12-Jahres-Zeitraum Januar 2012–Dezember 2023 ab und repräsentieren somit verschiedene Emissionsarten. Brandunfälle tragen zur Luftverschmutzung bei, wie in ergänzender Abbildung 2 dargestellt, die die FIRECOUNT-Trends von 2012 bis 2024 zeigt.
Langfristige Trends der Schadstoffe im Studienzeitraum
Abbildung 1 zeigt langfristige Trends der Schadstoffe über die Studienjahre (2012–2024). Die jährlichen Feuerzählungen und die durchschnittlichen PM₂.₅-Konzentrationen zwischen 2012 und 2024 weisen einen mäßig starken positiven Zusammenhang auf (r = 0,688), was darauf hindeutet, dass höhere Feueraktivität typischerweise mit höheren PM₂.₅-Konzentrationen zusammenhängt. Sowohl die gemessenen als auch die vorhergesagten PM₂.₅-Daten folgen einem ähnlichen Trend, was die Annahme stützt, dass die Verbrennung von Biomasse zur Partikelverschmutzung beiträgt. Obwohl es eine erhebliche zwischenjährliche Variabilität gibt, sind feuerbedingte Emissionen ein wichtiger Faktor bei der Bestimmung der PM₂.₅-Variabilität, was die Notwendigkeit eines regionalen Brandmanagements zur Verbesserung der Luftqualität unterstreicht. Die Autokorrelation des vorhergesagten PM2,5 bei dreißig Verzögerungen, wie in ergänzender Abbildung 3 dargestellt, weist bei fast allen dreißig Verzögerungen eine beträchtliche positive Autokorrelation auf und bestätigt, dass PM2,5 in Delhi eine starke zeitliche Abhängigkeit und mehrtägige Persistenz aufweist.

Abbildung 1: Langfristige PM₂.₅- und Brandzahlentrends von 2012 bis 2024. Abbildung 1 vergleicht die jährliche Variation der Feuerzählung mit beobachteten und vorhergesagten PM₂.₅-Konzentrationen. PM₂.₅ wird in μg/m3 angegeben. FIRECOUNT repräsentiert satellitenbasierte Feueraktivität von MODIS-Produkten. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
STL-Dekomposition (saisonale und trendbezogene Zerlegung unter Verwendung von Loess)
STL oder Seasonal and Trend Decomposition mit Loess ist ein iterativer Algorithmus, der die Aufschlüsselung von Zeitreihendaten in drei additive Komponenten ermöglicht, wie in Abbildung 2 dargestellt: Trend (langfristiger Trend) (Abbildung 2A), (Abbildung 2D), (Abbildung 2G), (Abbildung 2J), saisonale (zyklische Perioden) (Abbildung 2B), (Abbildung 2E), (Abbildung 2H), (Abbildung 2K) und Rest (Rauschen/Residual) (Abbildung 2C), (Abbildung 2F), (Abbildung 2I), (Abbildung 2L). STL hat sich als erfolgreich im Umgang mit den komplexen nichtlinearen Eigenschaften von Umweltdaten (wie PM2.5) erwiesen, bei denen viele andere analytische Techniken aufgrund variabler Amplituden im saisonalen Signal und durch das Vorhandensein von Ausreißern versagt haben. Die LOESS-Glättung ermöglicht eine genaue Trennung dieser Komponenten und erzeugt eine klarere Interpretation von Trends oder Mustern. Durch STL-Verarbeitung ist es möglich, die breiteren Aufwärtstrends von PM2,5 von den kürzeren täglichen/saisonalen Zyklen und von den unregelmäßigen Residuen innerhalb dieser Zyklen zu trennen. Diese Trennung ermöglicht es, festzustellen, welche Emissionen PM2,5 beeinflusst haben, im Gegensatz zu den meteorologischen Faktoren, die PM2,5 beeinflusst haben. Die Ergebnisse dieser Trennung helfen bei der genauen Vorhersage zukünftigerPM-2,5-Emissionen ; Bereitstellung von Daten für regulatorische Entscheidungen; und die Einhaltung der Standards für eine rigorose Deaggregation von Zeitreihendaten für Luftqualitätsstudien34. Durchschnittliche täglichePM-2,5-Konzentrationsmessungen an Überwachungsstationen in Delhi von 2012 bis 2024 zeigen minimale Veränderungen des PM2,5-Niveaus (d. h. keine signifikante Veränderung von 2022–24) insgesamt und äußerst begrenztes konsistentes Verhalten (oder Konsistenz derPM-2,5-Werte zwischen den vier Überwachungsorten). Die PM2,5-Niveaus in Dwarka Sektor 8 und Mundka-DPCC zeigen einen anhaltenden Abwärtstrend (d. h. weiter abnehmend), während Anand Vihar einen steigenden Trend zeigt (d. h. deutlich steigend) und Sonia Vihar einen leichten Aufwärtstrend (von einem sehr geringen Anstieg seit 2022). Darüber hinaus zeigten die Residuen der täglichenPM-2,5-Konzentrationen für jede der vier Überwachungsstationen, dass diePM-2,5-Konzentrationen stark von saisonalen (meteorologischen) Veränderungen beeinflusst wurden, die zu großen Schwankungen der durchschnittlichen täglichenPM-2,5-Konzentrationen für einzelne Stationen führten. Die täglichen PM2,5-Konzentrationen für die vier Überwachungsstationen in Delhi (2012–2024) sind in Abbildung 2 dargestellt.

Abbildung 2: STL-Dekomposition (Seasonal and Trend Decomposition Using Loess) Dekomposition der täglichen PM₂.₅-Konzentrationen an vier Messstationen in Delhi von 2022 bis 2024. Die Zeitreihe für jede Überwachungsstation ist in drei additive Komponenten unterteilt: Langzeittrend, saisonale Schwankung und Residuum (Rest). (A) Trendkomponente für Dwarka Sektor 8. (B) Saisonale Komponente für Dwarka Sektor 8. (C) Restbestandteil für Dwarka Sektor 8. (D) Trendkomponente für Anand Vihar. (E) Saisonale Komponente für Anand Vihar. (F) Restbestandteil für Anand Vihar. (G) Trendkomponente für Mundka-DPCC. (H) Saisonale Komponente für Mundka-DPCC. (I) Restbestandteil für Mundka-DPCC. (J) Trendkomponente für Sonia Vihar. (K) Saisonale Komponente für Sonia Vihar. (L) Restbestandteil für Sonia Vihar. STL, saisonale und trendbezogene Zerlegung mit Löss. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Abbildung 2 zeigt die zeitlichen Zersetzungen der täglichen PM2,5-Konzentrationen an vier städtischen Überwachungsstandorten im Jahr 2022–2024 und zeigt Muster von langfristigen Rückgängen, allmählichen Zuwächsen und großen täglichen Veränderungen auf. Diese Unterschiede lassen sich größtenteils auf physikalische Auswirkungen des Wetters zurückführen, also Veränderungen in der Höhe der planetaren Grenzschicht (PBL), wie etwa die Tagesausdehnung, die die vertikale Streuung erhöht und die Konzentrationen senkt, sowie nächtliche Kontraktion, wodurch Schadstoffe nahe am Boden bleiben und nachts einen höheren Höhepunkt entstehen. Weitere meteorologische Einflüsse stammen aus lokalen menschlichen Aktivitätsemissionen im Zusammenhang mit ihren Volumenzeiten (morgendliche/abendliche Spitzenzeiten), Industrien und deren Wechselwirkungen mit: ortsspezifischen Faktoren wie lokaler Topographie, Windgeschwindigkeit, relative Luftfeuchtigkeit und Jahreszeit (d. h. größere Korrelation im Winter), die stationsspezifische Veränderungen und langfristigen Rückgänge verursachen, könnten durch regulatorische Emissionskontrollen beeinflusst worden sein. was insgesamt zu Abwärtstrends führt.
Korrelation zwischen den Merkmalen
Abbildung 3 zeigt die Verteilung aller Eingabemerkmale, die im CORTA-Net-Modell verwendet werden. In den Panels zeigen Schadstoffvariablen (PM10 (Abbildung 3A), NO₂ (Abbildung 3B), CO (Abbildung 3C), SO₂ (Abbildung 3D)) rechtsverzerrte Verteilungen, die typisch für städtische Luftqualitätsdaten sind, während O₃ (Abbildung 3E) und Druck (Abbildung 3I) nahezu normale Muster35 aufweisen. Die Temperatur (Abbildung 3F) zeigt eine klare bimodale saisonale Struktur, die Luftfeuchtigkeit (Abbildung 3G) folgt einer breiten, gleichmäßigen Verteilung, und Windgeschwindigkeit (Abbildung 3H) zeigt eine Lichtschwanzverteilung. Diese Muster heben das heterogene statistische Verhalten der Prädiktoren hervor und begründen die Notwendigkeit von Feature Engineering und Normalisierung vor dem Modelltraining.

Abbildung 3: Verteilung der im CORTA-Net-Modell verwendeten Eingabemerkmale, einschließlich Luftschadstoffkonzentrationen und meteorologischen Variablen. Die Verteilungen veranschaulichen die statistischen Eigenschaften der Prädiktoren vor der Vorverarbeitung und dem Modelltraining. (A) PM₁₀ Konzentration. (B) NO₂-Konzentration. (C) CO-Konzentration. (D) SO₂-Konzentration. (E) O₃ Konzentration. (F) Lufttemperatur. (G) Relative Luftfeuchtigkeit. (H) Windgeschwindigkeit. (I) Atmosphärischer Druck. Schadstoffvariablen, insbesondere PM₁₀, NO₂, CO und SO₂, weisen rechtsverzerrte Verteilungen auf, wie sie typisch für städtische Luftqualitätsdaten sind, während O₃ und Atmosphärendruck ungefähr Normalverteilungen zeigen. Die Temperatur zeigt ein bimodales saisonales Muster, die Luftfeuchtigkeit ist breit verteilt, und die Windgeschwindigkeit konzentriert sich auf niedrigere Werte mit einer leichten Verteilung. Diese heterogenen Feature-Distributionen unterstützen den Einsatz von Feature Engineering und Normalisierung vor der Modellentwicklung. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Abbildung 4 zeigt das auf Gewinn basierende Feature-Importance-Ranking von XGBoost nach der CorrXGBoost-Rank-Vorverarbeitung für PM₂.₅-Prognosen. Das aktuelle Merkmals-Wichtigkeitsdiagramm zeigt, dass der Vortag PM₂.₅ der höchstbewertete Prädiktor mit einem Wichtigkeitswert von 0,280 ist, gefolgt von PM10 = 0,180, FIRECOUNT = 0,150, NO₂ = 0,120, CO = 0,080, Windgeschwindigkeit = 0,070, Temperatur = 0,040, Luftfeuchtigkeit = 0,030 und Jahrestag = 0,020. Die gestrichelte vertikale Linie stellt die tatsächliche XGBoost-Feature-Auswahlschwelle von 0,015 dar. Prädiktoren mit Wichtigkeitswerten höher oder gleich 0,015 wurden für den finalen CORTA-Net-Eingabesatz beibehalten, während Prädiktoren unterhalb dieser Schwelle, darunter SO₂ = 0,010, O₃ = 0,010, Druck = 0,005, Niederschlag = 0,005, Wochenende = 0,002 und Feiertag = 0,001, ausgeschlossen wurden. Diese Werte repräsentieren XGBoost-Gewinn-basierte Merkmals-Wichtigkeitswerte und sollten nicht als Pearson-Korrelationskoeffizienten oder kausale Effekte interpretiert werden.
Daher wurden nur die Merkmale, die einen Beitrag über dieser Schwelle erhielten, in das Modell einbezogen. XGBoost-Modelle verwenden ein Ensemble von Entscheidungsbäumen, die iterativ einen Baum erstellen, um eine Verlustfunktion zu minimieren, bekannt als Gradient Boosting. XGBoost berechnet die Bedeutung von Merkmalen anhand einer von drei Kennzahlen: Gewinn (wie stark die Aufteilung des Merkmals die Modellleistung verbessert), Gewicht (wie oft das Merkmal als Aufteilung für einen Baum gewählt wurde) oder Abdeckung (die Anzahl der Beobachtungen, die durch die Aufteilung beeinflusst werden). Das XGBoost-Modell basierte auf Daten zur Luftqualität (Schadstoffe, meteorologische Variablen) und konzentriert sich auf verzögertes PM2,5 , um PM2,5 autoregressiv vorherzusagen, was in PM2,5-Modellen für Delhi üblich ist und hilft, die zeitliche Persistenz von PM2,5 zu erfassen. Delhi_PM2.5 ist ein bedeutender Faktor aufgrund der hohen Autokorrelationseigenschaften feiner Partikel, die ebenfalls auf eine Trägheit der Verschmutzung durch die konstanten Emissionsquellen hinweisen. Die Windgeschwindigkeit ist ein bedeutender Faktor, da sie den Mechanismus für die Verteilung der Schadstoffe bildet; während niedrige Winde im Winter, wenn Inversionen vorhanden sind, Schadstoffe ansammeln können. NO2 korreliert mit PM2.5 aufgrund des Verkehrs/der Emissionen, während der Jahrestag einen Hinweis auf den jährlichen Emissionszyklus der Schadstoffe ist (d. h. niedrigere Emissionen am Wochenende). In Delhi weist PM2.5 aufgrund der stagnierenden Wintermeteorologie und der kontinuierlichen Emissionen von Fahrzeugen, Industrie und Biomasse28 eine hohe Selbstbeständigkeit auf. Wind unterstützt die Verteilung von Aerosolen, aber schwacher Wind < 2 m/s trug durch Inversionen zu einer Zunahme der Ansammlung von PM2,5 bei. Die Beziehung zwischen NO2 und PM2.5 ist ein Ergebnis ihres gemeinsamen Ursprungs (d. h. Verbrennung) und unterliegt zeitlichen Einflüssen (z. B. täglich vs. wöchentlich)36. Die vier Hauptfaktoren, die 93 % oder mehr der AQI-Variation erklären, sind Schwankungen der Schadstoffkonzentrationen durch verzögertePM-2,5-Ansammlung (93%+) und niedrige Windgeschwindigkeiten, die die Emissionen einfangen, die Emissionen von NO2/PM aus Fahrzeugen und der Industrie sowie tägliche Schwankungen im Verkehr37. Darüber hinaus ist die Geografie Delhis ein beitragender Faktor für das Fortbestehen von Inversionen in der Region und verschärft somit auch diePM-2,5-Konzentrationen . Hyperparameter-Tuning, Regularisierung und das Hinzufügen zusätzlicher Variablen (wie Temperatur) würden helfen, die Wahrscheinlichkeit von Überanpassungen zu verringern und die Gesamtmodellleistung zu verbessern. Die Umsetzung von operativen Strategien zur Reduzierung der PM-Emissionen sollte die Einführung täglicher Begrenzungen der PM-Emissionen, den Einsatz von Geräten mit Echtzeitüberwachung der Anwesenheit von PM und die Nutzung von Windenergie zur Verteilung von PM in den städtischen Grünflächen umfassen.

Abbildung 4: XGBoost gewinnbasiertes Feature-Importance Ranking nach CorrXGBoost-Rank Feature-Screening für PM₂.₅-Prognosen. Die Prädiktorbalken sind in absteigender Reihenfolge ihrer Bedeutung angeordnet. Die gestrichelte vertikale Linie stellt die tatsächliche XGBoost-Feature-Auswahlschwelle von 0,015 dar. Prädiktoren mit Werten ≥ 0,015 wurden für den finalen CORTA-Net-Eingabesatz beibehalten, während Prädiktoren unterhalb dieser Schwelle ausgeschlossen wurden. Das Ranking wird für das Feature-Screening und die Interpretation des Modellverhaltens verwendet und sollte nicht als kausale Attribution interpretiert werden. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
CORTA-net-Modellarchitektur
Abbildung 5 zeigt einen vorgeschlagenen PM 2.5-Vorhersagerahmen. Die ergänzenden Abbildungen 4 und 5 veranschaulichen die interne Anordnung der LSTM-Einheit und eine Darstellung des Multi-Head Attention-Blockdiagramms. Alle Datenquellen (z. B. Umgebungsbedingungen, meteorologische Beobachtungen, Brandaktivität sowie sowohl zeitliche als auch kontextuelle Aspekte der Daten) wurden vorbearbeitet, um sicherzustellen, dass sie zeitlich übereinstimmen, fehlende Daten (falls erforderlich) zugeordnet werden und sowohl der Entfernung als auch der Normalisierung von Ausreißern unterzogen wurden, bevor sie in einem der Modellbauprozesse eingesetzt werden. Die Architektur des Modells, Feature Engineering, Trainingskonfiguration, Datenkonfiguration, Transfer Learning, Evaluationsmetriken, Zukunftsprognosen und Implementierungsdetails sind in ergänzender Tabelle 1 dargestellt. Unter Verwendung des CorrXGBoost-Rank-Moduls wird der optimale Funktionssatz festgelegt, bevor eine Teilmenge davon in die LSTM-Architektur eingegeben wird, die durch die Integration von Multi-Head-Aufmerksamkeitsschichten verbessert wurde, um das Zeitreihenverhalten während der Modellierungsphase zu berücksichtigen. Sowohl die PM2.5-Prognose als auch die PM2.5-Feature-Bedeutung der Eingabemerkmale sowie mehrfache Aufmerksamkeitsgewichte als Aufmerksamkeitskarten wurden als Ausgaben bereitgestellt. Die interne LSTM-Einheitsstruktur und das Multi-Head-Aufmerksamkeitsblockdiagramm wurden als ergänzende Abbildungen 4 bzw. 5 aufgenommen, während Ergänzungstabelle 1 die Architekturparameter für jeden Schichttyp innerhalb dieser Architektur bereitstellt.

Abbildung 5: Gesamtarchitektur des CORTA-Net PM₂.₅ Prognosemodells. Ein Eingabevorhersageprozess umfasst Eingaben von Luftqualitätsindikatoren, Wetterindikatoren, Zeitindikatoren und MODIS (Moderate Resolution Imaging Spectroradiometer) Brandzählindikatoren. Für jeden dieser Schritte richtete der Algorithmus Zeitstempel aus, verwaltete fehlende Werte, filterte Ausreißer, normalisierte Daten und engineerte Features. Die finalen Prädiktoren wurden dann mit dem CorrXGBoost-Rank-Prozess ausgewählt. Anschließend wurden die ausgewählten Funktionen in Zeitsequenz-Schiebefenster platziert und durch einen LSTM-Encoder (Long Short-Term Memory) mittels Transfer Learning geleitet. Für jedes Merkmal und jeden Zeitpunkt wendet der Multi-Head-Aufmerksamkeitsmechanismus Gewichte an, bevor die kombinierte Ausgabe an die finale regressionsdichte Schicht gesendet wird, um die PM₂.₅-Vorhersage zu erzeugen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Ausbildung und Bewertung
Ein Schiebefenster-Ansatz wurde verwendet, um überwachte Lernsequenzen zu bilden. Das Training verwendete den Adam-Optimierer und den mittleren quadratischen Fehlerverlust (ergänzende Tabelle 2). Die Modellleistung wurde mittels RMSE und R2 über Trainings-, Validierungs-, Test- und Kreuzvalidierungspartitionen bewertet. Die Architektur des Modells, das Feature Engineering, die Trainingskonfiguration, die Datenkonfiguration, das Transfer Learning, Evaluationsmetriken, Zukunftsprognosen und Implementierungsdetails sind in der ergänzenden Tabelle 1 dargestellt. Abbildung 6 stellt die Trainingsdiagnostik für das CORTA-Net PM₂.₅ Vorhersagemodell dar. In den Panels zeigt Abbildung 6A die Trainings- und Validierungsverlustkurven und zeigt eine fortschreitende Fehlerreduktion mit optimalem Stopp bei Epoche 106. Die Entwicklung der Generalisierungslücke während einer Bewertung einer Overfit-Analyse wird durch die Divergenz zwischen Validierungs- und Trainingsdaten in Abbildung 6B illustriert. Insbesondere zeigt er Perioden, in denen die Divergenz vordefinierte Grenzen überschreitet; diese Informationen liefern Hinweise darauf, dass das Lernverhalten und die Verlustreduktionsmuster die Vorteile des geplanten Lernratenabfalls (LR) in kritischen Epochen als Mittel zur Verbesserung der Konvergenzstabilität veranschaulichen, wie in Abbildung 6C dargestellt. Diese Zahlen geben zusammen eine Zusammenfassung der Lerndynamik, der Verallgemeinerungsfähigkeit und der empfohlenen Trainingskonfiguration des Modells.

Abbildung 6: Trainingsdiagnostik für das CORTA-Net PM₂.₅ Vorhersagemodell. (A) Trainings- und Validierungsverlustkurven zeigen eine fortschreitende Fehlerreduktion während des Modelltrainings, mit vorzeitigem Stopp ab Epoche 106 basierend auf der Validierungsleistung. (B) Verallgemeinerungslücke zwischen Training und Validierungsverlust über Epochen hinweg, was die Entwicklung der Modellverallgemeinerung und Perioden erhöhter Divergenz veranschaulicht, die auf eine potenzielle Überanpassung hinweisen. (C) Lernratenplan, der den Einfluss des geplanten Lernratenabfalls auf die Optimierung während des Trainings zeigt. (D) Zusammenfassung des Konvergenzverhaltens des Modells, Nachweis stabiler Optimierung und der endgültigen Trainingskonfiguration, die für das CORTA-Net-Modell ausgewählt wurde. Zusammen illustrieren diese Diagnosen die Dynamik des Modells, die Konvergenzeigenschaften und die Verallgemeinerungsleistung während des Trainings. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.