Deze studie betrok geen menselijke proefpersonen of gewervelde dieren, noch het bemonsteren van weefsel. Alle gegevens die voor dit onderzoek zijn gebruikt, werden synthetisch gegenereerd met behulp van fysische voortplantingsmodellen en publiek toegankelijke meteorologische parameters. Daarom was er geen ethische goedkeuring van een Institutional Review Board (IRB) of Institutional Animal Care and Use Committee (IACUC) vereist.
Datasetgeneratie op basis van de fysische voortplantingstheorie. De dataset is opgebouwd om de uurlijkse atmosferische omstandigheden voor een optisch communicatiesysteem in vrije ruimte na te bootsen voor een volledig kalenderjaar (2024) onder Iraakse atmosferische omstandigheden. We hebben een synthetische database gemaakt met 1.500 monsters per uur.
Ten eerste werden de weersomstandigheden willekeurig toegewezen op basis van regionale trends: onbewolkte hemel (54,3%), stof (24,9%), mist (10,5%), regen (7,4%) en sneeuw (2,8%). Ten tweede werd voor elk monster het overeenkomstige fysische attenuatiemodel toegepast op basis van de weersomstandigheid, namelijk de wet van Beer-Lambert voor onbewolkte hemel, het Kim-model voor mist, de Carbonneau-theorie voor regen en de Mie-verstrooiingstheorie voor stofstormen. Ten derde werden de parameters van het FSO-systeem als volgt ingesteld: een zendvermogen van 20 dBm, een golflengte van 1550 nm, een transmissieafstand van 3 km, een zendopening van 2,5 cm en een ontvangstopening van 20 cm. Ten vierde werd de attenuatie in dB/km berekend voor elk monster. Ten slotte werd de volledige dataset willekeurig verdeeld in 1.200 trainingsmonsters (80%) en 300 testmonsters (20%). De gesimuleerde condities omvatten grote stofconcentraties in verband met zandstormen, regenstormen en temperatuurveranderingen van −4,89°C tot 47,99°C. De weersomstandigheden en parameterdistributies werden gekozen op basis van de Iraakse klimaatgegevens uit de periode 2020–2024. De vijf weersregimes (onbewolkte hemel, mist, regen, stofstormen en sneeuw) werden gekozen omdat ze het volledige spectrum aan atmosferische condities dekken die de FSO-attenuatie in Irak beïnvloeden, waarbij stofstormen bijzonder prevalent zijn in het Midden-Oosten. De historische meteorologische gegevens die in de Iraakse regio's zijn verzameld, werden gebruikt om de waarschijnlijkheidsdistributie voor elke weersomstandigheid te creëren. De resulterende distributie was als volgt: 54,3% onbewolkte hemel (de dominante toestand), 24,9% stof (representatief voor het zandstormprobleem in Irak), 10,5% mist (veelvoorkomend in de winters in Noord-Irak), 7,4% regen (lage neerslaghoeveelheden die typisch zijn voor Irak) en 2,8% sneeuw (soms in noordelijke berggebieden). De relevante meteorologische parameters werden gemodelleerd met waarschijnlijkheidsdistributies voor elke weersomstandigheid als volgt: de temperatuur werd gemodelleerd met een normale distributie (gemiddelde 28,55±11,18°C) tussen −4,89°C en 47,99°C op basis van Iraakse seizoensestremen; de vochtigheid werd gemodelleerd met een uniforme distributie (gemiddelde 42,01±25,56%) van 0% tot 100%; het zicht werd gemodelleerd met een log-normale distributie tussen 0,05 km en 29,99 km (gemiddelde 13,10±10,91 km) om rekening te houden met de frequente gebeurtenissen van laag zicht tijdens stofstormen; de stofconcentratie werd gemodelleerd met een exponentiële distributie tussen 0 en 4,96 mg/m3 (gemiddelde 0,74±1,30 mg/m3) met hogere waarschijnlijkheden voor lage concentraties en lange staarten voor extreme stofgebeurtenissen.
Het communicatiesysteem werd ontworpen met een zendvermogen van 20 dBm, een golflengte van 1550 nm, een transmissieafstand tot 3 km, een zendopening van 2,5 cm en een ontvangstopening van 20 cm om het divergentieverlies te compenseren. De parameters van het FSO-systeem werden verdeeld in twee groepen: vaste parameters die voor alle monsters gelijk bleven, en variabele parameters die werden gewijzigd tijdens het genereren van de dataset. Voor alle 1.500 monsters waren de volgende parameters vastgesteld: zendvermogen (20 dBm), werkingsgolflengte (1550 nm), zendopening (diameter 2,5 cm, efficiëntie 0,7) en ontvangstopening (diameter 20 cm, efficiëntie 0,7). Deze parameters waren vast omdat ze de fysieke specificaties van de FSO-systeemhardware zijn en niet veranderen bij verschillende weersomstandigheden. De dataset werd samengesteld uit 1.500 monsters waarbij de volgende parameters varieerden: temperatuur (−4,89°C tot 47,99°C), vochtigheid (0% tot 100%), zichtbaarheid (0,05 km tot 29,99 km), stofconcentratie (0 tot 4,96 mg/m3) en weersomstandigheid (heldere hemel, mist, regen, stof, sneeuw). Deze parameters werden aangepast volgens kansverdelingen afgeleid van Iraakse klimaatgegevens voor de jaren 2020–2024. Voor elk monster werd de attenuatiewaarde (dB/km) berekend met behulp van het overeenkomstige fysieke attenuatiemodel, op basis van de specifieke combinatie van weersomstandigheden en variabele parameters.
Fysische attenuatie werd gemodelleerd met behulp van het Carbonneau-model voor regen, de wet van Beer-Lambert voor onbewolkte lucht, de Mie-verstrooiingstheorie voor stof en het Kim-model voor mist24. De wet van Beer-Lambert is van toepassing bij onbewolkte hemelcondities, waarbij de attenuatie wordt gedomineerd door moleculaire verstrooiing en absorptie, die exponentieel afnemen met de afstand25. De extinctiecoëfficiënt α bij 1550 nm is te wijten aan Rayleigh-verstrooiing door luchtmoleculen en absorptie door atmosferische gassen26. Het Kim-model is een specifiek model voor mist dat attenuatie relateert aan het zicht via empirische coëfficiënten, afgeleid van grootteverdelingen van mistdruppels. De golflengte-afhankelijke exponent q houdt rekening met Mie-verstrooiing27. De belangrijkste parameter van het Carbonneau-model is de neerslaghoeveelheid R, aangezien de regenattenuatie afhankelijk is van de grootte en dichtheid van de regendruppels; de coëfficiënten zijn empirisch afgeleid bij 1550 nm en specifiek gekalibreerd voor optische golflengten28. De Mie-verstrooiingstheorie is toepasbaar op stofcondities, aangezien de grootte van stofdeeltjes (0,1–100 μm straal) vergelijkbaar is met de golflengte (1550 nm), en de complexe brekingsindex m = 1,55–0,005i voor stof uit het Midden-Oosten zowel verstrooiing als absorptie omvat29. De volgende fysieke attenuatiemodellen zijn geïmplementeerd met hun respectievelijke vergelijkingen en parameterinstellingen.
Voor heldere hemelomstandigheden werd de wet van Beer-Lambert gebruikt:
Aclear = 10×log₁₀(e(α×d)) (1)
waarbij α de extinctiecoëfficiënt is (gevarieerd met een normale verdeling gecentreerd op 0,02 dB/km met een variatie van ±0,005 dB/km bij 1550 nm onder heldere omstandigheden), en d de transmissieafstand is (vastgesteld op 3 km). Voor mistige omstandigheden is het Kim-model geïmplementeerd met behulp van de volgende vergelijking:
Afog = 10×ln(10)/V×(λ/550)−q (2)
waarbij V de zichtbaarheid in kilometers is (variërend van 0,05km tot 10km), λ de golflengte in nanometers is (vastgesteld op 1550nm), en q de coëfficiënt van de deeltjesgrootteverdeling is, berekend als: q=1,6 voor V>50 km, q=1,3 voor 6<V<50 km, q=0,585×V(1/3) voor 1 <V<6km, q=0 voor 0,5<V<1km, en q=0,5 voor V<0,5km. Voor regenomstandigheden werd het Carbonneau-model gebruikt:
Arain=0.023×R0.93 (3)
waarbij R de regenintensiteit is in mm/h (variërend tussen 0,25 en 50 mm/h volgens Iraakse regenregisters). De relatie voor extinctie-efficiëntie werd gebruikt voor de omstandigheden tijdens stofstormen met behulp van Mie-verstrooiing:
Adust=10×log₁₀(e(τ×L)) (4)
waarbij τ=∫₀^∞ πr2Qext(r,λ,m)N(r)dr, r de partikelstraal is (0,1–100μm volgens de Iraakse stofsamenstelling), Qext de extinctie-efficiëntie is berekend met de Mie-theorie, λ=1550nm, m=1,55–0,005i de complexe brekingsindex is voor stof uit het Midden-Oosten, en N(r) de partikelgrootteverdeling is gemodelleerd met een log-normale verdeling met een geometrisch gemiddelde straal van 2,5 μm en een standaarddeviatie van 2,0. Het attenuatiemodel werd als volgt geïmplementeerd voor sneeuwcondities:
Asnow = 0.1×S0.75 (5)
waarbij S de sneevalsnelheid is in mm/h (0,5–15 mm/h). Deze empirische vergelijking is gekozen op basis van werk uit de literatuur30, waarin attenuatiemodellen voor optische propagatie door sneeuw werden ontwikkeld met behulp van de Mie-verstrooiingstheorie toegepast op grootteverdelingen van sneeuwvlokken. De vergelijking is geldig voor sneevalsnelheden tussen 0,5 en 15 mm/h en gaat uit van droge sneeuwcondities met typische diameters van sneeuwvlokken van 1–10 mm. De coëfficiënt 0,1 en exponent 0,75 zijn verkregen uit curve-fitting van Mie-verstrooiingsberekeningen30 voor sneeuw bij 1550 nm. De vergelijking is niet gecorrigeerd voor natte sneeuw of gemengde neerslag, die variabele attenuatie-eigenschappen kunnen hebben, hoewel het een redelijke schatting biedt voor droge sneeuw. Omdat de aanpak computationeel efficiënt is, vaak wordt geciteerd in FSO-publicaties en geschikt is voor de voorspelde sneeuwomstandigheden in Noord-Irak (Koerdistan-regio in januari en februari), is deze gekozen voor dit onderzoek. Met behulp van Numpy voor numerieke berekeningen zijn alle modellen geïmplementeerd in Python 3.9. Het bijbehorende model werd toegepast op de willekeurig gekozen weersomstandigheid en bemonsterde omgevingsgegevens om de attenuatiewaarde voor elk monster te berekenen. De verkregen weersverdeling omvatte 814 onbewolkte omstandigheden (54,27%), 375 stofgebeurtenissen (25,00%), 157 mistgebeurtenissen (10,47%), 111 regengebeurtenissen (7,40%) en 43 sneeuwgebeurtenissen (2,87%).
Voor het vaststellen van de proporties van weerssituaties is gebruikgemaakt van het onderzoek naar historische meteorologische informatie die tussen 2020 en 2024 is verzameld via Iraakse meteorologische stations in verschillende regio's (Bagdad, Basra, Mosul en Ramadi). De oorspronkelijke gegevens werden geleverd door het Iraakse Ministerie van Transport en de Iraqi Meteorological Organization and Seismology (IMOS). De gegevens bevatten dagelijkse weerverslagen waarin de actuele atmosferische omstandigheden voor elke dag werden genoteerd. Specifieke kenmerken die uit deze verslagen werden geëxtraheerd, waren onder meer temperatuur (dagelijks minimum, maximum en gemiddelde), relatieve vochtigheid, zicht, hoeveelheid neerslag en het voorkomen van stofstormen. Het open dataportaal van de Iraakse overheid (https://www.motrans.gov.iq/) biedt toegang tot een deel van de IMOS-gegevens; de specifieke verslagen die in deze studie zijn gebruikt, zijn echter niet openbaar opgeslagen in een centrale repository. De klimaatgegevens die zijn gebruikt om de percentages van weersomstandigheden en parameterwaarden te berekenen, zijn samengevat in Tabel 1. Onbewolkte dagen werden gedefinieerd als dagen zonder neerslag, met een zicht groter dan 10 km en geen stofactiviteit, wat 54,27% van de 1.825 geregistreerde dagen besloeg. Dagen met stofstormen (inclusief volledige stofstormen (zicht < 1 km) en zwevend stof (zicht 1–5 km)) maakten 25,00% van de dagen uit, wat wijst op de hoge frequentie van zandstormgebeurtenissen in het aride en semi-aride klimaat van Irak. Dagen met een zicht van minder dan 1 km als gevolg van de suspensie van waterdruppels (exclusief zichtvermindering door stof) werden geclassificeerd als mistdagen. Het percentage mistdagen was 10,47%, en mistdagen kwamen voornamelijk voor in de winter in de noordelijke regio's van Irak. Regendagen, dagen met meetbare neerslag >0,1 mm, bedroegen 7,40%, wat overeenkomt met de lage gemiddelde jaarlijkse neerslag in Irak van 150–200 mm per jaar. Sneeuwdagen (dagen met accumulatie van bevroren neerslag) maakten 2,87% van de dagen uit en waren beperkt tot bergachtige noordelijke gebieden (Koerdistan-regio) in januari en februari. Deze proporties werden later gebruikt als waarschijnlijkheidsgewichten voor willekeurige bemonstering bij de generatie van de dataset. De synthetische dataset reflecteert zo de reële frequentie van elke weersomstandigheid in de Iraakse omgeving.
Overwegingen met betrekking tot bias bij de generatie van synthetische data
Om mogelijke bias te verminderen, zijn verschillende stappen ondernomen:
(1) Selecteer de distributie: De statistische eigenschappen van de brongegevens van het klimaat werden gebruikt om kansdistributies te selecteren. De temperatuur was normaal verdeeld met een gemiddelde en standaarddeviatie zoals geregistreerd door de IMOS. De luchtvochtigheid was uniform verdeeld over het gehele waargenomen bereik (0-100%). Er werd aangenomen dat het zicht een log-normale distributie volgde om rekening te houden met het frequente voorkomen van gebeurtenissen met gering zicht tijdens stofstormen. De stofconcentratie volgde een exponentiële distributie, waarbij er hogere kansen waren bij lage concentraties en lange staarten bij extreme stofgebeurtenissen31. Dit was consistent met de waargenomen frequentie van stofgebeurtenissen in Irak32.
(2) Aandelen weersomstandigheden: Analyse van IMOS-gegevens voor 2020–2024, bestaande uit 1.825 dagelijkse waarnemingen in alle vier de regio's, leverde de volgende aandelen op: 54,3% onbewolkt, 24,9% stof, 10,5% mist, 7,4% regen en 2,8% sneeuw. Dagen zonder neerslag, met een zichtbaarheid >10 km en zonder stofactiviteit werden gedefinieerd als onbewolkte dagen. Dagen met stofstormen omvatten zowel volledige stofstormen (zichtbaarheid <1 km) als zwevend stof (zichtbaarheid 1–5 km). Een mistdag werd gedefinieerd als een dag waarop de zichtbaarheid minder dan 1 km was en de oorzaak een suspensie van waterdruppeltjes was (geen stof). Regendagen werden gedefinieerd als dagen met meetbare neerslag >0,1 mm. Sneeuwdagen werden gedefinieerd als dagen met opgehoopte bevroren neerslag33.
(3) Parameterbereiken: De parameterbereiken waren gebaseerd op de waargenomen extremen in de IMOS-gegevens: de temperatuur varieerde van −4.89 °C (Mosul, winter) tot 47.99 °C (Basra, zomer), het zicht varieerde van 0.05 km (zware stofstormen) tot 29.99 km (heldere omstandigheden), en de stofconcentratie varieerde van 0 tot 4.96 mg/m3 (gebaseerd op de waargenomen maximale stofconcentratie tijdens zware haboob-gebeurtenissen)34.
(4) Aannames over onafhankelijkheid: We gingen ervan uit dat de omgevingsparameters onafhankelijk werden bemonsterd, wat een vereenvoudiging is van praktijkomstandigheden waarin atmosferische variabelen gecorreleerd zijn (bijv. een hoge stofconcentratie correleert vaak met een laag zicht). Om een gecontroleerde simulatieomgeving te bieden voor een methodische modelvergelijking, is deze aanname van onafhankelijkheid gehanteerd 35. De gevolgen van deze aannames worden behandeld in de Discussie.
(5) Gestratificeerde splitsing: De train-test split werd gestratificeerd op basis van de categorie weersomstandigheid (heldere lucht, mist, regen, stof, sneeuw) om ervoor te zorgen dat de proportie van elke weersomstandigheid in de trainings- en testsets overeenkwam met de distributie van de oorspronkelijke dataset. Op deze manier is de testset niet ongebalanceerd met betrekking tot zeldzame weersomstandigheden (met name sneeuw met 2,87%)36.
Erkenning van deterministische doelwitgeneratie
Het is belangrijk om op te merken dat de goede voorspellende prestaties die hier worden waargenomen, gedeeltelijk kunnen worden toegeschreven aan het feit dat het model de deterministische fysische vergelijkingen leert of benadert die zijn gebruikt om de synthetische doelwaarden te genereren37. In tegenstelling tot experimentele metingen in de echte wereld, die meetruis, instrumentfouten en niet-gemodelleerde fysische fenomenen bevatten, biedt de synthetische dataset een zuivere, ruisvrije relatie tussen de inputkenmerken en de attenuatiedoelwaarde. Dit komt doordat de attenuatiewaarden rechtstreeks zijn berekend uit de fysische propagatiemodellen (Beer-Lambert-wet, Kim-model, Carbonneau-model en Mie-verstrooiingstheorie) op basis van de inputparameters. Daarom vertegenwoordigen de kwantitatieve prestatiegegevens (R2, RMSE, MAE) de prestaties op uit vergelijkingen afgeleide synthetische gegevens en mogen zij niet worden geïnterpreteerd als de verwachte prestaties bij ruisgevoelige observationele of experimentele gegevens. De resultaten moeten primair worden beschouwd als een vergelijkende evaluatie van modelleringsmethodologieën in een gecontroleerde simulatieomgeving38.
Volledige kenmerkenset voor modeltraining
De trainingsdataset bevatte 10 inputkenmerken voor de modeltraining:
1. Temperatuur (°C)
2. Luchtvochtigheid (%)
3. Zichtbaarheid (km)
4. Stofconcentratie (mg/m3)
5. Neerslagintensiteit (mm/h)
6. Sneevalsnelheid (mm/h)
7. Windsnelheid (m/s)
8. Luchtdruk (hPa)
9. Maand (numeriek, 1–12)
10. Seizoen (one-hot gecodeerd: lente, zomer, herfst, winter)
Belangrijke verduidelijking: De weersomstandigheden (heldere hemel, mist, regen, stof, sneeuw) werden gebruikt als een categorische variabele voor stratificatie tijdens de splitsing van de dataset en werden niet opgenomen als invoerkenmerken voor enig model. De SHAP-analyse bevat alleen de hierboven genoemde 10 kenmerken. De seizoensvariabele werd one-hot gecodeerd (4 categorieën: lente, zomer, herfst, winter), en voor de SHAP-analyse werden de bijdragen van de one-hot gecodeerde seizoensvariabelen over de seizoenen opgeteld om één enkele waarde voor de seizoensbijdrage te verkrijgen. Deze gecombineerde waarde vertegenwoordigt de totale bijdrage van alle seizoensgerelateerde variabelen aan de voorspelling van de attenuatie. Voordat de samenvattende figuur werd gemaakt, werden de vier one-hot gecodeerde seizoenskolommen geïdentificeerd en werden hun SHAP-waarden voor elk monster bij elkaar opgeteld. Deze methode garandeert dat het gebruik van het seizoen door het model als een samengestelde categorische variabele consistent is met de SHAP-analyse.
De belangrijkste omgevingsfactoren die de optische attenuatie via fysieke mechanismen direct beïnvloedden, waren kenmerken 1–6. De toevoeging van kenmerken 7 en 8 (windsnelheid en druk) als aanvullende meteorologische factoren kan een indirect effect hebben op de attenuatie door de luchtstabiliteit en aerosolverspreiding te beïnvloeden. Om rekening te houden met seizoensvariaties in de atmosferische omstandigheden, werden kenmerken 9–10 (maand en seizoen) opgenomen als temporele beschrijvers. De attenuatiewaarde (dB/km) werd gebruikt als de doelvariabele voor alle modellen. Belangrijke statistieken van de dataset omvatten temperatuur (28,55°C ± 11,18°C), vochtigheid (42,01% ± 25,56%), zichtbaarheid (13,10 ± 10,91 km; bereik: 0,05–29,99 km), stofconcentratie (0,74 ± 1,30 mg/m3; maximum: 4,96 mg/m3), attenuatie (4,80 ± 7,20 dB/km; bereik: 0,09–50,93 dB/km), operationeel bereik (5,74 ± 1,97 km), en signaal-ruisverhouding (64,88 ± 15,07 dB). Het operationele bereik en de SNR werden berekend uit de attenuatiewaarden met behulp van standaard FSO-linkbudgetvergelijkingen.
Berekening van het werkbereik
Het operationele bereik (in km) werd berekend met behulp van de linkbudgetvergelijking:
Prx=Ptx×Gt×Gr×(λ/(4πR))2×10(−A×R/10) (6)
waarbij: Prx = ontvangen vermogen (ingesteld op een minimale gevoeligheid van −30 dBm); Ptx = zendvermogen (vastgesteld op 20 dBm); Gt = zenderversterking (berekend op basis van de apertuurafmetingen); Gr = ontvangerversterking (berekend op basis van de apertuurafmetingen); λ = golflengte (1550 nm); R = bereik in km; A = atmosferische demping in dB/km (berekend op basis van de fysische modellen).
Versterking van zender en ontvanger: De zenderversterking (Gt) werd berekend als: Gt = 10×log₁₀[0.7×(π×0.025/1.55×10⁻6)2] ≈ 44.2 dBi. De ontvangerversterking (Gr) werd berekend als: Gr = 10×log₁₀[0.7×(π×0.20/1.55×10⁻6)2] ≈ 62.3 dBi. De zendopening had een diameter van 2.5 cm, met een efficiëntie van 0.7. De ontvangstopening had een diameter van 20 cm, met een efficiëntie van 0.7. De vergelijking werd iteratief opgelost voor R om de maximaal haalbare verbindingsafstand voor elke attenuatiewaarde te bepalen.
Berekening van de signaal-ruisverhouding
De SNR (signaal-ruisverhouding) in dB werd berekend met de volgende vergelijking:
SNR=Prx−10×log₁₀(kTB)−NF (7)
waarbij: Prx = ontvangen vermogen in dBm (berekend op basis van de linkbudget); k = 1.38×10⁻23 J/K (constante van Boltzmann); T = 290 K (ontvangerstemperatuur); B = 109 Hz (bandbreedte ontvanger, 1 GHz); NF = 3 dB (ruisgetal ontvanger). De ruisvloer werd als volgt berekend:
10 × log10(kTB) ≈ −84 dBm (8)
Voor elk monster werd, na het berekenen van de demping A met behulp van het toepaselijke fysische model, het werkingsbereik afgeleid door het linkbudget op te lossen voor R, en werd de SNR berekend op basis van het resulterende ontvangen vermogen Prx bij dat bereik.
Operationele bereikwaarden per weersomstandigheid: Het operationele bereik varieerde afhankelijk van de weersomstandigheden: heldere hemel (7,12 ± 1,85 km), mist (5,81 ± 1,92 km), sneeuw (5,42 ± 1,56 km), regen (3,81 ± 0,98 km) en stof (3,72 ± 1,08 km). In de huidige berekeningen is geen marge van 3 dB toegepast; het operationele bereik vertegenwoordigt het theoretische maximale bereik zonder systeemmarge. Het gerapporteerde operationele bereik (5,74 ± 1,97 km) is het algemene gemiddelde over alle weersomstandigheden39.
Vaste transmissieafstand: de transmissieafstand in de fysieke attenuatiemodellen werd ingesteld op 3 km. Dit is de linkafstand waarvoor de attenuatieberekeningen zijn uitgevoerd. Het gerapporteerde operationele bereik is de theoretische maximale afstand berekend met de linkbudgetvergelijking, welke kan afwijken van de vaste transmissieafstand van 3 km. Weerspecifieke attenuatiewaarden werden vastgelegd voor heldere omstandigheden (0,27±0,06 dB/km), mist (1,88±1,92 dB/km), sneeuw (6,45±2,54 dB/km), regen (13,58±6,32 dB/km) en stof (13,10±7,32 dB/km). Alle in dit manuscript gerapporteerde kwantitatieve waarden worden gepresenteerd als gemiddelde ± standaarddeviatie (SD), tenzij anders aangegeven40.
De cross-validatie R2 voor Random Forest wordt gerapporteerd als 0,960±0,007. In bepaalde gevallen, zoals temperatuur (−4,89 tot 47,99°C), zichtbaarheid (0,05 tot 29,99km), stofconcentratie (0 tot 4,96 mg/m3) en attenuatie (0,09 tot 50,93dB/km), wordt het bereik (laagst tot hoogst) verbaal weergegeven. De dataset werd gesplitst in subgroepen voor testen (300 monsters; 20%) en training (1.200 monsters; 80%). Voor de train-test split werd gestratificeerde steekproefname gebruikt. Om ervoor te zorgen dat het percentage van elke weersomstandigheid in de trainingsset (80%) en de testset (20%) overeenkwam met de distributie van de oorspronkelijke dataset, werd stratificatie toegepast op basis van de categorie weersomstandigheid (heldere hemel, mist, regen, stof en sneeuw). In het bijzonder werden 1.200 (80%) van de 1.500 monsters toegewezen aan de leerset en 300 (20%) aan de testset. Monsters werden willekeurig gekozen voor elke categorie meteorologische omstandigheden, waarbij de oorspronkelijke proporties werden behouden: van de 814 monsters met heldere hemel (54,27%) werden er 651 toegewezen aan training en 163 aan testen; van de 375 stofmonsters (25,00%) gingen 300 naar training en 75 naar testen; van de 157 mistmonsters (10,47%) gingen 126 naar training en 31 naar testen; van de 111 regenmonsters (7,40%) gingen 89 naar training en 22 naar testen; van de 43 sneeuwmonsters (2,87%) gingen 34 naar training en 9 naar testen. De willekeurige steekproefname binnen elk stratum werd uitgevoerd met een random seed van 42 om reproduceerbaarheid te garanderen. Deze gestratificeerde aanpak werd gekozen om een ongebalanceerde representatie van zeldzame weersomstandigheden (met name sneeuw met 2,87%) in de testset te voorkomen, wat anders zou kunnen leiden tot een onbetrouwbare prestatie-evaluatie voor die omstandigheden.
Evaluatie van het machine learning-model
Zes machine learning-methoden werden geëvalueerd, waaronder Support Vector Regression (SVR) met een radial basis function-kernel (C = 100), K-Nearest Neighbors (KNN; k = 10, afstandsgewogen), RF (200 bomen, maximale diepte = 20), Extreme Gradient Boosting (XGBoost; 200 estimators, maximale diepte = 10, learning rate = 0.1), Light Gradient Boosting Machine (LightGBM; 200 estimators, maximale diepte = 10, learning rate = 0.1), en een baseline Lineaire Regressie. Voor alle machine learning- en deep learning-modellen werd hyperparametermodificatie uitgevoerd voor de meest kritische parameters, terwijl voor niet-gespecificeerde parameters de standaardwaarden werden behouden. Voor machine learning-modellen werden de volgende parameters expliciet afgesteld met behulp van grid search met 5-voudige cross-validatie op de trainingsset: 1) Random Forest: aantal bomen (getest: 50, 100, 150, 200, 250) en maximale diepte (getest: 10, 15, 20, 25, geen limiet), waarbij optimale waarden van 200 bomen en diepte 20 werden geselecteerd. 2) XGBoost: aantal estimators (getest: 100, 150, 200, 250), maximale diepte (getest: 6, 8, 10, 12), en learning rate (getest: 0.05, 0.1, 0.2), met optimale waarden van 200 estimators, diepte 10 en learning rate 0.1. 3) LightGBM: identieke afstellingsbereiken werden gebruikt, wat resulteerde in 200 estimators, diepte 10 en learning rate 0.1. 4) SVR: de regularisatieparameter C (getest: 1, 10, 50, 100) en de kernelcoëfficiënt gamma (getest: 'scale', 'auto', 0.1, 0.01) werden afgestemd, met een optimale C = 100 en RBF-kernel. 5) KNN: het aantal buren k (getest: 3, 5, 7, 10, 15) werd afgestemd, met een optimale k = 10 en ingeschakelde afstandsgewogen stemming.
Alle overige parameters voor deze modellen zijn op hun standaardwaarden gelaten zoals gedefinieerd in scikit-learn (zie Tabel met Materialen voor de versie; bijv. Random Forest: bootstrap=True, min_samples_split=2, min_samples_leaf=1; XGBoost: subsample=1.0, colsample_bytree=1.0, gamma=0). Voor deep learning-modellen werden de architectuur (aantal lagen en eenheden per laag) en de dropout-rate (20%) handmatig afgesteld via iteratieve experimenten op de validatieset, terwijl de optimizer (Adam), de initiële learning rate (0.001), het geduld voor early stopping (20 epochs) en de parameters voor de verlaging van de learning rate (factor 0.5, geduld 10) werden ingesteld op basis van standaardpraktijken in de literatuur en constant werden gehouden voor alle deep learning-experimenten.
Bronnen van klimaatgegevens
De historische meteorologische informatie die tussen 2020 en 2024 is verzameld bij Iraakse weerstations op verschillende locaties (Bagdad, Basra, Mosul en Ramadi) werd gebruikt om de proporties van de weertoestanden en de verdelingen van de variabelen te berekenen. De ruwe gegevens werden verstrekt door het Iraakse Ministerie van Transport en de Iraqi Meteorological Organization and Seismology (IMOS). De gegevens bevatten dagelijkse weerregistraties met details over de overheersende atmosferische toestand voor elke dag. Specifieke variabelen die uit deze registraties zijn verkregen, omvatten de temperatuur (dagelijks minimum, maximum en gemiddelde), relatieve vochtigheid, zichtbaarheid, neerslaghoeveelheid en het voorkomen van stofstormen. De IMOS-gegevens zijn gedeeltelijk beschikbaar via het open dataportaal van de Iraakse overheid (https://www.motrans.gov.iq/), hoewel de specifieke records die in deze studie zijn gebruikt niet openbaar zijn gearchiveerd in een centrale repository. Een samenvatting van de klimaatgegevens die zijn gebruikt om de proporties van de weersomstandigheden en de parameterbereiken te bepalen, wordt gegeven in Tabel 1.
Vijfvoudige kruisvalidering werd toegepast op de trainingset (1.200 monsters) om hyperparameters af te stemmen en de prestaties van alle machine learning-modellen te schatten. Alle invoervariabelen (temperatuur, luchtvochtigheid, zichtbaarheid, stofconcentratie, neerslagsnelheid, sneevalsnelheid, windsnelheid, druk) werden geschaald via standaardisatie (Z-score normalisatie): x_scaled = (x − μ)/σ, waarbij μ en σ het gemiddelde en de standaarddeviatie van de trainingset zijn. Om datalekken te voorkomen, vond de standaardisatie binnen elke kruisvalideringsfold plaats op basis van uitsluitend de statistieken van de trainingsfold. Boomgebaseerde modellen (Random Forest, XGBoost, LightGBM) zijn schaalinvariant, maar om de consistentie tussen alle machine learning-modellen te waarborgen, werd dezelfde standaardisatie toegepast. Voor deep learning-modellen werd min-max normalisatie gebruikt: x_scaled = (x−x_min)/(x_max−x_min), wat kenmerken schaalt naar [0, 1] op basis van de min/max-waarden van de trainingset. Begrensde invoer leidt tot een snellere convergentie van neurale netwerken, wat de reden was voor deze keuze. De testset werd geschaald met behulp van de parameters die uit de trainingset waren verkregen en werd niet gebruikt voor modelselectie of het afstemmen van hyperparameters.
Volledige prestatiemetrieken werden vastgelegd, waaronder de determinatiecoëfficiënt van de test (R2), de root mean square error (RMSE), de mean absolute error (MAE), de R2 van de kruisvalidatie en de trainingstijd. De trainingstijden voor alle machine learning- en deep learning-modellen worden gerapporteerd in seconden (s) voor de snellere modellen (Lineaire Regressie, KNN, SVR, Random Forest, XGBoost, LightGBM) en in minuten (min) voor de tragere modellen (deep learning-architecturen). Alle modellen werden getraind in dezelfde computeromgeving om een eerlijke vergelijking te garanderen41.
De trainingstijd werd gemeten met de Python time-module, oftewel de verstreken kloktijd vanaf het begin tot het einde van de model-fittingfunctie, exclusief de tijd die nodig was voor het laden en voorbewerken van de gegevens. De trainingstijd voor een deep learning-model is de tijd die nodig is om alle epochs te voltooien tot aan de early stopping. Dit omvat forward propagation, backward propagation en validatiecontroles. Alle experimenten werden uitgevoerd terwijl het systeem geen andere rekenintensieve processen draaide om consistente tijdmetingen te verkrijgen. De tijden zijn het gemiddelde van 5 onafhankelijke runs (standaarddeviaties)42.
Evaluatie van deep learning-modellen
Zes deep learning-architecturen werden geëvalueerd met behulp van GPU-acceleratie, waaronder een Multilayer Perceptron (MLP; 64-32-16), een Deep Neural Network (DNN) met batch-normalisatie (128-64-32-16), een Long Short-Term Memory-netwerk (LSTM; 64-32 units, sequentielengte = 10), een eendimensionaal convolutioneel neuraal netwerk (1D-CNN), een hybride CNN–LSTM-model en een attention-gebaseerd netwerk. Alle deep learning-modellen werden geïmplementeerd met TensorFlow via de Keras API en uitgevoerd met GPU-acceleratie (zie Tabel met Materialen voor hardware/softwareversies). De 1D-CNN-architectuur bestond uit drie convolutionele lagen (64, 128 en 256 filters, kernelgrootte 3, ReLU-activatie, padding=’same’), twee MaxPooling1D-lagen (poolgrootte 2), een GlobalAveragePooling1D-laag, een Dense-laag met 128 units en ReLU-activatie, een Dropout-laag (0,2) en een Dense outputlaag (1 unit, lineaire activatie), met in totaal ongeveer 245.000 trainbare parameters. De hybride CNN-LSTM-architectuur accepteerde inputsequenties van 10 tijdstappen met 5 kenmerken, gebruikmakend van twee Conv1D-lagen (64 en 128 filters, kernelgrootte 3, ReLU, padding=’same’), een MaxPooling1D-laag (poolgrootte 2), twee LSTM-lagen (64 en 32 units, return_sequences=False), Dropout-lagen (0,2), een Dense-laag (32 units, ReLU) en een Dense outputlaag (1 unit, lineaire activatie), met in totaal ongeveer 198.000 trainbare parameters. Het attention-gebaseerde netwerk maakte gebruik van een multi-head attention-mechanisme met 4 heads (key- en value-dimensies van 64), waarbij de input werd geprojecteerd naar 64 dimensies, gevolgd door scaled dot-product attention (formule: Attention(Q, K, V) = softmax(QKT/√d_k), residuale verbindingen, layer-normalisatie, een feedforward-netwerk (128→64 units), global average pooling, Dropout (0,2), een Dense-laag (32 units, ReLU) en een Dense outputlaag (1 unit, lineaire activatie), met in totaal ongeveer 167.000 trainbare parameters43.
Alle modellen maakten gebruik van early stopping (patience = 20), verlaging van de leersnelheid (factor = 0.5, patience = 10), dropout (20%) en de Adam-optimizer (leersnelheid = 0.001). Voor alle deep learning-modellen was de batchgrootte ingesteld op 32 samples, het maximale aantal trainings-epochs was 200 met early stopping (patience = 20, herstel van beste gewichten), en de verliesfunctie was de gemiddelde kwadratische fout (MSE). De verdeling tussen training en validatie was als volgt: van de oorspronkelijke 1.200 trainingssamples (na de 80/20 train-test split) werd 80% (960 samples) gebruikt voor training en 20% (240 samples) voor validatie. We hebben de train-validatie split gestratificeerd op basis van weersomstandigheden om de distributie te behouden. De validatieset werd uitsluitend gebruikt voor early stopping, verlaging van de leersnelheid en het monitoren van overfitting; deze werd nooit gebruikt voor modelselectie of het afstemmen van hyperparameters buiten deze geautomatiseerde procedures. We hebben geen aparte validatieset gereserveerd voor de machine learning-modellen; in plaats daarvan hebben we vijfvoudige kruisvalidatie toegepast op de 1.200 trainingssamples om hyperparameters af te stemmen en de prestaties te schatten44.
Rechtvaardiging voor de evaluatie van LSTM- en CNN–LSTM-architecturen
De belangrijkste dataset bestaat uit onafhankelijk gegenereerde weermonsters, maar we hebben ook LSTM- en CNN–LSTM-architecturen getest om de volgende redenen: (1) atmosferische omstandigheden in de echte wereld zijn temporeel autocorrelated en het testen van sequentiegebaseerde modellen stelt ons in staat om te bepalen of het vastleggen van dergelijke afhankelijkheden de voorspellingsnauwkeurigheid kan verbeteren; (2) recent onderzoek naar atmosferische voorspellingen heeft de potentiële waarde van sequentiële architecturen aangetoond voor het modelleren van de temporele evolutie van meteorologische parameters34; (3) het testen van een diverse reeks architecturen zorgt voor een uitgebreide vergelijking van methodologische benaderingen, wat een belangrijke bijdrage van deze studie is; en (4) de hybride CNN–LSTM-architectuur combineert ruimtelijke kenmerkextractie met temporele modellering, wat gunstig kan zijn voor het vastleggen van de complexe interacties tussen meerdere atmosferische variabelen45.
Dataformatteing voor sequentiële modelinvoer
Voor de sequentiële architecturen (LSTM en CNN–LSTM) werden de inputgegevens via een sliding-windowbenadering omgevormd van onafhankelijke monsters naar pseudo-sequenties. In het bijzonder werden de 1.200 trainingsmonsters eerst gegroepeerd in categorieën van weersomstandigheden om de fysieke consistentie te behouden. Binnen elke weercategorie werden de monsters geordend op basis van hun gegenereerde tijdstempels (gesimuleerde uurlijkse waarnemingen voor het kalenderjaar 2024). Vervolgens werd een sliding window met een lengte van 10 toegepast om inputsequenties van 10 opeenvolgende tijdstappen te produceren (elk met 5 kenmerken: temperatuur, vochtigheid, zichtbaarheid, stofconcentratie en neerslagintensiteit) om de attenuatie op de 11e tijdstap te voorspellen. Deze methode behoudt de temporele volgorde van de gesimuleerde waarnemingen, terwijl sequentiële modellen in staat worden gesteld om temporele afhankelijkheden te leren. De structuur van de testset was identiek, met dezelfde windowgrootte en set kenmerken. We erkennen dat deze pseudo-sequentiële structurering een methodologische vereenvoudiging is en geen weerspiegeling vormt van temporele dynamiek in de echte wereld. We hebben dit als een beperking benoemd in de sectie Discussie.
Evaluatie van hybride benaderingen
Er werden drie hybride benaderingen onderzocht. De eerste benadering was een Voting Ensemble dat de voorspellingen van de Random Forest-, XGBoost- en Deep Neural Network-modellen middelde met gelijke gewichten (elk model kreeg een gewicht van 1/3), waarbij de uiteindelijke voorspelling als volgt werd berekend:
ŷensemble=(1/3)ŷRF+(1/3)ŷXGB+(1/3)ŷDNN (9)
Er werd gekozen voor gelijke weging om het introduceren van extra hyperparameters te voorkomen en om de baseline-prestaties van het ensemble te evalueren zonder bias ten opzichte van een individueel model. De tweede aanpak maakte gebruik van Ridge meta-learner stacking. De base learners waren Random Forest, XGBoost en een Deep Neural Network (gebaseerd op Attention). De stacking-procedure bestond uit twee fasen: eerst werd elke base learner getraind op de volledige trainingsset van 1.200 samples met behulp van 5-voudige kruisvalidatie om out-of-fold voorspellingen te genereren, waardoor een nieuwe meta-feature matrix van 1.200×3 ontstond (één voorspelling per base model per sample). Ten tweede werd een Ridge-regressie meta-learner (L2-regularisatieparameter alpha=1.0) getraind op deze meta-features, waarbij de oorspronkelijke attenuatiewaarden als target werden gebruikt, om de optimale combinatiegewichten voor de base learners te bepalen. De uiteindelijke stacking-voorspelling was:
ŷstacking=wRF×ŷRF+wXGB×ŷXGB+wDNN×ŷDNN (10)
waarbij de gewichten w werden aangeleerd door de Ridge meta-learner. De derde benadering was een Physics-Informed Neural Network dat 70% van de voorspellingen van het neurale netwerk combineerde met 30% van het Kim-model voor monsters onder mistige omstandigheden. De combinatie werd uitgevoerd door middel van een vaste gewogen gemiddelde met behulp van de volgende formule:
ŷhybrid=0.7×ŷneural+0.3×ŷKim (11)
waarbij ŷneural de output is van het op aandacht gebaseerde neurale netwerk, en ŷKim de attenuatie is die is berekend via het Kim-mistmodel op basis van de input voor zichtbaarheid. Voor monsters zonder mist werd het fysieke deel op 0 ingesteld en werd het model uitgevoerd als een puur neuraal netwerk. De wegingen (70% neuraal en 30% fysica) werden vastgesteld op basis van voorlopige experimenten op de validatieset (niet de testset), waarbij we de wegingscombinaties 90:10, 80:20, 70:30, 60:40 en 50:50 hebben getest. De 70/30-verdeling werd gekozen omdat deze de beste validatie R2 opleverde en nog steeds voldoende fysieke beperking vanuit het Kim-model behield om voorspellingen te regulariseren en fysiek onplausibele outputs te voorkomen, vooral bij mist waarbij het Kim-model vastgestelde theoretische attenuatiegrenzen biedt.
Analyse van kenmerkbelang en interpreteerbaarheid
Het Random Forest-model met op onzuiverheid gebaseerde kenmerkbelangrijkheid (variantiereductie) werd gebruikt om de belangrijkheidsrangschikking van alle 10 inputkenmerken te extraheren. De analyse toonde aan dat stofconcentratie (67,3%) en zichtbaarheid (21,2%) de belangrijkste voorspellers waren, die samen 88,5% van de totale voorspellende belangrijkheid verklaarden. Het op een na belangrijkste kenmerk was de regenvalintensiteit (6,0%), gevolgd door windsnelheid (2,1%), temperatuur (1,5%), luchtvochtigheid (0,9%), maand (0,5%), seizoen (0,3%), sneeuwvalintensiteit (0,1%) en atmosferische druk (0,1%). De lage belangrijkheidsscores voor de temporele kenmerken (maand en seizoen) geven aan dat seizoensvariaties in atmosferische attenuatie primair worden vastgelegd door onderliggende omgevingsparameters en niet uitsluitend door tijdsgebonden patronen.
Er werd een SHAP-analyse (Shapley Additive exPlanations) uitgevoerd om de relaties tussen omgevingsfactoren en attenuatie te evalueren. De gebruikte SHAP-implementatie was de TreeExplainer-module van de SHAP-bibliotheek, die specifiek is geoptimaliseerd voor boomgebaseerde modellen, waaronder Random Forest, XGBoost en LightGBM (zie Tabel met materialen voor versie). De configuratie voor de SHAP-analyse was als volgt: het getrainde Random Forest-model werd doorgegeven aan de TreeExplainer, die de SHAP-waarden berekende met de interventional (marginale) feature-attributiebenadering op basis van de conditionele verwachting van de output van het model. SHAP-waarden werden berekend voor alle 300 monsters van de testset, wat resulteerde in een matrix van 300 × 10 (één SHAP-waarde per kenmerk per monster). Voor elk kenmerk representeerde de SHAP-waarde de bijdrage aan de voorspelling ten opzichte van de baseline (de gemiddelde modelvoorspelling). Negatieve SHAP-waarden duidden op een neerwaartse verschuiving, terwijl positieve SHAP-waarden aantoonden dat het kenmerk de voorspelling van de attenuatie versterkte. De sterkte van de bijdrage werd aangegeven door de grootte van de SHAP-waarde. De distributie van SHAP-getallen voor elk kenmerk (met behulp van beeswarm-plots), de richting van de invloed (de correlatie tussen kenmerkwaarden en SHAP-waarden) en de rangschikking van het belang van kenmerken werden allemaal gevisualiseerd met behulp van summary plots. De ingebouwde plotfuncties van de SHAP-bibliotheek — shap.summary_plot() voor de beeswarm-plot en shap.bar_plot() voor het globale belang van kenmerken — werden gebruikt om alle SHAP-visualisaties te maken.
Verwerking van one-hot-gecodeerde variabelen: Om de seizoensvariabele te coderen, werden eerst vier binaire kolommen (lente, zomer, herfst en winter) gebruikt. Om voor de SHAP-analyse één enkele bijdrage-waarde voor het "seizoen" per monster te creëren, werden de bijdragen van deze vier one-hot-gecodeerde variabelen gecombineerd door de SHAP-waarden voor elke seizoenscategorie bij elkaar op te tellen. Om deze groepering te realiseren, werden alle kolommen die overeenkwamen met de one-hot-gecodeerde seizoensgroepen geïdentificeerd, werden hun SHAP-waarden voor elk monster geëxtraheerd en vervolgens elementsgewijs gesommeerd. De resulterende gecombineerde SHAP-waarden representeren de totale bijdrage van het seizoen aan de voorspelling van de attenuatie. Deze methode maakt een enkele rij voor "seizoen" in de SHAP-samenvattingsplot mogelijk en garandeert consistentie met het gebruik van het seizoen als samengestelde categorische variabele in het model. Omdat het gecombineerde getal een begrijpelijker beeld geeft van de totale bijdrage van het seizoen, werden de SHAP-waarden voor het seizoen niet afzonderlijk per seizoenscategorie weergegeven.