Cette étude n'a pas impliqué de participants humains ni d'animaux vertébrés, ni de prélèvement de tissus. Toutes les données utilisées pour cette recherche ont été générées de manière synthétique à l'aide de modèles de propagation physique et de paramètres météorologiques accessibles au public. Par conséquent, aucune approbation éthique d'un comité d'éthique (IRB) ou d'un comité institutionnel de soins et d'utilisation des animaux (IACUC) n'était nécessaire.
Génération du jeu de données fondée sur la théorie physique de la propagation. Le jeu de données a été conçu pour imiter les conditions atmosphériques horaires d'un système de communication optique en espace libre sur une année civile complète (2024) dans des conditions atmosphériques irakiennes. Nous avons créé une base de données synthétique comprenant 1 500 échantillons par heure.
Premièrement, les conditions météorologiques ont été attribuées aléatoirement selon les tendances régionales : ciel dégagé (54,3 %), poussière (24,9 %), brouillard (10,5 %), pluie (7,4 %) et neige (2,8 %). Deuxièmement, le modèle physique d'atténuation correspondant a été appliqué à chaque échantillon en fonction de la condition météorologique, à savoir la loi de Beer-Lambert pour le ciel dégagé, le modèle de Kim pour le brouillard, la théorie de Carbonneau pour la pluie et la théorie de la diffusion de Mie pour les tempêtes de poussière. Troisièmement, les paramètres du système FSO ont été fixés comme suit : puissance d'émission de 20 dBm, longueur d'onde de 1550 nm, distance de transmission de 3 km, ouverture d'émission de 2,5 cm et ouverture de réception de 20 cm. Quatrièmement, l'atténuation a été calculée en dB/km pour chaque échantillon. Enfin, l'ensemble complet de données a été divisé aléatoirement en 1 200 échantillons d'apprentissage (80 %) et 300 échantillons de test (20 %). Les conditions simulées incluent de fortes concentrations de poussière associées à des tempêtes de sable, des orages et des variations de température allant de −4,89 °C à 47,99 °C. Les conditions météorologiques et les distributions de paramètres ont été choisies en fonction des données climatiques irakiennes recueillies entre 2020 et 2024. Les cinq régimes météorologiques (ciel dégagé, brouillard, pluie, tempêtes de poussière et neige) ont été sélectionnés car ils couvrent tout le spectre des conditions atmosphériques affectant l'atténuation FSO en Irak, les tempêtes de poussière étant particulièrement fréquentes au Moyen-Orient. Les données historiques météorologiques recueillies dans différentes régions d'Irak ont été utilisées pour établir la distribution de probabilité de chaque condition météorologique. La distribution obtenue est la suivante : 54,3 % de ciel dégagé (état prédominant), 24,9 % de poussière (reflétant le problème des tempêtes de sable en Irak), 10,5 % de brouillard (fréquent lors des hivers dans le nord de l'Irak), 7,4 % de pluie (faibles précipitations typiques de l'Irak) et 2,8 % de neige (parfois observée dans les zones montagneuses du nord). Les paramètres météorologiques pertinents ont été modélisés à l'aide de distributions de probabilité pour chaque condition météorologique comme suit : la température a été modélisée selon une distribution normale (moyenne 28,55±11,18 °C) comprise entre −4,89 °C et 47,99 °C, en fonction des extrêmes saisonniers en Irak ; l'humidité a été modélisée selon une distribution uniforme (moyenne 42,01±25,56 %) allant de 0 % à 100 % ; la visibilité a été modélisée selon une distribution log-normale comprise entre 0,05 km et 29,99 km (moyenne 13,10±10,91 km) afin de tenir compte des fréquents épisodes de faible visibilité pendant les tempêtes de poussière ; la concentration de poussière a été modélisée selon une distribution exponentielle comprise entre 0 et 4,96 mg/m3 (moyenne 0,74±1,30 mg/m3), avec des probabilités plus élevées pour les faibles concentrations et des queues longues pour les événements extrêmes de poussière.
Le système de communication a été conçu avec une puissance d'émission de 20 dBm, une longueur d'onde de 1550 nm, une distance de transmission allant jusqu'à 3 km, une ouverture d'émission de 2,5 cm et une ouverture de réception de 20 cm afin de compenser les pertes dues à la divergence. Les paramètres du système FSO ont été divisés en deux groupes : les paramètres fixes, qui n'ont pas changé pour tous les échantillons, et les paramètres variables, modifiés lors de la génération du jeu de données. Pour l'ensemble des 1 500 échantillons, les paramètres suivants ont été fixés : puissance d'émission (20 dBm), longueur d'onde de fonctionnement (1550 nm), ouverture d'émission (diamètre 2,5 cm, rendement 0,7) et ouverture de réception (diamètre 20 cm, rendement 0,7). Ces paramètres ont été maintenus constants car ils correspondent aux spécifications physiques du matériel du système FSO et ne varient pas selon les conditions météorologiques. Le jeu de données a été créé à partir de 1 500 échantillons en faisant varier les paramètres suivants : température (−4,89 °C à 47,99 °C), humidité (0 % à 100 %), visibilité (0,05 km à 29,99 km), concentration de poussière (0 à 4,96 mg/m3) et conditions météorologiques (ciel dégagé, brouillard, pluie, poussière, neige). Ces paramètres ont été ajustés selon des distributions de probabilité dérivées des relevés climatiques irakiens pour les années 2020 à 2024. Pour chaque échantillon, la valeur d'atténuation (dB/km) a été calculée à l'aide du modèle physique d'atténuation correspondant, en fonction de la combinaison spécifique de conditions météorologiques et de paramètres variables.
L'atténuation physique a été modélisée à l'aide du modèle de Carbonneau pour la pluie, de la loi de Beer-Lambert pour un ciel clair, de la théorie de diffusion de Mie pour la poussière et du modèle de Kim pour le brouillard24. La loi de Beer-Lambert s'applique aux conditions de ciel dégagé, où l'atténuation est dominée par la diffusion moléculaire et l'absorption, qui décroissent de manière exponentielle avec la distance25. Le coefficient d'extinction α à 1550 nm est dû à la diffusion Rayleigh par les molécules d'air et à l'absorption par les gaz atmosphériques26. Le modèle de Kim est un modèle spécifique au brouillard qui relie l'atténuation à la visibilité à travers des coefficients empiriques dérivés des distributions de taille des gouttelettes de brouillard. L'exposant dépendant de la longueur d'onde q tient compte de la diffusion de Mie27. Le paramètre principal du modèle de Carbonneau est l'intensité de précipitation R, car l'atténuation due à la pluie dépend de la taille et de la densité des gouttes de pluie, et les coefficients sont déterminés empiriquement à 1550 nm et spécifiquement calibrés pour les longueurs d'onde optiques28. La théorie de diffusion de Mie s'applique aux conditions de poussière, puisque la taille des particules de poussière (rayon de 0,1 à 100 μm) est comparable à la longueur d'onde (1550 nm), et l'indice de réfraction complexe m = 1,55–0,005i pour la poussière du Moyen-Orient inclut à la fois la diffusion et l'absorption29. Les modèles d'atténuation physique suivants ont été mis en œuvre avec leurs équations respectives et leurs paramètres.
Pour des conditions de ciel dégagé, la loi de Beer-Lambert a été utilisée :
Aclear = 10×log₁₀(e(α×d)) (1)
où α est le coefficient d'extinction (variable selon une distribution normale centrée sur 0,02 dB/km avec une variation de ±0,005 dB/km à 1550 nm dans des conditions claires), et d est la distance de transmission (fixée à 3 km). Pour les conditions de brouillard, le modèle de Kim a été appliqué en utilisant l'équation suivante :
Afog = 10×ln(10)/V×(λ/550)−q (2)
où V est la visibilité en kilomètres (variant de 0,05 km à 10 km), λ est la longueur d'onde en nanomètres (fixée à 1550 nm) et q est le coefficient de distribution de la taille des particules calculé comme suit : q = 1,6 pour V > 50 km, q = 1,3 pour 6 < V < 50 km, q = 0,585 × V(1/3) pour 1 < V < 6 km, q = 0 pour 0,5 < V < 1 km, et q = 0,5 pour V < 0,5 km. Pour les conditions de pluie, le modèle de Carbonneau a été utilisé :
Arain=0.023×R0.93 (3)
où R est la pluviométrie en mm/h (variant entre 0,25 et 50 mm/h selon les données irakiennes sur les précipitations). La relation d'efficacité d'extinction a été utilisée pour les conditions de tempête de poussière en appliquant la diffusion de Mie :
Adust=10×log₁₀(e(τ×L)) (4)
où τ=∫₀^∞ πr2Qext(r,λ,m)N(r)dr, r est le rayon des particules (0,1–100 μm selon la composition de la poussière irakienne), Qext est l'efficacité d'extinction calculée à l'aide de la théorie de Mie, λ=1550 nm, m=1,55–0,005i est l'indice de réfraction complexe de la poussière du Moyen-Orient, et N(r) est la distribution de la taille des particules modélisée à l'aide d'une distribution log-normale avec un rayon moyen géométrique de 2,5 μm et un écart type de 2,0. Le modèle d'atténuation a été appliqué aux conditions de neige comme suit :
Asnow = 0.1×S0.75 (5)
où S est la vitesse de chute de neige en mm/h (0,5–15 mm/h). Cette équation empirique a été choisie en se basant sur les travaux publiés dans la littérature30, où des modèles d'atténuation pour la propagation optique à travers la neige ont été élaborés à l'aide de la théorie de diffusion de Mie appliquée aux distributions de taille des flocons de neige. L'équation est valable pour des taux de chute de neige compris entre 0,5 et 15 mm/h et suppose des conditions de neige sèche avec des diamètres typiques de flocons de 1 à 10 mm. Le coefficient 0,1 et l'exposant 0,75 ont été obtenus par ajustement de courbe aux calculs de diffusion de Mie30 pour la neige à 1550 nm. Elle ne tient pas compte de la neige humide ni des précipitations mixtes, qui peuvent présenter des propriétés d'atténuation variables, bien qu'elle fournisse une estimation raisonnable pour la neige sèche. Étant donné que cette approche est efficace sur le plan computationnel, fréquemment citée dans les publications sur les communications par faisceau spatial (FSO) et adaptée aux conditions de neige prévues dans le nord de l'Irak (région du Kurdistan en janvier et février), elle a été retenue pour cette étude. À l'aide de Numpy pour les calculs numériques, tous les modèles ont été implémentés en Python 3.9. Le modèle correspondant a été appliqué aux conditions météorologiques choisies aléatoirement et aux données ambiantes échantillonnées afin de calculer la valeur d'atténuation pour chaque échantillon. La distribution météorologique obtenue comprenait 814 conditions de ciel clair (54,27 %), 375 épisodes de poussière (25,00 %), 157 épisodes de brouillard (10,47 %), 111 épisodes de pluie (7,40 %) et 43 épisodes de neige (2,87 %).
L'examen des données météorologiques historiques recueillies auprès de stations météorologiques irakiennes dans plusieurs régions (Bagdad, Bassorah, Mossoul et Ramadi) entre 2020 et 2024 a permis d'établir les proportions des situations météorologiques. Les données brutes ont été fournies par le ministère des Transports de l'Irak et l'Organisation météorologique irakienne et de sismologie (IMOS). Les données comprenaient des relevés météorologiques quotidiens enregistrant les conditions atmosphériques en vigueur chaque jour. Les caractéristiques spécifiques extraites de ces relevés comprenaient la température (minimum, maximum et moyenne journalière), l'humidité relative, la visibilité, la quantité de précipitations et la survenue de tempêtes de poussière. Une partie des données de l'IMOS est accessible via le portail de données ouvertes du gouvernement irakien (https://www.motrans.gov.iq/) ; toutefois, les enregistrements particuliers utilisés dans cette étude ne sont pas archivés publiquement dans un dépôt central. Le tableau 1 résume les informations climatiques utilisées pour calculer les pourcentages des conditions météorologiques et des valeurs des paramètres. Les journées à ciel dégagé ont été définies comme des journées sans précipitation, avec une visibilité supérieure à 10 km et aucune activité de poussière, représentant 54,27 % des 1 825 jours enregistrés. Les journées de tempête de poussière (incluant les tempêtes de poussière complètes (visibilité < 1 km) et partielles (visibilité entre 1 et 10 km))) ont représenté 22,30 % des jours, tandis que les journées nuageuses (sans précipitation ni activité de poussière) ont constitué 14,08 % des jours. Les journées pluvieuses (avec précipitations mesurables) ont représenté 9,34 % des jours. < 1 km) et poussière en suspension (visibilité de 1 à 5 km)) représentaient 25,00 % des jours, indiquant la fréquence élevée des épisodes de tempête de sable dans le climat aride et semi-aride de l'Irak. Les jours où la visibilité était inférieure à 1 km en raison de la suspension de gouttelettes d'eau (hors réduction de visibilité causée par les poussières) ont été classés comme des jours de brouillard. Le pourcentage de jours de brouillard était de 10,47 %, et ces jours se produisaient principalement en hiver dans les régions du nord de l'Irak. Les jours de pluie, jours avec une précipitation mesurable >0,1 mm, étaient de 7,40 %, en accord avec la faible moyenne des précipitations annuelles en Irak, qui s'élève à 150–200 mm par an. Les jours de neige (jours avec accumulation de précipitations gelées) représentaient 2,87 % des jours et étaient limités aux régions montagneuses du nord (région du Kurdistan) en janvier et février. Ces proportions ont ensuite été utilisées comme poids probabilistes pour l'échantillonnage aléatoire lors de la génération du jeu de données. Ainsi, le jeu de données synthétique reflète la fréquence réelle de chaque condition météorologique dans l'environnement irakien.
Prise en compte des biais dans la génération de données synthétiques
Plusieurs mesures ont été prises afin de réduire les biais possibles :
(1) Sélectionner la distribution : Les propriétés statistiques des données climatiques sources ont été utilisées pour choisir les distributions de probabilité. La température suivait une distribution normale, avec une moyenne et un écart-type tels que relevés par l'IMOS. L'humidité suivait une distribution uniforme sur toute la plage observée (0-100 %). On a supposé que la visibilité suivait une distribution log-normale afin de tenir compte de la fréquence élevée d'événements de faible visibilité pendant les tempêtes de poussière. La concentration de poussière suivait une distribution exponentielle, avec des probabilités plus élevées à faible concentration et des queues longues lors d'événements extrêmes de poussière31. Ceci était conforme à la fréquence observée des épisodes de poussière en Irak32.
(2) Proportions des conditions météorologiques : L'analyse des données d'IMOS pour la période 2020–2024, comprenant 1 825 observations quotidiennes dans les quatre régions, a donné les proportions suivantes : 54,3 % de ciel dégagé, 24,9 % de poussière, 10,5 % de brouillard, 7,4 % de pluie et 2,8 % de neige. Les journées de ciel dégagé ont été définies comme des journées sans précipitations, avec une visibilité >10 km et sans activité de poussière. Les journées avec tempêtes de poussière incluaient à la fois les tempêtes complètes (visibilité <1 km) et la poussière en suspension (visibilité de 1 à 5 km). Une journée de brouillard correspond à une journée où la visibilité était inférieure à 1 km et où la cause était la suspension de gouttelettes d'eau (et non de poussière). Les journées de pluie ont été définies comme des journées avec une précipitation mesurable >0,1 mm. Les journées de neige ont été définies comme des journées avec accumulation de précipitations gelées33.
(3) Plages de paramètres : Les plages de paramètres étaient basées sur les valeurs extrêmes observées dans les enregistrements d'IMOS : la température variait de −4,89 °C (Mosoul, hiver) à 47,99 °C (Basra, été), la visibilité allait de 0,05 km (tempêtes de poussière sévères) à 29,99 km (conditions claires), et la concentration de poussière variait de 0 à 4,96 mg/m3 (selon la concentration maximale de poussière observée pendant des événements sévères de haboob)34.
(4) Hypothèses d'indépendance : Nous avons supposé que les paramètres environnementaux étaient échantillonnés indépendamment, ce qui constitue une simplification des conditions réelles dans lesquelles les variables atmosphériques sont corrélées (par exemple, une forte concentration de poussière est souvent associée à une faible visibilité). Afin de fournir un environnement de simulation contrôlé permettant une comparaison méthodique des modèles, cette hypothèse d'indépendance a été adoptée 35. Les conséquences de ces présupposés sont abordées dans la Discussion.
(5) Fractionnement stratifié : Le fractionnement entre ensemble d'apprentissage et ensemble de test a été réalisé de manière stratifiée selon la catégorie de condition météorologique (ciel dégagé, brouillard, pluie, poussière, neige), afin de garantir que la proportion de chaque condition météorologique dans les ensembles d'apprentissage et de test corresponde à la distribution du jeu de données d'origine. Ainsi, l'ensemble de test n'est pas déséquilibré par rapport aux conditions météorologiques rares (notamment la neige à 2,87 %)36.
Reconnaissance de la génération déterministe de cibles
Il est important de souligner que la bonne performance prédictive observée ici peut être en partie attribuée au fait que le modèle apprend ou approche les équations physiques déterministes utilisées pour générer les valeurs cibles synthétiques37. Contrairement aux mesures expérimentales du monde réel, qui contiennent du bruit de mesure, des erreurs instrumentales et des phénomènes physiques non modélisés, le jeu de données synthétique offre une relation propre et sans bruit entre les caractéristiques d'entrée et la cible d'atténuation. Cela s'explique par le fait que les valeurs d'atténuation ont été calculées directement à partir des modèles physiques de propagation (loi de Beer-Lambert, modèle de Kim, modèle de Carbonneau et théorie de diffusion de Mie) en fonction des paramètres d'entrée. Par conséquent, les métriques de performance quantitatives (R2, RMSE, MAE) reflètent la performance sur des données synthétiques dérivées d'équations et ne doivent pas être interprétées comme une performance attendue sur des données observationnelles ou expérimentales bruitées. Les résultats doivent être considérés principalement comme une évaluation comparative de méthodologies de modélisation dans un environnement de simulation contrôlé38.
Jeu complet de caractéristiques pour l'apprentissage du modèle
L'ensemble de données d'entraînement comprenait 10 caractéristiques d'entrée pour l'entraînement du modèle :
1. Température (°C)
2. Humidité (%)
3. Visibilité (km)
4. Concentration de poussière (mg/m3)
5. Taux de précipitation (mm/h)
6. Taux de précipitation neigeuse (mm/h)
7. Vitesse du vent (m/s)
8. Pression atmosphérique (hPa)
9. Mois (numérique, 1–12)
10. Saison (codée en binaire : printemps, été, automne, hiver)
Précision importante : les conditions météorologiques (ciel dégagé, brouillard, pluie, poussière, neige) ont été utilisées comme variable catégorielle pour la stratification lors de la répartition du jeu de données et n'ont pas été incluses comme caractéristiques d'entrée pour aucun modèle. L'analyse SHAP inclut uniquement les 10 caractéristiques énumérées ci-dessus. La variable saison a été encodée en one-hot (4 catégories : printemps, été, automne, hiver), et pour l'analyse SHAP, les contributions des variables saison encodées en one-hot ont été additionnées selon les saisons afin de produire une seule valeur de contribution saisonnière. Cette valeur combinée représente la contribution totale de toutes les variables liées à la saison à la prédiction de l'atténuation. Avant de créer la figure récapitulative, les quatre colonnes saison encodées en one-hot ont été identifiées, et leurs valeurs SHAP ont été additionnées pour chaque échantillon. Cette méthode garantit que l'utilisation par le modèle de la saison comme variable catégorielle composite est cohérente avec l'analyse SHAP.
Les principaux facteurs environnementaux ayant directement affecté l'atténuation optique par des mécanismes physiques étaient les caractéristiques 1 à 6. L'ajout des caractéristiques 7 et 8 (vitesse du vent et pression) en tant que facteurs météorologiques supplémentaires pourrait avoir un impact indirect sur l'atténuation en influant sur la stabilité de l'air et la dispersion des aérosols. Afin de tenir compte des variations saisonnières des conditions atmosphériques, les caractéristiques 9 et 10 (mois et saison) ont été incluses comme descripteurs temporels. La valeur d'atténuation (dB/km) a été utilisée comme variable cible pour tous les modèles. Les statistiques clés du jeu de données comprenaient la température (28,55 °C ± 11,18 °C), l'humidité (42,01 % ± 25,56 %), la visibilité (13,10 ± 10,91 km ; plage : 0,05–29,99 km), la concentration en poussières (0,74 ± 1,30 mg/m3 ; maximum : 4,96 mg/m3), l'atténuation (4,80 ± 7,20 dB/km ; plage : 0,09–50,93 dB/km), la portée de fonctionnement (5,74 ± 1,97 km) et le rapport signal-sur-bruit (64,88 ± 15,07 dB). La portée de fonctionnement et le RSB ont été calculés à partir des valeurs d'atténuation à l'aide d'équations standard de bilan de liaison FSO.
Calcul de la plage de fonctionnement
La plage de fonctionnement (en km) a été calculée à l'aide de l'équation du bilan de liaison :
Prx=Ptx×Gt×Gr×(λ/(4πR))2×10(−A×R/10) (6)
où : Prx = puissance reçue (réglée à la sensibilité minimale de −30 dBm) ; Ptx = puissance d'émission (fixée à 20 dBm) ; Gt = gain de l'émetteur (calculé à partir des dimensions de l'ouverture) ; Gr = gain du récepteur (calculé à partir des dimensions de l'ouverture) ; λ = longueur d'onde (1550 nm) ; R = portée en km ; A = atténuation atmosphérique en dB/km (calculée à partir des modèles physiques).
Gains de l'émetteur et du récepteur : Le gain de l'émetteur (Gt) a été calculé selon la formule suivante : Gt = 10×log₁₀[0.7×(π×0,025/1,55×10⁻6)2] ≈ 44,2 dBi. Le gain du récepteur (Gr) a été calculé selon la formule suivante : Gr = 10×log₁₀[0,7×(π×0,20/1,55×10⁻6)2] ≈ 62,3 dBi. L'ouverture d'émission avait un diamètre de 2,5 cm, avec une efficacité de 0,7. L'ouverture de réception avait un diamètre de 20 cm, avec une efficacité de 0,7. L'équation a été résolue de manière itérative pour R afin de déterminer la distance maximale atteignable pour chaque valeur d'atténuation.
Calcul du rapport signal sur bruit
Le RSB (rapport signal sur bruit) en dB a été calculé à l'aide de l'équation suivante :
SNR=Prx−10×log₁₀(kTB)−NF (7)
où : Prx = puissance reçue en dBm (calculée à partir du bilan de liaison) ; k = 1,38×10⁻23 J/K (constante de Boltzmann) ; T = 290 K (température du récepteur) ; B = 109 Hz (bande passante du récepteur, 1 GHz) ; NF = 3 dB (facteur de bruit du récepteur). Le plancher de bruit a été calculé comme suit :
10 × log10(kTB) ≈ −84 dBm (8)
Pour chaque échantillon, après avoir calculé l'atténuation A à l'aide du modèle physique approprié, la portée opérationnelle a été déterminée en résolvant le bilan de liaison pour R, et le RSB a été calculé à partir de la puissance reçue Prx résultante à cette distance.
Valeurs de la plage de fonctionnement selon les conditions météorologiques : La plage de fonctionnement variait selon les conditions météorologiques : ciel dégagé (7,12 ± 1,85 km), brouillard (5,81 ± 1,92 km), neige (5,42 ± 1,56 km), pluie (3,81 ± 0,98 km) et poussière (3,72 ± 1,08 km). Une marge de 3 dB n’a pas été appliquée dans les calculs actuels ; la plage de fonctionnement représente la portée théorique maximale sans marge système. La plage de fonctionnement indiquée (5,74 ± 1,97 km) correspond à la moyenne générale sur l’ensemble des conditions météorologiques39.
Distance de transmission fixe : La distance de transmission dans les modèles d'atténuation physique a été fixée à 3 km. Il s'agit de la distance de liaison pour laquelle les calculs d'atténuation ont été effectués. La portée de fonctionnement indiquée correspond à la distance maximale théorique calculée à l'aide de l'équation du bilan de liaison, qui peut différer de la distance de transmission fixe de 3 km. Les valeurs d'atténuation spécifiques aux conditions météorologiques ont été enregistrées pour des conditions claires (0,27±0,06 dB/km), le brouillard (1,88±1,92 dB/km), la neige (6,45±2,54 dB/km), la pluie (13,58±6,32 dB/km) et la poussière (13,10±7,32 dB/km). Toutes les valeurs quantitatives rapportées dans cet article sont exprimées sous la forme moyenne ± écart type (ET), sauf indication contraire40.
Le R2 de validation croisée pour la forêt aléatoire est de 0,960 ± 0,007. Dans certains cas, comme la température (−4,89 à 47,99 °C), la visibilité (0,05 à 29,99 km), la concentration de poussière (0 à 4,96 mg/m3) et l'atténuation (0,09 à 50,93 dB/km), l'intervalle (du plus bas au plus élevé) est indiqué par écrit. L'ensemble de données a été divisé en sous-groupes pour les tests (300 échantillons ; 20 %) et l'apprentissage (1 200 échantillons ; 80 %). Un échantillonnage aléatoire stratifié a été utilisé pour effectuer la répartition apprentissage-test. Afin de garantir que le pourcentage de chaque condition météorologique dans l'ensemble d'apprentissage (80 %) et l'ensemble de test (20 %) corresponde à la distribution de l'ensemble de données d'origine, une stratification a été appliquée selon la catégorie de condition météorologique (ciel dégagé, brouillard, pluie, poussière et neige). En particulier, 1 200 (80 %) des 1 500 échantillons ont été attribués à l'ensemble d'apprentissage et 300 (20 %) à l'ensemble de test. Les échantillons ont été choisis aléatoirement pour chaque catégorie de conditions météorologiques tout en conservant les proportions initiales : parmi les 814 échantillons de ciel dégagé (54,27 %), 651 ont été affectés à l'apprentissage et 163 aux tests ; parmi les 375 échantillons de poussière (25,00 %), 300 à l'apprentissage et 75 aux tests ; parmi les 157 échantillons de brouillard (10,47 %), 126 à l'apprentissage et 31 aux tests ; parmi les 111 échantillons de pluie (7,40 %), 89 à l'apprentissage et 22 aux tests ; parmi les 43 échantillons de neige (2,87 %), 34 à l'apprentissage et 9 aux tests. Un échantillonnage aléatoire au sein de chaque strate a été réalisé en utilisant une graine aléatoire de 42 afin d'assurer la reproductibilité. Cette approche stratifiée a été choisie pour éviter une représentation déséquilibrée des conditions météorologiques rares (notamment la neige à 2,87 %) dans l'ensemble de test, ce qui pourrait autrement conduire à une évaluation peu fiable des performances pour ces conditions.
Évaluation d'un modèle d'apprentissage automatique
Six méthodes d'apprentissage automatique ont été évaluées, notamment la régression par vecteurs de support (SVR) avec un noyau à fonction de base radiale (C = 100), les k-plus proches voisins (KNN ; k = 10, vote pondéré par la distance), la forêt aléatoire (RF ; 200 arbres, profondeur maximale = 20), l'extrême gradient boosting (XGBoost ; 200 estimateurs, profondeur maximale = 10, taux d'apprentissage = 0,1), la machine d'augmentation de gradient légère (LightGBM ; 200 estimateurs, profondeur maximale = 10, taux d'apprentissage = 0,1), ainsi que la régression linéaire de base. Pour tous les modèles d'apprentissage automatique et d'apprentissage profond, un réglage des hyperparamètres a été effectué pour les paramètres les plus critiques, tandis que les valeurs par défaut ont été conservées pour les paramètres non spécifiés. Pour les modèles d'apprentissage automatique, les paramètres suivants ont été explicitement ajustés à l'aide d'une recherche en grille avec une validation croisée en 5 parties sur l'ensemble d'entraînement : 1) Forêt aléatoire : nombre d'arbres (testés : 50, 100, 150, 200, 250) et profondeur maximale (testée : 10, 15, 20, 25, sans limite), les valeurs optimales retenues étant 200 arbres et une profondeur de 20. 2) XGBoost : nombre d'estimateurs (testés : 100, 150, 200, 250), profondeur maximale (testée : 6, 8, 10, 12) et taux d'apprentissage (testés : 0,05, 0,1, 0,2), les valeurs optimales étant 200 estimateurs, une profondeur de 10 et un taux d'apprentissage de 0,1. 3) LightGBM : les mêmes plages de réglage ont été utilisées, conduisant à 200 estimateurs, une profondeur de 10 et un taux d'apprentissage de 0,1. 4) SVR : le paramètre de régularisation C (testé : 1, 10, 50, 100) et le coefficient du noyau gamma (testé : « scale », « auto », 0,1, 0,01) ont été ajustés, avec des valeurs optimales de C = 100 et un noyau RBF. 5) KNN : le nombre de voisins k (testé : 3, 5, 7, 10, 15) a été ajusté, avec une valeur optimale de k = 10 et un vote pondéré par la distance activé.
Tous les autres paramètres pour ces modèles ont été conservés à leurs valeurs par défaut telles que définies dans scikit-learn (voir le Tableau des matériaux pour la version ; par exemple, forêt aléatoire : bootstrap=True, min_samples_split=2, min_samples_leaf=1 ; XGBoost : subsample=1,0, colsample_bytree=1,0, gamma=0). Pour les modèles d'apprentissage profond, l'architecture (nombre de couches et d'unités par couche) et le taux de dropout (20 %) ont été ajustés manuellement par expérimentation itérative sur l'ensemble de validation, tandis que l'optimiseur (Adam), le taux d'apprentissage initial (0,001), la patience du mécanisme d'arrêt précoce (20 époques) et les paramètres de réduction du taux d'apprentissage (facteur 0,5, patience 10) ont été fixés selon les pratiques courantes décrites dans la littérature et maintenus constants pour toutes les expériences d'apprentissage profond.
Sources de données climatiques
Les informations météorologiques historiques recueillies à partir de stations météorologiques irakiennes dans plusieurs localités (Bagdad, Bassorah, Mossoul et Ramadi) entre 2020 et 2024 ont été utilisées pour calculer les proportions des états météorologiques et les distributions des variables. Les données brutes ont été fournies par le ministère des Transports de l'Irak et par l'Organisation météorologique irakienne et de sismologie (IMOS). Les données comprenaient des relevés météorologiques quotidiens détaillant l'état atmosphérique prédominant chaque jour. Les variables spécifiques extraites de ces relevés comprenaient la température (minimum, maximum et moyenne journaliers), l'humidité relative, la visibilité, la quantité de précipitations et la survenue de tempêtes de poussière. Les données de l'IMOS sont partiellement accessibles via le portail de données ouvertes du gouvernement irakien (https://www.motrans.gov.iq/), bien que les enregistrements spécifiques utilisés dans cette étude ne soient pas archivés publiquement dans un dépôt centralisé. Un résumé des données climatiques utilisées pour déterminer les proportions des conditions météorologiques et les plages de paramètres est fourni dans Tableau 1.
Une validation croisée en cinq parties a été utilisée sur l'ensemble d'apprentissage (1 200 échantillons) pour ajuster les hyperparamètres et estimer les performances de tous les modèles d'apprentissage automatique. Toutes les variables d'entrée (température, humidité, visibilité, concentration de poussière, taux de précipitations, taux de neige, vitesse du vent, pression) ont été normalisées par standardisation (normalisation par score Z) : x_scaled = (x − μ)/σ, où μ et σ représentent respectivement la moyenne et l'écart-type de l'ensemble d'apprentissage. La standardisation a été effectuée au sein de chaque pli de validation croisée en utilisant uniquement les statistiques du pli d'apprentissage afin d'éviter toute fuite de données. Les modèles basés sur des arbres (forêts aléatoires, XGBoost, LightGBM) sont invariants à l'échelle, mais la même standardisation a été appliquée pour assurer une cohérence entre tous les modèles d'apprentissage automatique. Une normalisation min-max a été utilisée pour les modèles d'apprentissage profond : x_scaled = (x−x_min)/(x_max−x_min), qui ramène les caractéristiques à l'intervalle [0, 1] selon les valeurs minimales et maximales de l'ensemble d'apprentissage. Des entrées bornées permettent une convergence plus rapide des réseaux de neurones, ce qui explique ce choix. L'ensemble de test a été normalisé à l'aide des paramètres obtenus à partir de l'ensemble d'apprentissage, et n'a pas été utilisé pour la sélection du modèle ou l'ajustement des hyperparamètres.
Des métriques de performance complètes ont été enregistrées, incluant le coefficient de détermination du test (R2), l'erreur quadratique moyenne (RMSE), l'erreur absolue moyenne (MAE), le R2 de validation croisée et le temps d'entraînement. Les temps d'entraînement pour tous les modèles d'apprentissage automatique et d'apprentissage profond sont indiqués en secondes (s) pour les modèles plus rapides (régression linéaire, KNN, SVR, forêt aléatoire, XGBoost, LightGBM) et en minutes (min) pour les modèles plus lents (architectures d'apprentissage profond). Tous les modèles ont été entraînés dans le même environnement informatique afin d'assurer une comparaison équitable41.
Le temps d'entraînement a été mesuré à l'aide du module time de Python, c'est-à-dire le temps écoulé sur l'horloge réelle entre le début et la fin de la fonction d'ajustement du modèle, à l'exclusion du temps nécessaire au chargement et au prétraitement des données. Le temps d'entraînement d'un modèle d'apprentissage profond correspond au temps nécessaire pour effectuer toutes les époques jusqu'à l'arrêt précoce. Cela inclut la propagation avant, la propagation arrière et les vérifications de validation. Toutes les expériences ont été réalisées en veillant à ce que le système n'exécute aucun autre processus informatiquement intensif, afin d'obtenir des mesures de temps cohérentes. Les temps indiqués représentent la moyenne de 5 exécutions indépendantes (écarts types)42.
Évaluation du modèle d'apprentissage profond
Six architectures d'apprentissage profond ont été évaluées à l'aide d'une accélération GPU, notamment un perceptron multicouche (MLP ; 64-32-16), un réseau neuronal profond (DNN) avec normalisation par lot (128-64-32-16), un réseau de mémoire à long terme et à court terme (LSTM ; 64-32 unités, longueur de séquence = 10), un réseau neuronal convolutif unidimensionnel (1D-CNN), un modèle hybride CNN-LSTM et un réseau basé sur le mécanisme d'attention. Tous les modèles d'apprentissage profond ont été implémentés à l'aide de TensorFlow avec l'API Keras et exécutés avec accélération GPU (voir Tableau des Matériaux pour les versions du matériel et des logiciels). L'architecture 1D-CNN comprenait trois couches de convolution (64, 128 et 256 filtres, taille du noyau 3, activation ReLU, padding=’same’), deux couches MaxPooling1D (taille du regroupement 2), une couche GlobalAveragePooling1D, une couche Dense avec 128 unités et activation ReLU, une couche Dropout (0,2), et une couche de sortie Dense (1 unité, activation linéaire), totalisant environ 245 000 paramètres entraînables. L'architecture hybride CNN-LSTM acceptait des séquences d'entrée de 10 pas de temps avec 5 caractéristiques, en utilisant deux couches Conv1D (64 et 128 filtres, taille du noyau 3, ReLU, padding=’same’), une couche MaxPooling1D (taille du regroupement 2), deux couches LSTM (64 et 32 unités, return_sequences=False), des couches Dropout (0,2), une couche Dense (32 unités, ReLU) et une couche de sortie Dense (1 unité, activation linéaire), totalisant environ 198 000 paramètres entraînables. Le réseau basé sur l'attention utilisait un mécanisme d'attention multi-têtes avec 4 têtes (dimensions de clé et de valeur de 64), dans lequel l'entrée était projetée sur 64 dimensions, suivie d'une attention par produit scalaire normalisé (formule : Attention(Q, K, V) = softmax(QKT/√d_k)V), des connexions résiduelles, une normalisation de couche, un réseau feedforward (128→64 unités), un regroupement par moyenne globale, un Dropout (0,2), une couche Dense (32 unités, ReLU) et une couche de sortie Dense (1 unité, activation linéaire), totalisant environ 167 000 paramètres entraînables43.
Tous les modèles ont utilisé l'arrêt précoce (patience = 20), la réduction du taux d'apprentissage (facteur = 0,5, patience = 10), le dropout (20 %) et l'optimiseur Adam (taux d'apprentissage = 0,001). Pour tous les modèles d'apprentissage profond, la taille du lot a été fixée à 32 échantillons, le nombre maximal d'époques d'entraînement était de 200 avec arrêt précoce (patience = 20, restauration des meilleurs poids), et la fonction de perte utilisée était l'erreur quadratique moyenne (MSE). La répartition entre ensemble d'entraînement et de validation était la suivante : à partir des 1 200 échantillons d'entraînement initiaux (après la répartition 80/20 entraînement-test), 80 % (960 échantillons) ont été utilisés pour l'entraînement et 20 % (240 échantillons) pour la validation. Nous avons stratifié la répartition entraînement-validation selon les conditions météorologiques afin de préserver la distribution. L'ensemble de validation a été utilisé uniquement pour l'arrêt précoce, la décroissance du taux d'apprentissage et la surveillance du surajustement ; il n'a jamais été utilisé pour la sélection du modèle ou l'ajustement des hyperparamètres au-delà de ces procédures automatisées. Nous n'avons pas réservé un ensemble de validation distinct pour les modèles d'apprentissage automatique ; à la place, nous avons utilisé une validation croisée en cinq parties sur les 1 200 échantillons d'entraînement pour ajuster les hyperparamètres et estimer les performances44.
Justification de l'évaluation des architectures LSTM et CNN-LSTM
L'ensemble de données principal se compose d'échantillons météorologiques générés indépendamment, mais nous avons également testé les architectures LSTM et CNN–LSTM pour les raisons suivantes : (1) les conditions atmosphériques réelles présentent une autocorrélation temporelle, et tester des modèles basés sur des séquences nous permet de déterminer si la prise en compte de ces dépendances pourrait améliorer la précision des prévisions ; (2) des recherches récentes en prévision atmosphérique ont démontré l'intérêt potentiel des architectures séquentielles pour modéliser l'évolution temporelle des paramètres météorologiques34 ; (3) tester une gamme diversifiée d'architectures garantit une comparaison exhaustive des approches méthodologiques, ce qui constitue une contribution essentielle de cette étude ; et (4) l'architecture hybride CNN–LSTM combine l'extraction de caractéristiques spatiales avec la modélisation temporelle, ce qui pourrait être avantageux pour capturer les interactions complexes entre plusieurs variables atmosphériques45.
Formatage des données pour l'entrée du modèle séquentiel
Pour les architectures séquentielles (LSTM et CNN–LSTM), les données d'entrée ont été restructurées à partir d'échantillons indépendants en pseudo-séquences à l'aide d'une approche par fenêtre glissante. En particulier, les 1 200 échantillons d'apprentissage ont d'abord été regroupés par catégories de conditions météorologiques afin de préserver la cohérence physique. Au sein de chaque catégorie météorologique, les échantillons ont été ordonnés selon leurs horodatages générés (observations simulées horaires pour l'année civile 2024). Ensuite, une fenêtre glissante de longueur 10 a été appliquée pour produire des séquences d'entrée composées de 10 pas de temps consécutifs (chacun comportant 5 caractéristiques : température, humidité, visibilité, concentration de poussière et taux de précipitation) afin de prédire l'atténuation au 11e pas de temps. Cette méthode préserve l'ordre temporel des observations simulées, tout en permettant aux modèles séquentiels d'apprendre les dépendances temporelles. La structure du jeu de test était identique, à l'exception de la même taille de fenêtre et du même ensemble de caractéristiques. Nous reconnaissons que cette structuration pseudo-séquentielle constitue une simplification méthodologique et ne reflète pas les dynamiques temporelles du monde réel. Nous avons indiqué cette limitation dans la section Discussion.
Évaluation des approches hybrides
Trois approches hybrides ont été examinées. La première approche était un modèle de vote combiné qui moyennait les prédictions issues des modèles Forêt aléatoire, XGBoost et Réseau neuronal profond en utilisant des poids égaux (chaque modèle se voyant attribuer un poids de 1/3), la prédiction finale étant calculée selon l'expression suivante :
ŷensemble=(1/3)ŷRF+(1/3)ŷXGB+(1/3)ŷDNN (9)
Un poids égal a été choisi afin d'éviter l'introduction de paramètres supplémentaires et d'évaluer les performances de base de l'ensemble sans biais en faveur d'un modèle individuel. La deuxième approche utilisait un empilement avec un méta-apprenant Ridge. Les apprenants de base étaient la forêt aléatoire, XGBoost et un réseau neuronal profond (basé sur l'attention). La procédure d'empilement comprenait deux étapes : premièrement, chaque apprenant de base était entraîné sur l'ensemble d'entraînement complet de 1 200 échantillons à l'aide d'une validation croisée en 5 parties pour générer des prédictions hors pli, créant ainsi une nouvelle matrice de méta-caractéristiques de taille 1 200×3 (une prédiction par modèle de base et par échantillon). Deuxièmement, un méta-apprenant de régression Ridge (paramètre de régularisation L2 alpha=1,0) était entraîné sur ces méta-caractéristiques, en utilisant les valeurs d'atténuation initiales comme cible, afin d'apprendre les poids de combinaison optimaux pour les apprenants de base. La prédiction finale par empilement était la suivante :
ŷstacking=wRF×ŷRF+wXGB×ŷXGB+wDNN×ŷDNN (10)
où les poids w ont été appris par l'algorithmes méta d'apprentissage de type Ridge. La troisième approche était un réseau de neurones informé par la physique, qui combinait 70 % des prédictions du réseau de neurones avec 30 % des prédictions du modèle de Kim pour les échantillons en conditions de brouillard. La combinaison était réalisée par une moyenne pondérée fixe à l'aide de la formule suivante :
ŷhybrid=0,7×ŷneural+0,3×ŷKim (11)
où ŷneural est la sortie du réseau de neurones basé sur l'attention, et ŷKim est l'atténuation calculée à partir du modèle de brouillard de Kim en fonction de l'entrée de visibilité. Pour les échantillons sans brouillard, la composante physique était fixée à 0, et le modèle était exécuté comme un réseau de neurones pur. Les poids (70 % neuronal et 30 % physique) ont été fixés sur la base d'expérimentations préliminaires sur l'ensemble de validation (et non sur l'ensemble de test), au cours desquelles nous avons testé les combinaisons de poids suivantes : 90:10, 80:20, 70:30, 60:40 et 50:50. La répartition 70/30 a été retenue car elle offrait le meilleur R2 sur l'ensemble de validation tout en conservant une contrainte physique suffisante issue du modèle de Kim pour régulariser les prédictions et éviter des sorties physiquement irréalistes, en particulier dans les conditions de brouillard où le modèle de Kim fournit des bornes théoriques d'atténuation bien établies.
Analyse de l'importance et de l'interprétabilité des caractéristiques
Le modèle de forêt aléatoire avec l'importance des caractéristiques basée sur l'impureté (réduction de la variance) a été utilisé pour extraire les classements d'importance des 10 caractéristiques d'entrée. L'analyse a montré que la concentration de poussière (67,3 %) et la visibilité (21,2 %) étaient les prédicteurs les plus importants, expliquant ensemble 88,5 % de l'importance prédictive totale. La troisième caractéristique la plus importante était l'intensité des précipitations (6,0 %), suivie de la vitesse du vent (2,1 %), de la température (1,5 %), de l'humidité (0,9 %), du mois (0,5 %), de la saison (0,3 %), de l'intensité de chute de neige (0,1 %) et de la pression atmosphérique (0,1 %). Les faibles scores d'importance pour les caractéristiques temporelles (mois et saison) indiquent que la variation saisonnière de l'atténuation atmosphérique est principalement captée par des paramètres environnementaux sous-jacents plutôt que par des motifs basés uniquement sur le temps.
Une analyse SHAP (Shapley Additive exPlanations) a été réalisée afin d'évaluer les relations entre les facteurs environnementaux et l'atténuation. L'implémentation SHAP utilisée était le module TreeExplainer de la bibliothèque SHAP, spécifiquement optimisé pour les modèles basés sur des arbres, notamment Random Forest, XGBoost et LightGBM (voir le Tableau des matériaux pour la version). La configuration de l'analyse SHAP était la suivante : le modèle Random Forest entraîné a été transmis à TreeExplainer, qui a calculé les valeurs SHAP selon l'approche d'attribution de caractéristiques interventionnelle (marginale), fondée sur l'espérance conditionnelle de la sortie du modèle. Les valeurs SHAP ont été calculées pour les 300 échantillons de l'ensemble de test, produisant une matrice de dimensions 300 × 10 (une valeur SHAP par caractéristique et par échantillon). Pour chaque caractéristique, la valeur SHAP représentait sa contribution à la prédiction par rapport à la référence (la prédiction moyenne du modèle). Des valeurs SHAP négatives indiquaient une diminution de la prédiction, tandis que des valeurs SHAP positives montraient que la caractéristique augmentait la prédiction d'atténuation. L'importance de la contribution était indiquée par l'amplitude de la valeur SHAP. La distribution des valeurs SHAP pour chaque caractéristique (à l'aide de diagrammes en nuage d'abeilles), le sens de l'influence (la corrélation entre les valeurs des caractéristiques et les valeurs SHAP) ainsi que les classements d'importance des caractéristiques ont tous été visualisés à l'aide de graphiques récapitulatifs. Les fonctions de tracé intégrées à la bibliothèque SHAP — shap.summary_plot() pour le diagramme en nuage d'abeilles et shap.bar_plot() pour l'importance globale des caractéristiques — ont été utilisées pour produire toutes les visualisations SHAP.
Traitement des variables encodées en binaire : Quatre colonnes binaires (printemps, été, automne et hiver) ont d'abord été utilisées pour encoder la variable « saison ». Afin de créer une seule valeur de contribution « saison » par échantillon pour l'analyse SHAP, les contributions de ces quatre variables encodées en binaire ont été combinées en additionnant les valeurs SHAP pour chaque catégorie de saison. Pour réaliser ce regroupement, toutes les colonnes correspondant aux groupes de saisons encodées en binaire ont été identifiées, leurs valeurs SHAP ont été extraites pour chaque échantillon, puis additionnées élément par élément. Les valeurs SHAP combinées résultantes représentent la contribution globale de la saison à la prédiction d'atténuation. Cette méthode permet d'obtenir une seule ligne « saison » dans le graphique récapitulatif SHAP et garantit la cohérence avec l'utilisation de la saison par le modèle comme variable catégorielle composite. Étant donné que la valeur combinée offre une représentation plus compréhensible de la contribution totale de la saison, les valeurs SHAP de la saison n'ont pas été affichées séparément pour chaque catégorie de saison.