Este estudo não envolveu participantes humanos ou animais vertebrados, nem coleta de tecidos. Todos os dados utilizados nesta pesquisa foram gerados sinteticamente usando modelos físicos de propagação e parâmetros meteorológicos de acesso público. Portanto, nenhuma aprovação ética por parte de um Comitê de Ética em Pesquisa (IRB) ou Comitê Institucional de Cuidado e Uso de Animais (IACUC) foi necessária.
Geração do Conjunto de Dados com Base na Teoria Física de Propagação. O conjunto de dados foi elaborado para simular condições atmosféricas horárias de um sistema de comunicação óptica em espaço livre durante um ano civil completo (2024), considerando as condições atmosféricas do Iraque. Criamos uma base de dados sintética com 1.500 amostras por hora.
Primeiro, as condições meteorológicas foram atribuídas aleatoriamente com base em tendências regionais: céu limpo (54,3%), poeira (24,9%), neblina (10,5%), chuva (7,4%) e neve (2,8%). Em segundo lugar, o modelo físico de atenuação correspondente foi aplicado a cada amostra com base na condição meteorológica, ou seja, a lei de Beer-Lambert para céu limpo, o modelo de Kim para neblina, a teoria de Carbonneau para chuva e a teoria de espalhamento de Mie para tempestades de poeira. Terceiro, os parâmetros do sistema FSO foram definidos da seguinte forma: potência de transmissão de 20 dBm, comprimento de onda de 1550 nm, distância de transmissão de 3 km, abertura de transmissão de 2,5 cm e abertura receptora de 20 cm. Quarto, a atenuação foi calculada em dB/km para cada amostra. Finalmente, o conjunto completo de dados foi dividido aleatoriamente em 1.200 amostras de treinamento (80%) e 300 amostras de teste (20%). As condições simuladas incluem altas concentrações de poeira associadas a tempestades de areia, chuvas fortes e variações de temperatura de −4,89°C a 47,99°C. As condições meteorológicas e as distribuições de parâmetros foram selecionadas com base nos registros climáticos do Iraque no período de 2020 a 2024. Os cinco regimes meteorológicos (céu limpo, neblina, chuva, tempestades de poeira e neve) foram escolhidos porque abrangem todo o espectro de condições atmosféricas que afetam a atenuação FSO no Iraque, sendo as tempestades de poeira especialmente prevalentes no Oriente Médio. Os dados históricos de meteorologia coletados em diversas regiões do Iraque foram utilizados para criar a distribuição de probabilidade para cada condição meteorológica. A distribuição resultante foi a seguinte: 54,3% de céu limpo (estado predominante), 24,9% de poeira (representando o problema de tempestades de areia no Iraque), 10,5% de neblina (frequente nos invernos do norte do Iraque), 7,4% de chuva (baixos índices pluviométricos típicos do Iraque) e 2,8% de neve (ocasional em regiões montanhosas do norte). Os parâmetros meteorológicos relevantes foram modelados utilizando distribuições de probabilidade para cada condição meteorológica da seguinte forma: a temperatura foi modelada usando uma distribuição normal (média 28,55±11,18°C) entre −4,89°C e 47,99°C com base nos extremos sazonais do Iraque; a umidade foi modelada usando uma distribuição uniforme (média 42,01±25,56%) de 0% a 100%; a visibilidade foi modelada usando uma distribuição log-normal entre 0,05 km e 29,99 km (média 13,10±10,91 km) para considerar os frequentes eventos de baixa visibilidade durante tempestades de poeira; a concentração de poeira foi modelada usando uma distribuição exponencial entre 0 e 4,96 mg/m3 (média 0,74±1,30 mg/m3), com maiores probabilidades para baixas concentrações e caudas longas para eventos extremos de poeira.
O sistema de comunicação foi projetado com uma potência de transmissão de 20 dBm, um comprimento de onda de 1550 nm, uma distância de transmissão de até 3 km, uma abertura de transmissão de 2,5 cm e uma abertura de recepção de 20 cm para compensar a perda por divergência. Os parâmetros do sistema FSO foram divididos em dois grupos: parâmetros fixos que não mudaram para todas as amostras e parâmetros variáveis que foram alterados durante a geração do conjunto de dados. Para todas as 1.500 amostras, os seguintes parâmetros foram fixos: potência de transmissão (20 dBm), comprimento de onda de operação (1550 nm), abertura de transmissão (diâmetro de 2,5 cm, eficiência de 0,7) e abertura de recepção (diâmetro de 20 cm, eficiência de 0,7). Esses parâmetros foram fixados porque correspondem às especificações físicas do hardware do sistema FSO e não variam com as condições meteorológicas. O conjunto de dados foi criado com 1.500 amostras, variando os seguintes parâmetros: temperatura (−4,89°C a 47,99°C), umidade (0% a 100%), visibilidade (0,05 km a 29,99 km), concentração de poeira (0 a 4,96 mg/m3) e condição meteorológica (céu limpo, neblina, chuva, poeira, neve). Esses parâmetros foram modificados de acordo com distribuições de probabilidade derivadas de registros climáticos do Iraque para os anos de 2020 a 2024. Para cada amostra, o valor de atenuação (dB/km) foi calculado utilizando o modelo físico de atenuação correspondente, de acordo com a combinação específica de condições meteorológicas e parâmetros variáveis.
A atenuação física foi modelada utilizando o modelo de Carbonneau para chuva, a lei de Beer-Lambert para céu limpo, a teoria de espalhamento de Mie para poeira e o modelo de Kim para nevoeiro24. A lei de Beer-Lambert aplica-se a condições de céu claro, nas quais a atenuação é dominada pelo espalhamento molecular e absorção, que diminuem exponencialmente com a distância25. O coeficiente de extinção α em 1550 nm é devido ao espalhamento Rayleigh por moléculas de ar e à absorção por gases atmosféricos26. O modelo de Kim é um modelo específico para nevoeiro que relaciona a atenuação à visibilidade por meio de coeficientes empíricos derivados das distribuições de tamanho das gotículas de nevoeiro. O expoente dependente do comprimento de onda q leva em conta o espalhamento de Mie27. O parâmetro principal do modelo de Carbonneau é a taxa de precipitação R, já que a atenuação pela chuva depende do tamanho e da densidade das gotas de chuva, e os coeficientes são derivados empiricamente em 1550 nm e calibrados especificamente para comprimentos de onda ópticos28. A teoria de espalhamento de Mie é aplicável a condições de poeira, uma vez que o tamanho das partículas de poeira (raio de 0,1–100 μm) é comparável ao comprimento de onda (1550 nm), e o índice de refração complexo m = 1,55–0,005i para poeira do Oriente Médio inclui tanto espalhamento quanto absorção29. Os seguintes modelos físicos de atenuação foram implementados com suas respectivas equações e configurações de parâmetros.
Para condições de céu claro, a lei de Beer-Lambert foi utilizada:
Aclear = 10×log₁₀(e(α×d)) (1)
em que α é o coeficiente de extinção (variado usando uma distribuição normal centrada em 0,02 dB/km com variação de ±0,005 dB/km a 1550 nm sob condições claras), e d é a distância de transmissão (fixa em 3 km). Para condições de neblina, o modelo de Kim foi implementado usando a equação:
Afog = 10×ln(10)/V×(λ/550)−q (2)
em que V é a visibilidade em quilômetros (variando de 0,05 km a 10 km), λ é o comprimento de onda em nanômetros (fixado em 1550 nm) e q é o coeficiente de distribuição do tamanho das partículas calculado como: q = 1,6 para V>50 km, q = 1,3 para 6<V<50 km, q = 0,585×V(1/3) para 1 <V<6 km, q = 0 para 0,5<V<1 km e q = 0,5 para V<0,5 km. Para condições de chuva, utilizou-se o modelo de Carbonneau:
Arain=0.023×R0.93 (3)
em que R é a taxa de precipitação em mm/h (variando entre 0,25 e 50 mm/h conforme registros pluviométricos do Iraque). A relação de eficiência de extinção foi utilizada para as condições de tempestade de poeira, empregando o espalhamento de Mie:
Adust=10×log₁₀(e(τ×L)) (4)
em que τ=∫₀^∞ πr2Qext(r,λ,m)N(r)dr, r é o raio da partícula (0,1–100 μm de acordo com a composição do pó iraquiano), Qext é a eficiência de extinção calculada utilizando a teoria de Mie, λ=1550 nm, m=1,55–0,005i é o índice de refração complexo para poeira do Oriente Médio e N(r) é a distribuição do tamanho das partículas modelada usando uma distribuição log-normal com raio médio geométrico de 2,5 μm e desvio padrão de 2,0. O modelo de atenuação foi implementado para condições de neve da seguinte forma:
Asnow = 0.1×S0.75 (5)
onde S é a taxa de precipitação de neve em mm/h (0,5–15 mm/h). Esta equação empírica foi escolhida com base no trabalho descrito na literatura30, em que foram desenvolvidos modelos de atenuação para propagação óptica através da neve utilizando a teoria de espalhamento de Mie aplicada às distribuições de tamanho de flocos de neve. A equação é válida para taxas de queda de neve entre 0,5 e 15 mm/h e assume condições de neve seca com diâmetros típicos de flocos de 1–10 mm. O coeficiente 0,1 e o expoente 0,75 foram obtidos por ajuste de curva aos cálculos de espalhamento de Mie30 para neve em 1550 nm. O modelo não faz ajustes para neve úmida ou precipitação combinada, que podem apresentar propriedades de atenuação variáveis, embora ofereça uma estimativa razoável para neve seca. Devido à eficácia computacional do método, seu frequente uso nas publicações sobre FSO e sua adequação às condições de neve previstas no norte do Iraque (região do Curdistão em janeiro e fevereiro), ele foi selecionado para esta investigação. Utilizando o Numpy para cálculos numéricos, todos os modelos foram implementados em Python 3.9. O modelo correspondente foi aplicado às condições meteorológicas escolhidas aleatoriamente e aos dados ambientais amostrados para calcular o valor de atenuação de cada amostra. A distribuição meteorológica obtida incluiu 814 condições de céu limpo (54,27%), 375 eventos de poeira (25,00%), 157 eventos de neblina (10,47%), 111 eventos de chuva (7,40%) e 43 eventos de neve (2,87%).
O exame de informações meteorológicas históricas coletadas em estações meteorológicas iraquianas em diversas regiões (Bagdá, Basra, Mossul e Ramadi) entre 2020 e 2024 foi utilizado para estabelecer as proporções das situações meteorológicas. Os dados originais foram fornecidos pelo Ministério dos Transportes do Iraque e pela Organização Meteorológica do Iraque e Sismologia (IMOS). Os dados incluíram registros meteorológicos diários que registravam as condições atmosféricas vigentes em cada dia. Entre as características específicas extraídas desses registros estavam temperatura (mínima, máxima e média diárias), umidade relativa, visibilidade, quantidade de precipitação pluviométrica e ocorrências de tempestades de poeira. Uma parte dos dados da IMOS está disponível no portal de dados abertos do governo iraquiano (https://www.motrans.gov.iq/); no entanto, os registros específicos utilizados neste estudo não são armazenados publicamente em um repositório central. A informação climática utilizada para calcular as porcentagens das condições meteorológicas e dos valores dos parâmetros está resumida na Tabela 1. Os dias com céu limpo foram definidos como dias sem precipitação, com visibilidade superior a 10 km e sem atividade de poeira, representando 54,27% dos 1.825 dias registrados. Os dias com tempestade de poeira (incluindo tempestade de poeira total (visibilidade < 1 km) e tempestade de poeira parcial (visibilidade entre 1 e 10 km)) representaram 22,47% do período analisado, enquanto os dias nublados (sem precipitação, mas com cobertura de nuvens superior a 7/8 do céu) representaram 15,07%. Os dias chuvosos, definidos como aqueles com precipitação pluviométrica acima de 0,1 mm, representaram 8,22% do total. < 1 km) e poeira suspensa (visibilidade de 1–5 km)) corresponderam a 25,00% dos dias, indicando a alta frequência de eventos de tempestades de areia no clima árido e semiárido do Iraque. Os dias com visibilidade inferior a 1 km causados pela suspensão de gotículas de água (excluindo a redução da visibilidade induzida por poeira) foram classificados como dias de nevoeiro. A porcentagem de dias de nevoeiro foi de 10,47%, ocorrendo principalmente no inverno nas regiões do norte do Iraque. Dias de chuva, dias com precipitação mensurável >0,1 mm, foram de 7,40%, consistente com a baixa média de precipitação anual no Iraque, de 150–200 mm por ano. Os dias com neve (dias com acúmulo de precipitação congelada) representaram 2,87% dos dias e estiveram restritos às áreas montanhosas do norte (região do Curdistão) em janeiro e fevereiro. Essas proporções foram posteriormente utilizadas como pesos probabilísticos para amostragem aleatória na geração do conjunto de dados. Assim, o conjunto de dados sintético reflete a frequência real de cada condição meteorológica no ambiente iraquiano.
Considerações sobre viés na geração de dados sintéticos
Várias etapas foram tomadas para reduzir possíveis vieses:
(1) Seleção da distribuição: As propriedades estatísticas dos dados climáticos de origem foram utilizadas para selecionar as distribuições de probabilidade. A temperatura apresentava distribuição normal com média e desvio padrão conforme registrado pelo IMOS. A umidade apresentava distribuição uniforme em toda a faixa observada (0-100%). Assumiu-se que a visibilidade seguisse uma distribuição log-normal para levar em conta a ocorrência frequente de eventos de baixa visibilidade durante tempestades de poeira. A concentração de poeira seguia uma distribuição exponencial, na qual havia maiores probabilidades em baixas concentrações e caudas longas em eventos extremos de poeira31. Isso estava de acordo com a frequência observada de eventos de poeira no Iraque32.
(2) Proporções das condições meteorológicas: A análise dos registros do IMOS para o período de 2020 a 2024, compreendendo 1.825 observações diárias em todas as quatro regiões, resultou nas seguintes proporções: 54,3% céu claro, 24,9% poeira, 10,5% neblina, 7,4% chuva e 2,8% neve. Dias sem precipitação, visibilidade >10 km e ausência de atividade de poeira foram definidos como dias de céu claro. Dias com tempestades de poeira incluíram tanto tempestades completas (visibilidade <1 km) quanto poeira suspensa (visibilidade entre 1 e 5 km). Um dia de neblina foi definido como um dia em que a visibilidade era inferior a 1 km e a causa era a suspensão de gotículas de água (não poeira). Dias de chuva foram definidos como dias com precipitação mensurável >0,1 mm. Dias de neve foram definidos como dias com precipitação congelada acumulada33.
(3) Faixas de parâmetros: As faixas de parâmetros foram baseadas nos extremos observados nos registros do IMOS: a temperatura variou de −4,89 °C (Mosul, inverno) a 47,99 °C (Basra, verão), a visibilidade variou de 0,05 km (tempestades de poeira severas) a 29,99 km (condições claras) e a concentração de poeira variou de 0 a 4,96 mg/m³ (com base na concentração máxima de poeira observada durante eventos severos de haboob)34.
(4) Pressupostos de Independência: Assumimos que os parâmetros ambientais foram amostrados de forma independente, o que representa uma simplificação das condições do mundo real, nas quais as variáveis atmosféricas são correlacionadas (por exemplo, alta concentração de poeira geralmente se correlaciona com baixa visibilidade). A fim de fornecer um ambiente de simulação controlado para comparação metódica de modelos, adotou-se este pressuposto de independência 35. As consequências desses pressupostos são abordadas na Discussão.
(5) Divisão Estratificada: A divisão entre treinamento e teste foi realizada de forma estratificada com base na categoria de condição meteorológica (céu limpo, neblina, chuva, poeira, neve) para garantir que a proporção de cada condição meteorológica nos conjuntos de treinamento e teste correspondesse à distribuição do conjunto de dados original. Dessa forma, o conjunto de teste não fica desbalanceado em relação a condições meteorológicas raras (especialmente neve, com 2,87%)36.
Reconhecimento da geração determinística de alvos
É importante destacar que o bom desempenho preditivo observado aqui pode ser parcialmente atribuído ao modelo ter aprendido ou aproximado as equações físicas determinísticas utilizadas para gerar os valores-alvo sintéticos37. Diferentemente das medições experimentais do mundo real, que contêm ruído de medição, erros de instrumento e fenômenos físicos não modelados, o conjunto de dados sintéticos oferece uma relação limpa e isenta de ruído entre as características de entrada e o alvo de atenuação. Isso ocorre porque os valores de atenuação foram calculados diretamente a partir dos modelos físicos de propagação (lei de Beer-Lambert, modelo de Kim, modelo de Carbonneau e teoria de espalhamento de Mie) com base nos parâmetros de entrada. Assim, as métricas quantitativas de desempenho (R2, RMSE, MAE) representam o desempenho em dados sintéticos derivados de equações e não devem ser interpretadas como desempenho esperado em dados observacionais ou experimentais com ruído. Os resultados devem ser encarados principalmente como uma avaliação comparativa de metodologias de modelagem em um ambiente de simulação controlado38.
Conjunto completo de características para o treinamento do modelo
O conjunto de dados de treinamento tinha 10 características de entrada para o treinamento do modelo:
1. Temperatura (°C)
2. Umidade (%)
3. Visibilidade (km)
4. Concentração de poeira (mg/m3)
5. Taxa de precipitação (mm/h)
6. Taxa de precipitação de neve (mm/h)
7. Velocidade do vento (m/s)
8. Pressão atmosférica (hPa)
9. Mês (numérico, 1–12)
10. Estação (codificada em uma saída: primavera, verão, outono, inverno)
Esclarecimento importante: as condições meteorológicas (céu limpo, neblina, chuva, poeira, neve) foram utilizadas como uma variável categórica para estratificação durante a divisão do conjunto de dados e não foram incluídas como características de entrada em nenhum modelo. A análise SHAP inclui apenas as 10 características listadas acima. A variável estação foi codificada em one-hot (4 categorias: primavera, verão, outono, inverno), e para a análise SHAP, as contribuições das variáveis de estação codificadas em one-hot foram somadas ao longo das estações para produzir um único valor de contribuição da estação. Esse valor combinado representa a contribuição total de todas as variáveis relacionadas à estação para a predição da atenuação. Antes de criar a figura resumo, as quatro colunas de estação codificadas em one-hot foram identificadas, e seus valores SHAP foram somados para cada amostra. Esse método garante que o uso da estação pelo modelo como uma variável categórica composta seja consistente com a análise SHAP.
Os principais fatores ambientais que afetaram diretamente a atenuação óptica por meio de mecanismos físicos foram as características 1–6. A inclusão das características 7 e 8 (velocidade do vento e pressão) como fatores meteorológicos complementares pode ter um impacto indireto na atenuação, afetando a estabilidade do ar e a dispersão de aerossóis. Para levar em conta as variações sazonais nas condições atmosféricas, as características 9–10 (mês e estação) foram incluídas como descritores temporais. O valor de atenuação (dB/km) foi utilizado como variável alvo para todos os modelos. As estatísticas principais do conjunto de dados incluíram temperatura (28,55°C ± 11,18°C), umidade (42,01% ± 25,56%), visibilidade (13,10 ± 10,91 km; intervalo: 0,05–29,99 km), concentração de poeira (0,74 ± 1,30 mg/m3; máximo: 4,96 mg/m3), atenuação (4,80 ± 7,20 dB/km; intervalo: 0,09–50,93 dB/km), alcance operacional (5,74 ± 1,97 km) e relação sinal-ruído (64,88 ± 15,07 dB). O Alcance Operacional e a RSR foram calculados a partir dos valores de atenuação utilizando equações padrão de orçamento de enlace FSO.
Cálculo do intervalo de operação
A Faixa de Operação (em km) foi calculada utilizando a equação do orçamento de enlace:
Prx=Ptx×Gt×Gr×(λ/(4πR))2×10(−A×R/10) (6)
em que: Prx = potência recebida (definida como a sensibilidade mínima de −30 dBm); Ptx = potência de transmissão (fixa em 20 dBm); Gt = ganho do transmissor (calculado a partir dos tamanhos da abertura); Gr = ganho do receptor (calculado a partir dos tamanhos da abertura); λ = comprimento de onda (1550 nm); R = alcance em km; A = atenuação atmosférica em dB/km (calculada a partir dos modelos físicos).
Ganhos do Transmissor e do Receptor: O ganho do transmissor (Gt) foi calculado como: Gt = 10×log₁₀[0.7×(π×0.025/1.55×10⁻6)2] ≈ 44,2 dBi. O ganho do receptor (Gr) foi calculado como: Gr = 10×log₁₀[0.7×(π×0.20/1.55×10⁻6)2] ≈ 62,3 dBi. A abertura de transmissão tinha diâmetro de 2,5 cm e eficiência de 0,7. A abertura receptora tinha diâmetro de 20 cm e eficiência de 0,7. A equação foi resolvida iterativamente para R a fim de determinar a distância máxima de enlace alcançável para cada valor de atenuação.
Cálculo da relação sinal-ruído
A RSE (Relação Sinal-Ruído) em dB foi calculada utilizando a equação:
SNR=Prx−10×log₁₀(kTB)−NF (7)
em que: Prx = potência recebida em dBm (calculada a partir do orçamento de enlace); k = 1,38×10⁻23 J/K (constante de Boltzmann); T = 290 K (temperatura do receptor); B = 109 Hz (largura de banda do receptor, 1 GHz); NF = 3 dB (figura de ruído do receptor). O nível de ruído foi calculado como:
10 × log10(kTB) ≈ −84 dBm (8)
Para cada amostra, após calcular a atenuação A utilizando o modelo físico apropriado, a Distância de Operação foi determinada resolvendo o orçamento de enlace para R, e a SNR foi calculada a partir da potência recebida resultante Prx nessa distância.
Valores de Faixa Operacional Específicos para Condições Climáticas: A faixa operacional variou conforme as condições meteorológicas: céu claro (7,12 ± 1,85 km), neblina (5,81 ± 1,92 km), neve (5,42 ± 1,56 km), chuva (3,81 ± 0,98 km) e poeira (3,72 ± 1,08 km). Uma margem de 3 dB não foi aplicada nos cálculos atuais; a faixa operacional representa a faixa máxima teórica sem margem de sistema. A faixa operacional relatada (5,74 ± 1,97 km) é a média geral entre todas as condições climáticas39.
Distância de Transmissão Fixa: A distância de transmissão nos modelos físicos de atenuação foi definida em 3 km. Essa é a distância do enlace para a qual foram realizados os cálculos de atenuação. O alcance operacional informado é a distância máxima teórica calculada utilizando a equação do orçamento de enlace, que pode diferir da distância de transmissão fixa de 3 km. Os valores de atenuação específicos para cada condição climática foram registrados para condições claras (0,27±0,06 dB/km), neblina (1,88±1,92 dB/km), neve (6,45±2,54 dB/km), chuva (13,58±6,32 dB/km) e poeira (13,10±7,32 dB/km). Todos os valores quantitativos relatados neste manuscrito são apresentados como média ± desvio padrão (DP), salvo indicação em contrário40.
O R2 de validação cruzada para Floresta Aleatória é informado como 0,960±0,007. Em certos casos, como temperatura (−4,89 a 47,99°C), visibilidade (0,05 a 29,99 km), concentração de poeira (0 a 4,96 mg/m3) e atenuação (0,09 a 50,93 dB/km), a amplitude (mínimo a máximo) é fornecida por extenso. O conjunto de dados foi dividido em subgrupos para teste (300 amostras; 20%) e treinamento (1.200 amostras; 80%). Utilizou-se amostragem aleatória estratificada para realizar a divisão entre treinamento e teste. Para garantir que a porcentagem de cada condição meteorológica no conjunto de treinamento (80%) e no conjunto de teste (20%) correspondesse à distribuição original do conjunto de dados, foi aplicada estratificação com base na categoria de condição meteorológica (céu limpo, neblina, chuva, poeira e neve). Especificamente, 1.200 (80%) das 1.500 amostras foram alocadas ao conjunto de aprendizado e 300 (20%) ao conjunto de teste. As amostras foram escolhidas aleatoriamente para cada categoria de condições meteorológicas, mantendo as proporções originais: das 814 amostras de céu limpo (54,27%), 651 foram destinadas ao treinamento e 163 ao teste; das 375 amostras de poeira (25,00%), 300 ao treinamento e 75 ao teste; das 157 amostras de neblina (10,47%), 126 ao treinamento e 31 ao teste; das 111 amostras de chuva (7,40%), 89 ao treinamento e 22 ao teste; das 43 amostras de neve (2,87%), 34 ao treinamento e 9 ao teste. A amostragem aleatória dentro de cada estrato foi realizada utilizando uma semente aleatória de 42 para garantir a reprodutibilidade. Essa abordagem estratificada foi escolhida para evitar representação desbalanceada das condições meteorológicas raras (especialmente neve, com 2,87%) no conjunto de teste, o que poderia levar a uma avaliação de desempenho não confiável para essas condições.
Avaliação de modelos de aprendizado de máquina
Seis métodos de aprendizado de máquina foram avaliados, incluindo Regressão por Vetores de Suporte (SVR) com kernel de função de base radial (C = 100), K-Vizinhos Mais Próximos (KNN; k = 10, com ponderação por distância), RF (200 árvores, profundidade máxima = 20), Boosting Extremo por Gradiente (XGBoost; 200 estimadores, profundidade máxima = 10, taxa de aprendizado = 0,1), Máquina de Boosting por Gradiente Leve (LightGBM; 200 estimadores, profundidade máxima = 10, taxa de aprendizado = 0,1) e Regressão Linear de referência. Para todos os modelos de aprendizado de máquina e aprendizado profundo, foi realizada a otimização dos hiperparâmetros mais críticos, enquanto os valores padrão foram mantidos para os parâmetros não especificados. Para os modelos de aprendizado de máquina, os seguintes parâmetros foram ajustados explicitamente usando busca em grade com validação cruzada de 5 dobras no conjunto de treinamento: 1) Floresta Aleatória: número de árvores (testados: 50, 100, 150, 200, 250) e profundidade máxima (testadas: 10, 15, 20, 25, sem limite), com valores ótimos de 200 árvores e profundidade 20 selecionados. 2) XGBoost: número de estimadores (testados: 100, 150, 200, 250), profundidade máxima (testadas: 6, 8, 10, 12) e taxa de aprendizado (testadas: 0,05, 0,1, 0,2), com valores ótimos de 200 estimadores, profundidade 10 e taxa de aprendizado 0,1. 3) LightGBM: foram utilizados intervalos idênticos de ajuste, resultando em 200 estimadores, profundidade 10 e taxa de aprendizado 0,1. 4) SVR: o parâmetro de regularização C (testado: 1, 10, 50, 100) e o coeficiente do kernel gamma (testado: ‘scale’, ‘auto’, 0,1, 0,01) foram ajustados, com valores ótimos de C = 100 e kernel RBF. 5) KNN: o número de vizinhos k (testado: 3, 5, 7, 10, 15) foi ajustado, com valor ótimo de k = 10 e votação ponderada por distância habilitada.
Todos os outros parâmetros para esses modelos foram mantidos em seus valores padrão conforme definidos no scikit-learn (consulte a Tabela de Materiais para a versão; por exemplo, Floresta Aleatória: bootstrap=True, min_samples_split=2, min_samples_leaf=1; XGBoost: subsample=1.0, colsample_bytree=1.0, gamma=0). Para os modelos de aprendizado profundo, a arquitetura (número de camadas e unidades por camada) e a taxa de dropout (20%) foram ajustadas manualmente por meio de experimentação iterativa no conjunto de validação, enquanto o otimizador (Adam), a taxa de aprendizado inicial (0,001), a paciência da parada antecipada (20 épocas) e os parâmetros de redução da taxa de aprendizado (fator 0,5, paciência 10) foram definidos com base em práticas padrão na literatura e mantidos fixos em todos os experimentos de aprendizado profundo.
Fontes de dados climáticos
As informações meteorológicas históricas coletadas de estações meteorológicas no Iraque em diversos locais (Bagdá, Basra, Mossul e Ramadi) entre 2020 e 2024 foram utilizadas para calcular as proporções dos estados climáticos e as distribuições das variáveis. Os dados brutos foram fornecidos pelo Ministério dos Transportes do Iraque e pela Organização Meteorológica do Iraque e Seismologia (IMOS). Os dados incluíram registros diários detalhando o estado atmosférico predominante em cada dia. As variáveis específicas obtidas desses registros incluíram temperatura (mínima, máxima e média diárias), umidade relativa, visibilidade, quantidade de precipitação e ocorrências de tempestades de poeira. Os dados da IMOS estão parcialmente disponíveis por meio do portal de dados abertos do governo iraquiano (https://www.motrans.gov.iq/), embora os registros específicos utilizados neste estudo não estejam arquivados publicamente em um repositório centralizado. Um resumo dos dados climáticos utilizados para determinar as proporções das condições meteorológicas e as faixas de parâmetros é apresentado na Tabela 1.
A validação cruzada cinco vezes foi utilizada no conjunto de treinamento (1.200 amostras) para ajustar os hiperparâmetros e estimar o desempenho de todos os modelos de aprendizado de máquina. Todas as variáveis de entrada (temperatura, umidade, visibilidade, concentração de poeira, taxa de precipitação, taxa de neve, velocidade do vento, pressão) foram padronizadas por escalonamento (normalização por escore Z): x_scaled = (x − μ)/σ, em que μ e σ são a média e o desvio padrão do conjunto de treinamento. Realizamos a padronização dentro de cada dobra da validação cruzada utilizando apenas as estatísticas da dobra de treinamento para evitar vazamento de dados. Modelos baseados em árvores (Floresta Aleatória, XGBoost, LightGBM) são invariantes à escala, mas a mesma padronização foi aplicada para garantir consistência entre todos os modelos de aprendizado de máquina. A normalização por min-máx foi utilizada para modelos de aprendizado profundo: x_scaled = (x−x_min)/(x_max−x_min), que transforma as características para a faixa [0, 1] com base nos valores mínimos e máximos do conjunto de treinamento. Entradas limitadas promovem uma convergência mais rápida das redes neurais, razão pela qual foram escolhidas. O conjunto de teste foi escalonado utilizando os parâmetros obtidos a partir do conjunto de treinamento, e não foi usado para seleção de modelos ou ajuste de hiperparâmetros.
As métricas completas de desempenho foram registradas, incluindo o coeficiente de determinação do teste (R2), erro quadrático médio (RMSE), erro absoluto médio (MAE), R2 da validação cruzada e tempo de treinamento. Os tempos de treinamento para todos os modelos de aprendizado de máquina e aprendizado profundo são apresentados em segundos (s) para os modelos mais rápidos (Regressão Linear, KNN, SVR, Floresta Aleatória, XGBoost, LightGBM) e em minutos (min) para os modelos mais lentos (arquiteturas de aprendizado profundo). Todos os modelos foram treinados no mesmo ambiente computacional para garantir uma comparação justa41.
O tempo de treinamento foi medido utilizando o módulo time do Python, ou seja, o tempo decorrido do relógio real desde o início até o fim da função de ajuste do modelo, excluindo o tempo necessário para carregamento e pré-processamento dos dados. O tempo de treinamento de um modelo de aprendizado profundo é o tempo necessário para concluir todas as épocas até a interrupção antecipada. Isso inclui propagação direta, propagação inversa e verificações de validação. Todos os experimentos foram realizados com o sistema sem a execução de outros processos computacionalmente intensivos, a fim de obter medidas de tempo consistentes. Os tempos correspondem à média de 5 execuções independentes (desvios padrão)42.
Avaliação do modelo de aprendizado profundo
Seis arquiteturas de aprendizado profundo foram avaliadas utilizando aceleração por GPU, incluindo um Perceptron Multicamadas (MLP; 64-32-16), uma Rede Neural Profunda (DNN) com normalização por lote (128-64-32-16), uma rede Longa de Memória de Curto Prazo (LSTM; 64-32 unidades, comprimento da sequência = 10), uma rede neural convolucional unidimensional (1D-CNN), um modelo híbrido CNN–LSTM e uma rede baseada em atenção. Todos os modelos de aprendizado profundo foram implementados usando TensorFlow com a API Keras e executados com aceleração por GPU (consulte a Tabela de Materiais para versões de hardware e software). A arquitetura 1D-CNN consistiu em três camadas convolucionais (64, 128 e 256 filtros, tamanho do kernel 3, ativação ReLU, padding=’same’), duas camadas MaxPooling1D (tamanho do pool 2), uma camada GlobalAveragePooling1D, uma camada densa com 128 unidades e ativação ReLU, uma camada Dropout (0,2) e uma camada de saída densa (1 unidade, ativação linear), totalizando aproximadamente 245.000 parâmetros treináveis. A arquitetura híbrida CNN-LSTM aceitou sequências de entrada de 10 passos temporais com 5 características, utilizando duas camadas Conv1D (64 e 128 filtros, tamanho do kernel 3, ReLU, padding=’same’), uma camada MaxPooling1D (tamanho do pool 2), duas camadas LSTM (64 e 32 unidades, return_sequences=False), camadas Dropout (0,2), uma camada densa (32 unidades, ReLU) e uma camada de saída densa (1 unidade, ativação linear), totalizando aproximadamente 198.000 parâmetros treináveis. A rede baseada em atenção utilizou um mecanismo de atenção com múltiplos cabeçotes com 4 cabeçotes (dimensões de chave e valor de 64), em que a entrada foi projetada para 64 dimensões, seguida por atenção de produto escalar (fórmula: Attention(Q, K, V) = softmax(QKT/√d_k)V), conexões residuais, normalização de camada, uma rede feedforward (128→64 unidades), agrupamento médio global, Dropout (0,2), uma camada densa (32 unidades, ReLU) e uma camada de saída densa (1 unidade, ativação linear), totalizando aproximadamente 167.000 parâmetros treináveis43.
Todos os modelos utilizaram parada antecipada (paciente = 20), redução da taxa de aprendizado (fator = 0,5, paciente = 10), dropout (20%) e o otimizador Adam (taxa de aprendizado = 0,001). Para todos os modelos de aprendizado profundo, o tamanho do lote foi definido como 32 amostras, o número máximo de épocas de treinamento foi de 200 com parada antecipada (paciente = 20, restaurando os melhores pesos) e a função de perda foi o erro quadrático médio (MSE). A divisão entre treinamento e validação foi a seguinte: das 1.200 amostras originais de treinamento (após a divisão 80/20 entre treinamento e teste), 80% (960 amostras) foram usadas para treinamento e 20% (240 amostras) para validação. Realizamos a divisão estratificada entre treinamento e validação por condição climática para preservar a distribuição. O conjunto de validação foi usado apenas para parada antecipada, decaimento da taxa de aprendizado e monitoramento de sobreajuste; nunca foi usado para seleção de modelos ou ajuste de hiperparâmetros além desses procedimentos automatizados. Não reservamos um conjunto de validação separado para os modelos de aprendizado de máquina; em vez disso, utilizamos validação cruzada com cinco dobras nas 1.200 amostras de treinamento para ajustar hiperparâmetros e estimar o desempenho44.
Justificativa para a avaliação das arquiteturas LSTM e CNN–LSTM
O conjunto de dados principal consiste em amostras de clima geradas independentemente, mas também testamos arquiteturas LSTM e CNN–LSTM pelos seguintes motivos: (1) as condições atmosféricas do mundo real apresentam autocorrelação temporal, e testar modelos baseados em sequências nos permite determinar se a captura dessas dependências poderia melhorar a precisão das previsões; (2) pesquisas recentes em previsão atmosférica demonstraram o valor potencial de arquiteturas sequenciais para modelar a evolução temporal de parâmetros meteorológicos34; (3) testar uma ampla variedade de arquiteturas garante uma comparação abrangente de abordagens metodológicas, o que constitui uma contribuição fundamental deste estudo; e (4) a arquitetura híbrida CNN–LSTM combina extração de características espaciais com modelagem temporal, o que pode ser benéfico para capturar as interações complexas entre múltiplas variáveis atmosféricas45.
Formatação dos dados para entrada no modelo sequencial
Para as arquiteturas sequenciais (LSTM e CNN–LSTM), os dados de entrada foram reestruturados a partir de amostras independentes em pseudo-sequências usando uma abordagem de janela deslizante. Em particular, as 1.200 amostras de treinamento foram inicialmente agrupadas em categorias de condições meteorológicas para preservar a consistência física. Dentro de cada categoria meteorológica, as amostras foram ordenadas pelos seus carimbos de data e hora gerados (observações simuladas horárias para o ano civil de 2024). Em seguida, aplicou-se uma janela deslizante de comprimento 10 para produzir sequências de entrada com 10 passos de tempo consecutivos (cada um com 5 características: temperatura, umidade, visibilidade, concentração de poeira e taxa de precipitação) para prever a atenuação no 11º passo de tempo. Esse método preserva a ordenação temporal das observações simuladas, ao mesmo tempo que permite que modelos sequenciais aprendam dependências temporais. A estrutura do conjunto de teste foi a mesma, exceto pelo uso do mesmo tamanho de janela e conjunto de características. Reconhecemos que essa estruturação pseudo-sequencial é uma simplificação metodológica e não reflete as dinâmicas temporais do mundo real. Reconhecemos isso como uma limitação na seção de Discussão.
Avaliação de abordagens híbridas
Três abordagens híbridas foram examinadas. A primeira abordagem foi um Ensemble de Votação que média as previsões dos modelos Random Forest, XGBoost e Deep Neural Network usando pesos iguais (cada modelo recebeu um peso de 1/3), com a previsão final calculada como:
ŷensemble=(1/3)ŷRF+(1/3)ŷXGB+(1/3)ŷDNN (9)
A atribuição de pesos iguais foi escolhida para evitar a introdução de hiperparâmetros adicionais e para avaliar o desempenho básico do conjunto sem viés em relação a qualquer modelo individual. A segunda abordagem utilizou empilhamento com meta-estimador Ridge. Os modelos base foram Floresta Aleatória, XGBoost e uma Rede Neural Profunda (com base em atenção). O procedimento de empilhamento envolveu duas etapas: primeiro, cada modelo base foi treinado no conjunto completo de treinamento, composto por 1.200 amostras, utilizando validação cruzada com 5 dobras para gerar predições fora da dobra, criando assim uma nova matriz de meta-recursos de dimensão 1.200×3 (uma predição por modelo base por amostra). Em segundo lugar, um meta-estimador de regressão Ridge (parâmetro de regularização L2 alpha=1,0) foi treinado com base nesses meta-recursos, utilizando os valores originais de atenuação como variável-alvo, para aprender os pesos ótimos de combinação dos modelos base. A predição final do empilhamento foi:
ŷstacking=wRF×ŷRF+wXGB×ŷXGB+wDNN×ŷDNN (10)
em que os pesos w foram aprendidos pelo meta-aprendiz Ridge. O terceiro enfoque foi uma rede neural informada pela física que combinou 70% das previsões da rede neural com 30% do modelo Kim para amostras de condições de nevoeiro. A combinação foi realizada por meio de média ponderada fixa, utilizando a seguinte fórmula:
ŷhybrid=0,7×ŷneural+0,3×ŷKim (11)
em que ŷneural é a saída da rede neural baseada em atenção, e ŷKim é a atenuação calculada a partir do modelo de neblina de Kim com base na entrada de visibilidade. Para amostras sem neblina, a parte física foi definida como 0, e o modelo foi executado como uma rede neural pura. Os pesos (70% neural e 30% física) foram fixados com base em experimentação preliminar no conjunto de validação (não no conjunto de teste), em que testamos combinações de pesos de 90:10, 80:20, 70:30, 60:40 e 50:50. A divisão 70/30 foi escolhida porque proporcionou o melhor R2 de validação e ainda manteve uma restrição física suficiente do modelo de Kim para regular as previsões e evitar saídas fisicamente implausíveis, especialmente na neblina, onde o modelo de Kim fornece limites teóricos estabelecidos de atenuação.
Análise de importância e interpretabilidade de características
O modelo Random Forest com importância de características baseada na impureza (redução da variância) foi utilizado para extrair todos os 10 rankings de importância das características de entrada. A análise mostrou que a concentração de poeira (67,3%) e a visibilidade (21,2%) foram os preditores mais importantes, explicando juntos 88,5% da importância preditiva total. A terceira característica mais importante foi a taxa de chuva (6,0%), seguida pela velocidade do vento (2,1%), temperatura (1,5%), umidade (0,9%), mês (0,5%), estação (0,3%), taxa de neve (0,1%) e pressão atmosférica (0,1%). Os baixos valores de importância para as características temporais (mês e estação) indicam que a variação sazonal na atenuação atmosférica é capturada principalmente por parâmetros ambientais subjacentes, e não apenas por padrões baseados no tempo.
Uma análise SHAP (Shapley Additive exPlanations) foi realizada para avaliar as relações entre fatores ambientais e atenuação. O implementação do SHAP utilizada foi o módulo TreeExplainer da biblioteca SHAP, que é especificamente otimizado para modelos baseados em árvores, incluindo Random Forest, XGBoost e LightGBM (consulte a Tabela de Materiais para a versão). A configuração para a análise SHAP foi a seguinte: o modelo Random Forest treinado foi fornecido ao TreeExplainer, que calculou os valores SHAP usando a abordagem interventiva (marginal) de atribuição de características com base na expectativa condicional da saída do modelo. Os valores SHAP foram calculados para todas as 300 amostras do conjunto de teste, gerando uma matriz de tamanho 300 × 10 (um valor SHAP por característica por amostra). Para cada característica, o valor SHAP representou sua contribuição para a previsão em relação à linha de base (a previsão média do modelo). Valores SHAP negativos indicaram uma redução; enquanto valores SHAP positivos indicaram que a característica aumentou a previsão de atenuação. A intensidade da contribuição foi indicada pela magnitude do valor SHAP. A distribuição dos valores SHAP para cada característica (usando gráficos de enxame), a direção da influência (a correlação entre os valores das características e os valores SHAP) e os rankings de importância das características foram todos visualizados usando gráficos resumo. As funções de plotagem embutidas na biblioteca SHAP — shap.summary_plot() para o gráfico de enxame e shap.bar_plot() para a importância global das características — foram utilizadas para criar todas as visualizações SHAP.
Tratamento de Variáveis Codificadas em One-Hot: Quatro colunas binárias (primavera, verão, outono e inverno) foram inicialmente utilizadas para codificar a variável estação. A fim de criar um único valor de contribuição de "estação" por amostra para a análise SHAP, as contribuições dessas quatro variáveis codificadas em one-hot foram combinadas somando os valores SHAP para cada categoria de estação. Para realizar esse agrupamento, foram identificadas todas as colunas correspondentes aos grupos de estação codificados em one-hot, os valores SHAP foram extraídos para cada amostra e então somados elemento a elemento. Os valores SHAP combinados resultantes representam a contribuição global da estação para a predição de atenuação. Esse método permite uma única linha de "estação" no gráfico resumo SHAP e garante consistência com o uso da estação no modelo como uma variável categórica composta. Como o valor combinado oferece uma representação mais compreensível da contribuição total da estação, os valores SHAP da estação não foram exibidos separadamente para cada categoria de estação.