Este estudio no involucró participantes humanos ni animales vertebrados, ni muestreo de tejidos. Todos los datos utilizados para esta investigación fueron generados sintéticamente empleando modelos físicos de propagación y parámetros meteorológicos de acceso público. Por lo tanto, no se requirió aprobación ética por parte de una Junta de Revisión Institucional (IRB) ni de un Comité Institucional para el Cuidado y Uso de Animales (IACUC).
Generación del Conjunto de Datos Basada en la Teoría Física de Propagación. El conjunto de datos fue construido para simular condiciones atmosféricas horarias durante un año calendario completo (2024) en condiciones atmosféricas iraquíes, destinado a un sistema de comunicación óptica en espacio libre. Creamos una base de datos sintética con 1.500 muestras por hora.
Primero, las condiciones meteorológicas se asignaron aleatoriamente según tendencias regionales: cielo despejado (54,3%), polvo (24,9%), niebla (10,5%), lluvia (7,4%) y nieve (2,8%). Segundo, se aplicó el modelo físico de atenuación correspondiente a cada muestra según la condición meteorológica, es decir, la ley de Beer-Lambert para cielo despejado, el modelo de Kim para niebla, la teoría de Carbonneau para lluvia y la teoría de dispersión de Mie para tormentas de polvo. Tercero, los parámetros del sistema FSO se establecieron de la siguiente manera: potencia de transmisión de 20 dBm, longitud de onda de 1550 nm, distancia de transmisión de 3 km, apertura de transmisión de 2,5 cm y apertura receptora de 20 cm. Cuarto, se calculó la atenuación en dB/km para cada muestra. Finalmente, el conjunto completo de datos se dividió aleatoriamente en 1.200 muestras de entrenamiento (80%) y 300 muestras de prueba (20%). Las condiciones simuladas incluyen altas concentraciones de polvo asociadas con tormentas de arena, tormentas de lluvia y cambios de temperatura desde −4,89 °C hasta 47,99 °C. Las condiciones meteorológicas y las distribuciones de parámetros se seleccionaron según los registros climáticos de Irak del período 2020–2024. Los cinco regímenes meteorológicos (cielo despejado, niebla, lluvia, tormentas de polvo y nieve) se eligieron porque cubren todo el espectro de condiciones atmosféricas que afectan la atenuación FSO en Irak, siendo las tormentas de polvo especialmente frecuentes en Oriente Medio. Los datos históricos de meteorología recopilados en diversas regiones de Irak se utilizaron para crear la distribución de probabilidad de cada condición meteorológica. La distribución resultante fue la siguiente: 54,3% de cielo despejado (estado predominante), 24,9% de polvo (que representa el problema de tormentas de arena en Irak), 10,5% de niebla (frecuente en los inviernos del norte de Irak), 7,4% de lluvia (cantidades bajas de precipitación típicas de Irak) y 2,8% de nieve (ocasional en zonas montañosas del norte). Los parámetros meteorológicos relevantes se modelaron utilizando distribuciones de probabilidad para cada condición meteorológica de la siguiente manera: la temperatura se modeló mediante una distribución normal (media 28,55±11,18 °C) entre −4,89 °C y 47,99 °C según los extremos estacionales de Irak; la humedad se modeló mediante una distribución uniforme (media 42,01±25,56%) desde 0% hasta 100%; la visibilidad se modeló mediante una distribución log-normal entre 0,05 km y 29,99 km (media 13,10±10,91 km) para tener en cuenta los frecuentes eventos de baja visibilidad durante las tormentas de polvo; la concentración de polvo se modeló mediante una distribución exponencial entre 0 y 4,96 mg/m3 (media 0,74±1,30 mg/m3), con mayores probabilidades para concentraciones bajas y colas largas para eventos extremos de polvo.
El sistema de comunicación fue diseñado con una potencia de transmisión de 20 dBm, una longitud de onda de 1550 nm, una distancia de transmisión de hasta 3 km, una apertura de transmisión de 2.5 cm y una apertura receptora de 20 cm para compensar la pérdida por divergencia. Los parámetros del sistema FSO se dividieron en dos grupos: parámetros fijos que no cambiaron para ninguna de las muestras y parámetros variables que se modificaron durante la generación del conjunto de datos. Para las 1.500 muestras, los siguientes parámetros se mantuvieron constantes: potencia de transmisión (20 dBm), longitud de onda de operación (1550 nm), apertura de transmisión (diámetro de 2.5 cm, eficiencia de 0.7) y apertura receptora (diámetro de 20 cm, eficiencia de 0.7). Estos parámetros se fijaron porque corresponden a las especificaciones físicas del hardware del sistema FSO y no varían con las condiciones meteorológicas. El conjunto de datos se creó con 1500 muestras, variando los siguientes parámetros: temperatura (de −4.89°C a 47.99°C), humedad (de 0% a 100%), visibilidad (de 0.05 km a 29.99 km), concentración de polvo (de 0 a 4.96 mg/m3) y condición meteorológica (cielo despejado, niebla, lluvia, polvo, nieve). Estos parámetros se modificaron según distribuciones de probabilidad derivadas de registros climáticos de Irak correspondientes a los años 2020–2024. Para cada muestra, el valor de atenuación (dB/km) se calculó utilizando el modelo físico de atenuación correspondiente, de acuerdo con la combinación específica de condiciones meteorológicas y parámetros variables.
La atenuación física se modeló utilizando el modelo de Carbonneau para la lluvia, la ley de Beer-Lambert para condiciones despejadas, la teoría de dispersión de Mie para el polvo y el modelo de Kim para la niebla24. La ley de Beer-Lambert se aplica a condiciones de cielo despejado, donde la atenuación está dominada por la dispersión y absorción moleculares, que disminuyen exponencialmente con la distancia25. El coeficiente de extinción α a 1550 nm se debe a la dispersión de Rayleigh por las moléculas del aire y a la absorción por los gases atmosféricos26. El modelo de Kim es un modelo específico para la niebla que relaciona la atenuación con la visibilidad mediante coeficientes empíricos derivados de las distribuciones del tamaño de las gotas de niebla. El exponente dependiente de la longitud de onda q tiene en cuenta la dispersión de Mie27. El parámetro principal del modelo de Carbonneau es la tasa de precipitación R, ya que la atenuación por lluvia depende del tamaño y la densidad de las gotas de lluvia, y los coeficientes se derivan empíricamente a 1550 nm y se calibran específicamente para longitudes de onda ópticas28. La teoría de dispersión de Mie es aplicable a condiciones de polvo, dado que el tamaño de las partículas de polvo (0.1–100 μm de radio) es comparable a la longitud de onda (1550 nm), y el índice de refracción complejo m = 1.55–0.005i para el polvo del Medio Oriente incluye tanto dispersión como absorción29. Los siguientes modelos físicos de atenuación se implementaron con sus respectivas ecuaciones y configuraciones de parámetros.
Para condiciones de cielo despejado, se utilizó la ley de Beer-Lambert:
Aclear = 10×log₁₀(e(α×d)) (1)
donde α es el coeficiente de extinción (variado mediante una distribución normal centrada en 0,02 dB/km con una variación de ±0,005 dB/km a 1550 nm en condiciones claras), y d es la distancia de transmisión (fijada en 3 km). Para condiciones de niebla, se implementó el modelo de Kim utilizando la ecuación:
Afog = 10×ln(10)/V×(λ/550)−q (2)
donde V es la visibilidad en kilómetros (varía de 0,05 km a 10 km), λ es la longitud de onda en nanómetros (fijada en 1550 nm) y q es el coeficiente de distribución del tamaño de partículas calculado como: q = 1,6 para V>50 km, q = 1,3 para 6<V<50 km, q = 0,585×V(1/3) para 1 <V<6 km, q = 0 para 0,5<V<1 km y q = 0,5 para V<0,5 km. Para condiciones de lluvia, se utilizó el modelo de Carbonneau:
Arain=0.023×R0.93 (3)
donde R es la tasa de lluvia en mm/h (varió entre 0,25 y 50 mm/h según los registros pluviométricos de Irak). Se utilizó la relación de eficiencia de extinción para las condiciones de tormenta de polvo mediante la dispersión de Mie:
Adust=10×log₁₀(e(τ×L)) (4)
donde τ=∫₀^∞ πr2Qext(r,λ,m)N(r)dr, r es el radio de la partícula (0,1–100 μm según la composición del polvo iraquí), Qext es la eficiencia de extinción calculada utilizando la teoría de Mie, λ=1550 nm, m=1,55–0,005i es el índice de refracción complejo para el polvo del Oriente Medio, y N(r) es la distribución del tamaño de partículas modelada mediante una distribución log-normal con un radio medio geométrico de 2,5 μm y una desviación estándar de 2,0. El modelo de atenuación se implementó para condiciones de nieve de la siguiente manera:
Asnow = 0.1×S0.75 (5)
donde S es la tasa de nevada en mm/h (0,5–15 mm/h). Esta ecuación empírica se seleccionó con base en los trabajos existentes en la literatura30, donde se desarrollaron modelos de atenuación para la propagación óptica a través de la nieve utilizando la teoría de dispersión de Mie aplicada a las distribuciones del tamaño de los copos de nieve. La ecuación es válida para tasas de caída de nieve entre 0,5 y 15 mm/h y asume condiciones de nieve seca con diámetros típicos de copos de 1–10 mm. El coeficiente 0,1 y el exponente 0,75 se obtuvieron mediante ajuste de curvas a cálculos de dispersión de Mie30 para nieve a 1550 nm. No realiza ajustes para nieve húmeda ni precipitación combinada, que pueden tener propiedades de atenuación variables, aunque ofrece una estimación razonable para nieve seca. Debido a que este enfoque es computacionalmente eficaz, frecuentemente citado en publicaciones sobre comunicaciones ópticas en espacio libre (FSO) y adecuado para las condiciones de nieve previstas en el norte de Irak (región del Kurdistán en enero y febrero), fue seleccionado para esta investigación. Mediante el uso de Numpy para cálculos numéricos, todos los modelos se implementaron en Python 3.9. Se aplicó el modelo correspondiente a la condición meteorológica elegida aleatoriamente y a los datos ambientales muestreados para calcular el valor de atenuación de cada muestra. La distribución meteorológica obtenida incluyó 814 condiciones de cielo despejado (54,27 %), 375 eventos de polvo (25,00 %), 157 eventos de niebla (10,47 %), 111 eventos de lluvia (7,40 %) y 43 eventos de nieve (2,87 %).
El examen de la información meteorológica histórica recopilada de estaciones meteorológicas iraquíes en varias regiones (Bagdad, Basora, Mosul y Ramadi) entre 2020 y 2024 se utilizó para establecer las proporciones de las situaciones meteorológicas. Los datos originales fueron suministrados por el Ministerio de Transporte de Irak y la Organización Meteorológica y Sismológica de Irak (IMOS, por sus siglas en inglés). Los datos incluían registros meteorológicos diarios que registraban las condiciones atmosféricas actuales para cada día. Entre las características específicas extraídas de estos registros se encontraban la temperatura (mínima, máxima y media diarias), la humedad relativa, la visibilidad, la cantidad de precipitación y la ocurrencia de tormentas de polvo. Una parte de los datos de IMOS está disponible a través del portal de datos abiertos del gobierno iraquí (https://www.motrans.gov.iq/); sin embargo, los registros específicos utilizados en este estudio no se almacenan públicamente en un repositorio central. La información climática empleada para calcular los porcentajes de las condiciones meteorológicas y los valores de los parámetros se resume en la Tabla 1. Los días con cielo despejado se definieron como días sin precipitación, con visibilidad mayor a 10 km y sin actividad de polvo, representando el 54,27 % de los 1.825 días registrados. Los días con tormenta de polvo (incluyendo tormenta de polvo completa (visibilidad < 1 km) y tormenta de polvo parcial (visibilidad entre 1 y 10 km)) representaron el 22,08 % del total. Los días nublados se definieron como días sin precipitación ni actividad de polvo, pero con visibilidad ≤ 10 km debido a la nubosidad, y representaron el 15,34 % del total. Los días lluviosos se definieron como días con cualquier cantidad de precipitación registrada, independientemente de la visibilidad o la actividad de polvo, y representaron el 8,27 % del total. < 1 km) y polvo suspendido (visibilidad de 1–5 km)) representaron el 25,00 % de los días, lo que indica la alta frecuencia de eventos de tormentas de arena en el clima árido y semiárido de Irak. Los días con visibilidad inferior a 1 km causados por la suspensión de gotas de agua (excluyendo la reducción de visibilidad inducida por polvo) se clasificaron como días de niebla. El porcentaje de días de niebla fue del 10,47 %, y estos días fueron principalmente en invierno en las regiones del norte de Irak. Días de lluvia, días con precipitación medible >0,1 mm, fueron del 7,40 %, lo que es consistente con el bajo promedio de precipitaciones anuales en Irak, de 150–200 mm por año. Los días con nieve (días con acumulación de precipitación congelada) representaron el 2,87 % de los días y se limitaron a las zonas montañosas del norte (región de Kurdistán) en enero y febrero. Estas proporciones se utilizaron posteriormente como pesos de probabilidad para el muestreo aleatorio en la generación del conjunto de datos. Por lo tanto, el conjunto de datos sintético refleja la frecuencia real de cada condición meteorológica en el entorno iraquí.
Consideraciones sobre el sesgo en la generación de datos sintéticos
Se tomaron varias medidas para reducir el posible sesgo:
(1) Seleccione la distribución: Se utilizaron las propiedades estadísticas de los datos climáticos originales para seleccionar las distribuciones de probabilidad. La temperatura presentaba una distribución normal con una media y una desviación estándar según lo registrado por el IMOS. La humedad presentaba una distribución uniforme en todo el rango observado (0-100%). Se asumió que la visibilidad seguía una distribución log-normal para tener en cuenta la frecuente ocurrencia de eventos de baja visibilidad durante las tormentas de polvo. La concentración de polvo seguía una distribución exponencial, en la que había mayores probabilidades a bajas concentraciones y colas largas en eventos extremos de polvo31. Esto era consistente con la frecuencia observada de eventos de polvo en Irak32.
(2) Proporciones de condiciones meteorológicas: El análisis de los registros de IMOS para el período 2020–2024, que comprende 1.825 observaciones diarias en las cuatro regiones, arrojó las siguientes proporciones: 54,3 % de cielo despejado, 24,9 % de polvo, 10,5 % de niebla, 7,4 % de lluvia y 2,8 % de nieve. Se consideraron días con cielo despejado aquellos sin precipitación, con visibilidad >10 km y sin actividad de polvo. Los días con tormentas de polvo incluyeron tanto tormentas completas (visibilidad <1 km) como polvo suspendido (visibilidad entre 1 y 5 km). Un día de niebla se definió como un día en que la visibilidad fue inferior a 1 km y la causa fue la suspensión de gotas de agua (no polvo). Los días de lluvia se definieron como días con precipitación medible >0,1 mm. Los días de nieve se definieron como días con precipitación congelada acumulada33.
(3) Rangos de parámetros: Los rangos de parámetros se basaron en los valores extremos observados en los registros de IMOS: la temperatura varió desde −4.89 °C (Mosul, invierno) hasta 47.99 °C (Basra, verano), la visibilidad varió desde 0,05 km (tormentas de polvo severas) hasta 29,99 km (condiciones claras), y la concentración de polvo varió desde 0 hasta 4,96 mg/m3 (según la concentración máxima de polvo observada durante eventos severos de haboob)34.
(4) Supuestos de independencia: Se asumió que los parámetros ambientales se muestrearon de forma independiente, lo cual es una simplificación de las condiciones del mundo real en las que las variables atmosféricas están correlacionadas (por ejemplo, una alta concentración de polvo suele correlacionarse con baja visibilidad). Con el fin de proporcionar un entorno de simulación controlado para la comparación metódica de modelos, se adoptó este supuesto de independencia 35. Las consecuencias de estos supuestos se analizan en la Discusión.
(5) División estratificada: La división entre conjuntos de entrenamiento y prueba se realizó de forma estratificada según la categoría de condición meteorológica (cielo despejado, niebla, lluvia, polvo, nieve) para garantizar que la proporción de cada condición meteorológica en los conjuntos de entrenamiento y prueba correspondiera a la distribución del conjunto de datos original. De este modo, el conjunto de prueba no queda desequilibrado respecto a condiciones meteorológicas raras (especialmente nieve con un 2,87 %)36.
Reconocimiento de la generación determinista de objetivos
Es importante señalar que el buen rendimiento predictivo observado aquí puede deberse en parte al aprendizaje o aproximación por parte del modelo de las ecuaciones físicas deterministas utilizadas para generar los valores objetivo sintéticos37. A diferencia de las mediciones experimentales del mundo real, que contienen ruido de medición, errores instrumentales y fenómenos físicos no modelados, el conjunto de datos sintético proporciona una relación limpia y libre de ruido entre las variables de entrada y el objetivo de atenuación. Esto se debe a que los valores de atenuación se calcularon directamente a partir de modelos físicos de propagación (ley de Beer-Lambert, modelo de Kim, modelo de Carbonneau y teoría de dispersión de Mie) basados en los parámetros de entrada. Por lo tanto, las métricas cuantitativas de rendimiento (R2, RMSE, MAE) representan el desempeño sobre datos sintéticos derivados de ecuaciones y no deben interpretarse como el rendimiento esperado sobre datos observacionales o experimentales con ruido. Los resultados deben considerarse principalmente como una evaluación comparativa de metodologías de modelado en un entorno de simulación controlado38.
Conjunto completo de características para el entrenamiento del modelo
El conjunto de datos de entrenamiento tenía 10 características de entrada para el entrenamiento del modelo:
1. Temperatura (°C)
2. Humedad (%)
3. Visibilidad (km)
4. Concentración de polvo (mg/m3)
5. Tasa de precipitación (mm/h)
6. Tasa de precipitación de nieve (mm/h)
7. Velocidad del viento (m/s)
8. Presión atmosférica (hPa)
9. Mes (numérico, 1–12)
10. Estación (codificada como variables ficticias: primavera, verano, otoño, invierno)
Aclaración importante: Las condiciones meteorológicas (cielo despejado, niebla, lluvia, polvo, nieve) se utilizaron como una variable categórica para la estratificación durante la división del conjunto de datos y no se incluyeron como características de entrada para ningún modelo. El análisis SHAP incluye únicamente las 10 características enumeradas anteriormente. La variable estacional se codificó mediante variables ficticias (4 categorías: primavera, verano, otoño, invierno), y para el análisis SHAP, las contribuciones de las variables estacionales codificadas se sumaron a través de las estaciones para producir un único valor de contribución estacional. Este valor combinado representa la contribución total de todas las variables relacionadas con la estación al pronóstico de atenuación. Antes de crear la figura resumen, se identificaron las cuatro columnas estacionales codificadas mediante variables ficticias, y sus valores SHAP se sumaron para cada muestra. Este método garantiza que el uso que hace el modelo de la estación como variable categórica compuesta sea coherente con el análisis SHAP.
Los principales factores ambientales que afectaron directamente la atenuación óptica mediante mecanismos físicos fueron las características 1–6. La inclusión de las características 7 y 8 (velocidad del viento y presión) como factores meteorológicos complementarios podría tener un impacto indirecto sobre la atenuación, al influir en la estabilidad del aire y en la dispersión de aerosoles. Con el fin de considerar las variaciones estacionales en las condiciones atmosféricas, se incluyeron las características 9–10 (mes y estación) como descriptores temporales. El valor de atenuación (dB/km) se utilizó como variable objetivo para todos los modelos. Las estadísticas clave del conjunto de datos incluyeron temperatura (28,55°C ± 11,18°C), humedad (42,01% ± 25,56%), visibilidad (13,10 ± 10,91 km; rango: 0,05–29,99 km), concentración de polvo (0,74 ± 1,30 mg/m3; máximo: 4,96 mg/m3), atenuación (4,80 ± 7,20 dB/km; rango: 0,09–50,93 dB/km), rango de operación (5,74 ± 1,97 km) y relación señal-ruido (64,88 ± 15,07 dB). El rango de operación y la relación señal-ruido se calcularon a partir de los valores de atenuación utilizando ecuaciones estándar de presupuesto de enlace FSO.
Cálculo del rango de operación
El Rango de Operación (en km) se calculó utilizando la ecuación del presupuesto de enlace:
Prx=Ptx×Gt×Gr×(λ/(4πR))2×10(−A×R/10) (6)
donde: Prx = potencia recibida (ajustada a la sensibilidad mínima de −30 dBm); Ptx = potencia de transmisión (fija en 20 dBm); Gt = ganancia del transmisor (calculada a partir de los tamaños de apertura); Gr = ganancia del receptor (calculada a partir de los tamaños de apertura); λ = longitud de onda (1550 nm); R = alcance en km; A = atenuación atmosférica en dB/km (calculada a partir de los modelos físicos).
Ganancias del transmisor y del receptor: La ganancia del transmisor (Gt) se calculó como: Gt = 10×log₁₀[0.7×(π×0.025/1.55×10⁻6)2] ≈ 44.2 dBi. La ganancia del receptor (Gr) se calculó como: Gr = 10×log₁₀[0.7×(π×0.20/1.55×10⁻6)2] ≈ 62.3 dBi. La abertura de transmisión tenía un diámetro de 2.5 cm, con una eficiencia de 0.7. La abertura receptora tenía un diámetro de 20 cm, con una eficiencia de 0.7. La ecuación se resolvió iterativamente para R a fin de determinar la distancia máxima de enlace alcanzable para cada valor de atenuación.
Cálculo de la relación señal-ruido
La RSE (relación señal-ruido) en dB se calculó utilizando la ecuación:
SNR=Prx−10×log₁₀(kTB)−NF (7)
donde: Prx = potencia recibida en dBm (calculada a partir del presupuesto de enlace); k = 1.38×10⁻23 J/K (constante de Boltzmann); T = 290 K (temperatura del receptor); B = 109 Hz (ancho de banda del receptor, 1 GHz); NF = 3 dB (figura de ruido del receptor). El nivel de ruido se calculó como:
10 × log10(kTB) ≈ −84 dBm (8)
Para cada muestra, después de calcular la atenuación A utilizando el modelo físico apropiado, se determinó el Rango de Operación resolviendo el presupuesto de enlace para R, y se calculó la relación señal-ruido (SNR) a partir de la potencia recibida resultante Prx a ese rango.
Valores del Rango de Operación según las Condiciones Meteorológicas: El rango de operación varió según las condiciones meteorológicas: cielo despejado (7,12 ± 1,85 km), niebla (5,81 ± 1,92 km), nieve (5,42 ± 1,56 km), lluvia (3,81 ± 0,98 km) y polvo (3,72 ± 1,08 km). No se aplicó un margen de 3 dB en los cálculos actuales; el rango de operación representa el rango máximo teórico sin margen del sistema. El rango de operación informado (5,74 ± 1,97 km) es la media general en todas las condiciones meteorológicas39.
Distancia de transmisión fija: La distancia de transmisión en los modelos de atenuación física se estableció en 3 km. Esta es la distancia del enlace para la cual se realizaron los cálculos de atenuación. El rango de operación informado es la distancia máxima teórica calculada mediante la ecuación del presupuesto de enlace, que puede diferir de la distancia de transmisión fija de 3 km. Los valores de atenuación específicos según el clima se registraron para condiciones despejadas (0,27±0,06 dB/km), niebla (1,88±1,92 dB/km), nieve (6,45±2,54 dB/km), lluvia (13,58±6,32 dB/km) y polvo (13,10±7,32 dB/km). Todos los valores cuantitativos informados en este manuscrito se presentan como media ± desviación estándar (DE), salvo que se indique lo contrario40.
Se informa un R2 de validación cruzada de 0,960±0,007 para el bosque aleatorio. En ciertos casos, como la temperatura (−4,89 a 47,99 °C), la visibilidad (0,05 a 29,99 km), la concentración de polvo (0 a 4,96 mg/m3) y la atenuación (0,09 a 50,93 dB/km), el rango (mínimo a máximo) se indica verbalmente. El conjunto de datos se dividió en subgrupos para pruebas (300 muestras; 20 %) y entrenamiento (1.200 muestras; 80 %). Se utilizó muestreo aleatorio estratificado para realizar la división entre entrenamiento y prueba. Para asegurar que el porcentaje de cada condición meteorológica en el conjunto de entrenamiento (80 %) y el conjunto de prueba (20 %) coincidiera con la distribución del conjunto de datos original, se aplicó estratificación basada en la categoría de condición meteorológica (cielo despejado, niebla, lluvia, polvo y nieve). En particular, 1.200 (80 %) de las 1.500 muestras se asignaron al conjunto de aprendizaje y 300 (20 %) al conjunto de prueba. Las muestras se seleccionaron al azar para cada categoría de condiciones meteorológicas manteniendo las proporciones originales: de las 814 muestras de cielo despejado (54,27 %), 651 se asignaron al entrenamiento y 163 a la prueba; de las 375 muestras de polvo (25,00 %), 300 al entrenamiento y 75 a la prueba; de las 157 muestras de niebla (10,47 %), 126 al entrenamiento y 31 a la prueba; de las 111 muestras de lluvia (7,40 %), 89 al entrenamiento y 22 a la prueba; de las 43 muestras de nieve (2,87 %), 34 al entrenamiento y 9 a la prueba. El muestreo aleatorio dentro de cada estrato se realizó utilizando una semilla aleatoria de 42 para garantizar la reproducibilidad. Este enfoque estratificado se eligió para evitar una representación desequilibrada de las condiciones meteorológicas raras (especialmente la nieve con un 2,87 %) en el conjunto de prueba, lo cual podría llevar de otro modo a una evaluación poco confiable del rendimiento para dichas condiciones.
Evaluación del modelo de aprendizaje automático
Se evaluaron seis métodos de aprendizaje automático, incluyendo Regresión por Vectores de Soporte (SVR) con un kernel de función de base radial (C = 100), K-Vecinos Más Cercanos (KNN; k = 10, con ponderación por distancia), RF (200 árboles, profundidad máxima = 20), Potenciación Extrema del Gradiente (XGBoost; 200 estimadores, profundidad máxima = 10, tasa de aprendizaje = 0.1), Máquina de Potenciación del Gradiente Ligera (LightGBM; 200 estimadores, profundidad máxima = 10, tasa de aprendizaje = 0.1) y regresión lineal básica. Para todos los modelos de aprendizaje automático y aprendizaje profundo, se realizó ajuste de hiperparámetros en los parámetros más críticos, mientras que se mantuvieron los valores predeterminados para los parámetros no especificados. Para los modelos de aprendizaje automático, los siguientes parámetros se ajustaron explícitamente mediante búsqueda en cuadrícula con validación cruzada de 5 pliegues sobre el conjunto de entrenamiento: 1) Bosque Aleatorio: número de árboles (probados: 50, 100, 150, 200, 250) y profundidad máxima (probada: 10, 15, 20, 25, sin límite), seleccionándose los valores óptimos de 200 árboles y profundidad 20. 2) XGBoost: número de estimadores (probados: 100, 150, 200, 250), profundidad máxima (probada: 6, 8, 10, 12) y tasa de aprendizaje (probada: 0.05, 0.1, 0.2), seleccionándose 200 estimadores, profundidad 10 y tasa de aprendizaje 0.1. 3) LightGBM: se utilizaron rangos idénticos de ajuste, resultando en 200 estimadores, profundidad 10 y tasa de aprendizaje 0.1. 4) SVR: se ajustó el parámetro de regularización C (probado: 1, 10, 50, 100) y el coeficiente del kernel gamma (probado: ‘scale’, ‘auto’, 0.1, 0.01), seleccionándose C = 100 y kernel RBF. 5) KNN: se ajustó el número de vecinos k (probado: 3, 5, 7, 10, 15), seleccionándose k = 10 y habilitándose la votación ponderada por distancia.
Todos los demás parámetros para estos modelos se dejaron en sus valores predeterminados según lo definido en scikit-learn (véase la Tabla de materiales para la versión; por ejemplo, Bosque aleatorio: bootstrap=True, min_samples_split=2, min_samples_leaf=1; XGBoost: subsample=1.0, colsample_bytree=1.0, gamma=0). Para los modelos de aprendizaje profundo, la arquitectura (número de capas y unidades por capa) y la tasa de abandono (20 %) se ajustaron manualmente mediante experimentación iterativa sobre el conjunto de validación, mientras que el optimizador (Adam), la tasa de aprendizaje inicial (0,001), la paciencia del detención anticipada (20 épocas) y los parámetros de reducción de la tasa de aprendizaje (factor 0,5, paciencia 10) se establecieron según las prácticas estándar en la literatura y se mantuvieron fijos en todos los experimentos de aprendizaje profundo.
Fuentes de datos climáticos
Se utilizó la información meteorológica histórica recopilada de estaciones meteorológicas iraquíes en varios lugares (Bagdad, Basora, Mosul y Ramadi) entre 2020 y 2024 para calcular las proporciones de los estados climáticos y las distribuciones de las variables. Los datos brutos fueron proporcionados por el Ministerio de Transporte de Irak y por la Organización Meteorológica de Irak y Sismología (IMOS). Los datos incluyeron registros diarios que detallaban el estado atmosférico predominante en cada día. Las variables específicas obtenidas de estos registros incluyeron temperatura (mínima, máxima y media diaria), humedad relativa, visibilidad, cantidad de lluvia y ocurrencias de tormentas de polvo. Los datos de IMOS están parcialmente disponibles a través del portal de datos abiertos del gobierno iraquí (https://www.motrans.gov.iq/), aunque los registros específicos utilizados en este estudio no están archivados públicamente en un repositorio centralizado. Se proporciona un resumen de los datos climáticos empleados para determinar las proporciones de las condiciones meteorológicas y los rangos de los parámetros en Tabla 1.
Se utilizó una validación cruzada de cinco pliegues en el conjunto de entrenamiento (1.200 muestras) para ajustar los hiperparámetros y estimar el rendimiento de todos los modelos de aprendizaje automático. Todas las variables de entrada (temperatura, humedad, visibilidad, concentración de polvo, tasa de lluvia, tasa de nieve, velocidad del viento, presión) se escalaron mediante estandarización (normalización Z-score): x_scaled = (x − μ)/σ, donde μ y σ son la media y la desviación estándar del conjunto de entrenamiento. Se realizó la estandarización dentro de cada pliegue de validación cruzada utilizando únicamente las estadísticas del pliegue de entrenamiento para evitar fugas de datos. Los modelos basados en árboles (Bosque Aleatorio, XGBoost, LightGBM) son invariantes a la escala, pero se aplicó la misma estandarización para mantener la coherencia entre todos los modelos de aprendizaje automático. Para los modelos de aprendizaje profundo se utilizó la normalización min-máx: x_scaled = (x−x_min)/(x_max−x_min), que escala las características al intervalo [0, 1] según los valores mínimos y máximos del conjunto de entrenamiento. Las entradas acotadas permiten una convergencia más rápida de las redes neuronales, razón por la cual se eligieron. El conjunto de prueba se escaló utilizando los parámetros obtenidos del conjunto de entrenamiento, y no se utilizó para selección de modelos ni ajuste de hiperparámetros.
Se registraron métricas completas de rendimiento, incluyendo el coeficiente de determinación de prueba (R2), el error cuadrático medio (RMSE), el error absoluto medio (MAE), el R2 de validación cruzada y el tiempo de entrenamiento. Los tiempos de entrenamiento para todos los modelos de aprendizaje automático y aprendizaje profundo se reportan en segundos (s) para los modelos más rápidos (Regresión Lineal, KNN, SVR, Bosque Aleatorio, XGBoost, LightGBM) y en minutos (min) para los modelos más lentos (arquitecturas de aprendizaje profundo). Todos los modelos se entrenaron en el mismo entorno computacional para garantizar una comparación justa41.
El tiempo de entrenamiento se midió utilizando el módulo de tiempo de Python, es decir, el tiempo real transcurrido desde el inicio hasta el final de la función de ajuste del modelo, excluyendo el tiempo necesario para la carga y el preprocesamiento de los datos. El tiempo de entrenamiento para un modelo de aprendizaje profundo es el tiempo necesario para completar todas las épocas hasta el detención anticipada. Esto incluye la propagación hacia adelante, la propagación hacia atrás y las comprobaciones de validación. Todos los experimentos se realizaron con el sistema ejecutando ningún otro proceso computacionalmente intensivo para obtener mediciones de tiempo consistentes. Los tiempos corresponden al promedio de 5 ejecuciones independientes (desviaciones estándar)42.
Evaluación del modelo de aprendizaje profundo
Se evaluaron seis arquitecturas de aprendizaje profundo utilizando aceleración mediante GPU, incluyendo un perceptrón multicapa (MLP; 64-32-16), una red neuronal profunda (DNN) con normalización por lotes (128-64-32-16), una red neuronal de memoria a corto y largo plazo (LSTM; 64-32 unidades, longitud de secuencia = 10), una red neuronal convolucional unidimensional (1D-CNN), un modelo híbrido CNN-LSTM y una red basada en mecanismos de atención. Todos los modelos de aprendizaje profundo se implementaron utilizando TensorFlow con la API de Keras y se ejecutaron con aceleración mediante GPU (véase la Tabla de Materiales para las versiones de hardware y software). La arquitectura 1D-CNN constó de tres capas convolucionales (64, 128 y 256 filtros, tamaño del núcleo 3, activación ReLU, padding=’same’), dos capas MaxPooling1D (tamaño del grupo 2), una capa GlobalAveragePooling1D, una capa densa con 128 unidades y activación ReLU, una capa Dropout (0,2) y una capa de salida densa (1 unidad, activación lineal), con un total aproximado de 245 000 parámetros entrenables. La arquitectura híbrida CNN-LSTM aceptó secuencias de entrada de 10 pasos temporales con 5 características, utilizando dos capas Conv1D (64 y 128 filtros, tamaño del núcleo 3, ReLU, padding=’same’), una capa MaxPooling1D (tamaño del grupo 2), dos capas LSTM (64 y 32 unidades, return_sequences=False), capas Dropout (0,2), una capa densa (32 unidades, ReLU) y una capa de salida densa (1 unidad, activación lineal), con un total aproximado de 198 000 parámetros entrenables. La red basada en atención utilizó un mecanismo de atención de múltiples cabezas con 4 cabezas (dimensiones de clave y valor de 64), en la que la entrada se proyectó a 64 dimensiones, seguida de atención de producto escalar (fórmula: Attention(Q, K, V) = softmax(QKT/√d_k)V), conexiones residuales, normalización de capa, una red de alimentación directa (128→64 unidades), agrupamiento promedio global, Dropout (0,2), una capa densa (32 unidades, ReLU) y una capa de salida densa (1 unidad, activación lineal), con un total aproximado de 167 000 parámetros entrenables43.
Todos los modelos utilizaron parada temprana (paciente = 20), reducción de la tasa de aprendizaje (factor = 0,5, paciente = 10), dropout (20 %) y el optimizador Adam (tasa de aprendizaje = 0,001). Para todos los modelos de aprendizaje profundo, el tamaño del lote se estableció en 32 muestras, el número máximo de épocas de entrenamiento fue de 200 con parada temprana (paciente = 20, restaurando los mejores pesos), y la función de pérdida fue el error cuadrático medio (MSE). La división entre entrenamiento y validación fue la siguiente: de las 1.200 muestras originales de entrenamiento (tras la división 80/20 entre entrenamiento y prueba), el 80 % (960 muestras) se usaron para entrenamiento y el 20 % (240 muestras) para validación. Se estratificó la división entre entrenamiento y validación según la condición meteorológica para conservar la distribución. El conjunto de validación se utilizó únicamente para la parada temprana, la disminución de la tasa de aprendizaje y la monitorización del sobreajuste; nunca se empleó para la selección del modelo ni para el ajuste de hiperparámetros más allá de estos procedimientos automatizados. No se reservó un conjunto de validación independiente para los modelos de aprendizaje automático; en su lugar, se utilizó una validación cruzada de cinco pliegues sobre las 1.200 muestras de entrenamiento para ajustar los hiperparámetros y estimar el rendimiento44.
Justificación para la evaluación de las arquitecturas LSTM y CNN–LSTM
El conjunto de datos principal consiste en muestras de clima generadas de forma independiente, pero también evaluamos arquitecturas LSTM y CNN–LSTM por las siguientes razones: (1) las condiciones atmosféricas del mundo real están autocorrelacionadas en el tiempo y probar modelos basados en secuencias nos permite determinar si capturar tales dependencias podría mejorar la precisión de las predicciones; (2) investigaciones recientes en predicción atmosférica han demostrado el valor potencial de arquitecturas secuenciales para modelar la evolución temporal de parámetros meteorológicos34; (3) probar una amplia gama de arquitecturas asegura una comparación exhaustiva de enfoques metodológicos, lo cual es una contribución clave de este estudio; y (4) la arquitectura híbrida CNN–LSTM combina la extracción de características espaciales con modelado temporal, lo que podría ser beneficioso para capturar las interacciones complejas entre múltiples variables atmosféricas45.
Formato de datos para la entrada del modelo secuencial
Para las arquitecturas secuenciales (LSTM y CNN-LSTM), los datos de entrada se reorganizaron a partir de muestras independientes en pseudo-secuencias utilizando un enfoque de ventana deslizante. En particular, las 1.200 muestras de entrenamiento se agruparon primero en categorías de condiciones meteorológicas para preservar la coherencia física. Dentro de cada categoría meteorológica, las muestras se ordenaron según sus marcas de tiempo generadas (observaciones simuladas por hora para el año calendario 2024). Luego, se aplicó una ventana deslizante de longitud 10 para producir secuencias de entrada de 10 pasos de tiempo consecutivos (cada uno con 5 características: temperatura, humedad, visibilidad, concentración de polvo y tasa de precipitación) para predecir la atenuación en el 11º paso de tiempo. Este método conserva el orden temporal de las observaciones simuladas, permitiendo al mismo tiempo que los modelos secuenciales aprendan las dependencias temporales. La estructura del conjunto de prueba fue la misma, excepto que se utilizó el mismo tamaño de ventana y conjunto de características. Reconocemos que esta estructuración pseudo-secuencial es una simplificación metodológica y no refleja las dinámicas temporales del mundo real. Hemos reconocido esto como una limitación en la sección de Discusión.
Evaluación de enfoques híbridos
Se examinaron tres enfoques híbridos. El primer enfoque fue un conjunto de votación que promedió las predicciones de los modelos de Bosque Aleatorio, XGBoost y Red Neuronal Profunda utilizando pesos iguales (a cada modelo se le asignó un peso de 1/3), con la predicción final calculada como:
ŷensemble=(1/3)ŷRF+(1/3)ŷXGB+(1/3)ŷDNN (9)
Se eligió un peso igual para evitar la introducción de hiperparámetros adicionales y para evaluar el rendimiento base del conjunto sin sesgo hacia ningún modelo individual. El segundo enfoque empleó un ensamblaje con metaaprendiz Ridge. Los aprendices base fueron Bosque Aleatorio, XGBoost y una Red Neuronal Profunda (basada en Atención). El procedimiento de ensamblaje constó de dos etapas: primero, cada aprendiz base se entrenó con el conjunto completo de entrenamiento de 1.200 muestras utilizando validación cruzada de 5 pliegues para generar predicciones fuera del pliegue, creando así una nueva matriz de metacaracterísticas de tamaño 1.200×3 (una predicción por modelo base por muestra). Segundo, se entrenó un metaaprendiz de regresión Ridge (parámetro de regularización L2 alpha=1,0) con estas metacaracterísticas, utilizando los valores originales de atenuación como objetivo, para aprender los pesos óptimos de combinación de los aprendices base. La predicción final del ensamblaje fue:
ŷstacking=wRF×ŷRF+wXGB×ŷXGB+wDNN×ŷDNN (10)
donde los pesos w fueron aprendidos por el metaaprendiz Ridge. El tercer enfoque fue una red neuronal basada en principios físicos que combinó el 70 % de las predicciones de la red neuronal con el 30 % del modelo de Kim para muestras de condiciones de neblina. La combinación se realizó mediante un promedio ponderado fijo utilizando la siguiente fórmula:
ŷhybrid=0.7×ŷneural+0.3×ŷKim (11)
donde ŷneural es la salida de la red neuronal basada en atención, y ŷKim es la atenuación calculada a partir del modelo de niebla de Kim en función de la visibilidad de entrada. Para muestras sin niebla, la parte física se estableció en 0, y el modelo se ejecutó como una red neuronal pura. Los pesos (70 % neuronal y 30 % física) se fijaron según experimentación preliminar en el conjunto de validación (no en el conjunto de prueba), en la cual probamos combinaciones de pesos de 90:10, 80:20, 70:30, 60:40 y 50:50. Se eligió la división 70:30 porque proporcionó el mejor valor de R2 en validación y aún mantenía una restricción física suficiente del modelo de Kim para regular las predicciones y evitar resultados físicamente inverosímiles, especialmente en condiciones de niebla, donde el modelo de Kim ofrece límites teóricos establecidos de atenuación.
Análisis de importancia y capacidad de interpretación de características
Se utilizó el modelo de bosque aleatorio con importancia de características basada en la impureza (reducción de la varianza) para extraer todos los 10 rangos de importancia de las características de entrada. El análisis mostró que la concentración de polvo (67,3 %) y la visibilidad (21,2 %) fueron los predictores más importantes, explicando conjuntamente el 88,5 % de la importancia predictiva total. La tercera característica más importante fue la tasa de lluvia (6,0 %), seguida de la velocidad del viento (2,1 %), la temperatura (1,5 %), la humedad (0,9 %), el mes (0,5 %), la estación (0,3 %), la tasa de nevada (0,1 %) y la presión atmosférica (0,1 %). Los bajos puntajes de importancia para las características temporales (mes y estación) indican que la variación estacional en la atenuación atmosférica se captura principalmente mediante parámetros ambientales subyacentes, y no únicamente mediante patrones basados en el tiempo.
Se realizó un análisis SHAP (Shapley Additive exPlanations) para evaluar las relaciones entre los factores ambientales y la atenuación. La implementación de SHAP utilizada fue el módulo TreeExplainer de la biblioteca SHAP, que está específicamente optimizado para modelos basados en árboles, incluyendo Random Forest, XGBoost y LightGBM (véase la Tabla de Materiales para la versión). La configuración del análisis SHAP fue la siguiente: se introdujo el modelo Random Forest entrenado en el TreeExplainer, el cual calculó los valores SHAP mediante el enfoque de atribución de características interventiva (marginal), basado en la esperanza condicional de la salida del modelo. Se calcularon valores SHAP para las 300 muestras del conjunto de prueba, generando una matriz de tamaño 300 × 10 (un valor SHAP por característica por muestra). Para cada característica, el valor SHAP representó su contribución a la predicción en relación con la línea base (la predicción promedio del modelo). Los valores SHAP negativos indicaron una reducción; mientras que los valores SHAP positivos indicaron que la característica aumentó la predicción de atenuación. La magnitud del valor SHAP indicó la intensidad de la contribución. La distribución de los valores SHAP para cada característica (mediante gráficos de abeja), la dirección de la influencia (la correlación entre los valores de las características y los valores SHAP) y los rangos de importancia de las características se visualizaron todos mediante gráficos resumen. Se utilizaron las funciones de graficación integradas de la biblioteca SHAP —shap.summary_plot() para el gráfico de abeja y shap.bar_plot() para la importancia global de las características— para crear todas las visualizaciones SHAP.
Manejo de variables codificadas en una sola clase: Primero, se utilizaron cuatro columnas binarias (primavera, verano, otoño e invierno) para codificar la variable estación. Con el fin de crear un único valor de contribución de «estación» por muestra para el análisis SHAP, se combinaron las contribuciones de estas cuatro variables codificadas en una sola clase sumando los valores SHAP para cada categoría estacional. Para lograr esta agrupación, se identificaron todas las columnas que correspondían a los grupos estacionales codificados en una sola clase, se extrajeron sus valores SHAP para cada muestra y luego se sumaron elemento por elemento. Los valores SHAP combinados resultantes representan la contribución general de la estación a la predicción de atenuación. Este método permite una única fila de «estación» en el gráfico resumen SHAP y garantiza coherencia con el uso que hace el modelo de la estación como una variable categórica compuesta. Dado que el valor combinado ofrece una representación más comprensible de la contribución total de la estación, los valores SHAP de la estación no se mostraron por separado para cada categoría estacional.