Данное исследование не предполагало участия людей или позвоночных животных, а также забора тканей. Все данные, использованные в этом исследовании, были синтетически сгенерированы с помощью моделей физического распространения и общедоступных метеорологических параметров. Следовательно, одобрение комитета по этике институционального наблюдательного совета (IRB) или институционального комитета по уходу и использованию животных (IACUC) не потребовалось.
Генерация набора данных на основе теории физического распространения. Набор данных был создан для имитации ежечасных атмосферных условий для системы оптической связи в свободном пространстве в течение всего календарного года (2024) для атмосферных условий Ирака. Мы создали синтетическую базу данных с 1 500 образцами в час.
Во-первых, погодные условия распределялись случайным образом на основе региональных тенденций: ясное небо (54,3%), пыль (24,9%), туман (10,5%), дождь (7,4%) и снег (2,8%). Во-вторых, к каждому образцу в зависимости от погодных условий применялась соответствующая модель физического затухания, а именно: закон Бугера — Ламберта — Бера для ясного неба, модель Кима для тумана, теория Карбонно для дождя и теория рассеяния Ми для пыльных бурь. В-третьих, параметры системы FSO были установлены следующим образом: мощность передачи 20 dBm, длина волны 1550 nm, расстояние передачи 3 km, апертура передатчика 2,5 cm и апертура приемника 20 cm. В-четвертых, для каждого образца рассчитывалось затухание в dB/km. Наконец, полный набор данных был случайным образом разделен на 1200 обучающих образцов (80%) и 300 тестовых образцов (20%). Смоделированные условия включают высокие концентрации пыли, связанные с песчаными бурями, ливнями и изменениями температуры от −4.89°C до 47.99°C. Погодные условия и распределение параметров были выбраны на основе климатических данных Ирака за период 2020–2024 гг. Пять погодных режимов (ясное небо, туман, дождь, пыльные бури и снег) были выбраны потому, что они охватывают весь спектр атмосферных условий, влияющих на затухание FSO в Ираке, при этом пыльные бури особенно распространены на Ближнем Востоке. Исторические метеорологические данные, собранные по всем регионам Ирака, использовались для создания распределения вероятностей для каждого погодного условия. Полученное распределение было следующим: 54,3% — ясное небо (преобладающее состояние), 24,9% — пыль (отражает проблему песчаных бурь в Ираке), 10,5% — туман (часто встречается зимой в северном Ираке), 7,4% — дождь (низкий уровень осадков, типичный для Ирака) и 2,8% — снег (иногда выпадает в северных горных районах). Соответствующие метеорологические параметры моделировались с использованием распределений вероятностей для каждого погодного условия следующим образом: температура моделировалась с помощью нормального распределения (среднее 28.55±11.18°C) в диапазоне от −4.89°C до 47.99°C на основе сезонных экстремумов в Ираке; влажность моделировалась с помощью равномерного распределения (среднее 42.01±25.56%) от 0% до 100%; видимость моделировалась с помощью логнормального распределения в диапазоне от 0.05 km до 29.99 km (среднее 13.10±10.91 km) для учета частых случаев низкой видимости во время пыльных бурь; концентрация пыли моделировалась с помощью экспоненциального распределения в диапазоне от 0 до 4.96 mg/m3 (среднее 0.74±1.30 mg/m3) с более высокой вероятностью низких концентраций и длинными «хвостами» для экстремальных случаев запыленности.
Система связи была спроектирована с мощностью передачи 20 dBm, длиной волны 1550 nm, расстоянием передачи до 3 km, апертурой передатчика 2.5 cm и апертурой приемника 20 cm для компенсации потерь на расходимость. Параметры системы FSO были разделены на две группы: фиксированные параметры, которые оставались неизменными для всех образцов, и переменные параметры, которые изменялись в процессе генерации набора данных. Для всех 1500 образцов были зафиксированы следующие параметры: мощность передачи (20 dBm), рабочая длина волны (1550 nm), апертура передатчика (диаметр 2.5 cm, эффективность 0.7) и апертура приемника (диаметр 20 cm, эффективность 0.7). Эти параметры были зафиксированы, так как они представляют собой физические характеристики оборудования системы FSO и не меняются в зависимости от погодных условий. Набор данных был сформирован из 1500 образцов с варьированием следующих параметров: температура (−4.89°C до 47.99°C), влажность (0% до 100%), видимость (0.05 km до 29.99 km), концентрация пыли (0 до 4.96 mg/m3) и погодные условия (ясное небо, туман, дождь, пыль, снег). Эти параметры изменялись в соответствии с распределениями вероятностей, выведенными из климатических записей Ирака за 2020–2024 годы. Для каждого образца значение затухания (dB/km) рассчитывалось с использованием соответствующей физической модели затухания в зависимости от конкретной комбинации погодных условий и переменных параметров.
Физическое затухание моделировалось с использованием модели Карбонно для дождя, закона Бугера — Ламберта — Бера для ясного неба, теории рассеяния Ми для пыли и модели Кима для тумана24. Закон Бугера — Ламберта — Бера применим для условий ясного неба, когда в затухании преобладают молекулярное рассеяние и поглощение, которые экспоненциально убывают с расстоянием25. Коэффициент экстинкции α при 1550 nm обусловлен рэлеевским рассеянием молекулами воздуха и поглощением атмосферными газами26. Модель Кима представляет собой специализированную модель для тумана, которая связывает затухание с видимостью через эмпирические коэффициенты, полученные из распределений капель тумана по размеру. Зависящий от длины волны показатель степени q учитывает рассеяние Ми27. Основным параметром модели Карбонно является интенсивность дождя R, так как затухание в дожде зависит от размера и плотности дождевых капель, а коэффициенты получены эмпирически при 1550 nm и специально откалиброваны для оптических длин волн28. Теория рассеяния Ми применима к условиям запыленности, поскольку размер частиц пыли (радиус 0.1–100 μm) сопоставим с длиной волны (1550 nm), а комплексный показатель преломления m = 1.55–0.005i для пыли Ближнего Востока учитывает как рассеяние, так и поглощение29. Следующие модели физического затухания были реализованы с соответствующими уравнениями и настройками параметров.
Для условий чистого неба использовался закон Бугера — Ламберта — Бера:
Aclear = 10×log₁₀(e(α×d)) (1)
где α — коэффициент затухания (варьировался с использованием нормального распределения с центром 0.02 dB/km и отклонением ±0.005 dB/km при 1550 nm в условиях ясного неба), а d — расстояние передачи (фиксировано на уровне 3 km). Для условий тумана была реализована модель Кима с использованием следующего уравнения:
Afog = 10×ln(10)/V×(λ/550)−q (2)
где V — видимость в километрах (варьировалась от 0.05km до 10km), λ — длина волны в нанометрах (фиксированная на уровне 1550nm), а q — коэффициент распределения частиц по размерам, рассчитываемый следующим образом: q=1.6 при V>50 km, q=1.3 при 6<V<50 km, q=0.585×V(1/3) при 1 <V<6km, q=0 при 0.5<V<1km и q=0.5 при V<0.5km. Для условий дождя использовалась модель Carbonneau:
Arain=0.023×R0.93 (3)
где R — интенсивность дождя в mm/h (варьировалась от 0.25 до 50mm/h согласно данным осадков в Ираке). Для условий пыльной бури использовалось соотношение эффективности экстинкции на основе рассеяния Ми:
Adust=10×log₁₀(e(τ×L)) (4)
где τ=∫₀^∞ πr2Qext(r,λ,m)N(r)dr, r — радиус частицы (0,1–100 μm согласно составу иракской пыли), Qext — эффективность экстинкции, рассчитанная по теории Ми, λ=1550 nm, m=1,55–0,005i — комплексный показатель преломления для пыли Ближнего Востока, а N(r) — распределение частиц по размерам, смоделированное с использованием логнормального распределения с геометрическим средним радиусом 2,5 μm и стандартным отклонением 2,0. Модель затухания была реализована для снежных условий следующим образом:
Asnow = 0.1×S0.75 (5)
где S — скорость снегопада в mm/h (0,5–15 mm/h). Данное эмпирическое уравнение было выбрано на основе литературных данных30, где модели затухания при оптическом распространении через снег были разработаны с использованием теории рассеяния Ми, примененной к распределению размеров снежинок. Уравнение применимо для скоростей снегопада от 0,5 до 15 mm/h и предполагает условия сухого снега с типичным диаметром снежинок 1–10 mm. Коэффициент 0,1 и показатель степени 0,75 были получены путем аппроксимации кривой расчетов рассеяния Ми30 для снега на длине волны 1550 nm. Оно не учитывает влажный снег или смешанные осадки, которые могут обладать переменными характеристиками затухания, хотя и дает достаточно точную оценку для сухого снега. Поскольку данный подход вычислительно эффективен, часто упоминается в публикациях по FSO и соответствует прогнозируемым снеговым условиям в северном Ираке (регион Курдистан в январе и феврале), он был выбран для данного исследования. Все модели были реализованы на Python 3.9 с использованием Numpy для численных расчетов. Соответствующая модель применялась к случайно выбранным погодным условиям и выборочным данным окружающей среды для расчета значения затухания для каждого образца. Полученное распределение погоды включало 814 условий ясного неба (54,27%), 375 случаев запыления (25,00%), 157 случаев тумана (10,47%), 111 случаев дождя (7,40%) и 43 случая снегопада (2,87%).
Для установления пропорций погодных условий использовался анализ исторических метеорологических данных, собранных с иракских метеостанций в нескольких регионах (Багдад, Басра, Мосул и Рамади) в период с 2020 по 2024 год. Первичные данные были предоставлены Министерством транспорта Ирака и Иракской организацией по метеорологии и сейсмологии (IMOS). Данные включали ежедневные записи погоды, фиксирующие текущие атмосферные условия на каждый день. Среди конкретных характеристик, извлеченных из этих записей, были температура (суточный минимум, максимум и среднее значение), относительная влажность, видимость, количество осадков и случаи возникновения пыльных бурь. Портал открытых данных правительства Ирака (https://www.motrans.gov.iq/) предоставляет доступ к части данных IMOS; однако конкретные записи, использованные в данном исследовании, не хранятся в открытом доступе в центральном репозитории. Климатическая информация, использованная для расчета процентного соотношения погодных условий и значений параметров, обобщена в Таблице 1. Дни с ясным небом определялись как дни без осадков, с видимостью более 10 km и отсутствием запыления, что составило 54,27% от 1825 зарегистрированных дней. Дни с пыльными бурями (включая полноценные пыльные бури (видимость < 1 km) и взвешенную пыль (видимость 1–5 km)) составили 25,00% дней, что указывает на высокую частоту песчаных бурь в засушливом и полузасушливом климате Ирака. Дни с видимостью менее 1 km, вызванной зависанием капель воды (исключая снижение видимости из-за пыли), классифицировались как дни с туманом. Процент дней с туманом составил 10,47%, при этом туманы наблюдались в основном зимой в северных регионах Ирака. Дождливые дни, дни с измеримыми осадками >0,1 mm, составили 7,40%, что соответствует низкому среднему годовому количеству осадков в Ираке, составляющему 150–200 mm в год. Снежные дни (дни с накоплением замерзших осадков) составили 2,87% дней и были ограничены горными северными районами (регион Курдистан) в январе и феврале. Эти пропорции в дальнейшем использовались в качестве весовых коэффициентов вероятности для случайной выборки при генерации набора данных. Таким образом, синтетический набор данных отражает реальную частоту каждого погодного условия в условиях Ирака.
Вопросы предвзятости при генерации синтетических данных
Для минимизации возможной систематической ошибки были предприняты следующие шаги:
(1) Выбор распределения: Для выбора вероятностных распределений использовались статистические свойства исходных климатических данных. Температура имела нормальное распределение со средним значением и стандартным отклонением согласно записям IMOS. Влажность имела равномерное распределение во всем наблюдаемом диапазоне (0-100%). Было принято допущение, что видимость следует логнормальному распределению, чтобы учесть частое возникновение явлений низкой видимости во время пыльных бурь. Концентрация пыли следовала экспоненциальному распределению, характеризующемуся более высокими вероятностями при низких концентрациях и длинными «хвостами» при экстремальных пылевых явлениях31. Это соответствовало наблюдаемой частоте пылевых явлений в Ираке32.
(2) Доли погодных условий: Анализ записей IMOS за 2020–2024 гг., включающий 1 825 ежедневных наблюдений во всех четырех регионах, показал следующие доли: 54,3% — ясное небо, 24,9% — пыль, 10,5% — туман, 7,4% — дождь и 2,8% — снег. Днями с ясным небом определялись дни без осадков, с видимостью >10 km и отсутствием пылевой активности. Дни с пыльными бурями включали как полноценные пыльные бури (видимость <1 km), так и взвесь пыли (видимость 1–5 km). День с туманом определялся как день, когда видимость составляла менее 1 km и причиной была взвесь капель воды (не пыль). Дни с дождем определялись как дни с измеримыми осадками >0,1 mm. Дни со снегом определялись как дни с накопленными замерзшими осадками33.
(3) Диапазоны параметров: Диапазоны параметров были основаны на наблюдаемых экстремумах в записях IMOS: температура варьировалась от −4.89 °C (Мосул, зима) до 47.99 °C (Басра, лето), видимость — от 0.05 km (сильные пыльные бури) до 29.99 km (ясная погода), а концентрация пыли — от 0 до 4.96 mg/m3 (на основе максимальной концентрации пыли, зафиксированной во время сильных хабубов)34.
(4) Предположения о независимости: Мы исходили из того, что параметры окружающей среды отбирались независимо, что является упрощением реальных условий, в которых атмосферные переменные коррелируют между собой (например, высокая концентрация пыли часто коррелирует с низкой видимостью). Для обеспечения контролируемой среды моделирования с целью систематического сравнения моделей было принято данное предположение о независимости 35. Последствия этих предположений рассмотрены в разделе «Обсуждение».
(5) Стратифицированное разделение: разделение на обучающую и тестовую выборки было стратифицировано по категориям погодных условий (ясное небо, туман, дождь, пыль, снег), чтобы обеспечить соответствие пропорции каждого погодного условия в обучающем и тестовом наборах распределению исходного набора данных. Таким образом, тестовый набор не будет несбалансированным в отношении редких погодных условий (особенно снега — 2,87%)36.
Подтверждение детерминированной генерации мишени
Важно отметить, что высокая прогностическая способность, наблюдаемая в данном случае, может быть частично обусловлена тем, что модель изучила или аппроксимировала детерминированные физические уравнения, использованные для генерации синтетических целевых значений37. В отличие от реальных экспериментальных измерений, которые содержат шум измерений, инструментальные погрешности и немоделируемые физические явления, синтетический набор данных обеспечивает чистую, свободную от шума взаимосвязь между входными признаками и целевым показателем затухания. Это объясняется тем, что значения затухания были вычислены непосредственно на основе физических моделей распространения (закон Бугера — Ламберта — Бера, модель Кима, модель Карбонно и теория рассеяния Ми) исходя из входных параметров. Следовательно, количественные показатели эффективности (R2, RMSE, MAE) отражают результаты работы на синтетических данных, полученных с помощью уравнений, и не должны интерпретироваться как ожидаемая эффективность на зашумленных обсервационных или экспериментальных данных. Полученные результаты следует рассматривать прежде всего как сравнительную оценку методологий моделирования в контролируемой среде симуляции38.
Полный набор признаков для обучения модели
Обучающий набор данных содержал 10 входных признаков для обучения модели:
1. Температура (°C)
2. Влажность (%)
3. Видимость (km)
4. Концентрация пыли (mg/m3)
5. Интенсивность осадков (mm/h)
6. Интенсивность снегопада (mm/h)
7. Скорость ветра (m/s)
8. Атмосферное давление (hPa)
9. Месяц (числовое значение, 1–12)
10. Сезон (one-hot кодирование: весна, лето, осень, зима)
Важное уточнение: погодные условия (ясное небо, туман, дождь, пыль, снег) использовались в качестве категориальной переменной для стратификации при разделении набора данных и не включались в число входных признаков для какой-либо модели. Анализ SHAP включает только 10 перечисленных выше признаков. Переменная «сезон» была закодирована методом one-hot encoding (4 категории: весна, лето, осень, зима), и для анализа SHAP вклады переменных сезонов, закодированных методом one-hot, суммировались по всем сезонам для получения единого значения вклада сезона. Это комбинированное значение представляет собой общий вклад всех переменных, связанных с сезоном, в прогнозирование затухания. Перед созданием итогового рисунка были определены четыре столбца сезонов с one-hot кодированием, и их значения SHAP были суммированы для каждого образца. Этот метод гарантирует, что использование моделью сезона в качестве составной категориальной переменной согласуется с анализом SHAP.
Основными экологическими факторами, которые непосредственно влияли на оптическое затухание посредством физических механизмов, были признаки 1–6. Добавление признаков 7 и 8 (скорость ветра и давление) в качестве дополнительных метеорологических факторов может оказывать косвенное влияние на затухание, воздействуя на стабильность воздуха и дисперсию аэрозолей. Для учета сезонных колебаний атмосферных условий в качестве временных дескрипторов были включены признаки 9–10 (месяц и сезон). Значение затухания (dB/km) использовалось в качестве целевой переменной для всех моделей. Ключевые статистические показатели набора данных включали температуру (28.55°C ± 11.18°C), влажность (42.01% ± 25.56%), видимость (13.10 ± 10.91 km; диапазон: 0.05–29.99 km), концентрацию пыли (0.74 ± 1.30 mg/m3; максимум: 4.96 mg/m3), затухание (4.80 ± 7.20 dB/km; диапазон: 0.09–50.93 dB/km), рабочую дальность (5.74 ± 1.97 km) и отношение сигнал/шум (64.88 ± 15.07 dB). Рабочая дальность и SNR были рассчитаны на основе значений затухания с использованием стандартных уравнений энергетического бюджета каналов FSO.
Расчет рабочего диапазона
Рабочий диапазон (в км) был рассчитан с использованием уравнения энергетического бюджета радиолинии:
Prx=Ptx×Gt×Gr×(λ/(4πR))2×10(−A×R/10) (6)
где: Prx = принятая мощность (установлена на минимальном уровне чувствительности −30 dBm); Ptx = мощность передачи (фиксированная, 20 dBm); Gt = коэффициент усиления передатчика (рассчитан на основе размеров апертуры); Gr = коэффициент усиления приемника (рассчитан на основе размеров апертуры); λ = длина волны (1550 nm); R = дальность в km; A = атмосферное затухание в dB/km (рассчитано на основе физических моделей).
Коэффициенты усиления передатчика и приемника: Коэффициент усиления передатчика (Gt) рассчитывался следующим образом: Gt = 10×log₁₀[0.7×(π×0.025/1.55×10⁻6)2] ≈ 44.2 dBi. Коэффициент усиления приемника (Gr) рассчитывался следующим образом: Gr = 10×log₁₀[0.7×(π×0.20/1.55×10⁻6)2] ≈ 62.3 dBi. Диаметр передающей апертуры составлял 2.5 cm при эффективности 0.7. Диаметр приемной апертуры составлял 20 cm при эффективности 0.7. Уравнение решалось итерационным методом относительно R для определения максимально возможной дистанции связи при каждом значении затухания.
Расчет отношения сигнал/шум
Отношение сигнал/шум (SNR) в дБ рассчитывали по следующей формуле:
SNR=Prx−10×log₁₀(kTB)−NF (7)
где: Prx = получаемая мощность в dBm (рассчитанная на основе энергетического бюджета линии связи); k = 1.38×10⁻23 J/K (постоянная Больцмана); T = 290 K (температура приемника); B = 109 Hz (полоса пропускания приемника, 1 GHz); NF = 3 dB (коэффициент шума приемника). Порог шума был рассчитан следующим образом:
10 × log10(kTB) ≈ −84 dBm (8)
Для каждого образца после расчета затухания A с использованием соответствующей физической модели был определен рабочий диапазон путем решения уравнения энергетического бюджета связи для R, а отношение сигнал/шум (SNR) было рассчитано на основе результирующей принимаемой мощности Prx на данном расстоянии.
Значения рабочего диапазона при различных погодных условиях: рабочий диапазон варьировался в зависимости от погодных условий: чистое небо (7.12 ± 1.85 km), туман (5.81 ± 1.92 km), снег (5.42 ± 1.56 km), дождь (3.81 ± 0.98 km) и пыль (3.72 ± 1.08 km). В данных расчетах запас в 3 dB не применялся; рабочий диапазон представляет собой теоретический максимум без учета системного запаса. Указанный рабочий диапазон (5.74 ± 1.97 km) является общим средним значением для всех погодных условий39.
Фиксированная дистанция передачи: в моделях физического затухания дистанция передачи была установлена на уровне 3 km. Это расстояние линии связи, для которого выполнялись расчеты затухания. Указанный рабочий диапазон представляет собой теоретическое максимальное расстояние, вычисленное с помощью уравнения энергетического бюджета линии связи, которое может отличаться от фиксированной дистанции передачи 3 km. Значения затухания для конкретных погодных условий были зафиксированы для ясной погоды (0.27±0.06 dB/km), тумана (1.88±1.92 dB/km), снега (6.45±2.54 dB/km), дождя (13.58±6.32 dB/km) и пыли (13.10±7.32 dB/km). Все количественные значения, приведенные в данной работе, представлены как среднее значение ± стандартное отклонение (SD), если не указано иное40.
Значение перекрестной проверки R2 для Random Forest составило 0.960±0.007. В некоторых случаях, таких как температура (−4.89 to 47.99°C), видимость (0.05 to 29.99km), концентрация пыли (0 to 4.96 mg/m3) и затухание (0.09 to 50.93dB/km), диапазон (от минимального до максимального значения) указан словами. Набор данных был разделен на подгруппы для тестирования (300 образцов; 20%) и обучения (1200 образцов; 80%). Для разделения выборки на обучающую и тестовую использовалась стратифицированная случайная выборка. Чтобы процент каждого погодного условия в обучающем наборе (80%) и тестовом наборе (20%) соответствовал распределению в исходном наборе данных, применялась стратификация по категориям погодных условий (ясное небо, туман, дождь, пыль и снег). В частности, 1200 (80%) из 1500 образцов были распределены в обучающий набор и 300 (20%) — в тестовый набор. Образцы для каждой категории метеорологических условий выбирались случайным образом с сохранением исходных пропорций: из 814 образцов с ясным небом (54.27%) 651 был назначен для обучения и 163 — для тестирования; из 375 образцов с пылью (25.00%) 300 — для обучения и 75 — для тестирования; из 157 образцов с туманом (10.47%) 126 — для обучения и 31 — для тестирования; из 111 образцов с дождем (7.40%) 89 — для обучения и 22 — для тестирования; из 43 образцов со снегом (2.87%) 34 — для обучения и 9 — для тестирования. Случайный отбор внутри каждой страты выполнялся с использованием случайного значения seed 42 для обеспечения воспроизводимости. Данный стратифицированный подход был выбран во избежание несбалансированного представления редких погодных условий (в частности, снега — 2.87%) в тестовом наборе, что в противном случае могло привести к недостоверной оценке эффективности модели для этих условий.
Оценка модели машинного обучения
Было оценено шесть методов машинного обучения, включая метод опорных векторов (SVR) с радиально-базисным ядром (C = 100), метод k-ближайших соседей (KNN; k = 10, с учетом веса расстояния), случайный лес (RF; 200 деревьев, максимальная глубина = 20), экстремальный градиентный бустинг (XGBoost; 200 оценщиков, максимальная глубина = 10, скорость обучения = 0.1), легковесную машину градиентного бустинга (LightGBM; 200 оценщиков, максимальная глубина = 10, скорость обучения = 0.1) и базовую линейную регрессию. Для всех моделей машинного и глубокого обучения была проведена настройка наиболее критических гиперпараметров, в то время как для неопределенных параметров были оставлены значения по умолчанию. Для моделей машинного обучения следующие параметры были явно настроены с использованием сеточного поиска с 5-кратной перекрестной проверкой на обучающей выборке: 1) Случайный лес: количество деревьев (тестировались значения: 50, 100, 150, 200, 250) и максимальная глубина (тестировались значения: 10, 15, 20, 25, без ограничений), при этом были выбраны оптимальные значения 200 деревьев и глубина 20. 2) XGBoost: количество оценщиков (тестировались значения: 100, 150, 200, 250), максимальная глубина (тестировались значения: 6, 8, 10, 12) и скорость обучения (тестировались значения: 0.05, 0.1, 0.2), при этом оптимальными оказались 200 оценщиков, глубина 10 и скорость обучения 0.1. 3) LightGBM: использовались идентичные диапазоны настройки, что привело к выбору 200 оценщиков, глубины 10 и скорости обучения 0.1. 4) SVR: настраивались параметр регуляризации C (тестировались значения: 1, 10, 50, 100) и коэффициент ядра gamma (тестировались значения: «scale», «auto», 0.1, 0.01), при этом оптимальными были C = 100 и RBF-ядро. 5) KNN: настраивалось количество соседей k (тестировались значения: 3, 5, 7, 10, 15), при этом оптимальным было k = 10 с включенным голосованием с учетом веса расстояния.
Все остальные параметры для этих моделей были оставлены по умолчанию, как определено в scikit-learn (см. Таблица материалов для каждой версии; например, Random Forest: bootstrap=True, min_samples_split=2, min_samples_leaf=1; XGBoost: subsample=1.0, colsample_bytree=1.0, gamma=0). Для моделей глубокого обучения архитектура (количество слоев и количество нейронов в слое) и коэффициент дропаута (20%) подбирались вручную путем итеративного экспериментирования на валидационной выборке, в то время как оптимизатор (Adam), начальная скорость обучения (0,001), параметр терпения для ранней остановки (20 эпох) и параметры снижения скорости обучения (фактор 0,5, терпение 10) были установлены в соответствии со стандартной практикой, описанной в литературе, и оставались неизменными во всех экспериментах с моделями глубокого обучения.
Источники климатических данных
Исторические метеорологические данные, собранные с иракских метеостанций в нескольких городах (Багдад, Басра, Мосул и Рамади) в период с 2020 по 2024 год, были использованы для расчета долей погодных состояний и распределения переменных. Исходные данные были предоставлены Министерством транспорта Ирака и Иракской организацией по метеорологии и сейсмологии (IMOS). В данные были включены ежедневные записи погоды с подробным описанием преобладающего атмосферного состояния для каждого дня. Конкретные переменные, полученные из этих записей, включали температуру (ежедневный минимум, максимум и среднее значение), относительную влажность, видимость, количество осадков и случаи пыльных бурь. Данные IMOS частично доступны через портал открытых данных правительства Ирака (https://www.motrans.gov.iq/), хотя конкретные записи, использованные в данном исследовании, не архивированы публично в централизованном репозитории. Сводка климатических данных, использованных для определения долей погодных условий и диапазонов параметров, представлена в Таблице 1.
Для настройки гиперпараметров и оценки эффективности всех моделей машинного обучения на обучающем наборе (1 200 образцов) использовалась пятикратная перекрестная проверка. Все входные переменные (температура, влажность, видимость, концентрация пыли, интенсивность осадков в виде дождя, интенсивность осадков в виде снега, скорость ветра, давление) прошли масштабирование признаков путем стандартизации (Z-масштабирование): x_scaled = (x − μ)/σ, где μ и σ — среднее значение и стандартное отклонение обучающего набора. Стандартизация проводилась внутри каждого фолда перекрестной проверки с использованием только статистических данных обучающего фолда во избежание утечки данных. Модели на основе деревьев решений (Random Forest, XGBoost, LightGBM) инвариантны к масштабу, однако для единообразия всех моделей машинного обучения применялась одна и та же стандартизация. Для моделей глубокого обучения использовалась min-max нормализация: x_scaled = (x−x_min)/(x_max−x_min), которая масштабирует признаки до диапазона [0, 1] на основе минимальных и максимальных значений обучающего набора. Ограниченные входные данные обеспечивают более быструю сходимость нейронных сетей, поэтому был выбран именно этот метод. Тестовый набор масштабировался с использованием параметров, полученных из обучающего набора, и не использовался для выбора модели или настройки гиперпараметров.
Были зафиксированы полные показатели эффективности, включая тестовый коэффициент детерминации (R2), среднеквадратичную ошибку (RMSE), среднюю абсолютную ошибку (MAE), R2 при кросс-валидации и время обучения. Время обучения для всех моделей машинного и глубокого обучения указано в секундах (s) для более быстрых моделей (Linear Regression, KNN, SVR, Random Forest, XGBoost, LightGBM) и в минутах (min) для более медленных моделей (архитектур глубокого обучения). Все модели обучались в одной вычислительной среде для обеспечения объективности сравнения41.
Время обучения измеряли с помощью модуля time в Python, т. е. общее время (стенные часы), прошедшее от начала до завершения функции подбора параметров модели, за исключением времени, затраченного на загрузку и предобработку данных. Под временем обучения модели глубокого обучения понимается время, необходимое для завершения всех эпох до срабатывания условия ранней остановки. Сюда входят прямое распространение, обратное распространение и проверки на валидации. Все эксперименты проводились при отсутствии в системе других ресурсоемких вычислительных процессов для получения согласованных показателей времени. Указанное время представляет собой среднее значение по 5 независимым запускам (стандартные отклонения)42.
Оценка модели глубокого обучения
С использованием GPU-ускорения были оценены шесть архитектур глубокого обучения, включая многослойный перцептрон (MLP; 64-32-16), глубокую нейронную сеть (DNN) с пакетной нормализацией (128-64-32-16), сеть долгой краткосрочной памяти (LSTM; 64-32 единицы, длина последовательности = 10), одномерную сверточную нейронную сеть (1D-CNN), гибридную модель CNN–LSTM и сеть на основе механизма внимания. Все модели глубокого обучения были реализованы с помощью TensorFlow с использованием API Keras и запущены с GPU-ускорением (версии аппаратного и программного обеспечения указаны в Таблице материалов). Архитектура 1D-CNN состояла из трех сверточных слоев (64, 128 и 256 фильтров, размер ядра 3, активация ReLU, padding=’same’), двух слоев MaxPooling1D (размер пула 2), слоя GlobalAveragePooling1D, полносвязного слоя (Dense) со 128 единицами и активацией ReLU, слоя Dropout (0,2) и выходного полносвязного слоя (1 единица, линейная активация), что в сумме составляет примерно 245 000 обучаемых параметров. Гибридная архитектура CNN-LSTM принимала входные последовательности из 10 временных шагов с 5 признаками, используя два слоя Conv1D (64 и 128 фильтров, размер ядра 3, ReLU, padding=’same’), слой MaxPooling1D (размер пула 2), два слоя LSTM (64 и 32 единицы, return_sequences=False), слои Dropout (0,2), полносвязный слой (32 единицы, ReLU) и выходной полносвязный слой (1 единица, линейная активация), что в сумме составляет примерно 198 000 обучаемых параметров. В сети на основе механизма внимания использовался многоголовый механизм внимания (multi-head attention) с 4 головами (размерность ключа и значения 64), где входные данные проецировались в 64 измерения с последующим применением масштабированного скалярного произведения внимания (формула: Attention(Q, K, V) = softmax(QKT/√d_k), остаточных связей, нормализации слоя, сети прямого распространения (128→64 единицы), глобального усредняющего пулинга, Dropout (0,2), полносвязного слоя (32 единицы, ReLU) и выходного полносвязного слоя (1 единица, линейная активация), что в сумме составляет примерно 167 000 обучаемых параметров43.
Во всех моделях использовались ранняя остановка (patience = 20), снижение скорости обучения (factor = 0.5, patience = 10), дропаут (20%) и оптимизатор Adam (learning rate = 0.001). Для всех моделей глубокого обучения размер пакета (batch size) был установлен на уровне 32 образцов, максимальное количество эпох обучения составляло 200 с применением ранней остановки (patience = 20, с восстановлением наилучших весов), а в качестве функции потерь использовалась среднеквадратическая ошибка (MSE). Разделение на обучающую и валидационную выборки было следующим: из исходных 1,200 обучающих образцов (после разделения на обучающую и тестовую выборки в соотношении 80/20) 80% (960 образцов) использовались для обучения и 20% (240 образцов) — для валидации. Мы провели стратификацию при разделении на обучающую и валидационную выборки по погодным условиям для сохранения распределения. Валидационный набор использовался только для ранней остановки, снижения скорости обучения и мониторинга переобучения; он никогда не использовался для выбора модели или настройки гиперпараметров за пределами этих автоматизированных процедур. Мы не выделяли отдельный валидационный набор для моделей машинного обучения; вместо этого мы использовали пятикратную перекрестную проверку на 1,200 обучающих образцах для настройки гиперпараметров и оценки производительности44.
Обоснование оценки архитектур LSTM и CNN–LSTM
Основной набор данных состоит из независимо сгенерированных образцов погоды, однако мы также протестировали архитектуры LSTM и CNN–LSTM по следующим причинам: (1) реальные атмосферные условия обладают временной автокорреляцией, и тестирование моделей, основанных на последовательностях, позволяет нам определить, может ли учет таких зависимостей повысить точность прогнозирования; (2) недавние исследования в области атмосферного прогнозирования продемонстрировали потенциальную ценность последовательных архитектур для моделирования временной эволюции метеорологических параметров34; (3) тестирование разнообразного ряда архитектур обеспечивает всестороннее сравнение методологических подходов, что является ключевым вкладом данной работы; и (4) гибридная архитектура CNN–LSTM сочетает в себе извлечение пространственных признаков с временным моделированием, что может быть полезно для фиксации сложных взаимодействий между несколькими атмосферными переменными45.
Форматирование данных для ввода в последовательную модель
Для последовательных архитектур (LSTM и CNN–LSTM) входные данные были реструктурированы из независимых образцов в псевдопоследовательности с использованием метода скользящего окна. В частности, 1200 обучающих образцов сначала были сгруппированы по категориям погодных условий для сохранения физической согласованности. Внутри каждой погодной категории образцы были упорядочены по их временным меткам (смоделированные ежечасные наблюдения за 2024 календарный год). Затем было применено скользящее окно длиной 10 для создания входных последовательностей из 10 последовательных временных шагов (каждый с 5 признаками: температура, влажность, видимость, концентрация пыли и интенсивность осадков) для прогнозирования затухания на 11ым временном шаге. Этот метод сохраняет временную последовательность смоделированных наблюдений, позволяя последовательным моделям изучать временные зависимости. Структура тестового набора была аналогичной с тем же размером окна и набором признаков. Мы признаем, что такая псевдопоследовательная структуризация является методологическим упрощением и не отражает реальную временную динамику. Это было отмечено в качестве ограничения в разделе «Обсуждение».
Оценка гибридных подходов
Были изучены три гибридных подхода. Первый подход представлял собой голосовой ансамбль (Voting Ensemble), который усреднял прогнозы моделей Random Forest, XGBoost и глубокой нейронной сети с использованием равных весов (каждой модели присваивался вес 1/3), при этом окончательный прогноз рассчитывался следующим образом:
ŷensemble=(1/3)ŷRF+(1/3)ŷXGB+(1/3)ŷDNN (9)
Равное взвешивание было выбрано, чтобы избежать введения дополнительных гиперпараметров и оценить базовую эффективность ансамбля без смещения в сторону какой-либо отдельной модели. Второй подход основывался на стекинге с использованием мета-обучаемого Ridge-регрессора. Базовыми моделями обучения были Random Forest, XGBoost и глубокая нейронная сеть (на основе механизма внимания). Процедура стекинга включала два этапа: сначала каждая базовая модель была обучена на полном обучающем наборе из 1 200 образцов с использованием 5-кратной перекрестной проверки для генерации предсказаний вне выборки (out-of-fold predictions), что позволило создать новую матрицу мета-признаков размером 1 200×3 (по одному предсказанию от каждой базовой модели для каждого образца). Затем мета-обучаемая Ridge-регрессия (параметр L2-регуляризации alpha=1.0) была обучена на этих мета-признаках, используя исходные значения затухания в качестве целевой переменной, чтобы определить оптимальные веса комбинации базовых моделей. Итоговое предсказание стекинга было следующим:
ŷstacking=wRF×ŷRF+wXGB×ŷXGB+wDNN×ŷDNN (10)
где веса w были определены с помощью мета-обучателя Ridge. Третий подход представлял собой физически-информированную нейронную сеть, в которой для образцов в условиях тумана сочетались 70% прогнозов нейронной сети и 30% прогнозов модели Кима. Объединение выполнялось путем фиксированного средневзвешенного вычисления по следующей формуле:
ŷhybrid=0.7×ŷneural+0.3×ŷKim (11)
где ŷneural — это выход нейронной сети на основе механизма внимания (Attention), а ŷKim — затухание, рассчитанное по модели тумана Кима на основе входных данных о видимости. Для образцов без тумана физическая часть была установлена на 0, и модель работала как чистая нейронная сеть. Веса (70% нейронной сети и 30% физической модели) были зафиксированы на основе предварительных экспериментов на валидационном наборе (не на тестовом), в ходе которых мы протестировали комбинации весов 90:10, 80:20, 70:30, 60:40 и 50:50. Разделение 70/30 было выбрано, так как оно обеспечило наилучший коэффициент R2 при валидации и при этом сохранило достаточное физическое ограничение модели Кима для регуляризации прогнозов и предотвращения физически недопустимых результатов, особенно в условиях тумана, где модель Кима задает установленные теоретические пределы затухания.
Анализ важности признаков и интерпретируемости
Для определения рангов значимости всех 10 входных признаков использовалась модель Random Forest с расчетом значимости признаков на основе примеси (снижения дисперсии). Анализ показал, что наиболее важными предикторами были концентрация пыли (67,3%) и видимость (21,2%), которые в совокупности обеспечили 88,5% общей прогностической значимости. Третьим по важности признаком была интенсивность дождя (6,0%), за которой следовали скорость ветра (2,1%), температура (1,5%), влажность (0,9%), месяц (0,5%), сезон (0,3%), интенсивность снегопада (0,1%) и атмосферное давление (0,1%). Низкие показатели значимости временных признаков (месяц и сезон) указывают на то, что сезонные колебания атмосферного затухания определяются преимущественно базовыми параметрами окружающей среды, а не только временными закономерностями.
Для оценки взаимосвязей между факторами окружающей среды и затуханием был проведен анализ SHAP (Shapley Additive exPlanations). Для реализации SHAP использовался модуль TreeExplainer из библиотеки SHAP, который специально оптимизирован для моделей на основе деревьев, включая Random Forest, XGBoost и LightGBM (версию см. в Таблице материалов). Конфигурация анализа SHAP была следующей: обученная модель Random Forest была передана в TreeExplainer, который вычислял значения SHAP с использованием интервенционного (маргинального) подхода к атрибуции признаков на основе условного ожидания выходных данных модели. Значения SHAP были рассчитаны для всех 300 образцов тестового набора, что позволило создать матрицу размером 300 × 10 (одно значение SHAP на один признак для каждого образца). Для каждого признака значение SHAP представляло собой его вклад в прогноз относительно базового уровня (среднего прогноза модели). Отрицательные значения SHAP указывали на смещение вниз, в то время как положительные значения SHAP показывали, что данный признак увеличивал прогноз затухания. Сила вклада определялась величиной значения SHAP. Распределение значений SHAP для каждого признака (с помощью графиков beeswarm), направление влияния (корреляция между значениями признаков и значениями SHAP) и ранги важности признаков были визуализированы с помощью сводных графиков. Для создания всех визуализаций SHAP использовались встроенные функции построения графиков библиотеки SHAP: shap.summary_plot() для графика beeswarm и shap.bar_plot() для глобальной важности признаков.
Обработка переменных с одногорячим кодированием (one-hot encoding): для кодирования переменной «сезон» изначально использовались четыре бинарных столбца (весна, лето, осень и зима). Чтобы для анализа SHAP создать единое значение вклада «сезона» для каждого образца, вклады этих четырех переменных с одногорячим кодированием были объединены путем суммирования значений SHAP для каждой категории сезона. Для выполнения этой группировки были найдены все столбцы, соответствующие группам сезонов с одногорячим кодированием, извлечены их значения SHAP для каждого образца, после чего они были суммированы поэлементно. Полученные комбинированные значения SHAP представляют собой общий вклад сезона в прогноз затухания. Такой метод позволяет отобразить в сводном графике SHAP одну строку «сезон» и обеспечивает соответствие использованию сезона в модели в качестве составной категориальной переменной. Поскольку комбинированный показатель дает более понясное представление об общем вкладе сезона, значения SHAP для сезона не приводились отдельно для каждой категории.