Методология
Была построена модель с контролируемым скользящим окном для прогнозирования будущего значения PM2.5 на момент времени t + 1 на основе предыдущих почасовых наблюдений. Длины окна ввода кандидатов — 12, 24 и 48 часовых шагов — оценивались с помощью производительности валидации, а окончательная конфигурация CORTA-Net использовала 24-часовую последовательность ввода. Для заполнения недостающих значений использовалась линейная интерполяция; выбросы удалялись с помощью метода IQR; и все переменные масштабировались с помощью нормализации min-max перед генерацией задерживающихся функций PM2.5 . Затем для выбора признаков применялась процедура CorrXGBoost-Rank. Во-первых, корреляционная фильтрация Пирсона сохраняла переменные с |r| ≥ 0.30. Во-вторых, крайне избыточные пары признаков с парной корреляцией |corr(x i, xj)| ≥ 0,85 были отфильтрованы для снижения мультиколлинеарности. В-третьих, регрессор XGBoost был обучен на оставшихся переменных, а предикторы с оценками важности на основе усиления XGBoost ≥ 0,015 были сохранены для итогового входа модели. Окончательная архитектура CORTA-Net состояла из слоёв LSTM для временного кодирования, многоголового слоя внимания для взвешивания на уровне признаков и временных шагов, а также плотных регрессионных слоёв для оценки PM2.5 . Модель была обучена с использованием оптимизатора Адама с потерями ошибки в среднем квадрате и ранней остановкой. Оценка модели проводилась с использованием RMSE иR 2 в рамках обучения, валидации, тестирования и 10-кратных перекрестных валидационных разделов. Таблица 2 представляет сводку предварительной обработки данных и инженерии характеристик.
| Шаг | Используемый метод | Параметр / порог | Назначение |
| Расчёт отсутствующего значения | Процент пропущенных наблюдений | Отчёт по переменным процентам | Количественно определяет полноту данных |
| Импутация короткого разрыва | Линейная интерполяция | Длина зазора ≤ 6 ч | Заполняет короткие пропущенные интервалы |
| Обнаружение выбросов | Метод IQR | Q1 − 1,5 × IQR, Q3 + 1,5 × IQR | Удаляет недопустимые экстремальные значения |
| Нормализация | Минимальное масштабирование | Тренировочные наборы минимум и максимум | Стандартизация диапазона функций |
| PM₂.₅ лаги | Задержки переменных | лаг₁, лаг₂, лаг₃ | Фиксирует временную устойчивость |
| Статистика перекатывания | Скользящие средние | 3 часа, 6 часов, 12 часов, 24 часа | Фиксирует краткосрочное накопление |
| Функция подсчёта пожаров | ПОДСЧЁТ МОДИ | Счёт в тот же день / предыдущий день | Отражает влияние региональных пожаров |
Таблица 2: Предварительная обработка данных и сводка по инженерии признаков. В Таблице 2 обработка данных осуществляется двумя способами: во-первых, через очистку и преобразование исходных данных (предварительную обработку), а во-вторых, через инженерию признаков для создания/выбора/изменения характеристик (особенностей). В совокупности эти два процесса помогают устранить или уменьшить шум; обрабатывать отсутствующие значения; повысить согласованность данных; и создавать более предсказательные модели.
Параметры нормализации оценивались только из обучающего набора и затем применялись без изменений к наборам тестирования и валидации, чтобы избежать утечек информации.
Математическая формулировка CorrXGBoost-rank
Пусть X = {x1,x 2, ...,x n} обозначает множество кандидатов входных переменных, а y — целевую концентрацию PM₂.₅. Для каждого признака xi коэффициент корреляции Пирсона с целевой переменной рассчитывался следующим образом:
(1)
где CoV(xi, y) — ковариация между признакомx i и целевой единицей y, а σxi и σy — их стандартные отклонения. Сохранившиеся функции, удовлетворяющие ими: |ri| ≥ τr , где τr = 0,30 в этом исследовании.
Парные корреляции рассчитывались среди всех сохранившихся features_xi, xj, и если |corr(xi, xj)| >= τкрасный, где τкрасный = 0,85, признак с меньшей абсолютной корреляцией к цели PM2,5 исключается из набора признаков. Этот процесс уменьшает переменные из набора признаков, обладающие мультиколлинеарностью. Затем к оставшимся признакам была подгонена регрессорная модель XGBoost, и оценки важности признаков рассчитывались для каждой с использованием важности XGBoost, а также признаков, удовлетворяющих i_i ≥ τxgb, где τxgb = 0,015, сохранялись в итоговом наборе признаков (S), определяемом какS final=S corr ∪ Sxgb, то есть набор признаков, определяемый фильтрацией по избыточности по корреляции и удалением любых признаков на основе важности переменной XGBoost. Общий подход, используемый при выборе признаков, таков: вычислить целевые признаки попарно корреляцию Пирсона, отбрасывать признаки с |r_i|< 0,30, отбрасывать признаки с парами с парными корреляциями ≥ 0,85, подгонять XGBoost к оставшимся признакам, сохранять признаки с показателем важности XGBoost ≥ 0,015, определить окончательные желаемые признаки Sfinal=Scorr ∪ Sxgb, где Scorr — это признаки, сохраняющиеся после избыточной корреляционной фильтрации, а Sxgb — признаки, выбранные с помощью оценки важности функций XGBoost. Таким образом, рабочий процесс CorrXGBoost-Rank таков: вычислить корреляцию Пирсона с целевой характеристикой, удалить признаки с |ri| < 0.30 убрать высоко избыточные признаки с парной корреляцией ≥ 0.85, обучить XGBoost на оставшихся переменных, сохранить переменные с показателем важности XGBoost ≥ 0.015 и использовать объединение выбранных переменных по корреляции и выбранных XGBoost переменных в качестве окончательного набора признаков. Параметры, используемые в этом исследовании: τr = 0,30, τкрасный = 0,85 и τxgb = 0,015.
Источники данных
Авторы интегрировали три больших набора данных для исследования; это данные о загрязнителях воздуха (PM2.5, PM10,NO 2, CO и SO₂), которые авторы получили через мониторинг качества воздуха CPCB (Центральный совет по контролю загрязнения) / DPCC (Комитет по контролю загрязнения Дели), метеорологические данные (температура, влажность, скорость/направление и давление ветра) от индийского метеорологического департамента (IMD) и спутниковая информация об активных пожарах из MODIS Active Fire Products от NASA. Эти три набора данных охватывают 12-летний период с января 2012 по декабрь 2023 года и, таким образом, представляют разные типы выбросов. Пожарные инциденты способствуют загрязнению воздуха, как показано на дополнительном рисунке 2, где показаны тенденции FIRECOUNT с 2012 по 2024 год.
Долгосрочные тенденции загрязнителей за период исследования
Рисунок 1 показывает долгосрочные тенденции загрязнителей за годы исследования (2012–2024). Годовые подсчета пожаров и средние концентрации PM₂.₅ в период с 2012 по 2024 годы имеют умеренно сильную положительную связь (r = 0,688), что указывает на то, что более высокая активность пожаров обычно связана с более высокой концентрацией PM₂.₅. Как измеряемые, так и прогнозируемые данные PM₂.₅ следуют схожей тенденции, что подтверждает идею о сжигании биомассы способствующего загрязнению частицами. Хотя существует значительная межгодовая вариабельность, выбросы, связанные с пожаром, являются важным фактором в определении вариабельности PM₂.₅, что подчёркивает необходимость регионального управления пожарами для улучшения качества воздуха. Автокорреляция прогнозируемого PM2.5 на тридцати задержках, показанная на дополнительном рисунке 3, имеет значительную положительную автокорреляцию почти на всех тридцати задержках, что подтверждает, что PM2.5 в Дели обладает сильной временной зависимостью и многодневной персистентностью.

Рисунок 1: Долгосрочные тенденции PM₂.₅ и подсчёт пожаров с 2012 по 2024 год. Рисунок 1 сравнивает годовое изменение количества пожаров с наблюдаемыми и прогнозируемыми концентрациями PM₂.₅. PM₂.₅ сообщается в мкг/м 3. FIRECOUNT отражает огневую активность, полученную от спутников, из продуктов MODIS. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Декомпозиция STL (сезонная и трендовая декомпозиция с использованием лёсса)
STL, или сезонная и трендовая декомпозиция с использованием Лёсса, — это итеративный алгоритм, позволяющий разбить данные временных рядов на три аддитивных компонента, как показано на рисунке 2: тренд (долгосрочный тренд) (рисунок 2A), (рисунок 2D), (рисунок 2G), (рисунок 2J), сезонный (циклический период) (рисунок 2B), (рисунок 2E), (рисунок 2H), (рисунок 2K) и остаток (шум/остаточный) (рисунок 2C), (Рисунок 2F), (Рисунок 2I), (Рисунок 2L). STL доказала свою эффективность в работе со сложными нелинейными характеристиками экологических данных (например, PM2.5), для которых многие другие аналитические методы не справились из-за переменных амплитуд сезонного сигнала и наличия выбросов. Сглаживание LOESS позволяет точно разделять эти компоненты, обеспечивая более чёткую интерпретацию тенденций или закономерностей. С помощью обработки STL можно отделить более широкие восходящие тенденции PM2.5 от более коротких дневных/сезонных циклов и от нестабильных остаточных в этих циклах. Такое разделение позволяет определить, какие выбросы повлияли на PM2.5, а какие метеорологические факторы повлияли на PM2.5. Результаты этого разделения помогают точно прогнозировать будущие выбросы PM2.5 ; предоставлять данные для регуляторных решений; и соответствовать стандартам, установленным для строгой деагрегации данных временных рядов для исследований качествавоздуха 34. Средние суточные измерения концентрации PM2.5 , проведённые на станциях мониторинга в Дели с 2012 по 2024 год, показывают минимальные изменения уровня PM2.5 (то есть отсутствие значимых изменений с 2022–24 годов) и крайне ограниченное стабильное поведение (или согласованность уровней PM2.5 в четырёх точках мониторинга). Уровни PM2.5 в секторе Дварка 8 и Мундка-DPCC демонстрируют устойчивую нисходящую тенденцию (то есть продолжают снижаться), в то время как Ананд Вихар демонстрирует тенденцию к росту (то есть значительный рост), а Соня Вихар — небольшой восходящий тренд (с очень небольшого роста с 2022 года). Кроме того, остатки суточных концентраций PM2.5 для каждой из четырёх мониторинговых станций показали, что концентрации PM2.5 сильно зависели от сезонных (метеорологических) изменений, которые приводили к значительным колебаниям среднесуточных концентрацийPM 2.5 для отдельных станций. Ежедневные концентрации PM2,5 для Четырёх мониторинговых станций в Дели (2012–2024) показаны на рисунке 2.

Рисунок 2: Сезонное и трендовое разложение с использованием лёсса (STL) ежедневных концентраций PM₂.₅ на четырёх мониторинговых станциях Дели с 2022 по 2024 год.Временные ряды для каждой станции мониторинга разлагаются на три аддитивных компонента: долгосрочный тренд, сезонные изменения и остаточные (остатки). (A) Компонент тренда для сектора Дварка 8. (B) Сезонный компонент для сектора Дварка 8. (C) Остаточный компонент для сектора Дварка 8. (D) Компонент тренда для Ананда Вихара. (E) Сезонный компонент для Ананда Вихара. (F) Остаточный компонент для Ананда Вихара. (G) Компонент тенденции для Mundka-DPCC. (H) Сезонный компонент для Mundka-DPCC. (I) Остаточный компонент для Mundka-DPCC. (J) Трендовый компонент для Сони Вихар. (K) Сезонный компонент для Сонии Вихар. (L) Остаточный компонент для Сонии Вихар. STL, сезонная и трендовая декомпозиция с использованием лёсса. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Рисунок 2 демонстрирует временное разложение ежедневных концентраций PM2.5 в четырёх городских мониторинговых точках в 2022–2024 годах, выявляя закономерности долгосрочных снижений, постепенного увеличения и значительных суточных изменений. Эти различия в значительной степени связаны с физическим воздействием погоды, то есть изменениями высоты пограничного слоя планеты (PBL), такими как дневное расширение, увеличивающее вертикальное рассеяние и снижение концентраций, а также ночное сжатие, оставляющее загрязнители близко к земле и создавая более высокий пик ночью. Другие метеорологические влияния связаны с выбросами локальной человеческой активности, связанными с часами наибольшего объёма (утренние/вечерние пики), промышленностью и их взаимодействием с: специфическими для мест факторами, такими как местный рельеф, скорость ветра, относительная влажность и сезон (то есть большая корреляция зимой), которые создают специфические для станции изменения, а общие долгосрочные снижения могли быть вызваны регуляторным контролем выбросов, что в целом привело к нисходящим тенденциям.
Корреляция между признаками
Рисунок 3 показывает распределение всех входных признаков, используемых в модели CORTA-Net. В панелях переменные загрязнителей (PM10 (рисунок 3A), NO₂ (рисунок 3B), CO (рисунок 3C), SO₂ (рисунок 3D)) показывают распределения с правым уклоном, типичные для городских данных по качеству воздуха, тогда как O₃ (рисунок 3E) и давление (рисунок 3I) демонстрируют почти нормальные закономерности35. Температура (рисунок 3F) демонстрирует чёткую бимодальную сезонную структуру, влажность (рисунок 3G) следует широкому равномерному распределению, а скорость ветра (рисунок 3H) — легкохвостое распределение. Эти закономерности подчёркивают гетерогенное статистическое поведение предикторов и оправдывают необходимость инженерии признаков и нормализации перед обучением модели.

Рисунок 3: Распределение входных признаков, используемых в модели CORTA-Net, включая концентрации загрязнителей воздуха и метеорологические переменные. Распределения иллюстрируют статистические характеристики предикторов до предварительной обработки и обучения модели. (A) Концентрация PM₁₀. (B) Концентрация NO₂. (C) Концентрация CO. (D) концентрация SO₂. (E) Концентрация O₃. (F) Температура воздуха. (G) Относительная влажность. (H) Скорость ветра. (I) Атмосферное давление. Переменные загрязнителей, особенно PM₁₀, NO₂, CO и SO₂, демонстрируют правонаправленные распределения, типичные для городских данных по качеству воздуха, тогда как O₃ и атмосферное давление показывают примерно нормальные распределения. Температура демонстрирует бимодальную сезонную схему, влажность широко распределена, а скорость ветра сосредоточена на более низких значениях с легкохвостым распределением. Эти гетерогенные распределения признаков поддерживают использование инженерии признаков и нормализации до разработки модели. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Рисунок 4 показывает рейтинг XGBoost по важности признаков на основе прироста после предварительной обработки CorrXGBoost-Rank для прогнозирования PM₂.₅. Текущий график важности признака показывает, что предыдущий день PM₂.₅ является самым высоким предиктором с оценкой важности 0.280, за ним следуют PM10 = 0.180, FIRECOUNT = 0.150, NO₂ = 0.120, CO = 0.080, скорость ветра = 0.070, температура = 0.040, влажность = 0.030 и день года = 0.020. Пунктирная вертикальная линия соответствует фактическому порогу выбора функций XGBoost в 0,015. Предикторы с показателями важности выше или равными 0,015 были сохранены для окончательного входного набора CORTA-Net, тогда как предикторы ниже этого порога, включая SO₂ = 0,010, O₃ = 0,010, давление = 0,005, осадки = 0,005, выходные = 0,002 и праздничные = 0,001, были исключены. Эти значения представляют собой показатели важности признаков на основе XGBoost и не должны интерпретироваться как коэффициенты корреляции Пирсона или причинные эффекты.
Таким образом, в модель включались только те признаки, которые получили вклад выше этого порога. Модели XGBoost используют ансамбль деревьев решений, которые итеративно строят дерево для минимизации функции потерь, известную как градиентное бустинг. XGBoost вычисляет важность признаков по одной из трёх метрик: усиление (насколько разделение признака улучшает производительность модели), вес (сколько раз признак был выбран как сплит для дерева) или покрытие (количество наблюдений, на которые влияет разделение). Модель XGBoost была построена на данных, связанных с качеством воздуха (загрязнители, метеорологические переменные), и сосредоточена на отстающем PM2.5 до авторегрессивного прогнозирования PM2.5, что часто встречается в моделях PM2.5 для Дели, и помогает фиксировать временную устойчивость PM2.5. Delhi_PM2.5 является значительным фактором благодаря высоким автокорреляционным характеристикам мелких частиц, что также указывает на наличие инерции загрязнения от последовательных источников выбросов. Скорость ветра является значительным фактором, поскольку она обеспечивает механизм рассеивания загрязнителей; в то время как низкий ветер позволяет загрязнителям накапливаться зимой, когда присутствуют инверсии. NO 2 коррелирует с PM2.5 из-за трафика/выбросов, а день года указывает на годовой цикл выбросов загрязнителей (то есть снижение выбросов в выходные). В Дели PM2.5 обладает высокой самостойкостью из-за застойной зимней метеорологии и постоянных выбросов от транспортных средств, промышленности ибиомассы 28. Ветер способствует рассеиванию аэрозолей, но слабый ветер < 2 м/с способствовал увеличению накопления PM2.5 из-за инверсий. Связь междуNO 2 и PM2.5 является результатом их общего происхождения (то есть сгорания) и подвержена временным влияниям (например, ежедневно или еженедельно)36. Четыре основных фактора, объясняющих 93% и более вариаций AQI, — это изменения концентрации загрязняющих веществ из-за задержки накопления PM2.5 (93%+) и низких скоростей ветра, удерживающих выбросы, выбросовNO 2/PM от транспортных средств и промышленности, а также ежедневных колебаний объёматрафика 37. Кроме того, география Дели является фактором, способствующим сохранению инверсий в этом районе и, следовательно, усугубляет концентрацию PM2.5 . Настройка гиперпараметров, регуляризация и добавление дополнительных переменных (например, температуры) помогут снизить вероятность переподгонки и повысят общую производительность модели. Внедрение операционных стратегий по снижению выбросов PM должно включать введение ежедневных лимитов выбросов PM, использование устройств с мониторингом наличия PM в реальном времени и использование ветра для рассеивания PM через городскую зеленую зону.

Рисунок 4: Рейтинг по важности признаков на основе прироста XGBoost после скрининга признаков CorrXGBoost-Rank для прогнозирования PM₂.₅ . Предикторные полосы расположены в порядке убывания важности. Пунктирная вертикальная линия соответствует фактическому порогу выбора функций XGBoost в 0,015. Предикторы с баллами ≥ 0,015 были сохранены для окончательного входного набора CORTA-Net, тогда как предикторы ниже этого порога были исключены. Рейтинг используется для скрининга признаков и интерпретации поведения модели и не должен интерпретироваться как причинная атрибуция. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Архитектура модели CORTA-net
Рисунок 5 представляет предложенную модель прогнозирования PM2.5 . Дополнительные рисунки 4 и 5 иллюстрируют внутреннюю структуру блока LSTM и представляют блок-схему Multi-Head Attention. Все источники данных (то есть окружающие условия, метеорологические наблюдения, активность пожаров, а также временные и контекстуальные аспекты данных) прошли предварительную обработку, чтобы убедиться, что они временно совпадают, имеют отсутствующие данные (при необходимости) и были подвергнуты как удалению выбросов, так и нормализации перед их применением в процессах построения моделей. Архитектура модели, инженерия признаков, конфигурация обучения, конфигурация данных, трансферное обучение, метрики оценки, прогнозы на будущее и детали реализации приведены в Дополнительной таблице 1. С помощью модуля CorrXGBoost-Rank оптимальный набор признаков определяется до того, как часть из них будет введена в архитектуру LSTM, что было усилено за счёт включения многоголовых уровней внимания для учёта поведения временных рядов на этапе моделирования. Как прогноз PM2.5 , так и PM2.5 отмечают важность входных характеристик, а также массовые веса внимания в виде карт внимания были предоставлены в качестве выходных данных. Внутренняя структура блока LSTM и многоголовная блок-схема внимания включены в качестве дополнительных рисунков 4 и 5 соответственно, а дополнительная таблица 1 содержит параметры архитектуры для каждого типа слоя в этой архитектуре.

Рисунок 5: Общая архитектура модели прогнозирования CORTA-Net PM₂.₅. Процесс входного прогноза включает данные от индикаторов качества воздуха, погодных индикаторов, временных индикаторов и индикаторов подсчёта пожаров MODIS (Medium Resolution Imaging Spectroradiometer). Для каждого из этих этапов алгоритм выравнивал временные метки, обрабатывал отсутствующие значения, фильтровал выбросы, нормализировал данные и проектировал признаки. Окончательные предикторы были выбраны с помощью процесса CorrXGBoost-Rank. Впоследствии выбранные функции помещались в скользящие окна временной последовательности и проходили через кодировщик LSTM (Long Short-Term Memory) с использованием трансферного обучения. Для каждого признака и шага времени многоголовый механизм внимания применяет веса перед отправкой совокупного выхода в финальный регрессионный плотный слой для получения прогноза PM₂.₅. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Обучение и оценка
Для формирования наблюдаемых учебных последовательностей использовался подход с раздвижным окном. Обучение использовало оптимизатор Адама и среднеквадратичную потерю ошибок (Дополнительная таблица 2). Производительность модели оценивалась с помощью RMSE иR 2 в обучающих, валидационных, тестовых и кросс-валидационных разделах. Архитектура модели, инженерия особенностей, конфигурация обучения, конфигурация данных, трансферное обучение, метрики оценки, прогнозы будущего и детали реализации приведены в таблице 1. Рисунок 6 представляет собой обучающую диагностику модели прогнозирования CORTA-Net PM₂.₅. На панелях рисунок 6A показывает кривые потерь для обучения и валидации, демонстрирующие прогрессирующее снижение ошибок с оптимальной остановкой на эпохе 106. Эволюция пробела обобщения при оценке анализа перенагружения иллюстрируется расхождением между валидацией и обучающими данными на рисунке 6B. В частности, он показывает периоды, когда расхождение превышает заранее определённые пределы; эта информация свидетельствует о том, что модели поведения на скорости обучения и снижения потерь иллюстрируют преимущества снижения запланированной скорости обучения (LR) в критические эпохи как средства повышения стабильности сходимости, как показано на рисунке 6C. В совокупности эти цифры дают краткое представление о динамике обучения, возможности обобщения и рекомендуемой конфигурации обучения модели.

Рисунок 6: Диагностика обучения для модели прогнозирования CORTA-Net PM₂.₅. (A) Кривая потерь при обучении и валидации, показывающие прогрессивное снижение ошибок во время обучения модели, с ранней остановкой на эпохе 106 на основе эффективности валидации. (B) Пробел в обобщении между обучением и потерей валидации в разных эпохах, иллюстрирующий эволюцию обобщения моделей и периоды увеличения расхождения, указывающие на потенциальную переподгонку. (C) Расписание скорости обучения, показывающее влияние запланированного снижения скорости обучения на оптимизацию на протяжении всего обучения. (D) Краткое описание поведения при сходимости модели, демонстрация стабильной оптимизации и окончательной обучающей конфигурации, выбранной для модели CORTA-Net. Вместе эти диагностические данные иллюстрируют динамику модели, характеристики сходимости и производительность обобщения во время обучения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.