Исследовательская статья

Гибридное глубокое обучение с интерпретацией, основанной на внимании, для прогнозирования PM2.5 в городских условиях Дели

DOI:

10.3791/71004

7 августа 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

CORTA (Correlation Optimized Ranked Transfer-Attention)-Net — гибридная фреймворк глубокого обучения для краткосрочного прогнозирования PM₂.₅ в Дели. Модель сочетает выбор признаков CorrXGBoost-Rank, трансферное обучение с сетями длительной краткосрочной памяти и многоголовое внимание для интерпретации на уровне времени и признаков, а также использует данные о качестве воздуха, метеорологии и спутниковых данных о подсчёте пожаров для улучшения прогнозирования PM2.5.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Краткосрочное прогнозирование PM2.5 в Дели сложно, поскольку концентрация твердых частиц зависит от местных выбросов, метеорологических колебаний, сезонной стагнации и эпизодического загрязнения, связанного с пожарами. В данном исследовании представлена CORTA-Net — гибридная фреймворк глубокого обучения для прогнозирования PM2.5 с использованием многоисточниковых экологических данных с 2012 по 2024 год. Входные данные включают ежечасные наблюдения качества воздуха с станций мониторинга CPCB (Центральный совет по контролю загрязнения) / DPCC (Комитет по контролю загрязнения Дели), метеорологические переменные от Метеорологического департамента Индии (IMD) и спутниковые данные о подсчёте пожаров из продуктов MODIS (Spectroradiometer Medium Resolution Imaging Imaging Spectroradiometer). Предлагаемая структура сначала применяет выбор признаков CorrXGBoost-Rank для снижения избыточных предикторов и сохранения важных загрязнителей, метеорологических, временных и связанных с пожарами переменных. Выбранные признаки затем организуются в виде контролируемых последовательностей скользящих окон и обрабатываются с помощью кодировщика LSTM на основе трансферного обучения, за которым следует многоголовый слой внимания. Механизм внимания обеспечивает интерпретацию прогноза PM2.5 на уровне характеристик и временных шагов. CORTA-Net оценивался с использованием хронологического обучения, тестирования и валидационных разделов, а также кросс-валидации. В сравнении с базовыми линиями случайного леса, XGBoost, LSTM и внимание-LSTM, предлагаемая структура снизила ошибку прогноза в условиях оцениваемой мониторинговой станции Дели. Новизна CORTA-Net заключается в сочетании явного скрининга признаков CorrXGBoost-Rank, временного кодирования на основе трансферного обучения, интеграции MODIS с огневой активностью и многоголового анализа поведения моделей в одном воспроизводимом конвейере прогнозирования PM2.5 . На практике эта структура может поддерживать краткосрочные прогнозы качества городского воздуха в условиях мониторинга, богатых данными, где доступны записи загрязнителей, метеорологические наблюдения и индикаторы пожарной активности.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Мелкие твердые частицы с аэродинамическим диаметром ≤ 2,5 мкм (PM2,5) являются важной проблемой качества воздуха в Дели, поскольку на них влияют локальныевыбросы 1,2,3, региональныйтранспорт 4, сезоннаяметеорология 5 и эпизодические события сжиганиябиомассы 6. В послемуссонные и зимниепериоды 7 низкая скоростьветра 8, мелководные условияпограничного слоя 9 и инверсия температуры могут уменьшить распространение загрязняющих веществ и увеличить накопление частиц. Прогнозирование краткосрочного PM2.5 сложно из-за присущего нелинейному, сезонному и резкому высокозагрязнённому явлению временнойсерии 10. Предыдущие исследования по прогнозированию PM2.5 использовали статистические модели, модели машинного обучения и модели рекуррентных нейронныхсетей 11. Статистические методы могут быть полезны для определения тенденций и сезонности данных12, но могут не полностью учитывать нелинейные взаимодействия между загрязнителями иметеорологией 13. Модели машинного обучения, такие как случайные леса и XGBoost, могут использоваться для моделирования нелинейныхвзаимосвязей 14; однако обычно они не имеют временной зависимости, если не разработаны задержки. Долгосрочные краткосрочные (LSTM) нейронные сети способны моделировать как временную зависимость, так и нелинейныевзаимосвязи 15.

Сети долгосрочной краткосрочной памяти могут моделировать временныепаттерны 16, но их производительность может зависеть от нестационарных условий и резкого загрязненияэпизодов 17. Современные подходы, основанные на внимании и трансформеры, улучшают временноепредставление 18, но многие из них напрямую обрабатывают все кандидатные переменные и обеспечивают ограниченный контроль над избыточностью признаков до моделированияпоследовательностей 19,20. Хотя трансформерные и гибридные модели глубокого обучения недавно улучшили PM2.5 иAQI 21, их вклад часто сосредоточен на обучении временномупредставлению 22, построению пространственныхграфов 23, слияниюмоделей 24 или оптимизации. Многие такие модели напрямую используют доступный многомерный набор входов и возлагают основную нагрузку на модельпоследовательности 25. Это может увеличить избыточность входных данных, снизить интерпретируемость и затруднить определение того, возникают ли улучшения за счёт временного моделирования, скрининга признаков, внешних индикаторов окружающей среды или взвешивания на основе внимания. Таким образом, CORTA-Net позиционируется как фреймворк прогнозирования на уровне рабочих процессов, а не как новый автономный нейронный уровень26. Её отличие заключается в упорядоченной интеграции из четырёх этапов: скрининг признаков CorrXGBoost-Rank перед моделированием последовательностей, кодирование LSTM с трансферным обучением для временной адаптации, включение подсчёта пожаров, основанных на MODIS, для эпизодического влияния на сжигание биомассы, и многоголовое внимание для интерпретации поведения модели на уровне признаков и временных шагов. Эта конструкция позволяет структуре оценивать как точность прогнозирования, так и вклад выбранных переменных загрязнителей, метеорологических, временных и пожарной активности при одной и той же установке мониторинговой станцииДели 27.

Недавние достижения в прогнозировании качества воздуха всё чаще используют гибридные модели глубокого обучения, механизмы внимания, обучение на основеграфов и архитектуры трансформеров для фиксации нелинейных временных и пространственныхзависимостей 29. Эти подходы повысили результаты прогнозирования за счёт изучения долгосрочных зависимостей и назначения адаптивных весов временным шагам или входнымпеременным 30. Однако многие современные модели всё ещё зависят от больших входных наборов признаков, не уменьшают явно избыточные предикторы до временного моделирования или не включают внешние индикаторы активности огня, когда важны эпизодические эффекты сжигания биомассы. CORTA-Net устраняет этот пробел, объединяя скрининг признаков, кодирование LSTM с обучением по передаче, интеграцию подсчёта пожаров на основе MODIS и многоголовое внимание в едином рабочем процессе прогнозирования.

В этом исследовании CORTA-Net представлен как воспроизводимый гибридный конвейер прогнозирования PM2.5 , а не как новый слой нейронных сетей. Фреймворк объединяет четыре этапа: выбор признаков CorrXGBoost-Rank, временное кодирование LSTM на основе трансферного обучения, интеграция с подсчётом огня на основе MODIS и многоголовый анализ поведения моделей на основе внимания. CorrXGBoost-Rank сначала снижает избыточные загрязнители и метеорологические переменные перед моделированием последовательностей. Выбранные признаки затем организуются в последовательности скользящих окон и обрабатываются с помощью кодировщика LSTM с обучением передачи. Переменные MODIS по количеству пожаров включены в качестве внешних индикаторов региональной активности пожаров, а многопрофильный уровень внимания используется для изучения того, какие недавние временные шаги и входные переменные наиболее влияют на прогноз. Фреймворк подходит для условий, где непрерывные наблюдения PM2.5 доступны как минимум с одной мониторинговой станции, желательно с несколькими годами почасовых данных. Также он получает выгоду от метеорологических наблюдений и спутниковых данных о подсчёте пожаров, когда влияние регионального биомассового сжигания имеет значение. Поэтому CORTA-Net предназначен для насыщенных данными условий прогнозирования качества городского воздуха и может быть неподходящим для мест с редкими, нерегулярными или краткосрочные мониторинговые записи.

Дели был выбран для изучения из-за повторяющихся высоких уровней PM₂.₅ в послемуссонный и зимнийпериоды 31. Город страдает от транспорта, промышленной активности, выбросов от жилых объектов, метеорологического стагнации и региональных сельскохозяйственных пожаров. Для этого исследования использовались четыре мониторинговые станции: сектор Дварка 8, Ананд Вихар, Мундка-DPCC и Соня Вихар. Каждая станция представляет собой разный тип городской микросреды: жилую зону, зону влияния на движение и зону с промышленным эффектом. Наблюдения, проведённые на каждой станции мониторинга в период с 2012 по 2024 годы, представлены на дополнительном рисунке 1. Обучение модели проводилось на данных с 2015 по 2022 год, а тестирование — на данных 2023 года как для разработки модели, так и для валидациимодели 32 по собранным в 2024 году. Используемые в качестве входных параметров включали PM2.5, PM10, NO,NO 2, NOx, CO, бензол, температуру воздуха, скорость ветра, солнечную радиацию и барметрическое давление, и определялись на основе доступных наобъекте 33. Данные о пожарах, полученные от MODIS, использовались как внешняя переменная, отражающая уровень пожарной активности в этом районе. Таблица 1 содержит сводку статистики концентрации PM₂.₅ с каждой из четырёх мониторинговых станций.

Набор данныхНазвание станцииЗлойSTDМин25%50%75%Макс
1Сектор Дварка 898.2479.127.5238.6570.83133.47588.15
2Ананд Вихар115.8789.428.9149.2884.36152.89574.92
3Mundka-DPCC113.6291.054.2143.5886.74158.42682.31
4Соня Вихар101.3580.255.8042.1575.60138.75565.40

Таблица 1: Сводная статистика концентрации PM₂.₅ на четырёх мониторинговых станциях Дели .В таблице 1 представлены средние уровни PM2.5 (мелкочастицы), измеренные на четырёх мониторах в Дели. PM2.5 состоит из воздушных загрязнителей размером менее 2,5 микрона в диаметре и, следовательно, достаточно мал, чтобы легко вдыхаться глубоко в лёгкие, что создаёт различные потенциальные опасности для здоровья.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Методология
Была построена модель с контролируемым скользящим окном для прогнозирования будущего значения PM2.5 на момент времени t + 1 на основе предыдущих почасовых наблюдений. Длины окна ввода кандидатов — 12, 24 и 48 часовых шагов — оценивались с помощью производительности валидации, а окончательная конфигурация CORTA-Net использовала 24-часовую последовательность ввода. Для заполнения недостающих значений использовалась линейная интерполяция; выбросы удалялись с помощью метода IQR; и все переменные масштабировались с помощью нормализации min-max перед генерацией задерживающихся функций PM2.5 . Затем для выбора признаков применялась процедура CorrXGBoost-Rank. Во-первых, корреляционная фильтрация Пирсона сохраняла переменные с |r| ≥ 0.30. Во-вторых, крайне избыточные пары признаков с парной корреляцией |corr(x i, xj)| ≥ 0,85 были отфильтрованы для снижения мультиколлинеарности. В-третьих, регрессор XGBoost был обучен на оставшихся переменных, а предикторы с оценками важности на основе усиления XGBoost ≥ 0,015 были сохранены для итогового входа модели. Окончательная архитектура CORTA-Net состояла из слоёв LSTM для временного кодирования, многоголового слоя внимания для взвешивания на уровне признаков и временных шагов, а также плотных регрессионных слоёв для оценки PM2.5 . Модель была обучена с использованием оптимизатора Адама с потерями ошибки в среднем квадрате и ранней остановкой. Оценка модели проводилась с использованием RMSE иR 2 в рамках обучения, валидации, тестирования и 10-кратных перекрестных валидационных разделов. Таблица 2 представляет сводку предварительной обработки данных и инженерии характеристик.

ШагИспользуемый методПараметр / порогНазначение
Расчёт отсутствующего значенияПроцент пропущенных наблюденийОтчёт по переменным процентамКоличественно определяет полноту данных
Импутация короткого разрываЛинейная интерполяцияДлина зазора ≤ 6 чЗаполняет короткие пропущенные интервалы
Обнаружение выбросовМетод IQRQ1 − 1,5 × IQR, Q3 + 1,5 × IQRУдаляет недопустимые экстремальные значения
НормализацияМинимальное масштабированиеТренировочные наборы минимум и максимумСтандартизация диапазона функций
PM₂.₅ лагиЗадержки переменныхлаг₁, лаг₂, лаг₃Фиксирует временную устойчивость
Статистика перекатыванияСкользящие средние3 часа, 6 часов, 12 часов, 24 часаФиксирует краткосрочное накопление
Функция подсчёта пожаровПОДСЧЁТ МОДИСчёт в тот же день / предыдущий деньОтражает влияние региональных пожаров

Таблица 2: Предварительная обработка данных и сводка по инженерии признаков. В Таблице 2 обработка данных осуществляется двумя способами: во-первых, через очистку и преобразование исходных данных (предварительную обработку), а во-вторых, через инженерию признаков для создания/выбора/изменения характеристик (особенностей). В совокупности эти два процесса помогают устранить или уменьшить шум; обрабатывать отсутствующие значения; повысить согласованность данных; и создавать более предсказательные модели.

Параметры нормализации оценивались только из обучающего набора и затем применялись без изменений к наборам тестирования и валидации, чтобы избежать утечек информации.

Математическая формулировка CorrXGBoost-rank
Пусть X = {x1,x 2, ...,x n} обозначает множество кандидатов входных переменных, а y — целевую концентрацию PM₂.₅. Для каждого признака xi коэффициент корреляции Пирсона с целевой переменной рассчитывался следующим образом:

figure-protocol-1(1)

где CoV(xi, y) — ковариация между признакомx i и целевой единицей y, а σxi и σy — их стандартные отклонения. Сохранившиеся функции, удовлетворяющие ими: |ri| ≥ τr , где τr = 0,30 в этом исследовании.

Парные корреляции рассчитывались среди всех сохранившихся features_xi, xj, и если |corr(xi, xj)| >= τкрасный, где τкрасный = 0,85, признак с меньшей абсолютной корреляцией к цели PM2,5 исключается из набора признаков. Этот процесс уменьшает переменные из набора признаков, обладающие мультиколлинеарностью. Затем к оставшимся признакам была подгонена регрессорная модель XGBoost, и оценки важности признаков рассчитывались для каждой с использованием важности XGBoost, а также признаков, удовлетворяющих i_i ≥ τxgb, где τxgb = 0,015, сохранялись в итоговом наборе признаков (S), определяемом какS final=S corr ∪ Sxgb, то есть набор признаков, определяемый фильтрацией по избыточности по корреляции и удалением любых признаков на основе важности переменной XGBoost. Общий подход, используемый при выборе признаков, таков: вычислить целевые признаки попарно корреляцию Пирсона, отбрасывать признаки с |r_i|< 0,30, отбрасывать признаки с парами с парными корреляциями ≥ 0,85, подгонять XGBoost к оставшимся признакам, сохранять признаки с показателем важности XGBoost ≥ 0,015, определить окончательные желаемые признаки Sfinal=Scorr ∪ Sxgb, где Scorr — это признаки, сохраняющиеся после избыточной корреляционной фильтрации, а Sxgb — признаки, выбранные с помощью оценки важности функций XGBoost. Таким образом, рабочий процесс CorrXGBoost-Rank таков: вычислить корреляцию Пирсона с целевой характеристикой, удалить признаки с |ri| < 0.30 убрать высоко избыточные признаки с парной корреляцией ≥ 0.85, обучить XGBoost на оставшихся переменных, сохранить переменные с показателем важности XGBoost ≥ 0.015 и использовать объединение выбранных переменных по корреляции и выбранных XGBoost переменных в качестве окончательного набора признаков. Параметры, используемые в этом исследовании: τr = 0,30, τкрасный = 0,85 и τxgb = 0,015.

Источники данных
Авторы интегрировали три больших набора данных для исследования; это данные о загрязнителях воздуха (PM2.5, PM10,NO 2, CO и SO₂), которые авторы получили через мониторинг качества воздуха CPCB (Центральный совет по контролю загрязнения) / DPCC (Комитет по контролю загрязнения Дели), метеорологические данные (температура, влажность, скорость/направление и давление ветра) от индийского метеорологического департамента (IMD) и спутниковая информация об активных пожарах из MODIS Active Fire Products от NASA. Эти три набора данных охватывают 12-летний период с января 2012 по декабрь 2023 года и, таким образом, представляют разные типы выбросов. Пожарные инциденты способствуют загрязнению воздуха, как показано на дополнительном рисунке 2, где показаны тенденции FIRECOUNT с 2012 по 2024 год.

Долгосрочные тенденции загрязнителей за период исследования
Рисунок 1 показывает долгосрочные тенденции загрязнителей за годы исследования (2012–2024). Годовые подсчета пожаров и средние концентрации PM₂.₅ в период с 2012 по 2024 годы имеют умеренно сильную положительную связь (r = 0,688), что указывает на то, что более высокая активность пожаров обычно связана с более высокой концентрацией PM₂.₅. Как измеряемые, так и прогнозируемые данные PM₂.₅ следуют схожей тенденции, что подтверждает идею о сжигании биомассы способствующего загрязнению частицами. Хотя существует значительная межгодовая вариабельность, выбросы, связанные с пожаром, являются важным фактором в определении вариабельности PM₂.₅, что подчёркивает необходимость регионального управления пожарами для улучшения качества воздуха. Автокорреляция прогнозируемого PM2.5 на тридцати задержках, показанная на дополнительном рисунке 3, имеет значительную положительную автокорреляцию почти на всех тридцати задержках, что подтверждает, что PM2.5 в Дели обладает сильной временной зависимостью и многодневной персистентностью.

figure-protocol-2
Рисунок 1: Долгосрочные тенденции PM₂.₅ и подсчёт пожаров с 2012 по 2024 год. Рисунок 1 сравнивает годовое изменение количества пожаров с наблюдаемыми и прогнозируемыми концентрациями PM₂.₅. PM₂.₅ сообщается в мкг/м 3. FIRECOUNT отражает огневую активность, полученную от спутников, из продуктов MODIS. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Декомпозиция STL (сезонная и трендовая декомпозиция с использованием лёсса)
STL, или сезонная и трендовая декомпозиция с использованием Лёсса, — это итеративный алгоритм, позволяющий разбить данные временных рядов на три аддитивных компонента, как показано на рисунке 2: тренд (долгосрочный тренд) (рисунок 2A), (рисунок 2D), (рисунок 2G), (рисунок 2J), сезонный (циклический период) (рисунок 2B), (рисунок 2E), (рисунок 2H), (рисунок 2K) и остаток (шум/остаточный) (рисунок 2C), (Рисунок 2F), (Рисунок 2I), (Рисунок 2L). STL доказала свою эффективность в работе со сложными нелинейными характеристиками экологических данных (например, PM2.5), для которых многие другие аналитические методы не справились из-за переменных амплитуд сезонного сигнала и наличия выбросов. Сглаживание LOESS позволяет точно разделять эти компоненты, обеспечивая более чёткую интерпретацию тенденций или закономерностей. С помощью обработки STL можно отделить более широкие восходящие тенденции PM2.5 от более коротких дневных/сезонных циклов и от нестабильных остаточных в этих циклах. Такое разделение позволяет определить, какие выбросы повлияли на PM2.5, а какие метеорологические факторы повлияли на PM2.5. Результаты этого разделения помогают точно прогнозировать будущие выбросы PM2.5 ; предоставлять данные для регуляторных решений; и соответствовать стандартам, установленным для строгой деагрегации данных временных рядов для исследований качествавоздуха 34. Средние суточные измерения концентрации PM2.5 , проведённые на станциях мониторинга в Дели с 2012 по 2024 год, показывают минимальные изменения уровня PM2.5 (то есть отсутствие значимых изменений с 2022–24 годов) и крайне ограниченное стабильное поведение (или согласованность уровней PM2.5 в четырёх точках мониторинга). Уровни PM2.5 в секторе Дварка 8 и Мундка-DPCC демонстрируют устойчивую нисходящую тенденцию (то есть продолжают снижаться), в то время как Ананд Вихар демонстрирует тенденцию к росту (то есть значительный рост), а Соня Вихар — небольшой восходящий тренд (с очень небольшого роста с 2022 года). Кроме того, остатки суточных концентраций PM2.5 для каждой из четырёх мониторинговых станций показали, что концентрации PM2.5 сильно зависели от сезонных (метеорологических) изменений, которые приводили к значительным колебаниям среднесуточных концентрацийPM 2.5 для отдельных станций. Ежедневные концентрации PM2,5 для Четырёх мониторинговых станций в Дели (2012–2024) показаны на рисунке 2.

figure-protocol-3
Рисунок 2: Сезонное и трендовое разложение с использованием лёсса (STL) ежедневных концентраций PM₂.₅ на четырёх мониторинговых станциях Дели с 2022 по 2024 год.Временные ряды для каждой станции мониторинга разлагаются на три аддитивных компонента: долгосрочный тренд, сезонные изменения и остаточные (остатки). (A) Компонент тренда для сектора Дварка 8. (B) Сезонный компонент для сектора Дварка 8. (C) Остаточный компонент для сектора Дварка 8. (D) Компонент тренда для Ананда Вихара. (E) Сезонный компонент для Ананда Вихара. (F) Остаточный компонент для Ананда Вихара. (G) Компонент тенденции для Mundka-DPCC. (H) Сезонный компонент для Mundka-DPCC. (I) Остаточный компонент для Mundka-DPCC. (J) Трендовый компонент для Сони Вихар. (K) Сезонный компонент для Сонии Вихар. (L) Остаточный компонент для Сонии Вихар. STL, сезонная и трендовая декомпозиция с использованием лёсса. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 2 демонстрирует временное разложение ежедневных концентраций PM2.5 в четырёх городских мониторинговых точках в 2022–2024 годах, выявляя закономерности долгосрочных снижений, постепенного увеличения и значительных суточных изменений. Эти различия в значительной степени связаны с физическим воздействием погоды, то есть изменениями высоты пограничного слоя планеты (PBL), такими как дневное расширение, увеличивающее вертикальное рассеяние и снижение концентраций, а также ночное сжатие, оставляющее загрязнители близко к земле и создавая более высокий пик ночью. Другие метеорологические влияния связаны с выбросами локальной человеческой активности, связанными с часами наибольшего объёма (утренние/вечерние пики), промышленностью и их взаимодействием с: специфическими для мест факторами, такими как местный рельеф, скорость ветра, относительная влажность и сезон (то есть большая корреляция зимой), которые создают специфические для станции изменения, а общие долгосрочные снижения могли быть вызваны регуляторным контролем выбросов, что в целом привело к нисходящим тенденциям.

Корреляция между признаками
Рисунок 3 показывает распределение всех входных признаков, используемых в модели CORTA-Net. В панелях переменные загрязнителей (PM10 (рисунок 3A), NO₂ (рисунок 3B), CO (рисунок 3C), SO₂ (рисунок 3D)) показывают распределения с правым уклоном, типичные для городских данных по качеству воздуха, тогда как O₃ (рисунок 3E) и давление (рисунок 3I) демонстрируют почти нормальные закономерности35. Температура (рисунок 3F) демонстрирует чёткую бимодальную сезонную структуру, влажность (рисунок 3G) следует широкому равномерному распределению, а скорость ветра (рисунок 3H) — легкохвостое распределение. Эти закономерности подчёркивают гетерогенное статистическое поведение предикторов и оправдывают необходимость инженерии признаков и нормализации перед обучением модели.

figure-protocol-4
Рисунок 3: Распределение входных признаков, используемых в модели CORTA-Net, включая концентрации загрязнителей воздуха и метеорологические переменные. Распределения иллюстрируют статистические характеристики предикторов до предварительной обработки и обучения модели. (A) Концентрация PM₁₀. (B) Концентрация NO₂. (C) Концентрация CO. (D) концентрация SO₂. (E) Концентрация O₃. (F) Температура воздуха. (G) Относительная влажность. (H) Скорость ветра. (I) Атмосферное давление. Переменные загрязнителей, особенно PM₁₀, NO₂, CO и SO₂, демонстрируют правонаправленные распределения, типичные для городских данных по качеству воздуха, тогда как O₃ и атмосферное давление показывают примерно нормальные распределения. Температура демонстрирует бимодальную сезонную схему, влажность широко распределена, а скорость ветра сосредоточена на более низких значениях с легкохвостым распределением. Эти гетерогенные распределения признаков поддерживают использование инженерии признаков и нормализации до разработки модели. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 4 показывает рейтинг XGBoost по важности признаков на основе прироста после предварительной обработки CorrXGBoost-Rank для прогнозирования PM₂.₅. Текущий график важности признака показывает, что предыдущий день PM₂.₅ является самым высоким предиктором с оценкой важности 0.280, за ним следуют PM10 = 0.180, FIRECOUNT = 0.150, NO₂ = 0.120, CO = 0.080, скорость ветра = 0.070, температура = 0.040, влажность = 0.030 и день года = 0.020. Пунктирная вертикальная линия соответствует фактическому порогу выбора функций XGBoost в 0,015. Предикторы с показателями важности выше или равными 0,015 были сохранены для окончательного входного набора CORTA-Net, тогда как предикторы ниже этого порога, включая SO₂ = 0,010, O₃ = 0,010, давление = 0,005, осадки = 0,005, выходные = 0,002 и праздничные = 0,001, были исключены. Эти значения представляют собой показатели важности признаков на основе XGBoost и не должны интерпретироваться как коэффициенты корреляции Пирсона или причинные эффекты.

Таким образом, в модель включались только те признаки, которые получили вклад выше этого порога. Модели XGBoost используют ансамбль деревьев решений, которые итеративно строят дерево для минимизации функции потерь, известную как градиентное бустинг. XGBoost вычисляет важность признаков по одной из трёх метрик: усиление (насколько разделение признака улучшает производительность модели), вес (сколько раз признак был выбран как сплит для дерева) или покрытие (количество наблюдений, на которые влияет разделение). Модель XGBoost была построена на данных, связанных с качеством воздуха (загрязнители, метеорологические переменные), и сосредоточена на отстающем PM2.5 до авторегрессивного прогнозирования PM2.5, что часто встречается в моделях PM2.5 для Дели, и помогает фиксировать временную устойчивость PM2.5. Delhi_PM2.5 является значительным фактором благодаря высоким автокорреляционным характеристикам мелких частиц, что также указывает на наличие инерции загрязнения от последовательных источников выбросов. Скорость ветра является значительным фактором, поскольку она обеспечивает механизм рассеивания загрязнителей; в то время как низкий ветер позволяет загрязнителям накапливаться зимой, когда присутствуют инверсии. NO 2 коррелирует с PM2.5 из-за трафика/выбросов, а день года указывает на годовой цикл выбросов загрязнителей (то есть снижение выбросов в выходные). В Дели PM2.5 обладает высокой самостойкостью из-за застойной зимней метеорологии и постоянных выбросов от транспортных средств, промышленности ибиомассы 28. Ветер способствует рассеиванию аэрозолей, но слабый ветер < 2 м/с способствовал увеличению накопления PM2.5 из-за инверсий. Связь междуNO 2 и PM2.5 является результатом их общего происхождения (то есть сгорания) и подвержена временным влияниям (например, ежедневно или еженедельно)36. Четыре основных фактора, объясняющих 93% и более вариаций AQI, — это изменения концентрации загрязняющих веществ из-за задержки накопления PM2.5 (93%+) и низких скоростей ветра, удерживающих выбросы, выбросовNO 2/PM от транспортных средств и промышленности, а также ежедневных колебаний объёматрафика 37. Кроме того, география Дели является фактором, способствующим сохранению инверсий в этом районе и, следовательно, усугубляет концентрацию PM2.5 . Настройка гиперпараметров, регуляризация и добавление дополнительных переменных (например, температуры) помогут снизить вероятность переподгонки и повысят общую производительность модели. Внедрение операционных стратегий по снижению выбросов PM должно включать введение ежедневных лимитов выбросов PM, использование устройств с мониторингом наличия PM в реальном времени и использование ветра для рассеивания PM через городскую зеленую зону.

figure-protocol-5
Рисунок 4: Рейтинг по важности признаков на основе прироста XGBoost после скрининга признаков CorrXGBoost-Rank для прогнозирования PM₂.₅ . Предикторные полосы расположены в порядке убывания важности. Пунктирная вертикальная линия соответствует фактическому порогу выбора функций XGBoost в 0,015. Предикторы с баллами ≥ 0,015 были сохранены для окончательного входного набора CORTA-Net, тогда как предикторы ниже этого порога были исключены. Рейтинг используется для скрининга признаков и интерпретации поведения модели и не должен интерпретироваться как причинная атрибуция. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Архитектура модели CORTA-net
Рисунок 5 представляет предложенную модель прогнозирования PM2.5 . Дополнительные рисунки 4 и 5 иллюстрируют внутреннюю структуру блока LSTM и представляют блок-схему Multi-Head Attention. Все источники данных (то есть окружающие условия, метеорологические наблюдения, активность пожаров, а также временные и контекстуальные аспекты данных) прошли предварительную обработку, чтобы убедиться, что они временно совпадают, имеют отсутствующие данные (при необходимости) и были подвергнуты как удалению выбросов, так и нормализации перед их применением в процессах построения моделей. Архитектура модели, инженерия признаков, конфигурация обучения, конфигурация данных, трансферное обучение, метрики оценки, прогнозы на будущее и детали реализации приведены в Дополнительной таблице 1. С помощью модуля CorrXGBoost-Rank оптимальный набор признаков определяется до того, как часть из них будет введена в архитектуру LSTM, что было усилено за счёт включения многоголовых уровней внимания для учёта поведения временных рядов на этапе моделирования. Как прогноз PM2.5 , так и PM2.5 отмечают важность входных характеристик, а также массовые веса внимания в виде карт внимания были предоставлены в качестве выходных данных. Внутренняя структура блока LSTM и многоголовная блок-схема внимания включены в качестве дополнительных рисунков 4 и 5 соответственно, а дополнительная таблица 1 содержит параметры архитектуры для каждого типа слоя в этой архитектуре.

figure-protocol-6
Рисунок 5: Общая архитектура модели прогнозирования CORTA-Net PM₂.₅. Процесс входного прогноза включает данные от индикаторов качества воздуха, погодных индикаторов, временных индикаторов и индикаторов подсчёта пожаров MODIS (Medium Resolution Imaging Spectroradiometer). Для каждого из этих этапов алгоритм выравнивал временные метки, обрабатывал отсутствующие значения, фильтровал выбросы, нормализировал данные и проектировал признаки. Окончательные предикторы были выбраны с помощью процесса CorrXGBoost-Rank. Впоследствии выбранные функции помещались в скользящие окна временной последовательности и проходили через кодировщик LSTM (Long Short-Term Memory) с использованием трансферного обучения. Для каждого признака и шага времени многоголовый механизм внимания применяет веса перед отправкой совокупного выхода в финальный регрессионный плотный слой для получения прогноза PM₂.₅. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Обучение и оценка
Для формирования наблюдаемых учебных последовательностей использовался подход с раздвижным окном. Обучение использовало оптимизатор Адама и среднеквадратичную потерю ошибок (Дополнительная таблица 2). Производительность модели оценивалась с помощью RMSE иR 2 в обучающих, валидационных, тестовых и кросс-валидационных разделах. Архитектура модели, инженерия особенностей, конфигурация обучения, конфигурация данных, трансферное обучение, метрики оценки, прогнозы будущего и детали реализации приведены в таблице 1. Рисунок 6 представляет собой обучающую диагностику модели прогнозирования CORTA-Net PM₂.₅. На панелях рисунок 6A показывает кривые потерь для обучения и валидации, демонстрирующие прогрессирующее снижение ошибок с оптимальной остановкой на эпохе 106. Эволюция пробела обобщения при оценке анализа перенагружения иллюстрируется расхождением между валидацией и обучающими данными на рисунке 6B. В частности, он показывает периоды, когда расхождение превышает заранее определённые пределы; эта информация свидетельствует о том, что модели поведения на скорости обучения и снижения потерь иллюстрируют преимущества снижения запланированной скорости обучения (LR) в критические эпохи как средства повышения стабильности сходимости, как показано на рисунке 6C. В совокупности эти цифры дают краткое представление о динамике обучения, возможности обобщения и рекомендуемой конфигурации обучения модели.

figure-protocol-7
Рисунок 6: Диагностика обучения для модели прогнозирования CORTA-Net PM₂.₅. (A) Кривая потерь при обучении и валидации, показывающие прогрессивное снижение ошибок во время обучения модели, с ранней остановкой на эпохе 106 на основе эффективности валидации. (B) Пробел в обобщении между обучением и потерей валидации в разных эпохах, иллюстрирующий эволюцию обобщения моделей и периоды увеличения расхождения, указывающие на потенциальную переподгонку. (C) Расписание скорости обучения, показывающее влияние запланированного снижения скорости обучения на оптимизацию на протяжении всего обучения. (D) Краткое описание поведения при сходимости модели, демонстрация стабильной оптимизации и окончательной обучающей конфигурации, выбранной для модели CORTA-Net. Вместе эти диагностические данные иллюстрируют динамику модели, характеристики сходимости и производительность обобщения во время обучения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Результаты выбора объектов и прогнозирования
Процедура CorrXGBoost-Rank выбрала отставшие PM₂.₅, скорость ветра, влажность, температуру, временные индикаторы и количество пожаров, полученных из MODIS, в качестве значимых предикторов качества воздуха. Каждая из этих переменных учитывает устойчивость загрязнения, рассеивание из-за метеорологических условий, сезонные различия в уровне загрязнения и региональное влияние пожаров. Избыточные переменные были удалены до моделирования последовательностей, чтобы уменьшить ненужную входную размерность. CORTA-Net оценивался с использованием средней абсолютной ошибки, ошибки корня среднего квадрата и коэффициента определения. В ежедневном наборе данных Дели модель достигла RMSE = 3,19 и R2 = 0,983. В разделе Daily Delhi Climate Training модель достигла RMSE = 4,98 иR 2 = 0,845. В анализе рассеяния целевых тестовых наборов наблюдаемые и предсказанные значения PM₂.₅ показали Pearson r = 0.942 иR 2 = 0.873. Эти значения относятся к разным разбиениям оценки и не должны рассматриваться как взаимозаменяемые результаты на уровне всей модели.

Рисунок 7 теперь служит единым консолидированным визуальным представлением эффективности тестирования CORTA-Net на тестовых данных. Раздел временных рядов показывает, что существует отличная корреляция между фактическим и прогнозируемым уровнем PM2.5 на тестовом наборе данных на протяжении всего периода оценки, включая эпизодические события с высоким уровнем загрязнения, такие как Дивали, и события сжигания остатков сельскохозяйственных культур. В подтверждение этого график рассеяния показывает сильную линейную корреляцию между фактическими и прогнозируемыми значениями (r Пирсона = 0,942, R2 = 0,873), что указывает на чрезвычайно высокий уровень точности предсказания.

Прогнозирование эффективности
Остаточные графики показывают, что ошибки обычно распределены примерно около нуля, при экстремальных всплесках загрязнения встречаются лишь несколько отдельных ошибок. Это убедительно подтверждает статистическую устойчивость и отсутствие смещения в моделях CORTA-Net. CORTA-Net продемонстрировала RMSE 3,19 и R2 0,983 в ежедневном наборе данных Дели, а также RMSE 4,98 и R2 0,844 в наборе данных Daily Delhi Climate Train. Эти измерения, в сочетании с приведёнными выше данными, подтвердили, что CORTA-Net точно моделирует как постепенные тенденции, так и резкие отклонения уровней PM2.5 .

Точность прогнозов концентраций PM2.5 оценивалась с помощью трёх методов: временной оценки валидированной по времени точности прогнозов концентрации PM2.5 , корреляции прогнозируемой и фактической концентрации PM2.5 на основе времени, а также оценки ошибок на основе статистического анализа. Временная оценка, сравнивающая прогнозируемые значения PM2.5 и временного PM2.5 (рисунок 7A), показала связь с течением времени между фактически измеренными концентрациямиPM 2.5 и прогнозируемыми по модели концентрациямиPM 2.5 и демонстрирует значительные случаи PM2.5 (например, фестиваль Дивали и период сжигания щетины), произошедших в этот период. Корреляция между прогнозируемыми моделью концентрациями PM2.5 и измеренными концентрациями PM2.5 свидетельствует о очень высокой корреляции (Pearson r = 0.942 и R2 = 0.873), с очень сильным соответствием между прогнозируемыми концентрациямиPM 2.5 и фактически измеренными концентрациями, что указывает на то, что модель PP-FRC является точным и надёжным предиктором концентраций PM2.5 (рисунок 7B). Распределение остатков по куртозу (рисунок 7C) показало небольшие ошибки со временем при изолированных днях с высокой ошибкой, в то время как остаточное распределение было примерно нормальным (рисунок 7D), а средние и медианные остаточные ошибки были очень близки к нулю, что свидетельствует о непредвзятости и статистически хорошем прохождении ошибок модели.

figure-results-1
Рисунок 7: Прогнозная эффективность модели CORTA-Net на независимом тестовом наборе данных. Концентрации PM₂.₅ сообщаются в мкг/м 3. (A) Временное сравнение наблюдаемых и прогнозируемых концентраций PM₂.₅, демонстрирующе близкое согласование между измеренными и прогнозируемыми моделью значениями, включая периоды крупных загрязнений. (B) Диаграмма рассеяния прогнозируемой и наблюдаемой концентрации PM₂.₅, демонстрирующая высокую предсказательную эффективность (Pearson r = 0,942; R2 = 0,873). (C) Временное распределение остатков (ошибка прогноза) в течение тестового периода, указывающее на обычно небольшие ошибки с ограниченным числом событий с высокой ошибкой. (D) Распределение остатков, показывающее примерно нормальное распределение, центрированное близко к нулю, со средними и медианными остатками, близкими к нулю, что указывает на неприкоснутые и хорошо организованные ошибки прогнозирования. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Рисунок 7 показывает предсказательную эффективность CORTA-Net на целевом тестовом наборе. График временных рядов показал совпадение между наблюдаемыми и прогнозируемыми значениями PM₂.₅, включая периоды повышенной концентрации частиц. Диаграмма рассеяния показала связь между предсказанными и наблюдаемыми значениями PM2.5 . Остаточные графики показали, что большинство ошибок прогноза сосредоточены близко к нулю, с более выраженными отклонениями во время эпизодов с высоким уровнем загрязнения.

Перекрёстная валидация
Десятикратная перекрёстная валидация показала ограниченную дисперсию между складками, демонстрируя устойчивость при нестационарных атмосферных условиях. Модель продемонстрировала сильные предсказательные способности. Прогнозируемые значения PM₂.₅ близко совпадают с наблюдаемыми значениями. Остатки показали минимальное смещение и приблизительную нормальность. Рисунок 8 показал обзор эффективности модели во многих условиях и со временем с использованием мер RMSE, MAE (средняя абсолютная ошибка) и R2 (коэффициент решительности) в 10-ступенчатой перекрёстной валидации. В панелях на рисунках 8A и 8B RMSE и MAE демонстрировали низкую вариабельность во всех пробелах в обучении и валидации перекрёстной верификации, что свидетельствует о стабильной точности прогнозирования. Рисунок панели 8C показывает стабильно высокие значения R2 (~0,92 для обучения и ~0,89 для валидации) на всех перекрёстных валидациях, что указывает на высокую объяснительную способность модели и очень низкую внутримодельную дисперсию между различными перекрёстными валидациями. Рисунок 8D показал, что среднее значение по всем этим показателям демонстрирует небольшой разрыв в обобщениях, что говорит о стабильной эффективности модели независимо от распределения данных.

figure-results-2
Рисунок 8: Сгибательная производительность модели CORTA-Net с использованием 10-кратной перекрёстной валидации. Производительность оценивалась с использованием ошибки среднего квадрата (RMSE), средней абсолютной ошибки (MAE) и коэффициента определения (R2). Индикаторы ошибки представляют стандартное отклонение по складкам, где это применимо. (A) Поварочные значения RMSE для наборов данных обучения и валидации, демонстрирующие стабильно низкую ошибку прогноза для всех сгибов. (B) Значения MAE по складкам для наборов данных обучения и валидации, указывающие на стабильную предсказательную производительность с минимальными вариациями между сгибами. (C) Сгибаемые значения R2 для наборов данных обучения и валидации, демонстрирующие стабильно высокую объяснительную силу для всех сгибов перекрёстной валидации. (D) Средние показатели производительности и разрыв в обобщении между наборами данных для обучения и валидации, демонстрируя согласованную производительность модели и хорошую обобщённость независимо от разделения данных. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Интерпретируемость на основе внимания
Для изучения того, какие недавние временные шаги и входные переменные наиболее сильно повлияли на прогноз PM2.5 , использовалось многоуровневое внимание. Некоторые центры внимания уделяли внимание краткосрочной памяти загрязняющих веществ из-за задержки PM2.5 , в то время как другие придавали большее значение метеорологическим переменным, связанным с дисперсией, таким как скорость ветра и влажность. Переменные количества пожаров также уделяли более тщательное внимание во время эпизодов загрязнения, что соответствует региональному влиянию на сжигание биомассы. Эти карты внимания следует интерпретировать как индикаторы поведения модели, а не как причинные объяснения. Результаты показали, что модель использует как недавнюю историю загрязняющих веществ, так и экологические ковариаты при составлении прогнозов.

Конфигурация моделиВыбор функцийТрансферное обучениеМногоголовое вниманиеВход по счёту огняRMSE ↓MAE ↓R² ↑
Базовая линия LSTMНетНетНетНет7.565.520.905
+ CorrXGBoost-RankДаНетНетНет4.243.100.970
+ Переводное обучениеДаДаНетНет3.892.840.975
+ Внимание с несколькими головамиДаДаДаНет3.482.540.980
Полный CORTA-NetДаДаДаДа3.192.330.983

Таблица 3: Компонентно-компонентный абляционный анализ CORTA-Net. Таблица 3 оценивает каждый архитектурный элемент системы путём удаления или изменения одного или нескольких компонентов и измерения изменений в производительности. Это показывает, какие архитектурные компоненты наиболее эффективны, подтверждает архитектурные решения и показывает, как различные компоненты взаимодействуют для повышения точности, надёжности, эффективности и общей результативности сети.

В таблице 3 представлен компонентно-покомпонентный абляционный анализ CORTA-Net. Базовая линия LSTM получила RMSE = 7,56, MAE = 5,52, а R2 = 0,905. Добавление выбора признаков CorrXGBoost-Rank снизило RMSE до 4,24, что указывает на то, что удаление избыточных и слабо релевантных предикторов улучшило эффективность прогнозирования. Трансферное обучение дополнительно снизило RMSE до 3,89, что указывает на то, что предварительно обученные временные представления улучшают стабильность модели. Благодаря использованию многоголового внимания RMSE был снижен с 3,48 до 3,19, тем самым улучшив значение R2 с 0,980 до 0,983, что свидетельствует о значительном улучшении временных прогнозов за счёт использования весов на уровне признаков и временных шагов в сочетании с другими компонентами модели CORTA-Net (например, CorrXGBoost-Rank, Transfer Learning, Multi-Head Attention и входными данными MODIS Fire Count). В целом улучшения продемонстрировали вклад выбора признаков, обучения временному переносу, взвешивания последовательностей на основе внимания и активности огня в реализацию и производительность модели CORTA-Net.

Выбор полнометражных материаловМоделирование временной последовательностиТрансферное обучениеАнализ поведения модели на основе вниманияДанные о огневой активностиОсновная роль в сравнении
Нет явного CorrXGBoost-RankНетНетНетНетКлассический базовый уровень нелинейного машинного обучения
Значение только на основе внутреннего дереваНетНетНетНетБазовая линия градиентного усиления для табличных предикторов
НетДаНетНетНетПовторяющаяся временная базовая линия
НетДаНетДаНетБазовая линия, основанная на внимании,
ДаДаДаДаДаПредлагаемая гибридная рамка прогнозирования

Таблица 4: Ключевые различия между моделями прогнозирования CORTA-Net и базовой линией. Таблица 4 показывает, что текущей моделью для прогнозирования является CORTA-Net, которая позволила применять более продвинутые методы извлечения временных признаков, а также использовать возможность адаптивного наблюдения на основе важных задач для захвата сложных временных закономерностей из наборов данных временных рядов. CORTA-Net динамически научилась связывать множество различных масштабов времени для достижения большей общей точности, устойчивости и способности создавать обобщения по сравнению с традиционными методами базового прогнозирования.

Различия между методологиями CORTA-Net и моделями сравнения приведены в таблице 4. Random Forest и XGBoost могут использоваться для предоставления нелинейного базового метода машинного обучения, но отсутствуют прямое моделирование последовательных зависимостей. LSTM использовались как метод повторяющейся временной базовой линии, тогда как Attention-LSTM обеспечивали взвешивание на основе внимания без явного скрининга, с использованием трансферного обучения или интеграции огневой активности. В отличие от этого, CORTA-Net объединяет четыре аспекта предыдущих базовых показателей в один конвейер прогнозирования: (1) выбор признаков CorrXGBoost-Rank; (2) кодировки LSTM с трансферным обучением; (3) внимание с несколькими головами; (4) и подсчёт огня, полученных от MODIS, как входные данные.

Сравнение исходной линии
Помимо количественных базовых сравнений (предоставленных отдельно с разницей средних складок, стандартными ошибками и 95% доверительными интервалами), авторы также оценивали внутреннюю работу CORTA-Net через механизм внимания. Веса внимания, присваиваемые каждому входному признаку (по временным шагам и нескольким головкам внимания), показаны на рисунке 9. На рисунке 9A группа показывает репрезентативное распределение весов внимания, присвоенных одному из экземпляров тестового набора данных. Как видно на этом рисунке, хотя некоторые входные признаки (например, PM2.5 при t-1, t-2 и t-3) будут иметь меньший относительный вес, чем другие предикторы, они всё равно получат наибольшее внимание/веса, что демонстрирует, что CORTA-Net уделяет больше внимания краткосрочной временной зависимости, чем зависимости от долгосрочной памяти. На рисунке 9B исследователи предоставляют агрегированные оценки относительной важности всех входных признаков по всем тестовым выборкам при прогнозировании PM2.5 для Дели; Задержка PM2.5, скорость ветра, температура и количество пожаров определяются как наиболее важные показатели прогнозирования. На рисунке 9C авторы демонстрируют многоголовые паттерны внимания CORTA-Net, где каждая голова фиксирует разные, но комплементарные временные и/или признаковые отношения между входными признаками, что позволяет ей изучить более богатое представление входных признаков. На рисунке 9D авторы иллюстрируют постепенное движение внимания во времени относительно PM10, демонстрируя, как внимание меняется со временем в зависимости от уровней PM10. Хотя веса внимания можно интерпретировать как индикаторы общих закономерностей обработки последовательно предоставленных данных окружающей среды CORTA-Net, а также приоритизации каждого последовательно предоставленного объекта, веса внимания не дают прямых доказательств причинно-следственных связей. Однако они не предоставили представления о том, как процессы CORTA-Net последовательно предоставляют экологические данные, что улучшает интерпретируемость их прогнозов (Дополнительная таблица 3).

figure-results-3
Рисунок 9: Визуализации поведения модели CORTA-Net на основе внимания. Веса внимания показаны для иллюстрации того, как модель распределяет фокус между входными признаками и временными шагами во время прогнозирования, и их следует интерпретировать как индикаторы поведения модели, а не как доказательства причинно-следственных связей. (A) Карта внимания с одним экземпляром, показывающая веса внимания, присвоенные входным признакам, и недавние исторические наблюдения для отдельного прогноза. (B) Агрегированная важность признаков на основе весов внимания по всему тестовому набору данных, подчёркивающая относительный вклад каждой входной переменной в прогнозирование PM₂.₅. (C) Многоголовые паттерны внимания, демонстрирующие то, как разные головы внимания захватывают взаимодополняющие представления на уровне признаков и времени. (D) Распределение временного внимания, показывающее относительную важность исторических временных шагов во время прогнозирования. В целом, наивысшие значения получили отставающие PM₂.₅, FIRECOUNT, скорость ветра (WDS), влажность и температура, что указывает на их важность в процессе прогнозирования модели. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Дополнительный рисунок 6A–B сравнивает CORTA-Net с базовыми моделями, использующими MAE, RMSE и R2. Более низкие значения MAE и RMSE указывали на меньшую ошибку прогноза, а более высокийR2 — на более объяснённую дисперсию. CORTA-Net показал меньшую ошибку прогноза, чем оцениваемые базовые модели при том же экспериментальном разбиении. Однако сравнение следует интерпретировать в рамках выбранного набора данных для мониторинговой станции Дели и того же конвейера предварительной обработки. Дополнительный рисунок 7 суммирует относительное ранжирование моделей CORTA-Net и базовой линии по представленным метрикам. Дополнительный рисунок 8 выделяет основные компоненты, способствующие производительности моделей, включая выбор признаков, трансферное обучение, моделирование временной последовательности и многоголовое внимание.

Оценка, сравнивающая производительность CORTA-Net с некоторыми базовыми моделями, проведена на дополнительной рисунке 7A–C с использованием радарной диаграммы, которая показывает единственную модель, измеряющую выше (или ниже) своих аналогов во всех измеренных областях (инвертированный RMSE, инвертированный MAE иR2 ). CORTA-Net заняла лучшее общее место в дополнительном рисунке 7B, а также заняла первое место по ряду других измеряемых показателей. Дополнительный рисунок 7C демонстрирует улучшения эффективности между CORTA-Net и множественными базовыми линиями, измеряемые CORTA-Net, демонстрируя значительный прогресс по сравнению с исходными показателями данного исследования. Наиболее значительное улучшение наблюдается при RMSE (22,8%), за ним следуют значения MAE (24,1%) и R2 (увеличение на 39,3–72,2% для объяснения дисперсии в каждом исходе). Краткий обзор CORTA-Net даёт обзор её сильных сторон. К ним относятся способность применять многоголовое внимание для оценки важности, временное слияние данных сенсоров для прогнозирования будущих загрязнителей, устойчивость к изменениям в событиях загрязнения (например, сильным штормам) и стабильная эффективность по всем показателям успеха в межфункциональной среде. CORTA-Net превосходит все другие современные модели глубокого обучения по своей предсказательности.

ДОСТУПНОСТЬ ДАННЫХ:
Данные о качестве воздуха в данном исследовании получены из общедоступного мониторинга Центрального совета по контролю загрязнения и Комитета по контролю загрязнения Дели, где они доступны. Метеорологические данные были получены из записей Индийского метеорологического департамента или соответствующих источников публичных метеорологических данных. Данные спутникового подсчёта пожаров были получены из продукта активного огня MODIS. Для отчёта обработанные наборы данных, выбранные списки признаков, параметры нормализации и код, необходимые для воспроизведения опубликованных экспериментов, доступны по ссылке на рукописный репозиторий: https://github.com/saravagnamahasiva/CORTA-Net .Рукопись подчёркивает воспроизводимость, предоставляя чёткое определение источника данных, этапов предварительной обработки, порогов выбора признаков, компонентов модели, раздела оценки и отчётных метрик. Модель оценивается с помощью хронологического обучения, тестирования и валидационных разделов. Параметры предварительной обработки были получены из обучающих данных и затем применялись как к тестовым, так и к валидационным данным. Результаты приводятся в виде выводов, специфичных для соответствующих разделов, и более общие утверждения избегаются.

Дополнительный рисунок 1: Карта учебной зоны Дели .Карта зоны исследования Дели, показывающая расположение четырёх станций мониторинга качества воздуха (сектор Дварка 8, Ананд Вихар, Мундка-DPCC и Соня Вихар), включенных в это исследование для сбора данных PM₂.₅ и разработки моделей. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный рисунок 2: Годовая тенденция FIRECOUNT (2012–2024). Пожарные инциденты способствуют загрязнению воздуха, что иллюстрируется тенденциями FIRECOUNT с 2012 по 2024 год. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный рисунок 3: График функции автокорреляции (ACF) для часового PM₂.₅. Автокорреляция прогнозируемого PM2.5 при 30 задержках демонстрирует сильную положительную автокорреляцию почти на всех задержках, подтверждая, что PM2.5 в Дели демонстрирует сильную временную зависимость и многодневную устойчивость. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный рисунок 4: Внутренняя структура блока LSTM. Сеть LSTM (Long Short-Term Memory) решает проблему долгосрочной зависимости стандартных рекуррентных нейронных сетей (RNN), регулируя поток информации через выделенное состояние ячейки, выступающее в роли конвейера памяти. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный рисунок 5: Блок-схема многоголового внимания. Многоголовое внимание расширяет самовнимание, разделяя вход на несколько голов, позволяя модели фиксировать разнообразные отношения и паттерны. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный рисунок 6: Общее сравнение эффективности моделей прогнозирования CORTA-Net и базового уровня. Производительность модели оценивалась с использованием средней абсолютной ошибки (MAE), ошибки среднего квадрата (RMSE) и коэффициента определения (R2). Более низкие значения MAE и RMSE указывают на меньшую ошибку прогноза, тогда как более высокие значения R2 — лучше объяснённую дисперсию. (A) Сравнительная производительность CORTA-Net и оцененных базовых моделей на основе метрик MAE, RMSE и R2 . (B) Общее сравнение, подчеркивающее относительную предсказательную эффективность оцененных моделей в рамках одного и того же раздела экспериментальных данных. CORTA-Net показала меньшие ошибки прогноза и более высокую объяснительную эффективность по сравнению с оценёнными базовыми моделями. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный рисунок 7: Сравнительный анализ эффективности моделей CORTA-Net и базовой линии с использованием нескольких метрик оценки. (A) Радарная диаграмма, сравнивающая нормализованную производительность модели на основе инвертированного RMSE, инвертированного MAE и R2, демонстрирующего общее превосходство CORTA-Net по оценённым метрикам. (B) Относительный рейтинг производительности CORTA-Net по сравнению с базовыми моделями, подчёркивающий стабильно лидирующие показатели. (C) Процентное улучшение CORTA-Net по сравнению с оценёнными базовыми моделями для MAE, RMSE и R2, что показало значительный рост точности прогнозирования и объяснимой дисперсии. (D) Краткое изложение ключевых характеристик CORTA-Net, с акцентом на механизм многоголового внимания, временное слияние признаков, устойчивость к событиям загрязнения и стабильно превосходящая прогнозная эффективность по всем показателям оценки. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный рисунок 8: Сравнение потерь в обучении и валидации между эпохами. Это демонстрирует прогрессивную сходимость модели и стабильную обобщение с минимальным перенагоном. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 1: Архитектура предлагаемой модели CORTA-Net. Обзор архитектуры CORTA-Net, включая каждый сетевой компонент, спецификации слоев, функции активации и соответствующее количество обучаемых параметров, используемых для прогнозирования PM₂.₅. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 2: Настройки гиперпараметров и обучающая конфигурация предлагаемой модели CORTA-Net. Краткое описание архитектурного проектирования, настроек гиперпараметров, конфигурации обучения, стратегии инженерии признаков, предварительной обработки данных, установки трансферного обучения и параметров оценки, используемых для разработки и оптимизации предлагаемой модели. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 3: Сравнение производительности предлагаемой модели с базовыми методами прогнозирования. Сравнение традиционных моделей машинного обучения и глубокого обучения с предлагаемой структурой с точки зрения выбора признаков, механизма внимания, трансферного обучения и предсказательной производительности, измеренных с использованием RMSE, MAE иR 2Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 4: Сравнение предыдущих исследований прогнозирования PM₂.₅ и предлагаемого подхода. Краткое изложение репрезентативных исследований прогнозирования PM₂.₅, выделение их методологий, наборов данных, ключевых входных характеристик, включения активности пожаров, прогнозной эффективности, интерпретируемости, сообщаемых ограничений и того, как предлагаемая структура CORTA-Net учитывает эти ограничения. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

CORTA-Net объединяет три ключевых компонента в последовательности для формирования гибридной архитектуры. CorrXGBoost-Rank: Индивидуальный компонент выбора признаков, который устраняет избыточные предикторы до этапа38-го временного моделирования. LSTM Encoder: Использует слои LSTM в стеке для фиксации краткосрочных и долгосрочных временных зависимостей в выбранной 24-часовой последовательностивхода 39. Многоголовый уровень внимания: применяется к выходу LSTM (с соответствующими весами внимания) в рамках последнего шага гибридной модели последовательностей CORTA-Net; улучшает интерпретируемость конечного результата, не заменяя при этом основную основную магистральLSTM 40. Кодировщик LSTM изучает временные зависимости из выбранной последовательности скользящего окна. CORTA-Net разработан для гибридного моделирования последовательностей, при котором CorrXGBoost-Rank обрезает избыточные предикторы. Многоголовый слой внимания обеспечивал взвешенную агрегацию всех результатов LSTM и давал как прогнозы PM2.5 , так и соответствующие веса внимания. Три компонента CORTA-Net существенно отличаются от чисто трансформаторной архитектуры: CORTA-Net использует LSTM (рекуррентные) сети для моделирования последовательного обучения, рекуррентные сети служат основой для последовательного обучения, а внимание выступает в роли объяснительного механизма.

Фреймворк CORTA-Net имеет четыре основных ограничения. Во-первых, оценка модели основывалась на различных мониторинговых станциях по всему Дели, поэтому производительность может не распространяться на города с разными источниками выбросов, климатическими условиями или плотностью/конфигурацией и т.д. Во-вторых, хотя подсчёты пожаров по спутниковым данным дают прокси для переменных пожара, они могут не давать полного представления о интенсивности огня, транспорте плюма или химических превращениях. В-третьих, однонаправленные датчики, отсутствующие данные и изменения на отдельных станциях мониторинга или предрасполагающих сетях мониторинга могут влиять на качество и надёжность данных временных рядов. В-четвёртых, хотя внимание информативно, оно не подразумевает причинно-следственной связи. Дальнейшая оценка потребует использования CORTA-Net в других независимых городах и дополнительных сетей мониторинга. В стремлении повысить точность оценок региональной транспортировки загрязнения воздуха с помощью новых технологий исследователи разработали концепцию, ориентированную на транспорт. Фреймворк интегрирует дополнительные данные, такие как извлечение признаков из наборов данных метеорологического и дистанционного зондирования, контроль качества данных, получение данных почти в реальном времени, оценка неопределённости и частая перекалибровка модели41. Исследовательская группа разработала комплексный набор вычислительных инструментов для решения этих проблем, включая адаптивные оптимизаторы для обучения моделей и настройки параметров, трансферное обучение для использования существующих данных с целью улучшения предсказательных возможностей, методы последовательного временного моделирования, моделирование на основе внимания и интерпретируемость моделей. Кроме того, интеграция объяснимого ИИ в фреймворк CORTA-Net позволяет напрямую связывать прогнозы с научными знаниями о основных факторах, способствующих загрязнению воздуха. Например, объяснимый ИИ позволяет выявлять активность пожаров в постмуссонный период как значительный фактор загрязнения воздуха. Перекрёстная валидация эффективности модели (Delhi RMSE = 3,19,R 2 = 0,983) подтверждает эффективность CORTA-Net, тогда как визуализации результатов модели на основе внимания показывают, что можно наблюдать закономерности, представляющие интерес принимающим решения, и специалистов общественного здравоохранения. Наконец, использование данных о пожарах и неконтролируемых данных о выбросах в рамках CORTA-Net существенно снизит обобщимость результатов на другие регионы, поскольку использование быстро или плохо контролируемых источников может серьёзно нарушить реализацию фреймворкаCORTA-Net 42.

Графическое представление, представленное на рисунке 10 , позволяет лицам, принимающим решения, и исследователям визуализировать взаимосвязи между моделями/системами, разработанными с использованием различных методологий прогнозирования PM₂.₅, где цветовые полосы обозначают RMSE (короткие полосы = большая точность) иR 2 (учитывается более длинные полосы = большая вариативность), при этом модели организованы по подходу (агрегация городов, специфическая станция, многомерные ряды). Графические представления глубины показывают, что ни одна модель предсказуемо не превосходит результаты во всех категориях; CORTA-Net стабильно превосходил аналогичные модели на городских, высокошумных, станционных наборах данных, демонстрирующих значительную локальную вариабельность, тогда как MxConnect обычно показывал превосходные региональные средние результаты на более крупных пространственных наборах данных, что иллюстрирует важность выбора моделей на основе масштаба анализируемых данных (то есть размера наборов данных), пространственного разрешения наборов данных (т.е. уровня перегруженности), уровня шума в наборах данных (то есть точность) или локальную дисперсию. По сути, уникальность CORTA-Net заключается в использовании адаптивного взвешивания признаков, встроенного в механизм повторяющегося последовательного внимания, для динамического уменьшения избыточных входов или входов с высоким случайным шумом во время временной обработки. Это достигается путём внедрения адаптивного веса признаков в пользовательский дизайн гейтинга, основанный на внимание, в отличие от большинства современных подходов, которые сильно опирались на статические эвристические подходы (то есть пороги корреляции или PCA) до применения модели в качестве этапа предварительной обработки (рисунок 10A). Этот адаптивный, контекстно-зависимый подход к приоритизации, используемый в CORTA-Net, позволяет корректировать в реальном времени локальную динамику в городских тканях, где более простые и менее сложные модели, разработанные на основе глобально обученных наборов данных, могут дать лучшие результаты прогнозирования средних показателей по стране. Сравнительные графические дисплеи, представленные на рисунке 10B , в совокупности выявляют связь между бенчмаркингом моделей, предоставляя исследователям и принимающим решения направление при выборе моделей для их конкретного применения (то есть могут выявлять дополнительные направления исследований, связанных с краткосрочным прогнозированием PM₂.₅).

figure-discussion-1
Рисунок 10: Сравнение предсказательной эффективности моделей прогнозирования CORTA-Net и базовых моделей. Производительность модели оценивалась с использованием средней абсолютной ошибки (MAE), ошибки среднего квадрата (RMSE) и коэффициента определения (R2). Более низкие значения MAE и RMSE указывают на лучшую предсказательную точность, тогда как более высокие значения R2 указывают на более объяснённую дисперсию. (A) Сравнительная эффективность всех оценённых моделей на основе MAE, RMSE и R2, обеспечивающая общую оценку точности предсказания и соответствия модели. (B) Сравнение производительности лучших моделей, выделяющее относительные сильные и слабые стороны подходов CORTA-Net и эталонных подходов. В целом, сравнение демонстрирует конкурентоспособную эффективность CORTA-Net и облегчает интуитивную оценку различных архитектур моделей для прогнозирования PM₂.₅. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Сравнение показывает, что CORTA-Net представляет собой гибридный рабочий процесс прогнозирования PM₂.₅, а не автономную архитектуру трансформатора (Дополнительная таблица 4). Новые архитектуры трансформаторов продемонстрировали значительную способность изучать долгосрочные временные зависимости, однако гибридные архитектуры CNN-RNN и трансформатор-LSTM повышают эффективность прогнозирования, используя сильные стороны каждой нейронной архитектуры (как показано в таблице 5). В отличие от CORTA-Net, многие существующие гибридные модели CNN-RNN и трансформатор-LSTM используют модель последовательностей, чтобы учиться на полном входном наборе признаков, а не выполнять явный скрининг признаков перед временным моделированием, тогда как CORTA-Net использует внешние данные MODIS о количестве пожаров для моделирования влияния биомассы. Использование CORTA-Net весов внимания для оценки того, как каждый предиктор влияет на вклад накопленного предиктора по отношению к времени (то есть агрегированному по времени) и его трёх различных этапах вносят вклад в общую ошибку, связанную с CORTA-Net, при этом комбинация всех трёх имеет наименьшую ошибку, измеренную по данным мониторинговой станции Делипод оценкой 43. В итоге, практический вклад CORTA-Net заключается в воспроизводимой интеграции четырёх релевантных областей краткосрочного прогнозирования PM₂.₅: выбор признаков, обучение временному переносу, обогащение внешней огненной активности и интерпретируемость на основе внимания. Группировать результаты по моделям и источникам данных (глобальный реанализ ERA5 для много-переменных городов) (рисунок 10), при этом исследователи могут легко сравнить, как производительность каждой модели соотносится с каждым из восьми ключевых переменных, связанных с общей эффективностью прогнозирования концентраций PM₂.₅.

Основные компоненты моделиЛучшие численные результатыКлючевое отличие от CORTA-Net
ARIMA для линейных компонент, CNN-LSTM для нелинейных компонентов, оптимизатор навозного жука для настройки гиперпараметровRMSE = 7,594, 14,940, 7,841 и 5,496; MAE = 5,285, 10,839, 5,120 и 3,770; R² = 0,989, 0,962, 0,953 и 0,953 по четырём городамСильная гибридная модель AQI, но она сосредоточена на оптимизации AQI и моделей; он не включает явный скрининг CorrXGBoost-Rank или интеграцию MODIS с подсчётом огня
Трансформаторный энкодер, декодер BiLSTM, интерпретация на основе SHAPПекин: RMSE = 3.0012, MAE = 1.7928, R² = 0.9694; Тяньцзинь: RMSE = 4.4785, MAE = 3.1614, R² = 0.9621; Шицзячжуан: RMSE = 5.1646, MAE = 3.4057, R² = 0.9324Фиксирует долгосрочные и краткосрочные зависимости AQI, но в основном использует данные концентрации загрязняющих веществ и не использует переменные MODIS по количеству пожаров или предварительное снижение CorrXGBoost-Rank
LSTM, оптимизация самоконцентрации трансформатора, оптимизация роя частицЛучшая сезонная среда: R² = 0.98745 и 0.95655 для двух городов; зарегистрированные значения с низкой ошибкой включают MAE = 0,83363 и RMSE = 1,0176 в лучшем режимеСильная оптимизированная модель Transformer-LSTM, но её основная новшество — оптимизация на основе PSO, а не удаление избыточности функций и обогащение огневой активности
CNN-LSTM с компонентами сети Колмогорова-Арнольда и географической осведомлённостьюШанхай: RMSE = 1,9222 и R² = 0,9832; Пекин: RMSE = 2,5213, с RMSE на 59,6% ниже, чем базовый LSTMСильная географически осведомлённая модель AQI, но она не рассматривает конкретно прогнозирование Delhi PM₂.₅ и не включает данные MODIS по количеству пожаров для эпизодов сжигания биомассы
Классические регрессоры машинного обучения с оптимизацией поиска по сеткеGBR: RMSE = 2.31; RF: MAE = 0,47 и RMSE = 2,95; XGBR: R² = 0.9781Полезный ориентир машинного обучения, но модели явно не отражают последовательную временную зависимость через LSTM или внимание
LSTM оптимизирован с помощью алгоритма поиска Sparrow; по сравнению с CNN-LSTM, CNN-BiLSTM и PSO-LSTMSSA-LSTM: RMSE = 8.601, MAE = 6.317, R² = 0.946; PSO-LSTM: RMSE = 8,860, R² = 0,944; базовый LSTM: RMSE = 12.481, R² = 0.884Показывает ценность оптимизированного LSTM, но не использует многоголовое внимание, адаптацию переноса-обучения или переменные активности спутникового огня
Модель трансформатора с кластерной недовыборкой для дисбалансированных событий с высоким уровнем загрязненияЛучшая конфигурация: RMSE = 2.080, MAE = 1.386, R² = 0.914Сильный вариант для прогнозирования PM₂.₅ при высоком количестве событий, но акцент делается на обработке дисбаланса, а не на интегрированном выборе признаков, трансферном обучении, обогащении количества огней и интерпретации на основе внимания
Только временной кодировщик LSTMRMSE = 7.56, MAE = 5.52, R² = 0.905Используется как внутренняя временная база в той же экспериментальной системе в Дели
LSTM с выбором признаков на основе корреляций и XGBoostRMSE = 4.24Демонстрирует, что удаление избыточных и слабых предикторов улучшает прогнозирование до изучения последовательностей
Выбор признаков, трансферное обучение LSTM и внимание с несколькими головамиRMSE = 3.48, R² = 0.980Показывает дополнительную ценность временного и признакового веса на основе внимания

Таблица 5: Методологическое сравнение CORTA-Net с недавними и существующими моделями прогнозирования PM₂.₅/AQI. Предлагаемая структура принципиально отличается от современных методов прогнозирования на основе трансформаторов или гибридных методов прогнозирования PM₂.₅. Более сильное сравнение с современным современным оборудованием.

Ключевой вклад этого исследования — гибридный подход к глубокому обучению под названием CORTA-Net, который предоставляет интегрированный метод прогнозирования краткосрочных концентраций PM2.5 в Нью-Дели, Индия, где сложная застроенная среда. Вместо того чтобы полагаться на раздвоенные модели, состоящие из трёх отдельных компонентов (модуль выбора признаков на основе CorrXGBoost-Rank для минимизации избыточности; LSTM, усиленный трансферным обучением для кодирования нестационарности временных зависимостей; и многоголовный механизм внимания для достижения интерпретируемых, долгосрочных и краткосрочных прогнозов), CORTA-Net использует конвейерный подход для синергической интеграции этих компонентов. Эта структура включает ввод метеорологических переменных, подсчёт пожаров MODIS и данные о качестве атмосферного воздуха, чтобы создать более полное представление о факторах, способствующих загрязнению PM2.5 . CORTA-Net показал значительно лучшие результаты установленных базовых показателей (Random Forest, XGBoost, LSTM и LSTM, основанный на внимание), используя строгие метрики оценки, включающие высокие значенияR2 (0,983) и низкие значения RMSE (3,19). Эти исследования показали, что все элементы CORTA-Net существенно способствовали производительности модели. Многоголовный механизм внимания CORTA-Net добавил дополнительной ценности этому исследованию, поскольку оно показало, что основными предикторами являются недавние измерения PM2.5 , подсчёты пожаров и метеорологические измерения, что хорошо соответствует известным атмосферным процессам и обеспечивает значимую степень интерпретируемости этой модели.

Несмотря на обнадёживающие результаты, авторы признают наличие некоторых ограничений, включая географическое ограничение (только Нью-Дели) и исключительную зависимость от подсчётов пожаров MODIS в качестве тепловых прокси для данных RS. Будущие исследования будут сосредоточены на валидации эффективности CORTA-Net в различных городских районах, а также на включении характеристик транспортной осведомлённости, таких как высота пограничного слоя и траектории ветра, в процесс моделирования для повышения обобщаемости. Тем не менее, авторы считают, что CORTA-Net — это очень жизнеспособная, воспроизводимая и интерпретируемая структура для поддержки систем формирования политики на основе данных и раннего предупреждения. Способность CORTA-Net достигать высоких результатов в богатой на данные, но сложной городской среде Нью-Дели свидетельствует о том, что CORTA-Net готова к широкому внедрению, тем самым закладывая основу для разработки нового стандарта прогнозирования качества воздуха в городах.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликтов интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Проект поддержки исследователей Университета принцессы Нуры бинт Абдулрахман (PNURSP2026R300), Университет принцессы Нуры бинт Абдулрахман, Эр-Рияд, Саудовская Аравия.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Шрифт CalibriMicrosoft CorporationURL: https://learn.microsoft.com/en-us/typography/font-list/calibriИспользуется в качестве запрашиваемой базовой типографии для исправленных диаграмм и меток фигур.
Скрипты генерации фигур для CORTA-NetСобственные скрипты для этого проекта CORTA-NetURL: https://github.com/saravagnamahasiva/CORTA-NetИспользуется для повторного создания PDF-файлов рисунков с исправленными метками и порядком для публикации.
CORTA_Net_High_Resolution_Images.zipАрхив изображений проекта, предоставленный пользователемНомер каталога/RRID: Не применимо; локальный источник архиваИспользуется в качестве исходного/справочного набора изображений и для определения идентификации фигур.
GitHubGitHub, Inc.URL: https://github.com/Используется в качестве предполагаемого хоста репозитория для кода проекта и файлов генерации рисунков.
MatplotlibMatplotlib Development TeamRRID: SCR_008624; URL: https://matplotlib.org/Используется для повторного рисования графиков, диаграмм, меток, маркеров панелей и векторных рисунков в формате PDF.
NumPyРазработчики NumPyRRID: SCR_008633; URL: https://numpy.org/Используется для определенных массивов и симулированных значений в повторно созданных панелях рисунков.
OpenAI CodexOpenAIURL: https://openai.com/codexИспользуется для помощи в редактировании кода, повторном создании рисунков, упаковке PDF-файлов и проверке.
PillowАвторы PillowURL: https://python-pillow.org/Используется для просмотра, изменения размера, предварительного просмотра и проверки растровых изображений.
PopplerРазработчики Poppler / freedesktop.orgURL: https://poppler.freedesktop.org/Используется для рендеринга сгенерированных PDF-файлов в PNG-превью для проверки визуального качества.
pypdfАвторы pypdfURL: https://pypdf.readthedocs.io/Используется для проверки наличия одной действительной страницы в каждом конечном PDF-файле рисунка.
PythonФонд PythonRRID: SCR_008394; URL: https://www.python.org/Используется в качестве программной среды для генерации рисунков и обработки PDF.
ReportLabReportLab Inc.URL: https://www.reportlab.com/Используется для создания обязательной таблицы материалов/инструментов/программного обеспечения в виде PDF-артефакта.
Windows PowerShellMicrosoft CorporationURL: https://learn.microsoft.com/en-us/powershell/Используется для команд управления файлами, извлечения архивов и конечной упаковки в ZIP.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

234234

Похожие статьи