需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

基于注意力机制可解释性的混合深度学习在德里城市环境中进行PM2.5预测

206 次观看

DOI:

10.3791/71004

2026年8月7日

本文内容

摘要

CORTA(相关性优化排序迁移注意力)网络,一种用于德里地区短期PM₂.₅预测的混合深度学习框架。该模型结合了CorrXGBoost-Rank特征选择、基于长短期记忆网络的迁移学习以及多头注意力机制,以实现对时间和特征层面的解释,并利用空气质量、气象以及卫星反演的火点数数据来提升PM2.5 的预测精度。

摘要

在德里,由于颗粒物浓度受到本地排放、气象变化、季节性停滞以及偶发性火灾相关污染的共同影响,PM2.5 的短期预测具有挑战性。本研究提出了一种名为CORTA-Net的混合深度学习框架,利用2012年至2024年的多源环境数据进行PM2.5预测。输入数据包括来自中央污染控制委员会(CPCB)和德里污染控制委员会(DPCC)监测站的逐小时空气质量观测数据、印度气象局(IMD)提供的气象变量,以及来自MODIS(中等分辨率成像光谱仪)产品的卫星反演火灾计数信息。该框架首先采用CorrXGBoost-Rank特征选择方法,减少冗余预测变量,保留重要的污染物、气象、时间及与火灾相关的变量。所选特征随后被组织为有监督的滑动窗口序列,并通过基于迁移学习的LSTM编码器处理,再经由多头注意力层进行建模。该注意力机制可对PM2.5预测结果在特征层面和时间步层面提供解释性分析。CORTA-Net通过按时间顺序划分的训练、测试与验证集以及交叉验证方法进行了评估。与随机森林、XGBoost、LSTM和带注意力机制的LSTM等基线模型相比,该框架在德里监测站场景下的预测误差更低。CORTA-Net的创新之处在于将显式的CorrXGBoost-Rank特征筛选、基于迁移学习的时间编码、MODIS火灾活动数据融合以及基于多头注意力机制的模型行为分析整合到一个可重复的PM2.5预测流程中。在实际应用中,该框架可用于具备丰富监测数据的城市环境中的短期空气质量预测,前提是污染物记录、气象观测数据和火灾活动指标均可获取。

引言

空气动力学直径 ≤ 2.5 µm 的细颗粒物(PM2.5)是德里空气质量的重要关注点,因其受到本地排放1,2,3、区域输送4、季节性气象条件5以及偶发性生物质燃烧事件6的影响。在季风后和冬季期间7,低风速8、浅薄的边界层条件9以及逆温现象会降低污染物的扩散能力,导致颗粒物累积增加。由于时间序列本身具有非线性、季节性以及突发性高污染等特征,短期 PM2.5 预报具有挑战性10。以往关于 PM2.5 预报的研究已采用统计模型、机器学习模型和循环神经网络模型11。统计方法有助于识别数据的趋势和季节性特征12,但可能无法充分刻画污染物与气象因素之间存在的非线性相互作用13。随机森林和 XGBoost 等机器学习模型可用于模拟非线性关系14;然而,除非设计滞后特征,否则它们通常不具备时间依赖性。长短期记忆(LSTM)神经网络能够同时建模时间依赖性和非线性关系15

长短期记忆网络能够建模时间模式16,但其性能可能受到非平稳条件和突发污染事件的影响17。近年来基于注意力机制和基于Transformer的方法改善了时间表示能力18,但其中许多方法直接处理所有候选变量,在序列建模前对特征冗余的控制能力有限19,20。尽管基于Transformer和混合深度学习模型最近在PM2.5和空气质量指数(AQI)预测方面取得了进展21,但其贡献通常集中在时间表示学习22、空间图构建23、模型融合24或优化策略上。许多此类模型直接使用现有的多变量输入集,将主要学习负担交由序列模型承担25。这可能导致输入冗余增加、可解释性降低,并难以判断性能提升究竟源于时间建模、特征筛选、外部环境指标还是基于注意力的权重机制。因此,CORTA-Net被定位为一种工作流级别的预测框架,而非一种全新的独立神经网络层26。其独特之处在于有序整合了四个阶段:在序列建模前采用CorrXGBoost-Rank进行特征筛选、利用迁移学习的LSTM编码实现时间适应性、引入MODIS反演的火灾计数以反映生物质燃烧的 episodic 影响,以及采用多头注意力机制实现对特征和时间步层级的模型行为解释。该设计使得该框架能够在相同的德里监测站设置下,评估预测精度以及所选污染物、气象、时间及火灾活动变量的贡献度27

近年来,空气质量预测领域的进展 increasingly 采用混合深度学习模型、注意力机制、基于图的学习28以及 Transformer 架构,以捕捉非线性的时序和空间依赖关系29。这些方法通过学习更长时间范围的依赖关系,并对时间步长或输入变量分配自适应权重,从而提升了预测性能30。然而,许多近期模型仍依赖于大规模的输入特征集,在进行时序建模前未明确剔除冗余预测因子,或在生物质燃烧效应显著的关键时段未纳入外部火灾活动指标。CORTA-Net 通过将特征筛选、迁移学习 LSTM 编码、MODIS 衍生的火灾计数整合以及多头注意力机制结合于单一预测流程中,弥补了这一不足。

本研究将CORTA-Net作为一种可重复的混合PM2.5预测流程提出,而非一种新的神经网络层。该框架结合了四个阶段:CorrXGBoost-Rank特征选择、基于迁移学习的LSTM时间编码、MODIS衍生的火点数整合以及基于多头注意力机制的模型行为分析。CorrXGBoost-Rank首先在序列建模前减少冗余的污染物和气象变量。所选特征随后被组织成滑动窗口序列,并通过基于迁移学习的LSTM编码器进行处理。MODIS火点数变量作为区域火灾活动的外部指标被纳入,而多头注意力层则用于分析哪些近期时间步长和输入变量对预测贡献最大。该框架适用于至少有一个监测站提供连续PM2.5观测数据的场景,最好具备多年的逐小时数据。当区域生物质燃烧影响显著时,该框架还可受益于气象观测和卫星反演的火点数信息。因此,CORTA-Net适用于数据丰富的城市空气质量预测环境,可能不适用于监测记录稀疏、不规律或短期的地区。

选择德里作为研究区域,是因为该地在后季风季节和冬季期间反复出现较高的 PM₂.₅ 水平31。该城市受到交通、工业活动、居民区排放、气象停滞以及区域农业焚烧的影响。本研究使用了四个监测站:德瓦卡第八区、阿南德维哈尔、芒德卡-德里污染控制委员会(DPCC)和索尼娅维哈尔。每个站点代表一种不同类型的城区微环境:住宅区、受交通影响区域以及受工业影响区域。2012 年至 2024 年间各监测站的观测数据见补充图 1。模型的训练使用了 2015 年至 2022 年的数据,模型开发与验证的测试则分别使用了 2023 年和 2024 年收集的数据32。输入变量包括 PM2.5、PM10、NO、NO2、NOx、CO、苯、空气温度、风速、太阳辐射和大气压强,这些变量根据各站点可获取的数据确定33。来自 MODIS 的火灾计数数据被用作反映该地区火灾活动水平的外部变量。表 1 汇总了四个监测站各自的 PM₂.₅ 浓度统计信息。

数据集站点名称均值标准差最小值25%50%75%最大值
1Dwarka Sector 898.2479.127.5238.6570.83133.47588.15
2Anand Vihar115.8789.428.9149.2884.36152.89574.92
3Mundka-DPCC113.6291.054.2143.5886.74158.42682.31
4Sonia Vihar101.3580.255.8042.1575.60138.75565.40

表1:德里四个监测站PM₂.₅浓度的统计摘要。 表1展示了在德里四个监测点测得的PM2.5(细颗粒物)平均水平。PM2.5由直径小于2.5微米的空气污染物组成,因其粒径极小,可被轻易深入吸入肺部,从而带来多种潜在健康风险

访问受限。请登录或开始试用以查看此内容。

方案

方法
构建了一个有监督的滑动窗口模型,用于根据之前每小时的观测值预测 t + 1 时刻的未来 PM2.5 值。通过验证性能评估了 12、24 和 48 个时间步长的候选输入窗口长度,最终 CORTA-Net 模型采用 24 小时的输入序列。使用线性插值填补缺失值;采用 IQR 方法剔除异常值;在生成滞后 PM2.5 特征之前,对所有变量进行最小-最大归一化处理。随后应用 CorrXGBoost-Rank 方法进行特征选择。首先,通过皮尔逊相关性筛选保留 |r| ≥ 0.30 的变量;其次,过滤掉两两相关性 |corr(xi, xj)| ≥ 0.85 的高度冗余特征对,以降低多重共线性;第三,对剩余变量训练 XGBoost 回归模型,并保留基于 XGBoost 增益的重要性评分 ≥ 0.015 的预测变量作为最终模型的输入。最终的 CORTA-Net 架构包括用于时间编码的堆叠 LSTM 层、用于特征和时间步级别加权的多头注意力层,以及用于 PM2.5 估算的全连接回归层。模型使用 Adam 优化器,以均方误差损失函数进行训练,并采用早停法。通过训练集、验证集、测试集以及 10 折交叉验证的 RMSE 和 R2 对模型性能进行评估。表 2 展示了数据预处理与特征工程的总结。

步骤使用方法参数 / 阈值目的
缺失值计算缺失观测值百分比按变量报告百分比量化数据完整性
短间隙填补线性插值间隙长度 ≤ 6 h填补短暂的缺失区间
异常值检测四分位距法(IQR)Q1 − 1.5 × IQR,Q3 + 1.5 × IQR去除无效的极端值
归一化最小-最大缩放(Min-Max scaling)训练集的最小值和最大值标准化特征范围
PM₂.₅ 滞后项滞后变量lag₁, lag₂, lag₃捕捉时间持续性
滚动统计量移动平均3 h, 6 h, 12 h, 24 h捕捉短期累积效应
火灾计数特征MODIS FIRECOUNT当日 / 前一日计数表征区域火灾影响

表2:数据预处理与特征工程摘要。 在表2中,数据处理通过两种方式进行:首先,对原始数据进行清洗和转换(预处理);其次,通过特征工程来创建、选择或修改特征(features)。这两个步骤共同作用,有助于消除或减少噪声,处理缺失值,提高数据一致性,并构建更具预测能力的模型。

标准化参数仅从训练集中估计得出,然后直接应用于测试集和验证集,以避免信息泄露。

CorrXGBoost-rank 的数学表达
设 X = {x1, x2, ..., xn} 表示候选输入变量的集合,y 表示目标 PM₂.₅ 浓度。对于每个特征 xi,其与目标变量的皮尔逊相关系数计算如下:

相关系数方程;统计学公式;教学示意图;数据分析概念。 (1)

其中,cov(xi, y) 表示特征 xi 与目标变量 y 之间的协方差,σxi 和 σy 分别为它们的标准差。保留满足以下条件的特征:|ri| ≥ τr,本研究中 τr = 0.30。

在所有保留的特征_x之间计算了两两相关性i,xj,以及如果 |corr(xi,xj)| >= τ红色,其中 τ红色 = 0.85 时,选择与 PM 绝对相关性较低的特征2.5 目标变量从特征集中移除。该过程可减少特征集中存在多重共线性的变量。随后,对剩余特征拟合XGBoost回归模型,并利用XGBoost重要性方法计算每个特征的重要性得分,筛选满足i_i ≥ τ的特征xgb 其中 τxgb = 0.015 的特征被保留在最终的特征集(S")中,该特征集定义为 S最终= Scorr ∪ Sxgb,即通过相关性过滤冗余特征并基于XGBoost变量重要性去除某些特征后所定义的特征集。特征选择的整体方法如下:计算特征与目标变量之间的成对Pearson相关系数,剔除|r_i|< 0.30,舍弃具有两两相关性 ≥ 0.85 的特征对,对剩余特征拟合 XGBoost,保留 XGBoost 重要性得分 ≥ 0.015 的特征,确定最终所需特征集 S最终=相关性 ∪ Sxgb,其中 S相关性 是冗余相关性过滤后保留的特征,以及 Sxgb 是使用XGBoost特征重要性得分所选择的特征。因此,CorrXGBoost-Rank工作流程为:计算特征与目标变量的皮尔逊相关系数,移除|r|小于设定阈值的特征,i| < 0.30,移除两两相关性 ≥ 0.85 的高度冗余特征,使用剩余变量训练XGBoost模型,保留XGBoost重要性评分 ≥ 0.015 的变量,并将相关性筛选与XGBoost筛选所得变量的并集作为最终特征集。本研究中使用的参数为 τr = 0.30, τ红色 = 0.85,且 τxgb = 0.015.

数据来源
作者整合了三项大型数据集用于本研究:一是通过印度中央污染控制委员会(CPCB)/德里污染控制委员会(DPCC)空气质量监测获得的空气污染物数据(PM2.5、PM10、NO2、CO 和 SO₂);二是来自印度气象局(IMD)的气象数据(温度、湿度、风速/风向和气压);三是来自美国国家航空航天局(NASA)MODIS主动火点产品提供的卫星火情监测信息。这三项数据集覆盖了2012年1月至2023年12月共12年的时间,因而代表了不同类型的排放源。火灾事件会加剧空气污染,如补充图2所示,该图展示了2012年至2024年的火灾发生次数(FIRECOUNT)变化趋势。

研究期间污染物的长期变化趋势
图1展示了研究年份(2012–2024年)内污染物的长期变化趋势。2012年至2024年间的年度火灾次数与平均PM₂.₅浓度之间存在中等强度的正相关关系(r = 0.688),表明火灾活动越频繁,通常PM₂.₅浓度也越高。实测与预测的PM₂.₅数据呈现出相似的变化趋势,支持了生物质燃烧对颗粒物污染有贡献的观点。尽管年际变化显著,但与火灾相关的排放仍是决定PM₂.₅波动的重要因素,凸显了区域火灾管理对改善空气质量的必要性。如补充图3所示,预测PM2.5 在三十个滞后阶数下的自相关性在几乎所有滞后阶数上均表现出较强的正自相关,证实了德里地区PM2.5具有显著的时间依赖性和多日持续性。

PM2.5与火灾数量相关性图(2012-2024年),显示观测值与预测值的趋势。
图1: 2012年至2024年长期PM₂.₅浓度与火灾数量变化趋势。 图1比较了年度火灾数量变化与观测及预测的PM₂.₅浓度。PM₂.₅浓度单位为µg/m3。FIRECOUNT代表基于MODIS产品卫星反演的火灾活动数据。 请点击此处查看该图的高清版本。

使用Loess的季节性和趋势分解(STL分解)
使用Loess的季节性和趋势分解(STL)是一种迭代算法,可将时间序列数据分解为三个相加成分,如图所示 图2:趋势(长期趋势)图2A), (图2D), (图 2G), (图2J),季节性(周期性)(图2B), (图2E), (图 2H), (图 2K),以及剩余部分(噪声/残差)(图2C), (图 2F), (图 2I), (图 2L)。STL 在处理环境数据(如 PM)复杂的非线性特征方面已证明具有显著成效2.5)而许多其他分析方法因季节信号的振幅变化以及异常值的存在而难以适用。LOESS平滑法能够准确分离这些组分,从而更清晰地解读趋势或模式。通过STL处理,可有效分离出PM总体上升的长期趋势2.5 从较短的昼夜/季节性周期及其周期内的不规则残差中分离出趋势。这种分离有助于识别影响PM的排放源2.5,而不是气象因素对PM的影响2.5该分离结果有助于对未来PM的精确预测2.5 排放;为监管决策提供数据;并符合空气质量研究中对时间序列数据进行严格分解的标准34. 平均每日PM2.5 2012年至2024年德里监测站的浓度测量数据显示,PM浓度极低2.5 水平变化(即2022–24年期间无显著变化)总体上极为有限,且一致行为(或颗粒物的一致性)非常不足2.5 四个监测点之间的水平差异)。PM2.5 德瓦卡第8区和芒德卡-德里污染控制委员会监测点的污染物水平持续呈下降趋势(即持续降低),而阿南德维哈尔呈上升趋势(即显著增加),索尼娅维哈尔则呈轻微上升趋势(自2022年以来增幅极小)。此外,每日PM的残差2.5 四个监测站的浓度表明 PM2.5 浓度受季节性(气象)变化的显著影响,导致平均每日PM出现大幅波动2.5 各站点的浓度。每日PM2.5 德里四个监测站(2012–2024年)的浓度数据如图所示 图2.

PM2.5趋势、季节性、残差的STL分解;空气质量分析;图表比较。
图2:2022–2024年中国台湾德里四个监测站每日PM₂.₅浓度的STL(利用局部加权回归进行季节性和趋势分解)分解结果。每个监测站的时间序列被分解为三个加性成分:长期趋势、季节性变化和残差(剩余部分)。(A) Dwarka Sector 8的趋势成分。(B) Dwarka Sector 8的季节性成分。(C) Dwarka Sector 8的残差成分。(D) Anand Vihar的趋势成分。(E) Anand Vihar的季节性成分。(F) Anand Vihar的残差成分。(G) Mundka-DPCC的趋势成分。(H) Mundka-DPCC的季节性成分。(I) Mundka-DPCC的残差成分。(J) Sonia Vihar的趋势成分。(K) Sonia Vihar的季节性成分。(L) Sonia Vihar的残差成分。STL:利用局部加权回归进行季节性和趋势分解。请点击此处查看该图的放大版本。

图2展示了2022年至2024年期间四个城市监测点每日PM2.5浓度的时间分解结果,揭示了长期下降、逐步上升以及显著的昼夜变化模式。这些差异主要可归因于气象的物理效应,即行星边界层(PBL)高度的变化:例如白天边界层扩张,增强垂直扩散并降低污染物浓度;夜间则边界层收缩,使污染物聚集在近地面层,导致夜间浓度出现高峰。其他气象影响因素还包括与人类活动排放相关的时间分布(如早晚高峰时段)、工业排放,以及这些因素与局地地形、风速、相对湿度和季节(例如冬季相关性更强)等站点特异性因素的相互作用。此外,整体长期下降趋势可能还受到排放监管措施的影响,从而导致总体浓度呈下降趋势。

特征之间的相关性
图3展示了CORTA-Net模型中使用的所有输入特征的分布情况。各子图中,污染物变量(PM10图3A)、NO₂(图3B)、CO(图3C)、SO₂(图3D))呈现出典型的城市空气质量数据常见的右偏分布,而O₃(图3E)和气压(图3I)则接近正态分布35。温度(图3F)表现出明显的双峰季节性结构,湿度(图3G)呈较宽的类均匀分布,风速(图3H)则呈现轻尾分布。这些分布模式凸显了预测变量在统计行为上的异质性,也说明了在模型训练前进行特征工程和归一化的必要性。

空气质量数据直方图;PM10、NOx、CO、SO2、O3、温度、湿度、风速、气压。
图3:CORTA-Net 模型中使用的输入特征分布,包括空气污染物浓度和气象变量。 这些分布展示了在预处理和模型训练之前预测变量的统计特征。(A)PM₁₀ 浓度。(B)NO₂ 浓度。(C)CO 浓度。(D)SO₂ 浓度。(E)O₃ 浓度。(F)气温。(G)相对湿度。(H)风速。(I)大气压。污染物变量,特别是 PM₁₀、NO₂、CO 和 SO₂,呈现出典型的城市空气质量数据右偏分布,而 O₃ 和大气压则近似正态分布。温度表现出双峰季节性模式,湿度分布较广,风速集中在较低值且呈轻尾分布。这些异质性的特征分布支持在模型构建前进行特征工程和归一化处理。请点击此处查看该图的放大版本。

图4展示了经过CorrXGBoost-Rank预处理后用于PM₂.₅预测的基于XGBoost增益的特征重要性排序。当前的特征重要性图显示,前一日PM₂.₅是重要性最高的预测因子,其重要性得分为0.280,其次是PM10 = 0.180、FIRECOUNT = 0.150、NO₂ = 0.120、CO = 0.080、风速 = 0.070、温度 = 0.040、湿度 = 0.030以及年积日 = 0.020。虚线垂直线表示XGBoost特征选择的实际阈值0.015。重要性得分大于或等于0.015的预测因子被保留在最终的CORTA-Net输入集合中,而低于该阈值的预测因子,包括SO₂ = 0.010、O₃ = 0.010、气压 = 0.005、降雨量 = 0.005、周末 = 0.002和节假日 = 0.001,则被排除。这些数值代表基于XGBoost增益的特征重要性得分,不应被解释为皮尔逊相关系数或因果效应。

因此,只有贡献度超过该阈值的特征才被纳入模型。XGBoost 模型采用一组决策树集成方法,通过迭代构建决策树以最小化损失函数,这一过程称为梯度提升。XGBoost 使用三种指标之一来计算特征的重要性:增益(该特征的分裂对模型性能的提升程度)、权重(该特征被选为决策树分裂节点的次数)或覆盖度(受该分裂影响的观测样本数量)。该 XGBoost 模型基于空气质量数据(污染物、气象变量)构建,并重点关注滞后的 PM2.5,以自回归方式预测 PM2.5 浓度,这在德里地区的 PM2.5 模型中较为常见,有助于捕捉 PM2.5 的时间持续性。Delhi_PM2.5 是一个重要贡献因子,源于细颗粒物具有较高的自相关特性,也反映出由于持续排放源导致的污染惯性。风速是显著因子,因其提供了污染物扩散的机制;而冬季逆温存在时,低风速则导致污染物积聚。NO2 与 PM2.5 相关,主要源于交通排放;而年中的日期则反映了污染物的年度排放周期(例如周末排放较低)。在德里,PM2.5 具有高度自我持续性,原因在于冬季气象条件静稳以及来自机动车、工业和生物质燃烧的持续排放28。风有助于气溶胶的扩散,但当风速较弱(< 2 m/s)时,由于逆温现象,会导致 PM2.5 浓度进一步积聚。NO2 与 PM2.5 之间的关系源于它们共同的来源(即燃烧过程),并受到时间因素的影响(例如日变化与周变化)36。解释空气质量指数(AQI)变异性的四个主要因素包括:滞后的 PM2.5 累积引起的污染物浓度变化(贡献超过93%)、低风速导致排放物滞留、机动车与工业排放的 NO2/PM,以及交通量的逐日波动37。此外,德里的地理环境也是该区域逆温现象持续存在的促成因素,从而进一步加剧了 PM2.5 的浓度水平。通过超参数调优、正则化处理以及引入更多变量(如温度),可有效降低过拟合风险,并提升模型整体性能。为减少 PM 排放的运行策略应包括实施每日 PM 排放限值、使用可实时监测 PM 浓度的设备,以及利用城市绿地中的风力促进 PM 的扩散.

XGBoost 特征重要性图;PM2.5,PM10,火灾次数;数据分析;机器学习
图4: 基于XGBoost增益的特征重要性排序,在使用CorrXGBoost-Rank特征筛选方法进行PM₂.₅预测后的结果。 预测因子条形图按重要性降序排列。虚线垂直线表示XGBoost特征筛选的实际阈值0.015。得分≥0.015的预测因子被保留在最终的CORTA-Net输入集中,而低于该阈值的预测因子则被排除。该排序用于特征筛选和模型行为解释,不应被解读为因果归因。 请点击此处以查看此图的放大版本。

CORTA-net 模型架构
图5 提出了一种建议的PM2.5 预测框架 补充图45 展示 LSTM 单元的内部结构以及多头注意力机制模块的示意图。所有数据源(即环境条件、气象观测、火情活动以及数据的时间和上下文特征)均经过预处理,以确保其在时间上对齐,必要时对缺失数据进行插补,并在用于任何模型构建过程之前完成异常值剔除和归一化处理。模型的架构、特征工程、训练配置、数据配置、迁移学习、评估指标、未来预测及实施细节如图所示。 补充表1利用 CorrXGBoost-Rank 模块,在建模阶段之前确定最优特征集,随后将其中一部分特征子集输入至 LSTM 架构中;该架构通过引入多头注意力层得以增强,以捕捉时间序列行为。两者均用于 PM2.5 预测与颗粒物2.5 输入特征的特征重要性以及作为注意力图的多头注意力权重被提供为输出。内部LSTM单元结构和多头注意力模块框图已被包含在内 补充图4和5,而 补充表1 提供该架构中每种层类型的架构参数。

使用LSTM、特征排序和注意力图进行PM2.5预测的深度学习流程图
图5 CORTA-Net PM₂.₅ 预测模型的整体架构。 输入预测过程包括空气质量指标、气象指标、时间指标以及MODIS(中等分辨率成像光谱仪)火点计数指标。对于每个步骤,算法对时间戳进行对齐,处理缺失值,过滤异常值,归一化数据,并进行特征工程。最终的预测变量通过CorrXGBoost-Rank过程进行选择。随后,所选特征被放入时间序列滑动窗口中,并通过采用迁移学习的LSTM(长短期记忆)编码器。对于每个特征和时间步,多头注意力机制在将组合输出传递至最终回归密集层之前分配权重,以生成PM₂.₅预测结果。 请点击此处查看该图的放大版本。

训练与评估
采用滑动窗口方法构建监督学习序列。训练过程使用 Adam 优化器和均方误差损失函数(补充表 2)。模型性能通过均方根误差(RMSE)和决定系数(R2)在训练集、验证集、测试集以及交叉验证划分中进行评估。模型的架构、特征工程、训练配置、数据配置、迁移学习、评估指标、未来预测及实现细节均汇总于 补充表 1 中。图 6 展示了 CORTA-Net PM₂.₅ 预测模型的训练诊断结果。其中,图 6A 显示训练损失与验证损失曲线,表明误差逐步降低,并在第 106 轮次达到最优停止点。图 6B 通过验证集与训练集数据的发散情况,展示了过拟合分析评估过程中泛化差距的演变过程。特别地,图中标识出发散超过预设阈值的时段;该信息表明,学习率行为与损失下降模式证明了在关键训练轮次采用计划式学习率(LR)衰减策略有助于提升收敛稳定性的优势,如 图 6C 所示。综上,这些图表综合总结了模型的学习动态、泛化能力以及推荐的训练配置。

CORTA-Net 训练动态;神经网络分析的损失、泛化差距和学习率图表。
图6 CORTA-Net PM₂.₅ 预测模型的训练诊断。A)训练损失和验证损失曲线,显示模型训练过程中误差逐步降低,并基于验证性能在第106轮次提前停止训练。(B)各训练轮次中训练损失与验证损失之间的泛化差距,反映模型泛化能力的演变过程,以及出现显著发散的阶段,提示可能存在过拟合。(C)学习率调度计划,展示训练过程中设定的学习率衰减对优化过程的影响。(D)模型收敛行为的总结,表明优化过程稳定,并展示了为 CORTA-Net 模型最终选定的训练配置。这些诊断结果共同揭示了模型在训练期间的动态特性、收敛特征及泛化性能。请点击此处查看该图的放大版本。

访问受限。请登录或开始试用以查看此内容。

结果

特征选择与预测结果
CorrXGBoost-Rank 方法选取了滞后的 PM₂.₅、风速、湿度、温度、时间指标以及 MODIS 反演的火灾次数作为空气质量的重要预测因子。这些变量分别反映了污染的持续性、气象条件导致的污染物扩散、污染水平的季节性差异以及火灾带来的区域影响。在序列建模前,冗余变量已被剔除,以降低不必要的输入维度。CORTA-Net 模型采用平均绝对误差、均方根误差和决定系数进行评估。在德里每日数据集上,模型达到 RMSE = 3.19 且 R2 = 0.983;在德里每日气候训练子集上,模型达到 RMSE = 4.98 且 R2 = 0.845。在目标测试集的散点分析中,观测值与预测的 PM₂.₅ 值之间的皮尔逊相关系数 r = 0.942,R2 = 0.873。上述数值对应于不同的评估子集,不应视为可互换的整体模型结果。

图7 目前作为 CORTA-Net 在测试数据上测试性能的统一可视化展示。时间序...

访问受限。请登录或开始试用以查看此内容。

讨论

CORTA-Net 通过将三个关键组件按顺序组合,形成一种混合架构。CorrXGBoost-Rank:一种定制的特征选择组件,在时间建模阶段之前消除冗余预测变量38。LSTM 编码器:使用堆叠的 LSTM 层来捕捉所选 24 小时输入序列中的短期和长期时间依赖性39。多头注意力层:作为 CORTA-Net 混合序列模型的最后一步,应用于 LSTM 的输出(及其对应的注意力权重);在不取代主干 LSTM 核心作用的前提下,增强最终输出的可解释性40。LSTM 编码器从选定的滑动窗口序列中学习时间依赖关系。CORTA-Net 旨在提供一种混合序列建模方法,其中 CorrXGBoost-Rank 用于剪枝冗余预测变量。多头注意力层对所有 LSTM 输出进行加权聚合,生成 PM2.5 预测结果及相应的注意力权重。CORTA-Net 的这三个组件与纯 Transformer 架构有显著区别:CORTA-Net 采用 LSTM(循环)网络进行序列学习建模,循环网络构成了序列学习的主要基...

访问受限。请登录或开始试用以查看此内容。

致谢

沙特阿拉伯利雅得公主诺拉·宾特·阿卜杜勒拉赫曼大学研究人员支持项目编号(PNURSP2026R300),公主诺拉·宾特·阿卜杜勒拉赫曼大学,沙特阿拉伯利雅得。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Calibri 字体Microsoft CorporationURL: https://learn.microsoft.com/en-us/typography/font-list/calibri用作校正后图表图示和标签的指定基础排版字体。
CORTA-Net 图表生成脚本本 CORTA-Net 项目专用的自定义脚本URL: https://github.com/saravagnamahasiva/CORTA-Net用于重新生成具有正确标签和顺序的出版级质量图表 PDF 文件。
CORTA_Net_High_Resolution_Images.zip用户提供的项目图像归档文件目录编号/RRID:不适用;本地源归档用作原始参考图像集,并用于确定图表身份。
GitHubGitHub, Inc.URL: https://github.com/用作项目代码和图表生成文件的预定代码仓库托管平台。
MatplotlibMatplotlib 开发团队RRID: SCR_008624; URL: https://matplotlib.org/用于重绘图表、示意图、标签、面板标记以及矢量 PDF 图形。
NumPyNumPy 开发者RRID: SCR_008633; URL: https://numpy.org/用于在重新生成的图表面板中生成确定性数组和模拟数值。
OpenAI CodexOpenAIURL: https://openai.com/codex用于辅助代码编辑、图表再生、PDF 打包及验证工作。
PillowPillow 贡献者URL: https://python-pillow.org/用于检查、调整大小、预览和验证光栅图像输出。
PopplerPoppler 开发者 / freedesktop.orgURL: https://poppler.freedesktop.org/用于将生成的 PDF 渲染为 PNG 预览图,以进行视觉质量检查。
pypdfpypdf 贡献者URL: https://pypdf.readthedocs.io/用于验证每个最终图表 PDF 文件是否仅包含一个有效页面。
PythonPython 软件基金会RRID: SCR_008394; URL: https://www.python.org/用作图表生成和 PDF 处理的编程环境。
ReportLabReportLab Inc.URL: https://www.reportlab.com/用于创建必需的材料/工具/软件表格作为 PDF 产物。
Windows PowerShellMicrosoft CorporationURL: https://learn.microsoft.com/en-us/powershell/用于文件编排、归档解压以及最终 ZIP 打包命令。

参考文献

  1. AlShafeey M. Unraveling climate trends in the mediterranean: a hybrid machine learning and statistical approach. Model Earth Syst Environ. 2024;10:6255-6277.
  2. Li B, Qian Y. Weather prediction using CNN-LSTM for time series analysis: a case study on Delhi temperature data. arXiv:2409.09414. 2024.
  3. Bashardoost A, Mesgari MS, Karimi M. Quantifying uncertainty in the spatial prediction of PM2.5 using a deep learning algorithm. Ann GIS. 2025;31(4):679-712.
  4. Bi K, Xie L, Zhang H, et al. Accurate medium-range global weather forecasting with 3D neural networks. Nature. 2023;619:533-538.
  5. Xu C, Liu J, Han S, Duan X, Xiang L, Zhang T. FourCastLSTM: a precipitation nowcasting model integrating global and local spatiotemporal features. Comput Geosci. 2025;204:105966.
  6. Damkliang K, Chumnaul J. Deep learning and statistical approaches for area-based PM2.5 forecasting in Hat Yai, Thailand. J Big Data. 2025;12:36.
  7. Elabd E, Hamouda HM, Ali MAM, et al. Climate change prediction in Saudi Arabia using a CNN GRU LSTM hybrid deep learning model in al Qassim region. Sci Rep. 2025;15:16275.
  8. Guo Q, He Z, Wang Z. Monthly climate prediction using deep convolutional neural network and long short-term memory. Sci Rep. 2024;14(1):17748.
  9. Zhang H, Jin Y, Shi J, Zhang S. Predicting PM2.5 concentrations using stacking-based ensemble model. Appl Comput Math. 2021;10(6):156-162.
  10. Şener İF, Tuğal İ. Optimized CNN-LSTM with hybrid metaheuristic approaches for solar radiation forecasting. Case Stud Therm Eng. 2025;72:106356.
  11. Shen J, Wu W, Xu Q. Accurate prediction of temperature indicators in Eastern China using a multi-scale CNN-LSTM-Attention model. arXiv:2412.07997. 2024.
  12. Karimian H, Li Q, Wu C, et al. Evaluation of different machine learning approaches to forecasting PM2.5 mass concentrations. Aerosol Air Qual Res. 2019;19:1400-1410.
  13. Kumar S, Mishra S, Singh SK. A machine learning-based model to estimate PM2.5 concentration levels in Delhi's atmosphere. Heliyon. 2020;6(11):e05618.
  14. Ladjal B, Nadour M, Bechouat M, et al. Hybrid deep learning CNN-LSTM model for forecasting direct normal irradiance: a study on solar potential in Ghardaia, Algeria. Sci Rep. 2025;15:15404.
  15. Lakshmi S, Krishnamoorthy A. Deep transfer learning and attention based PM2.5 forecasting in Delhi using a decade of winter season data. Sci Rep. 2025;15:31787.
  16. Lan R, Eastham SD, Liu T, et al. Air quality impacts of crop residue burning in India and mitigation alternatives. Nat Commun. 2022;13:6537.
  17. Lütjens B, Ferrari R, Watson-Parris D, Selin NE. The impact of internal variability on benchmarking deep learning climate emulators. J Adv Model Earth Syst. 2025;17:e2024MS004619.
  18. Suleman MAR, Shridevi S. Short-term weather forecasting using spatial feature attention-based LSTM model. IEEE Access. 2022;10:82456-82468.
  19. Mansfield LA, Nowack PJ, Kasoar M, et al. Predicting global patterns of long-term climate change from short-term simulations using machine learning. npj Clim Atmos Sci. 2020;3:44.
  20. Masood A, Ahmad K. Data-driven predictive modeling of PM2.5 concentrations using machine learning and deep learning techniques: a case study of Delhi, India. Environ Monit Assess. 2022;195(1):60.
  21. Duan J, Gong Y, Luo J, Zhao Z. Air-quality prediction based on the ARIMA-CNN-LSTM combination model optimized by dung beetle optimizer. Sci Rep. 2023;13:12127.
  22. Liu X, Su K, Wang S, et al. Intelligent prediction of air quality index based on the transformer-BiLSTM model. Sci Rep. 2025;15:41838.
  23. Liu Z, Fang Z, Hu Y. A deep learning-based hybrid method for PM₂.₅ prediction in central and western China. Sci Rep. 2025;15:10080.
  24. Hu Y, Ding Y, Jiang W. Geographically aware air quality prediction through CNN-LSTM-KAN hybrid modeling with climatic and topographic differentiation. Atmosphere. 2025;16(5):513.
  25. Makhdoomi A, Sarkhosh M, Ziaei S. PM₂.₅ concentration prediction using machine learning algorithms: an approach to virtual monitoring stations. Sci Rep. 2025;15:8076.
  26. Jiang Z, Nie Y, Gong W. Enhanced PM₂.₅ forecasting via bio-inspired hybrid LSTM optimization for high-precision results. AIP Adv. 2025;15:075346.
  27. Pan P, Malarvizhi AS, Yang C. Data augmentation strategies for improved PM₂.₅ forecasting using transformer architectures. Atmosphere. 2025;16(2):127.
  28. Masood A, Hameed MM, Srivastava A, et al. Improving PM2.5 prediction in New Delhi using a hybrid extreme learning machine coupled with snake optimization algorithm. Sci Rep. 2023;13:21057.
  29. Meng X, Xie C, Tang X, et al. Prediction of particulate matter 2.5 concentration based on attention mechanism and convolutional BiLSTM network. Discov Appl Sci. 2025;7:1372.
  30. Mohammadi F, Teiri H, Hajizadeh Y, Abdolahnejad A, Ebrahimi A. Prediction of atmospheric PM2.5 level by machine learning techniques in Isfahan, Iran. Sci Rep. 2024;14(1):2109.
  31. Mutinda JK, Langat AK, Mwalili SM. Forecasting temperature time series data using combined statistical and deep learning methods: a case study of Nairobi County daily temperature. Int J Math Math Sci. 2025;2025:4795841.
  32. Nath P, Saha P, Middya AI, Roy S. Long-term time-series pollution forecast using statistical and deep learning methods. Neural Comput Appl. 2021;33(19):12551–12570.
  33. Patel P, Patel S, Shah K, Desai K, Patel S, Shah M, Patel S. A systematic study on PM2.5 and PM10 concentration prediction in air pollution using machine learning and deep learning model. Environ Chem Ecotoxicol. 2025;7:1401-1415.
  34. Li Q, Zhang C, Shangguan W, et al. LandBench 1.0: a benchmark dataset and evaluation metrics for data-driven land surface variables prediction. Expert Syst Appl. 2024;243:122917.
  35. Mojgani R, Waelchli D, Guan Y, Koumoutsakos P, Hassanzadeh P. Extreme event prediction with multi-agent reinforcement learning-based parametrization of atmospheric and oceanic turbulence. arXiv:2312.00907v1. 2023.
  36. Yu S, White BL, Bhiwandiwalla A, et al. ClimDetect: a benchmark dataset for climate change detection and attribution. arXiv:2408.15993. 2024.
  37. Li T, Hua M, Wu X. A hybrid CNN-LSTM model for forecasting particulate matter (PM2.5). IEEE Access. 2020.
  38. Farhangmehr V, Imanian H, Mohammadian A, Cobo JH, Shirkhani H, Payeur P. A spatiotemporal CNN-LSTM deep learning model for predicting soil temperature in diverse large-scale regional climates. Sci Total Environ. 2025;968:178901.
  39. Wu C, Wang R, Lu S, Tian J, Yin L, Wang L, Zheng W. Time-series data-driven PM2.5 forecasting: from theoretical framework to empirical analysis. Atmosphere. 2025;16:292.
  40. Wu Y, Wang X, Wang M, Liu X, Zhu S. Time-series forecasting of PM2.5 and PM10 concentrations based on the integration of surveillance images. Sensors. 2025;25:95.
  41. Gong Y, Zhang Y, Wang F, Lee C-H. Deep learning for weather forecasting: a CNN-LSTM hybrid model for predicting historical temperature data. arXiv:2410.14963. 2024.
  42. Zhou S, Wang W, Zhu L, Qiao Q, Kang Y. Deep-learning architecture for PM2.5 concentration prediction: a review. Environ Sci Ecotechnol. 2024;21:100400.
  43. Zhang Z, Dey S, Lee K, et al. Temporal difference-based graph transformer networks for air quality PM₂.₅ prediction. Front Environ Sci. 2022;10:924986

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

234 234