研究文章

基于注意力的混合深度学习,适用于德里城市环境PM2.5 预测

DOI:

10.3791/71004

2026年8月7日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

CORTA(相关优化排序转移注意力)-Net,一个位于德里的短期PM₂.₅预测混合深度学习框架。该模型结合了CorrXGBoost-Rank特征选择、迁移学习与长短期记忆网络以及多头注意力进行时间和特征层面的解读,并利用空气质量、气象和卫星来源的火灾计数数据,提升PM2.5的预报能力。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

德里的短期PM2.5预测具有挑战性,因为颗粒物浓度受当地排放、气象变化、季节性停滞以及间歇性火灾污染影响。本研究介绍了CORTA-Net,一个利用多源环境数据进行PM2.5 预测的混合深度学习框架,涵盖2012年至2024年。输入数据包括中央污染控制委员会(CPCB)/德里污染控制委员会(DPCC)监测站的每小时空气质量观测、印度气象局(IMD)的气象变量,以及来自MODIS(中分辨率成像光谱仪)产品的卫星火灾计数信息。该框架首先应用CorrXGBoost-Rank特征选择,减少冗余预测变量,保留重要的污染物、气象、时间和火灾相关变量。选定特征随后被安排为监督滑动窗口序列,并使用基于迁移学习的LSTM编码器处理,随后是多头注意力层。该注意力机制提供了PM2.5 预报的特征和时间步长层级解释。通过时间顺序训练、测试和验证分区以及交叉验证来评估CORTA-Net。与随机森林、XGBoost、LSTM和注意力-LSTM基线相比,所提出的框架在评估的德里监测站设置下降低了预测误差。CORTA-Net的创新之处在于将显式CorrXGBoost-Rank特征筛选、基于迁移学习的时间编码、MODIS火灾活动集成以及多头注意力模型-行为分析整合到一个可重复的PM2.5 预测流程中。在实际操作中,该框架可以在数据丰富的监测环境中支持短期城市空气质量预测,这些环境包含污染记录、气象观测和火灾活动指标。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

空气动力直径≤2.5微米(PM2.5)的细颗粒物是德里重要的空气质量问题,因为它受当地排放1,2,3区域运输4、季节气象5和间歇性生物质燃烧事件6的影响。在季风后和冬季7、低风速8、浅边界层条件9以及温度逆温期间,污染物扩散减少并增加颗粒物积累。由于时间序列10本身具有非线性、季节性且突发的高污染现象,预测短期PM2.5具有挑战性。此前关于PM2.5预测的研究利用了统计模型、机器学习模型和循环神经网络模型11。统计方法有助于确定数据的趋势和季节性12,但可能无法完全解释污染物与气象之间的非线性相互作用13。机器学习模型如随机森林和XGBoost可用于建模非线性关系14;然而,除非设计了滞后特征,否则它们通常没有时间依赖性。长短期(LSTM)神经网络能够同时模拟时间依赖性和非线性关系15

长短期记忆网络可以模拟时间模式16,但其表现可能受到非平稳条件和突发污染事件的影响17。近期基于注意力和基于变换器的方法是改进了时间表示18,但许多方法直接处理所有候选变量,并且在序列建模前对特征冗余控制有限19,20。尽管基于变换器和混合深度学习模型最近改进了PM2.5和AQI预测21,但它们的贡献通常集中在时间表示学习22、空间图构建23、模型融合24或优化。许多此类模型直接使用可用的多变量输入集,并将主要学习负担放在序列模型25上。这会增加输入冗余,降低可解释性,并使得难以判断改进是来自时间建模、特征筛选、外部环境指标还是基于注意力的权重。因此,CORTA-Net定位为一个工作流级预测框架,而非新的独立神经网络第26层。其特点在于有序整合四个阶段:序列建模前的CorrXGBoost-Rank特征筛选、时间适应的迁移学习LSTM编码、基于MODIS的火控计数包含以实现情节性生物质燃烧影响,以及多头注意力用于特征和时间步级模型行为的解释。该设计使该框架能够在同一德里监测站设置下,评估预报准确性以及特定污染物、气象、时间和火灾活动变量的贡献27

近年来空气质量预报的进展越来越多地采用混合深度学习模型、注意力机制、基于图的学习28和变压器架构来捕捉非线性的时间和空间依赖关系。这些方法通过学习更长期的依赖关系并为时间步长或输入变量赋予自适应权重,提高了预测性能。然而,许多近期模型仍依赖大量输入特征集,未在时间建模前明确减少冗余预测变量,或在关键时刻关注间歇性生物质燃烧效应时不包含外部火灾活动指标。CORTA-Net通过将特征筛选、迁移学习LSTM编码、MODIS衍生的火力计数集成和多头注意力结合在单一预测工作流中,弥补了这一空白。

本研究将CORTA-Net呈现为一个可重复的混合PM2.5 预测流程,而非新的神经网络层。该框架结合了四个阶段:CorrXGBoost-Rank特征选择、基于迁移学习的LSTM时间编码、基于MODIS的火发计数积分以及多头注意力模型-行为分析。CorrXGBoost-Rank首先减少了冗余的污染物和气象变量,然后再进行序列建模。选定特征随后被排列成滑动窗口序列,并使用迁移学习LSTM编码器进行处理。MODIS火灾计数变量作为区域火灾活动的外部指标被纳入,并利用多头注意力层分析哪些近期时间步长和输入变量对预测贡献最为显著。该框架适用于至少一个监测站能连续进行PM2.5 观测的环境,最好包含数年小时数据。当区域生物质燃烧影响相关时,它还能利用气象观测和卫星获取的火灾计数信息。因此,CORTA-Net 主要面向数据丰富的城市空气质量预报环境,可能不适合监测记录稀疏、不规则或短期监测的地点。

德里被选为研究区域,因其在季风后和冬季期间反复出现高PM₂.₅水平。该市受到交通、工业活动、住宅排放、气象停滞和区域农业燃烧的影响。本研究使用了四个监测站:德瓦尔卡第8区、阿南德维哈尔、蒙德卡-DPCC和索尼娅维哈尔。每个车站代表不同类型的城市微环境:住宅区、交通影响区以及具有工业影响的区域。2012年至2024年间各监测站的观测数据见补充图1。模型训练基于2015年至2022年的数据进行,测试则基于2023年的数据进行,用于模型开发和2024年收集的数据验证。作为输入的变量包括PM2.5、PM10、NO、NO2、NOx、CO、苯、空气温度、风速、太阳辐射和气压,均基于33号站点的可用数据确定。MODIS来源的火灾计数数据被用作代表该地区火灾活动程度的外部变量。表1包含了四个监测站PM₂.₅浓度统计数据的总结。

数据集车站名称性病25%50%75%马克斯
1德瓦卡第8区98.2479.127.5238.6570.83133.47588.15
2阿南德维哈尔115.8789.428.9149.2884.36152.89574.92
3蒙德卡-DPCC113.6291.054.2143.5886.74158.42682.31
4索尼娅·维哈尔101.3580.255.8042.1575.60138.75565.40

表1:德里四个监测站PM₂.₅浓度的总结统计。 表1展示了德里四个监测站测得的平均PM2.5(细颗粒物)水平。PM2.5 由直径小于2.5微米的空气中污染物组成,因此体积足够小,容易被吸入肺部,从而带来多种潜在的健康危害

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

方法论
构建了一个监督滑动窗口模型,预测前一小时观测中 t + 1 时的未来 PM2.5 值。通过验证性能评估候选输入窗口长度为12、24和48小时每小时,最终CORTA-Net配置采用24小时输入序列。线性插值用于填补缺失值;异常值通过IQR方法被移除;所有变量在生成滞后PM2.5 特征前,均采用最小最大归一化进行尺度化。随后应用了CorrXGBoost-Rank程序进行特征选择。首先,Pearson相关过滤保留了具有|r|≥0.30。第二,高度冗余的特征对,具有两两相关性 |corr(xi, xj)|≥0.85被滤波以减少多重共线性。第三,对剩余变量训练XGBoost回归器,最终模型输入保留基于XGBoost增益重要性得分≥0.015的预测变量。最终的CORTA-Net架构由堆叠的LSTM层用于时间编码,多头注意力层用于特征和时间步级加权,以及密集回归层用于PM2.5 估计。该模型使用Adam优化器进行训练,采用均方误差损失和提前停止。模型评估采用RMSE和R2 ,跨训练、验证、测试和10折交叉验证分区进行。 表2 表示数据预处理和特征工程总结。

使用方法参数 / 阈值目的
缺失值计算缺失观测的百分比报告按变量百分比计算量化数据完整性
短间隙补值线性插值间隙长度≤6小时填充短缺失区间
异常值检测IQR方法Q1 − 1.5 × IQR,Q3 + 1.5 × IQR移除无效的极端值
归一化最小极大缩放训练集最小值和最大值标准化特征范围
PM₂.₅ 延迟滞后变量lag₁, lag₂, lag₃捕捉时间持续性
滚动统计移动平均线3小时,6小时,12小时,24小时捕捉短期积累
射击计数功能莫迪斯火力计数当天/前一天计数代表区域性火灾影响

表2:数据预处理与特征工程总结。 在表2中,数据处理有两种方式:首先,通过清理和转换原始数据(预处理),其次,通过特征工程来创建/选择/修改特征(特征)。这两个过程作为一个整体,有助于消除或减少噪声;处理缺失值;提升数据一致性;并创建更具预测性的模型。

归一化参数仅从训练集估算,然后不变地应用于测试和验证集,以避免信息泄漏。

CorrXGBoost排名的数学表述
设X = {x1, x2, ..., xn} 表示候选输入变量集合,y 表示目标PM₂.₅浓度。对于每个特征 xi,Pearson 相关系数与目标变量的计算公式如下:

figure-protocol-1(1)

其中 cov(xi, y) 是特征 xi 与目标 y 之间的协方差,σxi 和 σy 是它们的标准差。保留的特征满足:|ri|≥τ r 其中 τr = 0.30。

在所有保留的features_xi, xj, 以及如果 |corr(xi, xj)|>= τ红色,其中τred = 0.85,与PM2.5 目标绝对相关较低的特征被剔除。这一过程减少了特征集中具有多重共线性的变量。随后,对剩余特征拟合XGBoost回归模型,并利用XGBoost重要性计算每个特征的重要性评分,满足i_i ≥τ xgb(τxgb = 0.015)的特征保留在最终特征集(S“)中,定义为Sfinal= ScorrS xgb,即通过过滤特征的冗余性以确定相关性并剔除基于XGBoost变量重要性的所有特征。 特征选择的总体方法如下:计算特征目标的两对皮尔逊相关性,丢弃 |r_i|< 0.30 的特征,丢弃成≥对相关性为 0.85 的特征,拟合 XGBoost 与剩余特征,保持 XGBoost 重要性评分≥为 0.015 的特征,定义最终期望特征 Sfinal=ScorrS xgb, 其中S corr 是经过冗余相关过滤后保留的特征,Sxgb 是使用 XGBoost 特征重要性评分选择的特征。因此,CorrXGBoost-Rank的工作流程是:计算特征-目标Pearson相关性,移除具有|ri|<0.30,去除两两相关性≥0.85的高度冗余特征,对剩余变量训练XGBoost,保留XGBoost重要性评分≥为0.015的变量,并使用相关选择变量和XGBoost选择变量的联合作为最终特征集。本研究使用的参数为τr = 0.30,τred = 0.85,τxgb = 0.015。

数据来源
作者为研究整合了三个大型数据集;这些数据包括作者通过中央污染控制委员会(CPCB)/德里污染控制委员会(DPCC)空气质量监测获得的空气污染物(PM2.5、PM10、NO2、一氧化碳和SO₂)数据,印度气象局(IMD)提供的气象数据(温度、湿度、风速/风向和气压)以及NASA的MODIS主动火灾产品提供的活跃火灾卫星信息。这三个数据集涵盖了2012年1月至2023年12月的12年期间,因此代表了不同类型的排放。火灾事件会导致空气污染,如补充图2所示,该图展示了2012年至2024年的FIRECOUNT趋势。

研究期间污染物的长期趋势
图1显示了2012年至2024年研究期间污染物的长期趋势。2012年至2024年间的年度火灾计数与PM₂.₅浓度呈中等强度的正相关(r = 0.688),表明火灾活动升高通常与PM₂.₅浓度升高相关。测量和预测的PM₂.₅数据都呈现出类似趋势,支持生物质燃烧导致颗粒物污染的观点。尽管年际变异较大,但与火灾相关的排放是决定PM₂.₅变异性的重要因素,强调了区域性火灾管理以改善空气质量的必要性。补充图3所示的预测PM2.5在30个滞后处的自相关几乎在所有30个滞后处均有显著正自相关,证实德里PM2.5具有强烈的时间依赖性和多日持续性。

figure-protocol-2
图12012年至2024年PM₂.₅及火灾计数的长期趋势。 图1比较了年度火炬计数与观测及预测PM₂.₅浓度的差异。PM₂.₅的单位为μg/m3。FIRECOUNT代表MODIS产品中卫星衍生的火灾活动。 请点击此处查看该图的放大版本。

STL(使用黄土的季节与趋势分解)分解
STL,即使用黄土法进行季节与趋势分解,是一种迭代算法,允许将时间序列数据分解为三个加法成分,如 图2所示:趋势(长期趋势)(图2A)、(图2D)、(图2G)、(图2J)、季节性(周期)(图2B)、(图2E)、(图2H)、(图2K)和剩余部分(噪声/残差)(图2C)。 (图2F)、(图2I)、(图2L)。STL已被证明在处理环境数据(如PM2.5)复杂非线性特性方面取得了成功,许多其他分析技术因季节信号振幅变化和异常值存在而未能实现。LOESS平滑可以精确分离这些成分,从而更清晰地解释趋势或模式。通过STL处理,可以将更广泛的上升PM2.5 趋势与较短的日/季节周期以及这些周期内的不稳定残差区分开来。这种区分有助于识别哪些排放影响了PM2.5,而非气象因素影响了PM2.5。这种分离结果有助于准确预测未来PM2.5 排放;为监管决策提供数据;并符合空气质量研究中时间序列数据严格分解标准34。2012年至2024年间,德里监测站每日PM2.5 浓度测量显示PM2.5 水平变化极小(即2022-24年间无显著变化),且四个监测点间PM2.5 水平的一致性极为有限。Dwarka第8区和Mundka-DPCC的PM2.5 水平呈持续下降趋势(即持续下降),而Anand Vihar呈上升趋势(显著上升),Sonia Vihar则略有上升趋势(自2022年以来的微幅上升)。此外,四个监测站每日PM2.5 浓度的残差表明,PM2.5 浓度受到季节性(气象)变化的强烈影响,导致各站点平均日PM2.5 浓度大幅波动。德里四个监测站(2012–2024年)的每日PM2.5 浓度如 图2所示。

figure-protocol-3
图2:2022年至2024年间,四处德里监测站对PM₂浓度的STL(季节与趋势分解)分析结果。 每个监测站的时间序列被分解为三个加法成分:长期趋势、季节性变异和残差(剩余)。(A)德瓦卡第8区的趋势成分。(B)德瓦卡第8区的季节性部分。(c)德瓦卡第8区的残余成分。(D)Anand Vihar的趋势部分。(E)阿南德维哈尔的季节性部分。(F)阿南德维哈尔的剩余部分。(G)Mundka-DPCC的趋势成分。(H)蒙德卡-DPCC的季节性组成部分。()蒙德卡-DPCC的残余成分。(J)索尼娅·维哈尔的趋势成分。(K) 索尼娅维哈尔的季节性部分。(L)索尼娅·维哈尔的残余成分。STL,季节性和趋势分解,利用黄土。 请点击此处查看该图的放大版本。

图2 展示了2022-2024年四个城市监测点每日PM2.5浓度的时间分解,揭示了长期下降、渐进上升和大幅度日差的模式。这些差异主要归因于天气的物理影响,即行星边界层(PBL)高度的变化,如白天膨胀增加垂直扩散并降低浓度,以及夜间收缩,使污染物靠近地面,夜间形成更高的峰值。其他气象影响来自与其最大流量时段(早晚高峰)、工业相关的局部人类活动排放,以及与:场地特定因素(如局部地形、风速、相对湿度和季节(即冬季相关性更大)的影响,这些因素可能导致站点特有的变化和整体长期下降,这些因素可能受到排放监管控制的影响。 整体趋势下滑。

特征之间的相关性
图3 展示了CORTA-Net模型中使用的所有输入特征的分布情况。在面板中,污染物变量(PM10图3A)、NO₂(图3B)、一氧化碳(图3C)、SO₂(图3D))显示出典型的城市空气质量数据右偏分布,而O₃(图3E)和压力(图3I)则表现出接近正常的模式35。温度(图3F)显示出明显的双峰季节结构,湿度(图3G)呈现广泛均匀分布,风速(图3H)呈现轻尾分布。这些模式凸显了预测变量的异构统计行为,并证明了在模型训练前进行特征工程和归一化的必要性。

figure-protocol-4
图3:CORTA-Net模型中使用的输入特征分布,包括空气污染物浓度和气象变量。 分布展示了预测变量在预处理和模型训练前的统计特征。(A) PM₁₀ 浓度。(B) NO₂浓度。(C)一氧化碳浓度。(D) SO₂浓度。(E) O₃浓度。(F)空气温度。(G)相对湿度。(H)风速。()大气压力。污染变量,尤其是PM₁₀、NO₂、CO和SO₂,表现出典型的城市空气质量数据的右偏分布,而O₃和大气压力则大致呈正态分布。温度呈现双峰季节模式,湿度分布广泛,风速集中于较低值且呈轻尾分布。这些异构特征分布支持在模型开发前使用特征工程和归一化。 请点击此处查看该图的放大版本。

图4 展示了经过CorrXGBoost-Rank预处理后基于XGBoost的特征重要性排名,用于PM₂.₅预测。当前的特征重要性图显示,前一天PM₂.₅是排名最高的预测变量,重要性得分为0.280,其次是PM10 = 0.180,火灾计数 = 0.150,NO₂ = 0.120,CO = 0.080,风速 = 0.070,温度 = 0.040,湿度 = 0.030,年份日期 = 0.020。虚线垂直线代表实际的XGBoost特征选择阈值0.015。重要性评分大于或等于0.015的预测变量被保留用于最终的CORTA-Net输入集,而低于此阈值的预测变量,包括SO₂ = 0.010、O₃ = 0.010、气压 = 0.005、降雨量 = 0.005、周末 = 0.002 和假日 = 0.001,则被排除。这些值代表基于XGBoost增益的特征重要性评分,不应被解释为Pearson相关系数或因果效应。

因此,模型中只包含了那些贡献超过该阈值的特征。XGBoost模型使用一组决策树,这些树通过迭代构建树以最小化损失函数,这种现象称为梯度提升。XGBoost通过三种指标之一来计算特征的重要性:增益(特征分裂对模型性能的提升程度)、权重(该特征被树选择为分裂的次数)或覆盖(分裂影响的观测数量)。XGBoost模型基于与空气质量(污染物、气象变量)相关的数据,重点关注PM2.5的滞后预测,并对PM2.5进行自回归预测,这在德里的PM2.5模型中很常见,有助于捕捉PM2.5的时间持续性。Delhi_PM2.5是一个重要因素,因为细颗粒物具有高自相关性,这也表明来自持续排放源的污染惯性存在。风速是一个重要因素,因为它提供了污染物扩散的机制;而低风则允许冬季逆温时污染物积累。NO2与PM2.5相关,因交通量和排放量,而年份日期则反映污染物的年度排放周期(即周末排放较低)。在德里,由于冬季气象停滞以及车辆、工业和生物质持续排放,PM2.5具有高度自续性。风有助于气溶胶的扩散,但<2米/秒的弱风导致了PM2.5因逆温效应而增加。NO2与PM2.5之间的关系源于它们共同的来源(即燃烧),并受到时间因素的影响(例如,日燃与周燃)36。解释AQI93%或更高变化的四个主要因素是:PM2.5积聚滞后导致的污染物浓度变化(93%+)和低风速导致的排放,车辆和工业排放的NO2/PM,以及日常交通量的波动37。此外,德里的地理环境也是该地区逆温持续存在的一个因素,从而加剧了PM2.5的浓度。超参数调优、正则化以及添加额外变量(如温度)有助于减少过拟合的可能性,并提升整体模型性能。实施减少PM排放的运营策略应包括实施每日PM排放限值、使用实时监测PM存在的设备,以及利用风力将PM通过城市绿地传播

figure-protocol-5
图4基于XGBoost的特征重要性排序,经过CorrXGBoost-Rank特征筛查后,PM₂.₅预测 。预测条按重要性由高至低排列。虚线垂直线代表实际的XGBoost特征选择阈值0.015。最终CORTA-Net输入集保留得分为0.015的预测变量≥,低于该阈值的预测变量被排除。排名用于特征筛选和模型-行为解释,不应被视为因果归因。 请点击此处查看该图的放大版本。

CORTA-net 模型架构
图5 展示了提出的PM2.5 预测框架。 补充图4图5 展示了LSTM单元的内部布局及多头注意力框图的表示。所有数据源(即环境条件、气象观测、火灾活动以及数据的时间和上下文方面)都经过了预处理,以确保它们在时间上一致,必要时已归算任何缺失数据,并且在使用任何模型构建过程中之前,都经过了异常值消除和归一化处理。模型的架构、特征工程、训练配置、数据配置、迁移学习、评估指标、未来预测和实现细节见 补充表1。利用CorrXGBoost-Rank模块,在将部分特征输入LSTM架构之前,先确定最优特征集,LSTM架构通过引入多头注意力层以考虑建模阶段的时间序列行为得到了增强。PM2.5 预测和PM2.5 特征重要性输入特征的重要性,以及多头注意力权重作为注意力地图,均作为输出提供了。内部LSTM单元结构和多头注意力框图分别作为 补充图4和图5包含, 补充表1 则提供了该架构中每种层类型的架构参数。

figure-protocol-6
图5CORTA-Net PM₂.₅预测模型的整体架构。输入预报过程包括空气质量指示器、天气指示器、时间指示器和MODIS(中分辨率成像光谱仪)火灾计数指示器的输入。对于每一步,算法对齐时间戳、处理缺失值、过滤离群值、归一化数据以及工程特征。最终预测变量随后通过CorrXGBoost-Rank过程选出。随后,选定的特征被放入时间序列滑动窗口中,并通过迁移学习通过LSTM(长短期记忆)编码器传递。对于每个特征和时间步,多头注意力机制会在将合并输出发送到最终回归稠密层前应用权重,从而生成PM₂.₅预测。请点击此处查看该图的放大版本。

培训与评估
采用滑动窗口方法形成监督学习序列。训练使用亚当优化器和均方误差损失(补充表2)。模型性能通过RMSE和R2 在训练、验证、测试和交叉验证分区间进行评估。模型的架构、特征工程、训练配置、数据配置、迁移学习、评估指标、未来预测和实现细节均列于 补充表1图6 代表了CORTA-Net PM₂.₅预测模型的训练诊断。在面板中, 图6A 代表训练和验证损失曲线,显示错误递减,最优停止时间点为106。在过拟合分析评估过程中泛化差距的演变,可以通过 图6B中验证数据与训练数据之间的差异来展示。特别地,它显示了散度超过预定界限的时期;这些信息提供了证据,表明学习率行为和损失减少模式说明了在关键时期进行计划学习率(LR)衰减,作为增强收敛稳定性的益处,如 图6C所示。这些数据共同总结了模型的学习动态、泛化能力及推荐的训练配置。

figure-protocol-7
图6CORTA-Net PM₂.₅预测模型的训练诊断。A) 训练和验证损失曲线显示模型训练过程中误差递减,基于验证性能,错误在第106阶段提前停止。(B)跨时代训练与验证损失之间的泛化差距,展示了模型泛化的演变以及潜在过度拟合的发散期。(C)学习率计划,展示计划学习率衰减对整个训练优化的影响。(D) 模型收敛行为总结,展示稳定优化及最终CORTA-Net模型所选训练配置。这些诊断共同展示了模型的动态、收敛特性以及训练期间的泛化表现。请点击此处查看该图的放大版本。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

特征选择与预测结果
CorrXGBoost-Rank程序选择了滞后PM₂.₅、风速、湿度、温度、时间指示器和MODIS衍生火灾作为空气质量的重要预测因子。这些变量分别考虑了污染的持续性、气象条件导致的扩散、污染水平的季节性差异以及火灾带来的区域影响。在序列建模前,已去除冗余变量以减少不必要的输入维度。CORTA-Net 采用平均绝对误差、均方根误差和测定系数进行评估。在德里日数据集中,模型实现了RMSE = 3.19,R2 = 0.983。在每日德里气候训练划分中,模型实现了RMSE = 4.98,R2 = 0.845。在目标测试集散射分析中,观测和预测的PM₂.₅值显示Pearson r = 0.942,R2 = 0.873。这些值代表不同的评估划分,不应被视为可互换的模型范围结果。

图7 现作为CORTA-Net测试数据测试表现的统一可视化表示。时间序列部分显示,测试数据集中实际PM2.5 水平与预测值在评估期间存在极佳相关性,包括排灯节等间歇性高污染事件和作物残渣燃烧事件。支持这一点的是,散点图显示实际值与预测值之间存在强烈线性相关性(皮尔逊的r=0.942,R² =0.873),表明预测准确性极高。

预测表现
残余图显示,误差大致呈正态分布,极端污染峰值期间仅有少数孤立误差。这强烈支持了CORTA-Net模型的统计稳健性和无偏见性。CORTA-Net在每日德里数据集上展示了RMSE为3.19,R²为0.983,在每日德里气候列车数据集上RMSE为4.98,R2为0.844。这些测量结合上述证据,证实CORTA-Net准确模拟了PM2.5水平的渐进趋势和突然偏差。

PM2.5浓度预测准确性通过三种方法进行评估:基于时间的模型预测准确性评估、预测与实际PM2.5浓度的时间相关性评估,以及基于统计分析的误差评估。时间评估比较了PM2.5和PM2.5的预测值(图7A),显示实际测得的PM2.5浓度与模型预测PM2.5浓度之间的关系,并展示了该时期发生的一些显著PM2.5现象(如排灯节和烧秸秆期间)。模型预测的PM2.5浓度与测量PM2.5浓度之间的相关性表明存在极高相关性(Pearson r = 0.942,R² = 0.873),预测PM2.5浓度与实际测量浓度之间高度一致,表明PP-FRC模型是PM2.5浓度的准确可靠预测器(见图7B)。残差的峰度分布(图7C)在孤立高误差天数下表现出较小误差,而残差分布大致为正态(图7D),平均和中位残差误差接近零,表明模型的预测误差无偏且统计学上表现良好。

figure-results-1
图7:CORTA-Net模型在独立测试数据集上的预测表现。PM₂.₅浓度以μg/m为单位报告(A) 观察到与预测PM₂₅浓度的时间比较,显示测量值与模型预测值高度一致,包括在重大污染事件期间。(b) 预测与观测PM₂.₅浓度的散点图,显示出强的预测表现(Pearson r = 0.942;R2 = 0.873)。(C) 测试期间残差(预测误差)的时间分布,表示误差通常较小且高误差事件数量有限。(D) 残差分布,显示出近似正态分布,中心接近零,平均和中位残差接近零,表明预测误差无偏且行为良好。请点击此处查看该图的放大版本。

图7 展示了CORTA-Net在目标测试集上的预测表现。时间序列图显示了观测到的PM₂.₅值与预测值之间的一致性,包括颗粒物浓度升高的时期。散点图显示了预测值与观测PM2.5 值之间的关联。残余图显示,大多数预测误差中心接近零,在高污染时期偏差更大。

交叉验证
十倍交叉验证显示各折叠间的方差有限,在非静止大气条件下表现出鲁棒性。该模型展现了强大的预测能力。预测的PM₂.₅值与观测值高度吻合。残差偏差极小,近似正态。 图8 概述了模型在多种条件下和时间的变化表现,采用RMSE、MAE(平均绝对误差)和R2(确定系数)的十项交叉验证指标。在 图8A图8B中,RMSE和MAE在所有交叉验证训练/验证缺口中表现出低变异性,表明预测准确性稳定。 面板图8C 显示所有交叉验证中R2 值持续偏高(训练时~0.92,验证时~0.89),表明模型在不同交叉验证间具有较高的解释力和极低的模型内方差。 图8D 表明,所有这些指标的平均值几乎没有泛化差距,表明无论数据如何划分,模型表现始终良好。

figure-results-2
图8:采用10折交叉验证的CORTA-Net模型按折叠方式表现。 性能评估采用均方根误差(RMSE)、平均绝对误差(MAE)和确定系数(R2)。误差条表示适用时各折叠的标准差。(A)训练和验证数据集的按折叠计算RMSE值,显示所有折叠中预测误差始终较低。(b)训练和验证数据集的折叠MAE值,表明预测性能稳定,折叠间变化最小。(C)训练和验证数据集的按折叠方式R2值,显示所有交叉验证折叠的持续较高解释力。(D)训练与验证数据集之间的平均性能指标和泛化差距,展示模型性能一致且无论数据分区如何都能实现良好的泛化。请点击此处查看该图的放大版本。

基于注意力的可解释性
采用多头关注来考察哪些近期时间步长和输入变量对PM2.5 预测贡献最为显著。一些关注者强调通过滞后PM2.5 值来记忆短期污染物,而另一些则更重视与扩散相关的气象变量,如风速和湿度。在与区域生物量燃烧影响相符的污染事件中,火灾计数变量也受到了更密切的关注。这些注意力图应被解读为模型行为的指标,而非因果解释。结果表明,该模型在预测时同时使用了近期污染物历史和环境协变量。

模型配置特征选择迁移学习多头注意力射击计数输入RMSE ↓MAE ↓R² ↑
LSTM基线7.565.520.905
+ CorrXGBoost-Rank是的4.243.100.970
+ 迁移学习是的是的3.892.840.975
+ 多头注意力是的是的是的3.482.540.980
完整的CORTA-Net是的是的是的是的3.192.330.983

表3:CORTA-Net的分量消融分析。 表3通过移除或更改一个或多个组件并测量性能变化,评估系统中的每个架构元素。这表明哪些架构组件最有效,确认架构决策,并展示各组件如何相互作用以提升网络的准确性、鲁棒性、效率和整体效能。

表3 展示了CORTA-Net的成分逐项消融分析。LSTM基线得RMSE = 7.56,MAE = 5.52,R2 = 0.905。加入CorrXGBoost-Rank功能选择后,RMSE降至4.24,表明去除冗余且相关性较弱的预测变量提升了预测性能。迁移学习进一步将RMSE降至3.89,表明预训练的时间表示提升了模型稳定性。通过使用多头注意力,RMSE从3.48降至3.19,从而将R2 值从0.980提升至0.983,表明通过使用特征和时间级权重配合CORTA-Net模型的其他组成部分(如CorrXGBoost-Rank、转移学习、多头注意力和MODIS火力计数输入)在时间预测方面取得了显著提升。总体而言,这些改进展示了特征选择、时间迁移学习、基于注意力的序列加权和火灾活动对CORTA-Net模型实现和性能的贡献。

功能选择时间序列建模迁移学习基于注意力的模型行为分析火灾活动输入主要作用
没有明确的CorrXGBoost排名经典非线性机器学习基线
仅基于内部树的重要性表格预测器的梯度提升基线
是的复发性颞部基线
是的是的基于注意力的循环基线
是的是的是的是的是的拟议的混合预测框架

表4:CORTA-Net与基线预测模型的主要区别。 表4显示,目前用于预测的模型是CORTA-Net,它允许更先进的技术提取时间特征,并利用基于重要因素自适应关注的能力,从而从时间序列数据集中捕捉复杂的时间模式。CORTA-Net动态地学会了如何关联多种不同时间尺度,从而获得比传统基线预测技术更高的整体准确性、鲁棒性和概括能力。

CORTA-Net方法与比较基线模型之间的差异见 表4。Random Forest 和 XGBoost 可用于提供非线性机器学习基线方法,但缺乏对顺序依赖关系的直接建模。LSTMs被用作循环时间基线方法,而Attention-LSTM则通过迁移学习或整合火力活动,提供基于注意力的加权,无需明确筛选特征。相比之下,CORTA-Net将之前基线的四个方面整合到一个预测流程中:(1)CorrXGBoost-Rank特征选择;(2)迁移学习LSTM编码;(3)多头注意力;(4)和MODIS导出的火灾数据也算作输入数据。

基线比较
除了定量基线比较(分别提供均值折叠差、标准误和95%置信区间)外,作者还通过其注意力机制评估了CORTA-Net的内部运作。每个输入特征(按时间步和多个注意力头分配的注意力权重)如 图9所示。 在图9A中, 该组展示了分配给某一个测试数据集实例的代表性注意力权重分布。如图所示,尽管某些输入特征(如PM2.5在t-1、t-2和t-3)的相对权重低于其他预测变量,但它们仍获得最高的关注和权重,表明CORTA-Net更关注短期时间依赖性而非长期记忆依赖性。 在图9B中,研究人员对所有测试样本中所有输入特征在预测德里PM2.5 时的相对重要性进行了汇总评估;滞后的PM2.5、风速、温度和火灾计数被认为是最重要的预测输入特征。在 图9C中,作者展示了CORTA-Net的多头注意力模式,每个头捕捉输入特征间不同但互补的时间和/或特征层面关系,从而使其能够学习更丰富的输入特征表征。 在图9D中,作者展示了注意力随时间的步进流动,相对于PM10,展示了注意力如何随时间变化,基于PM10 水平。虽然注意力权重可以被解读为CORTA-Net处理顺序提供环境数据的总体模式,以及其对每个顺序提供的特征的优先排序,但注意力权重并不能直接证明因果关系。然而,他们未能揭示CORTA-Net流程如何顺序提供环境数据,从而提升了其预测的可解释性(补充表3)。

figure-results-3
图9:基于注意力的CORTA-Net模型行为可视化。 注意力权重的展示旨在说明模型在预测过程中如何将注意力分布于输入特征和时间步,应将其解读为模型行为的指标,而非因果关系的证据。(A) 单实例注意力图,显示单个预测的输入特征和近期历史观察值的注意力权重。(b) 基于测试数据集中的注意力权重进行特征重要性汇总,突出每个输入变量对PM₂.₅预测的相对贡献。(C) 多头注意力模式,展示不同注意力头如何捕捉互补的特征和时间层表征。(D)时间注意力分布,显示预测过程中历史时间步长的相对重要性。总体而言,滞后PM₂.₅、FIRECOUNT、风速(WDS)、湿度和温度获得了最高关注权重,显示其在模型预测过程中的重要性。 请点击此处查看该图的放大版本。

补充图6A–B 比较了使用MAE、RMSE和R2的CORTA-Net与基线模型。较低的MAE和RMSE值表示预测误差较低,而较高的R2 表示方差解释更充分。CORTA-Net在同一实验划分下显示的预测误差低于评估基线模型。然而,比较应在所选德里监测站数据集和同一预处理流程内进行解释。 补充图7 总结了CORTA-Net和基线模型在报告指标上的相对排名。 补充图8 突出了影响模型性能的主要组成部分,包括特征选择、迁移学习、时间序列建模和多头注意力。

对CORTA-Net与部分基线模型性能的比较评估见 补充图7A–C ,使用雷达图绘制了唯一在所有测量区域(反RMSE、倒MAE和R2 值)上测量高于或低于对应模型的模型。CORTA-Net在 补充图7B中获得最佳整体排名,同时在多个其他测量指标中位列前列。 补充图7C 展示了CORTA-Net与多重基线之间的性能提升,显示相较本研究基线有显著提升。RMSE改善最显著(22.8%),其次是MAE(24.1%)和R2 值(解释各结局方差时增加39.3%至72.2%)。CORTA-Net的总结框概述了其优势。这些包括多头关注评估重要性的能力、传感器数据的时间融合以预测未来污染物、对污染事件变化(例如暴风雨)的抵抗力,以及在跨职能环境中所有成功衡量指标中保持一致的表现。基于预测能力,CORTA-Net 的表现优于所有现有深度学习模型。

数据可用性:
本研究中的空气质量数据来自中央污染控制委员会和德里污染控制委员会(如有)公开监测。气象数据来源于印度气象局的记录或相应的公共气象数据来源。卫星来源的火灾计数数据来源于MODIS主动火产品。报告中,已处理的数据集、选定特征列表、归一化参数及复现报告实验所需的代码可通过手稿仓库链接 https://github.com/saravagnamahasiva/CORTA-Net 获取。 该手稿通过清晰识别数据源、预处理步骤、特征选择阈值、模型组件、评估分区及报告指标,强调了可重复性。该模型通过按时间顺序的训练、测试和验证分区进行评估。预处理参数从训练数据中得出,然后应用于测试和验证数据。结果以各自划分的特定发现形式提供,避免更笼统的主张。

补充图1:德里研究区地图。 德里研究区域地图显示了本研究中包含的四个空气质量监测站(Dwarka Sector 8、Anand Vihar、Mundka-DPCC和Sonia Vihar)的位置,用于PM₂.₅数据收集和模型开发。请点击这里下载此文件。

补充图2:2012–2024年年度FIRECOUNT趋势。 火灾事件导致空气污染,正如2012年至2024年FIRECOUNT趋势所示。请点击这里下载此文件。

补充图3:PM₂.₅小时自相关函数(ACF)图。预测PM2.5在30个滞后点的自相关显示出几乎所有延迟处的强烈正自相关,证实德里PM2.5表现出强烈的时间依赖性和多日持续性。请点击这里下载此文件。

补充图4:LSTM单元的内部结构。LSTM(长短期记忆)网络通过调节信息流,通过专用单元状态(充当记忆输送带)来解决标准循环神经网络(RNN)的长期依赖问题。请点击这里下载此文件。

补充图5:多头注意力框图。多头注意力通过将输入拆分为多个头来扩展自我注意力,使模型能够捕捉多样的关系和模式。请点击这里下载此文件。

补充图6:CORTA-Net与基线预测模型的整体性能比较。模型性能通过平均绝对误差(MAE)、均方根误差(RMSE)和确定系数(R2)进行评估。较低的MAE和RMSE值表示预测误差较低,而较高的R2值则表示方差解释更充分。(A) 基于MAE、RMSE和R2指标评估的基线模型与CORTA-Net的比较性能。(B)整体比较,突出同一实验数据分区下被评估模型的相对预测表现。CORTA-Net 实现了比评估基线模型更低的预测误差和更高的解释性能。请点击这里下载此文件。

补充图7:使用多种评估指标对CORTA-Net模型与基线模型的性能比较分析。A)基于反RMSE、倒MAE和R2的标准化模型性能进行雷达图比较,展示CORTA-Net在评估指标上的整体优势。(B)CORTA-Net相较于基线模型的相对性能排名,突出其持续排名第一的表现。(C) CORTA-Net相较评估的MAE、RMSE和R2基线模型提升百分比,预测准确性和解释方差显著提升。(D) 总结CORTA-Net的关键特征,强调其多头注意力机制、时间特征融合、对污染事件的鲁棒性,以及在所有评估指标上持续优异的预测表现。请点击这里下载此文件。

补充图8跨时代的训练与验证损失比较。 这证明了模型的渐进收敛和稳定推广,且过拟合最小。请点击这里下载此文件。

补充表1:拟议的CORTA-Net模型架构。 CORTA-Net架构概述,包括每个网络组件、层规范、激活函数,以及用于PM₂.₅预测的可训练参数数量。请点击这里下载此文件。

补充表2:拟议CORTA-Net模型的超参数设置和训练配置。 架构设计、超参数设置、训练配置、特征工程策略、数据预处理、迁移学习设置及用于开发和优化模型的评估参数总结。请点击这里下载此文件。

补充表3:拟议模型与基线预测方法的性能比较。 在特征选择、注意力机制、迁移学习以及使用RMSE、MAE和R2测量的预测性能方面,比较传统机器学习和深度学习模型与所提出框架。请点击这里下载此文件。

补充表4:以往PM₂.₅预测研究与拟议方法的比较。 代表性PM₂.₅预报研究摘要,重点介绍其方法论、数据集、关键输入特征、火灾活动的纳入、预测性能、可解释性、报告的局限性,以及拟议的CORTA-Net框架如何应对这些局限。请点击这里下载此文件。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

CORTA-Net 将三个关键组件按顺序组合,形成混合架构。CorrXGBoost-Rank:一个定制特征选择组件,可在时间建模阶段38前消除冗余预测变量。LSTM编码器:使用堆叠的LSTM层捕捉选定24小时输入序列39中的短期和长期时间依赖关系。多头注意力层:应用于LSTM输出(及其关注权重),作为CORTA-Net混合序列模型的最后一步;增强了最终输出的可解释性,同时不取代主LSTM骨干网40的角色。LSTM编码器从选定的滑动窗口序列中学习时间依赖关系。CORTA-Net 旨在提供一种混合序列建模方法,CorrXGBoost-Rank 修剪冗余预测变量。多头注意力层提供了所有LSTM输出的加权聚合,并生成PM2.5 预测及相关的注意力权重。CORTA-Net的三个组成部分与纯变换器架构有显著不同,而CORTA-Net采用LSTM(循环)网络来建模序列学习,循环网络是顺序学习的主要基础,注意力则作为解释机制。

CORTA-Net框架有四个主要局限性。首先,模型的评估基于德里各地的多个监测站,因此性能可能无法推广到不同排放源、气候条件或监测密度/配置等城市。其次,虽然卫星数据中的火灾计数可以作为火灾变量的代理,但它们可能无法完整反映火势强度、羽流运输或化学转化情况。第三,单向传感器、缺失数据以及单个监测站或倾向监测网络的变化,都会影响时间序列数据的质量和可靠性。第四,虽然关注具有信息价值,但并不意味着存在因果关系。进一步评估还需要在其他独立城市中使用CORTA-Net,并增加监测网络。为了通过新技术提高区域空气污染运输估算的准确性,研究人员开发了一个交通感知框架。该框架整合了额外数据,如从气象和遥感数据集中提取特征、数据质量控制、近实时数据摄取、不确定性估计以及频繁的模型重新校准41。研究团队开发了一套全面的计算工具套件来解决这些问题,包括用于模型训练和参数调优的自适应优化器、利用现有数据提升预测能力的转移学习、序列时间序列建模技术、基于注意力的建模以及模型可解释性。此外,将可解释的人工智能整合进CORTA-Net框架,使预测数据与对空气污染主要成因的科学知识直接结合起来。例如,可解释人工智能可以识别季风后期发生的火灾活动是否是空气污染的重要来源。模型性能的交叉验证(德里RMSE = 3.19,R2 = 0.983)证实了CORTA-Net的有效性,而基于注意力的模型输出可视化显示,可以观察到决策者和公共卫生从业者感兴趣的模式。最后,将火灾计数和非受控排放数据作为CORTA-Net框架的输入,本质上会降低结果在其他地区的推广性,因为使用快速或监测不力的源可能会严重干扰CORTA-Net42框架的实施。

图10所示的图形表示使决策者和研究人员能够可视化使用不同PM₂.₅预测方法开发的模型/系统之间的关系,其中颜色编码的条代表RMSE(短条=更高的准确性)和R2(较长的柱=考虑更大的变异性),模型按方法(城市聚合、站点特定、多变量系列)组织。深度的图形表示表明,没有单一模型在所有类别中可预测地优于所有类别;CORTA-Net在城市、高噪声、站点级数据集中表现优于类似模型,且具有显著局部变异性,而MxConnect在空间较粗糙的数据集中通常表现优于区域平均,说明了根据数据规模(即数据集规模)、数据集空间分辨率(即拥堵程度)、数据集噪声水平(即, 准确性)或局部方差。实际上,CORTA-Net的独特之处在于其利用嵌入于循环顺序注意力机制中的自适应特征加权,在时间处理过程中动态减权冗余输入或具有高随机噪声的输入。这通过在定制的注意力门槛设计中嵌入自适应特征权重实现,而与目前大多数方法不同,这些方法在模型作为预处理步骤前大量依赖静态启发式方法(即相关性或主成分分析阈值)进行(见图10A)。CORTA-Net采用的这种自适应、上下文敏感的优先级化方法,能够实时调整城市组织中的局部动态,在这些情况下,使用全球训练数据集设计的简单且较简单模型可能在国家级平均值上获得更优的预测结果。图10B中展示的比较图形显示共同识别了模型基准测试之间的关系,为研究人员和决策者提供了选择模型以适应其具体应用的方向(即可能发现与PM₂短期预测相关的额外研究方向)

figure-discussion-1
图10CORTA-Net与基线预测模型的预测表现比较。模型性能通过平均绝对误差(MAE)、均方根误差(RMSE)和确定系数(R2)进行评估。较低的MAE和RMSE值表示预测准确性较好,而较高的R2值表示解释方差较大。(A)基于MAE、RMSE和R2对所有评估模型的比较性能,提供预测准确性和模型拟合度的整体评估。(B)表现最佳模型的性能比较,突出CORTA-Net和基准方法的相对优势与局限性。总体而言,比较展示了CORTA-Net的竞争性能,同时便于直观地评估不同模型架构用于PM₂.₅预测。请点击此处查看该图的放大版本。

比较显示,CORTA-Net 是一个混合型 PM₂.₅ 预测工作流,而非独立的变压器架构补充表 4)。新的变换器架构已展现出学习长程时间依赖关系的强大能力,但混合CNN-RNN和变换器-LSTM架构通过利用每种神经架构的优势提升预测效率(如表5所示)。与CORTA-Net不同,许多现有的混合CNN-RNN和变压器-LSTM模型依赖序列模型从完整输入特征集中学习,而非在时间建模前进行显式特征筛选,而CORTA-Net则利用外部MODIS火控计数数据来模拟生物质燃烧影响。CORTA-Net利用注意力权重评估每个预测变量在累计预测变量贡献中的关系(即时间汇总加权),其三个不同阶段均对CORTA-Net的总误差贡献,其中三者组合在德里监测站数据集中误差最低,见评估43.总之,CORTA-Net的实际贡献是可重复地整合了短期PM₂.₅预测的四个相关领域:特征选择、时间迁移学习、外部火灾活动丰富和基于注意力的可解释性。按模型和数据源分组结果(ERA5 全球再分析至多变量城市特定城市)(见图10),研究人员能够轻松比较每个模型的性能与八个关键变量之间的关系,这些变量影响了模型对 PM₂.₅ 浓度的整体预测效果。

主要模型组件报告的最佳数值结果与CORTA-Net的主要区别
ARIMA用于线性成分,CNN-LSTM用于非线性成分,粪甲虫优化器用于超参数调谐RMSE = 7.594、14.940、7.841和5.496;MAE = 5.285、10.839、5.120和3.770;R² = 0.989、0.962、0.953 和 0.953,跨越四个城市强混合AQI模型,但侧重于AQI和模型优化;它不包含显式的CorrXGBoost排名筛查或MODIS火力计数集成
变换器编码器,BiLSTM译码器,基于SHAP的解释北京:RMSE = 3.0012,MAE = 1.7928,R² = 0.9694;天津:RMSE = 4.4785,MAE = 3.1614,R² = 0.9621;石家庄:RMSE = 5.1646,MAE = 3.4057,R² = 0.9324捕捉长短期AQI依赖关系,但主要使用污染物浓度数据,不使用MODIS火灾计数变量或预序列CorrXGBoost级降级
LSTM,变换器自注意,粒子群优化最佳季节性设置:R² = 0.98745和0.95655,适用于两个城市;报告的低误差值包括最佳设置下的MAE = 0.83363和RMSE = 1.0176强优化的变压器-LSTM模型,但其主要创新在于基于PSO的优化,而非特征冗余消除和火灾活动富集
CNN-LSTM与Kolmogorov-Arnold网络组件及地理意识上海:RMSE = 1.9222,R² = 0.9832;北京:RMSE = 2.5213,RMSE 比基本 LSTM 低 59.6%具有强烈的地理感知AQI模型,但未具体针对德里PM₂.₅预报,也不包含MODIS对生物质燃烧事件的火灾计数输入
经典机器学习回归器与网格搜索优化GBR:RMSE = 2.31;RF:MAE = 0.47,RMSE = 2.95;XGBR:R² = 0.9781有用的机器学习基准,但模型并不明确表示通过LSTM或注意力的顺序时间依赖
使用麻雀搜索算法优化LSTM;与CNN-LSTM、CNN-BiLSTM和PSO-LSTM相比SSA-LSTM:RMSE = 8.601,MAE = 6.317,R² = 0.946;PSO-LSTM:RMSE = 8.860,R² = 0.944;基线LSTM:RMSE = 12.481,R² = 0.884显示优化LSTM的价值,但不使用多头注意力、迁移学习适应或卫星火灾活动变量
基于簇的欠采样变压器模型,用于不平衡的高污染事件最佳配置:RMSE = 2.080,MAE = 1.386,R² = 0.914对于高事件PM₂.₅的预测表现强劲,但重点在于失衡处理,而非集成特征选择、迁移学习、发数丰富和基于注意力的解释
仅LSTM时间编码器RMSE = 7.56,MAE = 5.52,R² = 0.905在同一德里实验环境中用作内部时间基线
LSTM基于相关和XGBoost的特征选择RMSE = 4.24证明去除冗余和弱预测变量能改善序列学习前的预测
特征选择、迁移学习LSTM和多头注意力RMSE = 3.48,R² = 0.980展示了基于注意力的时间和特征加权的附加价值

表5:CORTA-Net与近期及现有PM₂.₅/AQI预测模型的方法学比较。 所提出的框架与近期基于变压器或混合的PM₂.₅预测方法有根本不同。更强有力地与近期技术水平进行比较。

本研究的关键贡献是一种名为CORTA-Net的混合深度学习方法,它为预测印度新德里短期PM2.5 浓度提供了一种综合方法,该市拥有复杂的建筑环境。CORTA-Net 不依赖由三个独立组件组成的分叉模型(基于 CorrXGBoost-Rank 的特征选择模块以最小化冗余;通过迁移学习增强的 LSTM 以编码时间依赖的非平稳性;以及多头注意力机制以实现可解释的长短期预测),CORTA-Net 采用基于流水线的方法协同整合这些组件。该框架整合了气象变量、MODIS火灾计数和环境空气质量数据,试图更全面地反映导致PM2.5 污染的因素。CORTA-Net在采用严格评估指标(包括高R2 值0.983)和低RMSE值(3.19)的情况下,表现显著优于既有基线(随机森林、XGBoost、LSTM和基于注意力的LSTM)。这些研究表明,CORTA-Net的所有元素都显著提升了模型性能。CORTA-Net的多头注意力机制为本研究提供了额外价值,因为它显示主要预测因素为近期PM2.5 测量、火灾计数和气象测量,这与已知的大气过程高度吻合,并为该模型提供了有意义的解释性。

尽管结果令人鼓舞,作者也承认存在一些局限,包括地理限制(仅限新德里)以及仅依赖MODIS火灾作为RS数据的热代理。未来研究将重点验证CORTA-Net在多种城市地区的表现,以及将交通感知特性(如边界层高度和风向轨迹)纳入建模过程,以提高普适性。尽管如此,作者认为CORTA-Net是一个高度可行、可重复且可解释的框架,支持数据驱动的政策制定和预警系统。CORTA-Net在数据丰富但复杂的新德里城市环境中取得强劲表现的能力表明,CORTA-Net已准备好广泛实施,从而为制定城市空气质量预测新标准奠定基础。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者之间没有利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

努拉·本特·阿卜杜勒拉赫曼公主 研究员 支持项目编号(PNURSP2026R300),努拉·本特·阿卜杜勒拉赫曼公主大学,沙特阿拉伯利雅得。

材料

本文使用的材料清单
姓名公司目录编号评论
Calibri字体Microsoft CorporationURL: https://learn.microsoft.com/en-us/typography/font-list/calibri用于作为修正后的图形图表和标签的请求基础字体。
CORTA-Net图形生成脚本此CORTA-Net项目的自定义脚本URL: https://github.com/saravagnamahasiva/CORTA-Net用于重新生成带有修正标签和顺序的出版质量的图形PDF。
CORTA_Net_High_Resolution_Images.zip用户提供的项目图像存档目录号/RRID: 不适用;本地源存档用作源/参考图像集和确定图形身份。
GitHubGitHub, Inc.URL: https://github.com/用作项目代码和图形生成文件的预期存储库主机。
MatplotlibMatplotlib开发团队RRID: SCR_008624; URL: https://matplotlib.org/用于重绘图表、图形、标签、面板标记和矢量PDF图形。
NumPyNumPy开发者RRID: SCR_008633; URL: https://numpy.org/用于在重新生成的图形面板中的确定性数组和模拟值。
OpenAI CodexOpenAIURL: https://openai.com/codex用于辅助代码编辑、图形重生成、PDF打包和验证。
PillowPillow贡献者URL: https://python-pillow.org/用于检查、调整大小、预览和验证光栅图像输出。
PopplerPoppler开发者/freedesktop.orgURL: https://poppler.freedesktop.org/用于将生成的PDF渲染为PNG预览以进行视觉质量检查。
pypdfpypdf贡献者URL: https://pypdf.readthedocs.io/用于验证每个最终图形PDF是否包含一个有效页面。
PythonPython软件基金会RRID: SCR_008394; URL: https://www.python.org/用作图形生成和PDF处理的编程环境。
ReportLabReportLab Inc.URL: https://www.reportlab.com/用于创建必需的材料/工具/软件表作为PDF工件。
Windows PowerShellMicrosoft CorporationURL: https://learn.microsoft.com/en-us/powershell/用于文件编排、存档提取和最终ZIP打包命令。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

234 234

相关文章