CORTA(相关性优化排序迁移注意力)网络,一种用于德里地区短期PM₂.₅预测的混合深度学习框架。该模型结合了CorrXGBoost-Rank特征选择、基于长短期记忆网络的迁移学习以及多头注意力机制,以实现对时间和特征层面的解释,并利用空气质量、气象以及卫星反演的火点数数据来提升PM2.5 的预测精度。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
CORTA(相关性优化排序迁移注意力)网络,一种用于德里地区短期PM₂.₅预测的混合深度学习框架。该模型结合了CorrXGBoost-Rank特征选择、基于长短期记忆网络的迁移学习以及多头注意力机制,以实现对时间和特征层面的解释,并利用空气质量、气象以及卫星反演的火点数数据来提升PM2.5 的预测精度。
在德里,由于颗粒物浓度受到本地排放、气象变化、季节性停滞以及偶发性火灾相关污染的共同影响,PM2.5 的短期预测具有挑战性。本研究提出了一种名为CORTA-Net的混合深度学习框架,利用2012年至2024年的多源环境数据进行PM2.5预测。输入数据包括来自中央污染控制委员会(CPCB)和德里污染控制委员会(DPCC)监测站的逐小时空气质量观测数据、印度气象局(IMD)提供的气象变量,以及来自MODIS(中等分辨率成像光谱仪)产品的卫星反演火灾计数信息。该框架首先采用CorrXGBoost-Rank特征选择方法,减少冗余预测变量,保留重要的污染物、气象、时间及与火灾相关的变量。所选特征随后被组织为有监督的滑动窗口序列,并通过基于迁移学习的LSTM编码器处理,再经由多头注意力层进行建模。该注意力机制可对PM2.5预测结果在特征层面和时间步层面提供解释性分析。CORTA-Net通过按时间顺序划分的训练、测试与验证集以及交叉验证方法进行了评估。与随机森林、XGBoost、LSTM和带注意力机制的LSTM等基线模型相比,该框架在德里监测站场景下的预测误差更低。CORTA-Net的创新之处在于将显式的CorrXGBoost-Rank特征筛选、基于迁移学习的时间编码、MODIS火灾活动数据融合以及基于多头注意力机制的模型行为分析整合到一个可重复的PM2.5预测流程中。在实际应用中,该框架可用于具备丰富监测数据的城市环境中的短期空气质量预测,前提是污染物记录、气象观测数据和火灾活动指标均可获取。
空气动力学直径 ≤ 2.5 µm 的细颗粒物(PM2.5)是德里空气质量的重要关注点,因其受到本地排放1,2,3、区域输送4、季节性气象条件5以及偶发性生物质燃烧事件6的影响。在季风后和冬季期间7,低风速8、浅薄的边界层条件9以及逆温现象会降低污染物的扩散能力,导致颗粒物累积增加。由于时间序列本身具有非线性、季节性以及突发性高污染等特征,短期 PM2.5 预报具有挑战性10。以往关于 PM2.5 预报的研究已采用统计模型、机器学习模型和循环神经网络模型11。统计方法有助于识别数据的趋势和季节性特征12,但可能无法充分刻画污染物与气象因素之间存在的非线性相互作用13。随机森林和 XGBoost 等机器学习模型可用....
访问受限。请登录或开始试用以查看此内容。
方法
构建了一个有监督的滑动窗口模型,用于根据之前每小时的观测值预测 t + 1 时刻的未来 PM2.5 值。通过验证性能评估了 12、24 和 48 个时间步长的候选输入窗口长度,最终 CORTA-Net 模型采用 24 小时的输入序列。使用线性插值填补缺失值;采用 IQR 方法剔除异常值;在生成滞后 PM2.5 特征之前,对所有变量进行最小-最大归一化处理。随后应用 CorrXGBoost-Rank 方法进行特征选择。首先,通过皮尔逊相关性筛选保留 |r| ≥ 0.30 的变量;其次,过滤掉两两相关性 |corr(xi, xj)| ≥ 0.85 的高度冗余特征对,以降低多重共线性;第三,对剩余变量训练 XGBoost 回归模型,并保留基于 XGBoost 增益的重要性评分 ≥ 0.015 的预测变量作为最终模型的输入。最终的 CORTA-Net 架构包括用于时间编码的堆叠 LSTM 层、用于特征和时间步级别加权的多头注意力层,以及用于 PM2.5 估算的全连接回归层。模型使用 Adam 优化器,以均方误差损失函数进行训练,并采用早停法。通过训练集、验证集、测试集以及 10 折交叉验证的 RMSE 和 R2 对模型性能进行评估。表 2 展示了数据预处理与特征工程的总结。
访问受限。请登录或开始试用以查看此内容。
特征选择与预测结果
CorrXGBoost-Rank 方法选取了滞后的 PM₂.₅、风速、湿度、温度、时间指标以及 MODIS 反演的火灾次数作为空气质量的重要预测因子。这些变量分别反映了污染的持续性、气象条件导致的污染物扩散、污染水平的季节性差异以及火灾带来的区域影响。在序列建模前,冗余变量已被剔除,以降低不必要的输入维度。CORTA-Net 模型采用平均绝对误差、均方根误差和决定系数进行评估。在德里每日数据集上,模型达到 RMSE = 3.19 且 R2 = 0.983;在德里每日气候训练子集上,模型达到 RMSE = 4.98 且 R2 = 0.845。在目标测试集的散点分析中,观测值与预测的 PM₂.₅ 值之间的皮尔逊相关系数 r = 0.942,R2 = 0.873。上述数值对应于不同的评估子集,不应视为可互换的整体模型结果。
图7 目前作为 CORTA-Net 在测试数据上测试性能的统一可视化展示。时间序.......
访问受限。请登录或开始试用以查看此内容。
CORTA-Net 通过将三个关键组件按顺序组合,形成一种混合架构。CorrXGBoost-Rank:一种定制的特征选择组件,在时间建模阶段之前消除冗余预测变量38。LSTM 编码器:使用堆叠的 LSTM 层来捕捉所选 24 小时输入序列中的短期和长期时间依赖性39。多头注意力层:作为 CORTA-Net 混合序列模型的最后一步,应用于 LSTM 的输出(及其对应的注意力权重);在不取代主干 LSTM 核心作用的前提下,增强最终输出的可解释性40。LSTM 编码器从选定的滑动窗口序列中学习时间依赖关系。CORTA-Net 旨在提供一种混合序列建模方法,其中 CorrXGBoost-Rank 用于剪枝冗余预测变量。多头注意力层对所有 LSTM 输出进行加权聚合,生成 PM2.5 预测结果及相应的注意力权重。CORTA-Net 的这三个组件与纯 Transformer 架构有显著区别:CORTA-Net 采用 LSTM(循环)网络进行序列学习建模,循环网络构成了序列学习的主要基.......
访问受限。请登录或开始试用以查看此内容。
沙特阿拉伯利雅得公主诺拉·宾特·阿卜杜勒拉赫曼大学研究人员支持项目编号(PNURSP2026R300),公主诺拉·宾特·阿卜杜勒拉赫曼大学,沙特阿拉伯利雅得。
....访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Calibri 字体 | Microsoft Corporation | URL: https://learn.microsoft.com/en-us/typography/font-list/calibri | 用作校正后图表图示和标签的指定基础排版字体。 |
| CORTA-Net 图表生成脚本 | 本 CORTA-Net 项目专用的自定义脚本 | URL: https://github.com/saravagnamahasiva/CORTA-Net | 用于重新生成具有正确标签和顺序的出版级质量图表 PDF 文件。 |
| CORTA_Net_High_Resolution_Images.zip | 用户提供的项目图像归档文件 | 目录编号/RRID:不适用;本地源归档 | 用作原始参考图像集,并用于确定图表身份。 |
| GitHub | GitHub, Inc. | URL: https://github.com/ | 用作项目代码和图表生成文件的预定代码仓库托管平台。 |
| Matplotlib | Matplotlib 开发团队 | RRID: SCR_008624; URL: https://matplotlib.org/ | 用于重绘图表、示意图、标签、面板标记以及矢量 PDF 图形。 |
| NumPy | NumPy 开发者 | RRID: SCR_008633; URL: https://numpy.org/ | 用于在重新生成的图表面板中生成确定性数组和模拟数值。 |
| OpenAI Codex | OpenAI | URL: https://openai.com/codex | 用于辅助代码编辑、图表再生、PDF 打包及验证工作。 |
| Pillow | Pillow 贡献者 | URL: https://python-pillow.org/ | 用于检查、调整大小、预览和验证光栅图像输出。 |
| Poppler | Poppler 开发者 / freedesktop.org | URL: https://poppler.freedesktop.org/ | 用于将生成的 PDF 渲染为 PNG 预览图,以进行视觉质量检查。 |
| pypdf | pypdf 贡献者 | URL: https://pypdf.readthedocs.io/ | 用于验证每个最终图表 PDF 文件是否仅包含一个有效页面。 |
| Python | Python 软件基金会 | RRID: SCR_008394; URL: https://www.python.org/ | 用作图表生成和 PDF 处理的编程环境。 |
| ReportLab | ReportLab Inc. | URL: https://www.reportlab.com/ | 用于创建必需的材料/工具/软件表格作为 PDF 产物。 |
| Windows PowerShell | Microsoft Corporation | URL: https://learn.microsoft.com/en-us/powershell/ | 用于文件编排、归档解压以及最终 ZIP 打包命令。 |
访问受限。请登录或开始试用以查看此内容。