需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

深度学习模型复杂度在有色金属价格预测中的比较评估

88 次观看

DOI:

10.3791/71032

2026年6月5日

本文内容

摘要

对13种金属价格预测架构的系统性重新评估表明,一种简单的门控循环单元优于更复杂的混合模型。在铜数据上训练并在铝和锌数据上测试的模型表现出持续较高的预测准确性,支持在大宗商品价格预测中采用简约方法。

摘要

本研究探讨了增加模型架构复杂性是否能够提高基于深度学习的金融模型的预测准确性。使用2015年1月至2025年9月期间上海有色金属市场铜(Cu)、铝(Al)和锌(Zn)的每日现货价格数据,应用了标准化的预处理流程,包括z-score归一化和滑动窗口序列构建(窗口长度=30,预测步长=1)。系统评估了共十八种模型,包括门控循环单元(GRU)、长短期记忆网络(LSTM)、卷积神经网络–双向LSTM–注意力机制混合模型(CNN–BiLSTM–Attention),以及传统计量经济学模型(自回归积分滑动平均模型和广义自回归条件异方差模型)、机器学习模型(随机森林和极端梯度提升)和基于Transformer的模型。所有深度学习模型均仅在Cu数据上进行训练,并在独立的Al和Zn数据集上进行评估,以检验其泛化能力。结果表明,标准GRU模型在Cu测试集上取得了最低的误差率(平均绝对误差[MAE] = 1032.85;均方根误差 = 1344.30)和最高的解释力(决定系数[R2] = 0.907),同时在Al(MAE = 167.51,R2 = 0.918)和Zn(MAE = 254.23,R2 = 0.952)上也表现出色。消融分析显示,添加注意力机制、双向层和卷积模块等架构组件会降低预测准确性。采用Diebold–Mariano检验进行的统计测试表明,大多数性能差异具有显著性(p < 0.05)。这些发现凸显了不必要的模型复杂性的局限性,并支持在大宗商品价格预测中采用更简单且稳健的方法。

引言

全球有色金属市场——包括铜(Cu)、铝(Al)和锌(Zn)——是世界经济的关键支柱。这些金属在建筑、制造、交通以及快速发展的绿色能源基础设施中具有基础性作用1,4。因此,其价格动态表现出高度波动性,受宏观经济力量、地缘政治紧张、供应链中断、投机性金融活动以及与能源市场的关联等多重复杂因素共同驱动3,4。准确的价格预测不仅具有学术意义,更是各国政府(战略资源安全)、矿业公司(生产规划)、工业用户(采购决策)和金融机构(风险管理与交易)面临的迫切实际需求5,6

对预测准确性的追求推动了方法论的演进。传统的计量经济学方法——自回归积分滑动平均模型(ARIMA)和广义自回归条件异方差(GARCH)模型——长期以来被用于捕捉线性依赖关系和波动率聚集效应7,8。然而,这些方法在处理非线性、非平稳以及高频噪声时往往表现不佳9。机器学习(ML)技术,如支持向量机和随机森林,通过建....

访问受限。请登录或开始试用以查看此内容。

方案

本研究未涉及人类参与者或脊椎动物实验对象。所使用的所有数据均为来自SMM的公开商品价格序列,无需伦理审批。因此,本研究无需也不曾申请伦理批准。

本部分阐述了为实证检验核心假设而实施的全面且严谨的研究设计。内容详细说明了所评估的十三种深度学习模型的数学表达形式与架构细节、精确的训练方案以及正式的评估指标。整体方法学流程在图1中以图示形式进行了概括。

多变量序列预测;CNN-RNN 模型示意图;包含铜、铝、锌的预测输出。
图 1:研究方法的示意图概述。 该图展示了完整的实验流程,包括数据划分、仅在铜价格序列上进行模型训练、在铜测试集上进行评估,以及在独立的铝和锌序列上进行样本外验证。虚线反馈回路表示为分析各个架构组件的贡献而进行的结构化消融实验。

访问受限。请登录或开始试用以查看此内容。

结果

本部分根据第3节所述的严格方法,对13种深度学习模型及额外的基线模型进行了全面的实证评估。分析分为四个部分:(1)数据集的描述性概述;(2)在独立保留的铜(Cu)测试集上对模型性能进行主要基准测试,包括拟合情况和训练动态的可视化诊断;(3)详细的消融研究,以分解架构复杂性对模型性能的影响;(4)在独立的铝(Al)和锌(Zn)价格序列上对模型泛化能力进行关键性测试。

完整数据集包含 2,602 条每日观测记录(2015-01-05 至 2025-09-12)。时间序列划分如下:训练集 = 前 2,081 条观测记录(索引 0–2080,约 80%),验证集 = 随后的 260 条观测记录(索引 2081–2340,10%),测试集 = 最后的 261 条观测记录(索引 2341–2601,10%)。各划分部分的确切日期边界详见 Zenodo 仓库(https://doi.org/10.5281/zenodo.19976985)。所有划分均遵循时间顺序,未进行任何打乱处理。

表2展示了中国市场上三.......

访问受限。请登录或开始试用以查看此内容。

讨论

所呈现的实证结果 结果 本节为我们的核心研究问题提供了清晰且一致的答案:在现实条件下数据有限(2,602个观测值、单变量输入、单步预测)的每日有色金属价格预测任务中,最简单的深度学习架构——门控循环单元(GRU)——持续且显著地优于一系列更为复杂的模型。这些模型包括混合卷积神经网络(CNN)、双向循环神经网络(RNN)、引入注意力机制的网络,以及多组件“超级混合”模型(如CNN–BiLSTM–Attention),同时也优于传统的计量经济学基线模型(ARIMA和GARCH)、机器学习方法(随机森林和XGBoost)以及标准Transformer模型。16,29,37. DM 检验确认了大多数比较的统计学显著性,且多种子稳健性分析(表7)表明,GRU模型在不同随机初始化下均实现了较低的平均均方根误差(RMSE),且方差较小。通过沿链式结构进行的系统性消融实验(GRU → BiGRU → .......

访问受限。请登录或开始试用以查看此内容。

披露

作者声明,他们不存在可能影响本研究工作报告的任何竞争性财务利益或个人关系。

致谢

本研究未获得外部资金支持。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
数据集每日铜(Cu)现货价格序列 – 三种目标金属之一;也作为多变量输入特征的一部分。上海有色金属市场(SMM),公开可获取SMM价格数据;列名 = Cu;价格类型 = 现货;频率 = 每日;单位 = 人民币/吨;日期范围 = 2015-01-05 至 2025-09-12;RRID:不适用
数据集每日铝(Al)现货价格序列 – 三种目标金属之一;也作为多变量输入特征的一部分。上海有色金属市场(SMM),公开可获取SMM价格数据;列名 = Al;价格类型 = 现货;频率 = 每日;单位 = 人民币/吨;日期范围 = 2015-01-05 至 2025-09-12;RRID:不适用
数据集每日锌(Zn)现货价格序列 – 三种目标金属之一;也作为多变量输入特征的一部分。上海有色金属市场(SMM),公开可获取SMM价格数据;列名 = Zn;价格类型 = 现货;频率 = 每日;单位 = 人民币/吨;日期范围 = 2015-01-05 至 2025-09-12;RRID:不适用
数据集预处理后的多变量金属价格数据集 – 经缺失值处理和滑动窗口构建(L = 30,h = 1)后,按时间顺序排序并清洗的Cu、Al、Zn序列。作者基于SMM数据生成存储于Zenodo知识库(DOI: 10.5281/zenodo.19976985);文件:Data.csv;RRID:不适用
软件Python编程语言 – 用于数据处理、模型实现、评估以及图表生成的主要语言。Python软件基金会 / AnacondaPython 3.10.19;Anaconda发行版;RRID: SCR_008394
软件TensorFlow/Keras – 用于实现GRU、LSTM、BiGRU、BiLSTM、CNN-混合、注意力机制和Transformer模型的深度学习框架。TensorFlow / KerasTensorFlow 2.20.0;RRID: SCR_016345
软件NumPy – 数值数组处理与矩阵运算。开源社区NumPy 1.26.4;RRID: SCR_008633
软件pandas – 数据加载、表格处理及CSV/Excel输出处理。开源社区pandas 2.3.3;RRID: SCR_018214
软件scikit-learn – 评估指标、预处理及机器学习工具。开源社区scikit-learn 1.7.2;RRID: SCR_002577
软件StandardScaler(z-score标准化) – 使用训练集统计信息进行的特征标准化。scikit-learn包含在scikit-learn 1.7.2中;RRID: SCR_002577
软件随机森林 – 机器学习基线实现(RandomForestRegressor)。开源社区scikit-learn 1.7.2;RRID: SCR_002577
软件statsmodels – ARIMA基线实现。开源社区statsmodels 0.14.6;RRID: SCR_016074
软件arch – GARCH基线实现。开源社区arch 8.0.0;RRID:不可用
软件XGBoost – XGBoost回归基线实现。开源社区XGBoost 3.1.2;RRID: SCR_025884
软件Transformer模型 – 用于对比的基线深度学习架构。TensorFlow / Keras基于TensorFlow 2.20.0实现;RRID: SCR_016345
软件Keras回调函数(ReduceLROnPlateau) – 训练过程中使用的学习率调度器。TensorFlow / Keras包含在TensorFlow 2.20.0中;RRID: SCR_016345
软件Matplotlib – 图表生成并导出为PDF/SVG/PNG格式。开源社区Matplotlib 3.10.6;RRID: SCR_008595
软件openpyxl – 支持Excel工作簿的生成与导出。开源社区openpyxl 3.1.5;RRID:不可用
代码GRU.py – 包含全部13种深度学习模型、Transformer对比、ARIMA/GARCH/XGBoost/随机森林基线、Diebold–Mariano检验及图表生成的完整实现。作者编写可在Zenodo获取(DOI: 10.5281/zenodo.19976985);RRID:不适用
代码README_reproducibility.md – 可重复性说明与逐步操作协议。作者编写可在Zenodo获取(DOI: 10.5281/zenodo.19976985);RRID:不适用
代码requirements.txt – 软件依赖项及精确版本说明。作者编写可在Zenodo获取(DOI: 10.5281/zenodo.19976985);RRID:不适用
硬件计算工作站 – 所有模型训练、验证、测试及图表/表格生成。华硕电脑股份有限公司(ROG Strix G634JZ_G634JZ)Windows 11 家庭版 10.0.26200 构建版本 26200;基于x64的个人计算机;RRID:不适用
硬件CPU – 用于训练和推理的中央处理器。IntelIntel64 家族 6 型号 183 步进 1,约 2.20 GHz;RRID:不适用
硬件内存(RAM) – 所有计算任务的物理内存。华硕工作站32,387 MB(约32 GB);RRID:不适用
硬件GPU加速 – 图形处理器使用状态。TensorFlow设备查询tf.config.list_physical_devices('GPU') 返回 [];未使用CUDA/cuDNN;RRID:不适用
试剂/模型随机种子(主实验) – 固定种子以确保随机元素的可重复性。Python random / NumPy / TensorFlow种子 = 42;RRID:不适用
试剂/模型随机种子(稳健性测试) – 用于多轮运行稳定性验证的额外种子。Python random / NumPy / TensorFlow种子 = {1, 7, 21, 42, 2024};RRID:不适用

重印与许可

标签

LSTM CNN BiLSTM Transformer Z Diebold Mariano