本研究提出了一种用于电网的成本预测混合模型,该模型结合了物理成本定额、动态宏观经济/技术调整以及基于XGBoost的残差补偿。该模型的平均绝对百分比误差(MAPE)达到2.34%,在准确性和可解释性之间实现了平衡,满足了电价制定过程中对监管透明度的需求。
本研究提出了一种用于电网的成本预测混合模型,该模型结合了物理成本定额、动态宏观经济/技术调整以及基于XGBoost的残差补偿。该模型的平均绝对百分比误差(MAPE)达到2.34%,在准确性和可解释性之间实现了平衡,满足了电价制定过程中对监管透明度的需求。
全球能源转型及持续进行的电力市场改革,要求电网企业平衡可靠供电与日益严格的输配电价监管。基于历史数据外推的传统预算方法往往无法反映资产运营的物理基础,而数据驱动的机器学习模型虽能实现较高的预测精度,却缺乏监管成本核查所需的透明度。为解决预测精度与可解释性之间的权衡问题,本研究提出一种基于成本定额的混合成本预测模型。该框架以标准化运行定额作为物理预算的基准,并引入由宏观经济状况和技术进步驱动的定额动态演化机制。采用极端梯度提升(XGBoost)模型捕捉基于定额估算之外的非线性残差,同时利用SHAP(Shapley加性解释)方法解析关键成本驱动因素的贡献。该模型在中国某省级电网16年的匿名化运行数据上进行了验证,平均绝对百分比误差(MAPE)为2.34%,相较于SARIMAX、独立XGBoost和Attention-LSTM模型,预测误差分别降低了61.8%、46.6%和34.1%。所提出的框架将工程成本定额原理与可解释人工智能相结合,既提供了准确的长期成本预测,也为监管允许成本核查提供了一个透明的决策支持工具。
全球能源转型正通过整合分布式可再生能源发电、日益频繁的极端天气事件以及物联网技术的广泛应用,重塑电力系统资产管理与运行实践,这些变化均要求更高的运行灵活性和维护资源,以确保系统可靠性1,2。与此同时,电力监管机构已通过诸如英国的RIIO机制和美国联邦能源监管委员会的收益率审查框架,加强了对输配电价的监管,强调成本论证的透明度3。中国同样采用了“准许成本加合理收益”的监管机制,要求电力企业证明工程活动与财务支出之间的明确关联4。然而,电力企业往往缺乏将实物资产运行与成本预测相连接的透明量化工具,限制了监管机构进行成本核实的有效性5。
现有的预测方法在此环境中存在重要局限性6。传统方法(包括增量预算法和基于ARIMA的模型)假设历史模式相对稳定,在经济波动或极端天气引起的结构性变化下,通常表现不佳7。相比之下,LSTM和Transformer架构等现代机器学习模型在短期预测中具有较高的预测精度,但缺乏监管决策所需的工程可解释性8,9。尽管近期的一些混合预测方法结合了统计学与机器学习技术,但通常忽略了支撑电网会计系统的标准化工程造价定额10。为克服这些局限性,本研究提出一种定额驱动的混合预测框架,将动态定额演化与基于机器学习的残差校正相结合,在保持工程可解释性的同时提升预测精度。
一个重要的研究方向源于自然垄断行业的激励性监管机制,包括英国的RPI-X机制和中国的准许成本核定框架11。这些研究主要采用数据包络分析(DEA)和随机前沿分析(SFA)来评估运营效率12。以往的研究探讨了资本支出(CAPEX)、运营支出(OPEX)与成本效率之间的长期关系,以支持电价监管13,14。尽管这些方法提供了有价值的宏观经济洞察,但其输出结果通常表现为相对效率评分,而非适用于年度预算编制的货币化预测值15,16。此外,前沿模型通常假设实物资产结构和运营条件相对稳定,因而难以捕捉由资产老化、基础设施更新或需求快速增长所引发的突发性成本变化17,18。
第二个研究方向聚焦于基于统计学和人工智能的预测模型。早期研究采用多元线性回归以及带外生变量的自回归积分滑动平均模型(ARIMAX)进行成本预测19。近年来,支持向量回归、随机森林、XGBoost、LSTM 和 Transformer 模型通过挖掘非线性关系和高维特征空间,显著提升了预测性能20,21,22。这些方法通常引入宏观经济指标,如电力需求、生产者价格指数(PPI)和气候变量23。然而,电网运行成本源于工程活动、资产老化、维护计划和管理决策,而不仅仅取决于宏观经济变量24。因此,纯数据驱动模型往往表现为“黑箱”,在监管审查或准许成本核验过程中难以解释预测结果25,26。
工程定额管理为应对这一挑战提供了潜在解决方案27。基于活动的成本核算(ABC)长期以来依赖标准化的作业定额,以估算常规电网运行中的人工、材料、设备及维护需求28。中国主要电力公司已建立涵盖巡检、维护、测试、修理和设备更换等作业的全面定额数据库。然而,这些工程标准主要用于项目结算和审计,而非动态的长期预测29,30。此外,定额标准通常每数年才修订一次,难以及时响应商品价格变动、技术进步和运行实践的变化31。将定额系统应用于数以百万计的分布式资产,也为大规模预测带来了显著的计算挑战32。
尽管在统计预测、机器学习和工程成本管理方面已取得显著进展,但目前尚无现有框架能够有效整合标准化工程造价定额、动态宏观经济调整以及可解释的机器学习,以构建统一的监管成本验证预测模型。本研究假设,将动态变化的造价定额与基于XGBoost的残差学习相结合,可在提高长期预测准确性的同时,保持监管决策所需的工程透明度。为验证该假设,开发了一种混合型定额驱动的预测框架,该框架集成了物理成本建模、宏观经济与技术调整机制、XGBoost残差补偿以及基于SHAP的模型解释方法。所提出的方法旨在为现代电力市场监管下的准许成本验证,提供既准确的长期成本预测结果,又具备可解释性的透明证据支持。
本研究使用了从中国东部某省级电网收集的匿名化运营和财务数据。所有数据在分析前均已汇总并去识别化,未包含任何可识别个人身份或敏感的个体层面信息。因此,本研究无需伦理审批。数据获取与分析遵守了适用于电力行业信息的数据保护法规及机构间协议。
预测框架概述
为了融合基于物理模型与数据驱动的预测方法,开发了一种将工程造价定额与机器学习相结合的混合预测框架。该框架并非简单地组合多种算法,而是遵循以下原则:由物理模型建立基础预测,机器学习则用于补偿残差误差。这种设计确保了预测过程以电网生产与运行活动背后的物理机制为基础,而非仅仅依赖历史成本的外推。
该框架首先建立电力系统资产、标准化运行活动与财务成本科目之间的层级映射关系。生产与运营成本被视为物理资产在常规活动中所消耗资源的货币表现形式,这些物理资产包括变电站、输电线路、配电馈线、计量设备和数字化巡检设备,常规活动则包括巡检、维护、测试、修理和更换等。成本定额作为可度量的工程工作量与相应财务支出之间的连接纽带。
如图1所示,成本定额在整个资产运营和维护过程中作为标准化的核算单位而嵌入,而非抽象的财务分配规则。底层资产工作量被转换为标准化的运营定额,随后映射至成本类别,包括人工、材料、施工设备、外包服务和应急物资。这种分层映射在整个预测过程中保持了工程可解释性和监管可追溯性,并为构建静态基准定额模型提供了物理基础。
方法学工作流程概述
所提出的预测框架包含三个依次进行的阶段:(1)利用资产级别工作负载配额构建物理基线,(2)通过宏观经济和技术调整实现成本配额的动态演化,(3)基于机器学习的残差补偿,以捕捉系统性的非线性效应。如图1所示,该框架建立了从底层资产和标准化运营活动到生产与运营成本预测的分层映射。各阶段的实施细节将在下述小节中进行描述。
基于资产级工作负载的物理基准成本模型
电网的生产与运营成本 Ctotal 包括与多项业务活动相关的支出,如变电站运行、输电线路维护、配电网管理、客户服务以及支持系统的开销。在本研究中,基准运营成本假设由各项标准化运营活动所产生的工作量及其相应的成本定额决定。
静态基线成本的计算公式如下:
(1)
其中 Vi,k,t 表示与工作量相关的 i- 商业类别中的资产或运营任务 k 在周期期间 t,以及 Qi,k 表示由工程造价定额体系所定义的相应标准化单位成本。业务类别包括变电站检修、输电线路巡检、配电网运行及客户服务等主要运营职能。双重求和用于汇总所有标准化运营活动的成本,以估算维持电网正常运行所需的理论基准支出。
公式(1)通过将标准化的运营活动直接映射到成本账户,建立了工程工作量与财务支出之间的物理关系。与纯统计预测模型不同,该公式提供了一个可解释的工程基准,作为后续动态配额调整和基于机器学习的残差校正的基础。该方程基于中国省级电网企业所采用的运营实践和成本配额体系而建立。表1总结了公式(1)中使用的符号,包括工作量(Vi,k,t)、标准化单位成本(Qi,k)、运营任务数量(Nk)以及业务类别索引(k)。
外部环境扰动下配额的动态演化机制
标准化成本定额(Qi,k)提供了一个具有物理可解释性的基准,但未考虑宏观经济条件变化或技术进步的影响。为了提高其长期适用性,引入了一种动态演化机制,以根据价格通胀和技术驱动的效率提升对基准定额进行调整。
第一个调整项用于反映由宏观经济通货膨胀引起的采购成本变化。电力系统的运行与维护高度依赖于大宗材料,包括铜、铝和硅钢,这些材料的价格与生产者价格指数(PPI)的波动密切相关。由于
是一个基准值为100的指数,需首先将其转换为标准化的通货膨胀率:
(2)
基于此,价格修正函数
定义为:
(3)
其中
是一个长度为 L 的滞后权重向量,满足

滞后期结构反映了宏观经济通胀对电网供应链采购成本的滞后传导效应。将生产者价格指数(PPI)转换为标准化的通货膨胀率,能够在保留价格变化累积效应的同时,避免直接使用指数值所带来的量纲偏差。公式(2)和(3)借鉴自已建立的宏观经济通胀调整模型,其中滞后期结构针对电力行业的采购周期进行了校准33,34。
通过成本降低因子纳入了技术进步,该因子反映了由于无人机巡检、智能机器人和数字化维修技术等进步所带来的运行效率提升。技术调整因子定义为:
(4)
在本部分中,α 和 β 是通过非线性最小二乘法,基于历史面板数据估计得出的经验弹性系数。为确保技术进步因子始终表示单位定额成本的合理降低,在参数估计过程中对 0 < Γ(Etech,t) ≤ 1 进行约束。需要注意的是,该因子主要反映由成熟技术替代所带来的长期效率提升。公式(4)为本文原创,借鉴了能源技术成本文献35,36 中的学习曲线概念,并将其应用于电网维护作业。在数字化设备部署初期可能产生的额外成本,例如新旧系统并行运行、平台集成、通信测试以及附加维护等,不会被强制从基准定额中扣除;而是由后续的机器学习残差补偿模块进行识别:
(5)
其中,Cbase,t 表示根据底层资产工作负载和标准化运营成本定额计算得出的静态基准成本;
反映了宏观价格波动对材料、设备及外部服务价格的传导效应;Γ(Etech,t) 则体现了技术成熟后基于效率提升所带来的单位运维成本降低。通过上述动态演化机制,定额基准不再局限于静态核算基础,而是能够随着经济环境和技术条件的变化进行自适应调整。公式(5)为本研究首次提出,标志着将价格与技术修正因素创新性地整合至定额基准框架之中。
配额约束下的系统性非线性残差捕获
尽管存在复杂的进化修正,配额模型在面对不可预测的灾害性天气干扰和突发政策指令时仍不可避免地产生系统性偏差,例如在临时降低资费期间客户投诉处理成本的增加。这种偏差形成了方程两侧的残差项:
Rt = Cactual,t - Cquota,t (6)
由于传统物理规律无法解释这一方面,机器学习可弥补这些局限性。为避免高维特征带来的“维度灾难”,本研究采用基于决策树集成的XGBoost算法对非线性关系 Rt37,38 进行建模。定义了一个强干扰特征矩阵 Xt,其中包括年极端冰冻日数 Dice 等气象特征以及宏观政策强度。
对于由回归树构成的非线性补偿器,预测残差
的生成逻辑可表示为39:
(7)
其中,F 表示所有可能的分类与回归树结构的空间。为了平衡拟合精度与防止过拟合,构建并在第 m 次迭代中最小化一个包含结构复杂度惩罚项的正则化目标函数:
(8)
其中,
是一个凸损失函数,用于衡量真实残差与预测残差之间的差异。本文采用Huber损失以增强模型对异常峰值支出的鲁棒性。正则化项
用于约束树结构的复杂度,其定义为:
(9)
其中 Tm 表示第 m 棵树中叶节点的数量,wm 表示相应的叶权重向量,γ 和 λ 分别表示叶节点数量惩罚系数和权重正则化系数。
最终的预测方程为:
(10)
进一步扩展如下:
(11)
上述公式从数学上表示了所提出的预测模型的闭环结构。最终的生产与运营成本需求并非由机器学习模型直接生成,而是通过将机器学习模块识别的非线性残差补偿叠加到动态定额基准上而获得。其中,价格和技术因素主要反映定额基准的动态演变,而诸如气候冲击、政策扰动以及维修事件激增等难以通过规则显式刻画的因素,则由机器学习残差补偿模块捕捉。公式(10)和(11)为本研究首次提出,将物理基准与基于机器学习的残差捕捉融合为一个统一的预测框架。
图2 显示,所提出模型的预测结果展现出清晰的分层生成逻辑。一方面,基准定额为成本需求提供了稳定、透明且可审计的物理基础;另一方面,价格调整、技术效应以及外部冲击残差使模型能够适应复杂环境下的动态变化。与直接输出预测值的黑箱模型相比,这种分解结构能够清晰揭示“成本为何上升或下降”,从而增强模型结果在预算审查及输配电价监管中的可解释性。
数据来源与收集方法
理论模型必须通过实证数据进行严格验证,以证明其实际应用价值。由于电力行业核心财务数据涉及国家基础设施运营的敏感信息,本研究从中国东部一个典型省级电网(为方便起见,简称E-Grid)提取了高精度、匿名化的月度财务数据,时间跨度为2010年至2025年连续16个日历年。该省份经历了从传统重工业驱动增长向高端制造业转型的典型经济周期,电网资产规模的年均复合增长率达到7.4%。因此,其成本结构的复杂演变对其他快速发展的电网系统具有潜在参考意义。数据来源于三个主要渠道:(1)内部运行维护日志,记录资产层级的工作负荷、巡检频率和维修事件;(2)财务会计系统,提供涵盖人工、材料、设备和外包服务的月度成本报表;(3)外部环境数据库,包括中国气象局的气象记录和国家统计局的宏观经济指标。
质量控制与缺失数据处理
针对从多源系统整合的130余项初始指标,实施了严格的质量控制流程。缺失数据点占总观测值的比例不足3%,针对具有时间趋势的连续变量采用线性插值法处理,分类指标则采用众数填补法。使用四分位距(IQR)法识别异常值,对于超过第三四分位数3.0倍IQR的数值,采用 Winsorization 方法将其截断至第99百分位数,以保障数据完整性并减轻极端值带来的偏差。
样本量考虑因素
该数据集包含192个月度观测值(2010年1月至2025年12月),其中156个观测值(2010–2022年)用于训练与验证,36个观测值(2023–2025年)保留用于样本外测试。尽管该样本量对于深度学习应用而言相对较小,但适用于XGBoost算法,该算法通过其正则化和树剪枝机制,专为在中小规模表格数据上实现良好性能而设计。为降低潜在的过拟合风险,采取了以下措施:(1)采用严格的正则化惩罚(γ = 0.1,λ = 1.0);(2)设置50轮的早停耐心值(early stopping);(3)保守的树深度限制(max depth = 5)。这些措施共同确保了模型在有限样本量下的稳定性与泛化能力。
数据分割与多源异构整合
为进行严格测试,将2010年1月至2022年12月的数据划为训练-验证区间,共包含156个观测值,用于训练配额演化因子和配额补偿残差网络。2023年1月至2025年12月被保留作为独立的样本外测试集,共包含36个观测值。为何选择这一时期作为最终测试阶段?原因是这三年恰逢新型电力系统建设加速,叠加大规模与厄尔尼诺现象相关的极端高温事件,以及分布式可再生能源发电的快速且不均衡增长,导致电网在物资供应链和维修人力调配方面面临前所未有的压力。
科学筛选并定量定义成本驱动因素,是确保机器学习残差网络能够有效捕捉系统性波动的基础。基于电力系统标准作业成本的管理逻辑,本研究突破了传统财务预测仅依赖历史现金流的单一维度,转而利用原始运行日志和外部系统账目,从物理资产规模、运行维护状况、宏观经济演变以及外部气候环境四个核心边界重构特征工程。在实际建模过程中,针对多源系统整合产生的130余项原始指标,本研究采用皮尔逊相关性检验剔除高度共线性的冗余变量,阈值设定为 |r| > 0.85。结合资深电网专家的先验知识,最终选定42项核心输入特征,构成特征矩阵 Xt。为清晰呈现输入张量的底层数据结构与分布情况,表2从上述四个评估维度中选取12项具有代表性的核心特征,并汇总其在观测期内的描述性统计结果。
为进一步阐明多源特征系统的空间拓扑基础,图3展示了所研究的省级电网的匿名化拓扑示意图。该图叠加了不同电压等级的变电站、输电走廊、分布式可再生能源集群、负荷中心以及典型的环境扰动区域。该拓扑有助于解释为何生产与运营成本共同受到资产规模、网络结构、应急抢修强度以及外部气候冲击的影响。同时,它也为XGBoost补偿模块中所使用的残差驱动变量提供了空间解释依据。
表2显示,不同业务维度的解释变量呈现出明显不同的统计形态。代表企业内生发展动力的实物资产变量,如变电站容量和线路长度,其标准差相对稳定,偏度值集中在0.1至0.8之间。整体数据结构近似正态分布,客观反映了电网基础设施建设周期中稳定发展的属性。与此形成鲜明对比的是表格底部的气象及外部环境扰动变量。例如,过去90天内高温预警日累计数量和线路跳闸影响指数均表现出极强的右偏特征,其偏度值分别为2.15和2.45。这种典型的重尾分布证实了电网实际运维中一个不容忽视的客观痛点:尽管极端天气灾害在年度时间尺度上发生频率相对较低,但一旦触发,往往会导致维修人工投入和备品备件消耗呈指数级增长。从另一个角度看,这些多源特征在分布上表现出的高度非均匀性和极值偏态,揭示了传统线性时间序列模型(如ARIMAX)在拟合复杂电网成本时的理论局限性,此类模型依赖于正态性和同方差性假设。这不仅进一步论证了在物理核算基准之上引入机器学习模块的合理性,也为本文选择XGBoost树模型提供了坚实的统计支持,该模型能够高效处理稀疏特征分布和非线性映射,以逼近成本残差。
超参数优化与评估系统设置
在确定特征输入空间后,模型超参数的设置直接影响残差逼近网络的拟合性能。由于XGBoost补偿网络涉及多个参数,包括树的深度(max depth)、学习率以及正则化惩罚项,且这些参数之间存在非线性相互作用,传统的网格搜索方法不仅计算复杂度高,而且在高维空间中容易陷入局部最优。因此,本研究在参数调优过程中引入了树结构Parzen估计器(Tree-structured Parzen Estimator, TPE),这是一种贝叶斯优化方法。TPE算法能够利用先前评估结果的损失函数反馈,动态引导后续采样方向。通过构建目标变量的后验核密度估计(KDE),自适应地缩小参数搜索范围,使模型能够在较低计算成本下逼近全局最优的超参数配置。TPE优化的目标是在100次迭代中最小化验证集的均方根误差(RMSE),若连续50轮无性能提升则提前终止。
在内部验证集上完成参数优化后,为客观评估各模型在样本外测试集上的最终性能,并满足监管机构对成本验证的定量评估要求,本研究采用平均绝对百分比误差(MAPE)来量化预测序列的相对偏差。同时,为应对实际操作中控制极端成本预测失败的需求,还引入了均方根误差(RMSE),以对较大的误差施加更强的惩罚。最后,决定系数 R2 用于量化回归模型对真实目标方差的整体解释能力。
各指标的数学定义如下:
(12)
(13)
(14)
其中,
表示在时段 t 的实际生产运营成本,
表示模型预测的成本,
表示测试样本中的平均实际成本,N 为测试集中的样本数量。
全景式降维预测准确性比较
当所有经过基于树结构帕森估计器(Tree-structured Parzen Estimator, TPE)优化的模型在2023–2025年样本外测试集上进行评估时,该测试集包含了疫情后恢复期的波动以及极端高温事件,从而能够客观比较主流预测算法的性能。为实现严格且全面的评估,研究纳入了四种代表不同方法论的基准模型:代表传统金融预测的指数平滑法(Exponential Smoothing);代表线性季节性时间序列建模的SARIMAX模型;代表无配额约束纯数据驱动方法的独立XGBoost回归模型;以及广泛用于长序列预测的注意力机制增强型长短期记忆网络(Attention-LSTM)。
如表3所示,在2023–2025年样本外预测期间,所提出的定额-机器学习(Quota-ML)模型在预测生产与运营成本方面优于所有基准模型。该模型的平均绝对百分比误差(MAPE)为2.34%,相较于SARIMAX模型(6.12%)降低了61.8%的预测误差,相较于Attention-LSTM模型(3.55%)降低了34.1%。其均方根误差(RMSE)为1569万元人民币,最大绝对误差(MaxAE)为2305万元人民币,均不足次优神经网络模型的一半,而R2值达到0.957,表明该模型可解释观测成本中超过95%的变异。这些结果表明,将工程造价定额、定额动态演化机制与基于XGBoost的残差补偿相结合,相较于传统时间序列方法和纯数据驱动模型,显著提升了预测的准确性与鲁棒性。
如图4所示,在测试期间,实际的生产与运营成本呈现出明显的季节性波动以及若干显著的峰值阶段。特别是,在2024年7月和8月的极端高温事件期间,成本急剧上升。尽管Attention-LSTM模型捕捉到了整体的季节性趋势,但其预测结果相对平滑,低估了与紧急维修、重型设备高负荷运行以及应急物资消耗增加相关的突发性成本增长。单独使用的XGBoost模型对局部波动响应更为灵敏,但在数月内偏离了实际观测轨迹,因其缺乏工程定额约束。相比之下,本文提出的定额-机器学习(Quota-ML)模型在整个测试期间紧密跟踪了实际成本变化趋势,准确再现了2024年夏季的成本激增以及2025年夏季的次高峰。
Quota-ML 模型的优异性能表明,将工程造价定额与基于机器学习的残差校正相结合具有显著优势。动态定额基线提供了一个具有物理可解释性的基础,能够反映电网资产和运行工作负荷的演变过程,避免了仅从有限的财务时间序列数据中进行无约束学习所带来的问题。残差补偿网络则专注于那些仅用工程定额规则难以表达的非线性扰动,包括气象事件、维修工单激增以及与政策相关的变动。因此,所提出的模型在所有评估方法中实现了最低的平均绝对百分比误差(MAPE)和均方根误差(RMSE)(表3),并对季节性成本峰值和极端事件的跟踪最为准确(图4),证明了其在长期生产与运行成本预测中的适用性。
核心架构组件的消融验证
在一个由嵌套子模块构成的复杂混合框架中,核心的学术评审关注点通常集中在模型是否存在“过度设计”的问题。通过移除核心组件进行内部消融实验,对于探究各模块之间的真实相互关系及其贡献程度十分必要。本研究为该架构设置了两条退化路径。第一条是结构A,即移除动态演化机制:将配额基线强制限定于过去的静态物理标准,剥离近年来宏观通胀累积效应与技术进步通缩因素的渗透影响,仅将历史静态基线
与残差网络相连。第二条是结构B,即移除非线性残差追踪模块:模型完全退化为一种精算方法,切断由人工智能驱动的随机波动捕捉回路,并在经过宏观环境校正后,直接采用纯动态配额计算值
作为最终输出。解释方差损失比根据完整模型与退化模型之间R2的相对下降程度计算,定义为:
(15)
表4的 消融研究显示,所提出框架的两个组成部分均对预测准确性有显著贡献,但机器学习残差补偿部分起到更为关键的作用。移除价格与技术的动态演化机制(变体A)后,MAPE上升至4.15%(相对下降1.81个百分点),R值降低2 降至 0.837,比完整模型少解释 12.5% 的方差。相比之下,消除机器学习残差补偿(Variant B)导致更显著的下降:MAPE 上升至 5.62%(+3.28 个百分点),R2 降至0.686,解释方差损失比达到28.3%。这些结果表明,尽管动态配额更新能够提升基线精度,但基于XGBoost的残差校正对于捕捉非线性成本驱动因素至关重要,二者共同构成了一种协同的混合架构。
为了便于比较消融实验中模型的性能,构建了归一化的雷达图以可视化五个评估指标:平均绝对百分比误差(MAPE)、均方根误差(RMSE)、决定系数(R2)、最大绝对误差(MaxAE)和鲁棒性。基于误差的指标(MAPE、RMSE 和 MaxAE)进行了反向归一化处理,使得误差越低对应的得分越高;而正向指标(R2 和鲁棒性)则进行常规归一化,使得数值越高对应的得分也越高。归一化后,所有指标均表示可比较的性能得分,数值越接近雷达图外缘,表示整体性能越优。
如图5所示,完整的Quota-ML模型在所有五个性能维度上均取得了持续较高的分数,形成了面积最大且最均衡的雷达图轮廓。该结果表明,所提出的框架在相对误差控制、整体预测准确性、解释能力、极端误差抑制以及在不同运行条件下的鲁棒性之间实现了有效平衡。
相比之下,排除了动态配额演化机制但保留基于机器学习的残差补偿的变体A,表现出整体性能的明显下降。这一结果表明,仅依靠静态配额基准无法充分反映由商品价格波动和技术进步所引起的结果变化。对于变体B,其进一步移除了残差补偿模块,仅依赖动态配额基准进行预测,性能下降更为显著。在此情况下,性能大幅恶化,尤其体现在误差相关指标和鲁棒性方面。
如表4所示,B变体的平均绝对百分比误差(MAPE)从完整模型的2.34%上升至5.62%,增加了3.28个百分点,而R2值下降了28.3%。这些结果表明,尽管动态配额模型纳入了宏观经济通胀和技术驱动效率调整因素,但仍无法充分捕捉与极端天气、紧急维修、政策变化及异常运行条件相关的突发性成本波动。
总体而言,消融分析表明,所提出框架的两个主要组成部分均至关重要。动态配额演化机制能够根据宏观经济条件和技术进步的变化,调整工程基线;而机器学习残差补偿模块则能够捕捉那些无法通过工程配额规则显式表达的非线性偏差。这两个互补的组成部分共同构成了一个集成的预测框架,将具有物理可解释性的配额基线与数据驱动的残差学习相结合,从而实现准确且稳健的长期成本预测。
残差补偿模型的可解释性验证
尽管预测精度比较和消融实验验证了机器学习残差补偿模块的重要性,但仅凭误差指标无法判断所捕捉到的非线性关系是否具有有意义的物理或运行层面的解释。因此,本研究采用SHAP(Shapley加性解释)方法对XGBoost残差模型40进行解释。SHAP已被广泛应用于电力与能源预测及相关复杂系统中机器学习模型的解释41,42。通过量化每个输入特征对模型预测结果的贡献,SHAP能够评估所学习到的残差模式是否与工程知识一致。
如图6所示,外部扰动变量——包括过去90天内累计的高温预警级天数、强对流和台风相关的线路停运指数、冻雨和降雪持续时间,以及非计划性维修事件次数——表现出较强的正SHAP值。这些变量取值较高的样本集中在正SHAP值区域,表明极端天气和应急维护活动始终导致实际成本超出动态定额基准。这些结果表明,残差补偿模块捕捉到了有意义的环境和运行扰动,而不仅仅是拟合随机噪声。
其他多个变量,包括重载运行时长、PPI金属价格指数、数字化投资比例、分布式光伏装机容量以及输电线路长度,也对残差预测表现出显著贡献。这些结果表明,配额基准的偏差共同受到短期天气事件、资产扩张、商品价格传导、电力系统转型以及数字化进程的影响。值得注意的是,在部分观测中,数字化投资比例对残差成本产生了正向贡献,表明在数字化转型初期,由于系统集成、平台维护以及新旧系统的并行运行,可能暂时增加支出。总体而言,SHAP分析验证了残差补偿模块在业务层面的可解释性,并为理解极端天气事件和数字化转型对生产与运营成本的影响提供了实证支持。
预测改进的统计显著性检验
为了确定所提出的框架在预测性能上的改进是否具有统计学显著性,进行了正式的预测比较检验。根据能源预测与计量经济学领域的既定实践,采用戴博尔德-马里亚诺(Diebold–Mariano, DM)检验来比较所提出模型与各基准模型的预测精度。DM检验适用于时间序列预测,因其在无需残差服从正态分布的前提下,能够考虑预测误差中的自相关性。
对于每次比较,原假设认为所提出的模型与基准模型具有相等的预测准确性,而备择假设则认为所提出的模型产生更低的预测误差。采用平方预测误差作为损失函数,进行单侧DM检验。为考虑损失差异序列中的异方差性和自相关性,采用带有自动滞后选择的Newey–West标准误。此外,还进行了Wilcoxon符号秩检验,作为一种不依赖于分布假设的非参数替代方法。这些互补检验共同对观测到的预测改进的统计显著性提供了稳健的评估。
如表5所示,所提出的预测框架在所有基准模型上均取得了具有统计学意义的改进。正的DM统计量表明,该框架的预测误差持续低于其他竞争方法。相较于ARIMA模型,改进最为显著(DM = 3.842,p < 0.001),这表明将工程费用定额纳入预测框架具有优势。与包含外生变量的ARIMAX模型相比,所提出模型也表现出显著提升(DM = 3.215,p < 0.001),凸显了将动态定额基准与基于机器学习的残差补偿相结合所带来的额外价值。
该模型的预测效果也显著优于深度学习基准模型。相对于LSTM模型(DM = 2.876,p = 0.002)和Transformer模型(DM = 2.543,p = 0.011),预测性能的提升具有统计学意义。尽管相较于独立使用的XGBoost模型,提升幅度较小(DM = 2.187,p = 0.029),但结果仍具有统计学显著性。由于这两个模型均采用基于树的学习方法,该结果表明,引入动态配额基线能够在纯数据驱动方法的基础上提供额外的预测价值。Wilcoxon符号秩检验得出的显著性水平与DM检验结果一致,进一步证明了所提出框架在预测性能上的提升具有统计稳健性。
数据可用性:
本研究中使用的数据集已上传至公共存储库(DOI: https://doi.org/10.5281/zenodo.21645584)。

图1:电网资产、标准作业定额与成本账户之间的映射关系。 本图表明,成本定额不仅仅是抽象的财务分配规则,而是贯穿电网资产全生命周期运维过程的标准化核算单元。 请点击此处查看该图的放大版本。

图 3:所研究的省级电网及驱动成本的扰动层的匿名化拓扑示意图。 本图展示了所研究的省级电网的匿名化拓扑结构示意图,叠加了不同电压等级的变电站、输电通道、分布式可再生能源集群、负荷中心以及典型环境扰动区域。请点击此处查看该图的放大版本。

图4:核心模型在2023–2025年样本外测试期间的预测趋势与实际成本对比。 该图显示,测试期间的实际生产与运营成本呈现出明显的季节性波动及突发性峰值。在2024年7月和8月的极端高温冲击期间,实际成本显著上升。请点击此处查看该图的放大版本。

图5:不同消融变体间预测性能的归一化比较。 雷达图使用五项评估指标对完整Quota-ML模型与两种消融变体的归一化性能进行了比较:MAPE得分、RMSE得分、R2得分、MaxAE得分和鲁棒性得分。基于误差的指标(MAPE、RMSE和MaxAE)经过反向归一化处理,使得得分越高表示预测误差越低;而R2和鲁棒性则进行正向归一化,使得得分越高表示模型性能越好。完整Quota-ML模型更宽广的雷达轮廓表明,其整体预测性能优于两种消融变体。请点击此处查看该图的高清版本。

图6:SHAP汇总图显示各特征对残差成本预测的贡献。 SHAP(Shapley加性解释)汇总图展示了对XGBoost残差补偿模型影响最大的变量贡献情况。每个点代表一个观测值,颜色表示特征值(蓝色=低值,红色=高值),水平位置表示SHAP值。对于极端高温天数、台风相关停电指数、冰暴持续时间以及非计划性维修事件等变量,较高的特征值通常与更正的SHAP值相关,表明运营与生产残差成本增加。该图表明,环境扰动和运行因素均对动态配额基准的偏离有显著影响。请点击此处查看此图的放大版本。
表1:核心模型变量与参数说明。 本表列出了所提出的配额-机器学习(Quota-ML)成本预测模型中的关键变量,区分了实际成本与预测成本、静态与动态配额基准、工作量与配额参数、宏观经济调整因子(生产者价格指数PPI与技术进步)以及残差成分。请点击此处下载该表格。
表2: 预测模型核心输入特征的分类与描述性统计。
该表显示,来自不同业务维度的解释变量呈现出不同的统计形式。本表总结了用作模型输入的代表性实物资产、运营、宏观经济和环境变量的描述性统计信息。 请点击此处下载此表格。
| 模型 | 平均绝对百分比误差 % | 均方根误差(人民币,百万元) | 拟合优度 R² | 最大绝对误差(人民币,百万元) |
| 传统指数平滑法 | 8.75 | 54.22 | 0.651 | 125.04 |
| SARIMAX 时间序列模型 | 6.12 | 38.54 | 0.768 | 84.21 |
| 纯 XGBoost 回归 | 4.38 | 29.16 | 0.852 | 51.06 |
| 注意力机制-LSTM 神经网络 | 3.55 | 24.02 | 0.894 | 40.53 |
| 提出的配额-机器学习模型 | 2.34 | 15.69 | 0.957 | 23.05 |
表3: 不同模型在2023–2025年样本外测试集上的整体性能比较。 该表表明,所提出的配额机器学习(Quota-ML)模型在预测2023–2025年样本外期间电网生产与运营成本方面,显著优于所有基准模型。
| 实验变体 | 移除的核心组件 | MAPE 降解性能 | R² | 解释方差损失比 |
| 变体 A | 无价格/技术动态演化 | 4.15% (+1.81 p.p.) | 0.837 | 12.50% |
| 变体 B | 无机器学习残差补偿 | 5.62% (+3.28 p.p.) | 0.686 | 28.30% |
| 完整模型 | 完整的拟议配额-机器学习框架 | 2.34% | 0.957 | 基线 |
表4: 配额-机器学习集成框架的消融实验结果。 该表格表明,所提出框架的两个组成部分均对预测准确性有显著贡献,但机器学习残差补偿部分起到更为关键的作用。
| 比较 | Diebold-Mariano 检验 | Wilcoxon 符号秩检验 |
| 提出模型 vs. ARIMA | DM = 3.842*** (p < 0.001) | W = 486.0*** (p < 0.001) |
| 提出模型 vs. ARIMAX | DM = 3.215*** (p < 0.001) | W = 452.0*** (p < 0.001) |
| 提出模型 vs. LSTM | DM = 2.876** (p = 0.002) | W = 398.0** (p = 0.003) |
| 提出模型 vs. Transformer | DM = 2.543* (p = 0.011) | W = 364.0* (p = 0.014) |
| 提出模型 vs. XGBoost(纯机器学习) | DM = 2.187* (p = 0.029) | W = 328.0* (p = 0.031) |
表5: 预测结果比较的统计显著性检验。 在零假设下,Diebold-Mariano检验统计量服从标准正态分布。DM值为正表示所提出模型的预测准确性更优。所有检验均为单侧检验,备择假设为所提出模型的预测误差低于基准模型。报告了Wilcoxon符号秩检验统计量W及其对应的p值。损失函数 = 预测误差的平方。
本研究表明,将工业成本定额与机器学习相结合,可为长期电网成本预测提供一个可解释且准确的框架。结果表明,与气候相关的变量,特别是极端高温天数和线路跳闸影响指数,是成本残差的主要驱动因素,凸显了外部扰动对公用事业支出日益增加的影响。这些发现提示,与天气相关的成本不应再被视为偶然性运营支出,而应纳入专门的应急储备金,并将储备金的启用与预测的气候风险挂钩。线路跳闸影响被确认为关键成本驱动因素,进一步强调了预测性维护和状态监测策略在减少运行中断和成本波动方面的价值。
分析还表明,由于转型期间存在双系统并行运行,数字化转型在实施初期可能会增加运营成本,而非立即带来效率提升。这一发现提示公用事业部门应采用全生命周期成本评估方法,而非仅依据短期财务表现来评估数字化投资,并且在部署智能监控、高级配电管理或数字化变电站时,应预见到暂时性的成本重叠。所提出的残余补偿框架还可进一步扩展,用于估算数字化投资开始产生净成本节约的临界点,从而支持更有效的技术规划与投资决策。
除了在公用事业运营中的应用外,该框架还具有重要的监管意义。通过量化外部驱动因素对成本残差的影响,该模型为建立气候调整后的应急准备金以及评估公用事业预算申请提供了客观依据。将基于配额驱动的基准成本与扰动驱动的残差分离,也有助于实现更有效的基于绩效的监管,从而区分可控的运营效率与不可控的外部冲击。此外,相较于纯粹的统计模型或黑箱人工智能模型,基于配额驱动的预测框架具有更高的透明度和可审计性,可在电价审查和监管听证过程中将预测成本直接关联到实际运行条件和工程参数。
应承认存在若干局限性。实证分析基于中国东部一个省级电网的数据,这可能限制了研究结果向具有不同气候条件、监管环境或网络结构地区的推广性。尽管192个月的数据集对于XGBoost模型而言已足够,但在捕捉罕见但影响重大的事件方面仍相对有限,且预测性能依赖于底层成本定额数据库的质量和一致性。此外,动态定额机制依赖于综合生产者价格指数和技术进步因子,这些因素可能无法充分反映区域或部件特有的成本变化。虽然SHAP分析提高了模型的可解释性,但所报告的特征贡献反映的是预测关联性,而非因果关系,因此应谨慎解读。
未来的研究应致力于通过领域特定的大语言模型整合非结构化的运维记录,引入时空图神经网络以捕捉互联电网中扰动的传播过程,将验证范围扩展至多个区域以提高模型的泛化能力,并引入不确定性量化方法以支持具备风险意识的监管决策。这些发展方向与近期在中长期能源预测及可再生能源并网领域的进展保持一致,后者强调将数据驱动的智能方法与基于物理规律的建模框架相结合,以实现电力系统的可靠运行43,44。
所有作者均声明无利益冲突。
作者贡献:
Xiaohui Wang 提出并设计了本研究,建立了研究方法,进行了正式的数据分析,并起草了初稿。Tong Li 参与了数据整理、软件实现和验证工作。Yanchao Lu 参与了方法学的开发、研究实施和数据分析解释。Quanfeng Lv 提供了研究资源,监督了数据采集,并对稿件进行了关键性审阅。Fan Liu 对项目进行了总体监督,参与了研究概念的形成和结果解释,获取了研究经费,并对稿件进行了关键性修改。所有作者均审阅并批准了稿件的最终版本。
本工作由国家电网有限公司科技项目“生产运行成本分摊分析及异步优化技术研究”(项目编号:520600250029-183-ZN)资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 电网匿名月度核算数据集 | 中国东部某省级电网 | 不适用 | 包含192个观测值的匿名月度生产与运营成本数据集(2010–2025),涵盖实物资产、运维、宏观经济及环境数据。其中156个观测值用于模型构建,36个用于样本外测试。 |
| Matplotlib 绘图库 | Matplotlib 开发团队 | 3.5.2 | 用于生成论文图表及图形输出,包括模型性能图、拓扑结构可视化、残差诊断图、雷达图以及与SHAP相关的可视化摘要。 |
| NumPy 数值计算库 | NumPy 开发者 | 1.22.3 | 用于数值数组操作、矩阵计算及可重复性控制。在适用情况下采用固定的随机种子42。 |
| Pandas 数据处理库 | pandas 开发团队 | 1.4.2 | 用于数据导入、整合、重构、筛选和预处理,包括缺失值填补、时间序列对齐以及模型输入变量的准备。 |
| Python 编程环境 | Python 软件基金会 | 3.9.13 | 用于实现完整的预测工作流程,包括数据预处理、特征工程、模型训练、超参数优化、预测、统计检验及性能评估。 |
| Scikit-learn 机器学习库 | scikit-learn 贡献者 | 1.0.2 | 用于数据预处理、训练-验证集划分、辅助模型评估及统计分析,包括皮尔逊相关性分析和特定性能指标的计算。 |
| SciPy 科学计算库 | SciPy 贡献者 | 1.9.0 | 用于统计计算,包括皮尔逊相关性分析,以及异常值处理和缩尾处理的支持性程序。 |
| 树结构Parzen估计器实现 | Optuna 贡献者 | 3.1.0 | 采用贝叶斯优化方法调优XGBoost超参数,包括最大树深度、学习率和正则化参数。该树结构Parzen估计器通过开源Optuna包实现。 |
| XGBoost 软件库 | DMLC / XGBoost 贡献者 | 1.7.1 | 基于决策树的集成学习库,用于非线性残差补偿。该模型采用带有Huber损失函数和树复杂度惩罚项的正则化目标函数,如公式7–9所述。 |