本研究提出了一种基于多智能体协同强化学习的低压馈线验收动态协调策略。智能体在不确定条件下协调馈线运行、拥塞管理、电压稳定性及可再生能源的集成。该方法通过使用FeederBW和236节点系统数据集进行仿真评估。
本研究提出了一种基于多智能体协同强化学习的低压馈线验收动态协调策略。智能体在不确定条件下协调馈线运行、拥塞管理、电压稳定性及可再生能源的集成。该方法通过使用FeederBW和236节点系统数据集进行仿真评估。
分布式可再生能源的大规模接入以及低压(LV)馈线的快速扩展,带来了与馈线接纳能力和拥塞协调相关的运行挑战。现有的电压控制和馈线管理方法在间歇性可再生能源发电和网络条件变化的情况下,可能存在可扩展性和适应性受限的问题。为解决这些局限性,本研究提出了一种基于多智能体强化学习框架中智能体协作的低压馈线接纳动态协同框架。与主要关注电压稳定的控制策略不同,该框架通过负责馈线监测、拥塞管理及基于电压敏感度优先排序的智能体协同运行,支持动态馈线接纳。各智能体独立观测馈线状态,评估拥塞程度和电压敏感度,并协作做出馈线接纳决策。该框架通过使用FeederBW数据集和236节点低压配电网数据集进行仿真评估,涵盖了不同可再生能源接入水平和负荷条件。所提出的框架实现了97%的馈线接纳率、98%的电压合规指数、98 ms的协同延迟(在报告的硬件上测得的协同算法实际运行时间)以及98.5%的收敛速度,优于所评估的集中式协调方法。结果还表明,在模拟的低压配电网条件下,该框架在适应性、运行韧性以及去中心化决策效率方面均有提升。
由于电力需求不断增长以及分布式发电的日益普及,现代电力系统面临着严峻的运行挑战。电力供需不平衡或分布式发电量的快速增加,可能给公用事业公司和终端用户带来经济压力,并危及电网的稳定性。因此,传统的集中式化石燃料电力基础设施正逐步转向以分布式可再生能源为主导的新型架构。这一转变改善了人们对更经济、更环保能源的获取。然而,光伏(PV)发电的间歇性和不可预测性也引发了人们对电网可靠性的担忧1,2。
由于光伏发电具有环境效益好、可扩展性强以及成本不断下降等优势,全球能源转型正在加速推进其部署。根据国际可再生能源署的预测,到2050年,光伏发电装机容量预计将占全球电力供应总量的22%以上,且太阳能光伏发电有望在2030年前成为全球电力供应的主要来源之一3。这种大规模的并网应用给传统电力系统带来了重大挑战,尤其是在运行稳定性和可靠性方面。电压波动是一个关键问题,因为光伏发电具有间歇性和不可调度性,随着其在配电和输电网络中的渗透率不断提高,这种影响将更加显著4。
太阳辐照度的变化直接影响光伏系统的输出,并可能导致电压快速变化。云层移动、辐照度突变以及负载瞬变可能引起电压波动,现有电网架构难以充分适应此类波动5尽管传统技术在集中式且相对稳定的电网结构中已证明有效,但其在日益分布化的电网中适用性较差。快速的双向电压变化可能超出传统电力系统的承受能力,特别是在高比例光伏接入的情况下。6不受控制的波动可能违反电压限值,影响敏感负载,并危及电网安全。
因此,将智能负荷和分布式资源集成到配电网中,推动了更先进控制策略的发展。能够持续监测和协调分布式设备的智能控制系统,有助于缓解高比例分布式发电的低压(LV)电网所面临的挑战7。大规模光伏(PV)并网还会给热力发电带来运行难题,特别是当光伏出力下降时,热力机组必须快速响应,有时甚至超出爬坡速率限制8。与此同时,需求响应(DR)项目必须在长期可持续性与经济可行性之间取得平衡9。
需求响应(DR)项目可在支持分布式发电集成的同时,帮助平衡电力供需。这些项目可分为基于价格的需求响应和基于激励的需求响应(IBDR)。基于价格的需求响应通过随时间变化的电价激励用户调整用电行为,而基于激励的需求响应则在需要时要求用户减少用电,并提供固定或可变的经济激励10。然而,基于价格的需求响应使用户暴露于波动的批发电价风险之中,且从电力公司的角度来看,其运行灵活性有限,这可能会使风险规避型参与者望而却步11,12。
已有若干研究探讨了在光伏(PV)资源丰富的配电网系统中基于激励的需求响应(IBDR)。其中一项研究评估了将IBDR与高比例光伏渗透相结合所面临的挑战与优势,但其关注点在于聚合功率使用,而非家庭层面的家居能源管理系统13。另一项研究提出了一种基于激励的电压管理方法,通过电价信号间接控制电池运行以维持电压限值,但未对家庭用电需求进行显式建模14。一种基于模糊逻辑的激励支付确定方法考虑了用户满意度与可再生能源集成成本,但未包含馈线层级的分析15。此外,已有研究探讨了结合基于价格和基于激励的需求响应(DR)的长期发电规划,涵盖热力发电与可再生能源发电,但未计入用户舒适度或家庭层面的用电需求16。
深度强化学习(RL)也已应用于居民需求响应(DR)。已有研究提出了在分时电价下用于聚合负荷控制的深度RL方法,但其泛化能力受限于用户群体规模较小以及缺乏电器级别的调度机制17。一种结合需求响应与电压控制的多智能体强化学习框架采用了长短期记忆网络进行负荷预测,但未能解决因负荷限制导致的用户满意度下降问题18。其他研究则聚焦于使用马尔可夫决策过程对商业建筑中的空调系统进行需求响应协调,但未考虑其他居民用电负荷19。现有的深度RL电压控制研究通常未同时整合需求响应与光伏(PV)系统的接入20,21。
智能逆变器能够快速响应光伏发电输出的突发性和不规则变化22。当发生电压越限时,光伏逆变器可在毫秒级时间内动作,而传统设备可能需要数秒时间23。一些研究提出了对标准设备控制流程的改进方案,包括采用多智能体方法协调电压调节器,以及修改传统的电压控制器动作逻辑24。然而,没有配套储能的独立光伏发电系统可能加剧电压波动,并且无法缓解傍晚用电高峰,即使其可减少白天的净电力输入24,25。家用电池在白天光伏发电过剩期间可能被耗尽,若其调度未与本地用电需求和发电情况协调,则可能在夜间电动汽车充电时无法使用26,27。随机性负荷、间歇性发电以及多样化的储能行为共同作用,使得容量管理、设备寿命和系统韧性成为配电网运营商的重要关注点28。家庭能源管理系统为在用户侧实施自动控制提供了一种潜在手段。强化学习(RL)特别适用于此类应用,因为智能体可通过与环境的交互学习控制策略,同时应对不确定性并实现低延迟决策。
电动汽车路径规划领域的进展也展示了深度强化学习如何管理动态能量约束。基于异构车队的有容量限制的电动汽车路径问题综合考虑了行驶动力学、道路特征、动能阻力和充电效率,同时最小化异构车队中的最大能耗29。一种具备动态感知能力的深度强化学习方法将该问题建模为定制化的马尔可夫决策过程,并采用编码器-更新器-解码器架构。在此设计中,编码器为顶点和车辆生成角色特异性的表示,更新器随着上下文信息的变化对车辆标记进行优化,解码器则将车辆选择与车辆特定的顶点选择分离,以支持自适应决策。类似地,带取送货任务和时间窗的能量最优电动汽车路径问题采用高分辨率能耗模型,涵盖充电行为、时间依赖的驾驶动力学以及详细的路线信息30。一种基于异构注意力机制的深度强化学习框架将路径规划任务表示为马尔可夫决策过程,其中编码器捕捉车场、客户和充电站之间的角色特异性交互,解码器跟踪状态转移和时间可行性。
尽管已有这些进展,大多数低压配电网管理研究仍侧重于电压稳定和无功功率优化,而非在可再生能源出力不确定条件下的动态馈线接纳协调。基于智能逆变器和机器学习的分布式电压控制方法通常聚焦于电压补偿和无功功率优化,未能解决复杂低压网络中的自适应馈线接纳控制或基于拥塞的协调问题。同样,针对需求响应的电压约束多智能体强化学习方法,并未直接涉及互联低压配电网系统中的协同馈线接纳管理、感知拥塞的去中心化协调或节点级准入控制。基于多智能体协同的协作式电压调节方法通常利用光伏逆变器最小化电压偏差和分接头操作次数,但未考虑自适应馈线准入、与可再生能源相关的接纳不稳定性,或在动态网络条件下去中心化的协调机制。
当前的分布式和多智能体资源协调方法在拥塞感知、时间适应性和可扩展性方面也存在局限性。大多数方法侧重于过载分析、分布式能源资源交互或基于电价的能量管理,而非自适应的馈线级接纳能力与电压感知的协调控制。这些方法依赖部分中心化架构和静态优先级,可能进一步限制去中心化决策、对拥塞传播的快速响应,以及对可再生能源波动性的适应能力。因此,亟需一种完全去中心化的、基于强化学习的框架,将协同智能体协调与电压和拥塞敏感性分析相结合,以实现基于大规模数据集(如 FeederBW 和 236 节点低压配电网)的自适应馈线接纳管理。
本研究中,馈线接纳能力是指一种适应性运行过程,用于判断低压馈线在维持网络安全性、电压合规性、热负载限值和运行可靠性的前提下,是否能够接纳额外的分布式能源或电力负荷。馈线接纳的运行边界包括在接纳或优先处理新的馈线接入之前,评估馈线容量、电压敏感性、拥塞状况以及可再生能源的波动性。与传统的电压控制(调节电压分布)、分布式能源协调(管理资源运行)或拥塞管理(缓解网络过载)不同,馈线接纳能力将这些功能集成于一个协作式多智能体强化学习框架内,以在高比例可再生能源条件下支持动态、去中心化且自适应的协调运行。
本研究旨在开发一种基于协作智能代理的动态编排策略,以应对运行条件变化和可再生能源不确定性下的低压馈线接纳问题。所提出的框架通过动态评估馈线状态、电压灵敏度、拥塞灵敏度及接纳能力,实现去中心化的馈线接纳编排,从而超越静态电压控制方法,实现自适应的优先级排序与决策。利用FeederBW数据集和236节点低压配电网数据集,本研究还开发了一种可扩展的多智能体强化学习架构,适用于大规模低压系统。该框架在每次模拟运行时间间隔内执行强化驱动学习和低延迟协作优化,旨在减少拥塞传播、提高电压合规性、降低编排延迟,并提升去中心化协调效率。
该框架提出了一种动态的低压馈线接纳编排方法,可取代基于静态电压控制的馈线管理策略;采用去中心化的多智能体强化学习架构,以应对可再生能源的不确定性及变化的负载条件;基于低延迟条件和动态馈线优先级实施去中心化准入管理;通过联合的电压敏感性与阻塞敏感性指标,识别关键馈线并优先做出接纳决策;实现相邻智能体之间的协同通信;通过持续的基于强化学习的策略优化,提升馈线稳定性、缓解阻塞、确保电压合规性并加快收敛速度;并利用FeederBW和236节点低压馈线数据集进行大规模基于仿真的验证。对比结果表明,相较于传统的集中式协调方法,该方法在馈线接纳能力、阻塞缓解、编排延迟、收敛速度和电压合规性方面均有提升。
本研究未使用人类受试者、脊椎动物、人体组织或动物组织。研究仅使用了公开可获取的数据集(FeederBW 数据集和 236 节点低压配电网数据集)以及基于计算机的仿真。因此,本研究无需经过机构审查委员会(IRB)、伦理或知情同意审批。
基于智能体协作的低压馈线接纳动态协调策略在富含可再生能源的运行条件下,采用多智能体强化学习(MARL)方法开发而成。FeederBW 和 236 节点低压数据集经过预处理、归一化和时间同步,用于构建动态网络模型,以表征馈线状态、分布式能源资源、电压敏感区域及拥塞状况。将智能体分配至馈线区段和网络节点,用于监测本地电压、拥塞情况、可再生能源发电不确定性及馈线接纳能力,与邻近智能体交换信息,并通过去中心化的强化学习更新协调策略。奖励函数的设计旨在提升馈线接纳能力,同时限制拥塞、电压失稳和协调延迟。研究中考虑了电压、馈线负载、变压器负载和拥塞约束,但未显式建模三相不平衡运行、先进光伏逆变器控制和无功功率补偿。整体框架如图1所示。本研究使用的研究工具列于材料表中。

图1:所提出框架的架构。 动态编排框架的示意图,包含智能代理、强化学习、拥塞分析以及自适应馈线协调。 请点击此处查看此图的放大版本。
1. 数据采集
数据来自 FeederBW 数据集31 和 236 节点低压配电数据集32。选择这些数据集是因为它们包含了分布式协调和基于强化的智能体学习所需的馈线拓扑、电压状况、可再生能源发电行为、负荷需求、拥塞情况以及动态运行特征信息。
FeederBW 数据集主要用于对低压电网中的馈线运行、可再生能源间歇性、电压偏差以及阻塞传播进行建模。该数据集包含支持自适应协调分析的馈线运行数据、分布式发电行为、节点电压测量值以及负荷波动数据。236 节点低压数据集用于评估系统的可扩展性与分布式协调能力,其中包含节点连接信息、馈线负载状况、节点电压特性、分布式可再生能源渗透情况以及对阻塞敏感的运行工况。这两个数据集共同支持在高比例可再生能源渗透条件下开展馈线层级和大规模系统分析。数据集特征及其在框架中的用途汇总于表 1中。
| 数据集名称 | 数据集类型 | 节点/母线数量 | 数据属性 | 在本研究中的用途 |
| FeederBW 数据集 | 低压馈线运行数据集 | 多个馈线节点 | 电压曲线、可再生能源发电、负荷需求、拥塞状态、馈线运行行为 | 低延迟馈线协调控制、拥塞分析、自适应接入优先级排序 |
| 236母线低压数据集 | 大规模低压配电数据集 | 236 条母线 | 母线拓扑、馈线负载、电压敏感性、可再生能源渗透率、拥塞动态 | 可扩展性验证、去中心化协调评估、大规模协调分析 |
表1:数据集特征。 各数据集的描述、操作属性及其在所提出的低压协调框架中的用途。
2. 数据预处理
对获取的数据集进行了预处理,以提高一致性、时间对齐性以及强化学习的稳定性。通过统计预处理方法,过滤了缺失条目、错误测量值、重复记录以及不一致的馈线数据。该步骤用于保持馈线运行数据、可再生能源发电曲线、电压测量值和拥塞状态数据之间的一致性。所有运行变量均进行了最小-最大归一化处理,使输入特征转换到适用于智能体学习的统一量纲。归一化的变量包括馈线电压、有功功率需求、可再生能源发电量、拥塞状态以及馈线接纳能力。预处理过程的数学表述见补充文件1(第1节)。
3. 动态低压电网建模
在数据采集和预处理之后,构建了一个动态的低压网络模型,用于模拟在不同负荷和发电条件下,高比例可再生能源接入的配电系统的运行行为。该模型能够动态追踪馈线拓扑结构、分布式能源资源行为、电压敏感区域以及拥塞传播过程。
与静态网络表示不同,该模型根据可再生能源的间歇性、用户需求和拥塞状况动态更新馈线行为。采用 FeederBW 和 236 节点低压(LV)数据集构建了互联馈线系统,其中母线、变压器、分布式可再生能源和负荷被表示为网络节点。每个馈线节点提供关于电压幅值、有功功率需求、可再生能源发电、馈线负载状态和拥塞状态的实时更新信息。智能代理利用这些变量监测馈线运行状态,并做出去中心化的协调决策。该网络模型还通过连续的敏感性分析,支持识别敏感区域和馈线接入优先级排序。
低压配电网络被表示为一个基于图的网络,包含母线站、馈线、变压器、可再生能源源和用户负荷节点。网络模型的详细数学推导见补充文件1(第2节)。动态网络状态和拥塞指数被持续监测。拥塞指数被归一化至[0,1]范围内,当拥塞指数超过0.80时,启动协同馈线接入协调机制。
4. 多智能体环境初始化
在构建动态低压网络模型后,初始化了多智能体环境以支持分散式馈线接入。智能体被分配至低压网络中的馈线区段、分布式能源接入点、变压器位置以及易发生拥塞的节点。
每个智能体作为一个独立的决策实体运行,监控本地馈线的运行状态,与相邻智能体交换信息,并执行自适应协调操作。智能体根据电压敏感性、可再生能源渗透率、拥塞程度及馈线重要性被分配至关键馈线节点。低压网络被配置为基于智能体的环境,其中各智能体持续监测馈线电压、有功功率需求、可再生能源发电波动、拥塞状态以及馈线接纳能力。多智能体环境的数学建模详见补充文件1(第3节)。
5. 基于强化驱动的智能体学习
在多智能体环境初始化后,实施了基于强化学习的训练,使智能体能够通过与变化的低压(LV)运行条件进行交互,学习馈线协调策略。在每次交互中,智能体观测当前馈线状态,选择一个协调动作,并获得相应的奖励或惩罚。这种去中心化的学习过程使智能体能够适应可再生能源发电的不确定性、变化的拥塞状况、电压波动以及馈线接纳能力的变化。每个智能体根据其学习到的策略选择协调动作。相关的数学推导详见补充文件1(第4节)。
共部署了64个智能代理。根据馈线拓扑结构、可再生能源渗透水平、电压敏感性以及拥塞严重程度,每个代理被分配至馈线区段、变压器站点、分布式能源资源接入点或对拥塞敏感的网络节点。在保持合理计算复杂度的同时,这种去中心化部署使得在整个236节点的低压配电网中实现了协同监控和自适应馈线接纳能力。每个代理观测一个五维状态向量,包括电压幅值、馈线负荷需求、可再生能源发电量、拥塞状态以及馈线接纳容量。动作空间包含五种协调操作:馈线接纳优先级设定、拥塞缓解、可再生能源协调、负荷平衡和电压控制。通过一种去中心化的邻域通信拓扑结构支持协同决策,其中每个代理仅与相邻的馈线代理交换灵敏度指标和本地运行信息。
采用具有两个隐藏层(分别包含 128 和 64 个神经元)的全连接神经网络实现了一种基于 Q 学习的多智能体强化学习(MARL)方法。隐藏层中应用了修正线性单元激活函数。网络参数使用 Adam 优化器进行优化,学习率为 0.001,折扣因子为 0.99。采用大小为 64 的小批量训练,经验回放缓冲区的容量为 100,000 次状态转移。当过去 20 个回合的累积奖励移动平均值在连续 10 个评估窗口内变化小于 0.1% 时,认为训练已收敛。若未满足此条件,则训练将继续,直至达到最多 500 个回合。强化学习的工作流程如 图 2 所示。

图 2:基于强化学习的智能体学习流程图。该流程图展示了用于去中心化馈线协调与决策优化的强化学习驱动的智能体学习过程。请点击此处查看此图的放大版本。
学习过程首先初始化低压配电网环境、智能体状态和学习参数。智能体被部署在馈线区域、分布式能源资源位置以及易发生拥塞的母线处。随后定义了观测空间、学习率、探索策略、奖励因子和策略函数。在每一轮交互中,每个智能体观测其指定馈线区域的当前状态。该状态包括节点电压幅值、馈线负荷需求、可再生能源发电特性、拥塞水平以及馈线接纳能力。这些观测值构成用于协调决策的环境状态。每个智能体根据其强化学习策略选择一个动作。可选动作包括馈线接入优先级排序、拥塞管理、可再生能源协调、负荷平衡和电压管理。所选动作被应用于动态低压环境,随后更新馈线状态。
每次操作后均计算一次奖励。当所选操作改善了馈线接纳能力、防止了拥塞传播、维持了电压合规性或提升了网络稳定性时,赋予正向奖励。若操作导致或未能避免馈线过载、电压越限或编排延迟,则施加惩罚。所计算的奖励用于通过强化优化更新智能体的价值函数与决策策略。重复执行观测、动作选择、环境转移、奖励计算及策略更新的序列,直至满足终止条件。
6. 电压与拥塞敏感性评估
在强化驱动学习之后,评估了电压和拥塞敏感性,以识别易受影响的馈线区域,并在可再生能源不确定性条件下支持动态馈线接入决策。
在每个运行时间间隔内,确定了馈线功率、可再生能源发电和负荷需求变化对节点电压和网络阻塞的影响。电压和阻塞灵敏度指标在每次模拟运行时间间隔均重新计算,而非仅基于静态网络条件推导得出。各馈线节点的灵敏度指标根据当前网络状态、可再生能源发电波动以及馈线负载情况动态更新。所得数值用于对馈线节点进行排序,以指导馈线接入、阻塞管理和电压控制操作。
电压灵敏度指数用于量化有功功率流动变化所引起的节点电压变化。在计算出电压灵敏度指数和阻塞灵敏度指数后,将二者结合形成综合灵敏度评分,以实现对馈线接入的自适应优先级排序。综合评分方法详见补充文件1(第5节)。在缓解阻塞、校正馈线接入以及电压调节操作过程中,灵敏度评分较高的馈线节点被赋予更高的协调优先级。灵敏度评分在每个运行时间间隔内重新计算,并通过协同通信环境共享给相邻的代理单元。
7. 每个模拟运行时间间隔内的协作接受协调与自适应决策优化
在进行灵敏度评估后,执行了协作式接纳协调,以使分布式代理能够在可再生能源不确定性及动态阻塞条件下,做出协调一致的馈线接纳决策。各代理交换本地馈线状态、灵敏度指标、阻塞告警以及运行优先级信息。每个代理在独立评估其本地馈线状况的同时,与相邻代理进行协调,以支持整个网络的稳定性。
根据电压敏感性、阻塞严重程度、可再生能源发电的波动性以及馈线可用容量,对馈线接纳能力进行了优先级排序。各智能体对具备本地敏感性感知的观测结果进行汇总,并协同生成馈线接纳决策。协作协调过程的数学表述详见补充文件1(第6节)。动态低压配电网环境部署了协作式智能体,分别位于馈线区域、可再生能源接入点以及易发生阻塞的母线处,具体如补充文件1(算法1)所述。在每个运行时段,各智能体均观测本地馈线参数,包括电压幅值、可再生能源出力变化、馈线负载率、阻塞水平以及馈线接纳容量。
随后计算了电压敏感性指数和拥塞敏感性指数,以识别易受电压失稳或拥塞传播影响的馈线区域。这些指数被合并为一个综合的馈线敏感性评分,用于确定馈线的接纳能力与协调优先级。各相邻智能体之间交换本地状态信息、拥塞水平、电压失稳指标以及接纳优先级。基于本地观测和共享的信息,每个智能体选择并执行自适应协调动作。每次动作后,根据馈线稳定性、拥塞缓解程度、电压合规性及馈线接纳效率,从动态的低压网络环境中获取强化反馈。该反馈用于通过基于强化学习的优化方法更新每个智能体的策略。全局协调目标函数同时为整个智能体群体的自适应优化提供协调反馈。策略更新持续进行,直至各智能体的策略收敛于最优的分布式协调策略。
8. 大规模验证
采用FeederBW数据集和236节点低压配电网数据集,在高可再生能源渗透率的运行场景下验证了动态协调策略。该验证评估了去中心化协调框架在互联低压配电网系统中管理动态馈线接纳能力、可再生能源间歇性、阻塞传播及电压不稳定性的能力。所评估的运行场景包括高可再生能源渗透率、变化的负荷需求、动态阻塞传播、电压敏感条件以及变化的馈线接纳容量。
使用馈线接受率、电压合规性指数、拥塞降低率、编排延迟、收敛速度、去中心化协调效率以及可再生能源接纳能力来评估框架性能。这些指标用于评估可扩展性、鲁棒性、适应性以及协调性能。在相同的网络配置下,将所提出的框架与传统的集中式馈线编排方法进行了比较。对对比方法采用了相同的等效数据集、运行场景、评估条件和性能指标。
表2总结了用于实验验证的数据集、运行条件、编排环境和性能变量。FeederBW 数据集用于评估低压馈线条件下馈线运行动态、可再生能源间歇性、拥塞发展、居民负荷变化以及电压波动。236节点低压数据集用于评估大规模互联系统中的去中心化编排。该架构在可再生能源发电、负荷需求、电压和拥塞等不同条件下进行了验证。通过智能代理对去中心化协调与基于强化学习的策略优化进行了联合评估。
在可再生能源系统动态运行条件下,采用馈线接受率、电压合规指数、拥塞缓解率、收敛速度和编排延迟来量化性能。
| 实验参数 | FeederBW 数据集 | 236节点低压数据集 | 验证目的 |
| 网络类型 | 低压馈线网络 | 大规模低压配电网络 | 动态协调评估 |
| 节点/母线数量 | 多个馈线节点 | 236 条母线 | 可扩展性分析 |
| 可再生能源集成 | 光伏与分布式可再生能源 | 高可再生能源渗透母线 | 可再生能源不确定性验证 |
| 负荷需求行为 | 动态居民负荷曲线 | 大规模馈线负荷变化 | 自适应负荷协调 |
| 拥塞场景 | 馈线过载与拥塞状态 | 多母线拥塞传播 | 拥塞缓解分析 |
| 电压条件 | 电压波动曲线 | 电压敏感母线状态 | 电压合规性评估 |
| 智能代理 | 分布式馈线代理 | 大规模协作代理 | 去中心化协调分析 |
| 学习环境 | 基于强化学习的协调机制 | 多代理自适应学习 | 策略优化验证 |
| 仿真条件 | 动态可再生能源波动性 | 大规模动态运行 | 低延迟协调测试 |
| 性能指标 | 接受率、拥塞减少量 | 电压合规性、收敛速度 | 整体协调性能 |
表2:大规模实验验证。用于评估可扩展性、可再生能源不确定性及去中心化协调能力的实验设置。
所有实验均使用不同的随机种子重复五次,以降低随机学习带来的影响。最终结果取五次运行的平均值。所有方法均采用相同的数据集、仿真参数、超参数、停止准则和评估流程。对比方法包括集中式电压控制(Centralized Voltage Control, CVC)33、传统多智能体控制(Conventional Multi-Agent Control, CMAC)21、基于强化学习的电压调节(Reinforcement Learning-Based Voltage Regulation, RLVR)20、分布式能源协调(Distributed Energy Resource Coordination, DERC)26以及基于灵敏度的拥塞管理(Sensitivity-Based Congestion Management, SBCM)34。
采用单因素方差分析(ANOVA),针对每项评估指标,分别对所提出的框架与基线技术(CVC、CMAC、RLVR、DERC 和 SBCM)进行统计学比较。当方差分析结果显示存在统计学显著差异时,采用 Tukey 的真实显著性差异(HSD)事后检验进行成对比较。统计显著性阈值设定为 p < 0.001。所有统计分析均采用单因素方差分析,必要时随后进行显著性差异事后检验。单因素 ANOVA 使用 statsmodels.stats.anova 模块完成。统计显著性检验所用数据来自每种方法独立进行的五次模拟运行所得的最终收敛性能值。中间训练阶段的目的是可视化学习过程;这些阶段未进行统计显著性检验。
数据采集
FeederBW 和 236 节点低压(LV)配电数据集支持在互补运行条件下对所提出的框架进行评估。FeederBW 数据集提供了时间序列的馈线信息,包括电压、分布式可再生能源发电、负荷需求、拥塞状况以及馈线接纳行为。该数据集用于评估动态馈线运行、可再生能源间歇性、居民用电负荷变化、拥塞传播以及电压波动。
236节点低压配电数据集包含236个互联节点,涵盖了馈线拓扑结构、电压敏感区域、可再生能源渗透条件、潮流状态以及拥塞传播场景。该数据集用于评估在更大规模互联配电网络中的去中心化协调能力、自适应编排能力及可扩展性。表3和表4总结了实验验证条件和仿真环境。
| 验证参数 | 描述 |
| 所用数据集 | FeederBW 数据集和 236 节点低压数据集 |
| 网络环境 | 动态低压高比例可再生能源配电网系统 |
| 可再生能源来源 | 分布式光伏(PV)和可再生发电装置 |
| 学习框架 | 多智能体强化学习(MARL) |
| 协调策略 | 协作式去中心化协调 |
| 运行场景 | 可再生能源间歇性、负荷波动、拥塞传播 |
| 智能体数量 | 64 个分布式馈线级协作智能体 |
| 验证目标 | 自适应馈线接纳能力优化 |
| 评估过程 | 实时协调与灵敏度感知的协同控制 |
| 对比分析 | 与传统集中式协调方法进行比较 |
表3:环境验证参数。 用于评估动态低压运行条件下自适应协调能力的验证参数。
| 仿真组件 | 配置 |
| 处理器环境 | 高性能多核处理系统 |
| 编程框架 | Python 3.11.9 |
| 学习框架 | 多智能体强化学习(MARL) |
| 学习算法 | 基于Q学习的多智能体强化学习 |
| 神经网络架构 | 全连接神经网络,包含两个隐藏层(128和64个神经元,ReLU激活函数) |
| 优化器 | Adam优化器 |
| 学习率(α) | 0.001 |
| 折扣因子(γ) | 0.99 |
| 回放机制 | 经验回放缓冲区(容量:100,000次状态转移) |
| 小批量大小 | 64 |
| 探索策略 | ε-贪婪探索(ε从1.0衰减至0.01) |
| 训练回合数 | 500 |
| 停止准则 | 达到最大训练回合数或累积奖励收敛 |
| 网络建模 | 低压馈线网络动态仿真 |
| 可再生能源仿真 | 可变可再生能源发电曲线 |
| 智能体协调 | 分布式协同通信 |
| 数据处理 | 实时同步馈线状态处理 |
| 优化方法 | 基于强化的自适应策略学习 |
| 实验平台 | 基于FeederBW数据集和236节点低压配电网数据集的大规模仿真 |
| 性能监控 | 馈线接纳率(FAR)、电压合规指数(VCI)、拥塞降低率(CRR)、编排延迟(OL)、收敛速度(CS)和去中心化协调效率(DCE) |
| 奖励权重(β) | 0.3 |
| 奖励权重(δ) | 0.25 |
| 目标权重(ω₁) | 0.30(馈线接纳) |
| 目标权重(ω₂) | 0.25(拥塞降低) |
| 目标权重(ω₃) | 0.25(电压合规) |
| 目标权重(ω₄) | 0.20(编排延迟) |
| 策略学习率(η) | 0.001 |
| 正则化/平衡参数(λ) | 0.1 |
表4:模拟环境。用于基于强化的馈线编排实验的模拟设置。
数据预处理
经过同步化和归一化处理的数据支持在所提出的框架与基线方法之间进行一致的比较。所有评估均使用相同的预处理馈线状态、可再生能源发电曲线、负荷需求条件、电压条件以及拥塞场景。这种统一的输入结构减少了由数据集准备带来的差异,使得观察到的性能差异可归因于所评估的编排方法本身。
动态低压网络建模
动态低压网络模型表征了可再生能源发电的变化、用户需求、电压状况、馈线负载及拥塞传播。在这些条件下,所提出的框架在响应电压敏感型和拥塞敏感型运行状态的同时,维持了馈线的接纳能力。该模型支持在可再生能源发电波动、用户负荷变化以及易发生拥塞的网络条件下进行评估。在各种条件下,协作代理实现了馈线优先级排序、依赖电压的协调控制、拥塞缓解以及可再生能源的消纳,且无需集中式控制。
多智能体环境初始化
去中心化的代理架构支持对馈线区域和网络节点的本地观测以及协调决策。各代理在独立选择编排动作的同时,与相邻代理交换馈线状态信息和灵敏度指标。观察到的协调行为表明,这种分布式架构能够支持馈线优先级排序、负荷协调、电压管理以及拥塞响应。去中心化配置还降低了对单一集中控制器的依赖,并支持在更大的236节点网络中实现协调运行。
强化驱动的智能体学习
在训练期间,基于强化学习的策略在馈线接纳、电压合规性、拥塞缓解、编排延迟和收敛速度方面均得到提升。图3对比了所提出框架与CVC、CMAC、RLVR、DERC和SBCM在馈线接纳率(FAR)上的表现。CVC的FAR最低,从62%提升至70%。CMAC和DERC的FAR最大值分别为75%和78%。RLVR和SBCM分别达到83%和81%。所提出的框架在训练初期FAR为72%,后期提升至97%。该结果表明,协同强化学习过程能够在可再生能源不确定性及低压运行条件变化下,支持自适应的馈线接纳能力。

图3: 饲电器具接受率(FAR)。 所提出框架与基线饲电器具协调方法在FAR上的比较。通过五次独立仿真实验,将所提出框架与各基线方法进行比较,结果以均值±标准差表示。统计学显著性评估标准为 p < 0.001,并提供95%置信区间。缩写:FAR,饲电器具接受率;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。 请点击此处查看该图的高清版本。
图4展示了电压合规性指数(VCI)。CVC从70%提高到77%,而CMAC和DERC分别达到约81%和84%。RLVR和SBCM分别达到88%和86%。所提出的框架在早期训练阶段为78%,收敛时提升至约98%。较高的VCI表明,在间歇性可再生能源发电和变化的负荷需求条件下,所提出的方法在维持电压合规性方面优于对比方法。

图 4: 电压合规性指数(VCI)。 在动态低压运行条件下 VCI 的对比分析。通过五次独立的仿真运行,将所提出的框架与各基线方法进行比较,结果以均值 ± 标准差表示,并计算 95% 置信区间,统计学显著性水平设定为 p < 0.001。 缩略词:VCI,电压合规性指数;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。 请点击此处查看该图的放大版本。
图5 中的 VCI 热图显示了各训练阶段中电压合规性的变化趋势。在后续迭代中,所提出的框架达到了 95% 至 98% 的数值,而 CVC 保持在 70% 至 77% 之间,RLVR 和 SBCM 分别达到约 88% 和 86%。因此,该热图表明,在学习的后期阶段,所提出的框架保持了最高的电压合规性能。

图 5: 电压合规性指数(VCI)热图。 该热图展示了不同训练迭代次数和馈线协调方法下的 VCI 性能表现。颜色标尺表示电压合规性指数的大小,较浅的颜色代表较低的 VCI 值,较深的颜色代表较高的 VCI 值。 缩写:VCI,电压合规性指数;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。 请点击此处查看此图的放大版本。
表5展示了拥堵缓解率(CRR)。CVC从48%提高到63%。CMAC和DERC分别达到约73%和75%,而RLVR达到80%,SBCM达到82%。所提出的框架在训练初期为64%,收敛后提升至约96%。与各对比方法的最终值相比,该框架的CRR分别比CVC提高约33%,比CMAC提高23%,比RLVR提高16%,比DERC提高21%,比SBCM提高14%。这些结果表明,与集中式、传统多智能体、电压调节、分布式资源以及基于灵敏度的对比方法相比,所提出的协同编排策略在抑制拥堵传播方面更为有效。图6对比了编排延迟(OL)。报告的编排延迟是指在指定硬件平台上进行仿真时,所提出的编排算法所消耗的实际时钟执行时间,不应将其理解为实际部署的配电网的物理运行时间。所提出的框架将OL从220 ms降低至98 ms。在收敛状态下,CVC、CMAC、RLVR、DERC和SBCM的延迟分别为283 ms、253 ms、215 ms、242 ms和205 ms。因此,与CVC、CMAC、RLVR、DERC和SBCM相比,所提出的框架分别将延迟降低了约65%、61%、54%、59%和52%。较低的延迟表明,去中心化的协作能够实现更快速的馈线编排决策。
| 训练轮次 | CVC (%)(均值 ± 标准差) | CMAC (%)(均值 ± 标准差) | RLVR (%)(均值 ± 标准差) | DERC (%)(均值 ± 标准差) | SBCM (%)(均值 ± 标准差) | 提出的方法 (%)(均值 ± 标准差) |
| 1 | 48.0 ± 0.5 | 52.0 ± 0.5 | 56.0 ± 0.4 | 54.0 ± 0.5 | 58.0 ± 0.4 | 64.0 ± 0.3 |
| 2 | 50.0 ± 0.5 | 54.0 ± 0.5 | 59.0 ± 0.4 | 56.0 ± 0.5 | 61.0 ± 0.4 | 68.0 ± 0.3 |
| 3 | 52.0 ± 0.5 | 57.0 ± 0.4 | 62.0 ± 0.4 | 59.0 ± 0.5 | 64.0 ± 0.4 | 72.0 ± 0.3 |
| 4 | 54.0 ± 0.4 | 60.0 ± 0.4 | 65.0 ± 0.4 | 62.0 ± 0.4 | 67.0 ± 0.4 | 76.0 ± 0.2 |
| 5 | 56.0 ± 0.4 | 62.0 ± 0.4 | 68.0 ± 0.3 | 64.0 ± 0.4 | 70.0 ± 0.3 | 80.0 ± 0.2 |
| 6 | 58.0 ± 0.4 | 65.0 ± 0.4 | 71.0 ± 0.3 | 67.0 ± 0.4 | 73.0 ± 0.3 | 84.0 ± 0.2 |
| 7 | 60.0 ± 0.4 | 67.0 ± 0.4 | 74.0 ± 0.3 | 69.0 ± 0.3 | 76.0 ± 0.3 | 87.0 ± 0.2 |
| 8 | 61.0 ± 0.4 | 69.0 ± 0.3 | 76.0 ± 0.3 | 71.0 ± 0.3 | 78.0 ± 0.3 | 90.0 ± 0.2 |
| 9 | 62.0 ± 0.4 | 71.0 ± 0.3 | 78.0 ± 0.3 | 73.0 ± 0.3 | 80.0 ± 0.3 | 93.0 ± 0.2 |
| 10 | 63.0 ± 0.4 | 73.0 ± 0.3 | 80.0 ± 0.3 | 75.0 ± 0.3 | 82.0 ± 0.3 | 96.0 ± 0.2 |
表5:阻塞缓解率(CRR):基于五次独立仿真实验,比较所提出的框架与基线馈线协调方法的阻塞缓解率(CRR)的平均值±标准差。缩写:CRR,阻塞缓解率;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的阻塞管理。

图6: 编排延迟(OL)。 自适应去中心化馈线协调过程中编排延迟的对比分析。数据基于五次独立仿真实验,以均值±标准差表示,比较所提框架与各基线方法的性能,并提供95%置信区间,统计学显著性水平为 p < 0.001。 缩写:OL,编排延迟;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。 请点击此处查看该图的放大版本。
图7展示了收敛速度(CS)。CVC在经过20轮训练后,收敛比例从42%提升至67%。CMAC和DERC分别达到约74%和79%。RLVR达到87%,SBCM达到约90%。本文提出的框架在第一轮训练时为58%,收敛时达到98.5%,在第十轮时已超过93%。与CVC相比,该框架最终收敛性能提高了31.5%;相较于CMAC提高24.5%;相较于RLVR提高11.5%;相较于DERC提高19.5%;相较于SBCM提高8.5%。这些结果表明,本文提出的策略相较于对比方法能够更快地达到稳定的编排性能。

图 7: 收敛速度(CS)。收敛曲线展示了各评估方法在自适应学习效率及编排收敛速度方面的表现。缩写:CS,收敛速度;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的阻塞管理。 请点击此处查看该图的高清版本。
协作式接纳协调与低延迟自适应决策优化
图8 展示了去中心化协调效率(DCE)。CVC的DCE最低,为68%;CMAC达到75%;DERC达到79%;RLVR达到84%;SBCM达到88%。所提出的框架实现了97%的DCE。该框架相比CVC高出29个百分点,相比CMAC高出22个百分点,相比DERC高出18个百分点,相比RLVR高出13个百分点,相比SBCM高出9个百分点。该结果表明,局部信息交换、邻近智能体协调以及去中心化策略优化相较于对比方法能够支持更高效的协调。

图 8: 去中心化协调效率(DCE)。智能体协作过程中 DCE 的比较分析。数据以五次独立仿真运行的均值 ± 标准差表示,将所提出的框架与各基线方法进行对比,统计学显著性水平为 p < 0.001,并计算 95% 置信区间。缩写:DCE,去中心化协调效率;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源资源协调;SBCM,基于灵敏度的阻塞管理。 请点击此处查看该图的放大版本。
图9 和 表6 展示了可再生能源消纳能力(RAC)。CVC 从 52% 提高到 63%。CMAC 和 DERC 分别达到约 72% 和 76%。RLVR 达到约 83%,SBCM 达到 86%。所提出的框架在学习初期为 70%,收敛时提升至 97%。与 CVC 相比,该框架高出 34 个百分点,比 CMAC 高出 25 个百分点,比 RLVR 高出 14 个百分点,比 DERC 高出 21 个百分点,比 SBCM 高出 11 个百分点。这些结果表明,所提出的协同优化方法在维持馈线运行、电压性能和拥塞感知的同时,能够消纳更高比例的可再生能源发电。

图9: 可再生能源消纳能力(RAC)。 在富含可再生能源的馈线系统中对RAC进行的对比分析。通过五次独立的仿真运行,将所提出的框架与各基线方法进行比较,结果以均值±标准差表示,并计算95%置信区间,统计学显著性水平为 p < 0.001。 缩写:RAC,可再生能源消纳能力;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。 请点击此处查看该图的放大版本。
| 训练迭代次数 | CVC (%) (均值 ± 标准差) | CMAC (%) (均值 ± 标准差) | RLVR (%) (均值 ± 标准差) | DERC (%) (均值 ± 标准差) | SBCM (%) (均值 ± 标准差) | 提出的方法 (%) (均值 ± 标准差) |
| 1 | 52.0 ± 0.5 | 58.0 ± 0.5 | 64.0 ± 0.4 | 60.0 ± 0.5 | 66.0 ± 0.4 | 70.0 ± 0.3 |
| 2 | 54.0 ± 0.5 | 60.0 ± 0.5 | 67.0 ± 0.4 | 62.0 ± 0.5 | 69.0 ± 0.4 | 74.0 ± 0.3 |
| 3 | 55.0 ± 0.4 | 62.0 ± 0.4 | 70.0 ± 0.4 | 64.0 ± 0.4 | 72.0 ± 0.4 | 78.0 ± 0.3 |
| 4 | 57.0 ± 0.4 | 64.0 ± 0.4 | 73.0 ± 0.3 | 66.0 ± 0.4 | 75.0 ± 0.3 | 82.0 ± 0.2 |
| 5 | 58.0 ± 0.4 | 66.0 ± 0.4 | 75.0 ± 0.3 | 68.0 ± 0.4 | 77.0 ± 0.3 | 86.0 ± 0.2 |
| 6 | 59.0 ± 0.4 | 67.0 ± 0.4 | 77.0 ± 0.3 | 70.0 ± 0.3 | 79.0 ± 0.3 | 89.0 ± 0.2 |
| 7 | 60.0 ± 0.4 | 68.0 ± 0.3 | 79.0 ± 0.3 | 72.0 ± 0.3 | 81.0 ± 0.3 | 91.0 ± 0.2 |
| 8 | 61.0 ± 0.4 | 69.0 ± 0.3 | 80.0 ± 0.3 | 73.0 ± 0.3 | 83.0 ± 0.3 | 93.0 ± 0.2 |
| 9 | 62.0 ± 0.4 | 70.0 ± 0.3 | 81.0 ± 0.3 | 74.0 ± 0.3 | 84.0 ± 0.3 | 95.0 ± 0.2 |
| 10 | 63.0 ± 0.4 | 72.0 ± 0.3 | 83.0 ± 0.3 | 76.0 ± 0.3 | 86.0 ± 0.3 | 97.0 ± 0.2 |
表6:可再生能源消纳能力(RAC):基于五次独立仿真运行结果的可再生能源消纳能力(RAC)均值±标准差,用于比较所提出的框架与基线馈线协调方法的性能。缩写:RAC,可再生能源消纳能力;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。
电压与拥塞敏感性评估
图10 展示了电压灵敏度稳定性(VSS)。CVC从60%提升至69%;CMAC和DERC分别达到约76%和78%,而RLVR达到84%。所提出的框架在早期训练阶段为74%,收敛后提升至98%。该框架相较CVC提高了29个百分点,相较CMAC提高了22个百分点,相较RLVR提高了14个百分点,相较DERC提高了20个百分点,相较SBCM提高了12个百分点。这些结果表明,具备灵敏度感知能力的框架在可再生能源间歇性、负荷需求变化和动态拥塞条件下,能够维持更强的电压敏感馈线性能。

图 10: 电压灵敏度稳定性(VSS)。 自适应电压感知馈线协调过程中电压灵敏度稳定性的比较分析。通过五次独立的仿真运行,将所提出框架与各基线方法进行比较,结果以均值 ± 标准差表示,并计算 95% 置信区间,在 p < 0.001 水平评估统计学显著性。缩写:VSS,电压灵敏度稳定性;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。 请点击此处查看该图的放大版本。
图11 展示了拥塞敏感性指数(CSI)。CVC 从 52% 增加到 63%。CMAC 和 DERC 分别达到 72% 和 76%。RLVR 达到约 83%,SBCM 达到约 86%。所提出的框架在训练初期为 72%,到训练结束时提升至约 98%。该框架相比 CVC 提高了约 35 个百分点,相比 CMAC 提高了 26 个百分点,相比 RLVR 提高了 15 个百分点,相比 DERC 提高了 22 个百分点,相比 SBCM 提高了 12 个百分点。热图显示,所提出的方法在后期训练阶段始终保持最高的拥塞敏感性性能。

图11:拥塞敏感性指数(CSI)热图。该热图展示了不同训练阶段和馈线协调方法下的拥塞敏感性性能。 颜色标度表示拥塞敏感性指数的大小,较浅的颜色表示较低的CSI值,较深的颜色表示较高的CSI值。 缩写:CSI,拥塞敏感性指数;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于敏感性的拥塞管理。 请点击此处查看此图的放大版本。
大规模验证
图12 和表7展示了馈线稳定性指数(Feeder Stability Index, FSI)。CVC的平均FSI为64.7%,而CMAC和DERC的平均FSI分别为72.5%和76.0%。RLVR的平均FSI为81.5%。所提出的框架在电压稳定性方面达到97%,拥塞控制达到96%,可再生能源集成能力达到95%,负荷平衡效率达到94%,协调效率达到98%,响应速度达到97%。这些组件数值产生的平均FSI约为96.2%。与CVC相比,该框架使平均FSI提高了约31.5个百分点;与CMAC相比提高了23.7个百分点;与RLVR相比提高了14.7个百分点;与DERC相比提高了20.2个百分点;与SBCM相比提高了11.7个百分点。各组件均衡的数值表明,该框架在电压稳定性、拥塞管理、可再生能源集成、负荷平衡、协调效率和响应速度方面均保持了良好的性能。在每次仿真运行中,通过计算六个性能指标——电压稳定性、拥塞控制、可再生能源集成、负荷平衡、协调效率和响应速度——的算术平均值,确定总体FSI。通过五次独立的仿真运行,计算得出所述的平均值和标准差。

图12: 馈线稳定性指数(FSI)。 针对所提出的框架与基线方法,在六个性能分量(电压稳定性、拥塞控制、可再生能源集成、负荷平衡、协调效率和响应速度)上的馈线稳定性指数(FSI)雷达图比较。各分量数值越高,表示性能越优。缩略语:FSI,馈线稳定性指数;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。 请点击此处查看该图的放大版本。
| 评估参数 | CVC (%) (均值 ± 标准差) | CMAC (%) (均值 ± 标准差) | RLVR (%) (均值 ± 标准差) | DERC (%) (均值 ± 标准差) | SBCM (%) (均值 ± 标准差) | 所提出方法 (%) (均值 ± 标准差) |
| 电压稳定性 | 68.0 ± 0.6 | 74.0 ± 0.5 | 82.0 ± 0.4 | 77.0 ± 0.5 | 86.0 ± 0.3 | 97.0 ± 0.2 |
| 拥塞控制 | 64.0 ± 0.6 | 71.0 ± 0.5 | 79.0 ± 0.4 | 74.0 ± 0.5 | 84.0 ± 0.3 | 96.0 ± 0.2 |
| 可再生能源集成 | 62.0 ± 0.5 | 70.0 ± 0.5 | 81.0 ± 0.4 | 76.0 ± 0.4 | 83.0 ± 0.3 | 95.0 ± 0.2 |
| 负载均衡 | 66.0 ± 0.5 | 73.0 ± 0.4 | 80.0 ± 0.4 | 75.0 ± 0.4 | 82.0 ± 0.3 | 94.0 ± 0.2 |
| 协调效率 | 65.0 ± 0.5 | 75.0 ± 0.4 | 83.0 ± 0.3 | 78.0 ± 0.4 | 87.0 ± 0.3 | 98.0 ± 0.2 |
| 响应速度 | 63.0 ± 0.5 | 72.0 ± 0.4 | 84.0 ± 0.3 | 76.0 ± 0.4 | 85.0 ± 0.3 | 97.0 ± 0.2 |
| 平均 FSI 评分 | 64.7 ± 0.5 | 72.5 ± 0.5 | 81.5 ± 0.4 | 76.0 ± 0.4 | 84.5 ± 0.3 | 96.2 ± 0.2 |
表7:馈线稳定性指数(FSI):基于电压稳定性、阻塞控制、可再生能源集成、负荷平衡、协调效率和响应速度,五次独立仿真运行得到的馈线稳定性指数(FSI)均值 ± 标准差。缩写:FSI,馈线稳定性指数;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的阻塞管理。
图13 展示了负载均衡效率(LBE)。CVC的总体LBE约为68%,其中均衡负载分配占42%,中等负载稳定性占18%,动态自适应均衡占8%。CMAC和DERC的总体值分别约为80%和86%。RLVR达到约92%,SBCM达到约96%。所提出的框架实现了约98%的总体LBE,其中均衡负载分配占72%,中等负载稳定性占20%,动态自适应均衡占6%。该结果表明,所提出的方法在所有被评估的方法中保持了最高的整体负载均衡性能。

图13: 负载平衡效率(LBE)。 所提框架与基线方法在负载均衡效率上的堆叠柱状图比较。每个堆叠柱形包含三个性能组成部分: 均衡负载分布, 中等负荷稳定性, 和 动态自适应平衡, 其综合值代表每种方法的整体负载均衡性能(LBE)。总值越高,表明负载均衡性能越好。. 缩写:LBE,负荷平衡效率;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的阻塞管理 请点击此处以查看此图的放大版本。
图14 展示了可再生能源利用效率(Renewable Utilization Efficiency, RUE)。CVC 从 50% 提高到 61%。CMAC 和 DERC 分别达到 70% 和 75%。RLVR 达到 82%,SBCM 达到 86%。所提出的框架在早期训练阶段为 72%,收敛时提升至约 98%。与 CVC 相比,该框架高出约 37 个百分点,超过 CMAC 28 个百分点、RLVR 16 个百分点、DERC 23 个百分点,以及 SBCM 12 个百分点。更高的 RUE 表明,所提出的编排策略在负载和拥塞条件变化的情况下,能够利用更大比例的可用可再生能源发电。

图14: 可再生能源利用效率(RUE)。 在低压馈线协调过程中对RUE的对比分析。通过五次独立的仿真运行,将所提出的框架与各基线方法进行比较,结果以均值±标准差表示,并计算95%置信区间,统计学显著性水平定义为 p < 0.001。缩写:RUE,可再生能源利用效率;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。 请点击此处查看该图的放大版本。
图15 和 表8 展示了自适应决策准确率(ADA)。所提出的框架将准确率从78%提升至99%。CVC、CMAC、RLVR、DERC和SBCM分别收敛至68%、76%、86%、79%和88%。所提出的框架相较于CVC提高了约31个百分点,相较于CMAC提高了23个百分点,相较于RLVR提高了13个百分点,相较于DERC提高了20个百分点,相较于SBCM提高了11个百分点。较高的ADA表明,在高比例可再生能源接入的低压运行条件下,协作代理能够选择更准确的编排决策。

图15: 自适应决策准确率(ADA)。 所提出的编排框架与基线方法在自适应决策准确率(ADA)上的比较分析。通过五次独立的仿真运行,将所提出框架与各基线方法进行比较,结果以均值±标准差表示,并计算95%置信区间,统计学显著性水平为 p < 0.001。 缩写:ADA,自适应决策准确率;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。 请点击此处查看该图的放大版本。
| 训练轮次 | CVC (%) (均值 ± 标准差) | CMAC (%) (均值 ± 标准差) | RLVR (%) (均值 ± 标准差) | DERC (%) (均值 ± 标准差) | SBCM (%) (均值 ± 标准差) | 提出的方法 (%) (均值 ± 标准差) |
| 1 | 58.0 ± 0.5 | 64.0 ± 0.5 | 70.0 ± 0.4 | 66.0 ± 0.5 | 72.0 ± 0.4 | 78.0 ± 0.3 |
| 2 | 60.0 ± 0.5 | 66.0 ± 0.5 | 73.0 ± 0.4 | 68.0 ± 0.5 | 75.0 ± 0.4 | 82.0 ± 0.3 |
| 3 | 61.0 ± 0.4 | 68.0 ± 0.4 | 76.0 ± 0.4 | 70.0 ± 0.4 | 78.0 ± 0.4 | 86.0 ± 0.2 |
| 4 | 62.0 ± 0.4 | 70.0 ± 0.4 | 78.0 ± 0.3 | 72.0 ± 0.4 | 80.0 ± 0.3 | 89.0 ± 0.2 |
| 5 | 63.0 ± 0.4 | 71.0 ± 0.4 | 80.0 ± 0.3 | 74.0 ± 0.4 | 82.0 ± 0.3 | 91.0 ± 0.2 |
| 6 | 64.0 ± 0.4 | 72.0 ± 0.4 | 82.0 ± 0.3 | 75.0 ± 0.3 | 84.0 ± 0.3 | 93.0 ± 0.2 |
| 7 | 65.0 ± 0.4 | 73.0 ± 0.3 | 83.0 ± 0.3 | 76.0 ± 0.3 | 85.0 ± 0.3 | 95.0 ± 0.2 |
| 8 | 66.0 ± 0.4 | 74.0 ± 0.3 | 84.0 ± 0.3 | 77.0 ± 0.3 | 86.0 ± 0.3 | 96.0 ± 0.2 |
| 9 | 67.0 ± 0.4 | 75.0 ± 0.3 | 85.0 ± 0.3 | 78.0 ± 0.3 | 87.0 ± 0.3 | 97.0 ± 0.2 |
| 10 | 68.0 ± 0.4 | 76.0 ± 0.3 | 86.0 ± 0.3 | 79.0 ± 0.3 | 88.0 ± 0.3 | 99.0 ± 0.2 |
表8:自适应决策准确率(ADA):通过五次独立的模拟运行,比较所提出的智能馈线协调框架与基线方法的自适应决策准确率(ADA)的均值±标准差。缩写:ADA,自适应决策准确率;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源资源协调;SBCM,基于灵敏度的拥塞管理。
表9展示了系统可靠性提升(SRI)。CVC从60%提高到69%。CMAC达到约78%,DERC约81%,RLVR约86%,SBCM约88%。所提出的框架在早期学习阶段为80%,收敛时提升至约99%。与对比方法相比,所提框架的SRI分别超过CVC约30个百分点、CMAC约21个百分点、RLVR约13个百分点、DERC约18个百分点以及SBCM约11个百分点。更高的SRI表明,所提出的框架在维持馈线连续性、电压稳定性、拥塞控制以及自适应可再生能源集成方面,比对比方法更有效。
| 训练轮次 | CVC (%)(均值 ± 标准差) | CMAC (%)(均值 ± 标准差) | RLVR (%)(均值 ± 标准差) | DERC (%)(均值 ± 标准差) | SBCM (%)(均值 ± 标准差) | 提出的方法 (%)(均值 ± 标准差) |
| 1 | 60.0 ± 0.5 | 66.0 ± 0.5 | 72.0 ± 0.4 | 68.0 ± 0.5 | 75.0 ± 0.4 | 80.0 ± 0.3 |
| 2 | 61.0 ± 0.5 | 68.0 ± 0.5 | 74.0 ± 0.4 | 70.0 ± 0.5 | 77.0 ± 0.4 | 84.0 ± 0.3 |
| 3 | 62.0 ± 0.4 | 70.0 ± 0.4 | 76.0 ± 0.4 | 72.0 ± 0.4 | 79.0 ± 0.4 | 87.0 ± 0.2 |
| 4 | 63.0 ± 0.4 | 72.0 ± 0.4 | 78.0 ± 0.3 | 74.0 ± 0.4 | 81.0 ± 0.3 | 90.0 ± 0.2 |
| 5 | 64.0 ± 0.4 | 73.0 ± 0.4 | 80.0 ± 0.3 | 76.0 ± 0.4 | 83.0 ± 0.3 | 92.0 ± 0.2 |
| 6 | 65.0 ± 0.4 | 74.0 ± 0.4 | 82.0 ± 0.3 | 77.0 ± 0.3 | 84.0 ± 0.3 | 94.0 ± 0.2 |
| 7 | 66.0 ± 0.4 | 75.0 ± 0.3 | 83.0 ± 0.3 | 78.0 ± 0.3 | 85.0 ± 0.3 | 95.0 ± 0.2 |
| 8 | 67.0 ± 0.4 | 76.0 ± 0.3 | 84.0 ± 0.3 | 79.0 ± 0.3 | 86.0 ± 0.3 | 96.0 ± 0.2 |
| 9 | 68.0 ± 0.4 | 77.0 ± 0.3 | 85.0 ± 0.3 | 80.0 ± 0.3 | 87.0 ± 0.3 | 97.0 ± 0.2 |
| 10 | 69.0 ± 0.4 | 78.0 ± 0.3 | 86.0 ± 0.3 | 81.0 ± 0.3 | 88.0 ± 0.3 | 99.0 ± 0.2 |
表9:系统可靠性提升(SRI):在可再生能源丰富的低压配电网条件下,五次独立仿真运行得到的系统可靠性提升(SRI)均值±标准差。缩写:SRI,系统可靠性提升;CVC,集中式电压控制;CMAC,传统多智能体控制;RLVR,基于强化学习的电压调节;DERC,分布式能源协调;SBCM,基于灵敏度的拥塞管理。
所提出的框架在可再生能源发电、负荷需求、电压和拥塞的不同条件下,使用 FeederBW 和 236 节点低压数据集进行了评估。评估指标包括馈线接纳能力、电压合规性、拥塞缓解、编排延迟、收敛速度、分布式协调、可再生能源消纳能力、电压敏感性、拥塞敏感性、馈线稳定性、负荷平衡、可再生能源利用率、决策准确性和系统可靠性。
在这些指标中,所提出的框架在FAR、VCI、CRR、CS、DCE、RAC、VSS、CSI、FSI、LBE、RUE、ADA和SRI方面均取得了最高的最终值,且OL最低。由于基线方法在相同的数据集、运行场景、仿真环境、停止准则和评估指标下进行评估,这些比较结果支持了以下假设:与已评估的集中式和分布式对比方法相比,结合电压敏感性和拥塞敏感性评估的协作式多智能体强化学习能够提升自适应馈线接纳能力。
结果表明,动态编排策略在降低编排延迟的同时,提高了馈线接纳能力、电压合规性、缓解了拥塞、提升了可再生能源消纳能力、实现了负荷均衡、增强了去中心化协调能力、决策准确性以及系统可靠性。该框架的收敛速度也快于对比方法。在所评估的仿真条件下,这些发现支持了本研究提出的假设,即协作式、具备灵敏度感知能力的去中心化强化学习方法能够在可再生能源发电不确定性以及负荷和拥塞条件变化的情况下,改善低压馈线的编排性能。
数据可用性:
FeederBW 数据集公开获取地址为 https://doi.org/10.5281/zenodo.17831177,236 节点低压配电网数据集公开获取地址为 https://doi.org/10.5281/zenodo.8274780。本研究开发的 Python 实现代码,包括仿真框架、预处理模块、多智能体强化学习环境、模型训练与评估脚本、配置文件以及重现所提出方法所需的输入数据格式,均已存入 Zenodo,公开获取地址为 https://doi.org/10.5281/zenodo.21423239。该代码仓库支持本文所报告方法与实验的可重复性。
补充文件1:所提出的动态协调策略的数学推导、算法及实现细节。 本补充文件提供了支持所提出框架各阶段的数学公式,包括数据预处理、动态低压网络建模、多智能体环境初始化、基于强化学习的智能体训练、电压与拥塞敏感性评估、协同馈线接入协调机制,以及性能评估指标。文件还包括算法1,描述了协同馈线接入协调流程,以及本研究中所用评估指标的数学定义。请点击此处下载该文件。
实验结果表明,与集中式电压控制(CVC)33、传统多智能体控制(CMAC)21、基于强化学习的电压调节(RLVR)20、分布式能源资源协调(DERC)26以及基于灵敏度的拥塞管理(SBCM)34相比,所提出的动态协调策略在分散式馈线协调、可再生能源集成、电压稳定性、拥塞管理以及低延迟协调方面均有所提升。在评估的馈线接纳率(FAR)、电压合规指数(VCI)、拥塞降低率(CRR)、分散式协调效率(DCE)、可再生能源利用效率(RUE)、自适应决策准确率(ADA)和系统可靠性提升(SRI)等指标上,所提出的框架在测试条件下均实现了更优的性能。基于FeederBW和236节点低压(LV)数据集获得的结果表明,将协作式多智能体强化学习与电压和拥塞灵敏度评估相结合,能够提高自适应馈线协调的效率与速度。
比较分析还表明,在馈线条件变化的情况下,集中式和基于规则的协调方法具有较慢的编排响应速度、较低的可再生能源接纳能力、降低的自适应协调效率以及更有限的可扩展性33,34。尽管RLVR和SBCM由于采用了强化学习和基于灵敏度的拥塞管理组件,性能优于其他对比方法,但它们并未提供一种协作式且去中心化的馈线接入编排机制。相比之下,所提出的框架结合了协作式智能代理、基于灵敏度的馈线优先级排序、自适应编排优化以及去中心化策略学习。其更快的收敛速度和更高的稳定性指标表明,该综合结构能够在可变的可再生能源发电、负荷、电压和拥塞条件下有效支持馈线运行。
去中心化的多智能体强化学习架构将决策权分散到馈线级智能体,而非依赖单一的集中式控制器。随着配电网络规模的扩大,各个智能体执行本地计算,并仅与相邻智能体交换所需的协调信息。这种架构减少了集中式计算的瓶颈和通信开销,从而支持系统的可扩展性35。因此,该框架可能适用于规模更大、可再生能源渗透率更高、馈线区段更多且运行更复杂的网络。然而,超大规模部署仍需对分布式计算资源和通信协议进行进一步优化。
该研究还提出了一种基于去中心化学习的低压馈线管理方法。与主要依赖静态运行规则或集中式优化的传统电压控制和拥塞管理方法33不同,所提出的策略整合了电压灵敏度评估、考虑拥塞的协调机制、强化驱动的策略优化、动态馈线接纳排序以及协作智能体之间的通信。这一整合将多智能体强化学习的应用范围从电压调节和资源协调,拓展至高比例可再生能源接入的低压配电网中的自适应馈线接纳协调。
该方法可为电力公司、智能电网运营商以及可再生能源管理系统提供馈线接入管理支持。然而,在实际应用之前,仍需解决若干挑战。通信延迟可能影响分布式智能体之间信息交换与协调的速度,尤其在大规模网络中更为显著。此外,还需采用安全通信与网络安全措施,以保护智能体间的交互过程及运行数据,防止未经授权的访问和网络攻击。与现有配电管理系统集成时,还需实现与电力公司通信协议、监控控制架构及运行流程的互操作性。因此,实际应用将依赖于低延迟通信架构、安全的数据传输、标准化接口以及现场验证36,37。
本研究受限于对 FeederBW 和 236 节点低压(LV)数据集的依赖,以及在预定义运行和通信条件下的基于仿真的验证。这些设置可能无法完全代表实际公用电网中遇到的拓扑结构、扰动、通信故障或信息物理事件。在超大规模或高比例可再生能源运行条件下,计算复杂度也可能变得更加显著。因此,未来的工作应利用更多公用事业规模的数据集、真实配电网络、硬件在环平台以及现场规模的试点装置来评估该框架。研究将重点在硬件在环平台、真实公用电网以及更大规模的配电系统中验证所提出的框架。此外,未来的研究还将探索先进的强化学习架构以及改进的分布式协调策略,以进一步提升系统的可扩展性和运行鲁棒性。总体而言,仿真结果表明,协同式多智能体强化学习结合电压敏感性和阻塞敏感性评估,能够改善馈线接纳能力、电压合规性、阻塞缓解、可再生能源整合、去中心化协调、收敛性、延迟以及自适应决策能力。还需利用真实公用电网数据、实际通信延迟、信息物理干扰以及硬件在环或现场测试条件进行进一步测试,以确认其在实际应用中的可扩展性和运行可靠性。
作者声明不存在任何竞争利益。
本研究由广东电网公司广州供电局通过项目“基于过程自动化的低压计量设备自动化验收技术研究”(项目编号:030100KC24120100)资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 236节点低压配电网数据集 | Canizes 等 | DOI: 10.5281/zenodo.8274780 | 用于评估所提出框架的可扩展性分析与大规模验证的公开基准数据集 |
| 中央处理器(CPU) | Intel Corporation | Intel Core i9-12900K(16核) | 用于仿真管理与环境执行 |
| 阻塞敏感性分析模块 | 自主开发模块 | Zenodo DOI: 10.5281/zenodo.21423239 | 执行实时阻塞敏感性计算与馈线优先级排序 |
| CUDA 工具包 | NVIDIA Corporation | CUDA 12.1 | 用于加速 PyTorch 模型训练的 GPU 计算平台 |
| cuDNN 库 | NVIDIA Corporation | cuDNN 9.3.0 | 与 CUDA 配合使用的深度神经网络加速库 |
| 自定义动态低压网络仿真器 | 自主开发模块 | 版本 1.0 | 由作者开发的仿真平台,使用 Python 和 PyTorch 实现,用于动态馈线协调实验。实现细节见方法与数据可用性部分。 |
| 数据处理库 | pandas 开发团队 | pandas 2.2.2 | 用于预处理、特征提取、归一化及时间序列数据管理 |
| 深度学习框架 | PyTorch 基金会 | PyTorch 2.3.1 | 用于多智能体强化学习(MARL)模型实现、神经网络训练与策略优化 |
| 分布式智能体通信模块 | 自主开发框架 | Zenodo DOI: 10.5281/zenodo.21423239 | 实现智能体之间的去中心化通信与协同策略交换 |
| FeederBW 数据集 | Treutlein 等 | DOI: 10.5281/zenodo.17831177 | 包含真实低压馈线测量数据、可再生能源发电与运行剖面的公开数据集 |
| 图形处理器(GPU) | NVIDIA Corporation | GeForce RTX 3090,24 GB GDDR6X | 用于神经网络训练与并行计算的硬件加速器 |
| 多智能体强化学习环境 | Farama 基金会 | Gym 0.26.2 | 定制化的强化学习环境,用于协同智能体交互与训练 |
| 数值计算库 | NumPy 开发者 | NumPy 1.26.4 | 用于数值计算、张量操作与矩阵运算 |
| 操作系统 | Canonical Ltd. | Ubuntu 22.04.5 LTS(64位) | 所有仿真与强化学习实验所使用的操作系统 |
| Python 编程语言 | Python 软件基金会 | Python 3.11.9 | 用于算法实现、仿真与模型开发的主要编程语言 |
| 系统内存 | Lenovo | 64 GB DDR5 内存 | 用于大规模 MARL 仿真与数据处理的安装内存 |
| 电压稳定性监测模块 | 自主开发模块 | Zenodo DOI: 10.5281/zenodo.21423239 | 在馈线协调过程中持续评估电压稳定性与合规性 |