← 返回 PaperDaily 大模型与智能体

加州真实数据实测:电网调度告别负荷预测,强化学习闭式解稳了

新能源越装越多,电网调度的老套路——靠预测吃饭——越来越不好使。预测一错,调度全乱。这篇论文干脆把预测模块整个丢掉,让强化学习直接从运行数据里学调度策略,还是闭式解!又稳又能解释。想在电力系统里玩RL的、搞控制优化的,这篇值得一读。

加州真实数据实测:电网调度告别负荷预测,强化学习闭式解稳了
原论文信息如下:
论文标题:
DER Allocation without Load Prediction via Reinforcement Learning
发表日期:
2026年08月
发表单位:
没有找到
原文链接:
https://arxiv.org/pdf/2608.15977v1.pdf
各位朋友,我是龙哥。今天要聊的这篇论文,跟咱们每个人的钱包和空气都息息相关——没错,就是电网。
故事得从新能源说起。这几年,光伏、风电像下饺子一样往电网里装,本来这是好事,对吧?清洁能源嘛。但问题来了:太阳下山了怎么办?风不吹了怎么办?电网的负荷瞬间就出现一个大缺口,需要火电、水电这些"老黄牛"立刻顶上。
这时候,分布式能源资源(DER)就成了香饽饽。啥是DER?说白了就是你家楼顶的光伏板、热水器、空调、冰箱,还有你家的电动车。这些分散的小资源,如果有一个中间人把它们聚合起来统一调度,就能像一个大电池一样,在电网需要的时候快速响应——这个中间人,就是DER聚合器(DERA)。
但问题来了:怎么调度这些聚合器?传统做法是先预测未来一段时间的负荷,然后基于预测做优化控制。这叫预测控制(MPC),思路没问题,但有个致命伤——预测会出错。一旦预测偏高或偏低,调度策略就跟着跑偏,轻则效率打折,重则电网震荡。
这篇论文的思路很野:既然预测容易错,那干脆不要预测了!直接用强化学习,让算法从历史运行数据里自己学出一套最优调度策略。不预测未来,只响应现在——这个反直觉的思路,居然在加州真实数据上跑通了。

电网平衡的困境:预测误差如何拖累DER调度

R-C.jpeg
先把问题说透。电网的平衡是一个实时过程:发多少电,用多少电,必须时刻相等。以前,电网的灵活性主要靠火电——烧煤、烧气,随时调节出力。但火电的毛病大家都清楚:不环保,而且响应速度慢,跟不上光伏、风电那种秒级波动的节奏。
DER聚合器的优势在于快。一个大型空调群,在收到调度指令后几分钟内就能调整功率;电动车充电桩群,更是可以毫秒级响应。但这些资源有一个共同的特点:它们的"电池容量"是有限的。空调不能一直关着不开,电动车也不能一直充个不停。这就带来了两个约束:SoC(荷电状态)约束爬坡速率约束
传统预测控制(MPC)的做法是:先用预测模型估算未来几个小时的净负荷曲线,然后基于这条曲线,求解一个有限时域的优化问题,算出每个聚合器未来每个时刻应该发多少功率。听起来很完美,对吧?但问题在于,预测误差会沿着时间轴不断累积和放大。今天的预测偏了1%,明天的调度就会多吃力3%;如果遇到极端天气,预测误差可能高达20%,这时候MPC算出来的"最优"策略,实际效果可能还不如一个经验丰富的调度员拍脑袋。
更麻烦的是,预测误差导致的错误调度会直接反映在SoC上。比如预测未来负荷很高,于是拼命让空调群满负荷工作,结果实际负荷很低,导致大量能源被浪费,而且空调群的SoC也被消耗殆尽,等真正需要它们的时候,反而无电可放。
所以,这篇论文的研究目标非常明确:能不能绕开预测,直接学习一个最优的实时分配策略?答案是肯定的,关键在于建模方式。

无预测强化学习:从数据中直接学习最优分配策略

要把强化学习用在这个场景,首先要解决一个建模问题:DER聚合器是一堆离散的物理设备,而净负荷是一个连续的随机过程,这俩怎么统一到一个框架里?
这篇论文的做法很巧妙,用了一个"混合"结构。一方面,把DER聚合器建模成广义电池模型,这个模型有明确的物理含义:每个聚合器有一个SoC(类似于电池电量),有一个功率输出,功率的调整速率受爬坡约束限制。这组动力学方程是确定性的线性系统,可以精确描述。
另一方面,净负荷这个外生随机变量,被建模成基于特征的线性马尔可夫过程。啥意思?就是说,未来的净负荷只跟最近一小段时间的净负荷有关,而且这种关系可以通过一组特征向量线性表达。这比硬生生预测未来24小时的负荷曲线要轻量得多,也更容易从数据中学习。
这两部分组合在一起,就形成了一头连着确定性物理动力学、一头连着随机马尔可夫需求的混合结构。在这种结构下,优化目标——也就是让DER聚合器的总输出功率尽可能贴近净负荷曲线——就变成了一个带二次成本的随机最优控制问题。
为什么二次成本很关键?因为它保持了线性二次调节器(LQR)的解析优美性——最优策略有闭式解。也就是说,不需要像深度强化学习那样用神经网络硬拟合,直接就能算出一个结构化的最优策略表达式。
打个比方,这就好比把"开车走哪条路最快"这个问题,从"每次出门前先预测全天路况再规划路线"(预测控制),简化成"教会司机一个简单的跟车策略:看到前车刹车灯亮了就松油门"(无预测强化学习)。后者不依赖对未来路况的完美预测,但应对日常通勤绰绰有余。

方法概述与核心设计

论文的整体框架可以分成三块:系统建模、策略推导、在线学习。
在系统建模部分,每个DER聚合器被描述为线性状态空间形式。具体来说,每个聚合器的状态包含两个变量:SoC和当前功率输出。而控制输入是功率的爬坡速率(也就是调节指令)。对于多个聚合器,直接把它们的模型拼成一个大的块对角矩阵,形成一个整体的线性系统。
净负荷这一侧的建模更有意思。论文假设净负荷是一个马尔可夫过程,但转移概率不是直接已知的,而是通过一个特征向量线性表达。这个特征向量选择的是带高斯核的基函数——一种经典的函数逼近技巧,意味着只要选好中心点和协方差矩阵,就可以近似任意复杂的净负荷转移规律,而无需显式建模。
在策略推导部分,论文给出一个核心定理:最优控制策略可以表示为三个反馈项的线性组合——第一项是对当前DER物理状态的反馈(类似LQR),第二项是对当前净负荷值的反馈,第三项是对净负荷历史窗口特征的反馈。每一项都有自己的增益矩阵,增益矩阵分别由Riccati递推和待学习的参数向量决定。
在在线学习部分,用最小二乘值迭代(LSVI)来学习那些未知的参数。算法把数据分成多个回合(episode),每个回合包含两个阶段:后向权重更新前向数据采集。用大白话说就是:先用已经收集到的所有历史数据,从时间的最后一个时刻往前逐步更新每个时刻的参数;然后用更新好的策略跑一遍系统,收集新数据,进入下一个回合。如此循环往复,策略质量越来越高。
这个算法还有两个工程细节值得点赞:一是加了正则化项,保证数值稳定性;二是加了参数投影步骤,保证学习到的参数不会跑飞。这些都是实际部署中很容易踩坑的地方。
整体方法框架可以概括为:一个确定性的线性系统(DER动力学) + 一个随机的马尔可夫过程(净负荷) + 一个二次成本函数 = 一个可学习的闭式最优策略。

理论之美:闭式最优策略的推导

接下来进入硬核环节。前面提到,最优策略是闭式解,这个结论有一整套数学推导支撑。
首先,每个DER聚合器的动力学模型如下:
z(t+1) = α·z(t) - β·p(t),p(t+1) = p(t) + u(t)
其中z是SoC,p是功率输出,u是功率变化率(即控制指令),α是能量泄漏系数,β是采样时间常数。这个模型虽然简单,但抓住了DER的核心矛盾:想多放电,就得消耗SoC;想恢复SoC,就得充电或降低出力。
然后,把多个DER聚合器组成一个块对角矩阵,形成整体的线性状态空间模型。这里M表示聚合器数量。
净负荷的马尔可夫模型则构造了一个历史窗口向量w,它通过一个转移矩阵A_hat和输入矩阵B_hat构建下一时刻的状态。在此基础上,假设转移概率可以通过特征向量线性表达,即P(s

电网平衡的困境:预测误差如何拖累DER调度

电网的实时平衡是一场没有彩排的演出:发多少电、用多少电,每一秒都必须对得上。过去,这个平衡主要靠火电来调节——虽然响应慢,但胜在皮实。可现在新能源的比例上来了,光伏、风电的出力完全看老天爷脸色,净负荷(总用电需求减去可再生能源出力)的波动越来越剧烈,火电那套"慢慢来"的打法已经跟不上节奏。
于是,分布式能源资源(Distributed Energy Resources,简称DER)聚合器被寄予厚望。空调群、电热水器、楼宇暖通、冰箱、电动车,这些看似不起眼的小资源,被聚合以后可以像一个大电池一样快速响应电网调度。这个"中间人"就是DER聚合器(DER Aggregator,简称DERA)。
但调度这些聚合器有个核心难点:每个DER本质上都是一个"电池",有容量限制(SoC,荷电状态),有爬坡速率限制。想让它多出力,就得消耗它的存量;想让它在关键时刻顶上,平时就得省着用。论文用一组线性动力学方程来刻画这种关系:
广义电池模型公式
广义电池模型公式。其中z为荷电状态,p为功率输出,u为爬坡速率指令,α为能量泄漏系数,β为采样时间常数。
传统做法是模型预测控制(Model Predictive Control,简称MPC):先用预测模型估算未来几个小时的净负荷曲线,再基于这条曲线求解一个有限时域优化问题,算出每个聚合器未来每个时刻应该输出多少功率。思路没问题,但有个致命伤——预测误差会沿着时间轴不断累积和放大。预测偏了1%,调度策略就跟着偏;调度偏了,SoC就用错;SoC错了,下一轮想纠偏就更难。
更麻烦的是,错误调度会直接反映在SoC上。比如预测未来负荷很高,调度端拼命让空调群满负荷工作,结果实际负荷很低——能源被浪费不说,空调群的SoC也被消耗殆尽,等真正需要它们顶峰出力时,反而无电可放。

无预测强化学习:从数据中直接学习最优分配策略

这篇论文的切入点很有意思:既然预测容易错,那干脆不要预测了,改成直接从历史运行数据里学习最优分配策略。但这里有个建模难题——DER聚合器是确定性物理系统,净负荷是随机过程,怎么把两者塞进一个框架?
论文的解法是"混合结构":一边用广义电池模型描述DER聚合器的确定性线性动力学,另一边把净负荷建模成基于特征的线性马尔可夫过程。所谓线性马尔可夫过程,就是说下一时刻的净负荷只跟最近一小段历史有关,而且这种关系可以通过一个特征向量的线性组合来刻画:
净负荷线性马尔可夫转移公式
净负荷的线性马尔可夫转移公式,其中φ(w)是特征向量,μ为未知的符号测度,w为历史窗口向量。
这里有一个关键区别:传统预测是在"猜未来某个时刻的具体数值",而线性马尔可夫建模是在"拟合净负荷的转移规律"。前者一旦猜错就全盘皆输,后者即使有偏差,也能通过滚动更新不断修正。
优化目标采用二次成本形式,同时惩罚跟踪误差(DER总出力与净负荷之差)、控制代价和SoC偏离:
二次成本函数公式
二次成本函数。其中W_x为状态权重矩阵,R为控制权重,κ为跟踪误差权重。
为什么二次成本很关键?因为它保留了线性二次调节器(Linear Quadratic Regulator,简称LQR)的解析优美性——最优策略有闭式解。换句话说,不需要用神经网络硬拟合,直接就能推导出一个结构化的最优策略表达式。整个随机最优控制问题可以写成:
随机最优控制问题
随机最优控制问题:在满足DER动力学约束、净负荷马尔可夫约束和控制策略形式的条件下,最小化期望累积成本。

理论之美:闭式最优策略的推导

论文最硬核的部分来了。作者团队在之前的工作中推导了一个重要结论:对于"确定性线性动力学 + 基于特征的线性马尔可夫过程 + 二次成本"这类混合结构,最优策略具有一个非常简洁的参数化表达形式。这篇论文把这个理论框架应用到了DERA分配场景,并给出了完整的定理:
最优策略表达式定理
定理III.1:最优策略的闭式表达式。u*由三项组成:对当前DER物理状态的反馈项、对当前净负荷的比例项、以及对净负荷历史特征的张量前馈项。
这个最优策略由三项构成,每一项都有清晰的物理含义。第一项Kt,xx是对DER聚合器当前状态的反馈,作用类似经典LQR控制器,保证系统稳定;第二项Kt,ss是对当前净负荷的直接响应,相当于"看到了缺口马上补上";第三项Kt,h(φ(w)ᵀ⊗Z)θt+1则利用历史净负荷窗口的特征信息,提前感知净负荷的动态趋势,做一个前瞻性的补偿。前两项的增益矩阵由Riccati递推直接算出,第三项里的参数向量θ则需要从数据中学习。
增益矩阵求解公式
增益矩阵K_t,x、K_t,s、K_t,h的求解公式。其中G_t+1由Riccati递推给出,θ_t+1为待学习的参数向量。
那θ怎么学?论文用的是最小二乘值迭代(Least-Squares Value Iteration,简称LSVI)算法。核心思想是:把值函数假设成特征的线性组合,用历史轨迹数据做带正则化的最小二乘回归,从而逼近真实值函数。整个过程分成多个回合(episode),每个回合内部有两个阶段。
第一阶段是后向权重更新:从最后一个时刻T-1往前,逐个时刻用已收集的全部历史数据求解一个正则化最小二乘问题,得到该时刻的参数θ。第二阶段是前向数据采集:把刚学到的参数代入闭式策略,从初始状态开始正向跑一遍系统,收集新的轨迹数据,为下一个回合做准备。这样循环往复,参数越学越准,策略质量逐步提升。
算法有两个工程细节值得点赞。一是加了正则化项λ‖θ‖²,保证矩阵求逆的数值稳定性;二是加了参数投影步骤,一旦参数范数超过阈值就缩回去,防止学出来的策略"跑飞"。另外论文还专门提到,由于真实系统中初始状态不是独立同分布的,数据缺乏天然激励,所以给控制信号加了小噪声探索项——这个细节非常实际。

实验验证:CAISO真实数据下的表现

理论再漂亮,最终还是要看实战。论文用了加州独立系统运营商(California Independent System Operator,简称CAISO)2023年5月15日到9月15日的真实净负荷数据,5分钟一个采样点,共407天,每天作为一个回合(T=289步,刚好覆盖一天的288个5分钟间隔加一个终点)。
实验设置了5类异构的分布式能源聚合器:空调(ACs)、电热水器(E-WHs)、楼宇暖通(bldgs)、冰箱(RFGs)和电动车(EVs),每类聚合器的物理参数各不相同,对应论文中的表1:
表1:五类DER聚合器动力学参数
表1:五类DER聚合器对应的离散时间线性动力学模型参数(公式(2))。每类聚合器的数量规模、泄漏系数等参数各不相同,体现了异构性。
特征函数φ(·)的选择也很有讲究。论文用了3维的高斯核基函数,基函数的均值和协方差矩阵通过K-means聚类在历史窗口数据上自动确定——这样既不需要人工调参,又能让特征自适应数据分布:
特征向量构造公式
特征向量φ(w)的构造公式。f_1为常数项,f_2和f_3为高斯核函数,通过归一化得到3维特征。
先看最直观的追踪效果。图1展示了五天内净负荷需求(红色虚线)、无预测强化学习控制器的DERA累计响应(蓝色实线)和基于预测的MPC基准(黑色点线)的对比:
图1
图1:五天内净负荷需求(红色虚线)、无预测强化学习控制器下DERA累计响应(蓝色实线)与基于预测的MPC基准累计响应(黑色点线)的对比。每个时间步对应5分钟间隔。可以看出,无预测RL控制器在完全不依赖预测的情况下,实现了与MPC可比的追踪精度。
可以看到,蓝色实线几乎贴住了红色虚线,说明DERA的总出力很好地跟随了净负荷需求。MPC因为有短期预测信息,跟踪误差确实更小,但RL控制器是在没有预测、没有在线优化的条件下达到这个水平的,含金量完全不虚。
接下来看看内部细节。图2和图3分别展示了五天内每类DER聚合器的功率轨迹和SoC轨迹:
图2
图2:五天内各DER聚合器的功率轨迹。空调(蓝色实线)、电热水器(红色虚线)、楼宇HVAC(绿色点线)、冰箱(紫色点划线)、电动车(棕色双点划线)。各聚合器的出力被差异化分配,没有出现某类资源被过度使用的情况。
图3
图3:五天内各DER聚合器的SoC轨迹,线型含义与图2相同。各聚合器的SoC都保持在合理区间内波动,没有出现越限或过度放电的情况,说明策略在满足资源约束方面表现稳健。
图4
图4:算法1学习到的策略在不同回合(episode 1到407)的累积成本变化。前387个回合加入较大探索噪声(方差0.25),之后减小到0.0025。随着回合数增加,累积成本持续下降并趋于平稳。
图4展示了一个非常健康的强化学习收敛曲线:前387个回合由于探索噪声较大,成本虽有波动但整体下行;当探索噪声减小时,成本进一步下降并逐渐平稳。这说明LSVI算法在这类问题上收敛性不错。
从实验设计角度看,论文的对比设置是"合理的偏袒":MPC拿到了预测信息,RL什么都没有。在这种信息不对等的情况下,RL仍然追上了MPC的跟踪精度,反而更能说明无预测范式的潜力。mmexport1760710364748.jpg

总结与展望

这篇论文的核心贡献可以概括为三点:第一,把DERA分配从"预测+优化"范式转换到了"直接从数据学策略"的无预测范式;第二,利用线性-二次混合结构,推导出最优策略的闭式表达,兼顾了可解释性和约束满足;第三,在CAISO真实净负荷数据上验证了框架的有效性。
这个方向的工程价值是显而易见的:闭式策略只有矩阵乘向量,延迟在秒级,对硬件几乎零要求;在线学习让策略能持续适应净负荷分布的变化,这是固定预测模型难以做到的。当然,局限也很明显:实验主要基于线性模型假设和二次成本,真实场景中的非线性设备特性、非凸约束、通信延迟等挑战还没有纳入考量。另外,CAISO数据只覆盖了5月到9月,冬季工况的泛化能力还有待验证。
展望未来,一个自然的方向是把模型扩展到非线性设备动力学的场景,同时引入容量上下限约束。另一个值得探索的点是,把这种无预测范式与深度强化学习结合——在保持策略可解释性的同时,利用深度网络的表达能力处理更复杂的净负荷动态。

融会贯通

结合PaperDaily已收录的相关论文可以观察到,电力系统中基于强化学习的调度方案正在经历一个明显的范式转移:从"预测+优化"走向"直接学习策略"。之前收录的电网调度相关工作中,大多依赖预测模型或随机场景生成,而本论文展示了闭式策略+在线学习的独特路线——用结构化策略保证可解释性,用数据驱动更新保证适应性。
不过需要提醒的是,不同论文在数据集划分、DER类型、目标函数权重等方面存在明显差异,本论文在CAISO数据上展示的定性结论不宜直接外推为全领域绝对优势。更强的结论需要更多数据集和更多基线方法的系统性对比。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文提出一种无预测的强化学习框架,用于分布式能源聚合器的实时分配。方法将DER动力学建模为确定性线性系统,将净负荷建模为基于特征的线性马尔可夫过程,并推导出闭式最优策略,通过最小二乘值迭代在线学习。
这篇工作最值得看的点是什么?所提出的无预测RL控制器在无需需求预测或在线优化的情况下,实现了与基于预测的MPC基准相当的跟踪性能;累积成本随episode数增加而下降
这篇工作的边界或风险在哪里?优点:(1)无需需求预测,避免了预测误差的传播;(2)策略为闭式表达式,计算效率高;(3)保持LQR控制器的可解释性和结构;(4)通过在线学习适应净负荷统计特性的变化。缺点:(1)依赖线性马尔可夫过程的假设,对非线性需求模式可能不适用;(2)需要选择适当的特征函数φ(·);(3)与MPC相比,跟踪精度略低。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种无预测的强化学习框架,将DERA动力学建模为确定性线性系统,净负荷建模为基于特征的线性马尔可夫过程,推导出最优策略的闭式表达式,并通过最小二乘值迭代算法从在线数据中直接学习策略参数。

实验合理度:★★★★☆

跟踪精度(累积DERA响应与净负荷需求的匹配程度)、累积成本

学术研究价值:★★★★☆

提出一种无预测的强化学习框架,将DERA动力学建模为确定性线性系统,净负荷建模为基于特征的线性马尔可夫过程,推导出最优策略的闭式表达式,并通过最小二乘值迭代算法从在线数据中直接学习策略参数;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

控制器为闭式表达式,仅需矩阵-向量乘法,延迟在秒级

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)依赖线性马尔可夫过程的假设,对非线性需求模式可能不适用;(2)需要选择适当的特征函数φ(·);(3)与MPC相比,跟踪精度略低。

主要参考文献

[4] 基于集中式模型预测控制的DERA分配框架。
[13] Al Makdah et al. 关于线性动力学+特征马尔可夫过程闭式最优策略的理论工作,本文LSVI算法的基础。
[14] California Independent System Operator (CAISO) 净负荷数据集,2023年5月-9月。
原文链接:https://arxiv.org/pdf/2608.15977v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
电网波动不用愁,预测抛掉乐悠悠;强化学习来调度,DER聚合显身手。新能源并网越来越多,电力平衡越来越难,想和龙哥一起探讨AI在电网调度中的落地之道吗?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 电力调度+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helperdianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。