论文最硬核的部分来了。作者团队在之前的工作中推导了一个重要结论:对于"确定性线性动力学 + 基于特征的线性马尔可夫过程 + 二次成本"这类混合结构,最优策略具有一个非常简洁的参数化表达形式。这篇论文把这个理论框架应用到了DERA分配场景,并给出了完整的定理:定理III.1:最优策略的闭式表达式。u*由三项组成:对当前DER物理状态的反馈项、对当前净负荷的比例项、以及对净负荷历史特征的张量前馈项。这个最优策略由三项构成,每一项都有清晰的物理含义。第一项Kt,xx是对DER聚合器当前状态的反馈,作用类似经典LQR控制器,保证系统稳定;第二项Kt,ss是对当前净负荷的直接响应,相当于"看到了缺口马上补上";第三项Kt,h(φ(w)ᵀ⊗Z)θt+1则利用历史净负荷窗口的特征信息,提前感知净负荷的动态趋势,做一个前瞻性的补偿。前两项的增益矩阵由Riccati递推直接算出,第三项里的参数向量θ则需要从数据中学习。增益矩阵K_t,x、K_t,s、K_t,h的求解公式。其中G_t+1由Riccati递推给出,θ_t+1为待学习的参数向量。那θ怎么学?论文用的是最小二乘值迭代(Least-Squares Value Iteration,简称LSVI)算法。核心思想是:把值函数假设成特征的线性组合,用历史轨迹数据做带正则化的最小二乘回归,从而逼近真实值函数。整个过程分成多个回合(episode),每个回合内部有两个阶段。第一阶段是后向权重更新:从最后一个时刻T-1往前,逐个时刻用已收集的全部历史数据求解一个正则化最小二乘问题,得到该时刻的参数θ。第二阶段是前向数据采集:把刚学到的参数代入闭式策略,从初始状态开始正向跑一遍系统,收集新的轨迹数据,为下一个回合做准备。这样循环往复,参数越学越准,策略质量逐步提升。算法有两个工程细节值得点赞。一是加了正则化项λ‖θ‖²,保证矩阵求逆的数值稳定性;二是加了参数投影步骤,一旦参数范数超过阈值就缩回去,防止学出来的策略"跑飞"。另外论文还专门提到,由于真实系统中初始状态不是独立同分布的,数据缺乏天然激励,所以给控制信号加了小噪声探索项——这个细节非常实际。
实验验证:CAISO真实数据下的表现
理论再漂亮,最终还是要看实战。论文用了加州独立系统运营商(California Independent System Operator,简称CAISO)2023年5月15日到9月15日的真实净负荷数据,5分钟一个采样点,共407天,每天作为一个回合(T=289步,刚好覆盖一天的288个5分钟间隔加一个终点)。实验设置了5类异构的分布式能源聚合器:空调(ACs)、电热水器(E-WHs)、楼宇暖通(bldgs)、冰箱(RFGs)和电动车(EVs),每类聚合器的物理参数各不相同,对应论文中的表1:表1:五类DER聚合器对应的离散时间线性动力学模型参数(公式(2))。每类聚合器的数量规模、泄漏系数等参数各不相同,体现了异构性。特征函数φ(·)的选择也很有讲究。论文用了3维的高斯核基函数,基函数的均值和协方差矩阵通过K-means聚类在历史窗口数据上自动确定——这样既不需要人工调参,又能让特征自适应数据分布:特征向量φ(w)的构造公式。f_1为常数项,f_2和f_3为高斯核函数,通过归一化得到3维特征。先看最直观的追踪效果。图1展示了五天内净负荷需求(红色虚线)、无预测强化学习控制器的DERA累计响应(蓝色实线)和基于预测的MPC基准(黑色点线)的对比:图1:五天内净负荷需求(红色虚线)、无预测强化学习控制器下DERA累计响应(蓝色实线)与基于预测的MPC基准累计响应(黑色点线)的对比。每个时间步对应5分钟间隔。可以看出,无预测RL控制器在完全不依赖预测的情况下,实现了与MPC可比的追踪精度。可以看到,蓝色实线几乎贴住了红色虚线,说明DERA的总出力很好地跟随了净负荷需求。MPC因为有短期预测信息,跟踪误差确实更小,但RL控制器是在没有预测、没有在线优化的条件下达到这个水平的,含金量完全不虚。接下来看看内部细节。图2和图3分别展示了五天内每类DER聚合器的功率轨迹和SoC轨迹:图2:五天内各DER聚合器的功率轨迹。空调(蓝色实线)、电热水器(红色虚线)、楼宇HVAC(绿色点线)、冰箱(紫色点划线)、电动车(棕色双点划线)。各聚合器的出力被差异化分配,没有出现某类资源被过度使用的情况。图3:五天内各DER聚合器的SoC轨迹,线型含义与图2相同。各聚合器的SoC都保持在合理区间内波动,没有出现越限或过度放电的情况,说明策略在满足资源约束方面表现稳健。图4:算法1学习到的策略在不同回合(episode 1到407)的累积成本变化。前387个回合加入较大探索噪声(方差0.25),之后减小到0.0025。随着回合数增加,累积成本持续下降并趋于平稳。图4展示了一个非常健康的强化学习收敛曲线:前387个回合由于探索噪声较大,成本虽有波动但整体下行;当探索噪声减小时,成本进一步下降并逐渐平稳。这说明LSVI算法在这类问题上收敛性不错。从实验设计角度看,论文的对比设置是"合理的偏袒":MPC拿到了预测信息,RL什么都没有。在这种信息不对等的情况下,RL仍然追上了MPC的跟踪精度,反而更能说明无预测范式的潜力。
[4] 基于集中式模型预测控制的DERA分配框架。[13] Al Makdah et al. 关于线性动力学+特征马尔可夫过程闭式最优策略的理论工作,本文LSVI算法的基础。[14] California Independent System Operator (CAISO) 净负荷数据集,2023年5月-9月。原文链接:https://arxiv.org/pdf/2608.15977v1.pdf