← 返回 PaperDaily 大模型与智能体

3零售商5用户全枚举验证,联盟博弈DSM算法收敛有保证

需求侧管理通常把用户-零售商归属当成固定输入,这篇论文偏偏把它变成决策变量,用联盟博弈把电价、用电和用户归属一股脑联合优化,还给出有限步收敛证明与CVaR风险扩展。做能源与博弈交叉研究的朋友,值得一读。

3零售商5用户全枚举验证,联盟博弈DSM算法收敛有保证

paperdaily_reaction_gif


原论文信息如下:
论文标题:
多零售商微电网中基于联盟博弈的需求侧管理(A Coalitional Game for Demand-Side Management in a Micro-Grid with Multiple Electricity Retailers)

发表日期:2026年08月

发表单位:没有(论文未标注)

原文链接:https://arxiv.org/pdf/2608.17934v1.pdf

多零售商博弈:需求侧管理的新视角

先聊一个很现实的生活场景:你打开手机里的电力App,看到几家售电公司都在推套餐——有的说"夜间谷电五折",有的说"签约一年送智能插座",还有的说"绿色风电不加价"。这几家零售商都在抢你,而你也在纠结选哪家更划算。放在过去,电网公司压根不用想这种问题,因为你的"归属"是固定的,电表上写着谁家就是谁家。但今天,随着电力市场化改革和分布式能源的普及,用户在零售商之间流动已经成为常态,而这恰恰是传统需求侧管理(Demand-Side Management,DSM)框架很少认真对待的事情。
什么叫需求侧管理?简单说,就是通过价格信号或者激励手段,引导用户调整用电行为,让电网运行更平稳高效。传统DSM的思路大多是:给定每个用户属于哪个零售商,然后优化电价和用电量。可问题来了——如果用户压根不是"固定归属"的呢?如果用户可以根据电价随时换零售商,那"谁卖电给谁"本身就应该是一个可以优化的决策,而不是事先定死的输入。
这就是这篇论文最核心的出发点。论文提出了一个多零售商微电网环境下的联盟博弈框架,把电价、用户用电量以及用户与零售商之间的归属关系三者联合起来同时优化,而且把"用户归谁"这个离散决策变成一个联盟博弈问题来处理。参与博弈的玩家分为两类:零售商集合R和消费者集合B。每个零售商r会吸引一组消费者B_r,从而组成一个联盟S_r={r}∪B_r。所有联盟需要满足一个基本假设:每个消费者只能归属于一个零售商,所有联盟合起来刚好覆盖全部玩家,而且零售商之间不会互相"吞并"。
假设1约束条件公式
联盟覆盖假设——所有联盟并集为全集、任意两个联盟不相交(上图中的数学约束)。这保证了每个消费者只被一家零售商服务,系统结构清晰。
在这个设定下,零售商r的利润函数为Πᵣ(λᵣ,P)=λᵣP−Cᵣ(λ,P+P_loss),其中λᵣ是电价,Cᵣ(·)是发电成本函数,P_loss代表输电损耗。消费者b的利润函数则是Π_b(P,λᵣ)=U_b(P,r)−λᵣP,即用电获得的效用减去电费支出。双方都是"价格接受型理性主体"——都追求自身利润最大化。于是整个系统就变成一个耦合的混合整数优化问题:零售商要决定电价和卖给谁,消费者要决定从哪里买、买多少。
如果直接求解这个混合整数优化,复杂度会随玩家数量指数爆炸。论文给出了一个重要的组合学结果:满足上述假设的可行划分数量是|R|^|B|,也就是每个消费者独立选择任意零售商的全部可能组合数。随着B和R增大,暴力枚举完全不现实。论文的做法,是用博弈论的方法设计一个高效算法,巧妙地避开组合爆炸。

联盟形成算法:从理论到实践

既然暴力枚举不可行,论文采取的策略是把问题映射到一个叫"最小生成树博弈"的结构上。每个零售商r想要吸引消费者,就会构建一个费用网络Gᵣ=(Sᵣ,Eᵣ)。网络里的节点是联盟成员(零售商+消费者),边上的权重代表连接成本。关键问题是:这个"成本"怎么定义?论文用了一个很聪明的做法——直接连到电网拓扑上。
零售商与消费者之间的连接成本ω(r,b),被定义成电网中从r到b的所有n步路径的某种几何平均值,再加上一个随路径长度增长的惩罚项nε。直观理解:如果零售商和消费者在电网中"电气距离"很近,连接成本就低;如果隔得很远,需要通过多层路径才能连通,成本就高。消费者之间的连接成本ω(b,d)则直接跟电网邻接矩阵的对应元素成比例。这样一来,电网的物理拓扑结构就通过成本函数嵌入了博弈模型,而不是像很多博弈论文章那样凭空抽象出收益表。
零售商与消费者连接成本公式
图:零售商与消费者之间的连接成本ω(r,b)公式——取电网中从r到b的所有n步路径权重的几何平均,γ是连接费用常数,nε是路径长度的惩罚项。
图1:零售商费用网络示例
图1:零售商r₁的费用网络示例。虚线表示该网络的最小生成树,其他零售商rⱼ也要承担类似的成本(红色标注)。在这个联盟S_{r1}={r₁,b₁,b₂,b₃}中,包含5条候选边,所有可能的生成树有7棵,其中最小生成树的成本为150。
有了费用网络,一个联盟Sᵣ的总成本c(Sᵣ)就定义为该网络的最小生成树(Minimum Spanning Tree,MST)的总权重。MST是图论里的经典概念:用总权重最小的边集合把所有节点连接成一棵树。这里用MST来表达联盟成本,隐含的物理含义是——联盟内部可以使用最低成本的"电网连接方案"来实现电量传输。
特征函数公式
图:联盟博弈的特征函数ν(Sᵣ)定义——消费者的单干成本之和减去联盟的最小生成树总成本,即联盟带来的总"节省"。α_b≥1是每个消费者的权重系数。
用MST成本进一步定义特征函数后,系统就变成了一个标准的合作博弈(coalitional game)。论文不仅证明了该博弈是凸博弈,还证明了它是置换凸博弈——这意味着联盟的"边际贡献"随规模增加而递增,核心(core)非空,稳定性有保障。更进一步,论文给出了一个简洁的不等式关系(下图),表明两个联盟合并后总价值不大于分别运行的价值之和,从数学上说明了竞争的合理性。
联盟价值次可加性公式
图:联盟价值具有次可加性——两个联盟合并后的总价值不超过各自独立运行的价值之和,这保证了市场竞争存在合理的博弈论基础。
接下来是真正的算法设计。整个多零售商DSM问题有多个决策变量:所有零售商的价格向量λ_R、所有消费者的用电量向量P_B、以及系统的联盟划分C。论文采用多目标优化的标量化方法,引入加权系数向量μ,把所有参与者的利润加权求和,得到标量化的目标函数η_μ(C),然后在给定划分下求这个加权和的最大值。
标量化目标函数公式
图:标量化目标函数η_μ(C)——给定联盟划分C时,所有零售商和消费者利润按权重μ加权求和的最大值。改变μ就可以探索Pareto前沿上不同的均衡点。
论文证明了一个关键性质:这个最大值可以拆分成每个联盟独立求解的子问题之和,即η_μ(C)=Σᵣ V_{r,μ}(xᵣ,Sᵣ)。这个性质意味着,给定划分后,每个联盟的最优价格和最优用电量可以分布式并行求解,极大地降低了计算负担。
可拆分性推导公式
图:可拆分性推导——整体标量化目标可以分解为每个零售商联盟独立求解的子问题之和,奠定了分布式计算的基础。
图2:算例网络拓扑
图2:算例的网络拓扑。消费者集合B={b₁,b₂,b₃,b₄,b₅}(共5个),零售商集合R={r₁,r₂,r₃}(共3个)。这个算例验证了算法在不同标量化权重下的收敛行为。
基于这样的分解结构,论文提出了联盟形成算法(Algorithm 1)。算法的思路非常直观:从一个初始划分开始,每一步检查是否存在某个消费者b,单独换到另一个零售商后,整体加权社会福利η_μ会提高。如果存在多个这样的改进机会,就选择改进量最大的那个"单边移动"执行;当没有任何单边移动能改进η_μ时,算法停止。这个过程本质上是在划分空间上做最陡上升搜索,而搜索的终点正是局部最优的联盟结构。
这个算法的理论保障是:它能保证在有限步内收敛,且收敛点对应了问题(1)的一个弱Pareto有效解。有限步收敛的证明很巧妙——因为每一步单边移动都会严格提升η_μ,而加权和始终被某个上界约束,所以不可能无限改进。更妙的是,论文还刻画了算法产生的终点划分集合与全局Pareto最优解之间的关系:从不同初始划分出发,最终会收敛到一组不同的终点划分,这些终点对应的目标值向量恰好构成了支持弱Pareto前沿(supported weakly Pareto-optimal frontier)的子集,即Pareto前沿上那些通过加权和标量化可以到达的点。

风险共享:CVaR框架下的稳健决策

前面讨论的都是确定性的用电量,但现实中的电力需求充满了随机性——夏天晚高峰可能突然飙升,工厂订单变化导致用电突增,这些不确定因素使得完全按确定性模型决策存在风险。这篇论文当然没有回避这个问题,而是把框架扩展到了随机需求场景。
具体来说,论文把每个联盟Sᵣ的总用电需求看作一个随机变量P_{S_r},需要满足零售商r的发电容量上限约束。为了描述这个约束的风险特征,论文定义了联盟级过载风险:F_{S_r}(P)=P[P_{S_r}≤P],即联盟总需求不超过给定阈值P的概率。当需求超出容量上限时,系统会面临过载风险。
联盟总需求概率分布公式
图:联盟Sᵣ总需求的经验累计分布函数——通过对时间窗口内的需求过程进行积分得到,用于评估联盟层面的过载概率。
为了量化尾部风险,论文引入了金融风险管理中非常经典的工具——条件风险价值(Conditional Value-at-Risk,CVaR)。简单说,CVaR回答的问题是:"如果发生最坏情况,平均会亏多少?"给定置信水平α,CVaR_α(Yᵣ)定义为损失Yᵣ超过该置信水平对应风险价值(VaR)时的条件期望。相比传统的方差风险度量,CVaR更关注尾部极端事件,在电力系统风险管理中被广泛应用。
CVaR定义公式
图:条件风险价值定义——CVaR_α(Yᵣ)等于损失Yᵣ在超过VaR_α(Yᵣ)时取的条件期望,衡量最坏α分位内的平均损失。
将CVaR嵌入联盟博弈后,论文把原来确定性的利润最大化目标,换成了一部分确定性利润和一部分风险损失加权组合的目标函数Ψ_α(·)。风险厌恶系数α越高,系统越倾向于规避极端尾部风险。论文证明了风险共享版本同样保持了某些关键性质,比如单边移动提升的单调性,并且提出了相应的扩展算法。更有意思的是,论文还给出了一个风险比较不等式:当前划分的风险值不超过任意单边移动后的风险值——这保证了在风险感知的目标下,算法仍然能稳定收敛到风险最优的联盟结构。
风险不等式公式
图:风险比较不等式——当前联盟结构Ψ_α(Ĉ)的风险不超过消费者b从零售商r转移到另一个零售商r'后的Ψ_α(Ĉ^{b→r'})。这在理论上保证了风险感知的联盟形成算法稳定收敛。

算例验证与结果分析

理论讲得再漂亮,也得用数字说话。论文用图2所示的网络拓扑做了学术算例验证——3个零售商、5个消费者的小型微电网系统。论文给出的零售商和消费者参数如下表所示:
表1:零售商和消费者参数
表1:零售商和消费者的参数设置。包括每个零售商的发电成本系数、最大容量限制,以及每个消费者的效用函数参数等。这些参数决定了每个参与者的"天生禀赋"。
论文选取了三个不同的权重向量μ₁、μ₂、μ₃,代表对零售商和消费者利益的不同偏好倾向。比如μ₁比较侧重某些零售商的利润,μ₃则更关注消费者的效用。从任意初始划分出发,算法沿着最陡上升方向不断调整联盟结构,最终形成稳定的均衡划分。
实验结果有几个非常直观且有意思的现象。首先看收敛性,图3展示了算法从同一个初始划分出发、在三个不同μ下的收敛轨迹。可以看到,无论μ怎么取,算法都能快速收敛到一个稳定的终点划分,而且迭代过程呈现明显的单调上升趋势,说明"单边移动"的策略在每一步都在实打实地改善整体社会福利。
图3:算法收敛轨迹
图3:算法从初始划分C₀出发的收敛过程。实线、虚线和点线分别对应三个不同的标量化权重μ₁、μ₂、μ₃。可以看到,无论μ如何选择,算法都快速收敛到稳定划分。
再看图4的单调演化图。这个图把算法在所有可能的初始划分(注意是所有,不是抽样)下的η_μ值随迭代步数的变化全部画了出来。每一条线都单调上升,最终汇聚到各自终点。这意味着无论市场从什么状态开始演化,消费者和零售商之间的重新配置总能找到一个更优的组织方式。
图4:η_μ单调演化
图4:在所有可能的初始划分下,η_μ(·)沿着算法迭代的单调演化。每条线对应一个初始划分,三个图分别对应三个不同的μ向量。全部线条单调上升,验证了"每一步单边移动都改善社会福利"的理论分析。
图5的直方图进一步揭示了收敛速度的分布规律——对绝大多数初始划分,算法只需极少步数就能收敛。由于总玩家数只有8个(3家零售商+5个消费者),可行的划分总数也就3⁵=243个,而大多数情况算法在几步之内就找到了稳定的终点。这说明联盟形成过程在中小规模场景下非常高效。
图5:收敛步数分布直方图
图5:算法对所有可能初始划分和三个标量化向量的收敛步数分布直方图。绝大多数初始划分在几步之内即可收敛,表现出了非常高效的实际收敛速度。
图6给出的是转移计数矩阵。这个矩阵的行是初始划分,列是终点划分,每个元素表示从该初始划分出发最终到达某个终点划分的频率(通过采样不同μ得到)。矩阵中深色区域聚集在特定列上,说明不管市场从哪开始,大多数情况下会落入少数几个均衡盆地。这其实是一个很有意思的结构性发现:联盟形成过程具有很强的"路径依赖"效应,但也意味着系统的均衡状态是可预测的。
图6:转移计数矩阵
图6:算法在完整划分集合上的归一化转移计数矩阵。行索引为初始划分,列索引为终点划分,颜色越深表示从该初始划分到达该终点划分的μ采样频率越高。可以看到矩阵集中在少数列上,说明均衡结构是可预测的。
最有信息量的可能是图7和图8的两个平行坐标图。平行坐标是一种可视化高维数据的方法——每个维度用一条垂直轴线表示,每个解就是连接各维数值的一条折线。图7展示了均衡划分集合中所有参与者(5个消费者+3个零售商)的利润取值。可以看到折线之间存在明显的交叉,这就是Pareto前沿上的权衡关系:一个零售商利润高了,另一个零售商的利润就会降低;消费者b₁的效用高了,b₂的效用可能就低。没有任何一个解能同时让所有人满意,这正是多目标优化问题的本质。
图7:目标值平行坐标图
图7:均衡划分集合目标向量的平行坐标图。每条折线对应一个终点解,报告了5个消费者的利润Π_bi和3个零售商的利润Π_rj。折线之间的交叉表明不同目标之间存在明显的权衡关系。
图8:决策变量平行坐标图
图8:均衡划分集合决策变量的平行坐标图。算法给出的电价λ_r几乎恒定在约束允许的最高值,而消费者选择的用电量P_b则呈现出丰富的多样性,消费者之间的用电量权衡远比电价变化来得明显。
图8反映了一个非常有趣的结论:在均衡状态下,零售商的电价几乎都顶到了约束允许的上限,差异极小;真正的区分度来自消费者选择了不同的用电量。这说明在竞争格局下,零售商之间的价格战并不会真正压低价格——因为利润最大化会推动电价趋于上限,而消费者的响应是调整用电量,不是换供应商。
需要说明的是,这篇论文的验证以学术算例为主,规模虽然不大,但足以展示算法的收敛性、单调性和Pareto最优性质。在小型系统上证明方法有效性之后,未来的工作可以用更大规模的电力系统案例和更复杂的网络拓扑来进一步检验算法鲁棒性。

总结与展望

这篇论文的贡献可以归结为三点。第一,把需求侧管理中的"用户归属"从固定参数变成了决策变量,让零售商和用户之间的联盟结构成为博弈论模型的一部分,这填补了现有DSM框架与联盟博弈之间的空白。第二,提出了一种有限步收敛的联盟形成算法,算法利用最小生成树结构定义了联盟成本,通过单边移动搜索获得弱Pareto最优解,并且把整体优化问题分解成每个联盟独立求解的子问题,具备分布式计算的潜力。第三,将条件风险价值引入联盟博弈,使系统在面对不确定需求时能够做出风险感知的定价和联盟决策,这为实际电力市场中的风险管理提供了一个有理论依据的分析工具。
从更广的视角看,这篇论文的价值不仅仅在于电力系统本身。它展示了一种思考范式:当多个利益主体之间的边界关系本身就是可变的时,如何用博弈论工具同时优化结构变量和连续决策变量。这种思路在能源交易平台、共享经济、分布式资源调度等场景中都具有潜在的借鉴意义。
当然,论文也存在一些局限。最明显的是验证规模偏小——3个零售商5个消费者的学术算例虽然能验证理论的正确性,但与实际微电网的规模还有距离。此外,算法收敛到的是"局部最优"(由单边移动定义),虽然在理论上被证明是Pareto有效的,但不一定是全局最优。当系统规模增大时,可能需要引入更复杂的搜索策略(比如多用户同时迁移、模拟退火等)来跳出局部最优。实际落地时还需要考虑通信延迟、隐私保护、市场规则等非技术因素。这些都是未来值得探索的方向。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?多零售商微电网中,电价、用电需求与用户归属通常分开优化,本文用联盟博弈将它们统一为决策变量,提出有限步收敛的联盟形成算法,输出弱Pareto最优分区,并扩展CVaR风险共享。算例展示多个可行均衡分区与目标权衡。
这篇工作最值得看的点是什么?论文通过学术算例验证了算法在有限步内收敛,且得到的均衡划分集包含多个竞争目标之间的可行权衡。
这篇工作的边界或风险在哪里?优点:1) 将联盟结构作为决策变量,填补了多零售商DSM中联合优化价格、需求与网络划分的空白;2) 算法具有有限收敛性和Pareto最优性保证;3) 扩展到风险共享框架,考虑CVaR风险度量。缺点:1) 算法复杂度随零售商和消费者数量呈指数增长,实际大规模应用受限;2) 假设消费者和零售商均为价格接受者,未考虑策略性行为;3) 实验仅基于学术算例,缺乏真实数据验证。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把用户-零售商归属从固定参数变成决策变量,结合MST成本博弈与CVaR风险进行联合优化,思路新颖,填补了多零售商DSM中联盟结构优化的空白。

实验合理度:★★★☆☆

算例规模偏小(3零售商+5消费者),但进行了穷举式验证——遍历所有243个可行划分和多个标量化向量,验证方式严谨。缺少数值上与现有DSM或联盟博弈方法的对比实验。

学术研究价值:★★★★☆

将MST的图论结构与联盟博弈特征函数巧妙地联系起来,并用CVaR处理随机需求风险,为多零售商DSM研究提供了新的理论分析框架,对能源博弈交叉方向有较好的启发性。

稳定性:★★★☆☆

算法保证有限步收敛,且满足单调性,但收敛到的是局部Pareto最优而非全局最优。CVaR的引入增强了应对随机需求扰动时的稳定性,但在更大规模网络上的稳定性还未充分验证。

适应性以及泛化能力:★★★☆☆

方法面向多零售商微电网场景,适配性较强——MST成本结构不依赖具体网络规模,CVaR框架也适用于多种随机需求分布。但对辐射状网络与非凸效用函数的适配性还缺乏验证。

硬件需求及成本:★★★★☆

方法以离线优化为主,每轮迭代只需求解MST和分布式凸优化子问题,计算量适中,对硬件要求不高。在线部署时的实时性需进一步优化,但整体计算成本可控。

复现难度:★★★☆☆

论文算法描述清晰,小算例复现门槛不高。但未提供开源代码和数据,最小生成树博弈实现细节和CVaR参数调优需要一定的博弈论和凸优化基础,复现有一定工作量。

产品化成熟度:★★☆☆☆

目前仍处于理论验证阶段,学术算例展示的可行性距离实际微电网运营还有较大距离。产品化需要补充更大规模算例、与现有EMS(能源管理系统)集成方案以及真实市场数据的验证。

可能的问题:实验规模较小,缺少与现有DSM方法的对比;算法可能陷入局部最优,在更大规模网络上的性能尚不明确;假设条件(如效用函数凹性、成本函数凸性)限制了实际应用范围;论文对算法计算复杂度的理论分析略显不足。


主要参考文献

[1] A.-H. Mohsenian-Rad, V. W. S. Wong, J. Jatskevich, R. Schober, and A. Leon-Garcia, "Autonomous demand-side management based on game-theoretic energy consumption scheduling for the future smart grid," IEEE Transactions on Smart Grid, vol. 1, no. 3, pp. 320–331, 2010.
[2] N. Li, L. Chen, and S. H. Low, "Optimal demand response based on utility maximization in power networks," in 2011 IEEE Power and Energy Society General Meeting, 2011, pp. 1–8.
[3] S. Maharjan, Q. Zhu, Y. Zhang, S. Gjessing, and T. Basar, "Dependable demand response management in the smart grid: A Stackelberg game approach," IEEE Transactions on Smart Grid, vol. 4, no. 1, pp. 120–132, 2013.
[4] C. Zhao, U. Topcu, N. Li, and S. Low, "Design and stability of load-side primary frequency control in power systems," IEEE Transactions on Automatic Control, vol. 59, no. 5, pp. 1177–1189, 2014.
[15] W. Tushar, C. Yuen, D. B. Smith, and H. V. Poor, "A canonical coalition-game-based framework for the integration of renewable energy sources into the smart grid," IEEE Transactions on Sustainable Energy, vol. 7, no. 1, pp. 412–425, 2016.
[29] P. Samadi, A.-H. Mohsenian-Rad, R. Schober, V. W. S. Wong, and J. Jatskevich, "Optimal real-time pricing algorithm based on utility maximization for smart grid," in 2010 First IEEE International Conference on Smart Grid Communications, 2010, pp. 415–420.
[32] D. Granot and G. Huberman, "Minimum cost spanning tree games," Mathematical Programming, vol. 21, no. 1, pp. 1–18, 1981.
[33] K. Miettinen, Nonlinear Multiobjective Optimization. Springer, 1999.
[34] R. T. Rockafellar and S. Uryasev, "Optimization of conditional value-at-risk," Journal of Risk, vol. 2, no. 3, pp. 21–41, 2000.
原文链接:https://arxiv.org/pdf/2608.17934v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球