← 返回 PaperDaily
视觉与图像
斯坦福北大联手,QWM让Q学习用上世界模型,操作成功率大幅飙升!
世界模型和Q学习还能这么玩?斯坦福北大团队提出的QWM,把世界模型当成“预言家”,只做测试时搜索,不让模型误差污染训练,操作成功率全面飙升。继7月末聊过ActSWM这类JEPA世界模型的规划玩法后,本期这篇把Q学习和世界模型的结合推到了一个新高度。
龙哥读论文
发布于 2026-08-23 00:20:00
阅读 12
查看原文
原论文信息如下:
强化学习这两年越来越能打,尤其是在机器人操控这个大舞台上。从离线数据里先学个差不多,再放到真实环境里在线微调,已经成了视觉-语言-动作模型(VLA)落地的标准打法。不过这里面一直有个让人又爱又恨的角色——世界模型。爱它,是因为它能预测未来状态,理论上能让智能体“未卜先知”;恨它,是因为但凡把它拿来做训练数据的生成器,模型误差就会被一步步放大,最后整个策略直接被带偏,这在长时程任务和高维视觉环境下尤其致命。
那有没有一种姿势,既能白嫖世界模型的预测能力,又不用承担它带来的复合误差?斯坦福大学和北京大学的研究者们最近在arXiv上放出了一篇有意思的工作,给出了一个相当简洁优雅的答案:与其把世界模型当作训练数据的“供应商”,不如把它变成决策时的“军师”——只做测试时搜索,不碰训练过程。这个框架叫做QWM,全称Q-Learning with World Models,字面意思就是“带着世界模型做Q学习”。
引言
要理解QWM的巧妙之处,得先搞清楚传统模型增强的强化学习(Model-based RL)是怎么一步步把自己玩崩的。
常规思路是:先学一个世界模型,然后在这个模型里想象(rollout)出一堆虚拟轨迹,再拿这些虚拟轨迹去训练策略或者价值函数。听着很美好对吧?问题在于,世界模型学得再准也是近似,不可能和真实环境完全一致。如果策略的训练数据大部分来自模型想象出来的东西,那么模型犯的每一个小错都会被策略忠实地学进去,然后在想象的轨迹里不断累积放大。任务越长、视觉输入越复杂,这种偏差就扩散得越厉害。这就是所谓的复合偏差(compounding bias),也是让无数模型增强RL方法在实际机器人任务上翻车的罪魁祸首。
QWM的思路完全反着来:策略和价值函数(Q函数)只拿真实环境交互数据来训练,世界模型呢,只在做出决策的那一瞬间被请出来“算一卦”——对候选动作做短期的未来推演,帮助智能体挑出当前最优的那个动作。这样,世界模型的预测再不准,也不会污染训练过程,因为训练数据里一个模型生成的样本都没有。用一句话概括就是:“训练靠真实,决策靠想象。”
更妙的是,这个“测试时搜索”不仅在评估阶段用,在在线采样的阶段也照用不误。也就是说,智能体在真实环境里收集数据的时候,用的就已经是经过世界模型加持的“强化版”动作选择策略。这样采到的数据质量更高,Q函数学得也就更快更好,形成了一个“更好的数据→更好的Q函数→更好的搜索→更好的数据”的正向循环。
这篇论文的通讯作者阵容里有斯坦福的Chelsea Finn和Dorsa Sadigh,都是机器人学习领域响当当的人物,论文质量自然有保障。下面龙哥就带大家把这套框架的里里外外拆开看看。
方法概述
QWM的整体框架可以用一句话概括:在标准的Q学习算法上面加一个世界模型树搜索的“外挂”,让动作选择变得更聪明。下图给出了QWM的总体结构。
整个树搜索过程有几个关键的超参数:每个状态节点采样动作数N,每个动作在世界模型中采样的下一个状态数K,以及搜索深度D。在根节点,策略先提出N个候选动作,然后每个动作被送入世界模型,由世界模型给出K个可能的下一个状态。这些状态又变成新的“状态节点”,策略再次从这些节点提出N个候选动作,世界模型再继续展开,如此递归到深度D。可以看出来,如果完全展开,这个树的大小是(N×K)的D次方,非常可怕。所以论文里设计了一个基于Q函数的剪枝策略,只保留价值最高的J条路径继续展开,避免搜索树爆炸。
树建好之后,怎么给每个动作打分呢?这是QWM的一个关键设计。以往的做法通常只评估叶节点的价值,然后一路回溯到根节点。但QWM认为,树中每一个中间状态-动作节点的Q值都很有价值,白白丢掉太可惜了。因此,QWM设计了两种互补的价值估计器来给节点打分,然后取平均。
第一种是直接拿Q函数给节点打分。因为Q函数本身就是对“从该状态执行该动作后,未来累积奖励的期望”的估计,所以可以直接用来给当前节点的每个候选动作打分,取最大Q值作为这个状态节点的价值。这种打分方式不依赖世界模型,所以不会引入模型误差,但它完全相信Q函数,一旦Q函数学得不够准,这个分数也会跟着不准。
第二种则是用世界模型把未来的轨迹“演”出来:从当前状态执行这个动作,用世界模型预测下一步的状态,然后用一个折扣系数λ把未来状态的价值折现回来,再加上当前步的奖励。这种方法能捕捉到长远的动作后果,但深度越深,世界模型的预测误差累积得就越厉害。
这两种估计器一个有偏但方差低,一个无偏(理论上)但方差高,正好互补。QWM把它们要平均一下,就得到了一个更稳的节点价值估计。下图展示了树搜索和价值聚合的具体流程。
核心设计
QWM最核心的亮点在于它实现了“搜索即增强”:不需要改变底层强化学习算法的目标函数,不需要为世界模型单独设计奖励模型,只需要在动作执行前多加一道“想象搜索”的工序。这种即插即用的设计让它可以直接叠加在现有的Q学习算法之上。论文里选了两个代表性的高样本效率Q学习算法作为底座,一个是EXPO,一个是RLPD。
EXPO这个算法的特点是用一个“编辑策略”在基础策略采样的动作之上加一个小的修正量,然后把修正后的动作拿去做Q值的时序差分(TD)更新。RLPD则是靠高更新次数(UTD)比例、集成评论家和离线在线数据混合采样来达到高样本效率。QWM在这两个算法上的接入方式完全一致:训练流程一概不动,只在动作执行前插一步树搜索。这种“非侵入式”的设计,让QWM具备了很强的通用性——理论上凡是带Q函数的强化学习算法,都可以试着往上叠一层QWM。
还有一个值得注意的细节:在稀疏奖励任务里,环境只在任务完成时给一个非零奖励,中间过程的奖励几乎全是零,所以QWM干脆不学奖励模型,直接用世界模型预测状态转移,然后用Q函数去估计下一状态的长期价值。这样省掉了一个模块的训练负担。
强化学习的新杠杆:世界模型如何让Q学习更强大?
先抛一个问题:世界模型在强化学习里到底该扮演什么角色?过去大多数人的第一反应是——“当训练数据的供应商”。让智能体在世界模型里想象出一堆虚拟轨迹,然后把这些想象当作真实经验去更新策略和价值函数。这个逻辑听起来无比顺滑,但落地时总被现实打脸:世界模型毕竟是近似模型,它的预测误差会沿着想象轨迹一路累积。策略学得越久,就把模型的“幻觉”学得越深,最后在真实环境里一跑就露馅。任务越长、视觉输入越复杂,这种情况就越严重,也就是论文里反复强调的复合偏差(compounding bias) 。
QWM(Q-Learning with World Models,带世界模型的Q学习)这篇工作的第一个反常识之处,就是主动放弃了“用想象数据训练”这条路。策略和Q函数只用真实环境交互的数据来更新,世界模型被安排到一个更纯粹的位置——只做测试时搜索 。每一次要执行动作之前,让世界模型对策略提出的几个候选动作做短暂的未来推演,看看哪个动作在“接下来几步”里最有前途,然后挑最好的那个出手。训练靠真实,决策靠想象,两者井水不犯河水。
这里其实藏着一条近两年特别火的思路——测试时扩展(test-time scaling)。就像大语言模型在做推理时采样多条候选答案、再用验证器挑最好的那条一样,QWM也是在动作空间里做“采样-评估-择优”。但和单纯按Q值从N个候选动作里挑最大不同,QWM并不只看动作的即时得分,而是用世界模型把动作执行后的未来状态“脑补”出来,再做一步甚至多步的前瞻判断。这样选出来的动作,更像是一个“考虑了后续影响”的动作,而不是一个只顾眼前Q值的动作。
更妙的是,这种“测试时搜索”不止用在评估阶段,在线采集数据的时候同样照用不误。也就是说,智能体在真实环境里收集transition时,用的就已经是经过世界模型加持的“前瞻版”动作选择器。这样采到的数据天然更高质,Q函数学得更快更准,接着树搜索的判断也会更靠谱,形成一个“更高质量的数据→更强的Q函数→更准的搜索→更高质量的数据”的正向闭环。这也是QWM在样本效率和最终性能上都能大幅领先的底层原因之一。
核心机制:测试时树搜索如何避免模型偏差?
树搜索具体怎么搭?QWM构造的是一棵状态-动作交替展开的搜索树 。树的根节点就是当前环境状态s₀。在状态节点上,策略π会一口气采样出N个候选动作;每个候选动作被送进世界模型M_ψ,世界模型为每个动作预测K个可能的下一状态,这样一层就扩出N×K个新的状态节点。到了下一层状态节点,策略再次为每个节点提出N个候选动作,世界模型再继续展开,一直递归到预定的深度D。整个搜索树的大小理论上会爆炸,所以QWM又设计了一套基于Q函数的剪枝策略,保证每个深度只留下J条最有希望的部分路径继续展开。
搜索树建好之后,下一个问题就是:怎么给每个初始动作打分?这里QWM的处理比“只看叶节点回报”的老办法精细得多。论文提出了两种互补的价值估计器,然后取它们的平均作为最终节点价值。第一种是直接让Q函数给节点打分,因为Q函数本来就估计“从当前状态执行某个动作后,未来累计奖励的期望”。写成公式就是这个样子:
第二种估计器则反过来,它把世界模型的预测能力用在刀刃上:用模型想象出当前动作导致的未来状态,把未来状态的价值折现回来,得到当前动作的长远得分。在稀疏奖励任务里,中间步骤奖励几乎全为0,所以论文干脆不学奖励模型,直接让世界模型预测状态转移,再用Q函数估计未来状态的长期价值。这样设计的一个直接好处是少训练一个模块,省下不少事。最后,根节点每个候选动作的树搜索价值Q_ts就把上述两种估计加权融合:
这么设计最大的好处,用一句话总结就是“决策时看想象,训练时只看真相” 。因为策略和Q函数从头到尾只吃真实环境transition,世界模型预测再不准,也没有机会把误差传导进训练目标。搜索过程只是改变了智能体“在真实环境里选哪个动作”这件事,而动作一旦执行,产生的transition照样是真实数据,照样拿去训练Q函数。这就在机制上彻底绕开了复合偏差,同时还能吃到世界模型预测未来带来的样本效率红利。
实验结果:QWM在机器人操作任务上的全面突破
实验在两类经典机器人操作基准上展开:Robomimic和LIBERO。Robomimic选了Lift、Can、Square、Tool Hang四个任务,难度从抓取、放置一路升级到长时程多阶段装配;LIBERO则按照已有工作设定选了五个任务。所有任务都用稀疏任务完成奖励——只有任务成了才有非零奖励,这对算法来说是最刁钻的设定。
先看和model-free基线的对比。QWM在四个任务的在线成功率全部压过RLPD、DSRL、QSM、QAM、FQL、IDQL这些强基线。为什么能赢?关键差别就在动作选择机制上:绝大多数基线是从策略里采样一个动作直接执行,即使像IDQL这样采样多个候选,也只是拿Q值挑个最高的,并不考虑动作执行之后会怎样。QWM则把“之后会怎样”这个维度补了进来——通过世界模型的未来推演,把候选动作的后续影响也纳入了打分,选择质量自然更高。
更硬核的考验是像素观测。QWM把世界模型换成了一个动作条件下的视频扩散模型(基于Wan2.2-TI2V-5B),直接对像素输入做未来帧预测。LIBERO五个任务的结果显示,QWM在Task 60和79上提升明显,在Task 28上比EXPO更早到达高成功率,其余任务上最终性能也不输甚至更强。这说明QWM的收益不止局限在低维状态输入,放到高维视觉控制场景同样成立。
消融实验还专门拆开了“在线采样时搜索”和“评估时搜索”各自的贡献。结果显示,只在在线采样时用搜索能提升数据质量,只在评估时用搜索能直接改善动作选择,但两个阶段同时启用效果最稳、最好。这恰恰印证了QWM设计的闭环逻辑:好数据养出好Q函数,好Q函数配合搜索选出更好数据。与此同时,论文还对比了“用Q函数搜索”和“用状态价值V搜索”两种变体,结论非常明确——用Q函数搜索的效果远好于用V搜索。背后的原因也不难理解:Q函数直接评价“状态-动作”对,能把动作维度的信息利用得更充分,而V函数把所有动作的信息给压平了,搜索时少了不少判别力。这个对比也说明,QWM选择在Q学习上叠加搜索,不是随便挑了个底座,而是确确实实把Q函数的优势给榨干了。
关键设计:价值聚合与搜索策略的巧妙结合
前面提到QWM的搜索树会随着深度急剧膨胀,如果每个分支都展开,计算量谁也扛不住。QWM的应对方式很务实:把Q函数当搜索策略来用,在每个深度只保留最有可能通向高回报的J条路径。具体来说,每条已经存活到深度d的部分路径b,会带上一个累积折扣得分,这个得分是路径上所有状态-动作对Q值的折扣和:
QWM在世界模型的实例化上也做得相当接地气。对于低维状态观测,它用了一个三层MLP残差动力学模型,输入是机械臂末端位姿、夹爪状态和物体特征,输出是状态增量Δ,预测目标就是真实状态转移。这个模型用离线演示数据做MSE预训练,轻量、好训、够用。对于像素观测,论文把Wan2.2-TI2V-5B这个视频扩散模型改造成了动作条件下的视频世界模型——通过一个三层MLP动作编码器把机器人动作映射成动作token,和文本条件token拼在一起送进扩散Transformer,在演示视频片段上做联合微调。推理时世界模型输出短时程的未来视频帧,把预测的下一帧当作后续观测,继续做迭代式展开和树搜索。这套“状态用MLP、像素用视频扩散”的双轨实现,可以说把不同观测模态的成本和效果平衡得比较到位。
局限与展望:计算开销与世界模型质量的双重挑战
QWM最现实的瓶颈在计算开销上。每执行一个动作,都要对N×K×D量级的候选分支做世界模型前向推理。低维状态观测下MLP跑起来倒没压力,可一旦切到像素观测,用一个5B参数的视频扩散模型反复做未来帧预测,每一步动作的时间成本瞬间就上去了。论文在LIBERO像素实验里只把世界模型用于在线采样、没有在评估阶段也跑一遍树搜索,这本身就是对计算开销的一种妥协。
另一个绕不开的变量是世界模型的质量。QWM虽然把模型误差挡在了训练过程之外,但搜索打分的第二项V_r终究是建立在模型预测之上的。世界模型预测得越离谱,树搜索给出的动作排序就越有误导性,到了极端情况,加了搜索反而可能不如不搜。论文里选择做短视推演、深度设得有限,正是为了在“看得远”和“看得准”之间找平衡。如何量化世界模型误差对QWM整体性能的敏感度、以及如何在不同任务上自适应地调整搜索深度,目前还缺少系统的分析。
此外,QWM要求底层算法必须有一个可用的Q函数,这让它在纯策略梯度方法或者无评论家架构的方法上没法直接套用。不过换个角度看,当下主流的高样本效率off-policy算法几乎都带Q函数,所以这个限制在实际使用中影响并不大。未来一个很自然的方向,就是把QWM叠加到更多更强的Q学习基座上,同时把像素世界模型蒸馏成更轻量的版本,让测试时搜索在真实机器人平台上也能跑得起来。还有一个值得期待的点:QWM完全可以作为VLA模型(视觉-语言-动作模型)RL微调时的“动作选择增强器”,在真实机器人数据稀缺的场景下,用想象搜索来提升数据利用效率,这条路一旦打通,想象空间不小。
龙迷三问
这篇论文到底在解决什么问题? 斯坦福和北大研究者提出QWM框架,在世界模型上做测试时树搜索,不改变Q学习训练过程,实现在线采样和评估阶段的高价值动作选择,机器人操作成功率和样本效率全面超越现有方法,已在Robomimic和LIBERO上验证。
这篇工作最值得看的点是什么? QWM在所有任务上取得最强性能,显著优于强模型无关基线和模型基RL方法;在样本效率和最终性能上均优于TD-MPC2和EfficientZero V2。
这篇工作的边界或风险在哪里? 优点:(1) 避免复合模型偏差,策略和价值函数仅在真实数据上训练;(2) 测试时搜索提升动作选择质量;(3) 可应用于不同Q学习算法;(4) 在状态和像素观测下均有效。缺点:(1) 树搜索引入显著计算开销;(2) 依赖高质量世界模型,训练成本高;(3) 搜索超参数(深度、折扣、候选数)需要调优。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出QWM框架,在标准Q学习之上利用世界模型进行测试时树搜索,通过想象未来轨迹选择高价值动作,同时保持策略和价值函数仅在真实环境转换上训练,避免复合模型偏差。
实验合理度: ★★★★☆
在线成功率(online success rate)。
学术研究价值: ★★★★☆
提出QWM框架,在标准Q学习之上利用世界模型进行测试时树搜索,通过想象未来轨迹选择高价值动作,同时保持策略和价值函数仅在真实环境转换上训练,避免复合模型偏差;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
树搜索引入非平凡的计算开销,搜索深度D=4,每节点采样N=8个动作,每个动作K=8个世界模型预测,保留J=1条路径;视觉世界模型推理使用1步去噪。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) 树搜索引入显著计算开销;(2) 依赖高质量世界模型,训练成本高;(3) 搜索超参数(深度、折扣、候选数)需要调优。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!