← 返回 PaperDaily 大模型与智能体

噪声前瞻会害人?新方法先筛再给智能体

这篇论文把“世界模型”从一次性预测工具,改造成了会自己修正上下文的在线规划助手。最有意思的是,它不改参数,专改记忆和提示词,既省掉在线训练的麻烦,又能把部署时的新经验吃进去。

噪声前瞻会害人?新方法先筛再给智能体
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文把“世界模型”从一次性预测工具,改造成了会自己修正上下文的在线规划助手。最有意思的是,它不改参数,专改记忆和提示词,既省掉在线训练的麻烦,又能把部署时的新经验吃进去。


原论文信息如下:
论文标题:
Self-Evolving World Models for LLM Agent Planning
发表日期:
2026年06月
发表单位:
National University of Singapore; Singapore University of Technology and Design; Singapore Management University
原文链接:
https://arxiv.org/pdf/2606.30639v1.pdf
部署时最怕什么?不是模型不会算,而是它明明昨天还挺聪明,今天就开始胡说八道。这篇论文抓的就是这个痛点:世界模型一旦遇到新环境、新任务、新轨迹,预测就会漂;但如果每次漂了就在线改参数,又贵、又慢、还容易把旧本事忘光。于是,作者干脆换了个思路——不改权重,改记忆;不动骨头,先补脑子
封面图
图3:WORLDEVOLVER 总览。冻结的世界模型通过情节记忆做“检索式模拟”,通过语义记忆把“预测错了什么”提炼成可复用规则,再用选择性预见把不靠谱的预测挡在智能体外面。
这套方法的名字叫 WORLDEVOLVER,核心意思很直白:世界模型不是一次训练完就等着挨打,而是要随着部署过程中的真实交互,自己“进化”出更靠谱的上下文。更妙的是,它把“进化”放在了提示词和记忆层面,而不是参数层面。对于大模型系统来说,这种做法有点像:不去给车子换发动机,而是先把导航、路况和驾驶提示调顺了。

世界模型如何优雅地应对部署时的环境变化?

先把概念说人话。世界模型可以理解成“给智能体装一个脑内沙盘”:智能体还没真正行动,先让模型预测一下下一步会发生什么。对长链路任务尤其有用,因为很多决策不是“看一眼就知道”,而是要先猜后果,再决定要不要下手。
问题也很现实:部署环境不是静态考场,而是会变的。今天在厨房里找杯子,明天在实验室里找烧杯;今天能开门,明天门把手换了。冻结的世界模型如果一直吃老数据,预测就会越来越像“凭印象做题”。作者把这个问题类比成机器人里的 sim-to-real gap:模拟里很顺,落地就翻车。
图1
图1:不同世界模型的对比。冻结式和离线微调式模型都不太会在部署时“边用边改”,而自演化式模型会把真实交互中的结果积累下来,通过“预测—观察不一致”持续修正上下文。
这篇工作最关键的判断是:部署时的修正,不一定非得靠梯度下降。在线改参数当然能改,但代价太高,LLM 规模一大就容易慢得离谱,还可能把旧知识改坏。于是,WORLDEVOLVER 选择把“改动”放到外部记忆里:把真实经历存下来,把预测失败提炼成规则,再让后续预测自动参考这些证据。这个思路的工程味道很浓,属于“别跟参数死磕,先把信息组织好”。
为了说明“糟糕的预见会害人”,作者还做了一个预备实验:给 ReAct 智能体不同质量的前瞻信息,结果显示噪声前瞻会拖后腿,完美前瞻才有帮助。意思很简单——世界模型不是越会瞎猜越好,有用的前瞻必须先过筛子

情节记忆与语义记忆:从认知科学中汲取灵感

这部分最有意思。作者没有把“记忆”当成一个笼统的缓存,而是借用了认知科学里经典的两类记忆:情节记忆(Episodic Memory)语义记忆(Semantic Memory)。前者记“发生过什么”,后者记“从这些经历里总结出什么规律”。
先看情节记忆。它存的是具体交互片段,也就是 (观察,动作,下一观察) 这样的真实转移。论文里把它写成 MEt,意思是时刻 t 的情节记忆集合。用的时候,不是乱翻旧账,而是根据当前候选动作去检索最相似的历史动作,再把这些真实经历塞回世界模型上下文里,让模型“照着相似案例想一想”。
公式:记忆总结构
公式里 Mt = (MEt, MSt) 表示总记忆由两部分组成:情节记忆和语义记忆。一个负责“回忆案例”,一个负责“总结教训”。
公式:情节记忆检索
检索公式里,TopK 表示取最相似的 k 条历史转移,sin(at, ai) 是动作之间的相似度,论文用的是动作 token 的 Jaccard 相似度。这个设计很朴素,但挺实用:别拿一大堆长上下文硬塞,先把和当前动作最像的案例捞出来,噪声会少很多。
再看语义记忆。它干的是更像“提炼经验”的活:当世界模型预测和真实观察不一致时,不去改参数,而是让一个 LLM critic 把这次失败总结成规则,写进语义记忆 MSt。这相当于:这次没猜对,不是模型脑子坏了,而是应该给它补一条“以后别这么想”的提示。
公式:语义记忆更新
语义记忆的更新很直白:MSt+1 = MSt ∪ ΔMSt。也就是把新总结出来的规则并入旧规则。这里的关键不是“记住所有细节”,而是把可复用的规律留下来。
作者还做了一个小设计:语义记忆不是每一步都立刻更新,而是可以按批次积累几条 mismatch 再统一整理。这个细节很工程化,因为现实里单条反馈往往太碎,攒一攒再总结,规则更稳,不容易被偶然噪声带偏。

选择性预见:不盲目信任每一个预测

这篇论文最像“老司机”的地方,不是它会预测,而是它知道什么时候该闭嘴。作者发现,世界模型给出错的前瞻,不但帮不上忙,还可能把智能体带沟里。所以它加了一个选择性预见(Selective Foresight):只有高置信度的预测才送进智能体上下文,低置信度的直接丢掉。
图2
图2:Gemma-4-26B-A4B 的预备实验。没有前瞻、噪声前瞻、完美前瞻三种情况对比下来,噪声前瞻反而会伤害动作准确率,说明“预测”本身不是礼物,质量不过关就是负担。
它怎么判断“靠不靠谱”?论文把模型生成的每个 token 的平均对数概率拿来当置信度,写成 ℓt,再指数化成 qt。如果置信度超过阈值 τ,才把预测观察暴露给智能体;否则就当作“这次先不说了”。
公式:置信度定义
这里的 ℓt 是平均 token 对数概率,qt 则是对应的归一化置信度。简单说,模型自己都不太确定的预测,就别硬塞给下游智能体了。
图6
图6:选择性预见的置信度校准。越高置信度的前缀,Exact Match 越高,说明这个“筛一遍再给智能体”的策略不是拍脑袋,确实有统计支撑。
这个模块看似简单,实际很关键。因为智能体规划不是单看预测准不准,而是看预测会不会“误导决策”。当世界模型不稳定时,宁可少给一点,也别把错误幻想包装成确定性答案。这个判断很对路,属于把系统安全边界往前推了一步。

实验全面验证:在不同模型与任务下均表现优异

实验分两层:第一层看世界模型预测准不准,第二层看这些预测到底能不能帮智能体把任务做成。这个设计是合理的,因为很多方法在“预测指标”上看着像回事,一到真正规划就露馅。作者没有只盯一个指标自嗨,而是把“能不能用”也一起测了。
表1
表1:Word2World 上的世界模型预测结果。三种骨干模型下,WORLDEVOLVER 都拿到了最高的预测准确率,说明“在线记忆修正”对预测本身确实有效。
先看预测任务。对比基线里,RAWM-Φ 靠检索历史轨迹已经不差,但 WORLDEVOLVER 还是更强,尤其是把情节记忆和语义记忆一起用时,三项指标都能上去。更值得注意的是,去掉情节记忆或语义记忆都会掉点,说明这两块不是重复劳动,而是互补关系:情节记忆负责“找相似案例”,语义记忆负责“补规则短板”。
作者还专门分析了超参数。结果很有意思:情节记忆的检索规模更敏感,语义记忆的批次大小相对没那么敏感。这意味着工程上优先把检索做好,收益更大;语义规则的整理则更像锦上添花。说白了,先把“拿对案例”这件事做好,比纠结“每次总结几条规则”更值。
图5
图5:记忆超参数带来的相对收益。情节记忆检索数从 1 增到 5 时提升最明显,说明“多捞几条靠谱案例”比“多攒几条规则”更直接。
再看规划任务。这里就更真实了,因为智能体不是在做单步预测题,而是在长链路环境里一步步试错。结果显示,很多世界模型方法在规划上甚至不如不加世界模型的基线,这一点很扎心,但也很诚实:预测准,不代表能帮忙做决策。WORLDEVOLVER 则在多个设置下稳定领先,选择性预见还会进一步提升或至少持平。
表2
表2:AgentBoard 上的规划成功率。WORLDEVOLVER 在 ReAct 和 ReflAct 两类智能体、两种骨干模型上都表现更稳,说明它不是只对某一种提示模板“偏心”。
从曲线看,随着多次 trial 的累积,WORLDEVOLVER 的优势会越来越明显,尤其在 ScienceWorld 上更突出。这说明它吃的是“部署时持续积累”的红利:越往后跑,记忆越丰富,后续规划越容易借到前面的势。这个现象很符合方法设计,也说明作者不是只追单次峰值,而是真的在考虑在线持续交互。
图4
图4:best-of-L 成功率曲线。随着尝试次数增加,WORLDEVOLVER 的累计收益更明显,说明“边做边学”的记忆机制确实能在长时序规划里滚出优势。
还有一个细节值得提:弱一点的骨干模型更能从选择性预见里受益。这个结论很合理,因为弱模型更容易被错误前瞻带偏,过滤掉低置信度预测后,反而更稳。强模型本身规划能力更好,世界模型的边际收益就会小一些。这不是坏消息,反而说明方法的作用边界比较清楚。

无参数更新的自演化:迈向更可靠的智能体规划

这篇论文最值得记住的,不是某个花哨模块,而是它给部署期世界模型定了一个很清晰的方向:让模型在不更新参数的前提下,通过记忆和筛选持续变聪明。这对真实系统很友好,因为参数更新意味着算力、稳定性、回滚和安全都要一起操心;而上下文级修正,至少能把很多工程麻烦先挡在门外。
当然,边界也很明显。第一,这套方法依赖高质量的交互轨迹,环境反馈越干净,记忆越好用;第二,语义规则的生成还是要靠 LLM critic,规则质量会受提示和模型能力影响;第三,当前主要验证在 ALFWorld 和 ScienceWorld 这类任务上,离更复杂、更开放的真实世界还有距离。换句话说,它已经把“怎么在部署时不把自己搞坏”讲明白了,但还没到“所有场景都通吃”的程度。
不过这并不妨碍它有启发性。对做智能体系统的人来说,这篇工作像是在提醒一件事:别总想着把世界模型训练得更大更重,先想想能不能把部署时的经验沉淀成可检索、可解释、可过滤的上下文。很多时候,系统真正缺的不是“再多一个参数”,而是“把错误经验组织成知识”的能力。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“世界模型在部署时会变得不靠谱”这个老问题。方法不是在线改参数,而是通过情节记忆、语义记忆和选择性预见,让世界模型在测试时自己修正上下文,从而更适合长期规划。

情节记忆和语义记忆有什么区别?情节记忆记的是具体经历,像“某次开门后发生了什么”;语义记忆记的是从多次经历里抽出来的规则,像“遇到这种门把手,先别急着下结论”。前者负责找案例,后者负责提炼规律。

为什么要做选择性预见,难道预测越多越好吗?不是。论文已经证明,噪声前瞻会伤害智能体决策。选择性预见的作用就是把低置信度预测挡掉,只把更可信的内容送进下游规划,避免“错误想象”污染行动。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把世界模型从“静态预测器”改成“部署时自演化的记忆系统”,思路挺新,尤其是不靠参数更新这点很有工程辨识度。

实验合理度:★★★★☆

既测预测准确率,也测真正的规划成功率,还做了超参数和多轮 trial 分析,基本能说明方法不是只在某个指标上“碰巧好看”。

学术研究价值:★★★★☆

把认知科学里的情节/语义记忆引入 LLM 世界模型,给“测试时自适应”提供了一个清晰框架,研究味道比较足。

稳定性:★★★☆☆

不改参数确实稳一些,但规则抽取和置信度校准仍依赖模型质量,遇到更复杂环境时鲁棒性还需要继续验证。

适应性以及泛化能力:★★★☆☆

在 ALFWorld 和 ScienceWorld 上跨骨干有效,说明有一定泛化性;但任务类型还不够开放,离通用部署还有距离。

硬件需求及成本:★★★★☆

相比在线微调,纯上下文修正的成本低得多,适合部署;但检索、再次推理和 LLM critic 仍会带来额外开销。

复现难度:★★★☆☆

方法本身不算难,但涉及多模型、多提示、多记忆组件,想稳定复现到论文效果,还是得花点耐心。

产品化成熟度:★★★☆☆

适合做“带记忆的规划辅助层”,但要上更复杂业务,还得补安全边界、回滚机制和规则质量控制。

可能的问题:方法很聪明,但规则生成和置信度门控仍依赖大模型自身质量;一旦环境更开放,记忆噪声和规则漂移可能会成为新麻烦。


主要参考文献

Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng. Self-Evolving World Models for LLM Agent Planning. arXiv:2606.30639v1, 2026.
Tulving, E. (1972). Episodic and semantic memory. 认知科学中“情节记忆/语义记忆”概念的经典来源。
ALFWorld、ScienceWorld、Word2World、AgentBoard:论文实验所用基准与评测平台。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。