← 返回 PaperDaily 大模型与智能体

强化学习基础模型,真的还没到来吗?一招用「合成先验」搞定任意MDP

社区热议(453赞)!这篇2026年6月的论文一针见血地指出:强化学习缺的不是更好的模型,而是一个可以随意采样的合成先验。作者借鉴TabPFN的成功经验,直接把MDP「表格化」,用图注意力网络一通训练,结果在未见过的环境中,6个episode就收敛到最优策略,效率吊打传统上千步的Q-learning。思路极其清奇,简直是给RL基础模型铺路!

强化学习基础模型,真的还没到来吗?一招用「合成先验」搞定任意MDP
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
社区热议(453赞)!这篇2026年6月的论文一针见血地指出:强化学习缺的不是更好的模型,而是一个可以随意采样的合成先验。作者借鉴TabPFN的成功经验,直接把MDP「表格化」,用图注意力网络一通训练,结果在未见过的环境中,6个episode就收敛到最优策略,效率吊打传统上千步的Q-learning。思路极其清奇,简直是给RL基础模型铺路!


原论文信息如下:
论文标题:
Reinforcement Learning Foundation Models Should Already Be A Thing
发表日期:
2026年06月

发表单位:
未明确指定

原文链接:
https://arxiv.org/pdf/2606.18812v2.pdf

开源代码链接:
https://github.com/Shika-B/One-Shot-Reinforcement-Learning

大家好,龙哥来了。
上次聊完大语言模型的假推理,这次换个赛道,聊聊强化学习(RL)。图像和语言领域已被基础模型霸占,但RL仍停留在“一个任务一个模型”的原始时代。这篇2026年6月的论文给出反常识观点:RL的基础模型早就该来了,只是大家走错了方向

强化学习基础模型,真的还没到来吗?

插图
基础模型成功的秘诀是“先验”。语言模型在互联网文本上练出语言先验,视觉模型在亿级图片上练出视觉先验。但RL每次遇到新环境基本都要从头训练,缺少大规模、可通用的先验
插图
这张图有点无奈。让我们看看怎么扭转局面。

从表格数据到MDP:一种全新的视角

作者首先关注了表格数据基础模型的成功案例。像TabPFN这类方法,直接在合成数据上学习贝叶斯先验,在新任务上做到“看一眼就能猜”(In-Context Learning)。TabPFN将新任务的训练数据作为上下文输入Transformer,直接输出预测。这种“先验拟合网络”的训练范式已被论证为贝叶斯推理的主导方法。
本文的核心洞察:一个马尔可夫决策过程(MDP),本质上也是一个表格
传统在线上下文RL方法(如Decision Transformer)把多轮轨迹串联成长序列,随着经验增加,序列越来越长,注意力复杂度爆炸,早期探索数据也容易被稀释。但表格型MDP的马尔可夫性质告诉我们:不需要记住全部轨迹。整个MDP可总结为三个充分统计量:

访问计数N(s, a):每个状态-动作对被访问次数。

经验平均奖励r̂(s, a):所有访问的平均奖励。

经验转移概率P̂(·|s,a):到各后续状态的频率分布。

这三个量堆成大小为|S||A|×( |S|+2 )的矩阵Z,**大小只取决于状态和动作个数,与回合数N、轨迹长度H无关!** 这不就是一张标准“表格”吗?
插图
为什么不用处理“表格数据”的方式处理RL?直接用矩阵Z作为输入,丢给擅长处理表格的架构,输出动作策略即可。

如何用“合成先验”让模型学会任意MDP?

论文选择图注意力网络(GAT),因为MDP本身就是一张图:状态是节点,动作是边,转移概率是边权重。具体设计:

输入特征:每对(s, a)的特征向量为[log(1+N), r̂]。

注意力偏置:转移概率P̂作为乘法偏置,显式诱导规划。

权值共享:K层消息传递,参数共享,训练时K=20,测试时可用K=24提升效果。

预测目标:回归到每个采样MDP的玻尔兹曼最优策略π*,等价于贝叶斯最优估计。

GAT在完全合成的MDP数据上训练:状态数2-32,动作数2-4,转移概率从确定到随机,奖励有正有负。这给了极其宽广的先验,让模型学会“所有表格型MDP该怎么做决策”。
超参数表格直观展示先验设计细节:
表2:先验和模型超参数
表2:先验和模型超参数

效率碾压传统RL:少样本学习的神奇之处

论文在GridWorld(确定性)和FrozenLake(随机性)上测试。

实验结果

表1给出在线实验收敛到最优策略所需回合数中位数:
表1:收敛所需回合数的中位数
表1:在线实验结果。本方法(In-Context)、UCB-VI和Q-Learning的收敛所需中位数回合数。
结果非常亮眼!3×3 GridWorld中,本方法仅需6回合,UCB-VI需16,Q-learning需469。5×5 GridWorld中,6回合 vs 53 vs 1205。随机性极强的FrozenLake中,本方法仅27回合,远少于UCB-VI的46和Q-learning的1014。
这是“少样本学习”在RL的完美展现!模型依靠合成MDP先验,仅用少量“上下文线程”就能在新环境快速找到最优策略。
离线设置结果:
图2:离线策略恢复实验
图2:离线策略恢复实验。本方法从均匀随机数据集中恢复的策略与VI-LCB不相上下,数据极少时表现更优。
在线实验完整结果(不同规划深度K):
图1:上下文内回报随经验回合数的变化
图1:上下文内回报随经验回合数变化。K=24(略大于训练时的K=20)表现最好。

实验结果分析

为什么效果这么好?

1. 巨大且覆盖性强的合成先验:模型在成千上万种MDP上训练,覆盖多种随机性、奖励结构和拓扑,学的是“所有表格型游戏的通用逻辑”。

2. 状态压缩与高效架构:固定大小统计量Z避免序列爆炸,GAT图传播天然适合价值迭代,注意力偏置显式利用转移概率。

3. 离线训练,在线泛化:模型在合成数据上离线训练,测试时可在线自主探索规划,展示了强大迁移能力。

不足在于只验证了小型表格型MDP,但作为概念验证已非常有力。
插图

局限与未来:通往通用RL基础模型之路

效果炸裂,但还不是万能药。

1. 状态空间限制:核心假设是“表格型”MDP。对连续或高维状态空间,需引入基于特征的行或连续动作策略头。

2. 规模泛化:当前训练在2-32状态的小型MDP,直接用到1000状态会懵,需引入规模先验或更强等变性。

3. 部分可观测性:马尔可夫性质是基石,POMDP下Z不再是充分统计量,需重新引入序列建模。

未来方向:用特征向量替代状态索引,研究增量式更新实现在线RL,与语言、视觉基础模型结合构建多模态决策体。

龙迷三问

龙哥对常见问题的解答:

这篇论文解决什么问题?解决RL缺少通用基础模型的问题。现有模型要么在特定任务族上训练,要么依赖长轨迹序列,效率低、泛化难。论文提出用宽广的合成先验训练模型,学会“处理任何MDP的通用策略”。

本文中用到的GAT是什么?GAT是图注意力网络,让节点在聚合邻居信息时通过自注意力赋予不同权重。本文用GAT处理MDP图结构,注意力权重由经验转移概率偏置,实现显式“规划式”消息传递。

“合成先验”具体怎么工作?通过程序随机生成大量不同MDP(不同状态数、动作数、转移概率、奖励结构),在人工环境上训练。每个批次采样新MDP,计算最优策略π*,让模型根据有限探索数据Z预测π*。模型学的是“在不确定性下从数据泛化到最优策略”的通用能力。

欢迎在评论区留言讨论~

龙哥点评

论文创新性分数:★★★★★

提出用合成先验构建RL基础模型的完整思路,极具前瞻性。

实验合理度:★★★★☆

概念验证设计严谨,少样本场景碾压传统方法,但只在两个小型基准上测试。

学术研究价值:★★★★★

为RL基础模型开辟全新方向,思路启发价值极高。

稳定性:★★★☆☆

测试环境表现稳定,但对先验分布敏感,大规模MDP泛化较弱。

适应性以及泛化能力:★★★☆☆

表格型小MDP泛化超强,但连续状态、大规模、部分可观测时失效。

硬件需求及成本:★★★★★

一张普通显卡即可训练,推理计算量远小于轨迹建模方法。

复现难度:★★★☆☆

实现细节和超参数详细,但需精心设计先验分布。

产品化成熟度:★★☆☆☆

前沿研究,离产品化远,但思路可能被集成到游戏AI、机器人控制等领域。

可能的问题:只在小规模表格型MDP验证,对大规模和连续空间扩展路径讨论偏粗略,特征向量方案缺乏实验证据。总体上是一篇优秀的“Position Paper”。


主要参考文献

[1] Hollmann, N., Muller, S., Eggensperger, K., and Hutter, F. TabPFN: A transformer that solves small tabular classification problems in a second. ICLR, 2023.
[2] Velickovic, P., Cucurull, G., Casanova, A., Romero, A., Lio, P., and Bengio, Y. Graph attention networks. arXiv:1710.10903, 2018.
[3] Chen, L., Lu, K., Rajeswaran, A., et al. Decision transformer: Reinforcement learning via sequence modeling. NeurIPS, 2021.
[4] Rashidinejad, P., Zhu, B., Ma, C., Jiao, J., and Russell, S. Bridging offline reinforcement learning and imitation learning: A tale of pessimism. NeurIPS, 2021.
[5] Muiller, S., Hollmann, N., Pineda Arango, S., Grabocka, J., and Hutter, F. Transformers can do Bayesian inference. ICLR, 2022.
[6] Zighem, A. and Vie, J. Reinforcement Learning Foundation Models Should Already Be A Thing. arXiv:2606.18812v2, 2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎交流探讨~ 想了解更多原文细节,可点击"阅读原文"

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或添加龙哥助手微信号加群:kangjinlonghelper。备注:研究方向+地点+学校/公司+昵称
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。