← 返回 PaperDaily
大模型与智能体
强化学习基础模型,真的还没到来吗?一招用「合成先验」搞定任意MDP
社区热议(453赞)!这篇2026年6月的论文一针见血地指出:强化学习缺的不是更好的模型,而是一个可以随意采样的合成先验。作者借鉴TabPFN的成功经验,直接把MDP「表格化」,用图注意力网络一通训练,结果在未见过的环境中,6个episode就收敛到最优策略,效率吊打传统上千步的Q-learning。思路极其清奇,简直是给RL基础模型铺路!
龙哥读论文
发布于 2026-08-15 00:20:10
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 社区热议(453赞)!这篇2026年6月的论文一针见血地指出:强化学习缺的不是更好的模型,而是一个可以随意采样的合成先验。作者借鉴TabPFN的成功经验,直接把MDP「表格化」,用图注意力网络一通训练,结果在未见过的环境中,6个episode就收敛到最优策略,效率吊打传统上千步的Q-learning。思路极其清奇,简直是给RL基础模型铺路!
原论文信息如下:
上次聊完大语言模型的假推理,这次换个赛道,聊聊强化学习(RL) 。图像和语言领域已被基础模型霸占,但RL仍停留在“一个任务一个模型”的原始时代。这篇2026年6月的论文给出反常识观点:RL的基础模型早就该来了,只是大家走错了方向 。
强化学习基础模型,真的还没到来吗?
从表格数据到MDP:一种全新的视角
作者首先关注了表格数据基础模型 的成功案例。像TabPFN这类方法,直接在合成数据上学习贝叶斯先验 ,在新任务上做到“看一眼就能猜”(In-Context Learning)。TabPFN将新任务的训练数据作为上下文输入Transformer,直接输出预测。这种“先验拟合网络”的训练范式已被论证为贝叶斯推理的主导方法。
本文的核心洞察:一个马尔可夫决策过程(MDP),本质上也是一个表格 。
传统在线上下文RL方法(如Decision Transformer)把多轮轨迹串联成长序列,随着经验增加,序列越来越长,注意力复杂度爆炸,早期探索数据也容易被稀释。但表格型MDP的马尔可夫性质告诉我们:不需要记住全部轨迹 。整个MDP可总结为三个充分统计量:
访问计数N(s, a): 每个状态-动作对被访问次数。
经验平均奖励r̂(s, a): 所有访问的平均奖励。
经验转移概率P̂(·|s,a): 到各后续状态的频率分布。
这三个量堆成大小为|S||A|×( |S|+2 )的矩阵Z,**大小只取决于状态和动作个数,与回合数N、轨迹长度H无关!** 这不就是一张标准“表格”吗?
如何用“合成先验”让模型学会任意MDP?
论文选择图注意力网络(GAT) ,因为MDP本身就是一张图:状态是节点,动作是边,转移概率是边权重。具体设计:
输入特征: 每对(s, a)的特征向量为[log(1+N), r̂]。
注意力偏置: 转移概率P̂作为乘法偏置,显式诱导规划。
权值共享: K层消息传递,参数共享,训练时K=20,测试时可用K=24提升效果。
预测目标: 回归到每个采样MDP的玻尔兹曼最优策略π*,等价于贝叶斯最优估计。
GAT在完全合成的MDP数据上训练 :状态数2-32,动作数2-4,转移概率从确定到随机,奖励有正有负。这给了极其宽广的先验,让模型学会“所有表格型MDP该怎么做决策”。
效率碾压传统RL:少样本学习的神奇之处
论文在GridWorld (确定性)和FrozenLake (随机性)上测试。
实验结果
结果非常亮眼!3×3 GridWorld中,本方法仅需6回合,UCB-VI需16,Q-learning需469。5×5 GridWorld中,6回合 vs 53 vs 1205。随机性极强的FrozenLake中,本方法仅27回合,远少于UCB-VI的46和Q-learning的1014。
这是“少样本学习”在RL的完美展现!模型依靠合成MDP先验,仅用少量“上下文线程”就能在新环境快速找到最优策略。
实验结果分析
1. 巨大且覆盖性强的合成先验: 模型在成千上万种MDP上训练,覆盖多种随机性、奖励结构和拓扑,学的是“所有表格型游戏的通用逻辑”。
2. 状态压缩与高效架构: 固定大小统计量Z避免序列爆炸,GAT图传播天然适合价值迭代,注意力偏置显式利用转移概率。
3. 离线训练,在线泛化: 模型在合成数据上离线训练,测试时可在线自主探索规划,展示了强大迁移能力。
不足在于只验证了小型表格型MDP,但作为概念验证已非常有力。
局限与未来:通往通用RL基础模型之路
1. 状态空间限制: 核心假设是“表格型”MDP。对连续或高维状态空间,需引入基于特征的行或连续动作策略头。
2. 规模泛化: 当前训练在2-32状态的小型MDP,直接用到1000状态会懵,需引入规模先验或更强等变性。
3. 部分可观测性: 马尔可夫性质是基石,POMDP下Z不再是充分统计量,需重新引入序列建模。
未来方向:用特征向量替代状态索引,研究增量式更新实现在线RL,与语言、视觉基础模型结合构建多模态决策体。
龙迷三问
这篇论文解决什么问题? 解决RL缺少通用基础模型的问题。现有模型要么在特定任务族上训练,要么依赖长轨迹序列,效率低、泛化难。论文提出用宽广的合成先验训练模型,学会“处理任何MDP的通用策略”。
本文中用到的GAT是什么? GAT是图注意力网络,让节点在聚合邻居信息时通过自注意力赋予不同权重。本文用GAT处理MDP图结构,注意力权重由经验转移概率偏置,实现显式“规划式”消息传递。
“合成先验”具体怎么工作? 通过程序随机生成大量不同MDP(不同状态数、动作数、转移概率、奖励结构),在人工环境上训练。每个批次采样新MDP,计算最优策略π*,让模型根据有限探索数据Z预测π*。模型学的是“在不确定性下从数据泛化到最优策略”的通用能力。
龙哥点评
论文创新性分数: ★★★★★
提出用合成先验构建RL基础模型的完整思路,极具前瞻性。
实验合理度: ★★★★☆
概念验证设计严谨,少样本场景碾压传统方法,但只在两个小型基准上测试。
学术研究价值: ★★★★★
为RL基础模型开辟全新方向,思路启发价值极高。
稳定性: ★★★☆☆
测试环境表现稳定,但对先验分布敏感,大规模MDP泛化较弱。
适应性以及泛化能力: ★★★☆☆
表格型小MDP泛化超强,但连续状态、大规模、部分可观测时失效。
硬件需求及成本: ★★★★★
一张普通显卡即可训练,推理计算量远小于轨迹建模方法。
复现难度: ★★★☆☆
实现细节和超参数详细,但需精心设计先验分布。
产品化成熟度: ★★☆☆☆
前沿研究,离产品化远,但思路可能被集成到游戏AI、机器人控制等领域。
可能的问题: 只在小规模表格型MDP验证,对大规模和连续空间扩展路径讨论偏粗略,特征向量方案缺乏实验证据。总体上是一篇优秀的“Position Paper”。
主要参考文献
[1] Hollmann, N., Muller, S., Eggensperger, K., and Hutter, F. TabPFN: A transformer that solves small tabular classification problems in a second. ICLR, 2023.
[2] Velickovic, P., Cucurull, G., Casanova, A., Romero, A., Lio, P., and Bengio, Y. Graph attention networks. arXiv:1710.10903, 2018.
[3] Chen, L., Lu, K., Rajeswaran, A., et al. Decision transformer: Reinforcement learning via sequence modeling. NeurIPS, 2021.
[4] Rashidinejad, P., Zhu, B., Ma, C., Jiao, J., and Russell, S. Bridging offline reinforcement learning and imitation learning: A tale of pessimism. NeurIPS, 2021.
[5] Muiller, S., Hollmann, N., Pineda Arango, S., Grabocka, J., and Hutter, F. Transformers can do Bayesian inference. ICLR, 2022.
[6] Zighem, A. and Vie, J. Reinforcement Learning Foundation Models Should Already Be A Thing. arXiv:2606.18812v2, 2026.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎交流探讨~ 想了解更多原文细节,可点击 "阅读原文" 。
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或添加龙哥助手微信号加群 :kangjinlonghelper。
备注:研究方向+地点+学校/公司+昵称 。