← 返回 PaperDaily
大模型与智能体
Oxford新作:实时RL学会“何时思考”,自适应预算反超固定搜索
实时强化学习最狠的矛盾,不是“会不会算”,而是“算的时候世界还在往前跑”。这篇牛津论文干脆把“思考时长”也变成可学习策略,5个环境里直接干过固定预算和启发式基线,还能迁移到双GPU部署,工程味很足。
龙哥读论文
发布于 2026-08-14 09:10:53
阅读 2
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 实时强化学习最狠的矛盾,不是“会不会算”,而是“算的时候世界还在往前跑”。这篇牛津论文干脆把“思考时长”也变成可学习策略,5个环境里直接干过固定预算和启发式基线,还能迁移到双GPU部署,工程味很足。
原论文信息如下:
打破行动延迟的“免费午餐”:实时RL中的规划预算自适应分配
这篇论文最有意思的地方,不是又做了一个更大的 planner,而是反过来问:规划这件事,本身能不能也学会“看场合下菜” 。在标准强化学习里,环境会老老实实等智能体想完再动;但在实时场景里,环境可没这么好说话,智能体想久一点,世界就往前跑一点,代价不是“延迟”,而是真正的状态变化 。这就很像打游戏时你盯着棋盘犹豫三秒,结果对手已经把局面推进成了“你再聪明也来不及”。
论文的核心贡献很清楚:先把实时 RL 里“思考会消耗世界进度”这件事讲明白,再把“思考多久”变成一个可学习的决策。作者没有去硬卷一个更重的搜索器,而是训练了一个很轻的门控策略,让它站在 planner 上面做裁判:这一步到底值不值得多搜几轮。说白了,就是让模型学会省脑子,但不是瞎省脑子。
核心思路:如何让智能体学会“何时思考”与“何时行动”?
先把概念捋顺。实时强化学习 指的是:环境按固定节奏持续推进,不会因为智能体还在算就停下来等。传统 MDP(马尔可夫决策过程)里,动作选择几乎是“免费”的;但在这里,计算时间本身会转化成环境时间,思考越久,可能错过的越多。
论文把这个问题进一步推广成可变延迟实时 RL (variable-delay real-time RL):不是固定延迟 1 步,也不是环境替智能体规定死了要等几步,而是由智能体自己决定这次要花多少帧去思考。这个“延迟”不是被动挨打,而是主动选择。听起来很自由,实际上也很容易把自己算死——因为一旦门控策略也要想“想多久”,那就会掉进“规划规划又规划”的递归黑洞。
为了解这个悖论,作者干了一件很工程的事:把重活交给冻结的 planner,把轻活交给门控网络。planner 负责搜索与改进动作质量,门控网络只负责挑预算。门控网络很小,前向一次的代价远低于一次 MCTS rollout,所以它不会把“要不要多想”这个问题本身变成新的性能瓶颈。这个设计的妙处在于:决策质量由 planner 保证,计算时机由 gate 学习 ,职责分工非常明确。
这里的关键术语也顺手解释一下。MCTS 是 Monte Carlo Tree Search,中文一般叫蒙特卡洛树搜索 ,本质上就是“多试几条未来分支,再选看起来最有希望的那条”。AlphaZero 风格 则是把神经网络和 MCTS 结合:网络先给一个初始判断,搜索再把这个判断打磨得更稳。论文的思路不是改造搜索器本身,而是给它加了一个“预算开关”。
门控策略的输入也很务实:当前观测、planner 的中间特征、planner 的价值估计;在时钟类环境里还加上剩余时间。也就是说,gate 不是盲猜,它能看到“棋盘长什么样”,也能看到“planner 自己觉得有多把握”。这就像一个副驾驶,不只看路,还顺带看主驾驶的脸色。
训练方式也比较干净:先训练 AlphaZero 风格的基础 planner,再冻结它,只训练门控策略,用 PPO(Proximal Policy Optimization,近端策略优化)去学“选哪个预算更划算”。这里的 PPO 不需要展开成一大坨公式,理解成“让策略稳定地朝更高回报的方向更新”就够了。因为每个 meta-step 的持续时间不同,作者还把折扣项按 k 帧做了适配,这样长期和短期收益不会被算歪。
技术拆解:可变延迟框架、预算选项与轻量级门控策略
从工程角度看,这篇工作其实是把一个麻烦的实时问题拆成了三层。第一层是实时交互协议 :环境每一帧都在走,智能体不能假装“暂停一下”。第二层是预算选项 :每个预算 k 对应一个持续 k 帧的 option,等待期间由 reflex policy 填补动作。第三层才是门控策略 :在这些预算里选一个,决定这次到底是快打还是深思。
这种写法比“直接把 state 扔给一个大网络,然后让它输出动作”更适合实时场景。原因很朴素:不是所有状态都值得同等计算 。有些局面一眼就能看出该躲;有些局面多搜几轮能明显减少失误;还有些局面再算也没啥区别,纯属浪费时间。门控策略学的就是这个“边际收益”判断。
作者没有把预算做成连续值,而是先离散化成几个候选 k。这个选择很现实:离散预算更容易训练、更容易调试,也更容易部署。对工业系统来说,连续控制当然优雅,但如果落地时预算抖得像心电图,工程师会先被日志逼疯。离散预算的代价是粒度不够细,优点则是稳定、可控、可复现 。
图5很关键,因为它证明门控策略不是随机抖动,也不是“训练出来一个玄学开关”。在 Pac-Man 里,离幽灵更近时,策略更偏向 k=1;在空间更安全时,才愿意多想一点。在实时 Tetris 里,棋盘越密、局面越危险,深度规划越常出现。Snake 里则更像“空间受限才开始认真”,局面开阔时它很快,局面逼仄时它会明显加预算。这些现象说明门控学到的是状态相关的计算分配 ,而不是单纯偏爱某个固定 k。
clock 类环境更有意思。这里不是“环境在跑”,而是“时钟在掉”。也就是说,棋盘可以暂时不变,但你的思考时间是真金白银。论文把这类问题放到 Speed Hex 和 Speed Go 里,门控策略根据剩余时间来调整预算:时间紧时更保守,时间宽裕时才敢多搜。这和人类下快棋的直觉非常一致——不是每一步都值得开大脑超频模式。
实验验证:在5个环境中全面领先固定预算与启发式基线
实验部分的结论非常直接:动态选预算,比固定选预算更强 。这不是“某个环境偶然赢一点”,而是在五个环境里都成立。更难得的是,作者还拿了启发式方法来对比,比如 greedy、midpeak 这类工程上常见的时间管理策略,结果门控策略依然能赢。说明它不是单纯学会了“多算就好”,而是真的学会了“哪里值得多算”。
看具体数值就更直观了。在 Pac-Man 上,最好的固定预算策略是 k=3,得分 2149,而门控策略到 2370,提升约 10.3%。实时 Tetris 的提升更夸张,固定最优只有 27.6,门控能到 45.6,涨幅约 65%。Snake 也从 14.91 提到 16.54。Speed Hex 和 Speed Go 这种对时钟更敏感的任务里,门控同样稳定优于固定预算和启发式基线。换句话说,“会分配算力”本身就是一种能力 ,而且在实时环境里非常值钱。
这组实验还有一个值得注意的点:随机选预算基本被按在地上摩擦。这个结果并不意外,但它说明一个朴素事实——在实时 RL 里,“何时思考”几乎和“思考什么”一样重要 。如果预算选错了,再强的 planner 也可能在错误的时机把好棋下成坏棋。
作者还做了更细的分析,看看门控到底在什么状态下会选更深的预算。结论很符合直觉,但这恰恰说明方法不是在瞎跑:危险更大、空间更紧、剩余时间更少时,策略会更偏向快反应;当局面更安全、可搜索空间更大、时钟更充裕时,才会把预算往深处挪。这个模式在不同环境里有各自的表现,但共同点都是——策略学会了按状态难度分配计算 。
从仿真到硬件:双GPU异步迁移,性能稳健复现
真正让这篇论文显得“不是只会跑仿真”的,是它把方法搬到了双 GPU 异步部署 里。一个 GPU 负责环境连续推进,另一个 GPU 负责 MCTS 搜索,二者并行。这样一来,k 变大并不是“让环境停下来等你”,而是“让你在后台多想一会儿,但游戏照常往前走”。这个设定非常贴近真实系统:推理和环境不一定在同一块卡上,调度也不一定同步。
这部分结果的价值不只是“能跑”。更重要的是,它验证了论文前面那个抽象:模拟中的 committed-action 机制,确实能近似真实的异步硬件执行。作者在实时 Tetris、Pac-Man 和 Snake 上做了多组部署测试,结果显示训练出来的预算分配策略可以比较稳定地迁移过去,返回值没有明显崩掉。换句话说,这个方法不是只在论文图里好看,到了硬件上也没有原地翻车。
不过这部分也有边界。作者自己也承认,committed-action 方案依赖一个比较理想的环境模拟器,尤其是 MCTS 需要能准确模拟那 k−1 个过渡动作。如果未来换成更难建模的 learned dynamics,或者环境本身噪声更大,这个抽象就要重新打磨。也就是说,它证明了方法能落地,但不是证明所有实时系统都能无脑照搬 。
局限性、未来方向与我们的新论文思路启发
这篇论文已经很完整了,但它的边界也比较清楚。第一,门控策略是建立在冻结 planner 之上的,说明“怎么搜”与“何时搜”还没有联合最优 。第二,预算集合是手工离散设计的,虽然工程上稳,但未必是最优划分。第三,当前方法主要围绕 MCTS 展开,若换成别的 anytime 算法,或者换成模型不那么完美的场景,效果可能会打折。
但它给后续研究留下了很好的入口。一个自然方向是把预算从离散集合扩展到连续控制,让 gate 不只会选“1、2、3、4”,而是能更细地分配计算。另一个方向是把 planner 和 gate 联合训练,看看“什么时候多想”与“怎么想得更好”能不能一起优化。再往前一步,还可以把这种思想迁移到大模型推理:不是每个问题都值得开大推理预算,难题多想,简单题快答,才能把算力花在刀刃上。
如果把这篇工作放到更大的技术趋势里看,它其实在做一件很重要的事:把“计算预算”从静态超参数,变成动态决策变量。这个思路对实时控制、机器人、游戏 AI,甚至大模型的自适应推理都很有启发。未来真正值钱的系统,可能不是单纯更大,而是更懂得把算力花在该花的地方 。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是实时 RL 里的“思考时间怎么分配”问题。环境不会等人,智能体不能总是固定搜同样久,所以论文让模型学会按状态决定规划预算,危险局面快反应,值得深想的局面多搜索。
文中的 budget、option、gate 分别是什么意思? budget 是一次规划允许花多少帧;option 是把这段预算包装成一个可执行的“时间段动作”;gate 是决定选哪个预算的轻量策略。三者合起来,相当于给 planner 装了一个会看局势的计时器。
为什么这类方法有现实意义? 因为很多系统的瓶颈不是“模型不会想”,而是“想太久会误事”。实时控制、游戏 AI、机器人和在线决策都存在类似矛盾。能动态决定算多少,往往比盲目堆算力更实用,也更接近真实部署。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 把“何时思考”变成学习问题,这个切口很漂亮;不是简单做延迟控制,而是把预算选择放进实时决策框架里,思路新,而且抓住了真痛点。
实验合理度: ★★★★☆ 对比了固定预算、随机和启发式基线,还做了跨环境与双 GPU 迁移,整体比较扎实。缺点是预算集合仍是手工设定,离“完全自动化”还差一步。
学术研究价值: ★★★★☆ 它把实时 RL、元推理和自适应计算串起来了,对后续研究很有启发,尤其适合继续往“动态算力分配”方向延伸。
稳定性: ★★★☆☆ 在给定环境和冻结 planner 下表现不错,但对模拟器精度、预算设置和基础 planner 的质量都比较敏感,离即插即用还有距离。
适应性以及泛化能力: ★★★☆☆ 跨 5 个环境有效,说明不是单点技巧;但方法仍偏向具有明确实时机制、且能做预算化搜索的任务,泛化范围还不算特别宽。
硬件需求及成本: ★★★☆☆ 门控本身很轻,但底层还是要跑 MCTS,算力并不低。好处是预算可控,坏处是想要更强效果,仍得付出搜索成本。
复现难度: ★★★☆☆ 论文给了代码和项目页,复现门槛不算离谱;但实时环境、异步部署和 JAX 实现细节都不算省心。
产品化成熟度: ★★★☆☆ 在游戏 AI、实时控制或带时钟约束的决策系统里有落地潜力,但需要稳定模拟器、明确预算边界和工程调度支持。
可能的问题: 门控依赖冻结 planner 和手工预算集,遇到复杂环境或不准的模拟器时,收益可能缩水;联合训练和连续预算仍待验证。
主要参考文献
Aneesh Muppidi, Firas Darwish, Dylan Cope, Joao F. Henriques, Jakob Nicolaus Foerster. Finding the Time to Think: Learning Planning Budgets in Real-Time RL. arXiv:2606.26463v1, 2026.
项目主页与代码:https://aneeshers.github.io/realtime-rl/
实时决策最怕的不是算不出来,而是 算太久,世界已经变了 。欢迎加入龙哥读论文粉丝群,和一群爱啃前沿、爱拆系统、爱聊落地的同好一起研究“何时思考、何时出手”🤖
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群