← 返回 PaperDaily 大模型与智能体

强化学习致命短板曝光:智能体真的没有内部时钟?

人人都说AI要像人一样干活,可它连“等锅汤开要多久”都没概念。根特大学等机构推出Chronocooked强化学习基准,把时间藏在炒菜场景里,逼着智能体靠内在计时做决策。想看AI到底会不会“看表”,这篇论文值得一读。

强化学习致命短板曝光:智能体真的没有内部时钟?
原论文信息如下:
论文标题:
Chronocooked: A Benchmark for Implicit Interval Timing in Reinforcement Learning Agents
发表日期:
2026年8月
发表单位:
比利时根特大学imec IDLab、阿姆斯特丹自由大学
原文链接:
https://arxiv.org/pdf/2608.16666v1.pdf
开源代码链接:
https://anonymous.4open.science/r/Chronocooked-1BA6/
你有没有遇到过这种情况:烤箱定时器坏了,但你知道这份炖菜已经煮了四十分钟,该出锅了。这种"凭感觉知道过了多久"的能力,人类几乎与生俱来,但放在AI身上,却成了让研究者挠头的大问题。🤔
绝大多数强化学习(RL)智能体确实不会"看表"。它们擅长解读像素、追踪物体、优化奖励,但如果环境里没有倒计时数字、没有外部提示,只靠内部感觉去估算"该行动了"的时机,很多模型立刻现出原形。更扎心的是,就算有些模型能完成任务,研究者也说不清它是真的感知了时间,还是偷偷用了别的捷径。
要回答"AI到底有没有时间感",不能光靠嘴,得有一个能逼着智能体暴露时间感知能力的标准考场。近期,来自比利时根特大学imec IDLab和阿姆斯特丹自由大学的研究团队,就带来了这样一个考场——Chronocooked。

时间感知:AI智能体的缺失维度

时间,是塑造人类日常决策的多面维度。从"再等两分钟就能出锅"到"这个红绿灯快变绿了",人类无时无刻不在利用对时间流逝的感知来协调行动。心理学中,这类基于时间间隔的决策行为被称为区间计时(interval timing),科学家通过专门的实验任务来研究人和动物如何编码、感知并基于时间做决策。
有意思的是,虽然许多AI系统在需要时间处理的任务上表现优异(比如视频理解、语音识别),但研究者的注意力几乎都集中在最终任务表现上,很少有人深究:这些系统真的发展出了内在的时间感,还是仅仅在依赖任务特定的启发式窍门?
在机器人领域,人机协作(HRI)研究大量关注同步与协调,却很少把时间作为显式维度来考量。现有方法通常依赖环境或人类伙伴提供的可观察线索来决定何时行动。但现实世界中,很多场景要求智能体仅仅依据"过去了多长时间"来行动,周围没有任何显式线索。就像我们能判断烤箱计时器坏了,因为"这台烤箱运行的时间已经超过了预期"——这种纯粹的基于流逝时间的决策能力,对当下多数AI来说,仍然是巨大的挑战。

Chronocooked:一个精心设计的隐式计时基准

名字很直白:Chronos(希腊神话里的时间之神)+ Overcooked(经典多人做饭游戏《胡闹厨房》)。研究团队把Overcooked简化成了一个单人强化学习环境,用"做饭→等汤煮熟→上菜"这个过程,把时间感知巧妙地藏进任务里。
环境本身简单到让人放心:一个5×3或4×3的网格世界,三个关键交互位置——洋葱出料口、烤箱、送餐台。智能体的目标很朴素:从出料口拿洋葱,放进烤箱,等汤煮好,端下来送到送餐台。核心机关在于,烤箱里藏着一个不可见的内部计时器,绑定了一个预定义的目标时长(TD)。在整个过程中,智能体的观测里没有任何关于时间的直接信息,想要拿到最高奖励,只能靠"感觉"。
与传统心理学实验不同,Chronocooked没有让"计时"本身成为最终目标,而是让时间感知成为达成目标的手段。奖励函数和智能体状态不携带任何显式时间信息——这就是论文所说的隐式区间计时(implicit interval timing):时间是一个未被观测、但必须被推断出来才能实现最优表现的隐藏变量。
(a) 二分任务 (b) 固定间隔与多计时器任务 (c) 双任务 (d) 不确定性任务
图1:隐式区间计时任务总览:(a) 二分任务;(b) 固定间隔任务与多计时器任务;(c) 双任务;(d) 不确定性任务。其中二分任务和固定间隔任务灵感来自心理学研究,其余任务是对这两类任务的拓展,用于评估不同的时间决策能力维度。

四种任务全面考验AI的时间智慧

Chronocooked借鉴了心理学中两个经典范式:二分任务(bisection task)固定间隔任务(fixed interval timing task),并在此基础上扩展出多个变体,像一套组合拳,从不同角度测试智能体的时间能力。

任务一:二分任务——测试时间分辨与编码

二分任务是计时研究中的经典范式。它设定两个锚定时长:短(S)和长(L),受试者在训练阶段学习这两个时长,测试阶段则会出现介于两者之间的中间时长,要求受试者判断每个时长"更接近短"还是"更接近长"。对于中间时长,客观上并没有标准答案,因此这个任务能揭示主观时间感知的特点。
在Chronocooked中,这个任务被实现为两个送餐台:一个标"短"、一个标"长"。智能体把洋葱放入烤箱后,烤箱会以50%的概率运行短或长时长。它需要在烤箱状态变为"就绪"后,把汤送到正确的送餐台。评测指标包括心理测量曲线(psychometric curve)二分点(bisection point, BP)韦伯分数(Weber fraction, WF)
心理测量曲线以测试时长为横轴、"回答长"的百分比为纵轴。若智能体能成功学会任务,短锚点及以下时长的"长响应率"应为0%,长锚点及以上应为100%。二分点则是判断"长"和"短"概率恰好各50%的时长位置:如果BP落在锚点的几何平均值附近,说明时间编码是对数式的(人类通常如此);如果落在算术平均值附近,则表明是线性编码。韦伯分数则衡量时间辨别的敏感度是否随时长等比例变化——著名的韦伯定律(Weber's law)认为,辨别两个时长的能力与时长大小成正比,WF应近似恒定。

任务二:固定间隔任务——测试时间控制精度

固定间隔任务源于动物学习研究。动物需要在固定时长之后做出反应,提前反应得不到奖励。在Chronocooked中,目标时长就是烤箱的固定间隔。智能体在TD之前交互烤箱不会引发状态变化,只有在TD之后才能取汤并获得+1奖励。奖励函数设计了一个显式下限(TD前不能取汤)和一个隐式上限(折扣因子促使智能体尽快送汤),让智能体的涌现计时行为可以被清晰研究。
这项任务引入了一个关键指标:首次检查烤箱时间(first oven check, FOC),即智能体在计时阶段第一次对烤箱发起"交互"动作时,烤箱计时器对应的值。FOC可以揭示智能体是否真的在"等时间",也会暴露大量无意义的烤箱检查行为——在人机协作场景中,这些多余动作可能付出真实代价。此外,峰值间隔任务(peak interval task)则把目标时间延长到训练值的2倍或5倍,考察智能体在超出训练区间后的计时行为。标量属性(scalar property)则要求平均反应时间和反应时间的标准差都随目标时长线性增长,变异系数(CV,即标准差除以均值)保持恒定。

任务三:多计时器任务——测试多时间存储与分布外泛化

多计时器任务是固定间隔任务的增强版。它引入了一个"时间缓冲区":智能体必须在TD±buffer的时间窗口内取汤,才能获得完整奖励+1,过早或过晚只能拿到0.1。任务还支持同时设置多个目标时长,烤箱有独立状态提示当前对应哪个时长——类似于不同颜色的指示灯。这能测试三个维度的能力:对单一时长的精确计时、同时存储多个时长的表征容量、以及对训练中未见过的时长(OOD,即分布外)的泛化能力。

任务四:双任务与不确定性任务——测试时间前提下的复杂决策

双任务(dual task)在计时阶段引入了一个额外的小额奖励点。这个奖励点足够诱人,但最优策略要求智能体必须在时间差不多时离开奖励点,及时赶回烤箱取汤——这要求智能体在计时的同时兼顾其他任务,模拟真实世界的时间分配场景。不确定性任务(uncertainty task)则给烤箱加了一个手动关闭按钮,按下后无论TD是否到达,烤箱都会变为就绪状态,但奖励会减少。训练时烤箱有小的概率永远不会自动就绪,此时最优策略就是按手动按钮。这个任务考察智能体在时间不确定性下的适应能力,以及一个更强的内在时间感是否能帮助它更快适应这种异常状况。

三大模型架构的计时能力大比拼

为了给基准建立参照系,研究团队评测了三种不同类型的模型架构:

非循环模型:CNN-MLP,卷积神经网络提取视觉特征后直接接多层感知机输出动作,没有循环结构,理论上不具备维持时间信息的内存机制。

循环模型:CNN-LSTM-MLP,在CNN特征提取后接入长短期记忆网络(LSTM,Long Short-Term Memory),LSTM的门控机制让模型能在时间维度上维护状态信息,是当前序列决策任务中的主力架构。

生物合理循环模型:CNN-CTRNN-MLP,用连续时间循环神经网络(CTRNN,Continuous-Time Recurrent Neural Network)替代LSTM。CTRNN源自计算神经科学,其神经元动力学更接近真实生物神经元,具有平滑的时间演化特性,被认为可能天然更适合时间感知任务。

所有模型使用PPO(Proximal Policy Optimization,近端策略优化)算法训练,基于Stable Baselines3实现。循环模型使用了三种记忆大小(8、125、256),主实验以125为主。每种任务、每个模型进行两次运行,结果在11到12个随机种子上聚合。
图2:三种模型类型(行)在不同锚点(列)下的心理测量曲线。Y轴为长响应百分比P(long),X轴为测试时长,并标注了各锚点的算术平均值(AM)和几何平均值(GM)。灰色点为每次运行的P(long)(各11个种子),黑色点为所有运行的平均值,红色线为平均P(long)的S形拟合曲线,蓝色水平虚线对应P(long)=50%。各图中的二分点(BP)已在图中标出。
图2:三种模型类型(行)在不同锚点(列)下的心理测量曲线。Y轴为长响应百分比P(long),X轴为测试时长,并标注了各锚点的算术平均值(AM)和几何平均值(GM)。灰色点为每次运行的P(long)(各11个种子),黑色点为所有运行的平均值,红色线为平均P(long)的S形拟合曲线,蓝色水平虚线对应P(long)=50%。各图中的二分点(BP)已在图中标出。

实验结果:AI计时能力的现状与不足

Chronocooked给出的结果,对于期待"AI已经偷偷学会感知时间"的人来说,算是一盆冷水——但也提供了大量有价值的信息。

二分任务:循环模型能分辨,但不像人类

从心理测量曲线看,LSTM125(记忆大小125的LSTM模型)在二分任务中表现优于其生物合理对手CTRNN125。不过当记忆大小提升到256时,两个模型性能变得接近。两组循环模型都能分辨大多数测试时长,包括超出训练范围的分布外(OOD)时长,这说明模型确实不只是在死记硬背训练数据,具备一定的时间泛化能力。
表1(a):韦伯分数(WF)。该表展示了三种不同模型和锚定时长组合下的韦伯分数均值和标准差。韦伯分数越恒定,表示时间辨别能力越符合人类韦伯定律。
表1(a):韦伯分数(WF)。该表展示了不同模型和锚定时长组合下的韦伯分数均值和标准差。韦伯分数越恒定,表示时间辨别能力越符合人类的韦伯定律规律。
表1(b):敏感性(DL)。该表展示了不同模型和锚定时长组合下的敏感性均值和标准差。DL值越小,说明模型对时长的辨别越敏锐。
表1(b):敏感性(DL)。该表展示了不同模型和锚定时长组合下的敏感性均值和标准差。DL值越小,说明模型对时长的辨别越敏锐。
值得注意的是韦伯分数的表现。CTRNN125的WF在多个锚点组合下几乎恒定(均值为0.04-0.06),这与人类的时间辨别模式相当接近。相比之下,LSTM125的WF波动较大,且随任务难度增加呈现系统性变化——LSTM的敏感度在多数情况下随任务变难而下降。不过,部分锚点组合下CTRNN的计算结果为NaN(无法计算),说明这些情况下CTRNN的拟合曲线存在问题。总体而言,两个循环模型虽然能分辨时间,但它们的时间感知模式是否真的与人类相似,论文给出的结论是:尚不能下定论

固定间隔任务:循环结构涌现出计时行为

固定间隔任务的结果颇为有趣。CNN模型的FOC在大多数情况下为零,意味着它在烤箱刚激活时就立即开始反复交互,直到获取汤为止。从最终目标(成功送汤)来看,这种策略并不算错,但它完全暴露了模型缺乏任何计时意识——就像一个人站在烤箱前疯狂拉门把手,直到门终于打开为止。🙈
mmexport1760710364748.jpg
而引入循环结构后,模型开始出现涌现的计时行为。LSTM125的FOC值明显更接近目标时长,说明它能较好地"估算"何时该去查看烤箱;CTRNN125虽然也展现出计时行为,但倾向于较早检查烤箱。当记忆大小提升到256时,CTRNN的性能明显改善,说明生物合理的动力学在足够容量下也能实现较好的时间估算。
图3:不同模型类型和目标时长下的首次检查烤箱时间(FOC)分布。误差条表示对应柱状图的标准差。FOC越接近目标时长,说明模型的计时越准确。
图3:不同模型类型和目标时长下的首次检查烤箱时间(FOC)分布。误差条表示对应柱状图的标准差。FOC越接近目标时长,说明模型的计时越准确。
标量属性方面,两个循环模型的平均FOC都随目标时长线性增长,符合标量属性的均值特性。但均值与标准差之间的关系在两个模型中都不呈线性,特别是CTRNN125的R²仅有0.02——这意味着它们都没能复现人类时间感知中方差随时长成比例放大的特征。LSTM125的CV相对更稳定,但距离"恒定CV"的标准仍有差距。
表2:固定间隔任务标量属性。(a) 不同模型类型和目标时长下的变异系数(CV = 标准差/均值)。恒定的CV意味着符合标量属性。(b) 标量属性的线性回归结果:均值对TD的R²以及均值对标准差的R²。
表2:固定间隔任务标量属性。(a) 不同模型类型和目标时长下的变异系数(CV = 标准差/均值)。恒定的CV意味着符合标量属性。(b) 标量属性的线性回归结果:均值对TD的R²以及均值对标准差的R²。

多计时器任务:没有一个模型能全面胜任

在精确计时子任务中,LSTM125总体表现优于其他两个模型,这与其更大的记忆容量相符。有趣的是,在最短的TD=4条件下,没有循环结构的CNN也能取得超过最低奖励0.1的平均分数。论文认为,这可能是强化学习底层的时序差分(TD,Temporal Difference)学习机制本身赋予模型的一种微弱时间感知能力——毕竟TD学习天生就是在处理"状态-时间"关系。但这种能力非常有限,一旦目标时长变长,CNN立刻失效。
图4:精确计时任务:不同时间缓冲区大小下各目标时长(TD)的平均奖励。阴影区域表示多次运行的标准差。红色虚线表示成功完成任务的最低可能奖励(0.1)。
图4:精确计时任务:不同时间缓冲区大小下各目标时长(TD)的平均奖励。阴影区域表示多次运行的标准差。红色虚线表示成功完成任务的最低可能奖励(0.1)。
多计时器任务的结果更加复杂。所有模型都未能在所有任务上表现出色。进一步分析平均烤箱关闭时间可以发现,模型倾向于把烤箱关闭时间稳定在某个训练过的TD值附近或中间值。烤箱关闭时间曲线中出现的"档位切换"数量,可以作为模型内部存储了多少个"近似计时器"的指标。在这方面,CTRNN125展现出的切换次数比LSTM125更多,说明它在区分不同烤箱状态方面可能具有更灵活的计时表征,但这种能力远没有达到可靠的水平。
图5(a):多计时器任务中按目标时长(TD)的平均奖励。子图标题表示训练时使用的TD数量和具体值,其他TD为分布外(OOD)时长。
图5(a):多计时器任务中按目标时长(TD)的平均奖励。子图标题表示训练时使用的TD数量和具体值,其他TD为分布外(OOD)时长。
图5(b):平均烤箱关闭时间(包含OOD时长)。该曲线显示模型在不同TD下的实际等待行为,用于分析模型内部存储的近似计时器数量。
图5(b):平均烤箱关闭时间(包含OOD时长)。该曲线显示模型在不同TD下的实际等待行为,用于分析模型内部存储的近似计时器数量。
综合来看,没有任何一个模型能够展示出完整的时间意识。它们要么缺乏内在计时能力(CNN),要么只能处理单个时间间隔(LSTM),要么在标准指标上不够稳定(CTRNN)。当前RL智能体的时间感知能力,距离真正时间感知AI还有相当距离。

未来展望:迈向真正的时间感知AI

论文坦诚地讨论了自身的局限。峰值间隔指标的测试结果在所有模型中都表现为统一的烤箱检查行为,这其实并不意外——模型从未在无奖励条件下训练过,该指标对它们并不公平。类似地,OOD泛化本就是标准RL的公认短板,元强化学习(meta-RL)等方法或许更适合作为OOD时间泛化的评估框架。
Chronocooked更大的价值在于它提供了一个标准化的多维计时能力评估框架。未来的工作可以从几个方向推进:加入心理学中更多的计时任务(如时间再现任务);扩展到多智能体协作场景;将时间显式工程化的模型(如神经振荡器、时间细胞模型)纳入基准测试。此外,评估更大范围的模型架构与训练超参数,也能为用户提供更全面的时间能力图谱。
想象一下,如果一个家用服务机器人真的能在"等待汤煮好"时不反复打开烤箱门、能在主人回家前恰好把饭做好、能在协作中不用催促就自动跟上节奏——这些场景的实现,都离不开AI的时间感知能力。Chronocooked或许正是打开这扇门的钥匙。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?Chronocooked是一个面向强化学习智能体的隐式间隔计时基准库。受Overcooked启发,在炒菜场景中让智能体必须在无显式时间线索的条件下完成计时决策,并配有心理测量曲线、韦伯分数等评估指标。
这篇工作最值得看的点是什么?LSTM125在大多数任务中表现优于CTRNN125和CNN;CTRNN125在韦伯分数一致性上表现更好;所有模型在标量属性方差一致性和多计时器任务上均表现不足;CNN在无递归情况下表现出有限的计时能力。
这篇工作的边界或风险在哪里?优点:环境设计简洁,任务设计系统化,评估指标全面且来自心理学文献,支持多种模型架构比较。缺点:模型在多个关键指标上表现不佳,缺乏与显式时间工程模型的对比,部分指标(如峰值间隔计时)对未训练场景的评估不够公平。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

构建一个基于Overcooked的简化强化学习环境,通过设计隐式时间决策任务和评估指标,系统评估不同模型架构(非递归、递归、生物合理)的时间感知能力。

实验合理度:★★★★☆

心理测量曲线、二分点(BP)、韦伯分数(WF)、首次烤箱检查(FOC)、峰值间隔计时、标量属性(均值准确性、方差标量属性、变异系数CV)、准确计时、多间隔存储容量、OOD泛化能力

学术研究价值:★★★★☆

构建一个基于Overcooked的简化强化学习环境,通过设计隐式时间决策任务和评估指标,系统评估不同模型架构(非递归、递归、生物合理)的时间感知能力;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(主要关注时间感知能力而非计算效率)

复现难度:★★★☆☆

https://anonymous.4open.science/r/Chronocooked-1BA6/

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:模型在多个关键指标上表现不佳,缺乏与显式时间工程模型的对比,部分指标(如峰值间隔计时)对未训练场景的评估不够公平。

主要参考文献

[1] Pednekar A, Khaluf Y, Garrido-Pérez Á, et al. Chronocooked: A Benchmark for Implicit Interval Timing in Reinforcement Learning Agents. arXiv preprint arXiv:2608.16666, 2026.
[2] Deverett B, Faulkner R, Fortunato M, et al. Interval timing in deep reinforcement learning agents. Advances in Neural Information Processing Systems, 32, 2019.
[3] Buhusi C V, Meck W H. What makes us tick? Functional and neural mechanisms of interval timing. Nature Reviews Neuroscience, 6(10): 755-765, 2005.
[4] Carroll M, Shah R, Ho M K, et al. On the utility of learning about humans for human-AI coordination. Advances in Neural Information Processing Systems, 32, 2019.
[5] Schulman J, Wolski F, Dhariwal P, et al. Proximal Policy Optimization Algorithms. arXiv preprint arXiv:1707.06347, 2017.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球