← 返回 PaperDaily
视觉与图像
加州理工最新研究:AI科学家跑完79个实验,竟然一次都没跑偏
论文标题: An AI Scientist that Doesn’t Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop 发表日期: 2026年08月 发表单位: California Institute of Technology
龙哥读论文
发布于 2026-08-14 21:50:26
阅读 7
查看原文
原论文信息如下:
龙哥导读:如果把一个AI科学家丢进“反复做实验”的循环里,它最危险的毛病是什么?不是算力不够,而是“漂移”——跑着跑着就忘记当初要验证什么,只围着当前指标打转。Karpathy提出的autoresearch范式,虽然能让AI自动改代码、跑实验、看分数,但同样会慢慢滑向“自我钻牛角尖”。加州理工(Caltech)研究团队这篇论文,想的不是怎么把分数再刷高一点,而是怎么让AI科学家“不漂移”。他们在一个四足机器人避障导航的仿真环境里,给自动科研循环装上了三个新东西:不可变实验卡片、专职子代理和一个叫kkanbu的“品味预言机”。结果相当有意思——两组对照跑下来,AI能把自己75%左右的假说证伪,还发现了人类之前漏掉的规律。今天龙哥就来聊聊这篇来自Caltech的论文。
引言:AI科学家为何会“漂移”?
先交代一下背景。所谓autoresearch,是Karpathy提出的一套自动科研范式:给定一份程序描述和评估指标,AI智能体就能不断提出代码修改,训练一小会儿,分数涨了就保留。看起来是“自我进化”,实际操作中却有一个结构性问题:它总是倾向沿着当前最优点局部打磨,而不是去验证最初想验证的假说。把这类系统长期跑下去,你得到的不一定是一本研究笔记,更像一个“刷分狂魔”的日志。
论文针对的具体场景是宇树Unitree Go1四足机器人在仿真环境中的导航策略。任务不算复杂:机器人从出生点出发,靠64线LiDAR(激光雷达)和自身状态信息走到目标点。研究者关心的是分布外(out-of-distribution,OOD)泛化——训练时障碍密度是固定的0.04个/平方米,测试时把密度往上拉,看策略能不能扛住更拥挤的环境。他们比较了四种主流范式:特权模仿学习(Privileged Imitation Learning,PIL)、离线强化学习IQL(Implicit Q-Learning,隐式Q学习)、在线强化学习PPO(Proximal Policy Optimization,近端策略优化),以及一种“PIL+路径点预测”的变体。
跑实验的这批智能体,目标是找出哪个训练时选择对密度漂移最鲁棒。可问题来了:如果整个搜索过程只认复合分数,跑得再久也只是围着当前最高分转。论文作者把这种病称为“漂移”(drift)。为了治这个病,他们不是靠prompt哄,而是从系统结构上动手。
三大支柱:实验卡片、子代理与kkanbu预言机
整个系统有11条研究流(research streams),每条流从一个“锚点”配置出发,一批接一批地做实验。每条流都有一个不可变实验卡片、一群分工明确的子代理,以及一个可以被查询的kkanbu预言机。先看三个组件的定位。
实验卡片。 这是系统的“良心开关”。每张卡片用固定JSON结构记录一次实验的三个阶段:计划阶段写下动机和预期结果,还要写清楚“什么结果算证伪”;实验阶段记录实际得分;分析阶段把发现和解释分开写。计划写完、训练开始后,预期结果不可修改——想甩锅或者改预言?系统不允许。
子代理分三拨:规划类(websearcher、brainstormer)、执行类(experiment-starter、builder、code-reviewer等)、分析类(mechanism-analyzer)。它们只干机械活,不许定方向。代码审查员在每次启动前检查改动是否越过了公平比较的红线,想“悄悄换测试集”是行不通的。
最后是kkanbu 。它不是简单的偏好列表,而是一个把研究者“品味”编码成类型化知识图谱的预言机:什么算真正的泛化、什么证据有说服力、哪种调参没意思。全系统只有四个方向决策点可以调用它,分别由websearcher、brainstormer和mechanism-analyzer在关键衔接处发起查询。kkanbu输出的每个建议都带置信度,并且必须从图谱里检索证据支撑。简单说:结构负责诚实,kkanbu负责品味。
在这个循环里要跑的范式各有个性。PIL控制先把专家策略做出来,专家拥有全局地图、用A*规划路径、用Pure Pursuit跟踪,学生网络只模仿专家的速度指令,目标函数是最小化均方误差(MSE):
PIL Trajectory换了个思路:不直接预测速度,而是让网络预测未来10个路径点(每个间隔0.5秒),再用Pure Pursuit控制器转化成速度。因为在杂乱环境里同一个观测往往对应多种合法动作(向左绕还是向右绕?),直接对速度做行为克隆(behavior cloning,BC)会把多模态动作平均成一个抖动的中间值;预测路径点则强迫网络选一条完整、一致的未来轨迹,目标函数是路径点序列上的MSE:
IQL属于离线强化学习,不依赖在线交互。第一步用expectile回归拟合价值函数Vψ,损失是
双臂消融:有预言机与无预言机的对比
为了知道kkanbu究竟有没有用,作者做了严格的双臂控制实验:同一个系统,开与不开预言机,各跑一遍。两边的实验卡片、子代理名单、11条研究流、演示数据、六密度评分规则完全一致。跑完,with-kkanbu组一共45个实验,without-kkanbu组34个实验。每组按三粒种子(3-seed)评估,给出平均数和分层bootstrap 95%置信区间。
先说结论:两边都没有漂移。代码级审计扫过22条流的所有谱系,没发现一例违反公平比较协议的行为。更有意思的是证伪率:有预言机组27个完成实验里20个被自己证伪,无预言机组27个完成实验里19个被自己证伪,都接近四分之三。无预言机组有一个实验比锚点高2.6个点,但因为卡片里预先写了“必须超过3个点才算验证”,它老老实实把结果记为证伪。这种“诚实”对惯于刷分的研究循环来说,几乎是奇迹。
再看分数。下图把两条臂的完整结果放在一起。图3上下两半分别是两个臂的密度-成功率曲线,实线粗线是每侧最强的三个训练结果,带kkanbu臂里的带点虚线是碰撞锥滤波器的不同门限取值。
从锚点曲线到结果表,都能看出“分数并没有把两个臂分开”。按这个回合自己定的验收标准,有预言机臂5条流超过锚点或参考,无预言机臂4条;换一个保守的Student-t标准,数字会变成2比3。所以结论不是“预言机让模型更强”,而是“预言机改变的是方向,不是分数”。
关键发现:表示边界、教师瓶颈与测试时滤波器
三条发现来自两条臂的完整审计轨迹,每条都能顺着实验卡片第七栏“下一步开放问题”一步步追到某个具体批次。
第一条,表示边界。 PIL Trajectory这一范式历史上是万年垫底。无预言机臂发现,重新生成带“侧移+刹车”规避动作的专家数据后,用速度头学生网络,拿下无预言机侧最佳90.96;可同样的数据灌给路径点表示,一下子崩到8.06。为什么?因为Pure Pursuit跟踪器在转弯时靠转向角前进,横向速度被硬编码成0。路径点表示天生表达不了“边退边躲”这类动作。有预言机臂则走了另一条路:重新标定跟踪器的前视距离,再加一个小训练头做横向微调,把该范式从63.39拉回78.48。两边从不同侧逼近同一条规律:速度空间可以表达规避,路径点+跟踪器结构上不能。
第二条,教师瓶颈。 无预言机臂最漂亮的实验链其实是三次证伪。第一个批次加了所谓“一致性损失”,确实让预测更抗扰动,但机制分析揭示它靠“降低LiDAR敏感度”来压方差,这是伪不变性,记为证伪;第二个批次加容量和激励,也不行,因为学生学不会老师几乎不演示的动作;第三步把矛头指向教师——检查所有约865万条演示帧,发现横向速度恒为0。于是重写专家演示,加入侧移和刹车,学生立刻涨到90.96。这条链是结构契约逼出来的:哪怕没有预言机,只要卡片逼着写机制和证伪,研究自然会钻到瓶颈深处。
第三条,测试时滤波器。 有预言机臂最抢镜的作品是一种“碰撞锥速度滤波器”。kkanbu没有让它去堆网络,而是把实验设计成一个对照:一个“覆盖率vs不变性”的A/B测试,控制组自然成为该臂的联合冠军。下一轮它直接让AI去改测试时策略——在冻结的学生网络后面,根据LiDAR和当前速度指令画一个碰撞锥,把危险速度向量滤掉,再给一个减速上限。打开这个滤波器,同一个模型复合分从87.54变到92.43。因为滤波器不吃训练,它可以直接部署到板载推理。论文也留了一个难堪但坦率的注脚:滤波器门限值是五个候选里挑的,最优选择偏差没有被置信区间覆盖。
预言机的可测量贡献:方向而非分数
所以预言机的贡献到底是什么?论文给出了三个可验证的现象。第一,测试时自适应这条轴自始至终只有有预言机臂碰过;无预言机臂没有任何实验涉及。第二,在kkanbu臂领先的设计中,有相当一部分是预言机直接写的,比如碰撞锥滤波器,它在计划阶段几乎一字不变地被转录到实验卡片里。第三,kkanbu有跨流记忆:某些无预言机臂需要七条流反复踩坑才得到的教师诊断,kkanbu臂早早就换方向了。可它并没有提高获胜分数——两支臂的最强训练结果,无预言机反而更高。
把话说透:实验卡片和子代理是刹车和护栏,kkanbu才是方向盘。结构让系统保持诚实,kkanbu决定系统看向哪里。
局限与展望:AI科学家的未来
论文也承认不少边界。所有实验在仿真中完成,作者明确不宣称sim-to-real;障碍密度是唯一的分布位移轴,其他因素如障碍形状、房间大小只做了预实验;双臂分析时两侧由不同研究者操作、使用不同计算队列,所以实验数量差异(45比34)是环境变量,不是预言机效应。另外,锚点基线不全是多seed,单seed的锚点给所有delta都带上了不确定性。
展望上,可以朝三个方向走。一是把kkanbu从单一图谱扩展成多个有不同偏好的预言机,让它们互相辩论;二是把品味图谱的构建从人工访谈变成自动从实验日志中学习;三是把整个框架挪到真实机器人或更贴近应用的决策任务上,让AI科学家不仅会做消融实验,还能产出真正能部署的知识。
龙迷三问
这篇论文到底在解决什么问题? 加州理工提出不会“漂移”的AI科学家:
这篇工作最值得看的点是什么? 论文通过双臂消融实验(有/无kkanbu)验证了系统架构的有效性:两臂均能防止研究漂移,约四分之三的假设被证伪;无kkanbu臂产生了最佳训练策略(90.96±1.52),有kkanbu臂探索了测试时适应并产生最高绝对结果(92.43±0.69)。
这篇工作的边界或风险在哪里? 优点:1) 提出了将结构诚实与研究方向分离的AI科学家架构,解决了自主研究循环的漂移问题;2) 通过受控双臂消融实验严格评估了品味预言机的作用;3) 实验卡片机制确保了研究的可追溯性和可证伪性。缺点:1) 仅在一个领域(四足导航)的仿真环境中验证;2) 手臂与操作者完全混淆,无法分离操作者技能与预言机效果;3) 脚手架本身已编码核心品味,无法测量预言机对非结构化循环的贡献。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出一种将结构诚实(不可变实验卡片、内容中立子代理)与研究方向(可查询的品味知识图谱kkanbu)分离的AI科学家架构,通过双臂消融实验验证该架构能防止研究漂移并引导探索方向。
实验合理度: ★★★☆☆
现有材料未完整覆盖数据划分、基线公平性和统计显著性,因此按中性评价处理。
学术研究价值: ★★★★☆
提出一种将结构诚实(不可变实验卡片、内容中立子代理)与研究方向(可查询的品味知识图谱kkanbu)分离的AI科学家架构,通过双臂消融实验验证该架构能防止研究漂移并引导探索方向;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: ;2) 通过受控双臂消融实验严格评估了品味预言机的作用;3) 实验卡片机制确保了研究的可追溯性和可证伪性。缺点:1) 仅在一个领域(四足导航)的仿真环境中验证;2) 手臂与操作者完全混淆,无法分离操作者技能与预言机效果;
主要参考文献
[1] Yiwen Zhang, Eloise Zeng, Jaeha Lee, Tony Yue Yu. An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop. arXiv:2608.07542v1, 2026.
[2] Andrej Karpathy. Autoresearch. 2026.
[3] Chris Lu, et al. The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery. 2024.
[4] Ilya Kostrikov, Ashvin Nair, Sergey Levine. Offline Reinforcement Learning with Implicit Q-Learning. ICLR 2022.
[5] John Schulman, et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017.
[6] R. Craig Coulter. Implementation of the Pure Pursuit Path Tracking Algorithm. 1992.
[7] Emanuel Todorov, Tom Erez, Yuval Tassa. MuJoCo: A physics engine for model-based control. IROS 2012.
[8] Joonho Lee, et al. Learning quadrupedal locomotion over challenging terrain. Science Robotics, 2020.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!