← 返回 PaperDaily 视觉与图像

加州理工最新研究:AI科学家跑完79个实验,竟然一次都没跑偏

论文标题: An AI Scientist that Doesn’t Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop 发表日期: 2026年08月 发表单位: California Institute of Technology

加州理工最新研究:AI科学家跑完79个实验,竟然一次都没跑偏
原论文信息如下:
论文标题:
An AI Scientist that Doesn’t Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop
发表日期:
2026年08月
发表单位:
California Institute of Technology
原文链接:
https://arxiv.org/pdf/2608.07542v1.pdf

龙哥导读:如果把一个AI科学家丢进“反复做实验”的循环里,它最危险的毛病是什么?不是算力不够,而是“漂移”——跑着跑着就忘记当初要验证什么,只围着当前指标打转。Karpathy提出的autoresearch范式,虽然能让AI自动改代码、跑实验、看分数,但同样会慢慢滑向“自我钻牛角尖”。加州理工(Caltech)研究团队这篇论文,想的不是怎么把分数再刷高一点,而是怎么让AI科学家“不漂移”。他们在一个四足机器人避障导航的仿真环境里,给自动科研循环装上了三个新东西:不可变实验卡片、专职子代理和一个叫kkanbu的“品味预言机”。结果相当有意思——两组对照跑下来,AI能把自己75%左右的假说证伪,还发现了人类之前漏掉的规律。今天龙哥就来聊聊这篇来自Caltech的论文。
图2
图2:AI科学家循环中的一个研究流批次。kkanbu(蓝色)是唯一被允许做主观判断的组件,在四个标注的决策点被咨询;绿色为规划代理,橙色为执行代理,紫色为分析代理。

引言:AI科学家为何会“漂移”?

先交代一下背景。所谓autoresearch,是Karpathy提出的一套自动科研范式:给定一份程序描述和评估指标,AI智能体就能不断提出代码修改,训练一小会儿,分数涨了就保留。看起来是“自我进化”,实际操作中却有一个结构性问题:它总是倾向沿着当前最优点局部打磨,而不是去验证最初想验证的假说。把这类系统长期跑下去,你得到的不一定是一本研究笔记,更像一个“刷分狂魔”的日志。
论文针对的具体场景是宇树Unitree Go1四足机器人在仿真环境中的导航策略。任务不算复杂:机器人从出生点出发,靠64线LiDAR(激光雷达)和自身状态信息走到目标点。研究者关心的是分布外(out-of-distribution,OOD)泛化——训练时障碍密度是固定的0.04个/平方米,测试时把密度往上拉,看策略能不能扛住更拥挤的环境。他们比较了四种主流范式:特权模仿学习(Privileged Imitation Learning,PIL)、离线强化学习IQL(Implicit Q-Learning,隐式Q学习)、在线强化学习PPO(Proximal Policy Optimization,近端策略优化),以及一种“PIL+路径点预测”的变体。
跑实验的这批智能体,目标是找出哪个训练时选择对密度漂移最鲁棒。可问题来了:如果整个搜索过程只认复合分数,跑得再久也只是围着当前最高分转。论文作者把这种病称为“漂移”(drift)。为了治这个病,他们不是靠prompt哄,而是从系统结构上动手。

三大支柱:实验卡片、子代理与kkanbu预言机

整个系统有11条研究流(research streams),每条流从一个“锚点”配置出发,一批接一批地做实验。每条流都有一个不可变实验卡片、一群分工明确的子代理,以及一个可以被查询的kkanbu预言机。先看三个组件的定位。

实验卡片。这是系统的“良心开关”。每张卡片用固定JSON结构记录一次实验的三个阶段:计划阶段写下动机和预期结果,还要写清楚“什么结果算证伪”;实验阶段记录实际得分;分析阶段把发现和解释分开写。计划写完、训练开始后,预期结果不可修改——想甩锅或者改预言?系统不允许。

子代理分三拨:规划类(websearcher、brainstormer)、执行类(experiment-starter、builder、code-reviewer等)、分析类(mechanism-analyzer)。它们只干机械活,不许定方向。代码审查员在每次启动前检查改动是否越过了公平比较的红线,想“悄悄换测试集”是行不通的。
最后是kkanbu。它不是简单的偏好列表,而是一个把研究者“品味”编码成类型化知识图谱的预言机:什么算真正的泛化、什么证据有说服力、哪种调参没意思。全系统只有四个方向决策点可以调用它,分别由websearcher、brainstormer和mechanism-analyzer在关键衔接处发起查询。kkanbu输出的每个建议都带置信度,并且必须从图谱里检索证据支撑。简单说:结构负责诚实,kkanbu负责品味。
在这个循环里要跑的范式各有个性。PIL控制先把专家策略做出来,专家拥有全局地图、用A*规划路径、用Pure Pursuit跟踪,学生网络只模仿专家的速度指令,目标函数是最小化均方误差(MSE):
PIL损失函数
这里πθ(o)是学生网络对观测o输出的速度指令,a*是专家动作,D是包含约10的7次方条专家转移的演示数据集。这个范式问题也明显:专家会什么学生才能会什么,教师不会的动作,学生学不来。
PIL Trajectory换了个思路:不直接预测速度,而是让网络预测未来10个路径点(每个间隔0.5秒),再用Pure Pursuit控制器转化成速度。因为在杂乱环境里同一个观测往往对应多种合法动作(向左绕还是向右绕?),直接对速度做行为克隆(behavior cloning,BC)会把多模态动作平均成一个抖动的中间值;预测路径点则强迫网络选一条完整、一致的未来轨迹,目标函数是路径点序列上的MSE:
路径点预测损失函数
fθ(o)是网络预测的路径点序列,τ*是专家给出的金标准路径。网络还要把64条LiDAR光束当token做self-attention,提取一个可解释的注意力权重,用来决定稀疏森林里该看哪几束光。
IQL属于离线强化学习,不依赖在线交互。第一步用expectile回归拟合价值函数Vψ,损失是
IQL值函数损失
其中expectile损失Lτ²(u)的定义为
Expectile损失
策略提取用优势加权回归,给高优势的动作加指数权重:
策略提取损失
β=3、c=5,这些是MuJoCo上的常用默认值。PPO则是在线RL的代表,论文还做了带特权评论家的变体:训练时让评论家看一眼A*规划好的最短路径,策略网络依然只用机载观测,初始奖励由稀疏到达奖励、距离缩减的稠密奖励和靠近路径点的奖励组成。
PPO奖励函数
其中的稠密距离奖励和路径奖励分别写为
稠密距离奖励 路径奖励
这里的d(s)是当前状态到目标的距离,d_waypoint是到下一个路径点的距离。后续autoresearch迭代又陆续加了倒退速度惩罚、碰撞时间惩罚和卡住检测惩罚。

双臂消融:有预言机与无预言机的对比

为了知道kkanbu究竟有没有用,作者做了严格的双臂控制实验:同一个系统,开与不开预言机,各跑一遍。两边的实验卡片、子代理名单、11条研究流、演示数据、六密度评分规则完全一致。跑完,with-kkanbu组一共45个实验,without-kkanbu组34个实验。每组按三粒种子(3-seed)评估,给出平均数和分层bootstrap 95%置信区间。
图1
图1:不同范式锚点在障碍物密度变化下的表现曲线。每条曲线代表该研究流的锚点,也就是人类事先调好的基线配置,之后该流的每一次实验都以它为参照对象。图例中给出了每个锚点的OOD加权复合分,训练密度0.04用虚线标出,右侧阴影区域是分布外(OOD)区域。
先说结论:两边都没有漂移。代码级审计扫过22条流的所有谱系,没发现一例违反公平比较协议的行为。更有意思的是证伪率:有预言机组27个完成实验里20个被自己证伪,无预言机组27个完成实验里19个被自己证伪,都接近四分之三。无预言机组有一个实验比锚点高2.6个点,但因为卡片里预先写了“必须超过3个点才算验证”,它老老实实把结果记为证伪。这种“诚实”对惯于刷分的研究循环来说,几乎是奇迹。
再看分数。下图把两条臂的完整结果放在一起。图3上下两半分别是两个臂的密度-成功率曲线,实线粗线是每侧最强的三个训练结果,带kkanbu臂里的带点虚线是碰撞锥滤波器的不同门限取值。
图3
图3:按消融臂划分的密度-成功率对比。浅色线是全部完成三粒种子评估的配置,粗线是各臂三个最强的训练结果;带kkanbu臂中的点划线是碰撞锥滤波器(推理时技术,不训练权重),粗点划线是报告的操作点。训练密度0.04用虚线标出,右侧阴影区域是OOD区域。
表1
表1:每条消融臂的领先已验证结果。所有条目都是三粒种子(均值±分层bootstrap 95%半宽);每个Δ都是和该行自己的参考配置相比,不同行之间不直接可比。带†的碰撞锥条目是在冻结权重上的推理时结果,操作点是五个门限值里挑出来的最优值,论文明确标注其置信区间没有覆盖这种选择偏差。
从锚点曲线到结果表,都能看出“分数并没有把两个臂分开”。按这个回合自己定的验收标准,有预言机臂5条流超过锚点或参考,无预言机臂4条;换一个保守的Student-t标准,数字会变成2比3。所以结论不是“预言机让模型更强”,而是“预言机改变的是方向,不是分数”。

关键发现:表示边界、教师瓶颈与测试时滤波器

三条发现来自两条臂的完整审计轨迹,每条都能顺着实验卡片第七栏“下一步开放问题”一步步追到某个具体批次。

第一条,表示边界。PIL Trajectory这一范式历史上是万年垫底。无预言机臂发现,重新生成带“侧移+刹车”规避动作的专家数据后,用速度头学生网络,拿下无预言机侧最佳90.96;可同样的数据灌给路径点表示,一下子崩到8.06。为什么?因为Pure Pursuit跟踪器在转弯时靠转向角前进,横向速度被硬编码成0。路径点表示天生表达不了“边退边躲”这类动作。有预言机臂则走了另一条路:重新标定跟踪器的前视距离,再加一个小训练头做横向微调,把该范式从63.39拉回78.48。两边从不同侧逼近同一条规律:速度空间可以表达规避,路径点+跟踪器结构上不能。

第二条,教师瓶颈。无预言机臂最漂亮的实验链其实是三次证伪。第一个批次加了所谓“一致性损失”,确实让预测更抗扰动,但机制分析揭示它靠“降低LiDAR敏感度”来压方差,这是伪不变性,记为证伪;第二个批次加容量和激励,也不行,因为学生学不会老师几乎不演示的动作;第三步把矛头指向教师——检查所有约865万条演示帧,发现横向速度恒为0。于是重写专家演示,加入侧移和刹车,学生立刻涨到90.96。这条链是结构契约逼出来的:哪怕没有预言机,只要卡片逼着写机制和证伪,研究自然会钻到瓶颈深处。

第三条,测试时滤波器。有预言机臂最抢镜的作品是一种“碰撞锥速度滤波器”。kkanbu没有让它去堆网络,而是把实验设计成一个对照:一个“覆盖率vs不变性”的A/B测试,控制组自然成为该臂的联合冠军。下一轮它直接让AI去改测试时策略——在冻结的学生网络后面,根据LiDAR和当前速度指令画一个碰撞锥,把危险速度向量滤掉,再给一个减速上限。打开这个滤波器,同一个模型复合分从87.54变到92.43。因为滤波器不吃训练,它可以直接部署到板载推理。论文也留了一个难堪但坦率的注脚:滤波器门限值是五个候选里挑的,最优选择偏差没有被置信区间覆盖。

预言机的可测量贡献:方向而非分数

所以预言机的贡献到底是什么?论文给出了三个可验证的现象。第一,测试时自适应这条轴自始至终只有有预言机臂碰过;无预言机臂没有任何实验涉及。第二,在kkanbu臂领先的设计中,有相当一部分是预言机直接写的,比如碰撞锥滤波器,它在计划阶段几乎一字不变地被转录到实验卡片里。第三,kkanbu有跨流记忆:某些无预言机臂需要七条流反复踩坑才得到的教师诊断,kkanbu臂早早就换方向了。可它并没有提高获胜分数——两支臂的最强训练结果,无预言机反而更高。
表8
表8:带kkanbu臂的全部三粒种子完整实验列表,按流按批次罗列了每个实验的设计、复合分和判定结果。
表9
表9:不带kkanbu臂的全部三粒种子完整实验列表。两张表放在一起,整个审计轨迹一目了然。
把话说透:实验卡片和子代理是刹车和护栏,kkanbu才是方向盘。结构让系统保持诚实,kkanbu决定系统看向哪里。
speechless

局限与展望:AI科学家的未来

论文也承认不少边界。所有实验在仿真中完成,作者明确不宣称sim-to-real;障碍密度是唯一的分布位移轴,其他因素如障碍形状、房间大小只做了预实验;双臂分析时两侧由不同研究者操作、使用不同计算队列,所以实验数量差异(45比34)是环境变量,不是预言机效应。另外,锚点基线不全是多seed,单seed的锚点给所有delta都带上了不确定性。
展望上,可以朝三个方向走。一是把kkanbu从单一图谱扩展成多个有不同偏好的预言机,让它们互相辩论;二是把品味图谱的构建从人工访谈变成自动从实验日志中学习;三是把整个框架挪到真实机器人或更贴近应用的决策任务上,让AI科学家不仅会做消融实验,还能产出真正能部署的知识。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?加州理工提出不会“漂移”的AI科学家:
这篇工作最值得看的点是什么?论文通过双臂消融实验(有/无kkanbu)验证了系统架构的有效性:两臂均能防止研究漂移,约四分之三的假设被证伪;无kkanbu臂产生了最佳训练策略(90.96±1.52),有kkanbu臂探索了测试时适应并产生最高绝对结果(92.43±0.69)。
这篇工作的边界或风险在哪里?优点:1) 提出了将结构诚实与研究方向分离的AI科学家架构,解决了自主研究循环的漂移问题;2) 通过受控双臂消融实验严格评估了品味预言机的作用;3) 实验卡片机制确保了研究的可追溯性和可证伪性。缺点:1) 仅在一个领域(四足导航)的仿真环境中验证;2) 手臂与操作者完全混淆,无法分离操作者技能与预言机效果;3) 脚手架本身已编码核心品味,无法测量预言机对非结构化循环的贡献。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种将结构诚实(不可变实验卡片、内容中立子代理)与研究方向(可查询的品味知识图谱kkanbu)分离的AI科学家架构,通过双臂消融实验验证该架构能防止研究漂移并引导探索方向。

实验合理度:★★★☆☆

现有材料未完整覆盖数据划分、基线公平性和统计显著性,因此按中性评价处理。

学术研究价值:★★★★☆

提出一种将结构诚实(不可变实验卡片、内容中立子代理)与研究方向(可查询的品味知识图谱kkanbu)分离的AI科学家架构,通过双臂消融实验验证该架构能防止研究漂移并引导探索方向;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;2) 通过受控双臂消融实验严格评估了品味预言机的作用;3) 实验卡片机制确保了研究的可追溯性和可证伪性。缺点:1) 仅在一个领域(四足导航)的仿真环境中验证;2) 手臂与操作者完全混淆,无法分离操作者技能与预言机效果;

主要参考文献

[1] Yiwen Zhang, Eloise Zeng, Jaeha Lee, Tony Yue Yu. An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop. arXiv:2608.07542v1, 2026.
[2] Andrej Karpathy. Autoresearch. 2026.
[3] Chris Lu, et al. The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery. 2024.
[4] Ilya Kostrikov, Ashvin Nair, Sergey Levine. Offline Reinforcement Learning with Implicit Q-Learning. ICLR 2022.
[5] John Schulman, et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017.
[6] R. Craig Coulter. Implementation of the Pure Pursuit Path Tracking Algorithm. 1992.
[7] Emanuel Todorov, Tom Erez, Yuval Tassa. MuJoCo: A physics engine for model-based control. IROS 2012.
[8] Joonho Lee, et al. Learning quadrupedal locomotion over challenging terrain. Science Robotics, 2020.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球