← 返回 PaperDaily 大模型与智能体

Meta FAIR新作:AI科研智能体装上"预算管家",2/3算力追平24小时成绩

AI科研智能体缺的不是想法,而是算力。本文提出研究偏好模型(RPM),相当于给智能体装了个“预算管家”:在花GPU之前,先让LLM当评委挑选最有潜力的候选方案。AIRS-Bench上,用不到三分之二的算力就能追上无引导基线24小时的成绩,思路清晰,落地性强。

Meta FAIR新作:AI科研智能体装上"预算管家",2/3算力追平24小时成绩

paperdaily_reaction_gif


原论文信息如下:
论文标题:
AI Research Preference Models
发表日期:
2026年08月

发表单位:
Meta FAIR(Meta基础人工智能研究团队)、牛津大学、伦敦大学学院

原文链接:
https://arxiv.org/pdf/2608.13940v1.pdf

写个方案5分钟,跑个实验5小时,运气差一点直接烧掉一天的GPU——这就是当下AI科研智能体(AI Research Agent)的真实日常。这些智能体确实能自己提出想法、写代码、做实验了,但真正卡住它们的不是“能不能想出新点子”,而是“GPU先跑哪个”。
Meta FAIR最近放出一篇很有意思的工作,方向和思路都相当“务实”:与其让智能体把每个候选方案都跑一遍再回头看,不如先找个“评委”在动手之前预测一下哪个方案最值得跑。这个“评委”就是论文里提出的研究偏好模型(RPM)。
这玩意的效果还挺猛:原本无引导的AIRA-dojo智能体在AIRS-Bench上平均归一化得分是0.684,配上推理型RPM直接涨到0.711,配上能跑试点实验的代理型RPM更是冲到0.729,距离只执行所有候选方案的“验证神谕上限

龙哥导读:AI科研的算力瓶颈与智能分配

先把话说透:这篇论文解决的痛点,一句话就能概括——AI科研智能体(AIRA)不缺创意,缺的是把创意变成实验结果的算力。
可以这样理解现在的局面:一个AI科研智能体,让它提出一个候选方案、写一段训练代码,可能只需要几分钟;但把这套代码真正跑起来,训练一个模型、测一下效果,动辄就是几小时到几天的GPU时间。这就产生了一个极其不对称的剪刀差——智能体生成候选的速度远远快于它执行候选的速度,短时间内它能提出一百个想法,但算力只够它跑两三个实验。
这就引出一个非常关键的问题:在有限的算力预算下,先跑哪个?后跑哪个?哪些方向值得投入,哪些要及时止损?论文把这个决策问题称为"研究偏好"(Research Preference),并专门为此训练了一个偏好模型来当"算力管家"。
这篇来自Meta FAIR、牛津大学和伦敦大学学院联合团队的工作,牛就牛在它把"选择执行哪个实验"这件事本身变成了一门学问:搞出了两个版本的偏好模型,一个只靠推理筛选(零成本),一个会先跑小型试点实验再决定(低成本高回报)。在AIRS-Bench这个专门评估AI科研智能体的基准上,得分从0.684提升到了0.711甚至0.729,还顺带刷新了两个任务的最优成绩。这活儿干得挺漂亮的。

研究偏好模型:让AI学会"选择"而非"猜测"

先掰扯一下研究偏好模型(Research Preference Model,RPM)到底在干嘛。要理解它,得先明白为什么"直接预测绝对效果"这条路走不通。
论文在前期实验里发现了一个很实在的现象:让语言模型预测"这个方案跑完大概能得多少分",预测结果非常不可靠,误差大得没法用;但如果让语言模型做选择题——"这两个方案,哪个更值得跑?"——它的判断就靠谱多了。这个现象其实不难理解:绝对数值预测要求模型对未知实验的分数有精确校准,而相对排序只需要"感觉上哪个更有戏",这更接近语言模型在训练中积累的直觉判断。
所以RPM的核心思路就很清晰了:把"算力分配"问题转化为"候选方案排序"问题,用语言模型的相对判断能力,在真正消耗GPU之前筛选出最值得执行的方案。
打个比方,RPM就像剧组里的选角导演——剧本(候选方案)堆了一桌子,预算只够拍一部戏,导演得靠经验判断哪个演员(方案)最有票房潜力,而不是把所有人的试镜片段都拍完再选。当然,选角导演偶尔也会看走眼,但总比把每部戏都拍出来再看的成本低得多,对吧?
论文的评估载体是AIRS-Bench,一个专门为AI科研智能体设计的基准测试。它包含20个从顶级论文中提炼的机器学习研究任务,覆盖语言建模、数学、生物信息学、时间序列预测等多个领域。每个任务给智能体一个训练数据集、一组测试输入,以及24小时的单张H200 GPU访问权限。智能体要写代码训练模型,然后输出一份预测文件submission.csv。最终的测试分数对智能体是隐藏的,它只能靠验证集分数来引导自己的搜索方向。
为了把不同任务的分数放在同一把尺子上比较,AIRS-Bench定义了一个归一化得分公式:
归一化得分公式
这个公式可以理解为:智能体a在任务t上的归一化得分NS,等于它的实际分数与所有智能体中最低分之间的距离,除以公开SOTA(State-of-the-Art,即当前最优方法)与最低分之间的距离。归一化得分NS=0代表最低基线水平,NS=1代表追平公开SOTA。中间还夹了一个非线性对数变换函数φ,作用是放大接近最优边界时的微小进步——因为在最优解附近,想再提升一个百分点往往比从零开始难得多。
有了这把尺子,就能清楚地量化RPM带来的提升:无引导的AIRA-dojo基线(即每次随机选一个候选方案执行)平均归一化得分是0.684,装上推理型RPM后涨到0.711,装上代理型RPM后进一步涨到0.729,而理论上的"验证神谕上限"是0.748——差距已经很小了。
既然RPM这么有用,那它的工作机制到底是怎样的?

推理型与代理型RPM:轻量筛选与试点实验的权衡

RPM是作为AIRA-dojo这个搜索框架的一个增强模块来设计的。AIRA-dojo本身是一个进化树搜索框架(Evolutionary Tree-Search Scaffold),它的工作流程可以概括为:从已有的搜索树里选一个得分最高的节点作为父节点,然后对父节点进行变异操作生成子节点,再执行子节点并打分,依次迭代。默认情况下,每步只生成一个子节点,生成了就直接执行,不做任何筛选。
RPM的介入方式很聪明:把"一步生成一个候选"改成"一步并行生成15个候选,然后让RPM从15个里挑出最值得执行的那个"。多生成的候选不花GPU时间去执行,RPM的选择只消耗语言模型的推理计算,成本几乎可以忽略不计。这样既扩大了搜索覆盖面,又不增加执行开销,相当于用廉价的推理换昂贵的GPU时间。
图1:RPM增强的AI科研智能体子节点生成流程概览
图1:RPM增强的AI科研智能体子节点生成流程概览。搜索树中的每个节点代表一个方案,标注有评估分数。智能体先选择有潜力的父节点,然后并行生成一批候选子节点,RPM利用历史执行方案的完整上下文选出最有希望的一个,最后只对选中的候选执行打分并扩展搜索树。实验中每步生成N=15个候选,RPM通过两两比较的淘汰赛制选出一个执行。
论文设计了两个版本的RPM,对应不同的"思考深度"和计算开销:
推理型RPM(Inference-only RPM):这是最轻量级的选择。它直接用一个冻结权重的预训练语言模型(论文用的是Qwen3.6-27B),对候选方案的计划、代码和之前跑过的解决方案进行推理分析,然后用淘汰赛制逐个两两比较,选出胜者。整个过程中不执行任何代码,纯粹靠模型的"直觉"做判断。论文还专门用DSPy框架里的MIPROv2方法做了提示词优化,让模型学会更结构化地分析每个方案,并且对小的、可修复的问题保持容忍——毕竟一个方案如果只是有点小bug,修一修可能还是有价值的。
代理型RPM(Agentic RPM):这是推理型的"高配版",核心思想是模仿人类研究员的习惯——在大规模实验之前,先跑个小规模试点实验验证一下想法是否靠谱。具体来说,代理型RPM里有一个试点实验Agent,它在和主智能体完全相同的沙箱环境里运行,有python、bash和submit_solution三个工具。它可以写一小段代码快速验证某个想法的可行性(比如在数据的子集上跑几个epoch),把实验结果总结提交,最后再由一个语言模型综合这些试点实验发现,对候选方案做出最终判断。
这个试点实验机制还有个很有意思的小插曲:论文发现试点实验Agent在分配时间时过于保守,第一次调用submit_solution时往往还剩下大量没用完的时间预算。就算提示它继续跑更多实验,后续实验也往往局限于对之前实验做超参数微调,信息量不大。为了解决这个问题,论文用了两个"小心机":一是在提示词里把剩余时间预算虚报成实际值的数倍,鼓励Agent不要过早收手;二是在每次submit_solution之后,引入一个独立的反馈模型来审查当前已有的实验发现,要么提出一个最有信息量的下一步实验,要么判定证据已足够、结束循环。这两个机制共同保证了试点实验的质量和效率。
两种RPM的权衡关系也很清晰:推理型零额外成本,每步决策只花几秒钟的推理时间,但判断力有限;代理型每步要花5分钟左右跑试点实验(论文把试点实验的时间预算设在5分钟),前期进度看起来会慢一些,但每一步的决策质量更高,长期来看反而能后来居上。

实验结果:性能提升与计算效率的双重突破

实验设计这块,论文做得相当扎实。端到端评估在AIRS-Bench的20个公开文本与表格任务上进行,每个任务给24小时的单张H200 GPU,重复10个不同随机种子。为了公平起见,生成候选的AIRA-dojo操作符和RPM用同一个Qwen3.6-27B作为底座模型,这样所有性能差异都来自框架本身,而不是更强的筛选模型。
图2:RPM增强的AIRA-dojo评估结果
图2:RPM增强的AIRA-dojo在AIRS-Bench上的评估结果。左图为平均归一化得分随时间的变化曲线,右图为最终性能对比。虚线表示无RPM基线和即时验证/测试神谕上限。推理型RPM(蓝色)在基线上保持稳定增益;代理型RPM(紫色)早期因每步试点实验的开销而上升缓慢,但后来居上,超过其他方法。
图2左边那张时间曲线很有意思,可以看出两种RPM的"性格差异":推理型RPM(蓝线)从头到尾都压在基线(橙线)上面,稳定输出不折腾;代理型RPM(紫线)早期明显偏慢,因为每跑一步都要先花几分钟做试点实验,但熬过前期之后,它开始发力并最终反超。这种"先慢后快"的曲线,和人类做研究时"磨刀不误砍柴工"的感觉还真有点像。
最终数字是实打实的:无RPM基线平均归一化得分0.684,推理型RPM达到0.711,代理型RPM达到0.729,逼近验证神谕上限的0.748。论文还做了统计显著性检验,用的是任务分层自助采样法(task-stratified bootstrap),结果是推理型和代理型RPM相比基线的提升概率分别为0.5923和0.5913,95%置信区间下限分别是0.5066和0.5018,严格排除了0.5的随机水平——也就是说,这个提升不是靠运气搅出来的。
除了平均分,RPM还实打实地刷新了两个任务的最优成绩。在WinoGrande任务上,配了代理型RPM的AIRA-dojo跑出94.1%的准确率,轻松超过之前由Lupidi等人保持的88.1% SOTA。有意思的是,智能体自己摸索出来的方案是"用打乱标签顺序的数据做LoRA微调,推理时对原始标签顺序和打乱标签顺序的预测logits取平均"——这一手消除位置偏置的招法,一般的研究员还真不容易想到。在SVAMP任务上,推理型RPM也带领智能体跑到95.7%的准确率,刷新了之前94.2%的SOTA。这里的策略是设计few-shot提示词,让模型从干扰性上下文里干净地分离出数值信息,再采样10条推理路径做多数投票。
效率层面的提升同样重要。无引导基线需要整整24小时才能达到0.684的最终得分,推理型RPM只用了14.88小时就追平了这个分数(1.61倍加速),代理型RPM用了15.50小时(1.55倍加速)。这意味着在同样的24小时算力预算下,RPM指导的智能体能多出大约9小时去做进一步的探索,或者直接省下三分之一的算力成本。
图11:选择优势与最终归一化得分的关系
图11:选择优势与最终归一化得分的关系。最终归一化得分与逐步选择优势呈强正相关(Pearson r=0.55,p=0.0007;Spearman ρ=0.56,p=0.0004)。代理型RPM在选样质量上和最终分数上都优于推理型RPM和随机选择。
这里有个关键指标叫"选择优势"(Selection Advantage),衡量的是选中的候选得分与整批候选平均得分之间的差距。随机选择的选择优势期望为0,推理型RPM显著为正,代理型RPM最高。图11清楚地展示了选择优势与最终归一化得分之间的强正相关关系——选择越准,最终成绩越好。这个相关性的存在说明,RPM带来的提升不是偶然的,而是直接源自更准确的候选筛选。

深入分析:RPM的扩展规律与决策机制

端到端评估虽然效果显著,但跑一次要200张H200 GPU跑24小时,成本太高了,没法用来做快速迭代。所以论文还在线下搭了一套轻量级评估框架:从之前AIRA-dojo在另40个未公开的多模态任务(图像、视频、音频)上的运行记录里,提取了1000对兄弟节点(同一父节点生成的两个候选),每个节点附带方案、代码和搜索树历史。以"子树中最高测试分数"为标签,评估RPM选对的概率。随机选择就是50%的准确率基线。
线下评估主要揭示了三个扩展规律:
图3:推理型RPM的扩展性质离线评估
图3:推理型RPM扩展性质的离线评估(使用GPT-5)。左图为增加搜索树上下文信息带来的预测准确率提升;中图为增加推理预算带来的选择性能提升;右图为扩大候选池带来的效果——理论神谕上限和RPM的实际选择性能都有系统性提升。
第一,上下文越多越好。给RPM提供更多历史搜索树节点和验证分数,它的选样准确率稳步上升。这一点很符合直觉——RPM看到的"前车之鉴"越多,越能判断哪个方向值得继续投入。
第二,候选池越大越好。每步生成的候选数量N从2扩到15,RPM的选择优势持续提升。这个结论直接指导了端到端实验里的配置选择——每步生成15个候选。
第三,推理预算越高越准。让语言模型多思考一会儿(更多的推理token预算),选样准确率也会相应提高。这其实也是当前"推理时扩展"(inference-time scaling)大趋势的一个有意思的佐证——给模型更多思考时间,判断质量确实更好。
论文还试着用不同的大模型组合来提升选样准确率。单独使用GPT-5、Claude Opus 4.8、Gemini 3.1 Pro时,准确率在64.66%到67.44%之间。简单多数投票能提升到68.04%,而用一个LLM仲裁器来综合三个模型的推理痕迹,能进一步提升到69.35%——多模型集成的效果确实存在,虽然提升幅度不算巨大。
表2:前端模型在排名评估上的基线结果
表2:前端模型在排名评估上的基线结果。准确率是正确选择的比例。可以看到GPT-5单独成绩最好,但LLM仲裁器集成能进一步压榨出提升空间。
代理型RPM的行为分析也相当有趣。论文记录了试点实验Agent在5分钟和30分钟两种时间预算下的策略选择,结果发现两者的策略出奇地一致:
图4:代理型RPM采用的策略分析
图4:代理型RPM使用的策略。代理型RPM经常运行原始候选的简化版本。左图为两个Agent都倾向于只跑一个交叉验证分割来节省时间;中图为两者都经常对训练数据进行子采样;右图为两者都会采用相似的训练调整,比如去掉集成、减少轮数和降低批大小。
简单说,Agent在跑试点实验时很有"人味儿":只跑一个交叉验证分割而不是完整的k折验证、对训练数据做子采样、去掉集成、减少轮数、降低批大小——这就是人类研究员在快速验证想法时常用的"降配"策略。不过,图5也揭示了一些细节问题:更多分割数量并不一定带来更好的判断性能;使用全量数据比子采样有明显优势;大部分训练调整对至少一个Agent有帮助,但有例外——移除学习率调度器和简化数据增强反而会降低效果。
图5:代理型RPM的策略对性能的影响
图5:代理型RPM的策略对性能的影响。整体上,增大时间预算能带来更高性能,但边际回报递减。5分钟和30分钟Agent虽然策略相似,但策略对性能的具体影响差异很大。更多分割对两者都没有帮助;使用全量数据优于子采样数据;大部分训练调整对至少一个Agent有帮助,但移除学习率调度器和简化数据增强是例外。
最后,论文还对RPM的推理痕迹做了归因分析。他们发现,在判断理由中引用了先前执行证据、实现正确性或预训练底座模型信息的推理痕迹,选样准确率更高;而只引用模型架构的描述反而会降低准确率。另外,引用的历史上下文节点数值越多,选样准确率越高。这个发现对实践有个重要的指导意义:在设计RPM的提示词时,应该引导模型多引用具体的、可核验的历史证据,而不是泛泛而谈。

局限与展望:从AIRS-Bench到更广泛的AI科研

论文的贡献是实打实的,但该泼的冷水也得泼。几个明显的局限值得注意。
第一,端到端评估只覆盖了AIRS-Bench的文本和表格模态任务,图像、视频、音频等模态只在离线评估中出现。虽然离线评估的结果和端到端结果趋势一致,但多模态任务中RPM的实际表现还没被在线验证过。
第二,论文只在AIRA-dojo这一个搜索框架上验证了RPM的通用性。虽然RPM的设计是框架无关的,但"框架无关"和"已经验证框架无关"是两码事。未来如果能在MLGym、AIRA2等其他框架里也看到RPM的身影,会更让人信服。
第三,代理型RPM的5分钟试点实验预算其实非常紧张,Agent很多时候只能跑"极度降配"的简化实验。虽然论文发现5分钟和30分钟预算下的策略选择相似,但也坦承更大时间预算的边际收益在递减。如果未来能开发出更聪明的"信息量最大化"实验设计方法,试点实验的效率还有很大提升空间。
第四,论文也发现了一个值得警惕的现象:如果RPM的底座模型(judge)太弱,选择质量会显著下降。在附录的测试集扩展实验中,用Qwen3.6-27B当judge时,RPM在候选池N变大时与验证神谕的差距明显扩大。这说明RPM对底座模型的能力有相当高的要求,不是随便套个开源小模型就能复现论文效果的。
不过,这篇论文的指向性是很清楚的。AI科研智能体往前走,拼的不仅仅是"能不能想出新点子",更是"如何在算力预算内找到最有价值的实验"。RPM把这个问题从"碰运气"变成了"有方法论"——光这一点,就值得所有做Agent方向的团队认真品一品。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?Meta FAIR联合牛津等机构提出研究偏好模型(RPM),在AI科研智能体执行候选方案前,先用LLM当评委判断哪个值得跑,避免GPU算力浪费。
这篇工作最值得看的点是什么?Inference-only RPM将平均归一化分数从0.684提升至0.711,Agentic RPM提升至0.729,接近验证oracle上限0.748;在WinoGrande和SVAMP两个任务上取得新的SOTA结果;两种方法均在约15小时内达到基线24小时的性能,使用不到三分之二的执行预算。
这篇工作的边界或风险在哪里?优点:(1)创新性地将候选选择问题形式化为偏好排序问题,避免了绝对性能预测的困难;(2)两种RPM变体设计合理,推理型轻量高效,代理型通过试点实验提高决策质量;(3)在多个维度上进行了系统分析(上下文规模、候选数量、推理预算等);(4)在标准基准上取得了显著的性能提升和新SOTA结果。缺点:(1)Agentic RPM的试点实验策略部分来自提示中的提示,并非完全自主发现;(2)离线评估数据存在策略偏差;(3)仅在一个基准(AIRS-Bench)和一个骨干模型上验证;(4)最终节点选择上的RPM集成未显示显著改进。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出AI研究偏好模型(RPM),利用冻结的预训练语言模型对未执行的候选解决方案进行相对排序,以在昂贵的GPU执行前筛选出最有潜力的候选方案,从而优化AI研究代理的计算资源分配。

实验合理度:★★★★☆

AIRS-Bench归一化分数(Normalized Score),离线评估使用候选选择准确率

学术研究价值:★★★★☆

提出AI研究偏好模型(RPM),利用冻结的预训练语言模型对未执行的候选解决方案进行相对排序,以在昂贵的GPU执行前筛选出最有潜力的候选方案,从而优化AI研究代理的计算资源分配;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

Inference-only RPM在24小时端到端运行中推理延迟总计0.660小时;Agentic RPM每次决策运行5分钟小规模试点实验

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:形式化为偏好排序问题,避免了绝对性能预测的困难;(2)两种RPM变体设计合理,推理型轻量高效,代理型通过试点实验提高决策质量;(3)在多个维度上进行了系统分析(上下文规模、候选数量、推理预算等);(4)在标准基准上取得了显著的性能提升和新SOTA结果。

主要参考文献

[1] Lupidi A, et al. AIRS-Bench: A Benchmark for AI Research Agents. 2026.
[2] Toledo E, et al. AIRA-dojo: An Evolutionary Tree-Search Scaffold for AI Research Agents. 2025.
[3] Hambardzumyan K, et al. AIRA2: Advancing AI Research Agents with Hidden Consistent Evaluation. 2026.
[4] Zheng L, et al. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023.
[5] Opsahl-Ong K, et al. Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs. EMNLP 2024.
[6] Chan J S, et al. MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering. 2025.
[7] Lu C, et al. The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery. 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球