← 返回 PaperDaily
大模型与智能体
智能体|生成一万个假说不如做对一次反馈:自动科研新范式
AI做科研这件事,已经不再是“帮忙查文献”这种打杂级别了。如今的自主科研智能体能够自己提出假说、写代码、跑实验、解读结果、再修改方案,流程跑得飞起。
龙哥读论文
发布于 2026-08-14 21:47:32
阅读 3
查看原文
原论文信息如下:
科研智能体为何“越跑越偏”?——从模糊测试中寻找答案
AI做科研这件事,已经不再是“帮忙查文献”这种打杂级别了。如今的自主科研智能体能够自己提出假说、写代码、跑实验、解读结果、再修改方案,流程跑得飞起。可问题也随之而来:智能体一天能产出的实验方案,人类研究员一个星期都验证不完。候选方案堆成山,根本无从下手。
面对这种“供大于求”,主流做法是走生成-排序(Generate-and-Rank) 路线:让更强的提议模型生成更多候选方案,再用一个学习出来的评判器给方案打分排序,只保留最高分。听上去有理有据,但论文敏锐地指出,这个范式漏掉了一个致命问题——反馈太稀疏 。
在“随机采样大量实验、事后再打分”这件事上,实证数据并不给面子。研究显示,随着独立候选样本数增加,解决任务的比例大致呈对数线性增长 ,几百个样本之后,多数投票和奖励模型选择就会进入平台期。换句话说,砸再多算力去“广撒网”,收获并不会等比例放大。
那么,同样的算力花在哪里才更值?答案是:让每次评估都多暴露一点信息 。
这篇论文把目光投向了软件测试领域磨了几十年的老工具——模糊测试(Fuzz Testing) 。通俗地说,模糊测试就是自动生成大量随机或半随机的输入去“轰炸”被测程序,期待能把它逼出崩溃。如果只是纯随机输入,效率当然很低。模糊测试的精髓在于它的控制回路 :变异种子输入、执行程序、观察反馈、根据反馈决定下一步变异什么。大多数执行都不会触发bug,但每一次执行都能让系统观测到“覆盖率”——即输入跑到了程序哪些分支或边。覆盖率就是那个中间信号 ,它让搜索过程不必等到“最终崩溃”就能判断进展。
科研自动化缺的正是这种东西。一个科研智能体的控制回路,跟模糊测试器出奇地一致:提出候选、执行实验、观察结果、再决定下一步试什么。论文据此提出了整个论述的核心立场——
自主科研应当是一种“仪器化、反馈驱动的搜索过程”:在明确的研究问题内,每一次实验都应暴露一个廉价的认知进展信号;搜索策略应当依据该信号决定下一步干预;而最终验证必须使用与搜索代理隔离的证据来判定什么算发现。
为了把这场类比讲透,论文还给出了一张逐组件对照表。从种子语料到变异算子,从覆盖率到调度策略,科研循环和模糊测试循环之间几乎一一对应。
值得注意的是,论文并不主张科研“像软件一样崩溃”。它说的是:昂贵的搜索需要可观测的进展,以及一个能据此行动的搜索策略 。这个“可迁移原则”才是整个类比的真正内核。
具体来看,模糊测试器的每个组件都能在科研循环中找到对应物。种子语料对应的是科研中的初始假说池——可能是从文献中提取的、由人类专家提供的、或者由LLM预生成的候选方向。变异算子对应的是科研中的提议器——它负责在现有假说基础上产生新的变体,比如修改实验条件、调整模型架构、替换数据集等。覆盖率对应的是认知进展信号——它衡量的是“这次实验让我们对问题空间多了多少了解”。调度策略对应的是科研中的实验规划器——它决定下一步该在哪个方向上投入更多资源。而最终裁决器(即“是否崩溃”)则对应科研中的受保护验证——它独立地判断某个候选是否真正构成了发现。
这个映射关系并非牵强附会。论文指出,模糊测试在过去二十年里从一种简单的随机输入生成工具,演变成了一个高度成熟的反馈驱动搜索框架。AFL(American Fuzzy Lop)和libFuzzer等现代模糊测试器之所以能在真实软件中找到大量漏洞,恰恰是因为它们把“覆盖率引导”和“能量调度”这两个核心机制做到了极致。科研自动化如果能够借鉴这套成熟的方法论,就有望避免“广撒网、低回报”的困境。
拆解评估黑箱:引导信号与验证信号为何必须分离
如今大多数自动科研系统把“评估”当成了一个黑箱:一个打分函数既要引导搜索方向,又要认证最终结果。这相当于让同一个人既当运动员又当裁判——不是说一定不公正,而是这两个角色天然不能兼容。
模糊测试早就把这件事拆开了:便宜的信号(覆盖率)用来引导,严格的裁决器(有没有崩溃)用来下结论,两者互不污染。论文用一张图展示了这种拆分前后的差别。
科研版本的“覆盖率”应该怎样定义?论文给出了一个很漂亮的概念:认知进展(Epistemic Progress) 。简单说,就是一次实验是否缩小了关于假说空间的不确定性——比如排除了一个替代解释、定位了一个边界、让某个留出预测变得更精确,或者改变了下一步该跑哪个实验。注意,这个信号不是 对当前候选“对还是错”的提前裁决,它衡量的是整个搜索战役的状态变化。
什么样的信号才算合格的“认知覆盖率”?论文提出了三条硬性标准:
C1 · 廉价且信息量大。 信号必须在每个候选上都能以极低成本获取,并且要比最终验证便宜得多。如果测一个信号比做一次正式实验还贵,那它就失去了“中间引导”的意义。
C2 · 与真实进展相关。 跟着信号走,应当通向真正的发现,而不是仅仅让信号数值本身变大。如果一个信号可以被“刷高”而对真实科研进展毫无贡献,它就不是好信号。
C3 · 在优化下保持稳健。 任何被搜索最大化的信号都可能被智能体“钻空子”。历史上有不少例子:好奇心驱动的预测误差可能固着在“噪声电视”上,覆盖率也可能把大量唯一崩溃错误地归并为少数真实缺陷。
论文也给了几个具体的候选信号:对模型的“惊奇值”、与已有工作的新颖度、验证器置信度、交叉重复不一致程度、到声明目标的距离等等。每个候选都有不同的C1-C3取舍。到底哪种信号靠谱,论文主张用实验说话 :在固定循环上插桩多个竞争信号,分别测量它们预测受保护成果的能力。
这里要特别点名一个常被混淆的概念。很多人以为“覆盖率高”就等于“发现的bug多”。论文明确纠正了这一点:覆盖率与发现bug相关,但覆盖率最高的模糊测试器未必能找到最多bug。类比到科研就是:认知进展信号是引导搜索方向的工具,而不是认证发现的依据。
这个区分在实践中有非常重要的意义。如果引导信号和验证信号混在一起,智能体就会学会“刷分”——优化那个被当作验证标准的信号本身,而不是真正推进科研。这正是论文反复强调的“受保护验证”的核心价值:验证器必须独立于搜索过程,它的输出不能反馈到搜索策略中,否则就会形成自我实现的循环,让智能体在错误的指标上越走越远。
三大可证伪预测:如何检验反馈驱动科研的有效性
如果只是把类比挂在嘴边,那跟朋友圈鸡汤没什么区别。这篇论文的学术含量体现在:它把整个立场拆成了三个可证伪的预测 ,每一个都能用受控对比实验来检验。
预测一 · 信号预测。 在提议器、任务和候选池固定的前提下,一个有价值的中间指标应该能预测受保护的科研结果,并在固定验证预算下比无信息或仅看最终结果的信号选出更多验证器确认的发现。如果没有任何候选信号能预测受保护的进展,这个预测就宣告错误。
预测二 · 搜索预测。 在提议器、任务、验证器和总预算全部固定的前提下,一个利用中间实验反馈来选择下一步干预的搜索策略,应当比重复采样在每单位成本内带来更多验证器确认的发现。这个预测把“好的搜索”操作化地定义为:下一步行动依赖于观测到的战役历史,且成功以统一的成本和验证规则来衡量。
预测三 · 验证预测。 在候选和搜索轨迹固定的前提下,使用受保护证据的最终验证应当比直接报告已优化的引导信号分数具有更低的假发现率。这是一个关于最终裁决可靠性的声明,而非又一种搜索能力。
为什么说“反馈驱动搜索”比“重复采样”有本质优势?论文引用了Angora模糊测试器的例子:在固定输入语料的前提下,梯度下降解决了所测程序97.0%的分支约束,而随机变异只解决了77.4%(以xmlwf为例)。这组数据的启示是:让观测结果决定下一次变换和资源分配,收益可能是巨大的 。当然,这并不意味着每种科研假说都要用梯度下降,而是说“根据历史做决定”这件事本身,就值得自动科研系统认真对待。
论文专门指出,MLE-bench的分析给这个框架提供了很好的注脚:智能体用交叉验证分数搜索,最终返回验证集最优解。但如果反事实地选择测试集最优节点,奖牌率会提高9到13个百分点。这组数字说明:在引导指标上的自适应进展,并不能保证受保护评估下的真进展 。研究人员不能把隐藏测试变成另一个反复查询的引导分数,但这个差距恰好证明了“受保护最终验证”的必要性。
这个框架还有一个很实际的诊断价值。一次失败的科研战役,其原因可能是:引导信号本身不包含有用信息、搜索策略错过了相关区域、或者最终验证器错误地认证了结果。传统的“混为一谈”式评估会把这三类失败搅在一起,让人无从下手;而拆分之后,每个环节都能独立检测,定位问题就像模糊测试的可靠性研究一样清晰 。
举例来说,如果一个自动科研系统在某个任务上表现不佳,传统做法是笼统地说“这个系统不行”。但在论文的框架下,我们可以进一步追问:是引导信号没有捕捉到有用的中间进展?还是搜索策略没有有效地利用这些信号?还是最终验证器过于宽松或过于严格?这三个问题对应着完全不同的改进方向。这种诊断能力对于自动科研领域的健康发展至关重要,因为它让研究者能够有针对性地改进系统的各个组件,而不是盲目地整体调参。
从“生成-排序”到“反馈-搜索”:科研范式的下一步
假如这个框架成立,那么自动科研的主流设计思想会从“生成-排序”整体切换到“反馈-搜索”。论文对现有的代表性系统做了一个横截面盘点,结果很有意思,几乎每个系统都落在了“引导信号”和“最终验证”两个维度的不同位置上。
AI co-scientist 使用辩论和演化来生成假说变体,再用LLM锦标赛(Elo评分)决定哪些假说继续深化,最终由湿实验验证。在模糊测试类比中,Elo是稠密的引导代理,物理实验是最终裁决。Elo只能组织搜索,不能证明假说为真 ,这个例子完美体现了“引导不是裁决”。
FunSearch与AlphaEvolve 则幸运得多,它们拥有机器可执行的验证器:FunSearch用确定性评估器拒绝非法程序并对合法程序打分,AlphaEvolve也有机器可执行的合法性检查和目标函数。在“正确性和进度都容易计算”的领域,引导和验证自然分开。
处于中间地带的AI Scientist-v2 用学习评判器选择实验节点,但人类选择初始想法并决定是否提交完成的稿件,最终由研讨会审稿人验收。Agent Laboratory 用奖励模型排序代码、用模拟审稿人给手稿打分。论文认为这些信号可以组织搜索,但它们的分数不能提供独立科学验证。更严重的警示来自MLR-Bench:约80%的编码代理情境下出现了捏造或未验证的实验结果——这恰好是“混淆引导与验证”的现实代价。
论文还从历史里挖出了不少有意思的对照。Hilbert曾期望一种机械过程判断一阶逻辑公式是否有效;Gödel证明了强形式系统无法自证所有真理;Church和Turing以否定方式回答了判定问题;Rice把这种“不可判定性”扩展到了程序行为的每个非平凡属性。由于完全机械化验证遥遥无期 ,软件工程在实际操作中退回到了“廉价引导+部分裁决”的组合拳。科研领域也一样,既然没有完美裁决器,就应该继承软件工程数十年打磨出的务实答案。
Schmidhuber的Gödel机是另一个绝妙的反面教材:它只接受“可证明有益”的自我修改,结果从未迈出过一步——一个没有廉价引导信号的受保护裁决,等于瘫痪。神经网络架构搜索则走向另一个极端,用同一个静态基准既做引导又做认证,最后过拟合了基准本身。每个停滞点,都踩在模糊测试环路预测的位置:要么缺引导,要么裁决太贵,要么一个信号身兼两职。
这种历史视角的引入并非只是为了增加文章的厚度。它揭示了一个深刻的规律:在任何一个复杂的搜索问题中,如果引导信号和验证信号没有分离,系统要么因为验证太贵而无法有效搜索,要么因为引导信号被过度优化而失去与真实目标的联系。模糊测试之所以成功,正是因为它找到了这两者之间的平衡——用廉价的覆盖率信号引导搜索,用严格的崩溃检测来认证结果。科研自动化要走的,正是这条已经被软件工程验证过的道路。
争议与边界:当科研问题本身可以被重新定义
任何有野心的框架都会遭到质疑。论文专门列出了六个最有代表性的反对意见,并一一做了回应。这六组问答恰好也画出了整个框架的边界。
异议一:“LLM无法做出发现所需的溯因跳跃。” 论文的回应很清醒:论点从一个已经声明的研究问题和候选表示之后开始,它负责的是“在给定问题内”如何观察进展、搜索和验证的问题。它不解释智能体如何改变“什么算问题、候选或发现”的元认知能力。
异议二:“这不就是贝叶斯最优实验设计(BOED)换了个名字?” 贝叶斯最优实验设计(Bayesian Optimal Experimental Design)站在模型丰富的一端,需要显式的概率模型、设计域和效用函数。本文的框架恰恰服务于“研究者还无法可靠给出这些成分”的阶段。两者是光谱上的不同位置,并不矛盾。
异议三:“这就是新颖性搜索或质量-多样性算法加了点步骤。” 论文指出,质量-多样性算法的行为描述符是人为设计的“接近目标”的描述,而覆盖率是从候选自身的执行中自动读取的“它做了什么”,不是“它离目标有多近”。前者需要一个关于“什么算发现”的模型,后者不需要——这正是开放科研场景的要求,因为最终发现恰恰是还无法被建模的东西。
异议四:“苦涩教训说规模生成器,而不是工程反馈。” 论文提醒大家,苦涩教训主张的是“搜索方法能利用计算”,而不是“任何特定生成器”。当重复采样的边际收益递减,自适应反馈恰恰是改善“计算→有效产出”交换比的手段,而不是在跟scale唱反调。这一点值得仔细品。
异议五:“开放研究没有稳定搜索空间,覆盖率没有定义。” 覆盖率并不要求枚举每个可达行为,一个固定目标和它的仪器化设置就已经定义了模糊测试器能观察到什么。科研的问题在于假说和表示会变化,因此框架要求在“已声明的问题”内,并允许进展表示随观测积累而生长。
异议六:“科研没有裁决器,类比失败。” 模糊测试自己也有裁决器问题——实际模糊测试工具经常使用不完美的、延迟的、差异的或人类辅助的检查。关键是语义角色的分离,而不是调用计划或成本差异。验证器无需完美,但必须独立于引导信号。
这些边界条件的讨论让框架更可信了。它不是宣称自己适用于一切科研活动,而是明确画出了自己的领地:在问题已声明的前提下,如何更聪明地搜索和验证 。至于“重新定义什么算问题”这种更高阶的能力,论文很诚实地把它留给了未来。
值得注意的是,论文对“问题已声明”这个前提的强调,实际上也划定了框架的适用范围。在探索性研究中,研究者往往连“什么问题值得问”都不确定,这时候模糊测试式的搜索框架可能并不适用。但在验证性研究中,当问题已经明确、候选方案已经生成、只需要判断哪个方案更优时,这个框架就能发挥最大的价值。论文的定位是相当精准的——它不试图解决所有问题,而是聚焦于自动科研中最核心、最可操作的那个环节。
龙迷三问
这篇论文到底在解决什么问题? 自主研究智能体生成实验的速度正远超验证速度,现有“生成-排序”范式忽视了稀疏反馈问题。论文提出将自动科研视为模糊测试:用廉价密集的认知进展信号引导搜索方向,由受保护的最终验证裁定发现,三大可验证预测为检验反馈架构设计提供了清晰路径
这篇工作最值得看的点是什么? 不适用(本文为立场论文,提出三个可验证的预测,但未进行实验验证)
这篇工作的边界或风险在哪里? 优点:1) 类比新颖且深刻,将成熟的模糊测试理论框架系统性地映射到自主科研领域,提供了清晰的设计空间;2) 明确区分了引导信号与验证信号,指出了当前生成-排序范式的关键缺陷(稀疏反馈);3) 提出了三个可证伪的预测,为后续研究提供了具体方向。缺点:1) 全文为观点论述,缺乏实验验证,核心主张的实证支撑不足;2) 对“认知进度信号”的定义和操作化描述仍较抽象,缺乏具体实例;3) 类比在“研究问题可被重新定义”的边界处解释力有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
将自主科研代理的迭代过程类比为灰盒模糊测试,提出将评估拆分为廉价密集的中间进度信号(引导搜索)与受保护的最终验证(认证发现)两个角色,以实现反馈驱动的科学搜索。
实验合理度: ★★★☆☆
现有材料未完整覆盖数据划分、基线公平性和统计显著性,因此按中性评价处理。
学术研究价值: ★★★★☆
将自主科研代理的迭代过程类比为灰盒模糊测试,提出将评估拆分为廉价密集的中间进度信号(引导搜索)与受保护的最终验证(认证发现)两个角色,以实现反馈驱动的科学搜索;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1) 全文为观点论述,缺乏实验验证,核心主张的实证支撑不足;
主要参考文献
[1] He, Y., Wang, J., Zhao, Y., Liu, J., & Chen, H. (2026). "Agentic Auto-Research is Fuzz Testing." arXiv:2608.09855. https://arxiv.org/pdf/2608.09855v1.pdf
[2] Böhme, M., Pham, V.-T., Nguyen, M.-D., & Roychoudhury, A. (2017). "Directed Greybox Fuzzing." In Proceedings of the 2017 ACM SIGSAC Conference on Computer and Communications Security.
[3] Brown, N., et al. (2026). "More Inference, More Experiments: What We Learned Hosting the Auto-Research Summit." AGI House.
[4] Good, I. J. (1965). "Speculations Concerning the First Ultraintelligent Machine." Advances in Computers, 6, 31–88.
[5] Romera-Paredes, B., et al. (2024). "Mathematical discoveries from program search with large language models." Nature, 625, 468–475.
[6] Zhang, D., et al. (2025). "AI co-scientist: A multi-agent system for scientific discovery." Google Research.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
科研智能体跑得快,验证跟不上?来龙哥读论文粉丝群聊聊反馈架构怎么设计!
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群