WHALE整体有效,但论文没有停留在“总分数更高”这种粗粒度结论上。它进一步拆解了行为指标,让我们看清在什么情况下瓶颈在模型、什么情况下瓶颈在harness。图3展示了两类典型的领域差异。图3:测试轨迹上的行为指标随rollout累积的变化。(a-c)SearchQA中格式遵从率、至少检索到包含参考答案文档的轨迹比例、以及在此基础上答案抽取正确率;(d-e)Math中达到token上限的轨迹比例、以及能从轨迹中提取出最终boxed答案的比例。虚线标出各方法达到最佳测试准确率的时刻。搜索问答是典型的harness主导场景。三个子能力里最夸张的是“正确检索到含答案文档”的比例:weight-only只能把这个指标从26.88%提到很有限的程度,而harness-only用少得多的rollout直接把它拉到60.61%。WHALE把两者结合后达到65.41%。原因很直接:虽然查询是模型写的,但查询改写、返回文档数量、上下文截取方式全部由harness控制,改动harness对检索效率的影响远大于改权重。数学推理则反过来,是典型的模型主导场景。主要瓶颈是“响应长度爆炸”:这个任务的2B模型有95.83%的轨迹会撞上token上限,导致答案根本写不完。weight-only能把截断率压到30.83%,因为它从“正确且及时终止”的轨迹里学到了要精简输出。harness-only就没这么幸运了——它也能通过限制轮数、设置response cap等招数尝试缩短输出,但模型本身“啰嗦”的行为不改变,格式正确率几乎推不动。WHALE最惊艳的案例出现在cycle 1:权重刚更新完一丁点,harness搜索只用了4,608次rollout就比harness-only花46,080次rollout换来的格式提升还高。这两种对立的“主导权”给实践者一个重要启发:如果想知道当前agent主要卡在哪里,不必做昂贵的全量实验。先花小预算做一轮短harness搜索,再花小预算做一轮短权重训练,观察哪边带来的收益更大,就能低成本诊断瓶颈位置。用论文的话说:a short harness search serves as a low-cost diagnostic before extensive model training。
下面是龙哥对于大家可能的一些问题的解答:这篇论文到底在解决什么问题?斯坦福等机构提出WHALE框架,首次实现智能体模型权重与可执行harness代码的交替联合优化,三个任务上最高提升24.38个百分点,揭示"谁拖后腿就换谁"的协同进化新范式。这篇工作最值得看的点是什么?WHALE在三个领域均取得最高准确率,超越仅权重更新7.67-10.05个百分点,超越仅harness更新7.67-24.38个百分点,超越FST 4.15-13.00个百分点;自适应WHALE在SearchQA达到52.82%准确率。这篇工作的边界或风险在哪里?优点:(1)提出新颖的交替优化框架,解决模型与harness协同适应问题;(2)模块化设计,可适配任意权重更新和harness搜索方法;(3)深入分析瓶颈域和调度策略,提供实用指导;(4)自适应版本消除手动调度超参数。缺点:(1)计算开销较大,需要多轮交替训练和搜索;(2)依赖Meta-Harness的proposer(Claude Opus 4.7),成本较高;(3)未在更大规模模型上验证;(4)自适应WHALE在Math领域略逊于最优手动调度。如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~