← 返回 PaperDaily
大模型与智能体
Apple Research最新论文 | ARBITRAGE:推理延迟降2倍,优势感知投机解码新范式
这篇论文把推测解码的老问题拆得很清楚:目标模型有相当比例的“重写”其实毫无价值,因为重写前后的推理步骤质量差不多,算力却要照付。ARBITRAGE直接用轻量路由器预估“这一步目标比草稿强多少”,只在真正有可能更优时才升级到目标模型,数学推理任务上端到端延迟最多降约2倍。
龙哥读论文
发布于 2026-08-18 00:20:01
阅读 3
查看原文
原论文信息如下:
一边看着大模型在数学题面前铺开几百行思维链,一边心疼GPU在疯狂烧钱,这大概是所有搞LLM的人都体会过的复杂心情。最近Apple Research和UC Berkeley联合放出一篇新论文ARBITRAGE ,悄悄解决的就是这个纠结:用一个轻量路由器判断“目标模型在这一步会不会比草稿模型更强”,不会更强就不升级,推理延迟最多降约2倍,精度不掉。
推理加速的痛点:无效的目标模型调用
先补一个背景知识。Speculative Decoding(推测解码) ,是近年来很热门的LLM推理加速方案。它同时运行两个模型:一个小而快的草稿模型(draft model) 和一个大而准的目标模型(target model) 。草稿模型先快速生成一批token,目标模型再一次性并行验证。验证通过的token直接保留,不通过的部分就回退用目标模型重新生成。这样既能保留大模型的质量,又不必每个token都让大模型亲自跑一遍。经典推测解码来自Leviathan等人2023年的工作,原理不复杂,但在短文本生成场景中确实有效。
但到了长思维链推理场景,传统的token级推测解码就有点水土不服了。为啥?因为推理过程经常存在语义等价但词面不同 的写法。比如“3乘以4等于12”和“12=3×4”,两种写法表达的意思一模一样,但token层面就是不一样,目标模型一验证就给打回票,草稿模型被频繁误伤。研究社区很快意识到这个问题,开始尝试把验证粒度从token级别提升到步骤(step)级别 。也就是把整个推理步骤当成一个整体来评估,而不是抠单个token。代表工作是Reward-guided Speculative Decoding(RSD),它引入一个Process Reward Model(PRM,过程奖励模型) ,给每个推理步骤打分,分数低于某个阈值就丢掉草稿,改用目标模型重新生成。
听起来挺合理,但ARBITRAGE这篇论文通过实验发现了一个扎心的事实:RSD的“重写”——也就是让目标模型重新生成——有相当大比例是无效劳动 。论文画了一张非常直观的图,把“浪费的目标调用率”随“延迟率”(也就是触发重写的频率)的变化展示出来。这里的浪费指目标模型重新生成之后的PRM分数并不比草稿高,等于白跑一趟。
从图里能清楚看到,当延迟率到70%时,大概40%的目标模型调用是白费的。为什么会有这么多无效调用?论文总结了两个原因:一是某些草稿步骤本身逻辑正确,只是PRM给的分数偏低,目标模型生成的其实差不多,质量没有本质提升;二是碰到真正困难的题,草稿和目标模型可能犯同样的逻辑错误,重写也没用。问题根源在于RSD的判决依据是草稿步骤的绝对分数,根本不看目标模型是不是真的能做得更好。这就引出了ARBITRAGE要做的核心改变:从“草稿够不够好”转向“目标模型比草稿好在哪”。
核心创新:从绝对阈值到优势感知路由
ARBITRAGE整个思路可以用一句话概括:不要无条件相信PRM的绝对分,要看目标模型相对草稿模型的“优势” 。论文用Figure 2的对比图把这个差异展示得非常清楚。
RSD的做法是给PRM分数设一个固定阈值τ,草稿步骤分数高于τ就接受,低于τ就升级到目标模型。这个过程的接受判定可以写成:A(x, z_d) = 1{s_d > τ}。也就是说,只要草稿“看起来不够好”,就盲目把目标模型拉过来重写。ARBITRAGE换了一个问题:如果让目标模型重写这一步,它产出的步骤质量真能超过草稿吗?只有当这个“优势”为正时,升级才有意义。
整个ARBITRAGE推理流程可以概括为三步:第一步,草稿模型自主生成一个候选步骤;第二步,轻量路由器基于当前上下文和草稿步骤,估计目标模型相对草稿模型的优势;第三步,如果优势估计值低于阈值τ,直接接受草稿步骤;如果优势估计值高于阈值τ,调用目标模型重新生成这个步骤。这个阈值τ是灵活调整的,可以用来控制计算量与生成质量之间的平衡。
ARBITRAGE ORACLE:理想路由策略的理论上界
有了方向之后,论文先把“理想路由策略”的数学形式定义出来,也就是ARBITRAGE ORACLE(理想仲裁者) 。假设给定上下文x,草稿模型生成了步骤z_d,目标模型生成了步骤z_t,PRM对两步的质量打分分别是s_d和s_t。那么理想策略就是挑选PRM分更高的那一个:
z* = argmax h_θPRM(x, z),z ∈ {z_d, z_t}
这个公式的意思是:在这一步上,谁的质量分数高就选谁。这种贪心策略给出了路由性能的理论上界——在所有相同升级频率的策略里,它能拿到最高的预期PRM分数。论文把这个“优势”定义为目标模型与草稿模型的质量差:
如果Δ大于0,说明目标模型比草稿模型强;如果Δ小于等于0,升级就是白费。有了这个优势定义,升级决策可以写成一个最优阈值策略:
也就是说,目标模型的优势Δ超过阈值τ才升级,否则直接接受草稿。这里τ的作用不是评判草稿“好不好”,而是控制“多明显的优势才值得升级”。论文在附录里还证明了一个漂亮的结论:在所有成本不超过给定预算的策略中,这个基于Δ的阈值策略能最大化预期PRM分数。ORACLE从理论上回答了“什么时候该升级”的问题。不过,这仅仅是一个理论参考,因为要计算Δ,就必须真的运行目标模型去生成z_t,这恰恰是推测解码想要避免的高成本操作。
ARBITRAGE ROUTER:轻量级实用路由器的训练与部署
ORACLE虽然理想,但没法直接落地。论文的真正价值在于提出了一个可行方案:训练一个轻量级的ARBITRAGE ROUTER(优势路由器) 来模拟理想策略的决策。
这个路由器的输入是当前上下文x和草稿步骤z_d,输出是一个标签y = 1[Δ > 0],表示目标模型是否有正优势。训练数据怎么来?套路很清晰:从NuminaMath-CoT数据集中采样3万道数学题,对每道题固定前缀,分别让草稿模型和目标模型各生成一个候选步骤,再用同一个PRM给两个步骤打分,算出Δ和标签y。每个样本的完整形式是(x, z_d, z_t, s_d, s_t, Δ, y)。为了让优势信号更可靠,论文还做了多次目标采样取平均分,用平均分计算优势,降低随机波动的影响。
训练数据有一个明显问题:大多数草稿步骤质量不错,不需要升级,导致y=0的样本远远多于y=1的样本。以文中Llama系列配置为例,y=0占62.27%,y=1只占37.73%。严重不平衡会让路由器偏向“统统接受”,从而丢失那些真正需要升级的困难步骤。论文的处理方式是对多数类做随机下采样,让训练集尽量均衡。另外还有一个细节:给每个历史步骤加上“当时调用的是哪个模型”的标注信息,相当于告诉路由器当前上下文里哪些步骤是草稿生成的、哪些是目标模型生成的,这能有效提升路由精度。
路由器本身的模型结构不复杂:从一个紧凑型PRM(比如Qwen2.5-Math-1.5B-Instruct-PRM)初始化,在最后的token嵌入上接一个分类头,用标准交叉熵损失微调。选PRM作为起点很聪明,因为PRM已经学会评估中间步骤质量,路由器只需要在这个基础上学习“目标模型相对草稿模型的相对质量”,比从零开始学容易得多。
训练过程中的评估也值得一说。如果用传统分类准确率、精确率、召回率来评估路由器,会有一个问题:这些指标太依赖选定的阈值τ了,没办法反映路由器在不同阈值下的整体排列质量。论文改用Spearman秩相关系数 ,直接计算路由器输出概率和真实优势Δ之间的等级相关性。这样即使换不同的τ阈值,只要路由器给高风险步骤的打分排序正确,整体路由质量就有保障,不需要每次调阈值都重新跑完整解码流程。
实验验证:全面超越基线的效率与质量提升
实验部分覆盖了三种有代表性的草稿-目标模型配置:LLaMA3-1B/8B(小模型配大模型)、LLaMA3-8B/70B(跨规模大差距)、Qwen2.5-Math的3bit量化版/全精度7B版(量化版当草稿)。验证基准选了两个数学推理数据集:MATH500和OlympiadBench。在整个过程中使用Skywork-o1-Open-PRM(1.5B)作为打分器,路由器则从Qwen2.5-Math-1.5B-Instruct-PRM微调而来。
第一个实验绘制的是“准确率-接受率曲线”。接受率越高意味着目标模型介入越少、速度越快,所以曲线越靠上、越靠左,说明同样的目标模型使用频率下精度越高。论文把ARBITRAGE ORACLE、ARBITRAGE ROUTER和RSD三条曲线放在一起对比。
结果非常干净:在全部六种模型-数据集组合中,ARBITRAGE ROUTER的曲线几乎全程压在RSD上方,并且和ORACLE上界贴得很近。这说明路由器确实学到了“优势”的本质信号,而不是简单模仿阈值策略。更关键的是,这种优势在LLaMA3-8B/70B这种极端跨规模配置下依然成立。
第二个实验是端到端延迟测试。光看接受率还不够,因为路由器本身也有开销,每一步都要跑一次前向。所以论文又画了“准确率-耗时曲线”。
在相同精度目标下,ARBITRAGE的端到端延迟比RSD最多降低约2倍。这个数字很能说明问题:路由器那点开销相比于省下来的目标模型调用,完全是值得的。
论文还放了一个很有说服力的定性案例(图6)。某个MATH500题目的推理过程中,RSD把第2步和第3步当作不合格步骤拒绝了,然后让目标模型重新生成。结果呢?目标模型重写出来的内容跟草稿基本上是一个模子刻出来的,最终答案同样是270/7。ARBITRAGE因为看的是相对优势,判断这两个步骤不值得重写,直接放行,省下了这两次完整的目标模型调用。这个例子把“绝对分数阈值”的尴尬展现得淋漓尽致。
局限与展望:优势感知路由的边界与未来
ARBITRAGE给出了一套很优雅的范式,但它也有一些需要正视的边界条件。
第一,路由器的训练依赖PRM的分数作为“优势”的判定标准。整个系统建立在PRM打分可靠的前提上,如果PRM本身对某些步骤的评估有偏差,那么路由器学到的优势信号也会被带偏。在数学推理这类PRM相对成熟的场景里问题不大,但换到代码生成、开放问答等领域,PRM质量就未必能支撑起这套优势标注了。
第二,路由器需要针对具体的草稿-目标模型组合进行训练和微调。每次更换目标模型或草稿模型,优势分布都会发生变化,需要重新采集数据、重新训练路由器。这在一定程度上限制了直接迁移到新模型组合上的便利性。
第三,ARBITRAGE的决策是基于单步的贪心路由,没有对未来的推理步骤做长期规划。某一步看起来没有正优势,但可能这个步骤是后续高质量推理的必要铺垫。论文没有探索多步前瞻或全局最优的路由策略,这是一个自然的延伸方向。
从实际应用价值看,ARBITRAGE很适合部署在数学解题、复杂推理、代码推导等长思维链任务的推理服务中。尤其是量化模型当草稿、全精度模型当目标这种省钱组合,能在资源有限的前提下榨出更大的吞吐量。未来如果能进一步降低路由器的训练成本和迁移成本,这套“优势感知”的思路完全可以推广到更多推理场景中去。
龙迷三问
这篇论文到底在解决什么问题? ARBITRAGE提出优势感知的步骤级投机解码框架:用轻量路由器预测目标模型相对草稿模型的每一步质量优势,动态决定是否升级计算,避免无效目标调用。在数学推理基准上,同等精度下推理…
这篇工作最值得看的点是什么? 在多个数学推理基准上,ARBITRAGE在匹配精度下相比RSD基线降低推理延迟最高约2倍;在MATH500量化草稿设置下达到1.62×加速,在OlympiadBench小草稿设置下达到1.97×加速。
这篇工作的边界或风险在哪里? 优点:1) 提出优势感知路由的新范式,有效减少无效目标模型调用;2) 形式化定义ARBITRAGE ORACLE作为理论上界;3) 路由器轻量高效,训练流程完善;4) 在多个模型配置和基准上一致优于基线。缺点:1) 依赖PRM质量,PRM…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出一种基于优势感知路由的步骤级投机生成框架,通过轻量级路由器预测目标模型相对于草稿模型的质量优势,动态决定是否升级到目标模型,从而避免无效的目标模型调用。
实验合理度: ★★★★☆
准确率、接受率、Spearman秩相关系数、端到端延迟。
学术研究价值: ★★★★☆
提出一种基于优势感知路由的步骤级投机生成框架,通过轻量级路由器预测目标模型相对于草稿模型的质量优势,动态决定是否升级到目标模型,从而避免无效的目标模型调用。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
路由器每步仅需一次轻量级前向传播,相比目标模型调用开销极小;在实验中,相比RSD基线,在匹配精度下推理延迟降低最高约2倍。
复现难度: ★★★☆☆
https://github.com/SqueezeAILab/Arbitrage
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1) 依赖PRM质量,PRM评分不准确时路由决策可能受影响;2) 路由器训练需要额外的数据收集和标注流程;3) 优势估计仅基于当前步骤,未考虑对未来…
主要参考文献
[1] Leviathan Y, Kalman M, Matias Y. Fast Inference from Transformers via Speculative Decoding. ICML 2023.
[2] Chen C, Borgeaud S, Irving G, et al. Accelerating Large Language Model Decoding with Speculative Sampling. arXiv:2302.01318, 2023.
[3] Maheswaran M, Tiwari R, Hu Y, et al. ARBITRAGE: Efficient Reasoning via Advantage-Aware Speculation. arXiv:2512.05033, 2025.
[4] 开源代码:https://github.com/SqueezeAILab/Arbitrage
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!