← 返回 PaperDaily 大模型与智能体

Token级协同推理来了:PyroDash把大模型调用压到1.9%

小模型先冲,大模型只在关键节点接力,这套思路最值钱的不是省钱,而是把“什么时候该求助”这件事训练成了模型自己的本能。PyroDash还把奖励直接对齐到真实推理成本,适合真想落地的人看。

Token级协同推理来了:PyroDash把大模型调用压到1.9%
原论文信息如下:
论文标题:
PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference
发表日期:
2026年07月
发表单位:
Pyromind Dynamics Inc.
原文链接:
https://arxiv.org/pdf/2607.20327v1.pdf

SLM+LLM如何“花小钱办大事”?

大模型好用,但账单也是真的会咬人。很多团队一开始都想得很简单:难题丢给大模型,简单题交给小模型,省钱又省心。可真上生产后才发现,问题不是“选谁”,而是“什么时候该把接力棒交出去”。交早了,成本飙升;交晚了,答案已经跑偏,后面再补救就像煮糊了再加糖,多少有点自欺欺人。
PyroDash想解决的就是这个现实问题:让小模型先自己想,真卡住了,再由大模型接手,而且不是整题重来,而是沿着小模型已经走出的推理轨迹继续往下写。更关键的是,这个“求助时机”不是外部路由器拍脑袋决定的,而是小模型在生成过程中自己学出来的。说白了,它不是“谁都能叫救兵”,而是“该叫救兵时才叫救兵”。
封面
封面图:PyroDash把“小模型先算、大模型后补”的协同推理思路,直接做成了一个可训练、可控成本的系统。
这篇论文最有意思的地方,不是又堆了一个更复杂的路由器,而是把路由决策“塞回”小模型自己身上。也就是说,小模型一边推理,一边判断自己到底还能不能扛住;一旦发现不行,就吐出一个控制 token(τoff),告诉系统:这里需要大模型接力。这个设计看起来朴素,实际上很狠,因为它把协同推理里最贵、最难调、最容易翻车的部分,变成了模型内部可学习的行为。
论文标题里的几个缩写也顺手解释一下。SLM 是 Small Language Model,中文一般叫“小语言模型”;LLM 是 Large Language Model,也就是“大语言模型”;GRPO 是 Group Relative Policy Optimization,中文可理解为“组相对策略优化”,是一种强化学习式的策略对齐方法。论文里还提到 SFT,即 Supervised Fine-Tuning,监督微调。名字都不短,但核心意思很简单:先教会它怎么说,再教会它什么时候该闭嘴把话筒递出去。

从“请求级”到“Token级”:协同推理的新革命

协同推理这件事,过去大多停留在“请求级”。意思是,先看整道题难不难,再决定整题交给谁。这个思路当然不差,但它有个天然缺陷:很多题并不是从头到尾都难,往往是前面几步还能靠小模型硬撑,到了某一步才突然卡壳。请求级路由这时候就像只会看门口招牌的保安,屋里都起火了还在问“这单子谁接”。
PyroDash把决策粒度推进到 Token级,也就是在生成每一个 token 的过程中判断是否需要接力。这个变化听着像“粒度更细”,实际意义却很大:小模型不再只是一个前置筛选器,而是一个真正参与推理并负责判断自身能力边界的“第一责任人”。
图1:PyroDash的协同推理架构图
图1:PyroDash的协同推理架构图。小模型先生成,遇到控制 token τoff 后,由协同引擎把“原始问题 + 小模型已生成的部分推理”一次性交给冻结的大模型继续完成。
这张图的关键不是“有两个模型”,而是“只有一次交接”。很多协同方法喜欢来回切换,像接力赛跑成了广场舞,模型状态、上下文、缓存、接口都要反复折腾。PyroDash干脆把规则定死:要么小模型自己做完,要么只切一次给大模型。这个设计看起来有点“倔”,但工程上非常讨喜,因为它把复杂度压到了最低。
更现实的一点是,它不要求访问大模型的 logits,也不要求重新训练大模型,甚至可以兼容很多只提供生成接口的闭源 API。换句话说,PyroDash不是在实验室里“秀架构”,而是在替真实部署环境考虑:大模型贵、接口黑盒、权限有限,这些痛点它都提前认账了。
从输入输出的角度来看,PyroDash的协同引擎接收的输入包括:原始用户问题、小模型已生成的 token 序列(其中可能包含 τoff 标记)、以及一个可选的协同提示(collaboration prompt)。输出则是大模型从 τoff 位置开始继续生成的完整回答。这个流程中,小模型和大模型之间没有中间状态共享,也不需要维护复杂的 KV 缓存同步,因为大模型在接手时会把小模型已生成的内容作为前缀,从头开始计算自己的 KV 缓存。这种设计虽然在大模型侧会多一次前缀计算,但避免了跨模型缓存转换的工程难题,在 API 调用场景下尤其实用。
论文还特别讨论了模块间的关系。整个系统由三个核心模块组成:小模型(SLM)、大模型(LLM)和协同引擎(Collaboration Engine)。小模型负责初始推理和决策,大模型负责接力补全,协同引擎则负责检测 τoff、拼接上下文、调用大模型接口。这三个模块之间是松耦合的:小模型和大模型可以独立替换,协同引擎只需要知道大模型的 API 地址和输入输出格式。这种松耦合设计意味着,即使未来出现了更便宜或更强的小模型或大模型,PyroDash 的框架可以无缝升级,而不需要重新训练整个系统。

三阶段训练:如何教会小模型“该出手时才出手”?

真正难的地方不是“定义一个 τoff”,而是让小模型知道这个 token 什么时候该冒出来。论文没有偷懒,直接给了一个三阶段训练流程:先让控制 token 能被模型理解,再让模型学会“在什么模式下该发出这个 token”,最后再用强化学习把这个决策和真实推理成本对齐。这个顺序很重要,少一步都容易变成“会喊救命,但不知道什么时候喊”。
图2:PyroDash的三阶段训练流程
图2:PyroDash的三阶段训练流程。先做控制 token 嵌入学习,再做面向 offloading 的监督微调,最后用 GRPO 做成本感知对齐。
第一阶段是 控制 token 嵌入学习。因为 τoff 是新加进来的词,模型一开始根本不认识它。论文的做法很实用:先用一组“自然断点” token 的嵌入均值来初始化,再加一点噪声,让它落在“句子该停顿、该转折、该结束”的语义附近。这个处理比纯随机初始化稳得多,不然模型一开始看到 τoff 可能会像见了陌生人,直接装作没看见。
具体来说,论文从小模型的词表中选取了句号、逗号、分号、换行符、以及一些常见的推理转折词(如“因此”、“但是”、“所以”)的嵌入向量,计算它们的均值作为 τoff 的初始嵌入,然后加入一个标准差为 0.01 的高斯噪声。这个初始化策略的直觉是:τoff 应该出现在推理过程中需要“换手”的位置,而这些位置在语义上往往与自然断点接近。实验表明,如果使用纯随机初始化,模型在第一阶段需要多训练约 30% 的步数才能达到相同的 τoff 识别准确率。
第二阶段是 offloading-oriented SFT,中文可以理解为“面向卸载决策的监督微调”。这里的关键不是单纯学答题,而是学两种行为:在普通模式下正常完成,在协同模式下根据题目难度和上下文决定是否插入 τoff。论文还专门把数据分成 easy 和 hard 两类,并且区分是否启用协同提示,这样模型才不会把“能求助”误学成“见到提示就乱求助”。
数据构造是这一阶段的核心。论文从训练集中选取了 5000 个 easy 样本和 5000 个 hard 样本,其中 easy 样本的定义是小模型能独立正确回答的题目,hard 样本则是小模型回答错误的题目。对于每个样本,论文构造了两种训练实例:一种是不带协同提示的普通模式,模型需要正常生成完整回答;另一种是带协同提示的模式,模型需要在推理过程中决定是否插入 τoff。对于 hard 样本,论文在推理轨迹中人工标注了“最佳交接点”——即小模型开始出错或推理方向偏离的位置,并在该位置插入 τoff 作为监督信号。对于 easy 样本,则不插入 τoff,让模型学习独立完成。通过这种方式,模型学会了在 hard 问题上主动求助,在 easy 问题上独立完成。
第三阶段最有味道,叫 cost-aware policy alignment with GRPO。前两阶段解决的是“会不会”,这一阶段解决的是“值不值”。模型每次做出协同决策后,奖励不只看答对没有,还要看用了多少大模型 token、调用了几次大模型、总成本比纯大模型方案省了多少。这个设计非常接地气,因为真实业务里,正确率和成本从来不是一个维度,最后拍板的永远是“效果够不够,账单疼不疼”。
GRPO 的具体实现值得展开。论文定义了一个奖励函数 R = R_acc - λ * C,其中 R_acc 是准确率奖励(正确为 1,错误为 0),C 是归一化的推理成本,λ 是一个超参数用于控制成本惩罚的强度。成本 C 的计算考虑了三个因素:小模型生成的 token 数、大模型生成的 token 数、以及大模型调用的固定开销(如 API 请求的固定延迟和费用)。论文将纯大模型推理的成本归一化为 1,小模型推理的成本设为 0.1,大模型 token 的成本设为小模型 token 的 10 倍。通过调整 λ,系统可以在“更省钱”和“更准确”之间平滑切换。论文实验了 λ 从 0.05 到 0.6 的多个取值,展示了完整的成本-精度折中曲线。
GRPO 的训练过程还引入了一个重要的技巧:组采样。每次训练时,模型对同一个输入生成 K 个不同的输出(论文中 K=8),然后在这组输出内部计算相对奖励。这样做的好处是减少了奖励函数的方差,因为模型可以在同一组内比较不同决策的相对优劣,而不是依赖绝对奖励值。例如,如果 8 个输出中有 3 个正确但成本较高、5 个错误但成本较低,GRPO 会倾向于选择那些在“正确且成本适中”之间取得平衡的策略,而不是极端地追求低成本或高准确率。
看到这里,思路其实已经很清楚了:不是让小模型“装成”大模型,而是让小模型学会在合适的节点主动放权。这个方向挺聪明,也挺现实。

实验结果大揭秘:省了96%的钱,准确率还能反超?

实验部分选的是五个数学推理基准,包括 GSM8K、Minerva、OlympiadBench、AIME24 和 AIME25。这个选择挺合理,因为数学题最能暴露“到底是真会还是硬撑”。如果一个协同系统连数学推理都管不住,那它在更复杂的业务场景里大概率也会翻车。
论文把两类结果都摆出来了:一类是不同方法在各个基准上的准确率和 token 使用情况,另一类是平均准确率、LLM token 比例、调用次数和总成本。这样看结果会比只看准确率更诚实,因为协同推理的价值本来就不是“谁分高谁赢”,而是“在尽量少用大模型的前提下,保住该有的能力”。
表1:五个数学推理基准上的性能对比
表1:五个数学推理基准上的性能对比。对比对象包括基础小模型、SFT 冷启动、RouteLLM、GlimpRouter,以及 PyroDash 的两个不同 λ 设置;GLM-5.2-FP8 作为仅用大模型的参考线。
表2:平均准确率、LLM使用比例、调用次数与总成本
表2:平均准确率、LLM 使用比例、平均调用次数与总成本。这个表最直观,能一眼看出“少用大模型”到底是少到什么程度。
图3:总成本与平均准确率对比
图3:总成本与平均准确率对比。PyroDash在不同 λ 下形成了明显的“成本—精度”折中曲线。
最亮眼的结果有两个。第一,在 λ=0.05 时,PyroDash 的平均准确率达到 64.04%,比仅用大模型的基线高出 6.36 个百分点,同时总成本还下降了 20.4%。这说明它不是“省钱所以变笨”,而是靠更聪明的交接时机,把小模型能做的部分尽量做完,把大模型的火力用在刀刃上。
第二,当 λ 提高到 0.6,系统更偏向省成本时,平均准确率变成 54.55%,但 LLM token 比例只有 1.90%,每个样本平均只触发 0.012 次大模型调用。按论文给出的价格设定,总成本从 49.36 美元降到 1.78 美元,直接砍掉 96.4%。这个数字很有冲击力,但它并不是白捡来的,代价就是精度会下降。论文没有回避这个 trade-off,这点比很多只报最好结果的工作诚实得多。
更详细地看表1的数据,PyroDash 在 GSM8K 上的表现尤其突出。在 λ=0.05 设置下,它在 GSM8K 上达到了 82.3% 的准确率,而纯大模型基线只有 76.1%,基础小模型只有 58.4%。这意味着 PyroDash 不仅省了钱,还通过“小模型先探路、大模型关键接力”的方式,在整体上提升了推理质量。论文分析认为,这是因为小模型在简单问题上已经能给出很好的推理起点,大模型在接手时不需要从头推理,而是可以专注于修正和补全,从而减少了“大模型在简单问题上过度复杂化”的倾向。
在更难的 AIME24 和 AIME25 上,PyroDash 的表现同样可圈可点。AIME24 上,λ=0.05 的 PyroDash 达到了 31.2% 的准确率,而纯大模型只有 28.7%;AIME25 上,PyroDash 达到 26.8%,纯大模型为 24.3%。这些提升虽然幅度不大,但考虑到 PyroDash 同时还在节省成本,这个结果就很有说服力了。论文还注意到一个有趣的模式:在 AIME 这类高难度竞赛题上,PyroDash 的 LLM token 比例(约 12-15%)明显高于 GSM8K(约 3-5%),说明模型确实学会了在更难的题目上更频繁地求助。
与基线方法的对比也值得细看。RouteLLM 和 GlimpRouter 都是请求级的路由方法,它们在 GSM8K 上表现尚可,但在 AIME 系列上明显落后于 PyroDash。例如,RouteLLM 在 AIME25 上只有 18.5% 的准确率,而 PyroDash(λ=0.05)达到了 26.8%。这个差距说明,请求级路由在面对“部分难、部分易”的题目时,要么过早地把简单部分也交给大模型(浪费成本),要么过晚地识别出困难部分(导致错误积累)。PyroDash 的 token 级决策正好弥补了这个缺陷。
这里最值得注意的,不是单点成绩,而是它真的学出了“不同 λ 对应不同策略”的可调性。换句话说,PyroDash不是一条固定路线,而是一组可按业务预算切换的策略。预算紧,就多让小模型扛;要极致效果,就让大模型多接力。这个可控性,才是工程落地最值钱的地方。
实验里也有一些值得冷静看的地方。首先,评测主要集中在数学推理任务,说明它更像是一个“推理型协同”的验证,而不是所有通用任务都已经被证明。其次,成本计算依赖具体 API 价格和 token 统计方式,换模型、换计费规则,绝对数值会变,但相对趋势大概率仍然成立。最后,这套方法的前提是小模型能产生足够靠谱的中间推理轨迹;如果小模型连“半成品思路”都写不出来,那再聪明的接力机制也接不住。
论文还进行了一组消融实验,验证了三阶段训练中每个阶段的必要性。结果显示,如果跳过第一阶段(控制 token 嵌入学习),模型在训练初期会出现 τoff 生成不稳定的问题,准确率下降约 4-5 个百分点。如果跳过第二阶段(offloading-oriented SFT),模型虽然能生成 τoff,但往往在错误的位置(如句子中间、推理尚未完成时)就发出求助信号,导致大模型接手后需要重新理解上下文,效率反而下降。如果跳过第三阶段(GRPO 对齐),模型虽然能在正确的位置求助,但缺乏成本意识,倾向于过度使用大模型,导致成本节约效果大打折扣——在 λ=0.05 设置下,跳过 GRPO 的版本总成本仅下降 8.3%,而完整版本下降了 20.4%。

总结与展望:协同推理的“黄金时代”来了吗?

PyroDash的价值,不只是“省钱”。它真正推进的是一种更成熟的协同推理观:不是把大模型当万能外包,也不是把小模型当廉价替身,而是让两者在同一条生成链路里各司其职。小模型负责快速推进和识别边界,大模型负责在关键节点补上能力缺口。这个思路一旦做实,很多推理系统的设计都会被重新洗牌。
不过,协同推理要真正进入“黄金时代”,还差几步。第一,训练数据和任务类型还需要更广,不能只在数学题上表现好就宣布通吃。第二,成本建模要更贴近真实线上环境,比如长上下文、缓存命中、并发吞吐、不同 API 计费方式都可能影响最终收益。第三,如何让控制 token 的决策更稳定、更可解释,也很重要;毕竟生产系统里,最怕的不是偶尔省钱,而是偶尔乱省钱。
如果把这篇论文放到更大的图景里看,它其实在回答一个很现实的问题:当大模型越来越贵、越来越像基础设施时,行业到底该怎么用它?答案不是“能不用就不用”,而是“把调用权交给模型自己,让它学会在合适的时刻请求更强的帮助”。这听起来像一句口号,但 PyroDash 至少把它做成了一个可训练、可评估、可调参的系统。
论文还讨论了几个未来方向。一是将 τoff 扩展为多个控制 token,对应不同级别的求助(如“需要提示”、“需要部分重写”、“需要完全重做”),从而让大模型的介入更加精细化。二是探索在非自回归生成场景下的协同推理,例如在代码生成或文本摘要任务中,小模型先生成结构框架,大模型再填充细节。三是将成本建模从简单的 token 计数扩展到更复杂的因素,如推理延迟、GPU 内存占用、API 并发限制等,使奖励函数更贴近真实部署环境。这些方向如果都能落地,协同推理的实用价值还会再上一个台阶。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“小模型什么时候该把任务交给大模型”这个现实问题。不是整题路由,而是在生成过程中按 token 判断是否需要接力,并且把这个判断训练成小模型自己的能力。

τoff 是什么意思?它是一个控制 token,英文可理解为 offloading token,中文就是“卸载/交接信号”。小模型一旦生成它,协同引擎就知道该终止小模型继续生成,把当前问题和已有推理过程交给大模型完成。

为什么这套方法看起来更适合落地?因为它不要求访问大模型 logits,也不要求重训大模型,甚至只需要一次 handoff。对很多只能调用 API 的场景来说,这种“黑盒可用”的设计,比那些必须深度改造推理栈的方案更现实。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把 token 级协同推理、单次交接和成本感知强化学习揉在一起,思路完整,且很贴近真实部署。

实验合理度:★★★★☆

用数学推理任务验证“何时接力”很合适,而且同时看准确率和成本,评价维度比较诚实。

学术研究价值:★★★★☆

它不只是做一个路由器,而是在探索协同推理的训练范式,对后续系统设计有启发。

稳定性:★★★☆☆

单次交接降低了系统复杂度,但对小模型中间推理质量依赖较强,泛化到更杂任务还要看。

适应性以及泛化能力:★★★☆☆

在数学推理上表现不错,但是否能稳稳推广到代码、问答、长文分析,还需要更多证据。

硬件需求及成本:★★★★☆

训练阶段仍有 RL 成本,但推理侧只需小模型先跑、必要时单次调用大模型,部署成本很有吸引力。

复现难度:★★★☆☆

方法链条不算短,涉及数据构造、三阶段训练和成本建模;如果代码和数据不全开,复现门槛不会低。

产品化成熟度:★★★☆☆

在 API 受限、成本敏感、任务以推理为主的场景可用,但要进更广泛生产线,还得补稳定性和任务覆盖。

可能的问题:方法很聪明,但强依赖小模型的中间推理质量,且评测主要集中在数学任务上,离“全场景通吃”还有距离。


主要参考文献

Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding. PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference. arXiv:2607.20327v1, 2026.
论文原文:https://arxiv.org/pdf/2607.20327v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
想看更多“让小模型少花钱还不掉链子”的论文,来群里继续聊 🤘
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。