← 返回 PaperDaily 大模型与智能体

告别人工脚手架!Spiral端到端训练模型自己搜索和聚合,递归自聚合效果惊艳

很多模型训练时只学顺序推理,一到测试却靠人工搭脚手架(并行采样+投票)来提分,中间有个巨大的“训练-测试”鸿沟。斯坦福这篇Spiral颠覆性地用集合强化学习,让模型边训练边学会如何搜索和如何聚合,把整个推理过程端到端打通了。效果非常硬核,4B模型推理效率吊打传统方法11倍,不愧是Chelsea Finn和Noah Goodman团队的新作!

告别人工脚手架!Spiral端到端训练模型自己搜索和聚合,递归自聚合效果惊艳
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
很多模型训练时只学顺序推理,一到测试却靠人工搭脚手架(并行采样+投票)来提分,中间有个巨大的“训练-测试”鸿沟。斯坦福这篇Spiral颠覆性地用集合强化学习,让模型边训练边学会如何搜索和如何聚合,把整个推理过程端到端打通了。效果非常硬核,4B模型推理效率吊打传统方法11倍,不愧是Chelsea Finn和Noah Goodman团队的新作!


原论文信息如下:
论文标题:
SPIRAL: Learning to Search and Aggregate
发表日期:
2026年06月
发表单位:
Stanford University
原文链接:
https://arxiv.org/pdf/2606.23595v1.pdf

从“我思”到“我们思”:AI推理的进化之路

想象一下你是一个学霸,面对一道极难的数学题。你会怎么做?
通常是:先自己埋头苦想(顺序推理),想不出来就换几个不同的思路同时探索(并行推理),最后把这些思路整合起来看看哪个最靠谱(聚合推理)。这三种推理方式,合起来就是解决复杂问题的核心手段。
当前的AI大模型呢?它们在训练阶段几乎只练“顺序推理”——也就是单条思维链(Chain-of-Thought)。开发者甩给它一个问题,模型必须在一个回答里把推理串完,然后根据最终答案给奖励。但一到了测试(推理)阶段,大家发现光靠一条链不够,于是赶紧人工搭脚手架:并行采多个答案再投票、或者让模型自己再聚合一遍。这就像把一个只会死记硬背的学生送到解题大赛,临时告诉他“你可以问同桌、可以翻书”——但他根本就没练过怎么跟别人配合、怎么筛选信息。结果可想而知:算力给得再多,模型也经常在原地踏步。
这个痛点,正是斯坦福大学最新论文 SPIRAL: Learning to Search and Aggregate 要解决的。论文团队(包括 Chelsea FinnNoah Goodman 等大佬)提出了一套革命性的训练框架,让大模型在训练过程中就学会如何使用这三种推理原语,把原本需要人工设计的搜索与聚合策略,内化为模型自身的能力。结果非常炸裂:在一个4B参数的小模型上,推理效率最高提升了11倍,性能猛涨15%
封面
封面:Spiral在推理计算缩放上的惊人表现

困局:算力砸下去,模型却“原地踏步”?

你可能觉得:给模型更多算力(比如允许它输出更多推理token),它不就能更好了吗?事实令人沮丧。论文里明确指出,在顺序计算缩放时,模型经常把预算浪费在细枝末节,把复杂的关键推理稀里糊涂一笔带过。当并行采样多个推理路径时,模型又容易陷入重复造轮子,采出来的答案高度相似,根本无法探索多样解法。最后,当让模型当裁判去合成多个答案时,它连基本的验证、筛选、融合都做不好,更别说从一堆烂方案里妙手回春了。
打个比方,你把一个只会写“独自推导”的学生,强行塞进一个需要团队协作的科研项目。他要么一个人闷头硬干,要么胡乱抄几篇论文凑一起,最后得到一堆没用的草稿。这时候再多的算力(比如让他加班通宵)也只是做无用功。
根本原因在于:训练和测试之间存在一道鸿沟。目前的强化学习范式(如GRPO)只优化单一轨迹(顺序推理),而测试时却要用到并行和聚合。模型在训练中从未见过这些操作,它怎么可能在测试时无师自通?所以业界只能靠手工设计复杂的“脚手架”(比如AlphaEvolve、Mixture-of-Agents)来强行弥补。
这可不是小问题——它制约了整个AI推理的上限。难道就没办法让模型自己学会搜索和聚合吗?斯坦福团队说:

破局者Spiral:训练模型成为自己的“搜索与聚合”大师!

Spiral(Sequential-Parallel-Aggregative Reinforcement Learning)的核心思想极其优雅:在训练阶段,就同时让模型接触并使用这三种推理原语,并通过统一的强化学习目标端到端优化,让模型自己学会如何搜、如何聚。
图1给出了一目了然的框架总览。
图1:Spiral总览
图1:Spiral框架总览。上半部分是训练流程:对同一个问题x,模型首先独立采样n条并行推理轨迹(search traces),然后把它们作为上下文,生成一条聚合轨迹y*。只有最终答案y*才会得到奖励r(x,y*)。利用这个奖励,Spiral通过集合强化学习(Set RL)优化并行轨迹,通过标准强化学习优化聚合轨迹。下半部分是测试时缩放效果:Spiral在三个原语都缩放时,性能远超GRPO。
具体来说,Spiral的目标是最大化下面这个期望(公式截图):
公式:Spiral目标函数
其中 π_θ 是生成搜索轨迹的策略,π_φ 是生成聚合轨迹的策略(可以是同一个模型,也可以是两个不同的模型)。r(x, y*) 是最终答案的奖励。这个公式很优雅:只有最终答案被奖励,但梯度同时反传给了搜索轨迹和聚合轨迹,从而让模型自组织出高效的搜索-聚合策略。
不过,直接用标准强化学习优化这个目标会遇到两个问题:第一,奖励是基于轨迹集合的,不是基于单条轨迹;第二,目标函数本身可能不可微。Spiral巧妙地拆解了梯度,得到两项:一项是集合强化学习梯度(优化搜索轨迹),一项是标准强化学习梯度(优化聚合轨迹)。这两个梯度自然耦合,形成一种协同进化——搜索轨迹努力生成对聚合有用的集合,聚合轨迹努力从给定集合中萃取出最优答案。

神之一手:集合强化学习如何让模型学会“团队合作”?

你可能要问:凭什么让模型自己学会搜索和聚合?这里的关键技术是集合强化学习(Set Reinforcement Learning, Set RL)。
常规RL给每条轨迹一个独立的优势值。但集合RL给整个集合一个奖励,然后所有属于该集合的轨迹共享这个奖励信号。这意味着:如果某个搜索轨迹单独看可能是错的,但因为它为聚合提供了必要的多样性线索,让聚合步骤能产生正确答案,那么它也会得到正面反馈。这就鼓励模型去“探索广泛,并且输出对团队有益的多样性”,而不是一味追求单个轨迹的正确。
Spiral的数据采集流程如图2所示。
图2:Spiral数据采集流程
图2:Spiral数据采集流程。模型先从问题x采样N1条搜索轨迹,然后均匀采样K个大小为n的集合。对每个集合Gi,再采样N2条聚合轨迹。奖励只在聚合轨迹结束时计算。
具体算法中,Spiral对搜索轨迹使用集合RL的梯度估计,对聚合轨迹使用标准RL的带基线优势。公式如下:
首先定义集合目标函数:
公式:f_spiral定义
这表示一组搜索轨迹y_1:n的“集体质量”——即它们作为上下文时,聚合轨迹能获得的期望奖励。
然后利用这个集合目标计算集合优势和边际优势:
公式:集合优势
其中f^hat_spiral(x)是基线,平均所有集合的质量。
公式:边际优势
边际集优势A^sharp_marg(x,y) 是对于每个搜索轨迹y,取包含它的所有集合的集合优势的平均值。这个信号告诉模型:你作为一员,在那些能成功聚合的贡献组里表现如何。
对于聚合轨迹,优势计算非常简单:
公式:聚合轨迹优势
用当前集合内的平均奖励作为基线,这是低方差的做法。
这种设计还有一个额外好处:训练时模型只学了两步的搜索-聚合,但在测试时可以递归式地反复应用(即递归自聚合)。后面的实验会证明,这种策略带来了巨大的额外增益。

实验揭秘:Spiral如何实现11倍效率飞跃?

实验部分用数据说话,相当硬核。团队选用Qwen3-4b-Instruct-2507作为基座模型,在一个数学推理数据集POLARIS-53k的子集上,用Spiral训练2个epoch,并与GRPO进行严格公平对比——保证每个问题使用的推理token总数一样。
先看平行计算缩放下的pass@k结果(图3)。这里模型只被允许独立采样答案,没有聚合——纯看搜索能力。Spiral的曲线随着k增加一路高歌猛进,而GRPO很快饱和。在测试集上,Spiral的缩放效率最高达到GRPO的11倍
图3:pass@k评估
图3:pass@k评估。x轴是独立采样次数k,y轴是测试集覆盖率。Spiral(蓝色)随k增加持续提升,GRPO(红色)则快速进入平台期。11倍的效率提升意味着,要达到相同覆盖率,Spiral需要的采样次数仅为GRPO的1/11。
为什么会这样?再看训练过程中的token级熵(图5)。GRPO的熵迅速坍缩,模型很快就锁死在一两种方法上;而Spiral的搜索轨迹始终保持高熵,意味着它一直在探索多样化的解题思路。
图5:训练熵对比
图5:训练过程中的token级熵。Spiral(蓝色)的搜索轨迹熵远高于GRPO(红色),表明模型在训练中学会了保持多样的探索。
更重磅的是递归自聚合(RSA)的测试结果(图4)。模型使用两阶段策略:先并行采样一批候选,然后分组用模型聚合,再对聚合结果反复迭代。这是真正考验“搜索+聚合”综合能力的场景。Spiral在递归步骤增加时稳步提升,最终比GRPO高出最多13%的绝对准确率,比不训练的基座模型更是碾压。
图4:递归自聚合下pass@1
图4:递归自聚合下pass@1。Spiral(蓝色)随聚合步数增加显著提升,GRPO(红色)几乎不变,基座模型(绿色)也平平。
此外,在顺序计算缩放(图6)中,Spiral同样把GRPO甩在后面,说明它不仅学会了搜索聚合,连单条思维链的质量也提升了。在并行轨迹缩放(图7)中,Spiral配合模型自聚合甚至击败了多数投票(Majority Voting)这个强基线。
图6:顺序计算缩放对比
图6:顺序计算缩放。x轴是允许的最大token数,y轴是pass@1。Spiral(蓝)始终优于GRPO(红)。
图7:并行轨迹缩放对比
图7:并行轨迹缩放。Spiral配合自聚合(深红)远超GRPO的多数投票(棕色)和自聚合(粉),直逼pass@1上限。
训练超参数见下表。
表1:训练超参数
表1:训练超参数。Spiral和GRPO使用了相同的总token预算。

未来可期:迈向通用推理智能的“下一步”

Spiral目前主要针对数学推理任务,但它的基本原理——让模型在训练中同时接触并优化三个推理原语——具有极强的通用性。可以想象,未来在代码生成、科学发现、多轮对话等需要复杂推理的场景中,Spiral都能发挥作用。
论文中的一些限制也很坦诚:当前训练时只用了固定大小的集合(n个搜索轨迹),而测试时可以缩放。此外,集合强化学习的无偏性证明依赖于轨迹的顺序随机性,实际模型可能存在顺序偏差,不过实验表明影响不大。未来工作可以考虑动态集合大小、多步递归聚合的训练,以及扩展到更多样化的任务和更大的模型。
最让龙哥心动的是:Spiral提供了一个简单而优雅的方案,让模型从“我思”进化到“我们思”。这种进化可能是通往更强AI推理能力的关键一步。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Spiral和普通的并行采样+多数投票有什么区别?多数投票是事后规则,不参与训练;Spiral在训练中就让模型学会如何生成适合聚合的搜索轨迹,并学会如何聚合,所以效果远超多数投票。而且Spiral可以递归自聚合,多数投票不能。

集合强化学习中的“集合优势”具体怎么理解?就是一个搜索轨迹的“团队贡献分”。如果包含当前轨迹的集合能帮助模型聚合出正确答案,那么这条轨迹就得到正优势;如果它所在的集合都表现不佳,则负优势。这迫使模型去探索能互补的多样方案,而不是追求每一条都正确。

Spiral需要两个不同的模型吗?训练成本高吗?论文中默认使用同一个模型生成搜索轨迹和聚合轨迹(参数共享),也可以分开。训练成本与GRPO差不多,因为总token预算保持一致(只是分配给了搜索和聚合两部分)。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将集合强化学习引入推理训练,整合三个原语端到端优化,idea很新颖。但集合强化学习本身是前人工作,Spiral是其巧妙应用,并非全原创。

实验合理度:★★★★★

对比实验设计严谨,严格保证相同token预算,测试了多种缩放维度,统计数据丰富,结果可信度高。

学术研究价值:★★★★★

打开了“训练时学习推理策略”的新方向,为后续研究提供了框架和基准。集合强化学习在推理中的使用值得深入探索。

稳定性:★★★★☆

训练过程中熵保持较高,说明策略不易过早收敛。但测试时依赖递归自聚合的稳定性有待更大规模验证。

适应性以及泛化能力:★★★★☆

当前只在数学推理上验证,但框架可推广到代码、科学推理等。不过需要更多任务验证。

硬件需求及成本:★★★☆☆

训练时需要采样多条搜索轨迹和聚合轨迹,显存要求较高。但推理时可根据算力灵活缩放,成本可控。

复现难度:★★★★★

论文详细给出了算法伪代码、超参数和开源计划(附有标准基座模型和数据集)。复现难度低。

产品化成熟度:★★★☆☆

实验基于4B模型,对复杂数学问题有效。要落地到对话、代码等场景还需适配,产品化尚需时日。

可能的问题:论文只在数学推理上评测,缺乏其他任务的泛化验证;训练的集合大小固定,与测试时灵活的递归缩放不完全匹配;集合优势的无偏性证明假设排列可交换性,语言模型的顺序偏差可能引入轻微偏差。


主要参考文献

[1] Hamid, J.I., Orney, I.H., Li, M.Y., et al. SPIRAL: Learning to Search and Aggregate. arXiv:2606.23595, 2026.
[2] Shao, Z., Wang, P., Zhu, Q., et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning with Open-Source Language Models. arXiv:2402.03300, 2024. (GRPO)
[3] Hou, B., Ouyang, Y., et al. Set Reinforcemenet Learning. arXiv, 2026.
[4] Verman, A., Jindal, M., et al. Recursive Self-Aggregation for Language Model Reasoning. arXiv, 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
想让你的大模型也学会“多线程思考”和“团队合作”?扫码加入龙哥读论文粉丝群,一起探讨最前沿的推理优化技术!
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 LLM推理+上海+复旦+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。