← 返回 PaperDaily
大模型与智能体
告别人工脚手架!Spiral端到端训练模型自己搜索和聚合,递归自聚合效果惊艳
很多模型训练时只学顺序推理,一到测试却靠人工搭脚手架(并行采样+投票)来提分,中间有个巨大的“训练-测试”鸿沟。斯坦福这篇Spiral颠覆性地用集合强化学习,让模型边训练边学会如何搜索和如何聚合,把整个推理过程端到端打通了。效果非常硬核,4B模型推理效率吊打传统方法11倍,不愧是Chelsea Finn和Noah Goodman团队的新作!
龙哥读论文
发布于 2026-08-25 00:20:07
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 很多模型训练时只学顺序推理,一到测试却靠人工搭脚手架(并行采样+投票)来提分,中间有个巨大的“训练-测试”鸿沟。斯坦福这篇Spiral颠覆性地用集合强化学习,让模型边训练边学会如何搜索和如何聚合,把整个推理过程端到端打通了。效果非常硬核,4B模型推理效率吊打传统方法11倍,不愧是Chelsea Finn和Noah Goodman团队的新作!
原论文信息如下:
从“我思”到“我们思”:AI推理的进化之路
想象一下你是一个学霸,面对一道极难的数学题。你会怎么做?
通常是:先自己埋头苦想(顺序推理 ),想不出来就换几个不同的思路同时探索(并行推理 ),最后把这些思路整合起来看看哪个最靠谱(聚合推理 )。这三种推理方式,合起来就是解决复杂问题的核心手段。
当前的AI大模型呢?它们在训练阶段几乎只练“顺序推理”——也就是单条思维链(Chain-of-Thought)。开发者甩给它一个问题,模型必须在一个回答里把推理串完,然后根据最终答案给奖励。但一到了测试(推理)阶段,大家发现光靠一条链不够,于是赶紧人工搭脚手架:并行采多个答案再投票、或者让模型自己再聚合一遍。这就像把一个只会死记硬背的学生送到解题大赛,临时告诉他“你可以问同桌、可以翻书”——但他根本就没练过怎么跟别人配合、怎么筛选信息。结果可想而知:算力给得再多,模型也经常在原地踏步。
这个痛点,正是斯坦福大学最新论文 SPIRAL: Learning to Search and Aggregate 要解决的。论文团队(包括 Chelsea Finn 和 Noah Goodman 等大佬)提出了一套革命性的训练框架,让大模型在训练过程中就学会如何使用这三种推理原语,把原本需要人工设计的搜索与聚合策略,内化为模型自身的能力。结果非常炸裂:在一个4B参数的小模型上,推理效率最高提升了11倍 ,性能猛涨15% !
困局:算力砸下去,模型却“原地踏步”?
你可能觉得:给模型更多算力(比如允许它输出更多推理token),它不就能更好了吗?事实令人沮丧。论文里明确指出,在顺序计算缩放时,模型经常把预算浪费在细枝末节,把复杂的关键推理稀里糊涂一笔带过。当并行采样多个推理路径时,模型又容易陷入重复造轮子,采出来的答案高度相似,根本无法探索多样解法。最后,当让模型当裁判去合成多个答案时,它连基本的验证、筛选、融合都做不好,更别说从一堆烂方案里妙手回春了。
打个比方,你把一个只会写“独自推导”的学生,强行塞进一个需要团队协作的科研项目。他要么一个人闷头硬干,要么胡乱抄几篇论文凑一起,最后得到一堆没用的草稿。这时候再多的算力(比如让他加班通宵)也只是做无用功。
根本原因在于:训练和测试之间存在一道鸿沟 。目前的强化学习范式(如GRPO)只优化单一轨迹(顺序推理),而测试时却要用到并行和聚合。模型在训练中从未见过这些操作,它怎么可能在测试时无师自通?所以业界只能靠手工设计复杂的“脚手架”(比如AlphaEvolve、Mixture-of-Agents)来强行弥补。
这可不是小问题——它制约了整个AI推理的上限。难道就没办法让模型自己学会搜索和聚合吗?斯坦福团队说:能 。
破局者Spiral:训练模型成为自己的“搜索与聚合”大师!
Spiral (Sequential-Parallel-Aggregative Reinforcement Learning)的核心思想极其优雅:在训练阶段,就同时让模型接触并使用这三种推理原语,并通过统一的强化学习目标端到端优化,让模型自己学会如何搜、如何聚。
具体来说,Spiral的目标是最大化下面这个期望(公式截图):
不过,直接用标准强化学习优化这个目标会遇到两个问题:第一,奖励是基于轨迹集合的,不是基于单条轨迹;第二,目标函数本身可能不可微。Spiral巧妙地拆解了梯度,得到两项:一项是集合强化学习梯度(优化搜索轨迹),一项是标准强化学习梯度(优化聚合轨迹)。这两个梯度自然耦合,形成一种协同进化——搜索轨迹努力生成对聚合有用的集合,聚合轨迹努力从给定集合中萃取出最优答案。
神之一手:集合强化学习如何让模型学会“团队合作”?
你可能要问:凭什么让模型自己学会搜索和聚合?这里的关键技术是集合强化学习 (Set Reinforcement Learning, Set RL)。
常规RL给每条轨迹一个独立的优势值。但集合RL给整个集合一个奖励,然后所有属于该集合的轨迹共享这个奖励信号。这意味着:如果某个搜索轨迹单独看可能是错的,但因为它为聚合提供了必要的多样性线索,让聚合步骤能产生正确答案,那么它也会得到正面反馈。这就鼓励模型去“探索广泛,并且输出对团队有益的多样性”,而不是一味追求单个轨迹的正确。
具体算法中,Spiral对搜索轨迹使用集合RL的梯度估计,对聚合轨迹使用标准RL的带基线优势。公式如下:
这种设计还有一个额外好处:训练时模型只学了两步的搜索-聚合,但在测试时可以递归式地反复应用 (即递归自聚合)。后面的实验会证明,这种策略带来了巨大的额外增益。
实验揭秘:Spiral如何实现11倍效率飞跃?
实验部分用数据说话,相当硬核。团队选用Qwen3-4b-Instruct-2507作为基座模型,在一个数学推理数据集POLARIS-53k的子集上,用Spiral训练2个epoch,并与GRPO进行严格公平对比——保证每个问题使用的推理token总数一样。
先看平行计算缩放下的pass@k结果(图3)。这里模型只被允许独立采样答案,没有聚合——纯看搜索能力。Spiral的曲线随着k增加一路高歌猛进,而GRPO很快饱和。在测试集上,Spiral的缩放效率最高达到GRPO的11倍 !
为什么会这样?再看训练过程中的token级熵(图5)。GRPO的熵迅速坍缩,模型很快就锁死在一两种方法上;而Spiral的搜索轨迹始终保持高熵,意味着它一直在探索多样化的解题思路。
更重磅的是递归自聚合(RSA)的测试结果(图4)。模型使用两阶段策略:先并行采样一批候选,然后分组用模型聚合,再对聚合结果反复迭代。这是真正考验“搜索+聚合”综合能力的场景。Spiral在递归步骤增加时稳步提升,最终比GRPO高出最多13%的绝对准确率 ,比不训练的基座模型更是碾压。
此外,在顺序计算缩放(图6)中,Spiral同样把GRPO甩在后面,说明它不仅学会了搜索聚合,连单条思维链的质量也提升了。在并行轨迹缩放(图7)中,Spiral配合模型自聚合甚至击败了多数投票(Majority Voting)这个强基线。
未来可期:迈向通用推理智能的“下一步”
Spiral目前主要针对数学推理任务,但它的基本原理——让模型在训练中同时接触并优化三个推理原语——具有极强的通用性。可以想象,未来在代码生成、科学发现、多轮对话等需要复杂推理的场景中,Spiral都能发挥作用。
论文中的一些限制也很坦诚:当前训练时只用了固定大小的集合(n个搜索轨迹),而测试时可以缩放。此外,集合强化学习的无偏性证明依赖于轨迹的顺序随机性,实际模型可能存在顺序偏差,不过实验表明影响不大。未来工作可以考虑动态集合大小、多步递归聚合的训练,以及扩展到更多样化的任务和更大的模型。
最让龙哥心动的是:Spiral提供了一个简单而优雅的方案,让模型从“我思”进化到“我们思”。这种进化可能是通往更强AI推理能力的关键一步。
龙迷三问
Spiral和普通的并行采样+多数投票有什么区别? 多数投票是事后规则,不参与训练;Spiral在训练中就让模型学会如何生成适合聚合的搜索轨迹,并学会如何聚合,所以效果远超多数投票。而且Spiral可以递归自聚合,多数投票不能。
集合强化学习中的“集合优势”具体怎么理解? 就是一个搜索轨迹的“团队贡献分”。如果包含当前轨迹的集合能帮助模型聚合出正确答案,那么这条轨迹就得到正优势;如果它所在的集合都表现不佳,则负优势。这迫使模型去探索能互补的多样方案,而不是追求每一条都正确。
Spiral需要两个不同的模型吗?训练成本高吗? 论文中默认使用同一个模型生成搜索轨迹和聚合轨迹(参数共享),也可以分开。训练成本与GRPO差不多,因为总token预算保持一致(只是分配给了搜索和聚合两部分)。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
将集合强化学习引入推理训练,整合三个原语端到端优化,idea很新颖。但集合强化学习本身是前人工作,Spiral是其巧妙应用,并非全原创。
实验合理度: ★★★★★
对比实验设计严谨,严格保证相同token预算,测试了多种缩放维度,统计数据丰富,结果可信度高。
学术研究价值: ★★★★★
打开了“训练时学习推理策略”的新方向,为后续研究提供了框架和基准。集合强化学习在推理中的使用值得深入探索。
稳定性: ★★★★☆
训练过程中熵保持较高,说明策略不易过早收敛。但测试时依赖递归自聚合的稳定性有待更大规模验证。
适应性以及泛化能力: ★★★★☆
当前只在数学推理上验证,但框架可推广到代码、科学推理等。不过需要更多任务验证。
硬件需求及成本: ★★★☆☆
训练时需要采样多条搜索轨迹和聚合轨迹,显存要求较高。但推理时可根据算力灵活缩放,成本可控。
复现难度: ★★★★★
论文详细给出了算法伪代码、超参数和开源计划(附有标准基座模型和数据集)。复现难度低。
产品化成熟度: ★★★☆☆
实验基于4B模型,对复杂数学问题有效。要落地到对话、代码等场景还需适配,产品化尚需时日。
可能的问题: 论文只在数学推理上评测,缺乏其他任务的泛化验证;训练的集合大小固定,与测试时灵活的递归缩放不完全匹配;集合优势的无偏性证明假设排列可交换性,语言模型的顺序偏差可能引入轻微偏差。
主要参考文献
[1] Hamid, J.I., Orney, I.H., Li, M.Y., et al. SPIRAL: Learning to Search and Aggregate. arXiv:2606.23595, 2026.
[2] Shao, Z., Wang, P., Zhu, Q., et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning with Open-Source Language Models. arXiv:2402.03300, 2024. (GRPO)
[3] Hou, B., Ouyang, Y., et al. Set Reinforcemenet Learning. arXiv, 2026.
[4] Verman, A., Jindal, M., et al. Recursive Self-Aggregation for Language Model Reasoning. arXiv, 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
想让你的大模型也学会“多线程思考”和“团队合作”?扫码加入龙哥读论文粉丝群,一起探讨最前沿的推理优化技术!
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 LLM推理+上海+复旦+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群