← 返回 PaperDaily 大模型与智能体

港科大新研究:只更新10%Token,推理能力飙升15%,告别盲目探索!

训练大模型就像带兵打仗,胡子眉毛一把抓只会越训越乱,熵塌陷了解一下?港科大的这篇论文发现了其中的“关键少数”——那些在分布上偏离群体平均的Token才是决定推理方向的决策节点。这套方法原理漂亮,效果更惊艳,只更新10%的Token反而吊打全量训练,是RLVR领域的一股清流。一起来看!

港科大新研究:只更新10%Token,推理能力飙升15%,告别盲目探索!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
训练大模型就像带兵打仗,胡子眉毛一把抓只会越训越乱,熵塌陷了解一下?港科大的这篇论文发现了其中的“关键少数”——那些在分布上偏离群体平均的Token才是决定推理方向的决策节点。这套方法原理漂亮,效果更惊艳,只更新10%的Token反而吊打全量训练,是RLVR领域的一股清流。一起来看!


原论文信息如下:
论文标题:
Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning
发表日期: 2026年06月
发表单位: 香港科技大学,四川大学,香港理工大学
原文链接: https://arxiv.org/pdf/2606.19771v1.pdf
开源代码链接: 暂无

Token更新也有“二八定律”?独家揭秘LLM推理的“关键少数”节点

大语言模型的推理能力,真是越来越让人上头了。从数学解题到程序生成,LLM表现出的“推理”能力让人惊叹。但各位龙迷有没有想过一个问题:我们在用强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)去训练模型推理的时候,到底是哪一部分Token在真正起着“关键先生”的作用?
传统的做法,大家习惯了一视同仁——把生成的每一个Token都用同样的强度去更新。但这样真的好吗?港科大、川大和港理工的研究人员这篇最新的论文,就狠狠地捅破了这层窗户纸。他们发现,在RLVR的训练中,其实存在着一个“二八定律”:真正决定模型推理方向和探索策略的,只有那百分之十左右的“独特Token”。
想象一下,整个推理链条就像一个迷宫,那些大多数Token都是在直线上行走,而所谓的“独特Token”则是站在岔路口的“关键节点”。你走哪条路,全靠它来抉择。那么问题来了,如何才能精准定位这些“关键节点”,而不是被那些无效的“盲走Token”干扰呢?

熵的“两面性”:盲目探索 vs. 导向探索

现有的RLVR方法,大部分在更新模型参数时,都是对每个Token“平均用力”。这种做法最直接的后果是,会导致一个叫“熵塌陷”(Entropy Collapse)的问题。就是模型的策略会过早地“固化”,局限在局部最优解的圈子里,失去了扩展新路径的能力。
为了对抗这个问题,有人提出了用香农熵(Shannon Entropy)来选择高熵的Token,希望通过增加不确定性来促进探索。但事情真有这么简单吗?
事实上,这里有个非常反直觉的坑。论文指出,香农熵仅仅是一个标量值,它只能告诉你“不确定的程度”,却不能告诉你“该往哪个方向去探索”。更坑的是,两个概率分布可能拥有完全相同的香农熵,但它们的本质和走向却可能千差万别。
图1:盲目探索与导向探索的对比
图1:盲目探索与导向探索的对比。左图显示,不同的概率分布可能产生相同的香农熵,这会导致盲目探索;右图显示,ICT框架通过分布属性识别关键分支点,实现导向探索,稳定收敛。
如图1所示,单纯依靠香农熵来引导探索,就如同蒙上眼睛在森林里乱跑,看起来你走了很多路,但其实只是在原地打转(如图中橙色曲线),最终导致“熵爆炸”(Entropy Explosion),模型推理链变得杂乱无章,甚至忘记了原本的目标。而一种更好的策略,应该是导向探索,精准识别出那些决定未来走向的关键节点(如图中红色曲线)。本篇论文,正是冲着解决这个矛盾来的。

打破沙漏:从“香农熵”到“分布特性”的范式转变

面对香农熵这个“信号放大器”的失灵,论文的核心贡献就是提出了一个全新的视角:与其去关注一个标量的“不确定度”,不如去看看Token内部概率分布的形态。论文中核心引用了信息论的一个基本概念——自信息(Self-Information),即一个事件发生的概率越小,它携带的信息量就越大。
基于此,论文有了一个非常漂亮的定义:一个Token的“独特性”(Uniqueness),体现在其logit概率分布对于序列平均分布的“偏离程度”上。 简单说,如果一个Token的预测输出,和同组其他Token的平均水平“画风”完全不同,那它大概率就是一个关键决策节点!
为了衡量这种“偏离”,论文采用了Jensen-Shannon散度(JS散度),这是一种用来衡量两个概率分布之间差异的对称性度量。它比KL散度更稳定,取值在0到log2之间,非常适合用来做Token的筛选。
这个思路可以说是突破了传统思维的瓶颈。以往我们关注的是“词”本身的不确定性,而这里关注的是“词”在整个推理结构中的“功能角色”。这种从标量到结构的跃迁,是这篇论文最根本的亮点。

理论基石:仅更新“独特令牌”如何调控探索?

光有直觉是不够的,论文还提供了非常扎实的数学理论分析。为了回答“为什么只更新独特Token就能有效”这个核心问题,论文引入了二阶Rényi熵(H2)
为什么用它而不是香农熵?因为H2基于碰撞概率(Collision Probability),对概率质量的“集中度”更敏感,它能更稳定地刻画模型策略的探索-利用权衡,而不是被那些长尾的低概率噪音干扰。
论文定义了一个关键的动态阈值——策略纯度(Strategy Purity)β(π),也就是当前策略的碰撞概率。然后,所有Token被分为两个阵营:
高置信度Token(RH:π(a) > β(π)):更新这些Token会降低H2,导致“熵塌陷”,让模型策略固化。
低置信度Token(RL:π(a) < β(π)):更新这些Token会增加H2,导致“熵爆炸”,让模型策略变得混乱。
图2:基于ICT的稀疏强化学习框架
图2:基于ICT的稀疏强化学习框架。
论文的核心理论在于:如果一个Token的更新既不属于纯粹的RH阵营,也不属于纯粹的RL阵营,而是介于两者之间,那么对这种“独特Token”的更新就能维持H2的平衡,从而同时规避“熵塌陷”和“熵爆炸”的风险。 理论证明,当Token概率接近策略纯度阈值时,其熵梯度会趋于中性。这就解释了,为什么只更新这10%的Token,就能有效引导探索。

实践验证:只更新10%的Token,效果翻倍!

理论很漂亮,那实战结果如何?研究人员在Qwen2.5(0.5B、1.5B、7B)模型上进行了一系列详尽的实验,与GRPO、20-Entropy和STAPO三种强基线模型进行了对比。
在包含数学推理、常识问答、奥林匹克竞赛在内的7个基准测试集上,ICT(独立组合Token,Independent Combinatorial Tokens)框架的表现简直可以用“惊艳”来形容!只更新10%的独特Token,就能在全参数训练的基础上实现平均pass@4提升4.58%,最高提升14.9%。而且,这个效果的提升不是偶然的,它随着模型规模的增大而变得更加显著。
表1:不同模型大小和基准的性能比较
表1:不同模型大小和基准的性能比较。ICT在所有模型规模上一致取得最高平均分,尤其是pass@4指标的大幅提升,证明了其强大的探索能力。
从表1可以看到,ICT不仅在数学题(Math500, GSM8K)上表现优异,甚至在非数学领域(如GPQA)也能取得不错的泛化效果。论文分析道,这个提升主要在PS@4上,说明ICT产生了更丰富、更多样化的正确推理路径,而不是千篇一律的重复方案。这正印证了“导向探索”的威力。
那么,这个“10%”的比例是怎么选出来的?论文通过消融实验展示了不同更新比例的对比,印证了“10%”这个最优阈值。
表2:不同更新比例的性能比较
表2:不同更新比例的性能比较。更新10%的独特Token性能最佳,超过20%和30%的比例。
图3和图4
图3:不同更新比例下奖励曲线的对比。结果显示,10%独特Token更新策略(红色)能获得最高的稳定奖励。图4:MATH和GSM8K数据集中独特Token的高熵与低熵比例。独特Token中高低熵Token的比例约是1:1,印证了理论中的平衡熵动力学。
从图3可以看出,更新10%的独特Token(红色曲线)不仅收敛快,而且最终奖励最高。而如果只更新随机或非独特的Token(绿色曲线),效果则会非常差。这充分说明,真正重要的就是那10%的“关键少数”。
图5:排序后的JS散度得分
图5:排序后的Jensen-Shannon散度得分。红色虚线标记了10%的阈值,在此阈值处Token的独特性急剧增加。这从经验层面证明了ICT分布选择器选择最独特Token的合理性。
而且,论文还巧妙地揭示了更新机制:对比图4中的数据,可以发现这些独特Token中,高熵和低熵Token的比例几乎是1:1。这正是理论分析的奇妙之处——它在“熵塌陷”和“熵爆炸”这两个极端之间实现了精准的中点平衡。

总结与展望:高效RLVR的“Token主义”

《Beyond Entropy》这篇论文,可以说给苦涩的RLVR训练指了一条“明路”。它不再依赖于粗暴的、对每个Token“一视同仁”的全量更新,而是提出了一个优雅且极具启发性的观点:在推理过程中,少数关键Token支配了优化的绝大部分收益。这让人不禁大呼——这才是真正的“用魔法打败魔法”!
这项工作的意义不止于“节省算力”,它实质上是对RLVR算法设计哲学的一次深刻重塑。 它告诉我们,不应该盲目地去控制一个全局的标量熵值,而应该深入到Token这个分子层面,从分布上理解模型的行为。未来的方向或许会更加专注于如何把这些“关键少数”Token的结构特性(比如它们在语言和逻辑上的角色)更直接地融合进训练目标中,而不是仅仅依赖于一个数学指标。
就像论文里说的,这项工作建立了一个“以Token为中心”(token-centric)的RLVR基础。这为我们打开了一扇新的窗户:也许未来更强大的推理模型,就在对那10%的“关键少数”的更精细化训练中产生。告别庞大的算力浪费,拥抱精准的“Token主义”,或许是接下来LLM训练的又一波大趋势。对于任何致力于提升LLM推理能力的团队来说,这篇论文都是绝对绕不开的硬核读物!

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

为什么香农熵不行,而JS散度可以?香农熵只是一个标量,它衡量的是分布整体的“混乱”程度,但是两个形状完全不同的分布可以拥有相同的熵,这就像两个不同性格的人体重一样,单看体重完全无法判断谁更壮。JS散度衡量的则是两个分布之间的“差异”,它就像一个“相似度计”,能精准地指示一个Token的输出分布相对于群体平均分布的“偏离”程度,从而识别出那些特立独行的关键节点。这正是分布特性优于标量值的核心。

只更新10%的Token,那90%的Token是不是就没用了?并不是。那90%的Token虽然不直接参与梯度更新,但它们并非完全没有作用。它们作为上下文,构成了整个推理链条的“路径”和“背景”。论文的稀疏更新策略,本质上是在模型已经生成了完整文本的基础上,再告诉模型“你看,这次行动的成败主要取决于这几个岔路口上的决策(即独特Token)”。所以剩下90%的Token是构成“岔路口”的基础,本身也非常重要,只是不需要更新它们的梯度来改变策略。

这个方法好复现吗?对硬件要求高吗?论文设计得非常巧妙,它的分布选择器只是在计算JS散度的过程中增加了一点点计算量,几乎可以忽略不计。而由于只更新10%的Token,在反向传播阶段,它的计算速度甚至要快于全参数更新。所以,这个方法即插即用,对硬件非常友好。甚至可以把它看作一个“免费”的性能加速器。唯一的挑战在于准确地利用group level的数据计算JS散度,论文已经给出了非常清晰的算法描述。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数 ★★★★☆
从熵的标量监督跳转到分布特性,提出了基于JS散度识别独特Token的新范式。理论分析建立在完整的二阶Rényi熵动力学上,思想非常前沿。并非完全从零到一,但在RLVR这个具体问题上确实是开创性的。

实验合理度 ★★★★★
实验设计非常扎实,覆盖了0.5B到7B三个模型尺度,七个基准测试,与三个强基线进行对比,进行了多次独立的随机实验(取均值)。消融实验包括不同更新比例、独特Token的高低熵比例、不同选择方法等,结论很令人信服。

学术研究价值 ★★★★★
这篇论文的研究价值极高。它为RLVR算法提供了一种全新的“token-centric”优化视角,很可能改变未来一两年内RLVR训练的默认做法。其理论和思路对其他序列决策问题也有很大的启发意义。

稳定性 ★★★★☆
理论上可以完美规避熵塌陷和熵爆炸,实验也展示了稳定且平滑的奖励曲线。但是,该方法对“独特”的界定完全依赖于group-level的分布,如果采样数量过少或存在噪声,稳定性可能会受影响。

适应性以及泛化能力 ★★★★☆
虽然在非数学领域(GPQA)也有效,但论文主要验证了数学推理任务。对于更通用的文本生成、对话等场景,方法的普适性还需要进一步验证。不过从理论上讲,这种基于分布偏差的方法应该具有不错的泛化能力。

硬件需求及成本 ★★★★☆
由于只更新10%的Token,反向传播的计算量大幅降低,训练速度更快,对显卡显存的需求也相应减少。虽然前向传播中的JS散度计算需要额外开销,但总体来看,相比全参数更新,这是一种更经济的方案。

复现难度 ★★★☆☆
论文提供了详细的算法和数学推导。但基于对GRPO的修改,需要对GRPO有基本了解。目前论文尚未开源官方代码,复现时需要自己实现基于GRPO的稀疏更新逻辑,对于不熟悉相关框架的读者会有一定难度。

产品化成熟度 ★★★☆☆
作为一种训练技巧,它非常适合集成到训练框架中,直接替换原有的GRPO训练流程。能够显著提升模型在数学和逻辑推理场景下的表现(如数学AI助手、代码审查等)。但距离成为一个可独立运行的产品还有距离,它更多是赋能底层模型。

可能的问题:1. 论文中的“独特Token”严格依赖于group-level的分布,这要求在一个batch内对不同序列进行对齐,如果序列长度差异大,空位(padding)的处理可能会引入偏差。2. 论文虽然在多尺度实验上表现良好,但在更大的模型(如70B+)上是否会有类似的效果,尚需验证。3. 对于非数学领域的通用性论证稍显不足,仅用GPQA一个基准说服力有限。


主要参考文献

[1] Shao, Z., Wang, P., Zhu, Q., et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning with Open-Source Language Models. 2024.
[2] Wang, P., Li, Z., et al. 20-Entropy: Guiding Exploration with Token-level Entropy Maximization for LLM Reasoning. 2025.
[3] Liu, Z., Li, H., et al. STAPO: Stable Token-level Policy Optimization for LLM Reasoning. 2026.
[4] Shannon, C. E. A Mathematical Theory of Communication. The Bell System Technical Journal, 1948.
[5] Feng, X., Li, Z., Liu, Z., et al. Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning. arXiv:2606.19771, 2026.

— 完 —

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
你看,连训大模型都知道“抓关键少数”最有效!
如此高效的优化策略,你的模型也该学学!
想第一时间掌握更多提升模型效率的前沿绝活?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
把你的模型优化到极致!wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。