← 返回 PaperDaily
大模型与智能体
ICML 2026新发现:RL工具调用竟能压到一个神经元?
这篇论文把“RL到底把工具调用能力藏在哪儿”这件事,直接追到跨编码器里的单个特征上了。更有意思的是,它不仅能定位,还能在推理时把能力拧出来,甚至让基础模型也跟着“蹭到一点”。
龙哥读论文
发布于 2026-08-14 09:10:46
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文把“RL到底把工具调用能力藏在哪儿”这件事,直接追到跨编码器里的单个特征上了。更有意思的是,它不仅能定位,还能在推理时把能力拧出来,甚至让基础模型也跟着“蹭到一点”。
原论文信息如下:
RL让模型学会调用工具,但背后机制成谜,我们找到了关键特征。
大模型会调用工具,这事现在不稀奇;稀奇的是,强化学习(RL)到底把这项能力“写”进了模型哪里 ,一直没人说得特别清楚。本文的思路很直接:既然 RL 让模型更会“按格式喊工具名”,那就别只盯着输出结果,干脆去模型内部翻抽屉,看看哪些特征在偷偷干活。
这里先把两个关键缩写捋顺。RL 是 Reinforcement Learning,强化学习 ;DFC 是 Dedicated Feature Crosscoder,专用特征交叉编码器 ,出自 Jiralerspong 和 Bricken 2025 的 Crosscoder / DFC 系列工作。简单说,Crosscoder 是拿来把两个模型的内部激活一起拆成稀疏特征的工具;DFC 则更进一步,把特征分成 A 专属、B 专属和共享三块,试图把“谁学到的东西”分门别类。
这篇论文研究的是 Qwen2.5-3B 上的 ToolRL 微调模型。ToolRL 的任务很朴素:让模型学会按结构化格式调用工具,比如输出 以及工具名、参数这些固定字段。结果显示,RL 并不是把“会用工具”这件事均匀地撒进整个网络,而是会在内部留下少量很集中的特征痕迹。问题是,这些痕迹到底能不能被单独抓出来?抓出来以后,能不能反过来控制模型行为?这就是本文要狠狠干的事。
揭秘DFC:如何将RL能力精确“定位”到一个神经元?
先说背景。语言模型内部不是一条特征对应一个神经元,通常是很多概念挤在一起、互相叠罗汉,这叫superposition,超位置 。所以想知道“RL 把工具调用能力放哪了”,不能直接盯着某个神经元硬猜,得借助稀疏分解方法把混在一起的表示拆开。
本文用的就是 DFC。它和普通 Crosscoder 的区别,像是“分房间”与“共用大客厅”的区别。Crosscoder 会把两个模型的激活一起编码到同一个字典里;DFC 则把字典切成三块:A 专属、B 专属、共享,并通过梯度掩码强制各自只写自己的区域。这里的 A 是 ToolRL 微调后的模型,B 是原始基础模型。
为了验证这事,作者做了 48 组超参数扫掠:字典大小 D 取 8192 或 16384,top-k 取 45、90、160,DFC 的专属比例 p 取 3%、5%、10%,再配合专属特征的 L1 惩罚 λexcl 取 0 或 10-3。说人话就是:把不同“抽屉大小、抽屉数量、抽屉紧不紧”都试一遍,看哪个最能把工具调用能力拆得清楚。
训练目标本身也很朴素:一边重建两个模型的残差流激活,一边让字典保持稀疏。这里的 top-k 稀疏约束意味着每次前向只保留激活最高的 k 个特征。直觉上,这就像只允许少数几个“重点嫌疑人”出场,避免模型把所有信息都摊成一锅粥。专属分区上的梯度掩码则强制 A 专属特征只服务 A,B 专属特征只服务 B,剩下的共享分区负责两边都能用的内容。
为了判断哪些特征真和工具调用有关,作者还做了特征筛选。先用 Cohen’s d 给特征排序,再结合 firing rate 过滤掉那些“偶尔闪一下但没啥稳定性”的特征。这里的 Cohen’s d 可以理解为:某个特征在“工具调用样本”与“普通文本样本”之间的区分力度有多大,数值越高,越像是“工具味儿很冲”的神经元。
然后就是最有意思的部分:把单个 A 专属特征拿出来做定向 steering 。steering 的意思不是重新训练,而是在推理时直接往残差流里加一个可控偏置,让某些特征更容易被激活。说白了,就是不给模型重新上课,直接在考试时悄悄递一张小纸条,看它会不会更会用工具。
单神经元操控:给模型加个“外挂”,工具调用能力暴涨65%。
论文最抓眼球的结果,是只靠一个 A 专属神经元,就能把工具调用正确率提升 65 个百分点 。这不是“稍微好一点”,而是直接把模型从“有点迷糊”拽到了“终于像个会办事的助理”。更夸张的是,这个效果不是某个神奇层里偶然冒出来的烟花,而是在大多数被测试层上都能复现。
作者把不同数量的特征集合都试了一遍,结果很有戏剧性。DFC 的 A 专属特征几乎在 |S| = 1 时就到顶了;而普通 Crosscoder 要到 |S| = 33 才摸到峰值。也就是说,在 DFC 里,能力像被压缩成了一个小芯片;在 Crosscoder 里,能力更像一团散装零件,得凑够一大把才勉强能跑。
这类结果说明一个很关键的事实:RL 引入的工具调用能力,并不是平均分布在很多特征上,而是高度集中在少数“工具交互”特征里 。作者后面的自动解释也印证了这一点:最强的 A 专属特征,往往识别的是 、 这类结构模板,而不是抽象的“会用工具”概念本身。换句话说,它更像一个格式哨兵,而不是一个泛化到一切工具的哲学家。
这里还有一个挺有意思的现象:把 A 专属和共享特征一起 steering,反而不如单独 steering A 专属。论文把这解释为方向不正交带来的destructive interference,破坏性干扰 。这就像两个方向盘同时打架,一个想左转,一个想右转,最后车就开始画龙。
能力“溢出”与隔离:基础模型为何也偷偷学会了?
论文里最“反直觉”的现象之一,是所谓的capability spillover,能力溢出 。意思是:把基础模型 B 的激活也丢进联合训练后的 crosscoder 里做重建,结果它居然也能在不微调的情况下,工具正确率从 0% 涨到 6.8%。这不是说基础模型突然开窍了,而是说明联合分解的共享字典里,已经悄悄混入了能触发工具选择的方向。
这点很关键,因为它把“会不会选工具”和“会不会按格式吐出工具调用”拆成了两件事。前者像脑子里已经知道该找谁帮忙,后者像嘴上还得学会怎么把话说清楚。本文看到的是:共享分区更容易承载前者,而后者更依赖窄而专的 RL 特征。
再往下看,作者发现如果给专属分区加更强的 L1 惩罚,A 模型的 fidelity 反而变差。直觉上你可能会以为“更稀疏、更干净”就更好,但现实没这么听话:惩罚专属分区会把工具相关信号挤回共享分区,结果 A 自己更难保持原本行为,B 反而更容易蹭到一点。这说明 DFC 更像一个过滤器(filter) ,而不是一个把 RL 差异彻底锁死的保险箱(sink)。
实验效果与局限性:单神经元控制真的够用吗?
如果只看实验结果,这篇论文的亮点很集中:第一,48 组 sweep 里,A 模型的工具正确率48/48 全部提升 ;第二,基础模型 B 出现了可测的能力溢出;第三,单个 A 专属特征就能达到峰值 steering。三件事放一起,基本可以说明:RL 引入的工具调用能力在 DFC 视角下确实是可定位、可迁移、也可操控的。
这也是本文最值得认真看的地方。它没有把“低 MSE”吹成万能指标,而是明确指出:真正重要的是任务相关的稀疏子空间。换句话说,模型内部不是所有误差都平等,有些地方偏一点没事,有些地方偏一点就直接不会调用工具 。工具调用显然属于后者。
不过,局限性也得老老实实说。首先,实验只在一个模型对上做了验证:Qwen2.5-3B 的基础版和 ToolRL 版。其次,任务也比较单一,就是结构化工具调用。再次,架构层面的 DFC vs Crosscoder 对比,统计显著性还不够强,作者自己也没把结论说死。最后,steering 的效果虽然亮眼,但还主要停留在受控实验和固定提示集上,离“随便丢进任何产品都稳如老狗”还有距离。
但这不妨碍它很有研究价值。因为它第一次把“RL 改造了工具使用能力”这件事,从宏观行为层面,往微观特征层面压缩到一个很小的范围里。对机械可解释性来说,这种工作最宝贵的地方不是“又涨了几个点”,而是它告诉大家:有些 agentic 能力,真的可以被拆到特征级别去看、去控、去验证 。
龙迷三问
这篇论文到底解决了什么问题? 它想回答的是:RL 让语言模型更会调用工具之后,这种能力到底藏在模型内部哪里。答案是,能力没有均匀铺开,而是高度集中在少数 A 专属特征里,甚至单个特征就能被拿来做有效 steering。
capability spillover 是什么意思? 就是把基础模型 B 的激活经过联合训练后的 crosscoder 重建后,B 也会在不微调的情况下多出一点工具调用能力。它不等于 B 真学会了完整工具使用,但说明共享表示里已经混进了部分工具选择信号。
为什么单个神经元就够用? 因为 DFC 把 RL 新增能力压缩到了很少的、彼此分离的特征里。作者用 Cohen’s d 排序后发现,最强的那个 A 专属特征本身就非常“工具化”,对结构模板特别敏感,所以只要把它轻轻拧一下,模型就更容易走向正确的 输出。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“模型会不会用工具”推进到“RL 新能力能否被定位到单个特征并实时操控”,这个切口很漂亮。不是凭空造概念,而是把机械可解释性和 agent 行为控制接上了。
实验合理度: ★★★★☆
48 组 sweep、重建与 steering 两条线并行,且有 DFC 和 Crosscoder 的对照,整体设计比较扎实。唯一扣分点是架构级差异的统计证据还不算特别硬。
学术研究价值: ★★★★☆
对 mechanistic interpretability、模型 diffing、以及 agent 能力定位都有启发。尤其是“能力溢出”和“单特征 steering”这两个现象,后续很值得继续追。
稳定性: ★★★☆☆
在受控评测里表现不错,但目前主要还是单模型、单任务、单数据分布的结果。离大规模、复杂真实场景还有验证空间。
适应性以及泛化能力: ★★★☆☆
跨层有一定泛化,但跨模型、跨任务是否还成立,目前还不能拍胸脯。现在更像一个有潜力的方法框架,而不是通吃方案。
硬件需求及成本: ★★★☆☆
训练 48 组 crosscoder 不算轻,做解释和 steering 也需要额外分析成本。但推理时的单特征操控本身很省,不属于那种“上车先买服务器”的方法。
复现难度: ★★★☆☆
项目开源是加分项,但要把训练、可视化、steering 全链路跑通,还是需要一定工程能力。不是点一下就出图的那种轻量玩具。
产品化成熟度: ★★☆☆☆
更适合研究和诊断,不适合直接当生产级控制器。要进产品,还得补鲁棒性、跨任务验证和安全边界。
可能的问题: 结论漂亮,但目前主要基于单一模型对和单一工具任务,泛化边界还没完全摸清;另外,能力溢出与安全控制之间的关系也值得继续深挖。
主要参考文献
Andrii Shportko, Shubham Bhokare, Ahmed Zeyad A Alzahrani, Bowen Cheng, Gustavo Mercier, Jessica Hullman. Localizing RL-Induced Tool Use to a Single Crosscoder Feature. arXiv:2606.26474v1, 2026.
Thomas Jiralerspong, Tim Bricken. Cross-architecture model diffing with crosscoders: Unsupervised discovery of differences between LLMs. NeurIPS Mechanistic Interpretability Workshop, 2025.
Cheng Qian, Ece C. Acikgoz, Qirong He, Huan Wang, Xinyue Chen, Dilek Hakkani-Tür, Gokhan Tur, Hongyuan Ji. ToolRL: Reward is All Tool Learning Needs. 2025.
项目代码:https://github.com/Antebe/model_diffing_crosscoders;项目页:https://huggingface.co/collections/antebe1/qwen-toolrl-crosscoder;原文:https://arxiv.org/pdf/2606.26474v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群