← 返回 PaperDaily 大模型与智能体

ICML 2026新发现:RL工具调用竟能压到一个神经元?

这篇论文把“RL到底把工具调用能力藏在哪儿”这件事,直接追到跨编码器里的单个特征上了。更有意思的是,它不仅能定位,还能在推理时把能力拧出来,甚至让基础模型也跟着“蹭到一点”。

ICML 2026新发现:RL工具调用竟能压到一个神经元?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文把“RL到底把工具调用能力藏在哪儿”这件事,直接追到跨编码器里的单个特征上了。更有意思的是,它不仅能定位,还能在推理时把能力拧出来,甚至让基础模型也跟着“蹭到一点”。


原论文信息如下:
论文标题:
Localizing RL-Induced Tool Use to a Single Crosscoder Feature
发表日期:
2026年06月
发表单位:
Northwestern University
原文链接:
https://arxiv.org/pdf/2606.26474v1.pdf
开源代码链接:
https://github.com/Antebe/model_diffing_crosscoders
项目链接:
https://huggingface.co/collections/antebe1/qwen-toolrl-crosscoder

RL让模型学会调用工具,但背后机制成谜,我们找到了关键特征。

大模型会调用工具,这事现在不稀奇;稀奇的是,强化学习(RL)到底把这项能力“写”进了模型哪里,一直没人说得特别清楚。本文的思路很直接:既然 RL 让模型更会“按格式喊工具名”,那就别只盯着输出结果,干脆去模型内部翻抽屉,看看哪些特征在偷偷干活。
这里先把两个关键缩写捋顺。RLReinforcement Learning,强化学习DFCDedicated Feature Crosscoder,专用特征交叉编码器,出自 Jiralerspong 和 Bricken 2025 的 Crosscoder / DFC 系列工作。简单说,Crosscoder 是拿来把两个模型的内部激活一起拆成稀疏特征的工具;DFC 则更进一步,把特征分成 A 专属、B 专属和共享三块,试图把“谁学到的东西”分门别类。
封面
图:本文最核心的两个故事都在这张图里——左边是 DFC,右边是普通 Crosscoder。一个像整理得整整齐齐的抽屉柜,一个像把东西全塞进了同一个大箱子。后面会看到,“分区”不只是好看,真的会影响能力能不能被定位和操控
这篇论文研究的是 Qwen2.5-3B 上的 ToolRL 微调模型。ToolRL 的任务很朴素:让模型学会按结构化格式调用工具,比如输出 以及工具名、参数这些固定字段。结果显示,RL 并不是把“会用工具”这件事均匀地撒进整个网络,而是会在内部留下少量很集中的特征痕迹。问题是,这些痕迹到底能不能被单独抓出来?抓出来以后,能不能反过来控制模型行为?这就是本文要狠狠干的事。

揭秘DFC:如何将RL能力精确“定位”到一个神经元?

先说背景。语言模型内部不是一条特征对应一个神经元,通常是很多概念挤在一起、互相叠罗汉,这叫superposition,超位置。所以想知道“RL 把工具调用能力放哪了”,不能直接盯着某个神经元硬猜,得借助稀疏分解方法把混在一起的表示拆开。
本文用的就是 DFC。它和普通 Crosscoder 的区别,像是“分房间”与“共用大客厅”的区别。Crosscoder 会把两个模型的激活一起编码到同一个字典里;DFC 则把字典切成三块:A 专属、B 专属、共享,并通过梯度掩码强制各自只写自己的区域。这里的 A 是 ToolRL 微调后的模型,B 是原始基础模型。
图1:三种联合稀疏分解架构
图1:两模型激活做联合稀疏分解时的三种架构。左边是普通 Crosscoder,中间是 Tied Crosscoder,右边是 DFC。本文真正关心的是右边:A 专属、B 专属、共享三块被明确分开,理论上可以把 RL 新增能力更干净地圈出来。
为了验证这事,作者做了 48 组超参数扫掠:字典大小 D 取 8192 或 16384,top-k 取 45、90、160,DFC 的专属比例 p 取 3%、5%、10%,再配合专属特征的 L1 惩罚 λexcl 取 0 或 10-3。说人话就是:把不同“抽屉大小、抽屉数量、抽屉紧不紧”都试一遍,看哪个最能把工具调用能力拆得清楚。
表1:48组交叉编码器超参数设置
表1:48 个变体的训练设置。核心不是参数多,而是它们刚好够用来回答一个关键问题:RL 引入的能力,是集中在专属分区里,还是会漏到共享分区里
训练目标本身也很朴素:一边重建两个模型的残差流激活,一边让字典保持稀疏。这里的 top-k 稀疏约束意味着每次前向只保留激活最高的 k 个特征。直觉上,这就像只允许少数几个“重点嫌疑人”出场,避免模型把所有信息都摊成一锅粥。专属分区上的梯度掩码则强制 A 专属特征只服务 A,B 专属特征只服务 B,剩下的共享分区负责两边都能用的内容。
公式与目标函数示意
图:训练目标可以理解为“重建误差 + 稀疏惩罚 + 分区约束”的组合拳。重建误差负责别把原始激活弄丢,L1 惩罚负责别让特征到处乱冒,梯度掩码负责别让 A、B 两边互相串门。参数里最关键的是 D、k、p 和 λexcl:它们分别控制字典容量、稀疏度、专属空间比例和专属特征是否要额外“交房租”。
为了判断哪些特征真和工具调用有关,作者还做了特征筛选。先用 Cohen’s d 给特征排序,再结合 firing rate 过滤掉那些“偶尔闪一下但没啥稳定性”的特征。这里的 Cohen’s d 可以理解为:某个特征在“工具调用样本”与“普通文本样本”之间的区分力度有多大,数值越高,越像是“工具味儿很冲”的神经元。
然后就是最有意思的部分:把单个 A 专属特征拿出来做定向 steering。steering 的意思不是重新训练,而是在推理时直接往残差流里加一个可控偏置,让某些特征更容易被激活。说白了,就是不给模型重新上课,直接在考试时悄悄递一张小纸条,看它会不会更会用工具。

单神经元操控:给模型加个“外挂”,工具调用能力暴涨65%。

论文最抓眼球的结果,是只靠一个 A 专属神经元,就能把工具调用正确率提升 65 个百分点。这不是“稍微好一点”,而是直接把模型从“有点迷糊”拽到了“终于像个会办事的助理”。更夸张的是,这个效果不是某个神奇层里偶然冒出来的烟花,而是在大多数被测试层上都能复现。
图5:单个A专属特征 steering 前后对比
图5:同一个 ToolRL-Qwen2.5-3B,经过 DFC 后,左边还是老老实实地只会解释、犹豫、补充说明,右边在单个 A 专属特征加上偏置后,直接开始输出合法的 格式,并且工具名和参数都对上了。这个对比很重要,因为它说明 steering 不是“让模型多说点废话”,而是把结构化工具调用行为真的拽出来了
作者把不同数量的特征集合都试了一遍,结果很有戏剧性。DFC 的 A 专属特征几乎在 |S| = 1 时就到顶了;而普通 Crosscoder 要到 |S| = 33 才摸到峰值。也就是说,在 DFC 里,能力像被压缩成了一个小芯片;在 Crosscoder 里,能力更像一团散装零件,得凑够一大把才勉强能跑。
图3:工具正确率随特征数变化的饱和曲线
图3:工具正确率随被 steering 的特征数量变化。DFC 的 A 专属曲线几乎一上来就饱和,说明最关键的信号高度集中;Crosscoder 则需要更多特征一起上阵,才能逼近同等效果。B 专属特征全程没反应,属于“该它出场时它偏不出场”的标准空转。
这类结果说明一个很关键的事实:RL 引入的工具调用能力,并不是平均分布在很多特征上,而是高度集中在少数“工具交互”特征里。作者后面的自动解释也印证了这一点:最强的 A 专属特征,往往识别的是 、 这类结构模板,而不是抽象的“会用工具”概念本身。换句话说,它更像一个格式哨兵,而不是一个泛化到一切工具的哲学家。
图2:DFC 与 Crosscoder 的特征空间几何差异
图2:在相同超参数下,DFC 的解码器特征在降维空间里明显分成三团:A 专属、B 专属、共享;而普通 Crosscoder 的“伪分区”则混在一起,A 偏、B 偏、共享特征彼此搅成一锅。这个图非常重要,因为它排除了“只是可视化方法把结果画歪了”的嫌疑,说明分离真的来自 DFC 的结构约束。
图4:不同层上单特征 steering 的提升情况
图4:不同层上,单个 A 专属特征都能带来明显提升,说明这不是某一层“撞大运”。有些层甚至没有可用的工具签名 A 专属特征,作者称之为 dead layers。翻译成人话就是:不是每层都适合当主角,但能打的层,确实能把工具调用这件事拎得很清楚。
图7:不同特征数与参数组合下的热力图
图7:不同特征数 |S| 和 steering 强度 α 的组合热力图。稀疏设置下,小 |S| 就能冲高;稠密设置下,更多特征一起上才更稳。这个图也提醒了一件事:steering 不是越猛越好,过强反而会把模型推到奇怪的方向上。
这里还有一个挺有意思的现象:把 A 专属和共享特征一起 steering,反而不如单独 steering A 专属。论文把这解释为方向不正交带来的destructive interference,破坏性干扰。这就像两个方向盘同时打架,一个想左转,一个想右转,最后车就开始画龙。
图6:不同α下的最佳提升
图6:把多个条件合并后看最佳提升,能发现中等强度的 α 往往最稳。α 太小像没踩油门,α 太大则容易过冲,模型开始“用力过猛”。这也是为什么本文强调的是精准操控,不是暴力推满。

能力“溢出”与隔离:基础模型为何也偷偷学会了?

论文里最“反直觉”的现象之一,是所谓的capability spillover,能力溢出。意思是:把基础模型 B 的激活也丢进联合训练后的 crosscoder 里做重建,结果它居然也能在不微调的情况下,工具正确率从 0% 涨到 6.8%。这不是说基础模型突然开窍了,而是说明联合分解的共享字典里,已经悄悄混入了能触发工具选择的方向。
表2:重建前后模型行为变化
表2:48 组结果的平均值。A 模型在重建后工具正确率提升明显,B 模型也出现了 6.8 个百分点的溢出;但格式准确率在 B 上始终还是 0 提升。也就是说,语义层面的工具意图已经能被共享表示传过去,但真正的 表面格式仍然很顽固
这点很关键,因为它把“会不会选工具”和“会不会按格式吐出工具调用”拆成了两件事。前者像脑子里已经知道该找谁帮忙,后者像嘴上还得学会怎么把话说清楚。本文看到的是:共享分区更容易承载前者,而后者更依赖窄而专的 RL 特征。
表3:DFC 与 Crosscoder 的架构级比较
表3:DFC 和普通 Crosscoder 的架构对比。两者重建误差几乎一样,但行为迁移略有差异。DFC 对 B 的溢出略低,不过统计上还不够硬,所以作者没有把话说满。这个克制挺好,不抢戏,符合论文味道。
再往下看,作者发现如果给专属分区加更强的 L1 惩罚,A 模型的 fidelity 反而变差。直觉上你可能会以为“更稀疏、更干净”就更好,但现实没这么听话:惩罚专属分区会把工具相关信号挤回共享分区,结果 A 自己更难保持原本行为,B 反而更容易蹭到一点。这说明 DFC 更像一个过滤器(filter),而不是一个把 RL 差异彻底锁死的保险箱(sink)。
表4:专属分区惩罚与能力保持的关系
表4:专属分区的惩罚项越强,A 的工具正确率越容易掉。这个结果不算惊天动地,但很诚实:如果把“专属区”压得太狠,真正有用的差异也会被一起压没。论文的结论因此变得更谨慎,也更可信——DFC 能定位能力,但并不能把能力和共享表示完全切开

实验效果与局限性:单神经元控制真的够用吗?

如果只看实验结果,这篇论文的亮点很集中:第一,48 组 sweep 里,A 模型的工具正确率48/48 全部提升;第二,基础模型 B 出现了可测的能力溢出;第三,单个 A 专属特征就能达到峰值 steering。三件事放一起,基本可以说明:RL 引入的工具调用能力在 DFC 视角下确实是可定位、可迁移、也可操控的。
表8:48组完整重建后的评估结果
表8:48 组完整结果表。它的价值不在于把每个数字背下来,而在于说明一个事实:不同超参数下,重建误差和行为效果并不简单同涨同跌。也就是说,激活重建做得“像”,不一定等于行为就一定“对”。
这也是本文最值得认真看的地方。它没有把“低 MSE”吹成万能指标,而是明确指出:真正重要的是任务相关的稀疏子空间。换句话说,模型内部不是所有误差都平等,有些地方偏一点没事,有些地方偏一点就直接不会调用工具。工具调用显然属于后者。
不过,局限性也得老老实实说。首先,实验只在一个模型对上做了验证:Qwen2.5-3B 的基础版和 ToolRL 版。其次,任务也比较单一,就是结构化工具调用。再次,架构层面的 DFC vs Crosscoder 对比,统计显著性还不够强,作者自己也没把结论说死。最后,steering 的效果虽然亮眼,但还主要停留在受控实验和固定提示集上,离“随便丢进任何产品都稳如老狗”还有距离。
但这不妨碍它很有研究价值。因为它第一次把“RL 改造了工具使用能力”这件事,从宏观行为层面,往微观特征层面压缩到一个很小的范围里。对机械可解释性来说,这种工作最宝贵的地方不是“又涨了几个点”,而是它告诉大家:有些 agentic 能力,真的可以被拆到特征级别去看、去控、去验证

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它想回答的是:RL 让语言模型更会调用工具之后,这种能力到底藏在模型内部哪里。答案是,能力没有均匀铺开,而是高度集中在少数 A 专属特征里,甚至单个特征就能被拿来做有效 steering。

capability spillover 是什么意思?就是把基础模型 B 的激活经过联合训练后的 crosscoder 重建后,B 也会在不微调的情况下多出一点工具调用能力。它不等于 B 真学会了完整工具使用,但说明共享表示里已经混进了部分工具选择信号。

为什么单个神经元就够用?因为 DFC 把 RL 新增能力压缩到了很少的、彼此分离的特征里。作者用 Cohen’s d 排序后发现,最强的那个 A 专属特征本身就非常“工具化”,对结构模板特别敏感,所以只要把它轻轻拧一下,模型就更容易走向正确的 输出。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“模型会不会用工具”推进到“RL 新能力能否被定位到单个特征并实时操控”,这个切口很漂亮。不是凭空造概念,而是把机械可解释性和 agent 行为控制接上了。

实验合理度:★★★★☆

48 组 sweep、重建与 steering 两条线并行,且有 DFC 和 Crosscoder 的对照,整体设计比较扎实。唯一扣分点是架构级差异的统计证据还不算特别硬。

学术研究价值:★★★★☆

对 mechanistic interpretability、模型 diffing、以及 agent 能力定位都有启发。尤其是“能力溢出”和“单特征 steering”这两个现象,后续很值得继续追。

稳定性:★★★☆☆

在受控评测里表现不错,但目前主要还是单模型、单任务、单数据分布的结果。离大规模、复杂真实场景还有验证空间。

适应性以及泛化能力:★★★☆☆

跨层有一定泛化,但跨模型、跨任务是否还成立,目前还不能拍胸脯。现在更像一个有潜力的方法框架,而不是通吃方案。

硬件需求及成本:★★★☆☆

训练 48 组 crosscoder 不算轻,做解释和 steering 也需要额外分析成本。但推理时的单特征操控本身很省,不属于那种“上车先买服务器”的方法。

复现难度:★★★☆☆

项目开源是加分项,但要把训练、可视化、steering 全链路跑通,还是需要一定工程能力。不是点一下就出图的那种轻量玩具。

产品化成熟度:★★☆☆☆

更适合研究和诊断,不适合直接当生产级控制器。要进产品,还得补鲁棒性、跨任务验证和安全边界。

可能的问题:结论漂亮,但目前主要基于单一模型对和单一工具任务,泛化边界还没完全摸清;另外,能力溢出与安全控制之间的关系也值得继续深挖。


主要参考文献

Andrii Shportko, Shubham Bhokare, Ahmed Zeyad A Alzahrani, Bowen Cheng, Gustavo Mercier, Jessica Hullman. Localizing RL-Induced Tool Use to a Single Crosscoder Feature. arXiv:2606.26474v1, 2026.
Thomas Jiralerspong, Tim Bricken. Cross-architecture model diffing with crosscoders: Unsupervised discovery of differences between LLMs. NeurIPS Mechanistic Interpretability Workshop, 2025.
Cheng Qian, Ece C. Acikgoz, Qirong He, Huan Wang, Xinyue Chen, Dilek Hakkani-Tür, Gokhan Tur, Hongyuan Ji. ToolRL: Reward is All Tool Learning Needs. 2025.
项目代码:https://github.com/Antebe/model_diffing_crosscoders;项目页:https://huggingface.co/collections/antebe1/qwen-toolrl-crosscoder;原文:https://arxiv.org/pdf/2606.26474v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。