龙哥推荐理由: 这篇论文把强化学习后的大模型工具调用,拆成了可定位、可操控、还能“溢出”的内部特征。更有意思的是,单个 A 专属特征就能把工具调用能力直接拉满,机制味儿很浓。
原论文信息如下:
论文标题:
Localizing RL-Induced Tool Use to a Single Crosscoder Feature
发表日期:
2026年06月
发表单位:
Northwestern University
原文链接:
https://arxiv.org/pdf/2606.27148v1.pdf
开源代码链接:
https://github.com/Antebe/model_diffing_crosscoders
项目链接:
https://huggingface.co/collections/antebe1/qwen-toolrl-crosscoder
RL训练让大模型学会工具调用,但背后的机制到底是什么?
大模型会用工具,听起来像是“长本事了”;但从机制角度看,更像是它在内部偷偷学会了一套新的触发器。这篇论文盯住的就是这个问题:强化学习(RL)把工具调用能力塞进模型以后,这个能力到底藏在哪些特征里?是散落在一大堆神经元里,还是能被压缩到少数几个可解释、可操控的方向上?作者用的是一对同架构模型:一个是基础模型,一个是经过工具调用 RL 微调后的模型。然后借助交叉编码器(crosscoder)和专用特征交叉编码器(Dedicated Feature Crosscoder,简称DFC)去做“模型差异显微镜”。简单说,DFC 不是只问“两个模型哪里不一样”,而是进一步问“这些不一样能不能被分到专门区域里,甚至被单个特征接管”。图1:成对模型激活的三种联合稀疏分解架构。左边是普通 crosscoder,中间是 tied crosscoder,右边是本文重点的 DFC。它的关键动作是把字典拆成 A 专属、B 专属和共享三部分,再用梯度掩码让每一部分“各管各的”,避免特征到处串门。这里先补一个基础概念:交叉编码器可以理解成“给两个模型共用一套稀疏字典”,把它们的激活都投影到同一组特征上。好处是能比较两个模型内部表示的异同;坏处是,如果不加约束,特征很容易混成一锅粥。DFC 的思路就很直白:既然要研究“差异”,那就把差异强行分区,看看 RL 新增的工具调用能力会不会自然沉淀到 A 专属区域里。论文里的另一个核心词是 稀疏自编码器(Sparse Autoencoder, SAE,稀疏自编码器;文中作为相关工作引用,见 Bricken et al., 2023;Cunningham et al., 2023)。SAE 的经典想法是:神经网络的表示不是一根神经元对应一个语义,而是很多语义叠在一起,像超市促销海报一样乱。稀疏分解就是想把这团乱麻拆成更可解释的“特征”。crosscoder 则把这个思路推广到两个模型之间,于是就能研究“能力差异”到底写进了哪些特征。
Shportko, A., Bhokare, S., Alzahrani, A. Y. A., Cheng, B., Mercier, G., & Hullman, J. Localizing RL-Induced Tool Use to a Single Crosscoder Feature. arXiv:2606.27148, 2026.项目代码:https://github.com/Antebe/model_diffing_crosscoders项目集合:https://huggingface.co/collections/antebe1/qwen-toolrl-crosscoder