← 返回 PaperDaily
大模型与智能体
开源模型的防盗锁来了?Apple用DLR-Net让微调成本暴涨4倍
这是龙哥近期看到的最有“反常识”的AI安全论文:正常防御都是让模型变笨或推理变慢,Apple却反手把训练成本拉满,推理保持原速,还顺手把自适应攻击者挡在门外。方向清奇且实验扎实,值得一读。
龙哥读论文
发布于 2026-08-14 08:31:05
阅读 3
查看原文
原论文信息如下:
模型锁定:一个看似不可能的任务
先聊一个看似矛盾的问题:开源权重模型的兴起,让整个行业享受到了前所未有的自由——任何人可以在任意硬件、任意平台上跑模型,可以拿去微调、做研究、甚至再分发。但硬币的另一面是,模型发布者一旦把权重交出去,就彻底失去了对模型行为的控制:任何一方都能把模型微调到新的领域,或者干脆去掉使用限制,而且成本往往只是原始训练成本的一个零头。
那么问题来了:能不能给模型装上一把“锁”——让微调它的成本远高于微调原始模型的成本,同时推理性能几乎不受影响?这个“模型锁定”概念最早由Rosati等人于2025年引入,Wang等人于2026年提出了非微调性的相关概念。Apple研究团队在这篇论文中对这个问题给出了一个相当反直觉的回答。
论文先把模型锁定形式化了一个清晰的定义:设f是预训练模型,锁定机制M加上私有信息s产生锁定模型g = M(f, θ₀, s)。理论上要求两条:一是效用保持——锁定模型在所有下游任务上的损失不超过原模型的ε;二是适配成本放大——对任意下游任务τ和目标性能p,锁定模型的适配成本至少是原模型的κ倍,κ > 1。这里的成本用墙钟时间、FLOPs或GPU小时来衡量。
那问题搞清楚了,接下来看看为什么说锁定是“不可能的任务”。论文分析了三类常见思路的失败原因。
第一类是基于对称性的防御。ReLU激活函数满足正齐次性:对任意a > 0,有ReLU(az) = a·ReLU(z)。于是对任意形如W₂ReLU(W₁x)的层,都有(aW₂)·ReLU(a⁻¹W₁·x)这个等价重参数化。这会让优化变得困难,但攻击者只需检查每层权重范数,就能轻易发现这种不平衡并重新平衡。更一般地,在两个连续线性层之间插入一个可逆矩阵A及其逆A⁻¹,也属于这类可被SVD(奇异值分解)拿掉的防御。
第二类是基于障碍的防御——在层间插入一个输入雅可比矩阵病态的模块B,让梯度爆炸或消失。但问题在于:屏障模块必须是不可分割的,而且形式必须靠学而不是靠手工设计,否则自适应攻击者能直接拆掉它。而标准蒸馏只能产生光滑的近似,想在不动下层的前提下构造病态雅可比,难度极大。更致命的是,屏障越有效,梯度被堵得越死,防守方自己也没法维持模型质量。
第三类是基于惩罚的防御——把“难以微调”本身写成约束条件,用优化去找病态解,即最大化某个困难度指标Ω(θ)。但这里有个自我拆台的死循环:防守方想找到“让优化变困难”的解,自己却必须依赖优化才能找到它。
推理-训练不对称性:新的防御维度
自动微分有一个被大多数人忽略的结构性差别:推理只需要一次前向传播,算完就扔掉中间激活值;而训练必须把所有中间激活值存下来,才能在反向传播时计算梯度。这个推理和训练之间的内存不对称,就是这篇论文选中的新防御轴。
DLR-Lock的策略,就是把模型里每一个SwiGLU MLP整个替换成一个深度低秩残差网络(DLR-Net)——参数总量差不多,输入输出映射几乎一致,但对于任何试图反向传播的人,代价剧增。如图1所示,这个替换引入了三重锁定机制。
这套防御的妙处在于,它不依赖寻找特定权重,不改变损失曲面,也不靠什么秘传配置——纯粹靠自动微分的结构性不对称建立防线。也就是说,无论攻击者用什么优化器,只要走反向传播这条路,就必然撞上这几道墙。
DLR-Net:深度低秩残差网络的设计与蒸馏
任何防御方案首先不能误伤用户。替换后的模块必须满足两个硬约束:一是输入输出行为与原始MLP匹配,二是不会显著增加参数量或推理成本。于是论文选择了低秩残差块:瓶颈秩r远小于隐藏维度d,每层的参数量很小,从而可以在总预算P下堆出很深的网络。
论文特意强调:当L超过100时,RMSNorm预归一化对训练稳定性至关重要——没有它,深度残差网络根本训不动。这里的RMSNorm对每个token做归一化,不引入跨token的交互,这正是能和原始Transformer结构无缝拼接的关键。
把MLP换成DLR-Net还不够,还要保证替换后的模型“看起来”还是原来那个模型。论文提出了两阶段蒸馏流程。
第一阶段是模块级蒸馏:对每个Transformer层l,先从预训练模型里采集隐藏状态z_l,然后单独训练对应的DLR-Net去拟合完整的残差子模块f_l(z) = z + FFN_l(RMSNorm(z))。损失函数是相对MSE,除以‖f_l‖²做归一化——因为不同层的输出范数差异很大。这一阶段所有层可以并行独立训练,效率很高,但单层误差会在整个前向传播中累积。
第二阶段是logits蒸馏:把所有DLR-Net参数联合起来,用原始模型当教师,对齐全模型的输出分布。对齐损失采用top-k KL散度——只计算教师概率最高的k个token的KL散度,k=1000。这一步能大幅修正累积误差。有意思的是,第二阶段需要反向传播穿过整个锁定模型,防守方自己也要面对激活内存墙——但第一阶段提供了很好的初始化,收敛很快,而且这笔开销只需要付一次。
攻击者当然不会坐以待毙,论文系统分析了四种可能的攻击策略。梯度检查点是第一反应——选择性重计算DLR-Net块,把峰值内存从O(NLd)降到O(Ld),但代价是每个MLP前向传播都要重算,最优的均间隔检查点策略额外开销为O(√(NL)d)。局部权重更新呢?冻结DLR-Net只训其他部分?RMSNorm的反向传播还是要存d维中间向量;如果用stop_grad完全截断梯度,沿主分支的梯度信号就丢了,训练信号有偏。LoRA呢?LoRA把基座权重冻结、只训低秩适配器——但DLR-Net里的U_i和V_i本身就已经是低秩的了,再加一层分解根本没有表达空间。最后,模块级蒸馏逆向?攻击者可以反过来把DLR-Net蒸馏回SwiGLU——但要彻底移除防御,必须把全部N层都反向蒸馏一遍,成本线性放大,防守方付了一次的代价,攻击者逃不掉要再付一次。
实验验证:质量保持与防御效果
实验在Qwen3-0.6B上进行。蒸馏数据用Nemotron-CC,一个经过清洗的网络文本语料。模型权重初始化遵循特定分布:U_i从N(0, 1/(d√L))采样,V_i从N(0, 1/r)采样,α_i置为0。两阶段训练都用AdamW优化器,权重衰减10⁻⁵,余弦学习率调度加5%线性预热,梯度裁剪到范数1。第一阶段每层独立训50万步,学习率3×10⁻³,批大小2,序列长度2048;第二阶段所有DLR-Net参数联合训10万步,top-k=1000,学习率10⁻³,批大小4,序列长度2048。
首先验证质量保持。论文在Nemotron验证集、WikiText-103以及LM Evaluation Harness的7个基准任务上做了评测,包括MMLU、ARC Easy/Challenge、HellaSwag、WinoGrande、BoolQ和PIQA。
接下来是推理开销。DLR-Net的理论FLOPs与原始SwiGLU相当,但一大串小矩阵乘法会带来内核启动开销。论文在H100上用bfloat16测了三种规模,对比了PyTorch的eager模式和torch.compile的reduce-overhead模式。编译后DLR-Net的劣势急剧缩小——8B规模的单个DLR-Net,eager模式下开销比高达144倍,reduce-overhead编译直接降到11倍。
最后是核心验证:锁定模型能不能扛住微调攻击。攻击者在WikiText-103上做全参数微调,扫描了三个学习率,并开启梯度检查点来降低内存。论文对比了预训练基线和锁定模型的收敛曲线,分别按训练token数和墙钟时间画了两行。
局限与展望
这套方案当然不是银弹。论文自己也承认一个绕不开的权衡:DLR-Lock是微调领域无关的,它锁死的是所有微调,包括那些完全无害的应用。一个正派的开发者想拿这个模型做点正经事,同样也会被锁卡住脖子。因此DLR-Lock更适用于“只开放推理接口、不希望任何人改权重”的发布场景,而不是“既想开权重又想防滥用”的两全方案。
另一个连防守方自己都躲不掉的问题是:第二阶段logits蒸馏需要反向传播穿过整个锁定模型,这会让防守方的锁定成本大幅抬高。论文巧妙地把第一阶段做成并行模块蒸馏,让第二阶段从一个极好的初始化出发快速收敛,但一次性成本仍然存在。好在防守方只需要付一次,成本可以在所有部署中摊销。
更深层的限制在于:DLR-Lock压制的是“微调”这条路径,那蒸馏攻击呢?攻击者如果预算够大,永远可以通过模型输出的logits蒸馏从零训练一个新模型。论文对此有清醒的认识——任何防御都敌不过预算超过预训练成本的攻击者。DLR-Lock的目标是把攻击者的成本从“一个零头”抬到“接近完整预训练”,这就已经让大多数恶意适配变得不划算了。
龙迷三问
这篇论文到底在解决什么问题? Apple提出DLR-Lock:把每个MLP换成深层低秩残差网络,推理性能基本不降,微调时激活内存线性增长、反传开销飙至8.1倍,在Qwen3-0.
这篇工作最值得看的点是什么? 锁定模型在质量保持上接近原始模型(困惑度完全恢复,下游任务准确率差距在几个点以内),同时显著增加微调成本(训练损失收敛更慢、发散风险更高、墙钟时间开销更大)。
这篇工作的边界或风险在哪里? 优点:(1) 创新性地利用推理-训练不对称性作为防御轴,不依赖权重秘密;(2) 通过蒸馏保持功能等价,理论上保留所有下游任务性能;(3) 三种锁定机制互补,防御效果可量化。缺点:(1) 推理延迟有显著开销(即使编译后,最强配置下仍有1.
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
利用自动微分的推理-训练不对称性,将预训练模型中的每个MLP替换为参数等量的深度低秩残差网络(DLR-Net),通过模块级蒸馏保持功能等价,从而在保持推理性能的同时显著增加微调成本。
实验合理度: ★★★★☆
困惑度(Perplexity)、准确率(Accuracy)、训练损失收敛曲线、推理延迟、内存开销
学术研究价值: ★★★★☆
利用自动微分的推理-训练不对称性,将预训练模型中的每个MLP替换为参数等量的深度低秩残差网络(DLR-Net),通过模块级蒸馏保持功能等价,从而在保持推理性能的同时显著增加微调成本;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
推理FLOPs与原始模型相当,但训练时激活内存从Θ(N·d_ff)增加到Θ(N·d·L),放大因子为Θ(d/r);反向传播时间显著增加,编译后训练开销比eager执行更差(t_b'/t_b > 1)。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) 推理延迟有显著开销(即使编译后,最强配置下仍有1.4-2倍开销);(2) 蒸馏过程复杂,需要两阶段训练;
主要参考文献
[1] Rosati D, et al. Model locking: Making pretrained weights resistant to fine-tuning. 2025.
[2] Wang Y, et al. Non-fine-tunability: A new perspective on protecting pretrained models. 2026.
[3] Hu E J, et al. LoRA: Low-rank adaptation of large language models. ICLR 2022.
[4] Shazeer N. GLU variants improve transformer. arXiv 2020.
[5] Chen T, et al. Training deep nets with sublinear memory cost. arXiv 2016.
[6] Bachlechner T, et al. ReZero is all you need: Fast convergence at large depth. UAI 2021.
[7] Yang A, et al. Qwen3 technical report. 2025.
[8] Su Y, et al. Nemotron-CC: Transforming common crawl into a refined long-sequence training dataset. 2025.
[9] Gao L, et al. A framework for few-shot language model evaluation. 2023.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
模型锁不住,微调两行泪?
Apple反手一个DLR-Lock:推理照样快,训练贵上天。
想跟龙哥一起追踪AI安全前沿?
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称 (如 AI安全+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。