← 返回 PaperDaily 大模型与智能体

开源模型的防盗锁来了?Apple用DLR-Net让微调成本暴涨4倍

这是龙哥近期看到的最有“反常识”的AI安全论文:正常防御都是让模型变笨或推理变慢,Apple却反手把训练成本拉满,推理保持原速,还顺手把自适应攻击者挡在门外。方向清奇且实验扎实,值得一读。

开源模型的防盗锁来了?Apple用DLR-Net让微调成本暴涨4倍
原论文信息如下:
论文标题:
Locking Pretrained Weights via Deep Low-Rank Residual Distillation
发表日期:
2026年5月

发表单位:
Apple

原文链接:
https://arxiv.org/pdf/2605.10777

模型锁定:一个看似不可能的任务

先聊一个看似矛盾的问题:开源权重模型的兴起,让整个行业享受到了前所未有的自由——任何人可以在任意硬件、任意平台上跑模型,可以拿去微调、做研究、甚至再分发。但硬币的另一面是,模型发布者一旦把权重交出去,就彻底失去了对模型行为的控制:任何一方都能把模型微调到新的领域,或者干脆去掉使用限制,而且成本往往只是原始训练成本的一个零头。
那么问题来了:能不能给模型装上一把“锁”——让微调它的成本远高于微调原始模型的成本,同时推理性能几乎不受影响?这个“模型锁定”概念最早由Rosati等人于2025年引入,Wang等人于2026年提出了非微调性的相关概念。Apple研究团队在这篇论文中对这个问题给出了一个相当反直觉的回答。
论文先把模型锁定形式化了一个清晰的定义:设f是预训练模型,锁定机制M加上私有信息s产生锁定模型g = M(f, θ₀, s)。理论上要求两条:一是效用保持——锁定模型在所有下游任务上的损失不超过原模型的ε;二是适配成本放大——对任意下游任务τ和目标性能p,锁定模型的适配成本至少是原模型的κ倍,κ > 1。这里的成本用墙钟时间、FLOPs或GPU小时来衡量。
适应成本公式
这里有一个关键假设:攻击者完全知道锁定算法M的存在和原理,只是不知道私有信息s。这正是Kerckhoffs原则——安全不能依赖保密,而必须依赖结构本身。攻击者的计算预算远小于预训练成本,因为如果攻击者的预算能覆盖预训练成本,他完全可以通过对模型输出的logits蒸馏从头训练一个新模型。
那问题搞清楚了,接下来看看为什么说锁定是“不可能的任务”。论文分析了三类常见思路的失败原因。
第一类是基于对称性的防御。ReLU激活函数满足正齐次性:对任意a > 0,有ReLU(az) = a·ReLU(z)。于是对任意形如W₂ReLU(W₁x)的层,都有(aW₂)·ReLU(a⁻¹W₁·x)这个等价重参数化。这会让优化变得困难,但攻击者只需检查每层权重范数,就能轻易发现这种不平衡并重新平衡。更一般地,在两个连续线性层之间插入一个可逆矩阵A及其逆A⁻¹,也属于这类可被SVD(奇异值分解)拿掉的防御。
第二类是基于障碍的防御——在层间插入一个输入雅可比矩阵病态的模块B,让梯度爆炸或消失。但问题在于:屏障模块必须是不可分割的,而且形式必须靠学而不是靠手工设计,否则自适应攻击者能直接拆掉它。而标准蒸馏只能产生光滑的近似,想在不动下层的前提下构造病态雅可比,难度极大。更致命的是,屏障越有效,梯度被堵得越死,防守方自己也没法维持模型质量。
第三类是基于惩罚的防御——把“难以微调”本身写成约束条件,用优化去找病态解,即最大化某个困难度指标Ω(θ)。但这里有个自我拆台的死循环:防守方想找到“让优化变困难”的解,自己却必须依赖优化才能找到它。
优化惩罚公式
论文做了一个关键实验来证明:锁定解存在,但梯度下降根本走不到。在MNIST上训练一个两层ReLU MLP,优化目标是最小化MSE与λΩ的差值,用29个λ值和3个学习率扫描。结果发现,无论怎么调参,没有一条轨迹能到达“高困难度+保持原函数”的区域。然而这种解确实存在——权重对称性给出的重参数化方向就是。梯度下降就是够不着。
图2:锁定解存在但梯度下降无法到达。在MNIST上训练的两层ReLU MLP上优化目标,扫描29个λ值和三个学习率。每条曲线是一条轨迹,颜色编码log₁₀λ。红星表示权重对称性解。左图:Ω = ‖Δθ‖²;右图:Ω = Tr(H_CE)。x轴均为相对MSE
这说明什么?在损失函数和梯度流上做文章的锁定策略,本质上都是穷途末路。换个角度思考:防守方的优势并不一定要藏在损失曲面里,也可以藏在自动微分的计算机制里。

推理-训练不对称性:新的防御维度

自动微分有一个被大多数人忽略的结构性差别:推理只需要一次前向传播,算完就扔掉中间激活值;而训练必须把所有中间激活值存下来,才能在反向传播时计算梯度。这个推理和训练之间的内存不对称,就是这篇论文选中的新防御轴。
Transformer块结构公式
现代大语言模型(LLM)堆叠了N个Transformer块,每个块由多头自注意力Attn和前馈网络FFN构成,配合残差连接和RMSNorm归一化,遵循Pre-Norm约定。上面公式描述了标准Transformer块的结构:输入X先经过RMSNorm再进入注意力,输出Z;Z再经过RMSNorm进入FFN,得到最终输出X′。公式里的RMSNorm是Post-Norm时代的“降噪器”,逐token独立做归一化。
SwiGLU公式
在LLaMA和Qwen这类新架构里,FFN是个SwiGLU门控MLP:三门权重W_gate、W_up分别投影输入,逐元素相乘后再经SiLU激活,最后W_down投影回原始维度。这里⊙表示逐元素乘法,σ(z) = z·sigmoid(z)是SiLU激活函数。每个token独立计算,属于逐行运算。
DLR-Lock的策略,就是把模型里每一个SwiGLU MLP整个替换成一个深度低秩残差网络(DLR-Net)——参数总量差不多,输入输出映射几乎一致,但对于任何试图反向传播的人,代价剧增。如图1所示,这个替换引入了三重锁定机制。
图1:DLR-Lock概述。原始模型中的每个MLP(上)通过模块级蒸馏被替换为功能等价的深度低秩残差网络DLR-Net(下)。替换引入了三种锁定机制:(1)激活内存增长,(2)架构不匹配导致的优化不稳定,(3)不成比例的反向传播开销
第一重是激活内存线性增长。DLR-Net的深度L远超原始MLP的层数,反向传播时需要逐层保存中间激活值,峰值激活内存随深度线性上涨。第二重是隐藏状态在不同层之间流动,反向传播需要沿深度逐层展开,形成与原始架构完全不同的优化曲面——那些为标准MLP精心调好的微调学习率和优化器设置,在这里几乎必然“水土不服”。第三重更阴险:反向传播的时间和内存开销被不成比例地放大,前向推理几乎不受影响,但训练就像背着沙袋跑马拉松。
这套防御的妙处在于,它不依赖寻找特定权重,不改变损失曲面,也不靠什么秘传配置——纯粹靠自动微分的结构性不对称建立防线。也就是说,无论攻击者用什么优化器,只要走反向传播这条路,就必然撞上这几道墙。

DLR-Net:深度低秩残差网络的设计与蒸馏

任何防御方案首先不能误伤用户。替换后的模块必须满足两个硬约束:一是输入输出行为与原始MLP匹配,二是不会显著增加参数量或推理成本。于是论文选择了低秩残差块:瓶颈秩r远小于隐藏维度d,每层的参数量很小,从而可以在总预算P下堆出很深的网络。
DLR-Net递推公式
DLR-Net的递推式如上:输入z经过L层残差更新得到输出x′。每一层h_{i+1} = h_i + α_i·U_i·σ(V_i·RMSNorm(h_i))。这里V_i ∈ R^{r×d}把输入降到瓶颈维度,U_i ∈ R^{d×r}再投影回来,σ使用与SwiGLU一致的SiLU激活,α_i则是一个可学习的ReZero缩放标量,初始化为0。每层约2dr个参数,深度L = ⌊P/(2dr + c_norm)⌋。瓶颈秩r越小,相同参数预算下网络越深。
论文特意强调:当L超过100时,RMSNorm预归一化对训练稳定性至关重要——没有它,深度残差网络根本训不动。这里的RMSNorm对每个token做归一化,不引入跨token的交互,这正是能和原始Transformer结构无缝拼接的关键。
把MLP换成DLR-Net还不够,还要保证替换后的模型“看起来”还是原来那个模型。论文提出了两阶段蒸馏流程。
第一阶段是模块级蒸馏:对每个Transformer层l,先从预训练模型里采集隐藏状态z_l,然后单独训练对应的DLR-Net去拟合完整的残差子模块f_l(z) = z + FFN_l(RMSNorm(z))。损失函数是相对MSE,除以‖f_l‖²做归一化——因为不同层的输出范数差异很大。这一阶段所有层可以并行独立训练,效率很高,但单层误差会在整个前向传播中累积。
第二阶段是logits蒸馏:把所有DLR-Net参数联合起来,用原始模型当教师,对齐全模型的输出分布。对齐损失采用top-k KL散度——只计算教师概率最高的k个token的KL散度,k=1000。这一步能大幅修正累积误差。有意思的是,第二阶段需要反向传播穿过整个锁定模型,防守方自己也要面对激活内存墙——但第一阶段提供了很好的初始化,收敛很快,而且这笔开销只需要付一次。
攻击者当然不会坐以待毙,论文系统分析了四种可能的攻击策略。梯度检查点是第一反应——选择性重计算DLR-Net块,把峰值内存从O(NLd)降到O(Ld),但代价是每个MLP前向传播都要重算,最优的均间隔检查点策略额外开销为O(√(NL)d)。局部权重更新呢?冻结DLR-Net只训其他部分?RMSNorm的反向传播还是要存d维中间向量;如果用stop_grad完全截断梯度,沿主分支的梯度信号就丢了,训练信号有偏。LoRA呢?LoRA把基座权重冻结、只训低秩适配器——但DLR-Net里的U_i和V_i本身就已经是低秩的了,再加一层分解根本没有表达空间。最后,模块级蒸馏逆向?攻击者可以反过来把DLR-Net蒸馏回SwiGLU——但要彻底移除防御,必须把全部N层都反向蒸馏一遍,成本线性放大,防守方付了一次的代价,攻击者逃不掉要再付一次。

实验验证:质量保持与防御效果

实验在Qwen3-0.6B上进行。蒸馏数据用Nemotron-CC,一个经过清洗的网络文本语料。模型权重初始化遵循特定分布:U_i从N(0, 1/(d√L))采样,V_i从N(0, 1/r)采样,α_i置为0。两阶段训练都用AdamW优化器,权重衰减10⁻⁵,余弦学习率调度加5%线性预热,梯度裁剪到范数1。第一阶段每层独立训50万步,学习率3×10⁻³,批大小2,序列长度2048;第二阶段所有DLR-Net参数联合训10万步,top-k=1000,学习率10⁻³,批大小4,序列长度2048。
首先验证质量保持。论文在Nemotron验证集、WikiText-103以及LM Evaluation Harness的7个基准任务上做了评测,包括MMLU、ARC Easy/Challenge、HellaSwag、WinoGrande、BoolQ和PIQA。
表1:Qwen3-0.6B锁定后的质量保持效果。“模块级蒸馏”在阶段1中将每个SwiGLU MLP替换为DLR-Net。“+Logits蒸馏”在阶段2中应用logits蒸馏,k=1000,学习率10⁻³。Nemo = Nemotron,WT = WikiText-103,ARC-E/C = ARC Easy/Challenge,HSw = HellaSwag,WiGr = WinoGrande
仅做模块级蒸馏时,指标有明显回落:Nemotron困惑度从14.9涨到21.8,WikiText-103困惑度暴涨到182,MMLU掉到31.1。这说明单层误差确实在全模型前向传播中不断累积。而加上logits蒸馏后,Nemotron困惑度完全恢复到14.9,WikiText-103也回到23.4,MMLU回升到36.8。其他基准也大多收窄到几个点以内。要知道,仅仅靠第二阶段一次训练就把这么深的替换网络拉回原水平,这个收敛速度本身就说明第一阶段的模块级初始化打得够好。
接下来是推理开销。DLR-Net的理论FLOPs与原始SwiGLU相当,但一大串小矩阵乘法会带来内核启动开销。论文在H100上用bfloat16测了三种规模,对比了PyTorch的eager模式和torch.compile的reduce-overhead模式。编译后DLR-Net的劣势急剧缩小——8B规模的单个DLR-Net,eager模式下开销比高达144倍,reduce-overhead编译直接降到11倍。
图3:左图:最深配置下MLP级开销比(DLR-Net / SwiGLU)与批大小的关系,使用reduce-overhead编译。0.6B (r=32)的算术强度低于roofline阈值,开销受内存限制。右图:Qwen3-8B的全模型prefill开销,每列对应不同深度L(秩r = 128、256、512、1024)
批大小能进一步摊薄开销——当批增大到2^18时,32B规模的开销比从7.2倍降到2.9倍。模型越大,每个残差块做的是更大的矩阵乘法,相对内核启动开销反而越不敏感。更妙的是,防御强度可以通过秩r和深度L来调节:图3右图显示,在Qwen3-8B上,当序列很长、注意力占主导时,最强配置(r=128, L=143)的全模型prefill开销只有1.4倍;而中等深度(L=35)几乎透明,只有1.09倍。防守方可以根据实际需求在“防御强度”和“推理代价”之间选一个工作点。
最后是核心验证:锁定模型能不能扛住微调攻击。攻击者在WikiText-103上做全参数微调,扫描了三个学习率,并开启梯度检查点来降低内存。论文对比了预训练基线和锁定模型的收敛曲线,分别按训练token数和墙钟时间画了两行。
图4:预训练基线与锁定模型在WikiText-103上的微调收敛对比。上:损失与训练token数(两者批大小和序列长度相同);下:损失与墙钟时间。列对应不同微调学习率。阴影区域表示3个种子的±1标准差。在墙钟时间上,基线模型的反向传播占训练总时间的83%,锁定模型占89%
结果清晰而直观:锁定模型的收敛速度显著变慢,且在不同学习率下都成立。更细看墙钟时间——基线模型的反向传播占总训练时间83%,锁定模型的占比高达89%。也就是说,训练本身的计算开销被锁死了,攻击者在相同预算下能完成的“有效更新”大幅缩水。

局限与展望

这套方案当然不是银弹。论文自己也承认一个绕不开的权衡:DLR-Lock是微调领域无关的,它锁死的是所有微调,包括那些完全无害的应用。一个正派的开发者想拿这个模型做点正经事,同样也会被锁卡住脖子。因此DLR-Lock更适用于“只开放推理接口、不希望任何人改权重”的发布场景,而不是“既想开权重又想防滥用”的两全方案。
另一个连防守方自己都躲不掉的问题是:第二阶段logits蒸馏需要反向传播穿过整个锁定模型,这会让防守方的锁定成本大幅抬高。论文巧妙地把第一阶段做成并行模块蒸馏,让第二阶段从一个极好的初始化出发快速收敛,但一次性成本仍然存在。好在防守方只需要付一次,成本可以在所有部署中摊销。
更深层的限制在于:DLR-Lock压制的是“微调”这条路径,那蒸馏攻击呢?攻击者如果预算够大,永远可以通过模型输出的logits蒸馏从零训练一个新模型。论文对此有清醒的认识——任何防御都敌不过预算超过预训练成本的攻击者。DLR-Lock的目标是把攻击者的成本从“一个零头”抬到“接近完整预训练”,这就已经让大多数恶意适配变得不划算了。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?Apple提出DLR-Lock:把每个MLP换成深层低秩残差网络,推理性能基本不降,微调时激活内存线性增长、反传开销飙至8.1倍,在Qwen3-0.
这篇工作最值得看的点是什么?锁定模型在质量保持上接近原始模型(困惑度完全恢复,下游任务准确率差距在几个点以内),同时显著增加微调成本(训练损失收敛更慢、发散风险更高、墙钟时间开销更大)。
这篇工作的边界或风险在哪里?优点:(1) 创新性地利用推理-训练不对称性作为防御轴,不依赖权重秘密;(2) 通过蒸馏保持功能等价,理论上保留所有下游任务性能;(3) 三种锁定机制互补,防御效果可量化。缺点:(1) 推理延迟有显著开销(即使编译后,最强配置下仍有1.
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

利用自动微分的推理-训练不对称性,将预训练模型中的每个MLP替换为参数等量的深度低秩残差网络(DLR-Net),通过模块级蒸馏保持功能等价,从而在保持推理性能的同时显著增加微调成本。

实验合理度:★★★★☆

困惑度(Perplexity)、准确率(Accuracy)、训练损失收敛曲线、推理延迟、内存开销

学术研究价值:★★★★☆

利用自动微分的推理-训练不对称性,将预训练模型中的每个MLP替换为参数等量的深度低秩残差网络(DLR-Net),通过模块级蒸馏保持功能等价,从而在保持推理性能的同时显著增加微调成本;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

推理FLOPs与原始模型相当,但训练时激活内存从Θ(N·d_ff)增加到Θ(N·d·L),放大因子为Θ(d/r);反向传播时间显著增加,编译后训练开销比eager执行更差(t_b'/t_b > 1)。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 推理延迟有显著开销(即使编译后,最强配置下仍有1.4-2倍开销);(2) 蒸馏过程复杂,需要两阶段训练;

主要参考文献

[1] Rosati D, et al. Model locking: Making pretrained weights resistant to fine-tuning. 2025.
[2] Wang Y, et al. Non-fine-tunability: A new perspective on protecting pretrained models. 2026.
[3] Hu E J, et al. LoRA: Low-rank adaptation of large language models. ICLR 2022.
[4] Shazeer N. GLU variants improve transformer. arXiv 2020.
[5] Chen T, et al. Training deep nets with sublinear memory cost. arXiv 2016.
[6] Bachlechner T, et al. ReZero is all you need: Fast convergence at large depth. UAI 2021.
[7] Yang A, et al. Qwen3 technical report. 2025.
[8] Su Y, et al. Nemotron-CC: Transforming common crawl into a refined long-sequence training dataset. 2025.
[9] Gao L, et al. A framework for few-shot language model evaluation. 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
模型锁不住,微调两行泪?
Apple反手一个DLR-Lock:推理照样快,训练贵上天。
想跟龙哥一起追踪AI安全前沿?
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 AI安全+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。