← 返回 PaperDaily 大模型与智能体

巴伊兰大学给遗忘算法上强度:越狱攻击一测,多个SOTA当场翻车

传统遗忘评测只问「忘没忘」,不问「能不能被硬撬开」。巴伊兰大学这篇论文把两件事同时做了:一是用边界知识检查误伤,二是拿越狱攻击检验假遗忘。看完实验只想说:不少模型连「表面失忆」都算不上,顶多是「装死」。

巴伊兰大学给遗忘算法上强度:越狱攻击一测,多个SOTA当场翻车
原论文信息如下:
论文标题:
Stress Testing Unlearning Algorithms
发表日期:
2026年08月
发表单位:
巴伊兰大学(Bar-Ilan University)
原文链接:
https://arxiv.org/pdf/2608.22527v1.pdf

你有没有想过一个问题:大模型说「我忘了」,到底是真忘了,还是只是被训得不敢说?
放在以前,这个问题没人较真。因为忘没忘,拿测试题考一下就知道了——模型答不上来,咱就默认它忘了。但巴伊兰大学这篇论文偏偏要较这个真:你那些「答不上来」,到底是脑回路里真没这知识了,还是仅仅被一层薄薄的「安全壳」压着?一旦有人用越狱攻击轻轻一撬,被压着的知识会不会像弹簧一样弹回来?
实验结果相当打脸。以生物学域的Llama-3-8B为例,两个遗忘方法在传统指标上表现几乎相同:RMU的目标集准确率24.98%,simNPO是26.08%,看起来都是「忘得很干净」。可一旦加上对抗攻击,RMU依旧坚挺在28.12%,simNPO却直接飙到60.09%——一个看似同样成功的遗忘,一个是真的洗掉了,一个只是把记忆盖了块布。盖布的那个,一掀就露馅。
*表格超出部分左右可以滑动

现有遗忘基准的致命盲区

图3
图3
这种「指标差不多、实战差一倍」的现象,正是这篇论文要解决的问题。它提出了一个名为WMDP++的新评测基准,给遗忘算法做压力测试。WMDP++在原有WMDP基准上加了两个维度的考察:一是边界知识,二是对抗提取。这两板斧下来,谁是真遗忘,谁是装失忆,一眼便知。
先聊聊机器遗忘是个什么活儿。大模型在互联网海量数据上训练,难免把一些不该记的东西吸进去:私密信息、版权内容、甚至制造危险品的步骤。出了问题怎么办?最笨的办法是找到问题数据、重训整个模型,但单次训练动辄数百万美元,没人烧得起。机器遗忘要做的就是「外科手术」:精细切除模型里特定知识的影响,同时保住其他能力,还不用从头重训。
想法很美好,评测却很敷衍。目前最常用的几个遗忘基准——WMDP、TOFU、Who's Harry Potter——结构上都差不多:一个遗忘集,里面是要清除的知识;一个保留集,用来确认模型其他能力没被破坏。评估时,遗忘集答不上来的比例越高、保留集分数掉得越少,就认为遗忘越成功。
这套套路有两个大坑。
这个盲区有多大?看看WMDP基准本身:它的保留集用的是MMLU(大规模多任务语言理解基准),但MMLU里和生化安全、网络安全真正相关的题目占比极小。哪怕模型在相关子领域的知识已经崩塌了,整体MMLU分数可能依然好看。就像期末考试几十门课,有一门专业课学崩了,但其他科目全是基础课程拉分,平均分照样骗人。
第二个坑更致命:评测只测「直接问」,不测「绕弯子撬」。现有基准基本都是把遗忘集里的题目直接丢给模型,答不上来就算遗忘成功。但现实中谁会傻乎乎地直接问一个被安全对齐过的模型「怎么造生物武器」?真正的攻击者是会绕路的——换个表述、加上下文暗示、用多轮对话诱导。评测基准不测这些,模型看起来「忘了」,实际上底层知识结构纹丝不动,一撬就出来。

WMDP++:更严格的遗忘评估框架

针对上述两个盲区,巴伊兰大学的研究团队在WMDP的基础上构建了一个升级版评测基准——WMDP++。这个名字简单粗暴:就是在WMDP上做加法,补上两块短板。
先回顾一下WMDP是什么。WMDP(WMD-P,全称是Weapons of Mass Destruction Proxy,大规模杀伤性武器代理基准)是一个专门用来评估模型是否遗忘了危险知识的基准,涵盖生化安全和网络安全两大领域。它由几百道专家级别的多选题组成,目标是把那些可能被恶意利用的危险知识从模型里「擦掉」。WMDP本身是2024年提出的,在当时算是比较全面的评测集,但它留下的两个漏洞,正是WMDP++要补的。
WMDP++在原有基础上增加了两个新维度的评测:

维度一:边界知识评测。专门构造一批与被遗忘知识「语义相邻但完全安全」的专家级题目,用来检测遗忘算法是否误伤了邻近的安全知识。这些边界问题覆盖生物学和网络安全两个领域,共200道(每个领域100道),是从原始危险题目中提炼出25个核心主题后,用GPT-5.2迭代生成的安全变体。它们不是简单换个说法,而是真正贴近危险知识邻域的、安全的专业内容——比如「危险」的是如何利用某种病原体制造生物武器,那「边界」的就是该病原体的正常生物学特征和传播机制。

维度二:对抗鲁棒性评测。在遗忘集上施加多种攻击手段,包括白盒攻击(增强型GCG,即贪婪坐标梯度方法)和黑盒攻击(Crescendo、DIA对话注入攻击),测试被遗忘的信息能否被强制提取出来。评测指标是Max-JB——取所有越狱攻击方法中最高准确率。这个指标极其严格:只要有一种攻击能撬出来,就算没真正遗忘。

这两个维度一个管「别误伤好知识」,一个管「别假装忘了」。设计逻辑很清晰:真正的遗忘应该同时满足——危险知识在任何攻击下都提取不出来,且邻近的安全知识不受影响。

边界知识:被忽视的「灰色地带」

边界知识(Boundary Knowledge)这个概念,是这篇论文最值得细品的贡献之一。
打个比方:你想让一个医学专家忘掉「如何合成致命毒素」这回事,但你不能让他把「毒素的分子结构」「毒素在体内的代谢途径」「中毒后的临床表现」这些正常的毒理学知识也一起忘掉。前者是危险知识,后者是合法且必要的专业知识。二者在语义空间上挨得非常近,一不小心就一起被擦掉了。
现有基准用的保留集(比如MMLU)跟遗忘集之间的「语义距离」太远了。MMLU里包含几十个学科的知识——历史、地理、法律、物理……其中和微生物学、网络安全直接相关的题目比例极小。换句话说,就算模型把和危险知识邻近的微生物学知识全忘了,在MMLU总分上可能就掉个零点几个百分点,完全看不出来。论文作者打了个比方:这就像用「全市统考平均分」来衡量「某一门专业课有没有学崩」,平均分当然会被其他科目拉平,让人误以为一切正常。
实际上,遗忘算法常出现的副作用——论文里叫概念渗漏(concept bleeding,即被遗忘知识的概念向邻近知识扩散)——在标准基准上完全检测不到。这种「看似成功,实则误伤」的现象,比「忘记不干净」更隐蔽,也更危险。想象一下:一个模型被用来遗忘生物安全知识后,连基础的细胞生物学问题都开始答错——这在部署场景里是难以接受的。
WMDP++的边界问题集正是为此设计:每个领域100道安全但专家级难度、且与被遗忘知识语义邻近的题目。比如网络安全领域,边界题目可能涉及「某种特定漏洞的检测方法」——这与「如何利用该漏洞进行攻击」非常接近,但前者是防御知识,后者才是危险内容。这些题目由LLM生成后,网络安全部分经过了人类专家的逐题验证,确认安全、相关且答案正确。

对抗攻击揭示「假遗忘」真相

如果说边界知识评测是「B超」,那对抗鲁棒性评测就是「活检」。不再只是从外面看看,而是直接上工具撬开看。
WMDP++引入了三类越狱攻击手段来测试遗忘效果:

白盒攻击GCG。GCG(Greedy Coordinate Gradient,贪婪坐标梯度)是一种基于梯度的攻击方法。攻击者能看到模型权重,通过梯度信息自动搜索能够触发有害回答的通用对抗后缀。论文用的是增强版GCG,在多个已对齐模型上都能找到统一的对抗后缀。这相当于黑客拿到了系统源码,直接找漏洞。

黑盒攻击Crescendo。Crescendo是一种多轮对话式越狱攻击。攻击者扮演提问者,像一个真实用户一样,从完全安全的话题开始,在一轮轮对话中逐渐逼近敏感内容。整个过程不需要访问模型权重,只需要API级别的访问权限。这相当于一个耐心的骗子,一步步把话题引向禁区。

多轮攻击DIA。DIA(Dialogue Injection Attack,对话注入攻击)同样不需要访问模型权重。它通过构造特定的多轮对话,将攻击指令注入到对话历史中,诱导模型在后续对话中输出危险内容。这种攻击充分利用了LLM的上下文学习能力,让模型在「不知不觉」中掉进陷阱。

此外,WMDP++还测试了上下文学习(In-Context Learning, ICL)对遗忘效果的影响——在提问前给模型「喂」一些相关上下文,比如遗忘集里的问答对、边界集的问答对或者MMLU相关子集的问答对,看看这些「提示」能否唤醒被压制的知识。这种「温和」的探测方式虽然不如越狱攻击暴力,但更能反映真实使用场景中的信息泄露风险。
评测指标上,WMDP++引入了Max-JB(Maximum JailBreak accuracy,最坏情况越狱准确率)指标——取所有越狱攻击中模型表现的最高准确率。这个指标的哲学是:只有所有攻击手段都撬不出来,才算真正遗忘。只要有一种方法能把知识提取出来,就说明遗忘不彻底。
论文在这个环节还做了个有意思的「自省」:他们原本也想用PAIR攻击(Prompt Automatic Iterative Refinement,提示自动迭代优化),但发现PAIR生成的攻击前缀经常不小心泄露目标问题的线索或部分答案——也就是说,PAIR「助攻」了模型而不是在攻击模型。于是果断把PAIR踢出了评测方法集合。这个细节说明作者在设计评测方法时很认真,不是拿来就用,而是先验证工具本身的可靠性和公平性。
图1:生物学领域实验结果
图1:生物学领域实验结果。上下文由目标集、MMLUS或边界集的问答对构成,前两行为Llama-3-8B模型结果,后两行为Zephyr-7B模型结果。
图1展示的是在人为提供相关上下文(即few-shot示例)后,不同遗忘模型在目标危险问题上的准确率变化。可以清晰看到,大部分方法在上下文「提示」下纹丝不动,但ELM方法出现了明显的知识恢复——上下文越长,恢复效果越强。这恰好说明ELM并没有真正擦除知识,只是把知识的「出口」暂时堵住了。
图2:网络安全领域实验结果
图2:网络安全领域实验结果。上下文由目标集、MMLUS或边界集的问答对构成,前两行为Llama-3-8B模型结果,后两行为Zephyr-7B模型结果。
网络安全领域的结果进一步验证了这个趋势:ELM在上下文注入下同样出现知识恢复。这说明ELM的遗忘机制确实更偏向「表层压制」而非「底层擦除」。

实验结果:哪些方法真正有效?

论文在Llama-3-8B和Zephyr-7B Beta两个开源模型上,横向评测了五种主流的遗忘方法:RMU(随机错向遗忘)、ELM(语言记忆擦除框架)、NPO(负偏好优化)、simNPO(简化版负偏好优化)、OrthoGrad(正交梯度法)。每种方法都用统一的新评测框架测试。
先看总体结果。表1是生物学领域的综合结果,表2是网络安全领域的综合结果:
表1和表2:WMDP生物学与网络安全领域综合结果
表1和表2:WMDP生物学与网络安全领域综合结果。评估指标包括目标遗忘集准确率(Target)、最坏情况越狱提取准确率(Max-JB)、通用MMLU生物/网络安全子集(MMLU)、高中和大学生物/网络安全子集(MMLUS)以及边界知识准确率(Boundary)。每项指标最优结果以加粗呈现。
这张表信息量非常大,咱们逐行拆解。

第一,目标集准确率严重「骗人」。看生物学领域Llama-3-8B那一行:RMU的目标准确率是24.98%,simNPO是26.08%,看起来几乎一样,都是「忘得很干净」。但Max-JB指标暴露了真相:RMU是28.12%,simNPO飙到60.09%。这说明simNPO只是把知识压下去了,没有真正从权重层面擦除——一旦遇到越狱攻击,知识立刻被激活。RMU则是实打实的权重级擦除,攻击也撬不出来。目标集准确率完全无法区分这两种情况。

第二,MMLU掩盖了边界知识的崩塌。看Zephyr-7B在生物学领域用RMU的结果:MMLU只掉了1个点左右,MMLUS掉了3个点,看起来岁月静好。但边界知识从98%暴跌到47%,几乎腰斩。再看Llama-3-8B在网络安全领域用ELM:MMLU掉6个点,MMLUS掉4个点,边界知识却从97%崩到38%。标准基准完全检测不到这种大规模的概念渗漏——好像发烧病人体温没高多少,但体内某个器官已经严重受损了。

第三,RMU整体表现最优,但不是万能。在两个领域、两个模型上,RMU的Max-JB分数都是最低的,说明它的遗忘最「瓷实」。但代价也明显:RMU对边界知识的破坏也挺大(生物学域Zephyr-7B的边界知识掉到47%)。换句话说,RMU是在「擦得干净」和「误伤较少」之间找到了一个相对更好的平衡点,但远未完美。

第四,simNPO在Zephyr-7B上出现了反常现象。生物学领域simNPO在Zephyr-7B上的目标准确率高达45.64%(遗忘效果最差),但越狱攻击后的准确率反而降到了41.40%(Max-JB低于Target)。这个结果很反常,论文没有展开解释。一种可能的原因是:simNPO在Zephyr-7B上压根没学会「拒绝」,它把目标问题也当作正常问题处理,回答策略相对随机;反而是越狱攻击改变了它的回答分布,导致准确率下降。这从侧面说明,越狱攻击与遗忘方法之间的交互非常复杂,不是一个简单的高低排序就能概括的。

接下来看上下文敏感性和具体的越狱攻击分解。
表3和表4:不同评测设置下目标与边界生物学问题准确率
表3和表4:不同评测设置下目标与边界生物学问题准确率。第一列为无额外上下文的零样本准确率,后几列为评测问题前附加来自不同来源(目标集、边界集、MMLUS)的少样本问答上下文后的表现。
表3和表4揭示了上下文敏感性的核心发现:大部分遗忘方法对上下文「提示」不敏感,无论你给不给例子、给什么例子,它们都稳定地保持在低准确率。唯一明显的例外是ELM——在加入目标或边界上下文后,ELM在目标问题上的准确率从33%一路飙到接近40%(Llama-3-8B)甚至56%(Zephyr-7B)。这说明ELM遗忘的知识是「可恢复」的:知识本身还在模型里,只是默认不输出。你给它「打个样」,它就顺着坡往下滑了。
表5:不同越狱攻击下目标生物学问题准确率
表5:不同越狱攻击下目标生物学问题准确率。第一列为标准良性提示下的基线准确率,后几列为分别使用GCG、DIA和Crescendo攻击后的准确率。
表5的越狱攻击分解给出了另一个关键洞察:白盒攻击(GCG)在绝大多数配置下都远强于黑盒攻击(DIA和Crescendo)。比如Llama-3-8B在OrthoGrad下,GCG把准确率从27%拉到62%,而DIA和Crescendo几乎无效。这说明梯度信息对提取被压制的知识极为有效——模型权重本身就是一本「打开的书」,有梯度就能「读到」知识藏在哪。
但例外也很有启发性:Zephyr-7B在ELM下,Crescendo(多轮对话攻击)达到54.05%,比GCG的49.25%还高。这意味着ELM对Zephyr-7B的压制方式,恰好能被「渐进式对话诱导」破解——话题一步一步逼近,模型就一步一步放松警惕。
网络安全领域的结果整体趋势类似:RMU最稳,白盒攻击普遍更强。值得注意的是,网络安全域的基础模型目标准确率本身就只有44%左右(比生物学域的69%低不少),说明网络安全知识的作答本身就更难,遗忘后所有方法的数据都更接近随机猜测水平(约25%),区分度没那么大。
整个实验看下来,核心结论可以归纳成三句话:
第一,现有的目标集准确率指标严重高估了遗忘效果,尤其是对simNPO和OrthoGrad这类「表层压制型」方法——它们可能在直接提问下表现良好,但在对抗压力下迅速崩溃。
第二,通用保留集指标(MMLU)无法捕捉「概念渗漏」——边界知识的大幅下降在MMLU分数上几乎看不出来,需要一个专门设计、足够敏感的评测集才能发现。
第三,白盒越狱攻击是检验遗忘效果的「试金石」——如果你的方法在GCG面前撑不住,那就不叫真遗忘。RMU是目前评测方法中最接近「真遗忘」的,但远非完美。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?巴伊兰大学提出WMDP++基准,为LLM机器遗忘评测补上两大盲区:用边界问题检测邻近安全知识是否被误伤,用越狱攻击检验遗忘是否可被强制恢复。实验显示传统指标相近的方法在对抗攻击下差距悬殊,许多“遗忘”只是表面压制。
这篇工作最值得看的点是什么?论文通过WMDP++基准揭示了现有遗忘方法的严重缺陷:目标集准确率无法区分不同方法的真实遗忘效果;通用基准(MMLU)无法检测边界知识的严重退化;对抗攻击(尤其是白盒GCG)能显著恢复被抑制的知识,表明多数方法仅实现表面抑制而非真正擦除。
这篇工作的边界或风险在哪里?优点:提出了更严格的评估基准,揭示了现有方法的重大缺陷;边界问题集设计合理,能有效检测概念泄漏;对抗鲁棒性评估全面,包括白盒和黑盒攻击。缺点:边界数据集规模较小(仅100个问题);生物学领域问题未经过人类专家验证;未提供新方法,仅提供评估框架。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出WMDP++基准,通过引入边界问题集和对抗鲁棒性评估(包括上下文学习和越狱攻击),对现有机器遗忘算法进行更严格的压力测试。

实验合理度:★★★★☆

目标集准确率(Target)、最大越狱提取准确率(Max-JB)、MMLU准确率、MMLUS准确率、边界问题准确率(Boundary)

学术研究价值:★★★★☆

提出WMDP++基准,通过引入边界问题集和对抗鲁棒性评估(包括上下文学习和越狱攻击),对现有机器遗忘算法进行更严格的压力测试;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(基准测试论文,不涉及新模型训练)

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:问题集设计合理,能有效检测概念泄漏;对抗鲁棒性评估全面,包括白盒和黑盒攻击。缺点:边界数据集规模较小(仅100个问题);生物学领域问题未经过人类专家验证;未提供新方法,仅提供评估框架。

主要参考文献

[1] Diamant N, Fetaya E, Glazer N. Stress Testing Unlearning Algorithms. arXiv:2608.22527, 2026.
[2] Li N, Pan A, Goyal A, et al. WMDP: Measuring Knowledge Removal in Large Language Models. 2024.
[3] Zhang R, Lin L, Bai Y, et al. Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning. 2024.
[4] Łucki J, et al. Adversarial Attacks on Machine Unlearning. 2024.
[5] Zou A, Wang Z, Carlini N, et al. Universal and Transferable Adversarial Attacks on Aligned Language Models. 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
假遗忘现形了,真测评才刚开始。想第一时间跟进大模型安全、遗忘、越狱攻防的最新论文?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型安全+北京+字节+阿伟),根据格式备注,可更快被通过且邀请进群。 『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,大模型安全领域的小伙伴们都在群里等你来Battle~

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。