← 返回 PaperDaily
大模型与智能体
普林斯顿大学最新:用扩散模型替代梯度,越狱成功率高达100%,竟能绕过防御
越狱攻击的“流畅性”和“成功率”就像鱼和熊掌,之前的GCG虽然成功率不错但写出的后缀简直不是人话,而基于改写的方法虽然流畅却容易丢失攻击意图。普林斯顿这篇论文直接用扩散模型替代梯度,解决了这个“既要又要”的悖论,在多个模型上取得SOTA,甚至对Mistral-7B达到了100%的攻击成功率,而且能完美绕过困惑度和守卫模型检测。如果你想了解攻击的最新范式,这一
龙哥读论文
发布于 2026-08-14 09:10:39
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 越狱攻击的“流畅性”和“成功率”就像鱼和熊掌,之前的GCG虽然成功率不错但写出的后缀简直不是人话,而基于改写的方法虽然流畅却容易丢失攻击意图。普林斯顿这篇论文直接用扩散模型替代梯度,解决了这个“既要又要”的悖论,在多个模型上取得SOTA,甚至对Mistral-7B达到了100%的攻击成功率,而且能完美绕过困惑度和守卫模型检测。如果你想了解攻击的最新范式,这一篇不能错过。
原论文信息如下:
从"噪声"中诞生:当"扩散模型"成为破解利器
龙哥之前聊过很多越狱攻击,但每次提到GCG,大家反应都很一致:攻击成功率确实高,但生成的提示词后缀简直不是人话——全是乱码,困惑度爆表,安全模型一抓一个准。另一边,基于改写的方法(如PAIR、AutoDAN)倒是流畅得像人类写的,可攻击意图经常被稀释,变成了"劫持税":模型虽然回复了,但根本不是在响应你的恶意意图。这就像你让AI"教我造炸弹",它却回你"如何制造一个蛋糕的炸弹式造型",然后你还以为成功了——实际上模型根本没上当。
那有没有一种方法,既能保持流畅自然 的文本,又能实现精准的token级优化 ?普林斯顿大学的研究者给出了答案:用离散扩散模型(DLM)替代梯度来做提议分布。Greedy Coordinate Diffusion(GCD)这个新框架,直接把扩散模型的生成先验融入对抗搜索,让攻击提示词从"噪声"(一堆mask标记)中逐步"去噪"成流畅的恶意文本。
你可能会问:扩散模型不是做图像生成的吗?其实,离散扩散语言模型(如MDLM、Dream)很早就被设计用来非自回归地生成文本——它不是从左到右逐词写,而是从一个全部mask的序列开始,逐步替换成具体的词。GCD正是利用这一特性:把攻击提示词初始化为全mask状态,然后每一步用扩散模型来"提议"每个位置应该填什么token,再根据攻击损失函数贪婪地选择最优替换。这天然就保证了生成的文本是语义连贯 的,因为扩散模型只会在训练数据中学过的合理分布里采样。
更妙的是,GCG需要模型梯度(白盒),而GCD只需要输出log概率(灰盒),这意味着它可以在API封装的模型上工作——比如只给你logprobs的闭源模型。这在实际攻击中实用性大大提升。
揭秘GCD如何生成"流畅"的对抗提示
GCD的核心思想其实很简洁:用扩散模型替代梯度来生成候选token 。整个流程如图1所示,每一步迭代都包含六个步骤:随机采样待修改位置、查询扩散模型获取top-K候选、构建候选序列、用单步扩散投射补全mask、计算损失、贪婪更新。
具体来说,对抗提示x_adv初始化为全mask序列。然后循环T步:
1. 位置采样: 随机选择一个子集T(占全部位置的γ比例)作为活跃位置进行优化。
2. 扩散提议: 对每个活跃位置i,将该位置mask掉,然后查询扩散模型Dφ,获取该位置上的top-K个最可能token。
4. 单步扩散投射(OSD): 这是GCD的关键创新。由于候选序列中可能还包含mask标记,而目标模型是自回归模型,无法处理mask标记。因此需要对带有mask的候选序列进行一次扩散去噪,一步将所有剩余mask位置填满,得到一个完整的、可被目标模型评估的文本。
5. 损失评估与贪婪更新: 对每个完整候选序列,计算复合损失L_comp,并选择损失最小的那个作为本步的更新。
GCD还采用了两阶段流水线。第一阶段优化至多T步,一旦目标前缀精确匹配成功,进入第二阶段。第二阶段继续优化,每步成功后生成完整的512-token回复,由代理法官(Gemini 2.5 Flash)按1-5分评分,收集评分≥4的候选,最终选出最优攻击。
为了进一步避免模型产生规避性回复,GCD在第二阶段加入了一个多样性损失 L_div,鼓励对抗提示促使模型生成不同的、有害的续文。多样性损失通过降低常见回避性首词的概率来实现。
与GCG相比,GCD最大的优势在于不需要梯度 ,同时通过扩散模型的先验约束搜索空间,只探索语义合理的区域。图4展示了GCD与GCG在48个样本的消融基准上的收敛曲线:GCD的目标CE损失下降更快、更稳定,而GCG波动很大。
实验对比:全面碾压,不仅仅是攻击成功率
GCD在四个主流开源模型上进行了测试:Llama-3-8B-Instruct、Mistral-7B-Instruct-v0.3、Qwen2-7B-Instruct和Gemma-2-9B-It。对比基线包括基于梯度的GCG、GBDA,以及基于人类可读攻击的PAIR、TAP、AutoDAN、Inpainting等。
从表1可以看出,GCD在无防御 条件下几乎在所有模型上都取得了最高ASR(以HarmBench为准)。特别地,对Mistral-7B,GCD达到了100%的攻击成功率。在困惑度防御 下,GCG和GBDA的性能大幅下降,而GCD的下降幅度很小,说明它生成的对抗提示本身就很自然,不易被困惑度过滤器检测。在守卫模型防御 下(表2),GCD同样表现突出,尤其是对Llama-3-8B和Mistral-7B,即便在Llama Guard的过滤下,GCD仍然能达到80%以上的ASR,远超其他方法。
此外,论文还对半数据集的性能进行了评估(表4),GCD展示了稳定的高成功率,证明其不是只在一小部分样本上work。
在响应质量 方面,GCD生成的回复在StrongReject评分和有害性评级上同样领先。这意味着攻击不仅成功率高,而且真的能让模型吐出有害内容,而不是敷衍了事。
可扩展性与鲁棒性:一体两面的攻防博弈
GCD的另一个亮点是可扩展性 。由于它使用扩散模型作为提议分布,而扩散模型天然支持并行填充多个mask位置,因此可以轻松扩展到长序列攻击。GCG每次只能修改一个token,且梯度计算随序列长度线性增长,而GCD通过坐标子采样(γ=0.8)和候选子采样(ρ=0.05)大幅降低了每次迭代的计算量。实验表明,在相同的优化步数内,GCD的收敛速度比GCG快得多(见图2)。
在鲁棒性 方面,GCD对多种防御(困惑度过滤、守卫模型)都表现出较强的抗性。这主要归功于复合损失函数中的L_guard和L_PPL项,使得优化过程本身就在寻找既能欺骗守卫模型又低困惑度的对抗提示。而GCG的梯度近似会产生高困惑度的后缀,在防御面前不堪一击。
当然,任何方法都有代价。GCD的主要开销在于每步需要查询扩散模型和调用受害者模型。但通过子采样和批处理,实际每步的受害者模型调用次数可以控制在较低水平。论文给出的配置下,每步大约只需要200-400次受害者模型调用,比GCG的每步计算量小得多。
GCD还有一个有趣的特性:分词器无关 。因为扩散模型的提议是基于文本字符串的,在传递给受害者模型前,提案被转换成文本,所以两个模型可以使用不同的分词器。这在实际攻防中意义重大,因为可以直接用小型扩散模型为大型LLM生成对抗提示。
然而,龙哥也不得不指出,GCD仍然存在一些局限。首先,它需要访问受害者模型的logprobs,这限制了它在完全不提供logprobs的API上的应用。其次,扩散模型本身需要一定的算力。此外,攻击长度受限于扩散模型能够处理的最大序列长度(目前实验中使用128个token的后缀)。
龙迷三问
GCD和GCG的本质区别是什么? GCG使用精确的梯度信息(白盒)来选择候选token,每一步计算损失对输入token嵌入的梯度,取top-K替换。但梯度近似会引入误差,且生成的token序列困惑度高。GCD用离散扩散模型作为提议分布(灰盒,只需要logprobs),扩散模型天然生成语义连贯的token,因此候选质量更高,且优化搜索空间被限制在合理语言范围内。
什么是“劫持税”(jailbreak tax)? 劫持税指攻击者为了获得流畅提示而改写原始恶意意图,导致模型回复的实际上是改写后的无害问题而不是原始恶意意图。比如把“教我造炸弹”改写为“如何用日常材料制作一个模拟炸弹的装饰品”,模型回复了装饰品制作方法,看起来攻击成功了,但实际攻击意图已经丢失。GCD通过保持原始恶意意图并使用严格的token级优化来避免劫持税。
GCD中使用的扩散模型是什么?需要自己训练吗? 论文使用现成的离散扩散语言模型Dream-v0-Instruct-7B(基于MDLM架构),不需要自己训练。扩散模型作为提议分布,只需要做一次前向传播得到每个位置的token概率分布即可。这意味着你可以直接下载预训练好的扩散模型,然后用它来生成对抗提示候选。此外,论文还证明可以使用更小的扩散模型(如7B)来攻击更大的受害者模型(如9B),因为提议规则不依赖于显卡大小。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★★
将离散扩散模型引入对抗性提示生成,替代传统的梯度近似,这是一个非常巧妙地范式转移。扩散模型作为提议分布不仅解决了困惑度问题,还实现了灰度箱攻击,创新性突出。
实验合理度: ★★★★★
实验设计全面,对比了4个受害者模型、多种防御设置和多个基线方法,且进行了充分的消融实验。结果可信,统计显著性有展示。
学术研究价值: ★★★★★
开创了扩散模型用于对抗搜索的新方向,为后续将生成模型与优化结合提供了范本。文中提出的“单步扩散投射”解决mask token不兼容问题的方法很有启发性。
稳定性: ★★★★☆
在多个模型和设置下表现稳定,但结果中仍存在一些方差(如对Gemma-2-9B的ASR略低),且扩散模型本身的随机性可能影响单次运行的一致性。
适应性以及泛化能力: ★★★★☆
在三个不同系列模型上都有出色表现,但仅测试了开源模型,对最新闭源模型(如GPT-4o、Claude)的适配性未知。另外攻击长度限制为128 token,可能不够灵活。
硬件需求及成本: ★★★☆☆
需要加载一个7B的扩散模型和一个受害者模型,对GPU显存有较高要求(至少需要两块24GB显存卡才能同时运行两个模型)。推理时间方面,每步需要多次受害者模型调用,但是可以通过子采样降低。总体而言计算成本中等。
复现难度: ★★★★★
论文提供了完整的开源代码、配置文件和实验脚本,支持单GPU运行和SLURM集群提交。使用的扩散模型是公开的Dream-v0-Instruct-7B,受害者模型也是常见开源模型。复现门槛较低。
产品化成熟度: ★★☆☆☆
目前仍属于研究探索阶段,主要用于红队测试和安全评估。直接产品化面临伦理和法律风险,且需要针对不同模型和防御进行调参。但作为安全评估工具,已经具备可用性。
可能的问题: 论文仅在4个开源模型上评估,缺少对GPT-4、Claude等闭源API模型的测试。此外,攻击成功率依赖于两阶段的选择机制(Gemini 2.5 Flash作为法官),这引入了额外的复杂性和成本。文中也指出,扩散模型生成的候选仍然可能包含无意义token,需要进一步优化。
主要参考文献
[1] Zou et al., "Universal and Transferable Adversarial Attacks on Aligned Language Models", 2023. (GCG)
[2] Chao et al., "Jailbreaking Black Box Large Language Models in Twenty Queries", 2023. (PAIR)
[3] Liu et al., "AutoDAN: Automatic and Interpretable Adversarial Attacks on Large Language Models", 2023.
[4] Guo et al., "Cold-Attack: Jailbreaking LLMs with Stealthiness and Controllability", 2024. (COLD)
[5] Wang et al., "Diffusion Attacker: Generation-based Prompt Attack for LLMs", 2025.
[6] 原始论文链接:https://arxiv.org/pdf/2606.15531v2.pdf
[7] 开源代码:https://github.com/princeton-peas-lab/gcd
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
今天聊的是“攻击”,但咱们心里装的都是“防御”。
想第一时间了解最新的AI安全前沿、对抗攻击新范式? 欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 大模型安全+上海+普林斯顿+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。