← 返回 PaperDaily 大模型与智能体

伦敦国王学院最新研究:给扩散LLM解码装上“锚点”,精度飙升6.4%,速度狂飙7.2倍!

扩散大模型并行解码虽快,但“一锅粥”式的上下文让错误像雪球一样越滚越大。伦敦国王学院这篇论文,巧妙地提出了一种无需训练的“锚点”机制,像给混乱的生成过程立了个不倒的“路标”,让模型在嵌入空间里就能“拨乱反正”,效果拔群。

伦敦国王学院最新研究:给扩散LLM解码装上“锚点”,精度飙升6.4%,速度狂飙7.2倍!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
扩散大模型并行解码虽快,但“一锅粥”式的上下文让错误像雪球一样越滚越大。伦敦国王学院这篇论文,巧妙地提出了一种无需训练的“锚点”机制,像给混乱的生成过程立了个不倒的“路标”,让模型在嵌入空间里就能“拨乱反正”,效果拔群。


原论文信息如下:
论文标题:
Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens
发表日期:
2026年06月
发表单位:
King's College London, The Chinese University of Hong Kong, The Alan Turing Institute
原文链接:
https://arxiv.org/pdf/2606.16847v1.pdf
开源代码链接:
未提供
项目链接:
未提供
开源数据集链接:
未提供

扩散LLM的“隐形陷阱”:错误传播与局部强化

想象一下:你指挥施工队同时砌砖赶工期。若某工人砌错一块,旁人会以错砖为基准继续砌,最终房子歪扭。更糟的是,质检员看到周围歪墙,以为“世界本如此”,连正确墙也推倒。这就是扩散大语言模型(dLLMs)并行解码的困境。传统自回归模型(如GPT)逐字生成,慢但稳;dLLMs(如LLaDA、Dream)则从全掩码([MASK])文本出发,逐步并行揭露所有位置,旨在加速推理。
图1:ASRD概览及其动机。现有的可撤销解码在混合质量的上下文中验证和生成token,导致错误传播和局部错误强化。ASRD则选择时间上稳定的token作为锚点,将锚点引导注入到掩码位置,并基于锚点扰动验证待定候选token。
图1:ASRD概览及其动机。现有可撤销解码在混合质量上下文中验证和生成token,导致错误传播局部错误强化
为纠正并行生成错误,研究者提出可撤销解码(Revocable Decoding):像“质检员”检查已砌砖,标记低置信度预测并推倒重来。但问题在于,验证与生成共享前向传播,质检员检查时周围全是未定性砖块,引出两个关键失败模式:
1. 错误传播:新位置生成token时,将周围未定性token(潜在错误源)当作可靠上下文学习,错误被“传承”。
2. 局部错误强化:错误token间相互“打掩护”,形成“自我和谐”假象,骗过质检员。
因此,我们需要一个可靠的“中心地标”,而非互相矛盾的“临时工”。

提出“锚点”:如何为无序生成构建可靠“路标”?

伦敦国王学院团队提出ASRD(锚点监督可撤销解码),一个训练无关框架。核心是锚点token缓存(ATC):token的预测在连续k个解码步骤中保持第一选择不变,才被“晋升”为锚点。这基于合理假设:真正的好答案不会朝秦暮楚。论文理论证明(命题1)表明,此筛选可使错误锚点概率随k指数级衰减。
图2:ASRD总览。在每个解码步骤,通过阈值的token按时间一致性分类:那些在连续k个步骤中保持一致的成为锚点(存储在ATC中),其余为待验证的待定token。锚点质心ct随后通过两个嵌入空间更新来监督每个未确认的位置。
图2:ASRD总览。核心思路是“立标杆,清旧账”。
ATC采用固定大小FIFO缓存,因dLLM解码顺序大致从左到右,ATC自然缓存最近确认的核心骨干,相当于模型不断更新的“短期记忆”。
插图
有了“可靠地图”,ASRD设计两把“手术刀”,分别针对错误传播和局部错误强化。

两把“手术刀”:锚点引导生成与锚点扰动验证的协同


第一刀:锚点引导生成——从源头切断错误传播

模型在 [MASK] 位置生成新词时,ASRD先计算ATC中所有锚点向量的中心点(锚点质心 ct),代表最可靠的“全局骨架”。然后对每个 [MASK] 位置进行“熵加权注入”:计算该位置预测熵,熵越高越不确定,注入量越大。公式为 êti = emask + γti (ct – emask),其中 γti = α · E_i。低熵位置注入几乎不影响,避免过度修正。此操作在嵌入空间完成,兼容FlashAttention,有效阻止错误传播。

第二刀:锚点扰动验证——在检查中撕开“局部共识”的伪装

验证待定token时,ASRD采用锚点扰动验证:提取 ct 中与待定token嵌入 eti 正交的部分 dj,乘以小系数 β 后加到 eti 上。若token正确,其方向与锚点接近,正交残差小,干扰弱;若基于“局部错误共识”产生错误,方向偏离锚点,正交残差大,打破“局部共识”,导致预测翻转,被标记为失败。这招“打草惊蛇”,精准揪出隐藏错误。

性能飞跃:6.4%精度提升与7.2倍加速

ASRD在LLaDA-8B和Dream-7B上,对GSM8K、MATH500、HumanEval、MBPP四个基准进行评测,与WINO和Saber对比。
表1:不同指导模型和方法在各项基准测试中的性能对比。
表1:ASRD(Ours)在精度和速度上全面领先。
1. 精度全面领先:Dream-7B上MATH500序列长度512时,相较标准解码器提升+6.4%;LLaDA-8B上HumanEval长度512时提升+4.9%。WINO和Saber有时甚至不如标准解码器。
2. 推理速度“逆天”:Dream-7B上MBPP序列长度512时,实现最大7.2倍加速,比WINO的5.2倍高出近40%。
ASRD优势随序列长度增加而放大。Dream-7B的MATH500任务,输出长度从256增至512时,精度优势从+3.8%增至+6.4%,速度优势从3.5×提升至5.4×。
表2:在LLaDA-Instruct-8B上的模块级消融实验。
表2:移除任一模块都会导致精度下降。
模块消融实验证实两模块不可或缺:移除“锚点引导生成”,HumanEval精度下降最多2.5%;移除“锚点扰动验证”,MATH500精度下降最多1.8%。

实验详解:锚点机制如何重塑注意力分布?

论文记录每层注意力权重,分析不同角色token间的注意力模式。
图3:ASRD诱导的逐层注意力重新分布。 (a)–(b): 锚点引导生成隐式纠正注意力;(c)–(d): 锚点扰动验证的增强效应。
图3:颜色越明亮,注意力权重越高。
1. 锚点引导生成:应用后,[MASK] token显著增加对锚点token的关注(图3a),减少对待定token的关注(图3b),尤其在深层网络最明显。
2. 锚点扰动验证:待定token增加对锚点token的注意力(图3c),减少彼此间相互注意(图3d),破坏“错误小团伙”。
图4:ATC大小m的消融实验。 表3:一致性窗口k对ASRD的影响。
图4:ATC大小m的消融实验。 表3:一致性窗口k对ASRD的影响。
超参数分析显示:ATC大小m呈倒U型曲线;一致性窗口k=2时精度最高,平衡了锚点“纯度”和“数量”。
图5:两类嵌入空间更新超参数α和β的敏感性分析。
图5:超参数α和β的敏感性分析。
ASRD从精巧的问题洞察出发,提出简单有效的核心概念,设计两个互补操作,思维链条清晰,理论和实验相互印证。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题? 解决dLLMs并行解码时的错误传播和局部错误强化。ASRD通过基于时间一致性的锚点token缓存(ATC)显式解耦上下文,可靠指导后续解码和验证。

什么是“锚点”?如何选出? 锚点是预测结果在连续k个解码步骤中保持一致的token。时间一致性筛选确保其可靠性,构成解码的“信任主干”。

为何强调“训练无关”和“在嵌入空间中操作”? “训练无关”意味着即插即用,无需微调。“在嵌入空间操作”不改变模型参数或注意力结构,轻量、通用且高效。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

问题洞察敏锐,精准识别“混合质量上下文”缺陷。锚点概念和基于时间一致性的筛选机制,以及对生成和验证阶段的解耦式干预,自成一体。虽各组件非完全从零开始,但有机组合应用于dLLM解码,是一次成功创新。

实验合理度:★★★★★

实验扎实完整,对比最先进基线,覆盖数学与代码领域,提供多维度对比。消融实验层层深入,逻辑清晰。

学术研究价值:★★★★✰

为解决扩散模型质量-速度矛盾提供全新范式,将核心问题定位到“上下文纯度”,研究价值高。

稳定性:★★★★✰

性能稳定优于其他方法,超参数敏感性分析显示在合理范围内表现稳健,但需在更多实际场景中验证。

适应性以及泛化能力:★★★★✰

在两个主流模型上成功,证明跨架构泛化能力。但需在更多类型dLLM和任务上测试,尚未到“通用”程度。

硬件需求及成本:★★★★★

训练无关,仅需嵌入空间少量向量运算,与FlashAttention兼容,额外计算开销小,非常“亲民”。

复现难度:★★★✰✰

算法描述细致,有完整消融和超参分析。但未提供开源代码,复现困难,不过实现逻辑相对直接。

产品化成熟度:★★★★✰

即插即用解码插件,产品化前景好。与现有模型兼容,无需训练即可提升长序列任务表现和推理速度,成本几乎可忽略。

可能的问题:未在更大规模(如70B+)dLLM上验证,效果和额外开销可能不同。依赖超参数调优,实际部署需针对特定模型和任务微调。


主要参考文献

[1] Nie et al., 2025, LLaDA: Large Language Diffusion with Masking.
[2] Ye et al., 2025, Dream 7B: A Diffusion Model for Text Generation.
[3] Hong et al., 2025, WINO: A Draft-and-Verify Framework for Diffusion LLMs.
[4] Dong et al., 2025, Saber: Confidence-Aware Acceleration for Diffusion Models.
[5] Cobbe et al., 2021, Training Verifiers to Solve Math Word Problems (GSM8K).
[6] Lightman et al., 2024, Let's Verify Step by Step (MATH500).
[7] Chen et al., 2021, Evaluating Large Language Models Trained on Code (HumanEval).
[8] Austin et al., 2021b, Program Synthesis with Large Language Models (MBPP).
[9] Yao et al., 2026, Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens. arXiv:2606.16847.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,在这里,你可以和志同道合的伙伴们一起探讨像ASRD这样的前沿方法,互相启发,共同进步。扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。