← 返回 PaperDaily
视觉与图像
中科大DAVET:扩散视觉语言模型按需“喂”视觉证据,平均提速1.55倍
扩散视觉语言模型快不起来,根子在于每一步去噪都在反复“看重”同一批视觉token。中科大这个DAVET直接把“视觉证据何时给、给多少”当作资源分配问题来做,不训练不微调,平均提速1.55倍、质量仅掉1.86%,思路相当实用。
龙哥读论文
发布于 2026-08-16 11:00:41
阅读 5
查看原文
原论文信息如下:
引言
扩散语言模型最近是越来越有存在感了。不像自回归模型那样只能从左往右一个字一个字憋,扩散语言模型通过双向注意力机制并行地迭代去噪,一次性可以同时精修多个位置的token,生成顺序灵活可控。LLaDA、Dream这些模型已经在纯文本任务上验证了这个范式的可行性,LLaDA2.0更是直接把这个路子推到了1000亿参数规模。扩散模型的潜力,显然不只是文本生成——把视觉编码器接进来,做多模态理解,就是扩散视觉语言模型(dVLMs),典型代表包括LLaDA-V和LaViDa。
但这里有一个很扎心的效率瓶颈。视觉编码器一次编码可能产生成百上千个视觉token——高分辨率输入场景下尤其夸张,而这些视觉token在每一个去噪步骤里都要参与注意力计算。哪怕最终答案只有十几个token,扩散模型在生成过程中也要反复地、一遍遍地“回头看”整条视觉token序列。这就像一个人考试做阅读理解,文章明明已经扫了好几遍,但每写一个答案都要从头重新读一遍全文——按这个思路,不让AI急眼才怪。
更微妙的问题在于:视觉证据在不同去噪步骤中的需求并不一样。论文作者设计了一个受控干预实验——固定高证据条件的总时长,但把这段“高证据脉冲”在8个去噪阶段中移动。结果发现同样的证据量放在不同阶段,生成质量差异非常大,而且这种差异还跟具体模型强相关。LLaDA-V对早期去噪阶段的高证据条件更敏感,而LaViDa则对后期更敏感。这背后对应的分别是一种“早期接地”和“晚期验证”的模式。
扩散视觉语言模型为何慢?——视觉条件化的重复计算瓶颈
先说清楚扩散视觉语言模型(Diffusion Vision-Language Models,简称 dVLMs)到底怎么工作的。给定一张图像 x 和一句查询 q,一个视觉编码器 Eφ 先把图像编码成一串视觉token序列 v = Eφ(x)。同时,答案序列 y = (y1, …, yL) 一开始全部是 [MASK] 掩码标记,模型需要经过 T 步迭代去噪,逐步把掩码位置替换成真正的答案token。在每一步 t,模型会并行预测所有仍未解析位置 i 的token分布:Pt,i = pθ(· | y(t-1), v, q),然后根据置信度选择一部分位置提交为具体token,其余位置继续保留掩码状态。
问题就出在这个 v 上——视觉token序列在每一步去噪时都完整参与注意力计算。高分辨率图像轻轻松松产生成百上千个视觉token,而一条简短答案可能只有十几二十个token。哪怕最终答案很短,模型也要在整整 T 步去噪中反复处理一整条长视觉序列。相当于让一个考生每次写一个字就把整本参考书翻一遍,不慢才怪。
那已有的加速方法呢?大致有两条路线。解码侧策略,比如 Fast-dVLM 做视觉token的KV缓存、VRCD 做带视觉接地的并行提交,它们解决的是“答案位置如何更快更新”,但完全不决定“每一步送多少视觉证据进来”。另一条路线是视觉token压缩,比如 RedVTP 根据响应信号剪掉不重要的视觉token,D3ToM 用动态合并缩短序列——这类方法能够改变视觉证据量,但变化方式依附于特定的剪枝或合并规则,不是面向去噪状态的通用预算分配。
于是这篇论文给的观察很直接:视觉证据是一种随时演化而变的资源,不该固定喂入。应该把“什么时候送证据、送多少”当作一个分配问题来解。
视觉证据需求的神秘规律:从早接地到晚验证
论文先做了一个受控干预实验,特别有意思。他们固定“高证据条件”的总曝光步数不变,然后把这段高证据脉冲在8个等分去噪阶段之间移动——从最早的第1阶段一路挪到最晚的第8阶段。如果视觉证据在各个阶段的价值差不多,那么脉冲放在哪儿,生成质量应该大体稳定。但实验结果恰恰相反:脉冲放在不同阶段,质量差异非常明显。
更微妙的是,这个“证据敏感期”是骨干网络相关的。LLaDA-V 在 Q2-Q3 阶段(即早期去噪)达到最高质量,说明它对早期的高证据条件更敏感;LaViDa 则是在 Q8 阶段最佳,属于晚期敏感。论文把这两种模式分别概括为“早期接地”(early grounding)和“晚期验证”(late verification)——前者要靠清晰视觉证据把答案的整体语义锚定住,后者则是在生成末端回来核对细节。
这个发现直接推翻了一个默认假设:很多方法习惯全程均匀供证据,或者压缩一次后全程复用。可真实情况是,证据需求在时间轴上呈“山峰状”,而且山峰位置因模型而异。如果提前知道山峰在哪,就能把预算集中到刀刃上,其他步骤省着点花。
DAVET:一个训练无关的视觉证据分配框架
基于这个观察,论文把问题形式化为一个分配问题。设 st 为第 t 步开始前可用的生成状态,包括去噪进度、查询、当前带掩码的答案以及推理期统计量。给定一个目标平均预算 B,分配策略 π 输出每一步的归一化预算:
这种“分配与实现分离”的设计带来一个很实际的好处:pooling、pruning、merging 都能作为证据实现器接进来,只要它们暴露出有序的“证据-成本”接口。分配策略不需要重新定义,换个实现器照样跑。
三种信号如何协同控制证据预算?
DAVET 的分配策略不是靠单一信号拍脑袋,而是三个信号各管一段,协同决定最终预算。第一个信号是相位条件轨迹(phase-conditioned trajectory)。它回答“什么时候该多给证据”这个结构性先验。论文用了一个两方向的相位族:早期接地用 pt = 1 - (t-0.5)/T,晚期验证用 pt = (t-0.5)/T。0.5的偏移让每一步位于自己区间的中心,避免端点归零。选好方向后用归一化算子 N(p1:T; ·) 做重缩放并裁剪到[0,1],使轨迹均值正好匹配设定的平均预算 B。方向由骨干决定:LLaDA-V 用早期接地,LaViDa 用晚期验证。
第二个信号是操作条件证据储备(operation-conditioned evidence reserve)。它回答“最多能额外给多少”。这个信号来自查询本身:一个轻量级的训练无关解析器 g 把查询 q 映射到五个操作类别——词汇读取、数值推理、实体接地、二元决策、通用理解。每个类别对应一个固定的需求先验 d(o) ∈ [0,1]。比如需要细粒度数值核对的查询,d(o) 会偏高;通用理解类则偏低。加上一个储备比例 ρ,就可以确定两条轨迹:
第三个信号是轨迹风险调制(trajectory-risk modulation)。它回答“这一步具体给多少”,是真正的实时调节。DAVET 从去噪过程本身提取两个统计量:前一步未解析位置的平均置信度 c̄t-1,以及预测变动性 χt-1——在连续两步都未解析的答案位置中,最高logit token发生变化的比例。两者组合出轨迹风险:
看到这里基本能get到这个设计的妙处:相位轨迹给了一个骨架,操作需求决定骨架上下能浮动多少,轨迹风险再按当前生成状态实时挑位置。三个信号互不重叠、各司其职。
实验结果:1.55倍加速与1.86%质量损失
实验部分选了 LLaDA-V 和 LaViDa 两个代表性dVLM骨干,在 InfoVQA、ChartQA、DocVQA、TextVQA 四个基准上评估,硬件用 NVIDIA A100 80GB,全部采用temperature=0的确定性解码。对比方法包括三档静态分辨率控制(Static High/Mid/Low)和两个视觉token压缩方法:RedVTP(剪枝)和 D3ToM(动态合并)。为了保证公平,DAVET与压缩类方法使用相同的视觉token保留比例。
*表格超出部分左右可以滑动
骨干
方法
InfoVQA 得分
InfoVQA 延迟(s)
ChartQA 得分
ChartQA 延迟(s)
DocVQA 得分
DocVQA 延迟(s)
TextVQA 得分
TextVQA 延迟(s)
LLaDA-V Static High 66.30 7.882 79.12 7.039 83.87 7.542 63.04 7.420
Static Mid 65.15 (-1.73%) 7.501 (1.05×) 73.96 (-6.52%) 4.023 (1.75×) 84.59 (+0.86%) 7.702 (0.98×) 62.42 (-0.98%) 5.852 (1.27×)
Static Low 50.91 (-23.21%) 5.366 (1.47×) 38.28 (-51.62%) 2.529 (2.78×) 79.82 (-4.83%) 6.076 (1.24×) 52.53 (-16.67%) 2.597 (2.86×)
RedVTP 64.73 (-2.37%) 4.497 (1.75×) 74.44 (-5.92%) 4.225 (1.67×) 83.49 (-0.46%) 4.611 (1.64×) 63.09 (+0.08%) 4.354 (1.70×)
D3ToM 59.81 (-9.78%) 4.732 (1.67×) 73.12 (-7.58%) 4.432 (1.59×) 72.62 (-13.41%) 4.819 (1.57×) 60.68 (-3.73%) 4.700 (1.58×)
DAVET 65.57 (-1.10%) 5.551 (1.42×) 78.36 (-0.96%) 5.277 (1.33×) 83.18 (-0.82%) 5.665 (1.33×) 62.86 (-0.29%) 5.464 (1.36×)
LaViDa Static High 36.14 2.801 67.40 3.064 63.52 3.185 58.77 3.176
Static Mid 35.72 (-1.15%) 2.782 (1.01×) 61.80 (-8.31%) 2.282 (1.34×) 63.62 (+0.16%) 3.152 (1.01×) 58.71 (-0.11%) 3.110 (1.02×)
Static Low 32.21 (-10.87%) 2.420 (1.16×) 32.80 (-51.34%) 1.677 (1.83×) 62.65 (-1.36%) 3.090 (1.03×) 48.94 (-16.74%) 1.728 (1.84×)
RedVTP 31.14 (-13.84%) 2.280 (1.23×) 52.12 (-22.67%) 2.350 (1.30×) 53.15 (-16.32%) 2.428 (1.31×) 54.60 (-7.10%) 2.483 (1.28×)
D3ToM 33.61 (-7.00%) 2.350 (1.19×) 57.56 (-14.60%) 2.543 (1.21×) 55.18 (-13.12%) 2.665 (1.20×) 57.38 (-2.37%) 2.588 (1.23×)
DAVET 35.50 (-1.78%) 1.663 (1.68×) 66.16 (-1.84%) 1.735 (1.77×) 59.18 (-6.83%) 1.855 (1.72×) 58.05 (-1.23%) 1.796 (1.77×)
表1:两个dVLMs骨干在四个基准上的主实验对比。延迟为各基准全部样本的平均生成延迟;质量下标表示相对Static High的相对变化,延迟下标表示相对Static High的加速倍数。
先看LLaDA-V:DAVET在四个任务上拿到1.33×到1.42×加速,质量损失只有0.29%到1.10%,基本可以忽略。再看LaViDa:加速提升到1.68×到1.77×,质量损失1.23%到6.83%。整体平均下来,DAVET实现了1.55×的加速和1.86%的相对质量下降。这个数字放在推理加速的语境下,属于相当均衡的疗效。
对比一下其他方法就能看出差距。RedVTP在LaViDa上质量掉了7.10%到22.67%,D3ToM也掉了2.37%到14.60%;静态Low在ChartQA上更是直接腰斩,质量损失超过51%。这些方法用更大的质量代价换速度,而DAVET在相似甚至更快的延迟下,把质量损失压到了1-2个百分点。
一个值得留意的点是LaViDa+DocVQA组合的质量下降了6.83%,在八个任务组合中最高。这或许跟DocVQA强烈的版面细节依赖有关,也跟晚期验证方向在文档类任务上容易受粗粒度视图的细节损失影响有关。这个偏高的数字说明DAVET不是在所有场景都能稳稳控制在2%以内,部署时还需要针对性评估。
消融实验进一步验证了三个信号各有贡献:去掉相位轨迹后,LLaDA-V和LaViDa的质量都明显下滑;去掉操作需求储备后,数值推理类任务(ChartQA)受影响最大;去掉轨迹风险调制后,整体质量维持能力下降。三个信号组合使用时效果最好,证明它们不是冗余的装饰品。
证据实现器的兼容性也做了测试:把DAVET的策略分别接到pooling、pruning、merging三种不同实现器上,质量-效率点都优于各自原有的静态/动态压缩基线,说明策略本身不绑定某一特定压缩手段。超参数分析显示,平均预算B从0.45提到0.75时质量稳步回升但延迟也增加;储备比例ρ在0.20附近效果最好;风险强度α在LLaDA-V上取1.0、在LaViDa上取0.5达到各自最优。
总结与展望:分配与实现分离的通用潜力
DAVET的核心价值在于把“视觉证据分配”从“视觉证据实现”中分离出来。前者用三个互补信号(相位轨迹、操作需求、轨迹风险)决定何时给多少证据,后者只需按预算提供有序证据视图。这种抽象让策略具备通用性——换个压缩算法不需要重设计策略;也让实现变得轻量——视觉编码只用跑一次,后续只是查表选视图。
实际落地时还有几个坑要留意。第一,相位方向需要人为按骨干指定,论文给了规则但还没做到完全自适应;第二,平均预算B和风险强度α在不同任务上要调,目前是每个骨干固定一组超参跑所有基准,换数据集可能还需要再调;第三,LaViDa+DocVQA上6.83%的质量损失提醒我们,细节敏感型任务需要更谨慎地选择预算下限。
后续一个很自然的方向是让相位方向也变成自动选择,比如基于去噪初期的置信度动态判断该走早期接地还是晚期验证;另一个方向是把证据分配思想扩展到视频输入和生成式dVLMs。整体来看,DAVET给出了一个简洁、可迁移、训练无关的推理加速范式,值得后续在更多骨干上验证。
龙迷三问
DAVET需要修改模型参数吗? 完全不需要。DAVET是纯推理期的训练无关框架,它只用模型输出里现成的logits做统计——对未解析位置的分布求平均置信度、对比相邻两步的argmax token算变动性。不更新任何权重,也不增加额外前向传播,唯一开销是去噪开始前构造三个证据视图的那一次编码。
“预测变动性”具体怎么算的? 论文里叫prediction churn,定义很直接:在所有连续两步都保持掩码未提交的答案位置里,最高logit token在前后两步之间发生改变的比例。举个例子,有10个位置连续两步都未被提交,其中4个位置的argmax token从A变成了B,那变动性χ就是0.4。变动性高意味着模型还在“犹豫”,此时轨迹风险上升,DAVET就会自动多分配视觉证据帮它下决心。
视觉token剪枝和合并有什么区别? 剪枝(pruning)是直接删除预测为“不重要”的视觉token,比如RedVTP按响应信号打分后砍掉低分token;合并(merging)是把语义相近的多个token聚合成一个,比如D3ToM让token按邻域相似度融合。两者都能缩短视觉序列长度,但信息保留方式不同:剪枝是离散取舍,合并是连续聚合。DAVET的好处是不挑食——剪枝、合并、池化都能作为证据实现器,分配策略完全不用改。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把视觉证据重新定义为“按去噪状态分配的时变资源”,并用“分配与实现分离”的抽象统一了剪枝、合并、池化多种压缩手段,视角足够新。
实验合理度: ★★★★☆
两个骨干、四个基准、三种对比方法,保留比例对齐做得公平;消融和实现器兼容性测试也齐全。扣一星是因为两个骨干用了不同的相位方向、B和α,超参不完全统一,对比的说服力略有打折。
学术研究价值: ★★★★☆
给dVLMs推理加速提供了一个新的抽象层次:证据分配策略与证据实现器的解耦。后续研究者可以在这个接口上换更好的分配策略或更高效的实现器,研究空间大。
稳定性: ★★★☆☆
整体稳定,但LaViDa+DocVQA掉6.83%、LLaDA-V在ChartQA上只拿到1.33×加速,说明性能在不同骨干和任务间有波动,相位方向还需要人工对齐。
适应性以及泛化能力: ★★★☆☆
只在两个理解型dVLMs上验证,尚未覆盖更多骨干、图像生成或视频输入场景;查询操作五类分类也比较粗,复杂开放域查询的泛化有待检验。
硬件需求及成本: ★★★★☆
训练零成本;推理侧省了约1/3到1/2延迟,同时只增加一次极轻量的查询解析。代价是平均预算、储备比例、风险强度这几个超参需要调试。
复现难度: ★★★☆☆
方法本身规则清晰、统计量容易算,但论文未放出官方代码和完整超参细节,附录的查询解析规则和类别先验也没有全部公开,复现需要自行补充实现细节。
产品化成熟度: ★★★☆☆
适合对延迟敏感且能接受1-2%精度损失的多模态理解场景,比如文档问答、图表理解;但要大规模产品化还得先解决相位方向自适应和不同骨干的泛化问题。
可能的问题: 相位方向需要人为指定,尚不能自动发现阶段敏感区;LaViDa+DocVQA质量损失偏高,论文对此的解释不足;操作需求解析器只靠词法线索,遇到表述绕的查询容易分错类。整体仍是dVLMs推理加速里值得跟进的工作。
主要参考文献
[1] Nie et al. LLaDA: Large Language Diffusion Models with Masked Diffusion. 2025.
[2] You et al. LLaDA-V: Diffusion Vision-Language Models. 2026.
[3] Li et al. LaViDa: Complementary Masking in Diffusion Vision-Language Models. 2025.
[4] Wan et al. LLaDA-FastV: Efficient Inference in Diffusion Vision-Language Models via Visual Token Pruning. 2026.
[5] Xu et al. RedVTP: Visual Token Pruning for Diffusion Vision-Language Models. 2026.
[6] Chang et al. D3ToM: Dynamic Token Merging in Diffusion Vision-Language Models. 2026.
[7] Zhou et al. DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models. arXiv:2608.01821v1, 2026.