← 返回 PaperDaily 视觉与图像

中科大DAVET:扩散视觉语言模型按需“喂”视觉证据,平均提速1.55倍

扩散视觉语言模型快不起来,根子在于每一步去噪都在反复“看重”同一批视觉token。中科大这个DAVET直接把“视觉证据何时给、给多少”当作资源分配问题来做,不训练不微调,平均提速1.55倍、质量仅掉1.86%,思路相当实用。

中科大DAVET:扩散视觉语言模型按需“喂”视觉证据,平均提速1.55倍
原论文信息如下:
论文标题:
DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models
发表日期:
2026年08月

发表单位:
中国科学技术大学(University of Science and Technology of China)

原文链接:
https://arxiv.org/pdf/2608.01821v1.pdf


引言

扩散语言模型最近是越来越有存在感了。不像自回归模型那样只能从左往右一个字一个字憋,扩散语言模型通过双向注意力机制并行地迭代去噪,一次性可以同时精修多个位置的token,生成顺序灵活可控。LLaDA、Dream这些模型已经在纯文本任务上验证了这个范式的可行性,LLaDA2.0更是直接把这个路子推到了1000亿参数规模。扩散模型的潜力,显然不只是文本生成——把视觉编码器接进来,做多模态理解,就是扩散视觉语言模型(dVLMs),典型代表包括LLaDA-V和LaViDa。
但这里有一个很扎心的效率瓶颈。视觉编码器一次编码可能产生成百上千个视觉token——高分辨率输入场景下尤其夸张,而这些视觉token在每一个去噪步骤里都要参与注意力计算。哪怕最终答案只有十几个token,扩散模型在生成过程中也要反复地、一遍遍地“回头看”整条视觉token序列。这就像一个人考试做阅读理解,文章明明已经扫了好几遍,但每写一个答案都要从头重新读一遍全文——按这个思路,不让AI急眼才怪。
更微妙的问题在于:视觉证据在不同去噪步骤中的需求并不一样。论文作者设计了一个受控干预实验——固定高证据条件的总时长,但把这段“高证据脉冲”在8个去噪阶段中移动。结果发现同样的证据量放在不同阶段,生成质量差异非常大,而且这种差异还跟具体模型强相关。LLaDA-V对早期去噪阶段的高证据条件更敏感,而LaViDa则对后期更敏感。这背后对应的分别是一种“早期接地”和“晚期验证”的模式。
图1:不同去噪阶段对视觉证据的需求随骨干网络不同而变化。在其余阶段混合证据条件下,将<h2 style=扩散视觉语言模型为何慢?——视觉条件化的重复计算瓶颈
先说清楚扩散视觉语言模型(Diffusion Vision-Language Models,简称 dVLMs)到底怎么工作的。给定一张图像 x 和一句查询 q,一个视觉编码器 Eφ 先把图像编码成一串视觉token序列 v = Eφ(x)。同时,答案序列 y = (y1, …, yL) 一开始全部是 [MASK] 掩码标记,模型需要经过 T 步迭代去噪,逐步把掩码位置替换成真正的答案token。在每一步 t,模型会并行预测所有仍未解析位置 i 的token分布:Pt,i = pθ(· | y(t-1), v, q),然后根据置信度选择一部分位置提交为具体token,其余位置继续保留掩码状态。
问题就出在这个 v 上——视觉token序列在每一步去噪时都完整参与注意力计算。高分辨率图像轻轻松松产生成百上千个视觉token,而一条简短答案可能只有十几二十个token。哪怕最终答案很短,模型也要在整整 T 步去噪中反复处理一整条长视觉序列。相当于让一个考生每次写一个字就把整本参考书翻一遍,不慢才怪。
那已有的加速方法呢?大致有两条路线。解码侧策略,比如 Fast-dVLM 做视觉token的KV缓存、VRCD 做带视觉接地的并行提交,它们解决的是“答案位置如何更快更新”,但完全不决定“每一步送多少视觉证据进来”。另一条路线是视觉token压缩,比如 RedVTP 根据响应信号剪掉不重要的视觉token,D3ToM 用动态合并缩短序列——这类方法能够改变视觉证据量,但变化方式依附于特定的剪枝或合并规则,不是面向去噪状态的通用预算分配。
于是这篇论文给的观察很直接:视觉证据是一种随时演化而变的资源,不该固定喂入。应该把“什么时候送证据、送多少”当作一个分配问题来解。

视觉证据需求的神秘规律:从早接地到晚验证

论文先做了一个受控干预实验,特别有意思。他们固定“高证据条件”的总曝光步数不变,然后把这段高证据脉冲在8个等分去噪阶段之间移动——从最早的第1阶段一路挪到最晚的第8阶段。如果视觉证据在各个阶段的价值差不多,那么脉冲放在哪儿,生成质量应该大体稳定。但实验结果恰恰相反:脉冲放在不同阶段,质量差异非常明显。
更微妙的是,这个“证据敏感期”是骨干网络相关的。LLaDA-V 在 Q2-Q3 阶段(即早期去噪)达到最高质量,说明它对早期的高证据条件更敏感;LaViDa 则是在 Q8 阶段最佳,属于晚期敏感。论文把这两种模式分别概括为“早期接地”(early grounding)和“晚期验证”(late verification)——前者要靠清晰视觉证据把答案的整体语义锚定住,后者则是在生成末端回来核对细节。
这个发现直接推翻了一个默认假设:很多方法习惯全程均匀供证据,或者压缩一次后全程复用。可真实情况是,证据需求在时间轴上呈“山峰状”,而且山峰位置因模型而异。如果提前知道山峰在哪,就能把预算集中到刀刃上,其他步骤省着点花。

DAVET:一个训练无关的视觉证据分配框架

基于这个观察,论文把问题形式化为一个分配问题。设 st 为第 t 步开始前可用的生成状态,包括去噪进度、查询、当前带掩码的答案以及推理期统计量。给定一个目标平均预算 B,分配策略 π 输出每一步的归一化预算:
公式:每一去噪步的归一化视觉证据预算由分配策略根据生成状态和平均预算决定
这里 bt 就是第 t 步的视觉证据预算,取值在0到1之间。整条序列 b1:T 构成所谓的“视觉证据轨迹”,它明确规定了什么时候送证据、送多少。接下来,一个证据实现器 A 把编码好的视觉token序列 v 和预算 bt 映射成这一步实际使用的视觉表示 vt = A(v; bt)。bt=1 表示不压缩直接用原始序列,更小的预算对应更粗糙的证据表示。整个优化目标可以写成:
公式:在平均预算约束下最小化生成答案的期望损失
即在固定模型和视觉编码器参数的前提下,保持平均分配预算不超过 B,同时最小化生成答案的期望损失。这个形式化最关键的地方在于:它把“什么时候给多少证据”和“证据怎么实现”彻底分开。分配策略只管输出预算数字,不关心怎么压缩;证据实现器只负责按预算构造视图,不参与分配决策。
图2:DAVET框架总览。初始化阶段对图像编码一次,证据实现器从单一视觉编码构造有序证据视图层次;分配策略形成证据包络,下轨跟随骨干特定的相位剖面,上轨叠加操作需求决定的储备;每个去噪步由平均置信度和预测变动性导出的轨迹风险在包络内选择预算,预算映射到对应证据视图并参与掩码位置的并行精修。
具体实现上,DAVET 用 K=3 的简化证据层次:coarse 视图通过结构化池化保留全局覆盖,token数量最少;mixed 视图在池化基础上追加一小部分未池化token,找回局部细节;high 视图就是完整视觉token序列。去噪开始前一次性构建这三种视图,之后每一步只根据预算查表选择。映射规则很简单:预算小于1/3用coarse,在1/3到2/3之间用mixed,超过2/3用high。
这种“分配与实现分离”的设计带来一个很实际的好处:pooling、pruning、merging 都能作为证据实现器接进来,只要它们暴露出有序的“证据-成本”接口。分配策略不需要重新定义,换个实现器照样跑。

三种信号如何协同控制证据预算?

DAVET 的分配策略不是靠单一信号拍脑袋,而是三个信号各管一段,协同决定最终预算。第一个信号是相位条件轨迹(phase-conditioned trajectory)。它回答“什么时候该多给证据”这个结构性先验。论文用了一个两方向的相位族:早期接地用 pt = 1 - (t-0.5)/T,晚期验证用 pt = (t-0.5)/T。0.5的偏移让每一步位于自己区间的中心,避免端点归零。选好方向后用归一化算子 N(p1:T; ·) 做重缩放并裁剪到[0,1],使轨迹均值正好匹配设定的平均预算 B。方向由骨干决定:LLaDA-V 用早期接地,LaViDa 用晚期验证。
第二个信号是操作条件证据储备(operation-conditioned evidence reserve)。它回答“最多能额外给多少”。这个信号来自查询本身:一个轻量级的训练无关解析器 g 把查询 q 映射到五个操作类别——词汇读取、数值推理、实体接地、二元决策、通用理解。每个类别对应一个固定的需求先验 d(o) ∈ [0,1]。比如需要细粒度数值核对的查询,d(o) 会偏高;通用理解类则偏低。加上一个储备比例 ρ,就可以确定两条轨迹:
公式:证据包络的下轨按平均预算的(1-ρ)部分归一化相位轨迹得到,上轨在平均预算上叠加由操作需求和储备比例决定的额外储备后同样归一化相位轨迹得到
下轨 b̲ 就是基础证据曲线,上轨 b̄ 在下轨之上叠加了一个“操作需求驱动的储备”。两条轨迹共享同一个相位方向,差值即证据储备。需要数值推理的查询d(o)偏高,包络就宽,模型在关键时刻可调用的证据更多;普通查询包络窄,整体更省。
第三个信号是轨迹风险调制(trajectory-risk modulation)。它回答“这一步具体给多少”,是真正的实时调节。DAVET 从去噪过程本身提取两个统计量:前一步未解析位置的平均置信度 c̄t-1,以及预测变动性 χt-1——在连续两步都未解析的答案位置中,最高logit token发生变化的比例。两者组合出轨迹风险:
公式:轨迹风险等于1减去风险强度乘以平均置信度与预测稳定度的乘积,置信度高且变化小时风险低,低置信或高变化时风险高
α 控制稳定信号的影响强度。当模型预测置信又稳定,c̄(1-χ) 接近1,风险 rt 趋近0,此时倾向于走下轨省证据;如果置信低迷或者预测在两步间反复横跳,风险升高,预算就往上轨靠。最后,实际预算通过包络插值确定:
公式:最终证据预算等于下轨加上轨迹风险与包络宽度的乘积,风险为0取下轨,风险为1取上轨
第一步没有历史预测,直接设 r1=1、χ1=0。三个信号全程不需要额外前向计算,所有统计量都是模型输出的副产物。
看到这里基本能get到这个设计的妙处:相位轨迹给了一个骨架,操作需求决定骨架上下能浮动多少,轨迹风险再按当前生成状态实时挑位置。三个信号互不重叠、各司其职。

实验结果:1.55倍加速与1.86%质量损失

实验部分选了 LLaDA-V 和 LaViDa 两个代表性dVLM骨干,在 InfoVQA、ChartQA、DocVQA、TextVQA 四个基准上评估,硬件用 NVIDIA A100 80GB,全部采用temperature=0的确定性解码。对比方法包括三档静态分辨率控制(Static High/Mid/Low)和两个视觉token压缩方法:RedVTP(剪枝)和 D3ToM(动态合并)。为了保证公平,DAVET与压缩类方法使用相同的视觉token保留比例。
*表格超出部分左右可以滑动
骨干 方法 InfoVQA 得分 InfoVQA 延迟(s) ChartQA 得分 ChartQA 延迟(s) DocVQA 得分 DocVQA 延迟(s) TextVQA 得分 TextVQA 延迟(s)
LLaDA-VStatic High66.307.88279.127.03983.877.54263.047.420
Static Mid65.15 (-1.73%)7.501 (1.05×)73.96 (-6.52%)4.023 (1.75×)84.59 (+0.86%)7.702 (0.98×)62.42 (-0.98%)5.852 (1.27×)
Static Low50.91 (-23.21%)5.366 (1.47×)38.28 (-51.62%)2.529 (2.78×)79.82 (-4.83%)6.076 (1.24×)52.53 (-16.67%)2.597 (2.86×)
RedVTP64.73 (-2.37%)4.497 (1.75×)74.44 (-5.92%)4.225 (1.67×)83.49 (-0.46%)4.611 (1.64×)63.09 (+0.08%)4.354 (1.70×)
D3ToM59.81 (-9.78%)4.732 (1.67×)73.12 (-7.58%)4.432 (1.59×)72.62 (-13.41%)4.819 (1.57×)60.68 (-3.73%)4.700 (1.58×)
DAVET65.57 (-1.10%)5.551 (1.42×)78.36 (-0.96%)5.277 (1.33×)83.18 (-0.82%)5.665 (1.33×)62.86 (-0.29%)5.464 (1.36×)
LaViDaStatic High36.142.80167.403.06463.523.18558.773.176
Static Mid35.72 (-1.15%)2.782 (1.01×)61.80 (-8.31%)2.282 (1.34×)63.62 (+0.16%)3.152 (1.01×)58.71 (-0.11%)3.110 (1.02×)
Static Low32.21 (-10.87%)2.420 (1.16×)32.80 (-51.34%)1.677 (1.83×)62.65 (-1.36%)3.090 (1.03×)48.94 (-16.74%)1.728 (1.84×)
RedVTP31.14 (-13.84%)2.280 (1.23×)52.12 (-22.67%)2.350 (1.30×)53.15 (-16.32%)2.428 (1.31×)54.60 (-7.10%)2.483 (1.28×)
D3ToM33.61 (-7.00%)2.350 (1.19×)57.56 (-14.60%)2.543 (1.21×)55.18 (-13.12%)2.665 (1.20×)57.38 (-2.37%)2.588 (1.23×)
DAVET35.50 (-1.78%)1.663 (1.68×)66.16 (-1.84%)1.735 (1.77×)59.18 (-6.83%)1.855 (1.72×)58.05 (-1.23%)1.796 (1.77×)
表1:两个dVLMs骨干在四个基准上的主实验对比。延迟为各基准全部样本的平均生成延迟;质量下标表示相对Static High的相对变化,延迟下标表示相对Static High的加速倍数。
先看LLaDA-V:DAVET在四个任务上拿到1.33×到1.42×加速,质量损失只有0.29%到1.10%,基本可以忽略。再看LaViDa:加速提升到1.68×到1.77×,质量损失1.23%到6.83%。整体平均下来,DAVET实现了1.55×的加速和1.86%的相对质量下降。这个数字放在推理加速的语境下,属于相当均衡的疗效。
对比一下其他方法就能看出差距。RedVTP在LaViDa上质量掉了7.10%到22.67%,D3ToM也掉了2.37%到14.60%;静态Low在ChartQA上更是直接腰斩,质量损失超过51%。这些方法用更大的质量代价换速度,而DAVET在相似甚至更快的延迟下,把质量损失压到了1-2个百分点。
一个值得留意的点是LaViDa+DocVQA组合的质量下降了6.83%,在八个任务组合中最高。这或许跟DocVQA强烈的版面细节依赖有关,也跟晚期验证方向在文档类任务上容易受粗粒度视图的细节损失影响有关。这个偏高的数字说明DAVET不是在所有场景都能稳稳控制在2%以内,部署时还需要针对性评估。
图3:四个基准上的平均质量-效率权衡。横轴为相对Static High的任务平均加速倍数,纵轴为质量保持率;虚线连接各骨干内的非支配点
图3把质量-效率前沿画得更直观。DAVET在两个骨干上的点都明显偏向图表的右上角——加速大且质量保持高,处在非支配前沿上。RedVTP和D3ToM虽然延迟更低,但质量保持率掉得厉害。Static Low更是直接沉到。
消融实验进一步验证了三个信号各有贡献:去掉相位轨迹后,LLaDA-V和LaViDa的质量都明显下滑;去掉操作需求储备后,数值推理类任务(ChartQA)受影响最大;去掉轨迹风险调制后,整体质量维持能力下降。三个信号组合使用时效果最好,证明它们不是冗余的装饰品。
证据实现器的兼容性也做了测试:把DAVET的策略分别接到pooling、pruning、merging三种不同实现器上,质量-效率点都优于各自原有的静态/动态压缩基线,说明策略本身不绑定某一特定压缩手段。超参数分析显示,平均预算B从0.45提到0.75时质量稳步回升但延迟也增加;储备比例ρ在0.20附近效果最好;风险强度α在LLaDA-V上取1.0、在LaViDa上取0.5达到各自最优。

总结与展望:分配与实现分离的通用潜力

DAVET的核心价值在于把“视觉证据分配”从“视觉证据实现”中分离出来。前者用三个互补信号(相位轨迹、操作需求、轨迹风险)决定何时给多少证据,后者只需按预算提供有序证据视图。这种抽象让策略具备通用性——换个压缩算法不需要重设计策略;也让实现变得轻量——视觉编码只用跑一次,后续只是查表选视图。
实际落地时还有几个坑要留意。第一,相位方向需要人为按骨干指定,论文给了规则但还没做到完全自适应;第二,平均预算B和风险强度α在不同任务上要调,目前是每个骨干固定一组超参跑所有基准,换数据集可能还需要再调;第三,LaViDa+DocVQA上6.83%的质量损失提醒我们,细节敏感型任务需要更谨慎地选择预算下限。
后续一个很自然的方向是让相位方向也变成自动选择,比如基于去噪初期的置信度动态判断该走早期接地还是晚期验证;另一个方向是把证据分配思想扩展到视频输入和生成式dVLMs。整体来看,DAVET给出了一个简洁、可迁移、训练无关的推理加速范式,值得后续在更多骨干上验证。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

DAVET需要修改模型参数吗?完全不需要。DAVET是纯推理期的训练无关框架,它只用模型输出里现成的logits做统计——对未解析位置的分布求平均置信度、对比相邻两步的argmax token算变动性。不更新任何权重,也不增加额外前向传播,唯一开销是去噪开始前构造三个证据视图的那一次编码。

“预测变动性”具体怎么算的?论文里叫prediction churn,定义很直接:在所有连续两步都保持掩码未提交的答案位置里,最高logit token在前后两步之间发生改变的比例。举个例子,有10个位置连续两步都未被提交,其中4个位置的argmax token从A变成了B,那变动性χ就是0.4。变动性高意味着模型还在“犹豫”,此时轨迹风险上升,DAVET就会自动多分配视觉证据帮它下决心。

视觉token剪枝和合并有什么区别?剪枝(pruning)是直接删除预测为“不重要”的视觉token,比如RedVTP按响应信号打分后砍掉低分token;合并(merging)是把语义相近的多个token聚合成一个,比如D3ToM让token按邻域相似度融合。两者都能缩短视觉序列长度,但信息保留方式不同:剪枝是离散取舍,合并是连续聚合。DAVET的好处是不挑食——剪枝、合并、池化都能作为证据实现器,分配策略完全不用改。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把视觉证据重新定义为“按去噪状态分配的时变资源”,并用“分配与实现分离”的抽象统一了剪枝、合并、池化多种压缩手段,视角足够新。

实验合理度:★★★★☆

两个骨干、四个基准、三种对比方法,保留比例对齐做得公平;消融和实现器兼容性测试也齐全。扣一星是因为两个骨干用了不同的相位方向、B和α,超参不完全统一,对比的说服力略有打折。

学术研究价值:★★★★☆

给dVLMs推理加速提供了一个新的抽象层次:证据分配策略与证据实现器的解耦。后续研究者可以在这个接口上换更好的分配策略或更高效的实现器,研究空间大。

稳定性:★★★☆☆

整体稳定,但LaViDa+DocVQA掉6.83%、LLaDA-V在ChartQA上只拿到1.33×加速,说明性能在不同骨干和任务间有波动,相位方向还需要人工对齐。

适应性以及泛化能力:★★★☆☆

只在两个理解型dVLMs上验证,尚未覆盖更多骨干、图像生成或视频输入场景;查询操作五类分类也比较粗,复杂开放域查询的泛化有待检验。

硬件需求及成本:★★★★☆

训练零成本;推理侧省了约1/3到1/2延迟,同时只增加一次极轻量的查询解析。代价是平均预算、储备比例、风险强度这几个超参需要调试。

复现难度:★★★☆☆

方法本身规则清晰、统计量容易算,但论文未放出官方代码和完整超参细节,附录的查询解析规则和类别先验也没有全部公开,复现需要自行补充实现细节。

产品化成熟度:★★★☆☆

适合对延迟敏感且能接受1-2%精度损失的多模态理解场景,比如文档问答、图表理解;但要大规模产品化还得先解决相位方向自适应和不同骨干的泛化问题。

可能的问题:相位方向需要人为指定,尚不能自动发现阶段敏感区;LaViDa+DocVQA质量损失偏高,论文对此的解释不足;操作需求解析器只靠词法线索,遇到表述绕的查询容易分错类。整体仍是dVLMs推理加速里值得跟进的工作。


主要参考文献

[1] Nie et al. LLaDA: Large Language Diffusion Models with Masked Diffusion. 2025.
[2] You et al. LLaDA-V: Diffusion Vision-Language Models. 2026.
[3] Li et al. LaViDa: Complementary Masking in Diffusion Vision-Language Models. 2025.
[4] Wan et al. LLaDA-FastV: Efficient Inference in Diffusion Vision-Language Models via Visual Token Pruning. 2026.
[5] Xu et al. RedVTP: Visual Token Pruning for Diffusion Vision-Language Models. 2026.
[6] Chang et al. D3ToM: Dynamic Token Merging in Diffusion Vision-Language Models. 2026.
[7] Zhou et al. DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models. arXiv:2608.01821v1, 2026.
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球