← 返回 PaperDaily 视觉与图像

中科院新作:视频大模型幻觉克星VADER,EventHallusion飙至72.6%

视频大模型对着画面侃侃而谈,却常常“睁眼说瞎话”?中科院团队提出VADER,一个纯推理期干预的训练无关框架,让LLaVA-Video-7B在EventHallusion上飙到72.60%,还顺手超越了依赖额外训练的TPO与RRPO。不微调也能这么能打,值得一读。

中科院新作:视频大模型幻觉克星VADER,EventHallusion飙至72.6%
原论文信息如下:
论文标题:
VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

发表日期: 2026年08月

发表单位: 中国科学院长春光学精密机械与物理研究所;中国科学院大学;香港城市大学

原文链接: https://arxiv.org/pdf/2608.08622v1.pdf

各位读者老爷们,龙哥又来唠嗑了。今天这个故事得从“睁眼说瞎话”开始讲。想象一下,你给一个视频大模型看一段“猫从桌上跳下来”的片段,然后问它:“猫最后在哪儿?”模型一本正经地告诉你:“猫站在冰箱顶上。”可视频里分明连冰箱的影子都没有。这画面,像不像考试时明明不会,却硬要编个答案出来的学生?🤚
视频大语言模型(Video Large Language Models,VideoLLMs)在开放域视频理解上确实能打,但“幻觉”问题一直是块硬伤。模型生成的回答语法通顺、逻辑自洽,可惜跟视频内容对不上号。动作识别错了、事件顺序颠倒了、因果关系瞎编了,这类“一本正经的胡说八道”在视频任务里尤其严重。为啥?因为视频里冗余帧太多,关键证据往往只在几帧里闪现,模型一偷懒,就顺着语言先验(Language Prior)走捷径,压根不细看画面。
为了解决这个问题,中科院和香港城市大学的团队提出了一套名为 VADER 的训练无关(Training-free)框架,全称是 Video-Adaptive Debiasing via Evidence Reweighting,翻译过来就是“通过证据重加权的视频自适应去偏”。这套方法不微调任何模型参数,纯靠推理期的智能干预,就把 LLaVA-Video-7B 在 EventHallusion 基准上的准确率拉到了 72.60%,甚至超过了需要额外训练的 TPO 和 RRPO。不训练也能反超,这就有意思了。

视频大模型为何“睁眼说瞎话”?

先别急着看方案,咱得先搞清楚病根在哪儿。视频大模型跟静态图像模型不一样,它面对的是几十甚至上百帧画面。帧与帧之间高度冗余,但时间上又环环相扣。举个例子,你问模型“这个人是不是先举了手再跳起来?”,模型就算把中间几帧看漏了,也能凭前后的画面“脑补”出答案。这种补全能力平时是好帮手,可真到了需要精确时间定位的场合,就成了幻觉的温床。
更麻烦的是,视频证据在模型内部的注意力分配中并不占优。系统提示词(System Prompt)、指令模板、历史文本这些“文字霸霸”挤占了大量注意力权重,真正该被关注的视觉token反而被挤到一边。模型解码的时候,眼睛虽然是睁开的,但心里根本没看视频,全靠语言模型在那儿“自由发挥”。这也就解释了为啥视频大模型会在动作识别、事件排序、时间一致性这些任务上频繁翻车。
所以,要治这个毛病,核心就一句话:让模型在解码的时候,老老实实把注意力放在视频证据上,而不是靠嘴硬输出。

两大瓶颈:静态干预与不充分对比证据

学术界其实早就有人动过“推理期干预”的心思,但现有的训练无关方法大多没挠到视频的痒处。龙哥仔细读了论文里对现有方法的剖析,发现两个致命伤。
第一,干预策略是“一刀切”的静态公式。很多方法会指定一个固定的层区间,比如统一在第10层到第15层之间增强视觉特征。可问题是,不同视频里的视觉证据跟文本的融合深度根本不一样。有的视频在第6层就已经把关键信息对齐了,有的可能得拖到第18层才真正激活跨模态通路。用一层不变的固定规则去干预“千人千面”的视频输入,效果自然打折扣。
第二,对比分支的证据擦除不够彻底。现有的对比解码(Contrastive Decoding)套路,是对输入做点噪声扰动、随机遮挡或者丢帧,然后看看模型在哪类输入下“依然自信”,从而压低那些脆弱的预测。这法子搁在静态图上还行,但搁在视频上就尴尬了:你随机遮住某一帧,下一帧立马补个差不多的画面;你丢掉一帧关键动作,前后帧的冗余信息照样能把证据“捞”回来。结果就是,对比分支其实并没有真正把视觉证据遮干净,模型照样可以靠“抄邻居”混过去。
VADER 之所以能脱颖而出,恰恰是因为它同时治好了这两个毛病:用“视频条件化”的干预策略取代静态配置,用“逐帧擦除高重要性token”构造一个真正干净的对比分支。

VFR:为每个视频量身定制的注意力重分配策略

VADER 由两个核心模块组成,第一个叫 视觉焦点重分配(Visual Focus Reallocation,VFR)。这个模块解决的就是“在哪些层干预、干预多强”的问题。
VFR 的思路很妙:先把模型自己的“初始预测”当作一个诊断信号,去计算每一层注意力对当前预测的贡献度。具体来说,它用梯度×注意力显著性的方式,算出每个token对之间的“敏感度张量” I,然后只关注“文本token到视频token”这个方向的跨模态流 φ。这个 φ 越大,说明该层在“从视频里提取证据喂给文本”这件事上出力的比例越大。
attention saliency公式
图:注意力显著性张量的计算公式。其中 H 是注意力头数,⊙表示逐元素相乘,∂L_diag/∂A 是诊断损失对注意力矩阵的梯度,用于衡量该注意力权重对当前预测的影响力。
跨模态流公式
图:跨模态显著流 φ_l 的计算公式,即平均所有文本位置到所有视频位置的注意力显著性。
算完每个层的 φ 之后,做一次min-max归一化,然后取 Top-5 层作为“该干预的层”。这一步非常关键——不同的视频,选出来的层可能完全不一样,而且允许是“非连续”的层。有的视频可能在第5、9、14层需要增强,另一个视频可能在第3、11、16层。这就是所谓的“视频条件化干预策略” π(V, q),它把“干预哪里”这个决策,从拍脑袋变成了一对一的诊断处方。
归一化公式
图:对每个样本内的所有层做最小-最大归一化,消除样本间量纲差异。
定了干预哪些层,还得定“干预多强”。VFR用选定层的归一化跨模态流之和 x 来衡量当前样本的证据强度,再用一个对数映射 a = log(1 + βx) 转化为重加权幅度。说白了,如果模型看视频时“证据流”很明显,就大胆加强视觉抑制文本;如果证据本来就模糊,那就下手轻一点,别把正常推理也一并毁了。这种“看菜下饭”的强度自适应,是那些固定超参方法做不到的。
证据强度映射公式
图:将归一化跨模态流总和 x 映射为干预幅度 a 的对数公式,默认 β=0.05。
有了层和幅度,VFR 在选定的层上对注意力打分矩阵做“互补式”重加权:压低系统token那一列的权重(乘上 1−a),抬高视频token那一列的权重(乘上 1+a)。需要注意的是,这里改的是 softmax 之前的注意力分数,而不是改 Q、K、V 本身,所以不会破坏模型原有的表达能力。
注意力重加权公式
图:VFR 在选定层对预softmax注意力分数进行互补重加权的公式。i∈T_dec 表示当前解码位置的行,j∈T_sys 表示系统token列,j∈T_vid 表示视频token列。
这一通操作下来,模型的注意力就被“掰”向视频证据了。龙哥觉得这套设计的精髓在于:它没有直接告诉你“第几层该干预”,而是让每个输入自己举手发言。这种“诊断-决策-干预”的闭环,远比手工指定的固定规则优雅。
VADER框架总览图
图1:VADER 框架总览。VFR 自动推导视频条件化的干预策略(干预层位置和响应强度),将注意力重新分配到视频证据上。SEE 逐帧抑制高响应视觉token,暴露先验偏差预测。联合时序对比抑制模块对比两个分支的logits。

SEE:解码器内部的“选择性失明”构建先验分支

VFR 负责给主分支“开眼”,那对比分支的负样本从哪来?这就轮到第二个核心模块 选择性证据擦除(Selective Evidence Erasure,SEE) 登场了。
SEE 干的事一句话就能概括:在解码器的内部注意力层,把当前预测最依赖的那些视觉token,逐帧挑出来“屏蔽掉”。但注意,它不是把整帧丢掉,而是只擦除每一帧里“注意力分数最高”的那部分token,保留那些低响应的背景token。这样一来,对比分支看到的视频,就只剩下“背景板”,关键证据被系统性移除,而且这种移除发生在解码器内部,相邻帧想“补位”都找不到对象。
token重要性打分公式
图:视觉token重要性打分公式,用当前解码位置对视觉token的平均注意力作为衡量标准。
每帧保留集公式
图:每个帧内保留注意力得分最低的 k_t 个token,其中 k_t 由保留比例 ρ 决定,默认 ρ=0.3。
擦除集合公式
图:擦除集合 M 的定义,即视频token全集中没有被保留的所有token。
这个“逐帧配额”的设计很关键。如果全局统一挑选低分token,那很可能出现某几帧被剃得干干净净、其他帧原封不动的情况,时间轴上依然存在“漏网之鱼”。逐帧保留低分token,等于每一帧都均匀地“削弱”,让对比分支在时间维度上处处受限,无法靠单帧漏勺钻空子。
SEE 在哪个层插入也很有讲究。论文通过一次性标定实验,选了第8层。这个位置不能太靠前(视觉表示还没成型,显著性不稳定),也不能太靠后(跨模态信息已经被充分吸收,擦不出区别)。第8层刚好处于能定位视觉证据、又没把结论定死的中间地带。
SEE插入深度标定实验
图2:SEE插入深度的标定实验。左图为代表性样例的查询条件化显著性可视化,右图为不同插入层在EventHallusion上的准确率曲线,第8层取得最高72.6%,该配置固定用于后续所有评测。
最后,VADER 把两条分支的logits做对比抑制:z̄ = (1+λ)·z_gnd − λ·z_prior。如果一个token在主分支得分高、在先验分支得分也高,那就说明它更可能是“语言先验”的产物,而不是来源于视频证据,直接压掉。如果它只在主分支高、在擦除后的分支不高,说明这个预测确实依赖视频证据,放心保留。
对比抑制融合公式
图:VADER 最终的对数几率融合公式,λ 为对比强度超参数,默认1.5。

实验验证:三个基准、三个模型、全面超越

光说理论不够,得看真刀真枪的评测。VADER 在三个视频幻觉基准(VidHalluc、VideoHallucer、EventHallusion)上,对三个开源模型(LLaVA-OneVision-7B、LLaVA-NeXT-Video-7B、Qwen3-VL-8B)做了全面测试,并且跟 TCD、DINO-HEAL、SEASON 等训练无关方法,以及 TPO、RRPO 这类训练方法进行了对比。
视频幻觉基准实验结果表
表1:视频幻觉基准实验结果。VADER在所有VADER结果均使用同一组固定配置,不做数据集特调。
先看幻觉基准上最硬的指标。在 EventHallusion 上,VADER 把 Qwen3-VL-8B 从 65.00% 拉到 71.00%,把 LLaVA-OV-7B 从 60.15% 拉到 68.84%,把 LLaVA-Video-7B 从 63.57% 干到了 72.60%。其中 LLaVA-Video-7B 这一项,直接比训练方法 RRPO 的 67.97% 高了 4.63 个点,比 TPO 的 63.33% 高了 9.27 个点。注意,VADER 一分钱的梯度都没动过。
在 VideoHallucer 的平均分上,VADER 对三个模型的提升分别是 +3.90、+10.30、+7.29 个点,提升幅度相当可观。VidHalluc 上的结果则有些“看人下菜”:Qwen3-VL-8B 提升了 2.23 个点,LLaVA-OV-7B 提升了 7.66 个点,但 LLaVA-Video-7B 上反而降了 1.92 个点。这并不奇怪——VidHalluc 本身侧重细粒度对象与动作的细枝末节,VADER 这种全局重分配机制未必在每种模型架构上都能兼顾所有小项。但整体来看,三个模型在三个基准上的平均涨幅是实打实的,特别是面向事件级推理和时间一致性的任务,增益几乎是全面开花。
通用视频理解基准结果表
表2:通用视频理解基准结果。MVBench、VideoMME、TVBench的缩写分别为MV、MME、TV,Δ表示相对原骨干模型的提升量。
更难得的是,改善幻觉的同时没有牺牲通用视频理解能力。在 MVBench、VideoMME、TVBench 三个通用基准上,VADER 在 LLaVA-OV-7B 上平均涨了 +0.6 个点,在 LLaVA-Video-7B 上平均涨了 +1.5 个点。对比之下,TCD 和 DINO-HEAL 在通用基准上基本是原地踏步甚至微跌。这说明 VADER 确实是“对症下药”,只针对幻觉的病根下刀,不伤及正常能力。
再看消融实验。把 VFR 换成固定层(7-14-15-16-17),性能从 VFR 自适应的水平往下掉;只保留 VFR、去掉 SEE,EventHallusion 从 72.60% 掉到 68.45%;只保留 SEE、去掉 VFR,更是只剩 67.23%。两个模块一拆,效果立刻缩水,说明 VFR 和 SEE 是“1+1>2”的互补关系,谁也离不开谁。
固定层VFR实验结果表
表3:将VFR应用于固定层位置的实验结果。Vid.为VidHalluc,VHall.为VideoHallucer,EHall.为EventHallusion。
核心组件消融实验表
表4:核心组件消融实验。VFR-only保留逐视频自适应选择与强度,SEE-only保留逐帧擦除机制。
固定层VFR注意力重平衡效果图
图3:固定层VFR的注意力重平衡可视化,显示VFR干预后系统token到视频token的注意力显著增强。
SEE保留比例敏感性实验图
图4:SEE保留比例敏感性实验结果,展示了不同保留比例对三个基准的影响。
SEE先验偏差暴露与对比修正效果图
图5:SEE通过擦除与对比修正暴露先验驱动偏差的案例可视化。

总结与展望:训练无关幻觉缓解的新范式

VADER 的价值,不仅在于把 EventHallusion 刷到 72.60%,更在于它提供了一个可迁移的“诊断-干预”范式。视频大模型的幻觉,根源是视觉证据与语言先验之间的失衡,VADER 用一层诊断信号把失衡的程度自动量出来,再决定在哪些层、以多大力度去纠偏。这比盲人摸象式地固定干预层数,显然高了一个维度。
从落地角度看,这种训练无关的插拔式方案对推理服务特别友好。模型不用重新训练,部署时在解码环节加一段预处理和分支解码即可,即便多跑了一个对比分支,总的计算开销也只是解码层的一倍左右,比重新训练大模型省太多。龙哥可以预见,这类“边推理边纠偏”的思路,未来会被更广泛地用在视频问答、自动驾驶场景理解、具身智能等对实时性敏感、又容不得“胡说八道”的领域。
当然,VADER 不是银弹。它在 VidHalluc 这种细粒度怪癖上偶尔掉点,且默认超参(β、λ、K_l、ρ)虽然号称“固定配置”,但其敏感性在不同骨干上仍有差异。未来如果能进一步自适应地动态调整这些超参,或者把诊断信号做得更轻量、减少一次额外前向的开销,这套方法的实用价值还能再上一个台阶。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?中科院等单位提出VADER,训练无关的视频大模型幻觉缓解框架。VFR按视频内容自适应重分配注意力,SEE在解码器内部按帧擦除关键证据,构建难被跨帧补偿的先验偏置分支,经对比解码抑制幻觉。
这篇工作最值得看的点是什么?VADER在EventHallusion上对LLaVA-Video-7B达到72.60%准确率,超过训练方法TPO(63.33%)和RRPO(67.97%);在VideoHallucer上提升+3.90至+10.30点;在保持通用视频理解能力的同时提升幻觉缓解效果。
这篇工作的边界或风险在哪里?优点:1)VFR实现视频条件化的自适应干预策略,避免全局固定配置的局限性;2)SEE在解码器内部按帧擦除高重要性令牌,构建难以被跨帧冗余补偿的先验偏置分支;3)训练无关,即插即用,无需额外监督或参数更新;4)在多个基准和多个骨干模型上取得一致提升。缺点:1)引入额外推理计算和内存开销;2)部分基准(如VidHalluc对LLaVA-Video-7B)上性能略有下降;3)超参数(β, λ, K_l, l*, ρ)需要一次性校准,虽固定后跨基准泛化但初始选择依赖源设置。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出VADER框架,通过视觉焦点重分配(VFR)自适应确定干预层与强度,结合选择性证据擦除(SEE)构建先验偏置分支,利用对比解码抑制视频大语言模型中的幻觉生成。

实验合理度:★★★★☆

准确率(Accuracy),包括各基准的细分指标(BQA、MCQ、STH、TSH、AVG等)

学术研究价值:★★★★☆

提出VADER框架,通过视觉焦点重分配(VFR)自适应确定干预层与强度,结合选择性证据擦除(SEE)构建先验偏置分支,利用对比解码抑制视频大语言模型中的幻觉生成;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

VADER引入额外的推理计算开销,包括梯度计算(诊断前向传播)和双分支前向传播,具体FLOPs未在论文中报告,但作者指出存在额外推理时间与内存开销。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;2)SEE在解码器内部按帧擦除高重要性令牌,构建难以被跨帧冗余补偿的先验偏置分支;3)训练无关,即插即用,无需额外监督或参数更新;4)在多个基准和多个骨干模型上取得一致提升。缺点:1)引入额外推理计算和内存开销;

主要参考文献

[1] Zhang et al. EventHallusion: Diagnosing Event Hallucinations in Video LLMs. 2024a.
[2] Li, Im, and Fazli. DINO-HEAL: Diagnosing Video Hallucinations via Vision-Language Attention. 2025.
[3] Li et al. LLaVA-OneVision: A Visual Foundation Model for Multi-Modal Understanding. 2024a.
[4] Zhang et al. LLaVA-NeXT: What Else Could Vision-Language Models See? 2024c.
[5] Bai et al. Qwen3-VL: A Multimodal Vision-Language Model Series. 2025a.
[6] Wu et al. SEASON: Semantically-Aware Erasure for Video Hallucination. 2025a.
[7] Wang et al. VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Video LLMs. 2024c.
[8] Li et al. MVBench: A Comprehensive Multi-Modal Video Understanding Benchmark. 2024b.
[9] Fu et al. VideoMME: The First-Frame Video Understanding Benchmark. 2025.
[10] Xing et al. VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models. arXiv:2608.08622, 2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
视频大模型爱脑补,VADER帮你来纠偏。
不微调、不炼丹,推理期干预效果显。
EventHallusion冲上72.6%,幻觉缓解有妙招!
想和志同道合的朋友一起聊透多模态与幻觉缓解?扫码加入‘龙哥读论文’粉丝群,备注“研究方向+地点+学校/公司+昵称”,秒速进群~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球