← 返回 PaperDaily 视觉与图像

视觉ToM新方法:PGD负样本让大模型少瞎猜

这篇论文的切口很狠:不去讨论“多模态大模型会不会推理”,而是直接问它们在只看视频时,能不能别靠语言偏见乱猜。VisionToM 不是简单微调,而是拿注意力头开刀,思路清楚,代价也低,适合真正想把可解释性做成工具的人。

视觉ToM新方法:PGD负样本让大模型少瞎猜
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文的切口很狠:不去讨论“多模态大模型会不会推理”,而是直接问它们在只看视频时,能不能别靠语言偏见乱猜。VisionToM 不是简单微调,而是拿注意力头开刀,思路清楚,代价也低,适合真正想把可解释性做成工具的人。


原论文信息如下:
论文标题:
Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models
发表日期:
2026年03月
发表单位:
University of Science and Technology Beijing
原文链接:
https://arxiv.org/pdf/2603.24484.pdf
先说结论:这篇工作最有意思的地方,不是“又一个多模态大模型答题器”,而是它把问题掰开了看——模型为什么会在只看视频时胡猜,以及能不能不靠重新训练,直接把注意力掰回正轨。这就像给模型做“脑内导航校准”,不是重装系统,而是先找出它走神的那几条神经通路,再精准拉回来。
这类任务叫Theory of Mind,ToM(心理理论),中文可以理解成“推测别人脑子里在想什么”。人类做这个很自然:看一个人往哪儿走、盯着什么、拿起什么,基本就能猜到他接下来要干嘛。可多模态大模型在这里常常有点“戏精”:字幕一来就开始顺着语言先验瞎补,视频明明已经给了线索,它还是爱按自己熟悉的套路答题。
这篇论文的切口很准:它不争论模型到底“有没有心智”,而是直接问——能不能把模型在视频 ToM 任务里的注意力和推理方向,做一次可解释的定向干预。方法名叫 VisionToM,核心不是微调,不是加一堆提示词,而是训练探针和编码器后,在推理时对注意力头做干预。说白了,像是给模型的“思维偏航”打补丁。

训练探针与编码器,仅使用视频即可(0.2+1小时)

先把基础概念说人话。这里的探针(probe),不是往模型里插根针,而是训练一个很轻的线性分类器,去“偷看”模型内部某个注意力头到底有没有学到有用信息。它的作用不是替代模型,而是诊断模型内部哪些头在认真看视频,哪些头在瞎忙活
编码器则更像“翻译器”。探针告诉系统哪些内部表示能区分对错,编码器负责把错误样本的表示往正确样本方向推一推,学出一个纠偏方向。这一步很关键,因为它不是粗暴地改输出,而是先在表征空间里找方向,再在推理时施加干预。工程上最讨喜的一点也在这里:MLLM 主干冻结,不需要全量微调,训练成本低很多。
论文在实验设置里给了一个很直接的信号:探针训练大约0.2 小时,编码器训练大约1 小时。这意味着它不是那种“效果不错,但一跑就把显卡烤成铁板烧”的方案。对于做原型验证或者想在现有视频大模型上快速加一层可解释干预的人来说,这个成本很有吸引力。
图2:方法总览——从内部表征提取到注意力头干预
图2:方法总览——先从多模态大模型内部提取视觉与文本维度的表示,再找出对视觉输入和任务推理敏感的注意力头,最后在推理阶段对这些头做定向干预。这个流程的精髓不在“复杂”,而在“克制”:不改主干参数,只改关键通路。
这里还有一个很实用的设计:只输入视频、问题和选项,不额外喂文本描述。这个设定看起来朴素,实际上是在强迫模型别偷看“答案提示”。很多多模态评测一旦加了语言辅助,模型就容易把文本当拐杖;而这篇工作就是故意把拐杖拿走,看看它还能不能走直线。

无需微调模型,干预注意力头的表征空间

VisionToM 的关键不是“让模型学会新知识”,而是识别并干预那些已经存在、但方向不对的内部表示。论文先分析注意力头在不同任务上的响应,再用探针找出最敏感的头。结果很有意思:视觉注意力相关的信号在不同任务之间有较强一致性,而 ToM 推理相关的表示在隐藏空间里会随任务变化,但同一任务内部又保持相对一致。
图3:视觉注意力与ToM推理表征的探针分析与可视化
图3:视觉注意力阶段与 ToM 推理阶段的探针准确率、核密度估计和主成分分析结果。它说明两件事:第一,很多头确实“看见了”视觉扰动;第二,ToM 推理的真假表示并不是一条简单直线,而是分布在一个更复杂的子空间里。换句话说,模型不是完全没学,而是学得有点散。
这也解释了为什么方法没有直接照搬“统一方向修正”。如果所有错误都能被一条向量修正,那事情就太简单了,论文也不用写这么长。现实是,不同错误模式对应不同语义偏差:有的错在目标判断,有的错在信念推断,有的错在动作预测。所以论文在 ToM 推理部分引入了编码器分簇:先把负样本按错误类型聚类,再为每一类学专属纠偏方向。
图4:LLaVA-Next-Video-7B各层各头的探针准确率热图
图4:LLaVA-Next-Video-7B 在三个 EgoToM 子任务上的注意力头探针热图。颜色越深,说明该头越能区分对错。这个图的价值在于,它不是在讲“模型整体很强或很弱”,而是在告诉读者:真正有用的是少数几个头和少数几层,其余部分更多是在陪跑。
干预位置也很讲究:是在多头注意力计算之后、输出投影之前插入。这个位置等于卡在“信息汇总”和“最终输出”之间,既能影响后续表示,又不至于把模型结构改得面目全非。工程味道很浓:轻量、可复用、可迁移,这比动不动全参微调更接近真实部署需求。

PGD攻击生成负样本,引导模型关注视觉信息

视觉注意力增强这部分,论文没有用随机噪声糊弄,而是用了PGD 攻击(Projected Gradient Descent,投影梯度下降攻击)。它的本质是:沿着让模型更容易答错的方向,给输入视频加一点有约束的扰动,制造“高质量负样本”。这里的 PGD 不是为了搞破坏,而是为了更准确地估计模型哪里最依赖视觉线索。
为什么不用随机高斯噪声?因为随机噪声像拿塑料锤子敲门,能不能敲出模型的弱点全看运气;PGD 更像拿扳手直接拧模型最敏感的那颗螺丝。论文的表1就说明了这一点:PGD 对模型准确率的打击更稳定,也更能提供有意义的纠偏方向。
表1:随机高斯噪声与PGD攻击效果对比
表1:随机高斯噪声与 PGD 攻击在 LLaVA-Next-Video 上的效果对比。可以看出,PGD 生成的负样本更“懂模型”,因为它不是随便扰动,而是沿着模型最容易出错的方向逼近。对 VisionToM 来说,这类负样本更适合拿来学习视觉纠偏向量。
这里有个很现实的工程判断:如果负样本质量差,后面的纠偏方向就会漂。也就是说,前面“造题”不准,后面“改错”就容易跑偏。论文选择 PGD,本质上是在提高监督信号的可辨识度,避免编码器学到一条模模糊糊的错误修正线。

引入编码器分离不同错误模式,精细引导ToM推理

ToM 推理这部分更像“外科手术”而不是“广撒网”。论文先把负样本按语义错误模式聚类,再为每个簇训练专门的编码器。这里的逻辑很朴素:不同错误不是同一种病,不能拿同一副药方硬治。有的样本错在把“目标”看反了,有的错在把“信念”理解偏了,有的错在对后续动作的因果链想歪了。
聚类数不是拍脑袋定的,而是结合轮廓系数、肘部法和 Calinski-Harabasz 指标一起选。这个设计有点“老实”,但老实得对。因为如果簇数过少,错误类型被糊成一团;簇数过多,又会把样本切碎,导致每个编码器学不到稳定方向。论文还限制每个簇至少有 5 个样本,避免统计上太虚。
图5:Qwen2.5-VL-7B各头各层的探针热图
图5:Qwen2.5-VL-7B 的探针热图。它和图4一起说明了一件事:这种“找头—定向干预”的思路不是只对某一个模型凑巧有效,而是能在不同骨干上复现出相似的层级分布特征。
编码器本身也不复杂:两层线性层,中间配 GELU 和层归一化,输入输出维度是 128→256→128。看起来朴素,但正因为朴素,才更像一个可控的方向估计器,而不是另一个黑箱大网络。训练时用 Adam,学习率 1e-3,主干模型冻结。这个组合的好处是稳定,坏处是表达能力不会太夸张;但在这里,“够用且可解释”比“炫技”更重要

在三个子任务上提升显著,且能泛化到更大模型和不同数据集

实验部分最值得看的,不是某个单点结果,而是整体趋势。EgoToM 包含三个子任务:目标推断、信念推理、动作推断。这三个任务其实对应了不同层次的 ToM 能力:先看别人想干嘛,再猜别人相信什么,最后预测别人会做什么。对模型来说,这三件事难度递增,尤其是信念和动作推断,往往比目标判断更容易翻车。
表2:VisionToM与人类基线及多种多模态大模型基线的性能对比
表2:VisionToM 在 EgoToM 上与人类基线及多种多模态大模型基线的对比。一个很直观的事实是,很多模型在目标推断上还能看起来“像那么回事”,但一到信念和动作推断就明显掉队。VisionToM 加上视觉注意力和 ToM 推理干预后,三项任务都能明显抬升,说明它不是只会修补某一个窟窿。
更关键的是,它的提升不是靠增加提示词长度,也不是靠堆训练数据,而是靠内部干预。这意味着方法在推理阶段就能起作用,对已经部署好的模型更友好。对于产品侧来说,这种“外挂式增强”比重新训练一个大模型省事得多;对于研究侧来说,它也更容易做机制分析。
表3:EgoToM开放式生成任务上的表现对比
表3:EgoToM 开放式生成任务上的结果。这个结果很说明问题:VisionToM 不只是在选择题里“蒙对了”,在自由生成场景里也能让回答更贴近角色的真实心理状态。换句话说,它不是单纯把选项排序做对,而是让模型讲出来的话更像“真的看懂了”。
泛化性也是这篇工作比较稳的地方。论文在更大的骨干模型 Qwen2.5-VL-72B 上也做了额外实验,结果说明这种干预思路并不依赖某个特定模型的小毛病,而是能随骨干规模一起扩展。对于很多“只在 7B 上好看”的方法,这一点算是很有分量的加分项。
表5:更大骨干模型上的额外实验结果
表5:更大骨干模型上的额外实验。VisionToM 在 Qwen2.5-VL-72B 上仍能继续提升 ToM 推理,说明这套思路不是小模型专属,也不是“模型越大越不需要干预”的反例。
再看超参数分析,论文也没有回避“是不是调参调出来的”这个问题。编辑头数量和干预强度都有分析,结果表明方法对参数变化有一定敏感性,但不是那种一变就塌的脆皮结构。尤其是对不同任务和不同骨干,最佳配置并不完全一样,这反而符合直觉:不同模型的“走神方式”本来就不一样
图6:LLaVA-Next-Video超参数影响分析
图6:LLaVA-Next-Video 的超参数影响分析。它主要说明干预头数量和干预强度需要平衡,太轻了没效果,太猛了可能把模型原本还算正常的表示也扰乱掉。
图7:Qwen2.5-VL超参数影响分析
图7:Qwen2.5-VL 的超参数影响分析。不同骨干上的最优干预配置并不完全一致,这也从侧面说明,VisionToM 更像一套“可迁移的干预框架”,而不是固定参数的死配方。
如果把整篇工作压缩成一句话,就是:先找出模型在视频 ToM 任务里真正用得上的内部头,再用高质量负样本和分簇编码器把它的注意力从“语言惯性”拉回“视觉证据”。这条路比单纯增加数据或堆提示词更像工程方案,也更接近可解释 AI 的方向。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是多模态大模型在只看视频做心理推理时容易依赖语言先验、忽视视觉证据的问题。VisionToM 通过探针、编码器和注意力头干预,把模型的内部表示往更靠谱的方向拉。

PGD 攻击在这里为什么不是“捣乱”,反而是有用的?因为这里的 PGD 是拿来生成信息量更高的负样本,让系统更容易看出模型哪里会错。随机噪声也能扰动,但不一定扰到要害;PGD 更像是沿着模型最脆弱的地方做“定点测试”。

这套方法能不能直接用到别的模型上?从论文结果看,方法能迁移到 LLaVA-Next-Video、Qwen2.5-VL,甚至更大的 Qwen2.5-VL-72B。前提是模型内部结构里有可分析的注意力头,并且任务和数据分布足够接近视频 ToM 场景。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是凭空造一个新任务,而是把“可解释干预”真正用到了视频 ToM 上,思路扎实,且有明确机制。

实验合理度:★★★★☆ 负样本、探针、编码器、干预、开放式生成都串起来了,逻辑完整;不过部分结果仍依赖特定 benchmark,外推还要再看。

学术研究价值:★★★★☆ 它把“模型内部表示能不能被解释和利用”这件事往前推了一步,对多模态可解释推理很有启发。

稳定性:★★★☆☆ 冻结主干是优点,但干预强度和头选择仍有调参空间,跨场景稳定性还需要更多验证。

适应性以及泛化能力:★★★★☆ 能迁移到不同骨干,还能在更大模型上继续有效,这点比很多只会在单模型上“表演”的方法强。

硬件需求及成本:★★★★☆ 训练成本不高,主干冻结,适合做研究原型;但推理时仍要做内部干预,部署链路会比纯前向模型复杂一点。

复现难度:★★★☆☆ 论文给了关键流程,但涉及探针、聚类、干预头选择,细节不少;好在主干不需要重训,门槛还算可控。

产品化成熟度:★★★☆☆ 适合做研究型插件或离线增强模块,离大规模稳定在线产品还有一段路,尤其是对不同任务的头选择要再验证。

可能的问题:方法依赖探针和聚类质量,若任务分布变化大,干预方向可能漂移;另外,当前验证仍以 EgoToM 为主,跨数据集稳定性还需更强证据。


主要参考文献

[1] Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen. Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models. arXiv:2603.24484, 2026.
[2] EgoToM benchmark and related works cited in the paper, including LLaVA-Next-Video and Qwen2.5-VL.
[3] PGD attack: Projected Gradient Descent attack, used here to construct adversarial negative samples for visual attention enhancement.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
视频大模型老爱“看见了却没看懂”,这篇就专治这个毛病。只看视频、不靠文本,照样把 ToM 推理往正确方向拽,适合关心可解释性、幻觉和多模态推理的人。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。