← 返回 PaperDaily 视觉与图像

NUS新方法给VLM配探照灯:GPT-4o、Gemini看图提升2-6个点

你遇到过吗?让VLM读个图表或者扫描PDF,模型说得头头是道:“我要先看y坐标然后对比...”结果最后答案错得一塌糊涂! 这不是推理能力不行,是 证据没入眼 。今天聊的NUS新研究SPOT-E,用一招「熵塑形」给VLM搭了个探照灯,冻结主干模型不用训,直接让GPT-4o、Gemini看图能力上一个台阶~

NUS新方法给VLM配探照灯:GPT-4o、Gemini看图提升2-6个点
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
你遇到过吗?让VLM读个图表或者扫描PDF,模型说得头头是道:“我要先看y坐标然后对比...”结果最后答案错得一塌糊涂!
这不是推理能力不行,是证据没入眼。今天聊的NUS新研究SPOT-E,用一招「熵塑形」给VLM搭了个探照灯,冻结主干模型不用训,直接让GPT-4o、Gemini看图能力上一个台阶~


原论文信息如下:
论文标题:
SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs
...
发表日期:
2026年06月
...
发表单位:
National University of Singapore, Fudan University, Technical University of Munich, Sagenic Tech, Zhejiang University, vivo, Shanghai Artificial Intelligence Laboratory
...
原文链接:
https://arxiv.org/pdf/2606.20244v1.pdf
...
开源代码链接:
https://github.com/YinBo0927/SPOT-E
准备好了吗?咱们要开始上硬菜了。前面讲VLM看着图表“眼瞎”的问题,其实就是个老难题——模型能推理,但证据太小它看不见。今天这篇来自NUS、复旦、慕尼黑工大等机构的SPOT-E,说白了就是给冻结的VLM配了一副“智能眼镜”,不用重新训练,就在测试的时候调一调探照灯的角度,让正确答案自己跳出来。

1. 冻结的VLM为何也会“看不清”?

先问个扎心的问题:为什么明明VLM(Vision-Language Model,视觉语言模型)已经很强了,读个图表还是翻车?比如让它看一张柱状图,它会说“我要先看y轴标签,再对比两组数据”,但最后给的答案却错得离谱。问题出在哪?不是推理不行,是证据没入眼。论文把这个现象叫做“证据利用缺口”(evidence utilization gap):模型知道该找什么,但就是从图片里抠不出那个关键的小数字、小符号。
怎么验证?论文做了一个精巧的实验:把图片打上粗网格,然后只模糊掉少数几个格子里的内容,其他像素完全不变。结果发现,比答案熵(answer entropy)——也就是模型在生成最终答案时的不确定性——会随着关键证据被遮挡而剧烈上升。下面这张图就展示了这个现象:当模糊的区域刚好覆盖了题目需要的证据时,答案熵瞬间飙高,答案就错了。
图1:局部证据控制答案熵。对部分网格区域施加模糊,其余像素不变,测量答案熵的变化。
图1:局部证据控制答案熵。对部分网格区域施加模糊,其余像素不变,测量答案熵的变化。
这说明什么?答案熵的高低直接反映了模型有没有“看清楚”证据。如果模型很确定,熵就低;如果关键位置被糊住,它就蒙圈了,熵就高。好,这不就是个天然的无监督信号吗?我们能不能直接用熵来指导视觉干预?别急,事情没这么简单。

2. 熵的“双面性”:降低不一定更好

如果熵低代表模型确信,那直接最小化熵不就行了吗?但论文用一个漂亮的实验揭露了陷阱:熵降低也可能是“假自信”。当把关键证据完全擦除后,模型反而会依赖先验知识或背景干扰物,给出一个看起来自信但实际错误的答案,这时候熵又掉下来了。 看下面这张图:横轴是模糊强度(α),纵轴是答案熵。随着模糊强度增加,熵先升高(证据变得模糊),然后当证据完全消失时,熵反而下降,因为模型“破罐子破摔”了。这就是熵歧义(entropy ambiguity)
图2:熵降低可能具有误导性。仅模糊最敏感的单区域子集S*,随着强度α变化,答案熵先升后降。
图2:熵降低可能具有误导性。仅模糊最敏感的单区域子集S*,随着强度α变化,答案熵先升后降。
所以,单纯用熵作为奖励函数会出大问题——模型可能会学“作弊”:通过遮挡难证据来降低熵,而不是真正找到证据。怎么办?论文提出了一个巧妙的思路:低熵锚点(low-entropy anchors)

3. SPOT-E登场:用“低熵锚点”稳住决策信心

什么是低熵锚点?就是对原始输入,模型本来就很确信的那些token位置。比如在生成“最终答案:...”这个结构时,有一些词模型闭着眼睛都能说对(比如格式词),它们就是锚点。如果一次视觉干预让这些锚点位置的熵也变大了,说明干预破坏了模型原本稳定的认知——这大概率是“作弊”而非“看清了证据”。
下图直观展示了两种干预:虽然都降低了答案熵,但左边的干预(揭示证据)保持了锚点低熵,右边(破坏证据)则明显增加了锚点熵。
图3:低熵锚点揭示了破坏性捷径。
图3:低熵锚点揭示了破坏性捷径。
基于这个洞察,SPOT-E提出了熵塑形(Entropy Shaping)的原则:想降低答案熵可以,但必须同时保护好低熵锚点,不让它们的熵上升太多。这就形成了一种“有监督的探索”——模型只能通过增强真实证据来降低不确定性,而不能走捷径。

4. 轻量探照灯+GRPO,如何让证据“现形”?

核心设计分三步走:视觉探照灯模块熵塑形奖励函数GRPO优化

视觉探照灯(Visual Spotlight)

首先,SPOT-E用了一个基于CLIP的轻量模块来生成问题条件性的软遮罩(question-conditioned soft mask)。给定问题,先提取关键视觉短语,然后用CLIP编码全局图像和多个局部裁剪,计算每个图像块与该文本的相似度,得到多个相关性图,再通过最大池化(max pooling)融合,最后上采样到原图分辨率,并通过sigmoid得到0~1的软遮罩。这个遮罩决定了哪些区域被“照亮”(增强),哪些区域被“暗化”(退化为背景模糊)。整个过程如下图所示。
图4:SPOT-E视觉探照灯模块。图像编码器和文本编码器均为CLIP。模块计算全局视图和局部裁剪上的块-文本相似度,然后通过最大池化融合多视图相关性图,生成最终的探照灯遮罩。
图4:SPOT-E视觉探照灯模块。图像编码器和文本编码器均为CLIP。模块计算全局视图和局部裁剪上的块-文本相似度,然后通过最大池化融合多视图相关性图,生成最终的探照灯遮罩。
最终干预后的图像通过公式生成:
优化后的图像 = 遮罩 ⊙ 原图 + (1-遮罩) ⊙ 背景模糊
其中B(·)是固定的背景退化操作(如暗化)。

熵塑形奖励函数

奖励函数由两部分组成:清晰度奖励(R_clarity)锚点保护奖励(R_preserve)
清晰度奖励鼓励模型在答案token上的熵降低,但带有一个动态缩放因子γ——如果基线熵已经很低,γ就小,避免盲目优化;如果基线熵很高,γ就大,鼓励大幅降低不确定性。
R_clarity = γ · ΔH_ans,其中γ = H_ans_base / (H_ans_base + c)
锚点保护奖励则惩罚那些使低熵锚点熵上升的行为:
R_preserve = -λ · ΔH_low
λ控制惩罚强度。总奖励就是两者之和:
R = R_clarity + R_preserve

GRPO优化:测试时自适应

SPOT-E使用GRPO(Group Relative Policy Optimization)进行优化。GRPO是DeepSeek团队提出的一种强化学习算法,论文中引用[27]。每个测试实例初始化探照灯参数,然后进行几步迭代:采样一组N个候选遮罩,计算每个候选的奖励,用组内标准化优势,更新LoRA适配器。之后参数会重置,不影响下一个实例。整个过程对VLM完全冻结,只更新极少的参数(LoRA层),计算量很小。
下面这张概览图把整个流程串起来了:左边是冻结的VLM,右边是探照灯模块,中间是奖励计算和GRPO更新。
图5:SPOT-E概览。冻结VLM,在测试时优化轻量级视觉探照灯生成干预图像,由答案熵清晰度和锚点保护奖励评分。
图5:SPOT-E概览。冻结VLM,在测试时优化轻量级视觉探照灯生成干预图像,由答案熵清晰度和锚点保护奖励评分。

5. 全面评测:提点显著,鲁棒性更强

论文做了大量实验,覆盖了闭源和开源的多类VLM主干,包括GPT-4o、GPT-4o-mini、Gemini-2.5-Flash、Qwen2.5-VL、LLaVA-NeXT、InternVL等。结果非常惊艳:所有模型在所有基准上一致提升,尤其是在证据密集型任务上提升更明显
表1:在闭源和开源主干上应用SPOT-E的结果。
表1:在闭源和开源主干上应用SPOT-E的结果。可见所有模型都有稳定提升,TextVQA、MathVista等任务上提升显著(+2~6个点)。
与现有推理时视觉干预方法(如FGVP、SoM、ViCrop等)相比,SPOT-E也全面领先,如下表:
表2:与推理时视觉证据操作基线的对比。
表2:与推理时视觉证据操作基线的对比。SPOT-E在多个任务上取得最好或持平结果。
更令人印象深刻的是鲁棒性测试:在TextVQA上添加高斯噪声、低分辨率、局部遮挡等干扰,SPOT-E始终比基线模型下降更少,证明了探照灯有助于模型聚焦真实证据而非图像伪影。
图6:分布外鲁棒性评估。在TextVQA上施加三种合成损坏,SPOT-E全程保持更优。
图6:分布外鲁棒性评估。在TextVQA上施加三种合成损坏,SPOT-E全程保持更优。
置信度校准方面,SPOT-E显著增加了错误预测的熵(让模型不要盲目自信),同时保持正确预测的熵低,从而更好地区分正确与错误答案。
图7:置信度校准箱线图。SPOT-E增加了错误预测的熵,同时保持正确预测熵低,改善了区分度。
图7:置信度校准箱线图。SPOT-E增加了错误预测的熵,同时保持正确预测熵低,改善了区分度。
消融实验验证了奖励函数各部分的作用:去掉锚点保护或动态缩放都会下降,默认设计最优。关于测试时更新步数,论文发现仅需10步左右就能稳定,说明效率很高。
表3:奖励设计消融。组合完整奖励最佳。
表3:奖励设计消融。组合完整奖励最佳。
表4:探照灯设计消融。多视图融合与背景退化均有贡献。
表4:探照灯设计消融。多视图融合与背景退化均有贡献。

6. 总结与思辨:从“开环”到“闭环”的跨越

SPOT-E的核心贡献在于将视觉干预从“开环”升级为“闭环”。以往的方法(如FGVP)只是基于固定规则或外部模型做一次性的区域强调,但无法验证强调的区域是否真的被模型利用了。SPOT-E通过熵塑形奖励,让模型自己“说话”——如果干预后答案熵降低且锚点保持稳定,就说明干预有效;否则就自动调整。这种自校验机制是本质性的进步。
当然,SPOT-E也有局限:它依赖VLM提供token级log概率,对不暴露log概率的闭源API(如部分商业模型)无法直接应用。此外,每个实例需要几步优化,虽然很快,但相比零额外开销的方法仍有延迟。不过,论文已经展示了在GPT-4o等模型上的成功应用(通过API提供log概率),并且开源了代码,值得一试。
最后放一张定性对比图,感受一下SPOT-E的实际效果——在图表、文档、数学题上,它真的让模型“看”见了那些关键小字。
图9:定性案例研究。比较冻结基线与+SPOT-E在同一推理设置下的结果。SPOT-E正确读出了被基线忽略的关键数值。
图9:定性案例研究。比较冻结基线与+SPOT-E在同一推理设置下的结果。SPOT-E正确读出了被基线忽略的关键数值。
龙哥觉得,这项工作的思路特别巧妙——用模型自身的熵信号作为无需标签的反馈,既轻量又有效。它可能开启一条新路线:以后部署VLM时,我们不再需要收集大量标注数据来微调,而是直接在推理时用几分钟的优化就能大幅提升性能。对于证据密集型应用(如文档分析、图表问答、医疗影像),SPOT-E的实用价值很大。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:SPOT-E中的“低熵锚点”具体是怎么定义的?A:低熵锚点是指在原始未干预图像上,模型在生成输出时那些预测熵最小的K个token位置。论文通过计算每个解码步的熵,选出最小的K个(通常K=5~10)。这些位置通常是模型确信的常见格式词或易读信息。干预后如果这些位置的熵显著增加,说明干预破坏了模型原本确定的认知,是不好的。

Q2:GRPO是什么?为什么要用GRPO而不是PPO?A:GRPO(Group Relative Policy Optimization)是DeepSeek-Math论文([27])中提出的一种强化学习算法。与PPO不同,GRPO不需要价值网络(critic),而是通过在一个组内对多个候选的奖励做标准化来估计优势。这样更轻量,适合测试时这种每次实例只做几步优化的场景。SPOT-E用GRPO更新探照灯模块的LoRA参数,每次从一个初始噪点出发,采样N个候选,计算奖励,然后更新。

Q3:这个方法对VLM主干的限制是什么?所有VLM都能用吗?A:SPOT-E要求VLM在推理时能输出每个token的log概率,因为需要计算熵。大多数开源VLM满足这一点,闭源API如GPT-4o、Gemini也提供了token级别的logprob功能。另外,VLM需要能够接收修改后的图像输入并正常处理。所以主流VLM基本都适用。论文测试了8种不同主干,全部得到提升。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

将熵信号与强化学习结合用于测试时视觉适应,提出低熵锚点区分真假自信,思路新颖。4星(缺少颠覆性但方向独特)。

实验合理度:★★★★★

覆盖8种不同VLM主干、多个基准、鲁棒性测试、消融详尽,对比方法均为最新,统计严谨。满分。

学术研究价值:★★★★✰

提出的熵塑形框架可推广到其他模态,对理解模型内部证据利用机制有启发。4星。

稳定性:★★★★✰

在多种损坏下鲁棒性提升明显,但依赖于优化过程,极端情况下可能收敛不良,但总体稳定。4星。

适应性以及泛化能力:★★★★✰

在多种任务上一致提升,但主要适用于证据密集型任务,对常识推理类任务提升较小。4星。

硬件需求及成本:★★★★✰

仅需一个额外CLIP编码器和少量优化步骤,相比训练整个VLM算力需求极低,但测试时每实例需额外几步推理,稍有延迟。4星。

复现难度:★★★★★

代码已开源,结构清晰,使用标准库。5星。

产品化成熟度:★★★✰✰

目前适用于需要高精度证据提取的场景(如文档问答),但优化步骤增加延迟,实时场景需要权衡。3星。

可能的问题:论文未讨论干预可能引入的偏差(如过度强调背景)。另外,GRPO的组内标准化可能在某些简单任务上不稳定。整体瑕不掩瑜。


主要参考文献

[1] Yin B, et al. SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs. arXiv:2606.20244, 2026.
[27] Shao Z, et al. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning with Group Relative Policy Optimization. 2024.
[36] FGVP: Fine-Grained Visual Prompting 等.
代码地址: https://github.com/YinBo0927/SPOT-E

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看完SPOT-E给VLM戴上的「探照灯」,是不是手痒想在自己模型上试试?群里已经有一波小伙伴在研究熵塑形了!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。