← 返回 PaperDaily
视觉与图像
NUS新方法给VLM配探照灯:GPT-4o、Gemini看图提升2-6个点
你遇到过吗?让VLM读个图表或者扫描PDF,模型说得头头是道:“我要先看y坐标然后对比...”结果最后答案错得一塌糊涂! 这不是推理能力不行,是 证据没入眼 。今天聊的NUS新研究SPOT-E,用一招「熵塑形」给VLM搭了个探照灯,冻结主干模型不用训,直接让GPT-4o、Gemini看图能力上一个台阶~
龙哥读论文
发布于 2026-08-14 09:10:40
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: 你遇到过吗?让VLM读个图表或者扫描PDF,模型说得头头是道:“我要先看y坐标然后对比...”结果最后答案错得一塌糊涂! 这不是推理能力不行,是证据没入眼 。今天聊的NUS新研究SPOT-E,用一招「熵塑形」给VLM搭了个探照灯,冻结主干模型不用训,直接让GPT-4o、Gemini看图能力上一个台阶~
原论文信息如下:
准备好了吗? 咱们要开始上硬菜了。前面讲VLM看着图表“眼瞎”的问题,其实就是个老难题——模型能推理,但证据太小它看不见 。今天这篇来自NUS、复旦、慕尼黑工大等机构的SPOT-E,说白了就是给冻结的VLM配了一副“智能眼镜”,不用重新训练,就在测试的时候调一调探照灯的角度,让正确答案自己跳出来。
1. 冻结的VLM为何也会“看不清”?
先问个扎心的问题:为什么明明VLM(Vision-Language Model,视觉语言模型)已经很强了,读个图表还是翻车?比如让它看一张柱状图,它会说“我要先看y轴标签,再对比两组数据”,但最后给的答案却错得离谱。问题出在哪?不是推理不行,是证据没入眼 。论文把这个现象叫做“证据利用缺口”(evidence utilization gap):模型知道该找什么,但就是从图片里抠不出那个关键的小数字、小符号。
怎么验证?论文做了一个精巧的实验:把图片打上粗网格,然后只模糊掉少数几个格子里的内容,其他像素完全不变。结果发现,比答案熵(answer entropy) ——也就是模型在生成最终答案时的不确定性——会随着关键证据被遮挡而剧烈上升。下面这张图就展示了这个现象:当模糊的区域刚好覆盖了题目需要的证据时,答案熵瞬间飙高,答案就错了。
这说明什么?答案熵的高低直接反映了模型有没有“看清楚”证据 。如果模型很确定,熵就低;如果关键位置被糊住,它就蒙圈了,熵就高。好,这不就是个天然的无监督信号吗?我们能不能直接用熵来指导视觉干预?别急,事情没这么简单。
2. 熵的“双面性”:降低不一定更好
如果熵低代表模型确信,那直接最小化熵不就行了吗?但论文用一个漂亮的实验揭露了陷阱:熵降低也可能是“假自信” 。当把关键证据完全擦除后,模型反而会依赖先验知识或背景干扰物,给出一个看起来自信但实际错误的答案,这时候熵又掉下来了。
看下面这张图:横轴是模糊强度(α),纵轴是答案熵。随着模糊强度增加,熵先升高(证据变得模糊),然后当证据完全消失时,熵反而下降,因为模型“破罐子破摔”了。这就是熵歧义(entropy ambiguity) 。
所以,单纯用熵作为奖励函数会出大问题——模型可能会学“作弊”:通过遮挡难证据来降低熵 ,而不是真正找到证据。怎么办?论文提出了一个巧妙的思路:低熵锚点(low-entropy anchors) 。
3. SPOT-E登场:用“低熵锚点”稳住决策信心
什么是低熵锚点?就是对原始输入,模型本来就很确信的那些token位置 。比如在生成“最终答案:...”这个结构时,有一些词模型闭着眼睛都能说对(比如格式词),它们就是锚点。如果一次视觉干预让这些锚点位置的熵也变大了,说明干预破坏了模型原本稳定的认知——这大概率是“作弊”而非“看清了证据”。
下图直观展示了两种干预:虽然都降低了答案熵,但左边的干预(揭示证据)保持了锚点低熵,右边(破坏证据)则明显增加了锚点熵。
基于这个洞察,SPOT-E提出了熵塑形(Entropy Shaping) 的原则:想降低答案熵可以,但必须同时保护好低熵锚点,不让它们的熵上升太多。这就形成了一种“有监督的探索”——模型只能通过增强真实证据来降低不确定性,而不能走捷径。
4. 轻量探照灯+GRPO,如何让证据“现形”?
核心设计分三步走:视觉探照灯模块 、熵塑形奖励函数 、GRPO优化 。
首先,SPOT-E用了一个基于CLIP的轻量模块来生成问题条件性的软遮罩(question-conditioned soft mask) 。给定问题,先提取关键视觉短语,然后用CLIP编码全局图像和多个局部裁剪,计算每个图像块与该文本的相似度,得到多个相关性图,再通过最大池化(max pooling)融合,最后上采样到原图分辨率,并通过sigmoid得到0~1的软遮罩。这个遮罩决定了哪些区域被“照亮”(增强),哪些区域被“暗化”(退化为背景模糊)。整个过程如下图所示。
最终干预后的图像通过公式生成:
其中B(·)是固定的背景退化操作(如暗化)。
奖励函数由两部分组成:清晰度奖励(R_clarity) 和 锚点保护奖励(R_preserve) 。
清晰度奖励鼓励模型在答案token上的熵降低,但带有一个动态缩放因子γ ——如果基线熵已经很低,γ就小,避免盲目优化;如果基线熵很高,γ就大,鼓励大幅降低不确定性。
锚点保护奖励则惩罚那些使低熵锚点熵上升的行为:
λ控制惩罚强度。总奖励就是两者之和:
SPOT-E使用GRPO(Group Relative Policy Optimization) 进行优化。GRPO是DeepSeek团队提出的一种强化学习算法,论文中引用[27]。每个测试实例初始化探照灯参数,然后进行几步迭代:采样一组N个候选遮罩,计算每个候选的奖励,用组内标准化优势,更新LoRA适配器。之后参数会重置,不影响下一个实例。整个过程对VLM完全冻结,只更新极少的参数(LoRA层),计算量很小。
下面这张概览图把整个流程串起来了:左边是冻结的VLM,右边是探照灯模块,中间是奖励计算和GRPO更新。
5. 全面评测:提点显著,鲁棒性更强
论文做了大量实验,覆盖了闭源和开源的多类VLM主干,包括GPT-4o、GPT-4o-mini、Gemini-2.5-Flash、Qwen2.5-VL、LLaVA-NeXT、InternVL等。结果非常惊艳:所有模型在所有基准上一致提升,尤其是在证据密集型任务上提升更明显 。
与现有推理时视觉干预方法(如FGVP、SoM、ViCrop等)相比,SPOT-E也全面领先,如下表:
更令人印象深刻的是鲁棒性测试 :在TextVQA上添加高斯噪声、低分辨率、局部遮挡等干扰,SPOT-E始终比基线模型下降更少,证明了探照灯有助于模型聚焦真实证据而非图像伪影。
置信度校准 方面,SPOT-E显著增加了错误预测的熵(让模型不要盲目自信),同时保持正确预测的熵低,从而更好地区分正确与错误答案。
消融实验 验证了奖励函数各部分的作用:去掉锚点保护或动态缩放都会下降,默认设计最优。关于测试时更新步数,论文发现仅需10步左右就能稳定,说明效率很高。
6. 总结与思辨:从“开环”到“闭环”的跨越
SPOT-E的核心贡献在于将视觉干预从“开环”升级为“闭环” 。以往的方法(如FGVP)只是基于固定规则或外部模型做一次性的区域强调,但无法验证强调的区域是否真的被模型利用了。SPOT-E通过熵塑形奖励,让模型自己“说话”——如果干预后答案熵降低且锚点保持稳定,就说明干预有效;否则就自动调整。这种自校验机制是本质性的进步。
当然,SPOT-E也有局限:它依赖VLM提供token级log概率,对不暴露log概率的闭源API(如部分商业模型)无法直接应用。此外,每个实例需要几步优化,虽然很快,但相比零额外开销的方法仍有延迟。不过,论文已经展示了在GPT-4o等模型上的成功应用(通过API提供log概率),并且开源了代码,值得一试。
最后放一张定性对比图,感受一下SPOT-E的实际效果——在图表、文档、数学题上,它真的让模型“看”见了那些关键小字。
龙哥觉得,这项工作的思路特别巧妙——用模型自身的熵信号作为无需标签的反馈,既轻量又有效。它可能开启一条新路线:以后部署VLM时,我们不再需要收集大量标注数据来微调,而是直接在推理时用几分钟的优化就能大幅提升性能。对于证据密集型应用(如文档分析、图表问答、医疗影像),SPOT-E的实用价值很大。
龙迷三问
Q1:SPOT-E中的“低熵锚点”具体是怎么定义的? A:低熵锚点是指在原始未干预图像上,模型在生成输出时那些预测熵最小的K个token位置 。论文通过计算每个解码步的熵,选出最小的K个(通常K=5~10)。这些位置通常是模型确信的常见格式词或易读信息。干预后如果这些位置的熵显著增加,说明干预破坏了模型原本确定的认知,是不好的。
Q2:GRPO是什么?为什么要用GRPO而不是PPO? A:GRPO(Group Relative Policy Optimization)是DeepSeek-Math论文([27])中提出的一种强化学习算法。与PPO不同,GRPO不需要价值网络(critic) ,而是通过在一个组内对多个候选的奖励做标准化来估计优势。这样更轻量,适合测试时这种每次实例只做几步优化的场景。SPOT-E用GRPO更新探照灯模块的LoRA参数,每次从一个初始噪点出发,采样N个候选,计算奖励,然后更新。
Q3:这个方法对VLM主干的限制是什么?所有VLM都能用吗? A:SPOT-E要求VLM在推理时能输出每个token的log概率 ,因为需要计算熵。大多数开源VLM满足这一点,闭源API如GPT-4o、Gemini也提供了token级别的logprob功能。另外,VLM需要能够接收修改后的图像输入并正常处理。所以主流VLM基本都适用。论文测试了8种不同主干,全部得到提升。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰
将熵信号与强化学习结合用于测试时视觉适应,提出低熵锚点区分真假自信,思路新颖。4星(缺少颠覆性但方向独特)。
实验合理度: ★★★★★
覆盖8种不同VLM主干、多个基准、鲁棒性测试、消融详尽,对比方法均为最新,统计严谨。满分。
学术研究价值: ★★★★✰
提出的熵塑形框架可推广到其他模态,对理解模型内部证据利用机制有启发。4星。
稳定性: ★★★★✰
在多种损坏下鲁棒性提升明显,但依赖于优化过程,极端情况下可能收敛不良,但总体稳定。4星。
适应性以及泛化能力: ★★★★✰
在多种任务上一致提升,但主要适用于证据密集型任务,对常识推理类任务提升较小。4星。
硬件需求及成本: ★★★★✰
仅需一个额外CLIP编码器和少量优化步骤,相比训练整个VLM算力需求极低,但测试时每实例需额外几步推理,稍有延迟。4星。
复现难度: ★★★★★
代码已开源,结构清晰,使用标准库。5星。
产品化成熟度: ★★★✰✰
目前适用于需要高精度证据提取的场景(如文档问答),但优化步骤增加延迟,实时场景需要权衡。3星。
可能的问题: 论文未讨论干预可能引入的偏差(如过度强调背景)。另外,GRPO的组内标准化可能在某些简单任务上不稳定。整体瑕不掩瑜。
主要参考文献
[1] Yin B, et al. SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs. arXiv:2606.20244, 2026.
[27] Shao Z, et al. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning with Group Relative Policy Optimization. 2024.
[36] FGVP: Fine-Grained Visual Prompting 等.
代码地址: https://github.com/YinBo0927/SPOT-E
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
看完SPOT-E给VLM戴上的「探照灯」,是不是手痒想在自己模型上试试?群里已经有一波小伙伴在研究熵塑形了!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群