← 返回 PaperDaily
视觉与图像
CVPR 2026:当降熵成为陷阱,SPOT-E用锚点保住证据
大模型能说会道,但遇到要细看图表、小字的地方,经常"看走眼"还"自信满满"。孙海伦团队从"答案熵"入手,发现模型在不确定时会表现出更高熵值,但盲目降熵反而让模型走上捷径。SPOT-E巧妙设计了一个视觉"聚光灯",配合强化学习,只调光照不调模型,让GPT-4o和开源模型在多个密集证据任务上获得稳定提升,思路清奇又实用。
龙哥读论文
发布于 2026-08-15 00:20:10
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 大模型能说会道,但遇到要细看图表、小字的地方,经常"看走眼"还"自信满满"。孙海伦团队从"答案熵"入手,发现模型在不确定时会表现出更高熵值,但盲目降熵反而让模型走上捷径。SPOT-E巧妙设计了一个视觉"聚光灯",配合强化学习,只调光照不调模型,让GPT-4o和开源模型在多个密集证据任务上获得稳定提升,思路清奇又实用。
原论文信息如下:
CVPR 2026收录!新加坡国立等提出SPOT-E:用“答案熵”指挥视觉聚光灯,冻结VLM也能精准读图?
别急,龙哥带你一层层拆解,看完你也会拍大腿——原来答案就藏在“答案熵”里。
冻结VLM的“近视眼”困境:证据利用鸿沟在哪里
先说说VLM(Vision-Language Model,视觉语言模型)现在有多牛。像GPT-4o、Qwen-VL这些模型,看图说话、理解图表、回答视觉问题,表现已经相当惊艳。但仔细一测就会发现问题:当任务要求模型从图片中提取一个很小的关键信息时——比如图表上的一个数字、一段小字说明——模型经常“眼瞎”。更诡异的是,它推理的步骤往往是对的,比如“先看X轴,再看Y轴,然后比较”,但最后给出的答案却是错的。论文把这叫做“证据利用鸿沟” (evidence utilization gap):模型知道该看哪里,但就是看不准、看不清。
传统解决办法是微调模型,但成本高、周期长。另一条路是“测试时干预”(test-time intervention):在推理时不改变模型参数,只调整输入图像,比如把关键区域放大、加个高亮框等。但现有方法都是开环的(open-loop),比如GVPF、SoM(Set-of-Mark)等,它们用固定规则来找关键区域,如果找错了,模型照样错,而且自己还不知道。
那有没有办法让模型自己“诊断”到底看没看懂,然后自动修正?论文从答案熵 (answer entropy)这个角度切入,找到了一个非常优雅的闭环反馈信号。
灵感源于不确定:答案熵如何揭示模型“看没看懂”
要理解“答案熵”,先想想人类的直觉:如果你对一个问题很确定,你回答时几乎毫不犹豫,只有一种可能性;如果你拿不准,脑子里会有好几个候选答案,每个都想说。这种“不确定的程度”可以用熵 (entropy)来量化——熵越高,越不确定;熵越低,越确定。
论文定义了一个非常巧妙的“答案熵 ”(answer entropy,记作 H ans(x, q)):在模型生成最终答案的那几个token上,计算其下一个token预测分布的熵。直观来说,如果模型正确读到了关键视觉证据,它会在答案token上非常集中(低熵);如果证据模糊或被遮挡,模型就会犹豫(高熵)。
论文通过一个简单的空间敏感性实验验证了这个直觉:把图像分割成多个区域,然后对某个子区域加模糊处理,观察答案熵的变化。结果如图2所示,当关键证据被模糊时,答案熵显著上升;但有趣的是,如果继续模糊到完全看不清,熵反而会降下来——因为模型放弃了证据,转而依赖先验知识或“捷径”回答,变得“自信”但错误。
这个发现引出一个关键问题:答案熵降低就一定意味着模型看对了吗? 不一定!这正是论文的核心洞察之一。
朴素熵最小化的陷阱:为什么“自信”不等于“正确”
假如我们简单地用答案熵作为反馈信号,去优化输入图像(比如让关键区域更清晰),目标是让答案熵降得越低越好。听起来很合理,但论文用图2直观地展示了一个反直觉陷阱 。
图中显示,对同一个区域逐渐增加模糊强度,答案熵会先升高(证据变模糊),然后降低(证据被完全掩盖)。低熵的两种情形:一种是真正的证据清晰,模型正确读出;另一种是模型完全看不见证据,转而用“捷径”回答(比如最常见的数字、常用术语等)。这两种情况虽然熵值一样低,但可靠性天差地别——前者正确,后者错误且充满误导性。
论文把这种依靠先验或捷径的低熵称为“确定性但错误” (confident but wrong)。朴素熵最小化会不加区分地鼓励所有低熵状态,很可能把模型推向捷径,而不是真正依靠证据。这可不行!
为了解决这个二义性,论文提出了一个天才策略:熵塑形 (Entropy Shaping)。核心思想是,不仅要降低答案熵,还要保护那些原本就低熵的“锚点”token(即模型在原始输入上已经很确定的token)。真正的证据增强不会破坏这些锚点;相反,捷径干扰往往会打乱这些锚点。通过约束这些锚点的熵不增加,就能区分有效证据和捷径干扰。
——左侧证据增强方式保留了基线低熵锚点,右侧捷径干扰则破坏了锚点。凭借这个锚点保留机制,SPOT-E可以在不依赖任何标签的情况下,找到真正能帮助模型看清证据的视觉调整方式。
SPOT-E登场:用视觉聚光灯照亮关键证据,GRPO优化精准聚焦
基于熵塑形原则,论文设计了一个完整的测试时优化框架SPOT-E (全称:Test-Time Entropy Shaping with Visual Spotlight for Frozen VLMs,即基于视觉聚光灯的测试时熵塑形)。整体流程如图4所示,核心是三个模块:
1. 视觉聚光灯模块(Visual Spotlight Module) :如图5所示,使用一个轻量级的CLIP模型(加LoRA适配器)接收问题和图像,输出一个与问题相关的软高亮掩码 (soft mask)。这个模块首先在全局视图和多个局部裁剪视图上分别计算文本-图像块相似度,然后通过最大池化融合多视图信息,生成一个覆盖全图的注意力热图,再上采样到原始图像分辨率,得到软掩码。最终对原图进行“背景变暗”操作:将掩码高亮区域保留,其他区域变暗,从而突出关键证据。
2. 熵塑形奖励函数(Entropy-Shaping Reward) :由两部分组成:
- 动态清晰度奖励 (Dynamic Clarity Reward):鼓励模型在最终答案token上的熵降低,但根据基线的熵值动态调整权重——基线不确定时奖励大,基线已经确定时抑制过度探索。
- 锚点保留奖励 (Anchor-Preservation Reward):惩罚在基线低熵锚点token上引起熵增的干预,从而避免捷径干扰。
3. GRPO优化(Group Relative Policy Optimization) :论文采用GRPO (Group Relative Policy Optimization,群组相对策略优化)来优化视觉聚光灯的LoRA参数。GRPO是一种强化学习算法,它从当前策略采样一组候选掩码,计算每个候选的奖励,然后通过组内归一化得到优势值,再更新策略。这样做的好处是无需价值网络,且每实例只需少量采样(论文中通常N=4或8),非常高效。关键设计是每次实例后重置参数 ,避免跨样本的灾难性遗忘。
整个流程的训练和推理一体化:对每个测试样本,SPOT-E进行几步梯度更新(通常5-10步),选出奖励最高的掩码,用该掩码增强后的图像让冻结VLM回答。全程VLM的权重不变,只有视觉聚光灯模块的LoRA参数被临时更新并随后丢弃。这保证了“即插即用”,不改变原有模型。
实验结果:七大基准提升,“冻结模型”也能逆袭
论文在涵盖密集证据任务(TextVQA、DocVQA、ChartQA、MathVista)以及通用视觉任务(MMMU、GQA、MMBench、POPE)的多个基准上进行了全面评估。表1展示了SPOT-E在封闭源和开源模型上的效果:
可以看到,无论是GPT-4o、GPT-4o-mini、Gemini-2.5-Flash这样的商业API,还是Qwen2.5-VL、LLaVA-NeXT等开源模型,SPOT-E都带来了一致且稳定 的性能提升。在密集证据型任务上提升尤为突出:例如在TextVQA上,LLaVA-NeXT-7B提升了6.2个点,GPT-4o-mini提升了3.5个点。在更通用的理解任务上(如MMBench、POPE)也有小幅改善,说明增强证据的同时不会损害模型原本的推理能力。
表2进一步与现有的测试时视觉干预方法(GVPF、SoM、API、ViCrop、WarpA)进行了公平对比:
SPOT-E在所有基准上都优于这些基线,尤其在需要精细视觉证据的任务上优势明显。此外,论文还测试了在视觉损坏(噪声、低分辨率、局部遮挡)下的鲁棒性,SPOT-E持续优于基线,表明其不仅增强关键区域,还提高了模型对视觉质量下降的抵抗能力。
思路启发与现实展望
1. 把“不确定”当成信号,而不是噪声 :以前我们总希望模型越确定越好,但论文发现“确定性”分两种——基于证据的和基于捷径的。通过分析熵的变化,可以区分这两种情况,并设计更精细的优化目标。
2. 测试时自适应可以很巧妙 :不修改模型,只修改输入,再加一个小型优化器,就能显著提升冻结模型的性能。这个方法对实际部署非常友好——不需要重新训练,也不需要访问训练数据。
3. 强化学习可用于非训练场景 :GRPO虽然通常用于训练,但论文将其应用于单实例优化,并配合重置机制,展示了强化学习在推理阶段的新玩法。
未来展望方面,SPOT-E目前需要每个实例进行数步优化,虽然已经很快(论文报告每实例几秒),但可以进一步通过蒸馏或硬件加速来满足实时应用。另外,当前的视觉聚光灯模块依赖CLIP,可能对某些领域不够鲁棒,未来可以探索更灵活的视觉提示机制。
龙迷三问
Q1: 什么叫“答案熵”?能举个简单例子吗? A1: 答案熵就是模型在生成最终答案时,每个token预测分布的不确定性。比如模型要回答“这是猫还是狗”,如果它很清楚是猫,那么生成“猫”这个token的概率接近100%,熵很低;如果它犹豫不决,觉得“猫”和“狗”各50%,熵就高。论文利用最终答案的几个token(比如“42”中的“4”和“2”)的熵来反映模型是否真的看懂了关键证据。
Q2: SPOT-E为什么不直接微调VLM?只在测试时改输入有什么好处? A2: 直接微调VLM需要训练数据、计算资源和时间,而且可能破坏模型原有的泛化能力。SPOT-E只增加了一个轻量级CLIP模块(加LoRA),测试时对每个样本优化几秒钟,VLM本身完全冻结,所以既保持了原有模型的全部能力,又提升了对特定样本的证据利用效率。这对已经部署的模型尤其友好。
Q3: 论文中提到的“低熵锚点”具体指什么?为什么能区分证据和捷径? A3: 低熵锚点是指原始输入下模型已经非常确定的token位置(比如开头几个词、某些常见搭配)。当对图像进行有效证据增强时,这些锚点token的熵保持不变或降低;当模型走捷径时,往往需要改变整个答案结构,从而扰乱这些锚点,使其熵升高。因此通过监控锚点的熵变化,就能区分哪种低熵是“好人”哪种是“坏人”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★★
首次将熵塑形概念用于测试时视觉干预,创新性地利用低熵锚点来区分证据增强和捷径干扰,想法非常巧妙。
实验合理度: ★★★★☆
对比方法包括了常见的GVPF、SoM等,并且涵盖了多种模型族和基准,实验设计全面。但消融实验细节略少,代码开源后可以进一步验证。
学术研究价值: ★★★★★
答案熵作为证据利用的信号、熵塑形原则、测试时闭环自适应,这三个概念都极具启发性,可以为未来VLM的推理增强提供新范式。
稳定性: ★★★☆☆
在视觉损坏下表现稳健,但依赖CLIP模块的质量,且每实例优化步骤需要超参数调优(如GRPO的组大小、学习率),在实际部署中可能存在不稳定性。
适应性以及泛化能力: ★★★★☆
在多个领域(图表、文档、数学、通用)都取得了提升,表现较好。但可能需要针对不同问题类型调整CLIP模型的文本编码方式,完全零适配仍有挑战。
硬件需求及成本: ★★☆☆☆
需要额外运行CLIP和GRPO优化,每实例耗时数秒,对延时敏感的场景成本较高。不过相比重新训练模型已经便宜很多。
复现难度: ★★★☆☆
论文已开源代码(GitHub链接),但CLIP模型和GRPO训练可能对环境要求较高。核心思路清晰,复现应可行。
产品化成熟度: ★★★☆☆
可集成到现有VLM应用(如文档分析、图表问答)中提升准确率,但实时性要求高的场景需优化加速。
可能的问题: 论文的消融实验对锚点数量等超参数不够敏感,且仅在单个数据集上展示了鲁棒性测试。此外,熵塑形奖励中两个部分的权重需要人工设定,可能存在调参难度。总体上瑕不掩瑜,是一篇高质量工作。
主要参考文献
[1] Yin et al. SPOT-E: Test-Time Entropy Shaping with Visual Spotlight for Frozen VLMs. arXiv:2606.19606, 2026.
[2] GVPF: Grounded Visual Prompting Framework for VLM. (详见论文引用)
[3] GRPO: Group Relative Policy Optimization. Shao et al., 2025.
[4] CLIP: Learning Transferable Visual Models From Natural Language Supervision. Radford et al., 2021.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群