← 返回 PaperDaily 视觉与图像

视觉重聚焦新招来了:VisRef固定预算反超文本自省

多模态推理最怕“越想越跑偏”,这篇 VisRef 直接把问题说透了:不是单纯让模型多想,而是让它想的时候还记得回头看图。无需再训练,固定预算下还能稳定涨点,工程味很足。

视觉重聚焦新招来了:VisRef固定预算反超文本自省
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
多模态推理最怕“越想越跑偏”,这篇 VisRef 直接把问题说透了:不是单纯让模型多想,而是让它想的时候还记得回头看图。无需再训练,固定预算下还能稳定涨点,工程味很足。


原论文信息如下:
论文标题:
VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models
发表日期:
2026年03月
发表单位:
University of Maryland, College Park; Amazon; Physion Labs
原文链接:
https://arxiv.org/pdf/2603.00207.pdf

视觉推理为何总“跑偏”?

多模态大推理模型最尴尬的地方,不是“不会想”,而是“想着想着把图忘了”。题目明明在问图里那个数、那条线、那个角度,模型却越写越像在背语文阅读理解,最后靠文本先验硬猜。VisRef 这篇论文抓住的就是这个痛点:延长推理链条并不等于更懂图,很多时候反而会让视觉信息被长长的思考过程“冲淡”。
这件事听起来很像人类的反面教材:人类做图形题时会反复看图,模型却常常是一眼看完,后面全靠脑补。论文把这个现象概括得很直接——视觉 token 在越来越长的文本推理里被稀释,注意力逐步滑向文本,最后就容易出现“看图题写成作文题”的经典翻车现场。
封面
图1:传统的“越想越长”会让模型逐渐丢掉视觉 grounding;VisRef 则在推理过程中把相关视觉线索重新塞回去,让模型边想边看图。
论文的核心判断很清楚:问题不在“想得不够多”,而在“想的时候没持续看图”。所以 VisRef 的方向不是再训练一个更会绕弯子的模型,而是训练-free 地在测试时给模型“补眼神”,让它在每一步推理中都能重新对齐图像信息。

VisRef如何“划重点”?

VisRef 的思路可以先用大白话说:模型每想一步,不是只盯着自己刚生成的文字继续往下编,而是把图像里“最该回头看的那部分”重新拿出来,塞回当前推理上下文里。这样做像什么?像做数学题时,写到一半发现自己开始跑偏,于是回头把题目条件再扫一眼,防止把“已知条件”写成“脑补条件”。
这套流程里有两个关键动作。第一步是视觉 token 选择:不是把整张图所有 token 一股脑重塞进去,而是挑出一小撮和当前推理最相关、同时又不重复的 token。第二步是自适应停止:当模型对答案已经足够自信时,就及时停下,别继续“越想越玄学”。
图2:VisRef整体框架
图2:VisRef 的整体框架。模型在每一步推理时,把视觉 token 投影到当前文本推理子空间中,再用基于确定性点过程的准则选出一小部分“既相关又不重复”的视觉 token 重新注入;同时用答案分布熵作为停止条件,避免无休止思考。
这里有个很重要的工程味细节:VisRef 不改模型参数,不做额外训练。它不是把模型重新拉去上岗培训,而是像给现成模型加了一个“推理时的回头看机制”。这点很实用,因为多模态大模型已经很贵了,再来一轮强化学习微调,很多团队钱包和算力都会先投降。
论文里还把这个过程写成了一个迭代算法:先生成当前思考步骤,再选视觉 token,再更新轨迹,再检查是否可以停。说人话就是:想一步、看一眼、再想一步、再看一眼。这比一口气埋头写到最后,通常更不容易跑偏。

DPP:平衡“相关”与“多样”的艺术

VisRef 选 token 的核心工具叫 DPP。DPP 是 Determinantal Point Process,中文一般译作确定性点过程。这个名字听起来像统计学论文的“高冷术语”,其实它干的事情很朴素:在一堆候选里,选出一组既彼此不太像、又都挺有代表性的元素。
放到图像推理里,DPP 的意义就更直白了。模型不是只要“最像当前问题”的几个视觉 token,也不是只要“覆盖最广”的几个 token,而是要同时满足两件事:和当前思考有关,并且彼此别太重复。因为如果全选那些长得一模一样的区域,信息密度其实很低;如果只追求多样性,又可能把真正关键的局部细节漏掉。
论文把这个想法落成了一个“行列式最大化”的打分。别被“行列式”三个字吓到,直觉上可以理解成:一组 token 的整体体积越大,说明它们越有信息量,且越不互相抄作业。相关性体现在对当前文本推理状态的对齐,多样性体现在 token 之间不要太像。两者一起上,才像一支靠谱的“视觉重点小组”。
图5:注意力可视化
图5:注意力可视化。随着推理推进,VisRef 会把注意力逐步拉回任务真正相关的区域,最开始乱糟糟的关注点,最后会收敛到关键物体或关键局部上。
这里的关键不是“选得少”,而是“选得准”。VisRef 不是在压缩视觉信息,而是在做面向当前推理状态的视觉重聚焦。这就解释了为什么它能在固定预算下还更准:同样的 token 预算,别人拿去堆重复信息,VisRef 拿去补关键证据,结果自然不一样。

准确率暴增6.4%:实验效果一览

实验部分最值得看的,不是某一个单点涨分,而是它的整体趋势:在不同模型、不同数据集、不同预算下,VisRef 都能比较稳定地赢。这类结果比“只在某个设置下偶然爆一下”更像能落地的方法。
表1:三大视觉推理基准上的结果
表1:在 MathVision、MathVista、MM-Star 三个视觉推理基准上的结果。对比标准思考(ST)和文本自省式推理(TSR),VisRef 在三种模型上都取得了更高准确率,最大提升达到 6.4%。
先看最有代表性的结论:文本自省式推理 TSR 不是没用,但提升很不稳定,有些任务涨一点,有些任务几乎不动,甚至还能倒退。这个现象其实很符合直觉——如果推理链条越拉越长,但视觉 grounding 没跟上,那多想几步也只是把偏差写得更工整而已。
VisRef 的优势则更像“补上了缺失的半边脑子”。以 InternVL-3.5-8B 为例,在 MathVision、MathVista、MM-Star 上分别比标准思考提升 5.4、11.2、5.9 个百分点;对 SAIL-VL2-8B,MathVision 上能到 7.5 个百分点的提升。这个量级已经不是“调参抠一点点分”,而是说明方法确实抓到了多模态推理的主要矛盾。
图3:固定预算下的测试时扩展
图3:在固定 token 预算下,VisRef 通过生成多条并行的视觉整合推理链,始终比纯文本并行思考更稳。也就是说,同样花钱,别人把算力花在“多想几遍”,VisRef 把算力花在“多想几遍还记得看图”。
更妙的是,它还不是只在单次推理里有用。论文把测试时扩展也一起做了:在固定预算下生成多条并行推理链,再做多数投票。结果显示,VisRef 在任何给定预算下都能比纯文本并行思考更好。这说明它不是单纯“把答案变聪明”,而是在提高每一单位计算预算的有效利用率
表2:与训练式方法对比
表2:与训练式方法 Look-Back 的对比。Look-Back 需要额外强化学习训练,VisRef 则完全不训练就能接近它的表现;两者叠加后效果最好,说明二者是互补关系,不是互相打架。
这一点非常有工程价值。训练式方法往往意味着数据构建、RL 过程、算力成本、模型改动和复现门槛;VisRef 走的是“插件式增强”路线,能直接挂到现成多模态大模型上。对于真正要上线的团队来说,这种方法往往比论文里那种“再训练一个更大模型”更像正经生意。
图4:超参数消融
图4:超参数消融。熵阈值 δentropy 主要控制什么时候停,token 预算 m 主要控制每一步选多少视觉 token。结果显示,30% 左右的 token 预算和 0.25 的熵阈值,能在准确率和效率之间取得比较稳的平衡。
从实验设计看,这组消融是合理的:一方面验证了“选多少 token”不是越多越好,另一方面也说明“停得太早”或“想得太久”都会出问题。换句话说,VisRef 不是在鼓吹无脑加算力,而是在强调算力要花在刀刃上
表3:相关性与多样性的消融
表3:相关性与多样性的消融。只保留相关性会明显掉点,只保留多样性也不够,二者一起用才最好。这基本坐实了论文的核心直觉:视觉重聚焦不是“找最像的”,也不是“找最散的”,而是“找最有信息密度的一组”
论文还给了注意力可视化和额外数据集上的结果,整体趋势都一致:注意力会从一开始的“东张西望”逐渐收敛到真正关键的区域。这种可解释性很加分,因为它至少说明方法不是在偷偷摸摸“调幸运值”,而是真的改变了模型看图的方式。
表4:额外基准上的结果
表4:在额外视觉推理基准上的结果。VisRef 在更多场景里依然保持优势,说明它不是只对某一类题型有效,而是对“视觉依赖型推理”这个更大的问题有普适意义。

无需训练,即插即用:优缺点分析

VisRef 最讨人喜欢的地方,是它很务实。它没有去挑战“把多模态大模型重新训练一遍”这种高成本路线,而是直接在测试时做视觉重聚焦。对于现有模型生态来说,这种方法的最大好处就是兼容性强、部署门槛低、改动小。如果一个方法不能轻松挂到现成模型上,论文里再漂亮,工程上也容易变成摆设。
但它也不是没有代价。首先,VisRef 需要在推理过程中反复做 token 选择和重新注入,虽然比全量重塞省很多,但毕竟还是增加了额外推理复杂度。其次,它依赖一个合理的 token 选择策略和停止阈值,参数设不好,可能出现“看得太少”或“想得太久”的两头都不讨好。再者,它的收益主要集中在视觉依赖较强的任务上,对纯语言推理任务未必同样有戏。
所以更准确地说,VisRef 不是“万能增强器”,而是一个面向视觉推理的低成本补丁。它把多模态大模型最常见的毛病——越思考越忘图——用一个很轻的方式修掉了。这个方向非常值得肯定,因为它解决的不是学术上好看的小问题,而是实际系统里真会撞上的问题。
看到这里,最合理的表情大概就是:模型原本已经开始认真思考了,结果思考着思考着把图给忘了。VisRef 的作用,就是把它从“纯脑补模式”里拽回来。

未来展望:从“看”到“思”的完美闭环

VisRef 其实给多模态推理指了一条挺朴素但很关键的路:不要把“看图”和“思考”割裂开。真正可靠的视觉推理,不是先看完图就把图忘掉,而是推理过程中持续回看、持续校准、持续纠错。这个闭环一旦建立起来,多模态模型才更像在“理解图”,而不是在“背图”。
未来可以继续往几个方向走。一个方向是把 token 选择做得更细,比如结合任务类型、图像结构或局部区域的重要性,进一步提升重聚焦的精度。另一个方向是把停止机制做得更智能,不只是看熵,还可以结合答案稳定性、视觉证据一致性等信号。再往前一步,甚至可以把这种“边想边看”的机制扩展到视频、3D 场景或机器人感知里,那就不只是论文里的小聪明,而是真正的系统能力了。
不过也要冷静一点。VisRef 证明的是“测试时视觉重聚焦有用”,不是“所有多模态问题都靠重聚焦就能解决”。如果模型底座本身视觉编码能力弱、题目本身需要更强的工具调用,或者数据分布偏得离谱,那这套方法也只能锦上添花,不能包治百病。论文最有价值的地方,恰恰在于它没有夸大自己,而是把一个真实瓶颈讲明白了。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?解决的是多模态大推理在长链条思考时“越想越不看图”的问题。VisRef 通过在推理过程中重新注入相关视觉 token,让模型在思考时持续保有视觉 grounding,而不是只靠文本先验瞎猜。

DPP 是什么,为什么它适合选视觉 token?DPP 是 Determinantal Point Process,中文叫确定性点过程。它的特点是既能鼓励“相关”,又能鼓励“多样”,很适合从一堆图像 token 里挑出既关键又不重复的一小组,避免全选重复区域造成信息浪费。

它为什么能在固定预算下更准?因为同样的推理预算,VisRef 把更多计算花在“有用的视觉证据”上,而不是无效的长文本自嗨。它不是单纯增加思考长度,而是提高了每一步思考和图像之间的对齐质量。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是凭空造一个新模型,而是把测试时扩展和视觉重聚焦拼成了一个更合理的闭环。创新点不算“炸裂”,但切中要害。

实验合理度:★★★★☆ 选择了三个视觉推理基准、多个模型和训练式对比,还做了消融,整体比较完整。唯一要注意的是,收益主要集中在视觉依赖任务上。

学术研究价值:★★★★☆ 这篇工作把“视觉 grounding 在长推理中会衰减”这件事讲得很清楚,也给出了一个训练-free 的解决方向,研究意义是实打实的。

稳定性:★★★☆☆ 方法比 RL 微调稳,但仍依赖 token 选择和停止阈值,参数没调好就可能变成“想太多”或“看太少”。

适应性以及泛化能力:★★★★☆ 在多个模型和多个数据集上都有效,说明不是单点技巧。但它更适合视觉依赖型推理,不是全场景通吃。

硬件需求及成本:★★★★☆ 相比训练式方法省很多,属于测试时增加一点推理开销换来更高准确率,工程上较友好。

复现难度:★★★☆☆ 思路不复杂,但要复现出稳定收益,得处理好模型接口、token 预算和阈值设置,没那么“点一下就跑”。

产品化成熟度:★★★★☆ 很适合挂到现成多模态推理系统上做增强,尤其是图表理解、数学题、视觉问答这类场景。

可能的问题:方法主要修复“看图不够”而非底座能力不足,若模型视觉编码本身弱或任务需要工具调用,收益可能有限。


主要参考文献

[1] Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang. VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models. arXiv:2603.00207, 2026.
[2] Muennighoff et al. Budget forcing: test-time scaling for reasoning models. 2024.
[3] DeepSeek-R1. Reinforcement learning for reasoning models. 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
想和同好一起追更多模态推理、视觉重聚焦、测试时缩放这类前沿论文,来群里边读边聊,少走弯路,少踩坑。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。