← 返回 PaperDaily
视觉与图像
1200个视觉依赖问题拷问四大模型:渲染偏差让3D推理暴跌15%
继6月聊过商汤“思考with images”之后,团队进一步追问:模型画出来的中间状态,到底是真用了还是仅仅装样子?为此他们构造了1200个视觉依赖样本的See2ThinkBench,并设计了可干预的VAoT协议。结果扎心:模型选动作挺准,但渲染忠实度平均只有60%,3D场景下错误反馈能让准确率暴跌15个百分点——画图推理,远没想象中靠谱。
龙哥读论文
阅读 3
查看原文
原论文信息如下:
最近AI圈有个很有趣的现象:很多多模态模型在答题时,会主动“画”出辅助线、高亮区域、甚至生成中间图像,看起来像是在认真思考。但问题是,这些画出来的东西,模型真的用上了吗?还是说,它们只是做了个“视觉装饰”的样子,其实答题主要靠的是纯文本推理?
想象一下:你让一个模型看一张几何图,它说“我要画一条辅助线”,然后真的画出来了,最后给出了正确答案。这看起来完美无缺,对吧?但问题是——如果这条辅助线画得歪歪扭扭,或者画错了位置,模型还能答对吗?如果模型根本没看自己画出来的图,只是凭记忆猜对了答案呢?
这正是香港科技大学、上海人工智能实验室等机构的研究人员所关心的核心问题。他们发现,现有的评估基准要么只关注最终答案的对错,要么只检查中间步骤的“合理性”,但很少真正去诊断:模型选的视觉动作是否相关?渲染出来的中间状态是否忠实?模型后续推理是否真的依赖它?这三个问题,才是判断模型是否“真正思考”的关键。
为此,他们提出了一个名为 See2Think 的统一评估框架,旨在回答一个直击灵魂的问题:多模态模型真的在“看”中间视觉状态来进行推理吗?
新基准See2ThinkBench:1200个视觉依赖问题
要判断模型是否真的用了中间视觉状态,首先得有一个靠谱的测试集。很多现有的多模态推理基准有一个致命缺陷:有些问题,不看图、光看文字描述就能蒙对。这显然无法用来评估视觉推理。为了解决这个问题,See2Think论文构建了一个全新的基准——See2ThinkBench,包含1200个精心筛选、严格确保“不看图就答不出”的视觉依赖问题。
数据构造原则:
这1200个问题覆盖了12个任务类别,并分为三个视觉推理层级:
2D结构化推理:包括几何、空间谜题、物理、化学、科学问答、抽象模式。这类问题通常涉及图表、几何图形、分子结构等,模型需要画辅助线、标记交点、追踪关系。例如,在几何问题中,模型可能需要判断两条线段是否平行,或者在化学问题中识别分子结构中的特定官能团。这些任务对精确的视觉定位要求极高,任何微小的渲染偏差都可能导致推理失败。
3D场景推理:包括对象属性和组合3D。模型需要识别目标对象,推理属性、相对位置、计数和多跳空间关系,有用的视觉操作包括标记对象、隔离区域等。例如,模型可能需要回答“蓝色方块是否在红色球体的左侧?”或者“场景中有多少个绿色的圆柱体?”这类问题不仅需要识别物体,还需要理解三维空间中的相对位置和遮挡关系。
真实世界视觉推理:包括机器人操作、机器人状态变化、视觉常识、直觉物理。这些任务需要语义理解、对象状态跟踪、物理合理性判断。例如,模型可能需要判断“如果松开手,杯子会掉到地上吗?”或者“机器人抓取物体后,物体的位置发生了什么变化?”这类任务更接近实际应用场景,对模型的综合推理能力要求更高。
严格的文本捷径过滤:
为了保证每个问题都是真正的“视觉依赖”问题,论文设计了一个巧妙的过滤流程。首先,用一个强大的多模态模型,在同时看到图片和问题的情况下,生成一个详细的“纯文字描述”(caption),要求只描述视觉证据,不回答问题。然后,把这个文字描述连同问题一起,喂给一个推理模型,看它在不看图的情况下能否答对。如果模型在三次试验中有两次以上答对,就认为这个样本存在文字捷径,被剔除。经过这一道过滤,剩下的样本才是真正的视觉依赖问题。这个流程确保了基准测试的纯净度,避免了模型通过文本线索“作弊”的可能性。
在现有的视觉中间状态推理基准中,See2ThinkBench具备独特的优势。下面的表格对比了它与其他代表性基准的差异:
VAoT协议:让模型“画图”再推理
有了高质量的测试集,还需要一个能“看见”模型内部推理过程的协议。论文提出了Visual Action-of-Thought(VAoT),这是一种可观测、可干预的推理协议。
VAoT的核心思想就是让模型在推理过程中,不仅输出文字思考,还要输出结构化的“视觉动作”,比如高亮某个对象、画一条辅助线、裁剪或放大某个区域等。然后,一个外部的渲染器(renderer)会执行这个动作,生成新的视觉状态,再反馈给模型,供后续推理使用。这种设计使得模型的推理过程变得透明,研究者可以清晰地看到模型每一步的视觉操作和对应的结果。
更重要的是,VAoT设计了四种可控的推理设置,像科学实验一样,通过控制变量来诊断问题:
CoT(标准思维链):模型只做纯文本推理,不能进行任何视觉操作。这是基线,用于衡量模型在没有视觉辅助情况下的表现。
VAoT-NoRender(规划但不渲染):模型可以生成结构化的视觉动作,但这些动作不会被实际执行渲染。这用来测试“规划能力”本身是否有助于推理,即模型是否仅仅通过规划动作就能提升表现。
VAoT(标准闭环渲染):模型生成的视觉动作被渲染器执行,更新后的视觉状态被返回给模型。这是完整的“画图推理”流程,用于评估模型在理想情况下的表现。
VAoT-WrongRender(错误渲染):渲染器执行模型的动作,但返回的视觉效果是故意“篡改”的、与任务相关但错误的状态。这用来探测模型是否真的依赖于视觉反馈,还是说只是“装样子”。如果模型在错误渲染下表现大幅下降,说明它确实依赖视觉反馈;如果表现不变,说明它可能只是走个过场。
四大模型实测:没有万能策略,渲染忠实度是瓶颈
论文在四个有代表性的多模态大规模语言模型上进行了全面测试:GPT-5.5、GPT-o3、Gemini 3.5 Flash、Qwen3-VL-32B-Instruct。这些模型涵盖了当前主流的多模态推理架构,包括闭源和开源模型,具有较好的代表性。
首先,来看看在1200个样本上的整体和分类别准确率。下表展示了关键数据:
核心发现一:没有“万能”策略
不同模型和不同任务,表现最好的推理策略各不相同。GPT-5.5和Qwen3-VL-32B-Instruct在纯文本推理的CoT设置下表现最好,GPT-o3在完整的VAoT闭环渲染下略胜一筹,而Gemini 3.5 Flash则在“只规划,不渲染”的VAoT-NoRender下达到最佳。这说明,中间视觉推理是一种条件性能力,而非普适的“加速器”。对于某些模型和任务,添加视觉操作反而可能引入噪声,降低性能。
核心发现二:渲染忠实度是最大瓶颈
为了找出性能差异的根源,论文对VAoT轨迹进行了过程级诊断,分解为三个维度:
Action Relevance(动作相关性):模型选的视觉操作是否针对了任务相关的视觉证据?例如,在几何问题中,模型是否选择了正确的线段进行高亮?
Render Faithfulness(渲染忠实度):渲染出来的状态是否忠实执行了模型要求?比如,模型说“高亮对象A”,渲染器真的高亮对了对象吗?如果渲染器高亮了错误的物体,或者画线位置偏移,都会导致渲染不忠实。
Feedback Uptake(反馈吸收):模型后续的推理中,是否真的用到了渲染状态里包含的信息?例如,模型是否根据高亮区域调整了后续的推理步骤?
结果令人惊讶:Action Relevance(动作相关性)几乎在所有模型和任务中都接近饱和(0.958-0.994),说明模型很清楚“我应该对哪里做什么”。但是,Render Faithfulness(渲染忠实度)却普遍偏低,平均只有0.594到0.630之间。换句话说,模型的想法很好,但“动手能力”堪忧——它想画一条线,但渲染器可能画歪了;它想高亮一个对象,但渲染器可能搞错了位置。这种“规划与执行之间的鸿沟”是当前视觉推理的主要瓶颈。
发现三:高反馈吸收 ≠ 高准确率
更有趣的是,Qwen3-VL-32B-Instruct在Feedback Uptake(反馈吸收)上得分最高(0.871),但它的最终准确率却是最低的。这说明,模型可能非常依赖视觉反馈,但用的方式却不对——它“看了”但“没看懂”,或者“看懂了”但推理错了。这个发现也印证了论文的一个核心观点:视觉状态的效用(usefulness)和模型对它的行为依赖(behavioral dependence)是两码事。一个模型可能高度依赖视觉反馈,但如果反馈本身质量不高或模型解读错误,反而会拖累性能。
发现四:渲染出错,在2D和3D任务上影响更大
论文还分析了“渲染收益”(Render Benefit,指从VAoT-NoRender错误变为VAoT正确的样本)和“渲染伤害”(Render Harm,指从VAoT-NoRender正确变为VAoT错误的样本)。结果发现,渲染不忠实在2D和3D推理中会造成净负面影响,而在真实世界任务中影响较小。这意味着,对于结构化的、依赖精确视觉信息的问题(比如几何、3D场景),一个“画歪”的辅助线足以毁掉整个推理过程。而在真实世界任务中,模型可能更多地依赖语义理解,对精确视觉定位的敏感度较低。
人工验证与干预实验:行为依赖 vs 真实效用
人工验证过程级评估
自动评估可能存在偏差,所以论文还进行了人工验证。两名标注员从240条VAoT轨迹中,评估动作相关性、渲染忠实度、反馈吸收这三个指标的打分是否合理。结果显示,超过92.9%的评估至少是“部分合理”的,证明自动评估是可靠的。这一步骤增加了实验结论的可信度,避免了自动评估可能带来的系统性偏差。
干预实验:模型真的依赖视觉状态吗?
VAoT-WrongRender设置是关键。如果模型在收到错误渲染后,其最终准确率大幅下降,就说明它确实依赖视觉反馈。实验发现:
在3D场景推理中,当Feedback Uptake评分从0上升到1时,错误渲染导致的准确率下降幅度从3.5%急剧增加到15.5%。这说明,模型对视觉反馈的“依赖程度”与它在VAoT设置下的“反馈吸收”评分高度相关。换句话说,那些看起来“吸收”了视觉反馈的模型,实际上更容易被错误渲染误导。
在2D和真实世界任务中,这种关系较弱或不稳定,说明行为依赖的有效性因环境而异。在2D任务中,模型可能更依赖精确的几何关系,因此对错误渲染更敏感;而在真实世界任务中,模型可能更多地依赖语义线索,对视觉误差的容忍度更高。
但重要的是,即使整体准确率下降不大,错误渲染仍然导致了32.7%到54.2%的样本的答案发生了语义改变。这说明模型的输出确实被视觉反馈影响了,只是有些改变可能是“从错误变成其他错误”或“从正确变成错误”,在净准确率上可能相互抵消。这一发现揭示了净准确率指标的局限性,它可能掩盖了模型对视觉反馈的真实依赖程度。
总结与展望
See2Think这篇论文,更像是给所有热衷于“画图推理”的AI研究者敲了一记警钟。它用一个设计精良的评估体系,有力地证明了:多模态模型的中间视觉推理,目前仍是一个“看起来很聪明”但实际效果参差不齐的能力。
第一,它是对当前视觉推理能力的一次“压力测试”,揭示了“规划”与“执行”之间的巨大鸿沟。未来要提升模型能力,不应该只关注如何生成更复杂的动作,更要提升外部渲染器的精度和模型对视觉反馈的利用能力。
第二,它提供了可复用的评估工具——See2ThinkBench和VAoT协议。任何想开发视觉推理能力的团队,都可以用它来诊断自己的模型到底卡在哪一步:是选不对目标?是渲染不准?还是反馈吸收不足?这种细粒度的诊断能力是现有基准所不具备的。
第三,它提醒我们,在追求视觉推理的“过程”时,不要陷入“过程主义”的陷阱——一个漂亮的可视化过程不等于真正有效的推理。严格来说,现在的模型更像是在“表演思考”,而非真正思考。研究者需要更加关注模型是否真正理解了视觉信息,而不仅仅是生成了看似合理的中间步骤。
当然,这项研究也有一些局限。VAoT协议目前仅支持有限的几种视觉操作(高亮、画线、裁剪等),未来可以扩展到更复杂的操作,比如基于手绘的草图交互、基于物理模拟的交互等。此外,1200个样本虽然覆盖广泛,但每个类别只有100个,对于一些细粒度任务来说代表性可能不足。未来的工作可以进一步扩大基准规模,增加更多样化的任务类别。
展望未来,研究者可能需要沿着两个方向努力:一是提升渲染器的忠实度,开发更精确的视觉执行引擎,确保模型规划的视觉操作能够被准确执行;二是提升模型对视觉信息的“消化吸收”能力,让视觉反馈不是装饰,而是真正的推理燃料。这可能需要对模型架构进行根本性的改进,例如引入更强大的视觉编码器或设计专门的视觉推理模块。
龙迷三问
Q1:这篇论文到底解决了什么问题?AA1:它解决了一个评估层面的根本问题——如何判断多模态模型是否真的使用了它自己生成的中间视觉状态(比如画辅助线、高亮区域)进行推理,而不是仅仅依靠文本推理或“表演性地”使用视觉。它通过构建视觉依赖的测试集和可干预的推理协议,系统性地诊断了动作选择、渲染执行和反馈利用三个环节。这种细粒度的诊断能力是现有基准所不具备的,为未来的视觉推理研究提供了关键的评估工具。
Q2:VAoT中的“错误渲染”是如何实现的?AA2:VAoT-WrongRender设置中的“错误渲染”是故意制造的、看起来自然但实际与任务相关且错误的状态。它不是随机噪声,而是基于任务语义进行的有目的篡改,旨在测试模型是否真的依赖视觉反馈。比如,在3D场景中,如果模型要求高亮“左侧的蓝色物体”,错误渲染可能会高亮一个“右侧的蓝色物体”或“左侧的红色物体”,看起来合理但实质上误导了模型。这种设计确保了错误渲染不会因为过于明显而被模型轻易忽略,从而更准确地测量模型对视觉反馈的依赖程度。
Q3:为什么渲染忠实度那么低却没有导致所有模型性能全面崩溃?AA3:这正是论文的一个有趣发现。虽然渲染忠实度普遍偏低(60%左右),但最终准确率并未全面崩溃,因为模型有多种“后路”:一些模型本来就过于依赖文本推理(如GPT-5.5在CoT下表现最好),视觉反馈的用处本就不大;一些模型虽然“看了”渲染结果,但可能在后续推理中忽略了错误信息(虽然这也不理想)。这再次说明了,视觉状态的效用和模型对它的行为依赖是两件独立的事情。一个模型可能高度依赖视觉反馈,但如果反馈本身质量不高,反而会拖累性能;而另一个模型可能完全不依赖视觉反馈,仅凭文本推理就能达到不错的效果。
龙哥点评
论文创新性分数:★★★★☆
这项工作最大的创新在于提出了“行为依赖 vs 真实效用”这个关键区分,并设计了可干预的实验来检验这一点。在评估方法论上,它是一篇扎实、有洞察力的工作,为未来的视觉推理研究提供了关键的诊断工具。
实验合理度:★★★★★
实验设计非常严谨,四条推理路径的设置像AB测试一样干净。人工验证也做得非常到位,考虑了标注者之间的差异。唯一的“小遗憾”是1200个样本中每个类别只有100个,统计显著性在一些细粒度分析上可能受限。
学术研究价值:★★★★☆
这篇论文更像是一篇优秀的评估和诊断工作,而非提出新模型。但其研究价值很高——它教会了整个领域如何正确地评估视觉推理,这种元研究视角在很多领域都严重不足。
稳定性:★★★☆☆
论文本身不提供模型,只提供评估框架。该框架在不同的模型和任务上表现出稳定的诊断能力,但评估结果(即渲染忠实度低等)可能会随着未来更强大模型的出现而改变。
适应性以及泛化能力:★★★★☆
VAoT协议和See2ThinkBench的构造方法有望被泛化到更多任务类别和模态。只要本质是“依赖视觉进行推理”的任务,都可以用这个框架来诊断。不过,目前只支持有限的几种视觉操作。
硬件需求及成本:★★★★☆
作为评估框架,运行VAoT需要额外的渲染器工作,但整体计算需求远低于模型训练。对于只想评估模型的研究团队来说,成本可接受。
复现难度:★★★★☆
论文提供了代码仓库和详细的数据构造流程,并且开源了基准测试集。虽然复现全部实验需要一定的工作量(尤其是人工验证部分),但核心的See2ThinkBench和VAoT协议应该是可复现的。
产品化成熟度:★★★☆☆
这篇论文本身是研究工具,不是产品。但它的诊断方法可以直接用于AI产品的质量评估环节,帮助产品经理和工程师定位模型的视觉推理短板。接口设计也比较清晰。
可能的问题:论文依赖外部大模型(GPT-5.4)作为过程级评估的自动裁判,虽然进行了人工验证,但仍然存在潜在的偏差。此外,1200个样本对覆盖“所有”视觉推理任务来说仍显不足,部分类别的代表性有待加强。不过,作为学术界第一篇系统诊断该问题的论文,瑕不掩瑜。
主要参考文献
[1] Siyu Yan et al. "See2Think: Do Multimodal Models Really Use Intermediate Visual States?" arXiv:2607.26769v1, 2026.
[2] MIRABench (MIRA) - 视觉推理基准,关注中间可视化对推理的益处。
[3] ViC-Bench - 支持自由形式视觉交错推理的基准。
[4] TwiFF-Bench - 动态未来帧推理基准。
[5] TWI-PRMBench - 视觉推理的过程奖励模型基准。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
想知道你的多模态模型画图推理是真有用还是装样子?加入龙哥读论文粉丝群,一起深扒大模型的“小把戏”!
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 视觉推理+上海+上海AI Lab+龙哥),根据格式备注,可更快被通过且邀请进群。