← 返回 PaperDaily 视觉与图像

84.1%登顶!小VLM测试时缩放,解析格式比束搜索更关键

这篇论文最有意思的地方,不是又堆了多少花活,而是把小型视觉语言模型的“考试成绩”拆成了两件事:先能不能把答案写出来,再谈会不会想。结果很不客气——很多提升其实来自解析格式和 token 预算,不是复杂搜索。

84.1%登顶!小VLM测试时缩放,解析格式比束搜索更关键
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
这篇论文最有意思的地方,不是又堆了多少花活,而是把小型视觉语言模型的“考试成绩”拆成了两件事:先能不能把答案写出来,再谈会不会想。结果很不客气——很多提升其实来自解析格式和 token 预算,不是复杂搜索。


原论文信息如下:
论文标题:
Nika at ImageCLEF 2026 Task on Multimodal Reasoning: More Tokens, Fewer Trees — Test-Time Scaling for Small VLMs on Multilingual Visual MCQ
发表日期:
2026年07月
发表单位:
University of Amsterdam
原文链接:
https://arxiv.org/pdf/2607.09438v1.pdf

测试时缩放(TTS)的胜负手:解析器格式与解码预算

这篇论文最“打脸”的地方在于:小型视觉语言模型做多模态推理,真正先决定胜负的,往往不是“想得多深”,而是“答案能不能被顺利写出来”。很多人一谈测试时缩放(Test-Time Scaling, TTS),脑子里就自动浮现复杂搜索、奖励模型、束搜索这些高配操作,但本论文先把一个很朴素的问题摆到台面上——链条再会想,如果最后没吐出答案字母,前面全白搭。
封面
图1:论文封面图对应的核心结果图,左边看的是“每题给多少计算”,右边看的是“温度怎么选”。它传达的意思很直接:在小型 VLM 上,算力花在把链条写完整,比花在堆花哨搜索更值钱。
这里的 TTS,可以简单理解成“考试时临场加算力”。不是训练更大模型,而是在推理时多采样几条思路、给每条思路更多生成空间、再想办法选出最靠谱的答案。论文里重点比较了三类东西:自一致性(Self-Consistency,简称 SC,中文可理解为“多链投票”)、先描述再推理的结构化搜索,以及两个后验选择器。结果很不客气:很多提升不是来自搜索本身,而是来自解析器格式解码预算
论文使用的任务是 EXAMS-V 多语言视觉选择题数据集,题目来自 13 种语言、20 个学科,题干还常常是“文字嵌在图片里”的那种考试卷样式。对模型来说,这类题目最烦的不是看图,而是看懂后还要按格式交卷。早期提示词格式会让一部分链条明明推对了,却没写出 A/B/C/D/E,导致结果看上去像“思考失败”,实际是“交卷失败”。论文把这个问题修掉以后,很多表面上的方法增益就露出了真身。

方法概述

本论文的主线其实很清楚:先把小型 VLM 的推理过程拆成“生成候选答案”和“从候选里挑答案”两层,再分别测试这两层到底谁更关键。为了避免“模型没想好”与“答案没写出来”混在一起,作者专门引入了guided repair,也就是当所有链条都没吐出答案字母时,强制补一个答案提示,再让模型只解一个字母。这个设计很土,但很有效,属于典型的工程上头、论文里却很难绕开的那种改法。
表1 实验配置总览
表1:实验配置总览。这里把不同策略分成了零样本、链式思考、自一致性、结构化搜索和后验选择器几类,并明确了每种配置的调用次数、采样方式和适用范围。读这张表最重要的是先建立直觉:这不是单一模型的“玄学调参”,而是一组围绕推理预算展开的系统比较。
论文里两个政策模型分别是 Qwen2.5-VL-7B-Instruct 和 Qwen3.5-4B。前者用于基线和消融,后者是更小但更新的模型,也是最终头牌配置。这里要注意一个容易被忽略的点:虽然 Qwen3.5-4B 参数更小,但它并不天然吃亏,反而在更合理的推理预算下明显更强。也就是说,模型大小不是唯一变量,推理时怎么花算力同样决定成绩单。

核心设计

如果把论文方法翻成人话,大致就是三步:先让模型看图并生成若干条解释;再让这些解释各自走到答案;最后用投票或选择器决定最终选项。看起来像常规的多链推理,但真正的创新点不在“多链”两个字,而在于作者把链条失败拆成了两种:一种是内容上没推对,另一种是格式上没写完。前者是模型能力问题,后者更像工程问题。论文的结论很直接:在这个任务和预算下,后者的影响被严重低估了。
所谓 describe-then-reason,可以理解成先让模型“复述题目并提炼视觉信息”,再把图像拿掉,仅基于描述继续推理。这样做的动机是把视觉理解和逻辑推理拆开,方便后续搜索和验证。论文进一步尝试了 PRM 引导的束搜索。这里的 PRM 是 Process Reward Model,中文叫过程奖励模型,它不是只给最终答案打分,而是给推理步骤打分,判断某一步像不像“正确推理”。
问题在于,PRM 在数学题上好用,不代表在多语言视觉选择题上也好用。论文把这个问题拆得很细:描述阶段的 PRM 分数已经很高,说明它在前半段就开始“太自信”;进入推理阶段后,分数仍然偏高,说明搜索空间被过早压扁,最后束搜索看似很努力,实际上是在一条越来越窄的路上原地打转。于是就出现了很尴尬的局面:搜索做得越复杂,答案多样性越低,最后还不如平铺直采样。
表3 双轴缩放结果
表3:双轴缩放结果。这里把“每条链能生成多少 token”和“采样多少条链”分开看,结论非常清晰:先把每条链写完整,比盲目加链数更有效。对于小模型来说,这种分解很重要,因为很多失败根本不是推理失败,而是生成被截断了。
论文还设计了三个后验选择器:一个是生成式 critic,一个是判别式 PRM,一个是多数投票。生成式 critic 的思路很像“让模型自己给自己打分”,判别式 PRM 则是单独训练一个评分器来挑答案。为了避免高置信多数直接被重算,作者还用了 skip-on-high 规则:如果某个答案已经很一致,就不折腾它了,只对低一致或无法解析的样本重评分。这种设计很朴素,但非常符合工程现实——算力不是拿来给每个样本都做豪华套餐的。

复杂搜索不如扁平采样:PRM束搜索为何“水土不服”?

这部分是论文最有“反常识味道”的地方。很多人默认:既然有了过程奖励模型,那就应该用它来引导搜索,毕竟“边想边筛”听起来比“傻乎乎多采样”高级。可惜论文结果告诉大家,至少在这个任务上,复杂搜索并没有赢,反而输了。
表11 结构化搜索与自一致性对比
表11:在 dev-200 上,结构化搜索与自一致性的对比。这里的结论很克制,但也很扎心:即便给了 PRM 引导的束搜索更高的计算成本,它也没有稳定压过平铺的自一致性。换句话说,在这个问题上,复杂搜索没有把信息“找回来”,反而把多样性“压没了”。
原因也不玄。第一,describe-then-reason 的前半段已经丢掉了一部分视觉细节,后半段即使有图像可参考,仍然很难补救前面丢失的信息。第二,PRM 的分数在很多步骤上过于饱和,导致不同分支被筛成了“差不多的答案”。搜索一旦不再分叉,就失去了本来该有的价值。第三,论文统计还发现,PRM 束搜索在高置信样本上甚至会回退,说明它并不是“稳健增强器”,更像“有时帮忙、有时添乱”的工具。
这其实很像现实里常见的一个坑:系统越复杂,越容易把问题从“模型不会”变成“系统互相打架”。PRM 本来是为了纠错,结果在小模型和多语言视觉场景下,纠错信号不够尖锐,搜索就变成了形式主义。论文没有把它吹成万能药,这点很加分。

Token预算比链数更重要:小模型如何花对“算力”?

如果说上一部分讲的是“别把搜索想得太神”,这一部分讲的就是“先把链条写完再说”。论文把推理预算拆成两个维度:一是每条链最多能生成多少 token,二是一次采样多少条链。结果非常明确:token 预算的提升远比链数提升更有效。这不是小修小补,而是直接改写了大家对 TTS 的默认想象。
图1 计算预算与准确率关系
图1:左图展示了准确率随每题调用次数变化的趋势,右图展示了不同温度下的表现。最关键的信息是:在固定采样次数下,把每条链从 1k token 提到 2k token,收益明显;而把链数从 8 提到 16,收益几乎可以忽略。也就是说,很多时候不是“再来一条”,而是“先把这一条说完”。
这背后的原因也不难理解。小模型在长题上经常不是不会推,而是推到一半被截断了,最后没有机会输出答案字母。于是统计上看起来像“模型做错了”,实际上只是“模型没来得及交卷”。论文把这种问题叫作 parse failure,中文可以理解成“解析失败”或者“答案格式没解析出来”。这类失败一旦被修掉,准确率就能回升一截,说明很多所谓的“推理提升”,本质上只是把原本被截断的正确链条放出来了。
表2 TTS 进展与解析失败
表2:全验证集上的 TTS 进展。这里能看到一个很典型的现象:Qwen3.5-4B 在零样本、链式思考、自一致性之间一路上涨,但真正的大头来自把每条链的 token 预算从 1k 拉到 2k。链数翻倍只增加了极小收益,说明在这个场景下,宽度不如深度,或者更准确地说,不是“多想几次”更重要,而是“让一次想法完整落地”更重要。
论文还做了温度扫描,发现 0.7 左右是比较稳的点。这个结论不算惊天动地,但至少说明作者没有只盯着一个参数死磕,而是把采样多样性和稳定性一起考虑了。对工程实践来说,这比“某个神奇超参”更有参考价值,因为真实部署里最怕的就是一顿参数玄学,最后换个题型就失效。

生成式与判别式选择器双双失效:多数投票为何屹立不倒?

很多人会自然地想:既然多条链已经采样出来了,那再加一个更聪明的选择器,不就能把多数投票干掉了吗?论文专门验证了这件事,结果很干脆:生成式 critic 和判别式 PRM 都没有稳定超过多数投票。这和直觉有点反着来,但逻辑是通的。
表4 选择器结果
表4:在全验证集上比较两类后验选择器。生成式 critic 的作用几乎是零,判别式 PRM 也只是轻微波动,没有形成稳定优势。这个结果说明,在当前设置下,候选答案池本身已经足够强,后验选择器并没有拿到足够清晰的“纠错信号”。
生成式 critic 失败的原因,论文给了一个很有意思的解释:它对自己生成的答案有偏好,分数分布极其集中,像是在给大家发“差不多都行”的分。判别式 PRM 虽然更像正规军,但它对正确与错误候选的分数差距也不大,最终还是没法稳定压过多数投票。换句话说,选择器不是没有上场,而是上场后没拿出决定性证据。
表6 生成式 critic 分数分布
表6:生成式 critic 的分数分布非常集中,最常见的分数是 0.75。这个现象很说明问题:如果一个评分器对大量候选都打出差不多的分,那它就很难真的区分谁对谁错。评分器一旦“太温柔”,就会变成装饰品。
多数投票之所以还能站住,核心原因也不神秘:在这类多语言视觉选择题里,只要采样链条之间还有一定独立性,投票就能把一部分随机错误抹掉。相反,一旦错误高度相关,投票也救不了。这也是为什么论文后面会强调不同语言、不同学科的差异:有些题目链条之间更容易分歧,有些题目则会一起犯同样的错。

最佳配置与关键洞察

论文最后给出的最佳配置是 Qwen3.5-4B,采样 16 条链,每条链 2048 token,再加上 guided repair。这个配置在 ImageCLEF 2026 的测试集上拿到 84.1%,并且在官方榜单上排第一。这里最值得记住的不是“第一名”三个字,而是它背后的方法论:先保证链条能完整生成,再谈采样和选择
表12 官方测试榜单
表12:官方测试榜单。作者提交的方案在总分和各语言上都排第一,说明论文的结论不是只在验证集上“讲得通”,而是真的在官方测试上兑现了。对一篇竞赛型论文来说,这一点很关键,因为很多方法在本地验证集上看着花里胡哨,到了榜单就开始露馅。
论文还做了按语言和学科的切分分析,发现预算增加对英语和中文最明显,某些中等难度语言更受益于自一致性,而少数文本密集型学科仍然偏弱。这说明 TTS 的收益并不是平均撒在所有样本上,而是集中在“模型原本会,但容易半路翻车”的区域。这个结论很实用,因为它提醒后续工作不要盲目追求全局平均分,而要看方法到底在什么样的样本上真正起作用。
如果把这篇工作浓缩成一句话,那就是:小型 VLM 的测试时缩放,先别急着上复杂搜索,先把格式、预算和政策模型调顺。这句话不够炫,但非常接近工程真相。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?它研究的是小型视觉语言模型在多语言视觉选择题上的测试时缩放到底该怎么做。结论不是“搜索越复杂越好”,而是先解决解析失败、再增加每条链的 token 预算,最后才轮到链数和选择器。

PRM 和多数投票分别是什么意思?PRM 是 Process Reward Model,中文叫过程奖励模型,用来给推理步骤打分;多数投票就是把多条链里最常出现的答案当最终答案。论文发现,在这个任务上,PRM 没有稳定赢过多数投票,因为它的分数区分度不够强。

guided repair 为什么这么重要?因为有些链条不是不会答,而是答到一半没写出选项字母。guided repair 的作用就是强制补上答案格式,让这些“其实已经想对了”的链条不再白白丢分。这个修复很朴素,但对结果影响很大。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

创新点不在于提出了一个全新的推理范式,而在于把小型 VLM 的 TTS 问题拆得很细,尤其是把解析失败和真正的推理失败分开看,这点很实在。

实验合理度:★★★★☆

对比项比较完整,既有不同政策模型,也有搜索、选择器和预算轴的消融;而且把 dev-200 和 full validation 区分开,避免了过度解读小样本。

学术研究价值:★★★★☆

价值在于给多模态 TTS 提供了一个更接近真实部署的判断:不是所有“更复杂的推理”都更好,工程细节和可解析性可能才是关键变量。

稳定性:★★★☆☆

在该任务和该模型家族上表现稳定,但结论明显依赖提示格式、解析规则和预算设置,换任务未必还能复现同样的收益曲线。

适应性以及泛化能力:★★★☆☆

对多语言视觉选择题有参考价值,但对开放式生成、长链复杂推理或其他 VLM 家族,未必能直接照搬。

硬件需求及成本:★★★☆☆

单卡 A100-40GB 可跑,但要做多链采样、PRM 评分和修复流程,推理成本并不低;好在论文证明了“加 token”比“加搜索”更划算。

复现难度:★★★☆☆

方法本身不算难,但要复现出论文里的结论,需要严格控制解析格式、预算和评测细节,不然很容易把工程噪声当成算法收益。

产品化成熟度:★★★☆☆

适合做多模态问答或考试辅助类系统的推理增强模块,但前提是输入输出格式可控、答案空间有限,否则解析失败会先把产品体验拖下水。

可能的问题:论文结论强依赖特定模型家族和选择题任务,且对 PRM 的负面结果主要说明当前配置不够强,不代表所有多模态 PRM 都没用。


主要参考文献

[1] Das et al. Exams-V: A multi-discipline multilingual multimodal exam benchmark for evaluating vision language models, 2024.
[4] Wang et al. Self-consistency improves chain of thought reasoning in language models, 2023.
[5] Lightman et al. Let’s verify step by step, 2023.
[6] Snell et al. Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024.
[12] Ong et al. Training vision-language process reward models for test-time scaling in multimodal reasoning: Key insights and lessons learned, 2025.
[14] Zhao et al. GenPRM: Scaling test-time compute of process reward models via generative reasoning, 2025.
[15] Zhang et al. GM-PRM: A generative multimodal process reward model for multimodal mathematical reasoning, 2025.
[26] Hu et al. PRM-BAS: Process reward model guided beam annealing search, 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
小模型想少走弯路,论文想少看废话,来群里直接拆重点。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。