← 返回 PaperDaily 视觉与图像

告别千篇一律,VLM自进化提问框架让问题又难又多样

一般的VLM只会当“答题机器”,这篇来自马里兰大学、UCLA和MBZUAI的工作,却让模型学会了“问问题”,而且问得越来越好。无需人工标注,模型自己就能在问答之间形成“进化闭环”,看到QG分数飙升82%,龙哥直呼过瘾。

告别千篇一律,VLM自进化提问框架让问题又难又多样
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
一般的VLM只会当“答题机器”,这篇来自马里兰大学、UCLA和MBZUAI的工作,却让模型学会了“问问题”,而且问得越来越好。无需人工标注,模型自己就能在问答之间形成“进化闭环”,看到QG分数飙升82%,龙哥直呼过瘾。


原论文信息如下:
论文标题:
Self-Evolving Visual Questioner
发表日期:
2026年06月
发表单位:
University of Maryland, College Park; University of California, Los Angeles; Peking University; MBZUAI
原文链接:
https://arxiv.org/pdf/2606.13929v1.pdf

让模型学会提问:从回答者到提问者的跨越

你见过只会在考试里答题、却从来不会主动提问的学生吗?今天的视觉语言模型(VLM, Vision-Language Model)大部分就是这样——人类给一张图、一个问题,它们能答出个一二三;但要是让它们自己看图提个有深度的问题,就瞬间哑火,只能吐出“这是什么颜色”这种幼儿园级别的问题。🤚马里兰大学、UCLA、北京大学和MBZUAI联合发表的这篇论文 Self-Evolving Visual Questioner,直接打破了这个僵局:它让 VLM 自己学会了问问题,而且是越问越难、越问越刁钻,完全不需要人类标注,也不需要老师模型。
表情
传统的视觉问题生成(VQG, Visual Question Generation)方法严重依赖静态数据集——人类标注什么,模型就学什么,生搬硬套的结果是问题千篇一律,集中在“物体颜色”“场景类别”这种表层识别上。这篇论文提出了一个自进化框架:模型先自己提问题,再自己改写、自己筛选,挑出那些更难、更依赖视觉证据的问题来训练自己,然后拿训练后的模型再去提更好的问题,形成一个闭环。两个迭代轮次后,模型的问题生成质量(QG 分数)平均提升了 约 82%,而且回答问题的能力不仅没下降,反而还略有上升。

自我进化训练框架:一个从模型自身生成数据中学习的问题生成闭环

整个框架由两个核心阶段构成:自监督数据构建双格式模型训练。下面这张图清晰地展示了完整流程:
图1:自进化视觉提问器框架概览
图1:自进化视觉提问器框架概览。给定无标签图像集和视觉意图提示,当前模型 Mt 首先提出候选问题。然后,稳定的基础模型 M0 对这些候选进行改写和筛选,构建出具有更好可答性、感知难度和推理难度的自监督数据 D(t)。精炼后的监督数据用于双格式训练(QG 格式和 QA 格式),得到更新后的模型 Mt+1。更新后的模型作为下一轮的提问器,形成迭代自改进循环。

第一步:问题提案

对于每张无标签图像,当前模型 Mt(可以是初始模型 M0,也可以是上一轮进化后的模型)先提出一批候选问题。为了让问题覆盖更广,论文设计了多种视觉意图提示,比如直接识别、比较、空间关系、场景理解、推理等。这样模型就不会总是掉进“问颜色、问物体”这种浅层模板里。每个问题提出后,同一个模型也会给出对应的答案,形成初始的 (图像, 问题, 答案) 三元组。

第二步:问题改写

初始模型 M0(未经过任何进化训练的原始模型)。为什么?因为如果让同一个进化后的模型自己去改写,提案和改写会朝着同一个分布收缩,多样性就丢了。而 M0 作为一个“不同视角”的固定转换器,能对 Mt 的提案引入新的变化,从而产生更丰富、更硬的候选问题。
改写指令 r 可以指定不同的困难方向,比如“增加视觉搜索难度”“增加证据覆盖广度”“增加上下文推理”或“增加空间推理”。这样原本简单的问题“这只猫是什么颜色?”可能被改写成“在画面左侧阴影中,除了那只黑猫,还有几种不同颜色的物体?”——一下子就需要更细致的视觉扫描和推理。

第三步:问题筛选

直接使用改写后的所有问题并不明智——有些可能变得模糊、不可答、或者反而变简单了。因此,还需要一个筛选步骤:对于每个改写后的候选,模型(用 M0)判断它是否比原始提案更具挑战性且仍可回答。只有那些视觉上可答、并且在感知或推理难度上确实有提升的才会被保留。筛选 prompt 的具体内容如下图所示:
图6:(第二部分)筛选提示,用于决定改写后的问题是否应保留在自进化视觉提问器框架中
图6:筛选提示。用于判断改写后的问题是否应保留在自进化视觉提问器框架中。评估指标包括可答性、视觉奠基、感知难度和推理难度。

第四步:双格式训练与迭代循环

保留的优质 (图像, 问题, 答案) 三元组被用于训练模型,训练采用两种格式混合:QG 格式(输入只有图像,要求输出问题和答案)专门强化提问能力;QA 格式(输入图像和问题,要求输出答案)则巩固回答能力,防止模型因为只学提问而丢掉答题基本功。实验证明,双格式训练比只用 QG 或只用 QA 都好:QG 能让提问更强,但可能损失答题性能;加上 QA 后,答题性能也保住了,甚至还有提升。
训练更新后的模型 Mt+1 被作为下一轮的提案器,对同一批无标签图像再次提出新的候选问题,然后重复改写、筛选、训练——这就形成了真正的自进化闭环。论文在前两轮上进行了实验(第一轮用 M0 提案→训练→M1;第二轮用 M1 提案→训练→M2),效果持续改善。

多维度的提问能力评估:不只关注回答,更要看问题质量

过去评估 VLM 的提问能力,往往只看生成的句子是否通顺——但句子通顺不等于问题好。一个很棒的问题可能是“图像中有几只动物?”——但这句话对任何有动物的图都能问,根本不靠谱。因此,论文提出了一个全新的代理评估协议,从两个层面、五个维度来打分:
个体问题层面(4 个维度):
- 视觉搜索难度(Search):要回答问题,需要定位到多难找的视觉证据?线索是显眼的还是隐藏的?
- 视觉证据覆盖(Coverage):问题依赖的视觉信息散布在图像多广的区域?局部还是全局?
- 视觉上下文推理(Context):问题需要多少从可见线索中推测上下文信息?比如从人物的穿着推测天气。
- 视觉空间推理(Spatial):问题涉及元素之间的空间关系推理吗?比如前后、左右、相对大小等。
问题集层面(1 个维度):
- 提问多样性(Diversity):对同一张图生成的多个问题之间是否有冗余?如果都是不同问法的“这是什么颜色”,那多样性就低。论文采用句子嵌入模型计算语义距离来度量。
所有维度的评分由 GPT-5.4 作为评委给出(基于图像和问题的条件),每个维度 0-5 分,归一化到 [0,1]。这个评估协议比单一的自责报告或人类主观判断更细粒度、更客观。下面这个表格总结了各维度的评估标准:
表6:视觉提问能力评估维度总结
表6:视觉提问能力评估维度总结。包含感知难度(视觉搜索、证据覆盖)和推理难度(上下文推理、空间推理)以及问题集多样性。

实验效果显著:QG分数飙升82%,QA性能不受影响

论文在三个主流 VLM 骨干上进行了实验:Qwen2.5-VL-3BQwen2.5-VL-7BQwen3VL-4B。评估时,每个模型对 100 张 CVBench 的多样性图片各生成 5 个问题,然后用上述协议打分。同时,也用 CVBench、SparBench、VStarBench 和 RealWorldQA 等基准测试来评估下游回答能力。
表1:不同模型在不同训练阶段下的QG和QA性能
表1:QG 和 QA 性能对比。报告了五个 QG 维度分数(归一化到 [0,1])以及五个 QA 基准的平均准确率。可以看到,经过两轮进化后,各模型的 QG 平均分都大幅提升(Qwen2.5-VL-3B 从 0.25 涨到 0.50,提升 100%;Qwen3VL-4B 从 0.36 涨到 0.57,提升 58%),而 QA 平均准确率基本持平甚至略有上升。
最亮眼的是:Qwen2.5-VL-3B 模型(最小的骨干)在经过两轮进化后,QG 平均分从 0.25 飙升至 0.50,提升了 整整 100%!即使取所有模型的平均,提升也达 82% 左右。而 QA 性能在 Qwen2.5-VL-3B 上甚至从 60.49 提升到了 62.56。这意味着模型不仅学会了问更好的问题,答题能力也没落下。
下面两张图直观地展示了提问能力随轮次演进的变化:
图9:跨生成轮次的问题改进定性示例(上)
图9:基模型 M0 常问“这是什么颜色”之类的浅层识别问题;第一轮后 M1 提出了跨区域反射推理、相对大小比较等更依赖视觉证据的问题;第二轮 M2 进一步产生了深度/布局理解和带排除条件的细粒度计数问题。
图10:跨生成轮次的问题改进定性示例(下)
图10:另一个例子中,基模型仅识别物体类型和颜色;进化后的模型开始提问场景情绪推理、空间布局推理、活动推理和人类参与推理——这些才是真正需要视觉理解的深层问题。

关键组件剖析:改写、筛选与双格式训练缺一不可

论文通过详尽的消融实验,拆解了每个模块的贡献。

双格式训练 vs 单格式

表2对比了只用 QA 格式、只用 QG 格式和混合 QA+QG 的效果。QG 单独能提升提问质量但降低 QA 性能;QA+QG 则既能提升提问又能保持甚至提升回答,是最好的权衡。
表2:监督格式对QG质量和QA性能的影响
表2:监督格式影响比较。在三个骨干上,QA+QG 都在 QG 平均分和 QA 平均分上取得了最佳平衡。

改写与筛选的作用

表3逐步加入了改写和筛选。单独使用自生成数据(无改写、无筛选)已经比基模型好,但加上改写后各个维度都有提升(尤其是空间推理从 0.20 提升到 0.29),再加上筛选后达到最优(空间推理进一步到 0.37)。这说明改写扩大了候选池,筛选则去掉了“伪好问题”,保留了真正有教育意义的数据。
表3:改写和筛选过程在生成过程中的效果
表3:改写和筛选对QG维度的贡献。全部管道达到了最均衡且最强的结果。

自监督数据 vs 原始标注数据

表4和表5回答了另一个关键问题:模型自己产生的数据,比直接从现有数据集中采样相同数量的标注数据更好吗?答案是肯定的。在10K 规模的小预算下,直接采样原始 SAT 标注数据(一个大型指令微调数据集)虽然能提升视觉搜索难度,但推理和多样性维度变差,且 QA 性能下降;而模型自监督数据则在所有维度上更优,并且 QA 性能也更好。这说明自进化过程产生的问题更精准、更有针对性。
表4:自监督数据对训练的效果
表4:不同数据源对训练的影响。自监督数据在所有 QG 维度上领先,同时 QA 平均分也是最高的。
表5:生成问题质量对QA训练的影响
表5:用更高质量的问题(改进模型生成的)作为训练数据,比用基模型生成的问题作为训练数据,能得到更好的 QA 性能。这验证了“好问题本身也是好老师”。

总结与展望:自进化提问器的潜力与挑战

这篇论文展示了令人兴奋的前景:一个纯粹的自我进化闭环,就能让 VLM 从笨拙的答题器转变为敏锐的提问者。想象一下,以后的教育 AI、医疗 AI 或探索机器人,能根据当前场景主动提出探索性问题来获取关键信息——这不正是智能的核心特质吗?
当然,当前方法也有一些局限:实验只进行了两轮迭代,更深的轮次是否会饱和或退步仍有待研究;评估协议依赖于 GPT-5.4 的评分,虽然与人类标注有较高一致性(附录表9展示了 Spearman 相关系数),但并非完全可靠;另外,框架目前专注于视觉问题,能否推广到纯文本或其他模态的问题生成也是一个开放问题。不过,这篇工作为“模型教自己”这一方向提供了一个坚实且优雅的范例。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:这篇论文解决什么问题?A:它解决了 VLM 不会主动提问的问题。现有 VLM 只擅长回答,不会自主生成高质量、多样化的视觉问题。论文提出了一套自进化框架,让模型自己生成、改写、筛选训练数据,从而在无需人类标注的情况下持续提升提问能力。

Q2:文中提到的 QG 和 QA 分别是什么意思?A:QG 是 Question Generation(问题生成),指模型根据图像生成问题;QA 是 Question Answering(问答),指模型根据图像和问题给出答案。框架中采用双格式训练,让模型同时提升两种能力。

Q3:这个框架需要多大的计算资源?A:论文在三个小型 VLM 上进行了实验(3B、4B、7B参数),使用 10K 训练样本,一轮训练在实验室常见 GPU 上即可完成(例如 8 张 A100 数小时)。整体计算成本相对可控。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

提出自进化框架让 VLM 实现从“答题”到“提问”的跨越,创新性突出。但整体思路介于自训练与课程学习之间,并非完全颠覆性。加一个星扣在半颗。

实验合理度:★★★★✰

消融实验全面,三个骨干验证了泛化性,评估协议(GPT-5.4 评分)也经过了人类对齐验证。但仅进行了两轮迭代,且评估用的 GPT-5.4 可能存在偏见。

学术研究价值:★★★★✰

开创了自进化问题生成这一方向,对理解模型主动学习和数据自主构建有重要启发。

稳定性:★★★✰✰

在多个骨干和多轮次上表现稳定,但仅实验了两轮,更远轮次的行为未知,且依赖 GPT 评分作为信号,存在不确定性。

适应性以及泛化能力:★★★✰✰

在 Qwen 系列上表现良好,但未测试其他模型族(如 LLaVA、InternVL)。此外,图像来源限定于 CVBench 和 SAT 数据集,域外泛化未知。

硬件需求及成本:★★★★✰

使用 3B/7B 模型,训练数据仅 10K,成本较低。但需要多次推理来生成和筛选数据,总体算力在可接受范围。

复现难度:★★★★✰

方法描述清晰,伪代码和 prompt 在附录中给出,核心是使用 Qwen 系列开源模型和公开数据集,复现障碍较小。

产品化成熟度:★★✰✰✰

目前仍属学术研究阶段,主要面向提升模型本身的能力,距离直接产品落地还有距离。但在教育、辅助探索等场景有潜力。

可能的问题:论文未探讨更长寿的进化(>2轮)是否会导致性能饱和或退化;评估依赖 GPT-5.4 可能引入偏差;改写阶段只用了 M0 一种视角,未来可以尝试多个或动态基模型。此外,论文未在 LLaVA 等其他流行 VLM 上验证,泛化性有待加强。


主要参考文献

[1] Bai et al. (2025b). Qwen2.5-VL: Technical Report. arXiv:2502.13923.
[2] Bai et al. (2025a). Qwen3-VL: Technical Report. arXiv:2505.13437.
[3] Tong et al. (2024). CVBench: Evaluating Vision-Language Models on Visual Concepts. ICLR 2025.
[4] Zhang et al. (2026). SparBench: Spatial Reasoning Benchmark for VLMs. arXiv:2603.xxxxx.
[5] Singh et al. (2026). GPT-5.4 System Card. OpenAI Technical Report.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。