公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~

龙哥推荐理由:
一般的VLM只会当“答题机器”,这篇来自马里兰大学、UCLA和MBZUAI的工作,却让模型学会了“问问题”,而且问得越来越好。无需人工标注,模型自己就能在问答之间形成“进化闭环”,看到QG分数飙升82%,龙哥直呼过瘾。
原论文信息如下:
让模型学会提问:从回答者到提问者的跨越
自我进化训练框架:一个从模型自身生成数据中学习的问题生成闭环
第一步:问题提案
第二步:问题改写
第三步:问题筛选
第四步:双格式训练与迭代循环
多维度的提问能力评估:不只关注回答,更要看问题质量
实验效果显著:QG分数飙升82%,QA性能不受影响
关键组件剖析:改写、筛选与双格式训练缺一不可
双格式训练 vs 单格式
改写与筛选的作用
自监督数据 vs 原始标注数据
总结与展望:自进化提问器的潜力与挑战
龙迷三问
Q1:这篇论文解决什么问题?A:它解决了 VLM 不会主动提问的问题。现有 VLM 只擅长回答,不会自主生成高质量、多样化的视觉问题。论文提出了一套自进化框架,让模型自己生成、改写、筛选训练数据,从而在无需人类标注的情况下持续提升提问能力。
Q2:文中提到的 QG 和 QA 分别是什么意思?A:QG 是 Question Generation(问题生成),指模型根据图像生成问题;QA 是 Question Answering(问答),指模型根据图像和问题给出答案。框架中采用双格式训练,让模型同时提升两种能力。
Q3:这个框架需要多大的计算资源?A:论文在三个小型 VLM 上进行了实验(3B、4B、7B参数),使用 10K 训练样本,一轮训练在实验室常见 GPU 上即可完成(例如 8 张 A100 数小时)。整体计算成本相对可控。
龙哥点评
论文创新性分数:★★★★✰
提出自进化框架让 VLM 实现从“答题”到“提问”的跨越,创新性突出。但整体思路介于自训练与课程学习之间,并非完全颠覆性。加一个星扣在半颗。实验合理度:★★★★✰
消融实验全面,三个骨干验证了泛化性,评估协议(GPT-5.4 评分)也经过了人类对齐验证。但仅进行了两轮迭代,且评估用的 GPT-5.4 可能存在偏见。学术研究价值:★★★★✰
开创了自进化问题生成这一方向,对理解模型主动学习和数据自主构建有重要启发。稳定性:★★★✰✰
在多个骨干和多轮次上表现稳定,但仅实验了两轮,更远轮次的行为未知,且依赖 GPT 评分作为信号,存在不确定性。适应性以及泛化能力:★★★✰✰
在 Qwen 系列上表现良好,但未测试其他模型族(如 LLaVA、InternVL)。此外,图像来源限定于 CVBench 和 SAT 数据集,域外泛化未知。硬件需求及成本:★★★★✰
使用 3B/7B 模型,训练数据仅 10K,成本较低。但需要多次推理来生成和筛选数据,总体算力在可接受范围。复现难度:★★★★✰
方法描述清晰,伪代码和 prompt 在附录中给出,核心是使用 Qwen 系列开源模型和公开数据集,复现障碍较小。产品化成熟度:★★✰✰✰
目前仍属学术研究阶段,主要面向提升模型本身的能力,距离直接产品落地还有距离。但在教育、辅助探索等场景有潜力。可能的问题:论文未探讨更长寿的进化(>2轮)是否会导致性能饱和或退化;评估依赖 GPT-5.4 可能引入偏差;改写阶段只用了 M0 一种视角,未来可以尝试多个或动态基模型。此外,论文未在 LLaVA 等其他流行 VLM 上验证,泛化性有待加强。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!