← 返回 PaperDaily
视觉与图像
图像生成|别只卷画质了!新基准专测"逻辑作画",最强开源模型不到32分
当所有文生图评测还在卷画质和指令跟随,UIUC这次直接把“答案藏在图里”的推理题丢给模型。2000道题、9个主流生成模型,最强Gemini 3 Pro也只拿64.6分。想看生成模型到底有多少“真推理”,这片试金石值得收藏。
龙哥读论文
发布于 2026-09-05 00:31:07
阅读 4
查看原文
原论文信息如下:
现在的大模型图像生成能力强不强?如果只看画质,各路模型几乎快把“以假乱真”写在脸上。但UIUC、纽约大学的研究者抛出了一个更扎心的问题:如果给你几张图,让你先“看懂”里面的隐藏规则,再亲手画出一张符合规则的答案图,这些生成模型还能打吗?
这篇论文提出了一个全新评测基准RIG-BENCH,专门用来考验“由推理驱动的图像生成”(Reasoning-driven Image Generation,RIG)。它把以往文本问答里那些逻辑推理题,全部换成了必须“画出来”的答案:看到同类型交互图片,画一张新的同概念图;看到几何变换演示对,把变换规则迁移到新物体上;看到3乘3矩阵缺一格,把缺失那一格画出来;看到化学分子式里的电子箭头,把反应产物画出来。
答案图就是推理证据,画错了,意味着模型对隐藏规则的归纳彻底失败。RIG-BENCH共包含2000条人类精心筛选的题目,横跨概念归纳、变换类比、模式补全和场景推断四大类。9个主流生成模型(Qwen-Image、BAGEL、Emu3.5、FLUX.2、Gemini 3 Pro Image Preview、Gemini 3.1 Flash Image Preview、GPT Image 1,以及视频生成模型Wan2.2与VBVR-Wan2.2)在上面无一满分,最好的Gemini 3 Pro Image Preview只拿到64.6分(百分制)。作为对照,人类试点答题的准确率高达92.9%。
在细细拆解这篇论文之前,先给不熟悉背景的读者理一下“图生图推理”和普通图像编辑的区别。日常见到的图像编辑,比如把一张照片里的猫换成狗,或者把背景从白天改成夜晚,本质上是按一句明确的文字指令做局部改动。RIG-BENCH里完全不给这类提示词。模型拿到的是一组与答案同源的上下文图片,以及一句几乎不含语义线索的通用指令,比如“补全这个3乘3矩阵的缺失格”。模型必须先自己从上下文里“顿悟”出规则,再把规则转成全新像素。推理结果和生成结果耦合在一起,每一个环节出问题,最终答案图都会错得离谱。 让AI“看图推理”:RIG-BENCH如何揭示生成模型的逻辑短板
RIG-BENCH四大任务族示例。上方为开源模型输出,下方为闭源及视频生成模型输出。可以看到,面对同一道推理题,模型给出的“答案图”五花八门,但大多没抓到真正的规则。
先给不熟悉背景的读者一个抓手:现在最火的图像生成模型,本质上还是一个“超大规模概率拟合器”。给它一句提示词,它做的事情是从海量训练数据里检索出一个最像样的像素分布,然后采样出一张图。这个过程在画风景、画人像、画万物的时候确实好用,因为那些任务没有绝对的对错,只要“像那么回事”就行。可一旦题目变成“左边这只红色圆球按照某种规律变成了蓝色方块,右边这只绿色三角该变成什么”,模型就不能再靠“像”来混日子了。它必须先在脑子里跑一遍逻辑推导,再把推导结果一丝不苟地渲染到像素上。一步错,步步错。
先说说这篇论文在较劲什么。过去几年,图像生成的评测基本分成两条路线。一条是文生图评测,大家比的是画质、文本跟随度、构图合理性,用CLIP Score、FID这些指标打分。另一条是视觉推理评测,比如经典的Raven推理矩阵、ARC抽象推理数据集,但这些评测几乎都用文本选项或者分类标签作为输出,模型只需要在一堆选项里选出正确答案即可。
这两条路线之间存在一个巨大的空档:模型能否从视觉输入中归纳出潜在规则,然后把规则对应的答案直接“画”出来? 这条能力链路,论文里叫做“推理驱动的图像生成”(Reasoning-driven Image Generation,简称RIG)。
为什么这条链路值得单独拿出来考核?因为它在概念上把两个经常被拆开的能力焊在了一起:既要模型具备System 2级别的抽象推理,又要模型能够把推理结果维持在高维像素空间里不崩塌。文本问答哪怕答错了,也只是选错一个token;图像生成一旦逻辑错了,整张图都会变成结构完整的“一本正经的胡说八道”。比如让模型补全一个3乘3矩阵的缺格,它可能生成一个和周围风格很像的图形,但内部的线条走向完全不符合行与列之间的变换规律。这就是论文最核心的观察——模型经常生成局部合理但全局不合逻辑的结果 。
从“指令跟随”到“规则归纳”:RIG任务形式化的关键设计
RIG-BENCH在任务形式化上做了几个非常关键的设计决定。整个任务的输入被定义为一个三元组 C = (I, D, t)。其中I是上下文图像集合,承载着推理素材,可能是一组概念示例,也可能是一个待补全的矩阵;D是可选的有序演示对集合,专门用于变换类任务,给模型展示“输入A变成输出B”的范例;t则是一句自然语言指令。这句话很讲究,它只说明输出的约束条件,比如“补全3乘3矩阵缺失的格子”,但绝不泄露任何可能简化推理的语义线索。
注意,这个设置把文字提示词的信息量压到了最低。模型面对的真正难题是:目标输出从未被语言指定,必须完全靠视觉上下文来推断。比如变换类任务里,模型拿到一组演示对,左边一个圆,右边一个方,再换一组演示,左边是红的,右边是蓝的,最后给一个新的输入,问输出应该是什么。模型必须自己“悟”出来这些演示对展现的是颜色变换、形状变换还是位置变换。
这种设计同时考核了三种能力。第一是视觉感知,模型必须做细粒度的特征提取,看清楚形状、颜色、数量、空间拓扑这些底层属性。第二是规则归纳,模型要从观测中抽象出潜在的逻辑关系,这一步靠的是高层次的抽象能力,不是表面模式匹配。第三是落地生成,模型需要把推理结果高保真地渲染到像素空间。多数现有评测只能覆盖其中一两个环节,RIG-BENCH是第一个同时强制要求三项能力的基准。
值得一提的还有配套的数据筛选流程。为了保证题目质量,论文做了三层蒸馏。第一层叫跨域重构,从ARC、Raven矩阵、化学分子推理等成熟数据源里抽取推理内核,再改写成生成任务,把问题从“识别答案”变成“画出答案”。第二层叫推理中立提示,作者手动撰写所有指令,确保指令不包含任何可被模型钻空子的语义捷径。第三层是启发式加人工过滤,剔除那些仅凭感知就能完成或者过于简单的题目,坚持“人类能解但模型吃瘪”的标准,把基准变成真正的压力测试。
四大任务族与十一子任务:RIG-BENCH的评测体系构建
RIG-BENCH总共包含2000条精心挑选的测试样本,覆盖四大任务族。这四大类的划分逻辑非常接近人类认知发展的层次。
第一类是基于概念的推理 :给模型看六张具备某个共同抽象概念的图片,让它生成一张符合这个概念的新图。这个任务的本质是小样本抽象分组,模型必须抓住类别的不变特征。
第二类是基于变换的推理 :模型需要从一组演示对里学会一个变换规则,再把这个规则应用到新输入上。变换可以是几何层面的旋转、镜像,可以是属性层面的颜色、尺度变化,也可以是更抽象的像素网格规则迁移。这是整个基准里最硬核的部分,因为规则本身没有文字定义,纯粹靠示例推导。
第三类是模式与结构推理 :覆盖3乘3矩阵补全和视觉空间谜题。Raven矩阵就是最典型的例子,九宫格里前八格有确定规律,模型要画出第九格。这种任务对全局规则的敏感性要求极高,任何一个局部组件错位都会导致整体推理链条断裂。
第四类是场景推理 :把感知和世界知识结合起来,包括科学过程推断、时间场景演进、跨域类比和风格偏好。比如看到化学分子结构式上的电子箭头,模型要能推断出反应产物。
此外,基准还从“答案空间”维度做了一个精巧的区分。有些子任务是开放式答案,存在多种视觉上合理的实现方式,比如风格偏好、场景时间延续;另一些子任务是封闭式答案,目标图像被几何、属性、结构或科学规则唯一锁定。这个区分的价值在于能够把两类失败分离出来:模型在开放式任务上表现好,说明它具备流畅的视觉生成能力;在封闭式任务上崩盘,说明它的逻辑归纳能力还有本质缺陷。
实验结果深度解析:为何最强模型也仅得64.6分?
RIG-BENCH评测了九个当前主流的生成模型,涵盖四类开源图像生成模型和三类闭源模型,还加入了两个视频生成模型。开源组包括阿里的Qwen-Image、BAGEL、Emu3.5和FLUX.2;闭源组包括Gemini 3 Pro Image Preview、Gemini 3.1 Flash Image Preview和GPT Image 1;视频模型组是Wan2.2-14B和加了推理增强的VBVR-Wan2.2-14B。所有模型使用统一的推理协议:只给上下文图片和中性指令,生成一张答案图。
结果相当震撼。最强模型Gemini 3 Pro Image Preview只拿到64.6分(满分100),其余闭源模型的得分在40到60区间,所有开源图像生成模型全部低于32分。作为对照,论文做了一个人类试点测试:66道均匀抽样的题目,人类被试可以手绘答案或者从网上检索匹配图像,人工检查准确率达到92.9%,大模型裁判打出的平均分是97.3。模型和人类之间的鸿沟肉眼可见。
论文还比较了同类模型在其他文生图基准上的表现,结论是RIG-BENCH上体现的开源-闭源差距,远比它们在文本条件生成评测里的差距更大。这说明目前的模型能力差异,很大程度上被文本提示词掩盖了。当任务变成视觉输入到视觉输出,模型的真实推理能力差异才会暴露。这也解释了一个行业里常见的困惑:为什么PPT里看各家模型都差不多,一上真实业务场景就拉开差距?因为真实场景里的任务往往不是“照着文字画图”,而是“看懂上下文再输出结果”。
分数的分布格局非常有信息量:Gemini 3 Pro在交互概念上拿到92.1分,风格偏好超过90分,但在三个变换类子任务上最强开源模型全部低于25分。这说明,开放式答案空间对模型很友好,因为生成结果只要“像那么回事”就能拿高分。但一旦答案被潜在规则唯一锁定,模型的能力就迅速见底。整个变换任务族相当于RIG-BENCH的脊柱,真正的规则归纳能力在这里接受审判。
再看开放答案和封闭答案的对比,结论更加尖锐。Gemini 3 Pro是在封闭式任务上唯一得分超过开放式的模型,说明它的内部推理确实在起作用;其他模型则全部呈现巨大落差,最强开源模型FLUX.2在开放式上拿到47.7分,封闭式只有21.4分,落差高达26.3分。差值越大,说明模型越依赖生成流畅度“蒙混过关”,而不是做真正的规则推导。
端到端生成失败点诊断:推理与渲染的鸿沟在哪里?
RIG-BENCH的一个重要贡献是给出了一个诊断框架,把端到端生成拆解成三个级联阶段:感知(Perception)、规则归纳(Rule Induction)和落地生成(Grounded Generation)。每个阶段都可能掉链子,而基准的设计恰好可以在模型做错的时候指出它到底是在哪一步失败的。
论文专门做了消融对照实验,以测试模型在不同环节上的表现。这个实验特别有意思的地方在于它揭示了:很多模型在纯文本推理条件下可以正确答对题目,在纯生成条件下也能够画出符合某个参考图的像素,但一旦要求模型“先看图再自己推理再画图”,整体成功率就出现了断崖式下跌。
这个“整合鸿沟”恰恰是论文想点出的最关键问题:模型的视觉编码器和文本推理链之间没有建立起有效的对齐。语言模态和视觉模态之间可能存在着一种“语义翻译损耗”。模型可能用语言可以轻松描述的规则,一旦需要直接在高维像素空间里操作,就没办法把符号层面的推理结果,准确映射到图像生成器的隐空间里。
图6:论文还补充了人类评估界面截图,来说明其评分流程的可靠性。为了验证自动化评分的可信度,作者组织了12名标注者对500条样本进行盲评,人类与裁判的一致性达到较高水平(皮尔逊相关系数0.766)。
论文还设计了一套更精细的级联分解实验,把每个子任务上的失败拆成感知失败、规则归纳失败和渲染失败三部分。以Gemini 3.1 Flash Image Preview为例,交互概念这类任务的主要瓶颈在感知上,说明模型可能连“图片里有哪些物体”都没有建全;而在科学过程这类任务上,模型往往能感知到正确的成分,规则归纳也算出了可能的走向,却在最后生成的化学结构式时出现键连错误。更多模型的结果表明,规则归纳是最常见的瓶颈环节,感知次之,渲染反而是相对最不常出问题的一环。
最值得反思的是VBVR-Wan2.2这个例子。它在感知相似度指标上表现亮眼:DINO相似度0.63、CLIP-I 0.82、LPIPS距离只有0.46,在全部九个模型里都是数一数二的好。但它的Rubric综合分只有21.6,比大多数图像生成模型还低。为什么会出现这种“指标很强、逻辑崩盘”的奇异组合?因为视频模型有着天然的时间一致性先验,生成的每一帧在像素层面都和输入的状态很“像”,但这种“像”只能保证画面流畅,根本不能保证画面里物体的空间关系符合推理规则。感知指标骗过了人眼,却骗不过针对推理正确性的专项评分。
这个发现对整个行业有振聋发聩的警示作用:如果评测体系只看画质和感知相似度,很多模型的真实推理缺陷会被完全掩盖。今天各家比拼视频生成、世界模型,如果不能在评测维度上引入逻辑一致性这个“照妖镜”,用户买到手的可能就是一只“画皮”模型——表面无可挑剔,内里一包草。
未来展望:迈向逻辑一致的世界模型
RIG-BENCH的意义绝不只是给模型打个分。它更像一面镜子,照出了当前生成式AI发展的一个深层误区:行业花了大量精力提升图像的视觉质量,却很少思考图像内容本身的逻辑自洽性。论文作者指出,真正的世界模型不能只是“看起来合理”的像素模拟器,它必须能够建立起从感知到归纳再到预测的闭环,这才是通向通用人工智能的关键一步。
从工程落地角度看,RIG-BENCH提出的评测理念对很多具体业务有直接参考价值。比如在具身智能领域,机器人看完一段操作演示后,需要自己推理出下一个动作应该怎么执行,这种“视觉输入到视觉输出”的闭环能力与RIG的设定高度吻合。又比如在医学影像分析中,看完一张病灶图后需要推理出下一阶段可能的发展形态;在辅助设计领域,看完一个结构草图后需要推理出完整结构。这些都是RIG的真实应用场景。
论文还有一些有趣的细节值得注意。作者发现在同一批模型上,RIG-BENCH揭示的推理能力排序,和它们在纯文本推理任务上的排序并不完全一致。这说明“语言推理强”不等于“视觉推理强”,两种能力可能依赖不同的内部机制。对那些宣称要做“世界模拟器”的大厂来说,这个结论值得反复咀嚼。
龙迷三问
这篇论文到底在解决什么问题? RIG-BENCH:2000张图推理题,答案从不写进文字。9个主流生成模型测下来,最强Gemini 3 Pro仅64.6分,开源模型全线低于32,为推理式图像生成立起一面照妖镜。
这篇工作最值得看的点是什么? 最强模型Gemini 3 Pro Image Preview达到64.6/100,所有开源模型低于32,视频生成模型表现最差(VBVR-Wan2.2仅21.6),显示显著的推理-生成差距。
这篇工作的边界或风险在哪里? 优点:1) 首次系统定义并评估推理驱动图像生成任务;2) 统一的图像输入-图像输出协议,避免语言泄漏;3) 严格的答案空间约束区分开放与封闭形式任务;4) 提供LLM-judge与人类标注的可靠性验证。缺点:1) 数据集规模有限(2000样本);2) 评估依赖LLM-judge,可能引入偏差;3) 未覆盖视频和3D推理。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出RIG-BENCH基准,通过统一的图像输入-图像输出协议,要求模型从视觉上下文中归纳潜在规则并直接合成答案图像,从而系统评估推理驱动的图像生成能力。
实验合理度: ★★★★☆
Rubric评分(LLM-as-judge,0-100)、DINO、CLIP-I、LPIPS、FID
学术研究价值: ★★★★☆
提出RIG-BENCH基准,通过统一的图像输入-图像输出协议,要求模型从视觉上下文中归纳潜在规则并直接合成答案图像,从而系统评估推理驱动的图像生成能力;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 1) 数据集规模有限(2000样本);2) 评估依赖LLM-judge,可能引入偏差;3) 未覆盖视频和3D推理。
主要参考文献
[1] Liu Y, Huang N, Cao X, et al. Thinking in Pictures: A Systematic Benchmark for Reasoning-driven Image Generation[J]. arXiv preprint arXiv:2609.02864, 2026.
[2] RIG-BENCH开源数据集: https://huggingface.co/datasets/Abbyyyt/RIG-Bench
看完了这篇「让AI看图思考再画图」的硬核评测,是不是也想知道自家模型能在里面拿几分?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像生成+上海+UIUC+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群;群里常有热心龙迷分享最新评测思路与模型部署踩坑实录,等你来聊~
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!