← 返回 PaperDaily
视觉与图像
同济新基准专治文生图“没文化”:GPT Image画隐喻也翻车,结构准确率仅78%
让AI画“时间就是金钱”,它可能真画一个挂满钞票的时钟;让AI画“知识就是力量”,它又可能把书本和哑铃硬拼在一起。文生图模型能把物体画得很真,却常常画不出“画外之音”。同济大学等机构提出VMetaphor-Bench,把“视觉隐喻生成”这件事第一次系统性地量化评测,结果连GPT Image 1.5也栽在结构组合上。
龙哥读论文
发布于 2026-09-05 00:31:07
阅读 3
查看原文
原论文信息如下:
文生图模型这两年的进步,肉眼可见。只要给一句提示词,它能画出以假乱真的照片级图像,物体、材质、光影、空间关系都拿捏得死死的。GPT Image 1.5、Nano Banana 2、FLUX.2-dev、Qwen-Image,一个比一个能打。可如果你让它画一个“用视觉去表达抽象概念”的隐喻,比如“大脑像一团乱麻”“城市是永不停歇的蜂巢”,模型的智商就会瞬间掉线。
为什么会这样?因为日常文生图评测几乎都在测“字面跟随”,也就是物体、属性、空间位置是否画得对。而视觉隐喻要求的是:把两个看起来毫不相关的概念域,通过某种视觉结构捏合在一起,并让观众一眼读出背后的含义。这已经不是“画得像不像”的问题,而是“有没有创意表达能力”的问题。
同济大学与上海创新研究院的研究者们显然也注意到了这个坑。他们提出的VMetaphor-Bench,是第一个专门针对文生图模型视觉隐喻生成能力的系统评测基准。这个基准不玩虚的,直接从真实创意图片里筛出1500个视觉隐喻样本,配上双层提示词,再设计了一整套多选问答加维度打分的混合评测协议,把11个主流文生图模型拉出来轮番拷打。
结果很有意思:闭源模型确实整体领先,GPT Image 1.5拿到了85.4%的综合准确率,看似不错。但只要拆开看,就会发现它在“结构类型判断”这一项上只有78.1%,在“元素映射”上只有76.5%。换句话说,模型能画出正确的元素,却经常不知道该用替换、融合还是并置的方式把两个域组合起来,画出来的东西常常差点意思。
这篇论文的价值,不在于告诉人们哪个模型更强,而在于第一次把“视觉隐喻生成”这件事拆解成可以量化的细粒度能力,让大家看到当前文生图模型在抽象语义表达上的真实水位。如果想让AI真正成为设计师、插画师、广告人的创作伙伴,这类能力早晚要补上。
视觉隐喻到底难在哪里?
在聊基准之前,先花点时间把“视觉隐喻”这个概念说透。隐喻在语言里很常见,比如“时间就是金钱”“生活是一场马拉松”。它本质上是用一个熟悉的概念域,去理解另一个相对抽象的概念域。视觉隐喻就是把这种概念层面的映射,变成纯视觉的表达,不借助文字,让观众看图就能心领神会。
VMetaphor-Bench:首个视觉隐喻生成基准
GPT-Image-1.5、Seedream 5.0 Lite和FLUX.2-dev在视觉隐喻生成中的常见失败模式。有的漏掉一个域,有的结构形式不对,有的生硬拼接,有的完全没有传达出隐喻含义。
上图展示的就是论文里总结的几类典型“翻车现场”。有的模型只画出了源域却漏掉了目标域,比如想表达“商业竞争像拳击赛”,结果只画了拳击手套;有的把两个域硬生生拼在一起,画面看起来像PS事故;还有的虽然把元素画全了,但完全看不出隐喻含义,观者只能一脸问号。
这种任务对模型的要求其实有三个层次。第一,模型要理解“哪个域修饰哪个域”,比如“城市是蜂巢”里,蜂巢是源域,城市是目标域;第二,模型要选择一个合适的视觉组合策略,是把两个域融合成一个物体,还是让它们并置在同一个画面中,抑或用源域直接替换目标域中的某个部分;第三,完成组合后还要保证普通观众能自然领会其中的含义。这三步环环相扣,任何一步出错,隐喻就废了。
VMetaphor-Bench:1500个真实隐喻从哪来?
既然是做评测基准,数据的质量和真实度就是生命线。VMetaphor-Bench没有用AI凭空生成一堆隐喻素材,而是从Pinterest这类富含创意内容的平台上,用“视觉隐喻”“创意广告”等关键词,先收集了约5000张候选图片。这些图片来自广告、社论插画、概念艺术等真实创作场景,本身就带着强烈的表达意图。
VMetaphor-Bench概览。左侧是三级十类的层次化分类体系,中间展示了三种结构类型的代表性样例,右侧是11个文生图模型在概念提示词下的准确率与维度得分表现。
收集只是第一步。两位作者先人工筛掉重复、模糊、不含清晰视觉隐喻的低质量图片,剩下约1600张进入标注环节。标注采用两阶段流水线,以大模型作为标注骨干,先把每张图片的结构化信息抽取出来,包括目标域、源域、结构类型、隐喻含义、元素映射五个字段;然后在结构化信息的基础上,为每张图生成两个不同粒度的提示词。
这里有个设计细节非常值得注意。论文把提示词分成概念提示词和描述提示词。概念提示词只说明“目标域是什么、源域是什么、想表达什么意思”,不给具体视觉构图线索;描述提示词则详细交代“画面里有什么、两个域是怎么在视觉上结合的”。一粗一细两组提示词,可以让评测同时考察模型的“从抽象概念反推视觉方案”的能力和“照着详细描述执行渲染”的能力,后者恰好能区分“不会画”和“听不懂”两种失败原因。
为了让数据不偏科,1500个样本按三个层次十个类别做了均衡分布:个体类覆盖认知过程、心理状态、健康生活、个人成长;外部类覆盖社会议题、自然环境、科技生活、人际互动;创意类覆盖创意设计与商业广告。每个样本还额外加了一个风格后缀,比如摄影写实或插画风,保证生成的图片在风格上与原始创意一致。三名受过训练的标注人员对所有图片、注释和提示词做了交叉人工校验,最终的样本质量相当扎实。
混合评估框架:把“画得好不好”拆成可计算的问题
数据建好了,下一步是怎么量化评估。过去评测文生图,常用FID、CLIPScore这类分布距离或特征相似度指标,它们能判断整体画质和语义相关度,却无法告诉研究者模型具体在哪一个环节出了问题。VMetaphor-Bench则换了一套更精细的打法:用多模态大语言模型当裁判,如果用一句话概括视觉隐喻的创作难度,就是“模型既要懂概念,还要懂构图,更要懂观众”。人类设计师画“时间就是金钱”,会自然而然地把钱币雕刻成表盘,让金币的纹路与钟面的指针融为一体,观众一眼就能读出含义。
换成文生图(T2I,Text-to-Image)模型,任务就不是“画得像”能覆盖的了。模型需要先识别出这里的两个概念域:目标域 是“时间”,源域 是“金钱”,然后用一种合理的视觉方式把二者的特征融合起来。这背后还藏着一层更麻烦的要求:模型不能用文字注释,得让观众只看图就能自动解码出“时间珍贵得像金钱”这层含义。
认知语言学里的概念整合理论早就指出,隐喻不是简单地把两个词放在一起,而是把两个认知域的部分结构投射到同一个“合成空间”里。对T2I模型而言,这恰恰是三重考验:第一,要从语义上找出“谁修饰谁”;第二,要在视觉上决定用融合(fusion) 把两域捏成一个物体,还是用替换(replacement) 让源域顶替目标域中该出现的东西,又或者用并置(juxtaposition) 把两域同时摆在画面里制造对比;第三,还得保证这种组合不会让普通人觉得莫名其妙。
这比“画一只戴帽子的猫”难得多,因为后者要画的元素全都写在提示词里;而视觉隐喻的提示词往往只给一个抽象概念,剩下的视觉方案全靠模型自己脑补。所以论文把视觉隐喻生成称为“T2I模型的高级推理任务”,一点也不夸张。
既然要评测这种高级能力,第一步就是搭建一个靠谱的数据集。VMetaphor-Bench没有偷懒用AI编造隐喻素材,而是从Pinterest这类富含创意图形的平台出发,围绕“视觉隐喻”“创意广告”等关键词收集了约5000张候选图片,再经过人工剔除低质量、模糊不清或不含明确隐喻的样本,最终留下1500张高质量图片。
既然是做基准,样本不能太单一。数据按三个层次十个主题类别做了系统划分,覆盖认知过程、心理状态、健康生活、个人成长、社会议题、自然环境、科技生活、人际互动、创意设计与商业广告等方向。每个样本都不是随手贴一张图了事,而要附带五类结构化标注:目标域、源域、结构类型、隐喻含义,以及元素映射。其中“元素映射”是很多评测容易忽略的细节:它把源域里的某个元素与目标域里的某个元素一一对应起来,指明这两个域之间到底靠哪些视觉部件建立意义连接。
VMetaphor-Bench整体流程总览。左侧为数据构建,通过两阶段标注管道生成结构化标注与两种粒度的提示词;右侧为混合评估框架,包含L1到L4的多选问答评测与三维度打分。
在标注方式上,作者采取了两阶段方案:第一阶段先让大模型看图抽取结构化信息,第二阶段再基于这些结构化信息生成两组提示词。两组提示词的设计非常巧妙:概念提示词 只描述抽象的目标域、源域和想传达的含义,不给具体视觉构图信息;描述提示词 则像分镜脚本一样把画面上的内容和两个域的视觉结合方式交代清楚。每组提示词还会附加一个风格后缀,比如“摄影写实”“插画风”,保证生成结果与原始创意图的风格保持一致。
图12:数据筛选阶段的人工校验界面截图。所有图片、注释和提示词都经过三位标注者交叉检查,以排除隐喻模糊、目标域和源域标反、提示词不够准确等问题。
为什么同一张图要配两种提示词?因为在真实的创意场景里,设计师往往只带着一句模糊概念就开始探索,比如“把知识的重量感画出来”,这时模型需要自行脑补视觉方案;但另一种场景下,客户会给出非常具体的参考图描述,模型只需要忠实执行。如果一个模型在描述提示词下表现优秀、在概念提示词下却一塌糊涂,说明它的短板更可能出在抽象推理与视觉方案生成上,而不是纯粹的图像渲染能力。
图15:覆盖VMetaphor-Bench十大主题类别的视觉隐喻生成示例,可以看到不同主题下隐喻结构呈现出的多样性。
混合评估框架:从多维度诊断模型能力
数据集搞定了,接下来的问题是:怎么判断一张生成图的隐喻质量?如果用老一套FID、CLIPScore这类指标,只能说明画面整体上的分布像不像真实图库、语义相关度有多高,完全无法定位“哪个环节画错了”。所以论文引入了主流的MLLM-as-judge范式,让多模态大语言模型(MLLM,Multimodal Large Language Model)充当裁判,并设计了两种互补的评估协议。
第一种是多选问答(MCQ,Multiple-Choice Question)协议 。它把一张图的隐喻质量拆成四个层级来提问:L1检查目标域和源域是否都出现在画面中;L2判断两个域的组合结构是否与原始创意图一致;L3考察画面是否传递出了既定含义;L4则细问到元素映射层面,检查每一个源域元素是否对应到了正确的目标域元素上。全部样本累计生成了9594个选择题,每题除了正确答案外还配有干扰项和“无法判断”选项,选项顺序全部随机化以消除位置偏差。
举个例子,假设题目想表达“商业竞争就像拳击赛”,L1会问“画面里是否出现了拳击相关元素”,L2会问“拳击手套是被并置在西装革履的人旁边,还是直接替换了人的手,又或者与人的形象融合成一体的新角色”,L3会问“观众能否读出对抗感”,L4则会追问“哪只手套对应哪个商战主体”。这样一层层剥下去,模型到底弱在哪一个环节就非常清楚了。
第二种是维度打分协议 ,让裁判在1到5的尺度上对三件事分别打分:隐喻效能看画面能否无解释地让观众领会含义;隐喻逻辑看跨域映射在概念上是否说得通;感知和谐看两个域在视觉上是否融合自然、构图融洽、不突兀。多选题负责严苛的“客观对错”,维度分负责捕捉“整体观感”,两者互相补充,避免陷入“全都答对但画面很难看”或“画面漂亮但语义完全不对”的两极陷阱。
11大模型横评:闭源领先,结构组合成瓶颈
基准建好了,接下来就是轮番上阵。论文一口气测了11个代表性文生图模型,分成三大阵营:闭源模型阵营有GPT Image 1.5、Nano Banana 2(即Gemini 3.1 Flash Image)和Seedream 5.0 Lite;开源扩散模型阵营有Stable Diffusion 3.5 Large、FLUX.1-dev、FLUX.2-dev、Z-Image和Qwen-Image;另外还有走“理解+生成一体化”路线的开源统一多模态模型OmniGen2、Bagel和Janus-Pro。默认裁判选择了开源可复现的Qwen3.5-27B,这只模型在视觉推理上表现足够强,同时对后续研究者更友好。
表1:VMetaphor-Bench概念提示词下的评测主结果。前五列是MCQ准确率,后四列是1到5分的维度得分。
先看综合排名。GPT Image 1.5以85.4%的MCQ综合准确率和4.30的维度综合分排在首位,Nano Banana 2以84.8%和4.11紧随其后,Seedream 5.0 Lite以78.5%位居闭源第三。开源模型里表现最好的是FLUX.2-dev,拿了76.0%和3.62,但它与GPT Image 1.5之间仍然隔着将近10个百分点。Qwen-Image和Janus-Pro稳定在中游,而走统一多模态路线的OmniGen2与Bagel排在末位,说明“会看图”不等于“会画隐喻”,理解能力并不能自动迁移到生成侧。
比排名更有价值的,是四层MCQ的分数分布。几乎所有模型的L1域存在和L3含义都接近90%甚至更高,开源统一模型OmniGen2在“含义”这一项也能到77.1%。一旦考题落到L2结构类型和L4元素映射,全场的准确率梯度就骤然拉大:结构类型最低只有48.1%,元素映射最低49.1%,即便是冠军GPT Image 1.5,这两项也只有78.1%和76.5%。这说明当前模型的短板不是“想不出含义”,而是“知道该画什么,却不知道怎么用正确的视觉结构把两个域组织起来”。
结构类型里还藏着一个更难啃的硬骨头:对替换型结构的判断和生成普遍不理想。替换是最“烧脑”的隐喻结构,因为目标域的一部分要从画面里隐去,观众需要根据上下文脑补出缺失内容。把这种结构做对,意味着模型不仅在画面里画出了源域物体,还清楚地理解了自己“故意留白”了什么。显然,大多数模型还没有建立起这种高级的视觉修辞意识。
图5:所有模型聚合后,预测结构类型与真实结构类型的混淆矩阵。替换型结构的错误最集中,模型常常把它误判为融合或并置。
再看维度打分,一个更有意思的现象出现了:所有模型的“感知和谐”分数都是三维度里最高的,区间在3.43到4.38之间,而“隐喻效能”和“隐喻逻辑”普遍偏低。两者差距在弱模型身上尤其刺眼,OmniGen2的和谐分有3.45,效能分却只有2.53,落差接近1分。这意味着模型做出来的图往往“精美但无神”——画面本身不突兀,但观众看完很难第一时间读出创作者想要的隐喻含义。好看的皮囊和有趣的灵魂,在这项任务里被生生拆成了两个维度。
图4:七个代表性模型在四条视觉隐喻上的生成结果定性对比。每行对应一条隐喻,左侧为该隐喻的概念提示词,其中蓝色文字标出目标域、紫色文字标出源域;四行示例分别覆盖融合、替换与并置三种结构。
从定性样例里能直观看到三大类“翻车现场”。第一类是结构形式搞错,比如提示词明显暗示“香烟与枪形阴影”的并置,Stable Diffusion 3.5 Large、Z-Image和Janus-Pro却把两域硬焊成了同一个物体;第二类是域画全了但融合得很生硬,咖啡杯被直接叠在一摞枕头上,两者各自为政,看不出它们是在表达同一个概念;第三类最致命,模型干脆漏掉一个域,比如Z-Image把抓娃娃机里的“商务人士”全部画成了普通玩具球,隐喻彻底失效。这些失败模式也反向验证了量化结果:结构、映射和跨域视觉整合,正是当前文生图通往“创意表达”这条路上最颠簸的路段。
提示词粒度揭示模型推理能力差距
前面反复提到VMetaphor-Bench为每个样本准备了概念提示词和描述提示词两套文本,实际价值在对比实验里体现得淋漓尽致。
表2:代表性模型在概念提示词与描述提示词下的表现对比。“Conc.”代表概念提示词,“Desc.”代表描述提示词,“△”为切换到描述提示词后的涨跌。
结果呈现出非常清晰的“反向增益”规律。GPT Image 1.5在拿到描述提示词后,MCQ综合只涨了3.1个百分点,维度分不升反降0.06;Nano Banana 2也只涨了4.4%。Nano Banana 2涨了4.4个百分点;而Z-Image在MCQ上直接提升了13.5个百分点,维度分涨了0.69;OmniGen2在MCQ上暴涨16.6个百分点。这里面的潜台词是:头部闭源模型已经具备“自己把抽象隐喻转译成具体构图”的推理能力,给不给详细描述对它影响不大;而开源和统一模型尚缺乏这种内在的视觉推理链路,一旦把构图细节写明白,它们就能发挥出接近真实水平的渲染能力。
描述提示词甚至能显著压缩模型之间的差距。在概念提示词设置下,GPT Image 1.5与Z-Image在维度综合分上差了1.09分;切到描述提示词后,这个差距被压到了只剩0.34分。这个现象给工程实践提了个醒:如果手里只有开源模型,又想生成创意隐喻图,最划算的杠杆不是盲目堆提示词咒语,而是把概念拆解成“画面里有什么、两个域怎么结合”的显式视觉描述,让模型把有限的推理资源留给渲染,而不是浪费在语义脑补上。
评估器可靠性验证与未来展望
看到这里,不少读者心里可能会犯嘀咕:让MLLM当裁判去评判另一批文生图模型,会不会“五十步笑百步”?裁判自己会不会也读不懂隐喻?论文专门设计了两项可靠性验证来回应这种质疑。
表3:两个不同MLLM裁判下的模型排名对比。前五名模型在MCQ与维度两个口径上的排名完全一致。
作者用GPT-5.4把整条评测流程又完整跑了一遍,与默认裁判Qwen3.5-27B的结论做对比。结果显示,11个模型在两个裁判心中的排名高度一致,前五名的席位完全重合,MCQ口径下Spearman等级相关系数达到0.991,维度打分口径也高达0.936。这意味着文章的结论对“用谁当裁判”不太敏感,不是某个特定模型审美偏好的产物。
表4:MLLM裁判与人类标注者在200张抽样图像上的对齐情况。上方的(a)部分是MCQ对齐的平衡准确率,下方的(b)部分是维度打分的平均绝对误差。
更深一层的人机对齐验证也相当扎实。五位受过专门训练的标注员用同样的协议评估了200张抽样生成图,Qwen3.5-27B的MCQ综合对齐平衡准确率达到80.24%,四个层级全部超过71%;维度打分的平均绝对误差控制在0.8以内,与人类判断的偏差很小。有趣的是,人机对齐最薄弱的环节依然是L2结构类型与L4元素映射——这两级判断连人类自己都要花更多时间斟酌,模型裁判给不准也在情理之中。
回归到整项工作的意义,VMetaphor-Bench最大的贡献不是给模型排名,而是首次把“视觉隐喻生成”从艺术创作的黑箱里拽出来,变成了一个有清晰层级、可复现、可诊断的系统性评估任务。它让研究者第一次能回答:模型缺的到底是哪一个环节?是元素的召回、结构的搭建、跨域映射的推理,还是最终观感的打磨?从商业创意的角度看,这恰恰是把文生图模型从“绘画工具”推向“创作伙伴”的关键一步。未来评测方向也完全可以沿着多语言文化隐喻、动态视频隐喻、图文混合表达等维度继续延伸。
龙迷三问
这篇论文到底在解决什么问题? 同济大学等机构提出VMetaphor-Bench,首个面向文生图模型视觉隐喻生成的基准,含1500个真实创意样本与9594道评估题。
这篇工作最值得看的点是什么? GPT Image 1.5取得最佳综合性能(MCQ准确率85.4%,维度评分4.30),闭源模型显著优于开源模型;所有模型在结构类型和元素映射层级表现最差,揭示组合性结构构建是核心瓶颈。
这篇工作的边界或风险在哪里? 优点:(1) 首次系统性地构建视觉隐喻生成评估基准,填补了该领域空白;(2) 混合评估框架结合客观多选题与主观维度评分,提供细粒度、可解释的诊断;(3) 数据集规模大、质量高,经过严格人工验证;(4) 评估了11个代表性模型,覆盖面广。缺点:(1) 数据分布不均衡,反映真实创意图像中视觉隐喻的自然分布;(2) 依赖MLLM-as-judge,在主观判断上存在局限;(3) 提示词和源图像以英文和西方创意传统为主,缺乏跨文化多样性。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
首个把视觉隐喻生成做成系统性评测基准的工作,双提示词+混合评估框架的设定兼顾创新与实用;整体属于评测设计创新,而非提出新的生成模型。
实验合理度: ★★★★☆
参测模型涵盖闭源、开源扩散与统一多模态三条路线,且做了跨裁判一致性和人机对齐验证,实验设计严密;扣掉的一星在于部分结论仍然建立在单一裁判的口径上。
学术研究价值: ★★★★★
为“文生图模型究竟有没有抽象表达能力”这一核心问题提供了一个可量化、可复现的观测窗口,后续研究者可以顺着这套分层框架继续深挖结构组合能力的提升方法。
稳定性: ★★★☆☆
评测基准本身质量扎实,跨裁判一致性高;但文生图模型迭代极快,榜单结论容易随新版本刷新而过时,需要基准长期维护和扩充才能保持稳定解释力。
适应性以及泛化能力: ★★★★☆
十大主题类别和三种结构类型覆盖了日常创意表达的主要形态,双提示词设计也增强了基准适配不同评测目的的能力;不过素材目前主要来自单一创意图库,存在一定的文化和风格倾向。
硬件需求及成本: ★★★★☆
评估全程不需要训练模型,调用现成MLLM即可完成大批量打分,开源模型+本地部署的路线也降低了复测成本;主要开销集中在海量图像生成环节。
复现难度: ★★★☆☆
评测协议描述得相当完整,但论文目前没有公开数据集、标注文件和代码仓库,新用户想完全复现评估需要自行重建整套数据与提示词管线,门槛不低。
产品化成熟度: ★★★☆☆
作为测评工具已经具备较高的工程可用性,可以嵌入到设计创意系统的模型选型流程中;但视觉隐喻生成本身的成功率还达不到商业设计师直接使用的标准,更适合作为人机协作的灵感激发环节。
可能的问题:
数据收集与两阶段标注都依赖同一个闭源大模型,人工虽然做了交叉校验,但提示词和题目仍可能携带该模型的语义偏好;另外,闭源模型之间基于API的对比存在版本与服务配置差异,数字不宜跨时间直接比较。未公开数据与代码也明显限制了复现生态。
[1] Chen C, Wang Z, He Y, et al. Blending Concepts: Benchmarking Visual Metaphor Generation in Text-to-Image Models. arXiv:2609.02502v1, 2026.
[2] Fauconnier G, Turner M. The Way We Think: Conceptual Blending and the Mind’s Hidden Complexities. Basic Books, 2002.
[3] Bitton-Guetta N, et al. MetaCLUE: Towards Comprehensive Visual Metaphors Research. CVPR 2023.
[4] Ghosh D, et al. GenEval: An Object-Centric Framework for Evaluating Text-to-Image Generation. 2023.
[5] Huang K, et al. T2I-CompBench: A Comprehensive Benchmark for Open-World Compositional Text-to-Image Generation. CVPR 2024.
[6] OpenAI. GPT Image 1.5 System Card. 2026.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!