← 返回 PaperDaily 视觉与图像

一条指令18个目标,Qwen/Flux靠“导演”终于不翻车

设计师一条需求写上200字,AI画图却常常翻车?本文提出LGBench基准,把长指令拆成18-22个目标,暴露出现有模型的脆弱;而VisionDirector像导演一样规划、执行、验证、回滚,让Qwen、Flux等模型在GenEval和ImgEdit上双双刷新SOTA,编辑轮数还减少了26%。

一条指令18个目标,Qwen/Flux靠“导演”终于不翻车
原论文信息如下:
论文标题:
VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis
发表日期:
2025年12月
发表单位:
香港科技大学、香港中文大学、华为研究
原文链接:
https://arxiv.org/pdf/2512.19243.pdf
给AI画图工具写一段200字的需求,你猜会发生什么?大概率是:AI画出了一张让人血压飙升的“缝合怪”——要一只戴礼帽的柴犬,它给你画了柴犬但帽子歪到天上,背景说好是东京塔结果变成埃菲尔铁塔,右下角要的“NEW BEGINNING”标语直接糊成一团乱码。别急,这锅不全得AI背——你那条指令里藏着20来个目标,普通模型根本“记不全”。
这不是个别现象,而是当前扩散模型(Diffusion Model)的普遍困境:长指令多目标对齐能力太弱。现有测试基准比如DrawBench、TIFA、MagicBrush,大多只用一两个显式目标构造提示词,模型在真实多目标场景下的脆弱性被严重掩盖。换句话说,以前考试总是考“2+2”,但真实工作场景是“35×47÷(2+3)”,模型一算就崩。
港科大、港中文和华为研究团队最近放出的新作——VisionDirector,就是要正面刚这个问题。它不但给出了一个能对“几十个目标”逐项验证的基准LGBench,还提了一套“导演式”闭环控制框架,让AI像拍电影一样:先规划、再执行、每拍一条就检查一遍,不对就重来。这套打法在GenEval上直接刷到0.94分,比原版Qwen-Image高出7个百分点,编辑轮数还降了26%。

1. 长指令生成:现有模型的致命弱点

VisionDirector 项目主图
真实世界的设计需求,从来都不是一句话的事。一张商业主视觉海报可能同时包含:一个人物的动作姿态、两种以上的材质风格、三段文字排版、两处logo位置、一组色彩明暗规范、甚至还要考虑镜头焦段和光影氛围。设计师写出来的需求,往往是一段数百字的长文本。
论文在引言里点破了这个矛盾:现有扩散模型虽然在美学质量上突飞猛进,但面对“全局风格+局部对象+文字排版+logo保真”这种多目标耦合的长指令时,经常顾此失彼。几个主流开源及商用模型在T2I任务上的完成率惨不忍睹——最好的Qwen-Image也只拿到71.8%的目标通过率,文本/logo相关的局部编辑更是重灾区。
为什么会这样?论文给了一个很直白的解释:现有模型的瓶颈不是画质,而是“听懂”多目标长指令的语义理解能力。因此,与其等下一代更聪明的基座模型,不如在模型外面加一个能规划、能检查、能纠错的“导演”。

2. LGBench:首个长目标多模态基准

要证明模型“不行”,首先得有一把能测出差距的尺子。现有基准DrawBench、TIFA、MagicBrush等,提示词通常只包含一两个明确目标;GenEval和MagicBrush虽然增加了任务数量,但仍然停留在短指令和低粒度评分上。也就是说,大家一直在测“简单题”,却没人系统地测“综合题”。
为了把这个空白补上,团队推出了LGBench(LongGoalBench,长目标基准)——一个包含2000个任务(1000个文生图T2I任务 + 1000个图生图I2I任务)、合计29252个细粒度标注目标的双模态基准。每条T2I指令平均包含18个目标,范围在15到23个之间;I2I指令平均11.2个目标。目标类型高度混合:新增物体、文本叠加、视觉效果、颜色约束、光照指令、构图要求等等,全都耦合在同一条指令里。
图2:LGBench中T2I和I2I子集的目标类型分布
图2:LGBench中T2I和I2I子集的目标类型分布——各类目标比例均衡,反映真实设计任务的多约束特性
LGBench是怎么构建的?答案是半自动化流水线,核心是用Claude 4.5 Sonnet做“提示词作曲家”。先人工定义每个类别的视觉目标池,比如“以高显著性加入熔金质感物体”“将色温设为3200K”,每个目标附带强度数值(0-100%)和类型标签;然后Claude读取目标池,负责把它们组织成一段连贯、无矛盾、机器可验证的自然语言指令。
图3:LongGoalBench的构建流程
图3:LongGoalBench(LGBench)的构建流程
I2I部分更是讲究:先用Flux-Krea生成一批代表不同场景(人物、动物、自然等29个大类)的“底图”,然后让具备视觉能力的Claude真的“看”这些图,识别出显著区域(人脸、灯光、文字块等),再提出10到22条具体的编辑指令,比如“把头发光泽度提升60%”或“叠加优雅衬线字体的TIMELESS BEAUTY标语”。因为Claude看得见图,给出的指令天然跟图像布局在空间和语义上保持一致,不会出现“让大象在天上飞”这种离谱编辑。
表1:LGBench数据统计结果
表1:LGBench统计数据——2000个任务、29252个目标,覆盖418个细分类别
自动评估交给谁?论文选用了Qwen3-VL-32B-Instruct作为多模态验证器。它把长指令转换成结构化目标集合,对每张生成图逐步推理,给出每个目标的通过/不通过判定,置信度低于0.81的结果会被过滤。一个任务如果有80%以上的目标通过才算成功,50%-80%算部分成功。这种设计让LGBench的评分不依赖人工,可扩展性强,还能按目标类型(文字、物体、颜色、光照等)逐项诊断模型短板。
表3:LGBench与其他基准的对比
表3:LGBench与其他T2I/I2I基准的能力对比——双模态、长链指令、混合目标、自动目标级验证,四项全占
那主流模型考得怎么样?一句话:惨不忍睹,但惨得很有信息量。从表2可以看到,Qwen-Image的总体目标完成率最高,71.8%;Flux-Krea次之,66.8%;Flux-Dev只有40.0%,文本相关目标的通过率只有0.8%——约等于全军覆没。I2I赛道上,Qwen-Edit+最好,71.0%,Flux-Kontext只有55.9%,还有7.3%的任务完全失败。文字排版、局部物体添加、光照精修这几个维度,是几乎所有模型的共同失分点。
表2:有无VisionDirector加持的模型性能对比
表2:模型在LGBench上使用/未使用VisionDirector的效果对比——所有基座模型在加持后各项指标均有提升

3. VisionDirector:导演式闭环控制框架

既然模型“听不懂”,那就在外面加一个“翻译官”和“监工”。VisionDirector的定位非常清晰:不重新训练任何扩散模型,而是在现有生成模型之上叠加一个“视觉-语言”闭环控制系统。整个系统三个角色各司其职:

① 规划器(Planner VLM):基于Qwen3-VL-8B实现。负责解析用户的长指令,把它分解成结构化目标清单,给每个目标标注类型(全局/局部/文字/布局等)、冲突标志,并预测一次性执行的可行性分数。

② 执行器(Editor):文生图或图生图的扩散模型(如Qwen-Image、Qwen-Image-Edit)。它是“无状态”的干活的——只按规划器下达的短指令做具体编辑,不做全局规划。

③ 验证器(Verifier VLM):负责检查结果,对照目标清单逐项判定通过/不通过,并决定是否触发回滚。

三个模块之间通过纯自然语言消息通信。这意味着执行器或验证器可以随时升级换代,规划器不用重新训练——这个模块化设计非常优雅,工程上的可维护性直接拉满。
VisionDirector 框架概览图
VisionDirector闭环流程总览:规划器解析长指令→决策一次性或分阶段→执行编辑→验证器检查→回滚或继续
具体流程上,VisionDirector采用8个确定性阶段,很像DeepSeek-R1那种“思考-行动-验证”循环,但针对视觉生成做了专门设计:
第1步“指令摄入”:规整多模态输入(包括参考图的元数据);第2步“目标提取与规划”:把长指令拆成多个子目标,放入“待办清单”;第3步“一次性生成还是分阶段执行”:如果一次性成功率估计较高且改动区域小,就直接生成;否则按“全局→局部”的顺序分批执行,每批只做一到两个目标;第4步“微网格执行”(Micro-Grid Sampling):对每个编辑指令生成多个随机种子的候选图,让轻量级VLM评委挑出最好的,从而缓解扩散模型的随机性;第5步“验证与回滚”:对照待办目标检查结果,如果新编辑反而破坏了整体对齐度,就回滚到上一版最佳图,并重新排列剩余目标避免重复踩坑;第6步“决策与继续”:全部达标就停止,否则根据失败类型切换策略——局部问题用inpainting(局部重绘),全局问题触发场景级重生成;第7-8步“循环与输出”:每轮结束前系统自问“还能不能更好?”来判断早停,最后输出成图及完整推理轨迹供审计。
这套机制的精髓在于:它把生成从“一次性赌博”变成了“分步执行 + 校验纠错”的确定性流程。每一个编辑动作都有验证、有兜底,不会让小错误滚雪球。

4. GRPO强化学习:从4.2轮到3.1轮的效率跃升

训练-free的VisionDirector已经能显著改善指令遵循能力,但还有一个小烦恼:太墨迹。平均要4.2轮编辑才能收敛一个任务。能不能让“导演”更果断、更高效?
论文在此引入强化学习中的GRPO(Group Relative Policy Optimization,组相对策略优化)。GRPO是PPO的轻量变体:传统PPO需要额外训练一个Critic价值网络来估计优势函数,而GRPO对同一个提示词采样多条轨迹,直接用“组内相对好坏”作为基准来更新策略,省掉了Critic网络,实现更简单、训练更稳。
论文的目标函数长这样:
J_GRPO(θ) = E[ (1/G)Σᵢ (1/Σₜ I(yₜ⁽ⁱ⁾)) Σₜ I(yₜ⁽ⁱ⁾) L_clip(ρₜ⁽ⁱ⁾, Âₜ⁽ⁱ⁾) − β·KL(π_θ ‖ π_ref) ]
看不懂没关系,逐个拆解:G表示每个提示词采样的轨迹数量;I(·)是token级掩码函数,只让规划器自己输出的文本指令参与梯度更新,外部工具产生的token全被屏蔽,防止模型“学坏”;L_clip是PPO风格的裁剪替代损失,防止策略更新过猛;ρₜ是每token的重要性比率(新旧策略概率比值);Âₜ是组归一化优势——组内表现好的轨迹获得正奖励,差的得到负奖励;最后的β·KL项则约束新策略不要偏离参考策略太远。
训练时,每个采样轨迹都会完整回放一遍“规划→执行→验证”的闭环流程,最终生成一张编辑后的图片。然后一个独立的对齐VLM给图片打0到5分,打分的维度包括排版、光照、空间布局等。GRPO调优后,效果立竿见影:平均编辑轮数从4.2降到3.1,推理延迟降低约26%,同时验证准确率不降。这意味着省下的是实打实的GPU时间和API调用成本。而且优化后的策略更擅长“早出高价值编辑”,一旦只剩琐碎残差目标就果断收工,非常像一位有经验的项目经理。

5. 实验结果:全面超越现有方法

看实验前先明确测试维度:文生图用GenEval(组合式生成基准,覆盖单/双物体、计数、颜色、位置、属性绑定等九项任务);图生图用ImgEdit(覆盖增删改、替换、背景、风格、动作等九种编辑原语,评分1-5分)。
图4与表4:VisionDirector工作流与GenEval结果
图4(上方):VisionDirector工作流——规划器解析长指令、决策一次性或分阶段执行、微网格采样、验证与回滚;表4(下方):GenEval基准结果
先看GenEval。表4列出15个代表性模型,HiDream-I1-Full和GPT Image 1(High)分别拿到0.83和0.84,Seedream 3.0也是0.84,Qwen-Image原版0.87。而VisionDirector以Qwen-Image为基座跑出0.94的整体分——不仅比基座高了7个百分点,还显著超过所有闭源商用模型。细看子项:Counting(物体计数)从0.89提升到0.96,Position(位置关系)从0.76大幅跃到0.88,Attribute(属性绑定)从0.77飙升到0.95。这些恰好是传统扩散模型最容易翻车的组合式推理任务。
再看ImgEdit。表5显示,OmniGen、UltraEdit、AnyEdit等开源编辑模型整体分在2.45到2.96之间,VisionDirector达到明显更高水平,在Add(添加)、Replace(替换)、Style(风格)、Action(动作)等多个原语上把开源模型甩开一个身位,甚至逼近闭源商业模型的水平。这个结果说明闭环控制并非只对生图有效,对“保留未编辑区域完整性”这类图生图需求同样管用。
表5:ImgEdit基准上的结果
表5:ImgEdit基准上的结果——VisionDirector在九个编辑原语上全面超越开源模型,与闭源模型不相上下
LGBench上的提升更是直观(见前文表2):把VisionDirector加到不同基座上,完成率几乎全部上涨。最夸张的是Flux-Dev,从40.0%飙升到62.4%(+22.4%),文本目标成功率从0.8%涨到29.5%——从“完全不能用”变成了“能站起来”。Qwen-Edit+在I2I上也从71.0%升到76.7%,组合编辑类任务从49.3%跳到59.3%。可见一个“导演层”的威力有多大。
I2I任务对比效果图
图5:图生图任务上的定性对比——VisionDirector在多阶段编辑中保持全局一致性,同时精准执行局部改动
自适应行为分析(图6)揭示了另一个有趣现象:当目标数≤15时,系统多数任务1-3轮收工,一次性生成的比例超过85%;可一旦目标数突破15,一次性偏好的比例急剧降到10%以下,迭代轮数增加到5-7轮。这说明GRPO训练出来的策略不是“一套方案打天下”,而是根据任务复杂度动态切换执行模式——简单的活儿一把过,复杂的活儿分步来,这正是一位成熟“导演”该有的判断力。
图6:VisionDirector的自适应决策行为
图6:VisionDirector的自适应决策——(a) 迭代次数随目标数增加从1-3轮升至5-7轮;(b) 一次性执行偏好从85%以上骤降至10%以下
消融实验也验证了每个组件的价值(表6和表7):去掉微网格采样,排版类指令的随机失败率上升7%;去掉语义回滚,幻觉开始累积,目标覆盖率掉到0.74;而GRPO在缩短26%路径的同时还小幅提升了目标覆盖率。结合所有优化策略后效果最佳。
表6与表7:GRPO效率与策略消融
表6(上):GRPO在LGBench上提升规划效率——目标覆盖率上升,扩散执行次数下降;表7(下):不同优化策略的消融实验结果

6. 总结与展望

VisionDirector这篇工作的价值,不只是刷高了两张榜单,而是给行业提供了一套可复用的“外挂”思路:当底层生成模型不够聪明时,用一个“视觉-语言监督层”把多目标长指令的解析、执行、验证、回滚闭环管起来。加上GRPO强化学习,整个系统还能越用越高效。
LGBench作为一个长期可用的压力测试基准,价值同样不小——以后各家发布新模型时,除了晒GenEval、T2I CompBench之外,又多了一个能反映真实设计需求的多目标基准。
当然,VisionDirector并非银弹。它仍受限于基座模型的上限——Flux-Dev加持后也就62.4%,离商用还有距离。其次,每个任务最多6轮闭环迭代,极复杂的任务可能仍然不够;回滚机制的“无损性”也值得深入研究。未来方向很明确:把导演范式迁移到视频生成、3D内容创建,或者用更强的基础模型作为执行器,让天花板再往上顶一截。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文提出LGBench(2000任务、29k目标)揭示长指令下模型脆弱性,并提出VisionDirector闭环优化框架,以VLM规划+微网格采样+语义回滚+GRPO强化学习,在GenEval和ImgEdit刷新SOTA。
这篇工作最值得看的点是什么?VisionDirector在GenEval上达到0.94的总体分数,超越所有对比方法;在ImgEdit上达到4.35的总体分数,超越所有开源模型并与闭源模型GPT Image 1(4.20)和Qwen-Image-Edit(4.27)相比具有竞争力;在LGBench上,将Qwen-Image的完成率从71.8%提升至74.8%,Flux-Krea从66.8%提升至74.9%。
这篇工作的边界或风险在哪里?优点:(1) 提出LGBench基准,填补了长指令多目标评估的空白;(2) VisionDirector无需训练即可提升多目标遵循能力,且模块化设计便于替换组件;(3) GRPO强化学习进一步提升了效率。缺点:(1) 依赖多个VLM组件,系统复杂度较高;(2) 验证器使用Qwen3-VL-32B,可能引入验证偏差;(3) 在LGBench上的评估使用同一系列模型(Qwen)作为验证器,可能存在偏好偏差。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出VisionDirector,一种无需训练的视觉语言引导闭环控制框架,通过VLM规划器将长指令分解为结构化目标,动态决策单次生成或分阶段编辑,并配合微网格采样与语义验证/回滚机制,实现对扩散模型的多目标指令遵循能力增强。

实验合理度:★★★★☆

GenEval准确率、ImgEdit评分(1-5分)、LGBench目标完成率(Finish Score)、≥80%目标完成率

学术研究价值:★★★★☆

提出VisionDirector,一种无需训练的视觉语言引导闭环控制框架,通过VLM规划器将长指令分解为结构化目标,动态决策单次生成或分阶段编辑,并配合微网格采样与语义验证/回滚机制,实现对扩散模型的。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

GRPO训练后编辑轮次从4.2降至3.1,推理延迟降低约26%。具体计算量未在论文中明确给出。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 依赖多个VLM组件,系统复杂度较高;(2) 验证器使用Qwen3-VL-32B,可能引入验证偏差;

主要参考文献

[1] Meng Chu, Senqiao Yang, Haoxuan Che, et al. VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis. arXiv:2512.19243, 2025.
[2] VisionDirector 项目主页: https://visiondirector.github.io/
[3] Shao et al. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948, 2025.
[4] Shao et al. Dapo: An open-source LLM reinforcement learning system at scale. arXiv:2503.14476, 2025.

end
AI画图总翻车?想第一时间读懂VisionDirector这类前沿框架?扫码加入龙哥读论文粉丝群,一起拆解顶会论文!添加龙哥助手微信号:kangjinlonghelper,备注图像生成+城市+学校/公司+昵称更快入群~ 龙哥读论文微信群覆盖图像处理、大模型、自动驾驶、AI医疗、AI金融五大方向,等你来聊!💙
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。