← 返回 PaperDaily 视觉与图像

哈工大等提出PRISM:让AI画画学会“看图自改”,TIFA飙至91.4%新SOTA

文生图提示优化一直是热门,但之前的方法要么只看文本要么只给分数,缺少结构化图像诊断。PRISM另辟蹊径,用一个VLM同时当裁判和教练,先看图挑毛病再针对性改提示,最后用强化学习让模型越改越好。在TIFA上从76.1飙升到91.4,关键是可解释性极强——每个修改都有理有据。

原论文信息如下:
论文标题:
PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

发表日期: 2026年7月

发表单位: 哈尔滨工业大学(深圳)、中山大学、华南理工大学、广东工业大学

原文链接: https://arxiv.org/pdf/2607.24353v1.pdf

开源代码链接: https://anonymous.4open.science/r/PRISM-FF81

为什么提示优化需要“看图说话”?——现有方法的三大局限

写好提示词扔给Stable Diffusion,结果画面缺胳膊少腿,你完全不知道问题出在哪儿。现有优化方法大多“闭眼改文字”:第一类用遗传算法或语言模型做文本增删改,但从没见过生成的图;第二类引入CLIP分数等外部奖励,但只给一个干巴巴的标量分数,语义、美学、风格问题一概不知;第三类如VisualPrompter和TIR已利用图像反馈,但设计是“测试时管线”——独立评判模型加重写模型,无法学习可复用策略,反馈目标也碎片化。
图1:PRISM的动机示意,对比现有方法(纯文本改写、提示扩展、标量奖励)与PRISM(结构化视觉反馈)
图1:PRISM的动机示意。左侧展示现有方法的局限——纯文本改写、提示扩展、标量奖励,均缺乏图像理解;右侧展示PRISM的核心思路:基于生成图像的结构化视觉诊断驱动提示优化。
总结三大局限:① 忽略图像诊断——闭着眼睛改;② 反馈信号贫瘠——只给分数不给具体问题分析;③ 策略难以复用——每个提示都得重新跑整个管线。

PRISM框架:把图像诊断和提示重写装进一个模型

PRISM的核心思想:让同一个VLM既当裁判又当教练。裁判看生成的图,诊断语义、美学、偏好三个维度的具体问题并打分;教练根据诊断报告精准修改原始提示。
PRISM用Qwen3-VL-8B-Instruct作为骨干,两阶段训练后输入原始提示,输出:结构化视觉诊断(三维度文本描述+1-10分:语义一致性检查对象属性空间关系,美学质量评估构图光线色彩,偏好对齐衡量自然度风格吸引力)和优化后的提示词
流程形成闭环:原始提示 → 生成图像 → 诊断打分 → 修改提示 → 重新生成。第二次修改还能参考前次诊断,越改越好。
图2:PRISM框架总览。阶段I进行多任务监督初始化,使VLM同时具备提示重写和视觉反馈评估能力;阶段II通过自奖励策略优化,候选提示由冻结的T2I生成器渲染,再用结构化视觉反馈评估,混合奖励聚合后更新策略。
图2:PRISM框架总览。阶段I进行多任务监督初始化,使VLM同时具备提示重写和视觉反馈评估能力;阶段II通过自奖励策略优化,候选提示由冻结的T2I生成器渲染,再用结构化视觉反馈评估,混合奖励聚合后更新策略。
例如原始提示“A little bird is standing on the branch with the sun rising behind it”,生成的图像太阳不明显、色彩对比弱。PRISM逐一指出问题,优化为“a small red bird sitting on a gnarled branch against a massive, vibrant sunrise...”,图像质量瞬间提升。

怎么让模型学会“自夸自改”?——两阶段训练揭秘

阶段一:多任务监督初始化。构造四类训练数据:提示重写(Drew,原始到专家映射)、视觉反馈评估(Dfb,输入提示+图像输出诊断和分数)、纯分数校准(Dscore)、反馈引导重写(Dfgr,输入原始提示+图像+诊断输出优化提示)。四个任务共享VLM,多任务损失联合训练,反馈引导重写权重加倍(λfgr=2)。
阶段二:自奖励策略优化。让模型自己生成候选提示、自己看图打分、根据分数改进策略。步骤:① 当前策略πθold采样K=8个候选提示;② 冻结的T2I生成器生成对应图像;③ 冻结的初始VLM做三维诊断打分得奖励向量r=[rsem, raes, rpref];④ 混合奖励聚合得标量R,计算组内优势;⑤ 使用组序策略优化(GSPO)更新策略。模型完全靠自我诊断进化,从未见过外部专家标注。

混合奖励机制:既要全局优化,也要补短板

简单加权平均合成三维分数有隐患:语义好但美学差时分数仍不低,模型会在弱项上偷懒。PRISM提出混合奖励:理想点奖励计算与理想向量[1,1,1]的欧氏距离,鼓励整体提升;切比雪夫奖励计算无穷范数距离,专门惩罚最差维度。最终奖励R = α × Rideal + (1-α) × Rcheb,α=0.5时各占一半。
混合奖励公式:Rideal = 1 - ||di||2 / ||w⊙r*||2 ; Rcheb = 1 - ||di||∞ / ||w⊙r*||∞ ; R = αRideal + (1-α)Rcheb
混合奖励公式。其中di = w ⊙ (r* - ri¯),r*=[1,1,1]为理想反馈向量,w为维度权重(默认[0.5,0.25,0.25]强调语义)。
消融实验证实:纯加权和奖励TIFA分数88.1,混合奖励提升到91.4,美学和偏好分数也略有改善。

实验结果一览:SOTA全面超越,细粒度对齐尤其亮眼

整体图像质量评估:在BeautifulPrompt测试集上,PRISM在CLIPScore、Aesthetic、PickScore、HPSv2、ImageReward五个指标上全部最佳或次佳。完整版美学评分6.318、PickScore 22.526、HPSv2 0.305、ImageReward 1.285,大幅领先235B参数的Qwen3-VL-235B-A22B,而PRISM骨干仅8B参数。
表1:BeautifulPrompt测试集上的整体图像级评估。PRISM-SFT为监督初始化变体,PRISM为完整模型。加粗表示最佳,下划线表示次佳。
表1:BeautifulPrompt测试集上的整体图像级评估。PRISM-SFT为监督初始化变体,PRISM为完整模型。加粗表示最佳,下划线表示次佳。
细粒度语义对齐评估:TIFA分数从原始提示76.1提升到91.4,超过GPT-4o(90.3)和Qwen3-VL-235B-A22B(89.6)。T2I-CompBench六个子任务平均分0.555,比原始0.449提升23.6%,所有baseline中排名第一,空间关系(0.429)和纹理(0.732)优势尤其明显。
表2:TIFA和T2I-CompBench上的细粒度语义对齐评估。加粗表示最佳,下划线表示次佳。
表2:TIFA和T2I-CompBench上的细粒度语义对齐评估。加粗表示最佳,下划线表示次佳。
消融实验:自反馈(Self-FB)优于外部评估器(Ext-VLM),模型自己打分更稳定。第二轮优化后PickScore从22.254提升到22.357,TIFA从88.9提升到89.3。
表3:反馈源消融。Self-FB表示使用自反馈,Ext-VLM表示使用外部VLM评估器,TF-Ext表示免训练测试时优化。
表3:反馈源消融。Self-FB表示使用自反馈,Ext-VLM表示使用外部VLM评估器,TF-Ext表示免训练测试时优化。
表4:奖励聚合策略消融。混合策略(Hybrid)在所有指标上最佳。
表4:奖励聚合策略消融。混合策略(Hybrid)在所有指标上最佳。
PRISM在多个独立基准上表现出系统性领先,不同论文实验设置可能存在差异,但多维度一致性表现增强了结论可靠性。

可解释反馈:每个提示修改都有据可依

PRISM先给出详细诊断报告再给出修改建议。例如原始提示“A child flying a kite in a sunny park”,生成的图像孩子漂浮、风筝单调。PRISM诊断:“孩子不正常漂浮而非奔跑;过曝草地、单调白色风筝、暗色背景降低精致度;缺乏快乐表情和鲜艳色彩”。然后给出优化提示,包括“真实照片风格、奔跑的孩子、鲜艳风筝、温暖午后阳光、35mm镜头、浅景深”等细节。
图4:PRISM的定性示例。每个示例展示了原始提示、初始生成图像、结构化视觉诊断、优化后的提示以及优化后的图像。
图4:PRISM的定性示例。每个示例展示了原始提示、初始生成图像、结构化视觉诊断、优化后的提示以及优化后的图像。
这种结构化诊断让用户理解改了什么,还能指导自己写更好的提示。PRISM还能多轮迭代,第二轮优化后效果进一步提升,尤其对初始分数低的样本改进空间更大。
图3:迭代反馈优化结果。第二轮优化带来额外提升,尤其对初始分数较低的样本。
图3:迭代反馈优化结果。第二轮优化带来额外提升,尤其对初始分数较低的样本。

龙迷三问

Q:PRISM为什么选择Qwen3-VL-8B作为骨干?A:工程和效果的平衡。8B推理效率快,且实验表明经过PRISM训练的8B模型在多个指标上超越了235B的Qwen3-VL-235B-A22B。

Q:PRISM推理成本如何?A:每次优化需一次VLM调用(诊断+重写)和一次T2I生成,迭代按轮次增加。比外部评估器+重写器的两段式方案少一次调用。PRISM每次输入需2次T2I和1次VLM调用,典型测试时优化方案(如TIR)需至少3次T2I和2次VLM调用。

Q:代码和训练数据会完全开源吗?A:代码承诺开源(anonymous.4open.science/r/PRISM-FF81),训练数据未明确说明。数据需专家标注或GPT-4o自动生成,存在复现门槛,但主干方法清晰,开源后可基于自己数据训练。

欢迎在评论区留言讨论~

龙哥点评

论文创新性:★★★★✰将VLM、结构化视觉诊断、自奖励机制、混合奖励聚合有机融合,自奖励循环设计很有想法。

实验合理度:★★★★✰实验全面,涵盖整体质量、细粒度语义、消融、扩展性,baseline包含主流方法,结论可信。缺少与Midjourney V6/DALL-E 3的对比。

学术研究价值:★★★★★提出“视觉闭环提示优化”新范式,将可解释AI与文生图优化结合,Chebyshev策略值得多目标优化任务借鉴。

稳定性:★★★★✰使用自动评估指标,未在真实用户研究中测试。结构化诊断的可解释性有助于高风险场景人工校验。

适应性以及泛化能力:★★★★✰在FLUX.2上做了泛化测试,可适配不同T2I生成器。不同领域(如医学图像)表现尚未验证。

硬件需求及成本:★★★✰✰8B VLM可在RTX 4090上推理,完整训练需A800 80G。单次优化成本可接受,大规模应用需优化。

复现难度:★★★✰✰提供方法细节和伪代码,承诺开源代码。训练数据构建依赖GPT-4o或专家标注,完全复现仍有工作量。

产品化成熟度:★★★✰✰研究阶段,自动评估优秀。实时性、工具集成、用户研究是关键问题,但思路清晰潜力大。

可能的问题:1. 自奖励优化存在“self-rewarding bias”。2. 三维诊断划分清晰但真实场景高度耦合,分开打分可能丢失交互信息。3. FLUX.2泛化测试仅在附录简略报告。


主要参考文献

[1] Cao et al., BeautifulPrompt: Towards automatic prompt engineering for text-to-image synthesis. EMNLP 2023, Industry Track.
[2] Wu et al., VisualPrompter: Decomposing prompts with Davidsonian Scene Graphs for target-specific optimization. CVPR 2025.
[3] Khan et al., TIR: Closed-loop test-time refinement with history-aware feedback. ICLR 2025.
[4] Zheng et al., Group Sequence Policy Optimization (GSPO). arXiv 2025.
[5] Bai et al., Qwen3-VL Technical Report. arXiv 2025.

融会贯通

PRISM在提示优化领域开辟了“可解释+自奖励”新路线,三个显著优势:

从“黑盒”到“白盒”:结构化诊断让每个修改有据可依。

从“外部依赖”到“自主迭代”:一个模型自给自足,通过自奖励持续自我提升。

从“单维优化”到“多目标均衡”:Chebyshev惩罚有效控制短板。

PRISM展示了一种将多模态大模型同时用作“评估者”和“优化器”的通用范式,未来可扩展到视频生成提示优化、3D场景提示生成等领域。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
PRISM让AI学会看图自省,你也想加入前沿讨论?
扫描下方二维码,和龙哥一起探索文生图最新黑科技!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。