PRISM的核心思想:让同一个VLM既当裁判又当教练。裁判看生成的图,诊断语义、美学、偏好三个维度的具体问题并打分;教练根据诊断报告精准修改原始提示。
PRISM用Qwen3-VL-8B-Instruct作为骨干,两阶段训练后输入原始提示,输出:结构化视觉诊断(三维度文本描述+1-10分:语义一致性检查对象属性空间关系,美学质量评估构图光线色彩,偏好对齐衡量自然度风格吸引力)和优化后的提示词。
流程形成闭环:原始提示 → 生成图像 → 诊断打分 → 修改提示 → 重新生成。第二次修改还能参考前次诊断,越改越好。
图2:PRISM框架总览。阶段I进行多任务监督初始化,使VLM同时具备提示重写和视觉反馈评估能力;阶段II通过自奖励策略优化,候选提示由冻结的T2I生成器渲染,再用结构化视觉反馈评估,混合奖励聚合后更新策略。
例如原始提示“A little bird is standing on the branch with the sun rising behind it”,生成的图像太阳不明显、色彩对比弱。PRISM逐一指出问题,优化为“a small red bird sitting on a gnarled branch against a massive, vibrant sunrise...”,图像质量瞬间提升。
PRISM先给出详细诊断报告再给出修改建议。例如原始提示“A child flying a kite in a sunny park”,生成的图像孩子漂浮、风筝单调。PRISM诊断:“孩子不正常漂浮而非奔跑;过曝草地、单调白色风筝、暗色背景降低精致度;缺乏快乐表情和鲜艳色彩”。然后给出优化提示,包括“真实照片风格、奔跑的孩子、鲜艳风筝、温暖午后阳光、35mm镜头、浅景深”等细节。
图4:PRISM的定性示例。每个示例展示了原始提示、初始生成图像、结构化视觉诊断、优化后的提示以及优化后的图像。
这种结构化诊断让用户理解改了什么,还能指导自己写更好的提示。PRISM还能多轮迭代,第二轮优化后效果进一步提升,尤其对初始分数低的样本改进空间更大。
图3:迭代反馈优化结果。第二轮优化带来额外提升,尤其对初始分数较低的样本。
[1] Cao et al., BeautifulPrompt: Towards automatic prompt engineering for text-to-image synthesis. EMNLP 2023, Industry Track.[2] Wu et al., VisualPrompter: Decomposing prompts with Davidsonian Scene Graphs for target-specific optimization. CVPR 2025.[3] Khan et al., TIR: Closed-loop test-time refinement with history-aware feedback. ICLR 2025.[4] Zheng et al., Group Sequence Policy Optimization (GSPO). arXiv 2025.[5] Bai et al., Qwen3-VL Technical Report. arXiv 2025.