← 返回 PaperDaily 视觉与图像

让AI画图"指哪打哪"!STAR新方法:让奖励信号精准导航,GenEval得分飙至0.9759

以前给AI发“大锅饭”奖励,生成区域无论主次都一个待遇,难怪画出来的图总在细节上翻车。这次STAR的方法挺巧妙——直接把模型里的注意力图拿来当导航,给“画什么”和“画在哪里”的区域多发奖励。效果是真不错,GenEval飙到0.97,而且计算量几乎没增加,属于花小钱办大事的典范。

让AI画图"指哪打哪"!STAR新方法:让奖励信号精准导航,GenEval得分飙至0.9759
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
以前给AI发“大锅饭”奖励,生成区域无论主次都一个待遇,难怪画出来的图总在细节上翻车。这次STAR的方法挺巧妙——直接把模型里的注意力图拿来当导航,给“画什么”和“画在哪里”的区域多发奖励。效果是真不错,GenEval飙到0.97,而且计算量几乎没增加,属于花小钱办大事的典范。


原论文信息如下:
论文标题:
STAR: SpatioTemporal Adaptive Reward Allocation for Text-to-Image RL Post-Training
发表日期:
2025年12月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2512.04085.pdf

生成图像为何"指哪打哪"?

文生图模型面对“三个红色气球和一个蓝色蛋糕”这类组合指令,常搞错数量、颜色甚至漏掉物体。为纠正这些毛病,研究者引入强化学习(RL)后训练:让模型画图,外部评判给整张图打分,模型目标就是刷分。但问题在于——这个总分该怎么用?
现有方法(如Flow-GRPO)把最终得分变成标量优势,均匀撒到整个生成过程的每个去噪步和每个像素上。这就像老师给小组作业打总分后平均分给组员——谁出力、谁摸鱼,根本分不清。模型花了大量精力优化与提示词关系不大的背景区域,而对真正决定得分的对象(如“红色气球”)只得到与其他区域一样的更新强度,效率低、效果受限。
问题的根源在于:文生图生成过程具有时空结构——不同去噪阶段负责全局布局、物体形成、细节优化;每个阶段只有部分潜在区域与提示词关键内容直接相关。而最终奖励是整体标量,并未告诉我们“哪里做对了”、“哪里做错了”。
插图

奖励信号分配不均

具体来看,现有RL后训练方法(如Flow-GRPO)对同一提示词采样多张图像组成组,用外部奖励模型打分,再组内归一化得到标量优势Aᵢ,最后用Aᵢ加权整个生成轨迹的对数概率更新参数。注意,这个Aᵢ作用于所有去噪步和所有空间位置是等权重的。
但图像级奖励并不意味着整张图对奖励的贡献是均匀的。即使提示词是“a bicycle”,文本对齐主要取决于自行车所在区域,而非背景。若提示词包含颜色、数量、空间关系,得分更依赖于几个语义关键区域。直接用标量优势更新所有位置,相当于强迫模型记住与提示词无关的噪声模式,徒增训练负担,还易走入局部最优。
这种“一视同仁”的信用分配导致了“粒度不匹配”(granularity mismatch),好比学校想提高数学成绩,却对语文、体育也投入同样资源,效率自然低下。

STAR:用注意力为奖励"导航"

本文提出STAR(SpatioTemporal Adaptive Reward Allocation),核心思想:利用模型自身产生的文本-图像注意力图,确定奖励应重点落在哪些区域。包含三个关键步骤:

第一步:提取提示词关键单元

STAR将提示词分解为多个“奖励相关文本单元”,每个单元对应一个核心成分(主体、颜色、数量等)。例如“一只蓝色的猫坐在红色的椅子上”会提取出“猫”、“蓝色”、“红色”、“椅子”四个单元。提取过程不需要LLM,确定性规则即可。

第二步:从模型内部获取注意力路由信号

在模型生成过程中,每个去噪步骤t,STAR从指定注意力层(论文选第10-15层)读取文本-图像注意力权重,得到路由图αᵢₜ。对每个文本单元qₖ,将其所有token对应的注意力分数选最大值,再对所有单元求和,得到单步热点图Hᵢₜ。然后通过非线性映射Cᵢₜ(u) = [1 + (λ-1)·H̄ᵢₜ(u)](λ≥1控制分配强度)转化为分配系数。关键区域系数>1(放大奖励),非关键区域接近1(保持基础奖励)。

第三步:空间解析的策略目标

STAR将标量优势Aᵢ变成空间优势图Aᵢₜ(u) = Aᵢ·Cᵢₜ(u),然后定义空间化对数概率比——对每个空间位置u分别计算当前策略与参考策略的对数概率差异,再乘以空间优势,最后用PPO风格的clipped ratio更新。这样关键区域会接收到更大梯度信号,非关键区域影响被弱化。
插图

几乎零成本的效果飞跃

STAR没有引入任何新网络结构或额外奖励模型,仅复用模型前向传播中已计算好的注意力图。在Flow-GRPO训练流程上加入STAR,训练时间增加不到2%,峰值GPU内存仅上升1.56%。这意味着STAR几乎是一个“免费”的升级包。
插图

实验结果全对比与总结

论文在GenEval(组合语义对齐)、OCR文本渲染、PickScore(偏好优化)三个任务上评估,以Stable Diffusion 3.5 Medium为基座,与Flow-GRPO对比。GenEval总体得分STAR达0.9759,远超高基线SD3.5-M的0.63和Flow-GRPO的0.95。数量(Counting)和颜色(Colors)分别达0.98和0.96,两个物体(Two Obj.)达1.00满分。
表1:GenEval结果。报告总体分数和六个组合子任务。Obj.表示对象,Attr.表示属性。蓝色表示最佳结果,绿色表示第二佳结果。
在其他两个任务上,STAR同样一致提升:OCR文字渲染0.9757 vs 0.96,PickScore 23.60 vs 23.40。定性结果也印证了量化指标——经过STAR后训练,模型在呈现复杂场景时对提示词细节的还原更加完整。
图2:三个T2I后训练基准上的主要结果。STAR在组合生成、文本渲染和偏好优化上一致优于Flow-GRPO基线。 图4:SD3.5-M原始模型与Flow-GRPO+STAR后训练模型的定性比较。每组提示词中,左图为SD3.5-M生成,右图为SD3.5-M+Flow-GRPO+STAR生成。
STAR通过轻量级注意力引导奖励分配,在几乎不增加计算开销的前提下,显著提升了文生图模型在组合语义生成、文字渲染和偏好对齐三方面能力。这种从“怎么用奖励”入手而非“怎么设计奖励”的思路,为RL后训练提供了极具实用价值的接口。

龙迷三问

STAR与Flow-GRPO是什么关系?STAR不替代Flow-GRPO,而是在其基础上增加轻量“奖励路由”模块。Flow-GRPO提供组相对优势,STAR负责按注意力热点图重新分配到不同区域和去噪步上,可看作Flow-GRPO的增强插件。

STAR需要额外训练或调整超参数吗?需设定几个简单超参数:注意力层选择(默认10-15层)、分配强度λ(默认1.5)、热点图聚合方式。提示词关键单元提取规则需针对任务简单设计,但不需要训练。整体工程难度很低。

STAR是否只适用于Stable Diffusion 3.5 Medium?论文实验以SD3.5-M为基座,但STAR设计适用于任何基于注意力的文生图模型(如SDXL、FLUX.1等),只要模型内部有文本-图像注意力机制即可。理论上具有通用性。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

用模型自己的注意力分配奖励,是“借力打力”的典型。虽注意力图用于定位非新概念,但系统结合到RL后训练信用分配中是首创。减一星因本质是对现有流程的改进。

实验合理度:★★★★✰

对比基线覆盖主流模型和最新RL方法,消融实验完整。但仅在SD3.5-M一个模型上验证,且缺少与其他细粒度奖励方法的直接对比。

学术研究价值:★★★★✰

为RL在生成模型中的“信用分配”问题提供简洁解法,启发性强。减一星因方法相对直接,未涉及深度理论分析。

稳定性:★★★✰✰

三任务表现稳定,但注意力图质量可能受模型本身能力影响。论文未深入分析失败案例或注意力不准确时的表现。

适应性以及泛化能力:★★★✰✰

理论上可应用于任何注意力机制文生图模型,但验证仅限SD3.5-M,需更多实验支持。

硬件需求及成本:★★★★★

额外计算量不到2%,峰值内存仅增加1.56%,几乎可忽略。满分!

复现难度:★★★★✰

方法清晰,但论文未提供开源代码。基于Flow-GRPO开源项目改造应不难,减一星因缺乏源代码。

产品化成熟度:★★★✰✰

作为轻量插件适合集成到现有产品,但需针对具体模型验证并处理注意力噪声问题,目前仍停留在学术验证阶段。

可能的问题:论文未讨论注意力图质量对分配的影响,也未展示失败案例。若模型初始注意力不准,STAR可能放大错误区域更新。整体瑕不掩瑜。


主要参考文献

[1] Liu, J. et al. Flow-GRPO: Training flow matching models via online RL. NeurIPS 2025.
[2] Ghosh, D. et al. GenEval: An object-focused framework for evaluating text-to-image alignment. NeurIPS 2023.
[3] Kirstain, Y. et al. Pick-a-pic: An open dataset of user preferences for text-to-image generation. NeurIPS 2023.
[4] Black, K. et al. Training diffusion models with reinforcement learning. ICLR 2024.
[5] Wallace, B. et al. Diffusion model alignment using direct preference optimization. CVPR 2024.
[6] Esser, P. et al. Scaling rectified flow transformers for high-resolution image synthesis. ICML 2024.
[7] Shen, J. et al. STAR: SpatioTemporal Adaptive Reward Allocation for Text-to-Image RL Post-Training. arXiv:2512.04085, 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
感觉意犹未尽?想跟龙哥和其他小伙伴一起深入探讨STAR的注意力分配、GRPO调参心得?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像生成+上海+清北+龙粉),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。