论文在GenEval(组合语义对齐)、OCR文本渲染、PickScore(偏好优化)三个任务上评估,以Stable Diffusion 3.5 Medium为基座,与Flow-GRPO对比。GenEval总体得分STAR达0.9759,远超高基线SD3.5-M的0.63和Flow-GRPO的0.95。数量(Counting)和颜色(Colors)分别达0.98和0.96,两个物体(Two Obj.)达1.00满分。在其他两个任务上,STAR同样一致提升:OCR文字渲染0.9757 vs 0.96,PickScore 23.60 vs 23.40。定性结果也印证了量化指标——经过STAR后训练,模型在呈现复杂场景时对提示词细节的还原更加完整。STAR通过轻量级注意力引导奖励分配,在几乎不增加计算开销的前提下,显著提升了文生图模型在组合语义生成、文字渲染和偏好对齐三方面能力。这种从“怎么用奖励”入手而非“怎么设计奖励”的思路,为RL后训练提供了极具实用价值的接口。
[1] Liu, J. et al. Flow-GRPO: Training flow matching models via online RL. NeurIPS 2025.[2] Ghosh, D. et al. GenEval: An object-focused framework for evaluating text-to-image alignment. NeurIPS 2023.[3] Kirstain, Y. et al. Pick-a-pic: An open dataset of user preferences for text-to-image generation. NeurIPS 2023.[4] Black, K. et al. Training diffusion models with reinforcement learning. ICLR 2024.[5] Wallace, B. et al. Diffusion model alignment using direct preference optimization. CVPR 2024.[6] Esser, P. et al. Scaling rectified flow transformers for high-resolution image synthesis. ICML 2024.[7] Shen, J. et al. STAR: SpatioTemporal Adaptive Reward Allocation for Text-to-Image RL Post-Training. arXiv:2512.04085, 2025.