← 返回 PaperDaily
视觉与图像
小米最新研究:RS-Gen让AI绘图告别“翻车”,逻辑推理+实时搜索,效果直逼闭源
让AI画个"某品牌最新概念车"?传统模型直接摆烂。小米团队提出的RS-Gen,专治AI绘图的"知识盲区"和"逻辑短路"。它像个聪明的项目经理,把复杂任务拆解成"先查资料、再想思路、最后画图",关键是不用重新训练模型,即插即用。在WISE基准上,直接把通义千问的基线模型从0.51拉到0.823,效果直逼商业闭源模型,这波开源社区赢麻了。
龙哥读论文
发布于 2026-08-17 00:20:06
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 让AI画个"某品牌最新概念车"?传统模型直接摆烂。小米团队提出的RS-Gen,专治AI绘图的"知识盲区"和"逻辑短路"。它像个聪明的项目经理,把复杂任务拆解成"先查资料、再想思路、最后画图",关键是不用重新训练模型,即插即用。在WISE基准上,直接把通义千问的基线模型从0.51拉到0.823,效果直逼商业闭源模型,这波开源社区赢麻了。
原论文信息如下:
一文看懂RS-Gen:如何让AI生成图片更智能?
你见过AI画图闹的笑话吗?让模型生成“特斯拉最新发布的Cybertruck”,结果出来一辆四个轮子的拖拉机——因为训练数据里没有这玩意儿,AI只能靠记忆瞎猜。再比如,你说“把图片里的猫换成狗”,模型却把背景里的花盆给改了——因为上下文指代没搞清楚。更离谱的是,让AI解一道火柴棍等式谜题,它直接给你画个不相干的涂鸦——缺乏逻辑推理能力。
现在,小米集团MiLM Plus团队出手了。他们提出的RS-Gen (推理与搜索增强的图像生成框架),一个无需训练、即插即用的多阶段Agent系统,让开源图像模型瞬间开窍。不需要重新训练、不需要昂贵的数据,直接把Qwen-Image等模型的性能拉到商业闭源级别。
从图1就能看出,无论是要求生成“某品牌最新概念车”(需要实时知识)、推断问号处该是什么图形(逻辑推理),还是移动一根火柴让等式成立(物理逻辑),RS-Gen都给出了正确且有视觉说服力的结果。这背后到底是怎么做到的?我们一步步拆解。
三大瓶颈:AI图像生成深陷的困境
为什么最强的图像生成模型,面对复杂指令时还是会翻车?根子出在三个深层问题上。
在多轮对话中,用户常会说“在它旁边加一只猫”或“把它换成红色”。这里的“它”指代什么?现有模型没有上下文记忆,无法准确锚定目标对象,导致编辑失败。
现有模型本质上是“文本到像素”的统计映射,没有因果推理能力。比如让AI画“两个小时后太阳的位置”,它会根据图形模式随意乱画,而不是推断光照角度变化。遇到视觉谜题,模型基本靠蒙。
所有模型的参数化知识在训练完成时就冻结了。遇到长尾实体或刚刚发生的事件,模型就会产生事实性幻觉——它不确认自己不知道,而是自信地编造一个“看起来合理”的错误答案。
RS-Gen:四步闭环破解图像生成难题
面对上述瓶颈,RS-Gen反其道而行之,将图像生成拆解为一个多阶段的Agent闭环:感知 → 分析 → 检索&推理 → 生成 。整个框架不需要任何训练,即插即用,可以轻量级地集成到任何开源图像模型上。
作为系统入口,它的核心任务是多模态共指消解 。它利用记忆机制理解多轮对话历史,把用户中模糊的指代(如“它”“那里”)映射到具体的图像和区域。同时,它还引入一个延迟解决原则 :遇到需要外部知识或逻辑推理的问题,它不会靠内部知识推测,而是原封不动地保留问题,交给下游Agent处理。另外,该Agent还内置一个鲁棒指令翻译协议 :将用户指令中的否定约束(如“不要贴纸”)等价转换为正面描述(如“干净光滑的表面”),大大提升了指令执行的准确率。
这个Agent相当于任务路由器和复杂度评估器 。如果任务简单(如“生成一只猫”),就直接走直连路径,跳过复杂的检索推理。如果任务需要外部知识或逻辑推理,则触发深度解析管道。在深度解析模式下,它会挖掘指令中隐含的约束,形成一系列结构化问题。比如用户说“生成三星最新的折叠屏手机”,Agent会提取出问题Q1:“三星最新折叠屏手机的外观是什么?” Q2:“有哪些关键视觉特征?”等。特别值得一提的是防御性提问 策略:对于非通用实体或长尾实体,强制要求必须通过检索获取准确视觉特征,从源头掐断幻觉。
这是整个系统的认知中枢 ,灵感来源于ReAct范式。该Agent能自主调用外部工具:搜索引擎用于事实检索,VQA工具用于图像理解,逻辑推理工具用于数学或物理推导。它采用多步深度推理,直到将上游的问题全部解决。最终,它会将搜索结果和推理结论整合成一份信息完备、逻辑自洽的指令和参考图,确保生成阶段“弹药充足”。
最后一步,执行图像生成和编辑。该Agent内置了“生成-审查-修正”闭环:先调用底层扩散模型生成图像,然后自动用评判模型检查生成结果与用户意图的吻合程度以及视觉质量。如果不满意,则触发新一轮局部修改或完全重新生成,让系统具备自纠错能力。
多Agent协作:谁是“大脑”,谁是“手脚”?
如果把RS-Gen比作一个创作团队,每个Agent的角色就非常清晰了:
图像路由智能体 像项目经理 ,负责精准理解客户需求,搞清楚哪个对象是哪个,然后列一个清晰的任务单。
意图分析智能体 像技术总监 ,评估任务难度:如果是简单任务直接派给执行组;如果是复杂任务,就把大问题拆成若干个具体可执行的小问题。
推理与搜索智能体 像研究顾问 ,带着小问题去查资料、做推理,给出准确的答案和依据。
图像生成智能体 像设计师 ,按照指令动手画图,画完还要自己检查一遍,如果不满意就重画。
整个流程严格按照“感知-分析-检索&推理-生成”的渐进式范式执行,每个Agent只负责自己的专业领域,通过明确的接口传递信息。这种解耦设计让系统非常灵活:如果以后有了更好的搜索引擎或推理工具,只需替换对应的Agent模块,而不需要动整体架构。更重要的是,这一切都是训练免费的,意味着任何现有的开源模型只需套上这个框架,就能立即获得能力提升。
实验结果:开源模型也能比肩商业巨头
RS-Gen的效果到底怎么样?论文在两个权威基准上进行了评估:WISE_Verified (图像生成质量与指令遵循综合评测)和RISEBench (图像编辑评测)。
从表1可以看到,把RS-Gen框架搭载到Qwen-Image上,在WISE_Verified基准上的总分从0.510提升到0.823,一举超越了所有开源纯生成模型和统一模型,甚至超过了部分商业闭源模型(如Midjourney v6.1的0.811、DALL-E 3的0.806)。
在图像编辑任务上(表2),Qwen-Image-Edit-2511的基线得分仅为0.47左右,而搭载RS-Gen后直接飙升到19.70。这个巨大的跃升证明,RS-Gen不仅让生成变强,更让编辑任务也获得了质的飞跃。
论文还做了详尽的消融实验,看看每个Agent到底贡献了多少。
从表3可以看到,每增加一个Agent,总分都在稳步提升:基线Qwen-Image得0.510,加上图像路由后提升到0.687,再加上意图分析提升到0.745,再加上推理与搜索提升到0.801,最后加上图像生成(含自纠错)达到0.823。这说明每个模块都不可或缺,推理与搜索模块带来的提升最大(+0.056),因为它直接解决了知识盲区和逻辑推理问题。
更重要的是,RS-Gen的跨模型泛化能力也得到了验证。
从表5可以看出,无论是FLUX.1-dev、Z-Image还是LongCat-Image,套上RS-Gen后,在WISE_Verified总评分上都有大幅提升。特别地,FLUX.1-dev + RS-Gen达到了0.770,远超FLUX.1-dev本身的0.674。这说明RS-Gen是一种通用的能力增强框架,即插即用。
局限与展望:通往通用智能生成之路
RS-Gen的强大之处在于它巧妙地把“死记硬背”变成了“先查后画”,但任何方法都有短板。论文也坦率指出了几个局限性:
推理延迟增加: 因为需要多步Agent调用外部工具,相比于单次前向传播,RS-Gen的生成时间会有所增加。不过论文通过任务难度自适应路由(简单任务走直接路径)来缓解这一问题。
对底层模型质量敏感: RS-Gen的最终效果受限于底层图像模型的生成能力。如果底层模型本身在常规场景下表现差,RS-Gen只能弥补知识和逻辑短板,不能修复基础视觉质量。
工具依赖与搜索质量: 框架依赖外部搜索引擎和VQA工具,如果搜索返回不准确的信息或工具本身有错误,会影响最终结果。
展望未来,RS-Gen的设计思路完全可以扩展到视频生成、3D内容生成等领域。当AI能够主动检索并推理,而不仅仅是“看图说话”时,通用智能生成的图景就离我们更近了。小米团队的这个工作,为开源社区打开了一扇新的大门——不需要烧几百万美元去训练超大模型,只需巧妙的系统设计,就能让现有模型焕发新生。
龙迷三问
问题1:RS-Gen为什么不需要训练?它是怎么工作的? RS-Gen是一个纯推理阶段的框架,它不对底层图像模型做任何微调,而是通过多轮对大语言模型(MLLM)的调用和外部工具的调用,把复杂问题拆解成子问题逐个解决。整个流程依赖于MLLM本身的指令理解和推理能力,以及搜索引擎等API,所以不需要训练。
问题2:RS-Gen提到了ReAct范式,这是什么意思? ReAct(Reasoning + Acting)是由Shunyu Yao等人在ICLR 2023上发表的一个智能体范式。核心思想是让模型交替进行推理(Think)和行动(Act),并通过观察(Observe)环境的反馈来调整下一步行动,形成一个闭环。RS-Gen中的推理与搜索Agent和图像生成Agent都采用了这个范式。
问题3:RS-Gen在多轮对话中怎么处理指代歧义?能举个例子吗? 假设多轮对话历史如下:用户在第一轮生成了一张“蓝色车”的图片,第二轮说“把它改成红色”。RS-Gen的图像路由Agent会通过记忆机制找到历史输出中的“蓝色车”图片,并准确确定用户指的“它”就是那张图片中的车,然后输出“对第N轮输出图片中的蓝色车进行颜色编辑,改为红色”。同时,它还会使用延迟解决原则:如果用户说“改为该品牌最新款的颜色”,Agent不会自行推测,而是把这个问题保留,交给后续的推理与搜索Agent去查资料。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
RS-Gen的创新在于将智能体系统的ReAct范式和检索增强生成思路系统性地适配到图像生成任务中,提出了多Agent协作的“问答闭环”机制。虽然每个子模块都是已有技术,但将它们组合成一个训练免费、即插即用的框架,并进行了严格的消融验证,整体设计流畅且实用。
实验合理度: ★★★★★
实验非常充分:在两个主流基准上对比了商业闭源模型和众多开源模型,做了完整的消融实验,还测试了跨不同底层模型和不同MLLM的泛化能力。表格数据清晰,对比方法也都是2024-2026年的最新工作,置信度高。
学术研究价值: ★★★★☆
该工作为“如何在不提升模型规模的情况下提升生成任务的智能性”提供了一个极具启发性的范例。它证明了系统工程和Agent框架可以在不依赖数据驱动的训练下超越端到端模型。
稳定性: ★★★★☆
框架的自纠错机制显著提高了结果的稳定性,避免了单次生成失败。但整体稳定性仍受限于底层MLLM和外部搜索工具的质量。在大多数测试场景下表现稳定,但极端复杂的逻辑任务仍有失败可能。
适应性以及泛化能力: ★★★★★
论文用多种不同的底层生成模型和多种MLLM进行了测试,均获得显著提升,证明了框架具有很强的跨模型、跨工具泛化能力。
硬件需求及成本: ★★★☆☆
由于需要多步调用MLLM和外部搜索API,推理延迟和成本比单一模型高。不过论文通过自适应路由缓解了一部分,并且不需要训练计算。三星是因为在低端设备上运行基于LLM的Agent仍有挑战。
复现难度: ★★★★☆
论文没有直接公开代码,但框架设计清晰,每个Agent的功能定义明确,使用开源MLLM和工具接口应该可以复现。需要自行组装Pipeline,有一定的工作量,但难度不高。
产品化成熟度: ★★★☆☆
RS-Gen已经具备产品化的潜力,特别是对于需要处理复杂用户指令的AI图像编辑工具。但目前依赖外部搜索和多个MLLM调用,延迟较高。目前适合作为后端服务,不适合实时交互很强的场景。
可能的问题: 整体而言RS-Gen是一个优雅实用的方案。但存在两个潜在问题:(1) 框架的“思考”过程完全由MLLM驱动,MLLM本身的推理一致性可能成为瓶颈,极端情况下Agent可能会陷入循环或给出错误决策;(2) 搜索工具检索到的信息可能包含视觉描述不准确,这种情况下Agent可能无法生成正确的参考图。
主要参考文献
[1] FLUX.1-dev. Black Forest Labs, 2024.
[2] Qwen-Image and Qwen-Image-Edit. Alibaba Cloud, 2025.
[14] Shunyu Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023.
[31] WISE: A Comprehensive Benchmark for Instruction Following in Image Generation. 2025.
[33] RISEBench: A Benchmark for Realistic Image Semantic Editing. 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
想让你的AI也学会"搜一搜、想一想再画"?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像生成+上海+小米+龙哥) ,根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群