← 返回 PaperDaily 视觉与图像

ICLR 2025新作SEAR:图像修复从“瞎搜”进化到会记忆

这篇 SEAR 很有意思:它不再把图像修复当成“看到退化就直接出手”的单步活,而是改成先规划、再执行,还会把成功经验存起来反复用。对复杂混合退化场景来说,这种“会思考、会记忆”的思路,比纯 greedy 搜索靠谱得多。

ICLR 2025新作SEAR:图像修复从“瞎搜”进化到会记忆
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
这篇 SEAR 很有意思:它不再把图像修复当成“看到退化就直接出手”的单步活,而是改成先规划、再执行,还会把成功经验存起来反复用。对复杂混合退化场景来说,这种“会思考、会记忆”的思路,比纯 greedy 搜索靠谱得多。


原论文信息如下:
论文标题:
Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution
发表日期:
2026年06月
发表单位:
Institute of Software, Chinese Academy of Sciences; University of Chinese Academy of Sciences; School of Life Sciences, Tsinghua University; Intelligent Science & Technology Academy of CASIC
原文链接:
https://arxiv.org/pdf/2606.28971v1.pdf

图像恢复的“思考,快与慢”:SEAR如何平衡探索与执行?

这篇论文最有意思的地方,不是又堆了一个更大的修复模型,而是直接把图像恢复改写成了“先想清楚,再动手”的决策问题。说人话就是:复杂退化图片不是按一下按钮就能修好的,顺序错了,后面再强的工具也可能把图修废。
封面
封面图:SEAR 的整体框架。它把图像恢复拆成两个系统:一个负责快执行,一个负责慢规划。
龙哥导读:SEAR 这套思路很“像人”。遇到熟悉问题就直接调用经验,遇到复杂情况就先规划路径再执行,最后还把成功经验存起来继续用。对真实世界里那些混合退化、顺序敏感的修复任务,这种设计比单纯追分数更像正经干活的系统。
先把背景说清楚。图像恢复(Image Restoration,IR)就是把一张被噪声、模糊、压缩、雨雾等问题搞坏的图,尽量修回正常状态。传统单任务模型在单一退化上很强,但现实照片经常是“混合拳”:又糊又脏又有雾,甚至还叠着压缩伪影。这个时候,谁先处理、后处理、处理到什么程度,都会影响最后结果。
以往的全能修复模型更像“固定流程工厂”,来了什么图就按同一套套路走;而 agentic IR(智能体式图像恢复)则把修复拆成一连串工具调用,让模型自己决定先用谁、后用谁。问题也很明显:很多方法太贪心,只盯着当前一步的收益,结果为了眼前的清爽把细节全抹掉了,后面再想补救就晚了。SEAR 的出发点,就是把这种“短视”改掉。
图1
图1:恢复局限性分析。静态全能模型很难应对耦合退化;而恢复质量又非常依赖执行顺序,贪心决策一旦把细节“洗没了”,后面基本没法补。

从短视到远见:P-MCTS如何实现长视野规划?

SEAR 的核心不是“多一个工具”,而是先规划,再执行。它把恢复过程看成一个序列决策问题:每一步选择哪种工具、按什么顺序调用,都会改变后续状态。这里的关键缩写先解释一下:MCTS 是 Monte Carlo Tree Search,中文叫蒙特卡洛树搜索;P-MCTS 是 Pruning-Aware Monte Carlo Tree Search,中文可理解为带剪枝感知的蒙特卡洛树搜索,出处就是这篇论文本身。
图2
图2:恢复决策策略对比。贪心智能体只顾眼前收益,容易走进死胡同;SEAR 则把直觉执行器和深思规划器配合起来,做长视野优化。
论文里把恢复过程拆成两层。上层由大语言模型生成一个“议程”,相当于先定大方向,比如先去噪、再去模糊、最后做超分;下层再用 P-MCTS 在这个框架里细搜具体工具序列。这个设计很像下棋:不是每一步都瞎试,而是先想好三五步之后棋盘会变成什么样。
P-MCTS 的厉害之处在于,它不是单纯“蒙一把”,而是会在搜索树里反复做选择、扩展、模拟、回传。选择阶段用 UCT(Upper Confidence Bound for Trees,树的上置信界)在“探索新路”和“利用好路”之间找平衡;扩展阶段只允许当前子任务相关的工具进入分支,相当于先把不靠谱的路砍掉;模拟阶段会把剩余子任务一路跑完,看看终局效果;最后把结果回传给祖先节点,逐步把搜索方向往高收益轨迹上推。
这套思路的价值很直接:复杂退化下,局部看起来“更干净”的操作,未必是全局最优。比如过早锐化、过猛去噪,可能把后续需要保留的纹理直接删掉。P-MCTS 的作用,就是尽量避免这种“手滑式灾难”。
图7
图7:P-MCTS 消融实验。去掉规划后,虽然工具调用更少,但 PSNR 明显下降,说明“少折腾”不等于“修得好”。

告别“做完就忘”:自进化记忆如何让智能体越用越聪明?

很多 agent 系统最大的问题,不是不会做,而是做完就忘。这篇论文把这个毛病称为 episodic amnesia,中文可以理解成“情景性失忆”:前面辛辛苦苦搜到的好轨迹,下一张图又得从头再来。SEAR 于是加了一个自进化记忆库,把成功经验存成可复用的“套路”。
这个记忆不是随便记点文本,而是按“状态指纹”来索引。论文里先用一个微调过的多模态大模型去诊断退化类型,再把退化信息量化成一个低维向量。这里的 MLLM 是 Multimodal Large Language Model,中文叫多模态大语言模型,论文中引用的是现成的多模态评估器和规划能力。这样做的好处很朴素:不是死记像素,而是记“这类退化大概长什么样、该怎么修”。
自进化效率摊销
图:自进化效率摊销。随着记忆不断积累,系统从“每次都重新规划”逐渐过渡到“熟题直接调用经验”,搜索成本会被慢慢摊平。
记忆检索也不是拍脑袋。论文给每条记忆都维护了访问次数、平均收益、历史最高收益等统计量,检索时会综合“像不像”和“值不值得用”来排序。更关键的是,SEAR 不会无脑照搬记忆:先执行,再过可靠性门控。如果检索到的轨迹真的靠谱,就直接走捷径;如果不靠谱,就把它当作热启动,让 P-MCTS 继续细搜。这个设计很像老司机带路,但不迷信老司机。
图6
图6:动态自进化。冷启动阶段系统更像在认真搜索,随着经验积累,执行器会逐渐学会直接调用高质量轨迹,效率越来越高。

不仅仅是得分高:混合奖励和MLLM锦标赛如何确保“人间真实”?

做搜索最怕什么?不是搜不到,而是把指标刷高了,把图修坏了。这叫 metric exploitation,中文可以理解成“指标投机”:模型学会了讨好分数,却不一定讨好人眼。SEAR 的解决办法是混合奖励加锦标赛复核,尽量把结果拉回“看起来像真的”。
这里的奖励不是单一指标,而是由多个无参考图像质量评价指标共同构成,包括 NIQE、MANIQA、MUSIQ、CLIP-IQA 等。无参考(no-reference)意思是没有真值图也能评估质量,这在真实修复里很重要,因为现实场景通常根本拿不到干净原图。论文还引入了多模态大模型做“锦标赛式”复核:把前几条候选轨迹拿出来让模型做成对比较,避免某个指标被钻空子。
图8
图8:奖励设计消融。雷达图和可视化结果都说明,单看某个分数容易偏,加入锦标赛复核后,输出更贴近人类感知。
这部分很像考试里的“防作弊机制”。如果只看单科分数,学生可能专挑题型刷分;但如果再加一道综合面试,投机空间就小很多。SEAR 的混合奖励本质上也是这个逻辑:让搜索目标不至于只盯着某一个容易被操纵的指标。

真实场景大考:SEAR在复杂退化图像上表现如何?

实验部分最值得看的,不是某个点数涨了多少,而是它在混合退化和真实场景里到底稳不稳。论文在 MiO100 的多个子集上做了对比,也在真实世界数据上做了泛化测试。整体结论很明确:SEAR 在感知质量上很强,尤其擅长处理那些“不是单一问题,而是问题叠问题”的图像。
表1
表1:MiO100 三个子集上的多退化恢复结果。SEAR 在多个指标上都保持领先,尤其在感知指标上更有优势。
表2
表2:效率分析。SEAR 不是无脑堆搜索,而是靠记忆把重复规划成本摊薄,所以在质量和时间之间取得了比较均衡的结果。
图4
图4:合成数据上的可视化对比。对比方法常见的问题是残留噪声、纹理过度平滑或颜色失真,而 SEAR 更能保住细节。
从结果看,SEAR 的优势主要体现在两点。第一,它对复杂混合退化更稳,不会因为某一步操作过猛而把后续恢复空间毁掉;第二,它的感知指标表现更好,说明最终图像更像“自然图”,而不是“分数很好看的修复图”。这点很重要,因为真实用户通常不关心 PSNR 公式长什么样,只关心图像是不是看着顺眼、细节是不是还在。
表3
表3:真实世界数据上的结果。SEAR 在 LPIPS、CLIP-IQA、MUSIQ 等感知指标上表现更强,说明它对真实退化的适应性更好。
图5
图5:真实世界场景可视化。像雾+模糊、噪声+模糊这类组合退化,SEAR 能保住自然纹理,基线方法则更容易留下残影或色偏。
消融实验也很有说服力。去掉记忆,工具调用次数会明显上升,说明系统不得不反复从零规划;去掉 P-MCTS,虽然省了一些步骤,但恢复质量掉得很明显;把宏观任务规划去掉后,搜索空间直接爆炸,工具调用次数飙升,效率几乎崩盘。换句话说,这不是“某个模块锦上添花”,而是几个模块互相补位,少一个都不太行。
表4
表4:消融实验。记忆、P-MCTS、宏观规划和状态指纹都在各自扮演角色,删掉任一部分都会影响质量或效率。
表5
表5:冷启动部署下的记忆路由统计。系统并不是无条件复用记忆,而是会在“直接执行”和“继续搜索”之间做门控判断。

如何理解SEAR背后的双系统协同与未来潜力?

SEAR 的真正亮点,不是某一个单点技巧,而是它把图像恢复做成了一个会积累经验的决策系统。快系统负责把熟悉问题迅速处理掉,慢系统负责在复杂场景里认真搜索;成功轨迹再被压缩进记忆库,变成下一次的经验。这个闭环一旦跑起来,系统就不是“每次重新做人”,而是“越用越像个熟练工”。
当然,这种方法也不是没有代价。首先,它依赖多模态大模型做退化感知和规划,推理成本不会低;其次,记忆库的质量决定了后续复用的上限,若早期轨迹质量一般,记忆再大也只是把“错误经验”存得更整齐;最后,真实部署里还要面对工具集变化、退化分布漂移和算力限制,这些都不是一句“自进化”就能自动解决的。
表6
表6:超参数敏感性分析。说明 SEAR 的关键参数并非随便拍脑袋设定,系统对部分参数变化有一定鲁棒性,但仍需要合理调参。
从行业角度看,SEAR 提供了一个很实用的方向:复杂视觉任务不一定非要靠更大的单模型硬扛,也可以靠规划 + 工具 + 记忆的组合拳来做。这个思路未来不只适合图像恢复,还可能迁移到图像编辑、视频修复、医学影像增强这类“步骤顺序很重要”的场景。前提是,工具体系要足够稳定,记忆机制要足够干净,别把系统做成一个会记仇但不会干活的智能体。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是复杂混合退化图像恢复里“顺序敏感、容易短视、经验难复用”的问题。SEAR 通过规划、执行和记忆闭环,让修复不再是一次性操作,而是可积累的决策过程。

P-MCTS 和普通 MCTS 有什么区别?P-MCTS 是带剪枝感知的蒙特卡洛树搜索。它不是在整个工具空间里乱撞,而是先用宏观议程缩小搜索范围,再在子任务内部做长视野搜索,减少无效分支,提高规划效率。

为什么还要加 MLLM 锦标赛和混合奖励?因为单一指标很容易被“刷分”。混合奖励提供多维度约束,MLLM 锦标赛则从感知层面对候选结果做复核,目的是让最终输出更贴近人眼,而不是只在指标表上好看。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ SEAR 的新意不在“又一个工具链”,而在把双系统理论、MCTS、记忆复用和图像恢复真正串成闭环,思路完整,且问题切得准。

实验合理度:★★★★☆ 对比了 AiO 和 agentic 两类基线,还做了效率、真实场景和消融,整体比较像一篇认真做实验的工作。

学术研究价值:★★★★☆ 它把图像恢复从静态预测推进到序列决策,对后续 agentic 视觉任务有明显启发。

稳定性:★★★☆☆ 记忆门控和规划机制能提升稳健性,但仍依赖多模态模型、工具库和奖励设计,离“随便部署都稳”还有距离。

适应性以及泛化能力:★★★★☆ 在复杂混合退化和真实场景上表现不错,说明方法确实比固定模型更能扛变化。

硬件需求及成本:★★★☆☆ 需要 LLM/MLLM 参与规划与评估,推理开销不低,明显不是轻量级方案。

复现难度:★★★☆☆ 思路清楚,但涉及多模型协同、搜索策略和记忆系统,工程复现门槛不算低。

产品化成熟度:★★★☆☆ 适合高价值、离线或半离线场景;若要实时、低成本、大规模部署,还得继续压缩搜索和评估开销。

可能的问题:方法很会“想”,但也很吃算力和系统工程;奖励与记忆若初始化不好,容易把经验学偏,后面越存越自信。


主要参考文献

1. Shuang Cui, Fan Ji, Guanglong Sun, Yufei Guo, Xiongxin Tang, Jiangmeng Li, Fanjiang Xu. Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution. arXiv:2606.28971v1, 2026.
2. 论文原文链接:https://arxiv.org/pdf/2606.28971v1.pdf
3. 论文中引用的相关方法包括 AgenticIR、4KAgent、P-MCTS、MCTS、MUSIQ、MANIQA、CLIP-IQA 等。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
想和同频的人一起拆论文、聊方法、追前沿,来群里最省心。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。