论文标题:
Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution
发表日期:
2026年06月
发表单位:
Institute of Software, Chinese Academy of Sciences; University of Chinese Academy of Sciences; School of Life Sciences, Tsinghua University; Intelligent Science & Technology Academy of CASIC
原文链接:
https://arxiv.org/pdf/2606.28971v1.pdf
SEAR 的核心不是“多一个工具”,而是先规划,再执行。它把恢复过程看成一个序列决策问题:每一步选择哪种工具、按什么顺序调用,都会改变后续状态。这里的关键缩写先解释一下:MCTS 是 Monte Carlo Tree Search,中文叫蒙特卡洛树搜索;P-MCTS 是 Pruning-Aware Monte Carlo Tree Search,中文可理解为带剪枝感知的蒙特卡洛树搜索,出处就是这篇论文本身。图2:恢复决策策略对比。贪心智能体只顾眼前收益,容易走进死胡同;SEAR 则把直觉执行器和深思规划器配合起来,做长视野优化。论文里把恢复过程拆成两层。上层由大语言模型生成一个“议程”,相当于先定大方向,比如先去噪、再去模糊、最后做超分;下层再用 P-MCTS 在这个框架里细搜具体工具序列。这个设计很像下棋:不是每一步都瞎试,而是先想好三五步之后棋盘会变成什么样。P-MCTS 的厉害之处在于,它不是单纯“蒙一把”,而是会在搜索树里反复做选择、扩展、模拟、回传。选择阶段用 UCT(Upper Confidence Bound for Trees,树的上置信界)在“探索新路”和“利用好路”之间找平衡;扩展阶段只允许当前子任务相关的工具进入分支,相当于先把不靠谱的路砍掉;模拟阶段会把剩余子任务一路跑完,看看终局效果;最后把结果回传给祖先节点,逐步把搜索方向往高收益轨迹上推。这套思路的价值很直接:复杂退化下,局部看起来“更干净”的操作,未必是全局最优。比如过早锐化、过猛去噪,可能把后续需要保留的纹理直接删掉。P-MCTS 的作用,就是尽量避免这种“手滑式灾难”。图7:P-MCTS 消融实验。去掉规划后,虽然工具调用更少,但 PSNR 明显下降,说明“少折腾”不等于“修得好”。
告别“做完就忘”:自进化记忆如何让智能体越用越聪明?
很多 agent 系统最大的问题,不是不会做,而是做完就忘。这篇论文把这个毛病称为 episodic amnesia,中文可以理解成“情景性失忆”:前面辛辛苦苦搜到的好轨迹,下一张图又得从头再来。SEAR 于是加了一个自进化记忆库,把成功经验存成可复用的“套路”。这个记忆不是随便记点文本,而是按“状态指纹”来索引。论文里先用一个微调过的多模态大模型去诊断退化类型,再把退化信息量化成一个低维向量。这里的 MLLM 是 Multimodal Large Language Model,中文叫多模态大语言模型,论文中引用的是现成的多模态评估器和规划能力。这样做的好处很朴素:不是死记像素,而是记“这类退化大概长什么样、该怎么修”。图:自进化效率摊销。随着记忆不断积累,系统从“每次都重新规划”逐渐过渡到“熟题直接调用经验”,搜索成本会被慢慢摊平。记忆检索也不是拍脑袋。论文给每条记忆都维护了访问次数、平均收益、历史最高收益等统计量,检索时会综合“像不像”和“值不值得用”来排序。更关键的是,SEAR 不会无脑照搬记忆:先执行,再过可靠性门控。如果检索到的轨迹真的靠谱,就直接走捷径;如果不靠谱,就把它当作热启动,让 P-MCTS 继续细搜。这个设计很像老司机带路,但不迷信老司机。图6:动态自进化。冷启动阶段系统更像在认真搜索,随着经验积累,执行器会逐渐学会直接调用高质量轨迹,效率越来越高。