← 返回 PaperDaily
视觉与图像
ICML 2026新研究:DGS让LLM学会先选对招,再下手
这篇论文最有意思的地方,不是又堆了一个“更强的LLM-AHD框架”,而是盯住了真正烧预算的那一步:先选哪个父代、用什么操作去生成。DGS把这一步变成可学习的决策,还用两个代理模型提前预判结果,思路很工程,也很像真正会省钱的系统。
龙哥读论文
发布于 2026-08-14 21:47:08
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文最有意思的地方,不是又堆了一个“更强的LLM-AHD框架”,而是盯住了真正烧预算的那一步:先选哪个父代、用什么操作去生成。DGS把这一步变成可学习的决策,还用两个代理模型提前预判结果,思路很工程,也很像真正会省钱的系统。
原论文信息如下:
让LLM学会“三思而后行”:DGS如何预判生成结果的好坏
这篇论文最有意思的地方,不是又堆了一个“更强的生成框架”,而是盯住了一个很现实的问题:LLM 每次生成都很贵,真正烧预算的往往不是“生成”本身,而是“先选谁、怎么改、值不值得试” 。在自动启发式设计里,LLM 不是随便写两行代码就完事,它每次都要基于父代程序、操作符和反馈再生成一个新程序,后面还得跑黑盒评测。动作选错了,预算就像开了闸的水龙头,哗哗流走。
把这个思路翻成人话,就是:不是先生成再后悔,而是先判断再出手 。这和很多“先试了再说”的方法不一样。DGS把“操作符 + 父代集合”当成一个可学习的动作,提前去预测这个动作会不会带来更好的启发式程序。对预算有限的搜索任务来说,这个改动很工程,也很务实。
DGS 的核心不是“再训练一个大模型”,而是把问题拆成两件事:这次动作会生成什么样的孩子 ,以及这个孩子大概率表现如何 。前者交给过渡代理(transition surrogate),后者交给效用代理(utility surrogate)。一个负责“路怎么走”,一个负责“走过去值不值”。
论文里先把启发式代码编码成连续向量,再映射到一个共享潜空间。这里的编码器用的是 ModernBERT (一种长上下文编码器),然后再接一个轻量的残差映射,把代码表示变成更适合当前任务搜索的 latent 向量。这个设计很像给程序做“体检”:原始代码能看懂,但真正用于比较优劣时,还得转成统一尺子。
效用代理并不是只看一个总分,而是把每个训练实例都单独考虑进去。这个思路很关键,因为同一个启发式程序,在不同样本上可能表现完全不同。论文把程序 latent、实例 embedding,以及它们的交互特征拼起来,再用多个 head 组成集成模型,既预测均值,也估计不确定性。说白了,就是不只问“平均能打多少”,还要问“这个判断稳不稳”。
为了让效用代理不只会“背答案”,论文还加了两个训练信号。一个是MSE (均方误差),负责拟合数值大小;另一个是rank loss (排序损失),负责保住同一实例上的优先级关系。前者管“分数像不像”,后者管“谁比谁强”。这点很像考试:光记住分数没用,还得知道谁排前谁排后。
过渡代理则更像一个“动作翻译器”。因为在真正调用 LLM 之前,系统还不知道会生成哪个具体程序,所以不能像普通黑盒优化那样直接给候选解打分。DGS 先学习“父代集合 + 操作符”会把孩子推到哪个 latent 区域,再根据这个分布去估计后续效用。这个设计把“动作”变成了可预测对象,终于不是凭感觉乱试了。
真正让 DGS 跟普通“排名式选父代”拉开差距的,是这两个代理不是各干各的,而是先预测动作会把孩子带到哪里,再判断这个落点值不值得 。这就像打游戏时,不只是看装备强不强,还要看这套装备适不适合当前地图。
这套设计还有一个很现实的优点:它不是在生成后补救,而是在生成前分配预算 。对 LLM-based AHD 这种“每次调用都要花钱”的场景来说,前置决策的价值非常高。只要前面少浪费几次,后面就可能多出几次真正有效的搜索机会。
不只是拷贝和变异:DGS在五个经典优化任务上的实测表现
实验选了五类任务:旅行商问题(TSP)、背包问题(KP)、在线装箱(OBP)、可容忍集合问题(ASP),以及带蚁群优化的容量车辆路径问题(CVRP-ACO)。这些任务覆盖了两种常见形态:一种是直接构造解的启发式,另一种是嵌在求解器里的组件式启发式。换句话说,DGS 不是只在一种“玩具场景”里好看,而是想证明自己能在不同任务结构里都管用。
更直观地看搜索曲线,DGS 在多个任务上都能更快抬高 best-so-far 分数。这个现象和方法设计是对得上的:如果动作选择更准,那么每一次 LLM 调用更可能产出“真有用”的候选程序,曲线自然就爬得更快。反过来,如果只靠规则随机抽,很多预算都会花在“看起来差不多,其实没戏”的动作上。
论文还做了一个控制实验,专门把“框架差异”压到最小,只比较动作选择方式。结果显示,单纯靠轮换、随机或者 bandit 规则,效果都不如学习式的联合动作选择。这一点挺关键,因为它说明 DGS 的收益不是“换了更强的提示词模板”这种表面变化,而是真的把动作选择这件事学进去了 。
DGS 的另一个亮点,是它不是只会“追高分父代”。如果只按 archive 排名挑父代,系统很容易越来越保守:总想用最强的那几个老程序,结果搜索空间越走越窄。DGS 通过不确定性项把一部分预算留给“值得试但没那么确定”的动作,这样既能利用已知强解,也不会把探索彻底掐死。
这套机制的好处在于,它比固定规则更像一个会学习的搜索策略。固定规则的问题很明显:一旦任务变化,规则就未必还对;而 DGS 学的是“动作的后果”,不是“动作的形式”。只要 archive 里积累了足够多的动作—结果记录,它就能慢慢修正自己的偏好。这种能力在黑盒优化里很值钱,因为黑盒最讨厌的就是“看起来差不多,实际完全不是一回事”。
这里值得认真看一眼。DGS 的方法并不神秘,甚至有点“克制”:没去堆一堆花里胡哨的新操作符,而是把动作选择前移 ,再用两个代理把“选什么”这件事做得更像样。很多时候,系统性能提升并不来自更复杂的生成器,而来自更聪明的调度器。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是 LLM-based 自动启发式设计里“下一步先选哪个父代、用什么操作”这个高成本决策问题。DGS 的思路不是多生成,而是先把最可能有用的动作挑出来,减少无效调用。
过渡代理和效用代理分别是什么意思? 过渡代理负责预测“动作会把程序带到哪个潜空间区域”,效用代理负责预测“这个区域里的孩子大概有多强”。前者管生成方向,后者管结果价值,两个合起来才像一个完整的决策系统。
它和普通的规则搜索有什么本质区别? 普通规则搜索通常靠固定策略选父代或轮换操作符,更多是“经验驱动”;DGS 则把动作选择当成学习问题,利用历史代码、实例分数和父子转移记录来预测下一步动作的收益,属于“数据驱动的调度”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
创新点不在“又造了一个大框架”,而在把预生成动作选择 做成可学习问题,还用双代理把动作后果拆开建模,思路清楚,工程味很足。
实验合理度: ★★★★☆
对比了多个强基线,还做了受控动作选择和消融,能比较清楚地说明收益来自哪里。若能补更多任务和更长预算区间,可信度还能再抬一点。
学术研究价值: ★★★★☆
它对“LLM 如何参与搜索”这条线有明确启发:不是只做生成器,而是把生成前的决策也学起来。这个方向对自动算法设计、黑盒优化都挺有参考价值。
稳定性: ★★★☆☆
方法依赖 archive 里逐步积累的动作—结果数据,前期数据少的时候,代理模型可能还不够稳。属于“越搜越聪明”的类型,不是开箱即满血。
适应性以及泛化能力: ★★★☆☆
论文在多个组合优化任务上都试了,但仍然集中在启发式设计这类场景。跨到别的生成式搜索问题,思路可迁移,参数和表示未必能直接照搬。
硬件需求及成本: ★★★☆☆
训练两个代理再加上在线更新,成本肯定比纯规则法高,但相比反复浪费 LLM 调用,整体仍然可能是划算的。真正贵的还是生成和评测,不是代理本身。
复现难度: ★★★☆☆
论文给了清晰的方法分解,但这类工作复现时很吃任务环境、评测器和 LLM 接口设置。代码若不完全开放,复现会比较考验耐心。
产品化成熟度: ★★★☆☆
在“昂贵搜索、有限预算、需要不断试错”的场景里有落地潜力,比如自动算法调优、启发式生成、求解器组件搜索。但要真正产品化,还得先解决稳定性、成本和任务适配问题。
可能的问题: 方法思路干净,但依赖历史数据质量和代理预测精度;如果早期 archive 噪声太大,动作选择可能会被带偏。更像一套“越跑越顺”的搜索系统,不是一次性神兵。
主要参考文献
1. Yuhan Wang, Chaoda Peng, Xingyu Wu, Sheng-Hao Wu, Zhi-Hui Zhan. How to Guide LLM Generation: Dual-Surrogate Guided Search for Automated Heuristic Design. arXiv, 2026.
2. Romera-Paredes et al. FunSearch: Making New Discoveries in Mathematical Sciences using Large Language Models. 2024.
3. Liu et al. Evolution of Heuristics (EoH). 2024.
4. Ye et al. ReEvo. 2024.
5. Zheng et al. Monte Carlo Tree Search for Automated Heuristic Design (MCTS-AHD). 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群