← 返回 PaperDaily 视觉与图像

ICML 2026新研究:DGS让LLM学会先选对招,再下手

这篇论文最有意思的地方,不是又堆了一个“更强的LLM-AHD框架”,而是盯住了真正烧预算的那一步:先选哪个父代、用什么操作去生成。DGS把这一步变成可学习的决策,还用两个代理模型提前预判结果,思路很工程,也很像真正会省钱的系统。

ICML 2026新研究:DGS让LLM学会先选对招,再下手
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是又堆了一个“更强的LLM-AHD框架”,而是盯住了真正烧预算的那一步:先选哪个父代、用什么操作去生成。DGS把这一步变成可学习的决策,还用两个代理模型提前预判结果,思路很工程,也很像真正会省钱的系统。


原论文信息如下:
论文标题:
How to Guide LLM Generation: Dual-Surrogate Guided Search for Automated Heuristic Design
发表日期:
2026年07月
发表单位:
South China Agricultural University; The Hong Kong Polytechnic University; Nankai University
原文链接:
https://arxiv.org/pdf/2607.13911v1.pdf

让LLM学会“三思而后行”:DGS如何预判生成结果的好坏

这篇论文最有意思的地方,不是又堆了一个“更强的生成框架”,而是盯住了一个很现实的问题:LLM 每次生成都很贵,真正烧预算的往往不是“生成”本身,而是“先选谁、怎么改、值不值得试”。在自动启发式设计里,LLM 不是随便写两行代码就完事,它每次都要基于父代程序、操作符和反馈再生成一个新程序,后面还得跑黑盒评测。动作选错了,预算就像开了闸的水龙头,哗哗流走。
图1:现有方法与DGS整体流程对比图
图1:现有方法与DGS整体流程对比图。左边是常见做法:从档案库里挑父代、套一个固定操作符、让LLM生成、再评测。右边的 DGS(Dual-Surrogate Guided Search,双代理引导搜索)多做了一步“开局先算一卦”:它先用两个代理模型估计这次动作大概会生成什么样的孩子、孩子大概有多强,再决定要不要把这次昂贵的生成机会用掉。
把这个思路翻成人话,就是:不是先生成再后悔,而是先判断再出手。这和很多“先试了再说”的方法不一样。DGS把“操作符 + 父代集合”当成一个可学习的动作,提前去预测这个动作会不会带来更好的启发式程序。对预算有限的搜索任务来说,这个改动很工程,也很务实。

从盲选到智选:双代理模型如何精准预测操作效果

DGS 的核心不是“再训练一个大模型”,而是把问题拆成两件事:这次动作会生成什么样的孩子,以及这个孩子大概率表现如何。前者交给过渡代理(transition surrogate),后者交给效用代理(utility surrogate)。一个负责“路怎么走”,一个负责“走过去值不值”。
论文里先把启发式代码编码成连续向量,再映射到一个共享潜空间。这里的编码器用的是 ModernBERT(一种长上下文编码器),然后再接一个轻量的残差映射,把代码表示变成更适合当前任务搜索的 latent 向量。这个设计很像给程序做“体检”:原始代码能看懂,但真正用于比较优劣时,还得转成统一尺子。
公式:启发式代码到共享潜空间的映射
这里的公式表示:先把代码 embedding 经过线性投影和残差 MLP,再做归一化,得到启发式程序的潜在表示 z(a)。直白点说,就是把“代码长什么样”压缩成“它大概属于哪类解法风格”。后面的两个代理模型,都在这个空间里做判断。
效用代理并不是只看一个总分,而是把每个训练实例都单独考虑进去。这个思路很关键,因为同一个启发式程序,在不同样本上可能表现完全不同。论文把程序 latent、实例 embedding,以及它们的交互特征拼起来,再用多个 head 组成集成模型,既预测均值,也估计不确定性。说白了,就是不只问“平均能打多少”,还要问“这个判断稳不稳”。
公式:效用代理的交互特征
图中这个交互特征 [z, q, z⊙q, |z-q|, cos(z,q)],可以理解成把“程序特征”和“实例特征”放在一起做多角度匹配。⊙ 是逐元素乘法,|z-q| 是差异,cos 是相似度。这个组合很朴素,但很实用:既看像不像,也看差多少,还看方向对不对。
为了让效用代理不只会“背答案”,论文还加了两个训练信号。一个是MSE(均方误差),负责拟合数值大小;另一个是rank loss(排序损失),负责保住同一实例上的优先级关系。前者管“分数像不像”,后者管“谁比谁强”。这点很像考试:光记住分数没用,还得知道谁排前谁排后。
公式:效用训练表构建
这个训练表把“程序编码、实例编号、实例得分、来源索引”放到一起,等于把历史搜索记录整理成一份可学习的数据集。DGS 的一个重要细节是:它不是只学一个总分,而是学“程序-实例”粒度的表现,这样后面做动作选择时,才能更细地判断某个孩子到底适不适合当前任务。
公式:排序监督的正样本对 公式:排序损失
排序监督的意思很简单:如果同一实例上 A 比 B 更好,那模型就应该学会把 A 排在 B 前面。这个约束比单纯回归更贴近搜索场景,因为动作选择最终关心的不是“绝对分数差一小截”,而是“下一步该押谁”。
过渡代理则更像一个“动作翻译器”。因为在真正调用 LLM 之前,系统还不知道会生成哪个具体程序,所以不能像普通黑盒优化那样直接给候选解打分。DGS 先学习“父代集合 + 操作符”会把孩子推到哪个 latent 区域,再根据这个分布去估计后续效用。这个设计把“动作”变成了可预测对象,终于不是凭感觉乱试了。
公式:过渡训练样本
这里的训练样本记录的是“执行了哪个操作符、用了哪些父代、最后生成了哪个孩子”。也就是说,过渡代理不是看静态档案,而是学习真实的“动作—结果”映射。这个映射是 DGS 能不能从规则搜索走向学习型搜索的关键。
公式:父代分布均值 公式:过渡代理输出
过渡代理先把父代 latent 做均值和方差汇总,再结合操作符 embedding,输出孩子 latent 的均值和方差。它本质上是在学:这个动作大概会把程序推向哪个方向,偏差有多大。这一步很像给搜索过程装了个“导航仪”,至少先知道前方是高速还是土路。
公式:过渡代理损失
过渡代理的训练目标是高斯负对数似然,意思是让预测的孩子 latent 分布尽量贴近真实孩子 latent。这个设计比直接回归一个点更稳,因为生成过程本身就有随机性,硬要把它压成一个确定值,往往会把模型训得太死。

DGS的秘密武器:过渡代理与效用代理的协同工作

真正让 DGS 跟普通“排名式选父代”拉开差距的,是这两个代理不是各干各的,而是先预测动作会把孩子带到哪里,再判断这个落点值不值得。这就像打游戏时,不只是看装备强不强,还要看这套装备适不适合当前地图。
公式:候选动作空间
候选动作空间并不是全档案乱搜,而是先从当前档案里挑出 top-K 父代,再在这些父代上枚举可行操作符组合。这样做的好处很直接:搜索空间没那么爆炸,在线决策也更可控。毕竟预算有限,没必要把所有可能性都拖出来排队。
公式:动作采集函数
采集函数把三件事揉在一起:预测效用效用不确定性过渡不确定性。前者偏利用,后两者偏探索。意思是:如果一个动作看起来很有前途,就优先试;如果模型自己也拿不准,那也可以给它一次机会去“探路”。这就是 DGS 的平衡点——既不死盯着老熟人,也不乱摸黑。
这套设计还有一个很现实的优点:它不是在生成后补救,而是在生成前分配预算。对 LLM-based AHD 这种“每次调用都要花钱”的场景来说,前置决策的价值非常高。只要前面少浪费几次,后面就可能多出几次真正有效的搜索机会。

不只是拷贝和变异:DGS在五个经典优化任务上的实测表现

实验选了五类任务:旅行商问题(TSP)、背包问题(KP)、在线装箱(OBP)、可容忍集合问题(ASP),以及带蚁群优化的容量车辆路径问题(CVRP-ACO)。这些任务覆盖了两种常见形态:一种是直接构造解的启发式,另一种是嵌在求解器里的组件式启发式。换句话说,DGS 不是只在一种“玩具场景”里好看,而是想证明自己能在不同任务结构里都管用。
表1:主结果对比表
表1:主结果对比表。这里给的是各任务上的平均排名,数值越小越好。DGS 在 TSP、KP、OBP 上拿到最好平均排名,在 ASP 上与 ReEvo 持平,在 CVRP-ACO 上排第二。这个结果说明,DGS 的优势不是单点爆发,而是在多个任务上都能较稳定地把搜索预算花在更有价值的动作上
更直观地看搜索曲线,DGS 在多个任务上都能更快抬高 best-so-far 分数。这个现象和方法设计是对得上的:如果动作选择更准,那么每一次 LLM 调用更可能产出“真有用”的候选程序,曲线自然就爬得更快。反过来,如果只靠规则随机抽,很多预算都会花在“看起来差不多,其实没戏”的动作上。
图2:四个任务上的搜索演化曲线
图2:四个任务上的搜索演化曲线。曲线表示平均 best-so-far 分数,阴影表示最小到最大范围。可以看到,DGS 在不少任务上起步后提升更快,后期也更容易维持较好的上界。对预算有限的搜索任务来说,这种“少走弯路”的收益非常实在。
论文还做了一个控制实验,专门把“框架差异”压到最小,只比较动作选择方式。结果显示,单纯靠轮换、随机或者 bandit 规则,效果都不如学习式的联合动作选择。这一点挺关键,因为它说明 DGS 的收益不是“换了更强的提示词模板”这种表面变化,而是真的把动作选择这件事学进去了
表2:TSP上的受控动作选择研究
表2:TSP 上的受控动作选择研究。这里比较的是同一套 prompt 模板和父代池下,不同动作选择策略的训练分数。DGS 在这个控制场景里依然表现更好,说明它的优势确实来自“联合选择动作”本身,而不是别的附带因素。

告别死板规则:DGS的自主探索与利用策略

DGS 的另一个亮点,是它不是只会“追高分父代”。如果只按 archive 排名挑父代,系统很容易越来越保守:总想用最强的那几个老程序,结果搜索空间越走越窄。DGS 通过不确定性项把一部分预算留给“值得试但没那么确定”的动作,这样既能利用已知强解,也不会把探索彻底掐死。
这套机制的好处在于,它比固定规则更像一个会学习的搜索策略。固定规则的问题很明显:一旦任务变化,规则就未必还对;而 DGS 学的是“动作的后果”,不是“动作的形式”。只要 archive 里积累了足够多的动作—结果记录,它就能慢慢修正自己的偏好。这种能力在黑盒优化里很值钱,因为黑盒最讨厌的就是“看起来差不多,实际完全不是一回事”。
这里值得认真看一眼。DGS 的方法并不神秘,甚至有点“克制”:没去堆一堆花里胡哨的新操作符,而是把动作选择前移,再用两个代理把“选什么”这件事做得更像样。很多时候,系统性能提升并不来自更复杂的生成器,而来自更聪明的调度器。
表3:最终DGS配置的消融实验
表3:最终 DGS 配置的消融实验。这个表主要看三个问题:去掉某个模块会怎样、单独保留某个模块够不够、各个组件是不是互相配合。结果整体支持论文的主张:双代理 + 不确定性采集 不是装饰品,而是 DGS 真正起作用的核心。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是 LLM-based 自动启发式设计里“下一步先选哪个父代、用什么操作”这个高成本决策问题。DGS 的思路不是多生成,而是先把最可能有用的动作挑出来,减少无效调用。

过渡代理和效用代理分别是什么意思?过渡代理负责预测“动作会把程序带到哪个潜空间区域”,效用代理负责预测“这个区域里的孩子大概有多强”。前者管生成方向,后者管结果价值,两个合起来才像一个完整的决策系统。

它和普通的规则搜索有什么本质区别?普通规则搜索通常靠固定策略选父代或轮换操作符,更多是“经验驱动”;DGS 则把动作选择当成学习问题,利用历史代码、实例分数和父子转移记录来预测下一步动作的收益,属于“数据驱动的调度”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

创新点不在“又造了一个大框架”,而在把预生成动作选择做成可学习问题,还用双代理把动作后果拆开建模,思路清楚,工程味很足。

实验合理度:★★★★☆

对比了多个强基线,还做了受控动作选择和消融,能比较清楚地说明收益来自哪里。若能补更多任务和更长预算区间,可信度还能再抬一点。

学术研究价值:★★★★☆

它对“LLM 如何参与搜索”这条线有明确启发:不是只做生成器,而是把生成前的决策也学起来。这个方向对自动算法设计、黑盒优化都挺有参考价值。

稳定性:★★★☆☆

方法依赖 archive 里逐步积累的动作—结果数据,前期数据少的时候,代理模型可能还不够稳。属于“越搜越聪明”的类型,不是开箱即满血。

适应性以及泛化能力:★★★☆☆

论文在多个组合优化任务上都试了,但仍然集中在启发式设计这类场景。跨到别的生成式搜索问题,思路可迁移,参数和表示未必能直接照搬。

硬件需求及成本:★★★☆☆

训练两个代理再加上在线更新,成本肯定比纯规则法高,但相比反复浪费 LLM 调用,整体仍然可能是划算的。真正贵的还是生成和评测,不是代理本身。

复现难度:★★★☆☆

论文给了清晰的方法分解,但这类工作复现时很吃任务环境、评测器和 LLM 接口设置。代码若不完全开放,复现会比较考验耐心。

产品化成熟度:★★★☆☆

在“昂贵搜索、有限预算、需要不断试错”的场景里有落地潜力,比如自动算法调优、启发式生成、求解器组件搜索。但要真正产品化,还得先解决稳定性、成本和任务适配问题。

可能的问题:方法思路干净,但依赖历史数据质量和代理预测精度;如果早期 archive 噪声太大,动作选择可能会被带偏。更像一套“越跑越顺”的搜索系统,不是一次性神兵。


主要参考文献

1. Yuhan Wang, Chaoda Peng, Xingyu Wu, Sheng-Hao Wu, Zhi-Hui Zhan. How to Guide LLM Generation: Dual-Surrogate Guided Search for Automated Heuristic Design. arXiv, 2026.
2. Romera-Paredes et al. FunSearch: Making New Discoveries in Mathematical Sciences using Large Language Models. 2024.
3. Liu et al. Evolution of Heuristics (EoH). 2024.
4. Ye et al. ReEvo. 2024.
5. Zheng et al. Monte Carlo Tree Search for Automated Heuristic Design (MCTS-AHD). 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。