← 返回 PaperDaily 大模型与智能体

东南大学提出DREvo:5个基准测试全面领先,平均提升16.2%

继2025年6月推过智能体基准评测之后,龙哥又盯上了智能体自演化的“可靠性”痛点。东南大学这篇DREvo,把历史经验当作“过期货”来查保质期,还能自动提炼出下一步修改方向,五个基准全超之前方法,平均提升16.2%,自我进化终于不再原地打转!

原论文信息如下:
论文标题:
DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution
发表日期: 2026年07月
发表单位: 东南大学计算机科学与工程学院(合作:香港科技大学、浙江师范大学、浙江工业大学、浙江大学)

自我进化为何总在“原地踏步”?——问题引出

想象一下,你让一个AI智能体自己写代码、自己跑评测、自己找bug、然后自己改代码,形成一个完整的“自我进化”闭环。听起来是不是很科幻?实际上,这已经是大模型领域一个非常前沿且热门的方向了。学术上,它被称为 Harness Self-Evolution(智能体框架自演化)。
这里的 Harness(框架/套件)指的是智能体外部的“行动逻辑”,比如它如何组织上下文、如何管理记忆、如何调用工具、如何解析输出。可以粗暴地理解为智能体的“操作系统”或“工作流程”。一个优秀的Harness,能让模型本身的潜力得到最大程度的释放;一个糟糕的Harness,则会让顶级模型也表现得像个“人工智障”。
然而,现实很骨感。现有的自我进化方法,比如 Meta-harness(一种通过复用历史摘要指导Harness生成的元学习方法)等,虽然让模型自己尝试去修改Harness,但它们的过程却像坐过山车一样刺激——准确率忽高忽低,反复横跳,历史的经验仿佛没有积累,花了大量计算资源和预算,可能最后得到的Harness还不如初始版本。
这种“进化了个寂寞”的现象,归根结底是两个问题没解决好:第一,过去积累的那么多试错经验,在当前状态下还靠不靠谱?第二,面对一堆新旧混杂的经验,下一步到底该往哪个方向改?
龙哥导读:就像一位厨师不断往锅里加料,但从不尝味道,也不管之前加的料现在是不是已经糊了——最后端上来的菜,你说能好吃吗?这就是现有自演化方法的尴尬现状。
图1:(a) 全历史复用与压缩历史复用(Meta-harness, Claude Opus 4.6, 1M-token 上下文窗口)在 S2D, USPTO 和 Law 数据集上均表现出非平稳演化,尽管积累了历史经验,准确率在多次迭代中反复倒退和恢复。(b) 框架自演化中的两个局限性:哪些仍然有效?以及下一步应该向哪里演化?
图1(a)清晰地展示了这种剧烈的“过山车”现象。无论是粗暴地把所有历史记录都喂给模型,还是将历史记录压缩后再喂,准确率曲线都像心电图一样波动,缺乏一个稳定上升的趋势。这直接导致在有限的演化预算下(比如只有20次迭代机会),很可能把预算都消耗在了无效的探索上。

DREvo:三大机制让历史经验“常换常新”

针对上述问题,来自东南大学、香港科技大学、浙江师范大学、浙江工业大学和浙江大学的联合团队,在最新论文《DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution》中,提出了一种全新的框架自演化方法——DREvo
DREvo的名字很有深意,它是 Distilling Recalibrated Historical Experience(蒸馏校准过的历史经验)的缩写。它的核心思路不是像传统方法那样,让模型在混乱的历史记录中“盲猜”下一步,而是引入了一套精密的“证据管理”系统,通过三个环环相扣的组件,给模型一张清晰的“演化路线图”:

1. 函数级证据锚定(Function-Level Evidence Anchoring):告别“黑盒”级的日志记录,将每一次代码改动与其执行效果,精确地“锚定”到具体的函数(即Harness的某个具体组件)上。想知道修改记忆模块对结果的影响?直接查对应的证据单元就行。

2. 状态依赖证据校准(State-Dependent Evidence Recalibration):给每条证据装上“保质期”。它会动态评估:这条过去有效的经验,在现在Harness的“身体状态”下,还管不管用?过去坑过我们的方向,现在是不是又可行了?

3. 角色条件搜索意图蒸馏(Role-Conditioned Search Intent Distillation):把经过校准的证据,蒸馏成一条明确的、可执行的指令。它告诉模型:“你现在是‘利用者’,请沿着这个方向继续优化记忆模块”或“你是‘规避者’,千万别碰那个会让你出Bug的检索逻辑”。

图2:DREvo框架的详细概述,它将历史证据锚定在函数级别,在其当前框架状态下重新校准其有效性,并将其蒸馏为在有限预算下的框架自演化的显式指导。
如果说传统方法是在浓雾中通过后视镜开车,那么DREvo则是给车装上了高清雷达和智能导航——不仅知道过去的路况,还能判断哪条路现在还能走,并直接给出最佳路线。

函数级锚定 + 状态校准:精准识别哪些证据还管用

这个部分是DREvo的地基。它的核心思想是:将混乱的、迭代级别的日志,转化为颗粒度更细、更易追踪的“函数级”证据单元。

第一步:函数级证据锚定

如何实现“精准定位”?DREvo采取了以下步骤:
首先,将整个Harness看作一个功能组件的集合C,比如工具调用、上下文管理、记忆管理等。每个组件c都对应一个具体的函数实现 fc。这就建立了“组件”和“代码”之间的锚点。
然后,在每次迭代t,DREvo解析试运行日志,提取出结构化反馈信息:

ot = (gt, Qt, Ft)

其中,gt 是全局统计数据(通过率、平均分),Qt 是每个任务级别的结果(通过状态、分数变化),而 Ft 则总结了不同失败模式的频率(超时、异常、工具调用错误等)。这一步,相当于给每次迭代做了一个“体检报告”。
接着,通过计算前后两个版本Harness的代码差异(Diff),DREvo能精确识别出哪些函数被修改了(集合 C∆t),以及具体的改动内容 δt,c。然后,它会计算这次改动带来的性能变化 Δt,并据此给这条证据一个初始的“极性”ρe(+1表示正面效果,-1表示负面效果)和“权重”we(单组件修改权重高,多组件并发修改权重低)。
最终,一条结构清晰、因果明确的证据单元 et,c = (c, fc, δt,c, ot, Δt, ρe, we, pt) 就诞生了。它清晰地记录了:改了什么组件、怎么改的、效果如何,以及原始日志的出处pt。这就好比给每次操作都贴上了“标签”,再也不用在混乱的日志里大海捞针了。

第二步:状态依赖证据校准

有了“标签化”的证据后,就需要判断这些旧经验的“新鲜度”了。DREvo从两个维度进行评估:

1. 历史可靠性 rt(e):这条证据在过去被反复“回顾”时,表现是否一致?它的“新鲜度”如何?可靠性的计算分为两个部分:

结果一致性 const(e):通过公式 (3) 计算,衡量历史上这条证据被使用时,其结果与当前极性ρe的相符程度。如果每次应用这条证据都带来了正面提升,那么它的一致性就很高。
时效性 fresht(e):通过一个简单的指数衰减公式 (4) 计算,距今越久远,时效性越低。一条10次迭代前的证据,其参考价值自然会打折扣。
最后,历史可靠性 rt(e) = const(e) × fresht(e),两者相乘,确保只有“既好用又新鲜”的经验才值得信赖。
公式(3)(4)(5)(6)截图:历史可靠性、结构兼容性及校准权重的计算公式

2. 结构兼容性 qt(e):即使证据本身很可靠,但其所依附的代码组件可能已经过多次迭代,面目全非了。为了评估这一点,DREvo会将证据创建时的组件代码 Te 和当前Harness中的代码 Tt 都解析成抽象语法树(AST),然后计算它们的 TED(树编辑距离,即Tree Edit Distance)。

通过公式 (5) 将树编辑距离归一化到[0, 1]之间,距离越小,兼容性越高。这意味着,如果证据锚定的那个函数在后来的演化中基本没变过,它的兼容性就会很高。而如果该函数被彻底重构,兼容性就会骤降,这条证据也就自然“过期”了。
最终,通过公式 (6) 的调和平均数,将 rt(e)qt(e) 融合为一个最终的校准权重 we。只有当可靠性和兼容性都高时,校准权重才会高。任何一方低,都会拉低最终权重。
这一套组合拳下来,DREvo就手握一本带有“保质期”和“评分卡”的经验手册了。

角色蒸馏:给模型一张“明牌”指出下一步怎么改

如果说“校准”解决了“什么经验能用”的问题,那么“角色条件搜索意图蒸馏”就是为了解决核心问题:“下一步往哪走?”
传统方法直接将所有历史记录作为上下文,让提出者(Proposer)自己去做决策,这就像让一个已经被信息淹没的决策者,自己去分析哪条信息有用、下一步该做什么。DREvo则不同,它将决策过程显式化、流程化。
第一步:证据检索与分类。在当前迭代t的试运行后,DREvo提取失败模式Ft,然后从历史库中检索出与这些失败模式相关的历史证据集合Zt。接着,根据每个证据的校准权重we和极性ρe,将它们分为三类:

可靠正面证据(Xt):we > 0.5, 且极性为正面。这意味着:之前这么做效果很好,现在身体条件也允许,放心大胆地继续干。

可靠负面证据(At):we > 0.5, 且极性为负面。意味着:之前这么做导致性能下降,而且现在的状态也不支持。千万别再踩这个坑。

低置信度证据(Tt):we ≤ 0.5。表示证据有点过时,或者结果反复横跳,拿不准。

第二步:角色激活。根据上面的分类,DREvo会“激活”以下四种搜索角色之一:

· 利用者(Exploit):当Xt不为空时激活。让模型集中精力,沿着既定成功的路径进行优化和微调。

· 规避者(Avoid):当Xt为空,但At不为空时激活。明确告诉模型:“这些路是死胡同,别去尝试”。

· 重测者(Retest):当Xt和At都为空,但Tt不为空时激活。给模型一些低置信度的线索,让它自己去“试试看”,即使失败了也不亏,正好验证一下。

· 探索者(Explore):当以上条件都不满足,或者上次重测失败时激活。不给模型任何约束,让它基于当前的失败模式自由发挥,开拓新的方向。

这个角色激活策略(如算法1所示)是一个清晰的优先级决策树:Exploit > Avoid > Explore(或Retest)。它巧妙地在“利用”与“探索”之间取得了平衡,避免了在无效方向上反复试探。
算法1:角色激活逻辑
第三步:意图蒸馏。激活角色后,DREvo并不会把一堆杂乱的历史证据直接扔给模型。它会根据当前激活的角色,将相关的、经过校准的证据,连同当前的失败模式,蒸馏成一条简洁、明确的 搜索意图(st)
例如,一条蒸馏后的意图可能是:“当前失败主要是工具调用超时。根据历史可靠证据,上一个版本的Agent循环组件中加入了重试逻辑,效果很好。请以‘利用者’的角色,对当前循环组件的重试逻辑进行进一步优化。” 模型得到指令后,不再需要自己困惑“我要看哪段历史”,而是清晰地知道“我要改哪里,以及怎么改”。

实验验证:五个基准全面领先,进化轨迹稳如老狗

光有漂亮的框架设计可不够,真正的检验场是实验。论文在两个大类的五个权威基准上进行了全面评估:

领域推理任务:USPTO(化学反应预测)、S2D(医疗诊断)和Law(法律推理)。

智能体任务:Terminal-Bench 2.0(终端操作)和SWE-Bench Verified(代码修复)。

对比的基线方法包括了一众手动设计的强基线(如OpenHands、Claude Code等)和现有的自演化方法(如ACE、Meta-harness、AHE等)。所有演化方法都使用 Claude Opus 4.6 作为提出者,且在有限的迭代次数内(领域推理20轮,智能体任务10轮)进行演化。

实验结果分析

DREvo的效果着实令人眼前一亮。在总体性能上,它在所有五个基准上都取得了最高的准确率点估计。特别是在领域推理任务上,相比第二好的方法,在USPTO上提升了9.0个百分点,在S2D上提升了2.4个百分点,在Law上提升了4.0个百分点。
更值得注意的是,在SWE-Bench Verified这个极难的代码修复任务上,DREvo仅仅从一个针对终端的Harness(Terminus-KIRA)出发,不需要任何人工针对代码修复进行工程设计,就能在演化过程中自然进化出一个强大的代码修复Harness,最终取得了67.6%的高分,甚至击败了专门为代码任务设计的Mini-SWE-Agent等工具。这充分说明了DREvo方法的泛化潜力。
表1:整体性能 (%)。∆表示DREvo相比每个基线的绝对提升。加粗和下划线分别表示最佳和第二佳准确率。
表2:按任务难度和仓库划分的细粒度成功率 (%)。Others 包括 Pytest, Pylint, Requests, Seaborn, and Flask。加粗和下划线分别表示最佳和第二佳准确率。Matplotlib 简写为 MPL。
细粒度分析进一步佐证了DREvo的鲁棒性。在Terminal-Bench 2.0上,DREvo在中等和困难任务上的表现远超所有对手,且随着任务复杂度的增加,增益反而扩大(从中等任务的+7.3个百分点提升到困难任务的+10.0个百分点)。在SWE-Bench Verified上,DREvo在8个软件组中的5个中排名第一或并列第一,说明其提升不是针对某个特定领域的“偏科”,而是通用的能力。

进化轨迹分析

论文最让人印象深刻的实验之一,是关于进化轨迹的分析。图3清晰地展示了DREvo与Meta-harness的对比:
图3:在领域推理任务上,DREvo 和 Meta-harness (压缩历史) 在框架自演化过程中的验证集准确率 (Acc.) 和上下文 (Ctx.) 大小对比。
Meta-harness的准确率曲线(红色虚线)像过山车一样剧烈波动,在65%到90%之间反复横跳。而DREvo的曲线(蓝色实线)则在早期迭代中快速提升,之后便维持在一个较高的水平,波动非常小。这种稳定性对于实际应用至关重要——谁也不想让一个智能体“忽胖忽瘦”。
更绝的是,DREvo的提出者上下文消耗(蓝色柱状图)始终维持在约2.9K tokens的低水平。而Meta-harness的上下文(红色柱状图)则随着迭代持续增长,最终超过了5.3K tokens。这意味着,DREvo的性能提升并非靠“吃更多信息”堆砌起来的,而是靠更高效、更精准地使用信息。换句话说,它不是“死记硬背”的选手,而是个“善于总结经验、直击要害”的高手。
此外,论文还设计了“组件状态漂移”的鲁棒性测试。他们随机地、强制性地修改已演化好的Harness的某个组件,来模拟演化过程中的状态变化。实验表明,在16种设置下,不加校准地盲目复用历史证据平均导致了5.3个百分点的性能下降,而DREvo通过动态校准,不仅没有下降,反而平均提升了0.6个百分点。
图4:受控组件状态漂移下的性能变化。漂移会修改目标组件,同时保持历史证据不变。盲重用是指不加状态校准地应用证据。

总结与展望

DREvo这篇工作,精准地指出了框架自演化领域的一个核心痛点——历史经验失效与搜索方向不明确,并给出了一个优雅且工程化的解决方案。它不仅仅是在指标上取得了提升,更重要的是,它让机器自我进化的过程变得更加可控和稳定,而其较小的上下文开销也展现了巨大的落地潜力。
未来的工作可能会围绕以下几点展开:

1. 跨任务泛化性验证:论文中承认,其提升主要来自于针对特定基准(如SWE-Bench)的Harness适配,其通用性是否能迁移到未见过的新任务上,还需要进一步验证。

2. 对基础模型的依赖:所有实验都是基于Claude Opus 4.6作为“提出者”。DREvo的设计高度依赖提出者理解和执行复杂意图的能力。如果换成一个能力较弱的模型,其效果是否会大打折扣?

3. 更复杂的演化场景:目前每次迭代主要鼓励修改单个组件。对于需要多个组件协同修改才能解决的复杂问题,DREvo的多组件证据权重衰减策略可能会导致探索效率不足。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

DREvo这篇论文解决什么问题?本文主要解决了大模型智能体框架(Harness)在自我演化过程中,历史经验难以稳定指导后续搜索的问题。作者指出两个关键局限:1. 历史经验是状态依赖的,随着框架演化会变得过时;2. 缺乏显式机制将有效经验转化为可操作的搜索方向。DREvo通过证据锚定、动态校准和意图蒸馏三大机制,让智能体在有限的计算预算下实现更稳定、更高效的自我进化。

文章中的TED(Tree Edit Distance)代表什么意思?TED是树编辑距离的缩写,全称为Tree Edit Distance。它用于衡量两棵抽象语法树(AST)之间的差异程度。简单来说,它计算了将一棵树转换为另一棵树所需要的最小操作次数(如节点插入、删除和替换)。在DREvo中,TED被用来量化证据所锚定的组件代码,从证据创建到当前时刻发生了多大的结构性改变,从而评估历史证据的“结构兼容性”。

DREvo的“角色蒸馏”具体是怎么工作的?可以举一个简单的例子吗?“角色蒸馏”的核心是根据当前状态和历史证据,为提出者(Proposer)分配一个明确的“角色”,并将复杂的证据信息蒸馏成一条简洁的指令。例如,假设在演化医学诊断任务时,模型上次修改了“工具调用”组件,虽然引入了一个小错误,但整体性能提升了5%(成为正面证据)。当前迭代后,模型又遇到了“工具调用”相关的错误。DREvo会检索到此条高置信度的正面证据,激活“利用者”(Exploit)角色,然后蒸馏出意图:“当前失败模式是工具调用错误。历史证据显示,参考上一个版本的工具调用优化方案,在此基础上修复已知Bug,可能是最优解。请按此方向对工具调用组件进行修改。” 模型收到这个明确的指令后,就能立即聚焦于目标,而不需要自己去大海捞针地分析历史日志。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

在Harness自演化这个细分领域,DREvo精准定位了“历史证据失效”这个痛点,并提出了证据锚定、动态校准和意图蒸馏的一套完整解决方案,思路清晰,设计巧妙。相比传统的“一股脑喂历史”做法,创新性很足,但并非开创性范式,因此4星。

实验合理度:★★★★★

实验设计非常扎实且全面。覆盖了5个不同性质的数据集,对比了从人工设计到多种自演化方法,包含了消融实验和鲁棒性分析。结果展示详实,细粒度分析和进化轨迹分析都非常有说服力。实验设置合理,对比公平。

学术研究价值:★★★★★

自演化是智能体领域的重要课题,DREvo提出的“证据管理”和“搜索意图显式化”思想,为后续研究提供了极具参考价值的新范式。其“状态依赖”的观点可能会启发一系列关于经验复用可靠性的研究,理论意义和实践指导都很大。

稳定性:★★★★☆

从进化轨迹和漂移测试来看,DREvo展现出了远超基线方法的稳定性。但目前的验证主要集中在论文设定的几个基准上,在更开放、更嘈杂的真实AI工作流中,其表现是否能保持,还需要更多测试,因此给4星。

适应性以及泛化能力:★★★★☆

从领域的推理任务到通用的代码修复任务,DREvo都表现出了强大的适应性,特别是能够将终端型的Harness进化为代码修复Harness,展示了其强大的泛化潜力。但正如论文所述,目前的提升主要针对特定基准,跨任务的泛化能力尚未验证,因此4星。

硬件需求及成本:★★★★☆

DREvo的核心优势之一就是开销小。其提出者的上下文窗口消耗极低(约2.9K tokens),远低于Meta-harness。虽然引入了AST解析等额外计算,但相比于减少的无效迭代和节省的API调用成本,这完全是值得的。不过,它仍然依赖顶级闭源模型作为提出者,对个人开发者不算友好。

复现难度:★★★☆☆

论文对方法细节描述得比较清晰,并给出了算法伪代码,逻辑上是可复现的。但考虑到其依赖Claude Opus等闭源模型,并需要在多个复杂基准上进行几十轮迭代,实际复现的全流程成本和门槛较高。

产品化成熟度:★★★☆☆

目前仍处于研究阶段,离直接产品化还有距离。它证明了更加智能、自适应的Harness自演化系统是可能的,但要让它在复杂的商业场景中稳定可靠地工作,还需要进行产品级的工程优化和更多场景的验证。

可能的问题:论文承认其提升是基准适配性的表现,跨任务泛化性不足。此外,其核心机制高度依赖能理解和执行复杂意图的高性能模型(如Claude Opus),这限制了其在弱模型场景下的应用。对多组件协同修改的支持也相对保守。


主要参考文献

[1] Lee, S., et al. (2026). Meta-harness: Harness Self-Evolution via Reusing Compressed Summaries.
[2] Guo, H., et al. (2026). DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution. arXiv:2607.26722.
[3] Yang, J., et al. (2024b). SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 智能体+上海+东南大学+御龙言智),根据格式备注,可更快被通过且邀请进群。

想第一时间get到DREvo这样的自演化前沿方法?想和同行一起破解“历史经验失效”的痛点?加入我们,和大模型智能体方向的同好一起进化!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。