← 返回 PaperDaily 大模型与智能体

Google+UC Berkeley新作:ArchAgent v2自动进化三级预取器

预取器是芯片里的“预言家”,过去全靠人类工程师手搓,如今Google联合UC Berkeley让LLM进化智能体自己“进化”出一个三级预取器,直接拿下DPC4冠军,IPC比人类顶级方案还高0.3%,低带宽场景下更是领先2%。这是AI自动硬件设计第一次真正在权威竞赛里赢过人类冠军,值得所有做体系结构和AI的人围观。

Google+UC Berkeley新作:ArchAgent v2自动进化三级预取器
原论文信息如下:
论文标题:
ArchAgent v2: A Case Study with the Data Prefetching Championship(ArchAgent v2:与数据预取锦标赛的一次实战)
发表日期:
2026年8月
发表单位:
Google、加州大学伯克利分校(UC Berkeley)、Google DeepMind
原文链接:
https://arxiv.org/pdf/2608.09874v1.pdf

引言:芯片里的“预言家”,被AI悄悄换掉了

芯片里有一种专门“猜未来”的硬件,叫数据预取器(Prefetcher)。它的工作简单说就一句话:在CPU真正需要数据之前,提前把数据从内存搬到离计算单元更近的缓存里。猜得准,程序跑得飞快;猜错了,不仅浪费带宽,还可能把有用的数据挤出去,让性能更差。过去几十年,预取器全靠人类架构师手工设计:分析程序访存模式、设计预测表、调参、仿真验证,一代代迭代出像Berti、Pythia这样精巧的算法。每一点性能提升,都是工程师们在仿真器前熬出来的。
但现在,剧本变了。
Google联合UC Berkeley发布的这篇论文里,一个叫ArchAgent v2的AI智能体框架,用大语言模型(LLM)驱动进化搜索,自动设计出了一个三级数据预取器。这个AI设计的方案,在第四届数据预取锦标赛(DPC4)上拿下了冠军——不是靠人类帮它调参,而是它自己从零“进化”出来的。更扎心的是,它比上一届人类手写的冠军方案BertiGO,整体IPC(每周期指令数)还高了0.3%;在低带宽单核场景下,领先幅度达到2个百分点(4.6%对2.6%)。
这不是实验室里自娱自乐。DPC4是体系结构领域公认的数据预取权威赛事,从2009年办到现在,吸引了全球顶尖机构同台竞技。今年的比赛要求参赛者同时设计L1D、L2、LLC三级预取器,还要严格遵守每级独立的存储预算(32KB、128KB、256KB),训练集和验证集分离,规则非常硬核。ArchAgent v2在这种规则下,自动搜索出来的方案居然赢了人类顶级专家,这放在两年前几乎没人敢信。
这篇论文是ArchAgent系列的第二代。第一代ArchAgent(v1)在2025年底发布,已经能自动发现缓存替换策略,但面对复杂度高一个量级的多级预取器,v1直接“哑火”。v2新增了两项关键设计:级联式分治进化搜索硬件可实现性存储反馈回路。前者把大问题拆成小问题逐级攻克,后者让

从人工设计到AI自动发现:ArchAgent v2如何征服数据预取锦标赛

数据预取器是CPU里专门负责“猜未来”的硬件。程序执行到某个数据访问时,如果预取器提前把后续要用的数据拉到缓存里,CPU就不用干等内存。但预取器如果猜错,不仅浪费带宽,还可能污染缓存。所以预取器设计在计算机体系结构领域素有“玄学”之称——它的核心难点不在电路,而在算法能否聪明地预测成千上万种程序的访存模式。几十年来,Berti、Pythia、EDP、Global Berti这些经典预取算法,都是架构师们用数不清的C++代码、仿真和试错一点点磨出来的。
AI正在重写这个故事。Google DeepMind此前提出的AlphaEvolve等进化智能体,能以“LLM生成代码→仿真评估→反馈进化”的闭环,自主探索算法设计空间。ArchAgent v1最早把这种范式带入计算机体系结构:它让LLM不断生成缓存替换策略,交给ChampSim模拟器评估性能,再让性能指标指导下一轮变异,最终在一个月内自动发现高性能缓存替换策略,在SPEC 2006单核配置上相对SOTA提升0.9%,在Google多核负载上提升5.3%。
不过,v1的局限也很明显:它只能搜索单级缓存组件。DPC4这类权威赛事,要求参赛者同时设计L1D、L2、LLC三级预取器,每个缓存级不仅有独立的存储预算(L1D 32KB、L2 128KB、LLC 256KB),而且三级之间存在复杂的交互——一个级上“看起来更好”的改动,放到另外两级的环境中可能完全失效。搜索空间从“一个替换策略”爆炸成“三个预取器的协同决策”,这迫使团队把ArchAgent升级到v2,引入了两项关键技术:级联式分治进化搜索(Cascaded Evolutionary Search)硬件可实现性存储反馈回路(Hardware-Realizability Feedback Loop)。图1展示了级联分治的思路——像剥洋葱一样逐层搜索;图2则是ArchAgent整体的闭环系统架构。
图1:级联式分治进化搜索示意图
图1:级联式分治进化搜索示意图
图2:ArchAgent系统总体概览
图2:ArchAgent系统总体概览

级联式分治:破解多级预取器设计空间爆炸难题

先说说为什么三级预取器不能简单“一起进化”。第一,搜索空间极度膨胀:每个预取器既要预测目标地址,又要决定预取时机和激进程度,三个预取器同时搜索的复杂度是组合级增长。第二,评估成本太高:ChampSim仿真一次单核trace最长要12小时以上,多核更慢。第三,也是最重要的,三级机制之间互相耦合:一个级上性能提升的变异,放到其他级的环境中可能完全失效,形成非单调的搜索空间,这对进化算法极不友好。
ArchAgent v2的解法是“级联式分治”。整个搜索过程分成两大阶段。第一阶段是逐级优化。第一步只进化L1D预取器(从Berti起步),保持L2用Pythia、LLC为空不变;等L1D性能进入平台期,冻结最优的L1D候选,再进化L2预取器,这是第二步;L2收敛后,冻结最优L1D和L2,再进化LLC预取器,这是第三步。每一轮搜索只面对一个缓存级的小型设计空间,LLM的推理压力大大降低,评估周期也短得多。
第二阶段是全局协同优化。在单级进化各自收敛后,把每级的最优预选方案组合起来做“交叉预取器优化”,捕捉级间协同效应。这个阶段又分两轮:先只跑单核工作负载,并对低带宽配置双倍加权(因为低带宽单核与多核在带宽争用特性上有很强的相似性,可以当作多核的廉价近似);之后再引入多核工作负载,继续进化。这样既避免了一上来就被多核仿真拖垮,又尽可能让最终方案兼顾多核场景。图4展示了整套级联方法的完整流程。
图4:进化搜索“级联”方法示意
图4:进化搜索“级联”方法示意图

硬件可实现性反馈:让AI设计不再纸上谈兵

真实芯片设计里,算法再漂亮,面积超了就是废纸。DPC4规定L1D预取器存储预算32KB、L2 128KB、LLC 256KB,超预算直接取消资格。麻烦的是,ChampSim这类仿真器只关心IPC之类的性能指标,完全不理会一个C++数据结构在真实硬件上占多少比特。而LLM优化器的天性就是“为了性能可以无限堆料”,如果不加外部约束,生成的设计很容易超预算。
ArchAgent v2为此构建了硬件可实现性反馈回路,具体有三道关卡:
第一,在提示词中写死存储约束。论文原文给出了一个典型的提示词片段(图3),它明确要求每个预取器必须实现prefetcher_size()函数并如实上报占用字节数;任何新增组件必须同步计入size函数;C++类型如果要表示3比特字段,写入前必须做掩码处理(避免按64位整数算存储)。这些规约从源头引导LLM生成“有面积意识”的代码。
第二,在编译和仿真阶段自动检查。框架为每个预取器接入prefetcher_size()接口,动态计算候选方案的存储占用,一旦超过预算,直接拒绝,不进入仿真评估。这就相当于给进化系统一个强烈的负面奖励,把“不可实现”的方案在最早期就淘汰掉,而不是等仿真跑完十几小时后才发现跑偏。
第三,离线LLM裁判与人工复核。LLM在修改代码时需要同步更新逻辑和size函数,系统用离线LLM judge检查它们的同步性,最终输出再经过人工核验。多管齐下,使得最终进化出的方案存储占用全部合规——L1D 31.1KB(限额32KB)、L2 110KB(限额128KB)、LLC 230.3KB(限额256KB)。这套反馈机制是ArchAgent v2能够真正满足硬件设计约束的关键,也是“AI辅助硬件设计”从玩具走向工程的必要一环。

超越人类冠军:ArchAgent v2在DPC4中的表现

经过约两个月的自动进化,ArchAgent v2搜索出一套三级预取方案。拆开来看,这套方案的每个模块都带着浓重的“机器设计”痕迹。
L1D预取器在Berti基础上补了两个新引擎:全局步长追踪器(Global Stride Tracker, GST)捕捉跨页面的线性步长流,全局增量历史表(Global Delta History Table, GDHT)捕捉不规则的页级跳转;此外还引入一个基于强化学习的仲裁器(RL Arbiter),用PC和滑动增量历史上下文给不同引擎打分决策,并根据真实缓存利用率来奖励或惩罚对应引擎。内存带宽吃紧时,仲裁器会自动降低激进程度,避免总线拥塞。
L2预取器没有推翻Pythia主体,而是升级了它的RL特征和动作空间:特征从2个扩展到5个,纳入PC序列与增量历史;动作空间从15种扩展到18种,都是正负2的幂次步长,覆盖流式、跨步、矩阵等常见模式;同时用“求和池化+置信度阈值”减少陌生模式下的激进预取。LLC预取器则用两个并行引擎——历史序列引擎负责重放不规则的指针追逐缺失序列,规则引擎检测线性/跨步访问,由滑动增量窗口按近期缺失的规律程度切换引擎。图5、图6、图7分别展示了三个缓存级的模块改动,表II列出了各级存储分项。
图5:L1D预取器修改高层概览
图5:L1D预取器修改的高层概览(虚线表示新增或修改的组件)
图6:L2预取器修改高层概览
图6:L2预取器修改的高层概览(虚线表示新增或修改的组件)
图7:LLC预取器修改高层概览
图7:LLC预取器修改的高层概览(虚线表示新增或修改的组件)
表II:进化所得预取器的存储占用分解
表II:进化所得预取器的存储占用分解
实验结果方面,在DPC4官方规则下,这套AI进化出的三级预取器相比官方基线实现了3.8%的geomean IPC提升,比上一届冠军方案BertiGO还高出0.3%。最亮眼的是低带宽单核配置:AI方案达到4.6%的性能提升,而BertiGO只有2.6%——低带宽恰恰是数据预取最难做出增益的场景。但在多核配置下,AI方案比BertiGO低约1.5%,说明多核进化仍有短板。图8给出了与多代基线/冠军方案的整体对比,图9和图10展示了分工作负载套件的细粒度表现。表I总结了进化和验证使用的方法论。
图8:ArchAgent v2方案与基线/SOTA预取器对比
图8:ArchAgent v2方案与基线/SOTA预取器的整体对比(EDP、Global Berti与BertiGO)
图9:单核ChampSim锦标赛配置下的分套件表现
图9:单核ChampSim锦标赛配置下分工作负载套件的性能对比
图10:多核ChampSim锦标赛配置下的分套件表现
图10:多核ChampSim锦标赛配置下分工作负载套件的性能对比
表I:训练/进化与验证的仿真方法论
表I:训练/进化与验证的仿真方法论
分析原因,AI方案在低带宽场景的强势,很大程度上来自级联搜索中把低带宽配置双倍加权,让进化压力集中在这个难啃的骨头上;多核场景因为在进化后期才引入,且仿真开销巨大、搜索空间爆炸,所以优化并不充分。总体而言,ArchAgent v2已经证明了自动进化搜索具备与人类顶级架构师掰手腕的能力。

12,000次进化的启示:AI如何探索微架构设计空间

这篇论文还做了一件很多AI系统论文不太做的事:把进化过程完整“解剖”给读者看。在L1D预取器第一次进化运行中,系统评估了超过12,000个候选设计,其中有效且带来提升的约占一半,另一半是编译失败、性能倒退或直接超预算的废案。图11展示了成功与失败设计的占比,一半的失败率说明即便有LLM加持,进化搜索仍伴随大量无效尝试;但换个角度看,AI能并行跑数千个候选,这个吞吐量是人类团队永远无法企及的。
图11:被评估想法的成功与失败
图11:被评估想法的成功与失败
从时间维度看(图12),候选设计的性能波动极大,最差值远低于基线,但“历史最优”红线始终在稳步爬升。论文追踪了最终冠军方案的主血脉(main lineage),发现AI的进化路径并不是一路“打怪升级”,而是“大跳变+微调”交替:大多数性能突破源于某个结构性的大改动,之后往往需要连续几代的小参数精修才能把增益真正释放出来。图13标注了这条主血脉,图14展示了不同想法在进化进程中的分布;表IV和表V进一步从“为什么这些想法有效”的角度做了分类统计。
图12:进化过程中的得分与热力图
图12:进化过程中的得分与热力图
图13:冠军方案的主血脉注释
图13:冠军方案的主血脉注释
图14:进化过程中想法的分布
图14:进化过程中想法的分布
表IV:“为什么”分类法
表IV:“为什么”分类法
表V:顶级想法分析
表V:顶级想法分析
这种“大跳变+微调”的进化模式,其实和生物进化里的“间断平衡”有异曲同工之处。对后续研究者来说,把进化过程公开、分析有效的和无效的想法,比单纯发一个“我赢了竞赛”的结论更有价值——因为它直接关系到下一代进化算法怎么设计。

未来展望:AI驱动的计算机体系结构发现

ArchAgent v2的突破还只是一个开始。当AI能在权威竞赛里赢过人类顶级架构师,整个计算机体系结构的设计范式都可能被改写。但论文也毫不避讳当前方法的几个软肋。
首先是多核场景:仿真延迟太高,进化迭代慢,多核工作负载的搜索空间又指数级扩大,导致最终方案在多核上比人类冠军掉点。其次是物理约束的维度:存储预算只是面积的一个代理,真实的芯片设计还要考虑布线、功耗、时序,这些约束目前还没有进入进化循环。最后是进化效率:12,000次评估中一半是无效尝试,这既说明AI的探索能力强,也说明失败成本依然高昂。
未来可以期待的方向包括:把功耗和布线的评估模型接入进化循环,让AI不仅受预算约束,还受时序和能耗约束;用多核模拟器的加速技术(比如抽样仿真)把多核纳入更早的进化阶段;更进一步,AI可以走出预取器这类局部模块,去探索流水线结构、缓存层次、互连拓扑等更高层的微架构组织。到那时候,人类架构师的角色可能会从“手写方案”变成“定义搜索空间和约束的人”——这是一个令人兴奋但也必须谨慎前行的方向。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?Google与UC Berkeley团队提出ArchAgent v2,用级联进化搜索与硬件可实现性反馈,在DPC4数据预取锦标赛中自动设计出三级预取器,IPC比人类冠军BertiGO高0.3%,低带宽场景高2%,展现AI自动硬件发
这篇工作最值得看的点是什么?ArchAgent v2自动设计的预取器在DPC4竞赛中超越人工设计的冠军方案BertiGO,实现3.8%的几何平均IPC加速比,在低带宽单核配置下达到4.6%的加速比。
这篇工作的边界或风险在哪里?优点:(1) 提出级联式分治进化搜索方法,有效处理多级预取器设计的组合爆炸问题;(2) 引入硬件可实现性反馈循环,确保生成的预取器满足物理存储约束;(3) 在DPC4竞赛中超越人工设计的冠军方案。缺点:(1) 多核场景下的进化搜索仍面临仿真延迟带来的挑战;(2) 生成的预取器设计新颖性有限,主要优势在于组合已有技术;(3) 进化过程效率较低,大量候选设计失败。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出ArchAgent v2框架,通过级联式分治进化搜索和硬件可实现性存储反馈循环,实现多级数据预取器的自动化设计。

实验合理度:★★★★☆

IPC(每周期指令数)加速比

学术研究价值:★★★★☆

提出ArchAgent v2框架,通过级联式分治进化搜索和硬件可实现性存储反馈循环,实现多级数据预取器的自动化设计;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;(2) 引入硬件可实现性反馈循环,确保生成的预取器满足物理存储约束;(3) 在DPC4竞赛中超越人工设计的冠军方案。缺点:(1) 多核场景下的进化搜索仍面临仿真延迟带来的挑战;(2) 生成的预取器设计新颖性有限,主要优势在于组合已有技术;

主要参考文献

[1] 原论文: ArchAgent v2: A Case Study with the Data Prefetching Championship, arXiv:2608.09874v1, Google / UC Berkeley / Google DeepMind, 2026.
[2] ArchAgent v1(自动微架构发现框架), 2025.(论文引文[16])
[3] AlphaEvolve(Google DeepMind的LLM进化框架), 2025.(论文引文[28])
[4] ChampSim:学术微架构仿真器.(论文引文[13])
[5] Fourth Data Prefetching Championship (DPC4) 竞赛规则.(论文引文[6])
[6] BertiGO:DPC4冠军人类设计方案.(论文引文[37])
[7] Berti与Pythia基线预取器.(论文引文[26][7])
[8] EDP和Global Berti既有SOTA预取方案.(论文引文[27][32])

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
数据预取像点菜,AI自动当大厨;人类冠军熬夜肝,架构智能体轻松超车。想围观AI设计芯片的“进化大片”?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 体系结构+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。