← 返回 PaperDaily 大模型与智能体

斯坦福联手KRAFTON:模型权重不是全部,让AI一边练脑一边换装备,最高涨24个点

斯坦福Chelsea Finn团队联合KRAFTON提出WHALE,把智能体优化从"单练模型"升级为"模型+执行框架交替进化",三个任务上最多提升24.38个百分点。对做智能体训练和Agent产品落地的朋友,这篇值得细读。

斯坦福联手KRAFTON:模型权重不是全部,让AI一边练脑一边换装备,最高涨24个点

paperdaily_reaction_gif


原论文信息如下:
论文标题:
WHALE: A Simple Recipe for Joint Harness–Weight Optimization
发表日期:
2026年09月

发表单位:
KRAFTON、KAIST、斯坦福大学

原文链接:
https://arxiv.org/pdf/2609.00196v1.pdf

开源代码链接:
https://github.com/krafton-ai/WHALE

家人们,今天咱们聊一个老有意思的话题:一个大模型智能体(Agent),到底啥最重要?
很多人第一反应是:那当然是模型权重啊!参数越大越聪明,微调越多越听话,这不是常识吗?
但今天这篇论文要告诉你:模型权重只是智能体的一半,甚至可能只是一部分。另一半,是那个平时不怎么被注意到的"外壳"——harness,也就是负责管理上下文、调用工具、处理错误、决定什么时候停下来的那层执行代码。
打个比方你就懂了。模型权重像是一个人的"脑子",而harness则是这个人的"手脚和习惯"。脑子再聪明,如果手脚不听使唤、做事没条理、拿到工具不知道怎么用,那也白搭。反过来,手脚再灵活,脑子不行,同样成不了事。
以前的研究呢,要么只优化模型权重(比如各种微调方法),要么只优化harness(比如最近很火的自动harness搜索),又或者两边都动但只局限于"文本提示词"这个层面。从来没有人想过:能不能让模型权重和harness代码像一对搭档一样,你一步我一步,交替着一起变强?

引言:模型权重只是智能体的一半,另一半是什么?

先来把概念掰扯清楚。这里说的harness到底是什么玩意儿?一句话概括,harness就是"把模型接到真实任务环境上的那一整套胶水代码"。具体包括:系统提示词怎么写、用户消息怎么组织、工具(比如搜索引擎、代码解释器)的schema怎么定义、工具返回的结果怎么解析、出错怎么处理、上下文怎么管理、对话什么时候该结束……这些统统算harness。
举一个具体例子。假设你做一个带检索功能的问答智能体:模型再强,如果harness里规定只检索一篇文档就给答案,那遇到需要多跳推理的问题直接抓瞎;反过来,harness写得再好,检索回来一堆文档,模型没能力从中综合出正确答案,一样白搭。这就是论文开头说的"shifting bottleneck"(漂移的瓶颈)——有时候卡在模型,有时候卡在harness,而且这个瓶颈位置还会随着一方的优化而转移。
图1(a):联合搜索空间示意
图1(a):联合搜索空间示意。只做权重优化或只做harness优化,都只是在J(θ,h)的单一坐标轴上移动;交替更新则可以让两个组件协同进化。
既然两边都重要,那最直觉的想法就是:那我同时优化两边,不就行了?理论上没错,但实际操作起来有一个大坑——两个组件更新的"节奏"完全对不上。
权重更新走的是"采样轨迹→算梯度→更新参数"这种高频小步快跑的路子;而harness搜索走的是"提出候选→大量rollout评估→选出更好版本"这种低频大动作的节奏。硬把两者拼在一起跑,要么互相干扰导致根本分不清是谁的功劳谁的锅,要么就得频繁同步互相等待,效率低到怀疑人生。
那怎么办?论文给出的答案非常朴素却有效:交替。先固定harness,专心训练模型;再固定训练好的模型,专心搜索更好的harness。一个周期一个周期来,谁也不干扰谁,但每次更新都是基于对方的最新状态。这其实有点像一个古老的数学优化方法——坐标下降法(Coordinate Descent)的思路。

方法概述:WHALE如何实现权重与代码的协同进化?

WHALE的全称是Weight-Harness Alternating LEarning,翻译过来就是"权重-harness交替学习"。它的结构其实特别清爽,核心就是一个两阶段的循环。整体公式可以表述为下面这样:
θ(k+1) = ModelUpdate(θk; hk, D_weight),h(k+1) = HarnessSearch(hk; θ(k+1), D_harness)
翻译一下就是:第k轮先拿着当前的harness去训练模型得到新的模型参数,然后拿着新模型去搜索更好的harness得到新的harness,如此往复。
其中两个阶段分别用了什么具体方法呢?
权重更新阶段用的是在线拒绝采样微调(online Rejection-Sampling Fine-Tuning,简称RSFT)。这个方法思路很直接:让模型在当前的harness下跑一批任务,采样多条轨迹,只保留那些通过了验证器(verifier)的正确轨迹,然后在这批"好轨迹"上做监督微调。这样做的好处是简单稳定,不需要搞复杂的强化学习算法。
harness搜索阶段用的是Meta-Harness(简称MH)。这玩意儿更狠,相当于让一个大模型(论文里用的是Claude Opus 4.7)扮演"harness工程师"的角色,它可以去翻看当前harness的源代码、运行结果、每个例子的成败记录,然后像程序员改代码一样直接修改harness的各个模块,改完在验证集上跑一遍,好的保留,差的丢弃,不断迭代。
图1(b):适应后的测试准确率对比
图1(b):适应后的测试准确率对比。WHALE在搜索问答(SearchQA)、数学推理(Math)和国际象棋谜题(Chess Puzzles)三个领域全面超过单一组件优化,也超过同时优化提示词和权重的FST方法。
听起来是不是有点像一个炼金术士在反复进行"炼丹-试药"的循环?先炼一炉丹(训练模型),再用这炉丹去试不同的药方(搜索harness),找到更好的药方后再炼一炉新丹……

核心设计:交替更新为何优于单组件优化和分阶段训练?

讲完WHALE的基本框架,接下来是整篇论文最精彩的部分:为什么简单的"交替"能吊打其他策略?
最直接的对比对象是stagewise(分阶段)优化:先用全部预算训练模型(假设4个epoch),训练完再一次性跑完所有harness搜索(假设40次迭代)。听起来没什么问题对吧?但实验结果显示,WHALE用29%的rollout量就超过了分阶段优化的最终准确率。
为什么会这样?论文给了一个非常精辟的解释:条件性过拟合(conditional over-optimization)。一句话来说就是——在分阶段优化里,第一阶段训练模型时,harness是固定的h0。模型会不自觉地"过度适应"h0的各种风格和习惯。等到第二阶段你换了一个新harness,模型反而水土不服了。
反过来也一样:如果一上来先用固定的初始模型去长时间搜索harness,搜出来的harness大概率是"专门适配这个笨模型"的方案,等后面模型变聪明了,这套harness可能反而限制了模型发挥。
图5:交替优化的两种失败极端与自适应WHALE的路径示意
图5:把每个阶段推到自身函数最大值会陷入局部最优(过优化极端);每阶段证据太少又会困在噪声里(噪声极端);自适应WHALE沿着谷底走向联合最优点。
而交替更新厉害就厉害在每一步动作幅度都很小。小幅更新模型后立刻搜索harness,此时模型对旧harness的"适配惯性"还不强,新harness很容易发挥作用;harness小幅改进后立刻又训练模型,模型很快适应新harness的节奏。两边永远在"追着对方的最新版本跑",而不是"对着一个永远不变的靶子猛练"。
不过交替更新也带来了新问题:每轮到底该训练多少、搜索多久?步幅太小,可能还没看到效果就切换了,最终在噪声里打转;步幅太大,又退化成类似分阶段优化的过拟合问题。论文专门做了一组系统的schedule对比实验,后面咱们细说。

数据准备及实验设计:三个领域检验联合优化的威力

论文选了三个很有代表性的工具使用场景来验证WHALE的效果。
第一个是搜索问答(SearchQA),模型可以调用检索工具从维基百科里找答案,训练数据含HotpotQA和Natural Questions共18946个问题,测试集覆盖7个问答数据集共700题。这个任务对harness的要求很高——检索词要不要改写?返回几条文档?每段截多长?上下文窗口怎么管理?每一步都会影响最终答案质量。
第二个是数学推理(Math),模型可以用Python代码解释器做中间计算,训练数据来自DAPO-Math-17K,测试集用AIME 2024和2025的真题,总共60道。这种任务本质上考验模型和代码执行环境之间的配合——什么时候该写代码、代码报错了怎么处理、最终答案怎么从执行结果里提取。
第三个是国际象棋谜题(Chess Puzzles),模型需要根据当前棋盘状态走出正确的将杀走法,数据来自Lichess开源题库。这个场景很有意思——棋盘怎么呈现?合法走法列表怎么组织?模型输出怎么解析?每一步的限制都极大地影响模型能不能做对。
三个任务里,SearchQA和Math用Qwen3.5-2B做基座模型,Chess Puzzles因为需要更强的推理能力所以用Qwen3.5-4B。所有方法共享同样的初始模型和初始harness,总预算也严格控制一致,这样对比出来的差距才公平。
图2:各方法在测试集上的最佳-so-far mean@8准确率
图2:测试集上随rollout累积的最佳mean

模型权重只是智能体的一半,另一半是什么?

如果给“另一半”找一个更精确的工程坐标,它其实是可以被枚举的:系统提示词怎么写、用户消息怎么排版、工具用几个、工具的参数结构长什么样、工具返回结果如何被截断或改写、报错信息反馈什么、上下文窗口何时该清理、多少轮没戏就终止……这一整套可执行的“胶水”在论文里被称为harness
用一个极端的例子来感受harness的杀伤力:同样一个问答agent,如果harness规定“只检索1篇文档就必须结束”,那面对多跳问题,模型权重再大也没地方使;如果harness规定“模型必须先改写查询、最多取回8篇文档、上下文里保留最近3轮工具结果”,同一个模型可能直接产生质的飞跃。反过来说,一个写得很聪明的harness,碰上不会综合多文档信息的弱模型,也只能干瞪眼。所以论文把这种互相制约称为shifting bottleneck——瓶颈并不固定,它会随着某一方的进步而转移。
要严谨地描述这种耦合,可以定义一个系统级目标函数:模型参数记为θ,harness程序记为h,二者共同决定智能体的轨迹分布π_{θ,h}。给定任务分布和一个能给出0/1结果的验证器R,整体期望奖励写为:
公式1:系统级优化目标
公式1:系统级优化目标。J(θ,h)表示整个“模型+执行框架”的期望奖励,任务从分布P中采样,轨迹τ由策略π_{θ,h}生成,只有被验证器R判定为正确(R=1)的轨迹才计分。
由于这个函数没法拆成“权重自己好”加“harness自己好”两部分,最朴素的思路就是轮流优化:固定一个,改进另一个;再固定另一个,改进这个。WHALE正是把这一几何直觉变成了可验证的训练配方。

WHALE如何实现权重与代码的协同进化?

WHALE的全称是Weight-Harness Alternating LEarning,它的核心循环可以用一个非常简单的递推关系写出来:第k轮先固定harness、更新模型,再固定新模型、搜索harness。
公式2:WHALE交替更新公式
公式2:WHALE的交替更新公式。ModelUpdate需要提供权重更新算法,HarnessSearch需要提供harness搜索算法;两个阶段通过各自的数据集和验证器完成一次循环。
这个框架本身非常模块化,任何“权重训练器”和“harness搜索器”都能插进去。论文实验里选了两种有代表性的实例化方法,让WHALE既有说服力又容易复现:权重阶段用在线拒绝采样微调(online RSFT),harness阶段用Meta-Harness(Lee et al., 2026)。
先看权重阶段。所谓“在线拒绝采样微调”,做法是让当前模型在当前harness下每个问题采样G条轨迹(实验里G=8),只留下被验证器接受的“幸存者”,再拿这批幸存者做标准监督微调。这个家族的方法已经被多篇论文验证过,比PPO这类强化学习算法简单不少,因为它不需要价值网络、不需要广义优势估计,只要会做SFT就行,训练稳定性也更好。
公式3:在线RSFT的优化目标。S⁺是验证器接受的“正确轨迹”集合;Z(τ)取轨迹中模型自己生成的token(用户提示与工具返回不属于要学习的对象);整个目标按token数归一化,避免长轨迹获得不成比例的大梯度。
这里有个细节值得划重点:用于生成轨迹的“行为模型”和正在训练的“目标模型”是分离的。每批数据先用旧权重rollout,再用新权重在批内做梯度上升,然后同步给采样worker。这套online设置能持续用新策略采样,让模型学到的是自己当前能力边界内能产出的最好行为,而不是数据集里的“历史最佳行为”。
再看harness搜索阶段。Meta-Harness的思路和AutoML有点像,不过它“演化”的对象不是网络结构,而是可以被执行的完整代码程序。搜索过程维护一个harness档案库,里面放着历史上的候选方案、它们的聚合分数、每个例子的成败记录和轨迹日志。
每个搜索轮次里,一个由大模型扮演的“提案器”会先审阅档案库里的源代码和评测产物,然后一次性写出M个新的harness候选;每个候选都要在harness搜索数据集上跑真实rollout,用验证器打分;最后把档案库里分数最高的harness设为新的接受状态。整个搜索过程允许后来者改进之前任意一个老版本,也允许直接回滚到早期设计,这种带档案的“宽口径搜索”比简单爬山要稳一些。
公式4:harness搜索的评估分数
公式4:harness搜索阶段使用的经验评分。对于给定的模型θ和候选harness h,在harness搜索数据集上对每个问题做多次采样求平均,再对所有样本求平均。实际实验中,为节省开销,每个候选-问题只采样1条轨迹。
一个容易被忽略的关键点是:WHALE对权重更新和harness搜索的输入做了刻意隔离——权重更新在D_weight上跑,harness搜索只在规模小得多的D_harness上评估。搜索时的rollout数量远小于训练时的rollout数量,这既控制了总预算,也避免了harness过度拟合到权重训练集的某些偶然特征上。

交替更新为何优于单组件优化和分阶段训练?

一个很自然的质疑是:有必要搞这么多轮交替吗?先把模型权重卯足了劲训练完,再卯足了劲搜一套好harness,不是更省事吗?论文把这种方案叫做分阶段优化(stagewise),并给出了清晰的否定证据。
表1汇总了三个实验域的主要设置。可以看到每个域都划分了权重训练集、harness搜索集和测试集;搜索问答用2B模型,数学推理也用2B模型,国际象棋谜题用4B模型,所有方法共享同一个初始权重和初始harness,保证对比公平。
表1:三个实验域的主要设置汇总
表1:三个实验域的主要设置汇总。分别列出权重训练数据、harness搜索数据、测试数据、基座模型以及各方法的预算配置。
论文实验结果中最直观的一张表是分数据集测试准确率。WHALE使用固定的(E,I)=(0.6,6)调度——也就是每个周期只训练0.6个epoch、只搜索6轮harness——就能在所有三个域稳定超过单一组件基线。表2给出了详细数字:在七个检索问答子数据集上、AIME两套数学题上以及国际象棋谜题上,WHALE都做到每列最佳。
表2:各数据集上的测试mean@8准确率
表2:测试集mean@8准确率(%)。WHALE在搜索问答、数学推理、国际象棋谜题上都取得了最高分,各子数据集上全面占优。加粗表示每列最优。
把论文里的对照数字翻译成大白话:相比只调权重的weight-only、只搜harness的harness-only,WHALE把测试集最高mean@8准确率提升了7.67到24.38个百分点;相比同时调权重和提示词的FST基线,提升了4.15到13.00个百分点。
尤其值得玩味的是FST对照。论文故意把FST设计成“和WHALE使用完全相同的更新方法和调度,只把搜索范围强行限制在system和user prompt上”。这样一来,FST与WHALE的差距就纯粹来自“可执行harness”和“提示词”的表达能力差异。实验结果说明:在工具调用、错误恢复、终止机制这些层面上,光改文本提示是不够的,必须让优化器直接触碰代码。
为什么分阶段优化会吃亏?论文给出了一个很精辟的机制解释:条件性过优化。假设先不动harness,把模型在h₀上训练到极致,模型会不可避免地把h₀的一些局部习惯“内化”进去——比如h₀每次只给10个检索结果,模型就学会依赖这10个结果里的直接线索,不再发展“多轮追问”的能力。等到第二阶段把harness换成新的h₁,模型却已经适应不了新harness对信息深度的要求,表现反而退步。反过来,如果先把harness针对弱模型调到最好,等模型变强后,这套专门为弱者设计的harness又会限制强模型发挥。
WHALE的做法相当于每一步都不让某一方“走太远”。小幅更新权重后马上换harness,模型还没来得及固化对旧harness的适应;harness只搜索几轮就立刻重新训练权重,harness也不会为了某一个固定模型过度特化。两边始终在追着对方的最新版本跑,自然更容易接近联合最优。

哪个组件是瓶颈?领域差异揭示的规律

WHALE整体有效,但论文没有停留在“总分数更高”这种粗粒度结论上。它进一步拆解了行为指标,让我们看清在什么情况下瓶颈在模型、什么情况下瓶颈在harness。图3展示了两类典型的领域差异。
图3:各方法在测试轨迹上的行为指标分解
图3:测试轨迹上的行为指标随rollout累积的变化。(a-c)SearchQA中格式遵从率、至少检索到包含参考答案文档的轨迹比例、以及在此基础上答案抽取正确率;(d-e)Math中达到token上限的轨迹比例、以及能从轨迹中提取出最终boxed答案的比例。虚线标出各方法达到最佳测试准确率的时刻。
搜索问答是典型的harness主导场景。三个子能力里最夸张的是“正确检索到含答案文档”的比例:weight-only只能把这个指标从26.88%提到很有限的程度,而harness-only用少得多的rollout直接把它拉到60.61%。WHALE把两者结合后达到65.41%。原因很直接:虽然查询是模型写的,但查询改写、返回文档数量、上下文截取方式全部由harness控制,改动harness对检索效率的影响远大于改权重。
数学推理则反过来,是典型的模型主导场景。主要瓶颈是“响应长度爆炸”:这个任务的2B模型有95.83%的轨迹会撞上token上限,导致答案根本写不完。weight-only能把截断率压到30.83%,因为它从“正确且及时终止”的轨迹里学到了要精简输出。harness-only就没这么幸运了——它也能通过限制轮数、设置response cap等招数尝试缩短输出,但模型本身“啰嗦”的行为不改变,格式正确率几乎推不动。WHALE最惊艳的案例出现在cycle 1:权重刚更新完一丁点,harness搜索只用了4,608次rollout就比harness-only花46,080次rollout换来的格式提升还高。
这两种对立的“主导权”给实践者一个重要启发:如果想知道当前agent主要卡在哪里,不必做昂贵的全量实验。先花小预算做一轮短harness搜索,再花小预算做一轮短权重训练,观察哪边带来的收益更大,就能低成本诊断瓶颈位置。用论文的话说:a short harness search serves as a low-cost diagnostic before extensive model training。

如何自动决定何时切换更新阶段?

交替优化看起来很美,但立刻带来一个实用问题:每个周期到底训练多久、搜索多少轮?如果每轮太小,还没看到有效信号就切走,最后容易在噪声里原地打转;如果每轮太大,又退化成接近分阶段优化的过优化状态。论文用五个固定调度组合做了网格实验(如图4),并给出了很有指导意义的结论。
图4:SearchQA与数学推理上的调度对比
图4:SearchQA与数学推理上的调度对比。每条折线代表一种调度策略“目前见过的最好准确率”;星标是各策略在整个预算上达到的最佳测试准确率。横轴是累计rollout数,纵轴是mean@8。
结果非常反直觉:搜索问答和数学推理处于两个相反的瓶颈区间,但它们各自最强的固定调度居然是同一组——(E,I)=(0.2,6),也就是每周期只训0.2个epoch、但harness搜索舍得给6轮。在SearchQA上(0.2,6)达到50.09%,比主实验用的(0.6,6)高1.75个百分点;在Math上达到28.33%,高出3.54个百分点。这说明“权重小步走、harness相对多搜”可能是跨领域比较稳的默认配置。
表3:各调度策略的最佳准确率与消耗rollout数
表3:图4中每种运行策略达到的最佳测试准确率,以及消耗的rollout数。加粗为每个域最高准确率,下划线为次高。这张表同时展示了预算效率:同一准确率下,交替更新比stagewise少用大量rollout。
既然固定调度这么难调,能不能让算法自己决定切换时机?论文提出了一个自适应WHALE变体,思路一句话就能说清:设一个最小阶段长度,之后如果当前阶段的训练信号连续一定次数不再提升,就主动切到另一个阶段。权重阶段看的是滑动窗口内的平均训练奖励,harness阶段看的是档案库里新harness是否还能刷新最高训练分。
这个自适应规则在实验里表现得很争气:在SearchQA和Math上,它都超过了精心调过超参的固定调度,同时把(E,I)从超参数清单里删掉了。值得一提的细节是,自适应WHALE只根据训练信号做切换,完全不看验证集,因此在论文的评估体系里不存在“拿测试集信息偷偷做早停”的嫌疑。
图6:自适应WHALE各周期真实消耗的预算
图6:自适应WHALE的耐心规则在SearchQA和数学推理中实际选择的每周期预算:柱状是权重更新epoch数(左轴),点线是harness搜索轮数(右轴)。虚线标出各自的最小阶段长度。可以看到自适应规则在前几周期倾向于多搜harness,后期则更多地把预算留给权重。

总结与展望:模型与harness应作为整体训练

把整篇论文压缩成一句对Agent训练社区的建议,就是“别再把权重和执行框架割裂

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?斯坦福等机构提出WHALE框架,首次实现智能体模型权重与可执行harness代码的交替联合优化,三个任务上最高提升24.38个百分点,揭示"谁拖后腿就换谁"的协同进化新范式。
这篇工作最值得看的点是什么?WHALE在三个领域均取得最高准确率,超越仅权重更新7.67-10.05个百分点,超越仅harness更新7.67-24.38个百分点,超越FST 4.15-13.00个百分点;自适应WHALE在SearchQA达到52.82%准确率。
这篇工作的边界或风险在哪里?优点:(1)提出新颖的交替优化框架,解决模型与harness协同适应问题;(2)模块化设计,可适配任意权重更新和harness搜索方法;(3)深入分析瓶颈域和调度策略,提供实用指导;(4)自适应版本消除手动调度超参数。缺点:(1)计算开销较大,需要多轮交替训练和搜索;(2)依赖Meta-Harness的proposer(Claude Opus 4.7),成本较高;(3)未在更大规模模型上验证;(4)自适应WHALE在Math领域略逊于最优手动调度。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出WHALE框架,通过交替执行模型权重更新(在线拒绝采样微调)与可执行harness代码搜索(Meta-Harness),实现智能体系统中模型与外围代码的协同优化。

实验合理度:★★★★☆

测试集上的mean@8准确率(每个样本采样8条轨迹的成功率)。

学术研究价值:★★★★☆

提出WHALE框架,通过交替执行模型权重更新(在线拒绝采样微调)与可执行harness代码搜索(Meta-Harness),实现智能体系统中模型与外围代码的协同优化;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确报告总FLOPs;实验使用8个rollout/提示进行权重更新,1个rollout/候选-样本对进行harness搜索,测试时8个rollout/样本。

复现难度:★★★☆☆

https://github.com/krafton-ai/WHALE

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;(2)模块化设计,可适配任意权重更新和harness搜索方法;(3)深入分析瓶颈域和调度策略,提供实用指导;(4)自适应版本消除手动调度超参数。缺点:(1)计算开销较大,需要多轮交替训练和搜索;(2)依赖Meta-Harness的proposer(Claude Opus 4.


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球