← 返回 PaperDaily 大模型与智能体

快手最新A/B:收入涨4.5%,推荐系统为何终于“会买”了?

推荐系统最怕“懂你”却“不会买”——意图清楚了,行动却掉链子。快手这篇工作把理解与行动分开建模,用反馈闭环让策略真正以效果说话:在线A/B测试收入+4.506%、广告价值+4.621%,在线推理时延却几乎零增加。工业级生成式推荐落地,值得细读。

原论文信息如下:
论文标题:
From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation
发表日期:
2026年7月
发表单位:
快手科技、华中农业大学、复旦大学、天津大学
原文链接:
https://arxiv.org/pdf/2607.27789v1.pdf
你刷短视频的时候有没有遇到过这种场景:明明刚搜过网球拍、网球和球鞋,系统推给下一条的竟然是网球帽,而不是球包或手胶。要说它“不懂你”吧,推荐结果确实都在网球这个大圈子里;要说“懂你”吧,又总觉得差了那么一口气。这种感觉用一句话概括就是——它理解了你的意图,却没有采取正确的行动。快手联合高校团队在2026年提出的一篇生成式推荐论文,做的就是补上“理解”与“行动”之间的那道鸿沟。
这篇工作来自快手科技、华中农业大学、复旦大学和天津大学,一作和通讯作者等信息可在原文页面查阅。论文关注一个非常实际的问题:基于语义ID(Semantic-ID,简称SID)的生成式推荐系统,如何从“懂你”走到“会买”。在线A/B测试的结果给出了一个相当直白的回答:主站业务指标收入(Revenue)提升4.506%,广告价值(ADVV)提升4.621%,而在线推理阶段完全不需要调用大语言模型。

推荐系统总“懂你”却“不会买”?快手这项研究补上了理解与行动之间的鸿沟

要理解这个“懂而不买”的尴尬,得先搞清楚现在主流的推荐模型是怎么工作的。传统的序列推荐模型,比如SASRec、GRU4Rec这些,本质上是把用户的历史交互物品ID输入一个编码器,再预测下一个最可能交互的物品ID。这种范式很强,但天花板也很明显:它只能学到物品与物品之间的共现关系,看不出用户行为背后真正的任务是什么。换句话说,模型看到“网球拍、网球、网球鞋”这三个物品,只能统计出“买了网球拍的人常买网球”,却很难推断出“这个用户正在为一场周末比赛置办全套装备”。这种推断需要的是对用户行为背后“任务”的抽象,而不仅仅是物品层面的统计关联。
后来大家发现,可以直接把生成模型那套搬过来。每个物品用几个离散的语义编码表示,也就是论文里说的SID(Semantic-ID,语义ID),然后推荐就变成了“根据用户历史序列,一步步生成目标物品SID”的问题。TIGER、LETTER这些方法都属于这个流派。这种生成式推荐的好处是输出空间紧凑、推理高效,但论文里点出了一个关键问题:这类模型的训练目标只有“预测目标物品”这一项,意图理解和行动决策被死死绑在同一个目标里。模型在训练时只被要求“输出那个正确的物品ID”,至于为什么是这个物品、用户当前处于什么任务状态、下一步该采取什么策略,模型一概不知。这种“端到端”的简洁性反而成了瓶颈:一旦遇到训练数据里没出现过的组合,模型就只能靠物品共现频率硬猜,谈不上真正的推理。
于是论文提出了一个概念:Understanding–Action Gap,即“理解—行动鸿沟”。意思是说,模型可能已经理解了用户当前的需求,但在“下一步到底该推哪个具体物品”的决策上,依然缺乏有效的指导信号。大语言模型可以补上语义推理的能力,但LLM本身没有接受过“推荐结果好坏”的反馈训练,它说得头头是道,不代表推荐结果真的有效。要弥合这道鸿沟,就需要把“理解”和“行动”分开来看,并且用真实的推荐效果给“行动”打分。这个思路其实和强化学习里的“策略梯度”有异曲同工之妙——先有一个行动假设,再用环境反馈来修正假设,只不过这里的环境反馈换成了推荐系统里的用户行为数据。

从意图到动作:一个反馈驱动框架打通生成式推荐“最后一公里”

论文提出的整体框架非常清晰,核心思路可以概括为三步。第一步,用大语言模型当“意图归纳器”,从用户行为序列中归纳出当前的任务型意图;第二步,让“策略智能体”根据意图和历史行为提出若干条推荐策略,再用一个受控执行器去评估这些策略到底有没有用,只留下那些确实带来增量收益的策略;第三步,把验证过的意图和策略知识,通过蒸馏方式压缩进一个轻量的SID生成模型里,实现不依赖LLM的在线推理。这个框架的巧妙之处在于,它把“理解”和“行动”彻底解耦了:意图归纳器只负责回答“用户想要什么”,策略智能体只负责回答“怎么给”,两者通过一个反馈评估环节连接起来,形成一个闭环。
图2:本文框架总览。任务导向的意图捕捉用户当前需求,策略知识决定推荐系统应如何行动。通过组内反馈生成策略假设并进行迭代优化,每条策略通过相对意图基线的增益进行评估。最终通过双空间关系蒸馏将意图和策略知识迁移到有序的意图Token与策略Token中,实现无LLM的在线服务。
这个流程里最值得说道说道的是“控制变量”的思想。“意图”是变量一,“策略”是变量二。为了验证策略到底有没有用,框架要求执行器先基于“只有意图、没有策略”的条件下做一次推荐,得到一条基线;然后再把策略加进去,再推荐一次。两条预测的物品描述都用同一个语义编码器映射成向量,算一下和用户真实下一个交互物品的语义相似度,两者的差值就是这条策略的“优势”(advantage)。优势为正,说明策略真的带来了额外价值;优势为负,说明策略纯属帮倒忙。这种“差分评估”的设计,本质上是在做因果推断——把策略的贡献从整体预测效果中剥离出来,单独衡量。它比直接看最终推荐准确率要公平得多,因为最终准确率里既有意图的功劳,也有策略的功劳,混在一起根本分不清谁贡献了什么。
这里还有一个很实际的设计考量:为什么不用Recall@K、NDCG@K这种推荐领域常用的排序指标来做策略评估?论文的解释是,这类指标太稀疏了。当真实目标物品不在前K个候选里时,所有候选策略拿到的奖励都是同一个零,模型完全分不清谁比谁更好,也没法告诉策略智能体该往哪个方向修改。语义相似度则不然,它是一个连续的打分,在目标还没进Top-K列表之前就能给出有梯度的反馈,让策略的迭代优化成为可能。打个比方,Recall@K就像考试只给“及格/不及格”两个结果,而语义相似度就像给了具体分数——哪怕你只考了30分,至少知道离60分还差多少,下次复习也更有方向。这个设计选择看似细节,实则是整个策略优化链条能否运转的关键。

两大知识分离建模:意图管“买什么”,策略管“怎么推”

先看论文开头那个非常生动的例子。用户的交互序列里有网球拍、网球、网球鞋,大多数推荐模型看到这几个物品,只会理解成“这个用户最近在买网球相关的东西”。但更深入的理解是:用户可能在“组装一套完整的网球装备”。前者只是行为层面的事实,后者才是驱动下一步决策的意图。这个区别很微妙,但决定了推荐系统的上限——如果只停留在“网球相关”这个层面,那推网球帽和推球包在模型眼里没有本质区别;但如果理解了“组装装备”这个意图,模型就会意识到用户可能更缺球包、手胶这类功能性物品,而不是装饰性的帽子。
图1:意图本身只能提供粗略的语义指导,难以支撑细粒度推荐;而策略能提供可执行的决策指导。
但“组装网球装备”这个意图还不够。在装备序列里,网球帽和球包都是语义合理的下一个物品,但不同用户有不同的偏好:有的人喜欢先补齐实用装备,有的人可能随手买个配饰。注意,这两种选择对应的意图可能完全相同。所以论文提出,光有意图知识(Intent Knowledge)还不够,还需要策略知识(Policy Knowledge)。意图知识回答“用户当前想要什么”,圈定语义相关的候选区域;策略知识回答“在候选区域里到底该怎么选”,指明优先推荐的方向和应当抑制的边界。这个区分在认知科学里也有对应——人做决策时,既要知道目标是什么,也要知道达成目标的路径是什么。推荐系统以前只建模了前者,这篇论文把后者也补上了。
论文里把策略知识描述得更加具体。一条策略包含两部分内容:推荐方向和拒绝边界。比如“优先推荐实用装备,减少配饰类物品的曝光”,就是一条有方向、有边界的策略。策略智能体会从用户的交互轨迹中提取多个“前缀—后继”转移样本,结合意图和历史物品的文本元数据,一次性生成K条候选策略。这些候选策略只是假说,它们可能对、也可能错,必须经过执行器的验证才能转正。这里“前缀—后继”的提取方式很关键——它把用户行为序列切分成“已经发生的”和“接下来发生的”两部分,前者用来推断意图,后者用来验证策略。这种数据组织方式让策略学习有了明确的监督信号,而不是凭空想象。
策略评估的公式可以直观地写成这样:先算意图基线的相似度得分R₀,再算给每条策略加上后得到的相似度得分,二者相减就得到了“优势”。只有优势为正的策略,才有资格被蒸馏到学生模型里;如果一个用户的所有候选策略优势都不为正,那说明LLM也没能找到比纯意图更好的行动方案,这个用户就只做意图蒸馏,不参与策略蒸馏。这个“只保留正优势”的过滤机制,确保了蒸馏到学生模型里的策略知识都是经过验证的“精华”,而不是噪音。它像是一个严格的质量控制流程——宁缺毋滥,只有真正能带来增量收益的策略才值得被记住。
优势计算公式:第r轮第k条策略的优势等于策略条件化预测结果的语义相似度减去仅有意图时预测结果的语义相似度。
但光验证一轮还不够。论文在策略智能体之外还设计了一个“反馈智能体”。这个反馈智能体做的事很像是“小组互评”:它把当前这一轮的K条策略、预测结果和优势分数全部摊开,然后找出那些高优势策略共享的模式、低优势策略共同踩的坑、以及哪些方向还没被探索过。策略智能体拿到这份组级批判意见后,再生成下一轮的K条新策略,如此迭代最多R轮。这样一轮一轮演化下来,策略质量会越来越高,实验显示大部分增益在头两轮内就已经拿到。这个迭代设计非常像人类专家开会讨论——第一轮大家各自提方案,第二轮根据第一轮的结果互相批评、修正,第三轮再收敛。反馈智能体扮演的就是那个“挑刺的评审专家”,它不直接提方案,但能指出方案里的共性问题,让下一轮提案更有针对性。

离线LLM教师+在线轻量学生:知识蒸馏如何做到保效果又降延迟?

LLM做推荐,效果再好看,在线服务时也不能真让用户等大模型慢慢吐字。一个122B参数的MoE大模型在线上跑一次推理的开销,是任何一个工业级推荐系统都扛不住的。所以这篇论文做了一个非常务实的决定:LLM只当离线教师,线上的活全交给轻量的SID生成模型。这个“重离线、轻在线”的思路,在工业界其实是被反复验证过的真理——再好的模型,如果上线后延迟增加100毫秒,用户流失率可能就上升好几个百分点。所以论文选择把最重的计算放在离线阶段,在线只保留最轻量的推理路径。
具体做法是在原本的SID解码序列中插入两个额外的潜在Token:意图Token(Intent Token)策略Token(Policy Token)。解码器先读行为序列,产出意图Token对应的隐藏状态,表示“用户想要什么”;然后把这个隐藏状态作为条件,产出策略Token的隐藏状态,表示“在了解意图之后该怎么行动”;最后再基于这两个隐藏状态去生成目标物品的SID。整条链路就是“理解—规划—生成”,形成一个隐式的意图—策略推荐链。这个设计把原本隐式的推理过程显式化了——模型不再是一步到位地输出物品ID,而是先想清楚“用户要什么”,再想清楚“怎么给”,最后才生成具体物品。每一步都有明确的语义对应,也让后续的知识蒸馏有了清晰的“插槽”。
这里有个很值得琢磨的细节:为什么不用最常见的“特征对齐”式蒸馏,也就是让学生的隐藏状态去直接逼近教师的表示?论文给出了一个很中肯的理由:教师模型是基于自然语言语义空间的,学生模型是基于行为序列的,两个空间的坐标系本来就不一致。强行让学生的向量去匹配教师的向量,不仅没有必要,还可能损害学生自身的行为建模能力。这个观察非常敏锐——很多蒸馏工作失败的原因就在于此:教师和学生用的特征空间差异太大,硬对齐反而把学生带偏了。就好比让一个只会说中文的人去模仿一个只会说英文的人的口型,不仅学不像,连自己原本会说的中文都可能变得不自然。
所以论文改成了双空间关系蒸馏(dual-space relational distillation)——不直接对齐坐标,而是对齐“用户之间的关系结构”。在同一个batch里,每个用户都能在教师空间里和其他用户算出一个语义距离分布;学生空间里同样也可以算出一个距离分布。蒸馏目标就是让这两个分布尽量接近。这传递的是相对关系——谁和谁在语义上更相似,谁和谁是结构上相似但不在同一个邻域里——而不是绝对的向量坐标。关系蒸馏里还分了一阶关系和高阶关系:一阶关系是用户间的直接相似度,高阶关系是“用户的邻居的邻居”这种间接结构模式。两个层次的蒸馏损失加权求和,配合标准的SID生成损失,一起训练学生模型。这种“关系对齐”的思路,其实和图神经网络里的“结构学习”有异曲同工之妙——它不关心每个节点的绝对位置,只关心节点之间的相对连接模式,因此天然对坐标系差异不敏感。
图2下半部分:潜在意图—策略推荐链与一阶/高阶关系蒸馏。学生模型基于用户交互行为序列,依次计算意图Token与策略Token的隐藏状态,再生成目标SID;教师空间与学生空间通过关系结构对齐,避免直接特征匹配。
在线服务时,LLM、语义编码器、投影头这些部件全都可以摘掉,只留下SID推荐模型和两个额外的Token位置。用户行为序列进来,模型直接推断意图Token和策略Token的状态,然后生成SID。相比原来只多了一个Token位置的计算,在线开销的增加几乎可以忽略不计。这个“训练时重、推理时轻”的设计,是工业级系统最欢迎的形态——训练时可以用最强大的模型慢慢磨,上线时只需要一个轻量模型快速响应。论文里提到的“在线推理时延几乎零增加”,正是这个设计带来的直接红利。

A/B测试直证:收入+4.506%,广告价值+4.621%

要说这篇论文最有含金量的部分,还得是实验结果。通用推荐研究里很多工作会在Amazon Review数据集上评测,论文也选择了其中三个品类:Beauty(美妆)、Toys and Games(玩具游戏)和Sports and Outdoors(运动户外)。对比的基线包含六种传统序列推荐模型(Caser、GRU4Rec、SASRec、BERT4Rec、HGN、P5),两种SID生成式推荐模型(TIGER和LETTER),以及一个直接的LLM基线(基于Qwen3.5-122B-A10B)。这个基线阵容相当全面——既有经典序列模型,也有最新的生成式模型,还有直接拿LLM硬做的方案,能全方位地检验新方法的相对位置。
原论文Table 1给出了三个数据集上的总体表现,结论非常干脆:论文提出的方法在三个数据集、两种骨干模型(TIGER和LETTER)上,Recall@5、Recall@10、NDCG@5、NDCG@10四个指标全部一致优于所有基线。这里不是“某个数据集赢了、某个数据集输了”的参差状态,而是全方位、无短板的提升。更为关键的是,同样的框架套在不同骨干上都有加成,说明方案不是为某个特定模型量身定制的补丁,而是可迁移的通用增强组件。这种“即插即用”的特性,对工业界来说尤其宝贵——不需要推翻现有的SID模型,只需要在训练流程里加上意图和策略两个Token,就能获得稳定提升。
为了验证“理解—行动鸿沟”确实存在,论文专门设计了一组对照实验。所有变体都保留意图Token和意图蒸馏,唯一的差别是是否使用策略Token和策略蒸馏。结果很有意思:只加一个策略Token位置、不做策略蒸馏,效果提升很有限;把策略蒸馏也加上,效果才出现明显跃升。这个对照说明,策略知识的价值不在于多加一个模型参数位,而在于“经过反馈验证的行动知识”真正被传递了进来。论文还有一个更细粒度的分析:把SID按层级切开来看,意图带来的收益主要出现在第一层语义编码上,而策略的收益集中在更深的编码层。这说明两个知识的分工确实是“意图圈定语义大区,策略在区内做精细挑选”。这个层级分析非常漂亮——它用实验证据证明了意图和策略在语义空间里确实扮演着不同层次的角色,而不是简单的“两个Token各加一点效果”。
在线A/B测试是在真实的短视频推荐场景里做的,核心业务指标选了ADVV和Revenue。ADVV全称Advertiser Value,可以理解为平台对广告流量应收金额的度量;Revenue则是平台实际收入。两个指标同时涨,而且ADVV涨幅比Revenue更高,说明流量价值增速超过了实际计费增速,在业务语言里这叫做“既卖了量又卖了价”。这个结果的意义在于,它证明了策略知识不仅提升了推荐的相关性,还带来了实实在在的商业价值——用户看到了更合心意的内容,平台获得了更高的广告收入和流量价值,这是一个双赢的局面。
表6:在线A/B测试结果,Revenue提升4.506%,ADVV提升4.621%。
这样的结果从方法设计上是可以解释的。语义相似度驱动的策略评估,天然比稀疏的排序指标更能提供稳定的优化信号;组级反馈又让策略智能体能站在全局视角进行修正;关系蒸馏又巧妙避开了语言空间和行为空间坐标不一致的问题。三个环节环环相扣,最终的增益是累积起来的。当然,离线评估使用Amazon公开数据集,与快手真实业务分布存在差异,在线指标也只反映当前实验周期内的增量,这些是看结果时需要留个心眼的边界条件。另外,论文没有披露在线实验的具体时长和流量比例,这也是工业界论文常见的保留——毕竟涉及商业机密,能给出核心指标已经很慷慨了。

总结与展望:反馈闭环驱动下的下一代推荐范式

这篇论文最让人印象深刻的地方,是它对“LLM融入推荐”这个命题给出了一个非常冷静的答案。现在很多工作喜欢把大模型当在线推理的引擎,效果没提升多少,成本倒是先上去了。而这篇的做法本质上是把LLM当一个“离线军师”,把军师教出来的策略浓缩成两个轻量Token,让前线士兵自己就能做决定。这种“重离线、轻在线”的思路,恐怕比具体的模型设计更有启发性。它提醒我们,大模型的真正价值不一定非要在线上实时体现,离线蒸馏、知识迁移同样能发挥大模型的威力,而且成本可控、延迟可控。
更值得关注的是“反馈闭环”这个设计哲学。策略不是靠语言通顺来证明自己,而是靠真实推荐效果的增量来证明自己。这条准则听起来简单,真正做到的方法不多。它意味着推荐系统不再把“理解用户”当作终极目标,而是把“在理解的基础上做对决策”当作可验证、可优化的对象。这个转变看似微小,实则深刻——它把推荐系统从“预测下一个物品”的统计任务,升级成了“在理解基础上做最优决策”的强化学习任务。反馈闭环让系统有了自我修正的能力,而不是永远依赖静态的训练数据。
未来沿着这条路走下去,可以想象几个方向:策略反馈从离线演化走向在线持续学习,让策略Token能根据实时交互结果动态调整;把策略抽象从推荐领域迁移到搜索、广告等其他生成式决策场景;甚至在多模态内容推荐里把视觉语义也纳入意图和策略的建模范围。无论如何,这篇论文已经给生成式推荐指出了一条值得跟进的路:下一次点击之前,先想清楚自己是“懂了”还是“会做”了。对于正在做推荐系统落地的工程师来说,这篇论文提供了一个可以直接借鉴的范式——如何在不增加在线成本的前提下,让系统从“懂你”进化到“会买”。
meng.jpeg
(看完这波A/B数据,龙哥只想说:可以,这很“打工人狂喜”。)

龙迷三问

下面是龙哥对大家可能的一些问题的解答:

Q1:意图知识和策略知识到底有什么本质区别?意图知识回答的是“用户现在的需求是什么”,它圈定的是一个语义区域,比如“用户在组装网球装备”;策略知识回答的是“在这个区域内推荐系统该怎么做”,它给出的是决策方向和拒绝边界,比如“优先实用装备、少推配饰”。同一个意图下可以有多种策略,策略必须靠效果反馈来验证,不像意图那样可以直接从行为里归纳。打个比方,意图是“目的地”,策略是“路线图”——知道目的地不等于知道怎么走,路线图需要根据实际路况(反馈)不断调整。

Q2:为什么策略评估要用语义相似度,而不用Recall@K?因为Recall@K这种排序指标太稀疏了。目标物品不在Top-K里时,所有候选策略的奖励都是零,模型得不到任何梯度信号去比较策略好坏。语义相似度是连续分数,即使目标还没进入Top-K,也能给出“这条策略比那条策略更接近目标”的细粒度反馈,让策略可以迭代优化。简单说,稀疏指标只能告诉你“对错”,连续指标能告诉你“差多少”,后者才能指导优化方向。

Q3:ADVV是什么意思,为什么说ADVV涨幅大于Revenue涨幅更好?ADVV是Advertiser Value的缩写,代表平台向广告主交付流量的合理应收金额;Revenue是平台实际计费收入。如果ADVV增速大于Revenue增速,说明广告流量的价值提升快于实际收入上升,在业务上意味着“同样的流量创造了更多广告价值”,广告主和平台双赢,是一种更健康的增长结构。换句话说,平台不仅多赚了钱,而且单位流量的价值也变高了,说明推荐质量的提升确实带来了广告效果的改善。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把意图知识与策略知识显式分离,并用反馈驱动的方式发现与验证策略,这个视角在生成式推荐里确实是新的,创新点完整且落地。

实验合理度:★★★★☆

离线覆盖三个数据集和两组骨干,消融实验逐层剥离各种因素,在线A/B给出真实业务增益。整体实验设计严谨,唯一小遗憾是部分消融细节放在附录。

学术研究价值:★★★★★

“理解—行动鸿沟”这一概念具有较高的领域普适性,不仅适用于推荐,对搜索、广告等生成式决策场景都有启发意义。

稳定性:★★★★☆

策略经过多轮反馈验证,只保留正优势策略;在线推理不依赖LLM,服务稳定性有保障。不过策略学习依赖离线LLM的初始生成质量,换基座时可能需要重新适配。

适应性以及泛化能力:★★★★☆

在两种不同结构的SID骨干上都取得了稳定提升,说明框架有较好的迁移性。当前实验覆盖电商类推荐场景,扩展到短视频、信息流等业务有待验证。

硬件需求及成本:★★★★☆

训练阶段需要调用LLM和语义编码器,对算力有一定要求;在线阶段只跑轻量SID生成模型,额外成本几乎可忽略。

复现难度:★★★☆☆

框架描述完整,但依赖Qwen3.5-122B-A10B这类大模型做教师,需要相当规模的算力和数据准备;目前未披露代码,复现成本不低。

产品化成熟度:★★★★☆

已经在快手真实业务上跑通在线A/B测试并获得正向提升,说明工程链路基本打通。更广泛业务形态的适配仍需要进一步打磨。

可能的问题:策略蒸馏只覆盖训练用户中策略优势为正的子集,长尾用户可能得不到策略监督;在线收益集中在一个实验周期内,长期稳定性与策略漂移需要更多观察。


主要参考文献

[1] Chen Z, Wang M, Liu X, et al. From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation[J]. arXiv preprint arXiv:2607.27789, 2026.
[2] Rajput S, Mehta N, Singh A, et al. Recommender systems with generative retrieval[C]//NeurIPS 2023.
[3] Wang W, Lin X, Feng F, et al. LETTER: A semantic-aware tokenizer for generative retrieval[C]//ACL 2025.
[4] Li Y, et al. OneRec-Think: Integrating explicit reasoning into industrial generative recommendation[C]//2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
推荐系统懂你,更要懂怎么行动;策略有反馈,推荐才靠谱。
来『龙哥读论文』,跟一群爱抠细节的人一起把顶会论文读薄、读透。
扫描下方二维码或添加龙哥助手微信号加群:kangjinlonghelper,备注格式:研究方向+地点+学校/公司+昵称。
『龙哥读论文』微信群现覆盖:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。