← 返回 PaperDaily 视觉与图像

商汤新研究:AI先规划再看视频,token省90%,长视频理解还能更强?

看长视频最怕"看多少、看哪里"的选择困难。商汤这篇EVA直接用强化学习把"先规划再看片"的训练出来,多个长视频基准提升6-12%,视觉token还省得惊人。让AI学会"聪明地看",这个方向值得重点关注。

商汤新研究:AI先规划再看视频,token省90%,长视频理解还能更强?

paperdaily_reaction_gif


原论文信息如下:
论文标题:
EVA: Efficient Reinforcement Learning for End-to-End Video Agent
发表日期:
2026年03月
发表单位:
SenseTime Research(商汤科技研究院)
原文链接:
https://arxiv.org/pdf/2603.22918.pdf

引言

追剧时,我们常纠结于全程倍速还是精准跳看。传统视频理解模型就像老实刷完全集的观众,费时费力还容易走神。商汤科技提出的EVA框架,则像聪明的老剧迷,先瞄简介判断关键集数,再精准跳看。
这个让AI学会"先规划再看片"的EVA,全称Efficient Reinforcement Learning for End-to-End Video Agent,是一个基于强化学习的端到端视频智能体框架。其核心思路是:让多模态大模型在接触任何视频画面之前,先根据文本问题规划要看什么、何时看、怎么看,然后通过迭代式的"总结—规划—行动—反思"循环,动态决定调用哪些视觉工具。
图1:面对超过6600秒的超长视频,传统均匀采样受限于上下文长度,难以覆盖所有关键帧;传统智能体方法虽然能调用工具,但无法调整帧率和分辨率;EVA则先低分辨率高帧率全局预览,找到关键时间段后再高帧率高分辨率精读,从而得出正确答案。
面对超过6600秒的超长视频,传统均匀采样受限于上下文长度,难以覆盖所有关键帧;传统智能体方法虽然能调用工具,但无法调整帧率和分辨率;EVA则先低分辨率高帧率全局预览,找到关键时间段后再高帧率高分辨率精读,从而得出正确答案。
这个方向值得关注,因为视频理解一直卡在"看少了怕漏,看多了装不下"的两难困境。过去主流的均匀采样,在处理"视频里第几秒发生了什么"这类问题时,常因关键帧未被抽到而答错。EVA的"规划优先于感知"范式,正是解决这一根本矛盾的关键。
从更宏观的视角看,视频理解领域正经历从"被动感知"到"主动认知"的范式转移。传统方法将视频视为静态数据,通过一次性前向传播提取信息;而EVA将视频理解重构为一个动态的、目标驱动的交互过程。这种转变的意义不亚于从"图像分类"到"视觉问答"的演进——它让模型不再只是"看",而是学会"思考该看什么"。在监控视频分析、影视内容审核、自动驾驶场景理解等实际应用中,这种主动选择关键信息的能力,往往比处理全部信息的能力更为重要。

方法概述

EVA的整体设计可从任务设定、工具设计、训练策略三方面理解。
任务设定上,EVA将视频理解形式化为马尔可夫决策过程(MDP)。每个时间步,智能体观测的状态是用户问题、图文交织的历史记录、以及通过工具调用获得的视觉证据的组合。初始状态下,模型只拿到文本问题,不见任何视频画面,必须先规划第一步行动。
为支持灵活观看,EVA设计了四参数可控帧选择工具:
*表格超出部分左右可以滑动 图18
图18
这四个参数组合,给了智能体巨大的行动空间:可全局低清预览,也可局部高清细看。这种灵活性是传统智能体方法不具备的——它们通常只能选时间范围,无法同时调整帧数和分辨率。
值得注意的是,工具设计中的分辨率参数(resize)在以往的工作中很少被纳入可学习范畴。大多数视频智能体默认使用固定分辨率(如224×224或336×336),这导致模型在需要识别小目标(如远处路牌上的文字)时力不从心。EVA将分辨率作为可调参数,使得模型能够根据任务需求动态权衡"看清细节"与"节省token"之间的矛盾。例如,在回答"视频中穿红色衣服的人在第几秒出现"时,模型可以先用低分辨率快速扫描全局,锁定大致时间范围后,再切换到高分辨率确认细节。
图2:EVA的数据处理与训练流程。基础模型先在有特定推理和工具调用模式的合成数据上微调,然后用KTO帮助模型从典型失败中学习,最后引入数据增强的多阶段GRPO训练流程。
图2:EVA的数据处理与训练流程。基础模型先在有特定推理和工具调用模式的合成数据上微调,然后用KTO帮助模型从典型失败中学习,最后引入数据增强的多阶段GRPO训练流程。
训练策略是EVA最核心的贡献之一,分为三个阶段:
第一阶段是监督微调(SFT)冷启动。用10k条高质量数据让模型学会工具调用格式、图文交织推理、帧级理解和基础选帧策略,相当于植入"行为先验"。
第二阶段是KTO(Kahneman-Tversky Optimization)策略校正。KTO只需单样本偏好标签,不像DPO需要成对数据。EVA收集11k条带标签的帧选择策略数据(63%成功、37%失败),让模型避开典型失败模式。
第三阶段是基于GRPO的在线强化学习。用9.6k条开放问答对和1.1k道多选题,通过数据驱动的奖励信号优化策略。特别的是,EVA在GRPO中引入"数据增强":模型持续失败时,系统收集失败案例,让教师模型在未见过的视频上生成新问答对,丰富训练数据多样性。
三阶段训练的设计逻辑环环相扣:SFT解决"不会做"的问题,KTO解决"常做错"的问题,GRPO解决"做得不够好"的问题。这种递进式的训练范式,与人类学习技能的路径高度相似——先模仿,再纠错,最后在实战中优化。对于视频智能体这类复杂决策任务,单靠任何一阶段训练都难以达到理想效果:纯SFT会导致模型机械模仿格式而缺乏策略灵活性;纯RL则因搜索空间过大而难以收敛;而SFT+KTO+GRPO的组合,恰好让模型在"有基础能力"的前提下逐步优化决策策略。

核心原理推导

EVA本质是解决序列决策问题:智能体在一系列工具调用中逐步收集证据,直到有信心回答问题。其数学表达是带KL正则化的策略优化目标,让策略在追求高回报的同时不偏离参考模型太远。
GRPO的训练目标是最大化期望奖励,同时用KL散度约束策略。奖励函数是复合的,包括准确率奖励和格式奖励。准确率奖励针对两种题型:多选题使用CSV奖励,要求模型明确找到正确答案对应的帧;开放式问题使用ROUGE分数(ROUGE-1、ROUGE-2、ROUGE-L的平均值)。
格式奖励设计巧妙:若模型生成了工具调用但答案错误,给予0.05的补偿奖励。这个数值经过精心选择——多选题随机猜测的期望得分约0.20-0.25,0.05的低奖励能有效防止模型靠猜测"刷分",同时不抑制工具调用行为。
从强化学习的视角看,EVA的奖励设计体现了"过程激励"与"结果激励"的平衡。纯结果奖励(只奖励正确答案)容易导致模型走捷径——比如在证据不足时强行猜测;纯过程奖励(只奖励工具调用)则可能让模型无意义地反复调用工具。EVA的复合奖励机制,既鼓励模型通过工具调用收集证据(格式奖励),又确保最终答案的准确性(准确率奖励),两者缺一不可。这种设计思路对于其他智能体任务(如网页导航、工具使用)同样具有借鉴意义。

从被动识别到主动观看:EVA如何让AI学会"看"视频

要理解EVA的价值,需先弄清传统方法的缺陷。传统视频理解把多模态大模型当"被动识别器",要么全帧塞入,要么均匀采样。这有两个硬伤:长视频上下文装不下;均匀采样不考虑内容相关性,关键瞬间常被漏掉。
后来的智能体方法引入帧选择工具,但仍有局限:通常在拿到均匀采样帧后才推理,本质还是"感知优先";工具逻辑固定,无法自由调整采样帧率和空间分辨率。
EVA的出发点正相反,提出"规划先于感知"(planning-before-perception)范式。初始状态下,模型只拿到文本问题,需自己决定:该不该调工具?调哪个?先看哪段时间?用多少帧?什么分辨率?
这种设计把视频理解建模成迭代式"总结→规划→行动→反思"循环。模型先生成对当前证据的总结,再规划下一步,然后调用工具获取新帧,最后反思证据是否足够。视觉token的使用完全由问题驱动,避免了均匀采样的浪费。
图7:规划先于感知的优势所在。面对相同问题,EVA通过先规划后感知的策略,显著减少无效帧的采样,提升回答准确率。
图7:规划先于感知的优势所在。面对相同问题,EVA通过先规划后感知的策略,显著减少无效帧的采样,提升回答准确率。
为实现自主观看,EVA设计了四参数帧选择工具(start_time、end_time、nframes、resize),几乎覆盖人类观看视频的所有基本操作。这种设计把工具使用的决策空间完全交给模型,让其在强化学习中探索最优策略。
形式化地看,这被建模为MDP。状态s_t = {q, h_t, F_t}(用户问题、交互历史、视觉证据),策略π_θ(a_t | s_t)决定动作。动作空间是所有可能的工具调用参数组合及"停止并作答"。这个设定把"看视频"从一次性前向计算,变成可不断纠错、深入的序列决策过程。
传统智能体方法是EVA的受限特例:它们只能选时间范围或使用固定帧率/分辨率。EVA允许在两个维度同时调节,这是效率优势的关键。例如处理6600秒监控视频时,EVA先低分辨率高帧率快速浏览,定位可疑时间段,再高分辨率高帧率细查,消耗的视觉token远少于均匀采样。
当然,这种自由度的代价是训练难度大幅上升。模型面对的行动空间庞大,若无合适训练策略,容易在无效尝试中浪费计算资源,甚至陷入死循环。这也是EVA在训练方法上创新的直接动机。
一个直观的对比是:传统方法处理一段10分钟的视频,可能需要均匀采样300帧(约30k视觉token),其中大量帧与问题无关;EVA可能只需先看20帧低分辨率帧(约2k token)定位关键时间段,再看10帧高分辨率帧(约3k token)确认细节,总token消耗仅为前者的六分之一。这种效率优势在视频长度超过1小时时更加显著——传统方法要么因上下文限制无法处理,要么需要复杂的视频分段策略;而EVA的规划机制天然适应任意长度的视频。

三阶段训练:从模仿到自我优化的进化之路

训练能自主规划的视频智能体,最直接的想法是监督学习模仿专家示范。但纯监督学习有局限:模型学会"格式"却学不会"策略"。EVA团队的三阶段训练管线,目标就是让模型从"会模仿"进化到"会决策"。
第一阶段是SFT冷启动。用Qwen2.5-VL-72B作为教师模型,在llava-video和cgbench数据集上生成高质量交互数据,严格遵循"总结→规划→行动→反思"格式。关键在"反思"环节:教师模型必须先判断证据是否足够,不够就继续调用工具,不能直接作答。冷启动数据约10k条,输出行为上"像样"但策略有限的模型。
第二阶段引入KTO。KTO从"成功"和"失败"的单样本标签中学习偏好,不需要成对数据,更适合多轮工具调用场景。EVA收集11k条带标签轨迹(63%成功、37%失败),失败轨迹判定基于"LLM作为裁判"选出证据不足却强行作答的轨迹。这阶段让模型在进入强化学习前规避常见错误,提升训练稳定性。
第三阶段是基于GRPO的在线强化学习。GRPO由DeepSeek提出,让模型对同一问题生成多个响应,以组内相对优劣作为奖励信号,避免PPO中额外价值网络的开销。EVA使用9.6k条开放问答对和1.1k道多选题,并对GRPO做了关键改进:可变数据增强。传统GRPO在固定数据集上训练,EVA则收集失败案例,让教师模型在未见过的视频(HD-VILA)上生成新问答对,不断扩充训练集。
图8:冷启动数据构建流程。教师模型在视频问答对的基础上,按总结、规划、行动、反思四步生成SFT训练数据,并对失败轨迹进行标注用于KTO训练。
图8:冷启动数据构建流程。教师模型在视频问答对的基础上,按总结、规划、行动、反思四步生成SFT训练数据,并对失败轨迹进行标注用于KTO训练。
GRPO的优化目标可用带KL正则项的期望奖励最大化描述:max_θ E_{τ∼π_θ}[R(τ)] − λ·E_{(s,a)∼π_θ}[KL(π_θ(·|s)‖π_ref(·|s))]。π_ref是经过SFT和KTO的参考模型,KL项防止策略偏离太远,相当于划定"安全范围"。
奖励函数由两部分组成:R(τ) = w_acc·r_acc + w_fmt·r_fmt。准确率奖励r_acc:多选题采用CSV奖励,要求模型在最后一轮检索的图像中明确找到正确选项证据;开放题采用ROUGE分数,即ROUGE-1、ROUGE-2、ROUGE-L三项F1分数的平均值。
格式奖励设计巧妙:若模型生成了工具调用但答案错误,给予0.05补偿奖励。这个数字是精心算过的——多选题随机猜测的期望得分约0.20-0.25,0.05的低奖励不足以让模型走"先乱调工具再乱猜答案"的捷径,但能保护工具调用行为不被抑制。
图10:反思提示词示例。教师模型在生成训练数据时使用反思提示词,引导模型先评估当前证据是否充分,再决定继续探查还是给出答案。
图10:反思提示词示例。教师模型在生成训练数据时使用反思提示词,引导模型先评估当前证据是否充分,再决定继续探查还是给出答案。
消融实验显示三阶段递进关系:SFT模型学会格式但消耗大量帧且准确率最低;KTO显著减少帧消耗和交互轮数,准确率提升;GRPO进一步减少采样帧数,但交互轮数增加。这说明GRPO训练出的策略不是简单"少看",而是学会"精准地看"。
具体来说,SFT阶段模型平均每轮调用工具消耗约150帧,但准确率仅45%左右;KTO阶段帧数降至约80帧,准确率提升至52%;GRPO阶段帧数进一步降至约50帧,准确率却达到58%。这个趋势清晰地表明,强化学习让模型学会了"用更少的视觉信息做出更准确的判断"——这正是"规划先于感知"范式的核心优势。

数据为王:高质量数据集如何支撑稳定训练

强化学习训练最怕奖励噪声大、数据分布单一、模型"钻空子"。EVA团队在数据层面做了大量工程化工作,构建三个高质量数据集支撑三阶段训练。
EVA-SFT数据集约10k条样本,来源是llava-video和cgbench。团队设计多种提示词引导教师模型,包括"过去成功经验总结"、"多样化工作流提示"、"反思性思考提示",让冷启动数据覆盖不同规划策略。
EVA-KTO数据集包含11k条带标签轨迹。从SFT数据生成中收集失败轨迹作为负样本,用LLM裁判筛选"证据不足却作答"的轨迹,再重采样高质量成功轨迹作为正样本。正负比例约63%比37%,让模型对典型失败模式保持敏感。
EVA-RL数据集包含9.6k条开放问答对和1.1k道多选题,90%为开放题。开放题占比高是有意为之:多选题选项设计容易泄露信息,模型可能学会"读题猜答案";开放题则迫使模型基于视频内容自主生成答案,配合ROUGE奖励,有效抑制奖励攻击。
图3:训练数据集的分布情况。展示了三个数据集在来源、类型、问答格式等方面的构成比例。
图3:训练数据集的分布情况。展示了三个数据集在来源、类型、问答格式等方面的构成比例。
GRPO阶段还有一个重要细节:数据增强循环。传统GRPO在固定数据集上跑几轮就结束。EVA的做法是:先用KTO模型在新生成的QA对上做若干轮GRPO训练,然后收集模型仍答错的案例,作为上下文示例交给教师模型,在HD-VILA数据集上生成新问答对,加入训练集继续训练。这个"失败→生成→再训练"循环,让数据分布跟随模型能力动态调整。
数据增强循环的设计灵感来源于课程学习(Curriculum Learning)的思想。传统课程学习是人为设计从易到难的数据顺序,而EVA的数据增强循环则是自动生成"当前模型最需要学习"的样本——模型答错的案例,恰恰是它能力边界附近的样本,对这些样本的针对性训练,能够最高效地拓展模型的能力边界。这种自适应数据生成机制,使得EVA的训练过程能够持续进步,而不会像固定数据集训练那样陷入性能平台期。

效率与精度兼得:EVA在六大基准上的表现

EVA在六个视频理解基准上进行了全面评估,覆盖不同任务难度和视频长度。
首先是采样困境基准LSDBench。闭源模型Gemini-2.0-Flash准确率最高(56.2%),但消耗超过696.6k视觉token。开源模型LongVA、Qwen2.5-VL等在256-768帧范围内准确率约50%。EVA仅用76.9帧、约10.3k视觉token就达到51.0%准确率,比同基座Qwen2.5-VL高出不少,token消耗只有后者的零头。
表1:采样困境基准(LSDBench)上的性能对比。EVA仅用10.3k视觉token就达到51.0%准确率,远低于其他模型的token消耗。
表1:采样困境基准(LSDBench)上的性能对比。EVA仅用10.3k视觉token就达到51.0%准确率,远低于其他模型的token消耗。
其次是长视频理解基准组,包括LongVideoBench、MLVU、VideoMME和LVBench。EVA-GRPO准确率分别达55.0%、68.3%、60.2%和43.3%。特别值得注意的是MLVU上68.3%的成绩,比同基座的Video-R1高出8.1个百分点,比静态帧采样方法高出12个百分点以上。而EVA实际只用到每段视频约20-30帧。
表2:多个视频理解基准上的主实验结果。EVA-SFT、EVA-KTO、EVA-GRPO三阶段性能逐步提升,在MLVU上达到68.3%的准确率。
表2:多个视频理解基准上的主实验结果。EVA-SFT、EVA-KTO、EVA-GRPO三阶段性能逐步提升,在MLVU上达到68.3%的准确率。
第三组是零样本视频推理基准Video-Holmes,包含社交推理、意图与动机链推理等七个子任务。EVA-GRPO在零样本设置下取得37.2%平均准确率,超过Video-R1的36.5%,与GPT-4o的42.0%差距不到5个百分点,而Gemini-2.0-Flash只有30.6%。
表3:Video-Holmes基准上的零样本推理性能对比。EVA-GRPO在总体准确率上超越多数开源模型。
表3:Video-Holmes基准上的零样本推理性能对比。EVA-GRPO在总体准确率上超越多数开源模型。
除了准确率,EVA还有一个值得关注的指标:交互轮次与视觉token的分布变化。图4展示了不同训练阶段的行为差异。SFT阶段消耗大量帧,交互轮数多,但准确率偏低;KTO阶段帧数明显下降;GRPO阶段虽然交互轮数回升,但每轮使用的帧数进一步减少。这说明GRPO训练出的策略是"精打细算"的探索方式。
图4a:不同模型和基准上的交互轮数分布对比。
图4a:不同模型和基准上的交互轮数分布对比。
图4b:不同模型和基准上的视觉token消耗分布对比。
图4b:不同模型和基准上的视觉token消耗分布对比。
GRPO训练数据组成的影响也在消融实验中验证。图5对比了只用多选题、只用开放题、混合数据三种设置。结果显示,混合数据在VideoMME上表现最好且训练更稳定。纯多选题设置下模型更容易出现奖励攻击;纯开放题也有劣势——ROUGE奖励对表述多样性的惩罚可能抑制探索。两者混合才能取长补短。
图5a:GRPO训练数据组成消融实验。
图5a:GRPO训练数据组成消融实验。
图5b:多选题、开放题和混合数据三种设置在VideoMME上的表现曲线。混合数据效果最好。
图5b:多选题、开放题和混合数据三种设置在VideoMME上的表现曲线。混合数据效果最好。
综合来看,EVA在长视频基准上的平均提升约6-12个百分点(相对通用MLLM基线),在自适应智能体基线上再提升1-3个百分点。这种增益在视频理解领域相当显著,特别是考虑到EVA实际消耗的视觉token远少于对比方法。
从效率角度看,EVA在LSDBench上的表现尤为突出:仅用10.3k视觉token就达到51.0%准确率,而Gemini-2.0-Flash虽然准确率更高(56.2%),但消耗了696.6k token——是EVA的67倍。这意味着在实际部署中,EVA的推理成本仅为Gemini的1/50左右,同时还能保持接近的准确率。对于需要处理海量视频的工业级应用,这种效率优势直接转化为可观的成本节约。

灵活的工作流:EVA如何适应不同查询需求

EVA最让人感兴趣的一点,是它不依赖预设的固定流程,而是根据问题类型灵活调整"观看策略"。
图6:EVA在不同查询下生成的多样化工作流。有的问题只需要低分辨率全局扫描,有的问题需要高分辨率局部放大,EVA能够根据查询内容自适应选择策略。
图6:EVA在不同查询下生成的多样化工作流。有的问题只需要低分辨率全局扫描,有的问题需要高分辨率局部放大,EVA能够根据查询内容自适应选择策略。
比如问题简单时,EVA可能一轮就给出答案;涉及具体细节时,会先低分辨率全局扫描,再高分辨率局部精读;涉及多个事件时间关系时,会进行多轮工具调用,在不同时间段切换比较。
图11:EVA在真实查询上的三轮推理案例。展示模型如何逐步定位关键事件的时间范围,最终准确回答问题。
图11:EVA在真实查询上的三轮推理案例。展示模型如何逐步定位关键事件的时间范围,最终准确回答问题。
论文还在ELV-Halluc基准上测试了EVA的抗幻觉能力。幻觉问题在视频智能体中非常致命。EVA在幻觉控制上的表现说明,规划先行的机制不仅是效率优化,还从行为层面抑制了模型的"胡说八道"倾向。
图9:EVA跨轮次的统计信息与ELV-Halluc幻觉基准的对比结果。展示了不同训练阶段在幻觉控制上的差异。
图9:EVA跨轮次的统计信息与ELV-Halluc幻觉基准的对比结果。展示了不同训练阶段在幻觉控制上的差异。
EVA在ELV-Halluc上的表现揭示了"规划先于感知"的另一个优势:当模型需要先规划再看视频时,它必须对"自己知道什么、不知道什么"有更清晰的认知。这种元认知能力(metacognition)使得模型在证据不足时更倾向于继续调用工具,而不是强行作答,从而从机制上减少了幻觉的产生。相比之下,传统的一步到位式方法,模型在缺乏证据时往往只能"硬答",幻觉风险自然更高。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?商汤科技提出EVA框架,用强化学习训练端到端视频智能体,让多模态大模型先规划再观看,借助总结—规划—行动—反思循环动态决定看什么、何时看、怎么看,在多个长视频基准上比通用模型提升6-12%,同时大幅压缩视觉token用量。
这篇工作最值得看的点是什么?EVA在多个视频理解基准上取得显著提升,相比通用MLLM基线提升6-12%,相比先前的自适应Agent方法提升1-3%,同时仅使用极少的视觉token(约6.2K-10.3K),展示了高效性。
这篇工作的边界或风险在哪里?优点:1)提出规划-先于-感知的新范式,显著提升长视频理解效率;2)三阶段训练策略(SFT-KTO-GRPO)设计合理,逐步提升模型能力;3)数据增强的GRPO管道有效缓解奖励黑客问题;4)在多个基准上取得SOTA性能。缺点:1)依赖预定义的工具接口,对未见或噪声查询分布可能鲁棒性不足;2)训练管道复杂,需要多阶段数据构造和训练;3)推理时多轮交互可能引入额外延迟。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种基于强化学习的端到端视频Agent框架,通过“总结-规划-行动-反思”的迭代推理循环,实现先规划后感知的查询驱动视频理解,并采用SFT-KTO-GRPO三阶段训练策略。

实验合理度:★★★★☆

准确率(Accuracy),视觉token数量,帧数

学术研究价值:★★★★☆

提出一种基于强化学习的端到端视频Agent框架,通过“总结-规划-行动-反思”的迭代推理循环,实现先规划后感知的查询驱动视频理解,并采用SFT-KTO-GRPO三阶段训练策略;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在32张H100 GPU上训练,推理时仅需约6.2K-10.3K视觉token,远低于传统方法的数百K token。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;4)在多个基准上取得SOTA性能。缺点:1)依赖预定义的工具接口,对未见或噪声查询分布可能鲁棒性不足;2)训练管道复杂,需要多阶段数据构造和训练;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球