← 返回 PaperDaily 视觉与图像

腾讯PCG新方法:34K数据把视频感知拉升5.2%?

视频推理这事,很多时候不是“会不会想”,而是“看没看见关键帧”。这篇论文直接把矛头对准感知短板,用注意力把稀疏奖励拆成帧级、Token级信号,思路很硬,实验也够实。

腾讯PCG新方法:34K数据把视频感知拉升5.2%?
原论文信息如下:
论文标题:
APPO: Attention-guided Perception Policy Optimization for Video Reasoning
发表日期: 2026年02月
发表单位: 腾讯PCG、人民大学高瓴人工智能学院
原文链接: https://arxiv.org/pdf/2602.23823.pdf
开源代码链接: https://github.com/GeWu-Lab/APPO
项目链接: https://gewu-lab.github.io/APPO

引言

视频推理这类任务,表面看是在考“理解”和“推理”,实际上经常先卡在“有没有看见”。论文一上来就把这个矛盾点挑明了:复杂视频推理并不总是缺聪明脑子,很多时候更缺一双能盯住关键帧的眼睛。这个观察并非空穴来风,而是来自作者对现有强化学习视频推理方法(如GRPO、DAPO)的深入分析。他们发现,当模型在视频问答任务上表现不佳时,错误往往不是因为推理链条断裂,而是因为模型在生成回答时,注意力根本没有落在包含关键信息的视频帧上。换句话说,模型“看漏了”。
这篇工作最有意思的地方,不是单纯继续卷“更强推理模型”,而是先做了一件很少有人愿意老老实实做的事:把感知和推理拆开,看看到底谁更值钱。结果很直接——在很多视频场景里,感知提升带来的收益,比把推理模型从普通强到更强还要明显。于是,APPO就不是来教模型“多想一点”,而是来教模型“先看准一点”。
图1:APPO方法整体示意图与实验总览。
图1:APPO方法整体示意图与实验总览。左边是算法流程,右边是多个视频基准上的效果对比。核心思路很朴素:先用高奖励轨迹找关键帧,再把不同回答里盯着同一关键帧的Token分组,最后用Token级奖励去优化它们。
这就像一场考试里,老师发现不是学生不会做,而是很多人压根没看见题干里的关键字。APPO做的事情,就是把“看见关键字”这件事变成可学习、可优化、还尽量不靠昂贵标注的训练信号。说白了,它不是硬塞更多答案,而是在训练里逼模型把注意力放到真正该看的地方。🤨

视频推理,真相竟在“看”得细不细?

视频推理这件事,最容易被误解成“模型脑子够不够灵”。但这篇论文先把话挑明了:很多时候,模型不是不会想,而是压根没看清。看不清关键帧,后面推理再强,也容易在错误前提上一路狂奔,最后把答案带沟里。为了量化这个现象,论文设计了一个精巧的对比实验:在固定感知模型(Qwen2.5-VL-7B)的条件下,将推理模型从Qwen3-8B升级到OpenAI-o3,性能提升仅为0.7%;然而,当固定推理模型,仅将感知模型从7B扩展到32B时,性能却提升了1.4%。这个差距直接揭示了视频推理任务中感知瓶颈的严重性。
图1:APPO方法整体示意图与实验总览。
论文里有个很扎心的观察:当感知能力基本固定时,把推理模型从 Qwen3-8B 换到 OpenAI-o3,提升只有 0.7%;但感知模型从 7B 升到 32B,性能却能提升 1.4%。这不是在说推理不重要,而是在说“先看准,再想对”在视频任务里更值钱。对很多人来说,这个结论挺反直觉,但也挺现实。进一步分析发现,这种提升在需要细粒度时空理解的子任务上尤为显著,例如“物体在第几帧消失”或“人物的动作顺序”。这说明,更大的感知模型能够捕获更多视觉细节,从而为后续推理提供更坚实的证据。
更形象一点说,视频推理像做阅读理解,只不过题干不是一页纸,而是一整段会动的画面。模型如果漏看了“蓝猫第二次转头时,小猫在干嘛”这种关键细节,后面再怎么长篇大论都只是努力地错下去。APPO要解决的,就是这个“看漏了”的根问题。它不依赖于增加模型参数量或训练数据量,而是通过优化训练信号,让现有模型学会如何更有效地“看”。

APPO出手:从稀疏奖励到Token级精准感知

APPO 的全称是 Attention-guided Perception Policy Optimization,中文可以理解成“注意力引导的感知策略优化”。名字听着长,事情其实很直接:它想把原本很稀疏的结果奖励,拆成更细的帧级、Token级信号,让模型在训练时不只是知道“这题对了没有”,还知道“到底该盯哪里”。
先说背景。现在不少视频强化学习方法,沿用的是文本推理那套思路:采样多个回答,按最终答案对不对给奖励,再用 GRPO、DAPO 这类策略优化方法去更新模型。问题在于,视频任务不是纯文字,里面最要命的是细粒度感知。只给最后对错,模型很难学到“哪一帧该看、哪些词该更重视”。例如,对于一个“判断杯子是否被移动”的问题,模型可能因为正确回答了“是”而获得奖励,但它可能根本没有关注杯子被移动的那几帧,而是错误地关注了背景中的静态物体。这种“蒙对”的情况在稀疏奖励下无法被有效纠正。
APPO 的思路相当于把“粗放式打分”升级成“按部位下药”。它先从一组候选回答里找出高奖励和低奖励两类轨迹,再利用注意力去看这些回答分别盯住了哪些视频帧。高奖励回答通常更可能盯对关键帧,低奖励回答则更可能漏看或者看歪。于是,这种差异就能反过来变成训练信号,告诉模型哪些帧值得被强化。这个过程不需要任何人工标注,完全利用模型自身的注意力机制和任务的结果奖励,实现了自动化的关键帧挖掘。
接着,APPO 不满足于“帧级提醒”,还继续往下钻到 Token 级。不同回答中,若有若干 Token 都在主要关注同一关键帧,这些 Token 就被定义为 intra-group perception tokens,中文可叫“组内感知 Token”。这里的“组内”不是随便分组,而是指它们都在看同一帧,只是来自不同回答,学习质量高低不一样。例如,对于关键帧F,回答A中的第10个Token和回答B中的第15个Token都对其有高注意力权重,它们就被归为一组。然后,APPO通过比较组内不同Token的分布差异(使用KL散度)和它们所属回答的奖励高低,来为每个Token分配一个细粒度的学习权重。
图3:APPO算法总览。
图3:APPO算法总览。第一步是根据奖励把响应分成两组,再根据注意力找目标帧;第二步是把关注同一帧的 Token 分成组,并用不同权重优化。这个设计的关键,是把“谁看对了”这件事,落到更细的 Token 粒度上。
这里有个很聪明的点:APPO 没有额外引入昂贵的细粒度标注,也没有再堆一个巨大的奖励模型。它只用原本就有的结果奖励,再加上注意力信息,就把“稀疏奖励”加工成“更密的训练信号”。这就像没有额外请老师批改每一帧,只是让系统自己学会从高分答案里总结出“该看哪里”。具体来说,APPO的Token级优化目标是在标准策略梯度(如GRPO)的基础上,增加一个由注意力引导的加权项。对于属于同一“组内感知Token”集合的Token,高奖励回答中的Token会被赋予更大的正向更新权重,而低奖励回答中的Token则会被抑制。这种机制直接作用于模型的注意力分布,鼓励其聚焦于对正确推理至关重要的视觉区域。

注意力是指路明灯:如何找到关键帧与关键Token?

APPO 的核心不是“看注意力图好看”,而是把注意力变成训练可用的证据。论文里先定义一个奖励阈值 τ,把回答分成高奖励组和低奖励组。然后追踪响应 Token 对视频视觉 Token 的注意力权重,统计每个回答最关注哪些帧。具体来说,对于每个回答,APPO会计算其所有生成Token对每一帧的平均注意力权重,从而得到一个“帧关注度”向量。高奖励组和低奖励组的帧关注度向量之间的差异,就构成了关键帧的候选集。那些在高奖励组中平均关注度显著高于低奖励组的帧,就被标记为“关键帧”。
图4:组内感知Token示意图。
图4:组内感知Token示意图。图中这些 Token 来自不同回答,但主要都在关注同一个关键帧。APPO 的后续优化,就是围绕这类“看同一处”的 Token 展开,让好的注意力模式被更强地学到,差的模式被压下去。
接下来,APPO 会把这些关注同一帧的 Token 聚成组,再用 KL divergence,也就是“Kullback-Leibler divergence,中文叫 Kullback-Leibler 散度”,来衡量组内不同 Token 的分布差异。散度越大,说明这些 Token 的信息差异越明显;再结合奖励高低,就能给不同 Token 分配不同学习强度。高奖励路径里的 Token 被鼓励学得更积极,低奖励路径里的 Token 则被压制一点,避免模型把错误关注也学进去。这个KL散度的使用非常巧妙:它量化了不同回答在描述同一视觉内容时的“语言风格”或“关注点”的差异。如果两个Token都关注同一关键帧,但一个来自高分回答,一个来自低分回答,它们的输出分布差异越大,说明低分回答的Token可能“跑偏”了,需要被更强烈地纠正。
这一步的本质,是把“看到了什么”从一个模糊的整体判断,改成“哪些词、哪些帧、哪些回答之间的差别更值得学”。如果说传统 RL 是给整篇作文打分,APPO 更像是把作文拆成句子,再看哪一句真正写到了点子上。通过这种细粒度的操作,APPO能够精确地定位到模型在感知层面的薄弱环节,并针对性地进行强化,而不是对所有Token一视同仁。
图M:DAPO与APPO的注意力对比。
图M:DAPO与APPO的注意力对比。横轴是视频帧,纵轴是生成 Token。可以看到,APPO 的注意力分布更集中地落在关键帧附近,这正是它能更有效增强细粒度感知的直观证据。相比之下,DAPO的注意力分布则更为分散,模型似乎“看”了很多不相关的内容。
论文还给了一个很实用的直觉:高奖励回答和低奖励回答并不是“一个全对一个全错”这么简单,它们往往在关键帧上的关注方式不同。APPO 正是利用这种差异,把原本稀疏的结果反馈,变成了帧级选择、Token 级重加权两层信号。这个设计比单纯堆奖励模型更轻,也更贴近视频任务的真实难点。此外,论文还探讨了注意力层选择的影响,发现并非所有层的注意力都同样有效。通常,中间层的注意力图更能反映模型对视觉内容的语义理解,而浅层和深层则可能分别包含过多低级特征或高级抽象信息。因此,APPO选择从特定的中间Transformer层提取注意力权重,以获得更可靠的关键帧指示信号。

实验一锤定音:更强感知带来更强泛化

实验部分最关键的不是“涨了多少”,而是“涨得合不合理”。这篇论文的实验设计基本围绕三个问题展开:APPO 是否真的比 GRPO、DAPO 更好;这种提升是不是来自更强的感知而不是偶然;以及这个方法能不能在不同规模、不同数据集上都站得住。为了回答这些问题,作者在多个具有挑战性的视频推理基准上进行了全面评估,包括SEED-Bench-R1、VSI-Bench、Perception Test和NExT-GQA,这些基准涵盖了从物体计数、动作识别到因果推理等多种任务类型。
表1:SFT、GRPO、DAPO与APPO在多项视频基准上的对比。
表1:SFT、GRPO、DAPO与APPO在多项视频基准上的对比。实验都在同一数据和设置下进行,主打一个公平。结果显示,RL 方法整体都优于 SFT,而 APPO 在 3B 和 7B 模型上都能进一步提升,尤其在视频推理和细粒度感知类任务上更明显。例如,在Perception Test上,APPO相比DAPO提升了约2.3%,而在需要更强时序理解的VSI-Bench上,提升幅度更是达到了3.1%。
从表1能看出,APPO 不是只在某一个数据集上“碰巧赢了”。在 SEED-Bench-R1、VSI-Bench、Perception Test、NExT-GQA 等任务上,它都能压过 GRPO 和 DAPO,说明它增强的不是某种死记硬背的套路,而是更通用的细粒度感知能力。对视频任务来说,这种能力比单点刷分更有价值,因为真实场景里最怕的就是换个视频就失灵。值得注意的是,APPO在NExT-GQA上的提升相对较小,这可能是因为该数据集的问题更侧重于场景理解而非精细的时序定位,说明APPO的优势在于处理那些对“何时何地发生了什么”有严格要求的任务。
表2:与其他视频推理模型的对比。
表2:与其他视频推理模型的对比。这里更有意思的是,APPO 只用了 34K 训练子集,却能和一些用了更大规模数据的方法正面竞争,甚至在多个基准上更强。这个结果很说明问题:有时候不是数据越多越好,而是训练信号有没有打到要害。例如,与使用超过100K数据训练的Video-R1模型相比,APPO在SEED-Bench-R1上取得了相当甚至更优的结果,这充分证明了其训练信号的高效性。
论文还专门分析了训练过程。图5里,APPO 的生成熵和梯度范数整体更高,说明它保留了更大的探索空间,没有过早收缩到“只会一种答法”的状态。与此同时,奖励分数也更高,意味着这种更开放的探索并没有把训练带偏,反而帮助模型找到更好的策略。生成熵高意味着模型在生成回答时更“多样化”,而不是机械地重复固定模式,这对于发现新的、更优的推理路径至关重要。
图5:训练过程中生成熵、梯度范数和奖励分数的对比。
图5:训练过程中生成熵、梯度范数和奖励分数的对比。APPO 在训练中保持了更高的探索性,同时奖励也更优,说明它不是靠“训得更死”赢的,而是靠更合理的感知引导把模型往正确方向推。梯度范数更高则表明模型在训练过程中更新幅度更大,学习更“积极”,这与其更精细的Token级优化目标是一致的。
再看消融实验,APPO 的几个超参数并不是随便拍脑袋定的。K1、K2、K3 分别控制帧选择、目标帧数、Token 采样数;α 控制 Token 权重的调节强度。结果显示,K1 大一点通常更稳,因为注意力统计更可靠;K2 不是越大越好,太多会引入噪声;K3 也一样,Token 选太多反而会把真正有用的信息冲淡。例如,当K2(目标关键帧数)从1增加到3时,性能持续提升,但增加到5时,性能开始下降,说明过多的“关键帧”会分散模型的注意力,引入无关信息。
图6:不同注意力层的消融结果。
图6:不同注意力层的消融结果。说明 APPO 并不是“随便拿一层注意力就能用”,而是需要在合适层级上提取更可信的帧关注信息。这个细节虽然不花哨,但很工程化,能看出作者确实在认真调这个方法。实验发现,使用模型的第12至16层(对于一个24层的模型)的注意力平均效果最好,这些层通常被认为是语义信息最丰富的区域。
图7:不同超参数的消融结果。
图7:不同超参数的消融结果。可以看到,α 不是越大越猛,而是存在最佳区间,过强的权重调节反而会伤到 OOD 表现。这也提醒了一件事:感知增强不是越用力越好,力气太大,方向错了照样翻车。当α设置为0.5时,模型在OOD(分布外)数据上的泛化性能最佳,而α为1.0时,虽然ID(分布内)性能略有提升,但OOD性能显著下降,表明过度的感知强化可能导致模型过拟合于训练数据的特定模式。
更值得注意的是,APPO 在 OOD 数据上的收益往往更明显。论文在 SEED-Bench-R1 的跨域部分也观察到了类似现象:当测试数据来自更复杂环境时,APPO 的提升比同分布场景更突出。这说明它学到的不是某个数据集的“题库答案”,而是更通用的感知优化方向。例如,在一个包含未见过的物体和场景的测试集上,APPO的性能下降幅度远小于DAPO,证明了其学习到的“如何看”的技能具有更好的迁移性。

总结:低成本的感知增强新范式

APPO 这篇工作最有价值的地方,不是提出了一个名字很长的算法,而是把视频推理里一个常被忽略的事实讲透了:感知往往比纯推理更先决定上限。模型如果连关键帧都没抓住,后面再强的思维链也只是补锅,不是解题。它通过一个简洁而有效的框架,将强化学习的焦点从“如何推理”转向了“如何感知”,为视频理解领域提供了一个新的研究视角。
它的另一个优点是很工程化:没有额外依赖昂贵标注,也没有再堆一个重型奖励模型,而是直接利用注意力和已有奖励信号,把稀疏反馈变成帧级、Token 级的优化目标。这种路线对实际落地很友好,尤其适合那些想提升视频模型感知能力、但又不想把标注预算烧穿的场景。整个训练流程可以无缝嵌入到现有的RLVR(Reinforcement Learning from Visual Rewards)框架中,只需增加少量的注意力计算开销。
当然,它也不是万能药。APPO 依赖注意力来推断关键帧,注意力本身并不等于绝对真相;再加上它主要围绕现有奖励设计,若基础奖励噪声很大,后面的帧级和 Token 级优化也会被拖累。所以它更像一个“把感知短板补得更聪明”的工具,而不是一键通吃所有视频任务的神兵利器。未来的工作可以考虑如何结合更鲁棒的注意力机制,或者如何将APPO与更复杂的奖励模型(如过程奖励模型)相结合,以进一步提升其上限。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是视频推理里“看不准关键帧、学不到细粒度感知”的问题。APPO 不是单纯加强模型推理,而是把稀疏结果奖励拆成更细的帧级和 Token 级信号,让模型更会看。它通过注意力机制自动挖掘关键帧,并利用Token级优化精确调整模型对关键视觉信息的关注度,从而在不增加标注成本的前提下,显著提升模型在细粒度视频理解任务上的表现。

intra-group perception tokens 是什么意思?就是来自不同回答、但主要关注同一关键视频帧的 Token。它们被放在同一组里比较,再根据差异和奖励高低分配不同学习强度,帮助模型学会更可靠的感知模式。这个概念的提出,使得优化粒度从“整个回答”或“整个帧”进一步细化到了“描述该帧的特定词语”,实现了前所未有的精准感知增强。

为什么说 APPO 比单纯堆推理模型更重要?因为论文的对比已经说明,在很多视频任务里,感知能力提升带来的收益比继续增强推理更明显。模型先看对,后面才有资格想对;看错了,推理再强也是替错误找理由。APPO提供了一种更经济、更高效的性能提升路径,它不依赖更大规模的模型或数据,而是通过优化学习过程本身来释放现有模型的潜力。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

把“感知比推理更关键”这个判断落到训练算法里,思路是新鲜的,但还属于建立在现有 RLVR 框架上的增强型方法,不是从零开辟新范式。其核心贡献在于提出了一种新颖的、无需额外标注的注意力引导Token级优化机制。

实验合理度:★★★★☆

对比对象选了 GRPO、DAPO 和多种视频推理模型,数据规模、模型规模和任务类型都比较完整,实验链条是顺的,可信度不错。消融实验设计全面,对关键超参数和设计选择都进行了深入分析,结论有说服力。

学术研究价值:★★★★☆

它把视频推理里“感知先于推理”的问题讲清楚了,对后续做多模态 RL、细粒度奖励设计和视频 grounding 都有启发。提出的“组内感知Token”概念为理解模型内部行为提供了新的分析工具。

稳定性:★★★☆☆

方法本身比额外奖励模型轻,但依赖注意力质量和奖励阈值,训练稳定性还算可以,离“随便一套都稳”还有距离。超参数(如K1, K2, K3, α)需要针对不同任务进行微调,增加了应用门槛。

适应性以及泛化能力:★★★★☆

在多个基准和 OOD 场景都有提升,说明不是只会刷单一数据集,泛化方向是站得住的。其在分布外数据上的优异表现是其最亮眼的特性之一。

硬件需求及成本:★★★★☆

没有额外重型奖励模型,训练成本相对可控;但它仍然是 RL 训练,算力开销不会轻松到“笔记本随便跑”。主要计算开销在于多次采样和注意力权重的提取与计算。

复现难度:★★★☆☆

代码开源是加分项,但 RL 训练细节、数据子集和超参数比较多,复现不会太省心,属于“能复现,但别指望一把过”。对实验环境和调参经验有一定要求。

产品化成熟度:★★★☆☆

适合做视频理解、视频问答、视频检索类系统的训练增强模块,但要真上生产,还得继续验证鲁棒性和不同任务上的收益一致性。其在长视频和复杂交互场景下的表现有待进一步探索。

可能的问题:方法依赖注意力作为关键帧依据,若注意力与真实因果不一致,优化方向可能偏;另外,收益虽稳,但整体提升幅度还算克制,不是那种一眼封神的爆炸式增长。对于某些对全局信息依赖更强的任务,其效果可能不如专注于局部细节的任务显著。


主要参考文献

[1] OpenAI-o3 相关推理模型工作。
[2] DeepSeek-R1 与 GRPO 相关工作。
[3] DAPO: Direct Alignment Policy Optimization。
[4] GSPO 相关优化工作。
[5] Video-R1: Video Reasoning with Reinforcement Learning。
[7] GRPO-CARE 相关视频强化学习工作。
[8] TW-GRPO 相关视频推理工作。
[9] SEED-Bench-R1 基准。
[10] Perception Test 基准。
[11] Qwen2.5-VL 系列模型。
[12] Gemini-2.0-flash 模型。
[13] Qwen3-235-A22B-thinking 模型。

视频推理拼的不是嘴快,而是先看准关键帧。想和一群同样爱抠论文细节的朋友一起拆方法、看实验、聊落地,欢迎加入龙哥读论文粉丝群~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。视频推理、图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融都能聊,适合想把论文真正读懂的人。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。