← 返回 PaperDaily
视觉与图像
清华字节新方法:不用CoT冷启动也能学会重看视频
这篇论文把“看视频”拆成了三件事:先粗看定位,再重看细节,最后重答修正。最妙的是,它不用冷启动的长串 CoT 标注,直接靠强化学习把重看能力练出来,省事还挺能打。
龙哥读论文
发布于 2026-08-14 09:10:51
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文把“看视频”拆成了三件事:先粗看定位,再重看细节,最后重答修正。最妙的是,它不用冷启动的长串 CoT 标注,直接靠强化学习把重看能力练出来,省事还挺能打。
原论文信息如下:
长视频理解新范式:video-SALMONN-R³如何实现高效“重看”,告别繁琐的CoT冷启动
视频理解这事,表面看是“把视频喂给模型”,实际上更像“让模型在一锅信息里捞针”。视频一长,帧一多,模型就容易犯老毛病:要么看得太粗,关键细节直接漏掉;要么看得太细,算力和显存先扛不住。video-SALMONN-R³做的事很有意思:它不追求一口气把视频看完,而是先粗看定位,再挑重点重看,最后带着新证据重答。说白了,就是把“看视频”拆成了三步走,像人类一样先扫一眼,再回头补课。
这篇论文最值得先记住的一点,是它不靠CoT冷启动 。很多视频大模型想学会“边想边看”,通常要先准备大量“思考轨迹+工具调用”的标注,成本高得像给模型请了个私人教练。video-SALMONN-R³选择了另一条路:直接用强化学习把“重看能力”练出来,省掉了大量人工轨迹标注,也尽量避免传统CoT监督把原本的视频理解能力带偏。
从提出“ReWatch-ReAsk-ReAnswer”框架开始
这套框架听起来像三连击,实际上逻辑非常顺:ReWatch 负责“重看”,先把视频里可能有关的问题片段找出来;ReAsk 负责“重问”,把问题重新注入第二次观察过程,避免模型看着看着就跑题;ReAnswer 负责“重答”,先给一个初始答案,再在重看后修正答案。这个设计的精髓不在于“多做一次”,而在于“第二次做得更聪明”。
这里顺手解释两个关键术语。CoT 是Chain of Thought,中文一般叫“思维链”,指模型把推理过程写出来;SFT 是Supervised Fine-Tuning,中文是“监督微调”。很多方法先靠CoT样本把模型“教会怎么想”,再做SFT或RL;而本论文的野心是:能不能不先写一大堆思维链,也把重看能力学出来?答案是可以,而且还学得不算差。
先说重看 。论文把视频理解拆成两轮:第一轮低分辨率、低帧率地扫全局,目标是先形成“哪里可能有线索”的粗判断;第二轮只对定位到的片段进行高 fidelity 的细看。这里的“fidelity”可以理解为“保真度”,也就是帧更密、分辨率更高,细节更清楚。这个思路很像看比赛录像:先快进找争议回合,再回放关键镜头,而不是把整场比赛每一秒都用慢动作看一遍。
第一轮输出的不只是答案,还包括三个东西:初始答案、简短推理、以及时间区间定位。也就是说,模型先给出一个“我觉得是这样”的判断,再告诉自己“关键证据大概在哪一段”。论文里的这个过程可以用下面的公式来概括。
再说重问 。这个设计非常关键,因为视频大模型常见的问题不是“看不见”,而是“看见了也没认真对题”。论文指出,若第二轮只丢进新视频片段,模型容易在 causal attention 下把问题和新证据的联系削弱。于是它把问题重新注入一次,也就是把问题Q′ 再喂进去,让模型在重看时始终记得自己到底在答什么。这个操作看起来朴素,实际很像老师提醒学生:“你先别急着写答案,先把题目再看一遍。”
最后是重答 。论文特别强调,第二轮并不是简单重复第一轮答案,而是允许模型“保留或修正”初始结论。这个设计的妙处在于,它把“先说一个答案”当成锚点,避免模型在第二轮因为看了更多信息就彻底跑偏;同时又通过奖励机制鼓励它在发现新证据时勇敢改口。对模型来说,这相当于一边稳住基本盘,一边允许亡羊补牢。
为了让训练稳定,论文还用了组内归一化优势值,简单说就是把同一问题下多条轨迹的奖励做相对比较,谁更好谁就更容易被强化。对应的优化目标是 token 级别的损失,而不是只看整段轨迹的一个总分,这样更容易把“哪些词、哪些动作、哪些工具调用是有效的”学清楚。
实验部分最重要的不是“赢了多少”,而是“为什么能赢”。论文把对比对象分得很清楚:有同骨干、同预训练的基线,也有只做监督微调的 QA-SFT,还有各种现成的视频大模型。这样一来,提升到底来自“模型更大”,还是来自“重看机制”,就不容易糊成一锅粥。
更有意思的是,论文专门拿 Video-MME 做了定位类方法对比。这里面既有多智能体方案,也有单模型方案。多智能体方法往往要靠大模型写文本记忆、再做多轮回溯,效果不错,但开销也不小;单模型方法更优雅,却常常依赖 CoT 冷启动。video-SALMONN-R³在这个对比里拿到了更高的平均表现,说明它把“效果”和“成本”这对老冤家,往中间拽了一点。
消融实验是这篇论文真正“露底牌”的地方。先看重看本身:如果只是把同一个低保真视频看两遍,或者第二轮不换视角,只是换个说法回答,提升都很有限。只有把第二轮预算集中到定位片段上,效果才明显上来。这说明模型提升不是“多看一遍就灵”,而是“看对地方才灵”。
再看重问。论文发现,如果第二轮不重新注入问题,模型往往会把第二轮变成“听完就复读”的模式;而加入重问后,模型会更主动地把问题和新证据对齐。更关键的是,光有重问还不够,还要配合 revise reward,也就是鼓励模型在第一轮答错时修正自己。没有这个奖励,模型会很懒,第二轮还是容易原地踏步。
训练 recipe 的消融也很有说服力。论文比较了不同训练策略,结果显示:如果只是换个训练套路,哪怕也带一点定位味道,提升通常还是有限;真正把重看机制、重答机制和 RL 组合起来,效果才会明显拉开。换句话说,这不是“某个小技巧突然发力”,而是整套流程一起配合才奏效。
还有一个很现实的问题:RL 不是白来的,参数也得调。论文对组大小和损失形式做了比较,默认的组大小 8 配合 DAPO 的 token 级损失表现最好。这个结果挺符合直觉:组太小,比较不稳定;组太大,训练又容易变慢。作者在这个平衡点上找得还算漂亮。
看到这里,很多人可能会有一个很自然的疑问:既然模型都能重看了,为什么还要先粗看一遍?答案其实很简单——因为直接高精度全看太贵了。第一轮粗看是为了先花小钱摸清方向 ,第二轮才把预算集中砸在最可能有用的片段上。这个策略和人类刷视频、看监控、查资料的习惯是一样的:先扫一眼,再回头深挖。
这篇论文很强,但也不是“从此视频理解天下无敌”。首先,它仍然依赖第一轮定位是否靠谱。如果第一轮就把关键片段找偏了,第二轮再怎么高保真也只是把偏差放大得更清楚。其次,当前方法主要围绕问答任务展开,对更复杂的视频推理、开放式长链分析、跨视频检索等场景,是否同样稳定,还需要进一步验证。
另外,虽然论文尽量避免 CoT 冷启动,但强化学习本身仍需要奖励设计和训练稳定性支撑。也就是说,它把“人工标注思维链”的成本降下来了,却把一部分难题转移到了奖励工程和训练调参上。这个方向很有价值,但要真正落到产品里,仍然要面对长视频输入、实时响应、不同领域泛化等现实压力。
未来比较值得期待的方向有两个:一是把“重看”从固定两轮扩展成更灵活的多轮自适应策略,让模型自己决定要不要再看一次;二是把这种“先粗后细”的机制推广到更广泛的多模态任务里,比如视频检索、事件定位、带音频的复杂场景理解。要是以后模型能像一个靠谱剪辑师那样,知道哪几秒最关键,那就真有点意思了。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“长视频里信息太多、模型看不细、还容易漏关键片段”的问题。方法不是一口气硬看,而是先低成本粗看定位,再对关键片段高保真重看,最后根据新证据修正答案。
ReAsk 和 ReAnswer 分别是什么意思? ReAsk 是把问题在第二轮重新注入,让模型重看时始终对题;ReAnswer 是先给初始答案,再在重看后保留或修正它。一个负责“别跑题”,一个负责“答错了能改”。
为什么不用 CoT 冷启动也能训练出重看能力? 因为论文直接用强化学习和规则奖励去塑形轨迹,让模型在试错中学会“先答、再看、再改”。这样省掉了大量思维链标注,也尽量减少了 CoT 监督对原有视频理解能力的干扰。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 这篇的亮点不在“又堆了一个更大模型”,而在于把重看、重问、重答做成一个能端到端训练的闭环,还尽量绕开了 CoT 冷启动,思路挺干净。
实验合理度: ★★★★☆ 对比基线和消融都比较完整,尤其能区分“多看一遍”和“看对地方”的差别,实验设计是站得住的。
学术研究价值: ★★★★☆ 对视频理解里的“定位—重看—修正”范式有明确启发,后续很多长视频任务都能拿来借鉴。
稳定性: ★★★☆☆ 方法逻辑清楚,但仍依赖第一轮定位质量和奖励设计,离完全无脑落地还有一段路。
适应性以及泛化能力: ★★★★☆ 在短中长视频上都有收益,说明不是只对某个数据集特供,但更复杂的开放式任务还需要继续验证。
硬件需求及成本: ★★★☆☆ 相比多智能体方案更省,但两轮视频处理和 RL 训练仍不便宜,不是轻量级玩具。
复现难度: ★★★☆☆ 方法本身不算玄学,但训练流程、奖励和数据筛选都有细节,复现起来还是要花点功夫。
产品化成熟度: ★★★☆☆ 适合视频问答、重点片段定位等场景,若要上生产,还得继续打磨稳定性和速度。
可能的问题: 第一轮定位一旦偏了,后面容易“越看越认真地看错”;奖励设计和任务格式也可能限制泛化。
主要参考文献
[1] video-SALMONN-R³: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding. arXiv, 2026. https://arxiv.org/pdf/2606.24477v1.pdf
[2] Qwen3-VL, Whisper-Large-v3, DAPO 等相关方法与模型见论文正文引用。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
长视频理解、强化学习、视频LLM、开源代码、论文拆解都在群里继续聊,来一起把“看视频”这件事整明白。