← 返回 PaperDaily
视觉与图像
Apple最新研究:视频推理不再"画未来",延迟降5倍+
这篇来自Apple的新研究直接把“视觉思维”做进了训练:模型在训练时预测未来帧的潜在表示,推理时不再生成中间图像,端到端延迟比显式视觉CoT降低5倍以上,同时在6个评测设置上稳定超越纯文本后训练。对视频理解、实时预测和统一多模态模型感兴趣的同学值得细读。
龙哥读论文
发布于 2026-08-26 00:20:08
阅读 2
查看原文
原论文信息如下:
最近的AI圈子里,关于“推理模型到底有没有真推理”的争论还没凉透,Apple的这篇新论文又给视频推理赛道扔了一颗深水炸弹。以往让多模态大模型做视频预测,主流思路是“先生成一张未来帧的中间图像,再基于这张图给出答案”——这种显式的视觉思维链(Visual Chain-of-Thought,简称Visual CoT)确实直观,但代价是推理时既要“画图”,又要重新编码图像,延迟直接翻好几倍。Apple研究团队想到一个反常识的角度:既然模型最终要的是对未来的判断,那能不能在训练阶段就把“预测未来”这件事内化到模型表征里,推理时直接生成答案,连中间图像都不要了?
这个思路落地成了一套名为Internalized Visual Thinking(内化视觉思维,简称IVT)的后训练框架。在Ego-Exo4D、Ego4D、EPIC-KITCHENS-100三个数据集上,IVT不仅稳定超过纯文本后训练,而且与显式Visual CoT相比,端到端推理延迟降低了5倍以上,性能还实现了持平或反超。换句话说,模型不用再“画出未来”再“看懂未来”,而是把视觉预测能力直接焊死在表征里。
视觉思维必须"画出来"吗?——训练时内化预测,推理时零开销
先说清楚一个背景概念。所谓“主动视频推理”(Proactive Video Reasoning),指的是模型必须在事件尚未结束甚至尚未发生时,就对“正在发生什么”或“接下来会发生什么”做出预测。这类任务包括早期事件预测(Early-Event Prediction,简称EEP)和下一事件预测(Next-Event Prediction,简称NEP)。前者要求动作进行到10%、30%、50%、70%时就能判断出来;后者则要求在下一事件开始前至少1秒给出预测。相比离线视频问答,这些任务不能“看了结局再答题”,模型必须从残缺的观测中推断意图、因果和未来状态,而且还得在时间窗口内完成响应。
其实在此之前,业界已经发现一个现象:如果让模型先画出一张未来帧的高清图像,再基于这张图作答,确实能提升预测准确率。这种“画图推理”就是论文里说的显式Visual CoT。听起来很合理对不对?但问题在于,生成一张图像的计算开销实在太大了——不仅要多跑一次扩散模型的采样,还需要把生成结果重新编码成视觉token喂回语言模型。论文实验里,Zebra-CoT这个代表性的Visual CoT模型,平均推理延迟比纯文本答案模型高了5到6倍。更尴尬的是,这种代价换来的收益并不稳定:在下一事件预测任务上,显式Visual CoT在4个指标里有3个不升反降。
论文作者用了一个很巧妙的诊断实验来定位问题:把模型自己生成的未来帧,替换成真实未来帧(论文叫oracle frame,即“神谕帧”)。结果发现,一旦用上真实未来帧,早期事件预测的ROUGE-L从34.4飙到41.9,提升21.6%;下一事件预测也涨了6.8%。这说明未来视觉信息本身非常有价值,瓶颈完全出在“生成未来帧的保真度不够”和“图像生成链路太贵”这两件事上。
于是核心问题浮出水面:能不能不让模型在推理时“画图”,却在训练时把预测未来状态的能力内化到参数里?这正是IVT想回答的问题。
从"画图推理"到"内化思维":IVT如何将视觉预测压缩进模型表征
IVT的思路可以用一句话概括:把“推理时需要做的未来帧预测”,变成“训练时需要完成的辅助任务”。具体来说,模型在训练时接收一个视频前缀(已经观测到的若干帧),既要预测目标文本答案,又要同时预测后续若干帧的潜在表示。这里的“潜在表示”不是像素,也不是通常说的图像特征,而是某个预训练编码器对未来帧提取的嵌入向量。到了推理阶段,未来帧预测分支整个去掉,模型只根据观测前缀和文本提示直接生成答案。
我们来看数学形式。设观测到的视频前缀为X≤t=(I₁,…,Iₜ),文本提示为q,目标答案为y=(y₁,…,y_T)。标准的有监督微调(Supervised Fine-Tuning,简称SFT)目标是最小化答案token的平均负对数似然:
其中L_text就是公式2.1定义的文本条件生成损失,它教会模型“看到当前视频,答出当前问题”。而IVT的增量在于加了一个辅助预测项L_pred,它要求模型基于同样的上下文去预测未来帧的嵌入表示。具体来说,对于未来某个时间偏移h,目标编码器E_tar把未来帧Iₜ₊ₕ映射成M个潜在token:
与此同时,多模态大模型在指定的未来预测位置产生对应的隐藏状态,再经过一个投影头P_φ映射到目标表征空间,得到预测值:
为了实现这个“双目标”训练,论文不是简单地在同一个解码器上硬塞两个loss,而是仔细设计了两种架构变体。第一种叫Dense设计,理解token和预测token共用同一个解码器,L_text和L_pred的梯度都会直接更新共享参数,信息融合最彻底。第二种叫MoE(Mixture-of-Experts,混合专家)设计,理解token走“理解专家”的前馈网络,预测token走独立的“预测专家”前馈网络,而transformer的其余组件共享。这里的专家选择是确定的,按token类型硬路由,不是学习的路由器。这一对比想搞清楚的问题很实在:未来状态监督到底应该直接冲刷语言推理参数,还是留一条半隔离的旁路?
值得一提的是,论文中的未来预测目标有两种实现方式。一种是直接特征回归,即让模型直接预测干净的目标表征,使用均方误差损失:
另一种是整流流匹配(Rectified Flow Matching),它不直接预测目标表征,而是预测一个从高斯噪声到目标表征之间的速度场。模型需要根据带噪的中间状态、时间步τ以及观测上下文,预测出速度向量:
你可能会问:这些未来帧表征从哪来?论文比较了三种目标表示空间:第一种是Flux-VAE的潜在编码,偏重建导向,保留细致的外观和空间信息;第二种是DINOv2的语义特征,偏高层概念;第三种是SigLIP2的特征,又分“冻结编码器”和“自适应编码器”两个变体。核心区别在于:重建导向的latent里包含更多“画面细节级别”的可预测结构,而语义特征更关注“这是什么”的不变性信息。
关键设计选择:目标表示、预测目标与训练策略的系统性探索
IVT看着简单,但真正落地时有一堆“旋钮”要调。论文做了一系列受控实验,每次只改一个变量,把目标表示、数据混合比、预测目标、训练课程和预测范围逐项拆开分析。先说目标表示,图2给出了Flux-VAE、DINOv2、SigLIP2(自适应和冻结)四种目标在早期事件预测和下一事件预测上的对比结果。
一个有意思的现象是,DINOv2这类语义特征虽然比Flux-VAE弱,但依然能稳定超过纯文本基线。这说明“预测未来”本身就带有监督价值,哪怕你预测的不是精细画面而是高层语义。而SigLIP2自适应版本显著优于冻结版本,暗示目标表示如果能在训练中跟着模型一起演化,预测目标会更“跟手”。
接下来是数据混合比。训练时每个batch里既有“理解类样本”(只学习预测答案),又有“预测类样本”(还要预测未来表征)。理解样本和预测样本的比例有1:1、3:1、5:1三档。直觉上,理解样本多一点能让模型更快适应任务,但论文发现事实恰恰相反。
这其实是个很重要的优化洞察:未来状态预测不是“偶尔吃一粒的保健品”,而是必须全程跟文本生成一起训练的主力目标。如果预测任务出现频率太低,模型刚学到的预测表征很快就被答案监督“冲刷”掉了。1:1的均衡混合让两个目标持续互相约束,最终在20k步时四项指标全部达到最优。
预测目标的选择同样有讲究。论文对比了整流流匹配和直接特征回归两种方式,而且分别在不同目标表示上做了验证。结果如图4所示。
这说明“预测表征”和“预测目标”不能分开选。DINOv2特征分布相对规整,直接回归就够了;而VAE的latent空间更复杂,流匹配的噪声到目标的路径建模能发挥更大价值。论文还专门指出,虽然BAGEL生成分支用的是VAE latent + 整流流,但在下游推理任务上直接回归的效果也完全能打,甚至在某些指标上更好。
训练课程上,论文对比了“联合训练”和“两阶段训练”。两阶段指的是先只优化未来预测目标,再只用理解目标微调。表2的结果可以说非常干脆:两阶段训练全面低于Answer-Only SFT基线,联合训练则全面大幅领先。
预测范围(Prediction Horizon)也是一个关键设计参数。所谓预测范围H,就是让模型同时预测未来1到H秒的帧表征。图5展示了Dense和MoE两种架构在不同H下的表现。
整体来看,Dense和MoE在所有预测范围上都超过了Answer-Only SFT虚线。Dense在短范围更优说明紧密的梯度耦合有利于“预测+理解”协同;MoE在更长范围内更稳,说明一定程度上隔离预测路径可以减少对语言推理的干扰。
效率与精度兼得:推理延迟降低5倍,性能全面超越文本CoT
效率是这篇论文最硬的卖点。表1给出了一组非常直观的数据:在早期事件预测上,Answer-Only SFT的平均延迟是1.07秒,Visual CoT直接飙到6.56秒,翻了6.2倍。到了下一事件预测,Visual CoT延迟5.0倍于基线,但性能只换来METEOR涨了4.3%,其他指标几乎原地踏步甚至倒退。
而IVT在推理阶段完全不需要生成和重编码图像,因此延迟曲线几乎和Answer-Only SFT贴合。表8更详细地展示了三个数据集上的端到端延迟:IVT的均值和P95延迟都接近Answer-Only SFT,而Visual CoT因为多了一步图像生成,延迟显著拉高。
精度方面的表现同样亮眼。表3到表5展示了在Ego-Exo4D、Ego4D和EPIC-KITCHENS-100三个数据集完整验证集上的对比结果。以Ego-Exo4D为例,IVT-Dense和IVT-MoE在早期事件预测的多个指标上都超过了Answer-Only SFT,并且和Zebra-CoT这个显式Visual CoT强基线打得有来有回,不少指标实现反超。Ego4D和EPIC-KITCHENS-100上的趋势也基本一致:IVT整体领先纯文本基线,在不少指标上追平甚至超过Visual CoT。
论文在6个评测设置上对IVT和纯文本后训练做了全面对比:三个数据集的EEP和NEP各算一个设置。结果是IVT在每个设置上都优于Answer-Only SFT。更关键的是,与Visual CoT相比,IVT在6个基准的4个上实现了反超,剩下2个也基本持平。
何时该用显式视觉CoT?——IVT的适用边界与未来展望
看到这里,你可能会问:既然IVT这么好,那显式Visual CoT是不是就该被彻底抛弃了?论文的态度很克制,并没有把话说死。他们专门做了一项从Ego-Exo4D到Charades的跨域迁移实验,验证IVT学到的是不是一套可泛化的预测能力。表7的结果显示,IVT在跨域迁移上全面超过Answer-Only SFT,Dense架构在所有预测范围上都优于MoE。这说明“内化未来预测”确实让模型学到了某种超越特定数据集模式的通用视频动态理解能力。
但边界也同样清晰。论文自己承认,当前工作聚焦在短时程预测上——NEP的预判间隔固定为1秒。长时程的意图预测(比如“这个人接下来十分钟打算做什么”)本质上更依赖语义目标、程序性知识和语言先验,未来帧嵌入预测这种“视觉动力学”型监督未必能覆盖。此外,当前实验用的是1fps的帧采样和224到448的输入分辨率,如果换成高帧率、高分辨率的复杂场景,预测难度和计算开销都会同步上升。
从更大的视角看,IVT的价值不只是“省了几秒延迟”,而是给多模态模型的设计提供了新思路:视觉生成能力和视觉理解能力不一定要在推理时“绑定”在一起。你完全可以在训练阶段用generative的辅助任务把模型“喂强”,然后在推理阶段把生成分支收起来,只走理解路径。这对延迟敏感的场景——自动驾驶、机器人实时决策、交互式助手——意义很大,因为在那些场景里,预测晚一秒,可能就什么价值都没有了。
龙迷三问
这篇论文到底在解决什么问题? Apple提出IVT后训练框架,在训练时预测未来帧的潜在表示,推理时直接生成答案。相比显式视觉CoT,端到端延迟降低5倍以上,在6个评测设置中全面超越纯文本后训练,4/6评测达优。
这篇工作最值得看的点是什么? IVT在所有6个评估设置中均优于纯文本后训练,在6个设置中的4个上超过Visual CoT,在全部3个下一事件预测基准上获胜,同时推理延迟降低超过5倍。
这篇工作的边界或风险在哪里? 优点:(1) 提出了一种新颖的训练时内化视觉思维范式,避免了推理时的图像生成开销;(2) 系统性地研究了多个设计选择的影响,提供了丰富的消融实验;(3) 在多个基准上取得一致改进,推理效率显著提升。缺点:(1) 在部分早期事件预测基准上仍落后于Visual CoT;(2) 与更大的Qwen3-VL-8B相比仍有差距;(3) 仅关注短时距预测,长时距预测留待未来工作。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出Internalized Visual Thinking (IVT)框架,在训练阶段通过预测未来帧的潜在嵌入表示来内化视觉预测能力,推理时直接生成答案而不显式生成中间图像,从而在保持高效推理的同时提升主动视频推理性能。
实验合理度: ★★★★☆
ROUGE-L、METEOR、CIDEr、BERTScore,下一事件预测额外使用Top-5召回率。
学术研究价值: ★★★★☆
提出Internalized Visual Thinking (IVT)框架,在训练阶段通过预测未来帧的潜在嵌入表示来内化视觉预测能力,推理时直接生成答案而不显式生成中间图像,从而在保持高效推理的同时。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
推理时与Answer-Only SFT相同,无额外图像生成开销。相比Visual CoT,端到端推理延迟降低超过5倍(平均延迟从6.56秒降至1.22秒)。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) 在部分早期事件预测基准上仍落后于Visual CoT;(2) 与更大的Qwen3-VL-8B相比仍有差距;
主要参考文献
[1] Zhu, X., Deng, X., Taddewadikar, S., Mondal, A.K., Jiang, Z., Fasel, I., Liebelt, J. (2026). Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning. Apple. arXiv:2608.15869.
[2] Li et al. (2025a). Zebra-CoT: Visual Chain-of-Thought for Proactive Video Reasoning. (论文中引用的Visual CoT代表性基线)
[3] Deng et al. (2025). BAGEL: Mixture-of-Transformers Architecture for Unified Generation and Understanding. (论文使用的基座模型)
[4] Grauman et al. (2024). Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives. CVPR 2024.
[5] Damen et al. (2022). Rescaling Egocentric Vision: Collection, Pipeline and Challenges for EPIC-KITCHENS-100. IJCV 2022.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
未来不用“画”出来,想清楚就够了~ Apple这篇IVT把视频预测藏进训练,推理一路狂飙。
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 视频推理+上海+清华+龙哥) ,根据格式备注,可更快