← 返回 PaperDaily 前沿研究

多模态AI为何卡在实时行动?6篇新论文拆开完整链路

一套多模态系统可以在图片问答里拿高分,却未必能在真实机器人上及时完成一次抓取。问题不只出在模型是否“聪明”,而是视频表征、空间几何、证据路由、视觉压缩、动作生成和物理预测能否在同一时间预算里闭环。 过去72小时首发的6篇论文,恰好把这条链路的六个关键瓶颈同时摊开。

一、一个现实问题:模型看懂了,机器人为什么还在等?

多模态模型在静态基准上回答正确,通常只证明它在给定输入和充足推理时间下完成了某种映射。真实系统却有另一套账本:摄像头不断产生帧,视觉编码器要及时抽取信息,语言模型要找到与指令相关的区域,动作头还要把连续控制量生成出来。任何一段延迟过高,后续动作面对的就已经不是模型刚刚看见的世界。桌上的杯子被碰了一下、机械臂已经移动了几厘米、行人走入盲区,都会把一次看似正确的推理变成错误动作。

因此,“多模态AI走向现实”并不是再堆一个更大的视觉语言模型。它更像一条端到端数据管道:上游学习时间和空间结构,中游找到并压缩真正相关的视觉证据,下游在严格延迟里连续生成动作,世界模型则预测候选动作的后果。系统价值取决于最慢、最脆弱的那一段,而不是最漂亮的单项分数。

时间窗与选文口径

北京时间2026年8月30日15:30回看24小时,周末没有形成足够的arXiv新批次,因此按任务要求扩展到72小时。6篇均为2026年8月27日首发的arXiv v1,UTC发布时间从14:52到17:43。选文依据是共同系统问题、环节互补、原文可核验性与工程信息量;它们不是同一排行榜上的“六强”,也不代表数据库全部相关论文。

候选主题比较中,近三天数据库信号还集中于LLM评测、医学AI和Agent。LLM评测与前一轮“可靠性错觉”长文重复度较高,Agent经验进化已在前一日形成完整汇总;医学方向虽然论文数量不少,但同一窗口内横跨脓毒症、超声、药物反应和分割,难以在不偷换任务的情况下形成统一实验主线。多模态实时链路则在同一批次同时出现表征、空间、机制、压缩、控制与世界模型工作,技术闭环更清晰。

选文思维导图:六篇论文覆盖从视频和空间表征到动作与物理预测的连续链路。图由本文依据论文原文整理。

二、LeVJEPA:先让视频预训练不再昂贵

链路起点是LeVJEPA。视频比单张图像多出时间维度,天然包含物体运动、遮挡变化和因果先后,但传统视频自监督通常需要目标编码器、指数滑动平均、停止梯度、预测器或像素重建器来避免表征坍塌。组件越多,训练成本和调参成本越高,也使研究团队很难判断收益究竟来自数据、目标函数还是工程技巧。

LeVJEPA把训练结构压缩为共享编码器和投影器:全局视图与局部视图的表示保持一致,再由SIGReg把嵌入分布约束为各向同性高斯,从数学上排除所有样本都映射到同一点的坍塌解。更反常识的设计是随机丢弃95%的patch Token。对视频模型而言,这不仅节省计算,还迫使编码器从稀疏时空线索恢复稳定的片段级表示,起到强正则化作用。少看Token不是简单裁剪,而是被训练目标吸收的学习策略。

LeVJEPA Figure 3:冻结编码器的patch表示可分离主体与环境,并随视频保持结构。图片来源:论文官方arXiv HTML。

在相同数据和训练轮数下,论文报告LeVJEPA跨ViT-S/B/L以少5.6至20.8倍的总预训练计算量匹配或超过V-JEPA 2;在相同总FLOPs下,ImageNet-1K比最强视频基线高7.6个百分点。与在相同视频帧上训练的DINOv2相比,它在外观任务接近后者,运动任务准确率接近翻倍。这些结果支持视频预训练可以从“高预算特权”变成更普遍的视觉底座。

但这仍是表征层证据。ImageNet线性探测或运动分类变强,不代表机器人控制延迟、数据效率和安全性同步提升;随机Token丢弃在训练阶段有效,也不等于部署时可以对所有任务统一丢掉95%输入。真正的工程问题是:预训练节省的预算能否被下游模型继承,而不是在视觉语言对齐和动作解码阶段重新花掉。

三、DINOcular:只有RGB,空间理解仍然缺一块

DINOcular处理的是另一种信息缺口。互联网图像让基础模型学到丰富语义,却没有给每个像素提供可靠的距离和三维关系。对于问答,这种缺口有时可以靠常识补偿;对于抓取、导航和避障,杯子在桌面前还是后、障碍物距离机械臂多远,不能只靠语言先验猜。

DINOcular把RGB-D观测中的深度几何先验注入视觉骨干,并同时做patch间和patch内融合。其多视角目标在同一物体的不同观察之间建立3D对应,3D RoPE则把空间位置写进注意力。这样得到的不是专门完成单个深度任务的网络,而是兼顾语义和几何、可迁移到分割、对应估计与物体姿态的冻结表示。

DINOcular Figure 3:RGB视觉特征、深度派生几何编码与3D位置编码在局部和全局层面融合。图片来源:论文官方arXiv HTML。

论文在同等数据规模下报告多项3D几何探测优势。小型DINOcular-S在多数任务甚至超过参数量约3倍的DINO ViT-B;在Probe3D-ScanNet对应估计中,它还超过包括DINOv3 ViT-B在内的参考模型。这个结果的工程意义不是“深度一定赢RGB”,而是说明真实系统已有深度传感器时,把几何只当作下游额外输入,可能浪费了预训练阶段可学习的稳定结构。

限制同样明确。训练只覆盖中等数据规模,DINO训练数据未完全公开,多视角数据要求也使严格等数据比较困难。消融还揭示空间与语义专门化存在权衡:减弱多视角目标会改善部分语义表现,却损害3D感知。团队若部署在手机问答、仓储抓取或自动驾驶,最优权重不会相同;额外深度传感器还带来硬件、标定、带宽和缺测处理成本。

四、Visual Retrieval Heads:VLM真正“看哪里”的头很少

有了视觉表示,系统仍需把问题与具体区域连起来。Retrieval Heads Meet Vision发现,VLM内部并不是所有注意力头平均承担视觉定位。作者把文本模型中的retrieval head分析迁移到视觉场景,识别出Visual Retrieval Heads:它们在输出Token生成时,把注意力集中到文本所指的图像区域,并将对应证据路由给后续输出。

论文 Figure 1:屏蔽Visual Retrieval Heads后,模型仍能保持输出格式,却会把定位框转向错误区域。图片来源:论文官方arXiv HTML。

跨11个VLM和5个指代表达基准,关键头只占总注意力头的约1.7%至2.6%;屏蔽前20个VRH可令定位准确率最多下降80个百分点,随机屏蔽相同数量影响很小。这些头还可迁移到属性、空间、计数和视觉数学任务,并在共享语言骨干但视觉编码器、投影器和指令微调不同的模型之间表现出因果迁移。VLM的视觉证据路由可能既稀疏,又在很大程度上由语言骨干承载。

这个发现为压缩和诊断提供了机制线索:若少量头决定证据检索,系统可重点监控它们的注意区域,或在缓存和Token选择时优先保护其输入。但注意力权重只能告诉证据从哪里来,不能完整回答证据被读成什么、如何变换成答案。实验也主要限于单图;视频、多图和交错上下文是否仍由同一组头控制,尚无直接证据。把“可视化注意力”写成完整可解释性,会明显超过论文结论。

五、PACE:压缩视觉输入,不能只在编码后动刀

理解机制之后,PACE把问题转向部署预算。常见视觉Token剪枝发生在视觉编码器之后,虽然减少LLM预填充开销,却没有减少高分辨率图片经过视觉编码器的成本。更激进的统一下采样可以更早省算力,又容易把图表小字、细线和局部物体一起抹掉。

PACE采用Condense-and-Extract两阶段。编码前,Adaptive Pixel Compressor先用浅层预览估计全局信息密度和局部细节,对冗余区域更积极地下采样;编码后,Dynamic Dual-Attention Extractor融合视觉编码器内部信号和LLM语义信号,保留与任务最相关的视觉Token。前者处理像素预算,后者处理语言模型预算,避免只优化半条链路。

PACE Figure 4:编码前依据像素信息密度自适应压缩,编码后融合视觉与语义注意力提取关键Token。图片来源:论文官方arXiv HTML。

集成到Qwen2.5-VL-7B后,论文在只保留10%视觉Token时保留93.8%的原始性能,并将首Token时间加速3.1倍。数字很有吸引力,但93.8%是多个评测下的相对保留口径,不代表每个高风险样本都只损失6.2%。对于票据、医学影像、工业仪表或代码截图,丢失一个小数点和平均分下降几个百分点不是同一种风险。

论文也主动承认两个边界。固定网格视觉编码器不会因降低像素预算而减少编码Token,APC因此没有编码端收益;查询无关的一次性压缩还可能永久丢掉细小字符、薄线和低对比目标,后续DDAE无法重建。官方仓库核验时只有最简README,尚不能据此宣称完整复现。生产系统需要保留高分辨率回看通道,并用不确定性触发二次裁剪,而不是把10%写成固定配置。

六、FlashVLA:动作解码要像视频流,而不是一段段停顿

视觉推理完成后,FlashVLA面对的是控制环最直接的延迟。流匹配VLA通常要经过多步去噪才能生成一个动作块。同步执行会让机器人在块边界等待;异步执行虽能边算边动,却常基于旧观测预测更远未来,模型看到的状态与动作真正执行时的状态逐渐错位。

FlashVLA维护一个包含多个不同噪声级动作块的流式缓冲区,用块级因果注意力共同解码。每次前向同时推进所有块一步,预热后每一步都能输出一个可执行块;高噪声的未来块还能关注更接近执行、噪声更低的动作块,从轨迹上下文中获得连续性。它没有缩短每个动作块应经历的去噪过程,而是把这些步骤摊到时间流水线上。

FlashVLA Figure 1a:传统同步方法在块边界停顿,传统异步方法受旧观测偏移影响;流式联合解码让动作块连续推进。图片来源:论文官方arXiv HTML。

论文分析中,π0.5的动作解码占单次推理时间75%;FlashVLA的流式设计使动作解码延迟最高下降约20倍。跨LIBERO、RoboTwin 2.0和真实Franka任务,它在一步异步延迟下匹配或改善π0.5成功率,端到端单动作最高加速2.43倍,并在单GPU上实现至少30Hz平滑控制。这类结果比单纯报告模型FLOPs更接近机器人真正关心的时间尺度。

但30Hz不是跨平台承诺。论文剖析使用具体GPU、双视角输入和特定策略,真实系统还受相机采集、网络、碰撞检测、控制器和机械响应影响。流式缓冲减少等待,却不能消除模型误判或环境突变;连续地产生错误动作,反而可能让安全层更难介入。部署时应同时测time-to-first-action、time-to-react、最坏延迟和紧急停止距离,而不只看平均控制频率。

七、CLAP:让不同机器人共享物理先验,代价是幻觉也进入控制链

链路末端是CLAP。单本体视频世界模型通常只学习一种机器人、一个动作空间,难以利用大量人类视频和其他机器人数据。CLAP的出发点是物理规律不因执行者改变:杯子受力会移动、物体受遮挡会消失,这些规律可在不同形态间共享;真正不一致的是动作表示。

CLAP用末端执行器姿态、语言动作和潜在动作三种表示协调异构数据,并采用课程式训练:先从无动作标注视频中学习潜在物理先验,再把模型落到末端执行器动作空间,用于真实任务。它覆盖DROID、Bridge、双臂YAM和G1人形机器人,还可根据多个策略提出的候选动作预测未来帧,再选择更符合任务奖励的方案。

CLAP Figure 2:人类与多类机器人视频通过末端姿态、语言和潜在动作对齐,训练跨本体动作条件视频模型。图片来源:论文官方arXiv HTML。

论文报告跨本体模型在DROID上接近或超过单本体SOTA,在Bridge等简单域只出现较小保真度下降;进一步少样本适配后,多数感知指标超过单本体基线。在跨策略规划中,世界模型还能改善π0.5和MolmoAct-2基础策略的任务成功率。官方仓库公开训练、评测、适配与部署入口以及模型下载,其工程完整度在六篇中最突出。

最重要的边界也由作者明确给出:CLAP仍会像其他视频世界模型一样产生幻觉。预测视频看起来合理,不等于接触力、摩擦、碰撞和物体状态都正确;语言条件在长预测跨度上还会累积误差。世界模型适合筛选候选和降低真实试验成本,不应在没有不确定性估计、真实反馈和安全控制器时直接充当物理裁判。跨本体扩展还会增加模型训练与推理成本,并没有自动解决实时性。

六组实验应该怎样读,才不会被数字带偏?

第一条原则是先看分母。LeVJEPA的5.6至20.8倍指相同数据、相同训练轮数下的总预训练计算量,不是所有视频模型部署都能立刻节省同样倍数;PACE的3.1倍针对首Token时间,不能代表整段回答、视频流处理或动作控制都加速3.1倍;FlashVLA的至少30Hz来自特定单GPU配置,也不能脱离相机、控制器和安全层独立解释。三个数字都真实,但回答的是三种不同问题。

第二条原则是区分平均性能与关键样本。PACE保留93.8%原始性能,描述的是基准聚合结果;对于含小字的票据、远处障碍或机械臂接触点,局部证据一旦在编码前被压掉,平均成绩无法补救。VRH的屏蔽实验恰好提示,决定定位的内部通路可能非常稀疏;稀疏意味着可以重点保护,也意味着单点损伤可能造成陡峭退化。因此压缩测试应按对象大小、对比度、文字密度和风险等级分层,而不是只汇报一条平均曲线。

第三条原则是区分感知指标与行动结果。DINOcular的3D对应和姿态探测更强,说明冻结特征包含更多几何结构,却不能直接推出抓取成功率;CLAP生成未来帧更逼真,也不能证明接触力和碰撞预测精确。若研究目标是机器人,至少还需测闭环成功率、恢复能力、碰撞次数、状态陈旧度和跨场景稳定性。离线表征是必要证据,但从表征到行动之间仍有策略、控制和安全三道接口。

第四条原则是把可复现性当成结果的一部分。CLAP仓库已经公开较完整的训练、评测、适配和部署入口;PACE在核验时只有极简README,FlashVLA虽然在论文中给出仓库,远程文档读取却不稳定;其余工作主要依靠论文和项目页。代码状态不会推翻论文实验,但会显著改变团队采用成本。对工程决策而言,同样的论文分数下,数据许可、模型权重、硬件需求、评测脚本和失败案例是否齐全,往往比标题中的最高提升更重要。

八、把六篇放在一起:真正的突破是预算协同

六篇论文没有组成一个已经集成的系统,也不能把各自提升幅度相加。LeVJEPA减少预训练成本,DINOcular增加几何信息,VRH揭示证据路由,PACE压缩视觉路径,FlashVLA流水化动作解码,CLAP预测候选动作后果。它们优化的是不同阶段、不同数据集和不同硬件条件。若把“20.8倍少计算”“3.1倍TTFT”“30Hz控制”写成一套系统的综合性能,既不科学,也会掩盖接口成本。

工程权衡图:每一段降本都伴随信息、硬件、时序或安全边界,数字必须留在各自实验语境中。图由本文依据六篇论文整理。

更值得关注的共同趋势,是研究对象从单模型平均准确率转向整条预算链。视觉预训练开始按Token计算成本,VLM压缩同时测编码器和LLM首Token时间,VLA报告动作首响应与异步连续性,世界模型则被放进策略选择和适配流程。评价问题正在从“模型能不能答对”改为“在信息没有被过度压缩、状态没有过期、风险可以被拦截的条件下,系统能否及时做对”。

一条更可靠的工程落地顺序

第一步应先画出端到端延迟剖面,分别记录传感器、编码器、LLM预填充、动作解码、网络和控制器开销。没有剖面就直接剪Token,可能优化了只占总时延很小的一段。第二步建立任务相关的信息保护规则:文本与图表保留更高分辨率,机器人场景保护手、工具、接触点和障碍区域,并允许低置信度样本回看原图。第三步再做流式控制,把平均频率、尾延迟、状态陈旧度和紧急停止共同纳入验收。

第四步才是世界模型进入规划。它应输出候选排序和不确定性,而不是未经约束地给出唯一动作;真实环境反馈必须持续纠偏。对于需要深度传感器的方案,还要把标定漂移、缺测和设备成本写入产品预算。对研究团队而言,最有价值的复现实验也不是一次性跑通六套代码,而是选择一个真实任务,逐段替换并记录准确率—延迟—安全三条曲线如何变化。

九、龙哥点评:从“会看图”到“能行动”,中间隔着系统工程

龙哥的判断是,这批工作真正值得关注的地方,不是又出现六个新缩写,而是它们把多模态模型最容易被忽略的现实约束拉回了实验:视频训练太贵、RGB缺几何、证据路由集中、视觉Token过多、动作去噪太慢、世界模型会幻觉。每篇都只解决一段,但问题定义比“再涨一个总榜分数”更接近产品。

其中,PACE和FlashVLA最容易形成短期工程收益,因为它们直接作用于可测量的部署延迟;LeVJEPA和DINOcular更像中期底座投资,收益要经过下游任务验证;VRH提供诊断和压缩的新机制入口,但距离稳定工具链仍有距离;CLAP的长期想象空间最大,也最需要克制,因为跨本体数据扩展和物理幻觉会同时放大。

对普通开发团队,最务实的路线不是立即训练世界模型,而是先做全链路profiling、保留高分辨率回退、测尾延迟,再决定是否引入视觉压缩或流式动作。对研究者,值得追问的是这些模块组合后会不会相互破坏:PACE会不会删掉VRH最需要的细节,LeVJEPA的稀疏视频表征能否帮助CLAP,FlashVLA更快的动作是否会放大世界模型误差。下一阶段的关键论文,可能不再靠单模块SOTA胜出,而靠跨模块共同预算和闭环失败分析。

十、龙迷三问

第一问:压缩前,系统知道什么是不能丢的吗?

若压缩策略与查询无关,小字、接触点和低对比障碍可能在模型开始推理前已经消失。可靠系统必须有任务相关保护区和原图回退。

第二问:30Hz意味着反应更安全吗?

高频只说明动作输出更快;若观测陈旧、模型错误或安全控制器更慢,高频会让错误更连续。应同时报告尾延迟、反应时间和停止距离。

第三问:生成视频可以当物理模拟器吗?

它可以作为候选筛选器和数据增广器,但像素合理不等于力学正确。没有不确定性、真实反馈和硬安全约束时,不应把视频预测当作唯一控制依据。

十一、总结与展望

这6篇论文给出的不是一条已经打通的万能方案,而是一张更清楚的故障地图:视频底座决定时间先验,RGB-D决定空间几何,少量检索头决定证据从哪里进入推理,压缩策略决定哪些细节会提前消失,流式动作决定系统是否赶得上环境变化,跨本体世界模型则决定能否在真实执行前比较动作后果。

短期趋势会是更细的端到端性能报告:不只给准确率,还给首Token、首动作、反应时间、尾延迟和硬件条件。中期趋势会把压缩、检索机制与不确定性联动,让系统在疑难样本上主动恢复高分辨率。长期趋势则是表征、动作和世界模型联合训练,但它只有在真实反馈、数据治理与安全控制同步成熟时,才可能从“会生成合理未来”走向“能承担现实后果”。

多模态AI的下一道门槛不是看得更多,而是在有限预算里保留正确证据、及时生成动作,并对预测错的未来保持敬畏。

主要参考资料

1. LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics官方项目页
2. DINOcular: Self-Supervised Visuospatial Representations官方项目页
3. Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information
4. PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference官方仓库
5. FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference官方仓库
6. CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators官方项目页官方仓库

本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。

本文仅代表对论文公开版本的技术解读,不构成产品、安全或投资建议。关键结论请以论文原文、项目页和官方仓库为准。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球