← 返回 PaperDaily 视觉与图像

CVPR 2026新作DexAC:57维灵巧手动作,别再一锅端压缩了

57维灵巧手动作不是“大一点的控制”这么简单,传统把动作一把压成向量的做法,在这里开始露怯了。本文把动作拆成结构化 token,再配上局部+全局注入和语义分支,思路很清楚,效果也确实能打。

CVPR 2026新作DexAC:57维灵巧手动作,别再一锅端压缩了
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
57维灵巧手动作不是“大一点的控制”这么简单,传统把动作一把压成向量的做法,在这里开始露怯了。本文把动作拆成结构化 token,再配上局部+全局注入和语义分支,思路很清楚,效果也确实能打。


原论文信息如下:
论文标题:
Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model
发表日期:
2026年06月
发表单位:
The Hong Kong University of Science and Technology (Guangzhou), Shenzhen University, Beijing University of Technology, JD Explore Academ
原文链接:
https://arxiv.org/pdf/2606.27325v1.pdf
项目链接:
https://zizhaoyuan.github.io/DexAC-WM

高自由度灵巧操控的世界模型为何受限?

先看一个很直观的画面:灵巧手在桌面上拆装家具、抓取、插拔、旋拧,动作看起来像“手很忙”,实际上是“脑子更忙”。对于世界模型来说,这类任务最难的地方不在于能不能看懂画面,而在于能不能把动作和未来变化一一对上号。手腕、相机、手指、手部姿态,甚至细小的关节抖动,都会影响下一帧长什么样。问题是,这些动作的量级差得离谱:有的像开大卡车,有的像捏针尖,传统把整段动作“一把压成一个向量”的做法,到了这里就开始露怯了。
封面
图1:DexAC-WM 总体架构。它不再把动作粗暴压缩成一个全局表示,而是让动作维度保留结构,再通过局部细化和全局调制一起注入世界模型。
这篇论文的核心想法很朴素:不是所有动作都该享受同等待遇。大动作负责“带节奏”,小动作负责“改细节”,如果把它们统统塞进一个共享 embedding,模型就容易只记住“手腕在动”,忘了“手指也在悄悄发力”。DexAC-WM 于是把动作条件重新拆开,给每个动作维度一点存在感,顺手再加一个语义分支,帮助模型把“看见什么”和“动了什么”对齐。别小看这一步,灵巧操控里最怕的就是:动作说自己很重要,模型却听成了背景噪声。
插图

核心创新:结构化动作表示与局部-全局条件

先把背景讲明白。这里的世界模型,本质上就是“根据当前画面和动作,预测未来会发生什么”。论文里采用的是动作条件化视频预测框架,动作维度高达 57-DoF,其中 DoF 是 Degree of Freedom,中文是自由度。这 57 维里既有两只手腕的位移和旋转,也有手指关节细粒度变化,还有头部/相机的自运动。换句话说,这不是“按一下前进”那种简单控制,而是“每根手指都像在打鼓”。
图2
图2:动作幅值分布对比。6-DoF 场景里动作尺度相对均衡,而 57-DoF 灵巧操控里,腕部/相机的大尺度动作和手指微动作之间存在高达 10-5 级别的差异,优化时很容易“强者恒强”。
论文先指出一个很关键的事实:传统方法通常把整段动作序列直接压成一个全局向量,再丢进扩散式视频模型里。这种做法在低自由度控制里常常没问题,因为各维动作差不多“同桌吃饭”,谁也别太抢戏;但到了高自由度灵巧操控,动作维度之间的量级和语义差异太大,手腕动作像主唱,手指动作像伴奏,结果全局压缩一上来,伴奏就被混音师顺手关小了。
为了解决这个问题,本文提出了 Structured Action Representation,中文可理解为结构化动作表示。这里的关键不是“把动作变复杂”,而是“别把复杂动作压扁”。它先把每个动作维度独立归一化,再保留时间维和维度维的结构,把每一维动作都当成一个 token 来处理。SAT 是 Structured Action Tokenizer,结构化动作分词器,作用可以粗暴理解成:不给动作整段打包,而是拆成若干“动作小方块”,每块都保留自己的时间轨迹和统计特征。
图10
图10:传统 MLP 动作嵌入与结构化动作分词器 SAT 的对比。前者像把一整锅菜打成糊,后者则是尽量保留每种食材的口感。
为什么这一步重要?因为高自由度动作里,尺度对齐只是第一关,语义不塌缩才是第二关。论文明确指出,哪怕先做了数值归一化,如果最后仍然把所有维度压成一个 embedding,语义还是会混在一起。SAT 的做法则是先维度级别保留结构,再沿时间维做轻量融合,让每个动作 token 既知道自己是谁,也知道自己在序列里的前后关系。这个设计看起来不花哨,但很像给每个动作维度发了工牌:别再说“我只是个向量”,你是有岗位的。
接下来是更有意思的部分:Unified Local-Global Conditioning,也就是局部-全局统一条件注入。它不是简单把动作 token 丢给 backbone,而是分成两条路:一条做局部细化,一条做全局调制。局部细化像拿放大镜盯着细节动作,保证手指微调、细小接触变化也能进入模型视野;全局调制则像总导演,负责告诉模型这一段动作的大方向,避免局部细节把整体节奏带偏。
局部分支里,动作 token 会通过 cross-attention 直接和 latent 噪声交互。这里的 cross-attention 可以理解成“让图像潜变量去问动作:你到底想让我怎么变”。这样做的好处是,小动作不会被提前汇总掉,而是能直接参与每个 latent token 的修正。全局分支则引入一个可学习 query,把整段动作 token 汇总成一个全局上下文,再通过 AdaLN 注入到 DiT 中。AdaLN 是 Adaptive Layer Normalization,中文是自适应层归一化,它的作用是用动作信号去调节特征的尺度和偏移,让 backbone 的“情绪”跟着动作走。
图1
图1:动作条件注入的两种范式对比。传统方法偏向全局压缩,而 DexAC-WM 把动作维度结构保留下来,再用局部细化和全局调制协同工作。
图4
图4:DexAC-WM 的完整架构图。可以看到,动作条件和语义条件并不是“谁先谁后”的关系,而是一起服务于未来视频预测。
再往上走一步,论文还加了一个Semantic Condition,即语义条件分支。这里用到 DINOv3 特征和文本嵌入,英文全称里 DINO 指的是 self-distillation with no labels,中文常译为“无标签自蒸馏”视觉特征。论文把 DINOv3 的局部空间结构和 VLM 的文本语义一起送进 cross-attention,让模型既知道“这块区域像什么”,也知道“这个动作大概在干嘛”。这一步很像给模型补了一副眼镜:以前只会看像素,现在还能看懂场景和物体关系。
从实现上看,这套方法并没有乱堆模块,而是形成了一个比较清晰的链条:动作先结构化,再分局部与全局两路注入,最后用语义分支补足场景理解。它解决的不是某一个点的小毛病,而是高自由度操控里最核心的老问题:动作尺度不均衡、语义混叠、细节跟不上。换句话说,这不是“模型更大一点”,而是“动作接口终于设计对了”。
插图

实验对比:全面碾压,但有一定局限性

实验部分比较有说服力。论文在 EgoDexEgoVerse 两个大规模第一人称灵巧操控数据集上做了验证,指标也比较全:PSNR、SSIM 看重建质量,LPIPS、FID、FVD 看感知与时序真实感,PCK@10 和 PCK@20 看关键点跟动作的一致性。这里的 PCK 是 Percentage of Correct Keypoints,中文是正确关键点比例。简单说,前面几项看“像不像”,后面几项看“跟不跟手”。
表1
表1:EgoDex 和 EgoVerse 上的定量对比结果。整体上,DexAC-WM 在视觉质量、时序一致性和动作一致性上都优于强基线,说明“结构化动作+语义分支”不是摆设。
从结果趋势看,完整模型在多个指标上都能把基线往下压一截,尤其是 FID、FVD 和 PCK 这三类指标更能说明问题:前两者下降,意味着生成视频更像真视频、时间上也更连贯;PCK 上升,则说明动作跟随更准。更值得注意的是,单独加 DexAC 或单独加语义分支都有收益,但两者叠加后效果最好,这说明动作结构建模和语义 grounding 不是互相替代,而是互相补位。一个管“怎么动”,一个管“动到哪儿”,凑一起才像个完整系统。
定性结果也挺有意思。EgoDex 上那些插入 USB、清理桌面、倒冰块、垂直抓放等任务里,完整模型对物体边界、手部位置和动作节奏的跟随更自然;EgoVerse 上更复杂的野外任务里,优势依然能看到,说明这套结构化动作条件并不是只会背题。尤其在长序列预测里,模型不容易出现“前几帧还行,后面开始发散”的老毛病,这和局部-全局双通路设计是对得上的。
图5
图5:EgoDex 上的定性对比。最上面是真实视频,下面依次是完整模型、仅加 DexAC、仅加 DINOv3 和基础模型。可以直接看出,完整模型在动作对齐和画面稳定性上更自然。
图6
图6:EgoVerse 上的定性对比。面对更复杂、更野外的场景,完整模型依然能维持较好的时空一致性,说明方法有一定泛化能力。
不过,文章也不是“无脑封神”。它的局限性同样很清楚。第一,方法依赖高质量的动作标注和较强的预训练 backbone,数据和算力门槛并不低。第二,虽然结构化动作表示缓解了高维动作的优化问题,但它并没有从根本上消灭高自由度控制里天然存在的噪声与歧义,尤其是手指级别的微动作,仍然可能受传感误差影响。第三,实验主要验证的是动作条件化视频预测,离真正的闭环机器人控制还隔着一层“从看懂到干活”的现实鸿沟。也就是说,它已经把路铺得更顺了,但还没把车直接开进工厂。
图3
图3:不同结构的训练损失曲线。普通全局条件在 57-DoF 场景下收敛更吃力,而 DexAC 加语义分支后,训练更稳定、损失更低。
插图

方法扩展性与未来方向

论文还有一个比较重要的信号:结构化动作条件是可迁移的。作者在不同 backbone 上验证了它的扩展性,说明这不是只绑定某一个模型的“特供外挂”,而更像一种通用接口设计思路。只要任务里存在动作维度不均衡、细粒度控制难以保留的问题,这种“别把动作过早压扁”的思路都值得借鉴。
表6
表6:模型复杂度对比。结构化动作和语义分支带来性能提升的同时,也意味着更多参数和计算开销,说明这套方法并不是“免费午餐”。
未来如果继续往前走,比较自然的方向有三个。第一,把结构化动作表示和更强的时序建模结合,减少长时预测里动作误差的累积。第二,把这种高自由度动作接口往真实机器人控制里迁移,验证它是否能从“会预测”变成“会执行”。第三,进一步压缩语义分支的成本,让模型既有眼力,也别太费电。毕竟工程世界里,能跑得动、跑得稳,才算真本事。
图7
图7:AdaLN 空间里的动作热力图。它能帮助观察哪些动作维度在条件注入时更“有存在感”。
图8
图8:PCA 可视化结果。不同任务在特征空间中的分布更清晰,说明结构化动作有助于学习更可分的表示。
图9
图9:t-SNE 可视化结果。不同任务的聚类边界更明显,进一步说明动作 token 不是“糊成一团”的。
表8
表8:语义条件权重的消融结果。说明语义分支不是越大越好,而是要和动作分支保持合适平衡。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决的是高自由度灵巧操控里“动作怎么条件化”的问题。以前常见做法是把整段动作压成一个全局向量,但在 57-DoF 场景里,这样会把手腕的大动作和手指的小动作混在一起,导致小但关键的信号容易被淹没。DexAC-WM 的思路是把动作结构保留下来,再分局部和全局两路注入。

DexAC、SAT、AdaLN 分别是什么意思?DexAC 是作者提出的结构化动作条件模块;SAT 是 Structured Action Tokenizer,中文是结构化动作分词器,用来把动作按维度拆成 token;AdaLN 是 Adaptive Layer Normalization,自适应层归一化,用来把全局动作上下文注入到生成 backbone 中。三者配合起来,才有“动作不被压扁”的效果。

为什么还要加语义分支,动作不就够了吗?不够。动作告诉模型“怎么动”,但语义分支告诉模型“动的是谁、周围是什么、这一步大概在干什么”。在第一人称灵巧操控里,物体边界、场景布局和手-物交互关系都很重要。DINOv3 的空间特征和文本嵌入一起进来,能让模型更容易把动作和视觉变化对齐,减少只会动、不知道为什么动的情况。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 结构化动作表示这条路不算凭空发明,但把“维度级 token + 局部-全局双通路 + 语义分支”组合成完整方案,针对性很强。

实验合理度:★★★★☆ 数据集、指标、消融都比较齐,且能看到各模块的独立贡献,整体比较可信。

学术研究价值:★★★★☆ 它抓住了高自由度控制里一个常被忽略的痛点:动作条件本身就该被重新设计,这对后续世界模型和具身学习都有启发。

稳定性:★★★☆☆ 在视频预测任务里表现不错,但离真实闭环控制和复杂噪声环境下的稳定运行还有距离。

适应性以及泛化能力:★★★☆☆ 跨 backbone 有一定扩展性,但主要还是围绕第一人称灵巧操控场景,泛化到别的任务还要再看。

硬件需求及成本:★★☆☆☆ 2B 级 backbone、H200 训练配置,说明这不是轻量级方法,工程落地成本不低。

复现难度:★★★☆☆ 论文信息较完整,但高质量数据、预训练模型和算力门槛都不低,复现不算轻松。

产品化成熟度:★★★☆☆ 作为预测模块有潜力,但要进机器人产品,还需要进一步验证实时性、鲁棒性和闭环控制能力。

可能的问题:方法思路清楚,但代价也清楚:更复杂的条件注入意味着更高算力和更强数据依赖,离“随便一套就能跑”还有一段路。


主要参考文献

[1] Yuan Z, Liang Z, Wang T, et al. Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model. arXiv preprint arXiv:2606.27325, 2026.
[2] DexAC-WM 项目主页:https://zizhaoyuan.github.io/DexAC-WM
[3] 原论文链接:https://arxiv.org/pdf/2606.27325v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。DexAC 这种“动作别一锅端”的思路,很适合继续深挖,欢迎来星球和龙哥一起拆。想看更多前沿论文、代码和招聘信息,记得扫码加入~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。