← 返回 PaperDaily
视觉与图像
复旦最新QuantWAMs:世界动作模型W4A4量化,成功率仅降0.2%?真机部署快人一步!
世界动作模型(WAM)性能强但部署成本高,传统PTQ方法在闭环场景下频频翻车。复旦大学等机构提出了QuantWAMs,从结构、分布、目标三个上下文校准量化决策,W4A4下几乎无损,真机验证也稳了。这篇把量化粒度讲得明明白白,值得一读。
龙哥读论文
发布于 2026-08-14 09:12:09
阅读 4
查看原文
原论文信息如下:
想象一下:一台人形机器人站在厨房里,它的“大脑”是一个庞大的世界动作模型(World Action Model, WAM)。这个模型不仅能预测下一秒的画面,还能同时规划出机械臂该怎么动。听起来很酷吧?但问题来了——这样的模型太“重”了,每毫秒都要进行数十次迭代去噪,在真实机器人上跑起来,算力开销简直让人肉疼。
引言:世界动作模型部署为何如此昂贵?
世界动作模型是最近两年机器人领域的热门方向。它把视频扩散模型和动作扩散专家揉在一起,输入当前观测,既能生成未来的画面帧,又能直接输出对应的控制动作。这种“联合预测”范式在通用机器人操作上表现亮眼,但目前最大的拦路虎是部署成本。每个控制周期都需要迭代去噪,而且是在闭环中运行——模型生成的动作会改变机器人看到的下一帧画面,而这些新画面又成为后续预测的输入。这种闭环特性意味着模型推理不是一次性的,而是要持续跑下去,计算开销成倍放大。
要把这么大的模型塞进真实机器人里,后训练量化(Post-Training Quantization, PTQ)是绕不开的路线。量化相当于给模型做“瘦身”,把原本32位浮点数表示的参数和激活值压到更低的位宽,比如4位或8位。这样模型体积变小、推理变快,还能省内存。可问题在于,现有的PTQ方法基本是为大语言模型(LLM)或者扩散模型设计的,它们有几个假设在世界动作模型这里完全不成立:
假设一: 目标是开环的,比如最小化困惑度或者单张图片的重建误差,每次前向传播独立打分。但WAM是闭环的,前面量化引入的误差会在闭环中传播、放大,最后影响任务成功率。
假设二: 模型是同质的Transformer。但现在的WAM实现五花八门,有双流Mixture-of-Transformers架构(视频和动作各走一个分支),也有共享扩散主干(视频和动作token共享同一套参数)。这些异构模块耦合在一起,不同模块之间能否共享量化统计量,是一个需要仔细判断的问题。
正因如此,复旦大学等机构的研究者们提出了一个专门为WAM量身定制的PTQ框架——QuantWAMs 。他们的核心洞察是:每个PTQ决策本质上都是一个有限样本估计,必须在正确的“校准上下文”下进行。这个上下文包括三个维度:结构(证据池化的范围)、分布(测量敏感性的状态分布)和目标(评估敏感性的损失函数)。只有三个维度都对得上,量化决策在部署时才有意义。
方法概述:三个策略对齐校准上下文
QuantWAMs的总体架构如图2所示。整个框架围绕三条策略展开,分别对应结构轴、目标轴和分布轴:
核心设计(上):共享基异常值校准
先来看结构轴上的问题。在激活量化中,常见做法是保留少数“异常通道”,把K个能量最高的输入通道用高精度(比如BF16)表示,其余通道压到4比特。这个异常通道掩码(Top-K mask)怎么选?统计数据从哪里来?
一个朴素的思路是:把所有模块的激活值汇总到一起,算一个全局的通道能量统计,然后取Top-K。但论文指出,这种做法在WAM里很危险。因为WAM的不同模块可能没有共同的坐标系统——比如在Fast-WAM的双流架构中,视频分支的注意力输出投影和动作分支的对应投影,它们的输出空间虽然维度相同,但经过的线性变换不同,直接池化会“张冠李戴”。
QuantWAMs的做法是先判断哪些模块“坐标兼容”。如果两个模块共享同一个有序基(比如Fast-WAM中共享的值通路对齐了输出投影),那么它们的通道索引可以共享;否则就得为每个上下文单独估计掩码。
但坐标兼容只是必要条件,还远远不够。即使两个模块坐标兼容,它们的通道能量分布也可能差异极大。如果把差异很大的模块硬凑在一起池化,用共享的Top-K掩码去套每个模块,很可能某个模块的真正常用通道被漏掉,反而保了一堆噪声通道。论文在这里做了一个很有意思的统计学分析:把每个通道的统计量建模为“全局均值 + 跨模块异质性 + 采样噪声”,然后推导出池化相对于独立估计的误差对比,得到一个关键的“池化交叉点”N*。
简单说:当校准轨迹数量N小于某个阈值N*时,池化能降低风险;N超过N*后,独立估计反而更好。因为样本多了,每个模块自己算出的掩码更可靠,不需要“借别人的数据”。量化中校准集通常很小(本文只用了32条轨迹),所以池化在大多数情况下是有利的。但论文并没有一刀切,而是在每个候选分组上用bootstrap重采样评估掩码稳定性,只有稳定的组才采用池化。
核心设计(中):联合目标显著性
说完了结构轴的激活掩码,再来看看目标轴上的权重精度分配。在混合精度量化中,一个核心问题是:哪些层应该分配到更高位宽?传统方法通常是逐层扫描验证,或者用单流损失函数的梯度作为显著性指标。但WAM的联合视频-动作训练目标,让事情变得微妙起来。
WAM的训练目标是一个联合损失:ℓco = λvℓv + λaℓa。视频损失和动作损失加权相加。现在要对某个线性层做量化敏感性分析,需要计算该层输出扰动对最终任务损失的影响。常见做法是用经验Fisher信息矩阵GL来近似参数重要性。
这里有个关键陷阱。如果我们先分别计算视频损失的Fisher GLv和动作损失的Fisher GLa,然后做加权融合(Fusion),即GLfusion = λv²GLv + λa²GLa,这样看似“考虑了联合目标”,但实际上丢掉了视频梯度和动作梯度之间的交叉项。
正确的做法是先把两个损失的梯度逐坐标相加,再做外积:GLjoint = E[(λvgv,L + λaga,L)(λvgv,L + λaga,L)T]。展开后,joint和fusion的区别就在交叉项λvλaE[gv,Lga,LT]上。在梯度方向一致的地方,joint会放大显著性;方向相反时,joint会缩小显著性。这种逐坐标的交互信息,是后融合方式永远捕捉不到的。
在此基础上,论文用Kronecker分解的经验Fisher计算每个层的比特级扰动失真DL(b),然后求解一个背包优化问题:在预算约束下选择哪些层从低位升到高位,使得总失真减少量最大化。
值得注意的是,论文特意强调用层粒度 来分配精度,而不是更细的元素或列粒度。原因是:有限校准数据下,细粒度的排名非常不稳定,相邻分数太接近,排来排去全是噪声。层总量的信噪比更高,更稳。
这就是“正确的粒度” 的另一个体现——不仅仅是空间上的粒度(模块间能否池化),还有决策单元本身的粒度(用层不用元素)。
核心设计(下):固定干预rollout审计
扩散模型的量化有个众所周知的问题:去噪过程不同时间步的激活分布差异很大。前面几步噪声大、激活剧烈,中间几步逐渐平稳。常规做法是校准几个关键时间步,分配更高的精度,也就是所谓的“去噪步保护计划”。
但WAM中的情况更复杂:每一步产生的动作会改变环境状态,环境状态又成为后续去噪步骤的输入。如果只用合成数据或者开环数据来校准敏感性,得到的时间步保护计划可能是在“错误的状态分布”上做的——那些合成状态在闭环中根本不会出现。
论文提出了一种固定干预重放(Fixed-Intervention Replay) 审计方法。核心思想是:先用FP16全精度模型跑出一批真实的闭环rollout轨迹,记录每个去噪步的输入快照(包括观测历史、chunk位置、持久缓存等)。然后在每个快照上,把所有目标模块都强制设置为低位精度(即统一的低精度干预q0),再对比输出和FP16输出的差异,得到每个时间步的敏感性分数。
为什么不直接用当前保护计划下的观测分布去测敏感性?因为那会“自我掩盖” ——某个时间步如果已经被高精度保护了,测出来的误差自然很小,但这恰恰是因为保护起了作用,而不是这个时间步不重要。固定干预的做法则是让所有步都承受同样的低精度扰动,在“公平竞赛”的条件下比较每个时间步的真实脆弱性。
另外,论文还指出:局部的单步误差ℓt并不能直接等同于最终任务成功率的损失。因为闭环系统存在误差传递:δsj+1 = Ajδsj + Bjεj,下游任务影响还取决于转移雅可比矩阵的乘积。所以这个profile只用来提出和修订保护计划,不解释为边际任务增益。
整个流程严格控制了数据的隔离:32条轨迹用于PTQ校准,另外32条FP16闭环rollout用于构建重放profile,还有独立的验证集和测试集。每个环节数据不交叉,避免选择偏差。
实验验证:仿真与真机的闭环成功率
论文在两种发布的开源WAM实现上做了评估:Fast-WAM(双流Mixture-of-Transformers)和LingBot-VA(共享扩散主干)。仿真环境用RoboTwin 2.0和LIBERO,真机用AgiBot G2机器人完成三类操作任务。
数据分离是本实验设计的一大亮点。论文将数据分成四类角色:PTQ校准集(32条轨迹)、profile构建集(另外32条FP16闭环rollout)、schedule验证集和最终测试集。所有角色轨迹不交叉,连初始状态种子都不同。每个随机种子r独立执行完整的PTQ拟合和调度选择,保证实验结论不是一次性的运气。
先看Fast-WAM上的结果。表1展示了RoboTwin 2.0和LIBERO四个套件的成功率对比。在W4A4设置下,QuantWAMs在RoboTwin 2.0上的平均成功率达到91.7%,与FP16的91.9%只差0.2个百分点;LIBERO平均97.4%,与FP16的97.6%只差0.2个百分点。相比之下,同是W4A4的SVDQuant在RoboTwin 2.0上只有61.1%,Atom只有71.7%。QuantWAMs直接把W4A4的量级从“掉十几个点”拉到了“几乎不掉点”。
*表格超出部分左右可以滑动
表1:Fast-WAM在RoboTwin 2.0和LIBERO上的量化结果(原论文表格)
Full Precision (FP16): RoboTwin平均91.9%,LIBERO平均97.6%,内存14.4GB
GPTQ (W4A16): RoboTwin 90.9%,LIBERO 96.0%,内存5.5GB
SmoothQuant (W8A8): RoboTwin 91.3%,LIBERO 96.4%,内存7.2GB
SVDQuant (W4A4): RoboTwin 61.1%,LIBERO 73.7%,内存3.6GB
Atom (W4A4): RoboTwin 71.7%,LIBERO 76.2%,内存3.8GB
QuantWAMs (W4A4): RoboTwin 91.7%,LIBERO 97.4%,内存4.2GB
表1:Fast-WAM在RoboTwin 2.0和LIBERO基准上的量化结果。QuantWAMs在W4A4下与FP16仅差0.2-0.3个百分点,大幅领先同精度的SVDQuant和Atom。
再来看LingBot-VA。官方发布的checkpoint只支持LIBERO-Long套件,所以其他套件标记为N/A。从表2可以看出,QuantWAMs在RoboTwin 2.0上平均91.6% vs FP16的92.3%,LIBERO-Long上98.0% vs 98.5%,差距也都在0.5个百分点左右。值得注意的是,虽然Atom的“加星版本”提升了不少,但QuantWAMs仍然领先一大截。
*表格超出部分左右可以滑动
表2:LingBot-VA在RoboTwin 2.0和LIBERO上的量化结果(原论文表格)
Full Precision (FP16): RoboTwin平均92.3%,LIBERO-Long 98.5%,内存13.5GB
GPTQ (W4A16): RoboTwin 90.6%,LIBERO-Long 97.0%,内存5.6GB
SmoothQuant (W8A8): RoboTwin 91.2%,LIBERO-Long 97.5%,内存6.8GB
SVDQuant (W4A4): RoboTwin 64.9%,LIBERO-Long 73.8%,内存3.4GB
Atom (W4A4): RoboTwin 72.9%,LIBERO-Long 76.9%,内存3.6GB
QuantWAMs (W4A4): RoboTwin 91.6%,LIBERO-Long 98.0%,内存3.9GB
表2:LingBot-VA在RoboTwin 2.0和LIBERO-Long上的量化结果。QuantWAMs在W4A4下与FP16差距在0.5个百分点以内。
真机实验方面,论文在AgiBot G2上完成了三类操作任务的部署验证,进一步确认了仿真结果的可靠性。
从资源占用看,QuantWAMs把峰值权重和激活内存降到了FP16的约29%(以Fast-WAM为例,从14.4GB降到4.2GB),同时带来1.4-1.6倍的模块级推理加速。这意味着WAM终于有机会从实验室的A100集群,走进真实的机器人边缘设备。
龙迷三问
W4A4到底是什么意思?为什么都说4比特量化难度很大? W4A4是指权重(Weight)4比特、激活(Activation)4比特的量化方案。相比W8A8(权重和激活各8比特),4比特的动态范围更窄,表示精度更低。激活张量中有不少能量很高的异常通道,直接压到4比特会损失大量信息,所以需要用异常值保护策略保留关键通道。W4A4通常能带来最大的推理加速和显存节省,但精度掉点也最严重,是最有挑战性的量化设置。
为什么量化误差在闭环场景中会被放大? 闭环系统的特点就是“一步错,步步错”。假设机器人第一次预测动作有微小误差,这个误差会让机械臂的位置偏离理想轨迹,于是相机拍到的画面也偏离了训练数据的分布。模型在分布外的输入上继续预测,误差会更大,进而导致更偏离的状态,形成一个恶性循环。而在开环场景中,每次预测的输入都是固定的,误差不会被反馈放大。所以闭环部署对量化精度的要求远比开环严苛。
固定干预重放和普通的rollout敏感性分析有什么区别? 普通做法是在当前的量化模型上做rollout,观察不同时间步的误差,但这存在“自我掩盖”问题:如果某个时间步已经被高精度保护了,它的误差自然小,但你无法判断这个时间步到底是天生不重要,还是因为被保护了才表现好。固定干预重放的做法是把所有时间步都强制设为同一种低精度(即固定的干预条件),然后统一比较每个时间步的误差。这样就排除了“保护计划本身”对敏感性评估的干扰,测出来的才是每个时间步真实的脆弱程度。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把量化校准的“上下文”三维对齐思路引入WAM场景,是第一个系统研究WAM量化的框架,理论分析和工程实践结合得挺好。扣一颗星是因为三个策略本身的底层算子大多复用了现有PTQ轮子,主要创新在“如何正确地用”而非“发明新算子”。
实验合理度: ★★★★★
数据分离非常讲究,PTQ拟合、profile构建、schedule验证、测试完全隔离,连种子都做了三重独立重复。两个架构覆盖了双流和共享主干两种主流WAM设计,基线和消融齐全,实验设计几乎无可挑剔。
学术研究价值: ★★★★☆
为WAM量化提供了统一的理论视角,特别是池化交叉点的统计学推导,对后续多模态、多分支模型量化都有参考价值。但目前的结论还集中在两种特定架构上,理论框架的普适性有待进一步验证。
稳定性: ★★★★☆
在三个随机种子下的标准差控制在0.3-0.5个百分点,说明方法本身相当稳定。真机验证进一步增强了结论的可信度。只是目前只在AgiBot G2单款机器人上做了验证,多平台适应性还有待观察。
适应性以及泛化能力: ★★★★☆
论文在两个架构Fast-WAM和LingBot-VA上都做了验证,覆盖了双流和共享主干两种主流设计,说明方法的架构适应性不错。但WAM本身还在快速演进,未来会不会出现更复杂的多模态架构,到时候这套“坐标兼容性+分布匹配”的思路是否依然有效,还需要持续跟进。
硬件需求及成本: ★★★★☆
梯度辅助的PTQ步骤需要额外的反向传播计算,增加了离线校准成本,且需要访问原始训练目标(视频-动作梯度),这对一些只提供开放API的模型不太友好。不过这些成本都在部署前,不影响运行时效率。总体性价比很高。
复现难度: ★★★☆☆
论文提供了项目主页,且基于开源模型做评估,理论上可复现性较好。但梯度Fisher计算和bootstrap掩码稳定性评估的工程细节较多,代码尚未完全开源,复现时可能需要一些试错成本。
产品化成熟度: ★★★★☆
W4A4下几乎无损的量化效果,加上真机验证,让这个方法具备了很强的产品落地潜力。内存降到FP16的约29%,模块级加速1.4-1.6倍,这些数字对边缘部署非常有吸引力。主要制约因素是校准过程中需要访问原始训练目标的梯度,这对部分黑盒模型不适用。
可能的问题: 论文的统计推导基于一些简化假设(如平衡工作模型),对非平衡、多模块复杂依赖场景的解释力有限。另外“基准特定校准”可能导致任务迁移时策略失效,跨任务泛化验证有所欠缺。
主要参考文献
[1] Frantar E, Ashkboos S, Hoefler T, et al. GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers[C]. ICLR 2023.
[2] Xiao G, Lin J, Seznec M, et al. SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models[C]. ICML 2023.
[3] Zhao Y, Lin C Y, Zhu K, et al. Atom: Low-bit Quantization for Efficient and Accurate LLM Serving[C]. MLSys 2024.
[4] Martens J, Grosse R. Optimizing Neural Networks with Kronecker-factored Approximate Curvature[C]. ICML 2015.
[5] Yuan Z, et al. Fast-WAM: Efficient World Action Models for Robotic Manipulation. 2026.
[6] Li X, et al. LingBot-VA: Shared-backbone World Action Model. 2026.
[7] Chen Z, et al. RoboTwin 2.0: Simulation Platform for Dual-arm Robot Learning. 2025.
[8] Liu B, et al. LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning[C]. NeurIPS 2023.
[9] Ross S, Gordon G, Bagnell D. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning[C]. AISTATS 2011.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!