← 返回 PaperDaily 视觉与图像

W4A4仅掉0.2分!复旦把世界模型量化整明白了

世界行动模型(WAM)又重又慢,部署到机器人上量化是必经之路。但现有PTQ方法在WAM上集体翻车。复旦这篇QuantWAMs,从结构、分布、目标三个维度重新审视校准粒度,在4bit精度下模拟分数几乎不掉点,还在真机上验证了一波,属实有点东西。

W4A4仅掉0.2分!复旦把世界模型量化整明白了
原论文信息如下:
论文标题:
QuantWAMs: Calibrating at the Right Granularity for World Action Models
发表日期: 2026年07月
发表单位: 复旦大学智能机器人与先进制造学院,华东师范大学数据科学与工程学院
原文链接: https://arxiv.org/pdf/2607.28405
项目链接: https://quantwams.github.io

世界行动模型(WAM)最近在机器人圈子里可是香饽饽。这类模型把视频扩散世界模型和扩散动作专家结合,让机器人既能“想象”未来,又能“动手”执行。但问题来了——这玩意儿的计算开销和内存占用,简直是个无底洞。每个控制周期都要迭代去噪,还要闭环运行,部署到真实机器人上,硬件根本吃不消。
想给模型“减减肥”,后训练量化(PTQ)是条常规路径。可现有的PTQ方法,像是给GPT、给扩散模型设计的那些,拿到WAM上就集体水土不服。为啥?因为它们都基于两个错误的假设:一是用开环目标(比如困惑度、单帧重建)来优化,二是假设模型是同质的Transformer结构。可WAM呢?它是在闭环里跑的,一步量化误差会通过控制回路不断传播、放大;而且它的计算分布在耦合的双流MoT或者共享扩散骨干上,路径复杂得很。用一个静态的单流代理去校准,精度自然就偏了。
复旦大学的团队最近放了个大招,提出了QuantWAMs,一个专门为WAM量身定制的PTQ框架。核心思想很直接:量化决策的每个环节,都必须跟部署时的校准上下文对齐。这个上下文包括三个维度:模型结构(哪些模块能共享校准证据)、 rollout分布(在闭环可达的状态上做敏感性分析)和任务目标(用联合视频-动作梯度来分配精度)。
结果相当惊艳。在W4A4配置下,QuantWAMs在RoboTwin 2.0和LIBERO上的模拟成功率与FP16相差仅有0.2到0.7个百分点,峰值内存直接降到FP16的29%,还带来了1.4到1.6倍的块级加速。更硬核的是,他们还在AgiBot G2真机上试了试,三个任务、30次试验,成功率跟FP16基本持平。这波操作,属实是把量化玩明白了。

一个“老问题”的新战场:世界动作模型量化为什么难做?

先给不熟悉的朋友科普下背景。量化就是把模型里的高精度参数(比如FP16)用低精度(比如INT4)来表示,以此换取更小的内存占用和更快的推理速度。这招在LLM上已经玩得很溜了,像GPTQ、AWQ这些方法,能让大模型在几乎不掉点的情况下实现4bit部署。
但WAM不一样,它有两个“要命”的特性:
第一,闭环执行。WAM在部署时是闭环运行的,每一步生成的动作都会改变后续的观测状态。这意味着,早期步骤产生的量化误差,会被“喂”给后面的步骤,就像滚雪球一样越滚越大。你在开环校准集上测出来的误差很低,但跑在闭环里可能早就偏到姥姥家去了。
第二,异构耦合架构。无论是Fast-WAM的双流混合Transformer,还是LingBot-VA的共享扩散骨干,WAM内部都有视频和动作两条路径在交互。传统方法假设模型是同质的,校准一个流就当校准了全部,这显然会错失另一条路径的敏感度。
论文里把这个问题提升到了一个很本质的高度:每一个PTQ决策,本质都是部署前的一个有限样本估计,而这个估计的有效性取决于三个上下文——校准证据的池化范围(G)、测量时的状态分布(Db)、以及打分的任务目标(L)。这三点只要有一个在部署时不匹配,决策就可能翻车。
三位一体的校准原则,这就是QuantWAMs整个方法的立论基石。下面咱们就来看看,它具体是怎么把这三个维度落到实处的。

方法概述:三条策略对齐三种上下文

QuantWAMs的整体框架可以用一句话概括:在正确的粒度上做校准。它包含三个核心策略,分别对应前面提到的三种上下文:
1. 共享基异常校准(Shared-Basis Outlier Calibration):解决“结构上下文”失配问题。它明确了哪些模块可以安全地共享激活统计信息,避免在坐标不兼容的模块间乱合并。
2. 协同训练目标显著性(Co-Training-Objective Saliency):解决“任务目标”失配问题。它利用联合视频-动作梯度计算经验Fisher信息,在稳定的层粒度上分配权重精度。
3. 固定干预回放审计(Fixed-Intervention Rollout Auditing):解决“分布上下文”失配问题。它通过在FP16的闭环轨迹上施加固定的低精度干预,来修正去噪步的保护计划,而不是被有偏的敏感性峰值误导。
图2
图2:QuantWAMs概览。共享基校准仅在坐标兼容的模块间池化激活统计;协同训练引导的显著性使用联合视频-动作梯度分配精度;固定干预回放为耦合的视频和动作DiT块修正去噪步计划。
这三个策略之间是有严格的逻辑递进关系的。先通过结构分析划定可共享的“安全区”,再在安全区内用联合目标算重要性,最后用闭环回放动态调整保护计划。三者环环相扣,共同服务于一个目标:让每一个精度决策都落在正确的粒度上。

“坐标兼容”不是可选项:激活证据在什么条件下才能安全合并?

第一个策略,也是最硬核的一个,叫做共享基异常校准。它解决的是:在计算激活异常通道的Top-K掩码时,哪些层的数据可以合并在一起统计?
先看动机。WAM里有大量的线性层和注意力层,如果每层单独算统计量,在小样本校准集(论文里只用32条轨迹)下,估计出的Top-K通道掩码会很不稳定,噪声很大。如果把这些层合并起来一起统计,样本量变大了,估计更准,但风险是:如果两层的数据分布差异太大(比如一个是视频流,一个是动作流),硬合并反而会把精度带偏。
论文对这个问题的分析非常严谨,用了一个随机效应模型来刻画合并的风险。简单来说,对于每一对模块,用一个交叉公式来判断是单独估计好还是合并估计好。这个公式的关键是看模块间的真实差异(异质性)和模块内的采样噪声谁大谁小:
N < N* = σ² / τ² 时,合并更优;反之则单独估计更优。N是校准样本量,σ²是模块内采样方差,τ²是模块间异质性。如果τ²=0(模块间完全同质),那么合并永远更好。这个公式虽然是用一个理想化模型推导的,但它提供了一个非常清晰的决策准则,并且和后续的实验结果吻合得很好。
但光有这个准则还不够,还有一个更前置的问题:“坐标兼容性(Coordinate Admissibility)”。意思很简单,两个模块能合并的前提是,它们的通道索引代表的是同一个物理含义。比如在Fast-WAM里,共享值路径(shared value pathway)对齐了成对的输出投影,它们的坐标是兼容的,可以合并。但专家私有的残差流(expert-private residual streams),虽然可能维度相同,但含义完全不同,就不能跨专家合并Q/K/V的统计量。这个约束防止了“为了省事而盲目合并”带来的灾难。
图1d
图1:self_attn.o上的异常值演化。(a) 原始激活显示出持续的单通道异常值。(b) 联合平滑+Hadamard旋转将量级分散到各通道。(c) 低N下的逐上下文Top-K采样噪声会产生不稳定的掩码和较低的能量恢复。(d) QuantWAMs保留池化能量Top-K通道在FP16中,并将其他通道量化为A4。
图1非常直观地展示了这个策略的必要性。图1(a)里,原始激活有明显的逐通道异常值;图1(b)经过平滑和旋转后,量级被分散了;图1(c)显示,如果用低采样(低N)的逐上下文Top-K,掩码很不稳定,恢复的能量也低;而图1(d)的QuantWAMs方法,通过在正确粒度上池化证据,得到的掩码更稳定,恢复的能量也更高。

权重精度不由单一模态决定:联合视频-动作梯度如何决定哪些层升比特

确定了哪些激活可以共享统计量之后,下一个问题是:哪些权重层应该升级到更高的精度(比如从W4升到W8)?
传统方法,比如GPTQ,用二阶信息来补偿量化误差;SmoothQuant则用激活感知的缩放。但它们大多是针对单一模态的目标设计的。WAM不一样,它天生就有两个目标:视频预测损失ℓ_v和动作预测损失ℓ_a。在训练时,这两个损失是加权联合优化的。
QuantWAMs的做法很直接:使用联合损失下的经验Fisher信息。在对角近似下,联合Fisher信息与“事后融合”版本的差异正好是2λ_v λ_a E[g_v ⊙ g_a]。这个交叉项捕捉的是视频和动作损失对同一层权重的协同敏感性——某些层只有同时影响两个任务时才显得关键。
通过Kronecker分解的经验Fisher近似,可以算出某个层在比特数b下的量化失真D_L(b)。然后,把层升级(从b_lo到b_hi)的收益定义为B_L = D_L(b_lo) − D_L(b_hi)。在预算约束下,通过一个简单的0/1背包或贪心选择,挑出Top 20%的层升级精度。
值得注意的是,虽然联合Fisher信息是在训练目标上做梯度计算,但这只是一个PTQ步骤——不需要更新权重,只需一次前向和反向传播。

去噪步保护也要“亲测有效”:固定干预回放如何修复虚假敏感峰

扩散模型做PTQ时有一个常识:不同去噪步的激活分布差异很大,所以需要做时间步级别的敏感度分析,挑出最“脆弱”的去噪步给予更多保护。在WAM里,这个问题变得更棘手——因为每一步去噪后生成的动作会改变下一轮控制循环里机器人的观测,进而改变后续所有去噪步的输入分布。
如果用合成数据(synthetic inputs)来测敏感度,测出的分布根本不是闭环可达状态;如果用真实闭环状态但在当前保护计划下测量,又会陷入“自掩蔽”——某个步已经被保护了,测出来自然不敏感。论文的解决方案是固定干预回放(Fixed-Intervention Replay):把FP16模型跑出来的完整闭环轨迹记录下来,然后在每个去噪步上施加同一个固定的低精度干预(即所有目标模块都用低精度q₀),再对比低精度和全精度模型的输出差异。
再通过分布偏移诊断Δ_prof(t),对比FP16参考轨迹和全低比特滚动轨迹上的回放敏感度,就能发现哪些去噪步的敏感度是被“虚假峰值”误导的。论文强调,这个诊断只是一步的局部指标,不能直接换算成闭环任务收益;它只用来提议修复一个已有的K步保护计划,而不改变精度水平或预算。

模拟分数几乎无损、真实机器人可部署:量化世界模型的边界与启示

方法功底扎实,最终还是要拿实验数据说话。论文选择了两种架构差异明显的WAM实现:Fast-WAM(双流混合Transformer)和LingBot-VA(共享骨干模型),并在RoboTwin 2.0和LIBERO两个模拟基准以及AgiBot G2真机上做了全面评估。
实验设置的严谨程度值得单独夸一嘴。论文把数据分成四个不相交的角色:PTQ拟合集(32条轨迹)、回放剖面集(32条闭环轨迹)、时间表验证集、最终测试集。三个随机种子42/43/44下,每个方法都独立重跑全部拟合和选择流程,最终在完全相同的测试初始状态上做对比。这种协议避免了“在校准集上偷看测试结果”的隐患。
图3a
图3:池化(Pooling)能降低有限样本风险并提高恢复能量。相比逐上下文Top-K,池化后的统计量在低样本区间的掩码更稳定。
*表格超出部分左右可以滑动
方法 精度 RoboTwin Clean↑ RoboTwin Random↑ RoboTwin Average↑ Speedup↑ LIBERO Long↑ Mem. (GB)↓
Full PrecisionFP1691.9±0.291.8±0.691.9±0.31.0×95.2±0.414.4
GPTQW4A1691.2±0.390.6±0.690.9±0.41.2×95.1±0.65.5
SmoothQuantW8A891.6±0.391.0±0.491.3±0.31.4×94.8±0.57.2
SVDQuantW4A463.8±0.758.4±1.061.1±0.81.6×72.3±1.03.6
AtomW4A471.5±0.771.9±0.871.7±0.61.6×75.2±0.93.8
QuantWAMsW4A491.8±0.291.6±0.591.7±0.31.4×95.0±0.44.2
表1:Fast-WAM在RoboTwin 2.0和LIBERO上的量化结果(节选)。QuantWAMs在W4A4下的RoboTwin平均分91.7%,与FP16仅差0.2个百分点;而SVDQuant和Atom分别掉了30.8和20.2个百分点。
在LingBot-VA上,QuantWAMs在LIBERO-Long上达到98.0%,与FP16的98.5%只差0.5个百分点,而同类方法的降幅普遍在17个百分点以上。
在真机实验中,QuantWAMs在AgiBot G2上完成了三个操作任务,30次试验的成功率与FP16基本持平。这至少证明了W4A4量化不是只能在模拟器里自嗨,而是真的能放进闭环控制器里跑起来的。
为什么QuantWAMs能在W4A4下做到几乎无损?关键就在于它把三个上下文的失配问题逐一补齐。共享基校准让Top-K掩码在有限样本下更稳定;联合目标显著性把比特预算投到了真正同时影响视频和动作性能的层上;固定干预回放修正了去噪步保护计划中的虚假峰值。每个决策都在正确的粒度上,误差自然不会累积到任务层面。
图3b
图3(续):池化后的Top-K掩码显著提升了低样本下的能量恢复,验证了结构上下文对齐的必要性。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

WAM到底是什么?和世界模型有什么区别?WAM(World Action Model)是“世界模型+动作专家”的联合体,它同时预测未来的视频观测和对应的机器人动作。传统世界模型只负责“想象未来”,动作由单独的策略网络给出;WAM则把两部分放在一起联合训练和推理,好处是视频预测能给动作决策提供更丰富的结构先验。

W4A4具体指什么?W4A4表示权重(Weight)和激活(Activation)都用4bit量化。整篇论文里QuantWAMs不只是简单地把所有层压到4bit,它会对部分关键层升级到8bit。综合下来,权重平均位数是0.8×4 + 0.2×8 = 4.8bit,但论文仍然称其为W4A4主导的配置。

为什么闭环误差传播比开环严重那么多?开环场景里,每一步推理是独立的,误差不会跨样本传导;闭环场景里,每一步推理的输入都包含上一步的输出,量化误差会被状态转移矩阵不断放大。论文里给出了一个一阶近似公式δs_{j+1} = A_j δs_j + B_j ε_j,下游任务影响取决于转移雅可比矩阵的连乘,而不是单步误差本身。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把PTQ的三个决策重新抽象到“结构、分布、目标”三个上下文维度,并给出了数学化的池化切换条件和联合Fisher公式,不是简单的工程调参,而是提供了一个新的思考框架。但没有引入全新的网络或训练范式,故扣一星。

实验合理度:★★★★★

三种随机种子、四组角色完全不相交的数据分离、真机和模拟双重验证,对比方法包括SVDQuant、Atom等当前最强PTQ工具,对比设置公平且严格。还特意区分了LingBot-VA缺失的LIBERO套件并标为N/A,没有硬凑结果。

学术研究价值:★★★★☆

这是第一篇系统讨论WAM量化问题的论文,明确了PTQ上下文对齐的数学框架,对后续机器人基础模型的模型压缩研究有很强的借鉴意义。

稳定性:★★★★☆

在三种随机种子下重现性良好,RoboTwin和LIBERO上的方差都在0.5个百分点以内。但只验证了两个WAM架构和一个真机平台,对于更广泛的WAM变体稳定性还未知。

适应性以及泛化能力:★★★★☆

方法适用于双流和共享骨干两种主流WAM设计,且RoboTwin/LIBERO/真机三类场景都覆盖到了。但不同任务间的泛化(跨任务校准)尚未验证。

硬件需求及成本:★★★★☆

W4A4配置下峰值内存降为FP16的29%,块级推理提速1.4-1.6倍,整体硬件友好度很高。但PTQ流程本身需要额外的梯度和前向计算,校准阶段开销略高。

复现难度:★★★★☆

论文提供了项目主页,且承诺发布代码;公式推导和应用细节都在附录中写得很详细。但需要先跑通Fast-WAM和LingBot-VA两个基座模型,环境搭建有一定门槛。

产品化成熟度:★★★★☆

真机验证已经证明了在真实机器人上部署的可行性,内存和速度也达到边缘设备初步要求。但要大规模产品化,还需要更广泛的场景覆盖和更稳定的国产芯片适配。

可能的问题:论文的校准流程依赖预训练时的联合损失,如果拿不到原始训练目标(比如只拿到发布权重),联合Fisher这一套就转不动了。此外,32条轨迹的校准集在任务分布极广的场景下可能不够用。


主要参考文献

[1] Yuan et al. Fast-WAM: A dual-stream mixture-of-transformers world action model. 2026.
[2] Li et al. LingBot-VA: Shared-backbone world action model for robotic manipulation. 2026.
[3] Chen et al. RoboTwin 2.0: A large-scale dual-arm manipulation benchmark. 2025.
[4] Liu et al. LIBERO: Benchmarking knowledge transfer for lifelong robot learning. NeurIPS 2023.
论文原文:https://arxiv.org/pdf/2607.28405
项目主页:https://quantwams.github.io

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
机器人想要跑得快,量化部署是关键!QuantWAMs 让世界行动模型在4bit下也能精准操控。想第一时间获取更多量化、部署、机器人的前沿解读?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 具身智能+上海+复旦+龙哥),根据格式备注,可更快被通过且邀请进群。🚀
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。