实验部分有哪些硬核结论?先看最主要的对比:与“先生成RGB再抠图”两阶段管线的全面比较。作者将三种主流I2V生成器(Wan2.1-I2V-14B、CogVideoX1.5-I2V、HunyuanVideo-I2V)与四种alpha提取器(BiRefNet、MatAnyone2、SAM3、UniVidX)配对,组成了12个两阶段baseline。所有生成器都使用相同的624×640白色背景参考图、输出97帧;本文方法额外使用RGBA latent锚点。表1的结果非常直观:本文模型在所有生成器中取得了最低的FVD(174.4,而最接近的Wan+BiRefNet为224.3)和最低的端到端推理时间(104.8秒对比Wan系最快的126.7秒)。MAD方面,本文的108.1×10⁻³低于所有Wan和HunyuanVideo管线,虽然CogVideoX系有几个组合获得了更低的MAD,但它们的FVD严重偏高(316以上 vs 本文174.4)。DINO-ID方面,本文的0.840与最优的0.849差距很小,但换来的是其他所有指标的全面优势。简单说——比本文快的没本文质量好,比本文质量接近的没本文运动平滑。主观视觉对比是什么样的?图2和图15-16给出了不同两阶段baseline的定性比较结果。以图2为例,每个组展示RGBA参考图(左)和两个方法各四个时间帧。从图中可以看到,两阶段baseline(上方)在角色边缘特别是半透明区域会出现明显的alpha溢出或收缩,而本文方法(下方)保持了更干净的前景边缘和更稳定的alpha通道。图2展示的是与两阶段baseline的定性对比结果。每一组包含RGBA参考图(左)以及两阶段baseline(上排)和本文模型(下排)在相同时间索引下的四个采样帧。棋盘格图案表示透明区域。可以看到两阶段方法在角色的半透明边缘(如飘动布料、光影过渡区域)容易产生粗糙的alpha边界或细节丢失,而本文单阶段方法生成的alpha保持更干净的前景边缘和更稳定的通道结构。效率方面的核心数据是什么?在验证集上,第2次评估后的初始路由比例平均为35%,最终在第3-4次评估中实际跳过约35%的token计算,带来约1.2倍的DiT骨干加速。图13给出了质量-计算量边界曲线:随着要求的路由比例从10%逐步提升到70%,横轴显示实际跳过的token比例也相应增加,FVD则呈抛物线状:在35%的初始路由比例下,FVD从密集推理的174.4略升至175.4,几乎持平;继续增加路由比例到45%时FVD保持在176.2附近;直到路由比例超过60%,FVD才明显攀升到180以上。这说明可见性路由在相当宽的计算-质量权衡区间内都有着优秀的表现。图13展示的是部署中Cache-KV路由器的质量-计算量边界曲线(验证集,n=239):蓝色圆点为带局部重新激活的Cache-KV,虚线为相同97帧棋盘格合成FVD协议下的密集推理。标签标注的是请求的路由比例,横轴则是第3-4次评估中实际跳过的token评估比例。可以看到在35%路由比例下,FVD与密集推理几乎持平(约175.4 vs 174.4),说明跳过大量透明token确实几乎不损害生成质量。还有一个细节值得注意:图10和图11从两个角度验证了“早期预测透明token是可行的”。图10显示,probe对“最终透明度”的预测AUC从第1次评估的0.9863迅速上升到第2次的0.9952,接近第4次评估的0.997;而同一步解码alpha的读数从第1次评估起就稳定在0.997以上。这说明模型对alpha的估计本身是可信的,早期预测的误差主要来自“信念漂移”,而不是probe的读取失败。图10展示了token透明度的早期可读性分析结果(probe基于训练轨迹拟合,在48条验证轨迹上评估,每次评估187.2万个token):蓝色曲线为probe分数对最终透明度标签的预测能力,珊瑚色虚线为同一probe对同一步解码alpha的预测能力,竖直线标记路由点k=2。可以看到同一步读数从第1次评估起就保持在0.9974-0.9981的高位,而最终透明度预测从第1次的0.9863上升到第2次的0.9952后趋于平稳。
[1] Li Z, Qiao H, Xu Z, et al. Alpha as an Efficiency Signal: Visibility-Routed RGBA Image-to-Video Generation. arXiv preprint arXiv:2608.09355, 2026.[2] Wang R, et al. TransPixeler: Text-to-video generation with RGBA assets. 2025.[3] Dong Z, et al. Wan-Alpha: Merged-latent RGBA video generation. 2025.[4] Lin S, et al. VideoMatte240K: Benchmarking video matting. 2021.[5] Liu Y, et al. RAS: Routing by update magnitude in diffusion transformers. 2025.