← 返回 PaperDaily 视觉与图像

字节等发布RGBA视频生成新作:跳过35%透明token,1.2倍提速画质不降

游戏行业离不开RGBA动画,但“先生成RGB再抠图”的老路子,一到半透明边缘就翻车。字节联合北大清华带来一个反直觉方案:既然alpha本身就是可见性信号,那干脆用它来跳过计算——用2.4K个游戏资产视频训练RGBA生成器,1.2倍提速,FVD 174.4,质量几乎无损。

字节等发布RGBA视频生成新作:跳过35%透明token,1.2倍提速画质不降
原论文信息如下:
论文标题:
Alpha as an Efficiency Signal: Visibility-Routed RGBA Image-to-Video Generation
发表日期:
2026年8月
发表单位:
北京大学、字节跳动、清华大学
原文链接:
https://arxiv.org/pdf/2608.09355v1.pdf
在游戏行业,RGBA视频几乎是所有动画资源的“标准格式”。它在RGB三通道外增加一个alpha通道记录透明度,让角色动画能无缝合成到任意背景上。没有alpha,特效合成就是一场噩梦。
长期以来,业界主流是先生成RGB视频,再抠图(matting)。这个思路有致命缺陷:一旦背景色混入前景像素,抠图模型就几乎无法还原干净的前景色——特别是头发丝、发光特效、运动模糊这些半透明区域,抠图结果不是闪烁就是糊成一团。而这些“软区域”恰恰是判断游戏资产能否直接复用的关键。
另一条路线是让模型直接生成RGBA视频。但现有方法也有瓶颈:TransPixeler把alpha作为额外token拼接,注意力计算量从(L+L)²膨胀到(L+2L)²;TransText把alpha图拼到空间画布旁,破坏了预训练模型的原始数据分布;Wan-Alpha把RGB和alpha融合到一个latent里,但依然对所有token一视同仁。
本文提出了一个反直觉的思路:既然alpha通道本身就是在告诉模型“哪些区域最终不会出现在画面里”,那为什么不用它来跳过不必要的计算呢?换句话说,让alpha从“输出的结果”变成“加速推理的信号”。

游戏资产动画的RGBA生成难题

本文研究的是参考图条件下的RGBA图像到视频生成:给定一张RGBA参考图和一句文本描述,模型需要同时生成前景RGB和时序一致的alpha通道。这是一个直接面向游戏资产生产线的任务。
为什么难?核心在于半透明。RGBA合成公式 C = α×前景色R + (1−α)×背景色B 看似简单,但正是这个公式,让“先生成再抠图”在数学上就是不适定问题——多个不同的(前景色, α)组合可能产生完全相同的合成结果。背景一旦混入,alpha就难以精确还原。
更棘手的是,现有RGBA视频数据集严重偏向写实人像和VFX特效,游戏资产类内容极度匮乏。VideoMatte240K有484条人类视频剪辑,Wan-Alpha有429条人类/VFX剪辑,LayerDiffuse虽规模达100万张图像但纯图像级、没有运动信息。游戏行业最常见的“角色+装备+特效”组合在这些数据集里几乎找不到。
技术选型上,alpha怎么“进”模型是关键。作者比较了三种方案:TransPixeler把alpha token额外拼接进序列,注意力矩阵从(L+2L)²规模扩张;TransText把alpha图平铺到空间维度,改变了token几何结构;本文采用Wan-Alpha的合并latent方案(Merged RGB-A VAE)——RGB和alpha通过轻量融合模块M合并成16通道的latent,不增加任何DiT token,也不改变预训练模型的输入接口。这个选择直接决定了后续效率优化的上限。

可见性路由:让alpha通道成为效率信号

这篇论文最核心的洞察在于一个简单的数学事实。根据RGBA合成公式,最终画面的颜色对前景色的偏导数恰好等于alpha:∂C/∂R = α。这意味着,如果某个区域的最终alpha是0,那么无论前景RGB是什么,都不会对合成结果产生任何影响
这个道理放到扩散模型的去噪流程里就很有文章可做。扩散模型的推理需要多步去噪,每一步都要让DiT处理所有token。如果能在早期步骤就判断出哪些token最终会是全透明的,那后面几步这些token的DiT更新是不是就可以直接跳过?
公式6
公式(6)中,合成颜色对前景RGB的偏导就是α;当α≈0时,前景RGB的误差就不会传导到合成结果里——这就是“可见性路由”在数学上成立的根基。
但这里有一个关键的工程挑战:如何“提前”知道哪些token的最终alpha会是0?本文的做法是训练一个逻辑回归probe——一个轻量级分类器,在训练视频的密集去噪轨迹上离线拟合,把每个token的2×2×16 latent patch映射成64维特征,再输出透明度logit。判断标准是:某个token在它的时空区域内的最大解码后alpha不超过阈值η=0.05,就认为它“最终透明”。
为了降低预测错判的风险,路由策略设计得相当保守:预测为“不透明”的前景支持区域会向外做膨胀处理(空间半径r_s=2,时间半径r_t=1),第一帧始终强制保留;如果候选路由token占比不足10%,或者不确定性token占比超过15%,整个样本直接退回密集路径。这些安全机制在设计上就考虑到了“游戏资产运动会导致前景扩张”的情况。
图1:可见性路由的RGBA推理流程
图1展示了完整的可见性路由推理框架。(a)部分展示了整体流程:第1-2次评估处理所有token,第2次评估之后,路由器基于当期干净估计x̂₀预测前景支持区域并加保护边距,其余token进入路由;第3-4次评估只更新激活token,同时用x₀-lock机制推进路由token的状态,被新前景覆盖的token会被重新激活并合并解码。(b)部分展示了x₀-lock核心思想:被路由的token不再经过DiT,而是沿着全局噪声调度对应的直线流匹配插值路径,朝第2步时存储的端点移动。(c)部分是Cache-KV实现:被路由的token在第2步时缓存其KV值,后续稀疏步骤中激活token的query可以继续查询这些缓存的KV,而路由token的query、输出投影和FFN计算全部省略。
这里的x₀-lock机制值得单独拿出来说。跳过DiT更新之后,被路由token的latent状态应该怎么演化?本文的解法是:在第2步时,把模型对每个路由token的干净估计x₀,j*存下来。后面每一步,这些token沿着直线流匹配插值路径前进:v = (x_k − x₀*)/σ_k。这个速度向量保持恒定,token的状态在全局噪声调度下被精确地“传输”到对应的噪声水平。
公式7
公式(7)中,v^(lock)_k,j表示第k次评估时token j的锁定速度,x^(lock)_k,j是路由token第k次评估时的latent状态,x₀*,j是第2次评估时存储的端点。在x₀-lock机制下,路由token的新状态就等于存储端点x₀*,j加上按σ比例缩放的当前噪声残差——整个过程不需要任何DiT推理。
此外,除了Cache-KV这种实现方式之外,本文还提供了Drop-KV变体:直接丢弃路由token的KV缓存,换取消去对缓存KV的注意力计算。两者都不改变DiT的4步去噪调度和骨干网络参数,因此可以与步进蒸馏等技术正交叠加。表格3中的结果显示,Cache-KV在35%初始路由比例下,实现了1.21倍骨干加速,且FVD仅从174.4微升至175.4,几乎没有质量损失;Drop-KV则通过牺牲略微多的指标换取额外加速。
表3:路由消融实验
表3是路由消融实验的完整结果。RAS(基于更新幅度的代理)、Planner(静态规划)、Union2D(2D联合估计)和Random(随机选择)都在匹配了实际跳过数量的条件下进行对比。可以看到,Ours(Cache-KV)在同等计算量下取得了最低的FVD(175.4)和最低的MAD(110.2),明显优于其他选择策略;Drop-KV用更高的FVD换取了1.28倍的更快速度。值得注意的是,RAS虽然Alpha-Edited FVD还不错,但MAD明显偏高;Planner(即静态第一帧策略)的表现则验证了论文的核心观点——静态视图无法预测未来的运动变化。

GameAlpha-2.4K:高质量游戏RGBA数据集构建

有了方法还不够,训练数据是另一个大问题。作者在论文中直言,现有RGBA视频数据集要么是写实人像,要么是VFX特效,游戏资产的覆盖几乎为零。更关键的是,直接拿现成游戏视频去抠alpha会遇到和两阶段管线一样的问题:RGB里已经混入了背景信息,抠图怎么抠都不干净。
本文的策略是在生成阶段就“约束”出适合抠图的RGB,而不是事后补救。具体来说,先用一个固定的高容量文生图模型在空背景上合成1920×1920的参考图,然后用VLM检查构图、属性、背景污染和外部阴影;每个拒绝项都会转化为文本提示的“修复指令”,重新生成最多三次。只有通过VLM检查的参考图才会进入视频生成环节。
在得到生成的RGB视频后,alpha的恢复也不是用一个模型一次搞定。由于不同抠图模型对硬边界、细结构、运动模糊和部分透明等情况的擅长点各不相同,作者同时跑了三个alpha假设:BiRefNet(逐帧抠图,用光流做时间稳定化)、SAM3(视频分割)和MatAnyone2(视频抠图),然后用一个多模态评估器比较合成结果的完整性、背景泄漏、软边界和时间稳定性,每个clip选择一条完整的alpha序列。这样做的好处是避免在帧级别切换抠图器导致的时间不连续。
数据质量控制远不止于此。每个生成阶段都有对应的“质量门”,且每个门都在问题还可以修复的时候起作用:参考图门可以重新生成图像;原始视频门避免在残缺clip上跑三个抠图器;抠图选择门通过合成结果比较完整假设;最后的VLM+人工审计检查主题一致性、动作、方向、装备、风格和时间稳定性。整个流程中产生的规律性失败和类别不均衡会反过来更新下一批次的采样权重——形成了如图4所示的闭环数据生产管线。
图4与表4:GameAlpha-2.4K构建流程与采样分类树
图4展示了完整的数据集构建管线:分布控制的提示采样(阶段1)→ 适合抠图的参考图合成与修复循环(阶段2)→ 通过审核的RGB参考图驱动视频合成与原始视频门(阶段3)→ 三条alpha假设生成与基于合成效果的比较选择(阶段4)。红色的反馈边表示持续的失败反馈会更新下一批次的采样规则。表4则列出了完整的采样分类树,覆盖实体、装备、动作、风格和视角五个维度。
最终产出的GameAlpha-2.4K数据集包含2400个游戏资产动画clip,约23.28万帧,视频分辨率960×960,涵盖70种实体、35种动作组合。图5展示了数据构建的“漏斗”:从3000个初始采样元组,到最终2395个通过所有质量门的clip,每个环节都有明确的淘汰率。与现有数据集相比,GameAlpha-2.4K的帧数是VideoMatte240K的约0.97倍,但clip数量是其近5倍,多样性优势明显。
图5:GameAlpha-2.4K数据构建漏斗
图5是GameAlpha-2.4K的构建漏斗:从3000个提议元组出发,经过参考图质量门(移除34个)、视频质量门(移除13个)、抠图质量门(移除10个)和最终帧安全检查(移除567个边缘接触问题的产物),最终得到2395个可接受的clip(训练2156个、验证239个)。
表2:RGBA生成与视频抠图训练数据对比
表2将现有的RGBA生成和视频抠图训练数据与GameAlpha-2.4K做了对比。可以看到,与VideoMatte240K(484个clip、人类主题)、Wan-Alpha(429个clip、人类/VFX)、TransVDM(约1万clip、物体)相比,GameAlpha-2.4K在clip数量上遥遥领先(2400个),且专注于游戏资产这一此前空白领域。

实验验证:质量与效率的双重突破

实验部分有哪些硬核结论?先看最主要的对比:与“先生成RGB再抠图”两阶段管线的全面比较。作者将三种主流I2V生成器(Wan2.1-I2V-14B、CogVideoX1.5-I2V、HunyuanVideo-I2V)与四种alpha提取器(BiRefNet、MatAnyone2、SAM3、UniVidX)配对,组成了12个两阶段baseline。所有生成器都使用相同的624×640白色背景参考图、输出97帧;本文方法额外使用RGBA latent锚点。
表1:两阶段生成后抠图对比
表1的结果非常直观:本文模型在所有生成器中取得了最低的FVD(174.4,而最接近的Wan+BiRefNet为224.3)和最低的端到端推理时间(104.8秒对比Wan系最快的126.7秒)。MAD方面,本文的108.1×10⁻³低于所有Wan和HunyuanVideo管线,虽然CogVideoX系有几个组合获得了更低的MAD,但它们的FVD严重偏高(316以上 vs 本文174.4)。DINO-ID方面,本文的0.840与最优的0.849差距很小,但换来的是其他所有指标的全面优势。简单说——比本文快的没本文质量好,比本文质量接近的没本文运动平滑。
主观视觉对比是什么样的?图2和图15-16给出了不同两阶段baseline的定性比较结果。以图2为例,每个组展示RGBA参考图(左)和两个方法各四个时间帧。从图中可以看到,两阶段baseline(上方)在角色边缘特别是半透明区域会出现明显的alpha溢出或收缩,而本文方法(下方)保持了更干净的前景边缘和更稳定的alpha通道。
图2:与两阶段baseline的定性对比
图2展示的是与两阶段baseline的定性对比结果。每一组包含RGBA参考图(左)以及两阶段baseline(上排)和本文模型(下排)在相同时间索引下的四个采样帧。棋盘格图案表示透明区域。可以看到两阶段方法在角色的半透明边缘(如飘动布料、光影过渡区域)容易产生粗糙的alpha边界或细节丢失,而本文单阶段方法生成的alpha保持更干净的前景边缘和更稳定的通道结构。
效率方面的核心数据是什么?在验证集上,第2次评估后的初始路由比例平均为35%,最终在第3-4次评估中实际跳过约35%的token计算,带来约1.2倍的DiT骨干加速。图13给出了质量-计算量边界曲线:随着要求的路由比例从10%逐步提升到70%,横轴显示实际跳过的token比例也相应增加,FVD则呈抛物线状:在35%的初始路由比例下,FVD从密集推理的174.4略升至175.4,几乎持平;继续增加路由比例到45%时FVD保持在176.2附近;直到路由比例超过60%,FVD才明显攀升到180以上。这说明可见性路由在相当宽的计算-质量权衡区间内都有着优秀的表现。
图13:质量与计算量的边界曲线
图13展示的是部署中Cache-KV路由器的质量-计算量边界曲线(验证集,n=239):蓝色圆点为带局部重新激活的Cache-KV,虚线为相同97帧棋盘格合成FVD协议下的密集推理。标签标注的是请求的路由比例,横轴则是第3-4次评估中实际跳过的token评估比例。可以看到在35%路由比例下,FVD与密集推理几乎持平(约175.4 vs 174.4),说明跳过大量透明token确实几乎不损害生成质量。
还有一个细节值得注意:图10和图11从两个角度验证了“早期预测透明token是可行的”。图10显示,probe对“最终透明度”的预测AUC从第1次评估的0.9863迅速上升到第2次的0.9952,接近第4次评估的0.997;而同一步解码alpha的读数从第1次评估起就稳定在0.997以上。这说明模型对alpha的估计本身是可信的,早期预测的误差主要来自“信念漂移”,而不是probe的读取失败。
图10:token透明度早期可读性分析
图10展示了token透明度的早期可读性分析结果(probe基于训练轨迹拟合,在48条验证轨迹上评估,每次评估187.2万个token):蓝色曲线为probe分数对最终透明度标签的预测能力,珊瑚色虚线为同一probe对同一步解码alpha的预测能力,竖直线标记路由点k=2。可以看到同一步读数从第1次评估起就保持在0.9974-0.9981的高位,而最终透明度预测从第1次的0.9863上升到第2次的0.9952后趋于平稳。

局限与未来展望

这篇论文有没有局限?当然有。作者在论文中也坦诚地指出了一些值得注意的问题。
首先,GameAlpha-2.4K数据集的规模仍然有限。虽然2400个clip在游戏资产领域已经是最大规模,但对于训练一个14B参数的DiT模型来说,这个数据量还是偏少。作者用了DoRA(一种参数高效微调方法)来缓解这个问题,但这本质上是一种妥协——如果真的想把这个模型做成通用游戏资产生成器,数据规模可能需要再大一个数量级。
其次,可见性路由的适用范围依赖“透明区域占比”。如果前景物体充满了整个画面(比如一个占满屏幕的游戏角色特写),透明token的比例会很低,路由的加速效果就会大打折扣。第3节中10%的密集回退阈值保证了这个路由策略“不会更慢”,但也没有额外的收益。
另外,跨域泛化能力还没有充分验证。作者在VideoMatte240K上做了跨域评估,但总体上模型还是以游戏资产为主。写实人物、自然场景中的半透明物体(玻璃、水面)表现如何,论文中提供的证据有限。
未来方向上,作者提到两个很有潜力的点:一是把可见性路由与步进蒸馏(step distillation)结合,毕竟路由策略不改变去噪调度,理论上完全兼容;二是将路由策略推广到其他“输出可预测”的生成任务——比如背景生成、后期特效合成,在这些场景下“哪些区域最终不会出现在画面里”同样是一个先验可知的信号。龙哥认为,把“任务本身的物理约束”转化为“效率优化信号”这个思路,其意义可能不亚于这篇论文的RGBA生成成果本身。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对游戏资产RGBA视频生成中数据稀缺与两阶段抠图不稳定的问题,本文构建GameAlpha-2.4K数据集,训练参考图像条件的RGBA视频生成器,一次推理同时输出RGB与alpha;并提出可见性路由器在去噪后期跳过透明token,
这篇工作最值得看的点是什么?在GameAlpha-2.4K验证集上,所提方法获得最低FVD(174.4)和最快推理时间(104.8s),优于所有两阶段基线;在VideoMatte240K跨域评估中也取得最佳FVD和MAD。
这篇工作的边界或风险在哪里?优点:1) 首次将alpha通道作为效率信号用于推理路由,创新性强;2) 构建了高质量的GameAlpha-2.4K数据集;3) 单阶段联合生成RGB和alpha,避免两阶段方法的误差累积;4) 路由机制与现有加速技术正交兼容。缺点:1) 二进制路由仅针对完全透明token,对前景密集片段的加速有限;2) 路由错误仍然存在;3) 数据集仅2.2%的中间透明度像素,对半透明物体的泛化能力有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将alpha通道从生成目标反转为效率信号,用解析合成判据指导token路由,这一思路在RGBA视频生成领域确实新颖,跳出了“模型输出→后处理”的惯性框架。

实验合理度:★★★★☆

12个两阶段baseline覆盖了3种生成器×4种抠图器,消融实验包含5种路由策略和两种KV实现,对比面相当充分。扣一星是因为部分对比(如UniVidX)端到端耗时过高,实际可比性打折;且全文的最优路由配置是在验证集上通过风险-收益分析选择的,存在一定的选择偏差风险。

学术研究价值:★★★★☆

“任务的物理约束可以转化为效率信号”这一方法论具有跨任务普适性,对视频生成、图像编辑、3D渲染等方向都有启发意义。GameAlpha-2.4K数据集填补了游戏资产RGBA数据的空白,也会是后续研究的重要资源。

稳定性:★★★☆☆

第3节的路由回退阈值(<10%候选或>15%不确定)提供了安全兜底,但probe是离线训练并在推理时冻结的,如果测试数据分布发生变化,路由质量可能下降。此外,路由后token经过x₀-lock推进,与密集路径token在语义一致性上的稳定性还需要更大规模验证。

适应性以及泛化能力:★★★☆☆

游戏资产领域表现出色,跨域到写实视频(VideoMatte240K)时,FVD相对两阶段管线仍有优势但MAD优势缩小,说明半透明物体(尤其是玻璃、水面等非人物对象)的泛化还需要更多数据支撑。路由策略在“透明区域占比低”的场景(如全屏特写)中加速收益有限。

硬件需求及成本:★★★☆☆

14B参数量的DiT训练需要32卡GPU节点跑不到一天,这个训练成本对于大厂来说可接受,但对高校或小团队门槛偏高。推理时跳过35%token带来的1.2倍加速虽然实在,但和蒸馏、量化等成熟加速手段相比幅度不算激进。

复现难度:★★★☆☆

GameAlpha-2.4K数据集计划公开但尚未发布,代码同样未开源。数据集的构建管线相当复杂(涉及文生图、VLM审核、三个抠图器、光流稳定化、VLM+人工终审),完整复现工作量极大。不过核心思路可以在现有工具链上以简化形式验证。

产品化成熟度:★★★☆☆

对游戏资产动画生产场景,本文已展示出接近可用的质量,1.2倍加速对批量生产也有实际价值。但要在游戏工业流水线中落地,还需要解决两个问题:一是生成时长的稳定性(本文104.8秒/97帧,实时性不足),二是对特定IP角色的细粒度控制(当前只有参考图+文本的条件方式)。

可能的问题:核心方法虽然新颖,但路由的加速幅度(1.2倍)相对于其带来的系统复杂度提升,在工程上是否值得推广仍存疑;跨域和跨任务泛化证据薄弱;数据集虽然是空白领域的第一块拼图,但未公开前的可验证性受限。

融会贯通

结合PaperDaily已收录论文的同基准实验数据,可以对本文的RGBA生成定位做一个辅助判断。在GameAlpha-2.4K验证集上,本文模型FVD为174.4,在两阶段baseline中表现最好的Wan+BiRefNet为224.3,领先幅度约22%;在VideoMatte240K上,本文模型相对两阶段也有FVD优势。需要说明的是,这些都只是PaperDaily已收录论文范围内的辅助判断,GameAlpha-2.4K是本文新提出的数据集,此前没有任何公开模型在该基准上有可查记录,且不同论文的split与setting可能存在差异,因此不宜将其上升为全领域绝对结论。
更值得关注的,是这篇论文在方法论层面给整个生成式AI领域带来的启发。当生成任务的输出本身带有“可预测的结构信息”(比如alpha通道)时,这些信息完全可以反哺推理效率。顺着这个思路延伸,图像编辑中的编辑掩码、深度估计中的深度图、3D生成中的法线贴图……每一个都是潜在的效率信号。这种“输出即路由”的范式,或许会比“通用token加速”走得更远。

主要参考文献

[1] Li Z, Qiao H, Xu Z, et al. Alpha as an Efficiency Signal: Visibility-Routed RGBA Image-to-Video Generation. arXiv preprint arXiv:2608.09355, 2026.
[2] Wang R, et al. TransPixeler: Text-to-video generation with RGBA assets. 2025.
[3] Dong Z, et al. Wan-Alpha: Merged-latent RGBA video generation. 2025.
[4] Lin S, et al. VideoMatte240K: Benchmarking video matting. 2021.
[5] Liu Y, et al. RAS: Routing by update magnitude in diffusion transformers. 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
AI视频生成卷出新高度,RGBA动画一镜到底还能1.2倍提速?想第一时间读懂前沿论文,跟龙哥一起拆解干货,欢迎加入『龙哥读论文』粉丝群!扫描下方二维码或添加龙哥助手微信号:kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),更快通过审核哦~目前群内有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5大方向等你来聊!
wechat_helper

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。