← 返回 PaperDaily
视觉与图像
罗格斯大学最新研究:SSD让自回归图像生成速度狂飙13倍,复杂度从O(n²)降到O(n)!
从2026年6月的PathSpec到1月的COOL-SD,加速自回归图像生成的方法层出不穷,但都难逃1D序列的束缚。罗格斯大学这篇SSD彻底打破常规,让模型用“二维视野”同时看上下左右,把复杂度从O(n²)降为O(n),实现13倍加速,这波操作属实惊艳!
龙哥读论文
发布于 2026-08-21 00:20:08
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 从2026年6月的PathSpec到1月的COOL-SD,加速自回归图像生成的方法层出不穷,但都难逃1D序列的束缚。罗格斯大学这篇SSD彻底打破常规,让模型用“二维视野”同时看上下左右,把复杂度从O(n²)降为O(n),实现13倍加速,这波操作属实惊艳!
原论文信息如下:
视觉生成也有“空间思维”:SSD如何从二维视角加速自回归图像生成
自回归模型生成图像时,将二维图片拉成一维序列逐token推理,违背了视觉的二维局部性,导致“内存墙”瓶颈。罗格斯大学提出SSD(Spatially Speculative Decoding),发现视觉预测依赖是二维的——token不仅依赖左边,更依赖正上方。SSD放弃一维线性思维,让模型同时预测水平和垂直方向的后续token,一次性草拟整个空间块,再通过一次并行前向验证修正错误。生成速度飙升至13.3倍,复杂度从O(n²)降到O(n)。
作者通过“破坏实验”验证了预测依赖的二维本质:在Janus-Pro-7B生成中,将每行后半部分替换为随机token,只要正上方的token正确,被破坏的行仍保持视觉连贯性。这说明垂直预测依赖空间邻接而非一维距离。此前照搬NLP推测解码的方法(如1D-MTP、SJD)仅获1.8×到3.7×加速,因为它们死守一维序列,预测正下方token需跨越+48偏移量,精度急剧下降。SSD只训练两个局部草拟头集合——水平方向预测偏移量+1、+2、+3,垂直方向预测+48、+96、+144,充分利用二维空间近邻预测能力。
二维“预言术”:揭秘SSD的并行草拟与自动纠错机制
SSD工作流程分草拟和验证与自动纠错两个阶段。草拟阶段:模型完成当前行水平生成后,先用水平草拟头填满当前行剩余token,再用垂直草拟头利用整行信息并行预测下一行及后续所有token。同一列不同行token互不依赖,可并行预测整个行块,将每行解码代价从O(n)降为O(1),整图复杂度从O(n²)压缩到O(n)。
实验发现,在离散token空间做预测行不通——视觉码本分布平坦,精确匹配接受率不到5%。预测连续隐空间(Transformer最后一层RMSNorm归一化前的隐藏状态)效果更好,能生成有意义的图像结构。消融实验确认预测pre-norm状态(hpre)加上输入拼接token embedding(e)能达到最佳草拟质量。
验证与自动纠错阶段:模型将草拟token拼接到原始序列,做一次前向传播并行计算所有位置的真实分布。标准推测解码要求整块全部接受,但视觉token分布宽,整块匹配概率极低。SSD独立接受每个位置,对拒绝的token从残差分布重采样,利用验证输出自动修正。即使不验证(r=0),草拟结果已有合理布局;经过2轮验证(r=2),质量追平自回归基线,加速比仍达5.7×。对于多行草拟,采用分阶段验证:先对多行做基础修正,再逐行增量修正,质量更高。
速度飞跃13倍:SSD在三大主流模型上的性能实测
实验覆盖三个主流自回归视觉生成模型:Janus-Pro-7B(24×24网格,576 token)、Lumina-mGPT-7B(48×48,2304 token)、Emu3-8B(90×90,8100 token)。所有预训练骨干冻结,只训练轻量空间草拟预测头,训练数据很少:Janus-Pro用6万张,Lumina用2万张,Emu3仅5千张。生成质量用DPG-Bench和GenEval评估,速度报告加速倍数、绝对延迟和端到端加速比。
表1显示,1D-MTP加速2.0–2.4×但质量严重下降,SJD保持质量但仅加速1.5–2.9×。SSD在Emu3上延迟从339秒降到25.55秒,加速13.27×,得分仅从78.69略降到76.03;Lumina-mGPT上加速12.19×,质量略升;Janus-Pro上加速5.74×,质量几乎无损。GenEval上(表2),总体分略有下降,但考虑13×加速比,质量损失可接受。定性结果(图5)证实SSD生成图像在高倍加速下依然清晰。
加速比与网格大小正相关:Emu3的90×90网格获最大加速(13.28×),Janus-Pro的24×24网格仅5.74×。大网格中更多行可并行草拟和验证,验证前向传播成本相对更低。草拟头计算开销极低(图3),草拟240个token时开销低于0.1个AR步;验证开销随K增长缓慢(图4左),K=240时仅为单步AR的1.6倍,因为内存墙使参数加载时间占主导。
从O(n²)到O(n):SSD的几何突破与极致加速效果
SSD通过水平+垂直分解,将二维空间预测转化为两个一维问题,利用列独立并行性将整个行块草拟压缩为一次操作,理论上将复杂度从O(n²)降到O(n),实际实现13倍以上加速。SSD是即插即用模块,不修改预训练骨干,草拟头训练数据少,移除后原模型不变。这启示我们:处理视觉任务时,尊重数据固有几何结构比迁移语言模型经验更有效。
龙迷三问
SSD和之前提到的1D-MTP、SJD有什么区别?为什么它们加速效果差那么多? 1D-MTP只沿栅格扫描序列预测后续token,垂直方向在序列中距离远,长距离草拟头精度差且草拟块小。SJD基于雅可比迭代,没有学习草拟,速度上限约3×。SSD利用二维空间局部性,用极少的专用草拟头直接预测整个行块,配合验证自动纠错实现块级并行,加速可达10×以上。
为什么在离散token空间做草拟不行,但在隐空间就可以? 视觉码本有数万个条目,每个token概率分布平坦,精确匹配概率仅几个百分点。预测连续隐藏状态,目标为高维稠密向量,包含丰富语义和结构信息,Smooth L1损失提供稳定梯度,使草拟头学会预测正确视觉特征,再通过原始模型输出头解码出离散token。
SSD的训练过程是怎样的?需要多少数据? 采用自蒸馏训练:先用原始AR模型在Midjourney提示词上生成图像,得到配对数据。然后冻结原始模型,只训练轻量空间草拟头(水平+垂直共6个头),每个头包含SwiGLU层,输入为当前token隐藏状态和token embedding的拼接,输出预测的下一行或下一列隐藏状态,训练损失为Smooth L1损失。训练数据量很小:Janus-Pro用6万张,Lumina用2万张,Emu3仅需5千张。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★★
打破1D思维定势,提出2D空间草拟与验证自动纠错,是视觉自回归加速的里程碑式创新。
实验合理度: ★★★★☆
覆盖三个不同规模模型,对比基线全面,消融实验充分。但缺少与更多近期方法对比,且仅在一个GPU上测延迟。
学术研究价值: ★★★★★
将“尊重数据几何”引入推测解码,对后续多模态模型生成加速有很强启发意义。
稳定性: ★★★☆☆
高加速比下质量略有下降,自动纠错依赖验证轮次调节,需针对不同模型调优。
适应性以及泛化能力: ★★★★☆
在三个不同架构模型上均有效,训练数据量小,泛化性好。但未测试更大模型或视频/3D生成任务。
硬件需求及成本: ★★★★☆
训练成本极低,推理计算量远小于标准AR。但验证需额外前向传播,对显存带宽要求较高。
复现难度: ★★★★☆
论文公开了训练数据生成流程和超参数,但未开源代码,需自行实现草拟头和验证逻辑。
产品化成熟度: ★★★☆☆
可作为插件集成到现有管线,训练成本低,加速显著。但不同分辨率需重新训练草拟头,自动纠错轮次需手动调整。
可能的问题: 缺少与更先进Jacobian方法及扩散蒸馏方法的对比;质量下降的定量分析不够深入;多行草拟调度策略对结果敏感。
主要参考文献
[1] Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao. SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation. arXiv:2606.20543, 2026.
[2] Leviathan, Y., Kalman, M., Matias, Y. Fast inference from transformers via speculative decoding. ICML 2023.
[3] Chen, X., et al. Janus-Pro: A unified multimodal autoregressive model. 2025.
[4] Esser, P., Rombach, R., Ommer, B. Taming transformers for high-resolution image synthesis. CVPR 2021.
[5] Sun, Z., et al. Lumina-mGPT: A generalist transformer for vision generation. 2025.
[6] Sun, Q., et al. Emu3: A unified autoregressive model for vision and language. 2025.
[7] Ghazvininejad, M., et al. Speculative Jacobi decoding for parallel text generation. 2024.
[8] Xiao, G., et al. Multitoken prediction improves efficiency for autoregressive image generation. 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
你的自回归模型还在龟速画图吗?SSD告诉你“二维思维”才是王道!想和龙哥一起,在图像生成加速这个赛道上飙车吗?快来加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像生成+上海+复旦+龙哥) ,根据格式备注,可更快被通过且邀请进群。