← 返回 PaperDaily
视觉与图像
PRA把像素自回归拉到新SOTA:135M反超1.9B
像素空间自回归一直有个尴尬:输入和输出都在“高维泥潭”里打滚,越滚越脏。PRA的思路很实在,直接把难题拆成“先降维、再并行近似 rollout”,还顺手把生成和理解一起往前推了一步。
龙哥读论文
发布于 2026-08-14 09:10:57
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 像素空间自回归一直有个尴尬:输入和输出都在“高维泥潭”里打滚,越滚越脏。PRA的思路很实在,直接把难题拆成“先降维、再并行近似 rollout”,还顺手把生成和理解一起往前推了一步。
原论文信息如下:
像素空间自回归模型生成高质量图像为什么难?
先把话说直白一点:像素空间自回归 这条路,看起来最朴素,实际上最容易“翻车”。它不走离散词表,也不靠外部 tokenizer,而是直接把图像切成一块块原始像素补丁,按顺序一个接一个地预测。理论上很优雅,像是把语言模型那套“接龙”直接搬到图像上;现实里却很容易变成“前面写歪一点,后面全跟着跑偏”。
这篇论文的判断很明确:像素空间自回归之所以难,不是单一问题,而是两个问题绑在一起了。第一个是输出难 ,因为每一步都要直接生成高维像素补丁,比如 16×16×3 的补丁就是 768 维连续向量,单步预测压力非常大;第二个是输入错 ,训练时模型看到的是干净的真实前缀,推理时看到的却是自己刚生成出来、带误差的前缀。一个负责“第一次写错”,另一个负责“把错一直传下去”,这组合拳很难受。
为了说明这件事为什么真有必要,论文先做了一个诊断实验。它把像素空间自回归和像素空间扩散模型 JiT 放到两个设置里比较:一个是低维补丁,一个是高维补丁,但两者自回归长度相同。结果很有意思:补丁维度一上去,自回归模型的 FID 明显崩得更厉害,而扩散模型相对稳一些。这说明问题不是“自回归天生不行”,而是“高维像素补丁 + 自回归反馈”这套组合太容易放大误差。
PRA如何双管齐下解决“输出难”和“输入错”?
这篇工作的核心方法叫Parallel Rollout Approximation,简称 PRA ,中文可以理解为“并行近似 rollout”。这里的 rollout,本质上就是让模型在推理时沿着自己的生成结果继续往下走,看看误差会怎么滚雪球。问题在于,真正做完整 rollout 太慢了,因为连续 token 的自回归采样本来就贵,再叠加多步采样,训练成本直接起飞。
PRA 的聪明之处在于,它没有傻乎乎地真的去做完整 rollout,而是做了一个“像 rollout,但不真的 rollout”的近似:输出上先降维,输入上再并行构造推理态 。前者让每一步预测更容易,后者让训练时看到的前缀更接近推理时的前缀。两边同时下手,像是给模型装了两个减震器。
先看输出侧。PRA 不直接让模型预测 768 维像素补丁,而是让它先生成一个更低维的中间状态 z。这个 z 不是拿现成 tokenizer 硬套出来的,也不是先训练一个外部 VAE 再接上去,而是端到端学出来的 。学到什么程度呢?学到这个 z 既要比像素补丁更容易生成,又要能被一个像素解码器还原回原始补丁。这样一来,AR 主干面对的是更轻的目标,但最终输出仍然是像素补丁,接口没有变味。
这里的关键是“中间状态”不是瞎压缩。论文里用的是一个目标编码器 gψ 和一个因果像素解码器 Dϕ 。前者负责把真实像素 token 和上下文信息映射成低维状态,后者负责把这个状态解回像素 token。为了避免编码器只偷看当前 token、把因果上下文忘得一干二净,论文还加了 token masking,让编码器不能太依赖局部捷径。这种设计的味道很像:别光背答案,要学会解题过程。
再看输入侧。训练时如果只喂干净前缀,模型会觉得世界很美好;一到推理,前缀变成自己生成出来的,质量参差不齐,模型就开始“认不出自己写的字”。PRA 的处理方式不是简单往像素上加噪,而是先在中间状态空间里采样一个扰动版本,再通过同一个像素解码器映射回像素空间,构造出推理态风格的像素输入 。这比直接给真实像素加独立噪声更像真实 rollout,因为误差是沿着“中间状态→像素”这条路径生成出来的,不是拍脑袋乱抖出来的。
这就是 PRA 名字里“Parallel”的含义:不是顺序采样一条长长的 rollout,而是对每个位置独立构造近似的推理输入,训练仍然保持并行。于是它既保住了训练效率,又让模型提前见识“自己生成自己”的后果。这个思路不花哨,但很工程化,属于那种真正知道训练成本有多贵的人才会写出来的设计。
PRA的具体实现:低维中间状态与并行近似Rollout
从实现流程看,PRA 其实是三件事串起来:先用自回归 Transformer 编码前缀,再用低维中间状态头生成下一步的状态,最后用像素解码器把状态还原成像素 token。训练时还有一条并行支路,专门构造“像推理一样”的输入。整个流程看起来不复杂,但每一步都在对准一个痛点。
论文里还专门讨论了输入构造的作用。表4和表5的思路是:只构造普通训练输入不够,只有把输入变得更像推理态,模型才会真正学会在“脏前缀”上工作。表4验证了并行构造的训练输入确实有帮助;表5进一步说明,在这个基础上再做更鲁棒的像素输入,会继续带来收益。这里最重要的不是某一个小技巧,而是一个整体判断:像素空间自回归的瓶颈是系统性的,不能拿单点补丁糊过去 。
1. 用真实像素补丁做 teacher forcing,得到前缀表示
2. 通过目标编码器 gψ 生成低维中间状态 z
3. 对 z 加扰动,再用像素解码器 Dϕ 还原出近似推理态的像素输入
4. 用这些重建输入再跑一遍自回归前向
5. 在中间状态空间上训练 flow head
6. 同时用像素重建损失约束解码器
7. 推理时按“生成中间状态 → 解码成像素 → 反馈前缀”的顺序逐步生成
这个流程的妙处在于,它没有把像素空间自回归改造成另一个完全不同的系统,而是尽量保留了原来的“pixel-in, pixel-out”接口。也就是说,外部看起来还是直接吃像素、吐像素,内部只是把难啃的地方换成了更容易学的中间状态。对于想做统一图像生成和理解的系统来说,这种接口很值钱。
实验效果:性能超十亿参数模型,还能做图像理解?
实验部分最有说服力的地方,不是“PRA 做到了不错的 FID”,而是它把性能、规模、接口统一性 三件事同时拉了上来。论文在 ImageNet-1K 256×256 类条件生成上做评估,主指标是 FID,辅以 IS。结果显示,PRA-S 只有 135M 参数,却已经把以前 1.9B 级别的像素空间自回归模型甩在后面;PRA-L 进一步把 FID 压到 1.94,成为像素空间自回归里的新 SOTA。
更有意思的是,PRA 不只在生成上表现好,在图像理解上也有额外收益。论文做了 ImageNet linear probing,也就是把生成训练好的 backbone 拿来做线性分类探针,看看表示是否真的有用。结果显示,PRA-L 的 top-1 准确率最好,说明这种像素空间自回归训练出来的表示,并不只是“会画图”,还带着一定的语义结构。
模型规模的配置也做得比较清楚。表7列出了不同规模下的层数、宽度、训练成本等信息,说明这不是一个“只在小模型上灵”的技巧,而是可以平滑扩展到更大规模的系统。更现实的一点是,PRA 仍然需要较重的训练资源,尤其是 400 epoch 的端到端训练和 100 步的推理采样,成本并不算轻松。但和它换来的质量相比,这个代价是可以理解的。
总结与思考:PRA的优缺点与未来改进方向
PRA 的价值,不在于它把像素空间自回归包装得更好看,而在于它把真正卡脖子的地方找准了:高维输出难、训练推理不一致、误差反馈累积 。它没有试图绕开像素空间,而是直接在像素空间里做减法:降维、解码、并行近似 rollout。这个路线很务实,也很像工程里最值钱的那类优化——不靠玄学,靠对症下药。
但它也不是没有代价。第一,推理阶段仍然是逐步自回归的,虽然内部状态更轻了,但整体采样链条并没有消失;第二,训练时引入了额外的像素解码器和并行重建支路,系统复杂度比纯 AR 更高;第三,实验主要集中在类条件 ImageNet,离更复杂的文本条件、开放域生成和多模态统一建模,还有一段路要走。也就是说,PRA 解决的是“像素空间自回归能不能更像样”,不是“所有图像生成问题从此都被解决了”。
未来如果继续往前推,比较值得期待的方向有三个。一个是把并行近似 rollout 做得更轻,减少训练时额外前向的成本;一个是把中间状态设计得更通用,看看能不能兼容文本条件或者更复杂的视觉任务;还有一个是把像素空间自回归和理解任务真正绑到一起,做成既能生成、又能识别、还能统一表示学习的模型。PRA 已经把门踹开了一条缝,后面能不能把门整个推开,还得看后续工作怎么接力。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是像素空间自回归图像生成里两个连在一起的痛点:高维像素补丁难生成,训练时又看不到推理时那种“带误差前缀”。PRA 用低维中间状态降低单步难度,再用并行近似 rollout 缩小训练推理差距。
rectified flow 是什么意思? 可以把它理解成一种连续生成方式:模型学习从噪声状态往目标状态走的方向,而不是直接把答案一次性猜出来。论文把它放在中间状态空间里,用来训练每一步的连续 token 生成。
它和普通 latent AR 有什么区别? 普通 latent AR 往往先有一个外部 tokenizer 或 autoencoder,再在潜空间里做自回归;PRA 的中间状态是端到端学出来的,而且最终仍然保持 pixel-in、pixel-out 的接口,不需要额外预训练 tokenizer。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 不是凭空发明新范式,而是把像素空间自回归最痛的两个点拆开处理,思路清楚,且有实打实的性能收益。
实验合理度: ★★★★☆ 诊断实验、主实验、消融实验链条完整,能解释为什么有效;但主要还是集中在 ImageNet,场景覆盖还不够广。
学术研究价值: ★★★★☆ 对“原生像素生成”这条线有明确推进作用,也给统一生成与理解提供了值得借鉴的接口设计。
稳定性: ★★★☆☆ 方法比纯 AR 更稳,但仍依赖较重的训练和多步推理,离“拿来即用”还有距离。
适应性以及泛化能力: ★★★☆☆ 在类条件 ImageNet 上表现很好,但对文本条件、开放域和多任务泛化还需要进一步验证。
硬件需求及成本: ★★★☆☆ 训练成本不低,推理还要走多步采样;比大模型堆参数更聪明,但绝不是轻量方案。
复现难度: ★★★☆☆ 结构不算离谱,但组件较多,训练细节和算力门槛都不低,复现需要一定工程能力。
产品化成熟度: ★★★☆☆ 适合作为研究型生成骨干或统一表示学习方向的候选,还不算直接能大规模落地的工业标准件。
可能的问题: 方法有效但系统较复杂,推理仍偏重,且验证场景主要是 ImageNet,离更广泛应用还差最后一公里。
主要参考文献
Xu J, He D, Ke G. Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation. arXiv:2606.27978v1, 2026.
论文原文:https://arxiv.org/pdf/2606.27978v1.pdf