← 返回 PaperDaily 视觉与图像

阿里联合港科大新作UNIGP:一张图同时搞定生成和感知

这篇论文最有意思的地方,不是“能做很多任务”,而是它真把生成和感知这对老冤家塞进了同一个扩散框架里,还尽量不把原本的生成先验搞丢。DUGP 这招“只复制图像分支”的思路很克制,实验也说明它不是花架子。

阿里联合港科大新作UNIGP:一张图同时搞定生成和感知
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是“能做很多任务”,而是它真把生成和感知这对老冤家塞进了同一个扩散框架里,还尽量不把原本的生成先验搞丢。DUGP 这招“只复制图像分支”的思路很克制,实验也说明它不是花架子。


原论文信息如下:
论文标题:
UNIGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception
发表日期:
2026年06月
发表单位:
The Hong Kong University of Science and Technology, DAMO Academy, Alibaba Group, Zhejiang University, Tsinghua University, The Chinese University of Hong Kong, Zeekr Automobile R&D Co., Ltd.
原文链接:
https://arxiv.org/pdf/2606.30332v1.pdf
项目链接:
guoqincode.github.io/UniGP

图像生成与理解之争终于和解?

扩散模型这几年最火的事,早就不只是“画图好看”了。更有意思的是,它开始被拿去做“看图”——深度估计、法线估计、结构条件生成,样样都想沾一点。问题也很现实:生成模型擅长“想象”,感知模型擅长“测量”,这两位老兄凑一块,常常不是互相成就,而是互相拆台。
这篇 UNIGP 的思路,核心就一句话:别把生成和感知硬塞成两个完全独立的系统,试着让它们在同一个扩散 transformer 里共存,还尽量别把生成先验搞丢。听起来像“既要又要”,但作者没有靠玄学,直接拿结构设计和训练策略硬顶。
封面
图1:UNIGP 统一扩散 transformer 框架,一套模型同时支持文本生成图像、深度、法线联合生成,联合深度与法线估计,以及任意条件下的文本到图像生成。
如果只看演示图,UNIGP 像是在做一件很“不讲武德”的事:同一个模型,既能画图,又能补深度和法线,还能在条件控制下生成更贴合结构的图像。真正厉害的地方不在于“能做很多”,而在于它尽量没有把原本强大的生成能力弄坏。扩散模型最怕的就是一顿微调后,生成还没变强,先把老本行忘了,这种“学会新技能,忘掉旧本事”的现象,论文里也直指其害。

统一框架UNIGP:用一张图搞定生成与感知

先说人话版。以往这类方法大致分两派:一派是控制生成,比如给深度图、边缘图、姿态图,让模型照着画;另一派是做感知,比如把扩散模型改成深度估计器、法线估计器。前者偏“画”,后者偏“看”。UNIGP 想做的是:把这两种能力放进一个框架里,让它们共享扩散模型的世界知识。
这里先解释几个缩写。DiTDiffusion Transformer,中文可理解为“扩散 transformer”;MMDiTMultiModal Diffusion Transformer,即“多模态扩散 transformer”;DUGPDisentangled Unified Generation and Perception,中文可译为“解耦式统一生成与感知分支”。这三个词是全文的骨架,后面所有设计都围着它们转。
图2:UNIGP整体框架
图2:UNIGP 框架。输入可以是 RGB 图、深度图、法线图,也可以是随机条件和文本提示;经过 VAE 编码和加噪后,RGB、深度和法线的潜变量进入 backbone,条件潜变量进入 DUGP 的条件补丁器;随后 token 级拼接,再经过控制层和感知层,最后由 backbone 生成 RGB,由 DUGP 生成深度和法线。
这个框架的关键不是“多接几个头”这么简单,而是把任务分成了两类:一类负责让生成结果受条件控制,另一类负责从输入中读出几何信息。也就是说,UNIGP 并不是把深度、法线、图像都当成同一种东西粗暴处理,而是承认它们分布不同、目标不同,再用统一的扩散训练把它们串起来。这个姿势很像做菜时不再把所有食材一锅乱炖,而是先分清主菜、配菜和调味料。

DUGP分支:一招“复制粘贴”保留大模型核心能力

UNIGP 最有意思的地方,落在 DUGP 上。面对“要不要复制整个 backbone”的老问题,作者没有选最土豪的方案。JointNet 那种做法,是把整个网络复制一份,参数和算力都往上翻,效果还不一定稳;Marigold 那类做法则是直接微调 backbone,结果常常是感知能力上来了,生成先验却被洗掉一层。UNIGP 选了个更克制的办法:只复制 MMDiT 的图像分支,不动文本分支,也不动主 backbone 的生成能力。
图3:设计范式对比
图3:代表性设计范式对比。UNIGP 只复制 MMDiT 的图像分支来建模额外视觉分布,同时保留 backbone 的通用先验;JointNet 风格会复制整个 backbone,计算量更重;Marigold 风格则直接微调 backbone,容易遗忘生成先验。
图4:DUGP初始化方式
图4:MMDiT 模块与 DUGP 初始化方式。左侧虚线框是 MMDiT,包含独立的文本分支和图像分支;右侧虚线框是 DUGP,通过复制 MMDiT 的图像分支初始化。
这招为什么有道理?因为在 MMDiT 里,文本分支主要负责语言条件,真正承载视觉分布的是图像分支。既然深度、法线这些东西本质上也是视觉世界的一部分,那就没必要把整个模型全盘复制。DUGP 进一步拆成三个部分:条件补丁器、堆叠控制层、堆叠感知层。条件补丁器先把条件输入变成 token;控制层负责让条件影响生成;感知层则专门做几何读出。最关键的一点来了:在感知层中,作者切断了对主 backbone 的加性更新路径,这样密集预测的梯度就不会反过来改写生成 backbone 的参数。说白了,就是“你可以借我的眼睛看世界,但别顺手把我的脑子改了”。
这里还要提一个很实用的点:多条件输入时,UNIGP 不是把推理时间线性乘上条件数,而是通过序列拼接在一次前向里完成交互。这个设计不算花哨,但很工程化。很多论文喜欢把“支持多条件”写得像宇宙级能力,结果一落地就发现算力账单先爆炸。UNIGP 至少在这件事上没有装。

从互补中获益:生成与感知如何“互相成就”?

这部分是 UNIGP 最值得看的地方。很多统一框架都喜欢讲“多任务互补”,但真到实验里,经常是互补没看见,互相拖后腿倒是很明显。UNIGP 的 ablation 结果说明,这次不是嘴上互补,而是确实有机制支撑的。
先看生成帮感知。生成任务学到的是更丰富的纹理、物体形状和世界先验,这些信息会反哺深度和法线估计,让感知结果不至于只剩“平滑大白板”。再看感知帮生成。感知任务学到的是空间边界、几何约束和结构一致性,这些会让条件生成更听话,不会出现“深度图让它别越界,它偏要把草地画进手里”的情况。作者把这种关系总结得很直白:感知训练让生成更严格,生成训练让感知更细腻。
图6:生成与感知关系的消融研究
图6:生成与感知关系的消融研究。紫色框标出了对比区域;加入感知训练后,生成结果会更严格贴合条件边界;加入生成训练后,感知结果会获得更丰富的细节。
更妙的是,作者没有把这个结论停留在“感觉上更好”,而是直接用消融实验去验证。去掉感知训练,条件图像的边界就容易糊;去掉生成训练,深度和法线又会变得过于平滑,细节像被橡皮擦抹过。这个结果很符合直觉:感知任务逼模型尊重空间结构,生成任务逼模型学会真实世界的纹理和局部变化。两个任务放一起,才像一个完整的视觉系统,而不是只有“会画”或者只有“会算”。

超越专家模型:统一框架的强势性能一览

实验部分的结论很直接:UNIGP 不是“什么都能做一点”的样子货,而是在多个任务上都能拿出像样结果。尤其值得注意的是,它用的训练数据并不离谱,感知部分只有约 5.9 万样本,生成部分约 100 万样本,却能在联合生成、可控生成、深度估计、法线估计上都站住脚。这种表现,至少说明它不是靠堆数据把结果糊出来的。
表1:联合生成结果对比
表1:联合生成对比。UNIGP 在联合生成任务上取得更低的 FID、更高的 CLIP 分数,并把几何一致性指标 GD、GN 压到更低,说明图像质量和结构一致性都没有掉链子。
先看联合生成。表1里,UNIGP 的 FID 更低、CLIP 更高,同时 GD 和 GN 也明显更优。这里的 GD 是 Generated Depth RMSE,即“生成深度均方根误差”;GN 是 Generated Normal RMSE,即“生成法线均方根误差”。简单说,作者先用一个专家模型把生成图像重新估计出伪深度和伪法线,再和模型直接生成的几何结果做 RMSE 对比,数值越低,说明 RGB 和几何越对得上。这个指标设计挺聪明,因为它不只看图像好不好看,还看“图像和几何是不是同一回事”。
表2:可控生成结果对比
表2:五种空间条件下的可控生成结果。UNIGP 在深度、法线、边缘、草图、姿态等条件上都保持了较强的文本一致性和结构约束,且多项指标优于控制类基线。
再看可控生成。UNIGP 在深度到图像、法线到图像这类任务里,RMSE 压得很低,说明它不是“差不多像”,而是“真的对齐了”。对比一些只做单条件控制的方法,UNIGP 还能处理更多条件类型,而且并没有因为统一框架而丢掉文本一致性。这一类结果很能说明问题:模型如果真学到了几何约束,它生成出来的东西就不会只是语义对了,空间也会对。
表3:零样本深度估计对比
表3:零样本仿射不变深度估计结果。UNIGP 在多个数据集上接近或达到强回归模型的水平,尤其是在 ETH3D 等更复杂场景中表现更稳。
表4:零样本法线估计对比
表4:零样本表面法线估计结果。UNIGP 在法线任务上明显优于多数生成式基线,并且接近强回归模型 DSINE。
深度和法线结果更能说明 UNIGP 的价值。它不是靠把感知任务“单独训到极致”来拿分,而是在很少感知数据的前提下,借助生成 backbone 的先验,把零样本泛化能力做得很能打。尤其是和那些从头训练、数据量动辄几千万的回归模型相比,UNIGP 的数据效率相当亮眼。说白了,它不像一个从零开始死记硬背的学生,更像一个已经见过很多世界、再回来补几道题的老练选手。
图5:定性结果对比
图5:可控生成、密集预测、联合生成和多条件联合生成的定性对比。UNIGP 在多个任务上都优于先前的扩散式专家模型和统一模型。
从图5这种可视化结果里也能看出,UNIGP 的优势不是某一个角落的“局部最优”,而是整体稳定。可控生成里,条件贴合更严;感知里,边缘和结构更细;联合生成里,RGB、深度、法线之间更一致。这个“统一”不是把任务强行混在一起,而是让不同任务在同一潜空间里互相补课。
表7:模型设计选择对比
表7:模型设计选择对比。不同统一网络范式都在同一个 SD3-Medium backbone 上实现,UNIGP 的 DUGP 设计在参数效率和效果之间更平衡。
如果把表7和前面的结果放一起看,UNIGP 的设计逻辑就更清楚了:不是盲目堆分支,而是把“该复制的复制、该冻结的冻结、该隔离的隔离”。这类做法听起来朴素,但工程上很值钱。毕竟真正能落地的统一模型,往往不是最复杂的那个,而是最知道哪里该省、哪里不能省的那个。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“生成”和“感知”长期分家带来的浪费。以前要么单独做控制生成,要么单独做深度/法线估计,UNIGP 试图在一个扩散 transformer 里同时学两类分布,并且尽量保住原本强大的生成先验。

GD 和 GN 是什么,为什么要单独造这两个指标?GD 是生成深度 RMSE,GN 是生成法线 RMSE。它们不是看图像是否好看,而是看生成的 RGB 与生成的几何结果是否一致,专门用来衡量联合生成里的跨模态结构对齐。

DUGP 为什么只复制图像分支,不复制整个 backbone?因为 MMDiT 里真正承载视觉分布的是图像分支。只复制图像分支可以大幅减少参数和算力,同时通过感知层的梯度隔离,避免密集预测任务把生成先验“洗掉”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

UNIGP 的创新不在“提出了一个很玄的新范式”,而在于把统一生成与感知这件事做得更克制、更工程化。只复制图像分支、感知层梯度隔离、统一数据路由,这些设计拼起来,确实比常见的“堆模块”更像能落地的方案。

实验合理度:★★★★☆

对比方法覆盖了控制生成、联合生成、深度估计、法线估计四条线,且既看定量也看定性,还补了消融。唯一要注意的是,不同基线背后的训练数据和 backbone 不完全一致,结论更适合看“整体趋势”而不是死抠单点。

学术研究价值:★★★★☆

这篇工作对统一视觉建模的研究价值不低,尤其说明了生成先验和感知监督并不是天然冲突,关键在于怎么隔离、怎么共享、怎么训练。它给后续“统一多模态视觉任务”的论文提供了一个很实用的参考模板。

稳定性:★★★☆☆

单模型多任务听起来很香,但真实部署里仍要面对任务切换、条件缺失、数据分布偏移等问题。论文结果说明它比很多统一框架稳,但要直接上产品,还得看更复杂场景下是否会互相干扰。

适应性以及泛化能力:★★★★☆

零样本深度和法线结果都挺能打,说明它不是只会背训练集。尤其在 ETH3D 这类更复杂数据上仍能保持不错表现,泛化能力值得肯定。

硬件需求及成本:★★★☆☆

训练时需要 16 张 A800,成本不低;但推理端只保留一个统一框架,且没有把整个 backbone 复制一遍,算是把“训练贵”尽量变成“推理别太贵”。

复现难度:★★★☆☆

思路不算特别难抄,但要复现到位,数据统一、条件路由、梯度隔离、不同任务的采样策略都得对齐。好在项目页已给出,整体比“只在附录里讲一句”的论文友好。

产品化成熟度:★★★☆☆

在统一内容生成、结构控制、几何感知这类场景里有潜力,但距离通用产品还差一截。主要卡点在多任务冲突、数据偏差和高算力需求,适合先做垂直场景试点。

可能的问题:统一框架的上限仍受数据混合质量和任务冲突影响,且训练成本不低;更重要的是,当前结果主要证明“能统一、能提升”,但离大规模稳定部署还需要更强的鲁棒性验证。


主要参考文献

Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu. UNIGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception. arXiv:2606.30332v1, 2026.
项目主页:guoqincode.github.io/UniGP

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
UNIGP这类“生成+感知”统一模型,最适合在群里继续拆:方法怎么省参数、先验怎么保住、实验到底值不值。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。