← 返回 PaperDaily
视觉与图像
阿里联合港科大新作UNIGP:一张图同时搞定生成和感知
这篇论文最有意思的地方,不是“能做很多任务”,而是它真把生成和感知这对老冤家塞进了同一个扩散框架里,还尽量不把原本的生成先验搞丢。DUGP 这招“只复制图像分支”的思路很克制,实验也说明它不是花架子。
龙哥读论文
发布于 2026-08-19 00:20:05
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文最有意思的地方,不是“能做很多任务”,而是它真把生成和感知这对老冤家塞进了同一个扩散框架里,还尽量不把原本的生成先验搞丢。DUGP 这招“只复制图像分支”的思路很克制,实验也说明它不是花架子。
原论文信息如下:
图像生成与理解之争终于和解?
扩散模型这几年最火的事,早就不只是“画图好看”了。更有意思的是,它开始被拿去做“看图”——深度估计、法线估计、结构条件生成,样样都想沾一点。问题也很现实:生成模型擅长“想象”,感知模型擅长“测量”,这两位老兄凑一块,常常不是互相成就,而是互相拆台。
这篇 UNIGP 的思路,核心就一句话:别把生成和感知硬塞成两个完全独立的系统,试着让它们在同一个扩散 transformer 里共存,还尽量别把生成先验搞丢。 听起来像“既要又要”,但作者没有靠玄学,直接拿结构设计和训练策略硬顶。
如果只看演示图,UNIGP 像是在做一件很“不讲武德”的事:同一个模型,既能画图,又能补深度和法线,还能在条件控制下生成更贴合结构的图像。真正厉害的地方不在于“能做很多”,而在于它尽量没有把原本强大的生成能力弄坏。扩散模型最怕的就是一顿微调后,生成还没变强,先把老本行忘了,这种“学会新技能,忘掉旧本事”的现象,论文里也直指其害。
先说人话版。以往这类方法大致分两派:一派是控制生成 ,比如给深度图、边缘图、姿态图,让模型照着画;另一派是做感知 ,比如把扩散模型改成深度估计器、法线估计器。前者偏“画”,后者偏“看”。UNIGP 想做的是:把这两种能力放进一个框架里,让它们共享扩散模型的世界知识。
这里先解释几个缩写。DiT 是 Diffusion Transformer ,中文可理解为“扩散 transformer”;MMDiT 是 MultiModal Diffusion Transformer ,即“多模态扩散 transformer”;DUGP 是 Disentangled Unified Generation and Perception ,中文可译为“解耦式统一生成与感知分支”。这三个词是全文的骨架,后面所有设计都围着它们转。
这个框架的关键不是“多接几个头”这么简单,而是把任务分成了两类:一类负责让生成结果受条件控制,另一类负责从输入中读出几何信息。也就是说,UNIGP 并不是把深度、法线、图像都当成同一种东西粗暴处理,而是承认它们分布不同、目标不同,再用统一的扩散训练把它们串起来。这个姿势很像做菜时不再把所有食材一锅乱炖,而是先分清主菜、配菜和调味料。
UNIGP 最有意思的地方,落在 DUGP 上。面对“要不要复制整个 backbone”的老问题,作者没有选最土豪的方案。JointNet 那种做法,是把整个网络复制一份,参数和算力都往上翻,效果还不一定稳;Marigold 那类做法则是直接微调 backbone,结果常常是感知能力上来了,生成先验却被洗掉一层。UNIGP 选了个更克制的办法:只复制 MMDiT 的图像分支,不动文本分支,也不动主 backbone 的生成能力。
这招为什么有道理?因为在 MMDiT 里,文本分支主要负责语言条件,真正承载视觉分布的是图像分支。既然深度、法线这些东西本质上也是视觉世界的一部分,那就没必要把整个模型全盘复制。DUGP 进一步拆成三个部分:条件补丁器、堆叠控制层、堆叠感知层。条件补丁器先把条件输入变成 token;控制层负责让条件影响生成;感知层则专门做几何读出。最关键的一点来了:在感知层中,作者切断了对主 backbone 的加性更新路径 ,这样密集预测的梯度就不会反过来改写生成 backbone 的参数。说白了,就是“你可以借我的眼睛看世界,但别顺手把我的脑子改了”。
这里还要提一个很实用的点:多条件输入时,UNIGP 不是把推理时间线性乘上条件数,而是通过序列拼接在一次前向里完成交互。这个设计不算花哨,但很工程化。很多论文喜欢把“支持多条件”写得像宇宙级能力,结果一落地就发现算力账单先爆炸。UNIGP 至少在这件事上没有装。
这部分是 UNIGP 最值得看的地方。很多统一框架都喜欢讲“多任务互补”,但真到实验里,经常是互补没看见,互相拖后腿倒是很明显。UNIGP 的 ablation 结果说明,这次不是嘴上互补,而是确实有机制支撑的。
先看生成帮感知。生成任务学到的是更丰富的纹理、物体形状和世界先验,这些信息会反哺深度和法线估计,让感知结果不至于只剩“平滑大白板”。再看感知帮生成。感知任务学到的是空间边界、几何约束和结构一致性,这些会让条件生成更听话,不会出现“深度图让它别越界,它偏要把草地画进手里”的情况。作者把这种关系总结得很直白:感知训练让生成更严格,生成训练让感知更细腻。
更妙的是,作者没有把这个结论停留在“感觉上更好”,而是直接用消融实验去验证。去掉感知训练,条件图像的边界就容易糊;去掉生成训练,深度和法线又会变得过于平滑,细节像被橡皮擦抹过。这个结果很符合直觉:感知任务逼模型尊重空间结构,生成任务逼模型学会真实世界的纹理和局部变化。两个任务放一起,才像一个完整的视觉系统,而不是只有“会画”或者只有“会算”。
实验部分的结论很直接:UNIGP 不是“什么都能做一点”的样子货,而是在多个任务上都能拿出像样结果。尤其值得注意的是,它用的训练数据并不离谱,感知部分只有约 5.9 万样本,生成部分约 100 万样本,却能在联合生成、可控生成、深度估计、法线估计上都站住脚。这种表现,至少说明它不是靠堆数据把结果糊出来的。
先看联合生成。表1里,UNIGP 的 FID 更低、CLIP 更高,同时 GD 和 GN 也明显更优。这里的 GD 是 Generated Depth RMSE ,即“生成深度均方根误差”;GN 是 Generated Normal RMSE ,即“生成法线均方根误差”。简单说,作者先用一个专家模型把生成图像重新估计出伪深度和伪法线,再和模型直接生成的几何结果做 RMSE 对比,数值越低,说明 RGB 和几何越对得上。这个指标设计挺聪明,因为它不只看图像好不好看,还看“图像和几何是不是同一回事”。
再看可控生成。UNIGP 在深度到图像、法线到图像这类任务里,RMSE 压得很低,说明它不是“差不多像”,而是“真的对齐了”。对比一些只做单条件控制的方法,UNIGP 还能处理更多条件类型,而且并没有因为统一框架而丢掉文本一致性。这一类结果很能说明问题:模型如果真学到了几何约束,它生成出来的东西就不会只是语义对了,空间也会对。
深度和法线结果更能说明 UNIGP 的价值。它不是靠把感知任务“单独训到极致”来拿分,而是在很少感知数据的前提下,借助生成 backbone 的先验,把零样本泛化能力做得很能打。尤其是和那些从头训练、数据量动辄几千万的回归模型相比,UNIGP 的数据效率相当亮眼。说白了,它不像一个从零开始死记硬背的学生,更像一个已经见过很多世界、再回来补几道题的老练选手。
从图5这种可视化结果里也能看出,UNIGP 的优势不是某一个角落的“局部最优”,而是整体稳定。可控生成里,条件贴合更严;感知里,边缘和结构更细;联合生成里,RGB、深度、法线之间更一致。这个“统一”不是把任务强行混在一起,而是让不同任务在同一潜空间里互相补课。
如果把表7和前面的结果放一起看,UNIGP 的设计逻辑就更清楚了:不是盲目堆分支,而是把“该复制的复制、该冻结的冻结、该隔离的隔离”。这类做法听起来朴素,但工程上很值钱。毕竟真正能落地的统一模型,往往不是最复杂的那个,而是最知道哪里该省、哪里不能省的那个。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“生成”和“感知”长期分家带来的浪费。以前要么单独做控制生成,要么单独做深度/法线估计,UNIGP 试图在一个扩散 transformer 里同时学两类分布,并且尽量保住原本强大的生成先验。
GD 和 GN 是什么,为什么要单独造这两个指标? GD 是生成深度 RMSE,GN 是生成法线 RMSE。它们不是看图像是否好看,而是看生成的 RGB 与生成的几何结果是否一致,专门用来衡量联合生成里的跨模态结构对齐。
DUGP 为什么只复制图像分支,不复制整个 backbone? 因为 MMDiT 里真正承载视觉分布的是图像分支。只复制图像分支可以大幅减少参数和算力,同时通过感知层的梯度隔离,避免密集预测任务把生成先验“洗掉”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
UNIGP 的创新不在“提出了一个很玄的新范式”,而在于把统一生成与感知这件事做得更克制、更工程化。只复制图像分支、感知层梯度隔离、统一数据路由,这些设计拼起来,确实比常见的“堆模块”更像能落地的方案。
实验合理度: ★★★★☆
对比方法覆盖了控制生成、联合生成、深度估计、法线估计四条线,且既看定量也看定性,还补了消融。唯一要注意的是,不同基线背后的训练数据和 backbone 不完全一致,结论更适合看“整体趋势”而不是死抠单点。
学术研究价值: ★★★★☆
这篇工作对统一视觉建模的研究价值不低,尤其说明了生成先验和感知监督并不是天然冲突,关键在于怎么隔离、怎么共享、怎么训练。它给后续“统一多模态视觉任务”的论文提供了一个很实用的参考模板。
稳定性: ★★★☆☆
单模型多任务听起来很香,但真实部署里仍要面对任务切换、条件缺失、数据分布偏移等问题。论文结果说明它比很多统一框架稳,但要直接上产品,还得看更复杂场景下是否会互相干扰。
适应性以及泛化能力: ★★★★☆
零样本深度和法线结果都挺能打,说明它不是只会背训练集。尤其在 ETH3D 这类更复杂数据上仍能保持不错表现,泛化能力值得肯定。
硬件需求及成本: ★★★☆☆
训练时需要 16 张 A800,成本不低;但推理端只保留一个统一框架,且没有把整个 backbone 复制一遍,算是把“训练贵”尽量变成“推理别太贵”。
复现难度: ★★★☆☆
思路不算特别难抄,但要复现到位,数据统一、条件路由、梯度隔离、不同任务的采样策略都得对齐。好在项目页已给出,整体比“只在附录里讲一句”的论文友好。
产品化成熟度: ★★★☆☆
在统一内容生成、结构控制、几何感知这类场景里有潜力,但距离通用产品还差一截。主要卡点在多任务冲突、数据偏差和高算力需求,适合先做垂直场景试点。
可能的问题: 统一框架的上限仍受数据混合质量和任务冲突影响,且训练成本不低;更重要的是,当前结果主要证明“能统一、能提升”,但离大规模稳定部署还需要更强的鲁棒性验证。
主要参考文献
Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu. UNIGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception. arXiv:2606.30332v1, 2026.
项目主页:guoqincode.github.io/UniGP
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
UNIGP这类“生成+感知”统一模型,最适合在群里继续拆:方法怎么省参数、先验怎么保住、实验到底值不值。