阿里联合港科大新作UNIGP:一张图同时搞定生成和感知
这篇论文最有意思的地方,不是“能做很多任务”,而是它真把生成和感知这对老冤家塞进了同一个扩散框架里,还尽量不把原本的生成先验搞丢。DUGP 这招“只复制图像分支”的思路很克制,实验也说明它不是花架子。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,不是“能做很多任务”,而是它真把生成和感知这对老冤家塞进了同一个扩散框架里,还尽量不把原本的生成先验搞丢。DUGP 这招“只复制图像分支”的思路很克制,实验也说明它不是花架子。
扩散模型最怕的不是算力,而是数据里混进来的“脏样本”。这篇论文很实在:不改大结构,只把去噪损失换成散度诱导的加权形式,就把鲁棒性做出来了。
长视频重光照最烦的不是“能不能变亮”,而是“每一块都别自己演戏”。这篇 NVIDIA 新作把问题改写成跨块连续翻译,再加暖启动提示,思路很工程,也很实用。
像素空间自回归一直有个尴尬:输入和输出都在“高维泥潭”里打滚,越滚越脏。PRA的思路很实在,直接把难题拆成“先降维、再并行近似 rollout”,还顺手把生成和理解一起往前推了一步。
病理图像合成最烦的不是“生成”,而是“生成得像且结构还对”。CHIS偏偏把这两个最难缠的问题拆开处理,还做成了训练自由插件,省掉了不少标注和微调成本。
Home3D 1.0 不是单纯“把图变成 3D”,而是把家具商品化这件事拆成几道硬菜:几何、纹理、材质、部件,各管一摊。最有意思的是,它把“可编辑”放到了和“像不像”同等重要的位置,这才像真正面向设计和电商的方案。
训练看起来很“正经”,推理却偷偷跑偏,这就是 Flow Matching 里最烦人的暴露偏差。DEFAR 的思路很妙:不把偏差当噪声硬压,而是把它当反馈信号,让模型自己学会纠偏。
这篇论文最有意思的地方,不是“又做了一个归因器”,而是直接把目光从生成结果挪到了去噪器本身。8个扩散模型里,哪怕是共享VAE、共享骨干的近亲,SDS 也能把它们分开,实用性很强。
这篇论文不盯生成结果,专门盯去噪器“怎么去噪”。结果很狠:只靠前向推理,就能把八个扩散模型的“出身”分得明明白白,连共享同一类自编码器的近亲版本也不太好糊弄。
这篇论文把“写报告”这件事拆成了两步:先把医生的自由文本洗成结构化标签,再让模型按规矩自动生成。别看它是医学场景,思路其实很通用,尤其适合那些“数据不多、标签还乱”的硬核任务。
57维灵巧手动作不是“大一点的控制”这么简单,传统把动作一把压成向量的做法,在这里开始露怯了。本文把动作拆成结构化 token,再配上局部+全局注入和语义分支,思路很清楚,效果也确实能打。
这篇工作把“数据不够”这件事,硬生生掰成了“先切块、再渐进长大、最后整图开画”的扩散生成流程。更有意思的是,它不只会造图,还顺手把中间特征拿去做分割,属于一套模型干两份活。😀
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球