5张人脸见证:GAN引导扩散PSNR提升4.40dB
GAN快但不够稳,扩散稳但太磨叽,这俩能不能别打架、搭个伙?本文给出了一个简单又实用的答案:把冻结的WGAN-GP中间特征当“导师”,用交叉注意力喂给扩散U-Net,在CelebA人脸去噪上直接涨了4.40dB。方法不复杂,但对混合范式感兴趣的读者值得一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
GAN快但不够稳,扩散稳但太磨叽,这俩能不能别打架、搭个伙?本文给出了一个简单又实用的答案:把冻结的WGAN-GP中间特征当“导师”,用交叉注意力喂给扩散U-Net,在CelebA人脸去噪上直接涨了4.40dB。方法不复杂,但对混合范式感兴趣的读者值得一读。
法医病理误判的潜在风险,被一次脑洞大开的「图像翻译」给盯上了。本论文首次把薛定谔桥搬进死后自溶恢复,不搞像素级配对,直接学分布映射,还建了首个真实数据集AutoPath。更狠的是,它证明FID这类老牌指标在诊断场景里可能「帮倒忙」——专家盲评和滑片级诊断一致性,才是硬通货。
扩散模型做MRI重建效果好,但动辄几百上千步的迭代采样让临床落地遥遥无期。明尼苏达大学这篇CM-RED,把一致性模型塞进RED优化框架,4步出图,PSNR/SSIM全面超越1000步的DPS和100步的DDS,计算量直降25—250倍。生成式MRI重建的“速度焦虑”,这次是真的被治好了。
训练扩散Transformer最烧钱的不是模型,而是优化器?Meta这篇新作把Muon优化器从1.3B一路验证到15B,生成质量稳定赢过AdamW最高19.1%,又用「周期性行式」设计把优化器通信量砍掉66.7%。质量不掉、速度反超,训练成本敏感的同学值得细读。
这篇论文把扩散模型里最"玄学"的分数网络,用小波基展开成了完全可解析的形式——不用梯度训练,闭式岭回归直接算出最优去噪器。更妙的是,三种相关性结构把"数据里哪些统计量最重要"变成了可量化的诊断工具。理解扩散模型内部机制,这篇值得一读。
4K分辨率下改图,既要改得准、还要改得快、更要纹理细节不丢失,这可能吗?阿里千问与上海交大给出的答案是:61秒,一个细节都不少。
这篇论文把“谁来判断压缩图像好不好”这个老问题翻出了新花样。斯坦福和谷歌团队发现,Gemini 2.5-Flash这类通用视觉语言模型,竟然能零样本复现人眼的相似度判断,干脆把它请来当裁判,用偏好优化把扩散自编码器训得更懂人眼。结果在多个基准和上万次用户评测里直接干到第一梯队。想看看VLM怎么当评委、这条路能省多少人工标注成本?这篇值得一读。
模拟存内计算(CIM)部署扩散模型是低功耗生成的重要路径,但芯片非理想性会让引导信号悄悄“失真”。这篇北大港大合作的工作把失效通道定位到无分类器引导残差上,并给出免重训练、只改一个标量参数的优雅修复方案,在3个扩散模型上大幅恢复生成质量,值得所有关注AI芯片落地和扩散模型的读者一读。
3DGS资产正在被“拆零件拼装”式盗用,而现有的渲染级水印在这种局部侵权下几乎集体失灵。浙大这篇NGS-Marker直接对高斯原语下手,任意抠一块都能验明正身,局部侵权场景下解码准确率冲到99%以上,是3D资产版权保护里少见的真痛点工作。
一张照片拍完就定型了?南京大学最新研究告诉你:换视角、拉焦距、调色温、改曝光,一张图就能“重拍”出各种效果,还跟真重新拍过一样。首个统一框架ReX-Shot,直接把单图三要素控制一次搞定。
CFG的八种免训练替代方法,真的比原版CFG更香吗?这篇论文在统一协议下,用组合对齐基准在SD3.5 Medium和FLUX.2 klein上实测,结论相当扎心:没有一个方法能全面胜出,CFG依然是性价比之王。想知道哪些方法在哪些指标上偷偷涨了点?这篇评测给你答案。
放疗中反复CT辐射剂量高,低剂量CBCT图像质量又不够用?这篇ECR 2026论文用条件扩散模型做CBCT到CT合成,还专门较真了“输入图像怎么表示”这件事——结果发现,看似更粗糙的FDK重建反而能让扩散模型发挥更大潜力,PSNR相对提升超过20dB,思路很值得借鉴。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球