CVPR 2026风格新作RFMSR:超分辨率不再从噪声硬冲
这篇论文最有意思的地方,不是又堆了一个大模型,而是把超分辨率的“起跑线”往前挪了一步:不再从纯噪声出发,而是让低质图像自己带路。再加上两阶段训练,既能单步快跑,也能多步细修,工程味很足。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,不是又堆了一个大模型,而是把超分辨率的“起跑线”往前挪了一步:不再从纯噪声出发,而是让低质图像自己带路。再加上两阶段训练,既能单步快跑,也能多步细修,工程味很足。
这篇论文最有意思的地方,不是又训练了一个奖励模型,而是把“奖励”这件事倒过来做了:让预训练多模态大模型回读提示词,看图能不能把原话读回来。结果很直接——不用偏好标注,不用再养模型,照样能把文生图强化学习带起来。
这篇论文最有意思的地方,不是又堆了多少模块,而是反其道而行之: 一层注意力 就敢把高维视觉特征压进生成空间。Apple Research还把它做到了扩散和流模型两条线都能用,实用味很足。
3D贴图最烦的不是“有没有”,而是“能不能把复杂花纹贴得像真的”。Ink3D的思路很直接:几何交给3D模型,纹理交给视频生成,再用烘焙把两边缝起来,工程味很足,也很有启发。
这篇论文最有意思的地方,不是“又一个可控生成”,而是把控制粒度卡在了文本和结构之间的中间地带:既想要全局分布,又要求精确到直方图。HIG用最优传输把这件事做成了,而且还是推理时、无需训练、还能顺手做信息嵌入,思路挺干净。
扩散模型已经很会“画”,但要它严格听话,往往得靠额外网络、微调或复杂条件。HIG更狠:直接在推理阶段用最优传输改轨迹,既能控颜色分布,也能玩信息嵌入,还几乎不增加训练成本。
AI生成图像检测这条线,最怕的不是模型差,而是对手升级太快。Flet不再死磕“静态特征”,而是直接把检测器做成能跟着新生成器一起变的系统,这个思路很对路。
这篇论文把“破损3D物体修复”从单纯补几何,推进到形状和纹理一起补,而且还要尽量保住原来没坏的部分。更狠的是,它不是只靠人工标注,而是把补哪里这件事也交给模型自己判断。
这篇论文最有意思的地方,不是把视频放大,而是把“放大倍率”和“生成成本”硬生生拆开了。AVSR-Diff 用固定低分辨率潜空间做扩散,再用连续解码补细节,2×到8×都能跑,内存还几乎不涨,工程味很足。
动态高斯最烦的,不是会动,而是 一动就把光照也“焊死”在纹理里 。DR-GS干的事很直接:把几何、光照、材质拆开,再让它们在变形和换光下各司其职。
复杂多实例生成最烦的不是“画不出来”,而是“画对了对象却串了属性”。InstanceControl 直接绕开手工实例标注,用视觉语言模型先把文本和区域对上,再用自适应掩膜细化兜底,思路很工程,效果也很实在。
NVIDIA 这篇没有走“越大越强”的老路,而是盯着离散扩散最烦的两个痛点下手:不会自我修正、词表一大就学不动。结果很直接,1024 分辨率文生图拿到 SOTA,训练还更省显存。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球