LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:图像生成

共 101 篇
加州理工新框架FAPS:首个统一函数空间回归与PDE逆问题的后验采样器,推理快1.7倍
视觉与图像

加州理工新框架FAPS:首个统一函数空间回归与PDE逆问题的后验采样器,推理快1.7倍

从稀疏采样到全局推断,这是科学计算与AI交叉领域最迷人的难题之一。加州理工团队提出的FAPS,巧妙地用流匹配先验“包”住了后验采样,不仅统一了函数回归和PDE逆问题,还在推理阶段降本增效。更关键的是,它不需要显式评估先验密度,且能无缝对接不同查询网格,切切实实把理论转化成了实用工具。

生成AI老“画”不对?浙大新方法GAZER:让自回归模型在生成中“自纠错”,无需重新训练!
视觉与图像

生成AI老“画”不对?浙大新方法GAZER:让自回归模型在生成中“自纠错”,无需重新训练!

生成AI经常“画不对题”?这可能是顶尖模型也无法避免的“语法错误”。浙大联合山大的GAZER,不走寻常路,它不重训模型,而是在生成过程中,让模型自己扮演“质检员”,通过多模态大模型“复盘”草稿,发现错误后“回炉重造”,简单一招就让图像和视频生成的语义对齐效果显著提升。同类工作中,GAZER切中了核心痛点,非常值得一看!

Meta最新研究:一张照片就能生成4D人-物交互动画,效果效果优于单令牌方法!
视觉与图像

Meta最新研究:一张照片就能生成4D人-物交互动画,效果效果优于单令牌方法!

只需一张图片,就能精准控制4D人-物交互动画中的姿态、接触、布局细节。Meta联合马普所、阿姆斯特丹大学等机构提出的IMAGIN-4D,用“空间-时间”双重解耦的图像条件化策略,把生成图像遵循度指标直接砍半。同类工作做视频生成,它做4D交互,效果惊艳。

小米最新研究:RS-Gen让AI绘图告别“翻车”,逻辑推理+实时搜索,效果直逼闭源
视觉与图像

小米最新研究:RS-Gen让AI绘图告别“翻车”,逻辑推理+实时搜索,效果直逼闭源

让AI画个"某品牌最新概念车"?传统模型直接摆烂。小米团队提出的RS-Gen,专治AI绘图的"知识盲区"和"逻辑短路"。它像个聪明的项目经理,把复杂任务拆解成"先查资料、再想思路、最后画图",关键是不用重新训练模型,即插即用。在WISE基准上,直接把通义千问的基线模型从0.51拉到0.823,效果直逼商业闭源模型,这波开源社区赢麻了。

何凯明团队最新BiFlow:告别万步自回归,归一化流一步生成FID 2.39
视觉与图像

何凯明团队最新BiFlow:告别万步自回归,归一化流一步生成FID 2.39

说起生成模型,大家最熟悉的可能是扩散模型(Diffusion Models)和自回归模型(Autoregressive Models),它们一个靠“慢慢去噪”做到高质量,一个靠“逐词预测”称霸语言。但还有一个老牌家族——归一化流(Normalizing Flows,简称NF),虽然理论优雅,却一度因为推理速度慢、架构受限,被很多人遗忘在角落。

Netflix最新研究Vera:分层视频编辑,内容保真度狂甩VACE几条街!
视觉与图像

Netflix最新研究Vera:分层视频编辑,内容保真度狂甩VACE几条街!

还在苦恼给视频换个背景,主角的头发丝却“糊”了?传统方法“重绘全图”的做法就像把整面墙重刷一遍,难免会蹭到不该动的地方。Netflix联手Caltech最新力作Vera,直接给出“分层”方案——要改的部分单独画在一个“透明图层”上,再盖回原视频,从源头杜绝了“改哪坏哪”的尴尬。PSNR狂甩VACE 7dB,效果真的有点东西。

只需3分钟!台交大新作JanusMesh:零样本生成3D视觉错觉,一个模型秒变两种物体
视觉与图像

只需3分钟!台交大新作JanusMesh:零样本生成3D视觉错觉,一个模型秒变两种物体

3D视觉错觉生成一直是个「看着悬乎、做着更悬」的课题。以往的方法要么慢得像蜗牛(40分钟一个),要么生成的东西满是拼接缝和色彩过曝。台湾阳明交通大学这次祭出的JanusMesh,直接把时间压缩到3-5分钟,而且不需要针对每个形状做优化训练,真正做到了零样本!更关键的是,它生成的模型从各个角度看都完整无漏,只在特定视角才「变戏法」,效果相当惊艳。对于做3D内容

告别“似是而非”,StyleDoctor一招提升风格一致性50%
视觉与图像

告别“似是而非”,StyleDoctor一招提升风格一致性50%

AI画画火了这么久,但你有没有发现,让它“精准复刻”某种画风,比如水墨、印象派、卡通,结果总有点“似是而非”? 核心问题在于,现有的“人类偏好奖励模型”能判断美丑,却根本不懂“风格”这回事。CVPR 2026的这篇StyleDoctor,就像给AI配上了一位严格的“美术史教授”,专门用来评估和引导风格生成。这项工作还配套了一个涵盖1000种风格、40万对样本

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球