LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:图像生成

共 101 篇
大模型不需要深:一个递归技巧让数独生成器小5倍快3倍
视觉与图像

大模型不需要深:一个递归技巧让数独生成器小5倍快3倍

模型大≠能力强?这篇来自洛桑联邦理工学院(EPFL)等机构的工作,直接把「递归循环」这一此前只在自回归模型里验证过的思路,正式引入了掩码扩散模型(MDM)。结果相当亮眼:一个6层Transformer循环5次,参数省5倍,模型小了,效果反而吊打30层模型!更绝的是,推理时去噪步数还能砍掉近3倍。龙哥觉得,这可能是近期最实用的模型「瘦身」思路之一。

让AI画图"指哪打哪"!STAR新方法:让奖励信号精准导航,GenEval得分飙至0.9759
视觉与图像

让AI画图"指哪打哪"!STAR新方法:让奖励信号精准导航,GenEval得分飙至0.9759

以前给AI发“大锅饭”奖励,生成区域无论主次都一个待遇,难怪画出来的图总在细节上翻车。这次STAR的方法挺巧妙——直接把模型里的注意力图拿来当导航,给“画什么”和“画在哪里”的区域多发奖励。效果是真不错,GenEval飙到0.97,而且计算量几乎没增加,属于花小钱办大事的典范。

中科院发CVPR 2026:专攻风格一致性的奖励模型,效果吊打ImageReward
视觉与图像

中科院发CVPR 2026:专攻风格一致性的奖励模型,效果吊打ImageReward

继之前我们聊过阿里"统一思考者"给AI画图装大脑、字节跳动"先想后画"解决图像编辑难题后,龙哥发现,AI图像生成领域对风格的控制越来越精细了。但一个核心瓶颈一直没解决: AI作画好不好看,谁来打分? 通用奖励模型(比如ImageReward)根本不懂「风格」,只知道「像不像」或者「喜不喜欢」。今天这篇CVPR 2026的新作StyleDoctor,就是给风格

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球