LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12787 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:图像生成

共 101 篇
图像生成|招牌写"兽医"宠物店秒变诊所?新基准专治文生图语义泄漏
视觉与图像

图像生成|招牌写"兽医"宠物店秒变诊所?新基准专治文生图语义泄漏

先来看一种并不罕见的场景:在产品包装设计、店铺招牌生成、设备铭牌渲染这类视觉内容创作任务里,用户往往给模型下达一个明确指令——在某个指定的主体区域(比如一家面包店的招牌、一辆货车的车身、一瓶饮料的标签)写入指定的文字,同。

同济新基准专治文生图“没文化”:GPT Image画隐喻也翻车,结构准确率仅78%
视觉与图像

同济新基准专治文生图“没文化”:GPT Image画隐喻也翻车,结构准确率仅78%

让AI画“时间就是金钱”,它可能真画一个挂满钞票的时钟;让AI画“知识就是力量”,它又可能把书本和哑铃硬拼在一起。文生图模型能把物体画得很真,却常常画不出“画外之音”。同济大学等机构提出VMetaphor-Bench,把“视觉隐喻生成”这件事第一次系统性地量化评测,结果连GPT Image 1.5也栽在结构组合上。

KAIST最新:AI整图重绘也能精准定位篡改,IoU达0.92
视觉与图像

KAIST最新:AI整图重绘也能精准定位篡改,IoU达0.92

当扩散模型把整张图都“重画”一遍,你还能看出哪里被改过吗?现有主动防篡改定位方法在“全再生”场景下集体崩盘,AUC直接掉到0.5左右。KAIST这篇APT论文第一个系统研究该问题,用潜空间锚点对齐扰动把FR场景定位IoU做到0.92,碾压最强基线WAM(0.84),且能泛化到未知篡改类型。想搞懂AI取证下一个赛点,这篇值得读。

东北大学开源RegionCache:多轮图像编辑最高提速2.55倍
视觉与图像

东北大学开源RegionCache:多轮图像编辑最高提速2.55倍

东北大学提出RegionCache,专治多轮图像编辑的重复计算病:连续编辑轮次中平均81%-92%区域根本不变,却每次都把整张图重新生成一遍。RegionCache用跨注意力把“没变的语义”映射到“没变的区域”,直接复用缓存隐藏状态,只重算真正被改的地方,在PixArt-α上拿到1.43-2.55倍端到端加速,画质基本不掉。有代码,值得跑一跑。

图像恢复|天津大学ZVRM:零样本视频修复提速近3倍,时序闪烁减八成
视觉与图像

图像恢复|天津大学ZVRM:零样本视频修复提速近3倍,时序闪烁减八成

又一篇零样本视频修复的狠活。天津大学团队把文本到图像扩散模型用出了花:不用训练就能修视频,还支持文本、图像两种参考输入,推理速度直接砍到三分之一,时序一致性指标WE降到原来的五分之一。被视频闪烁折磨过的同学,这篇值得重点研究。

告别一键硬修!SuperSharpen把盲去模糊变成“手动挡”,细节更真实
视觉与图像

告别一键硬修!SuperSharpen把盲去模糊变成“手动挡”,细节更真实

这篇工作把扩散模型去模糊从“一键生成”变成了“手动调档”,引入了类似音量旋钮的模糊度量(BM),让用户自己决定要锐化多少、生成多少细节。还实打实对比了ControlNet适配和全量微调两条路线,结论清晰,落地感强,值得做图像恢复和摄影后处理的朋友读一读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球