LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12809 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:图像生成

共 101 篇
AI · PAPER
视觉与图像

香港科技大学提出LiveLight:视频重光照首次实时化,交互式打光边播边调

实时移动光源,画面即刻响应——LiveLight 让视频重光照从『渲染后等待』变为『边播边调』。香港科技大学联合多家机构提出首个基于扩散模型的实时流式视频重光照框架,仅用4步采样跑出15.78FPS还把质量做到SOTA,视频编辑领域值得重点关注的方向性工作。

AI · PAPER
视觉与图像

哈工大等提出PRISM:让AI画画学会“看图自改”,TIFA飙至91.4%新SOTA

文生图提示优化一直是热门,但之前的方法要么只看文本要么只给分数,缺少结构化图像诊断。PRISM另辟蹊径,用一个VLM同时当裁判和教练,先看图挑毛病再针对性改提示,最后用强化学习让模型越改越好。在TIFA上从76.1飙升到91.4,关键是可解释性极强——每个修改都有理有据。

AI · PAPER
视觉与图像

香港大学新方法Protego:保护后照片互不匹配,效果翻倍

还在担心你的照片被 PimEyes、Clearview AI 这类“人脸搜索引擎”人肉吗?港大团队提出的 Protego 通过一个独特的 3D 隐私纹理,让你的面部在搜索引擎中彻底“隐身”——即使查询图像也是被保护过的,仍然无法匹配。实验显示召回率暴降 3.5 倍,而且能流畅保护视频,效果自然得像是没加过工。

Sony AI新作:仅$2000成本,1.5B模型同时搞定图像理解与生成,SOTA还省钱!
视觉与图像

Sony AI新作:仅$2000成本,1.5B模型同时搞定图像理解与生成,SOTA还省钱!

统一多模态模型(UMM)过去要么贵得离谱(训练成本几万美元、数据上亿),要么理解与生成总得二选一。Sony AI这篇Argus-Unified直接掏出“混合视觉令牌”方案,把预训练VLM的视觉编码器冻住,只花$2000和1500万数据就训出比7B模型还强的理解能力,生成效果也不拉胯。对搞低预算落地的团队来说,这是一份很实在的参考。

AI · PAPER
视觉与图像

2026最新!弗吉尼亚大学Lantern:物理引导扩散不崩生成,FPD持平纯去噪

这篇来自弗吉尼亚大学的Lantern直面物理引导扩散在量热器模拟中的梯度冲突问题,设计GradBlend让物理辅助损失不妨碍生成保真度,并引入新度量CFD诊断层间与体素相关性。实验显示Lantern在FPD上持平纯去噪基线,而普通多任务方法性能崩溃2-100倍。对想给生成模型加物理约束的团队极有启发性。

AI · PAPER
视觉与图像

Netflix ID-V2V开源:一招锁住人脸,重风格化零损失

Netflix 这次玩真的——以前给演员换背景换灯光,人脸基本就崩了。ID-V2V 把身份保持当成了重光照问题,用“重光照面部”+“法线图”把演员的脸死死锁住,单视频就能训,真人脸相似度直接拉到 0.701,比第二名高出 30% 多,还能同时管住多人场景。做视频后期的小伙伴,这篇一定得看。

视频换脸数据合成不再“裸奔”:自适应锚定闭环放置,告别美颜滤镜式失真
视觉与图像

视频换脸数据合成不再“裸奔”:自适应锚定闭环放置,告别美颜滤镜式失真

视频换脸的一大痛点就是没有“正确答案”用来训练。DreamID-V虽用首尾帧锚定加姿势驱动生成了配对数据,但中间帧的身份漂移和皮肤像美颜滤镜一样平滑,一直没解决。这篇2026年7月的新论文直接把锚点放置闭环化,哪里漂插哪里,还从真实视频里扒纹理补回去——思路简单粗暴,实验设计也很严谨,七组实验一一对应验证假设。做换脸、视频生成或数据增强的小伙伴值得看看。

3D纹理超分新SOTA来了!自适应视角+扩散模型,浙大这一招让老旧资产秒变4K
视觉与图像

3D纹理超分新SOTA来了!自适应视角+扩散模型,浙大这一招让老旧资产秒变4K

你是不是也遇到过这种尴尬:下载了一个精美的3D模型,结果纹理一放大全是马赛克,UV接缝处裂开得像补丁?传统图像超分模型拿到纹理图上直接翻车,生成模型又一味“自由发挥”不保留原细节。浙大团队这次祭出Texture++,用“自适应视角+四叉树掩码+局部单步扩散”三板斧,既保真又无缝,4倍超分PSNR飙到37.53,比SOTA高出1.5个dB,关键是——不需要梯度

2026新作:DDIM后验采样拿下多数指标
视觉与图像

2026新作:DDIM后验采样拿下多数指标

这篇论文最有意思的地方,不是“又做了一个扩散逆问题方法”,而是把原本很容易写成一团经验技巧的 posterior sampling,硬生生拆成了按奇异方向逐坐标更新的 DDIM。更狠的是,它还给出后验一致性证明,属于“能跑、能讲、还能证”的那类工作。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球