LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12787 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:图像生成

共 101 篇
西交&中大MICCAI 2026:死后组织“生前还原”,专家盲选23.81%胜出
视觉与图像

西交&中大MICCAI 2026:死后组织“生前还原”,专家盲选23.81%胜出

法医病理误判的潜在风险,被一次脑洞大开的「图像翻译」给盯上了。本论文首次把薛定谔桥搬进死后自溶恢复,不搞像素级配对,直接学分布映射,还建了首个真实数据集AutoPath。更狠的是,它证明FID这类老牌指标在诊断场景里可能「帮倒忙」——专家盲评和滑片级诊断一致性,才是硬通货。

明尼苏达大学CM-RED:4步MRI重建,效果亮眼1000步扩散模型
视觉与图像

明尼苏达大学CM-RED:4步MRI重建,效果亮眼1000步扩散模型

扩散模型做MRI重建效果好,但动辄几百上千步的迭代采样让临床落地遥遥无期。明尼苏达大学这篇CM-RED,把一致性模型塞进RED优化框架,4步出图,PSNR/SSIM全面超越1000步的DPS和100步的DDS,计算量直降25—250倍。生成式MRI重建的“速度焦虑”,这次是真的被治好了。

哈佛最新研究:扩散模型分数函数被"拆穿",小波展开无需训练直接去噪
视觉与图像

哈佛最新研究:扩散模型分数函数被"拆穿",小波展开无需训练直接去噪

这篇论文把扩散模型里最"玄学"的分数网络,用小波基展开成了完全可解析的形式——不用梯度训练,闭式岭回归直接算出最优去噪器。更妙的是,三种相关性结构把"数据里哪些统计量最重要"变成了可量化的诊断工具。理解扩散模型内部机制,这篇值得一读。

李飞飞参与,斯坦福&Google新作:让VLM当裁判,图像压缩更懂人眼
视觉与图像

李飞飞参与,斯坦福&Google新作:让VLM当裁判,图像压缩更懂人眼

这篇论文把“谁来判断压缩图像好不好”这个老问题翻出了新花样。斯坦福和谷歌团队发现,Gemini 2.5-Flash这类通用视觉语言模型,竟然能零样本复现人眼的相似度判断,干脆把它请来当裁判,用偏好优化把扩散自编码器训得更懂人眼。结果在多个基准和上万次用户评测里直接干到第一梯队。想看看VLM怎么当评委、这条路能省多少人工标注成本?这篇值得一读。

模拟存内计算秒变“猪队友”?北大港大出手:只调一个引导参数,扩散模型FID狂降75%!
视觉与图像

模拟存内计算秒变“猪队友”?北大港大出手:只调一个引导参数,扩散模型FID狂降75%!

模拟存内计算(CIM)部署扩散模型是低功耗生成的重要路径,但芯片非理想性会让引导信号悄悄“失真”。这篇北大港大合作的工作把失效通道定位到无分类器引导残差上,并给出免重训练、只改一个标量参数的优雅修复方案,在3个扩散模型上大幅恢复生成质量,值得所有关注AI芯片落地和扩散模型的读者一读。

ECR 2026新研究:扩散模型给CBCT做"翻译",FDK重建输入让合成CT质量飙升20dB
视觉与图像

ECR 2026新研究:扩散模型给CBCT做"翻译",FDK重建输入让合成CT质量飙升20dB

放疗中反复CT辐射剂量高,低剂量CBCT图像质量又不够用?这篇ECR 2026论文用条件扩散模型做CBCT到CT合成,还专门较真了“输入图像怎么表示”这件事——结果发现,看似更粗糙的FDK重建反而能让扩散模型发挥更大潜力,PSNR相对提升超过20dB,思路很值得借鉴。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球