ECNU新方法:医学切片超分辨率提升1.07dB
这篇论文把医学切片超分辨率从“随便补细节”改成“先守规矩再补脑补”,特别适合临床场景。零空间约束负责不乱改原始观测,样条混合负责把缺失层补得更像那么回事。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文把医学切片超分辨率从“随便补细节”改成“先守规矩再补脑补”,特别适合临床场景。零空间约束负责不乱改原始观测,样条混合负责把缺失层补得更像那么回事。
这篇论文最有意思的地方,是把原本“玄学味很重”的GAN训练,硬生生拆成了可解的高维动力学问题。类条件、相关性、非零均值这些看起来很乱的因素,最后都被压进了一个有效协方差里,理论和实验还能对上。
这篇论文把“GAN为什么会学、什么时候会崩”讲得很透:不是只看单个特征强不强,而是看它们凑在一起后的有效协方差。相关性这回不只是添乱,处理得好还能把弱信号抬进可学习区间,挺有意思。
从稀疏采样到全局推断,这是科学计算与AI交叉领域最迷人的难题之一。加州理工团队提出的FAPS,巧妙地用流匹配先验“包”住了后验采样,不仅统一了函数回归和PDE逆问题,还在推理阶段降本增效。更关键的是,它不需要显式评估先验密度,且能无缝对接不同查询网格,切切实实把理论转化成了实用工具。
生成AI经常“画不对题”?这可能是顶尖模型也无法避免的“语法错误”。浙大联合山大的GAZER,不走寻常路,它不重训模型,而是在生成过程中,让模型自己扮演“质检员”,通过多模态大模型“复盘”草稿,发现错误后“回炉重造”,简单一招就让图像和视频生成的语义对齐效果显著提升。同类工作中,GAZER切中了核心痛点,非常值得一看!
只需一张图片,就能精准控制4D人-物交互动画中的姿态、接触、布局细节。Meta联合马普所、阿姆斯特丹大学等机构提出的IMAGIN-4D,用“空间-时间”双重解耦的图像条件化策略,把生成图像遵循度指标直接砍半。同类工作做视频生成,它做4D交互,效果惊艳。
让AI画个"某品牌最新概念车"?传统模型直接摆烂。小米团队提出的RS-Gen,专治AI绘图的"知识盲区"和"逻辑短路"。它像个聪明的项目经理,把复杂任务拆解成"先查资料、再想思路、最后画图",关键是不用重新训练模型,即插即用。在WISE基准上,直接把通义千问的基线模型从0.51拉到0.823,效果直逼商业闭源模型,这波开源社区赢麻了。
说起生成模型,大家最熟悉的可能是扩散模型(Diffusion Models)和自回归模型(Autoregressive Models),它们一个靠“慢慢去噪”做到高质量,一个靠“逐词预测”称霸语言。但还有一个老牌家族——归一化流(Normalizing Flows,简称NF),虽然理论优雅,却一度因为推理速度慢、架构受限,被很多人遗忘在角落。
还在苦恼给视频换个背景,主角的头发丝却“糊”了?传统方法“重绘全图”的做法就像把整面墙重刷一遍,难免会蹭到不该动的地方。Netflix联手Caltech最新力作Vera,直接给出“分层”方案——要改的部分单独画在一个“透明图层”上,再盖回原视频,从源头杜绝了“改哪坏哪”的尴尬。PSNR狂甩VACE 7dB,效果真的有点东西。
3D视觉错觉生成一直是个「看着悬乎、做着更悬」的课题。以往的方法要么慢得像蜗牛(40分钟一个),要么生成的东西满是拼接缝和色彩过曝。台湾阳明交通大学这次祭出的JanusMesh,直接把时间压缩到3-5分钟,而且不需要针对每个形状做优化训练,真正做到了零样本!更关键的是,它生成的模型从各个角度看都完整无漏,只在特定视角才「变戏法」,效果相当惊艳。对于做3D内容
从2026年6月的PathSpec到1月的COOL-SD,加速自回归图像生成的方法层出不穷,但都难逃1D序列的束缚。罗格斯大学这篇SSD彻底打破常规,让模型用“二维视野”同时看上下左右,把复杂度从O(n²)降为O(n),实现13倍加速,这波操作属实惊艳!
AI画画火了这么久,但你有没有发现,让它“精准复刻”某种画风,比如水墨、印象派、卡通,结果总有点“似是而非”? 核心问题在于,现有的“人类偏好奖励模型”能判断美丑,却根本不懂“风格”这回事。CVPR 2026的这篇StyleDoctor,就像给AI配上了一位严格的“美术史教授”,专门用来评估和引导风格生成。这项工作还配套了一个涵盖1000种风格、40万对样本
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球