UCF-101上VideoRAE刷新SOTA:离散40、连续93
这篇论文最有意思的地方,不是又做了一个视频自编码器,而是把“只会理解”的冻结视频基础模型,硬生生改造成了能重建、能生成、还能加速训练的通用视频潜空间。更妙的是,它把连续和离散两条生成路线都打通了,工程味很足。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,不是又做了一个视频自编码器,而是把“只会理解”的冻结视频基础模型,硬生生改造成了能重建、能生成、还能加速训练的通用视频潜空间。更妙的是,它把连续和离散两条生成路线都打通了,工程味很足。
这篇论文最有意思的地方,不是又堆了一个大模型,而是把超分辨率的“起跑线”往前挪了一步:不再从纯噪声出发,而是让低质图像自己带路。再加上两阶段训练,既能单步快跑,也能多步细修,工程味很足。
NVIDIA 这篇没有走“越大越强”的老路,而是盯着离散扩散最烦的两个痛点下手:不会自我修正、词表一大就学不动。结果很直接,1024 分辨率文生图拿到 SOTA,训练还更省显存。
扩散模型最怕的不是算力,而是数据里混进来的“脏样本”。这篇论文很实在:不改大结构,只把去噪损失换成散度诱导的加权形式,就把鲁棒性做出来了。
训练看起来很“正经”,推理却偷偷跑偏,这就是 Flow Matching 里最烦人的暴露偏差。DEFAR 的思路很妙:不把偏差当噪声硬压,而是把它当反馈信号,让模型自己学会纠偏。
遥感变化描述最烦的,不是模型不会看图,而是太爱“说套话”。这篇DFM专门盯住这个毛病:用文本引导的对比学习把视觉特征往“该说的变化”上拽,再拿变化检测先验补一脚,思路很工程,也很对症。
这篇论文很像给语音质量模型做了一次“脑内整理术”。它没堆更大的编码器,而是在DNSMOS Pro里塞进对比学习,让模型自己把“好听”和“难听”在潜在空间里分开,思路干净,效果也稳。
这篇论文最有意思的地方,不是又堆了多少花活,而是把盲超分最容易被忽略的“分布对不齐”拎出来狠狠干了一顿。三阶段对齐思路很朴素,但对真实相机数据确实有效,适合想看“训练协议怎么影响结果”的读者。
室内占据预测,传统方法要么算得慢,要么基元浪费。南方科技大学这篇FLM-Occ,直接把问题换个角度定义——从分类变成估计分布,用最大似然训练。结果呢?只用32个基元,精度超越SplatSSC的1200个,速度还快了快4倍!这思路,有点东西。
当你把机器人放进一座没有灯光的漆黑走廊,绝大多数视觉传感器都会当场“罢工”,但热红外相机可以。只是,它拍出来的画面像蒙上了一层雪花点,还带着顽固的横条纹。首尔大学团队交出的这份答卷——TIDY,用一种极其优雅的方式把噪声“剥离”了出来,纯靠小波域的数学之美,让热成像实现了前所未有的清晰。
当我们看图时,真正读到的究竟是像素,还是图中物体间“分离”或“重叠”的逻辑关系?这篇2026年6月的论文,从信息论角度彻底颠覆了“渲染=画得像”的传统认知。它将场景的几何分离关系视为一个待传输的“信源”,把渲染过程建模为一个噪声信道,并用手性证书的理论给出了一个优雅的率失真框架。一句话总结:这是渲染与几何信息论的一次清新跨界,看完忍不住想鼓掌。
重庆大学这波操作有点东西!在低光增强领域,无监督方法最头疼的就是复杂非均匀光照下的局部过曝/欠曝和颜色偏色。这篇论文干脆把高斯泼溅的连续光场表示当成“物理先验”硬塞进Transformer的自注意力里,让模型在增强时能“看懂”光照的物理结构,而不是在黑盒子里瞎猜。PSNR和SSIM在LOL等数据集上直接登顶,视觉修复效果图看着是真的解压。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球