语义token+扩散渲染:Vega新范式
视频理解和视频生成长期像两拨人:一边要“看懂”,一边要“画准”。Vega直接把两件事塞进同一个框架里,还用3B参数在多个基准上打出了很能打的成绩,值得细看。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1668 篇文章
视频理解和视频生成长期像两拨人:一边要“看懂”,一边要“画准”。Vega直接把两件事塞进同一个框架里,还用3B参数在多个基准上打出了很能打的成绩,值得细看。
这篇论文不是单纯“把翻译模型做出来”,而是直接拆开看它到底哪里会翻车。短句、无生词时表现还行,一旦句子变长,神经机器翻译的短板就暴露得很诚实;而 grConv 还顺手展示了自己学语法结构的能力,挺有意思。
这篇论文最有意思的地方,不是又堆了一个跟踪滤波器,而是把无人机在图像里“歪一点、抖一下”的姿态,硬生生变成了加速度约束。对短时预测来说,这招很实用,尤其适合小目标、机动目标和多相机异步融合场景。
这篇论文最有意思的地方,不是又套了一个高斯过程,而是把“输入不准”和“输出不准”一起收拾了。对气动不确定性量化来说,这种做法比只调均值靠谱得多,尤其适合稀疏真值和外推场景。
机器人偏好学习最烦的不是“没数据”,而是“数据看起来很多,实际全在讲废话”。这篇 FPL 直接把偏好拆成速度、安全、质量等自然语言轴,监督更细,策略也更会“看脸色”了。
动态高斯最烦的,不是会动,而是 一动就把光照也“焊死”在纹理里 。DR-GS干的事很直接:把几何、光照、材质拆开,再让它们在变形和换光下各司其职。
房间模拟这事,很多人总觉得“差不多能用就行”。这篇论文偏不,它直接拿真实测量数据做评测,结果很扎心:模拟越像现实,多通道语音增强就越吃香,最高能把中位词错误率相对降掉38%。
多模态推理最怕“越想越跑偏”,这篇 VisRef 直接把问题说透了:不是单纯让模型多想,而是让它想的时候还记得回头看图。无需再训练,固定预算下还能稳定涨点,工程味很足。
复杂多实例生成最烦的不是“画不出来”,而是“画对了对象却串了属性”。InstanceControl 直接绕开手工实例标注,用视觉语言模型先把文本和区域对上,再用自适应掩膜细化兜底,思路很工程,效果也很实在。
牛津这篇不靠“更大模型”,而是给自动驾驶塞进一段更像人类的驾驶记忆:前方路况没看到,也能提前知道。更妙的是,它还考虑了先验失真时怎么安全退回,工程味很足。
SAMBA这篇很对路:它没跟着Transformer继续堆算力,而是直接把SAR的物理散射特性拉进自监督预训练里。结果就是,参数更轻,识别和检测还更稳,属于“懂雷达的人写出来的雷达基础模型”。
世界模型最怕的不是不会算,而是算着算着就跟现实脱节。AdaJEPA把自适应塞进MPC闭环里,用一次梯度步就能边规划边纠偏,思路很朴素,但很实用。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球