单目预训练+3D蒸馏,GeoLaV冲上SOTA
这篇论文最有意思的地方,不是又堆了一个更大的视频模型,而是反其道而行之:先拿单张图做几何预训练,再把3D教师的结构先验蒸馏进去。结果很直接——图像数据也能学出视频所需的空间一致性,最后还在多个基准上冲到SOTA。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,不是又堆了一个更大的视频模型,而是反其道而行之:先拿单张图做几何预训练,再把3D教师的结构先验蒸馏进去。结果很直接——图像数据也能学出视频所需的空间一致性,最后还在多个基准上冲到SOTA。
这篇工作最有意思的地方,不是单纯把Mamba搬进医疗场景,而是把图像和表格信息拆成两段来处理,既保留了诊断流程的直觉,又把解释性补了回来。PAD-UFES-20和NDB-UFES两套数据都跑了,结果不算“碾压”,但在召回率和可解释性上确实有看头。
这篇论文的切口很狠:不去讨论“多模态大模型会不会推理”,而是直接问它们在只看视频时,能不能别靠语言偏见乱猜。VisionToM 不是简单微调,而是拿注意力头开刀,思路清楚,代价也低,适合真正想把可解释性做成工具的人。
长视频最怕的不是“看不懂”,而是“看得懂一点点,却被海量冗余帧淹没”。HPP把感知和推理解耦,让编码型大模型像程序员一样分层探测视频,思路很硬核,成本也更像工程方案而不是玄学。
遥感变化描述最烦的,不是模型不会看图,而是太爱“说套话”。这篇DFM专门盯住这个毛病:用文本引导的对比学习把视觉特征往“该说的变化”上拽,再拿变化检测先验补一脚,思路很工程,也很对症。
ViQ这篇很像“把图像也做成词表”的认真尝试:既想保住细节,又想让视觉表示更适合多模态大模型。最有意思的是,它不是只顾理解,也没把重建丢掉,效率还真提上来了。
这篇 OmniAct 很适合机器人/具身智能方向的读者:它不是把“规划、记忆、执行”揉成一锅粥,而是拆成三层各司其职,专门解决长程任务里最烦的两件事——工具太杂、失败太多。更有意思的是,它在真实家庭场景里把开源模型也拉到了接近商用的表现,思路相当顺手。
阿里和浙大这次把“鉴伪”做成了会自我进化的智能体:先看语义、再看频域、还会调用空间专家,最后靠事后驱动反复打磨推理链。更有意思的是,它不只追求答对,还在和 GPT-5 比谁更会“讲道理”。
阿里和浙大这次没走“单次判断”老路,而是把AI鉴伪做成了一个会看、会判、还会反思进化的智能体。更有意思的是,它不只追准确率,还把推理质量也一起往上拽。
桌面智能体最烦的不是“不会做”,而是“做完了也不知道算不算对”。这篇论文把 VLM 变成自动考官,再把考官的口误做噪声校正,思路很实用,结果也挺扎实,适合想看 Agent 怎么真正学会干活的读者。
这篇论文把“看视频”拆成了三件事:先粗看定位,再重看细节,最后重答修正。最妙的是,它不用冷启动的长串 CoT 标注,直接靠强化学习把重看能力练出来,省事还挺能打。
这篇论文最有意思的地方,是把“基础模型很强但不好验”这个老大难,拆成了一个能落地的工程问题。大模型负责看图、听话、想任务,小安全模块负责把关,形式化验证只盯住后者,思路很干净。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球