冻结Qwen3-VL也能加音频?Fusion Embedding统一四模态
这篇论文最有意思的地方,不是“又做了一个多模态模型”,而是 冻结基座不动,也能把音频硬塞进统一空间 。更狠的是,文本、图像、视频的原有结果还能保持 bitwise 一致,工程味很足。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,不是“又做了一个多模态模型”,而是 冻结基座不动,也能把音频硬塞进统一空间 。更狠的是,文本、图像、视频的原有结果还能保持 bitwise 一致,工程味很足。
视频摘要最容易犯的错,不是总结得不够短,而是把最关键的证据先删没了。HAS偏偏反着来:不做硬挑帧,而是把“高光分布”变成推理时的注意力引导,思路很干净,实验也够实在。
自动驾驶模型最怕的不是“看不见”,而是“看见了却不知道到底信了谁”。这篇工作直接把单个目标从画面里抹掉,再看轨迹怎么变,黑盒里谁在捣鼓方向盘,终于有机会被点名。
地图到底是给人看的,还是给机器看的?这篇论文直接把这个老问题拉到多模态大模型时代重新拷问了一遍。2400张合成等值区域图、12000道题、22个模型,结论很实在: 地图没有过时,反而在高层次空间推理里更像“外挂” 。
这篇论文最有意思的地方,不是“让图表更好看”,而是把“好看”和“正确”这对天生互相打架的目标,硬生生拉到了一张桌子上。它不只给出方法,还顺手做了一个双语基准和六轴评测,属于能直接拿来做后续研究的那种工作。
多模态智能体最怕的不是答错,而是把错的东西“记牢”。这篇论文直接把矛头对准长期记忆:攻击者只改一张图,就能在黑盒条件下把记忆系统带偏,而且五种后端都没能幸免。更关键的是,它把“检索被命中”和“模型真的信了”这两件事分开看,结论很扎实。
视频推理这事,很多时候不是“会不会想”,而是“看没看见关键帧”。这篇论文直接把矛头对准感知短板,用注意力把稀疏奖励拆成帧级、Token级信号,思路很硬,实验也够实。
视频理解模型往往要把每一帧都当成独立图片来处理,这又慢又浪费算力。微软和斯坦福的研究人员直接从视频压缩算法中取经,用轻量级的运动向量和残差代替大部分图像的密集编码,让首帧生成时间快了86%,令牌用量暴减93%,同时性能还不降反升!这个方法与之前的Quickviewer等非均匀采样思路不同,它是在编解码层面做“减法”,从根源上避免了冗余。
阿里这次没玩虚的,直接把文档解析从“流水线拼装”拉到“端到端一把梭”。0.8B 小模型能在公开榜单上登顶,关键不在嘴上说模型小,而在数据引擎和训练 recipe 真把小模型喂明白了。
机器人策略最烦的不是“不会动”,而是“记不住”。这篇把测试时训练塞进机器人基础模型里,直接把上下文拉到8K步,还顺手做出单次视频模仿和在线改进,思路很硬。
施工路段最容易把模型训练出的“老司机直觉”打回原形。WorkDrive的思路很直接:先把现场关键事实看清,再把因果链讲明白,最后用一致性奖励把轨迹拽回来,适合关心自动驾驶落地的人细看。
这篇论文最有意思的点,不是又堆了一个多模态采样器,而是把“图文互相打架”这件事变成了可修正的过程。文本和图像不再各写各的,而是在同一次去噪里边想边改,挺像老师边讲边在黑板上补笔。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球