DynaWM登场:清华把VLA“反应式抓取”改成“预判式拦截”
机器人抓静态物体,大家早就不稀奇了;真正麻烦的是,目标自己在动,策略还在按“刚才的位置”出手。清华这篇 DynaWM 的思路很直接:不去硬改底座 VLA,而是把它吐出的动作块当条件,再结合多视角历史重画轨迹,专治“追着空气跑”。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
机器人抓静态物体,大家早就不稀奇了;真正麻烦的是,目标自己在动,策略还在按“刚才的位置”出手。清华这篇 DynaWM 的思路很直接:不去硬改底座 VLA,而是把它吐出的动作块当条件,再结合多视角历史重画轨迹,专治“追着空气跑”。
流式语音到语音翻译最烦的不是“会不会翻”,而是“能不能边听边翻还不崩”。这篇论文的狠活在于:只用约2k小时配对数据,就把长篇流式S2ST做到了很能打的水平,而且还把读写策略和语音生成拆开,思路很干净。
这篇论文不靠花活,专盯一个老问题:为什么残差网络一加深就训练不顺。结论很直接——跳连和加法后激活别乱动,保持“直通车”最重要,1000层网络才有机会真的跑起来。
视频压缩最难的,不是把码率压低,而是把画面压低以后还不让人想砸键盘。北大这篇直接把“结构锚点”和“运动细节”拆开处理,用生成模型补细节,思路很硬,码率也压得够狠。
这篇论文最有意思的地方,不是继续争论 Mamba 该不该进视觉,而是把 VMamba 和 MambaOut 拆开看:一个更吃“方向”,一个更吃“幅度”。结论对高分辨率分类和分割都很有启发,属于那种看完会忍不住想回头检查自己模型表征的工作。
多智能体强化学习最怕两件事:一是智能体一多就“全局爆炸”,二是连续状态动作一上来,离散表格那套直接失效。CDCPG把这两个坑一起填了,靠局部策略、局部评论家和随机特征,把理论和工程代价都压到了可讨论的范围里。
超分辨率论文很多,但大多还是“算一次就交卷”。这篇 ThinkSR 的有意思之处在于,它把连续思考机器搬进了像素重建里,让模型可以一边想、一边补细节,而且四个思考步内就能看到稳定变清晰的轨迹。更关键的是,它不是只讲概念,确实把稀疏思考和密集输出之间的矛盾拆开了。
自回归图像压缩最烦人的不是“压得不够好”,而是“明明模型很强,推理却慢得像在排队买奶茶”。这篇论文直接不改模型,靠波前并行把串行瓶颈拆开,属于很实用的系统型加速。
这篇论文最有意思的地方,不是又造了一个“更重尾”的噪声,而是直接把问题拆成两半:噪声到底能提供什么,去噪器到底决定什么。结论有点扎心,但很值钱——很多时候,噪声看起来很忙,真正干活的却是条件信息。
量化论文最怕两件事:一是把模型压小了,二是把精度也一起压没了。Quant Experts 这篇的思路很实在,不跟“全局统一补偿”死磕,而是把重要通道分成全局稳定和 token 相关两类,再用共享专家和路由专家分工处理,72B 模型在 W4A6 下还能追回 5.09% 平均精度,确实有点东西。
最狠的地方不是“生成得像”,而是 不用再训练一个新模型 ,直接把多个单条件扩散模型拼起来,就能同时听懂框、点、草图、深度、参考图和文字。更离谱的是,它还敢说理论上条件数量不限。
世界模型最怕的不是预测错一点,而是 看起来很会想,实际上只会顺着状态续写 。这篇论文直接把“长时程想象失败”拆成运动学和动力学两层,诊断味道很足,尤其适合做机器人、自动驾驶和具身智能的人看。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球