不看全局,每台机器人只花256字节就能预测集群未来?
集群机器人最烦的就是每台各看各的、未来状态对不上账。ITMO这篇CS-JEPA让每台机器人只靠局部观测和单轮256字节消息,独立预测同一个未来集体状态,只给6个全局标注样本就开始见效,拓扑、规模外推和规划价值评估全都能打,值得细读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
集群机器人最烦的就是每台各看各的、未来状态对不上账。ITMO这篇CS-JEPA让每台机器人只靠局部观测和单轮256字节消息,独立预测同一个未来集体状态,只给6个全局标注样本就开始见效,拓扑、规模外推和规划价值评估全都能打,值得细读。
还在发愁机器人规划里怎么设计奖励函数?来自香港浸会大学的这篇论文直接告诉你:不用愁!它从无奖励的演示日志里“挖”出时间距离,让世界模型规划得又快又准,导航成功率直接拉满,操作任务也大幅提升。这正是龙哥一直在说的:比起花里胡哨的模型结构,搞清楚“规划目标从哪来”往往更重要。
大模型驱动的机器人VLA虽然强大,但推理慢、显存高。TurboVLA反其道而行,直接跳过LLM,用双向视觉-语言交互实现32Hz实时控制,仅需0.2B参数和0.9GB显存,性能却比肩甚至超越十亿级模型。机器人部署从此不再高攀不起!
当机器人VLA模型在域外任务中频频翻车,RL²给出了一个既聪明又高效的解法:只在预测到即将失败时,才调用离线强化学习产生的多样化动作来“组合引导”,否则就安心跟着原始VLA走。这项研究不仅揭示了“成功/失败状态缩放定律冰火两重天”的反直觉结论,还在真实机器人上带来了接近30%的成功率提升——关键是,所有模块都是轻量+离线,部署成本极低。值得所有做机器人泛化操
如何让机器人学会像人一样理解物理世界?港浸大团队提出了VisualPatchWorld,它不依赖人工搭建的物理引擎,而是从几个专家轨迹中自动学习可执行的代码级世界模型。这种方法既保留了神经模型的自动化能力,又让模型变得清晰可见、可编辑。
机器人世界模型怎么喂动作?直接喂控制信号?还得自己学动作实现。首尔大学这招妙:先把动作在仿真里走一遍,渲染成机器人几何和深度,然后把"这堆像素"喂给视频模型。模型直接"看见"机器人怎么动,只负责学场景怎么响应。效果嘛——比喂状态向量强一截,还能直接泛化到没见过的机械臂和人类演示。
机器人装配里最容易翻车的,不是“不会做”,而是“太用力”。这篇工作把LLM从“嘴强王者”变成了会给力控设预算、会看力信号选恢复动作的监督器,思路非常工程化。
机器人抓静态物体,大家早就不稀奇了;真正麻烦的是,目标自己在动,策略还在按“刚才的位置”出手。清华这篇 DynaWM 的思路很直接:不去硬改底座 VLA,而是把它吐出的动作块当条件,再结合多视角历史重画轨迹,专治“追着空气跑”。
世界模型最怕的,不是不会预测,而是把“环境自己在变”和“动作造成变化”混成一锅粥。DWM专门盯住这个老毛病下手,训练阶段分开学,推理阶段却不加戏,思路很干净。
抓取这件事最烦的地方,不是“看见了”,而是“看见之后还抓不准”。这篇论文把低成本校准、YOLO识别、立体视觉和视觉反馈串成一条流水线,结果很实在:校准模型在熟悉区域很猛,视觉反馈在全桌面更稳。
机器人操作里最烦的不是“不会动”,而是“会动但总选错那一下”。这篇工作把候选动作选择从依赖 critic 打分,改成了接触前后分阶段的几何进度判断,思路很朴素,但很实用。
世界模型最怕的不是预测错一点,而是 看起来很会想,实际上只会顺着状态续写 。这篇论文直接把“长时程想象失败”拆成运动学和动力学两层,诊断味道很足,尤其适合做机器人、自动驾驶和具身智能的人看。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球