Apple实测:世界模型多塞2.4亿参数,技能发现反而四连跌
在机器人学习圈子里,长期存在一个有点“程序员味”的执念:能不能别让模型把每个动作都当成一行新代码来背,而是像人写程序一样,先把“拿起”“放下”“对齐”这类子技能抽成函数库,遇到新任务直接调用?
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
在机器人学习圈子里,长期存在一个有点“程序员味”的执念:能不能别让模型把每个动作都当成一行新代码来背,而是像人写程序一样,先把“拿起”“放下”“对齐”这类子技能抽成函数库,遇到新任务直接调用?
拍文档照片最怕什么?阴影、模糊、歪斜、摩尔纹——哪怕是最强多模态模型也会当场翻车。直接拿恢复工具全图修一遍?可能越修越糟糕。华南理工这篇论文给了个聪明的解法:让模型自己判断“现在能不能答”,不能答再精准修复,修坏了还能自动回滚。全程免训练,效果逼近人类专家。
当开源视频数据集还在几百万视频级别徘徊时,LAION直接把数字拉到了8000万视频、1000万小时,还一口气验证了视频、音频、图像三种模态的预训练效果。这种级别的数据弹药,对做多模态研究的团队来说,值得好好研究。
单张照片就能告诉机器人“杯子把手在哪、椅子坐哪里”?同济大学与中科院最新开源AfordAny,把开放世界3D功能定位做成了端到端流水线,473类基准直接拉满。
史上最亮伽马暴GRB 221009A飞过天际时,IXPE用了三天才转过头,偏振只能给出一个上限;而规划中的EXPO能在约50秒内自主重指向,把"上限"变成"精度"。这篇文章讲的就是这台把X射线偏振能段拓宽4倍、重指向快8000倍的下一代空间天文台。
这篇来自Apple的新研究直接把“视觉思维”做进了训练:模型在训练时预测未来帧的潜在表示,推理时不再生成中间图像,端到端延迟比显式视觉CoT降低5倍以上,同时在6个评测设置上稳定超越纯文本后训练。对视频理解、实时预测和统一多模态模型感兴趣的同学值得细读。
图表理解长期卡在数据上:规模小、模态不全、代码缺失。MIT、IBM联合开源ChartNet,150万张图表、24种类型、6种绘图库,五种模态完全对齐,居然让2B小模型在图表重建、数据提取上超越GPT-4o,这数据质量有点东西。
康奈尔大学CVPR 2026新作,用电影解说视频自动构建8231个问答对,提出无参考评估新范式。结果发现GPT-4o、Claude 3.5等顶级模型看电影,视觉几乎帮不上忙,纯靠字幕反而分更高,值得所有做多模态的人细品。
这篇论文把“谁来判断压缩图像好不好”这个老问题翻出了新花样。斯坦福和谷歌团队发现,Gemini 2.5-Flash这类通用视觉语言模型,竟然能零样本复现人眼的相似度判断,干脆把它请来当裁判,用偏好优化把扩散自编码器训得更懂人眼。结果在多个基准和上万次用户评测里直接干到第一梯队。想看看VLM怎么当评委、这条路能省多少人工标注成本?这篇值得一读。
多模态大模型“一本正经地胡说八道”是落地最大痛点之一。这篇CVPR 2026论文把幻觉拆成“感知偏差”和“推理漂移”两类,用不到1%的额外计算找到该加强的注意力头,平均提分4.2%且完全无需训练,插拔即用,值得所有做多模态推理的团队收藏。
传感器掉线、字幕丢失、画面损坏……LVLM一遇模态缺失就肉眼可见地“降智”。这篇TTSD-FAR偏偏只更新0.629%的参数,就把50%文本缺失下的F1从趴窝的0.4785拉回0.5124,还顺手解决了持续适应的漂移问题。方法不算复杂,思路非常实用,值得所有做多模态落地的朋友读一读。
当大模型学会“思考”后,机器人也该学学“先想后做”了。本论文把大模型里的测试时计算扩展到了机器人子任务规划中,用世界模型预测、价值模型评分、束搜索择优,让机器人在面对长时程任务时不再“走一步算一步”。四项真实世界长时程任务平均成功率45%,值得所有做机器人决策的朋友读一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球