Stanford新方法:机器人偏好学习告别“总分制”
机器人偏好学习最烦的不是“没数据”,而是“数据看起来很多,实际全在讲废话”。这篇 FPL 直接把偏好拆成速度、安全、质量等自然语言轴,监督更细,策略也更会“看脸色”了。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
机器人偏好学习最烦的不是“没数据”,而是“数据看起来很多,实际全在讲废话”。这篇 FPL 直接把偏好拆成速度、安全、质量等自然语言轴,监督更细,策略也更会“看脸色”了。
世界模型最怕的不是不会算,而是算着算着就跟现实脱节。AdaJEPA把自适应塞进MPC闭环里,用一次梯度步就能边规划边纠偏,思路很朴素,但很实用。
内存优化最烦的不是“找不到问题”,而是“找到也修不完”。MOA把这事拆成三段:先从 profiling 里挖出反模式,再自动长出静态检查器,最后批量生成补丁,挺像给性能工程装了一条流水线。
VLA剪枝最尴尬的地方,不是剪不动,而是剪完还得靠恢复“补作业”。这篇论文直接把恢复拿掉,用ΔW去找真正该删的参数,思路很硬。
这篇论文最有意思的地方,是它没有继续给模型“加班训练”,而是把问题搬到了测试时:先拆奖励,再重排输出。对偏好对齐、推理加速、树搜索都很友好,属于那种工程味很浓、落地门槛也不高的工作。
这篇论文最实用的地方,不是又造了一个更复杂的对齐模型,而是把“测试时怎么选更符合偏好的回答”这件事讲清楚了。REAR 直接用 base model 自己的概率做奖励分解,省掉额外训练,工程味很足。
连续潜变量推理最大的毛病,不是“不聪明”,而是“说不清、管不住、训不稳”。这篇上海交大的 DLR 直接把潜在状态离散化,还借了渲染压缩的思路,算是把推理模型从黑箱里往外拽了一把。
自动驾驶最难的不是“会开”,而是“开错了怎么补课”。R2LPL把闭环里的错误当成教材,再用终身学习把知识存住,思路很务实,尤其适合关心落地和长期迭代的人。
扩散模型最怕的不是算力,而是数据里混进来的“脏样本”。这篇论文很实在:不改大结构,只把去噪损失换成散度诱导的加权形式,就把鲁棒性做出来了。
这篇论文最有意思的地方,不是又造了一个“更会猜答案”的模型,而是把离散流模型硬生生改造成了会自我验证、会自我修正的推理器。数独上 7 次前向传播到 99.2%,还把 OOD 难题一起带飞,值得细看。
NVIDIA这篇不是简单给扩散语言模型“加速”,而是直接把上下文表示和去噪职责拆开,思路很工程,也很务实。30B 混合架构上还能保住 98.7% 质量、提速 2.42 倍,这种结果值得认真看。
这篇论文最有意思的地方,不是又堆了一个更大的自动驾驶模型,而是把“中间表示”当成了真正要训练的对象。它把视频生成、轨迹规划和安全边界三件事拆开处理,结果还真把收敛速度和闭环表现一起抬起来了。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球