ASSCG来了:自动驾驶LLM该查、该存、还是该扔?
自动驾驶里最怕的不是“慢”,而是慢系统该出手时没出手、不该出手时瞎出手。ASSCG把这个老大难问题拆成“查、存、扔”三种动作,思路很朴素,效果却相当能打。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
自动驾驶里最怕的不是“慢”,而是慢系统该出手时没出手、不该出手时瞎出手。ASSCG把这个老大难问题拆成“查、存、扔”三种动作,思路很朴素,效果却相当能打。
这篇论文把“无三点共线”这类老牌几何难题,硬生生改造成了一个能跑 MCTS 的搜索问题。更妙的是,它不是只会搜,还会用几何对称性和增量约束把搜索树修得更瘦,挺有工程味道。
在线强化学习最怕什么?不是不会学,而是学着学着突然跑偏。GEOALIGN抓住“高分但方向不对”的rollout,直接在潜空间里做体检,数学推理和对齐任务都更稳了。
这篇论文最有意思的地方,是把“基础模型很强但不好验”这个老大难,拆成了一个能落地的工程问题。大模型负责看图、听话、想任务,小安全模块负责把关,形式化验证只盯住后者,思路很干净。
这篇论文抓住了在线RL最烦人的毛病:明明奖励不低,训练却像坐过山车。GEOALIGN不跟奖励硬刚,而是从“方向”下手,专门揪出那些高分但带偏全局更新的rollout,思路相当清爽。
这篇论文把强化学习后的大模型工具调用,拆成了可定位、可操控、还能“溢出”的内部特征。更有意思的是,单个 A 专属特征就能把工具调用能力直接拉满,机制味儿很浓。
这篇论文专门盯上了离散扩散VLA的“RL卡脖子点”:最终动作的边缘概率算不出来,那就直接优化去噪轨迹本身。思路很硬,结果也很硬,LIBERO和RoboTwin 2.0都打出了能拿出来讲的成绩。
这篇论文把“单个问题慢慢解”改成了“很多问题一起解”,而且还是在GPU上批量跑非线性规划。对机器人、轨迹优化和模型预测控制来说,这种吞吐量思路很实用,属于把优化器从老式单机房,直接拎进了GPU流水线。
这篇论文把“RL到底把工具调用能力藏在哪儿”这件事,直接追到跨编码器里的单个特征上了。更有意思的是,它不仅能定位,还能在推理时把能力拧出来,甚至让基础模型也跟着“蹭到一点”。
这篇论文挺有意思,核心不是让AI帮人飞得更稳,而是让AI知道什么时候该帮、什么时候该收手。宾大这套L2C把“教练”这事做成了强化学习问题,FPV无人机实验也给出了挺硬的结果。
很多模型训练时只学顺序推理,一到测试却靠人工搭脚手架(并行采样+投票)来提分,中间有个巨大的“训练-测试”鸿沟。斯坦福这篇Spiral颠覆性地用集合强化学习,让模型边训练边学会如何搜索和如何聚合,把整个推理过程端到端打通了。效果非常硬核,4B模型推理效率吊打传统方法11倍,不愧是Chelsea Finn和Noah Goodman团队的新作!
训练多轮智能体时,GRPO等无评判器方法常常在长序列任务中“失灵”,大家都以为是“长程信度分配”的锅。但龙哥今天带来的这篇工作却一针见血地指出:罪魁祸首是“例行公事”太多!论文首次定义了“决策密度”这个量化指标,并完美推导验证了其与训练信噪比之间的幂律关系。啃完这篇,你对强化学习训练效率的理解会上一个台阶。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球