端到端自动驾驶:22小时适配变0.9小时,且零在线交互
端到端驾驶系统有个“隐形痛点”:车厂不断升级感知模型,可下游的决策策略一旦重训就是天价成本。上海交大这篇论文直接点题:不重训策略,就用一个轻量“拼接层”把特征空间对齐回来!效果扎实,跨域场景下驾驶分数从34.76飙到89.88,而适配时间从22小时缩到1小时以内。这思路特别实用,喜欢搞工程落地的朋友别错过。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
端到端驾驶系统有个“隐形痛点”:车厂不断升级感知模型,可下游的决策策略一旦重训就是天价成本。上海交大这篇论文直接点题:不重训策略,就用一个轻量“拼接层”把特征空间对齐回来!效果扎实,跨域场景下驾驶分数从34.76飙到89.88,而适配时间从22小时缩到1小时以内。这思路特别实用,喜欢搞工程落地的朋友别错过。
大多数自动驾驶模型都是“一条路走到黑”,直接生成轨迹,却不知道这轨迹未来会导出什么结果。中山大学等机构提出的IRR-Drive模型,让智能体先“预设意图”,再通过预测未来BEV可视化地“反思”一遍,最后才修正轨迹。这种做法在NAVSIM v1/v2两个权威榜单上都拿到SOTA,而且仅用4B参数就能干翻不少8B模型,性价比拉满。
当药物分子库动辄上亿候选物时,那个经典的“找最佳分子”问题瞬间变成了在浩瀚星辰中寻宝。不仅要考虑多个属性,还得在“探索”和“利用”间平衡。这篇论文提出了TTPFTS,第一个真正意义上的“随时”贝叶斯算法,无需预设预算,就能边采样边给出越来越准的帕累托最优解集。更绝的是,在9400万分子的库中,它只用了0.05%的探索量就几乎锁定了全部真实最优解,还自带一个“
大模型能说会道,但遇到要细看图表、小字的地方,经常"看走眼"还"自信满满"。孙海伦团队从"答案熵"入手,发现模型在不确定时会表现出更高熵值,但盲目降熵反而让模型走上捷径。SPOT-E巧妙设计了一个视觉"聚光灯",配合强化学习,只调光照不调模型,让GPT-4o和开源模型在多个密集证据任务上获得稳定提升,思路清奇又实用。
当别人还在苦苦帮你设计的机械手找动作重定向算法时,这篇论文直接让数据决定手本身该长什么样。用400万帧人类指尖运动作为“训练数据”,通过逆向运动学,低门槛地生成出硬件与控制的联合最优解。一个通用手精度吊打商用产品,专用手还能用被动关节省钱减重。妥妥的实用主义顶刊范儿。
让大模型第一步就做对,这要求有点高。但如果允许它错几次,再一步步修正呢? 西北大学联手亚马逊AGI提出的REVES框架,精准点出了当前“测试时扩展”技术的核心瓶颈——训练与推理的“步数”不匹配。它巧妙地通过把“接近正确”的错解转化为修正样本,用单步强化学习高效地训练模型学会自我纠错,在代码、数学上全面领先,还用4B模型在圆球填充任务上追平了8B系统的SOTA
传统视觉编码器(如CLIP、DINOv2)再强大,也是用猫狗图片、风景照训练的,它根本不知道“抓杯子”需要看哪儿。这篇UC Berkeley和NVIDIA的CAIP,用地表最强的“人类第一人称操作视频”(Ego4D等)作为训练数据,让视觉编码器学会了看“手”和“物体接触点”。这招“用人类手部姿态代理机器人动作”,直接让灵巧操作任务成功率飙升30%,而且抗干扰
机器人的左右腿,是不是总被当成两套独立的程序在学?这篇论文的作者们也这么想,于是他们干脆把“对称性”这个物理常识硬塞进了神经网络。结果咋样?一台重达72公斤的机器人,在美国国家航空航天局(NASA)的JPL实验室里也跑不出这么猛的数据——1.63米高台一跃而上,2.13米宽的鸿沟轻松跨过,这波操作,真把四足跑酷玩成了物理定律的炫技。
训练大模型就像带兵打仗,胡子眉毛一把抓只会越训越乱,熵塌陷了解一下?港科大的这篇论文发现了其中的“关键少数”——那些在分布上偏离群体平均的Token才是决定推理方向的决策节点。这套方法原理漂亮,效果更惊艳,只更新10%的Token反而吊打全量训练,是RLVR领域的一股清流。一起来看!
大模型做agent已不新鲜,但让它在真实场景长期部署、边工作边学习、自己积累经验,才是终极形态。阿里CoD论文用强化学习端到端训练LLM学会“连点成线”的元能力,任务序列里第四个任务成功率从28%干到76%,还跨域泛化到没见过的任务上。
在继2026年6月推送过‘自动驾驶新突破!LLM+端到端双系统让无人车学会"老司机"思维’之后,今天Mila、蒙特利尔大学等机构的研究者们又开辟了让AI在虚拟世界里‘自己跟自己飙车’以训练端到端驾驶的新范式。其核心在于用超高速模拟器Gigapixel实现像素级自博弈训练,显著提升了模型的闭环鲁棒性,是应对长尾安全问题的一记猛药。
社区热议(453赞)!这篇2026年6月的论文一针见血地指出:强化学习缺的不是更好的模型,而是一个可以随意采样的合成先验。作者借鉴TabPFN的成功经验,直接把MDP「表格化」,用图注意力网络一通训练,结果在未见过的环境中,6个episode就收敛到最优策略,效率吊打传统上千步的Q-learning。思路极其清奇,简直是给RL基础模型铺路!
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球