北大×小米新方法:施工区域规划更稳了
施工路段最容易把模型训练出的“老司机直觉”打回原形。WorkDrive的思路很直接:先把现场关键事实看清,再把因果链讲明白,最后用一致性奖励把轨迹拽回来,适合关心自动驾驶落地的人细看。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1665 篇文章
施工路段最容易把模型训练出的“老司机直觉”打回原形。WorkDrive的思路很直接:先把现场关键事实看清,再把因果链讲明白,最后用一致性奖励把轨迹拽回来,适合关心自动驾驶落地的人细看。
这篇论文最有意思的地方,不是“能不能遗忘”,而是“遗忘前能不能先把没必要遗忘的删掉”。Apple Research 直接把机器遗忘做成了省算力工程,最高能省下约50%执行时间,思路很实在。
这篇论文抓住了一个很工程、也很扎心的问题:SIFT在普通场景里挺能打,一碰到百叶窗、栅栏这类线性结构就容易“眼神失焦”。Hough-SIFT的思路很直接——先把图像搬到Hough空间,再让SIFT去那里找线索。
这篇论文最有意思的地方,不是“把事件相机加进来”这么简单,而是先把雨和背景拆开,再让两种模态按角色配合。对动态雨天视频来说,这种“先分家,后合作”的思路,比粗暴融合更像正经工程。
这篇论文最有意思的点,不是又堆了一个多模态采样器,而是把“图文互相打架”这件事变成了可修正的过程。文本和图像不再各写各的,而是在同一次去噪里边想边改,挺像老师边讲边在黑板上补笔。
这篇论文最有意思的地方,不是又堆了一个更大的流式模型,而是把“视频”重新解释成了“世界 + 事件流”。这个视角一换,预训练目标、交互形式、行为控制,全都顺了。
束缚能和原子核半径,表面上是两件事,实际上讲的是同一个核系统的“身体”和“体重”。这篇论文最有意思的地方,不是把公式写得更花,而是用1个参数把全球半径趋势和局部结构一起兜住了。
这篇论文专门盯住一个很阴险的问题:正确答案提前露给模型,训练数据就“看起来都对”,但学生模型还是会被带歪。它不是在讨论玄学,而是用一比特实验把锅精准甩给“答案可见”。
这篇论文最狠的地方,不是把RLVR讲明白了,而是第一次把“训练得不错”推进到“理论上也站得住”。更有意思的是,它不是空谈定理,而是拿出一条Progressive RLVR流水线,把压缩、蒸馏、量化一起拧上,真把泛化界做到了能看、能算、还能落地。
一个模型把细粒度动作、长视频问答和直播流主动响应都装进去了,还只用4B参数。更关键的是,模型、代码、训练策略和数据集全开源,社区终于不用对着“半遮半掩”的视频大模型干瞪眼了。
金融问答最怕什么?不是题难,是模型一本正经地把账算错。本文直接把“自然语言讲道理”换成“可执行程序讲道理”,再用执行验证筛掉假把式,7B学生竟然能把72B教师按在地上摩擦,思路很硬,结果也很硬。
这篇不是“又一个理论猜想”,而是把单侧Cl吸附、空穴掺杂、对称性分析和第一性原理算到一起,硬生生把FeSe这类老牌超导材料,改造成了一个可讨论交变磁性的现实平台。更关键的是,620 meV 的自旋劈裂和 10 层 slab 里的鲁棒性,说明它不是纸上谈兵。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球