认证式投机执行来了:冻结大模型提速2.96倍
这篇论文把“让AI先提案、再由可信核心放行”这件事做成了可认证合同,专治硬约束决策里“快和稳只能二选一”的老毛病。更狠的是,冻结大模型也能被它收编,最后还能在单位调度上换来2.96倍加速。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文把“让AI先提案、再由可信核心放行”这件事做成了可认证合同,专治硬约束决策里“快和稳只能二选一”的老毛病。更狠的是,冻结大模型也能被它收编,最后还能在单位调度上换来2.96倍加速。
老年人出行不是“年轻人缩小版”,这篇论文把这个常识用数据钉死了。更关键的是,它还顺手证明:训练集一旦被多数群体主导,连大模型也会把少数群体的轨迹学歪。
Text-to-SQL 真正难的不是“生成”,而是“别把错答案挑成正确答案”。这篇论文把 ORM 拉进测试时验证,思路很朴素,但效果相当能打。
这篇论文最有意思的地方,是它没有继续给模型“加班训练”,而是把问题搬到了测试时:先拆奖励,再重排输出。对偏好对齐、推理加速、树搜索都很友好,属于那种工程味很浓、落地门槛也不高的工作。
这篇论文最实用的地方,不是又造了一个更复杂的对齐模型,而是把“测试时怎么选更符合偏好的回答”这件事讲清楚了。REAR 直接用 base model 自己的概率做奖励分解,省掉额外训练,工程味很足。
这篇论文把 CAD 代码生成从“会画个大概”往“能执行、能编辑、能落地”推了一大步。更有意思的是,它不是单模型硬扛,而是让多个异构专家协作,再用强化学习把这些专家的长板拼起来。
这篇论文不研究机器人“会不会说话”,而是研究它们“为什么要插话、该不该插话”。610条解释日志把LM编排器的调停逻辑摊开给人看,读起来像一份多人协作里的“裁判判词”。
这篇论文最有意思的地方,不是把 FFN 换成了更“数学”的东西,而是把原本黑箱的中间层,改造成了能直接读出“and / and not / 量词”的逻辑模块。更狠的是,它还把这种逻辑一路做进了语法许可器检测里。
NVIDIA 这篇没有走“越大越强”的老路,而是盯着离散扩散最烦的两个痛点下手:不会自我修正、词表一大就学不动。结果很直接,1024 分辨率文生图拿到 SOTA,训练还更省显存。
连续潜变量推理最大的毛病,不是“不聪明”,而是“说不清、管不住、训不稳”。这篇上海交大的 DLR 直接把潜在状态离散化,还借了渲染压缩的思路,算是把推理模型从黑箱里往外拽了一把。
这篇论文最有意思的地方,不是把机器人做得更“会说”,而是把“会想”和“会动”拆开了。训练时让模型认真做具身思维链,推理时又把这层思考直接跳过,工程味很足,值得细看。
这篇论文把“世界模型”从一次性预测工具,改造成了会自己修正上下文的在线规划助手。最有意思的是,它不改参数,专改记忆和提示词,既省掉在线训练的麻烦,又能把部署时的新经验吃进去。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球