IBM巴里理工新作:ORM给Text-to-SQL做验证,最高提4.33%
Text-to-SQL 真正难的不是“生成”,而是“别把错答案挑成正确答案”。这篇论文把 ORM 拉进测试时验证,思路很朴素,但效果相当能打。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1668 篇文章
Text-to-SQL 真正难的不是“生成”,而是“别把错答案挑成正确答案”。这篇论文把 ORM 拉进测试时验证,思路很朴素,但效果相当能打。
VLA剪枝最尴尬的地方,不是剪不动,而是剪完还得靠恢复“补作业”。这篇论文直接把恢复拿掉,用ΔW去找真正该删的参数,思路很硬。
这篇论文最有意思的地方,是它没有继续给模型“加班训练”,而是把问题搬到了测试时:先拆奖励,再重排输出。对偏好对齐、推理加速、树搜索都很友好,属于那种工程味很浓、落地门槛也不高的工作。
这篇论文最实用的地方,不是又造了一个更复杂的对齐模型,而是把“测试时怎么选更符合偏好的回答”这件事讲清楚了。REAR 直接用 base model 自己的概率做奖励分解,省掉额外训练,工程味很足。
联邦图学习最烦的不是没效果,而是模型一张嘴就“说不清证据链”。FedLAB直接把模态证据、节点语义、拓扑上下文拆成三层码本,既能学,也能查,算是把黑箱拧成了可审计的抽屉。
这篇工作最实用的地方,不是“猜一个目标”,而是直接给出 多个可能走向 。对机器人导航、人机协作和自动驾驶来说,这种“别把人想死板”的预测,才更像真实世界。
这篇论文把 CAD 代码生成从“会画个大概”往“能执行、能编辑、能落地”推了一大步。更有意思的是,它不是单模型硬扛,而是让多个异构专家协作,再用强化学习把这些专家的长板拼起来。
移动域上的不可压流体,最烦的不是方程本身,而是域还在动、散度还不能乱。本文把 ALE、空间时间 DG 和 Piola 变换拧在一起,直接把“压力污染速度”这件事按住了。
固定事件概率预测最麻烦的地方,不是“有没有预测”,而是“每次更新到底有没有越改越准”。这篇论文把这个问题变成了鞅和合成PIT值,终于给出了一条能检验的路。
这篇论文不研究机器人“会不会说话”,而是研究它们“为什么要插话、该不该插话”。610条解释日志把LM编排器的调停逻辑摊开给人看,读起来像一份多人协作里的“裁判判词”。
假视频越来越像真视频,传统只看像素伪影的办法已经不太够用了。这篇 DeepMind 的 ReStraV 反其道而行,盯着视频在 DINOv2 特征空间里“走路直不直”,思路简单,效果却很能打。
这篇论文把“边界”和“相位”这两个看起来很学术的词,变成了决定孤子能不能活下去的生死开关。更有意思的是,截断行数一变,表面模的家族就跟着扩容,但稳定性并没有跟着“平均分配”,反而相位选择得很狠。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球