IFT后推理会丢?这篇论文用合并法救回来了
推理模型最怕的,不是不会做题,而是微调完把“会想”这件事顺手弄丢了。这篇论文给出一个很朴素但很能打的解法:先把任务学进去,再把推理习惯捞回来。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
推理模型最怕的,不是不会做题,而是微调完把“会想”这件事顺手弄丢了。这篇论文给出一个很朴素但很能打的解法:先把任务学进去,再把推理习惯捞回来。
Muon 在预训练里已经很能打,但到了强化学习后训练阶段,表现却一直不清不楚。这篇论文不讲玄学,直接拿三种优势估计器和学习率做对照,结果很扎眼:有的场景能涨 88%,有的场景却几乎没戏。
这篇论文最有意思的地方,不是又把黎曼假设拿出来“拜一拜”,而是进一步问:零点之间怎么站队、怎么排队,能不能真的影响素数分布?作者把“零点间距”拉进来后,两个老问题都被往前推了一步,思路很硬,味道也很正。
LLM 幻觉检测最烦的地方,不是“看不出来”,而是“参考样本”和“查询样本”天生不对称。ASK-NN 直接顺着这个现实来做,把近邻检验改成非对称版本,理论和工程都更像样。
这篇论文把实时调度里最经典的吞吐量问题重新翻了一遍:哪些地方能保常数竞争比,哪些地方一换模型就彻底崩掉,边界划得很清楚。更有意思的是,它不是只会“证明不行”,还真的补出了一条可用的 1/5 路线。
这篇论文最有意思的地方,不是又证明了一个“能做”,而是把等距浸入的柔性边界一次性统一了:任意维度、任意余维都能给出同一个阈值公式。更妙的是,它还顺手把薄预应变膜的能量缩放也接上了,数学和力学终于不再各说各话。
细网格一多,显式法就被 CFL 绑住手脚;全隐式法又贵得离谱。这篇论文的思路很实在:高阶 Gauß 隐式 RK 负责精度,预处理 QMR 负责把细网格的拖累压下去,理论和实验都给出了像样的交代。
ODRL这类政策语言,最怕的不是规则多,最怕的是“同一套规则,不同系统各自理解”。这篇论文把评估问题拉回形式化语义,并做出一个能跑、能比、还能处理流式事件的评估器OVAL,属于少见的“理论不飘、工程能落地”。
这篇论文很像在GPU通信里“抠微秒”。看起来只是把延迟从 11.0 微秒压到 2.37 微秒,背后其实是在逼近硬件下限;一旦放进大模型推理链路,省下来的就不只是时间,还有真金白银。
GPU 推理最怕的不是算力不够,而是通信那点“看起来不大、实则很贵”的微秒级开销。NVIDIA 这篇论文把 AllReduce 往硬件极限推,最好只剩约 7% 的误差,vLLM 推理和 cuSOLVERMp 都能吃到红利,属于非常典型的“抠延迟抠出真金白银”的工作。
微撕裂模这类电磁不稳定性,最怕的不是算不出来,而是“局域模型看着没毛病,全局模型却悄悄改了答案”。这篇论文把芯部和台基区放在一起比,直接指出:电流层宽度和层间重叠,才是局域与全局分叉的真正开关。
这篇论文最有意思的地方,不是“看见了喷流”,而是看见喷流在黑洞附近居然不是笔直冲出去,而是先拐弯、再加速、还顺手把视角压到接近正脸。EHT把3C 279的内核区域拍得足够细,细到能把“伪影”和“真结构”分开,这才是硬核。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球