多伦多大学EPFL新方法:TRL让推理更像人话
这篇论文最有意思的地方,不是把推理分数再往上拱一拱,而是盯住了一个更现实的问题:模型变强了,弱模型和人却未必跟得上。TRL用“接力式” rollout 把单挑能力和协作可读性尽量绑在一起,思路很工程,也很像真业务会遇到的坑。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,不是把推理分数再往上拱一拱,而是盯住了一个更现实的问题:模型变强了,弱模型和人却未必跟得上。TRL用“接力式” rollout 把单挑能力和协作可读性尽量绑在一起,思路很工程,也很像真业务会遇到的坑。
训练看起来很“正经”,推理却偷偷跑偏,这就是 Flow Matching 里最烦人的暴露偏差。DEFAR 的思路很妙:不把偏差当噪声硬压,而是把它当反馈信号,让模型自己学会纠偏。
这篇论文把“AI写没写代码”这件事,硬生生压成了一个单标记生成问题。看起来很朴素,结果却在OOD榜上拿到0.789,和基线0.305相比,差距有点像“会做题”和“连题目都看不懂”。
可变速率图像压缩的老问题很现实:想要多个码率,就得养多套模型,存储和训练成本都不太讲武德。这篇论文把 LoRA 塞进深度图像压缩网络,做到训练时只动很少参数,推理时还能和主干合并,思路很干净,工程味也很足。
DenseNet真正的短板不是算力,而是显存。本文把“存不下”这个工程老大难拆成共享内存和按需重算两步,硬是把264层模型塞进单机训练里。
这篇论文最有意思的地方,不是去噪本身,而是它把“乘性噪声”硬生生拧成了“对数域里的加性噪声”,再用自监督把训练目标做成等价监督学习。更关键的是,它不是纸上谈兵,最后真把 ICF 这种难缠图像的 PSNR 拉到了 21.41 dB。
这篇 MIT 的论文不跟你争“指数到底是不是 1/3”,它直接把焦点挪到更实用的地方:系数。指数像规矩,系数像手感;前者决定大方向,后者才真管模型怎么长、算力怎么花。
大模型量化里最难啃的骨头之一,就是把权重压到三元还别把精度摔碎。CAT-Q这篇很有意思:不用百亿token重训,靠后训练量化就能把1.7B到235B模型压到1.58比特,且对QAT三元方法也不怵,值得认真看看。
这篇论文把“看视频”拆成了三件事:先粗看定位,再重看细节,最后重答修正。最妙的是,它不用冷启动的长串 CoT 标注,直接靠强化学习把重看能力练出来,省事还挺能打。
这篇论文把“老师盯着学”这件事,做成了一个能自适应收放的安全迁移框架。换道这种高风险任务里,它不只管少撞车,还尽量别把效率一起按进地板里,思路挺顺手。
Ribbon 这篇挺有意思:它不跟传统贝叶斯正面硬刚,而是把“重采样的不确定性”用影响函数线性化,训练一次就能近似多次重训的效果。更妙的是,狄利克雷浓度参数还能拿来做校准,属于效率和鲁棒性都想要的那类方法。
这篇论文专门盯住一个很现实的问题:训练语料里那些“删不干净的重复”,到底会怎么偷走算力。它不只说“重复不好”,还给出了最伤人的重复区间、模型规模趋势,以及一个能把损失翻成算力浪费的尺子,挺实用。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球