北京理工大学新方法:让模型“说实话”再追求精准
这篇论文把一个很现实的问题挑明了:多模态大模型不是不会说细节,而是细节一多就更容易“翻车”。GRANFACT、层级评测和RP-DPO三件套,正好把“说得更细”和“说得更准”这对老冤家拎到台面上狠狠干一架。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文把一个很现实的问题挑明了:多模态大模型不是不会说细节,而是细节一多就更容易“翻车”。GRANFACT、层级评测和RP-DPO三件套,正好把“说得更细”和“说得更准”这对老冤家拎到台面上狠狠干一架。
这篇论文不玩虚的,直接拿 DeepSeek-R1 教 Qwen2.5-7B 做数学题,结果不是“玄学提升”,而是能稳定涨分,还顺手把“推理长度一缩水,准确率就掉”这件事讲明白了。对想做小模型蒸馏、数学推理和本地部署的人,都挺有参考价值。
Transformer 一直把“记忆”和“预测”塞进同一条链路里,像让一个人一边背台词一边写剧本。康奈尔这篇论文直接把两件事拆开,结果是更低损失、更好泛化,而且推理几乎不涨成本,思路很硬。
长程智能体最烦的不是“想不起来”,而是“想起来了却不知道该把功劳算给谁”。ECHO把记忆选择和信用分配绑在一起,思路很工程,也很实用,尤其适合做搜索、工具调用和深度研究的Agent训练。
这篇论文最有意思的地方,不是又把一个榜单刷高了,而是把“没有标准答案”的优化题,硬生生改造成了可训练的强化学习环境。原始分数不靠谱、频繁样本会抢戏,RiVER都给它摁住了。
这篇论文最有意思的地方,不是把模型从头再训一遍,而是拿一个已经后训练好的111B多语模型,靠三步适配把“会说话”升级成“会办事”。更关键的是,它把韩语回答、英语推理、工具调用和单卡部署这几件原本互相打架的事,硬是捏到了一起。
多模态大模型最烦的,不是不会想,而是训练时偷看答案、推理时却只能裸奔。AMVL直接把这个“作弊窗口”堵上,用双向KL同时管住先验和后验,思路很硬,实验也够实在。
Pocket FM这篇不是单纯“让模型会写故事”,而是把“角色怎么想、世界发生了什么、下一步该往哪走”拆成一套闭环系统。更关键的是,Atlas 还专门负责抓长篇里的情节打脸,终于不是只会写,连自查也安排上了。
热成像检测最烦的不是“看不见”,而是“看见了也不知道它叫什么”。这篇 Thermal-Det 直接把开放词汇、语言引导和跨模态蒸馏塞进热成像里,还真把零样本检测做出了像样的结果,属于能落到真实场景的那种活儿。
这篇论文最有意思的地方,不是“又做了一个剪枝”,而是把ViT到底在看什么这件事,往因果层面往前拽了一步。它不靠重训,直接定位并切掉那些专门走背景捷径的注意力头,思路很狠,实验也够硬。
这篇论文最狠的地方,不是分数有多高,而是它把“高分幻觉”拆得很难看:二元问答能蒙混过关,真到区分相近乐器、长上下文和时间定位时,很多模型立刻露馅。对做音频大模型评测的人来说,这篇更像一份体检单。
内存优化最烦的不是“找不到问题”,而是“找到也修不完”。MOA把这事拆成三段:先从 profiling 里挖出反模式,再自动长出静态检查器,最后批量生成补丁,挺像给性能工程装了一条流水线。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球