Cohere与LG CNS新作:111B模型只改三步,韩英智能体更会推理还省显存
这篇论文最有意思的地方,不是把模型从头再训一遍,而是拿一个已经后训练好的111B多语模型,靠三步适配把“会说话”升级成“会办事”。更关键的是,它把韩语回答、英语推理、工具调用和单卡部署这几件原本互相打架的事,硬是捏到了一起。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1668 篇文章
这篇论文最有意思的地方,不是把模型从头再训一遍,而是拿一个已经后训练好的111B多语模型,靠三步适配把“会说话”升级成“会办事”。更关键的是,它把韩语回答、英语推理、工具调用和单卡部署这几件原本互相打架的事,硬是捏到了一起。
多模态大模型最烦的,不是不会想,而是训练时偷看答案、推理时却只能裸奔。AMVL直接把这个“作弊窗口”堵上,用双向KL同时管住先验和后验,思路很硬,实验也够实在。
医学影像里最烦的事之一,就是图像又糊又吵,分割还得硬上。DiSIINet干脆把增强和分割绑成一对“互相打辅助”的双分支扩散模型,思路顺,结果也扎实。
机器人和室内感知一边想“看懂世界”,一边又得守住隐私底线,这事儿一直挺拧巴。UTTO的思路很直接:既然不能看RGB,那就把不确定性当线索,专门修那些“看不稳”的点。
JWST这次不是“看见了几个怪东西”就完事,而是把前200个最重星系按光谱做了一次系统盘点。更关键的是,它直接告诉读者:高红移宇宙里,谁在疯狂长肉,谁已经提前躺平,谁又披着厚厚尘埃装神秘。
这篇论文最有意思的地方,不是又把 Calogero 模型“套”上了一层超对称外衣,而是直接换了一种更难缠的不可分解多重态,结果反而把自旋、耦合和超共形结构一起串起来了。对喜欢看理论物理“怎么把复杂系统拼成一个整体”的读者,这篇很对味。
Halo EFT最烦的地方,不是“算不出来”,而是能量依赖相互作用把标准量子力学框架搅得有点别扭。这篇工作直接换成有限范围势,既保住了EFT的系统性,又把6He的E1谱、半径和实验数据串起来了。
这篇论文不玩虚的,直接把“谱阈值一高,图里到底会冒出多少个坏家伙”这件事算到了最优常数。它把 Mubayi 的经典超饱和结果搬进了边谱世界,还顺手把 Fang–Lin–Zhai 的猜想一并解决,属于极值图论里那种看着冷门、其实很硬的活。
这篇论文最有意思的地方,不是又算出了一个级数,而是把 Andrews 当年的“看起来会交错”的直觉,硬生生证明成了定理。更妙的是,作者还给出了统一框架,说明这类符号规律不是偶然,而是振荡渐近和圆法共同“演出来”的。
Pocket FM这篇不是单纯“让模型会写故事”,而是把“角色怎么想、世界发生了什么、下一步该往哪走”拆成一套闭环系统。更关键的是,Atlas 还专门负责抓长篇里的情节打脸,终于不是只会写,连自查也安排上了。
热成像检测最烦的不是“看不见”,而是“看见了也不知道它叫什么”。这篇 Thermal-Det 直接把开放词汇、语言引导和跨模态蒸馏塞进热成像里,还真把零样本检测做出了像样的结果,属于能落到真实场景的那种活儿。
这篇论文最有意思的地方,不是“又做了一个剪枝”,而是把ViT到底在看什么这件事,往因果层面往前拽了一步。它不靠重训,直接定位并切掉那些专门走背景捷径的注意力头,思路很狠,实验也够硬。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球