大模型零遗忘新范式Brainstacks:医疗提问97%路由到数学堆栈
这篇论文最有冲击力的地方,不是零遗忘的堆栈设计本身,而是那个反常识的发现:医疗提示在97%的情况下会路由到聊天+数学堆栈——它们训练时根本没见过医疗数据。这说明微调注入的是可迁移的认知原语,而不是领域知识。思考方式被当作"能力"打包,这件事值得所有做微调的人停下来想想。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有冲击力的地方,不是零遗忘的堆栈设计本身,而是那个反常识的发现:医疗提示在97%的情况下会路由到聊天+数学堆栈——它们训练时根本没见过医疗数据。这说明微调注入的是可迁移的认知原语,而不是领域知识。思考方式被当作"能力"打包,这件事值得所有做微调的人停下来想想。
继8月推过单次采样SAPO之后,强化学习训练多轮智能体又有新活。这次厦大和南洋理工的合作工作,只靠“成功轨迹的长度”这一个几乎零成本的信号,就把GRPO平均拔高27.2%,还顺带解决了成功轨迹之间的“优势坍缩”难题,值得一读。
当数学家遇上ChatGPT,会碰撞出什么火花?这篇论文研究p进一般线性群GL(2n,F)中间超尖点表示的局部朗兰兹对应,在p∤2n的温和条件下给出了朗兰兹参数的显式描述。有意思的是,最终公式的化简是在ChatGPT帮助下完成的——纯数学研究也开始用AI助攻了!
大模型修代码的评测大多扎堆Java和Python,冷门系统编程语言几乎没人管。上海交大、浙大这篇OdinEval把目光瞄向Odin语言,用168个真实issue把6个大模型拉出来遛了一圈,还给出了一套可复现性拉满的评测协议。想看看Kimi-K3、GLM-5.2这些模型在陌生语言面前谁更能打,这篇必读。
太赫兹波束的形状和偏振,过去基本是“材料说了算”,这篇论文却把主动权交还给光本身:用飞秒矢量光束在半导体里“写”出想要的电流分布,正向能发射,逆向能设计,相当于给太赫兹波束装了个可编程旋钮。物理图像清晰,思路清奇,值得一读。
高电荷电子束是激光等离子体物理的“硬通货”。这篇论文用黑腔软X射线预热泡沫靶,把电子束电荷量做到数百nC/sr,比固体靶提升一两个数量级,还实现了参数可调谐,是解决DLA可控性难题的漂亮思路。
龙哥第一眼看到这篇论文时,注意力完全被标题吸引住了:Basilica群?等等,这不是那个以"教堂"命名的数学对象吗?一个代数结构居然用建筑风格来命名,这背后肯定有故事。
量子计算要上万比特,第一道坎居然是怎么把控制信号送进稀释制冷机。中科大团队用一根光纤替代一束同轴电缆,在4K温区用光电二极管重构信号,单比特门保真度冲到99.915%,双比特门也到了99.676%,达到表面码纠错阈值。这套方案向下兼容现有控制系统,实属工程落地典范。
想象一下这个场景:一笔并购交易历经数月谈判,终于在截止日前夜敲定了最终条款。此时,一位律师揉着布满血丝的眼睛,逐行核对一份几百页的合同——不是在看条款对不对,而是在找"错别字"级别的硬伤:某个大写术语在这里为什么没大写?
数学的世界里,总有一些数字“不守规矩”。在双曲流形上,拉普拉斯算子的谱由连续谱和离散特征值组成,但在连续谱门槛ρ²之下,偶尔会潜伏着几个特殊的特征值。
重离子对撞后,先问一个问题:人类目前最昂贵的实验装置之一——欧洲核子研究中心的大型强子对撞机(LHC)——把两个重原子核加速到接近光速然后对撞,这个过程产生的“夸克-胶子等离子体”,为什么能在比预期热化时间短得多的时刻,就表现出完美的流体行为? 这个“意外地快速进入流体力学描述”的现象,被物理学家命名为流体动力学化(hydrodynamization)。
低资源语言的NLP工具一直是老大难,这篇来自地拉那大学的论文直接用本地Gemma 4搭了一条媒体偏见分析流水线,在8358篇阿尔巴尼亚语新闻上把人物实体召回率做到70.3%。更妙的是提示词对比实验:严格校验虽然消灭了标签不一致,但覆盖率几乎腰斩。看完只想说,工程里没有万能的prompt,只有合适的取舍。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球