NVIDIA开源Molt:8.6K行代码驯服700B MoE强化学习
给大模型训练强化学习,框架代码动辄数万行,改个奖励函数得绕三天。NVIDIA最新开源Molt,核心RL代码仅8.6K行,但能流畅训练700B规模的MoE模型,性能还跟Megatron-based框架平起平坐。这框架到底有啥魔力?值不值得你的团队迁移?咱们今天就来扒一扒。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
给大模型训练强化学习,框架代码动辄数万行,改个奖励函数得绕三天。NVIDIA最新开源Molt,核心RL代码仅8.6K行,但能流畅训练700B规模的MoE模型,性能还跟Megatron-based框架平起平坐。这框架到底有啥魔力?值不值得你的团队迁移?咱们今天就来扒一扒。
历史文档修复一直是NLP领域的硬骨头,尤其是那些需要外部知识才能确定的古代人名、地名。这篇来自韩国江原大学的工作,巧妙地将RAG与大模型微调结合,不仅让命名实体恢复准确率从个位数跃升至38%,还通过了人类专家的实操检验。对于想做RAG落地或古籍数字化的朋友,值得一读。
历史文档修复一直是难题,尤其涉及专有名词时连GPT-5都容易翻车。韩国江原大学这篇论文把RAG和LLM结合,让模型在修复时自动“查资料”,在朝鲜王朝档案上命名实体恢复率提升近一倍,甚至超过了Gemini-2.5-Pro。代码、模型全部开源,实用价值极高。
历史文档像一本被水泡过的《永乐大典》,人名地名糊成一片,传统MLM模型只能干瞪眼。韩国国立江原大学的团队祭出大招——ARI让大语言模型学会“翻书查资料”,用RAG精准找回那些被岁月抹去的名字。在朝鲜王朝实录的修复中,ARI-32B(Qwen3 32B微调版)在命名实体恢复上直接把GPT-5.1按在地上摩擦,效果翻倍。这不仅是个技术活,更像是在帮AI配一副“历
最近大家都在追怎么让AI“长记忆”,但你有没想过:就算记忆再长,记错关键计算的中间结果、或者被无关干扰冲昏头脑,照样白搭?多伦多大学联合Vector Institute的新工作ArbiGraph,就用一套可验证的任务图,精准拷打了语言代理在复杂流程中的“上下文管理”能力。结果有点扎心:Qwen3.5-27B单做一题数学题94.5%正确,但放进带分支的依赖链里
继2026年6月推送“AI投资天团”之后,龙哥又挖到一篇角色模拟领域的硬核评估论文——GPT-4.1扮演美国选民预测大选,8/9州全中!还能预测你对孩子打疫苗的态度(准到94%)。但别急着欢呼,深入一看,偏见比数据更顽固。这篇工作把角色模拟的“高光”和“暗面”一起扒了个干净,值得每一位关心AI可控性的同学细读。
手术台上,医生盯着质谱仪实时反馈的代谢数据,问AI“为什么判断这里是肿瘤?”——以前只能得到一个黑盒概率。现在皇后大学团队让AI学会自己发现代谢概念,甚至能用知识图谱解释“看到了异常的氨基酸信号”。关键是不需要人工标注概念,这招解决了质谱分析的一大痛点。方法新、实验实、还给出术中案例,值得关注。
验证是AI的隐藏瓶颈!斯坦福伯克利这篇最新论文,提出LLM-as-a-Verifier,用连续评分取代离散判分,并沿三个维度缩放验证能力。无需训练就在代码、机器人、医学四基准拿下SOTA,GitHub已获近600星。想了解如何让Agent更可靠?这篇值得细读。
遥感LVLM看着挺靠谱,但能被一张加了微小噪声的图片骗得认错地物?GeoThreat做到了,攻击成功率飙到88%,比之前最好的方法高出46%。这篇工作不仅是攻击,更是对遥感领域LVLM鲁棒性的警钟。
一篇让数学界看到AI潜力的工作:用ChatGPT-5.6找到了比传统启发式更大的独立集,把C7香农容量下界又推高了那么一丢丢。数字虽小,意义不小——LLM正在学会做真正的数学发现。尽管本地搜索算法和模拟退火苦战三月未果,LLM仅靠对话就突破了关键壁垒。这种"聊天式科研"的范式,会不会成为未来的新常态?
机器人装配里最容易翻车的,不是“不会做”,而是“太用力”。这篇工作把LLM从“嘴强王者”变成了会给力控设预算、会看力信号选恢复动作的监督器,思路非常工程化。
智能体这波最热闹的地方,不是“会不会做题”,而是“能不能放心交活”。这篇论文直接把话挑明:没有契约、护栏、审计和责任边界,智能体再聪明也只是实验室里的热闹。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球