过渡级监督来了,LLM Agent记忆更可信了?
LLM Agent 的记忆最怕什么?不是“装不下”,而是“记错了还会一直记”。TRUSTMEM盯住每一次记忆更新的覆盖、保留和忠实度,把训练信号从终点前移到每个过渡步,专治长期记忆里的“慢性病”。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
LLM Agent 的记忆最怕什么?不是“装不下”,而是“记错了还会一直记”。TRUSTMEM盯住每一次记忆更新的覆盖、保留和忠实度,把训练信号从终点前移到每个过渡步,专治长期记忆里的“慢性病”。
长视频最怕的不是“看不懂”,而是“看得懂一点点,却被海量冗余帧淹没”。HPP把感知和推理解耦,让编码型大模型像程序员一样分层探测视频,思路很硬核,成本也更像工程方案而不是玄学。
这篇论文最有意思的地方,不是“又做了个路由器”,而是把推测式解码从 token 级搬到了响应级,还能跨模型、跨厂商、跨架构跑起来。更狠的是,在真实 agentic coding 负载里,成本、延迟、质量居然一起往上走,工程味很足。
这篇 OmniAct 很适合机器人/具身智能方向的读者:它不是把“规划、记忆、执行”揉成一锅粥,而是拆成三层各司其职,专门解决长程任务里最烦的两件事——工具太杂、失败太多。更有意思的是,它在真实家庭场景里把开源模型也拉到了接近商用的表现,思路相当顺手。
阿里和浙大这次没走“单次判断”老路,而是把AI鉴伪做成了一个会看、会判、还会反思进化的智能体。更有意思的是,它不只追准确率,还把推理质量也一起往上拽。
桌面智能体最烦的不是“不会做”,而是“做完了也不知道算不算对”。这篇论文把 VLM 变成自动考官,再把考官的口误做噪声校正,思路很实用,结果也挺扎实,适合想看 Agent 怎么真正学会干活的读者。
这篇论文把“找 Bug”从盲猜升级成了“带诊断报告的定位”。不用训练、不用多智能体吵架,靠一个推理 LLM 加四个仓库工具,就能把定位和修复一起带飞,挺适合喜欢看智能体干活的同学。
自动驾驶里最怕的不是“慢”,而是慢系统该出手时没出手、不该出手时瞎出手。ASSCG把这个老大难问题拆成“查、存、扔”三种动作,思路很朴素,效果却相当能打。
这篇论文把强化学习后的大模型工具调用,拆成了可定位、可操控、还能“溢出”的内部特征。更有意思的是,单个 A 专属特征就能把工具调用能力直接拉满,机制味儿很浓。
很多模型训练时只学顺序推理,一到测试却靠人工搭脚手架(并行采样+投票)来提分,中间有个巨大的“训练-测试”鸿沟。斯坦福这篇Spiral颠覆性地用集合强化学习,让模型边训练边学会如何搜索和如何聚合,把整个推理过程端到端打通了。效果非常硬核,4B模型推理效率吊打传统方法11倍,不愧是Chelsea Finn和Noah Goodman团队的新作!
训练多轮智能体时,GRPO等无评判器方法常常在长序列任务中“失灵”,大家都以为是“长程信度分配”的锅。但龙哥今天带来的这篇工作却一针见血地指出:罪魁祸首是“例行公事”太多!论文首次定义了“决策密度”这个量化指标,并完美推导验证了其与训练信噪比之间的幂律关系。啃完这篇,你对强化学习训练效率的理解会上一个台阶。
让AI画个"某品牌最新概念车"?传统模型直接摆烂。小米团队提出的RS-Gen,专治AI绘图的"知识盲区"和"逻辑短路"。它像个聪明的项目经理,把复杂任务拆解成"先查资料、再想思路、最后画图",关键是不用重新训练模型,即插即用。在WISE基准上,直接把通义千问的基线模型从0.51拉到0.823,效果直逼商业闭源模型,这波开源社区赢麻了。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球