告别离散判分:连续概率评分让LLM验证准确率提升至86.5%,零微调超越专用模型
验证是AI的隐藏瓶颈!斯坦福伯克利这篇最新论文,提出LLM-as-a-Verifier,用连续评分取代离散判分,并沿三个维度缩放验证能力。无需训练就在代码、机器人、医学四基准拿下SOTA,GitHub已获近600星。想了解如何让Agent更可靠?这篇值得细读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
验证是AI的隐藏瓶颈!斯坦福伯克利这篇最新论文,提出LLM-as-a-Verifier,用连续评分取代离散判分,并沿三个维度缩放验证能力。无需训练就在代码、机器人、医学四基准拿下SOTA,GitHub已获近600星。想了解如何让Agent更可靠?这篇值得细读。
智能体这波最热闹的地方,不是“会不会做题”,而是“能不能放心交活”。这篇论文直接把话挑明:没有契约、护栏、审计和责任边界,智能体再聪明也只是实验室里的热闹。
长期记忆这件事,很多模型平时看着挺聪明,一到多会话、跨时间、隐式时间表达就开始露馅。RUMBA把俄语场景拆成三轴诊断题,直接告诉读者:到底是忘了、算错了,还是时间没看懂。
开放词汇目标检测最尴尬的地方,不是“看不见”,而是“看见了却只会机械对词”。这篇论文把检测器改造成会做视觉推理的轻量代理,还尽量不把系统搞成大模型重灾区,思路很对路。
代码代理终于不只是“会不会改对”,而是开始认真算“改一次要花多少钱”。这篇 CodeRescue 把失败后的恢复动作拆成可路由、可校准、可控预算的流程,思路很实用,工程味也很足。
代码 Agent 失败后,真正值钱的不是“继续堆算力”,而是先判断这次失败到底适合修、重做还是升级。CodeRescue 的厉害之处在于,它把这个经验判断做成了可训练、可校准、还能按预算切换的路由器。
Agent 不是不会干活,是经常被“工具海”淹没。本文把 MCP 从直连玩成云端网关,顺手把旧 API、协议兼容、工具筛选和会话路由一起收拾了,属于真能落地的基础设施活。
这篇论文不玩虚的,直接拿白盒代码审计任务开刀:同一任务、同一检查项,只改上下文,看看智能体到底是“真会做”还是“靠短记忆硬撑”。结果很扎心,长上下文确实更容易掉链子,但不是所有任务都这样。
这篇 TokCom 很有意思,表面看是 6G 通信,骨子里其实是在把“传比特”改造成“传语义、传 token、传状态”。它真正想解决的不是带宽多一点少一点,而是 AI 系统在边缘、云和多智能体之间怎么更省、更稳地协同干活。
网络事故最怕的不是出错,而是出错时没人比系统更快。微软 Azure 这篇论文把“告警—诊断—修复—验证”做成了多智能体闭环,还真在生产里跑出了 90% 以上的自主解决率,属于能落地的那种狠活。
多模态智能体最怕的不是答错,而是把错的东西“记牢”。这篇论文直接把矛头对准长期记忆:攻击者只改一张图,就能在黑盒条件下把记忆系统带偏,而且五种后端都没能幸免。更关键的是,它把“检索被命中”和“模型真的信了”这两件事分开看,结论很扎实。
Muon 在预训练里已经很能打,但到了强化学习后训练阶段,表现却一直不清不楚。这篇论文不讲玄学,直接拿三种优势估计器和学习率做对照,结果很扎眼:有的场景能涨 88%,有的场景却几乎没戏。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球