Apple Research最新论文 | Agent Seer:MCP规范零标注变评估集,7套件全覆盖
咱们直接进入正题。当下做企业级AI Agent,说白了就是在跟各种API打交道:日历、项目管理、数据库、通信软件……Agent要干活,就得学会调用这些外部工具。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
咱们直接进入正题。当下做企业级AI Agent,说白了就是在跟各种API打交道:日历、项目管理、数据库、通信软件……Agent要干活,就得学会调用这些外部工具。
多智能体语言模型模拟在社会行为研究中越来越流行。但绝大多数评估只问:智能体有没有坚持扮演分配的角色?却很少有人系统跟踪另一个问题: 智能体用来描述自己的身份设定,会不会被它自己在运行中改掉?
Vibe Coding从Karpathy一条推文变成柯林斯年度词汇,只用了一年。这篇综述把123份证据摊开:+26%的同行实验、-19%的独立实测、+441%的审查时间,三组数字互相打架。想搞清楚AI写代码到底是效率革命还是烂摊子制造机,这篇是目前最全面的地图。
电商推荐系统想离线做策略评估,最缺的就是一个“真实买家”。阿里和人大等团队提出的RecVerse,让模型真的去看截图“逛街”,还配了套三层记忆和轨迹级奖励,模拟出来的购物行为既像真人一样会犹豫比较,又能买到用户真想买的东西,顺手开源了5千多条真实轨迹的交互式基准。做推荐、做用户增长的同学值得一读。
先问大家一个问题:如果你是一个放射科医生,看到一张腹部CT片子,有人问你“肝脏在脾脏的左边还是右边?”,你会怎么回答?
先问大家一个问题:如果你是一个放射科医生,看到一张腹部CT片子,有人问你“肝脏在脾脏的左边还是右边?”,你会怎么回答?
继8月推过单次采样SAPO之后,强化学习训练多轮智能体又有新活。这次厦大和南洋理工的合作工作,只靠“成功轨迹的长度”这一个几乎零成本的信号,就把GRPO平均拔高27.2%,还顺带解决了成功轨迹之间的“优势坍缩”难题,值得一读。
这篇被引1300+次的开创性工作,来自普林斯顿大学。WebShop用118万件真实商品和1.2万条人工指令,把“语言智能体”的评测从玩具级任务搬进接近真实的电商场景——AI要自己读懂需求、搜索商品、挑选项、下单。更难得的是,训练好的智能体能零样本迁移到真实Amazon和eBay,是语言grounding方向绕不开的经典基准。
智能体强化学习正处在大模型后训练的核心位置,但PPO太贵、GRPO又存在信用分配短板。本文提出SAPO,用一条自回归流同时搞定策略与价值估计,在ALFWorld和WebShop上比PPO/GRPO平均涨15.1/12.1个百分点,还省掉独立critic、提速33.2%。一句话:值估计的便宜和单采样的高效,这次全都要。
你的AI助手能记住你三个月前说过"最近改喝零度可乐"这种小事吗?还能看出你最近压力大、回答时自动把语气调到安静模式?南京大学和字节跳动这篇CVPR 2026工作,把"长期记忆+动态人格对齐"做成了完整框架,在自建基准上把GPT-4o都赢了,值得一看。
这篇论文干了一件很“较真”的事:当大家都在用LLM给强化学习当“教练”时,它用数学证明了只要奖励塑形方式得当,教练再怎么“瞎指挥”,也改变不了最终的最优策略。不管是做LLM Agent还是RL的读者,都值得看看这份理论保障。
这年头能见到一篇"把大模型跑不起来的原因逐条列清楚"的论文,真不容易。研究者把Nanbeige4.2-3B在Apple Silicon上五个独立bug连根拔起,还顺手给出分块预填充方案让上下文扩展2.7倍,干货密度极高。想在Mac上玩agent模型的同学,这份排雷报告必须收藏。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球