让AI学会货比三家?普林斯顿这个基准至今无人超越
这篇被引1300+次的开创性工作,来自普林斯顿大学。WebShop用118万件真实商品和1.2万条人工指令,把“语言智能体”的评测从玩具级任务搬进接近真实的电商场景——AI要自己读懂需求、搜索商品、挑选项、下单。更难得的是,训练好的智能体能零样本迁移到真实Amazon和eBay,是语言grounding方向绕不开的经典基准。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇被引1300+次的开创性工作,来自普林斯顿大学。WebShop用118万件真实商品和1.2万条人工指令,把“语言智能体”的评测从玩具级任务搬进接近真实的电商场景——AI要自己读懂需求、搜索商品、挑选项、下单。更难得的是,训练好的智能体能零样本迁移到真实Amazon和eBay,是语言grounding方向绕不开的经典基准。
24小时动态心电(Holter)是诊断心律失常的金标准,但多模态大模型在超长时序信号面前几乎“失灵”。浙大等团队开源Holtercare-Bench基准与Holtercare-23K数据集,用信号-视频-文本三模态对齐,让GPT-5、Qwen3-VL等模型首次系统性接受“心电马拉松”考验——微调后时序定位准确率飙到99.7%,差距比想象中更大。
想象一个场景:你打算从一家创业公司跳槽去竞争对手那里,拿起手机问AI:“公司能强制执行我的竞业限制协议吗?”它几乎秒回:“竞业限制协议在合理范围内一般可执行,但需结合具体条款判断。
智能体强化学习正处在大模型后训练的核心位置,但PPO太贵、GRPO又存在信用分配短板。本文提出SAPO,用一条自回归流同时搞定策略与价值估计,在ALFWorld和WebShop上比PPO/GRPO平均涨15.1/12.1个百分点,还省掉独立critic、提速33.2%。一句话:值估计的便宜和单采样的高效,这次全都要。
微调大模型,LoRA 省显存但总差口气?中科大新方法 LoRA-GA² 表示:只盯一步梯度确实容易“短视”,多走几步、看看真实的微调轨迹,GLUE 直接反超全量微调,显存还一分不多花。
你的AI助手能记住你三个月前说过"最近改喝零度可乐"这种小事吗?还能看出你最近压力大、回答时自动把语气调到安静模式?南京大学和字节跳动这篇CVPR 2026工作,把"长期记忆+动态人格对齐"做成了完整框架,在自建基准上把GPT-4o都赢了,值得一看。
团队协作研究终于不用「一刀切」了。这篇工作把晚期分块、变点检测和LLM辅助标注串成一条可追溯流水线,在30场VR协作实验中验证:阶段边界检测与交互行为对齐,适合做VR训练、人机协作和沟通分析的朋友读一读。
大模型评测几乎都在用“对错”代替“官方评分”,越南2025年高考的凸性评分直接把这种替代打回原形。本文用632道真题和百万考生真实分布,把模型放进人类排名里比了一次,结果让人捏把汗。
这可能是今年最"考古"的AI基础设施工作:哈佛联手波士顿公共图书馆,把1795到1930年的147万份报纸扫描件,变成163亿token的干净文本。更难得的是,整套流水线设计成工作站级硬件就能跑,租服务器全程只要约2.5万美元——相比云端OCR动辄几十万美元的报价,这性价比简直离谱。对做数据工程、LLM预训练和数字人文的人来说,这篇值得细读。
这就是社区问答(Community Question-Answering,简称CQA)平台面临的真实困境。
本期亮点在于用参数化CAD约束当“探针”,把“可解码、可生成、可影响、可控制”四个层次拆开审计。结果相当扎心——大模型能线性解码几何约束,生成和应用却掉链子。想搞清楚“模型知道≠模型做到”的差距,这篇值得读。
这篇论文干了一件很“较真”的事:当大家都在用LLM给强化学习当“教练”时,它用数学证明了只要奖励塑形方式得当,教练再怎么“瞎指挥”,也改变不了最终的最优策略。不管是做LLM Agent还是RL的读者,都值得看看这份理论保障。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球