阿里USB基准发布:5274条真实购物轨迹,支持多轮强化学习
电商推荐系统想离线做策略评估,最缺的就是一个“真实买家”。阿里和人大等团队提出的RecVerse,让模型真的去看截图“逛街”,还配了套三层记忆和轨迹级奖励,模拟出来的购物行为既像真人一样会犹豫比较,又能买到用户真想买的东西,顺手开源了5千多条真实轨迹的交互式基准。做推荐、做用户增长的同学值得一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
电商推荐系统想离线做策略评估,最缺的就是一个“真实买家”。阿里和人大等团队提出的RecVerse,让模型真的去看截图“逛街”,还配了套三层记忆和轨迹级奖励,模拟出来的购物行为既像真人一样会犹豫比较,又能买到用户真想买的东西,顺手开源了5千多条真实轨迹的交互式基准。做推荐、做用户增长的同学值得一读。
数学解题能力强,不代表真的“懂数字”。这篇NAACL论文把数值能力当成自然语言推理任务来测,一口气跑了49个模型,结果发现数学专用大模型只在算术上占优,数字比较和归一化反而拉胯,值得每一位关注LLM推理能力的读者看看。
大模型修代码的评测大多扎堆Java和Python,冷门系统编程语言几乎没人管。上海交大、浙大这篇OdinEval把目光瞄向Odin语言,用168个真实issue把6个大模型拉出来遛了一圈,还给出了一套可复现性拉满的评测协议。想看看Kimi-K3、GLM-5.2这些模型在陌生语言面前谁更能打,这篇必读。
图表理解长期卡在数据上:规模小、模态不全、代码缺失。MIT、IBM联合开源ChartNet,150万张图表、24种类型、6种绘图库,五种模态完全对齐,居然让2B小模型在图表重建、数据提取上超越GPT-4o,这数据质量有点东西。
想象一下这个场景:一笔并购交易历经数月谈判,终于在截止日前夜敲定了最终条款。此时,一位律师揉着布满血丝的眼睛,逐行核对一份几百页的合同——不是在看条款对不对,而是在找"错别字"级别的硬伤:某个大写术语在这里为什么没大写?
这篇被引1300+次的开创性工作,来自普林斯顿大学。WebShop用118万件真实商品和1.2万条人工指令,把“语言智能体”的评测从玩具级任务搬进接近真实的电商场景——AI要自己读懂需求、搜索商品、挑选项、下单。更难得的是,训练好的智能体能零样本迁移到真实Amazon和eBay,是语言grounding方向绕不开的经典基准。
24小时动态心电(Holter)是诊断心律失常的金标准,但多模态大模型在超长时序信号面前几乎“失灵”。浙大等团队开源Holtercare-Bench基准与Holtercare-23K数据集,用信号-视频-文本三模态对齐,让GPT-5、Qwen3-VL等模型首次系统性接受“心电马拉松”考验——微调后时序定位准确率飙到99.7%,差距比想象中更大。
康奈尔大学CVPR 2026新作,用电影解说视频自动构建8231个问答对,提出无参考评估新范式。结果发现GPT-4o、Claude 3.5等顶级模型看电影,视觉几乎帮不上忙,纯靠字幕反而分更高,值得所有做多模态的人细品。
想象一个场景:你打算从一家创业公司跳槽去竞争对手那里,拿起手机问AI:“公司能强制执行我的竞业限制协议吗?”它几乎秒回:“竞业限制协议在合理范围内一般可执行,但需结合具体条款判断。
如果让一个从来没出过村的老学究,突然面对整个互联网的图片,他会怎么看世界?大概率是懵的。反过来,如果把全世界最聪明的AI模型扔进一座百年图书馆,让它只看一堆发黄的书页扫描件,它也会懵。
说实话,给卧室装监控这件事,绝大多数人心里都会有点抗拒。哪怕你反复强调"视频只在本地处理",老人一句"那我上个厕所是不是也被看见了",直接把你噎回去。但换一种思路呢?
你的AI助手能记住你三个月前说过"最近改喝零度可乐"这种小事吗?还能看出你最近压力大、回答时自动把语气调到安静模式?南京大学和字节跳动这篇CVPR 2026工作,把"长期记忆+动态人格对齐"做成了完整框架,在自建基准上把GPT-4o都赢了,值得一看。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球