← 返回 PaperDaily 大模型与智能体

阿里USB基准发布:5274条真实购物轨迹,支持多轮强化学习

电商推荐系统想离线做策略评估,最缺的就是一个“真实买家”。阿里和人大等团队提出的RecVerse,让模型真的去看截图“逛街”,还配了套三层记忆和轨迹级奖励,模拟出来的购物行为既像真人一样会犹豫比较,又能买到用户真想买的东西,顺手开源了5千多条真实轨迹的交互式基准。做推荐、做用户增长的同学值得一读。

阿里USB基准发布:5274条真实购物轨迹,支持多轮强化学习
原论文信息如下:
论文标题:
Towards Faithful Simulation of Human Shopping Behavior
发表日期:
2026年08月

发表单位:
中国人民大学高瓴人工智能学院、中国科学院大学、新加坡国立大学、阿里巴巴集团

原文链接:
https://arxiv.org/pdf/2608.20707v1.pdf

购物模拟为何如此困难?——记忆与优化的双重挑战

想象一下,你打开手机淘宝,从首页推荐流一路刷下去,点开几个商品详情页,对比一下价格和评价,犹豫再三,把一件东西放进了购物车,最后可能下单也可能关掉App走人。这一连串动作,在推荐系统工程师眼里,就是一条“用户浏览轨迹”。如果能用AI把这条轨迹逼真地模拟出来,推荐系统就能在不上线、不打扰真用户的前提下,离线做策略评估、做反事实推演,甚至给强化学习推荐模型当训练环境。
这个想法并不新鲜。早期的规则模拟器(比如RecSim)用概率模型描述用户状态和物品特征,但预设的动作空间根本装不下现代电商界面的复杂交互。后来LLM智能体登场(RecAgent、Agent4Rec这些),能推理、能带人设,但它们只看得懂文字描述,忽略了屏幕上真正左右用户决策的图片布局。再后来,GUI智能体终于学会了“看截图”(比如A/B Agent和STA),把观察模态拉到了和真实用户一样的水准。听起来一步到位了,对吧?
但问题恰恰藏在这个“看”字背后。一篇论文指出了两个被大多数工作忽略的硬骨头:记忆挑战和优化挑战。
先说记忆。一次真实购物会话往往要翻几十屏,用户在第三屏点开的商品,可能直到第十五屏才决定要不要买。中间隔着大段浏览历史,如果模型把这些历史全部塞进上下文窗口,token爆掉不说,长上下文研究早就证明:塞得越多,模型越“迷失在中间”,仿真质量反而下降。图1非常直观地展示了这个现象——随着视觉记忆片段增加,准确率先升后降,token成本却一路飙升。
图1:多模态上下文中视觉记忆片段增加的影响。准确率起初提升,但超过中等上下文长度后出现收益递减甚至轻微下降,而token成本持续增长。
再说优化。现在的主流做法是模仿学习——每一步都让模型预测“用户日志里下一步做了什么”,然后拿这个下一步动作的准确率当监督信号。听起来没毛病,但真实用户的浏览行为里充满了“噪声”:手滑多翻了一屏又翻回来、点进详情页发现不感兴趣马上退出。强行拟合这些噪声,模型反而学不会用户的真实意图。更要命的是,单步监督完全管不住“整段轨迹像不像真人”——有的模型变成“疯狂点击狂魔”,有的变成“只看不买高冷用户”,这些病态模式在单步loss里根本看不出来。
这就像学开车只看教练踩油门的瞬间动作,却不管整个路线的走向——练出来的“司机”要么油门焊死,要么刹车踩穿。😏
shaona
正是看准了这两大痛点,来自阿里巴巴集团、中国人民大学高瓴人工智能学院、中国科学院大学和新加坡国立大学的研究团队,提出了RecVerse——一个GUI感知、带三层记忆、用轨迹级强化学习优化的用户行为仿真智能体。它还有个响亮的口号:“让模拟用户的行为轨迹,逼近真实用户的浏览分布。”

RecVerse:让AI学会像人一样“逛”电商

RecVerse的整体架构如图2所示。它的核心洞察其实很简单:忠实模拟用户购物行为,需要两个现有智能体普遍缺失的能力——第一,能在长会话中持续演进的结构化记忆;第二,能跳出单步正确性、从整条轨迹层面优化的训练目标。
图2:RecVerse总览。每一步,智能体感知页面截图,读取多级记忆,并同时输出环境动作和记忆更新。记忆层级包括:①工作记忆,用于瞬时视觉空间上下文;②情景记忆,用于会话级行为轨迹;③偏好记忆,用于提炼高层用户意图。记忆更新本身属于动作空间的一部分(记忆即动作),与环境动作联合学习。智能体通过轨迹级强化学习进行端到端优化,包含两个互补信号:(a)宏观奖励,对齐聚合的物品相关行为分布;(b)微观奖励,进行意图加权的品类对齐。
从数据流角度看,RecVerse在每一个时间步t做的事情是:接收当前页面的像素级截图o_t,从上一时刻的记忆状态M_{t-1}中读取信息,然后由策略模型π_θ联合输出三样东西——内部推理z_t(反映用户当下的心态,比如“这东西有点贵,再看看别的”)、环境动作a_t(比如滑动、点击、加购)、记忆更新m_t(决定往记忆里写什么、更新哪条偏好)。这个“记忆即动作”的设计非常巧妙,它把记忆管理从手工规则中解放出来,让模型自己在强化学习过程中学会“什么时候该记、该记什么”。

三层记忆系统:从视觉印象到深层偏好

认知科学早就告诉我们,人类浏览网页时不是把历史当流水账记的。视觉印象、会话事件、长期偏好,这三种
记忆系统各司其职,正好对应RecVerse设计的三层记忆结构。用一句话概括:工作记忆负责“眼前”,情景记忆负责“刚才”,偏好记忆负责“一直想要”。
先从最底层的工作记忆(Working Memory)说起。它维护的是一个容量受限的FIFO(先进先出)队列,只保留最近K步的浏览记录,形式化定义如下:
工作记忆公式
每个条目包含三部分:v_i是这一屏的视觉印象,z_i是模型推理出的用户心态(比如“这款稍贵,再看看”),a_i是当时的操作。当新条目进来,最早的被顶出去,模拟人类视觉记忆的短暂性和容量瓶颈。RecVerse的每一步决策,首先就是基于这个“最近几屏”的视觉工作区来做出。
再往上一层是情景记忆(Episodic Memory),保存的是会话级行为事件的文本记录:
情景记忆公式
关键在e_t的生成方式——RecVerse把“是否生成新记录”也放进了动作空间。模型每走一步可以决定:这一屏值不值得记?如果要记,记什么?整套记忆写作策略完全由强化学习优化而来,而非靠人工规则预设。这种“记忆即动作”(Memory-as-Action)的设计,是论文里很灵性的一笔。
最顶层是偏好记忆(Preference Memory),做的是更高层次的意图蒸馏:
偏好记忆公式
偏好记忆不记录“发生了什么”,而提炼“用户在想什么”。比如它可能沉淀出“用户偏好200元以下、浅色系、轻薄面料”这种高度浓缩的判断。这个抽象过程让超长会话中的用户状态变化被持续收敛成几条可读的高层描述,不会随浏览页数增长而膨胀。
三层记忆联动起来的效果是什么?工作记忆负责给当下感知提供锚点,情景记忆保证跨页面的行为逻辑可追溯,偏好记忆则让模型在几十步之后依然能记得“这趟进来到底想买什么”。这种分层压缩的思路,本质上是用“遗忘”换“记住”——主动丢掉无关的原始帧,留下浓缩过的认知线索。

轨迹级强化学习:从“模仿动作”到“对齐意图”

记忆系统解决了“拿什么去推理”的问题,训练目标解决的是“按什么标准去优化”。
RecVerse的训练分两个阶段。第一阶段是模仿学习(Imitation Learning, IL)热启动:
模仿学习目标公式
这个阶段直接最大化真实用户动作的对数似然,目标是让模型快速掌握基本的“界面操作手感”。但从前面的分析可以知道,单靠模仿学习会让模型陷入“过拟合噪声+整体分布走形”的困境。于是第二阶段用强化学习来精调。
RL框架采用GRPO(Group Relative Policy Optimization,组相对策略优化)——一种不需要训练价值网络的策略优化方法。给定同一个起始状态,模型生成G条完整轨迹,然后通过组内比较计算每条轨迹的优势值:
GRPO优势估计公式
这条公式直观上就是“我的奖励比同组平均水平高多少”,高于平均就给正向推力,低于就给负向拉力。GRPO在训练中天然自带“相对比较”,很适合轨迹质量的排序优化。
RecVerse真正的杀手锏是奖励设计。论文把轨迹级奖励拆成三个部分,先看宏观奖励R_macro:
宏观奖励公式
这里A是参与统计的物品相关动作类型集合,比如点击、加购、购买;N_a统计类型a在轨迹中的出现次数;τ是模型生成的轨迹,τ*是真实用户轨迹。公式对比的是两类轨迹在行为计数上的分布差异,差异越大,负向惩罚越重。这一项的作用是压制“过度探索型”和“过度被动型”的病态行为分布。
再看微观奖励R_micro,它评估每个物品相关动作是否符合购物意图:
微观奖励公式
w(a)是意图强度权重,比如购买行为的权重高于单纯点击;r(a)是层级类别匹配分,把动作关联的物品x_a与真实轨迹中的物品集合按三级类目体系做匹配:
层级类别匹配分数公式
L是类目层级深度,c_l[·]取第l层类目标签。这个设计的妙处在于:它不要求模型精确点中用户买的那一个商品,只要类目层级对上就给奖励——既符合电商里“有多个合理替代品”的现实,又能给RL提供更密集的反馈信号,缓解GRPO优化中的稀疏奖励问题。
加上一个格式奖励R_format保证输出可解析、动作可执行,总奖励写为:
总奖励公式
其中λ是平衡系数。可以看到,R_macro管“整个轨迹的统计长相像不像真人”,R_micro管“每个关键动作是不是买对了方向”,两者一个管宏观、一个管微观,配合起来就把“真实感”和“意图度”都拉住了。

USB基准:首个支持多轮强化学习的购物模拟数据集

要说RecVerse能在这个任务上做出成绩,离不开一个关键支撑——USB(User Simulation Benchmark,用户模拟基准),这是论文团队从东亚某大型电商平台采集的大规模GUI购物轨迹数据集。它包含5274条真实的用户浏览轨迹、69842条动作记录和90095件被浏览物品。表1汇总了数据集的关键统计量。
表1:USB概览统计,分别按轨迹、物品和用户维度展示。
动作空间覆盖8种类型:向下滚动、向上滚动、点击、进入详情页、返回、加购、购买、终止会话。商品按三级类目组织——41个一级类目、517个二级类目、2256个三级类目,图3展示了L1/L2/L3三层类目的分布情况。每位用户还带有画像信息(年龄、性别)和近期交互历史(最近点击与购买记录),为个性化模拟提供了数据基础。
图3:USB的类目分布分析。(a)(b)(c)分别展示L1、L2、L3级别的前10类目,(d)展示采样类目的词云,字号与出现频率成正比。
USB最大的价值在于“可交互”。对比表2可以看到,Amazon、MovieLens这些老牌基准只有单一交互类型且没有视觉上下文;Qilin和OmniBehavior虽然动作类型丰富了,但观察模态仍停留在文字层面;OPeRA虽有GUI轨迹,却只是静态离线日志,不支持智能体与环境互动。USB是第一个同时兼备GUI视觉轨迹、多样动作类型、用户画像和交互式多轮RL环境的用户模拟基准——这相当于把“只能看录像回放”升级成了“可以进训练场真练”,对做强化学习推荐研究的团队来说意义很大。
表2:用户模拟基准的特性对比。Visual Traj.:提供GUI级截图作为观察;Diverse Actions:支持超越评分的多种动作类型;User Profile:包含用户属性用于个性化模拟;Multi-Turn Agentic RL:支持带交互式视觉反馈的多轮智能体强化学习。
值得一提的是,USB的数据采集和交互环境构建都相当完整:轨迹层记录了完整的浏览动作序列,物品层提供三级类目体系,用户层还带画像特征。表1中可以看到,平均每条轨迹13.24步,用户的平均点击历史356.48次、购买历史10.36次,这些统计量的存在意味着USB不只是“动作记录”,而是真正能支撑起个性化模拟研究的完整数据底座。

实验结果:行为更真实,意图更一致

实验部分,论文把RecVerse和文本方法(RecAgent、Agent4Rec、OPeRA、AlignUSER、Shop-R1、Customer-R1)以及GUI方法(A/B Agent、STA)做了全面对比。表3给出完整结果。
表3:总体评估性能。TF、IL、RL分别表示训练提示、模仿学习、强化学习。除ATL外所有指标均以百分比报告。红色行表示方法因过度活跃模式而显著偏离真实用户,蓝色行表示RecVerse变体。意图一致性指标中,加粗表示各模态组内行为可比方法中的最佳分数。
先看一个容易被表面数字蒙住的坑:RecAgent和Agent4Rec的意图指标看起来并不差,但看它们的ACR(加购率)、CVR(转化率)、IPVR(详情页访问率),比真实用户高出一大截。图4把各方法的行为统计相对真实用户做了归一化展示,一眼就能看出这两兄弟稳稳落在“过度活跃”区间。
图4:按真实用户统计归一化的行为保真度对比。每个点表示某方法行为统计与对应真实用户值的比率。阴影区域区分过度活跃、高保真和欠活跃行为区间。
meng
也就是说,它们的高命中率是靠疯狂点击和加购“刷”出来的,根本不是被模拟用户的真实意图驱动。论文特意用红色标出这类方法,提醒读者:意图指标必须结合行为保真度一起看,否则就是数字游戏。
在行为分布真正和真实用户落在同一高保真区间的模型里,RecVerse的优势就很突出了。从文本切到GUI,HCO(层级类目重叠度)从19.03升到30.00(IL阶段),说明像素级截图确实提供了文本描述里没有的视觉证据;叠加轨迹级RL后,相比最强GUI基线STA,RecVerse把item级F1从4.27提升到7.19,命中率从5.92提升到10.45,HCO从23.11提升到32.64,提升幅度相当可观。
消融实验进一步拆解各模块的贡献,如图5所示。
图5:RecVerse消融分析。(a)记忆消融:完整记忆层级对比移除偏好记忆(PM)或仅保留工作记忆(WM)的变体。(b)RL奖励消融:评估宏观和微观奖励的贡献,各项分数相对完整模型归一化。
图5a显示,去掉偏好记忆或只保留工作记忆,各项指标明显下滑,尤其意图一致性指标掉得更狠——光靠最近几屏的视觉印象撑不起跨页面的稳定购物意图。图5b显示,去掉微观奖励对意图指标的伤害最大,说明光对齐宏观行为分布学不到细粒度购物意图;去掉宏观奖励则相对轻一些,但也削弱了对病态行为模式的约束。这两组消融刚好互相印证:三层记忆和两类奖励是配套设计的,缺一个都会让模拟“走样”。
论文还做了人类评估实验,图6展示了成对轨迹偏好判断的结果。
图6:成对偏好判断的人类评估。标注者比较RecVerse、STA和真实用户生成的轨迹,条带越大表示该侧方法的偏好率越高。
标注者在比对RecVerse、STA生成的轨迹与真实用户轨迹时,RecVerse被误判为真人的比例最高,说明它生成的行为已经很难和真实用户区分。图9的案例研究更是直观展示了RecVerse在真实浏览会话中的推理过程:模型产出的心智链条里既有“价格有点超出预算”的犹豫,也有“换一个类似款”的比较,偏好记忆里也沉淀出“用户偏好轻便款”这种高层判断——这种“像人一样思考”的过程,正是之前模拟器里最稀缺的部分。
图9:RecVerse在真实浏览会话中的案例研究。示例展示了RecVerse与真实用户之间对齐的动作轨迹,以及支撑购买决策的生成心智能量和偏好记忆。
另外,表4对奖励系数λ做了敏感性分析,结果显示RecVerse在λ合理取值范围内表现稳定,没有出现一调参就崩盘的脆弱情况。
表4:奖励系数λ的敏感性分析。ΔATL相对真实用户平均轨迹长度计算。
从Qwen3.5-2B换到Qwen3.5-4B(图7),各指标进一步提升,说明方法还具备随基座模型升级而继续变强的潜力。
图7:从Qwen3.5-2B扩展到Qwen3.5-4B在行为保真度和意图一致性指标上的表现。
综合来看,RecVerse的实验结论清晰:GUI感知带来了视觉信号,三层记忆保持了长程意图,轨迹级RL修正了整体行为分布——三者缺一不可。这种“层层设防”的设计思路,最终把模拟用户的购物行为逼到了和真实用户几乎无法区分的地步。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?电商用户行为仿真迎来新突破。阿里等团队提出RecVerse,用认知启发三层记忆加轨迹级强化学习,让AI智能体在GUI购物页面中生成更真实的多轮浏览轨迹;并发布首个支持交互式多轮强化学习的电商数据集USB,行为保真与意图一致性均大幅
这篇工作最值得看的点是什么?RecVerse-GUI在RL设置下显著优于所有基线,在意图一致性指标上大幅领先(F1从4.27提升到7.19,HR从5.92提升到10.45,HCO从23.11提升到32.64),同时行为保真度接近真实用户分布。
这篇工作的边界或风险在哪里?优点:(1)创新性地提出认知启发的分层记忆系统,有效解决长序列浏览中的记忆挑战;(2)将记忆更新作为动作空间的一部分,通过RL学习何时记忆和记忆什么;(3)提出轨迹级RL框架,从宏观和微观两个层面对齐真实用户行为;(4)发布了首个支持多轮智能体强化学习的GUI购物模拟基准。缺点:(1)依赖Qwen3.5-2B作为骨干,模型规模较小可能限制模拟能力;(2)人工评估显示与真实用户仍有差距(74%偏好真实用户);(3)记忆系统的设计增加了模型复杂度,训练成本较高。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出RecVerse,一个基于GUI的购物行为模拟智能体,通过认知启发的分层记忆系统(工作记忆、情景记忆、偏好记忆)和轨迹级强化学习目标,实现忠实于真实用户的浏览行为模拟。

实验合理度:★★★★☆

行为保真度指标(ATL、CTR、IPVR、ACR、CVR)和意图一致性指标(HR、P、R、F1、CP、CR、HCO),以及人工评估。

学术研究价值:★★★★☆

提出RecVerse,一个基于GUI的购物行为模拟智能体,通过认知启发的分层记忆系统(工作记忆、情景记忆、偏好记忆)和轨迹级强化学习目标,实现忠实于真实用户的浏览行为模拟;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确给出具体FLOPs,使用Megatron-LM框架进行分布式训练,vLLM加速rollout推理,最大图像输入像素预算为200,704(448×448)。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)依赖Qwen3.5-2B作为骨干,模型规模较小可能限制模拟能力;

主要参考文献

[1] Jiakai Tang, Yan Mi, Jing Yu, et al. Towards Faithful Simulation of Human Shopping Behavior. arXiv:2608.20707, 2026.
[2] Shao, Z., et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300, 2024.
[3] Yao, S., et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
逛一圈淘宝,AI学会了“货比三家”😜 想聊聊RecVerse背后的记忆魔法和轨迹级RL?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 推荐系统+杭州+阿里+小明),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。