← 返回 PaperDaily 大模型与智能体

让AI学会货比三家?普林斯顿这个基准至今无人超越

这篇被引1300+次的开创性工作,来自普林斯顿大学。WebShop用118万件真实商品和1.2万条人工指令,把“语言智能体”的评测从玩具级任务搬进接近真实的电商场景——AI要自己读懂需求、搜索商品、挑选项、下单。更难得的是,训练好的智能体能零样本迁移到真实Amazon和eBay,是语言grounding方向绕不开的经典基准。

让AI学会货比三家?普林斯顿这个基准至今无人超越
原论文信息如下:
论文标题:
WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents
发表日期:
2022年7月
发表单位:
普林斯顿大学计算机科学系
原文链接:
http://arxiv.org/pdf/2207.01206.pdf
把“网上购物”拆开看,每一环都是对人类智能的巨大考验:读懂口语化需求、翻译成搜索关键词、从营销话术里挑出靠谱商品、核对颜色尺寸价格、不满意再退回重来。人类驾轻就熟,但对计算机而言,每一步都像在雷区里跳舞——既要理解自然语言,又要做多步决策,还得应对噪声信息。
龙哥今天要聊的这篇论文,就是专门给AI打造的“网购训练场”——来自普林斯顿大学的WebShop。它一口气塞进118万件亚马逊真实商品和1.2万条人类写的购物指令,逼着AI学会从看懂需求到下单付款的完整链路。这项2022年发表的工作如今已被引用超过1300次,成了语言智能体(Grounded Language Agent)领域绕不开的经典基准。

环境设计:118万真实商品与12087条指令

图1:WebShop环境概览
WebShop环境概览。A部分展示了HTML模式下的一条完整任务轨迹;B部分是简单模式(simple mode)下的结果页,蓝色文字代表可点击操作;C部分是商品标注示例。
WebShop的核心底气藏在数据体量里。它直接爬取了亚马逊上横跨时尚、美妆、电子、家具、食品5大品类的118万件真实商品,涉及113个子类别。平均每个商品自带262.9词描述,全部商品合计拥有84万多个购买选项。商品信息经过结构化处理:每个商品包含标题、描述、概览(bullet points)以及选项(颜色、尺寸、数量等),为检索和匹配提供了丰富信息。
有了海量商品,还得有像样的“购物清单”。作者通过亚马逊土耳其机器人(AMT)平台,众包标注了12087条自然语言购物指令。这些指令不是简单的“帮我买个杯子”,而是充满真实人类口吻的复合需求,比如:“能帮我找一双黑蓝配色的运动鞋吗?要防雨的,鞋底要柔软,价格不超过90美元。”一条指令里同时包含属性约束、选项约束和价格约束。整个指令集平均每条15.9个词,词汇量高达9036个。作者还设计了质量控制机制,要求标注者必须写出包含至少两个属性的指令,并通过人工抽检保证质量。
整个交互过程被建模为回合制游戏:智能体每一步观察到当前页面的文本内容(以及可能的图片特征),然后从预定义动作集合中选择一个执行。动作集合包括:search[查询词](发起搜索)、choose[按钮文本](点击任何可点击元素,包括商品链接、选项按钮、购买按钮等)。这种设计简洁统一,使得任何基于文本的强化学习或模仿学习算法都能直接应用。
表1:WebShop中的动作定义
WebShop中的动作定义。动作空间是动态变化的,因为每个页面的可点击按钮集合都不同,这要求模型能够处理变长的动作集合。
任务被形式化为部分可观测马尔可夫决策过程(POMDP)。搜索由预构建的BM25检索索引驱动——基于Pyserini工具离线搭建,对商品标题、描述、概览和选项文本拼接后编码,因此搜索过程完全确定,方便复现。这种确定性机制是WebShop可复现性的关键之一。
接下来是这个环境最精妙的设计之一——自动奖励函数。每回合结束时,智能体购买的商品会与指令进行匹配打分,得分即为0到1之间的奖励值。这个奖励函数并非简单的二元成功/失败,而是提供细粒度分数,反映购买商品与指令要求的匹配程度,为强化学习提供更密集的反馈信号。
公式1:WebShop奖励函数
公式1:WebShop奖励函数。其中U_att和U_opt分别代表指令中要求的属性集合和选项集合;Y_att和Y_opt代表购买商品的属性集合和选项集合;y_price是商品价格,u_price是指令给定的价格上限。r_type是文本匹配分数,用于惩罚那些“属性相似但根本不是一类商品”的错误购买——比如同样标着“无残忍”“非转基因”,黄油和植物肉毕竟不一样。这个类型匹配项通过计算购买商品与指令中隐含的目标商品类型之间的文本相似度来实现,有效防止了智能体通过“属性碰瓷”来获取高分。
这套自动打分机制完美绕开了人工评估的瓶颈,让强化学习能大规模跑起来,也让不同模型之间的对比有了统一标尺。更重要的是,奖励函数的各个组成部分都是可解释的,研究者可以清晰地分析模型在哪些方面表现不佳,从而有针对性地改进。

智能体训练:模仿学习+强化学习的双阶段方案

环境搭好了,接下来就是重头戏:怎么训练出一只能“自己逛街”的智能体?作者给出了一条清晰的进阶路线——先用人类演示数据做模仿学习(IL),再用强化学习(RL)做在线微调。这种双阶段策略,在今天的大模型Agent训练中依然是非常主流的范式。其核心思想在于:先通过模仿学习让模型获得一个“靠谱”的初始策略,避免强化学习从零开始探索时的低效和不稳定;然后再通过强化学习在真实环境反馈的引导下,进一步优化策略,超越人类演示的水平。
先看第一阶段:模仿学习。WebShop把“购物”拆成了两个子任务——搜什么(search)和点哪里(choose)。于是作者部署了两个独立的预训练语言模型来分别搞定这两件事。这种模块化的设计降低了每个子任务的学习难度,也使得每个模块都可以针对其特定目标进行优化。
负责搜索的是BART模型。作者从1012条人类演示轨迹里抽出1421对(指令,搜索词)数据,微调BART做序列到序列的条件生成。简单说,就是让模型学会把口语化的需求“翻译”成适合电商搜索引擎的关键词。为了提升探索的多样性,推理时模型通过beam search生成排名前5的搜索词,再随机挑一个执行,避免Agent在搜索页钻进死胡同。这个搜索生成的损失函数长这样:
公式2:搜索生成模型的训练损失
公式2:搜索生成模型的训练损失。直接在人类演示的(指令,搜索词)对上进行条件语言建模,最大化生成动作的概率。这里使用的是标准的交叉熵损失,训练目标是让模型在给定指令的条件下,生成与人类演示中搜索词尽可能相似的结果。
负责点击决策的模型则基于BERT搭建。它会接收当前页面的完整文本状态、所有可点击按钮的文本,以及商品图片的视觉特征,然后为每个动作计算一个相关度分数,再用softmax转成概率。整个架构如图3所示——图像经过ResNet-50提取512维特征,再线性映射到768维与BERT的文本表征拼接;动作侧则编码每个按钮文本;最后通过一个注意力融合层(Attention Fusion Layer)计算状态与动作的匹配度。这个注意力融合层是模型的核心组件,它允许模型动态地关注状态表示中与当前动作最相关的部分,从而做出更精准的决策。
图3:基于选择的模仿学习(IL)模型架构
图3:基于选择的模仿学习(IL)模型架构。商品图片I经ResNet得到图像表征;指令文本u经BERT的Transformer编码得到文本表征;图文融合后与每个动作表征做交叉注意力,最终输出该动作的标量分数S(o,a)。值得注意的是,这里的“状态”不仅包含当前页面的文本,还包含了用户的原始指令,这使得模型能够始终以指令为目标导向进行决策。
训练时,模型的优化目标就是最大化人类点击的那个按钮的概率。这个模仿学习的损失函数和策略形式如下:
公式3:选择模型模仿学习损失
公式3:选择模型模仿学习损失。逐条最大化人类演示中真实点击动作的条件对数似然。这个损失函数鼓励模型为人类选择的动作分配更高的概率,从而学习到人类的决策模式。
公式4:选择模型的策略分布
公式4:选择模型的策略分布。每个动作的分数由观测表示和动作表示做交叉注意力后取平均再线性变换得到。最终通过softmax函数将分数转换为概率分布,智能体根据这个分布进行动作采样。
第二阶段是强化学习。作者观察到,直接拿RL微调文本生成模型很容易导致语言漂移,生成一堆人类看不懂的乱码。于是他们聪明地打了个组合拳:把BART搜索模型彻底冻结,只保留它通过beam search生成的前10个候选搜索词;然后让BERT选择模型在这些候选里做决策,并用策略梯度算法优化。这样做既保留了搜索空间的丰富性,又规避了RL直接改语言的风险。这种“冻结生成器,优化选择器”的策略,是WebShop训练方案中一个非常实用的创新点,它有效地解决了RL训练中语言不稳定的问题。
公式5:策略梯度损失
公式5:策略梯度损失。其中R_t是折扣回报,V(o_t)是由BERT参数共享的基线网络输出的价值估计。减去基线是为了降低梯度方差,让训练更稳定。这个基线网络与选择模型共享大部分参数,但输出的是一个标量价值估计,用于预测当前状态的期望回报。
这里龙哥多提一嘴:在2022年那个时间点,把“模仿学习做冷启动+强化学习做在线探索”的组合方式用于网页交互任务,算是相当前瞻的工程判断。后来的WebGPT、MindAct等一批知名工作,回头看不难发现同样的影子。这种范式的成功,也验证了在复杂交互任务中,将人类知识(通过IL注入)与自主探索(通过RL实现)相结合的巨大潜力。

实验结果:AI购物能力与人类差距有多大?

模型训完了,是骡子是马得拉出来遛遛。实验开场的第一个动作,是把1.2万条指令按照10,587/1,000/500划分成训练、开发、测试三份。所有模型在500条测试指令上做最终评估,同时作者也找了一批人类受试者(包括7名受过训练的专家)跑同样500条指令作为性能天花板参考。这种“人机对比”的设置,为衡量AI能力的绝对水平提供了一个重要的参照系。
先看整体表现,结果如图4所示。那个只会“搜索原句然后无脑买第一件”的规则基线(Rule),任务分只有45.6,成功率更是低到9.6%——这直接证明了WebShop这个任务并不是靠搜索引擎的蛮力就能过关的。而经过IL训练的智能体一下把分数拉到59.9,成功率飙到29.1%。再加上RL微调,分数进一步涨到62.4,成功率微降到28.7%——分数涨而成功率微降的细节,恰恰体现了RL在优化平均奖励时,会有意“多试几个选项”,代价是更容易在中途翻车。这个现象也说明,任务分数和成功率是两个不同维度的指标,分数衡量的是“买得有多好”,成功率衡量的是“是否买对了”,两者并不完全一致。
图4:模型在测试集上的任务分数与成功率对比
图4:各模型在WebShop测试集上的任务分数与成功率(3次随机种子结果)。LP Search指用预训练BART生成搜索词;IL w/o LP Search指用规则生成搜索词;LP Choice指用预训练BERT初始化选择模型;IL w/o LP Choice指选择模型完全随机初始化。从图中可以清晰地看到,预训练初始化(LP)和模仿学习(IL)都对最终性能有显著贡献。
但人类的表现才是真正的“降维打击”——人类专家平均分82.1,成功率59.6%;即便是普通人类受试者,成功率也达到了50%。最牛模型的成功率只有人类专家的一半不到。这个差距说明:让AI学会网购,远不是“接个大模型API”就能搞定的事。它需要模型具备更强的语义理解、多步推理和抗干扰能力。
更细的拆解藏在Table 2的分数分解里。这个分解表将总分拆分为属性匹配、选项匹配、类型匹配和价格匹配四个子项,能够清晰地揭示模型在不同方面的能力短板。
表2:分数分解与轨迹统计
表2:左侧为总分按属性、选项、类型、价格四个子项的分解;右侧为平均/最大/最小访问状态数、商品查看数和搜索次数。可以看出AI在选项匹配(Opt)上得分极低,只有38.9,这正是与人类差73.9分差距最大的地方——AI经常找不到指令里指定的颜色、尺码等具体选项。这表明模型在细粒度的属性-值匹配上存在明显不足,是未来改进的关键方向。
作者还做了细致的消融实验来验证架构设计的合理性。当选择模型改用随机初始化的Transformer(IL w/o LP Choice),成功率直接暴跌近三分之二。这充分说明在数据量不够大、任务复杂的情况下,语言预训练提供的先验知识几乎是不可替代的。而当搜索生成模型被替换成规则(IL w/o LP Search)时,分数和成功率也掉了3个点左右,说明“教AI重新组织搜索词”确实比“拿原话去搜”更管用,但它的重要性远不如学会选择正确选项。
更耐人寻味的是这类Agent的优势区间——表格数据显示IL+RL模型的搜索次数反而比纯IL模型更少(平均1.0次vs 1.3次)。这说明RL帮助模型学会了“少折腾、多核实”的购物策略,而不是盲目反复搜索。这是个挺符合直觉的优化方向:与其反复搜,不如把当前页面看仔细。RL的奖励信号有效地引导模型学会了更高效的浏览策略。

模拟到真实:从WebShop到Amazon和eBay的迁移

如果WebShop只是一个“假装是购物网站”的模拟器,那它的价值要大打折扣。论文最让人眼前一亮的部分,是它在真实电商网站上的零样本迁移测试。研究团队把训练好的智能体直接部署到真实的amazon.com和ebay.com上,用100条测试指令重新跑了一遍购物流程。当然,真实网站没有现成的“简单模式”接口,作者就写了个HTML翻译器,把真实网页自动转成模型能理解的简单格式。这个翻译器是连接模拟与现实的桥梁,它通过解析真实网页的HTML结构,提取出与WebShop简单模式类似的文本和可点击元素,使得模型能够无缝迁移。
结果是:智能体在亚马逊上拿到了64.5%的分数(模拟环境得分62.4),在eBay上竟然还略有提升。而对照组“把指令原样输入网站搜索框、无脑买第一个结果”的规则基线只有56.1%和55.2%。这意味着WebShop训练出的Agent,确实学到了通用的“搜索—比较—选择”技能,而不仅仅是背下了某个模拟环境的动作序列。这种零样本迁移的成功,有力地证明了WebShop环境的高仿真性和训练方法的有效性。
表5:零样本从模拟到真实的迁移结果
表5:零样本从模拟到真实网站的迁移结果。在100条测试指令上,WebShop训练的智能体在Amazon和eBay上得分均超过规则基线约8-10分,成功率也有近5个百分点的提升。这一结果在2022年算得上相当有冲击力的“sim-to-real”证明了:它告诉后来者,在可控的模拟环境里训练,是有可能迁移到开放世界真实场景的——只要模拟环境里的数据和交互设计得足够接近现实。
这个结果在2022年算得上相当有冲击力的“sim-to-real”证明了:它告诉后来者,在可控的模拟环境里训练,是有可能迁移到开放世界真实场景的——只要模拟环境里的数据和交互设计得足够接近现实。当然,作者也指出,真实网站的页面结构更加复杂多变,模型在真实环境中的表现仍有很大的提升空间。

未来展望:语言grounding智能体的发展方向

站在2026年回看WebShop,它有两条遗产值得单独拎出来讲。第一条,它验证了“数据规模+交互环境”的组合拳威力。通过提供大规模、高质量、可交互的环境,WebShop使得训练和评估复杂的语言智能体成为可能。第二条,它系统性地拆解了语言智能体在真实交互场景里会遇到的四类研究挑战:生成好的搜索查询、开展策略性探索、鲁棒地理解网页噪声文本、以及用长期记忆比较商品和回溯。这四条几乎成了后来所有Web Agent论文的“标准提纲”。
当然,WebShop也留下了不少遗憾。它的页面格式相对工整,真实网站那些动态加载、弹窗广告、反爬机制、验证码统统没模拟;它的指令平均只有十几词,跟真实用户动辄长篇大论还有差距;它只用了5个商品品类,扩展到全品类还需要更多工程努力。后续的WebArena、MindAct等工作,正是沿着这方向继续补完。WebArena构建了更接近真实网站的模拟环境,而MindAct则探索了利用大模型进行网页操作的新范式。
对于普通读者来说,WebShop真正的启示在于:当大模型越来越强,大家比拼的不再是“模型能不能记住知识”,而是“模型能不能在真实环境里做完一件多步骤的脏活累活”。从这个角度看,网购恰恰是最贴近大众、最能体现智能体完整能力的一块试金石。它考验的不仅是语言理解,更是规划、决策、纠错和适应能力。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?普林斯顿大学提出WebShop模拟电商购物基准,含118万真实商品与1.2万条人工指令。智能体需根据文本指令完成搜索、选品、选规格与下单,最佳模型成功率29%,是规则基线(9.6%)的3倍,且能零样本迁移到真实电商网站。
这篇工作最值得看的点是什么?IL+RL模型达到62.4的任务得分和28.7%的成功率,显著优于规则基线(45.6分和9.6%成功率),但远低于人类专家(82.1分和59.6%成功率)。在Amazon和eBay上的零样本迁移测试中,IL+RL分别达到65.9/25%和62.3/21%的性能。
这篇工作的边界或风险在哪里?优点:(1)构建了大规模、可扩展的电子商务环境,包含真实产品和众包指令;(2)设计了自动奖励函数,无需人工评估;(3)提供了HTML和简单两种观察模式,支持人类和模型交互;(4)展示了从模拟到真实的迁移能力。缺点:(1)智能体性能与人类专家差距较大,尤其在选项选择方面;(2)搜索查询生成能力有限;(3)缺乏长期记忆机制;(4)RL微调后探索性下降,选项得分降低。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

构建一个大规模模拟电子商务网站环境WebShop,包含118万真实产品和12087条众包文本指令,并训练基于预训练语言模型(BERT和BART)的智能体,结合模仿学习和强化学习完成在线购物任务。

实验合理度:★★★★☆

任务得分(Task Score,100×平均奖励)和成功率(Success Rate,奖励为1的指令比例)。

学术研究价值:★★★★☆

构建一个大规模模拟电子商务网站环境WebShop,包含118万真实产品和12087条众包文本指令,并训练基于预训练语言模型(BERT和BART)的智能体,结合模仿学习和强化学习完成在线购物任务;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

IL模型在RTX 2080 GPU上训练约2小时,RL模型在RTX 3090 GPU上训练约27小时。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1)智能体性能与人类专家差距较大,尤其在选项选择方面;(2)搜索查询生成能力有限;(3)缺乏长期记忆机制;

主要参考文献

Yao S, Chen H, Yang J, et al. WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents[C]//Advances in Neural Information Processing Systems (NeurIPS), 2022. arXiv:2207.01206.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
AI逛淘宝还迷路?WebShop这本“AI网购启蒙书”,教你从搜索词到下单按钮一步步调教智能体。加入龙哥读论文粉丝群,和一群爱琢磨AI落地的人一起拆解前沿工作,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型智能体+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。