← 返回 PaperDaily 大模型与智能体

京东人大新研究:让购物Agent学会“听劝”,NDCG暴涨47%

你有没有被电商AI导购气得牙痒痒过?明明说了“今天就要”,它偏给你推明天才发货的。京东和人大这篇新研究,就是让购物Agent学会从真实用户的吐槽和购买行为中自己进化,不用人工标注,推荐效果直接起飞。

京东人大新研究:让购物Agent学会“听劝”,NDCG暴涨47%
原论文信息如下:
论文标题:
Learning from Online User Feedback for Shopping Agents
发表日期:
2026年08月
发表单位:
中国人民大学高瓴人工智能学院、京东
原文链接:
https://arxiv.org/pdf/2608.11604v1.pdf
设想一个场景:你跟电商平台的AI导购聊了七八轮,从“适合干皮的洗面奶”聊到“价格200以内、含氨基酸、不要皂基”,它推荐的还是不对味。你又一次次补充信息,最后累了,关掉对话框,什么都没买。这段对话,真的毫无价值吗?在大多数购物Agent的训练流程里,它确实毫无价值——系统只记录了“未购买”这个冷冰冰的结果,你说过的偏好、抱怨和修正,全被当成噪音扔掉了。
京东和中国人民大学的研究者显然看不下去了。他们搞出一个新框架,专门让购物Agent从真实在线日志里“无师自通”地进化,不用任何人工标注。效果呢?推荐核心指标NDCG@1相对提升超过五成,对话成功率全面提升。这篇文章,就来聊聊这个会“听劝”的Agent是怎么炼成的。

购物Agent的进化困境:为何在线反馈是金矿?

基于大语言模型(LLM)的购物Agent这几年疯狂扩张,亚马逊、京东这些平台早已把对话式导购搬上线。相比传统推荐系统只会按历史行为排序,购物Agent能听懂自然语言、调用商品搜索引擎、多轮对话,还能在推荐时给出理由。听起来很美,但一个尴尬的事实是:这些Agent的能力训练,大多还停留在“离线静态数据”阶段——靠用户历史行为、人工标注或合成偏好数据来微调。这类数据干净规整,却离真实世界有距离。
真实世界的用户怎么说话?他们不会规规矩矩地写“价格低于300元的白色T恤”,而会说“太贵了”“我要的是纯棉的”“这个牌子的尺码偏大吧”“另一个颜色呢”。这些自然语言反馈,恰恰是对推荐结果最直接的评价——甚至比“买没买”更能说明问题。
这篇论文把真实在线日志中的反馈分成两大类。第一类是显式行为反馈,比如点击、购买,这类信号很可靠,但稀疏、延迟,只能回答“这次推荐成功没有”。第二类是对话内指令反馈,也就是用户在后续对话里给出的修正和不满,它能回答“为什么成功或失败”,但高度异构、稀疏、充满噪声,很难自动转换成有效的学习信号。过去的工作大多只盯着第一类,白白浪费了第二类富矿。
这正是LOFA的出发点:把两类反馈当成互补的监督来源,而不是二选一。图1展示了真实购物日志中的监督信号长什么样。
图1:真实在线购物日志中包含的监督信号示例
真实在线购物日志中包含的监督信号示例,包括显式行为反馈(如购买结果)和对话内指令反馈,揭示了用户为什么对之前的推荐满意或不满意,为改进后续推荐决策和对话回复提供细粒度指导。

双反馈机制:从“买不买”到“为什么不满”的完整闭环

LOFA的全称是Learning from Online user Feedback for shopping Agents,也就是“从在线用户反馈中学习购物Agent”。看整体框架(图2),日志数据进来之后,两条监督链路各走各的,最后把学到的能力合体。
图2:LOFA框架的整体架构
图2:LOFA框架的整体架构,从真实在线日志中同时提取显式行为反馈和对话内指令反馈,分别驱动强化学习和在线策略蒸馏。
先看左边这条处理显式行为反馈的链路。做法很朴素:只保留最终成功购买的那些交互会话(session),把完整对话轨迹、用户画像、商品候选集和最终购买的商品打包成训练数据。训练目标一句话——让Agent生成推荐列表时,把用户真正下单的那个商品排到更靠前的位置。
这里用到的优化算法叫GRPO,全称Group Relative Policy Optimization(组相对策略优化),是DeepSeek团队提出的一种强化学习算法。传统强化学习通常要训练一个价值网络(critic)来估计奖励,GRPO则取了个巧:让模型对同一个问题生成一组答案,然后用组内相对比较来估计优劣,不需要额外的critic模型,训练更稳定、开销更低。
一个交互会话(session)可以记作下面的形式:
公式1:交互会话表示
公式1:交互会话表示。其中 q_t 是第t轮的用户请求,o_t 是外部工具返回的搜索结果,a_t 是Agent的回复。一次会话就是若干轮三元组组成的序列,若最终发生购买,再额外记一个目标商品 i*。
为了让GRPO优化的方向不跑偏,论文设计了两路奖励。第一路是格式奖励——购物Agent必须按预定义格式输出思考(think)和回答(answer)标签,缺标签、推荐数量不够、商品ID非法,都算格式违规,直接给-1的惩罚,如公式2所示。
公式2:格式奖励
公式2:格式奖励。当轨迹遵循预定义格式时取0,否则取-1。
第二路是推荐奖励——用目标商品在推荐列表中的排序位置来计算NDCG(Normalized Discounted Cumulative Gain,归一化折损累计增益)。NDCG是信息检索里衡量“好结果排得够不够靠前”的经典指标,排在第一位得满分,越靠后折损越大。公式3把推荐奖励定义为NDCG@20。
公式3:推荐奖励
公式3:推荐奖励,以目标商品位置计算NDCG@20作为奖励值。
最终整体奖励这样计算:如果格式违规,整体奖励直接取-1;否则就取推荐奖励。通过GRPO在这个奖励信号下反复优化,Agent就能逐渐学会把更可能成交的商品往前排。这套“买没买”的信号虽然简单,但实验结果证明它极其好使。

反馈感知教师:如何将稀疏对话转化为密集监督信号?

行为反馈虽然可靠,但有个先天短板:它只在成功购买时出现,而且属于“事后诸葛亮”,没法告诉Agent“刚才那一轮对话里,哪句话说得不对”。而这些信息,恰恰藏在用户的后续对话里。
LOFA先用一个基于LLM的反馈挖掘流程,把对话中的指令信号挖出来。论文使用DeepSeek-V3.2作为判官模型,把每一轮交互拆出来,结合用户画像、历史记录、当前搜索结果、Agent回复和用户后续反馈,让模型判断这属于哪一类反馈。类别一共五种:显式批评(Explicit Criticism)、隐式推断(Implicit Deduction)、纯负面反馈(Pure Negative Feedback)、比较性偏好(Comparative Preference)和话题转移或放弃(Topic Shift/Abandonment)
前四类都包含能指导改进的“有效信号”。比如用户说“这个太贵了”,是纯负面反馈;说“隔壁那个便宜一百块”,是比较性偏好;说“我明明只要黑色的”,是显式批评;而“我孩子上初中,想要个护脊书包”,则是可以从上下文和常识推断出来的隐式需求。只有第五类——话题转移或放弃,对推荐质量几乎没有信息量,直接丢掉。同时,判官模型还会生成一句简短的解释,说明用户不满或偏好变化的原因。
但光分类还不够。用户的自然语言反馈是稀疏的,可能一整轮对话只有一句“不行”,怎么把它变成训练信号?LOFA的思路很巧妙:构建一个反馈感知教师模型(Feedback-Aware Teacher)。
所谓教师,不是外挂一个更大的模型,而是同一个模型但拥有“特权信息”。部署的时候,学生模型只能看到当前上下文 C_t(用户画像、对话历史、当前请求、工具返回结果);而教师模型额外看到Agent上一轮的回复 a_t、用户的后续反馈 q_{t+1}、识别的反馈类别 c_t 和生成的解释 e_t。这相当于考试时教师能看到标准答案,再回头告诉学生“你这道题哪一步扣分了”。公式4和公式5分别给出了学生和教师在生成第j个token时的概率分布。
公式4:学生token分布
公式4:学生模型在第j个生成步骤的token概率分布。
公式5:教师token分布
公式5:教师模型在第j个生成步骤的token概率分布,其中额外注入了特权反馈信息。
教师的指导通过在线策略蒸馏(On-Policy Distillation,OPD)传递给学生。学生模型先生成一整条回答,教师模型不另起炉灶生成标准答案,而是拿着特权信息去评估学生的每一步生成,用逆向KL散度计算两个分布在每个token位置上的差异,作为损失加权。公式6和公式7展示了这个流程。
公式6:OPD优化目标
公式6:在线策略蒸馏的优化目标,对学生采样分布与教师分布之间的散度取期望。
公式7:序列级散度计算
公式7:序列级散度计算方式,对所有token位置的KL散度取平均。
这里的KL散度(Kullback-Leibler divergence)用来衡量两个概率分布的差异,逆向KL散度在实际效果上就是让学生的生成尽量落在教师认为合理的范围内。这样一来,用户的一句“不行”被放大成了整条回答每个token上的密集监督信号,Agent能精确知道“刚才哪句话说得不好、应该往哪个方向改”。
最后是训练顺序。两类反馈一个在会话(session)级别、一个在轮次(turn)级别,颗粒度不同,直接联合优化并不合适。LOFA采用顺序管线:先用购买结果做GRPO,让Agent学“什么能卖出去”,再用对话反馈做OPD,让它学“怎么说更好”。整个流程不需要任何人工标注,天然支持周期性的模型更新——新的日志进来,就再滚一轮。

实验验证:真实电商日志上的全面性能提升

实验数据来自京东部署的购物Agent“京言”的真实交互日志,匿名化后构造了两个数据集。JD-Search用于行为反馈学习,包含6704个用户、7001个会话,平均约2轮对话;JD-conv用于对话反馈学习,由多轮对话拆成8249个轮次样本,其中隐式推断类最多,占了5413个。表1和表2给出了详细统计。
表1和表2:数据集统计信息
表1和表2:行为反馈学习数据集(左)与对话反馈学习数据集(右)的统计信息。EC、ID、PNF、CP分别表示显式批评、隐式推断、纯负面反馈和比较性偏好的样本数。
基线方面,论文以Qwen3-8B为基础骨架,对比了不启用推理模式(NoThink)、纯监督微调(SFT)、推理时自我反思(Self-Reflection)、只用GRPO(+RL)、只用OPD(+OPD),以及两种训练顺序(RL→OPD和OPD→RL)。推荐质量用NDCG@K、Recall@K、MAP@K衡量,对话反馈解决效果用成功率(Success Rate,SR)衡量。
表3:主实验结果
表3:JD-Search和JD-conv两个任务上的NDCG、Recall、MAP@1/5/10及整体成功率(SR)结果,最优值加粗显示。
主结果里有几个点非常值得聊。首先,纯RL的效果相当惊艳:NDCG@1从0.2679直接冲到0.4112,相对提升超过53%;Recall@10从0.6103涨到0.8567,相对提升约40%。这说明购买结果作为奖励信号,对推荐质量的拉动立竿见影。
其次,纯OPD对推荐排名的提升有限——它的目标本来就不是排名——但把成功率SR从0.5443推到0.6010。这说明让Agent“听劝”之后,它确实更会应对用户的抱怨和补充需求,对话质量肉眼可见地变好。
最完整的RL→OPD,也就是完整版LOFA:NDCG@1达到0.4212,比基础模型高57%;Recall@10达到0.8911;SR达到0.6022,几乎全面占优。而调换顺序的OPD→RL(SR 0.5924)就差了一截,说明先学“卖什么”、再学“怎么说”,这个次序是对的。
还有一个数字挺扎眼:纯SFT的SR只有0.4064,不但没超过基础模型(0.5443),反而大幅落后。原因在于日志里没有推理痕迹,SFT只能学“答案”学不到“思考过程”,多步推理能力被削弱。NoThink同样证明了显式推理对购物决策的重要性。
speechless.png
大家可能关心:OPD带来的提升,主要落在哪类反馈上?表4按四类反馈拆分了成功率。可以看到,OPD对比较性偏好的提升幅度最大,从0.3529涨到0.5882,几乎翻倍;对隐式推断类也从0.4610提升到0.5314。这说明细粒度的偏好修正正是对话反馈学习的强项。不过当用户完全没有给方向(纯负面反馈)时,各家差距不大——毕竟“我不要这个”不包含任何改进方向。
表4:四类反馈数据上的成功率
表4:四类反馈数据及整体数据上的成功率(SR)结果。
再往下是几组消融实验。表5对比了不同RL奖励设置,可以看到同时使用格式奖励和推荐奖励效果最好;表6则研究了训练数据来源对OPD的影响,验证了在线日志数据的价值。
表5:不同RL奖励设置的消融结果
表5:不同RL奖励设置下消融模型的性能(NDCG、Recall、MAP和整体成功率)。
表6:不同训练数据的消融结果
表6:不同训练数据下消融模型在四类反馈数据及整体数据上的结果。
模型规模方面,图3对比了4B和8B两种骨架下的表现。两者绝对性能有差距,但提升趋势高度一致——行为反馈学习和对话反馈学习在两种规模下都有效,说明LOFA跟骨架规模关系不大,泛化能力有一定保障。
图3:不同骨架规模下LOFA的表现
图3:不同骨架规模下LOFA在NDCG@1和成功率(SR)上的结果对比。
最后看一个案例(表7)。第一个例子里,用户问“今天能到的”,Agent最初的回复居然自相矛盾——标题写着“今天”,商品却写“明天发货”。基础模型直接忽略了时效约束,而LOFA明确回应了“今日可送达”。第二个例子中,基础模型把“礼物”狭义理解成护肤套装,完全没召回用户想买的商品;LOFA则把用户实际购买的商品排到了第一位。“听劝”和“不听劝”,差别就在这里。
表7:案例研究
表7:LOFA两个任务的案例研究。Case 1原始回复自相矛盾,基础模型静默丢弃时效约束,而本方法明确解决当日送达约束;Case 2基础模型将“礼物”窄化为同类护肤品且未召回目标商品,本方法将用户实际购买商品排在第一位。
从实验设计来看,所有对比都在同一骨架、同一数据集上进行,GRPO和OPD都是全参数微调,学习率1e-6,采样温度1.0,训练1-2轮,整体设计公平、可归因。唯一的保留意见是:判官模型DeepSeek-V3.2同时参与反馈挖掘和结果评估,可能存在一定系统性偏差。不过论文在多个指标上交叉印证,结论的可信度还是有保障的。

从实验室到工业界:LOFA的部署价值与未来展望

LOFA最大的亮点,不是某个花哨的模块,而是整个训练闭环可以全自动运转:日志进来,自动筛选购买会话,自动挖掘对话反馈,自动构建教师分布,自动训练更新模型。不需要人工标注,不需要精心设计的合成数据,这其实是工业级Agent持续进化最现实的一条路。
成本方面,全参数微调8B模型加上外部LLM判官的API调用,对普通团队不算便宜,但对比从头训练或大规模人工标注,性价比已经很高。尤其对京东这种有真实流量的平台,训练数据是“可再生资源”,模型可以按周期滚动更新,越用越聪明。
当然,它的局限也很清楚。首先,这套框架依赖一个前提:你得先有一个部署中的购物Agent和真实的交互日志,冷启动场景不适用。其次,反馈挖掘完全依赖LLM判官的质量,分类错了,后续监督也跟着错。第三,全参数微调在超大模型上仍然昂贵,未来可以尝试LoRA等参数高效微调方案。最后,论文目前只用了文本信号,真实购物场景里还有大量图片、语音等跨模态反馈,这些都有待进一步挖掘。
在龙哥看来,LOFA的价值在于它点破了一个被忽视的常识:Agent部署之后产生的在线反馈,本身就是一座金矿。过去大家拼命设计更好的离线训练集,却忘了免费的“用户评分”每天都在眼皮底下生成。顺着这个思路,未来所有能部署的Agent——不光是购物,还有医疗助理、教育助手、企业客服——都可能用类似的思路从自己的日志里持续学习。这种“越用越聪明”的能力,或许才是Agent真正大规模走进产业的关键。
go I am not angry.jpg

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?购物Agent每天都在产生海量用户交互日志,却被绝大多数方案忽视。京东与人大提出LOFA,巧妙合并购买结果与对话吐槽两种反馈,用GRPO增强学习加反馈感知蒸馏双管齐下,无需人工标注,让Agent越用越懂你。
这篇工作最值得看的点是什么?LOFA (RL→OPD) 在推荐质量指标上全面最优(NDCG@10: 0.6512, Recall@10: 0.8911, MAP@10: 0.5747),在指令反馈解决率上也达到最高(SR: 0.6022),显著优于所有基线方法。
这篇工作的边界或风险在哪里?优点:(1) 提出双反馈学习框架,同时利用显式行为反馈和对话内指令反馈,互补性强;(2) 无需人工标注,可自动从真实交互日志中学习,具有工业部署价值;(3) 反馈感知教师模型设计巧妙,将稀疏异构的对话反馈转化为密集token级监督。缺点:(1) 反馈挖掘依赖LLM(DeepSeek-V3.2),存在一定误差传播风险;(2) 顺序训练流程(先RL后OPD)可能不是最优,需要更多探索;(3) 对纯负面反馈的处理效果有限,该类反馈缺乏明确改进方向。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出LOFA框架,联合利用显式行为反馈(购买结果)和对话内指令反馈(用户后续话语),通过GRPO强化学习和反馈感知的on-policy蒸馏,实现从真实在线交互日志中自动学习优化购物Agent。

实验合理度:★★★★☆

NDCG@K、Recall@K、MAP@K(K=1,5,10)用于推荐质量评估;Success Rate(SR)用于指令反馈解决率评估

学术研究价值:★★★★☆

提出LOFA框架,联合利用显式行为反馈(购买结果)和对话内指令反馈(用户后续话语),通过GRPO强化学习和反馈感知的on-policy蒸馏,实现从真实在线交互日志中自动学习优化购物Agent;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确给出具体FLOPs,模型为8B参数规模,采用全参数微调,学习率1e-6,batch size 32,训练1-2个epoch。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 反馈挖掘依赖LLM(DeepSeek-V3.2),存在一定误差传播风险;

主要参考文献

[1] Haobo Zhang, Kelong Mao, Sulong Xu, Simiu Gu, Zhicheng Dou. Learning from Online User Feedback for Shopping Agents. arXiv:2608.11604, 2026.
[2] Zhihong Shao, Peiyi Wang, Qihao Zhu, et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300, 2024. (GRPO)
[3] Qwen Team. Qwen3 Technical Report. arXiv:2505.09388, 2025.
[4] DeepSeek-AI. DeepSeek-V3.2 Technical Report. 2025.
[5] Long Ouyang, Jeff Wu, Xu Jiang, et al. Training Language Models to Follow Instructions with Human Feedback. NeurIPS 2022. (RLHF)
[6] Rafael Rafailov, Archit Sharma, Eric Mitchell, et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. (DPO)

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
购物Agent怎么才能越用越聪明?京东和人大给出的答案是:认真听用户的“吐槽”。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 电商Agent+北京+京东+阿龙),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。