← 返回 PaperDaily 视觉与图像

Meta最新研究:LLM Agent让用户一句话重塑信息流,反感内容直降2.74%

Meta在RecSys 2026上放了颗实弹:用LLM Agent把推荐系统从"被动猜你喜欢"变成"用户实时说了算"。三层架构干净利落,离线准确率98.85%,线上A/B负面反馈同时下降,是目前少见的工业级对话推荐实战样本,搞推荐的同学值得一读。

Meta最新研究:LLM Agent让用户一句话重塑信息流,反感内容直降2.74%

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation(塑造你的信息流:面向对话式推荐的LLM智能体系统)

发表日期: 2026年8月

发表单位: Meta Platforms(美国加州门洛帕克)

原文链接: https://arxiv.org/pdf/2608.06632v1.pdf

刷短视频时,有没有过这样的瞬间:明明点了好几次"不感兴趣",系统还是锲而不舍地推同一类内容;明明在搜索框里敲过"怎么做红烧肉",结果信息流里塞满了各种毫不相干的做饭视频,唯独没有真正想看的那个。用户想表达的需求,和系统真正理解到的意图之间,隔着一道无形的墙。传统推荐系统就像个猜谜高手,只能根据点击、停留时长这些行为信号去揣测心思,猜错了用户也没地方说理。Meta这次在RecSys 2026上带来的Shape Your Feed(SYF)系统,想做的就是把这道墙拆掉,让用户直接告诉系统"我要什么"和"我不要什么",实时生效。
这篇论文的标题很直白——《Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation》,中文可以理解为"塑造你的信息流:面向对话式推荐的LLM智能体系统"。作者全部来自Meta Platforms(美国加州门洛帕克),发表于2026年8月,被ACM RecSys '26(第20届ACM推荐系统会议)接收。论文的核心贡献是一套完整的、可落地的工业级对话式推荐框架,不是停留在实验室里的玩具,而是在真实生产流量上做过A/B测试的系统。

从被动推荐到主动共创:SYF如何让用户掌控信息流

先理解一下传统推荐系统的问题出在哪里。论文里给出了一个形式化的定义:对于用户u和候选内容v,系统根据用户历史行为Hu和当前上下文E,估计一个参与概率ŷu,v,公式为ŷu,v = fθ(v, Hu, E)。这个公式本身没什么问题,问题在于它把用户偏好完全当作一个从行为中推断的潜在变量。用户没有直接表达的通道,系统也不提供反馈的接口。
公式1
传统推荐系统的参与概率估计公式,其中fθ为系统模型参数,Hu为用户历史行为,E为当前环境上下文
这种范式带来三个结构性缺陷。黑盒性质:推荐逻辑对用户完全不可见,用户不知道为什么看到这些内容,也无法针对性地纠正;控制粒度粗糙:用户能做的只有点击"减少此类内容"或划走,系统分不清用户是讨厌这个主题、这个创作者还是这种表达风格;缺乏多模态输入:用户无法用自然语言告诉系统"多推点科技新闻但少推AI炒作"这种复杂意图。
SYF要解决的正是这个问题。它的核心思路是:把推荐从"系统单向猜测"变成"用户与系统双向共创"。用户可以通过文本、语音、UI点击等多种方式表达偏好,系统实时理解意图并调整信息流。论文用了一个很准确的说法——从被动个性化到交互式用户-算法共同策展(from passive personalization toward interactive, user-algorithm co-curation)。

三层Agent架构:感知、服务与自进化的闭环设计

SYF的整体架构是三个相互耦合的流程组成:感知流程(Perception Flow)、服务流程(Serving Flow)和自进化流程(Self-Evolution Flow)。这三个流程不是简单的串联,而是形成一个闭环:感知层理解用户意图,服务层执行推荐调整,自进化层根据反馈不断优化前两层。
图1
图1:Shape Your Feed系统架构总览。感知流程处理用户输入,服务流程负责候选集的增强与重排,自进化流程驱动闭环优化。
先看感知流程。它的作用是把用户的多模态交互It解析成一个半结构化的语义画像(Semantic Profile)St。这个画像不是简单的用户标签集合,而是用文本形式表达用户的细粒度兴趣、不感兴趣的内容以及兴趣强度。论文给出的更新公式为St = AP(It, St-1, Tt-1),其中AP是感知智能体,Tt-1是历史意图轨迹。
公式2
图:感知流程公式释义,It为当前轮次的多模态交互输入,St-1为上一轮的语义画像,Tt-1为历史意图轨迹
感知流程内部有四个子模块。第一个是交互接口,系统提供三种反馈入口:上下文感知反馈胶囊(Context-Aware Feedback Pills)让用户对单条内容进行细粒度标注;内容偏好设置中心(Content Preference Settings)允许用户主动选择感兴趣的话题标签或输入自定义偏好;MetaAI助手集成则支持用户用自然语言或语音直接提出要求。三种入口最终统一成一个查询qt。
图2
图2:感知流程的实例说明。用户的多模态反馈经过意图识别、偏好合成等步骤更新语义画像,并触发异步候选内容获取。
第二个是编排器(Orchestrator),它负责解析统一查询、提取用户意图并路由任务。编排器根据意图的复杂程度,同时触发推荐工具链和非推荐工具(比如通用问答),确保画像更新的一致性。论文中的图3展示了这种多任务意图解析与路由逻辑,可以看出一个用户输入可能同时包含多个意图方向,编排器会将它们拆分并路由到不同的处理模块。
图3
图3:编排器的多任务意图解析与路由逻辑。用户的混合意图被拆解为多个子任务,路由到推荐工具链或非推荐工具并行处理。
第三个是推荐工具链(Recommendation Toolchain),这是一组基于LLM的模块化工具。其中意图检测负责从qt中解析出显式的行为动机;偏好合成则通过去重、强化、冲突消解、语义扩展四个操作把新信息合并进既有画像。比如用户先说"多推点做饭视频",系统会在画像中加入烹饪类兴趣;用户过一会儿又说"不要烘焙类",系统会进行冲突消解,保留"做饭视频"但排除"烘焙"子类。第四个是响应生成器(Response Generator),它把查询和工具输出合成为连贯的回复消息,在服务阶段之前向用户透明地确认意图理解的结果。
感知流程中有个设计细节很值得注意:异步候选内容获取(Async Candidate Sourcing)。每当画像中检测到新的正向兴趣ΔSt+,系统立即异步地从内容库中检索相关候选,用轻量级模型排序后存入候选缓存Cs,t。这样做的好处是把最耗时的检索过程从主服务链路中剥离,用户提出要求的瞬间,系统已经提前准备好了相关内容,响应延迟大幅降低。
再看服务流程。它的输入是当前语义画像St和候选缓存Cs,t,输出是最终的重排结果R。公式表示为R = AS(Vfinal, St; fθ),其中Vfinal是生产候选与感知检索候选混合后的最终候选池。
公式3
图:服务流程公式释义,AS为服务智能体,Vfinal为最终候选池,fθ为基础生产模型
服务流程包含四个关键步骤。①上下文生成:把生产系统中原本是哈希ID或稠密向量的内容特征解码成自然语言描述(主题字符串、创作者元数据等),再结合用户的语义画像构造一个上下文感知提示词Palign。这一步很关键,因为LLM无法直接理解哈希ID,必须把结构化特征转成语义文本。②智能体精炼:依次执行四个操作——从候选缓存中抽取高相关度内容进行增强(Augmentation)、对增强后的候选池进行列表式对齐评分(Alignment Scoring)、对低于阈值的候选进行硬性剪枝(Pruning)、用加权融合公式计算最终排序分数(Re-ranking)。③理由生成:为最终保留的高排名内容生成简短的文本解释,比如"因为你说过想看更多科技新闻",增强系统透明度。
最终排序分数的计算公式为sfinal = α·ŷv|St + (1-α)·ŷu,v,其中α是融合权重。这个公式的含义是:最终排序既要考虑内容与用户语义画像的对齐程度(第一项),也要考虑生产模型预测的参与概率(第二项)。α的存在保证了系统不会只顾满足用户的显式要求而牺牲基础的内容质量。
图:最终排序分数融合公式,ŷv|St为语义对齐分数,ŷu,v为生产模型参与概率,α控制两者权重
图4
图4:服务流程实例说明。候选池经过增强、对齐评分、剪枝和重排后,形成最终的信息流排序。
最后是自进化流程,它负责系统的持续优化。论文提出了两条路径。第一条是智能体到生产的知识传播(Agentic-to-Production Propagation):把LLM智能体习得的高层语义意图蒸馏成结构化先验,用于增强生产排序器。具体做法包括把语义画像St、意图轨迹Tt等作为特征加入生产模型,或在召回阶段利用画像进行检索增强。第二条是双反馈策略对齐(Dual-Feedback Policy Alignment),后面单独展开讲。中间的记忆持久化层(Memory Persistence Layer)是系统运行的数据底座,存储语义画像、意图轨迹、候选缓存和用户行为反馈四类数据,供三个流程实时读写。

双反馈策略对齐:如何用稀疏信号训练高质量排序模型

SYF系统里有多个LLM驱动的组件,论文把对齐评分模块作为重点案例来介绍训练方法,因为它是直接面对用户显式反馈的模块(比如用户点击"显示更少"或划走某条内容),有非常明确的优化信号。这个模块面临两个严格的约束:延迟预算——它位于高吞吐量信息流的关键执行路径上,必须在极短的尾延迟(p99 < δ毫秒)内完成评分;监督信号稀疏——显式的用户正负反馈虽然信息量高,但自然出现的频率很低。
为了满足延迟约束,系统采用列表式评分:给定用户的语义画像St和一组K个候选内容,模型在单次推理中同时输出所有候选的对齐分数,避免了逐条打分的巨大计算开销。为了应对稀疏监督,论文引入了一个LLM评委集成(LLM-as-a-Judge ensemble),用开源大模型(如Llama 4 Maverick、Qwen3-VL-235B-A22B)对缺少显式信号的"St-内容"配对进行标注,多数投票保证标注质量。这些LLM评委与人类判断的一致率达到96%,可靠性相当高。
图5
图5:双反馈策略对齐框架总览。LLM评委集成生成SFT训练的伪标签,用户真实行为反馈构建DPO偏好对,两阶段训练得到最终的对齐评分模型。
训练过程分两个阶段。第一阶段是监督微调(Supervised Fine-Tuning,简称SFT)阶段。用LLM评委生成的标签构建训练集,每条样本包含用户的当前语义画像和一组信息流候选。关键的设计决策是:在SFT阶段刻意不使用显式用户反馈,这些宝贵的信号被保留下来专供第二阶段的DPO使用。这样做的目的是让SFT先建立一个基础的领域理解能力,而不会过早地过拟合到少数真实反馈上。训练配置方面,论文在单机8×80GB GPU上对Llama3-8B进行了微调,约2.5个GPU小时完成一个epoch。
第二阶段是直接偏好优化(Direct Preference Optimization,简称DPO)阶段。DPO是一种不需要训练独立奖励模型、也不需要在线强化学习采样的对齐方法,直接利用偏好数据(chosen-rejected对)优化策略本身。SYF的DPO偏好对来自两个渠道:真实用户行为反馈(作为高保真锚点)和LLM评委在显式信号缺失时推断的生成标签(作为覆盖放大器)。这种双反馈机制是论文的核心创新之一——它同时兼顾了信号质量和数据覆盖度。DPO训练使用2台8×A100 80GB GPU机器,batch size为4,学习率2e-6,训练1个完整epoch。
表1
表1:与少样本基线的效果对比。在准确率、精确率、召回率和F1分数四个指标上,SFT和SFT+DPO均大幅超越Few-shot基线,且延迟从650ms降低到323ms。

在线实验验证:真实生产环境中的效果与挑战

论文最硬核的部分在于它不仅做了离线评估,还进行了大规模在线A/B测试,这是很多对话式推荐论文想都不敢想的。在线实验中,SYF在生产流量上运行,对比的是Meta现有的生产基线排序系统。
表5
表5:SYF系统相对于生产基线的信息流质量提升。多个关键指标都获得了正向提升,尤其是在负面反馈率上实现了显著下降。
表5展示了SYF相对生产基线的信息流质量提升(Relative Lift)。从数据来看,多个关键指标都获得正向增益,特别是帖子不喜欢率(Dislike Rate)显著下降,说明用户对"什么内容不该出现"的控制确实生效了。用户情感相关的指标也在提升,说明这种主动控制权让用户的体验变好了,不只是数据层面的改善。
表6
表6:消融实验结果。分别去掉某些模块后观察指标变化,验证各模块的贡献。结果显示去掉对齐评分或剪枝模块后,信息流的对齐质量明显下降。
这里特别想聊一下消融实验。表6展示的是去掉SYF某些关键模块后的效果变化。如果去掉对齐评分模块、只保留生产排序器的效果,或者去掉候选增强只看纯生产结果,可以明显看到各项指标都向生产基线回落。这证明了SYF的每一层模块设计都是有实际贡献的,不是堆砌概念。不过论文也坦诚地提到了一些挑战:比如在线实验的观察期相对较短(3周),无法完全评估长期影响;用户行为反馈存在自我选择偏差——愿意主动表达偏好的用户可能本身就比普通用户更活跃;另外,不同用户群体对"主动控制"的接受度和使用频率差异很大,系统需要针对不同用户类型做自适应调整。
值得注意的一个结果是,论文在对齐评分模块的离线评测中,SFT+DPO方案(98.85%准确率)比SFT方案(98.21%)有提升。从表2可以看出一个非常有趣的现象:当信息流与用户偏好匹配时,SFT+DPO的优势更加明显(准确率从0.749提升到0.794);而当信息流与偏好不匹配时,两种方案几乎一样好(0.992 vs 0.994)。这说明DPO阶段的优化主要增强了模型在"模糊地带"的判别能力,而不是简单地在所有样本上均匀提升。
表2
表2:SFT与SFT+DPO在不同条件下的效果对比。前两列衡量信息流与用户偏好的匹配程度(P90(CSL)和P90(CSM)),后两列是对齐评分的准确率。
论文还报告了一些其他离线实验细节,比如不同参数规模模型的零样本性能对比(表3),以及用户与反馈胶囊的交互分布(表4)。表3分析了不同规模LLM的零样本对齐评分能力,结果显示随着模型规模增大,零样本能力也在增强,但距离经过微调的模型仍有差距。表4则展示了用户最常使用的反馈方式,"少推此类内容"和"更多此类内容"胶囊占比最高,说明用户最迫切的需求是"减少"与"增加"两类控制。
表3
表3:黄金数据集上不同规模模型的零样本性能对比。更大规模的模型在零样本对齐评分上表现更好,但经过SFT+DPO训练的8B模型仍然优于所有零样本大模型。
表4
表4:用户与反馈胶囊的交互分布。用户最常用的反馈是"减少此类内容"和"增加此类内容"两类胶囊,占比明显高于其他选项。

局限与展望:从显式反馈到主动偏好引导

论文在讨论部分坦诚地列出了局限性,这比那些只报喜不报忧的论文要实在得多。
第一,反馈偏差问题。愿意主动表达偏好的用户本身就是自我选择的结果,系统可能对"沉默的大多数"用户没有帮助。那些从不点击反馈胶囊、从不跟MetaAI对话的用户,获得的是和原来一样的被动推荐体验。第二,基准评估的局限。离线评估依赖LLM评委生成的金标准,虽然与人类判断一致率高达96%,但评委自身也可能存在系统偏差。第三,长期影响未知。三周的在线实验无法评估长期使用后用户行为的变化,比如用户会不会过度收敛到信息茧房、会不会产生反馈疲劳。
未来方向方面,论文认为从"用户显式反馈"到"系统主动引导偏好发现"是自然延伸。目前的SYF是被动响应用户的要求,下一步可以让系统在发现用户的潜在兴趣转移时主动询问或推荐。还有多轮对话中的长期偏好演化建模,以及把SYF框架扩展到更多内容类型(如电商商品、社交好友推荐等)。

融会贯通

结合PaperDaily已收录论文来看,SYF可以被放在两条研究脉络的交汇处。一条是对话式推荐系统(Conversational Recommender Systems, CRS)的发展脉络——从早期的槽填充式对话到基于知识图谱的推荐,再到LLM驱动的开放域对话推荐;另一条是LLM与推荐系统深度融合的脉络——从用LLM做特征工程,到用LLM做重排序,再到SYF这种用LLM做整个闭环控制器的范式。
与现有工作相比,SYF最突出的差异在于它把LLM从"生成答案的模型"变成了"执行动作的智能体",并且首次在工业级信息流环境中验证了这种范式转变的可行性。值得注意的是,与类似论文相比,SYF的离线评测和在线实验设置存在差异,比如评估数据集构建方式、基线模型的选择等,因此在进行横向对比时需要谨慎看待具体数值。从行业影响角度看,SYF最大的贡献可能不在于某个模块的设计,而在于证明了"用户可控推荐"在大规模生产环境中不仅是可行的,而且能带来真实的正向指标提升。这对整个推荐系统行业都有示范意义。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?Meta在RecSys 2026提出Shape Your Feed(SYF),一个基于LLM Agent的对话式推荐框架,支持文本、语音和UI多模态实时表达偏好,通过感知、服务、自进化三层架构闭环协同。
这篇工作最值得看的点是什么?SFT+DPO达到98.85%准确率,在线A/B测试显示帖子关闭率降低1.70%,帖子不喜欢率降低2.74%,兴趣消费量提升0.16%。
这篇工作的边界或风险在哪里?优点:1)提出完整的三层Agent架构,实现用户可操控的推荐系统;2)多模态输入统一处理,支持文本、语音和UI交互;3)通过DPO和LLM-as-a-Judge实现双反馈对齐;4)在线实验验证了实际效果。缺点:1)依赖用户主动提供反馈,被动用户无法受益;2)系统复杂度高,部署成本较大;3)LLM推理延迟仍是瓶颈;4)对冷启动用户效果有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一个基于LLM的三层Agent架构(感知流、服务流、自进化流),通过结构化语义画像和实时重排序实现用户可操控的对话式推荐系统。

实验合理度:★★★★☆

准确率、精确率、召回率、F1分数、延迟、在线指标(帖子关闭率、帖子不喜欢率、兴趣消费量)。

学术研究价值:★★★★☆

提出一个基于LLM的三层Agent架构(感知流、服务流、自进化流),通过结构化语义画像和实时重排序实现用户可操控的对话式推荐系统;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

对齐评分推理延迟323ms,系统总延迟增加+0.043%关键路径延迟和+0.412%直接层延迟。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)依赖用户主动提供反馈,被动用户无法受益;2)系统复杂度高,部署成本较大;3)LLM推理延迟仍是瓶颈;4)对冷启动用户效果有限。

主要参考文献

[1] Ziyun Xu, Bosen Ding, Yue Zhang, Ji Qi, Qingyuan Song, Jizhou Huang, Liwei Wang, Jefrey Santelli, Yue Weng, Qichao Que, Zhen

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球