刷短视频时,有没有过这样的瞬间:明明点了好几次"不感兴趣",系统还是锲而不舍地推同一类内容;明明在搜索框里敲过"怎么做红烧肉",结果信息流里塞满了各种毫不相干的做饭视频,唯独没有真正想看的那个。用户想表达的需求,和系统真正理解到的意图之间,隔着一道无形的墙。传统推荐系统就像个猜谜高手,只能根据点击、停留时长这些行为信号去揣测心思,猜错了用户也没地方说理。Meta这次在RecSys 2026上带来的Shape Your Feed(SYF)系统,想做的就是把这道墙拆掉,让用户直接告诉系统"我要什么"和"我不要什么",实时生效。这篇论文的标题很直白——《Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation》,中文可以理解为"塑造你的信息流:面向对话式推荐的LLM智能体系统"。作者全部来自Meta Platforms(美国加州门洛帕克),发表于2026年8月,被ACM RecSys '26(第20届ACM推荐系统会议)接收。论文的核心贡献是一套完整的、可落地的工业级对话式推荐框架,不是停留在实验室里的玩具,而是在真实生产流量上做过A/B测试的系统。
论文最硬核的部分在于它不仅做了离线评估,还进行了大规模在线A/B测试,这是很多对话式推荐论文想都不敢想的。在线实验中,SYF在生产流量上运行,对比的是Meta现有的生产基线排序系统。表5:SYF系统相对于生产基线的信息流质量提升。多个关键指标都获得了正向提升,尤其是在负面反馈率上实现了显著下降。表5展示了SYF相对生产基线的信息流质量提升(Relative Lift)。从数据来看,多个关键指标都获得正向增益,特别是帖子不喜欢率(Dislike Rate)显著下降,说明用户对"什么内容不该出现"的控制确实生效了。用户情感相关的指标也在提升,说明这种主动控制权让用户的体验变好了,不只是数据层面的改善。表6:消融实验结果。分别去掉某些模块后观察指标变化,验证各模块的贡献。结果显示去掉对齐评分或剪枝模块后,信息流的对齐质量明显下降。这里特别想聊一下消融实验。表6展示的是去掉SYF某些关键模块后的效果变化。如果去掉对齐评分模块、只保留生产排序器的效果,或者去掉候选增强只看纯生产结果,可以明显看到各项指标都向生产基线回落。这证明了SYF的每一层模块设计都是有实际贡献的,不是堆砌概念。不过论文也坦诚地提到了一些挑战:比如在线实验的观察期相对较短(3周),无法完全评估长期影响;用户行为反馈存在自我选择偏差——愿意主动表达偏好的用户可能本身就比普通用户更活跃;另外,不同用户群体对"主动控制"的接受度和使用频率差异很大,系统需要针对不同用户类型做自适应调整。值得注意的一个结果是,论文在对齐评分模块的离线评测中,SFT+DPO方案(98.85%准确率)比SFT方案(98.21%)有提升。从表2可以看出一个非常有趣的现象:当信息流与用户偏好匹配时,SFT+DPO的优势更加明显(准确率从0.749提升到0.794);而当信息流与偏好不匹配时,两种方案几乎一样好(0.992 vs 0.994)。这说明DPO阶段的优化主要增强了模型在"模糊地带"的判别能力,而不是简单地在所有样本上均匀提升。表2:SFT与SFT+DPO在不同条件下的效果对比。前两列衡量信息流与用户偏好的匹配程度(P90(CSL)和P90(CSM)),后两列是对齐评分的准确率。论文还报告了一些其他离线实验细节,比如不同参数规模模型的零样本性能对比(表3),以及用户与反馈胶囊的交互分布(表4)。表3分析了不同规模LLM的零样本对齐评分能力,结果显示随着模型规模增大,零样本能力也在增强,但距离经过微调的模型仍有差距。表4则展示了用户最常使用的反馈方式,"少推此类内容"和"更多此类内容"胶囊占比最高,说明用户最迫切的需求是"减少"与"增加"两类控制。表3:黄金数据集上不同规模模型的零样本性能对比。更大规模的模型在零样本对齐评分上表现更好,但经过SFT+DPO训练的8B模型仍然优于所有零样本大模型。表4:用户与反馈胶囊的交互分布。用户最常用的反馈是"减少此类内容"和"增加此类内容"两类胶囊,占比明显高于其他选项。
下面是龙哥对于大家可能的一些问题的解答:这篇论文到底在解决什么问题?Meta在RecSys 2026提出Shape Your Feed(SYF),一个基于LLM Agent的对话式推荐框架,支持文本、语音和UI多模态实时表达偏好,通过感知、服务、自进化三层架构闭环协同。这篇工作最值得看的点是什么?SFT+DPO达到98.85%准确率,在线A/B测试显示帖子关闭率降低1.70%,帖子不喜欢率降低2.74%,兴趣消费量提升0.16%。这篇工作的边界或风险在哪里?优点:1)提出完整的三层Agent架构,实现用户可操控的推荐系统;2)多模态输入统一处理,支持文本、语音和UI交互;3)通过DPO和LLM-as-a-Judge实现双反馈对齐;4)在线实验验证了实际效果。缺点:1)依赖用户主动提供反馈,被动用户无法受益;2)系统复杂度高,部署成本较大;3)LLM推理延迟仍是瓶颈;4)对冷启动用户效果有限。如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~