← 返回 PaperDaily
视觉与图像
京东最新研究:让推荐大模型不训练也涨点,OneRec 8B命中率提升近4成
让推荐大模型先“思考”再给结果,这事儿听起来很美,实际却常常不涨反跌。京东等团队给出的解法相当清爽:冻结骨干、不重训语义ID,纯靠个性化自然语言在推理期把协同信号接回去,OneRec-8B的命中率直接提升近4成,落地友好,值得细读。
龙哥读论文
发布于 2026-08-14 09:12:12
阅读 4
查看原文
原论文信息如下:
生成式推荐这两年走了一条很直接的路线:把每个物品用残差量化压缩成几个离散码,得到一个短小的语义 ID,也就是论文里常说的 semantic ID(SID)。TIGER、OneRec 这些模型做的事情,就是把“下一件该买什么”变成“下一个该生成的 SID 是什么”。SID 由内容向量量化而来,物品之间内容越像,ID 前缀就越接近,这想法确实漂亮。
但期待中的“推理增强”一直没兑现。很多团队试过让推荐模型先生成一段自然语言分析,再输出 SID,结果要么涨不动,要么反而跌。本文给出了一个很扎眼的数据:在 OneRec-1.7B/8B 上,开启思考模式后,完整三级 SID 的命中率不仅没升,还比直接解码更低;而本文提出的方案,在完全不动模型参数、不改 SID 词表的前提下,把命中率拉回来一大截,8B 模型的全 SID 命中率相对提升接近四成。
论文主体思路
为什么“越想越错”?本文给出一个非常清醒的解释:SID 的容量是有限的,它既要表达物品内容,又试图携带用户行为里的协同信号,这两个优化目标在同一小段离散码里会打架。内容信号通常赢,协同信号经常输,于是推荐结果只能靠内容相似度硬撑。另一方面,语言模型的文本 token 和 SID token 并没有真正对齐到同一个语义空间,模型哪怕写出了很动人的理由,也难以把这些理由准确翻译成一个正确的 SID。
这套思路的关键不是让模型“更会想”,而是绕开思考,直接把协同信号做成一条可寻址的通道,在推理阶段重新接回 SID 生成过程中。下面把这个框架拆成一张概览表,便于理解整体结构。
*表格超出部分左右可以滑动
项目
内容
应用场景 电商/内容平台的语义ID生成式推荐
问题建模 将推荐看作自回归生成物品三级语义ID(SID)
模型Backbone及选择原因 冻结的OneRec-1.7B/8B;目的验证不重训也能恢复协同信号
损失函数 本文不新增模型损失,离线仅做共现矩阵分解
训练数据集 用户的交互历史(原文未公开具体数据集名称与规模)
测试数据集 原文未具体说明,评估指标为完整SID hit@K
训练方法 分层泊松分解 + 大模型标签 + 推理时逐层重排序
实验效果 对Full-SID hit@K一致提升;OneRec-8B相对提升近四成
方法优势 不重训骨干、不改写SID、不扩大推理束宽,在线可用性高
方法缺点 依赖共现统计质量和标签体系;最细粒度s_c不使用协同信号
下面按三个关键步骤展开,把这条“协同信号恢复通道”讲清楚。
协同信号从哪来?最直接的是“两个物品被同一批用户看过”这件事。传统协同过滤会直接分解用户-物品矩阵,但本文选了另一个角度:先构造物品-物品的共现矩阵 C ,其中每个元素 C_ij 表示同时消费过物品 i 和 j 的用户数,也就是二阶共现。这里的“二阶”指的是不直接建模用户与物品一阶关系,而是站在物品对物品的共现关系上,更容易剥离流行度噪声,留下受众重叠结构。
拿到这个稀疏矩阵后,论文用分层泊松分解(Hierarchical Poisson Factorization,HPF)把它拆成物品的非负隐因子。HPF 是面向稀疏计数数据的经典概率矩阵分解方法,用 Gamma–Poisson 结构建模,比普通矩阵分解更适合这种取值很大、大部分为零的共现矩阵。分解后每个物品得到一个 64 维的协同向量。由于推荐模型生成的是 SID 而不是 item id,离线模块还需要把物品向量聚到 SID 前缀上:每个被占用过的 (s_a, s_b) 前缀,取其下所有物品因子的平均,作为这个前缀的协同签名,对应论文中的 sig(s_a, s_b)。这一层只做到中粒度前缀为止,因为更深的 s_c 级别物品太少,共现统计不稳,再做签名反而容易过拟合。
协同签名建好了,还需要回答一个问题:一个用户到底要往哪个方向“签”?最朴素的做法是拿用户历史物品因子求平均,但这等于把协同查询重新绑回原始行为序列,既没有语言入口,也没法解释。本文选择让大模型把用户历史总结成一组标签,标签分两类:一类是受众意图,比如“硬核竞技类”“女性向”;另一类是行为风格,比如“单IP追更型”“广泛涉猎型”。原始标签再映射到固定本体表上,保证线上可复用。
然后离线为每个标签 t 学习一个“标签→协同因子”的分布 P(f|t)。做法很直观:在训练用户里,把每个用户的行为因子均值按标签数量均分,再按标签汇总,并用全局因子先验做一次平滑。这样每个标签都被放到一个可解释的协同位置上。线上推理时,只看目标用户的标签,把对应标签分布加起来做归一化,就得到用户的个性化协同查询向量 q_u。整个过程不读用户原始历史,也不碰物品内容,完全由自然语言驱动协同空间中的检索。
最后一步是这篇文章最“工程友好”的部分。推理时骨干模型照常做受限束搜索,但每一层候选的打分不再是模型单独说了算,而是叠上一个协同残差。残差的形式是用户查询向量 q_u 和候选签名 sig(·) 的点积,外面再用一个固定标量 λ 控制强度。关键是束的宽度完全不变,只对骨干已经给出的候选做重排,不会引入额外候选,也不会增加解码开销。
重排规则是分层而治的。第一层 s_a 的协同残差主要起“候选扩张”作用:把束搜索原本会丢掉的正确大类重新拉回 top-M_a。第二层 s_b 是真正承重的协同重排:因为内容相近、受众对立的物品容易被 SID 编码塞进同一个中粒度前缀,协同残差在这一层能把用户真正想要的那个分支顶上去。第三层 s_c 不再加协同项,只用库存约束保证生成结果在目录内存在,因为同一 (s_a, s_b) 下的物品已经非常相似,继续做协同区分收益小、风险大。
值得注意的是,整个流程中的协同签名和语言标签桥都属于离线预计算,线上只多了一次向量点积和一个很小倍率的打分融合。对已经上线了 SID 推荐模型、却苦于“模型越调越贵、协同越补越偏”的团队来说,这个设计几乎是零侵入的。
龙迷三问
为什么“思考模式”会在语义ID推荐上不升反降? 问题不出在推理能力本身,而出在表征错位。文本 token 和 SID token 来自不同嵌入空间,模型就算能写出合理分析,也很难把分析结论准确翻译成目标 SID,更何况还叠加了“SID 同时承载内容与协同信号、导致协同被挤掉”的结构性缺陷。所以论文采用的思路不是修补推理,而是绕开推理,在生成端直接补协同偏好。
什么是HPF?为什么要用它? HPF 全称 Hierarchical Poisson Factorization,中文是分层泊松分解。它把共现矩阵拆成非负的用户向量和物品向量,用泊松分布拟合计数数据,带层次先验保护稀疏物品。相比普通 SVD 或矩阵分解,HPF 更擅长处理长尾严重、取值稀疏的共现矩阵,这也是本文选它算协同签名而不是用神经网络的原因:轻量、可解释、离线几分钟就能跑完。
为什么只在中粒度前缀加协同残差,不在最细粒度加? 最细粒度的 s_c 前缀下物品数量太少,共现统计非常稀疏,很难估计出可靠签名;同时同一 (s_a,s_b) 下的物品内容已经高度相似,受众差异也小,协同残差基本区分不出什么。而中粒度前缀既有足够样本支撑统计稳定性,又能留下足够的受众区分度,是“可估计”和“有判别力”之间的折中。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 反直觉地指出“推理增强”在 SID 推荐上失效,并提出“协同签名+自然语言桥+推理期逐层重排”这一正交路线,思路新的,且非常克制。
实验合理度: ★★★★☆ 使用同一套 frozen backbone、同等解码预算做对比,排除“模型变大、beam 变宽”的干扰;直接以 full-SID hit@K 为指标,结论清晰。唯一遗憾的是公开实验细节偏少。
学术研究价值: ★★★★☆ 把“协同信号应该放在哪一层”重新提出来研究,以自然语言作为协同空间的寻址方式,给后续生成式推荐研究提供了一个可复用的分析范式。
稳定性: ★★★☆☆ 推理期只做候选重排,不会干扰骨干模型原本的生成分布;但增益上限取决于离线共现统计和标签系统的稳定供应,若用户行为分布快速漂移,需要周期性重算签名。
适应性以及泛化能力: ★★★☆☆ 主干思路与具体骨干模型解耦,理论上能接到其他 SID 生成式推荐模型上;但标签本体表需要针对不同业务定制,跨领域时有一定的迁移成本。
硬件需求及成本: ★★★★☆ 离线 HPF 计算量很小,推理时只增加了一次点积和一个标量融合;相比微调或训练推理模型,几乎可以忽略额外算力成本。真正的隐性成本是大模型打标签的维护。
复现难度: ★★★☆☆ 伪代码和分层重排公式都给得比较完整,理论上可复现;但论文没有明确给出公开数据集名称,也没有提供开源代码,需要团队自己搭建 SID 推荐骨干,动手成本不低。
产品化成熟度: ★★★★☆ 非常适合已上线 SID 生成式推荐模型的系统做冷启动式升级,不碰模型、不换 ID,直接挂在重排层即可。比较适合“想立刻看到协同红利”的团队;需要注意标签在线服务质量和共现矩阵的更新频率。
可能的问题: 主实验集中在 OneRec 1.7B/8B 一套骨干预训练上,跨域和更大规模目录的增益证据不足;s_c 粒度完全放弃协同,在最需要细粒度区分的品类可能损失信息;标签本体依赖离线维护,冷启动新语义时仍需人工介入。
主要参考文献
1. Han C, Li Q, Zang Y, et al. Restoring Collaborative Signals in Semantic-ID Generative Recommendation via Personalized Natural Language. arXiv:2607.05901, 2026.
2. Rajput S, et al. TIGER: recommendation as autoregressive sequence generation. 2023.
3. Deng J, et al. OneRec: unified generative recommendation framework. 2025.
4. Gopalan P, Hofman J M, Blei D M. Scalable Recommendation with Hierarchical Poisson Factorization. UAI, 2015.
5. Wei J, et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS, 2022.
6. Turpin M, et al. Language Models Don't Always Say What They Think. 2023.
7. Liu X, et al. Content-Collaborative Trade-off in Semantic ID quantization. 2025.
8. OneRec Team; He B, et al. Reasoning mode degrades SID generation. 2026.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
给推荐系统喂标签,它给你喂好物;给龙哥粉丝群一个备注,龙哥给你喂好论文。😝 群里每日推送最新AI论文解读,
图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融 五群齐开,速来找同好!扫描下方二维码或者添加龙哥助手微信号加群:
kangjinlonghelper ,一定要备注:
研究方向+地点+学校/公司+昵称 (如 推荐系统+北京+京东+龙哥),备注合规可更快被通过并邀请进群哦~