← 返回 PaperDaily
视觉与图像
腾讯2026新作!BARGE填补生成式推荐“结构鸿沟”,点击率飙升0.60%
生成式推荐(GR)这两年火得不行,但把物品拆成分层语义ID后,编码器分不清哪些token属于同一物品,解码时前缀选错目标就永远找不到。腾讯BARGE像给GR做了“显微手术”,三模块精准修复两个结构漏洞,百万级数据上Recall@10提升近20%,部署后点击率涨0.6%。实打实的工业级改进,做推荐系统的值得细看。
龙哥读论文
发布于 2026-08-14 09:11:27
阅读 3
查看原文
原论文信息如下:
引言
序列推荐本质是猜用户下一步会点什么。以前主流是“判别式”:给每个候选项打分,选分最高的。但商品从几千涨到几百万,每次请求对所有商品打分,计算量线性增长。生成式推荐(GR)换思路:直接“生成”目标商品ID。主流做法用残差量化(RQ-VAE)把商品编码成多层语义ID,如(c1,c2,c3,c4),然后像语言模型一样逐token预测。推理复杂度从O(N)降到O(log N),语义相近的商品共享前缀,很优雅。
但问题来了:这套框架从NLP搬来,token有独立语义,而分层语义ID每层只有结合前缀才有意义。这造成两个结构性“错配”——项目边界消失 和语义漂移 。腾讯这篇论文针对这两个问题提出BARGE,一个三模块正交修复方案。
生成式推荐的结构性缺陷:项目边界消失与语义漂移
图1:生成式推荐中的两个结构性缺陷。左图(项目边界间隙,P1):每个项目被分词为L层分层语义ID并展平为单一序列后,项目边界从GR模型的输入中消失,编码器无法区分哪些token属于同一个项目("项目在哪里?")。右图(语义漂移,P2):在分层码本树上,任何一层的错误都会将解码导向错误的子树,使得目标叶子节点沿着所选路径无法到达,无论剩余token如何评分。
图1左边:每个商品拆成4个语义ID token后展平,自注意力一视同仁,编码器不知哪些token属于同一商品,只能靠位置编码猜测。右边:多层语义ID构成树形码本,第一层选错分支,后面再精确也白搭。论文在基准上测了:TIGER模型在c3层,前缀正确时准确率77%,前缀错误时直接降到0.6%——128倍差距。标准beam search对此毫无知觉。
BARGE:三模块正交修复方案
BARGE(Bridging AutoRegressive Generation for rEcommendation)用三个互补模块分别修复两个结构缺陷:编码端用ICA,解码端用HPR和DPD从不同角度攻击。三者正交,效果几乎等于各自增益之和。
图2:BARGE整体架构。左上:预训练OSQ-VAE通过正交旋转和双码本堆栈将每个项目分化为两个通道特定的语义ID元组;双ID通过MLP投影为展平的token序列。中上:用户历史经过ICA后再进入共享编码器。右上:两个独立解码器(通道A和B)各自跟随HPR并行运行;它们的Top-K候选列表通过OR-Fusion合并产生最终推荐。左下:ICA细节:带可学习查询的交叉注意力池化,MLP投影,门控残差融合。右下:HPR细节:每层双塔评分,用累积路径嵌入与解码器隐藏状态h0对比,通过LHPR损失训练。
ICA(Item Context-Aware Attention)策略:先聚合,再融合。对每个商品v_i,其L个token embedding组成矩阵X(i)。先通过可学习查询向量q做交叉注意力池化,聚合出商品级上下文向量z(i);再用MLP做非线性投影得ẑ(i);最后通过门控机制让每个token自己决定吸收多少商品级上下文:
g(l) = σ(Wg · [x(l) || ẑ] + bg)
门控向量g(l)由sigmoid输出,范围0~1。接近0时ICA退化为恒等映射,接近1时token与商品上下文深度融合。论文在Beauty和Sports上测量门控激活值,稳定在0.35~0.38——网络学到了温和且一致的融合强度。
图6:门控激活值分布。门控值稳定集中在0.35–0.38,表示选择性且一致地注入商品级上下文。
ICA好处是累积的。图5显示,从c1到c4层,有ICA的模型累计命中率始终更高,且差距随层数增加而扩大——注入商品级上下文能有效帮助解码器在深层保持正确路径。
图5:带/不带ICA的跨语义ID层累积命中率对比。ICA的优势随着层数累积而增长,显示出在更深层对语义漂移更强的抵抗能力。
标准beam search在每层只保留概率最高的top-B候选,但概率高不等于语义正确。HPR(Hierarchical Path Reranking)在解码器旁加装每层双塔评分器,评估当前路径片段是否与用户整体偏好一致。它选择解码器初始隐藏状态h0作为锚点——h0在生成任何token前通过交叉注意力聚合了编码器输出,包含用户历史偏好的整体信息。
HPR先定义累积路径嵌入p(l) = Σ e_cj(j=1到l),捕捉路径语义轨迹。然后维护每层双塔评分器,将h0和p(l)分别投影到共享低维空间,计算余弦相似度:r_l(h0, p(l)) = cos(φ_ctx(h0), φ_path(p(l))) · e^τ。双塔架构下,用户上下文投影只需计算一次,即可对所有候选路径高效评分。
HPR损失采用对称InfoNCE,并引入前缀感知负样本——从NTP概率分布中抽取高概率但不正确的候选,以及浏览过但未点击的商品,显式模拟推理中的漂移模式。推理时,先保留更大候选池N,再基于融合评分重排序:score(c,l) = log p(c|c
DPD(Dual-Path Decoding)从根源引入第二个量化通道,形成双保险。核心组件是OSQ-VAE(正交分割量化VAE):对预训练商品embedding z施加可学习正交旋转矩阵R(通过Householder reflections参数化,保证R⊤R=I),然后将旋转后特征均匀分割成两半z̃(A)和z̃(B),每半由独立L层残差码本堆栈量化,产生两个通道的语义ID元组s(A)和s(B)。由于正交性,两个通道支撑子空间满足SA⊥SB且SA⊕SB=RD,将商品语义空间分解为两个互补的正交子空间。
训练时先离线预训练OSQ-VAE并冻结,再训练共享编码器和两个解码器。推理时每个解码器独立运行beam search,产生两个top-K候选列表,通过OR-Fusion在商品ID空间合并:只要有一个通道把目标商品排进top-K,就推荐给用户。实验显示两个通道Jaccard重叠率仅0.18和0.17,高度互补,OR-Fusion能挽回大量被单一通道遗漏的商品。
实验验证:全面超越基线,在线部署收益显著
实验分两部分:公开数据集离线评测和腾讯商业媒体平台在线A/B测试。
表II:在两个Amazon数据集上的整体性能对比。最优结果加粗,最强基线加下划线。
在Beauty数据集上,BARGE的Recall@10达9.77,远超最强基线TIGER的8.16(提升近20%);NDCG@10从3.90提升到4.44。Sports数据集上趋势一致,Recall@10从10.27提升到11.73。
表III:腾讯商业媒体平台离线测试性能对比。*表示已部署的工业基线。
离线测试中BARGE相比TIGER的Recall@10从9.48提升到10.89。在线A/B测试:点击率提升0.60%,点击独立访客数提升1.34%,总阅读时长提升1.70%。计算效率方面,双解码器使参数量从39M增至48M,推理FLOPs从404G增至577G,但这是用合理计算成本换取显著性能提升。
消融研究显示:单独加ICA在Beauty上NDCG@10从3.47到3.62;加HPR到4.03;DPD单通道效果类似,双通道加OR-Fusion到4.24;三者结合达4.44。验证了模块的正交性和互补性。
表VI:在Amazon Beauty上,教师强制(TF)和自回归(AR)模式下的每层预测质量。最后两行将AR模式下的c3层结果按自回归前缀是否正确进行拆分。
表VI关键发现:教师强制模式下BARGE在c2-c4层准确率更高;自回归模式下TIGER的c3层准确率断崖式下跌——前缀正确时70.5%,错误时仅0.6%。BARGE不仅前缀正确时准确率更高(73.9%),还能将前缀错误时的准确率提升到3.1%(约5倍),说明即使前缀选错,仍有一定概率在后续层级找回正确路径。
表VIII:在Amazon测试集上,K=10时的DPD双通道经验互补性
表VIII显示两个通道Jaccard重叠率仅0.18和0.17,高度互补。OR-Fusion得到的top-K列表中,15-24%的商品只出现在单一通道候选列表——说明OR-Fusion确实挽回了大量被遗漏的商品。
龙迷三问
问题1:为什么说ICA、HPR和DPD三个模块是“正交”的? 正交性意味着三个模块解决不同维度缺陷,互不冲突,增益可累加。ICA修复编码端问题,让自注意力感知项目边界;HPR修复解码端路径内问题,在单一通道内通过重排序纠正漂移;DPD修复解码端跨通道问题,通过第二个正交量化通道提供第二条语义路径。消融实验证实增益几乎可加。
问题2:HPR每层维护独立双塔评分器,计算开销大吗? HPR设计轻量,每个评分器只是线性投影层(d_proj较小),双塔架构下h0投影每层只需计算一次,然后批量化评分。实际额外计算量主要是矩阵乘法,对推理延迟影响很小。表IV显示FLOPs从404G增至577G,但Recall和NDCG大幅提升,代价值得。
问题3:OSQ-VAE为什么一定要用正交旋转矩阵R? 正交旋转保证两个子空间严格正交(SA⊥SB)且直和等于完整空间(SA⊕SB=RD),使两个通道捕捉完全互补的语义特征,无冗余。若无正交约束,通道可能学到高度重叠特征,OR-Fusion增益大打折扣。Householder reflections参数化保证R⊤R=I恒成立,无需额外正交约束损失。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
核心创新在于精确诊断GR框架结构性缺陷,提出三个正交轻量修复模块。虽无颠覆性范式变革,但在“发现问题→分解→正交修复”闭环上做得完整优雅。
实验合理度: ★★★★★
实验扎实全面,公开数据集和工业级数据均有对比,消融完整,含在线A/B测试。基线涵盖判别式和GR方法,结果清晰证明每个模块贡献。
学术研究价值: ★★★★☆
对GR结构性缺陷进行正式化定义和论证,对后续研究有重要参考价值。语义漂移问题的分类(路径内vs跨通道)及解决方案设计思路可启发更多GR改进工作。
稳定性: ★★★★☆
在线A/B测试显示在真实场景中表现稳定,点击率、访客数和阅读时长显著提升。多模块正交设计增强系统鲁棒性,单一模块失效不会导致整体崩溃。
适应性以及泛化能力: ★★★★☆
在Beauty和Sports两个不同领域数据集上均取得显著提升,工业级场景验证有效。但HPR和DPD中超参数(如λ、beamsize B、候选池N)可能需在不同场景下调整。
硬件需求及成本: ★★★☆☆
双解码器使推理FLOPs增加约43%(404G→577G),参数量增加23%(39M→48M)。虽可接受,但对资源受限的边缘部署可能有挑战。训练阶段需单独预训练OSQ-VAE。
复现难度: ★★★★☆
三个模块设计相对独立,代码实现不复杂。但DPD中OSQ-VAE需实现正交旋转矩阵(Householder reflections)和双码本训练,可能需要一定工程技巧。
产品化成熟度: ★★★★★
最大亮点是在腾讯平台进行在线A/B测试并取得显著收益,技术方案已经历工业级验证,具备真实落地条件。
可能的问题: 双解码器使推理FLOPs增加约43%,超大规模系统边际成本仍需优化。两个量化通道的语义差异是否总能保证互补性,在数据稀疏场景下是否会被削弱,需进一步验证。
[1] S. Rajput, N. Mehta, A. Singh, R. H. Keshavan, T. Vu, and L. Heldt, “Recommender systems with generative retrieval,” in Advances in Neural Information Processing Systems, 2023. (TIGER)
[2] J. Zeng, J. Zhu, J. Chen, Y. Li, C. Zhuo, W. Liu, and Z. Li, “Bridging the structural gap: Adapting autoregressive generation for recommendation,” arXiv preprint arXiv:2607.21028v1, 2026. (BARGE,本文)
[3] Y. Chen et al., “Bridging the gap between training and inference for autoregressive generation in recommendation,” in SIGIR, 2024. (APAO)
[4] H. Krishnan et al., “PROMISE: Process-aware reranking for multi-level sequence generation,” in KDD, 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
生成式推荐再进化,BARGE填补结构鸿沟!想和龙哥一起讨论推荐系统前沿?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 推荐系统+上海+腾讯+小明) ,根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,还有强大的推荐系统专属讨论群等你来!