← 返回 PaperDaily 大模型与智能体

快手一招砍掉一层SID,QPS暴增47%还更准了

生成式推荐要落地,第一步先要给物品“起名字”。不是随便起,得让名字本身带着语义结构、藏着协同信号,还得保证不同物品尽量不重名。这一套起名规则,就是论文里说的 SID,也就是 Semantic ID,语义ID。

快手一招砍掉一层SID,QPS暴增47%还更准了
原论文信息如下:
论文标题:
From a Static Multi-Level Small Semantic Codebook to a Dynamic Single-Level Large Semantic Codebook for Generative Recommendation
发表日期:
2026年08月
发表单位:
Kuaishou Technology
原文链接:
https://arxiv.org/pdf/2608.21012v1.pdf

paperdaily_reaction_gif

生成式推荐要落地,第一步先要给物品“起名字”。不是随便起,得让名字本身带着语义结构、藏着协同信号,还得保证不同物品尽量不重名。这一套起名规则,就是论文里说的 SID,也就是 Semantic ID,语义ID。传统做法是用残差量化生成多级语义码,比如快手线上常用的三级结构:第一个码管主干语义,第二个码补残差细节,第三个码用来做协同消歧。听起来很完备对吧?但龙哥看了论文里那张图,直接倒吸一口凉气。
图1:部署的三级SID中,两个语义层级的全局与条件利用率分析。直方图展示每个活跃SID1下可观察到的SID2词典比例分布,表格给出全局利用率及条件利用率统计摘要。
图1:部署的三级SID中,两个语义层级的全局与条件利用率分析。直方图展示每个活跃SID1下可观察到的SID2词典比例分布,表格给出全局利用率及条件利用率统计摘要。
快手分析了大约15亿条工业样本,发现一个非常拧巴的现象:第二个语义码 SID2 在全局上看,93.31% 的码都有人用,覆盖率贼高;但一旦你固定住第一个语义码 SID1,再去看 SID2 的实际使用情况,平均每个 SID1 下面只用了整个 SID2 词表的 2.48%。这意味着什么?意味着第二个语义码建了一个无比巨大的层级空间,但每个一级码下面只稀稀拉拉住了几个“居民”。换句话说,就是为了每个物品多补一点点细节,整个系统白白多付出了一整个自回归解码步骤,还要在一个大部分区域都是空荡荡的层级空间里做搜索。这笔账怎么算怎么亏。
论文的思路非常直接:既然现代大模型已经具备很强的超大词表预测能力,那干脆把两个语义残差量化层级合并成一个大词表的单层语义码本。简单说,就是把原来需要两步才能说清的语义,改成一步到位。这时候你可能会问:那原来第三个协同消歧码呢?保留。但它不再参与语义重建,只负责把落进同一个语义码的“撞车”物品区分开。于是,物品的 SID 从三元组变成了二元组,解码步数从三步变成两步。
图2:本文提出的单层大语义码本总览。初始构建结合曝光加权语义量化(SID1)与确定性协同消歧(SID2)。在线更新维护时间曝光权重,对曝光加权的SID1切换施加惩罚,并在保持SID2不变的情况下更新活跃中心。
图2:本文提出的单层大语义码本总览。初始构建结合曝光加权语义量化(SID1)与确定性协同消歧(SID2)。在线更新维护时间曝光权重,对曝光加权的SID1切换施加惩罚,并在保持SID2不变的情况下更新活跃中心。
来,我们看看原来的残差量化到底做了什么。给定一个归一化后的物品 embedding,第一步先找最近的第一个码,得到近似表示;然后算残差,再用第二个码去拟合这个残差。整个过程可以用下面这组公式表示:
公式:残差量化过程。第一个语义码通过最小化物品向量与码本中心的距离得到,第二个语义码对残差继续量化,最终重建向量为两个码之和。
公式1:残差量化过程示意图。第一个语义码通过最小化物品向量与码本中心的距离得到,第二个语义码对残差继续量化,最终重建向量为两个码之和。
而本文的单层大码本方案呢?直接在大词表里找一个距离最近的码,一步到位:
公式:单层语义码本分配。语义码直接通过最小化归一化物品向量与码本中心的距离得到,重建向量就是该语义中心本身。
公式2:单层语义码本分配。语义码直接通过最小化归一化物品向量与码本中心的距离得到,重建向量就是该语义中心本身。
这里的核心洞察是:与其把语义容量分摊到多层码本上,不如把词表做大,在“宽度”上做文章。这就带来一个非常直接的收益——自回归生成时少预测一个 token。可不要小看这一个 token。在工业级推荐系统里,SID 每多一层,解码器就得多推一步,beam search 的搜索空间也跟着扩大一圈。这不仅仅是多一点算力的问题,而是整个推理链路的效率都会受影响。后面我们会看到,光这一步简化,就能带来接近一半的解码计算量下降。
那物品“撞车”了怎么办?语义码只有一个,肯定有多个物品落在同一个语义中心的情况。这时候 SID2 就登场了。SID2 的生成规则是一个确定性函数,对物品的稳定标识做哈希映射:
公式:消歧码分配。消歧码通过对物品稳定标识应用固定规则(工业实现为稳定哈希)得到。
公式3:消歧码分配。消歧码通过对物品稳定标识应用固定规则(工业实现为稳定哈希)得到。
这个函数一旦定下来就不变了,无论码本怎么更新,同一个物品的 SID2 永远保持不变。这样设计有两层考虑:一是保证同一个物品在码本迭代前后的标识尽量稳定,降低下游模型的适配成本;二是把“语义表达”和“身份区分”彻底解耦——语义码管好不好重建,消歧码管到底是谁。
最后看自回归生成的目标函数:
公式:生成概率分解。目标物品的SID生成概率分解为语义码的条件概率与消歧码在给定语义码下的条件概率之积。
公式4:生成概率分解。目标物品的SID生成概率分解为语义码的条件概率与消歧码在给定语义码下的条件概率之积。
原来的三级结构要多一个“第二个语义码”的条件概率项。现在少了一层预测,模型要学的映射更短,推理时的约束条件也少了。这个结构简化属于“看着不起眼,算下来吓一跳”的类型。

曝光感知动态更新:应对码本漂移的工业级方案

结构简化只是第一步。真正让龙哥觉得“有点东西”的,是论文对工业场景中码本漂移问题的处理。
什么叫码本漂移?简单说,推荐系统的物品池不是静态的。每天都有新物品进来,老物品的曝光量也在变,用户兴趣更是一天一个样。如果码本是用历史窗口的数据一次性拟合出来的,那它跟当前的真实流量分布一定会越来越脱节。原本为高频物品分配的大簇,可能现在已经没什么人看了;而新的热门内容,却被困在一个容量不够的簇里。静态码本的“分区”跟现实流量“对不上号”,这就是漂移。
直接重新训练一个码本行不行?行,但很贵。每换一版码本,整个物品池都要重新打标,下游的生成式推荐模型也得跟着重新训练、重新评估。这个反馈周期太长了,根本没法快速迭代。所以论文提出了一个更聪明的办法:与其推倒重来,不如让码本每天“微调”一次,跟着流量走。
这个动态更新机制有三个核心组件:时间衰减的曝光权重、指数移动平均的中心更新、以及曝光加权的切换惩罚。
先说曝光权重。工业流量服从典型的长尾分布,头部物品曝光量极高,尾部物品几乎没人看。如果做普通的 k-means,每个物品权重一样,码本就会去迎合“数量多但没人看”的长尾物品,反而牺牲了高频物品的表达精度。这显然不合理。论文给出的方案是,把原始曝光量取个对数压一下,避免头部物品过度主导:
公式:曝光权重压缩。原始曝光计数经过对数压缩后作为初始曝光权重,区间从1开始以避免零权重。
公式5:曝光权重压缩。原始曝光计数经过对数压缩后作为初始曝光权重,区间从1开始以避免零权重。
注意这里的 1+log10 设计,既保证了权重为正,又把“超级爆款”和“普通爆款”之间的差距拉到一个合理的量级。更关键的是,这个权重不是静态的,而是会跨天累积的。论文用了一个带遗忘因子的递推公式,让权重既能记住历史,又能逐步遗忘过时信息:
公式:时间曝光权重的递推更新。当天权重由历史状态与当日压缩曝光量加权组合而成,遗忘因子控制历史衰减速度。
公式6:时间曝光权重的递推更新。当天权重由历史状态与当日压缩曝光量加权组合而成,遗忘因子控制历史衰减速度。
然后是中心更新。每天拿到当天的物品 embedding 和曝光权重之后,先找到每个簇里的物品集合,算一个曝光加权的平均中心,然后把它跟旧中心做指数移动平均(也就是 EMA,Exponential Moving Average)。这样一来,中心点的位置会平滑地跟着流量走,不会因为某一天的数据波动就跳来跳去:
公式:中心平滑更新。新中心由旧中心与当天加权中心的凸组合得到,EMA系数控制更新速度。
公式7:中心平滑更新。新中心由旧中心与当天加权中心的凸组合得到,EMA系数控制更新速度。
最后这个切换惩罚,是整个机制的灵魂。如果只是单纯更新中心然后重新分配,那些流量巨大的头部物品一旦换了 SID,下游模型的监督信号就会突然大量改变,梯度更新可能直接“抽风”。论文的做法是,在分配新 SID 的时候,给“换码”这个行为加一个代价——换码可以,但必须是“显著变好”才行,不能为了芝麻大点的距离改善就折腾一次:
公式:带切换惩罚的语义分配。分配目标函数由量化距离与曝光加权的切换惩罚两部分组成,只有距离改善足够大时才允许换码。
公式8:带切换惩罚的语义分配。分配目标函数由量化距离与曝光加权的切换惩罚两部分组成,只有距离改善足够大时才允许换码。
注意,惩罚项前面乘了曝光权重。也就是说,越是高曝光的物品,越不轻易换码;尾部物品换码代价小,随便折腾。这个设计非常符合工业直觉:头部物品的 SID 稳定性直接关系到模型训练稳定性,尾部物品影响面小,给码本留一些自适应空间是合理的。
整个动态更新的流程可以归纳为下面的算法,每天跑一次,轻量高效:
    算法1:曝光感知的动态语义码本更新
    输入:当天物品集合(含向量、曝光量、稳定键)、上一天码本、上一天权重状态
    1. 更新所有物品的时间曝光权重(新物品用当天曝光量初始化,旧物品做指数衰减)
    2. 剔除权重低于阈值的过期物品
    3. 用上一天码本给当天物品打参考标签
    4. 按参考标签聚合,计算每个簇的当天曝光加权中心
    5. 用EMA系数把旧中心和新中心做加权平均,得到当天中心
    6. 依据“量化距离+曝光加权换码惩罚”重新分配当天SID1
    7. 发布新码本和新SID(SID2由稳定哈希直接得到,保持不变)
    整个更新过程不需要重新训练任何模型,只对码本做增量维护,成本极低。这也为工业落地扫清了最大障碍。

    离线评估框架:加速码本迭代的利器

    有了新结构、新更新机制,怎么判断一版码本到底行不行?最靠谱的办法当然是端到端训练一遍推荐模型,看看线上指标。但这个办法太贵了——每次换码本,物品池要重新打标,模型要重新训练,少说也要好几天。如果一天试一个方案,迭代速度根本跟不上。
    论文为此专门设计了一套离线码本评估框架,在下游模型训练之前,先从五个维度给码本做“体检”。这五个维度分别是:表示质量、语义码利用率、簇负载、全SID碰撞率、时间稳定性。
    表示质量衡量的是物品向量被量化之后信息损失了多少。论文用余弦相似度来度量原始向量和它的重建向量之间的距离,同时报告均值、10分位数和中位数,重点关注低尾表现:
    公式:表示质量指标。计算所有评估物品的向量与重建向量之间的平均余弦相似度。
    公式9:表示质量指标。计算所有评估物品的向量与重建向量之间的平均余弦相似度。
    语义码利用率看词表里的码被实际使用了多少。如果大量码都是“死码”,说明词表扩了但没用到,是一种浪费。簇负载统计则关注每个码下面的物品数量分布是否均衡,用95分位数和变异系数来刻画。
    公式:语义码利用率指标。计算语义层级中被占用的码数占词表总码数的比例。
    公式10:语义码利用率指标。计算语义层级中被占用的码数占词表总码数的比例。
    全SID碰撞率是把语义码和消歧码拼在一起后,看还有多少物品是“重名”的。论文设计了两个互补指标:一个是发生碰撞的SID占比,一个是卷入碰撞的物品占比:
    公式:全SID碰撞指标。分别计算发生碰撞的SID占用比例和卷入碰撞的物品占全部物品的比例。
    公式11:全SID碰撞指标。分别计算发生碰撞的SID占用比例和卷入碰撞的物品占全部物品的比例。
    最后是时间稳定性。这里有个很关键的设计细节:为了隔离“码本变了”和“物品向量变了”这两个因素,评估时固定用同一天的物品向量,分别用旧码本和新码本编码,看有多少物品的SID发生了变化。论文同时报告物品维度的变化率和曝光加权的变化率——后者更能反映真实影响,因为高曝光物品的SID变化对下游模型的冲击更大。
    公式:时间稳定性指标。分别计算物品维度的SID变化率和曝光加权后的SID变化率。
    公式12:时间稳定性指标。分别计算物品维度的SID变化率和曝光加权后的SID变化率。
    有了这套离线体检,码本迭代就不需要每次都端到端训练模型,筛掉明显不行的候选,只对最有希望的方案做完整验证。这相当于给码本研发装了一个“快速预筛通道”,大幅压缩了迭代周期。

    实验验证:从公开数据集到线上A/B测试的全面胜利

    接下来是检验真金的时候。论文的实验设计非常完整,从公开数据集上的静态对比,到固定日期评估下的动态码本对比,再到工业评估和线上A/B测试,层层递进。
    公开数据集用了两个:Amazon Reviews 2014 的 Beauty 子集(美妆品类,五核过滤后约 12,101 个物品、19.8 万条交互)和 KuaiRec 2.0 Big Matrix(快手开源的推荐数据集,约 1,253 万条交互,带时间戳,适合做时序评估)。数据集统计信息如下:
    表1:实验所用公开数据集的统计信息。
    表1:实验所用公开数据集的统计信息。
    先说静态对比。论文在 Beauty 数据集上比较了三级SID(S3)和两级SID(S2)在 OneRec-V1、OneRec-V2 两种生成式推荐架构下的表现。OneRec 是基于 MoE 的生成式推荐模型,OneRec-V1 和 V2 是两个不同配置的版本(专家数量、激活方式、输出层设计不同)。结果如下:
    图3:Amazon Reviews 2014 Beauty数据集上,OneRec-V1和OneRec-V2在S3与S2下的扩展实验结果。
    图3:Amazon Reviews 2014 Beauty数据集上,OneRec-V1和OneRec-V2在S3与S2下的扩展实验结果。
    在 Beauty 上,两级SID相比于三级SID,OneRec-V1 的平均 Recall@10 提升了 5.0% 到 8.8%,平均 NDCG@10 提升了 4.1% 到 5.1%;OneRec-V2 的提升更猛,Recall@10 提升了 7.1% 到 8.7%,NDCG@10 提升了 3.8% 到 8.5%。这个提升幅度在推荐领域已经相当可观了。而且注意,这还没有用到动态更新,仅仅是结构简化就带来了这么大的收益。这也从侧面说明,之前三级SID里那个“条件稀疏”的 SID2,确实是在拖后腿。
    表2:Amazon Reviews 2014 Beauty数据集上的推荐性能对比。结果报告三个随机种子下的均值±样本标准差。
    表2:Amazon Reviews 2014 Beauty数据集上的推荐性能对比。结果报告三个随机种子下的均值±样本标准差。
    KuaiRec 上的静态对比结果同样支持这一结论:
    图4:KuaiRec数据集上,OneRec-V1和OneRec-V2在S3、S2及曝光加权S2(PV-S2)下的扩展实验结果。
    图4:KuaiRec数据集上,OneRec-V1和OneRec-V2在S3、S2及曝光加权S2(PV-S2)下的扩展实验结果。
    论文还做了一个细化对比:在 KuaiRec 上比较了普通两级SID和曝光加权两级SID(PV-S2)。曝光加权的意思就是在训练码本时把曝光量考虑进去。结果发现 PV-S2 在离线码本评估指标上表现更好,这说明曝光感知的码本学习确实能提升表示质量。具体数据见下表:
    表3:KuaiRec上的离线码本质量评估。
    表3:KuaiRec上的离线码本质量评估。
    更关键的是动态码本的验证。论文设计了一个固定日期评估方案:用 9 月 4 日之前的数据拟合或更新码本,然后用 9 月 4 日当天的数据做验证,9 月 5 日做测试。静态对照组使用第一阶段拟合的 PV-S2 码本;动态组则继续用 9 月 1 日到 9 月 4 日的数据做每日更新,然后做 warm-start 微调。实验设置对比可以看这张图:
    图5:KuaiRec上静态与动态码本对比的固定日期评估设置。
    图5:KuaiRec上静态与动态码本对比的固定日期评估设置。
    固定日期评估下的动态更新结果也很能打:在 OneRec-V1 上,动态更新额外带来了 Recall@10 提升 1.4%、NDCG@10 提升 7.0% 的增益;在 OneRec-V2 上分别是 2.7% 和 2.7%。这意味着在非平稳流量下面,让码本“跟着流量走”确实比“以不变应万变”要好。具体数据可以看下面这些结果表:
    表5:KuaiRec固定日期静态与动态对比下的推荐性能。
    表5:KuaiRec固定日期静态与动态对比下的推荐性能。
    图6:固定日期KuaiRec对比下,OneRec-V1和OneRec-V2的静态与动态码本结果。
    图6:固定日期KuaiRec对比下,OneRec-V1和OneRec-V2的静态与动态码本结果。
    别忘了还有更细节的公开数据集结果表,感兴趣的读者可以对照着看:
    表9:OneRec-V1在Amazon Beauty上的详细结果。
    表9:OneRec-V1在Amazon Beauty上的详细结果。
    表10:OneRec-V2在Amazon Beauty上的详细结果。
    表10:OneRec-V2在Amazon Beauty上的详细结果。
    表11:OneRec-V1在KuaiRec上的详细结果。
    表11:OneRec-V1在KuaiRec上的详细结果。
    表12:OneRec-V2在KuaiRec上的详细结果。
    表12:OneRec-V2在KuaiRec上的详细结果。
    然后是工业验证。论文在工业级码本评估中对比了静态 PV-S2 和动态 PV-S2,在第一个评估日和第七个评估日分别统计重建相似度。动态版本在第一天的重建相似度就已经略高,到了第七天优势进一步拉大,相对提升 1.50%。这个数字看似不大,但在十亿级别的物品池里,1.5% 的表示质量改善反映到下游推荐效果上,可能就是好几个百分点的业务指标变化。
    表6:工业评估中,首个与第七个评估日的平均重建相似度。
    表6:工业评估中,首个与第七个评估日的平均重建相似度。
    效率提升更是立竿见影。论文实测了三种推理架构下的解码 FLOPs(浮点运算量)和单卡 QPS(每秒查询数):在 Decoder、LazyAR、MTP 三种架构下,更短的 SID 使解码 FLOPs 下降了 47.93% 到 48.70%,单卡 QPS 提升了 28.57% 到 47.0%。一半的算力省下来了,这对工业推荐系统的意义怎么强调都不过分。省下来的算力可以拿去扩大候选集、加深模型,也可以直接转化成成本节约。
    最后的重头戏是线上 A/B 测试。论文在 2.5% 的生产流量上跑了五天,两级SID 相比三级SID 在主消费指标上提升了 0.792%。考虑到推荐系统的体量,0.792% 的消费提升已经是非常可观的业务收益了。而且这还是在只做了结构简化、还没完全调优的情况下拿到的数。这个结果的意义在于,它证明了这套方案不是只在离线指标上好看,而是能真实转化为业务价值。

    总结与展望:生成式推荐的新范式

    这篇论文的价值,龙哥认为不只是提出了一个更高效的码本结构,更重要的是它揭示了一个设计原则:在生成式推荐里,码本的“宽度”和“深度”之间存在一个权衡。过去大家倾向于用多级残差量化来避免超大词表,但那是受限于早期模型的能力。现在大模型已经能hold住超大词表了,那不妨换个思路——把码本做宽,把序列做短。宽度换深度,用模型能力换解码效率,这个权衡在算力昂贵的工业场景里非常划算。
    同时,论文对码本漂移问题的处理也代表了一个趋势:推荐系统里的离散索引不再是“拟合一次用一年”的静态资产,而是需要跟随流量动态维护的基础设施。曝光感知的更新机制加上离线评估框架,让这个“基础设施建设”变得可维护、可迭代、低成本。
    未来可以探索的方向还有很多:更大的语义词表上限在哪里?动态更新机制能不能跟强化学习结合,让码本的演化方向直接对齐业务指标?更激进的,能不能把码本的赋值过程也变成可微的,让推荐模型的梯度直接指导码本演化?这些问题的答案,可能会把生成式推荐推向下一个高度。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:
    这篇论文到底在解决什么问题?快手团队提出单级大语义码本,将生成式推荐常用的多级残差量化语义ID压缩为两级(语义+消歧),并引入曝光感知动态更新机制应对码本漂移。
    这篇工作最值得看的点是什么?在Amazon Beauty上,两级SID相比三级SID提升OneRec-V1平均Recall@10达5.0%-8.8%,NDCG@10达4.1%-5.1%;OneRec-V2对应提升7.1%-8.7%和3.8%-8.5%。在KuaiRec固定日期评估中,动态更新进一步将Recall@10提升1.4%和2.7%,NDCG@10提升7.0%和2.7%。线上A/B测试中主要消费指标提升0.792%。
    这篇工作的边界或风险在哪里?优点:1) 通过压缩语义码本层级显著降低自回归解码成本;2) 曝光感知动态更新机制有效应对码本漂移;3) 提出完整的码本级离线评估框架,加速码本迭代。缺点:1) 单级大码本可能增加语义码间的混淆;2) 动态更新机制的超参数(γ、λ、α)需要调优;3) 消歧码的确定性哈希规则可能限制其表达能力。
    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★★☆

    将残差量化层级压缩为单层大码本,并配套曝光感知动态更新机制,思路清晰且工程导向明确。虽然没有提出全新的理论框架,但“宽度换深度”的设计在生成式推荐中的系统化验证本身就有价值。

    实验合理度:★★★★☆

    实验设计层层递进,从公开数据集静态对比到固定日期动态对比,再到工业评估和线上A/B,覆盖面广。遗憾点是 Beauty 和 KuaiRec 都是偏小规模的数据集,针对超大词表的压力测试还不够充分。

    学术研究价值:★★★★☆

    揭示了码本设计中“宽度-深度”权衡,并给出工业级动态码本的解决方案,对后续生成式推荐研究有较强的借鉴意义。离线评估框架的提出也为码本研究提供了标准化工具。

    稳定性:★★★☆☆

    曝光加权的切换惩罚有效缓解了SID变动带来的训练不稳定性,但动态更新机制的长期运行效果尚未验证,超长周期下的码本质量衰减风险仍需观察。

    适应性以及泛化能力:★★★★☆

    方法在两种公开数据集和工业场景中均取得一致增益,说明结构性收益对不同数据分布有较好的泛化性。但单层大码本对词表容量的依赖,在极大物品池中的表现还需要更多验证。

    硬件需求及成本:★★★★★

    核心贡献之一就是降低解码计算量近一半,无论是在训练还是推理阶段,对硬件资源都更友好。动态更新机制的额外开销也很低,每天只需跑一次轻量级码本更新。

    复现难度:★★★☆☆

    论文对方法描述的细节比较充分,公开数据集上的实验可以直接复现。但工业部分的曝光数据、稳定哈希规则、动态更新的具体参数等依赖内部系统,外部研究者只能复现公开数据集部分。

    产品化成熟度:★★★★★

    本文来自快手工业实践,已经完成线上A/B测试验证且收益为正,产品化程度非常高。动态更新机制和离线评估框架也已经嵌入实际迭代流程,是一套完整可落地的工业方案。

    可能的问题:实验数据集的物品规模相对有限,对于数亿物品的工业超大语料场景,单层码本的词表容量上限、检索效率和稀疏性问题缺乏公开数据支撑;离线评估框架的五个指标与最终推荐效果之间的相关性也缺少系统性分析。


    主要参考文献

    [1] TIGER: Generative Recommender as a Novel Recommendation Paradigm. 原论文引用编号 [13]
    [2] LETTER: Embedding Semantics into Large-Scale Item Retrieval. 原论文引用编号 [20]
    [3] RPG: Parallel Decoding for Hierarchical Generative Recommendation. 原论文引用编号 [7]
    [4] LLaDA-Rec: Parallel Decoding for Generative Recommendation via Discrete Diffusion. 原论文引用编号 [14]
    [5] SSRLive: Dynamic Semantic IDs for Live Streaming Recommendation. 原论文引用编号 [15]
    [6] DIGER: Differentiable Item Tokenization for Generative Recommendation. 原论文引用编号 [4]

    融会贯通

    结合 PaperDaily 已收录论文中的相关研究,可以观察到一些有趣的呼应。之前有不少工作在做并行SID生成、图引导解码、扩散式解码,本质上都是在“避开”多级SID带来的长序列解码开销。而本文选择了另一条路:直接从源头减少语义码的数量。这个对比很有意思——别人在“怎么更快地解出来”上下功夫,本文在“根本不用解那么多步”上下功夫。从解码 FLOPs 降低 48% 这个结果来看,后者的思路在效率上确实是更直接的。
    另外,论文提出的动态码本更新机制,跟推荐系统圈子里越来越受关注的“流式聚类”方向形成了呼应。不过需要提醒的是,本文与其他已收录工作之间的对比主要用于理解研究脉络,不同实验的划分方式、评估设置、基座模型都存在差异,不能直接拿来当作绝对意义上的“谁更强”的结论。

    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       


    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

    LONGGE AI COMMUNITY

    把每天读到的论文,变成长期积累

    加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

    加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

    龙哥读论文知识星球二维码 微信扫码加入知识星球