← 返回 PaperDaily 大模型与智能体

快手港城大新作HD-REC:生成式跨域推荐的新范式

图2:HD-REC整体架构。(a)HDQ通过全局共享粗粒度量化和自适应路由细粒度量化构建语义ID。(b)DAS MoE结合常驻共享专家与动态选择的特化专家。

快手港城大新作HD-REC:生成式跨域推荐的新范式
原论文信息如下:
论文标题:
Hierarchical Quantization with Domain-Adaptive Sparse Routing for Generative Cross-Domain Recommendation
发表日期:
2026年08月
发表单位:
City University of Hong Kong, Kuaishou Technology
原文链接:
https://arxiv.org/pdf/2608.06997v1.pdf

HD-REC整体架构图
图2:HD-REC整体架构。(a)HDQ通过全局共享粗粒度量化和自适应路由细粒度量化构建语义ID。(b)DAS MoE结合常驻共享专家与动态选择的特化专家。(c)CRCL鼓励同一物品的语义token保持一致的专家路由决策。

跨域推荐为何如此困难?——从嵌入可视化说起

先抛一个问题:如果你在刷短视频,系统推荐了一条运动鞋的开箱视频,然后又给你推了一件运动T恤——这背后是同一个"你"在两个不同内容域之间的行为串联。可是商品域里的"运动"和内容域里的"运动",语义空间能直接对齐吗?
这正是跨域推荐(Cross-Domain Recommendation, CDR)要解决的核心难题。传统的跨域推荐大多依赖用户或物品的重叠来"搭桥",可现实里不同平台之间因为隐私和数据结构差异,共享实体少得可怜。后来大家想到用预训练语言模型把物品元数据统一编码到共享语义空间,但域间分布差异又会让对齐效果打折。
最近火起来的生成式推荐(Generative Recommendation, GenRec)范式提供了一条新路:把物品编码成紧凑的语义ID(Semantic IDs, SIDs),再用类似语言建模的"预测下一个token"方式统一处理多个域的用户行为序列。这套思路确实巧妙,可问题也随之而来——一个统一模型要同时承载多个域中不同粒度的语义差异,传统方法要么所有参数全局共享,要么只做极轻量的域适配,建模能力明显不够用。
t-SNE嵌入可视化
图1:学习到的嵌入的t-SNE可视化。(a)Sports与Clothing域对比。(b)Electronics与Cell Phones域对比。
论文里用t-SNE可视化了Amazon数据集上学到的物品嵌入。可以看到,不同域的嵌入既存在跨域共享的语义簇,又有各自依赖域的几何结构。换句话说,一个统一的跨域模型既要有共享容量去捕捉通用的语义结构,又得有自适应容量去建模特定域的细粒度模式。这就引出了本文的主角——HD-REC,一个层次化量化加域自适应稀疏路由的统一生成式跨域推荐框架。

层次量化:让共享与特化各司其职

HD-REC的第一个核心组件是层次域感知量化器(Hierarchical Domain-Aware Quantizer, HDQ)。理解它之前,先科普一个背景——残差量化(Residual Quantization)
残差量化的思路就像把一个复杂的物品特征拆成多级"零件":第一层先选一个最接近的码字(code),然后算残差,下一层在这个残差上继续找最近的码字,如此逐层逼近原始向量。在生成式推荐里,这些码字的索引组合起来就是给物品生成的语义ID(Semantic ID),每个token代表不同层级的语义。主流方法如RQ-VAE(Residual-Quantized Variational Autoencoder)就是这种方式,但它的所有码本(codebook)都是全局共享的。
HDQ的创新在于:把量化过程分成前L-1层的全局共享粗粒度量化最后一层的自适应路由细粒度量化。前几层用共享码本来捕捉跨域通用的语义(比如"运动"、"电子"这种大类别),最后一层则准备K个独立的细粒度码本,由一个轻量路由网络动态选择一个码本去做残差量化。这样,不同域的物品在细粒度语义上就能被特化的码本覆盖,而不是被全局共享码本强行"平均"。
粗粒度码本选择公式
共享层选择与残差距离最近的码字,逐层剥离去粗取精。
对于最后一层的路由决策,论文用了Gumbel-Softmax技巧来实现可微分的离散选择——前向传播时直接选top-1码本,反向传播时用soft概率来算梯度,并用直通估计器(Straight-Through Estimator, STE)打通梯度。为了防止某个码本被过度使用导致"路由塌缩",还加了一个负载均衡正则项。
路由逻辑公式
根据残差表示计算路由逻辑值。
Gumbel-Softmax公式
Gumbel-Softmax使得离散路由变得可微。
量化器以重建物品原始特征为主目标,配合码本损失和承诺损失联合训练。整体目标函数如下:
码本损失公式
码本损失让码字逼近残差,稳定量化过程。
承诺损失公式
承诺损失约束编码器输出贴近所选码字。
负载均衡正则公式
负载均衡正则项防止路由塌缩。

稀疏路由:用最少的计算换最大的容量

量化器搞定了物品的语义ID,但模型主干也得有相应的"域自适应"能力。HD-REC的第二个核心组件是域自适应稀疏专家混合(Domain-Adaptive Sparse Mixture-of-Experts, DAS MoE)
传统的MoE架构每个token独立选择专家。HD-REC的做法是:每个MoE层包含一个常驻共享专家(shared expert)和K个特化专家(specialized experts)。共享专家处理所有token,保证基础能力;特化专家由一个轻量路由网络动态选择其中一个,为特定模式补充特化容量。最后将两者输出相加,作为这一层的最终表示。
MoE路由逻辑公式
门控网络将token表示映射为K个特化专家的路由分数。
top-1专家选择公式
确定性选择路由分数最高的特化专家。
MoE输出公式
共享专家与选中的特化专家输出相加。
这套"共享+路由"设计的好处在于:既保留了全参数共享模型的高效性——每个token只多加一个专家计算;同时又给模型注入了数据依赖的稀疏条件计算能力。简单来说,用可控的计算开销换取了更大的模型容量

一致性正则:让同一物品的token"心往一处想"

在生成式推荐里,一个物品被拆成L个语义token,模型的主任务是下一个词预测(Next-Token Prediction, NTP)——按顺序预测用户下一个交互物品的每个语义token。标准的MoE在token级别独立路由,这就带来一个隐患:同一个物品的多个token可能被分配给完全不同的专家分布,导致物品内部路由不一致,削弱语义ID的连贯性。
NTP损失公式
生成式推荐的主任务:预测下一个物品的每个语义token。
为了解决这个问题,HD-REC提出跨粒度路由一致性学习(Cross-Granularity Routing Consistency Learning, CRCL)。做法很直观:把同一物品所有token的表示做均值池化,得到物品级的路由分布;然后用KL散度作为正则项,约束每个token的路由分布向物品级路由分布靠近。这样既允许token保有局部灵活性,又让它们整体上"心往一处想"。
物品级均值池化公式
对物品的所有token表示做均值池化,得到物品级路由参考点。
物品级路由分布公式
物品级路由分布由均值池化表示通过门控网络得到。
token级路由分布公式
每个token根据自己的表示产生本地的路由分布。
一致性损失公式
用KL散度约束token级路由分布向物品级分布靠拢。
最终总训练目标由NTP损失、路由一致性损失和MoE负载均衡损失加权求和。整个过程在统一的生成式框架下联合优化,让量化器、路由网络和Transformer主干各司其职又相互配合。
总损失公式
总训练目标:生成任务损失 + 路由一致性正则 + MoE负载均衡正则。

实验验证:三个数据集上的全面胜利

论文在三个公开跨域数据集上进行了系统实验:Clothing-Sports(休闲)、Electronics-Phones(科技)、Books-Movies(娱乐),分别来自Amazon和豆瓣。数据规模从数千到十几万用户不等,稀疏度普遍在99%以上,是名副其实的"稀疏环境"测试场。
Table 1 数据集统计
表1:数据集统计信息。覆盖用户数、物品数、交互数与稀疏度。
对比的基线覆盖三大类:单域序列推荐(BERT4RecSASRecSTOSA)、生成式推荐(VQ-RecTIGERHSTU)、跨域序列推荐(C2DSRTriCDRLLM4CDSRGenCDR),并使用Hit Rate@10和NDCG@10作为评估指标。
Table 2 总体实验结果
表2:三个跨域数据集上的总体结果。HD-REC在所有指标上全面领先,粗体为最优,下划线为次优。
从表2看,HD-REC在几乎所有域和指标上都取得了最优或次优成绩,尤其是在Sports和Electronics两个域上相对最强基线的提升幅度相当可观。值得注意的是,单域模型BERT4Rec、SASRec表现最弱,说明跨域信号确实有实质帮助;而生成式模型VQ-Rec、TIGER等虽优于单域模型,但由于缺乏层次化自适应容量,还是被HD-REC甩在身后。
为验证各模块的贡献,论文做了细致的消融实验。完整模型作为上限,去掉任一关键组件(层次量化、路由细粒度码本、共享+稀疏专家、一致性正则)都会带来不同程度的性能回落,说明各组件确实各司其职、缺一不可。
Table 3 主要消融实验
表3:主要消融实验结果。逐一移除层次量化、路由码本、共享专家和一致性正则后,性能均有下滑。
Table 4 量化器消融实验
表4:量化器消融结果。进一步验证层次化域自适应量化的有效性。
Table 5 效率与路由一致性对比
表5:beam size为200时的效率与路由一致性对比。HD-REC在推理耗时和路由方差上均优于基线。
图3 超参数实验结果
图3:Clothing与Sports数据集上的超参数实验结果,考察了码本数量、一致性损失权重等的作用。
论文还回答了推理开销这个现实问题——引入路由机制后到底会不会拖慢线上推断?实验显示,相比TIGER基线,HD-REC的推理时间仅有微小的增加,但推荐精度换来了明显提升。在beam size较大(200)的压力测试下,HD-REC的推理效率依然几乎无损,说明稀疏路由机制在工程上是划算的。
特别值得一提的还有论文对路由一致性这个内部指标的分析——CRCL正则显著降低了同一物品内token的路由方差(Routing Variance),说明模型确实学到了更连贯的专家分配策略,而不是靠牺牲灵活性换来的。
路由方差定义公式
路由方差:衡量同一物品各token路由分布的离散程度,越低表示路由一致性越好。

总结与展望:生成式跨域推荐的下一步

HD-REC真正的贡献不在于某个单独模块有多花哨,而是把三个设计串成一个完整逻辑:输入层的层次化量化让语义ID本身拥有"粗粒度全局共享+细粒度域特化"的归纳偏置;主干层的稀疏MoE让Transformer在统一训练下仍能保持数据依赖的自适应容量;训练目标的一致性正则则把前两者的离散路由决策拧成一股绳。这和之前单纯堆全局共享参数或加个轻量adapter的路线,本质上是两种思路的差距。
这套方案也给后续研究打开了几个值得深挖的方向。比如,层次化路由的思想完全可以推广到更多域的场景——当前实验只验证了双域,真正的工业场景往往是几十个域并存,路由机制和负载均衡策略还需要重新设计。另外,CRCL正则用的是简单的均值池化来代表物品级路由参考,更精细的聚合方式说不定还能再挤出一截提升空间。当然也有人会质疑:引入那么多路由和专家,是不是有点过度设计?至少在现有的跨域公开基准上,结果是站得住脚的。
Clothing和Sports数据集对比图
图:Clothing与Sports数据集的嵌入对比可视化,直观展示了跨域语义重叠与域间差异并存的现象。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?面向生成式跨域推荐,港城大联合快手提出HD-REC框架。
这篇工作最值得看的点是什么?HD-REC在所有三个跨域数据集上均取得最佳性能,在Sports和Electronics上提升显著(H@10分别提升17.6%和16.3%),在Clothing和Douban数据集上也有稳定提升。
这篇工作的边界或风险在哪里?优点:(1)层次量化设计合理,全局共享粗粒度码本+自适应路由细粒度码本有效平衡了跨域共享与域特化需求;(2)稀疏MoE在增加模型容量的同时保持计算效率;(3)跨粒度路由一致性正则化创新性地解决了同一物品token路由不一致问题;
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出HD-REC统一生成式跨域推荐框架,通过层次域感知量化器(全局共享粗粒度码本+自适应路由细粒度码本)和域自适应稀疏MoE(共享专家+动态选择专家)实现跨域语义建模,并引入跨粒度路由一致性正则化提升同物品token的路由一致性。

实验合理度:★★★★☆

Hit Rate@10 (H@10) 和 NDCG@10 (N@10)

学术研究价值:★★★★☆

提出HD-REC统一生成式跨域推荐框架,通过层次域感知量化器(全局共享粗粒度码本+自适应路由细粒度码本)和域自适应稀疏MoE(共享专家+动态选择专家)实现跨域语义建模,并引入跨粒度路由一致性正则化提升。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

推理时间在Clothing和Sports数据集上分别为106.2ms和107.8ms每测试实例,相比基线TIGER仅增加约2.5%和2.0%的推理开销。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;(4)在多个数据集上取得一致提升。缺点:(1)仅验证了双域设置,多域扩展性未验证;(2)依赖内容特征质量,对噪声元数据敏感;

主要参考文献

[1] Haiying He, Xiaopeng Li, et al. Hierarchical Quantization with Domain-Adaptive Sparse Routing for Generative Cross-Domain Recommendation. arXiv:2608.06997.
[2] Hou Y, et al. VQ-Rec: Vector-quantized tokenization for generative recommenders. 2023.
[3] Rajput S, et al. TIGER: Generative recommendation via next-token prediction. 2023.
[4] Zhai J, et al. HSTU: Hierarchical sequential transduction units for generative recommendation. 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
跨域推荐难在哪?难在「共享」与「特化」的平衡。HD-REC用层次量化+稀疏路由给出了漂亮解法,想和龙哥一起追踪生成式推荐的前沿进展?欢迎加入『龙哥读论文』粉丝群,扫描下方二维码或添加龙哥助手微信号kangjinlonghelper加群,备注:研究方向+地点+学校/公司+昵称(如 推荐系统+上海+快手+龙哥)!

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。