← 返回 PaperDaily
大模型与智能体
Meta最新研究:用“软聚类”给物品画像,生成式推荐效果大涨!
生成式推荐是当下的研究热点,但如何将用户复杂的协同行为和物品语义同时注入大模型,始终是个难题。Meta这次提出G2Rec,巧妙的用了一个稀疏的物品协同图来捕捉用户行为,再用一个可扩展的“软聚类”方法自动学习出每个物品属于不同兴趣原型的概率,把难以表达的“上下文”变成了模型能轻松理解的结构化token。结果在多个数据集上全面领先,而且在线部署效果也很亮眼。读这
龙哥读论文
发布于 2026-08-14 09:10:43
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 生成式推荐是当下的研究热点,但如何将用户复杂的协同行为和物品语义同时注入大模型,始终是个难题。Meta这次提出G2Rec,巧妙的用了一个稀疏的物品协同图来捕捉用户行为,再用一个可扩展的“软聚类”方法自动学习出每个物品属于不同兴趣原型的概率,把难以表达的“上下文”变成了模型能轻松理解的结构化token。结果在多个数据集上全面领先,而且在线部署效果也很亮眼。读这篇文章,能让你看到工业级推荐系统解决一个核心问题的完整思路。
原论文信息如下:
生成式推荐的新范式:G2Rec,关键在于物品兴趣上下文的结构化与分词
推荐系统走到今天,生成式推荐(Generative Recommendation, GR)已经成了工业界的兵家必争之地。简单说,就是用大模型来预测用户下一步会点什么、会买什么、会看什么。但这里头有个老大难问题:如何把用户的“兴趣上下文”老老实实地喂给大模型? 传统做法要么靠图神经网络(GNN)只看到局部邻居,要么靠人工规则给物品打语义标签,前者算不动、后者标签不准。
Meta最近联合UIUC(伊利诺伊大学香槟分校)放了个大招——G2Rec (Sparse Co-Engagement Graph Schema for Generative Recommendation)。这个框架的脑洞在于:先把所有用户的交互行为压缩成一张物品-物品的“协同共现图”,再用一种可以大规模并行的“软聚类”算法自动给每个物品算出一个概率分布——它属于哪些“兴趣原型”(比如“健康饮食”、“早上好routine”)。然后,把这些“兴趣画像”当作额外的token塞进用户序列里,让大模型一边学物品顺序,一边学兴趣如何转移。效果嘛——在多个公开数据集上全面吊打现有方法,Meta的线上A/B测试也赢了。
如何构建一张稀疏的“协同共现图”?
G2Rec第一步:把几十亿用户“扔掉”,只看物品之间的关系。 传统做法是用user-item二分图,但用户数量太爆炸了。G2Rec换了个思路:如果两个物品被同一个用户交互过(比如点过赞、加过购物车、买了),那它们之间就画一条边。这样我们得到一张只含物品节点的图——物品协同共现图 (item-item co-engagement graph)。为什么这招好使?因为用户的交互行为天然是图上的一条路径:今天点A,明天点B,那条边就记录了兴趣转移的模式。
但问题来了:M个交互,两两组合的边数最多能到O(M²),Meta这种体量根本算不动。G2Rec设计了一个理论上有保证的稀疏化采样 :对每个用户只随机抽m个共现对,加入到图中。论文证明(Theorem 2),只要m取O(log M)量级,就能在谱意义下近似保持图拉普拉斯矩阵的信息,边数降到O(M log M)——接近线性。工业场景下,这个采样是离线跑的,不影响在线响应。
来看下实验用的公开数据集大小——所有数据集稀疏度都超过99.9%,够狠。
可扩展的“软聚类”算法学习兴趣原型
图建好了,但边里有很多随机共现——比如一个人随手点了个搞笑视频又点了个美食视频,不代表这就该连在一起。G2Rec的做法是对图做聚类 :如果一批物品内部互相共现频率远超随机,那它们大概率代表了某种“兴趣原型”(比如“健身装备”、“厨房小家电”)。但传统硬聚类(每个物品只属于一个簇)太死板——一个牛油果吐司教程视频,既可能属于“健康饮食”,也可能属于“早间routine”。所以G2Rec提出了可扩展的软聚类算法 :为每个物品学一个概率分布p_i∈R^C,表示它属于C个兴趣原型的概率。
这个软聚类不是凭空想出来的,它基于一个经典度量——图模度 (Graph Modularity)。原生模度只支持硬分配,G2Rec将其推广为可微的软模度目标函数Q_soft :
Q_soft(P) = 1/(2|E|) Σ_{i,j} (A_{ij} - γ * (k_i k_j)/(2|E|)) * p_i^T p_j
其中A是邻接矩阵,k是度数,γ是分辨率参数,p_i^T p_j是i和j属于同个兴趣原型的联合概率。这个式子是凸的?其实是可微的,能用GPU梯度优化。更重要的是,计算复杂度是O(ρM log M)——ρ是每个物品非零概率的数量(即稀疏度),乘上交互数再乘log,几乎线性。初始化时用Leiden算法(一个快速社区发现算法)得到初始硬聚类,然后展开成软分布。
看表4,软聚类相比硬聚类(Leiden)在所有数据集上模度都更高,证明了软分配的优势。
基于兴趣画像的序列分词与模型训练
有了每个物品的软投影分布(即“兴趣画像”p_i),怎么把它变成大模型能吃的token?G2Rec的做法很巧妙:首先,为每个兴趣原型a计算一个原型嵌入v_a——就是所有物品向量的加权平均,权重就是p_i(a)。然后,每个物品i的“兴趣画像token”y_i就是原型嵌入的加权平均,权重也是p_i(a)。这样,每个物品除了原本的ID嵌入外,还多了一个连续的语义token 。
接下来,对用户交互序列[i1, i2, …, iN],G2Rec生成了一个交替序列 :token序列 = [⟨BOS⟩, y_{i1}, i1, y_{i2}, i2, …, y_{iN}]。为啥不直接把y_i塞到物品前面?注意顺序:先是y_i,再是物品自身ID。这样推荐模型在自回归预测时,既要学会根据前面的上下文预测下一个物品ID,还要学会预测下一个兴趣画像。论文设计了两个交叉熵损失:
L_t^item = CE(预测下一个物品, 真实物品)
L_t^profile = CE(预测下一个兴趣画像, 真实物品的兴趣画像) (把p_i当作软标签使用)
最终损失 L = L_item + λ L_profile,λ是超参数。
这样做的好处是:模型被迫同时理解“用户点了什么物品”和“用户为什么会点这个物品(兴趣转移)”,对长尾和冷启场景尤其有效。
在线部署与大放异彩的实验效果
G2Rec已经在Meta多个产品面(比如Instagram Reels)上线。离线实验用Llama 2 13B作为基座,加LoRA微调3轮。对比方法涵盖了经典方法(POP、MF)、序列方法(GRU4Rec、SASRec、BERT4Rec、Caser、EAGER)和图方法(LightGCN、HeLLM)。结果见表2:
图1更直观地展示了G2Rec在不同cutoff下的领先幅度。
另一个关键点是效率:G2Rec加兴趣画像token对训练和推理时间的影响微乎其微——每batch训练时间仅从0.763秒增加到0.774秒(+1.4%),推理甚至更少。
消融实验(图2)进一步确认了兴趣画像损失λ的权重设定在0.1~1区间效果最佳,验证了L_profile的有效性。
龙迷三问
Q1:G2Rec中的软聚类算法和传统Louvain/Leiden有什么本质区别? 传统Louvain/Leiden输出每个物品一个硬标签(只属于一个簇)。G2Rec输出的每个物品一个概率分布,这样同一个物品可以对应多个兴趣原型,比如“运动摄像机”既属于“户外运动”又属于“数码配件”。更厉害的是,G2Rec的目标函数(软模度)是可微的,可以用梯度下降优化,直接跑在GPU上,而传统算法是贪心迭代,难以并行。
Q2:G2Rec对冷启动物品和冷启动用户怎么处理? 对于冷启动物品:由于它没有历史交互,无法被直接加入共现图,但G2Rec可以利用物品自身的特征(如文本描述、图像)作为初始化嵌入,然后通过“兴趣原型”近似——只要新物品的特征与某个原型相似,就可以先分配一个软分布。论文中假设所有物品都在交互集合内,但实际产品中可以通过特征相似度回退策略处理。对于冷启动用户:G2Rec只要用户发生过一次交互,就能获得完整的交替序列,所以冷启动用户并不冷启动。
Q3:G2Rec用的基座模型是Llama 2 13B,换成更小的模型或者非LLM的序列模型(如SASRec)还能work吗? 理论上可以。G2Rec的核心贡献在于构造历史序列时的“交替token化”,与底层模型无关。论文中的实验也对比了SASRec(非LLM),但G2Rec是作为tokenization层 加在模型前面的,所以如果需要,完全可以只把兴趣画像token作为额外特征注入传统序列模型。不过实验显示Llama 2 13B配合G2Rec收益最大,因为LLM能更好地理解语义概念。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰(4星)
将图共现建模与软聚类引入LLM生成式推荐的tokenization,思路新颖;尤其是软模度可微目标函数的设计,理论上有新意。
实验合理度: ★★★★★(5星)
对比了9个基线,覆盖经典、序列、图方法各流派,指标全面(Recall、NDCG、MRR),且做了消融、效率、线上A/B测试,证据链完整。
学术研究价值: ★★★★★(5星)
为生成式推荐中“如何组织用户行为上下文”提供了可实现的范式,软聚类+tokenization的思路可启发后续工作。
稳定性: ★★★★☆(4星)
离线实验方差较小,线上A/B测试显示稳定提升;但软聚类依赖超参数γ(分辨率),需要调参,稳定性略有折扣。
适应性以及泛化能力: ★★★★★(5星)
在4个不同领域(美妆、体育、玩具、餐饮评论)均表现最好,说明泛化性强;且能适配LLM和非LLM模型。
硬件需求及成本: ★★★★☆(4星)
图构建和软聚类可以离线GPU加速,在线推理几乎不增加开销;但需要Llama 2 13B级别的模型,对普通团队成本偏高。
复现难度: ★★★★☆(4星)
论文未提供开源代码,但关键公式(软模度、tokenization流程)写得清楚,核心算法可用PyTorch实现;不过工业级数据预处理和分布式图处理需要大量工程。
产品化成熟度: ★★★★★(5星)
已经在Meta百万级用户的产品上部署,有完整工程方案(离线图引擎+定时聚类+在线实时推理),成熟度极高。
可能的问题: 软聚类目标函数Q_soft的凸性未分析,可能陷入局部最优;另外兴趣原型的数量C需要人工设置,没有自动确定机制。此外,论文假设所有物品至少被一个用户交互过,对真正零交互物品的冷启动处理缺乏讨论。
主要参考文献
[1] Ruizhong Qiu, Yinglong Xia, Dongqi Fu, Hanqing Zeng, Ren Chen, Xiangjun Fan, Hong Li, Hong Yan, Hanghang Tong. "Structuring and Tokenizing Distributed User Interest Context for Generative Recommendation". arXiv:2606.20554, 2026.
[2] Geng et al., "Generative Recommendation: A New Paradigm". 2022.
[3] Kang and McAuley. "SASRec: Self-Attentive Sequential Recommendation". 2018.
[4] Newman, "Modularity and Community Structure in Networks". 2006.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!