← 返回 PaperDaily
视觉与图像
快手&南开RecoReward:用推荐器反馈训练描述生成,召回提升40%,推理零用户信息
这篇论文巧妙解决了多模态推荐中一个两难问题:既要利用用户行为信号优化描述,又要保持推理时纯内容生成。快手和南开提出的RecoReward用推荐器作为训练时的“裁判”,让MLLM学会生成对推荐更友好的描述,离线全面领先,在线也有实实在在的提升。思路新颖,工程上也很实用,值得做推荐系统的同学关注。
龙哥读论文
发布于 2026-08-14 09:11:35
阅读 4
查看原文
原论文信息如下:
培训时“偷看”用户信号,推理时“装作”纯内容——RecoReward的巧妙平衡
推荐系统领域一直以来都面临一个尴尬的“两难”困境:想要描述更精准,就得了解用户偏好,但一旦把用户信息塞进生成过程,描述就从“共享物品特征”退化成“千人千面”的个性化文案——每次召回都得重新生成,缓存失效、计算爆炸。反过来,纯靠物品内容生成的描述虽然能缓存复用,但往往抓不住重点,给所有用户推同一套说辞,就像卖货主播只会念产品说明书,完全不管观众爱吃瓜还是爱看热闹。
快手和南开大学的一组研究者,偏偏想打破这个魔咒——RecoReward 应运而生。它的核心思路特别“鸡贼”:训练时让多模态大模型(MLLM)“偷看”用户反馈信号,但推理时完全装作“纯内容生成”,假装什么用户信息都没见过。 怎么做到的呢?答案是把推荐系统当“裁判”——用双塔模型给生成的描述打分,分数高的描述说明更受目标用户欢迎,然后用这个分数作为强化学习的奖励,去调优生成策略。一旦模型训练好,推荐器就退休了,生成器独自上场,只靠直播画面和语音输出描述。
这就像是个“卧底”训练:教练(推荐器)在训练时偷偷递小纸条告诉学员(生成器)哪些描述能吸引真正爱看的人,但到了正式比赛,学员要装作什么都没发生,仅凭本能(纯内容)表现。这套玩法在快手直播推荐的真实场景中取得了显著效果。
图1:三种生成策略的对比。a)纯内容生成:模型只看物品,不看用户,生成的是共享描述,但不能感知用户意图;b)用户条件生成:模型同时看物品和用户信息,描述因人而异,推理时需要用户输入;c)RecoReward:训练时利用推荐器(看到用户)提供的奖励信号,推理时却只靠物品内容,既知用户又享纯内容推理的便利。
这种方法解决了业界一个长期痛点:纯内容生成无法收到下游推荐反馈,用户条件生成则让物品表示变成用户相关计算。 RecoReward 实现了“鱼与熊掌兼得”——在训练时引入用户行为信号,在推理时保持完全的内容独立性。正如论文中的关键发现:描述虽然符合同一结构化模板,但可以侧重于不同的人员、事件、场景或属性,组合不同,对推荐效果的影响天差地别。 这意味着,即使两个描述在语义上都是“正确”的,它们对推荐系统的价值可能完全不同。RecoReward 的核心任务就是教会 MLLM 识别并生成那些“对推荐更有价值”的描述。
行为分析揭秘:为什么直接从目标用户学到的描述会偏“大众化”?
在正式设计奖励函数之前,研究者先做了一组极其严谨的行为分析实验 ,从快手直播平台上采样数据,按时间严格划分:前六天(历史)的用户行为用来构造“目标用户”和“非目标用户”,最后一天(未来)的数据用来验证预测效果。核心问题很直接:“历史目标用户的平均表示,到底能不能代表未来目标用户?”
实验发现了一个反直觉的现象:直接用历史目标用户的嵌入中心(称为“Proxy Center”)去选择描述,虽然能一定程度上预测未来目标用户(ROC-AUC 达到 0.7603),但它同时也包含了大量与“所有活跃用户”共有的偏好方向。 换句话说,这个中心向量不仅指向“喜欢该直播的用户”,还指向了“快手所有活跃用户的平均口味”。如果直接把它作为推荐信号,模型会倾向于生成那些“大众化”的描述——也就是谁都觉得还不错,但没有针对性的内容。
图3:行为分析实验的设计与发现。a)时间分离分析协议;b)代理中心分解:蓝色箭头(Proxy Target Center)与非目标用户中心(Non-target Center)都包含大量全局用户方向(与全局用户中心的余弦相似度分别为0.775和0.925),相减后残差方向(Corrected Direction)与全局中心几乎正交(0.096);c)修正后的中心更倾向于选择对目标用户具有更高区分度的描述。
研究者进一步量化:历史目标用户中心与全体用户中心(Global User Center)的余弦相似度为 0.7752,而非目标用户中心与全体用户中心的相似度更是高达 0.9255。两者都包含了很强的全局共性。但神奇的是,当用目标用户中心减去非目标用户中心后,得到的“修正方向”与全局中心的相似度骤降至 0.0960 ——几乎正交,说明全局偏好的成分被干净地去除了。对应的,修正方向对未来目标用户的预测能力反而提升了:ROC-AUC 从 0.7603 提升到 0.8052,平均精度(AP)从 0.7518 提升到 0.7904。
更关键的是选择结果:使用修正方向后,与使用原始目标中心相比,约 47.4% 的直播间所选的最佳描述发生了变化 。修正后虽然目标用户的平均亲和力略有下降(从 0.3108 降至 0.2969),但非目标用户的亲和力降幅更大(从 0.1596 降至 0.1354),使得两者之间的“边际”从 0.1513 扩大到了 0.1616。这个结果强有力地说明:非目标用户作为背景参考,能帮助推荐器筛选出那些“更招目标用户喜欢,而大众反应平淡”的描述。 这就是 RecoReward 奖励函数设计的核心洞察。这一发现也解释了为什么直接使用目标用户信号进行监督学习效果不佳——因为模型会学到大众化的共性,而非目标用户特有的偏好。
RAS公式:用双塔推荐器给描述打分,专挑对目标用户有用的
基于上述行为分析,研究者提出了Recommender Affinity Score(RAS) ——推荐器亲和力分数,用来量化“一个描述到底有多对目标用户胃口”。这个分数综合了目标用户和非目标用户的反馈,通过一个简单的线性公式实现:
RASλ(y; a) = S+(y; a) – λS−(y; a)
其中:S+ 是直播间 a 的历史目标用户对该描述 y 的平均亲和力(也就是用户嵌入与描述嵌入的内积均值),S- 是历史非目标用户的平均亲和力,λ 是一个超参数,控制非目标用户背景信号的扣除强度。整个公式本质上是在做“目标用户亲和力”减去“大众背景亲和力”,从而得到“目标用户独享的亲和力”。这正是行为分析中“修正方向”的数学形式化。当 λ=0 时,RAS 退化为仅使用目标用户信号,此时模型会倾向于生成大众化描述;当 λ 取值适中(如 2)时,模型能够有效剔除全局共性,聚焦于目标用户的独特偏好。
整个训练流程如 Figure 4 所示:MLLM 根据直播内容和语音生成多个候选描述(Rollout),然后用训练好的双塔推荐器(包含用户塔和描述塔)计算每个描述对目标用户的 RAS 分数,再通过 GRPO(Group Relative Policy Optimization,群体相对策略优化 )进行强化学习更新。注意,用户信息在整个训练过程中只出现在推荐器侧,且推荐器完全冻结 ——MLLM 根本看不到任何用户嵌入或历史行为,只能通过推荐器的分数间接学习哪些描述更受目标用户欢迎。这种设计确保了推理时 MLLM 可以完全独立于用户信息运行。
图4:RecoReward完整训练流程。MLLM生成候选描述,双塔推荐器计算RAS分数,通过GRPO进行策略优化。用户信号只存在于推荐器侧。
为了训练双塔推荐器,研究者使用了一个大规模行为日志数据集,每条样本包括用户嵌入(基于用户历史行为序列、属性等)和描述嵌入(仅来自生成的描述文本),目标是将互动的用户-描述对在向量空间中拉近。损失函数是带权重的 InfoNCE 对比损失,权重 wb 根据用户与直播间的具体互动类型(进入房间、长看、关注、评论、点赞、送礼等)赋予不同强度。例如,送礼和关注这类强信号行为会被赋予更高的权重,而仅仅进入房间则权重较低。训练完成后,双塔推荐器对任意用户-描述对都能输出一个稳定的亲和力分数。这个推荐器在整个 RecoReward 训练过程中保持冻结,只作为奖励信号的提供者,不参与梯度更新。
离线实验遍地开花:7个召回指标全优,消融实验揭示最佳配置
离线实验采用了快手直播平台一周的日志数据,严格按时间切分为训练集(前6天)和测试集(最后1天)。评估方式非常严谨:对每一种生成策略,都重新训练三组不同随机种子的双塔推荐器(DSSM),然后取平均值和标准差报告指标,包括 HR@10、HR@64、HR@128、NDCG@10、NDCG@64、NDCG@128 和 MRR 共七个指标。这种多指标、多随机种子的评估方式有效避免了单次实验的偶然性。
对比基线分两大类:非 MLLM 的经典推荐模型(DSSM、LightGCN、NextItNet、GRU4Rec)以及商用/开源的多模态大模型(GPT-5、Gemini-3.1-Pro、Qwen3.5 系列、InternVL 系列等)生成的描述 + DSSM。结果如表3所示。值得注意的是,经典推荐模型直接使用原始多模态特征(如视频帧、音频、OCR文本等)进行召回,而 MLLM 基线则是先生成结构化描述,再基于描述进行召回。这种对比设计能够清晰展示“描述生成质量”对推荐性能的独立贡献。
表3:离线召回性能对比。RecoReward-9B 在所有七个指标上取得最高值,并且相对于 Qwen3.5-9B 提升 31.7%–40.4%。RecoReward-4B 也超过了所有未优化的8B/9B模型。
RecoReward-9B 在所有七个指标上全部领先 :NDCG@128 从 Qwen3.5-9B 的 0.013166 提升到 0.018199,HR@128 从 0.062489 提升到 0.086597,相对提升 31.7%–40.4%。更令人惊讶的是,未经过优化的 Qwen3.5-9B 反而比其 4B 版本还弱 ,说明模型变大并不自动带来更好的推荐特征——关键在于是否将下游推荐信号纳入训练。RecoReward-4B 也超过了所有未优化的 8B/9B 模型,包括商用模型 GPT-5 和 Gemini-3.1-Pro 生成的描述。这一结果强有力地证明了 RecoReward 训练范式的有效性:即使是较小的模型,只要经过推荐信号引导,也能生成比大模型更有利于推荐的描述。
对比基线中,最值得关注的是商用模型 GPT-5 和 Gemini-3.1-Pro ,它们虽然能力强大,但完全基于指令遵循生成,没有针对推荐优化,结果被 RecoReward 大幅超越。这说明“描述本身的语义质量高”不等于“描述对推荐有用”——RecoReward 恰恰弥补了这个鸿沟。 例如,GPT-5 可能生成一段文采斐然但信息冗余的描述,而 RecoReward 生成的描述虽然模板化,但每个字段都精准对应了目标用户的兴趣点。
(1)非目标用户减法系数 λ :从表4可见,λ=0(即不使用非目标用户减法)时性能最差;λ=2 时在所有指标上都达到最优。λ=0.5 时在 NDCG@64、NDCG@128 上表现也不错,但在 MRR 上不如 λ=1,说明适度扣除背景信号有助于提升首位排序质量 。当 λ 过大(如 3 或 4)时,性能开始下降,说明过度扣除会损失目标用户的有效信号。
表4:非目标减法系数 λ 的消融实验。λ=0 时最差,λ=2 全面最优。
(2)每个输入生成的候选描述数量 G :从 4 增加到 12 时,所有指标持续上升;从 12 到 16 时,NDCG 仍有提升但 HR 略有下降,整体饱和点出现在 12–16 之间。这说明更多的候选描述为 GRPO 提供了更丰富的对比样本,但超过一定数量后边际收益递减。实际部署时可以选择 G=12 以平衡计算开销和性能。
(3)计算奖励时使用的用户数量 :实验发现,只需要大约 100 个目标用户和 100 个非目标用户,就能达到接近全量用户的性能。这说明RAS 统计量的方差控制得相当好,在小样本下依然稳定 。这一发现具有重要的工程意义:在实际部署中,不需要为每个直播间维护大量用户嵌入,只需采样少量代表性用户即可获得可靠的奖励信号,大幅降低了计算和存储开销。
在线A/B测试:关键页用户渗透率提升,外溢流量同步增长
离线实验很出色,但真正的考验在线上。研究者将 RecoReward 训练好的描述生成器部署到快手直播推荐系统中,进行了一周的在线 A/B 测试。实验组使用 RecoReward 生成的结构化描述替换原有的物品特征,对照组使用同一基座模型(Qwen3.5-9B)纯内容生成的描述。测试覆盖了快手主站推荐流的全量用户,确保了统计显著性。
关键页用户渗透率(Key-page Effective-user Penetration) :衡量在关键页面(如推荐流、发现页等)有有效行为的用户占比。RecoReward 在这项指标上取得了正向提升 ,说明更多用户被推荐的内容吸引并产生了互动。具体而言,实验组中用户在推荐页的停留时长、点击率和互动率均有改善,表明生成的描述更有效地传达了直播间的吸引力。
外溢流量分布(Outflow Distribution) :衡量推荐系统“流出”到其他页面的用户流量分布变化。RecoReward 同样观察到正向改善 ,说明推荐内容更好地匹配了用户兴趣,减少了跳出。例如,用户从推荐页进入直播间后,更倾向于继续浏览主播的其他内容或关注主播,而不是直接退出应用。
在线 A/B 测试的论文中说“reports positive changes”,虽然没有给出绝对值(出于商业原因),但显著性是达到的。龙哥认为,这种工业级验证在推荐系统论文中非常难得 ——很多学术方法虽然离线刷榜,一上线就扑街。RecoReward 能在快手大规模在线真实流量中站稳脚跟,证明了它的实用价值。此外,论文还提到在线部署时,描述生成的计算开销与基线完全一致,因为推理阶段 MLLM 的输入输出格式没有变化,只是内部参数经过了优化。
龙迷三问
RecoReward和之前的一些用户条件生成方法(如Rec-R1、CURec)本质区别是什么? 最大区别在于推理时是否需要用户信息。Rec-R1、CURec、VRAgent-R1等方法在推理阶段需要传入用户历史或profile,导致描述生成变成“用户特定计算”,无法缓存共享。RecoReward通过训练时的推荐器奖励将用户偏好内化到MLLM的参数中,推理时只看物品内容就能输出对推荐有利的描述,保持了纯内容推理的高度复用性。这意味着在工业部署中,RecoReward生成的描述可以像传统物品特征一样预计算并缓存,而用户条件方法需要为每个用户实时生成,延迟和计算成本高出数个数量级。
什么是DSSM双塔模型?为什么要用它作为评分器? DSSM(Deep Structured Semantic Model,深度结构化语义模型)是一种将用户和物品分别映射到同一向量空间的双塔神经网络结构。RecoReward之所以选择它,是因为它天然支持“用户-描述”的兼容性度量,且工业界部署成熟、效率高。训练好的DSSM可以在毫秒级内对任意用户-描述对打分,适合作为强化学习的奖励函数。具体来说,用户塔输入用户的历史行为序列和属性特征,输出用户嵌入;描述塔输入结构化描述文本,输出描述嵌入。两个嵌入的内积即为亲和力分数。这种双塔架构的另一个优点是:用户塔和描述塔可以独立更新,当用户行为分布发生变化时,只需重新训练用户塔,描述塔可以保持不变。
实验中的“未来目标用户”是怎么构造的?这能代表真实推荐中的新用户吗? 论文严格按时间划分:前6天的用户行为用来构造历史目标用户和非目标用户,第7天的用户行为用作未来目标用户的标签。这种时间分离保证了“未来”用户是训练阶段完全没见过的。虽然这不能完全模拟推荐系统冷启动场景,但已经是线下评估中很接近在线环境的设置。具体构造方法是:对于每个直播间,将前6天与该直播间有过正向交互(如进入、点赞、关注等)的用户定义为历史目标用户,将有过负向交互(如曝光未点击)或完全没有交互的用户定义为非目标用户。第7天新产生交互的用户则作为未来目标用户,用于评估预测能力。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
创新点很清晰:利用推荐器作为训练时的奖励函数,巧妙地绕过了用户条件生成推理时的开销。虽然双塔+RL奖励的组合已有类似工作,但将非目标用户作为背景扣减这一细节设计很有洞察力,且系统性验证了行为分析。此外,论文提出的 RAS 公式简洁而有效,将行为分析的发现直接转化为可训练的奖励信号,这种从分析到设计的闭环思路值得学习。
实验合理度: ★★★★★
离线实验设计非常扎实:严格时间切分、训练多个随机种子的评估器、报告均值±标准差、包含丰富消融实验。在线A/B测试也给出了正向结果,整体可信度很高。特别值得一提的是,论文对每个超参数都进行了系统性的消融,并给出了合理的解释,这种严谨性在推荐系统论文中较为罕见。
学术研究价值: ★★★★☆
提出了一种将用户行为间接融入生成的新范式,对于“如何让大模型感知下游任务”这一通用问题有参考意义。单独的行为分析实验方法论也值得推荐领域研究者借鉴。该范式不仅适用于推荐系统,还可能推广到搜索排序、广告投放等需要将生成内容与下游任务对齐的场景。
稳定性: ★★★★☆
奖励函数依赖于训练好的双塔推荐器;如果推荐器因数据漂移而退化,生成质量可能受影响。不过论文通过冻结推荐器减轻了这一问题。线上实验一周的结果没有报告长期稳定性。在实际部署中,可能需要定期用新数据重新训练推荐器,并重新微调 MLLM,以保持描述生成与用户偏好变化同步。
适应性以及泛化能力: ★★★☆☆
方法主要在快手直播推荐场景中验证,对其他类型推荐(如商品、音视频、广告)的泛化能力有待检验。不过框架具有一般性,只要存在用户-物品匹配的双塔模型就可应用,应能迁移。例如,在电商推荐中,可以用类似方法优化商品标题生成;在短视频推荐中,可以优化视频摘要生成。但不同场景下“目标用户”和“非目标用户”的定义可能需要调整。
硬件需求及成本: ★★★★☆
训练阶段需要一张MLLM和双塔推荐器,但双塔推荐器规模远小于MLLM,整体开销可控。推理阶段仅有MLLM的一次前向,与其他纯内容生成方法完全一致,无额外成本。具体来说,训练时每轮迭代需要为每个直播间生成 G 个候选描述并计算 RAS 分数,主要计算开销在 MLLM 的多次前向推理上。但 GRPO 的更新效率较高,通常只需要数百到数千步即可收敛。
复现难度: ★★★☆☆
论文没有公开代码和预训练模型,仅凭文字复现难度中等。核心的RAS公式和训练流程描述较清楚,但工业级数据(快手内部日志)无法获取,只能使用公开数据集进行近似复现。研究者可以尝试在 Amazon Reviews、MovieLens 等公开数据集上验证方法,但需要注意这些数据集缺乏多模态内容,可能需要适配。
产品化成熟度: ★★★★☆
已经在快手直播推荐中完成上线验证,且有正向在线效果。但是否能直接用于其他产品还需定制化调整(如双塔模型改造、奖励尺度适配)。论文提供的方法框架基本具备产品化基础。对于希望快速落地的团队,可以直接复用论文中的 DSSM + GRPO 框架,只需替换 MLLM 基座和用户行为数据即可。
可能的问题: 在线指标虽然正向,但论文没有给出具体的量化提升幅度,这可能是因为商业数据保密。另外,方法在推理时完全依赖纯内容生成,如果发生内容侧问题(如ASR转录错误、视频帧模糊),生成的描述质量会直接下降,进而影响推荐,这一点在极端情况下需要额外容错机制。此外,论文未讨论当直播间内容发生剧烈变化(如主播突然改变直播主题)时,预生成的描述是否还能保持有效性,这在实际部署中是一个需要考虑的时效性问题。
主要参考文献
[1] Mu G, Liu Y, Cao J, et al. RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation. arXiv:2607.25901v1, 2026.
[2] Rec-R1, CURec, VRAgent-R1 等同类工作详见论文第2节相关研究。
[3] 双塔模型 DSSM: Huang P S, He X, Gao J, et al. Learning deep structured semantic models for web search using clickthrough data. CIKM, 2013.