← 返回 PaperDaily 视觉与图像

快手与北航新范式:从“挑视频”到“造视频”,广告视频可以现场拍

如果把短视频推荐系统想象成一家大型仓库,算法的工作就是“在仓库里找一件用户最可能喜欢的东西”。仓库越大,推荐越准。可问题在于:算法再聪明,也只能在仓库里挑,不能在用户最想要的那一刻,照着用户的心思现场做一件出来。

快手与北航新范式:从“挑视频”到“造视频”,广告视频可以现场拍
原论文信息如下:
论文标题:
Recommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale
发表日期:
2026年06月
发表单位:
Kuaishou Technology, Beihang University
原文链接:
https://arxiv.org/pdf/2606.25496v1.pdf

如果把短视频推荐系统想象成一家大型仓库,算法的工作就是“在仓库里找一件用户最可能喜欢的东西”。仓库越大,推荐越准。可问题在于:算法再聪明,也只能在仓库里挑,不能在用户最想要的那一刻,照着用户的心思现场做一件出来。快手和北航联合提出的这套系统,就想把“仓库出货”改成“现场定制”。
从技术脉络上看,过去十年工业界推荐系统大多走的是所谓 DLRM(Deep Learning Recommendation Model,深度推荐模型)路线,也就是把用户特征、视频特征拼进深度模型,预测点击率,再从已经生产好的素材库中做召回和排序。随后出现的 GRM(Generative Recommendation Model,生成式推荐模型)把推荐变成了序列生成任务:先学一套语义ID,再让模型自回归预测用户感兴趣的ID序列,但最后一步仍然是拿ID去库里捞视频。
而本文这套名为 RaG(Recommendation-as-Generation,把推荐直接做成生成任务)的系统,完全跳过了“去库里找”这一步:它对用户兴趣完成编码后,利用视频生成智能体,现场做一条全新的、风格和内容都对齐的视频交给你。这意味着用户兴趣预测不再受内容供给限制,过去那种“你明明喜欢某个调调但平台没货”的问题,从机制上被绕过了。

从“推荐”到“生成”:推荐系统的新范式革命

要理解这个范式到底“新”在哪里,先看下面这张图。
图1:推荐范式转变示意图
图1:推荐范式转变。(a) DLRMs 只能从固定内容池中检索视频,当用户兴趣落在内容池之外时,匹配效果必然打折扣;(b) 本文范式按需生成个性化视频,既对齐生成式推荐模型预测出的用户兴趣,又让真实用户反馈以闭环方式驱动生产,突破了固定内容池的边界。
过去大家反复琢磨的,是在已有内容池里如何精排;这篇文章直接把问题改写成了“能不能在建库之前就生成”。系统里真正关键的不是某一条视频拍得多精致,而是一套能让“兴趣预测”和“内容生产”共享同一个抽象空间的机制。
下面这个动图,就是系统根据用户兴趣生成的个性化广告视频效果:镜头、旁白、字幕和节奏都不是从现成素材里剪出来的,而是按用户的兴趣标签现算出来的。
RaG根据用户兴趣生成个性化视频的动图演示
演示效果:由用户兴趣驱动、RaG 生成的个性化广告视频示意。
这里需要强调一点:本文并不是要把传统推荐引擎完全扔掉,而是把它向上抬高了一层,加入了 AIGC(AI Generated Content,人工智能生成内容)的能力翻新。好比以前推荐算法是“懂货的买手”,现在让买手直接调用一支全自动生产线,“懂货”和“造货”第一次被无缝接在了一起。

解耦语义ID:连接推荐与生成的统一接口

推荐系统和视频生成系统,原本是两种“语言系统”。推荐用的数据是用户ID、视频ID、点击序列,是离散的、结构化的;视频生成模型处理的是文本、图像、音频、运动,是连续的、多模态的。想让两边直接对话,就必须造一个两边都认识的中间语言。
本文使用的是 D-SIDs(Disentangled Semantic IDs,解耦语义ID)。普通语义ID只告诉你视频“讲的是什么”,D-SIDs则进一步把视频拆成两个维度:内容维度(人物、物体、主题等)和 创作维度(风格、节奏、氛围感等)。同样是拍咖啡,内容和风格拆开之后,系统既可以描述“谁在喝咖啡”,也可以描述“是日系小清新风还是赛博朋克风”,两边互不干扰。
数学上,给定一段视频 v,解耦语义视频编码器 E 会输出一组 token 序列,作为这段视频的 D-SIDs:
D-SIDs定义公式
公式1:D-SIDs = E(v) 的含义。E 表示解耦语义视频编码器;s_content^l 表示第 l 层内容语义码;s_creative^l 表示第 l 层创作风格码。L 是每个模态的码层数,L 越大,能表达的语义细节越丰富。
从工程细节看,编码器基于 Qwen2.5-VL-7B-Instruct 改造,再利用快手内部训练的视频密集描述模型 CapModel 生成两路文本描述:content 描述实体、事件、主题;creative 描述风格、音乐氛围、转场节奏。两路文本再与视觉特征一起送到多模态模型中,分别得到两个 L2 归一化的向量 z_content 与 z_creative。
训练时,文章用对比学习让同一个视频的内容表征互相靠近,并让创作表征也按风格聚类;为了不让两个维度“互相串味”,还专门加了正交约束:
对比学习损失公式
公式6:对比学习损失。z_m^i 是当前样本的表征,z_m^j 是它的正样本;分母部分在所有候选样本上做 softmax 归一化。τ 是温度参数,控制分布尖锐程度。
正交约束公式
公式7:正交约束。让内容向量 z_content 与创作向量 z_creative 尽可能正交,从而减少两个模态语义之间的信息泄漏。
视频向量是连续的,但推荐模型更擅长对离散 token 做自回归预测。为了和语言模型接口对齐,论文用 RQ-Kmeans(Residual Quantization-based K-means,基于残差量化的 K 均值方法)把连续表征离散成码本下标。每个模态单独维护一套码本,每层容量 8192 个码字,多层叠加后得到高度压缩的 D-SIDs。
残差量化公式
公式9:残差量化。第 l 层码本通过查表 c^l 得到码向量,L 层码向量相加后尽可能逼近原始语义向量 z_m。s^l 就是模型真正要预测的离散 token。
RaG整体方法架构图
图2:RaG 整体方法架构。视频经解耦语义编码后得到 D-SIDs;生成式推荐模型 GRM 根据用户上下文预测用户兴趣对应的 D-SIDs;指令模型 IM 再把这些 ID 转成镜头级制作指令;视频生成智能体 VGAs 按指令分层规划、逐步执行,最后用协同跨域奖励学习 SCRL 统一优化。
有了这套统一接口,推荐任务就被写成了自回归预测任务:给定用户画像和交互历史组成的上下文 c_user,GRM 逐个预测用户下一步最可能感兴趣的 D-SIDs token;而和过去 GRM 不同,这些预测出的 D-SIDs 不再是召回 key,而是后续生成的“种子”。
GRM自回归预测公式
公式2:GRM 将推荐建模为对 D-SIDs 的自回归条件概率乘积。p(s_t | s_ RaG整体推理链路公式
公式3:RaG 的完整推理链路。v 是原始视频,E(v) 把它编码成 D-SIDs;p 部分负责从用户上下文预测兴趣 D-SIDs;G 负责把预测得到的 D-SIDs 解码生成新视频 v̂。这里的 v̂ 不再是库里已有的某条素材,而是系统按需求“现造”出来的。
解耦语义ID质量评估表
表2:解耦语义ID质量评估。报告了两种指标:embedding 语义检索质量,以及 SID 离散化质量。表中加粗表示相对最强基线的提升;R@k 是 Recall@k(前 k 个结果的召回率),Cpr. 是压缩率,Col. 是码本碰撞率。

视频生成Agent:工业级个性化视频生产的引擎

有了 D-SIDs 做“需求说明书”,接下来的问题是怎么低成本、按分钟级把说明书变成成片。当前最强的文生视频模型虽然能生成高画质片段,但往往需要人工反复试 prompt,再依赖专业工具做多阶段剪辑、加字幕、配乐,单条视频的边际成本根本扛不住几亿用户的长尾兴趣。
RaG 的做法不是训练一个什么都能干的“巨型全能生成器”,而是把视频生产流程拆成一支可编排的智能体团队。整个生成过程被建模成一个多智能体序贯决策问题:
Agent决策过程公式
公式13:智能体决策建模。在每个时间步 t,活性子智能体根据当前状态 S_t 采样动作 a_t,并通过确定性算子 P 转移到下一个状态 S_{t+1}。
视频生成智能体 VGAs(Video Generation Agents,视频生成智能体)内部有三个角色:
VPA(Visual Planning Agent,视觉规划智能体)是总导演,负责把上层指令转化成分镜故事板,决定场景怎么分、镜头怎么给、时间边界怎么切;接着是 AAA(Audio Alignment Agent,音频对齐智能体),它看着视觉分镜去生成与场景切换同步的解说和背景音乐,保证声音和画面卡在同一个节拍上;最后是 AEEA(Artistic Effect Enhancement Agent,艺术特效增强智能体),负责加字幕、特效、转场和交互引导,让成片更接近“能直接投广告”的完成态。
三个智能体策略公式
公式15:整体策略由视觉规划、音频对齐、特效增强三个子策略共同组成,每个子智能体只在自身对应阶段被激活。
要注意,这三个智能体并不是三个独立的大模型,而是共享同一个 Qwen2.5-32B 底座,只是通过不同的角色 prompt、不同的工具可见范围和不同的上游状态来“扮演”不同角色。由于它们是按顺序执行的,且上游输出只追加不修改,因而可以大量复用 KV cache:后一个智能体只需要编码自己新增的那一段输入,显著降低了多阶段生成的推理成本。
现实中的视频生成难免出现画面和声音不一致、字幕和画面不匹配,因此 VGAs 还有个“有界反思”机制:走一遍“观察→思考→行动”的循环,对跨模态一致性做修正,反思最多执行两轮,避免为了追求质量把耗时拖到线上不可接受的程度。
视频合成公式
公式16:最终视频通过统一的生成算子 G,把视觉分镜、音频和特效三部分意图组合成一条完整成片。
VGAs与workflow基线视频质量对比表
表3:本文提出的 VGAs 与 workflow 基线(人工编排式工作流)生成的视频质量对比。Automated Score(自动化打分)同时报告了平均分和中位数。

协同跨域奖励学习:闭环优化的关键

系统能生成视频还不够,推荐系统必须保证“生成的视频真的有用户愿意看、愿意点”。可“用户想看”和“生成得好”是两个领域的信号,量纲不同、噪声不同,直接加权求和容易让训练震荡。
论文提出 SCRL(Synergistic Cross-Domain Reward Learning,协同跨域奖励学习),一共收集三类奖励信号:
视频质量奖励(R_quality)衡量画质是否精美、音画是否同步、字幕特效是否对齐;兴趣对齐奖励(R_align)衡量生成出的脚本、成片和 GRM 预测出的 D-SIDs 在语义上是否一致;用户反馈奖励(R_feedback)则来自真实世界的互动信号,比如点击、点赞、收藏、下单转化。
SCRM 的核心思路是把优化写成带约束的策略学习问题:用户反馈是主目标,兴趣对齐和视频质量是边界约束。为什么要这样做?因为真实点击等信号稀疏又延迟,而质量分数和对齐分数虽然密集,却不一定能直接代表用户最终是否满意。把后者设为“必须守住的底线”、把前者设为主攻方向,是一种更稳的平衡方式。
带约束的合成奖励公式
公式17:带约束的合成奖励。R_feedback(y_i) 是用户反馈主目标;λ_a(t)、λ_q(t) 是时变拉格朗日乘子;τ_a、τ_q 分别表示兴趣对齐和视频质量需要守住的阈值。若某项分数低于阈值,就通过 ReLU 惩罚项把优化拉回正轨。
论文还引入 group-decoupled reward normalization(组级解耦奖励归一化),也就是 GDPO:先对每个奖励通道分别做标准化,消除量纲差异,再在同一个采样组内计算相对优势。
组内优势计算公式
公式18:GDPO 的组内优势计算。对候选集合 Y 计算均值和标准差,再做标准化,得到的 A_i 表示该候选在这个样本组内“相对好不好”。
GDPO目标函数公式
公式19:GDPO 目标。以冻结的 SFT 策略 π_ref 为参考,最大化组内相对优势 A_i 对应的概率比,从而让用户更偏好的候选获得更高生成概率。
阈值也不是人拍脑袋定的,而是参考 SFT 基线模型在验证集上的分布来标定:τ = μ_base + k·σ_base。系数 k 则和设备角色挂钩:VGAs 直接决定最终成片,约束最严;指令模型 IM 次之;GRM 只做兴趣预测,约束最宽松。
奖励组件消融实验表
表4:奖励消融实验。对每项奖励组件,在对应评测集上比较加入该奖励后的策略(Ours)和不加奖励的基线策略(Base),用于验证每个奖励项单独都是有效的。

工业级验证:广告收入提升1.87%的背后

RaG训练与在线服务架构图
图3:RaG 系统的训练和在线服务架构。离线侧完成视频编码、指令蒸馏和奖励模型训练,在线侧通过缓存与轻量 VGAs 协同为推荐请求快速出片。
真正让这篇论文有分量的,不是某个公开数据集上的 FID 涨了零点几,而是它把整套系统部署到了日活跃用户超过 4 亿的工业级平台,在一个以收入为关键指标的广告场景里完成了在线 A/B 测试。表 1 给出的是相对生产基线的收益改进结果。
在线A/B测试结果表
表1:在线 A/B 测试结果。Rev. 表示广告收入,所有结果都是相对生产基线的相对提升值。论文报告,相比一个已经很强的生产级 GRM 基线,广告收入最高提升了 1.87%。
1.87% 看起来不算“炸裂”,但放在广告收入基数上,它是一个非常可观的增量。更要紧的是,这个增量是在“GRM 生成推荐已经吃掉了大部分红利”之后继续挤出来的,说明生成视频确实把推荐系统的天花板又抬高了一块。
在线系统最担心的还有推理成本。论文通过共享 Qwen2.5-32B 底座、KV cache 复用和 SID 索引缓存,把多智能体生成链路压缩到了可服务状态。表 5 对比了 RaG 系统各模块的推理效率。
RaG系统推理效率对比表
表5:RaG 系统各模块的推理效率对比。表中拆分了指令模型、视觉规划、音频对齐、特效增强等阶段的开销,用来验证整套系统在工业级请求压力下的可行性。
下面这张图是广告场景中一批由兴趣驱动生成的个性化视频案例。可以看到不同用户拿到的成片,在产品卖点、画面风格和叙事节奏上都有自己的侧重点,而不是简单把同一条素材重复投放。
广告场景个性化视频生成案例
图4:广告场景中兴趣驱动的个性化视频生成定性示例。从产品露出到镜头语言,系统会在同一套“兴趣说明书”下生成存在明显差异化的视频版本。

局限与未来:从近线到实时的挑战

如果冷静一点看这套系统,它最大的现实约束来自“成本”和“实时性”的权衡。文中的做法是引入 SID 索引缓存:把已经生成过的优秀视频按语义 ID 存下来,优先让请求命中缓存;只有缓存未命中或高价值请求,才真正触发多智能体生成链路。可以合理推测,目前线上 RaG 主要工作在近线预生成加上缓存分发的模式,而不是每一次刷视频都现场从零生成。
这意味着,从“近线”“缓存”走向真正意义上的逐用户实时生成,还需要视频生成底座提速、算力成本进一步下降,以及内容合规质检自动化能力的配合。尤其当生成内容进入广告场景时,品牌安全、素材审核、版权音乐和敏感信息控制,都会成为比模型精度更棘手的产品问题。
另外还有一个容易被忽略的隐患:如果推荐系统优化主目标是用户反馈,生成模型为了追求点击率,会不会主动学习并强化某种“套路化”内容,让成片越来越同质化?这种由闭环反馈带来的内容生态问题,值得行业长期观察。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?快手联合北航提出“推荐即生成”(RaG)框架,用解耦语义ID打通推荐与视频生成。
这篇工作最值得看的点是什么?在线A/B测试显示,完整RaG系统相比DLRM基线广告收入提升+5.462%,相比强GRM基线提升+1.870%;D-SIDs在语义检索R@1上达0.896,比最强基线提升+16.5%;VGAs在自动化胜率上达70.1%,显著优于工作流基线28.7%。
这篇工作的边界或风险在哪里?优点:(1) 提出RaG新范式,突破固定内容池限制,实现从检索到生成的范式转变;(2) D-SIDs解耦内容与创意语义,统一推荐与生成接口;(3) VGAs通过分层多智能体架构实现工业级可扩展的视频生成;(4) SCRL实现跨域奖励的协同优化。缺点:(1) VGAs延迟仍高达180s,仅支持近线生成而非实时;(2) 依赖Gemini2.5 Pro蒸馏指令数据,存在教师模型偏差;(3) 论文未提供生成视频的具体质量指标(如FVD等),主要依赖人工评估;(4) 系统复杂度高,复现难度大。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

推荐系统与视频生成通过解耦语义ID统一到一个闭环里,概念和工程架构都是真正意义上的范式尝试。不过 D-SIDs、GRM、奖励优化等底层组件在原论文中更多是组合式创新,因此给四星而不是五星。

实验合理度:★★★★☆

实验设置整体可信:既有表2的解耦质量评测,也有表3的成片质量对比、表4的奖励消融,再加上真实的在线 A/B 收入测试。相比很多只做离线的论文,工业级闭环验证的权重很高。

学术研究价值:★★★★☆

这篇论文给出了一条“推荐系统如何接住 AIGC”的可落地路径,D-SIDs 可作统一接口的思路能直接启发很多后续研究。推荐系统和视频生成两个社区的研究者都能在里面找到值得深挖的点。

稳定性:★★★☆☆

系统已经在线运行,说明稳定性经过了大流量考验;但它的产出依赖视频生成器质量、缓存命中率和在线评审链路,离模型“随手一调参数就能推广到所有内容场景”还有距离。

适应性以及泛化能力:★★★☆☆

当前实验场景集中在广告收入上。内容社区里更复杂的“纯内容推荐”、直播场景,以及电商商品视频生成,都属于后续有待验证的扩展方向。架构本身具备通用性,但证据面还不够宽。

硬件需求及成本:★★☆☆☆

底层用到 Qwen2.5-VL-7B、Qwen3-8B、Qwen2.5-32B 以及文生视频模型,训练和推理成本都很高。虽然共享 KV cache 和缓存机制能摊薄在线成本,但整体部署门槛并非中小团队能轻松承担。

复现难度:★★☆☆☆

论文给出了项目主页,但没有开放代码和完整数据集;视频编码器、CapModel、GRM、VGA 等模块都高度依赖快手的业务数据和内部基础设施,外部研究者想完整复现难度很大。

产品化成熟度:★★★★☆

从论文披露的信息看,系统已经在收入敏感型广告场景完成在线 A/B 并取得正向收益,说明它能支撑真实业务。不过它对多模态审核、内容风险、全品类素材覆盖的要求很高,产品化成熟度上限取决于这些配套能力的完备程度。

可能的问题:实验细节的开放程度偏低。在线 A/B 只报告了“广告收入相对提升”这类汇总指标,视频生成质量的人工评估、多轮在线风险指标、不同流量占比的稳定性分析都披露不足,外部研究者很难判断系统在更宽泛内容场景是否依然稳健。


主要参考文献

[1] Recommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale. arXiv:2606.25496. Kuaishou Technology / Beihang University.
[2] 项目主页:https://recommendation-as-generation.github.io/
[3] Qwen2.5-VL / Qwen3 / Qwen2.5-32B,相关技术报告与模型文档见论文引用与项目主页。

end
推荐系统不再是"猜你喜欢",而是"懂你喜欢后直接做给你看"。想第一时间读懂 RaG 这类工业级新范式?欢迎加入龙哥读论文粉丝

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球