← 返回 PaperDaily 大模型与智能体

快手新作:离线在线都涨,推荐缩放换了新玩法

快手这篇 UniFormer 很像推荐系统里的“总装车间”:不再让行为建模、特征交互、任务预测各干各的,而是把它们拉进同一套统一缩放框架里。更关键的是,它不只讲模型更大,还把线上推理效率和服务 QPS 一起算进账本,挺适合工业界细品。

快手新作:离线在线都涨,推荐缩放换了新玩法
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
快手这篇 UniFormer 很像推荐系统里的“总装车间”:不再让行为建模、特征交互、任务预测各干各的,而是把它们拉进同一套统一缩放框架里。更关键的是,它不只讲模型更大,还把线上推理效率和服务 QPS 一起算进账本,挺适合工业界细品。


原论文信息如下:
论文标题:
UniFormer: Efficient and Unified Model-Centric Scaling for Industrial Recommendation
发表日期:
2026年06月
发表单位:
Kuaishou Technology
原文链接:
https://arxiv.org/pdf/2606.27058v1.pdf

从组件中心到模型中心:推荐系统缩放范式的变革,UniFormer如何实现高效统一的协同缩放?

工业推荐系统一直像个“多线程打工人”:用户行为要看,特征要交互,任务还得多目标一起管。以前大家更习惯组件中心缩放,也就是哪个模块不够强,就给哪个模块加料;但这样一来,模型虽然变大了,整体协同却常常不够顺滑。
UniFormer 的思路更像是把整台机器重新做了一次总装:不再盯着单个零件猛加参数,而是把行为建模、特征交互、任务建模放进统一框架里一起缩放。结果就是,既要效果,也要效率,连线上服务的 QPS 也得算进去,工业味很浓。🤚

这篇论文来自Kuaishou Technology,发表在KDD 2025,原文链接见上。没有公开代码、数据集或项目页信息,说明这次主要还是工业场景里的“真刀真枪”优化,不是实验室里摆拍。

方法概述

UniFormer 的整体框架可以先记成一句话:先把输入变成统一 token,再分到特征空间和任务空间做两轮交互。前者负责把用户行为、非序列特征这些信息揉到一起,后者再把高阶特征和任务信号继续搅拌,最后输出多任务预测结果。
图1:代表性缩放方法对比。图(a)到图(c)是组件中心缩放范式;图(d)到图(e)是在特征空间内联合建模序列行为与特征交互;图(f)则是本文提出的统一协同缩放框架,可在序列行为、非序列特征和任务之间高效协同缩放。
图1:代表性缩放方法对比。图(a)到图(c)是组件中心缩放范式;图(d)到图(e)是在特征空间内联合建模序列行为与特征交互;图(f)则是本文提出的统一协同缩放框架,可在序列行为、非序列特征和任务之间高效协同缩放。

揭秘核心技术:令牌化策略与统一交互模块的设计

UniFormer 的关键,不是把 transformer 往推荐系统里硬塞,而是先做语义化令牌化。它把序列特征、非序列特征、任务特征都变成 token,但不是一锅乱炖,而是按语义分组:哪些是用户侧的,哪些是物品侧的,哪些是任务侧的,分得清清楚楚。
这么做有两个好处。第一,推理时可以把与候选物品无关的用户信息先算一次,再复用给多个候选项,这就是它能把服务 QPS 拉高的底气。第二,语义分组能让注意力机制看到不同视角的行为模式,避免所有 token 都盯着同一处,最后模型“眼神呆滞”。
图2:UniFormer整体架构。它由令牌化模块和统一交互模块组成;统一交互模块包含堆叠的特征空间交互模块FIM和任务空间交互模块TIM。FIM输入序列特征和非序列特征,通过注意力层与FFN层建模特征空间交互;TIM进一步结合FIM产生的高阶表示和任务特征,继续建模任务-特征关系及任务间交互。
图2:UniFormer整体架构。它由令牌化模块和统一交互模块组成;统一交互模块包含堆叠的特征空间交互模块FIM和任务空间交互模块TIM。FIM输入序列特征和非序列特征,通过注意力层与FFN层建模特征空间交互;TIM进一步结合FIM产生的高阶表示和任务特征,继续建模任务-特征关系及任务间交互。
在特征空间里,UniFormer 用的是多序列交叉注意力,把短期、长期、搜索式行为分开看,避免偏好塌缩成“只顾一头”。随后再接自注意力和多视角 FFN,让不同类型的行为各说各话,但最后还能握手言和。
到了任务空间,TIM 再把高阶特征和多任务信号拉到一起,做任务感知的交互。这个设计有点像“先把人群分好,再按不同考核指标继续精修”,既保留共享信息,也避免任务之间互相抢饭吃。

离线和在线效果如何?看看快手的大规模实验

实验部分很务实,直接上快手主场景:单页短视频推荐。论文用四个任务来评估,包括 Effective-view、Long-view、Like 和 Follow。离线指标是 GAUC,线上则看 App Stay Time、Watch Time 以及互动指标。
对比结果显示,UniFormer 在所有任务上都超过了基线方法,尤其是比强基线 MixFormer 还要更进一步。这个结论的意思很直白:只在特征空间里卷,已经不够了;把任务空间也纳入统一缩放,才更完整
图3:UniFormer在快手工业数据集上的消融实验,展示了Effective-view和Like任务上的表现。
图3:UniFormer在快手工业数据集上的消融实验,展示了Effective-view和Like任务上的表现。
消融实验也挺有说服力:去掉多序列交叉注意力,性能会掉得比较明显,说明“防偏好塌缩”不是口号;把 S-FFN 或 NS-FFN 换成共享 FFN,也会让效果明显缩水,说明多视角参数分配确实不是装饰品。
图4:GAUC提升与模型参数规模之间的缩放规律,横轴采用对数刻度。
图4:GAUC提升与模型参数规模之间的缩放规律,横轴采用对数刻度。
更有意思的是缩放曲线。UniFormer 的性能随着参数增加持续上升,说明它不是那种“堆参数但不长肉”的模型;多视角 FFN 让不同模块都能吃到容量红利,所以增长更平滑,也更像真正的模型中心缩放。
在线 A/B 更是工业界最爱看的硬菜。快手和 Kuaishou Lite 两个场景里,UniFormer 在停留时长、观看时长和互动指标上都取得了稳定提升;同时,借助用户-物品解耦,推理 QPS 还提升了 48%,而 GAUC 几乎没受影响。
图5:不同令牌化方式下的注意力模式可视化。
图5:不同令牌化方式下的注意力模式可视化。
图6:特征-任务关系的注意力分布可视化。
图6:特征-任务关系的注意力分布可视化。

方法总结与未来展望

UniFormer 最值得记住的,不是某个单独模块,而是它把推荐系统的缩放逻辑从“哪里不够补哪里”,推进到了“整个模型一起长大”。这对工业推荐很重要,因为真正的瓶颈往往不在某个小模块,而在模块之间的协同效率。
从工程角度看,它把令牌化、交互建模、训练优化、在线解耦连成了一条线,说明推荐系统的“大模型化”并不只是把参数堆高,而是得把效率账也算明白。这个思路,值得很多工业推荐团队认真抄作业。👍

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

UniFormer 和以前的推荐 transformer 有什么本质区别?以前很多方法主要还是在特征空间里做文章,顶多把行为建模和特征交互一起缩放;UniFormer 进一步把任务空间也纳入统一框架,相当于从“修几间房”升级成“整栋楼一起设计”。

它为什么能把推理 QPS 提上去?核心是用户-物品解耦:与候选项无关的用户侧 token 先算一次、再复用给多个候选项,减少了重复计算。工业推荐里,少算一步,往往就是少掉一大截延迟。

这类方法最值得普通读者关注什么?不是“推荐系统又多了个新名词”,而是它展示了一个很现实的方向:模型变大不一定更慢,只要结构设计和部署策略够聪明,效果和效率可以一起往前走。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把“模型中心缩放”真正落到推荐系统工业场景里,而且把任务空间也纳入统一设计,思路是完整的,不是只会堆名词。

实验合理度:★★★★★。离线、消融、缩放曲线、线上 A/B、效率分析一套齐活,工业论文该有的硬指标基本都摆出来了。

学术研究价值:★★★★☆。它给推荐系统的 scaling law 和统一建模提供了一个很清楚的方向,后续很容易继续扩展和对比。

稳定性:★★★★☆。在线 A/B 和多场景结果都比较稳,没有那种“实验室里很美,线上一跑就散架”的味道。

适应性以及泛化能力:★★★★☆。方法围绕工业推荐的多任务、多特征、多行为设计,适配性不错,但是否能无缝迁移到别的推荐范式,还得看具体场景。

硬件需求及成本:★★★☆☆。参数量并不小,尤其 Large 版接近 10 亿参数,工业部署还是要认真算资源账。

复现难度:★★★☆☆。模块设计清晰,但涉及大规模推荐数据、在线系统和服务优化,复现门槛不低。

产品化成熟度:★★★★★。这篇就是奔着线上去的,QPS 提升和 A/B 收益都说明它不是纸上谈兵。

可能的问题:方法很强,但高度依赖工业推荐的系统条件;如果没有大规模数据、候选召回链路和在线服务能力,很多收益很难完整兑现。

从组件中心到模型中心:推荐系统缩放范式的变革,UniFormer如何实现高效统一的协同缩放?

工业推荐系统最怕的,不是模型不够大,而是模型越堆越像“东拼西凑的拼装车”。行为建模一套、特征交互一套、任务建模又一套,大家各忙各的,最后还得指望线上效果自己长出来。现实通常很骨感:模块越多,调参越像修仙。
UniFormer 想做的事很直接:把推荐系统从组件中心缩放,推进到模型中心缩放。前者像给某个零件单独加厚,后者则是把整台机器重新设计一遍,让行为、特征、任务三类信息在同一套框架里协同长大。听起来像口号,做起来却很工业:既要效果,也要效率,还得考虑线上服务能不能扛住。
这篇工作来自 Kuaishou Technology,落点非常明确:不是纸面上的漂亮架构,而是快手真实推荐场景里的在线优化。下面这张图,基本就把它和前面那些方法的区别说透了。
图1:代表性缩放方法对比。图(a)到图(c)是组件中心缩放范式;图(d)到图(e)是在特征空间内联合建模序列行为与特征交互;图(f)则是本文提出的统一协同缩放框架,可在序列行为、非序列特征和任务之间高效协同缩放。
从图1可以看出,之前很多推荐模型的缩放思路,还是在“某个模块更强一点”的层面打转。比如行为建模更长、交互更复杂、任务专家更多,但整体仍然是分块优化。UniFormer 的野心更大:它不只盯着特征空间,还把任务空间一起纳入统一缩放框架,试图让整个模型像一台协同良好的总装机,而不是一堆零件的临时组合。

UniFormer如何实现高效统一的协同缩放?

先说结论:UniFormer 的核心不是“把 transformer 套进推荐系统”,而是先把推荐里的信息拆成几个更适合处理的空间,再用统一的交互模块把它们重新连起来。这个思路有点像先分拣快递,再按路线统一派送,既减少混乱,也方便扩容。
这里先把几个必要缩写解释一下。FIM 是 Feature-space Interaction Module,中文可理解为特征空间交互模块;TIM 是 Task-space Interaction Module,即任务空间交互模块。前者负责特征侧的交互,后者负责任务侧的交互。BCE 是 Binary Cross-Entropy,中文是二元交叉熵,是多任务分类里常见的损失函数。
图2:UniFormer整体架构。它由令牌化模块和统一交互模块组成;统一交互模块包含堆叠的特征空间交互模块FIM和任务空间交互模块TIM。FIM输入序列特征和非序列特征,通过注意力层与FFN层建模特征空间交互;TIM进一步结合FIM产生的高阶表示和任务特征,继续建模任务-特征关系及任务间交互。
从图2看,UniFormer 分两步走。第一步是 tokenization,也就是把序列特征、非序列特征、任务特征都变成统一的 token 表示。第二步是 unified interaction block,里面堆了两类模块:FIM 负责特征空间里的交互,TIM 负责任务空间里的交互。这样做的好处是,模型不会一上来就把所有东西混在一起硬算,而是先按空间拆分,再逐层融合,计算更可控,扩展也更自然。
更关键的是,它把“统一”这件事做得并不粗暴。UniFormer 并没有追求全空间全连接,那样太贵;它选择把整体建模空间拆成特征空间和任务空间,分别用标准化的 attention 和 FFN 叠起来。也就是说,统一的是框架,不是把所有计算搅成一锅粥。这个分工很像公司组织架构:部门可以统一制度,但不必每个人都去干同一件事。

揭秘核心技术:令牌化策略与统一交互模块的设计

UniFormer 最有意思的地方,恰恰不在“更大”,而在“更会分”。它先用语义化令牌化把输入拆开,再用统一交互模块把该连的连起来。这个过程如果讲成一句大白话,就是:先别急着一起开会,先让每个人把自己负责的材料整理好。
令牌化这里有个关键点:它不是简单把所有特征拍扁成一串 token,而是按语义分组。序列特征分成短期行为、长期压缩兴趣、搜索式行为等;非序列特征再分成用户侧、物品侧、上下文侧;任务特征则单独成组。这样做的目的,是让后面的注意力机制能看到“谁和谁更像一类人”,而不是一堆杂乱无章的变量。
这里还涉及一个容易忽略的缩写:GAUC 是 Grouped AUC,中文常说分组 AUC。它先对每个用户单独算 AUC,再按样本权重聚合,特别适合推荐这种“每个用户口味都不一样”的场景。相比全局 AUC,GAUC 更能反映排序质量在用户维度上的真实性。
FIM 里最值得看的是多序列交叉注意力。很多方法会把短期、长期、搜索式行为混在一起做共享交互,结果容易出现偏好塌缩:模型最后只盯住某一种行为,其他信息像在旁边站着罚站。UniFormer 则让不同序列各自做交叉注意力,再用自注意力和多视角 FFN 继续加工,尽量保住短期兴趣、长期兴趣和跨域兴趣的多样性。
TIM 的思路则是把高阶特征拿来做任务感知交互。先前 FIM 已经把特征空间里的信息揉得比较充分,TIM 再把这些高阶表示和任务 token 放一起,让任务之间也能交换信息。这个设计有点像先把菜切好,再按不同口味做二次烹饪;不是重复做菜,而是换一个维度继续提味。
如果把这一套流程压缩成伪代码,大概就是下面这样:
    输入:用户行为序列、非序列特征、任务特征
    1. 按语义把特征 token 化
    2. 先进入 FIM:
       2.1 用多序列交叉注意力分别建模短期/长期/搜索式行为
       2.2 用自注意力增强特征间交互
       2.3 用多视角 FFN 做分组参数增强
    3. 再进入 TIM:
       3.1 用任务感知交叉注意力聚合高阶特征
       3.2 用任务自注意力建模任务间关系
       3.3 用任务 FFN 输出任务表示
    4. 送入任务头,得到多任务预测结果
    从实现角度看,这套设计还有两个很现实的工程味道。一个是训练时的用户级公共压缩,把同一用户共享的行为特征只处理一次,减少重复开销;另一个是推理时的用户-物品解耦,让与候选物品无关的用户侧 token 先算一次、后面复用。工业推荐里,这种“少算但不偷懒”的本事,往往比单纯堆参数更值钱。
    图5:不同令牌化方式下的注意力模式可视化。
    图5:不同令牌化方式下的注意力模式可视化。
    图5的意思很直观:如果 token 化方式不够聪明,注意力就容易“看串台”;而语义分组之后,模型的关注点会更清楚地分布在不同类型的行为上。换句话说,token 化不是前处理小工,而是直接决定后面 attention 能不能看懂人话的关键一步。

    离线和在线效果如何?看看快手的大规模实验

    实验部分很工业,直接上快手单页短视频推荐主场景。这里有几个背景信息要先记住:平台日活超过 4 亿,每天产生超过 500 亿条交互日志。也就是说,这不是“样例数据集”,而是真正会影响用户停留、观看和互动的线上战场。
    离线实验用了四个任务:Effective-view、Long-view、Like 和 Follow。这里的意思不复杂,就是平台既关心用户有没有看、看得够不够久,也关心有没有点赞、关注这类更强反馈。评价指标用 GAUC,因为推荐排序本来就是“每个用户都不一样”,不能拿一个全局平均把所有人的口味糊成一锅汤。
    表1:快手工业数据集上的离线GAUC结果。提升幅度相对第一个基线SIM+DCN计算,粗体表示最高分,下划线表示基线中的最好结果。最后一列报告了密集神经网络的参数量。
    表1:快手工业数据集上的离线GAUC结果。提升幅度相对第一个基线SIM+DCN计算,粗体表示最高分,下划线表示基线中的最好结果。最后一列报告了密集神经网络的参数量。
    表1里最重要的信息不是某一个点涨了多少,而是 UniFormer 在多个任务上都保持了稳定领先。它相对 SIM+DCN、SIM+HoME、SIM+RankMixer 以及 HyFormer、MixFormer 都有优势,说明它的收益不是靠某个局部技巧撑起来的,而是整体框架更顺。尤其是它在把任务空间也纳入统一建模之后,效果能够继续往上走,这一点很符合“模型中心缩放”的初衷。
    实验设置也比较讲究公平:所有模型都在同一 GPU 集群上从头训练,优化器、学习率、batch size 尽量统一。这样比较出来的结果更像是在比方法本身,而不是在比谁家的训练配置更会“开挂”。
    图3:UniFormer在快手工业数据集上的消融实验,展示了Effective-view和Like任务上的表现。
    消融实验说明了两个关键点。第一,去掉多序列交叉注意力后,效果会明显变差,说明短期、长期、搜索式行为分开建模确实有必要。第二,把多视角 FFN 换成共享 FFN 也会掉点,说明参数不是越共享越好,至少在这个任务里,给不同模块保留一定的独立表达空间,反而更稳。
    图4:GAUC提升与模型参数规模之间的缩放规律,横轴采用对数刻度。
    图4更像是 UniFormer 的“体检报告”:参数增加后,GAUC 提升是持续的,不是那种堆大了就开始原地打转的模型。这个现象说明它的缩放路径比较健康,容量增加能够真正转化为建模能力,而不是只换来更高的显存占用和更慢的训练速度。
    表2:在线A/B测试结果。
    表2:在线A/B测试结果。
    在线结果就更有说服力了。UniFormer 在快手和 Kuaishou Lite 两个生产场景里,App Stay Time 和 Watch Time 都有稳定提升,且互动指标也同步改善。更亮眼的是,它通过用户-物品解耦带来了明显的推理加速,QPS 提升了 48%,而离线 GAUC 基本没有被牺牲掉。工业界最喜欢的就是这种“又快又准”的组合拳。
    如果把离线和线上放在一起看,UniFormer 的价值就很清楚了:它不是只在 benchmark 上刷存在感,而是把模型结构、训练优化和在线部署串成了一条完整链路。推荐系统里很多方法都能“涨点”,但能同时兼顾线上收益和服务效率的,就没那么多了。
    图6:特征-任务关系的注意力分布可视化。
    图6:特征-任务关系的注意力分布可视化。
    图6进一步说明,TIM 并不是装饰模块。特征和任务之间的注意力分布确实发生了变化,说明任务空间交互在补足特征空间建模之后,能继续挖出有效信息。这个结果也侧面支持了论文的核心判断:推荐模型的缩放,不应该只在特征空间里卷到底,任务空间同样值得认真对待。

    方法总结与未来展望

    UniFormer 最值得记住的,不是某个单点技巧,而是它把推荐系统的缩放逻辑重新梳理了一遍:先统一 token 化,再统一交互,再把特征空间和任务空间一起纳入模型中心缩放。这个思路的好处是,模型扩容不再只是“某个模块加强一点”,而是整个系统协同变强。
    从工程角度看,它把语义化令牌化、分空间交互、训练压缩、推理解耦串成一条链,说明工业推荐的大模型化绝不是“参数越多越好”,而是要让计算、表达和部署三者一起跑得顺。否则,模型再大,线上也可能只是一个贵但不太好用的大家伙。
    未来如果继续沿着这条路走,几个方向会很值得关注。其一是更复杂的任务空间组织方式,尤其是多目标之间的冲突和协同怎么进一步建模;其二是更通用的 token 化策略,能不能适配更多类型的推荐数据;其三是更强的在线部署优化,毕竟工业系统里,模型效果和服务成本永远是一对不能分家的兄弟。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:

    这篇论文到底解决什么问题?它解决的是工业推荐里“怎么把行为建模、特征交互、任务建模一起高效缩放”的问题。以前很多方法只盯着某个模块,UniFormer 则想把整个模型当成一个整体来扩容,同时还要兼顾线上推理效率。

    FIM 和 TIM 分别是干什么的?FIM 是特征空间交互模块,负责把序列特征和非序列特征先交互起来;TIM 是任务空间交互模块,负责把高阶特征和任务信号再交互一轮。前者管“特征怎么合”,后者管“任务怎么分工协作”。

    为什么它既能提效果,又能提效率?效果上,它用多序列交叉注意力和多视角 FFN 保住了不同兴趣模式;效率上,它通过语义化令牌化、用户级公共压缩和用户-物品解耦减少了重复计算。简单说,就是少做无用功,多做有效功。

    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。