← 返回 PaperDaily 视觉与图像

快手KDD 2026新作:冷启动推荐告别“噪音”,线上指标最高涨近3%!

从快手真实场景痛点出发,直击冷启动推荐中隐式反馈的噪音问题。DIF方法思想巧妙(用内容相似的温物品做伪标签),理论扎实,落地强悍(线上指标全面大涨),是工业界和学术界都非常值得一看的佳作。

快手KDD 2026新作:冷启动推荐告别“噪音”,线上指标最高涨近3%!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
从快手真实场景痛点出发,直击冷启动推荐中隐式反馈的噪音问题。DIF方法思想巧妙(用内容相似的温物品做伪标签),理论扎实,落地强悍(线上指标全面大涨),是工业界和学术界都非常值得一看的佳作。


原论文信息如下:
论文标题:
Denoising Implicit Feedback for Cold-start Recommendation
发表日期:
2026年6月(KDD 2026)
发表单位:
快手科技、香港浸会大学、北京大学、南京大学、中国科学院信息工程研究所
原文链接:
https://arxiv.org/pdf/2606.19658v1.pdf
开源代码链接:

引言:冷启动推荐中的噪声隐式反馈,一个被忽视的难题

推荐系统依赖隐式反馈(点击、观看等),但这些反馈充满噪音。比如标题党带来的“假点击”,或位置靠后导致的“假忽略”。以往去噪研究忽略了一个关键:冷启动物品比热物品更容易被噪声污染。快手团队发现,冷视频的标题党比例比热视频高出37.7%,被放在推荐列表尾部的概率高出28.3%。这意味着冷物品的标签“信噪比”极低,现有方法会错误地将冷样本当成噪声剔除,导致“富者愈富”的马太效应。

方法概述:DIF的巧妙设计——借“温”灌“冷”

DIF(Denoising Implicit Feedback for Cold-start Recommendation)核心思想:用户兴趣在内容层面稳定,可用内容相似的温物品(训练充分的热门物品)为冷物品生成伪标签。方法包含三阶段:伪标签生成、置信度建模、不确定性估计与标签校正。
图1:DIF结合双塔模型的整体概览图
图1:DIF结合双塔模型的整体概览图

核心原理:三步走,让冷物品的标签“洗白”


第一步:如何生成伪标签?——找“温”邻居来投票

如图2,新视频上传后:1)多模态推理提取内容向量;2)用ANN服务检索K个内容最相似的温物品ID及相似度;3)从在线模型Embedding服务获取温物品的协同表征;4)用户表征与温物品表征内积,得到K个伪标签。
图2:在线流式训练中伪标签生成的工业实践
图2:在线流式训练中伪标签生成的工业实践
有一个新思路

第二步:如何提升伪标签质量?——加入置信度建模

利用ANN返回的内容相似度分数,通过带温度系数τ的softmax转化为权重,对K个伪标签加权求和,得到更准确的最终伪标签。

第三步:如何精准修正?——不确定性估计引导校正

1. 相对熵:计算原始标签与模型预测的KL散度,越高说明标签越可能是噪声。

2. 冷启动状态:基于交互次数的指数函数,交互越少值越接近1,表示噪声风险越高。

两者结合得到不确定性分数,自适应地将原始标签向伪标签“软校正”,生成最终软标签。理论证明该方式能最小化校正后标签与真实标签的均方误差。

数据准备及实验设计

实验使用Amazon-Sports、Amazon-Baby和TikTok三个真实多模态数据集。DIF集成到NeuMF、LightGCN、SimGCL三个基座模型,对比RINCE、DECL、MWUF等基线。
表1:实验数据集统计信息
表1:实验数据集统计信息

实验验证与线上效果:显著提升冷启动推荐性能

DIF在冷物品指标上全面领先所有基线,多数配置下超越第二好方法一倍以上。例如Amazon-Sports+LightGCN,冷物品Recall@20达0.00347(次优DECL为0.00277)。热物品性能未下降,甚至略有提升。人工噪声鲁棒性实验中,DIF下降幅度最小。消融实验验证了各模块的必要性。
表2:不同方法性能对比
表2:不同方法在冷物品、热物品、全量上的Recall@20与NDCG@20对比
线上A/B测试在快手进行,为期一周。冷启动视频人均播放时长+1.45%、人均点赞数+1.62%、人均关注数+1.89%,冷视频播放占比提升1.37%。
表4:线上A/B测试结果
表4:线上A/B测试结果
我懂了

龙迷三问

DIF中的“温物品”具体指什么?论文定义“冷物品”为发布24小时内且观看量小于5万次的视频。“温物品”指积累了足够交互(超过5万次观看)、协同表征训练充分的物品。DIF利用温物品的内容相似性为冷物品生成伪标签。

为什么用相对熵+冷启动状态组合?只使用相对熵无法区分噪声与冷物品表征未学好。加入冷启动状态γ_i,通过交互次数识别物品冷热,对热物品γ_i接近0,避免误伤;对冷物品γ_i贡献基础不确定性,确保噪声大的样本获得更强烈校正。

只有文本或图片,还能用吗?可以。理论只要求内容表征空间能反映物品相似性,不限定模态。可用Sentence-Bert或视觉模型提取向量。多模态融合通常更准确,但单模态也可退化为检索。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰ 思路巧妙,有理论证明与工业细节。伪标签+知识蒸馏在非推荐领域不新鲜,创新在于适配冷启动并解决工程难题。

实验合理度:★★★★★ 三个数据集、三个基座、四个基线,含鲁棒性测试、消融和线上A/B测试,说服力强。

学术研究价值:★★★★✰ 提出冷启动去噪细分问题,提供完整方法论和理论框架,有启发意义。

稳定性:★★★★✰ 人工噪声测试稳健,线上长期有效。但伪标签质量受限于内容相似度检索准确性。

适应性以及泛化能力:★★★★✰ 模型无关,可接入任意推荐模型,适用于检索、精排等阶段。依赖多模态特征,但可退化为单模态。

硬件需求及成本:★★★✰✰ 需维护多个在线服务,系统复杂度较高。但可复用现有基础设施,成本可控。

复现难度:★★★✰✰ 代码未开源,但工业架构描述详细,核心公式清晰,可基于faiss复现。

产品化成熟度:★★★★✰ 已在快手数亿用户APP上成功部署,线上指标全面正向提升。

可能的问题:伪标签准确性依赖内容相似度检索质量,若多模态模型召回不到真正相关的温物品,可能引入偏差。未来可探索动态融合多源信号增强鲁棒性。


主要参考文献

[1] Chen et al., "Denoising Implicit Feedback for Cold-start Recommendation", KDD 2026.
[2] Chen et al., "Dual Denoising for Implicit Feedback", AAAI 2022.
[3] Wang et al., "Improving Cold-start Recommendation with User and Item Attention", CIKM 2021.
[4] Johnson et al., "Billion-scale similarity search with GPUs (FAISS)", TPAMI 2019.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看了这篇如何用「温物品」拯救「冷物品」的文章,是不是觉得推荐系统去噪又有新思路了?想和龙哥、以及更多志同道合的小伙伴一起深聊推荐系统、冷启动、大模型等AI前沿话题吗?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 推荐系统+北京+快手+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。