← 返回 PaperDaily
视觉与图像
快手KDD 2026新作:冷启动推荐告别“噪音”,线上指标最高涨近3%!
从快手真实场景痛点出发,直击冷启动推荐中隐式反馈的噪音问题。DIF方法思想巧妙(用内容相似的温物品做伪标签),理论扎实,落地强悍(线上指标全面大涨),是工业界和学术界都非常值得一看的佳作。
龙哥读论文
发布于 2026-08-16 11:00:50
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 从快手真实场景痛点出发,直击冷启动推荐中隐式反馈的噪音问题。DIF方法思想巧妙(用内容相似的温物品做伪标签),理论扎实,落地强悍(线上指标全面大涨),是工业界和学术界都非常值得一看的佳作。
原论文信息如下:
引言:冷启动推荐中的噪声隐式反馈,一个被忽视的难题
推荐系统依赖隐式反馈(点击、观看等),但这些反馈充满噪音。比如标题党带来的“假点击”,或位置靠后导致的“假忽略”。以往去噪研究忽略了一个关键:冷启动物品比热物品更容易被噪声污染 。快手团队发现,冷视频的标题党比例比热视频高出37.7%,被放在推荐列表尾部的概率高出28.3%。这意味着冷物品的标签“信噪比”极低,现有方法会错误地将冷样本当成噪声剔除,导致“富者愈富”的马太效应。
方法概述:DIF的巧妙设计——借“温”灌“冷”
DIF(Denoising Implicit Feedback for Cold-start Recommendation)核心思想:用户兴趣在内容层面稳定,可用内容相似的温物品(训练充分的热门物品)为冷物品生成伪标签。方法包含三阶段:伪标签生成、置信度建模、不确定性估计与标签校正。
核心原理:三步走,让冷物品的标签“洗白”
如图2,新视频上传后:1)多模态推理提取内容向量;2)用ANN服务检索K个内容最相似的温物品ID及相似度;3)从在线模型Embedding服务获取温物品的协同表征;4)用户表征与温物品表征内积,得到K个伪标签。
利用ANN返回的内容相似度分数,通过带温度系数τ的softmax转化为权重,对K个伪标签加权求和,得到更准确的最终伪标签。
1. 相对熵 :计算原始标签与模型预测的KL散度,越高说明标签越可能是噪声。
2. 冷启动状态 :基于交互次数的指数函数,交互越少值越接近1,表示噪声风险越高。
两者结合得到不确定性分数,自适应地将原始标签向伪标签“软校正”,生成最终软标签。理论证明该方式能最小化校正后标签与真实标签的均方误差。
数据准备及实验设计
实验使用Amazon-Sports、Amazon-Baby和TikTok三个真实多模态数据集。DIF集成到NeuMF、LightGCN、SimGCL三个基座模型,对比RINCE、DECL、MWUF等基线。
实验验证与线上效果:显著提升冷启动推荐性能
DIF在冷物品指标上全面领先所有基线,多数配置下超越第二好方法一倍以上。例如Amazon-Sports+LightGCN,冷物品Recall@20达0.00347(次优DECL为0.00277)。热物品性能未下降,甚至略有提升。人工噪声鲁棒性实验中,DIF下降幅度最小。消融实验验证了各模块的必要性。
线上A/B测试在快手进行,为期一周。冷启动视频人均播放时长+1.45%、人均点赞数+1.62%、人均关注数+1.89%,冷视频播放占比提升1.37%。
龙迷三问
DIF中的“温物品”具体指什么? 论文定义“冷物品”为发布24小时内且观看量小于5万次的视频。“温物品”指积累了足够交互(超过5万次观看)、协同表征训练充分的物品。DIF利用温物品的内容相似性为冷物品生成伪标签。
为什么用相对熵+冷启动状态组合? 只使用相对熵无法区分噪声与冷物品表征未学好。加入冷启动状态γ_i,通过交互次数识别物品冷热,对热物品γ_i接近0,避免误伤;对冷物品γ_i贡献基础不确定性,确保噪声大的样本获得更强烈校正。
只有文本或图片,还能用吗? 可以。理论只要求内容表征空间能反映物品相似性,不限定模态。可用Sentence-Bert或视觉模型提取向量。多模态融合通常更准确,但单模态也可退化为检索。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★✰ 思路巧妙,有理论证明与工业细节。伪标签+知识蒸馏在非推荐领域不新鲜,创新在于适配冷启动并解决工程难题。
实验合理度:★★★★★ 三个数据集、三个基座、四个基线,含鲁棒性测试、消融和线上A/B测试,说服力强。
学术研究价值:★★★★✰ 提出冷启动去噪细分问题,提供完整方法论和理论框架,有启发意义。
稳定性:★★★★✰ 人工噪声测试稳健,线上长期有效。但伪标签质量受限于内容相似度检索准确性。
适应性以及泛化能力:★★★★✰ 模型无关,可接入任意推荐模型,适用于检索、精排等阶段。依赖多模态特征,但可退化为单模态。
硬件需求及成本:★★★✰✰ 需维护多个在线服务,系统复杂度较高。但可复用现有基础设施,成本可控。
复现难度:★★★✰✰ 代码未开源,但工业架构描述详细,核心公式清晰,可基于faiss复现。
产品化成熟度:★★★★✰ 已在快手数亿用户APP上成功部署,线上指标全面正向提升。
可能的问题: 伪标签准确性依赖内容相似度检索质量,若多模态模型召回不到真正相关的温物品,可能引入偏差。未来可探索动态融合多源信号增强鲁棒性。
主要参考文献
[1] Chen et al., "Denoising Implicit Feedback for Cold-start Recommendation", KDD 2026.
[2] Chen et al., "Dual Denoising for Implicit Feedback", AAAI 2022.
[3] Wang et al., "Improving Cold-start Recommendation with User and Item Attention", CIKM 2021.
[4] Johnson et al., "Billion-scale similarity search with GPUs (FAISS)", TPAMI 2019.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
看了这篇如何用「温物品」拯救「冷物品」的文章,是不是觉得推荐系统去噪又有新思路了?想和龙哥、以及更多志同道合的小伙伴一起深聊推荐系统、冷启动、大模型等AI前沿话题吗?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 推荐系统+北京+快手+龙哥) ,根据格式备注,可更快被通过且邀请进群。