← 返回 PaperDaily
前沿研究
SIGIR 2026新作:买完还推?阿里这招让重复率降60%
电商推荐最尴尬的事,不是“猜错你想买什么”,而是“你都买了,它还追着推”。这篇 SIGIR 2026 论文就是来治这个毛病的:把购买当成兴趣退出信号,用双路径注意力和动态门控学会该忘就忘。
龙哥读论文
发布于 2026-08-14 09:11:08
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 电商推荐最尴尬的事,不是“猜错你想买什么”,而是“你都买了,它还追着推”。这篇 SIGIR 2026 论文就是来治这个毛病的:把购买当成兴趣退出信号,用双路径注意力和动态门控学会该忘就忘。
原论文信息如下:
揭秘购物后的“兴趣退出”:告别买完还推的烦恼,单次购买=兴趣终结?
电商推荐里最容易被忽略的一件事,不是“这次猜没猜中”,而是“用户都买完了,系统还在继续推同一类东西”。这就像外卖刚吃饱,平台还在给人端上来一碗同口味的大份加餐,逻辑上就很离谱。这篇 SIGIR 2026 论文 盯上的,正是这个看似不起眼、但在工业推荐里很要命的问题:购买后推荐冗余 。
论文给出的核心判断很直接:在电商场景里,一次购买不一定代表兴趣增强,反而可能代表兴趣退出 。比如买了冰箱,短期内大概率不想再买冰箱;买了纸巾,过一段时间又会回来。这种“买完就该冷静一下”的行为,传统序列推荐模型往往没学会。它们习惯把点击、购买都当成正向信号一路往后堆,结果就是把已经满足的兴趣继续抬高,最后在推荐位上反复“复读”。
这篇工作把这个问题起了个挺形象的名字:Action-Intent Asymmetry ,中文可以理解为“动作和意图不对称”。意思是,用户做了一个购买动作,并不等于这个意图还要继续延伸;很多时候,购买恰恰是这个意图的终点。论文进一步把这个终点状态称为 Interest Exit ,也就是“兴趣退出”。
如果把用户兴趣比成一条河,传统推荐模型更像只会往河里加水;而这篇论文的观点是,河水有时候是会自然流走的,甚至需要“排水阀”。这就是它最有意思的地方:推荐系统不只要学会记住,还要学会忘记 。🤨
破解购买后推荐冗余的困局
先把概念说人话。所谓购买后推荐冗余,就是用户刚买过某类商品,系统还在高频推荐同类商品,甚至连“刚买过”的那一件都继续推。对平台来说,这不是小毛病,而是会直接浪费黄金推荐位;对用户来说,这属于“你都买了还推给我”的经典尴尬;对业务来说,则可能压低信任感,甚至影响后续点击和转化。
过去常见的处理方式,很多都偏“后处理”:比如用固定时间窗过滤、用多样性重排、或者根据经验规则把最近买过的品类压一压。问题在于,这类方法往往是模型外补丁 ,不是模型内学习。它们能减少一部分重复曝光,但很难区分“永远不该推”与“过几天还要推”;更难理解不同用户、不同商品的生命周期差异。
论文的出发点就是:别再把“购买”粗暴地当成持续偏好,得把它看成一个生命周期节点 。这个节点的前面是浏览、加购、犹豫,后面是满足、冷却、再补货。不同商品的冷却时间差别极大,耐用品可能几百天都不用再出现,消耗品却可能几十天就该重新露头。系统如果还用一把尺子量天下,结果通常不会太好看。
这也是 SAM 的价值所在:它不是简单“拉黑”历史,而是尝试学习一个更细的过程——什么时候该压制、压制多久、什么时候该重新唤醒 。这件事听起来像人类常识,但真要放进工业推荐系统里,难度一点不低。
双路径架构:一边“定位”一边“预测”
SAM 的核心设计可以概括成一句话:先找出“该忘的是什么”,再估计“多久后该想起来” 。前半句解决兴趣退出,后半句解决复购回归。它把这两件事拆成两条路来学,避免模型一上来就把所有历史混成一锅粥。
第一条路是意图定位(Intent Localization) 。这里的思路很巧:购买行为会作为一个“探针”,反向去找它前面那一串相关点击。因为用户真正满足的,往往不是孤零零的一个商品,而是一整个意图簇,比如“买厨房纸”“换洗护套装”“给孩子补文具”。模型不是只盯着最后那个买下来的东西,而是回头把同一意图链条上的历史点击一起识别出来,然后统一压制。
论文这里用了一个很关键的技术细节:不是用普通的 softmax 去做长序列权重,而是用逐点相似度门控 。原因很现实:长序列一旦很长,softmax 容易把注意力摊薄,最后谁都不够“像”。而逐点门控更像是直接问一句——“你和这次购买是不是同一类意图?”如果是,就给高压制;如果不是,就别乱扣帽子。
第二条路是节奏预测(Rhythm Retrieval) 。这条路不看“该压谁”,而看“多久后会再来”。它从长期购买历史里检索用户的补货节奏,学出一个周期信号。这个信号不是拍脑袋的固定窗口,而是由历史购买间隔直接学出来的个性化节律。有人买纸巾是 15 天一轮,有人是 30 天一轮,还有人囤货党一买就是三个月不用管,模型都得分得清。
这两条路最后会汇到一个叫 Adaptive Satiation Gating Unit 的模块里。这里先解释缩写:ASGU 是 Adaptive Satiation Gating Unit ,中文可译为自适应饱足门控单元 。它负责把“该忘”和“该记起”变成一个随时间变化的软掩码,而不是一刀切。
自动学习产品生命周期,无需人工标签
SAM 真正有意思的地方,不只是“压制重复”,而是它想学出一个随时间变化的饱足曲线 。论文里把这个过程讲得很像人类消费习惯:刚买完的时候,相关兴趣处于高饱足状态,系统应该尽量少推;等时间慢慢过去,兴趣会进入恢复期;再往后,接近预测的复购周期时,系统要提前把相关兴趣轻轻唤醒,避免错过补货需求。
这里有一个很关键的术语:TTNP ,全称是 Time-to-Next-Purchase ,中文是距离下一次购买时间 。它是一个自监督辅助任务,用来让模型学习“下一次同类购买大概多久会来”。这一步很重要,因为如果没有这个监督信号,模型只会知道“别推了”,却不知道“什么时候该重新推”。
论文在实现上用了一个比较务实的做法:把购买序列单独抽出来,利用相邻两次同类购买之间的时间间隔作为监督目标;对于只有一次购买、没有后续复购的样本,则用类别级的全局平均复购周期做补全。这个处理很像工业界的典型风格:不等完美标签,先把能学到的规律吃干榨净 。
ASGU 的门控也不是简单的“开/关”二值逻辑,而是一个时间敏感的软掩码 。论文里提到一个 lead-in offset(中文可理解为“提前唤醒偏移”),意思是模型不会等到补货周期完全到点才恢复注意力,而是会提前一点把相关兴趣放出来。这一点很实用,因为真实用户行为往往不是卡着整点发生的,提前一点更符合推荐系统“宁可早一点,别晚太多”的节奏。
实验数据大公开:效果显著,值得一试!
先说实验设置,这部分其实挺关键。论文使用的是阿里系电商平台的工业日志,时间跨度覆盖数月,按时间切分训练集和测试集,避免数据泄漏;只保留活跃用户,并把行为序列截断到 500 长度。这个做法比较符合真实工业场景,因为推荐系统最怕“离线看起来很美,线上一跑就露馅”。
评价指标也很有针对性。除了常规的 AUC 和 GAUC,论文还专门引入了 PPRR(Post-Purchase Repeat Rate,购买后重复推荐率) ,中文可理解为“购买后同类重复曝光比例”。这个指标非常对题,因为它直接衡量系统有没有在用户刚买完之后继续推同类商品。还有一个线上业务指标叫 Bad-Case Ratio,统计用户明确吐槽“已经买过了”这类负反馈的比例,挺接地气。
结果上,最值得盯住的不是 AUC 多了零点几,而是PPRR 大幅下降 。论文给出的结论是,SAM 在离线指标上能够和最强基线持平或略优,同时把购买后重复推荐显著压低,在线 A/B 里 CTR 和 GMV 也都有正向提升。换句话说,它不是“为了不重复而把推荐搞废了”,而是把重复压下去之后,反而让真正值得推荐的内容更容易被看见。
这点很重要。很多“去重”方法一上来就猛删历史,结果把本该回来的复购需求也一起误伤了。SAM 的不同之处在于,它不是硬掐,而是根据时间和周期动态恢复兴趣 。所以它能同时兼顾“不要老推刚买过的”和“也别把该回来的复购需求杀死”。
消融实验也挺能说明问题。去掉节奏检索后,重复推荐明显变多,说明“什么时候该停”主要靠购买节奏来判断;去掉 TTNP 后,模型对不同品类的周期理解变差,耐用品和消耗品容易混;把 ASGU 换成硬掩码,冗余虽然还在压,但准确率会受影响,因为模型失去了“提前唤醒”的弹性。这个结果很诚实,也很符合直觉:真正有效的不是一刀切,而是带节奏的忘记 。👍
龙迷三问
这篇论文到底解决什么问题? 它解决的是“用户刚买完,系统还在继续推同类商品”的购买后冗余问题。核心不是提升一般点击率,而是让推荐系统学会识别兴趣退出,并在合适时间重新唤醒复购需求。
TTNP 和 ASGU 分别是什么意思? TTNP 是 Time-to-Next-Purchase,中文是“距离下一次购买时间”,用来监督模型学习复购周期;ASGU 是 Adaptive Satiation Gating Unit,中文是“自适应饱足门控单元”,负责根据时间动态控制历史兴趣的压制和恢复。
为什么不能直接用固定时间窗过滤? 因为不同商品和不同用户的复购周期差别太大。固定时间窗只能粗暴地“统一拉黑”,会误伤该回来的复购需求;SAM 试图学习个性化周期,所以能更平衡地处理“减少重复”和“保留复购”这两个目标。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
这篇论文的新意不在于又堆了一个更大的序列模型,而在于把“购买=继续喜欢”这个默认假设掰正了。把兴趣退出显式建模 ,这个角度挺实在。
实验合理度: ★★★★☆
离线+在线一起做,而且指标里专门放了 PPRR 和 Bad-Case Ratio,说明作者确实知道问题痛点在哪。唯一要盯紧的是,工业日志和线上流量都很强,但跨平台复现时还得看场景是否同样存在明显复购周期。
学术研究价值: ★★★★☆
这篇工作给推荐系统补上了一个长期被忽略的维度:意图终止 。它不只是工程修补,更像是对用户行为建模假设的一次修正,研究味道是有的。
稳定性: ★★★☆☆
思路本身比较稳,但它依赖购买周期和历史日志质量;如果业务里复购不明显、或者购买行为非常稀疏,效果可能会打折。属于“有条件好用”,不是拿来就能全场景通吃。
适应性以及泛化能力: ★★★☆☆
对有明确复购节奏的电商类场景很友好,但对低频、一次性、强探索型商品,周期学习会更难。泛化不是没有,但前提是业务里确实存在“买完会回来”的规律。
硬件需求及成本: ★★★☆☆
双路径交叉注意力和辅助任务都会增加训练与推理复杂度,但还没到离谱程度。对工业系统来说,更多是“多花一点算力换少一点冗余”,能不能接受取决于业务收益。
复现难度: ★★☆☆☆
论文依赖真实工业日志,公开复现门槛不低;不过方法描述相对完整,核心模块也清楚。难点主要不在代码,而在数据和线上环境。
产品化成熟度: ★★★★☆
这是少数离产品很近的研究:问题真实、指标真实、A/B 也真实。只要业务确实有复购场景,这套思路就不是纸上谈兵,而是能直接进推荐链路讨论的方案。
可能的问题: 模型默认复购规律可被历史稳定学到,但现实里促销、季节、库存、价格波动都会扰动周期;如果后续不加这些外部因素,周期预测可能会被业务噪声带偏。
主要参考文献
Yipin Dai, Ruocong Tang, Xing Fang, Yang Huang, Jing Wang, Zhentao Song, He Guo. Learning to Forget: Satiation-Aware Long-Sequence Transducers for Mitigating Post-Purchase Redundancy. SIGIR 2026.
Guorui Zhou et al. Deep Interest Network for Click-Through Rate Prediction. KDD 2018.
Guorui Zhou et al. Deep Interest Evolution Network for Click-Through Rate Prediction. AAAI 2019.
Alibaba PAI Team. TorchEasyRec: An Easy-to-Use Framework for Recommendation. 2024. https://github.com/alibaba/TorchEasyRec
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
买完还推?这类尴尬,群里正好聊得明白;想看更多能落地、能省钱、能少踩坑的论文,扫码来一起拆。