← 返回 PaperDaily 视觉与图像

Sports上Recall@20提升19.33%的去噪方案

多模态推荐最烦的不是“缺特征”,而是“特征里混了太多废话”。这篇 DDMSR 直接把噪声拆成两层处理:先在物品语义图上做低通滤波,再把用户序列丢进频域里抓异常信号,思路很工程,也很实用。

Sports上Recall@20提升19.33%的去噪方案
原论文信息如下:
论文标题:
Beyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation

发表日期: 2026年07月

发表单位: University of Science and Technology of China

原文链接: https://arxiv.org/pdf/2607.19731v1.pdf

开源代码链接: https://github.com/jluo00/DDMSR

项目链接: https://github.com/jluo00/DDMSR/raw/main/DDMSR.png

双噪声困境:多模态序列推荐的新瓶颈

多模态序列推荐看起来很美:商品有图、有文案,用户历史也有顺序,模型似乎只要把这些信息“喂进去”就能更懂人。现实却很扎心——真正拖后腿的,往往不是信息不够,而是信息太吵。这篇 DDMSR 盯上的,就是推荐系统里两个最常见、也最容易被忽略的噪声源:特征层面的冗余噪声,以及序列层面的随机噪声。
图1:多模态推荐中的多层噪声示意图
图1:多模态推荐中的多层噪声示意图。左边说的是特征层噪声:通用预训练模型很会“看大概”,但推荐任务更在意“看细节”;右边说的是交互层噪声:用户历史里会混进误点、冲动点击、系统曝光带来的假兴趣。DDMSR 的思路很直接,先把特征洗一遍,再把序列洗一遍,不给噪声装好人。
先说第一层噪声。论文指出,现有多模态推荐通常直接拿 BERT、ViT 这类预训练编码器提取文本和图像特征,再映射到统一空间。问题是,这些模型擅长的是“全局语义”,比如一张图里是海滩还是厨房,一段文字大概在说什么;但推荐真正关心的可能只是衣服的轮廓、包的颜色、商品的纹理。于是,背景、无关物体、泛化语义统统混进来,看起来信息量很大,实际上很多都是对用户意图没用的杂音
第二层噪声更接地气。用户历史序列并不都是“稳定偏好”的忠实记录,里面常常夹着误点、临时需求、看热闹式点击。把这些行为一视同仁地当作兴趣轨迹,模型就会被带偏。论文把这个问题说得很形象:在时间域里看,噪声和兴趣混在一起;但把序列送到频域之后,持续偏好更像低频信号,突发误点更像高频尖刺。这个判断并不神秘,核心就是一句话:有些噪声在时序里藏得深,在频域里反而更容易暴露
图2:DDMSR整体框架图
图2:DDMSR 整体框架图。整个方法分成三段:先对文本和图像做图结构去噪,再对用户序列做频域去噪,最后加一个多模态对比对齐目标,把文本和视觉语义拉到更一致的空间里。别看模块不少,逻辑其实很朴素:先净化输入,再建模序列,最后补一层跨模态约束,避免两种模态各说各话。

从头净化:图谱低通滤波+频域自适应去噪

DDMSR 的核心设计其实就两招,但这两招都挺“工程派”:第一招不靠复杂生成过程,而是直接在物品语义图上做拉普拉斯平滑;第二招不靠固定滤波器,而是把序列送进频域后,用可学习的频率滤波器动态调节。前者管特征,后者管交互,两个层面各扫门前雪,噪声想混进来就没那么容易了。
先看特征去噪。论文没有把每个物品当成孤立点,而是根据同一模态下的文本或视觉特征,计算余弦相似度,构建物品语义图。这里的关键不是“图”这个字有多高级,而是图能把语义相近的物品连起来,让特征在邻域里传播。这个传播过程本质上就是拉普拉斯平滑,像一块低通滤波器,抹掉那些和邻居不一致的高频扰动,保留共享的显著语义。
不过,图平滑也不是越猛越好。平滑过头会把不同物品都磨成一个模子,最后谁都像谁,推荐就开始“脸盲”。所以论文加了一个可学习的自适应权重,在每一层里动态平衡“保留自身特征”和“吸收邻居信息”的比例。说白了就是:该听邻居的听邻居,该坚持自己的也别全盘放弃。这比一刀切的平均更聪明,也更符合推荐场景里长尾物品需要借力、头部物品需要保真的现实。
图5:Beauty数据集上文本与视觉特征分布的可视化对比
图5:Beauty 数据集上文本与视觉特征分布的可视化对比。左边是原始特征,中间是去掉图去噪后的结果,右边是加入图去噪后的结果。图里最值得注意的地方,不是“点变少了”,而是文本和视觉两种模态的角度分布更贴近了,说明图去噪不只是“消噪”,还在帮不同模态靠拢。这个现象很关键,因为模态之间如果长期各说各话,后面的融合再花哨也白搭。
再看序列去噪。这里的思路更有意思:先把用户交互序列从时间域通过快速傅里叶变换(FFT,Fast Fourier Transform,快速傅里叶变换)搬到频域,再用可学习的复数滤波器去调节不同频率成分。直白点说,就是先把“连续点击的故事”拆成“不同频率的波”,然后让模型自己学会哪些波该放大,哪些波该压下去。
这个模块比传统低通滤波更灵活。传统方法往往默认“高频就是噪声”,但真实推荐序列没那么老实:有些高频变化确实是误点,也有些低频漂移可能代表兴趣转移。DDMSR 没有死守固定规则,而是让滤波器自己学,最后再通过逆傅里叶变换(IFFT,Inverse Fast Fourier Transform,逆快速傅里叶变换)回到时间域。这样做的好处是,模型能在全局频谱上统一看问题,而不是只盯着局部邻近点击,视野更大,判断也更稳。
频域去噪之后,序列再送入 Transformer 编码器做偏好建模。这里的逻辑很顺:先把脏数据洗干净,再让序列模型去学用户的真实演化轨迹。否则就像让一个很聪明的人在噪声里背锅,最后不是模型不行,是输入太离谱。
训练时,DDMSR 还加了一个多模态对比学习目标。它把同一物品的文本特征和视觉特征当作正样本对,不同物品的跨模态特征当作负样本,用 InfoNCE 约束两种模态对齐。这里的作用不是“锦上添花”那么简单,而是给前面的去噪再补一刀:如果文本和图像的语义都往一个方向收敛,后面序列建模拿到的表示会更统一,推荐打分也更不容易左右互搏。
表1:预处理后数据集统计信息
表1:预处理后数据集统计信息。这里选了四个公开数据集,覆盖电商和短视频场景,稀疏度都非常高,说明推荐任务并不是“数据很多就好办”,而是典型的少量行为里找真实偏好。这种环境下,多模态信息和去噪设计才有存在感,否则纯 ID 模型很容易被冷启动和长尾物品按在地上摩擦。

实验碾压:全面超越现有方法

实验部分最重要的不是“赢了多少”,而是赢得是否有说服力。DDMSR 这组实验的优点在于,数据集、指标、对比方法和训练设置都比较完整:既有 ID 基线,也有多模态基线,还用了全排序评估,避免只抽负样本带来的乐观偏差。对于推荐论文来说,这种设置算是比较老实,不玩花活。
表2:DDMSR与基线方法的总体性能对比
表2:DDMSR 与基线方法的总体性能对比。结果很清楚:DDMSR 在四个数据集上都拿到了最优,且提升不是“挤牙膏式”的 0.1 点,而是有明显幅度,尤其在 Sports 上 Recall@20 提升达到 19.33%。这说明双层去噪不是装饰性模块,而是确实在压制噪声、提升排序质量。
更值得注意的是,DDMSR 对强基线也不手软。像 MISSRec、TedRec 这类已经把多模态和序列建模做得比较成熟的方法,仍然被 DDMSR 拉开差距。这个现象说明,单纯把多模态信息塞进 Transformer 里,并不等于真正理解了多模态;如果输入本身混着噪声,模型再大也可能是在认真地学错东西。DDMSR 的优势就在于,它不是简单“加特征”,而是先把特征和序列分别净化,再做融合。
论文还给出了消融实验。这个部分的作用很朴素:证明到底是哪个模块在干活,而不是整套系统一起“凑热闹”。
表3:DDMSR消融实验(Recall@20)
表3:DDMSR 消融实验(Recall@20)。去掉图去噪、去掉频域去噪、去掉对比学习后,性能都会下降,说明三者不是摆设。这里最有说服力的点在于:图去噪和频域去噪是互补的,一个处理特征噪声,一个处理行为噪声,少了谁都不完整。对比学习则像润滑剂,负责把两种模态的语义缝合得更紧。
超参数分析也很有价值。论文考察了图构建时的 top-K 邻居数,以及频域去噪层数的影响。这个设计不是为了“调参表演”,而是为了回答一个很现实的问题:去噪到底是越强越好,还是存在最优强度?结果表明,邻居数太少,图传播不够;太多,又会把不相干语义拉进来。频域层数同理,层数太浅,滤不干净;层数太深,反而可能过度平滑。这个结论其实挺符合常识:去噪不是越狠越好,而是要刚刚好
图3:top-K邻居数量的影响
图3:top-K 邻居数量的影响。可以看到,图去噪对邻居数比较敏感,说明语义图的稀疏程度直接影响平滑效果。这个结果也侧面证明,DDMSR 不是靠“多连边”硬堆效果,而是依赖于合理的局部语义结构。
图4:频域去噪层数的影响
图4:频域去噪层数的影响。层数增加并不总是带来更好效果,说明频域滤波也存在“过犹不及”的问题。这个图的价值很实在:它告诉读者,频域去噪是有效的,但不是无脑堆层数就能赢。

高效与有效并重:告别生成式模型的高开销

很多去噪方法的问题,不在于“不够强”,而在于太贵。尤其是一些扩散式、生成式去噪方案,训练和推理都很容易把算力预算烧穿。DDMSR 在这点上很讨巧:它没有走复杂生成路线,而是用图平滑和 FFT 这种成熟且轻量的工具做结构化净化,思路上更接近“把问题拆开处理”,而不是“用更大的模型硬扛”。
论文还专门和 DMMD4SR 做了效率对比,这很关键,因为它不是只比精度,还把训练时间和显存占用摆到台面上。对于真正要落地的推荐系统来说,能不能跑得起、能不能稳定迭代,往往比论文里多 0.2 个点更重要。
表4:与DMMD4SR的效率对比
表4:与 DMMD4SR 的效率对比。结论很直接:DDMSR 在效果更好的同时,训练开销也更可控。这个结果说明,“去噪”不一定要靠复杂生成过程,结构先验和频域调制同样能把噪声压下去,而且更容易部署。对工程团队来说,这种方法的吸引力往往比“又大又慢”的方案更高。
项目开源信息也比较完整,代码基于 PyTorch,依赖 RecBole,说明复现门槛不算离谱。对想快速验证思路的人来说,这种“能跑起来”的论文比只会讲概念的论文更有诚意。毕竟推荐系统研究最怕的不是模型复杂,而是复杂到最后连自己都复现不出来。

长尾分析:图-频联合机制让冷门物品不再沉睡

长尾物品一直是推荐系统的老难题:曝光少、交互少、特征又不够干净,模型很容易把它们当空气。DDMSR 在这里的一个聪明点,是图去噪并不只是“消噪”,还会通过语义邻域传播给长尾物品补信息;频域去噪则帮助模型别被偶发点击带偏。两个模块一前一后,刚好把长尾问题最常见的两种症状都照顾到了。
图8:不同物品流行度分组上的性能提升
图8:不同物品流行度分组上的性能提升。这个图很能说明问题:DDMSR 在长尾分组上的收益更明显,说明它确实不是只会服务热门物品。原因也不难理解,图结构传播能给稀疏物品补语义,频域去噪能减少偶然行为对长尾偏好的干扰,于是冷门物品不至于一上来就被判“没戏”。
不过,这篇论文也不是没有边界。它的图去噪依赖预训练特征本身的质量,如果文本和图像编码器给出的底座太差,图传播只能在一个不太好的起点上做修补;频域去噪虽然有效,但对序列长度、噪声模式和超参数还是有一定敏感性。换句话说,DDMSR 解决的是“噪声怎么处理更科学”,不是“数据怎么凭空变干净”。这点说清楚,比盲目吹效果更重要。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是多模态序列推荐里的“双噪声”问题:一边是预训练特征里混进来的冗余语义,另一边是用户历史里夹杂的误点和随机交互。DDMSR 用图去噪处理前者,用频域去噪处理后者,思路是把噪声分层清理,而不是混在一起硬扛。

FFT 在这里到底起什么作用?FFT 是快速傅里叶变换,用来把用户序列从时间域变到频域。这样一来,模型就能更容易区分持续偏好和突发噪声;再配合可学习滤波器,模型不必死守“高频一定坏、低频一定好”的老规矩,而是自己学会怎么调频。

为什么图去噪和对比学习都要加?图去噪负责把文本和图像特征洗干净,对比学习负责把两种模态拉到同一个语义空间。前者解决“特征里有脏东西”,后者解决“两个模态说话不在一个频道”。这两个目标不冲突,反而是互补关系。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把噪声拆成“特征层”和“序列层”两条线处理,思路清晰,不是那种为了新而新的拼装式创新。

实验合理度:★★★★☆

对比基线覆盖面比较完整,且加入了消融、效率和长尾分析,能较好支撑结论。

学术研究价值:★★★★☆

把图信号处理和频域去噪引入多模态序列推荐,研究意义比较明确,对后续做鲁棒推荐有启发。

稳定性:★★★☆☆

方法比生成式去噪更稳,但仍依赖预训练特征和频域超参数,极端场景下还要继续验证。

适应性以及泛化能力:★★★★☆

四个数据集都有效,说明场景适应性不错;但对强依赖多模态内容的任务更占优。

硬件需求及成本:★★★★☆

没有走扩散式重模型路线,训练和推理成本相对友好,工程上更容易接受。

复现难度:★★★★☆

代码开源、框架清楚、依赖也比较常规,复现门槛不高。

产品化成熟度:★★★☆☆

适合多模态推荐场景的离线或半在线优化,若要大规模在线部署,还需继续验证吞吐、时延和特征更新成本。

可能的问题:方法依赖预训练特征质量和频域超参数,边界条件下的鲁棒性还需更多验证;另外,语义图构建在超大规模物品集上是否仍然高效,也值得继续观察。


主要参考文献

[1] Jie Luo, Qi Jin, Xinming Zhang. Beyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation. arXiv preprint, 2026.
[2] 论文代码:https://github.com/jluo00/DDMSR
[3] 项目演示图:https://github.com/jluo00/DDMSR/raw/main/DDMSR.png

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。