← 返回 PaperDaily
视觉与图像
Sports上Recall@20提升19.33%的去噪方案
多模态推荐最烦的不是“缺特征”,而是“特征里混了太多废话”。这篇 DDMSR 直接把噪声拆成两层处理:先在物品语义图上做低通滤波,再把用户序列丢进频域里抓异常信号,思路很工程,也很实用。
龙哥读论文
阅读 4
查看原文
原论文信息如下:
双噪声困境:多模态序列推荐的新瓶颈
多模态序列推荐看起来很美:商品有图、有文案,用户历史也有顺序,模型似乎只要把这些信息“喂进去”就能更懂人。现实却很扎心——真正拖后腿的,往往不是信息不够,而是信息太吵。这篇 DDMSR 盯上的,就是推荐系统里两个最常见、也最容易被忽略的噪声源:特征层面的冗余噪声,以及序列层面的随机噪声。
先说第一层噪声。论文指出,现有多模态推荐通常直接拿 BERT、ViT 这类预训练编码器提取文本和图像特征,再映射到统一空间。问题是,这些模型擅长的是“全局语义”,比如一张图里是海滩还是厨房,一段文字大概在说什么;但推荐真正关心的可能只是衣服的轮廓、包的颜色、商品的纹理。于是,背景、无关物体、泛化语义统统混进来,看起来信息量很大,实际上很多都是对用户意图没用的杂音。
第二层噪声更接地气。用户历史序列并不都是“稳定偏好”的忠实记录,里面常常夹着误点、临时需求、看热闹式点击。把这些行为一视同仁地当作兴趣轨迹,模型就会被带偏。论文把这个问题说得很形象:在时间域里看,噪声和兴趣混在一起;但把序列送到频域之后,持续偏好更像低频信号,突发误点更像高频尖刺。这个判断并不神秘,核心就是一句话:有些噪声在时序里藏得深,在频域里反而更容易暴露。
从头净化:图谱低通滤波+频域自适应去噪
DDMSR 的核心设计其实就两招,但这两招都挺“工程派”:第一招不靠复杂生成过程,而是直接在物品语义图上做拉普拉斯平滑;第二招不靠固定滤波器,而是把序列送进频域后,用可学习的频率滤波器动态调节。前者管特征,后者管交互,两个层面各扫门前雪,噪声想混进来就没那么容易了。
先看特征去噪。论文没有把每个物品当成孤立点,而是根据同一模态下的文本或视觉特征,计算余弦相似度,构建物品语义图。这里的关键不是“图”这个字有多高级,而是图能把语义相近的物品连起来,让特征在邻域里传播。这个传播过程本质上就是拉普拉斯平滑,像一块低通滤波器,抹掉那些和邻居不一致的高频扰动,保留共享的显著语义。
不过,图平滑也不是越猛越好。平滑过头会把不同物品都磨成一个模子,最后谁都像谁,推荐就开始“脸盲”。所以论文加了一个可学习的自适应权重,在每一层里动态平衡“保留自身特征”和“吸收邻居信息”的比例。说白了就是:该听邻居的听邻居,该坚持自己的也别全盘放弃。这比一刀切的平均更聪明,也更符合推荐场景里长尾物品需要借力、头部物品需要保真的现实。
再看序列去噪。这里的思路更有意思:先把用户交互序列从时间域通过快速傅里叶变换(FFT,Fast Fourier Transform,快速傅里叶变换)搬到频域,再用可学习的复数滤波器去调节不同频率成分。直白点说,就是先把“连续点击的故事”拆成“不同频率的波”,然后让模型自己学会哪些波该放大,哪些波该压下去。
这个模块比传统低通滤波更灵活。传统方法往往默认“高频就是噪声”,但真实推荐序列没那么老实:有些高频变化确实是误点,也有些低频漂移可能代表兴趣转移。DDMSR 没有死守固定规则,而是让滤波器自己学,最后再通过逆傅里叶变换(IFFT,Inverse Fast Fourier Transform,逆快速傅里叶变换)回到时间域。这样做的好处是,模型能在全局频谱上统一看问题,而不是只盯着局部邻近点击,视野更大,判断也更稳。
频域去噪之后,序列再送入 Transformer 编码器做偏好建模。这里的逻辑很顺:先把脏数据洗干净,再让序列模型去学用户的真实演化轨迹。否则就像让一个很聪明的人在噪声里背锅,最后不是模型不行,是输入太离谱。
训练时,DDMSR 还加了一个多模态对比学习目标。它把同一物品的文本特征和视觉特征当作正样本对,不同物品的跨模态特征当作负样本,用 InfoNCE 约束两种模态对齐。这里的作用不是“锦上添花”那么简单,而是给前面的去噪再补一刀:如果文本和图像的语义都往一个方向收敛,后面序列建模拿到的表示会更统一,推荐打分也更不容易左右互搏。
实验碾压:全面超越现有方法
实验部分最重要的不是“赢了多少”,而是赢得是否有说服力。DDMSR 这组实验的优点在于,数据集、指标、对比方法和训练设置都比较完整:既有 ID 基线,也有多模态基线,还用了全排序评估,避免只抽负样本带来的乐观偏差。对于推荐论文来说,这种设置算是比较老实,不玩花活。
更值得注意的是,DDMSR 对强基线也不手软。像 MISSRec、TedRec 这类已经把多模态和序列建模做得比较成熟的方法,仍然被 DDMSR 拉开差距。这个现象说明,单纯把多模态信息塞进 Transformer 里,并不等于真正理解了多模态;如果输入本身混着噪声,模型再大也可能是在认真地学错东西。DDMSR 的优势就在于,它不是简单“加特征”,而是先把特征和序列分别净化,再做融合。
论文还给出了消融实验。这个部分的作用很朴素:证明到底是哪个模块在干活,而不是整套系统一起“凑热闹”。
超参数分析也很有价值。论文考察了图构建时的 top-K 邻居数,以及频域去噪层数的影响。这个设计不是为了“调参表演”,而是为了回答一个很现实的问题:去噪到底是越强越好,还是存在最优强度?结果表明,邻居数太少,图传播不够;太多,又会把不相干语义拉进来。频域层数同理,层数太浅,滤不干净;层数太深,反而可能过度平滑。这个结论其实挺符合常识:去噪不是越狠越好,而是要刚刚好。
高效与有效并重:告别生成式模型的高开销
很多去噪方法的问题,不在于“不够强”,而在于太贵。尤其是一些扩散式、生成式去噪方案,训练和推理都很容易把算力预算烧穿。DDMSR 在这点上很讨巧:它没有走复杂生成路线,而是用图平滑和 FFT 这种成熟且轻量的工具做结构化净化,思路上更接近“把问题拆开处理”,而不是“用更大的模型硬扛”。
论文还专门和 DMMD4SR 做了效率对比,这很关键,因为它不是只比精度,还把训练时间和显存占用摆到台面上。对于真正要落地的推荐系统来说,能不能跑得起、能不能稳定迭代,往往比论文里多 0.2 个点更重要。
项目开源信息也比较完整,代码基于 PyTorch,依赖 RecBole,说明复现门槛不算离谱。对想快速验证思路的人来说,这种“能跑起来”的论文比只会讲概念的论文更有诚意。毕竟推荐系统研究最怕的不是模型复杂,而是复杂到最后连自己都复现不出来。
长尾分析:图-频联合机制让冷门物品不再沉睡
长尾物品一直是推荐系统的老难题:曝光少、交互少、特征又不够干净,模型很容易把它们当空气。DDMSR 在这里的一个聪明点,是图去噪并不只是“消噪”,还会通过语义邻域传播给长尾物品补信息;频域去噪则帮助模型别被偶发点击带偏。两个模块一前一后,刚好把长尾问题最常见的两种症状都照顾到了。
不过,这篇论文也不是没有边界。它的图去噪依赖预训练特征本身的质量,如果文本和图像编码器给出的底座太差,图传播只能在一个不太好的起点上做修补;频域去噪虽然有效,但对序列长度、噪声模式和超参数还是有一定敏感性。换句话说,DDMSR 解决的是“噪声怎么处理更科学”,不是“数据怎么凭空变干净”。这点说清楚,比盲目吹效果更重要。
龙迷三问
这篇论文到底解决了什么问题?它解决的是多模态序列推荐里的“双噪声”问题:一边是预训练特征里混进来的冗余语义,另一边是用户历史里夹杂的误点和随机交互。DDMSR 用图去噪处理前者,用频域去噪处理后者,思路是把噪声分层清理,而不是混在一起硬扛。
FFT 在这里到底起什么作用?FFT 是快速傅里叶变换,用来把用户序列从时间域变到频域。这样一来,模型就能更容易区分持续偏好和突发噪声;再配合可学习滤波器,模型不必死守“高频一定坏、低频一定好”的老规矩,而是自己学会怎么调频。
为什么图去噪和对比学习都要加?图去噪负责把文本和图像特征洗干净,对比学习负责把两种模态拉到同一个语义空间。前者解决“特征里有脏东西”,后者解决“两个模态说话不在一个频道”。这两个目标不冲突,反而是互补关系。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
把噪声拆成“特征层”和“序列层”两条线处理,思路清晰,不是那种为了新而新的拼装式创新。
实验合理度:★★★★☆
对比基线覆盖面比较完整,且加入了消融、效率和长尾分析,能较好支撑结论。
学术研究价值:★★★★☆
把图信号处理和频域去噪引入多模态序列推荐,研究意义比较明确,对后续做鲁棒推荐有启发。
稳定性:★★★☆☆
方法比生成式去噪更稳,但仍依赖预训练特征和频域超参数,极端场景下还要继续验证。
适应性以及泛化能力:★★★★☆
四个数据集都有效,说明场景适应性不错;但对强依赖多模态内容的任务更占优。
硬件需求及成本:★★★★☆
没有走扩散式重模型路线,训练和推理成本相对友好,工程上更容易接受。
复现难度:★★★★☆
代码开源、框架清楚、依赖也比较常规,复现门槛不高。
产品化成熟度:★★★☆☆
适合多模态推荐场景的离线或半在线优化,若要大规模在线部署,还需继续验证吞吐、时延和特征更新成本。
可能的问题:方法依赖预训练特征质量和频域超参数,边界条件下的鲁棒性还需更多验证;另外,语义图构建在超大规模物品集上是否仍然高效,也值得继续观察。
主要参考文献
[1] Jie Luo, Qi Jin, Xinming Zhang. Beyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation. arXiv preprint, 2026.
[2] 论文代码:https://github.com/jluo00/DDMSR
[3] 项目演示图:https://github.com/jluo00/DDMSR/raw/main/DDMSR.png

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

