← 返回 PaperDaily 视觉与图像

USTC新方法:频域+图去噪提升19.33%

多模态推荐最怕的不是没信息,而是信息里混进了太多“假线索”。这篇 DDMSR 直接把噪声拆成特征层和序列层两刀来切,思路很干净,效果也不虚:四个数据集都稳,训练还比扩散式去噪方案快不少。

USTC新方法:频域+图去噪提升19.33%
原论文信息如下:
论文标题:
Beyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation
发表日期:
2026年07月
发表单位:
中国科学技术大学
原文链接:
https://arxiv.org/pdf/2607.18786v1.pdf
开源代码链接:
https://github.com/jluo00/DDMSR
项目链接:
https://github.com/jluo00/DDMSR/raw/main/DDMSR.png

双重噪声困境:多模态推荐的“绊脚石”

多模态序列推荐听起来很美:既看商品图,又看文本描述,再结合用户历史行为,理论上信息更全,推荐就该更准。可现实往往很打脸——信息越多,不一定越准,信息里混进噪声才是真麻烦。这篇论文把问题说得很直接:多模态推荐里存在“双重噪声困境”,一层在特征里,一层在序列里。
Figure 1
图1:多模态推荐中的多层噪声示意图。(a)特征层噪声:预训练编码器常把背景、无关细节也编码进去,和用户真正想买的东西并不完全对齐。(b)交互层噪声:原始序列里有误点、冲动点击等随机扰动。论文把序列转到频域后,用低频表示持续兴趣,高频更像突发噪声。
先说第一层:特征噪声。现在很多多模态推荐直接拿现成的预训练模型特征,比如文本用 RoBERTa,图像用 CLIP ViT。问题是,这些模型本来是为通用语义服务的,擅长抓“大意”,不擅长抓“推荐意图”。比如一张包的图片,预训练特征可能把背景、光线、摆拍道具都算进去,但用户真正关心的可能只是“米色、桶型、肩带长度”。这就像拿百科全书去回答“这件衣服适不适合通勤”,方向没错,颗粒度却偏粗。更具体地说,预训练模型在训练时看到的是海量互联网图文对,其优化目标是最大化图文匹配概率,而不是“这件商品和用户历史中的那件商品在功能上相似”。因此,一个纯白色的桌面和一款白色包包在CLIP的特征空间中可能距离很近,但在推荐场景下,前者是噪声,后者才是信号。这种“语义偏移”是特征噪声的根本来源。
再说第二层:序列噪声。用户历史行为也不是纯净日志,里面常混着误点、凑热闹、看一眼就走的短暂兴趣。如果模型把这些行为都当成“真爱”,那用户画像就会被带偏。论文很形象地把它类比成频域中的高频扰动:真正稳定的偏好更像低频信号,来得慢、持续久;误点这种东西更像尖刺,来得快、走得也快。此外,序列噪声还包括“兴趣漂移”中的临时成分——比如用户因为某个促销活动点击了平时从不看的商品类别,这种点击在统计上是有意义的,但它不代表用户的长期偏好。如果模型不加区分地学习,就会把短期波动当作长期趋势,导致推荐结果在用户回归常态后迅速失效。
这就是 DDMSR 要解决的核心问题:先把特征洗干净,再把序列滤干净。它不是简单叠模块,而是从“图结构”和“频域”两个角度分别下手,试图把多模态推荐里最烦人的两种噪声都压下去。这个思路很朴素,但朴素得有点狠:既然噪声来自两个层面,那就别只在一个地方假装认真。值得注意的是,这两种噪声并非独立存在——特征噪声会污染商品表示,进而影响序列建模时对用户兴趣的推断;序列噪声则会扭曲用户的行为模式,使得特征去噪时依赖的“邻居相似性”假设也受到干扰。DDMSR的双层设计恰好形成了一个良性循环:特征去噪让序列中的商品表示更干净,序列去噪则让用户行为模式更清晰,两者相互促进。

特征降噪:用图信号“拉普拉斯平滑”搞定冗余信息

这部分是 DDMSR 的第一刀:把图像和文本特征放到“语义图”里做去噪。别被“图信号处理”这几个字吓到,人话版就是:相似的商品应该靠近,不相似的杂音应该被压下去。模型不是孤零零看每个商品,而是先根据特征相似度连边,再在图上做信息传播。这里的核心洞察是:推荐场景下的“有用特征”往往是那些在同类商品中共享的共性特征,而“噪声特征”则是每个商品独有的、与推荐意图无关的个性特征。通过图上的邻域聚合,共性特征被增强,个性噪声被抑制。
论文这里用到的关键术语是拉普拉斯平滑。它的直觉很简单:如果两个节点在图上是邻居,那么它们的特征应该更接近;反过来,那些和邻居差得很离谱的高频抖动,就更像噪声。换句话说,这个过程相当于在图上做一个结构化低通滤波器,把“跟大家都不一样的异常值”压一压。从数学上看,拉普拉斯平滑对应着图拉普拉斯矩阵上的低通滤波操作:特征矩阵左乘一个平滑核,相当于在谱域衰减高频分量。DDMSR并没有直接使用固定的平滑核,而是通过可学习的门控机制来控制平滑强度,这使得模型能够根据每个节点的局部密度自适应地调整去噪力度——在稠密区域可以多借邻居信息,在稀疏区域则更依赖自身特征。
Figure 2
图2:DDMSR 的整体框架图。流程上先对文本和图像特征做图去噪,再通过 MoE Adapter 映射到统一空间;随后把序列送入频域去噪模块,最后交给 Transformer 编码器建模用户偏好,并配合跨模态对比学习一起训练。从图中可以清晰地看到,整个框架是一个“先净化、再融合、后建模”的三段式流水线。其中MoE Adapter的设计也值得一提——它不是一个简单的线性映射,而是由多个专家网络和一个门控网络组成,每个专家擅长处理不同类型的特征模式,门控网络根据输入特征动态选择最合适的专家组合。这种设计使得从去噪后的特征到统一语义空间的映射更加灵活,能够适应不同模态、不同商品类别的特征分布差异。
具体做法也不复杂。先用图像和文本原始特征计算余弦相似度,构造各自的 item-item 语义图;然后只保留每个节点最相近的 Top-K 邻居,避免图太密导致“大家都连一起,最后谁也不清楚”。接着在图上做若干层图卷积聚合,核心是把自己的特征和邻居聚合后的特征做自适应融合。这里的门控权重是可学习的,意思是:高质量特征少洗一点,长尾或稀疏特征多借邻居一点,避免一刀切把信息洗没了。具体来说,门控机制会计算一个介于0和1之间的融合系数,当自身特征与邻居特征的一致性高时,融合系数偏向邻居;当自身特征已经足够独特且可靠时,融合系数偏向自身。这种自适应机制的关键优势在于,它不需要人为设定哪些商品是“高质量”的,而是让模型在训练过程中通过梯度信号自动学会判断。
这一步的妙处在于,它不是靠生成式模型“重画一遍特征”,也不是靠复杂采样硬凑一个干净表示,而是直接利用语义邻域做平滑。工程上这就很香:计算相对轻,训练稳定性也更好。对推荐系统来说,很多时候最怕的不是不够新,而是新得太花哨、最后跑不动。此外,图去噪还有一个隐性的好处:它天然具有归纳能力。当一个新的商品加入商品库时,只要能够提取其预训练特征,就可以通过它在语义图中的邻居快速获得一个去噪后的表示,而不需要重新训练整个模型。这对于工业界频繁上新的场景来说,是一个非常重要的实用特性。
Figure 5
图5:Beauty 数据集上文本特征和图像特征在三种设置下的分布可视化。上图是单位圆上的二维投影,下图是角度分布的核密度估计。左到右分别是原始特征、去掉图去噪、加入图去噪。可以直观看到,图去噪后两种模态的分布更集中,跨模态语义对齐也更像回事了。具体来看,原始特征中文本和图像的角度分布峰值位置有明显偏移,说明两种模态对同一商品的描述存在系统性偏差;而加入图去噪后,两个分布的峰值几乎重合,且分布的方差显著减小。这意味着图去噪不仅让单模态特征更干净,还意外地起到了跨模态对齐的桥梁作用——因为语义图是基于特征相似度构建的,当文本特征和图像特征在语义上指向同一商品时,它们在图上会通过共同的邻居节点间接连接,从而在平滑过程中互相校准。
图5其实很说明问题:原始特征里,文本和图像的角度分布散得比较开,说明两种模态虽然都在“说同一件商品”,但说法并不统一。经过图去噪后,分布明显更紧凑,跨模态的一致性增强了。说白了,原来像两个各讲各话的销售,现在终于开始说同一种话术了。这种对齐效果的提升,对于后续的跨模态对比学习来说是一个很好的初始化——如果两个模态的表示在进入对比学习之前就已经比较靠近,那么对比学习的优化过程会更加平滑,收敛也更快。

序列降噪:玩转“傅里叶变换”,滤掉异常交互

如果说上一部分是在“商品长什么样”上做减噪,那这一部分就是在“用户怎么点”的序列上动刀。DDMSR 的第二刀很有意思:先把行为序列从时域搬到频域,再用可学习滤波器做自适应修正。这不是为了炫技,而是因为噪声在频域里往往更容易暴露本性。时域中,一个误点和一个真实兴趣点看起来都是“在某个时间步上出现了一个商品”,很难直接区分;但在频域中,真实兴趣通常表现为连续的低频成分,而误点则更像是一个孤立的脉冲,其频谱会扩散到各个频率分量上。这种本质差异使得频域滤波成为一个非常自然的去噪手段。
这里的关键缩写是FFT,英文全称是 Fast Fourier Transform,中文叫快速傅里叶变换。它的作用是把序列从“按时间顺序排列的点”变成“不同频率成分的组合”。直白点说,原本看不出谁是噪声、谁是真兴趣,到了频域里,高频尖刺和低频趋势就更容易分家。DDMSR在这里处理的是序列中每个时间步的商品表示向量——每个向量都是一个d维的嵌入,FFT是沿着时间维度对每个特征维度分别进行的。这意味着模型实际上是在学习“用户在这个特征维度上的兴趣变化模式”,而不是简单地处理一个标量序列。这种多维频域处理方式能够捕捉到更丰富的用户行为模式,比如某个用户对颜色的偏好是稳定的(低频),但对款式的偏好却经常变化(高频)。
论文没有简单地用一个固定低通滤波器“一刀切”,而是设计了可学习的频率滤波器。这点很关键,因为推荐序列里的噪声不是统一模板:有的是误点造成的高频尖峰,有的是临时兴趣带来的低频漂移。固定滤波器太死板,容易把真兴趣也当垃圾扔掉;可学习滤波器更像一个会看情况的门卫,知道什么时候该放行、什么时候该拦下。具体实现上,这个可学习滤波器是一个与频谱维度相同的复数张量,每个频率分量都有一个独立的复数增益参数。模型通过反向传播来学习这些增益参数的最优值——如果一个频率分量对最终推荐任务有帮助,它的增益就会被放大;反之,如果它主要携带噪声,增益就会被抑制。这种细粒度的频率选择能力,是固定滤波器无法比拟的。
Figure 4
图4:频域去噪层数量的影响。可以看到,去噪层并不是越多越好,适度堆叠能带来提升,但层数过深会让收益变小,甚至出现过度平滑的问题。这个结果也说明,频域去噪是“精修”,不是“无脑猛加”。从图中可以观察到,当去噪层数从1增加到2时,性能提升最为显著;从2到3时提升幅度减小;超过3层后性能开始出现轻微下降。这个现象背后的原因是:多层频域滤波相当于对频谱进行了多次非线性变换,虽然理论上可以建模更复杂的去噪模式,但过多的变换也会扭曲频谱中的有效信息,导致信息丢失。这也提醒我们,在实际应用中,频域去噪层的数量是一个需要仔细调节的超参数。
从流程上看,这一层先对序列做 FFT,得到复数频谱;再用可学习的复数滤波器逐元素调制频谱;随后用逆变换回到时域。为了避免滤波太猛,论文还加了门控融合,把滤波后的表示和原始表示动态结合起来。这个设计挺务实:不是所有位置都该被重度处理,有些位置本来就挺干净,硬洗反而把信息洗掉。门控融合的具体做法是,为每个时间步计算一个融合权重,这个权重取决于滤波前后表示的差异程度——如果差异很大,说明滤波操作对这个位置做了较大修改,模型会倾向于保留更多原始信息以防止过度去噪;如果差异很小,说明滤波操作认为这个位置本身就很干净,模型就会更多地采用滤波后的结果。这种自适应机制确保了去噪操作的安全性和稳健性。
Figure 3
图3:Top-K 邻居数量的影响。语义图不是连得越密越好,邻居太少会信息不足,邻居太多又容易把不相干的东西也卷进来。这个图说明,图结构去噪同样存在“甜蜜点”。具体来看,当K值从5增加到20时,性能稳步提升;在K=20附近达到最优;当K继续增大到50时,性能开始下降。这是因为当邻居数量过少时,每个节点只能从极少数相似商品中获取信息,去噪效果有限;当邻居数量过多时,图中会混入大量不相关的商品,导致平滑过程引入了新的噪声。这个“甜蜜点”的存在也说明,语义图的构建质量对最终效果有显著影响,而Top-K的选择需要根据数据集的特性进行调优。
图3和图4放在一起看,基本能读出一个朴素结论:DDMSR 的两个去噪模块都不是越强越好,而是要控制强度。语义图的邻居数太大,容易过平滑;频域去噪层太深,也会把序列磨得太钝。推荐系统里很多“看起来很高级”的方法最后翻车,往往不是没能力,而是太用力。这个观察其实揭示了推荐系统研究中的一个普遍规律:去噪的本质是在“保留有效信息”和“去除噪声信息”之间寻找平衡,而这个平衡点往往不是极值点。DDMSR通过引入可学习的门控机制和自适应融合策略,使得模型能够在训练过程中自动找到这个平衡点,而不是依赖人工设定的固定参数。

对比学习助攻:让文本和图像特征心有灵犀

只做去噪还不够,因为文本和图像本来就不是一个模态,天然存在“表达方式不同、语义空间不完全一致”的问题。DDMSR 于是加了一层辅助目标:跨模态对比学习。这一步的目标不是让两种模态变得一模一样,而是让同一个商品的文本和图像表示更靠近,让不同商品的表示更容易区分。这里的关键在于,对比学习提供了一种无需人工标注的对齐信号——同一商品的不同模态视图天然构成正样本对,而不同商品之间则构成负样本对。模型通过最大化正样本对的相似度、最小化负样本对的相似度,来学习一个跨模态共享的语义空间。
这里常见的缩写是InfoNCE,英文全称是 Information Noise-Contrastive Estimation,中文一般译为信息噪声对比估计。它是对比学习里很经典的一种损失:把同一个样本的两种视图当正样本,把 batch 里别的样本当负样本,逼着模型学会“谁和谁是一家人”。InfoNCE损失的核心思想是,在一个包含一个正样本和N个负样本的集合中,模型需要正确识别出哪个是正样本。这个目标等价于最大化正样本对的互信息下界,因此它不仅能让表示更对齐,还能让表示包含更丰富的共享信息。DDMSR在计算InfoNCE损失时,使用了温度系数来调节相似度分布的锐利程度——温度越低,模型对负样本的区分越严格,对齐效果越强,但也更容易过拟合。
DDMSR 这里的对比学习不是主角,但它很像一个靠谱的副驾驶。图去噪解决的是“特征里有杂质”的问题,对比学习解决的是“两个模态彼此不认账”的问题。前者让单模态更干净,后者让跨模态更统一。两者叠加后,推荐系统拿到的不是两份互相打架的特征,而是两份能对得上口径的表示。值得注意的是,对比学习的引入还有一个隐性的正则化效果:它迫使模型在去噪后的特征空间中保持跨模态的一致性,这间接地防止了图去噪模块过度平滑——因为如果图去噪把不同商品的文本特征都拉得太近,对比学习就会通过负样本对给出惩罚信号,迫使模型在去噪和区分度之间找到平衡。
这个设计最值得肯定的一点,是它没有把“对齐”理解成生硬地把两个模态压成一个球。论文先做图去噪,再做 MoE Adapter 映射到统一空间,最后再用对比学习拉近语义。顺序安排得很顺:先净化,再对齐,最后训练。很多方法一上来就硬对齐,结果不是对齐,是互相拉扯。这种“先净化后对齐”的策略还有一个深层原因:如果特征中还存在大量噪声,那么对比学习可能会学到错误的对齐模式——比如把两个商品中共同的背景噪声对齐起来,而不是对齐它们真正的语义内容。先通过图去噪把噪声压制下去,对比学习才能专注于学习真正有用的语义对齐。

效果炸裂:四个数据集全面屠榜,训练还比对手快3倍

论文最关键的地方,不是“想法听起来很顺”,而是四个公开数据集上都能稳定领先。而且它领先的方式也比较实在:不是只在某一个指标上蹭一下,而是 Recall 和 NDCG 都有提升,且多个数据集都显著优于最强基线。对推荐任务来说,这种“全面而不偏科”的结果,比某个单点爆发更值得信。四个数据集覆盖了不同的领域和稀疏程度:Beauty和Toys来自亚马逊,属于典型的长尾电商场景;Sports同样来自亚马逊但品类更集中;MicroLens是一个短视频推荐数据集,其多模态信息来自视频帧和标题。DDMSR能在这些差异巨大的数据集上一致地取得最优结果,说明其去噪设计具有很好的泛化能力,而不是针对某个特定数据集过拟合。
Table 1
表1:预处理后的数据集统计信息。可以看到,Beauty、Sports、Toys 和 MicroLens 都是典型的高稀疏场景,用户和物品数量不小,但平均交互很少,稀疏率接近 99.9%。这也解释了为什么多模态信息和去噪设计很重要:在这种数据条件下,光靠 ID 记忆,基本就是拿小抄对抗失忆症。具体来看,Beauty数据集有超过22万用户和12万商品,但平均每个用户只有约8次交互;MicroLens更是有超过100万用户和2万商品,平均交互次数不到10次。在这种极度稀疏的场景下,协同过滤信号非常微弱,模型必须依赖内容特征来弥补交互数据的不足。但如果内容特征本身充满噪声,这种弥补就会大打折扣——这正是DDMSR要解决的核心矛盾。
Table 2
表2:DDMSR 与各类基线的总体性能对比。可以看到,DDMSR 在四个数据集上都拿到了最优或显著最优结果,最高提升出现在 Sports 数据集上,Recall@20 相比最强基线提升了 19.33%。另外,Beauty 上 NDCG@20 也有 10.68% 的提升,说明它不只是“多捞到几个相关项”,而是排序质量也更稳。值得注意的是,DDMSR在MicroLens数据集上的提升幅度相对较小(约5-8%),这可能是因为短视频推荐中用户的兴趣变化更快,序列中的“噪声”和“真实兴趣”之间的界限更加模糊,频域去噪的假设(稳定兴趣为低频)的适用性有所下降。这也从侧面印证了DDMSR的局限性——它在用户兴趣相对稳定的场景中表现最佳。
从基线对比能看出几个很清楚的信号。第一,单纯的 ID 序列模型在多模态稀疏场景里吃亏,说明只记行为不看内容,天花板确实有限。第二,已有多模态模型虽然能补内容信息,但如果没有专门处理噪声,提升会被稀释。第三,像 DMMD4SR 这类扩散式去噪方法,虽然概念上很“高级”,但在推荐场景里未必好优化,甚至会因为流程复杂、目标不够贴合而掉队。DDMSR 的优势就在于:去噪方式更直接,训练目标更贴近推荐任务,工程上也更轻。具体来说,扩散式方法需要模拟一个从噪声到干净的逆向过程,其训练涉及多个时间步的采样和去噪,计算量是DDMSR的数倍;而且扩散模型的优化目标(最小化重建误差)与推荐任务的目标(最大化推荐准确率)之间存在一定的偏差,这种偏差需要通过复杂的调参来弥合。DDMSR则直接将去噪作为推荐流程中的一个可微模块,其优化目标与推荐任务完全一致,因此训练更加高效和稳定。
Table 3
表3:消融实验结果。去掉图去噪、去掉频域去噪、去掉对比学习后,性能都会下降,说明这三部分不是“装饰件”,而是各自承担了不同的净化职责。尤其是双层去噪同时保留时,收益最完整,证明两个模块是互补关系,不是重复堆料。从消融结果的具体数值来看,去掉图去噪带来的性能下降在Beauty数据集上最为显著(Recall@20下降约12%),这说明在视觉特征主导的品类中,特征层噪声的影响更大;而去掉频域去噪在Sports数据集上的影响更大(Recall@20下降约9%),这可能是因为体育用品的购买决策更受短期促销活动的影响,序列噪声更为突出。这种差异化的影响模式,恰好验证了“双重噪声”假设的正确性。
消融实验的价值在于,它把“为什么有效”这件事掰开了讲。图去噪主要解决特征冗余,频域去噪主要解决序列随机扰动,对比学习主要解决跨模态不一致。三者各管一摊,少一个都不完整。这个结果也顺手证明了一件事:多模态推荐的瓶颈,很多时候不是“模型不够大”,而是“脏东西没人管”。此外,消融实验还揭示了一个有趣的现象:同时去掉图去噪和频域去噪(只保留对比学习)时,性能甚至低于只去掉其中一个模块的情况,这说明两个去噪模块之间存在协同效应——特征去噪为序列去噪提供了更干净的输入,序列去噪则为特征去噪提供了更准确的用户行为信号,两者相辅相成。
Table 4
表4:与 DMMD4SR 的效率对比。DDMSR 的训练时间和显存占用都更友好,说明它不仅效果更稳,工程成本也更低。对真实业务来说,这点非常关键:推荐系统不是论文跑分机,能不能训得动、能不能上线、能不能稳定迭代,往往比多 0.2 个点更重要。具体数据上,DDMSR在Beauty数据集上的单轮训练时间约为DMMD4SR的1/3,显存占用约为1/2。这种效率优势主要来自两个方面:一是DDMSR的图去噪和频域去噪都是前向计算中的轻量操作,不需要像扩散模型那样进行多步迭代;二是DDMSR的整体架构更加简洁,没有引入额外的生成式模块或复杂的采样过程。对于工业界动辄千万级用户和商品的大规模场景,这种效率优势可能意味着从“跑不动”到“跑得动”的质变。
Figure 8
图8:不同流行度分组下的性能提升。DDMSR 在长尾物品上提升更明显,这和它的图去噪思路是对得上的:长尾物品本来特征就稀疏,更依赖邻居传播和多模态补充。这个结果说明,方法不是只会在热门商品上刷分,而是真的在帮冷门物品“补血”。从图中可以清晰地看到,在交互次数最少的商品分组(长尾组)中,DDMSR相比最强基线的Recall@20提升超过了25%;而在交互次数最多的热门商品分组中,提升幅度约为5-8%。这种差异化的提升效果具有重要的商业价值——在电商和内容平台中,长尾商品往往占据了商品总量的绝大部分,但传统的推荐模型由于缺乏足够的交互数据,很难给这些商品公平的曝光机会。DDMSR通过多模态去噪,使得长尾商品即使只有少量交互,也能通过其内容特征和语义邻居获得合理的表示,从而获得被推荐的机会。
如果把整篇论文的实验结果串起来看,结论其实很统一:DDMSR 的收益主要来自“去噪”而不是“堆复杂度”。它在高稀疏、多模态、长尾明显的场景里尤其有效;而且训练成本并没有因为多加两个模块就失控,反而比扩散式方案更轻。这个组合挺难得:效果、稳定性、效率三者没有明显互相打架。从方法论的角度看,DDMSR的成功也给了我们一个启示:在推荐系统研究中,有时候“把已有的东西弄干净”比“发明新的东西”更重要。预训练模型、Transformer、对比学习这些技术都已经很成熟了,但如何让它们在一个统一的框架中协同工作、互相净化,才是真正的挑战所在。
当然,论文也不是没有边界。它依赖预训练图文特征,说明上游编码器质量仍然决定了下限;语义图构建和 Top-K 邻居选择也需要调参;频域去噪对序列模式的假设在某些极端场景里未必总成立。也就是说,DDMSR 不是“全场景无脑通吃”的万能药,但作为一个轻量、清晰、可解释的去噪框架,已经比很多只会把模块越堆越厚的方案体面得多。具体来说,以下几个场景中DDMSR可能面临挑战:一是当预训练特征质量极差时(比如商品图片全是白底图、文本描述全是模板化内容),语义图中的邻居关系可能本身就不可靠,图去噪反而会传播错误信息;二是当用户行为序列极短(比如只有1-2次交互)时,FFT的频域分辨率不足,频域去噪的效果会大打折扣;三是当商品库更新极快时,语义图的增量维护可能成为一个工程挑战。这些局限性也为未来的研究提供了方向——比如如何设计更鲁棒的图构建策略、如何结合时频分析处理极短序列、如何实现语义图的在线更新等。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是多模态序列推荐里的“双重噪声”问题:一边是预训练特征里混进来的冗余信息,一边是用户行为序列里的误点和随机波动。DDMSR 通过图去噪和频域去噪,把这两类脏信号分别处理掉。更具体地说,特征噪声来自预训练模型与推荐任务之间的语义偏移,序列噪声来自用户行为中的非意图性交互。这两类噪声如果得不到有效处理,会相互放大——脏特征导致序列建模偏差,脏序列又反过来污染特征学习。DDMSR的双层去噪设计正是为了切断这个恶性循环。

FFT 和拉普拉斯平滑分别是什么意思?FFT 是快速傅里叶变换,把序列从时域变到频域,方便区分稳定趋势和突发噪声;拉普拉斯平滑则是在图上做邻域聚合,让相似商品的表示更接近,从而压制高频语义噪声。两者虽然都叫“平滑”,但作用域完全不同:FFT作用于时间维度,处理的是用户行为的时间模式;拉普拉斯平滑作用于商品维度,处理的是商品特征的语义模式。这种跨维度的去噪设计,使得DDMSR能够同时从“时间”和“语义”两个角度净化数据。

它为什么比一些扩散式去噪方法更实用?因为它没有把去噪做成一套特别重的生成流程,而是直接利用图结构和可学习频域滤波完成净化,训练更轻,调试更稳,和推荐任务本身也更贴合。扩散式方法需要设计前向加噪和反向去噪两个过程,训练时需要采样多个时间步,推理时也需要迭代去噪,整体计算量是DDMSR的3-5倍。更重要的是,扩散模型的优化目标是重建原始数据分布,而推荐任务的优化目标是预测用户的下一个交互——这两个目标之间存在本质差异,导致扩散式方法在推荐场景中往往需要额外的适配工作。DDMSR则将去噪直接嵌入到推荐流程中,其优化目标与推荐任务完全一致,因此更加高效和直接。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是“发明了一个全新宇宙”,但把特征噪声和序列噪声拆开处理,思路清晰,组合也合理。特别是将图信号处理和频域分析这两个相对成熟的技术,以“双层去噪”的形式有机结合起来,形成了一个完整的解决方案,这种系统性的创新比单纯引入一个新模块更有价值。

实验合理度:★★★★☆ 数据集、指标、消融、效率对比都齐了,而且对比对象覆盖了 ID 模型、多模态模型和去噪模型,比较完整。唯一的小遗憾是没有在更多类型的多模态数据(如视频+音频)上进行验证,但这不影响论文本身的说服力。

学术研究价值:★★★★☆ 对多模态推荐的“噪声建模”给了一个很实用的方向,尤其适合后续继续做轻量去噪和跨模态对齐。论文中提出的“双重噪声”概念框架,为理解多模态推荐中的信号污染问题提供了一个清晰的视角,有望启发更多相关工作。

稳定性:★★★★☆ 图去噪和频域滤波都比生成式去噪更稳,整体不花哨,落地风险相对小。从消融实验可以看出,即使去掉某个模块,性能下降也是渐进的,不会出现“崩盘”式的大幅下跌,这说明框架的各个组件都具有较好的鲁棒性。

适应性以及泛化能力:★★★☆☆ 在高稀疏多模态场景里很有希望,但对不同业务的图构建和频域假设仍有依赖。特别是在用户兴趣变化极快的场景(如新闻推荐)中,频域去噪的“稳定兴趣为低频”假设可能需要重新审视。

硬件需求及成本:★★★★☆ 相比扩散式方法更省,训练和显存开销都更可控,工程上友好。在常见的单卡GPU(如RTX 3090)上,DDMSR可以在合理时间内完成四个数据集的训练,这对于资源有限的团队来说是一个重要优势。

复现难度:★★★★☆ 代码已开源,框架和数据处理也比较标准,复现门槛不高。从开源代码的结构来看,作者对代码的可读性和模块化做了很好的设计,每个组件都有清晰的接口和文档,这大大降低了复现和二次开发的工作量。

产品化成熟度:★★★☆☆ 适合做离线推荐增强模块,但上线前仍需验证不同业务下的图构建和特征质量。对于工业场景,还需要考虑语义图的增量更新策略、大规模商品下的图存储和查询效率等工程问题,但这些都属于可解决的工程优化,不涉及方法论的根本缺陷。

可能的问题:方法依赖预训练特征和邻域结构,若上游特征质量差或场景变化大,收益可能不稳定。此外,频域去噪对序列长度的敏感性也需要关注——当序列极短时,FFT的频率分辨率不足,去噪效果会受到影响。未来的改进方向可以包括:引入自适应图构建策略、结合小波变换处理非平稳序列、以及探索无监督或自监督的特征净化方法。


主要参考文献

Jie Luo, Qi Jin, Xinming Zhang. Beyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation. arXiv 2026.
项目代码:https://github.com/jluo00/DDMSR
项目图示:https://github.com/jluo00/DDMSR/raw/main/DDMSR.png

多模态推荐最怕的不是信息少,而是信息太吵。DDMSR把噪声拆成两层来治,思路清楚,工程也不重。想继续围观这种“既讲原理又讲落地”的论文拆解,欢迎扫码加入龙哥读论文粉丝群,一起把推荐系统里的脏信号揪出来🤘  

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。