← 返回 PaperDaily 大模型与智能体

浙大IMFuse:打破LLM推荐只用最后一层惯例!平均提升6.72%,参数几乎不增加

继2025年末佐治亚理工的降噪思路后,浙大团队发现一个更根本的问题:在做LLM增强推荐时,直接取最后一层语义并不合理——中间层保留了互补的细粒度信息,不同物品对层深的偏好也不同。为此他们提出IMFuse,一个即插即用的多层语义聚合模块,仅增加0.03M参数就让推荐性能平均提升6.72%。门槛低、收益高,值得关注。

浙大IMFuse:打破LLM推荐只用最后一层惯例!平均提升6.72%,参数几乎不增加
原论文信息如下:
论文标题:
IMFuse: Instance-Aware Multi-Layer Fusion for LLM-Enhanced Sequential Recommendation
发表日期:
2026年07月
发表单位:
浙江大学(合作:郑州大学、中国科学技术大学)
原文链接:
https://arxiv.org/pdf/2607.27002v1.pdf
好了,话说回来,团队在做推荐系统时,经常会遇到一个终极难题:用户的历史行为就那么点,冷启动和长尾物品怎么才能推荐得更准?
龙哥表情
这几年,大家的共识是:光靠物品的离散ID不够,还得用大语言模型把物品的文本描述(标题、品类)变成“语义向量”塞进去,效果那叫一个立竿见影。但是,龙哥仔细看了看现有的做法,发现了一个盲区——所有人都去拿LLM最后一层的输出作为物品的语义表示。
如果你以为LLM最后一层就是精华,那今天这篇文章就是要来怼你的。

最终层语义坍塌严重?中间层竟藏宝!

龙哥先抛个残忍的事实:浙大团队这篇文章的核心发现之一,就是LLM的深层表示存在严重的谱坍塌(Spectral Collapse)问题。
什么意思呢?就是说LLM的深层表示中,大多数维度的信息都湮灭了,最后只留下前几个“主成分”在那里撑场面。这使得物品之间的语义差异变成了一个非常扁平的、一维的对比,精细的语义信号反而被淹没了。
封面
图1:在Amazon Clothing数据集上,用LLaMA-3-8B作为LLM主干的分析。可以看到,深层LLM层的Top-K奇异值比例越来越高(谱坍塌加剧),且不同层之间的语义余弦相似度差异显著。
那是不是说越浅越好呢?也不是。
经过仔细分析,团队发现中间层虽然谱分布更均匀、保留了更多细粒度信息,但它们与最终层的语义差异很大(从图1的右上角也能看出)。也就是说,浅层和深层编码的是互补的信息,而不是谁替代谁的关系。
这还没完,更有意思的发现来了。
他们把所有物品按照语义聚类后发现,不同类型物品的表示在LLM的各层演化规律完全不同。比如“乐高玩具”这种具体物品,可能深层坍塌得很快;而“抽象书籍”如那些哲学著作,它的语义表示可能在整个深度范围内都保持了一定的区分度。
图2:物品群体在LLM层间的异质性分析
图2:物品群体在LLM层间的异质性分析。(a) 不同语义群体在Top-1奇异值比例和与最终层相似度上存在显著差异。(b) 代表性群体展现出不同的层间语义相似性结构。
这意味着,强行给所有物品指定一个统一的“最佳层”,根本行不通。有的物品需要在浅层淘金,有的则要在中层、深层里挖掘。这才是痛点中的痛点。
所以,龙哥觉得这个切入点非常致命:既然一层不够,那就多取几层;既然取法不能一刀切,那就自适应地融合。于是,IMFuse应运而生。

全局偏好+实例调制:让物品各取所需

下面来拆解一下IMFuse到底是怎么运作的。它其实就两个大模块:全局层偏好学习(Global Layer Preference Learning)和实例感知专家调制(Instance-Aware Expert Modulation)。

1. 全局层偏好:先学一个通用的“选层配方”

首先,IMFuse并没有直接给每个物品独立学习一个层权重,那样参数太多,容易过拟合。相反,它通过学习一个全局层得分矩阵W(维度为d x (L+1),其中d是语义嵌入维度,L是LLM层数),来捕捉所有物品共享的层贡献模式。
这个矩阵W可以看作是一个“通用滤网”,它告诉模型,对于语义空间中的每一个维度,应该倾向于从第几层去获取信息。通过softmax沿着层维度进行归一化,就得到了全局层权重矩阵G。
全球一个配方,够了吗?显然不够,因为之前分析过,不同物品的偏好不同。

2. 实例感知调制:给每个物品“开小灶”

为了解决物品差异性问题,IMFuse引入了实例感知专家调制模块。
这个模块的核心是轻量级的路由器(Router)。它把每个物品的最终层语义表示(E_L)作为输入,判断这个物品应该更看重浅层(Shallow Expert)、中层(Medium Expert),还是深层(Deep Expert)的信息。路由器通过软路由选择对应的专家模板,然后生成一个物品专属的层调制向量b_i。
最后,用这个b_i来调整全局层得分矩阵W,得到最终的物品特定层权重A_i。这样,每个物品都有自己的“选层策略”,而且是通过一个共享的模板库衍生出来的,策略上更灵活,参数上更节省。
图3:本文提出的IMFuse的整体框架
图3:本文提出的IMFuse的整体框架。它通过全局层偏好和实例感知专家调制,自适应地聚合多层语义信息,生成物品特定的语义表示,再送入下游的序列推荐器。
看懂图3,整个方法就清晰了:你只需要把IMFuse当作一个“即插即用”的模块,放在LLM与下游推荐模型之间。输入是LLM所有层的输出,输出是一个融合后的、物品感知的语义向量。
龙哥觉得这里设计得比较巧妙的地方在于:它抓住了“不同物品对语义深度的依赖不同”这一层间异质性,并通过专家调制的方式优雅地解决,而不是粗暴地平均或只取一层。

四数据集六基线下全面碾压,平均提6.72%

说了这么多原理,最终还得看疗效。IMFuse在四个Amazon真实数据集(Clothing、Beauty、Toys、Office)上做了严格的测试。
表1:数据集统计
表1:四个数据集统计,稀疏度均达到99.9%以上,是典型的冷启动和稀疏场景。
他们选取了两种经典的序列推荐主干网络(SASRecHSTU),以及四种主流的语义增强方法(RLMRec、LLM-ESR、LLMInit、SpecTran)作为基线,然后分别测试了“裸基线”与“基线+IMFuse”的效果。
表2:四个数据集上的总体性能对比(SASRec主干)
表2:SASRec主干下的性能对比。"+ IMFuse" 表示在该方法基础上添加IMFuse。基线包括RLMRec、LLM-ESR、LLMInit、SpecTran。
结果非常直观:IMFuse在所有4个数据集、两个主干网络、4种方法下,都取得了全面提升。平均相对提升达到了6.72%。特别是在Office这个最稀疏的数据集上,提升尤其明显,有些指标直接拔高了十几个百分点。
表3:HSTU主干下的性能对比
表3:HSTU主干下的性能对比结果。IMFuse在总共16个对比项中全部取得最优。
特别说明:根据同基准(PaperDaily MCP已收录论文范围)的间接对比,IMFuse在与最新的多层级融合方法(如LAEF、CASE-MLP、VA-HS)的对比中,同样表现出显著优势。虽然实验设置可能略有不同,但这个提升方向是明确的。
图4:消融实验结果
图4:各组件消融实验。从左到右依次展示了:仅用最后一层、仅用平均层、移除实例调制、随机初始化、随机打乱模板等情况下的性能变化。可以看到,去掉任何一个核心组件,性能都会下降。
消融实验进一步证明了:仅用最后一层(w/ Last)效果最差;简单的平均聚合(w/ Mean)也不行;去掉了实例感知调制(w/o IM)性能明显下降。这说明全局偏好和实例调制缺一不可。

参数仅增0.03M,效率依旧能打

龙哥最关心的一个指标,就是参数增加和推理速度。毕竟,一个方法再好,如果跑起来慢如蜗牛,或者GPU显存爆了,老板是不会让你上线的。
IMFuse给出的答案是:额外参数仅增加0.03M(约3万参数),推理速度几乎没有影响。
为什么这么高效?因为IMFuse的所有操作几乎都是可并行的矩阵运算:全局偏好矩阵W的更新、路由器的前向传播、以及最终的加权求和。整个模块不涉及对LLM底层参数的任何微调,完全冻结LLM,也不需要像某些方法那样反复加解码器或复杂适配器。
它的额外计算量主要来自三个方面:
1. 对每一层LLM输出进行降维(用适配器或奇异值分解SVD)。
2. 全局偏好矩阵的计算。
3. 路由器的计算。
通过精心设计的低维专家模板(论文中默认用3个专家),可以保证整个模块的计算开销远小于主流推荐模型的训练成本。
而且论文特别提到,IMFuse不仅兼容SASRec、HSTU等不同的推荐主网络,还可以无缝接入RLMRec、SpecTran等不同的语义增强管道,真正做到“即插即用”。

从分析到落地:这套套路可迁移至哪些场景?

龙哥认为,IMFuse最大的价值并不仅仅是提出了一个更好的推荐算法,更在于它揭示了“语义表征的多层融合”这一通用策略的潜力。
如果你正在做以下这些工作,IMFuse的思路绝对值得参考:
1. 冷启动推荐:新物品没有交互历史,只能依靠文本信息。IMFuse通过对多层的自适应融合,能够更好地挖掘新物品的语义细节,有效缓解冷启动问题。实验结果中Office数据集上的大幅提升也印证了这一点。
2. 跨领域/跨场景推荐:当物品品类、领域分布差异很大时,不同物品对语义深度的偏好差异会更加显著。IMFuse的实例感知机制天然适合这种场景。
3. 长序列建模:虽然本文聚焦于物品级别的语义,但可以想象,这个思路也可以推广到用户行为序列的编码中。比如用户的行为序列也可以用LLM编码,然后通过IMFuse实现“序列级别”的多层融合。
4. 多模态推荐:也许相关的思路还能启发多模态场景,比如文本编码器和图像编码器的多层特征融合,其原理都是相通的。
总的来说,IMFuse的价值在于它提供了一个非常聪明的视角:不要迷信LLM的最后输出,要自己去探索它内部的宝藏。而且,这个探索过程几乎不增加什么成本。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

IMFuse的核心思路是什么?IMFuse的核心思路是:不再只用LLM的最后一层输出来增强推荐,而是跨层融合所有层的语义信息。它通过“全局偏好”学习通用选层模式,再通过“实例感知调制”为每个物品生成个性化选层策略,从而得到更丰富、更个性化的语义表示。

为什么深层LLM表示会有谱坍塌(Spectral Collapse)?谱坍塌是指LLM深层表示的各项奇异值分布不均,前几个主成分占据了绝大部分方差,导致表示的信息容量下降。这是由于LLM在训练过程中,深层表示逐渐向任务相关的、高概率的输出空间收缩,导致非核心语义信息被压抑。

IMFuse的开销大吗?适合部署吗?开销非常小。额外参数仅增加约0.03M,这主要是由于共享的层偏好矩阵和轻量级的路由器。推理时间几乎无感。由于它是即插即用的模块,不改变下游推荐模型结构,部署起来非常方便,非常适合工业落地。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

不是套路式的堆叠,而是基于扎实的实证分析发现痛点,提出了有针对性的解决方案。虽然“多层融合”本身不算新,但“全局偏好+实例调制”的组合设计以及在推荐场景中的针对性分析做得很好。

实验合理度:★★★★★

实验非常扎实。在4个真实数据集、2个主流网络、4种语义增强方法下进行测试,并与多种多层融合基线进行对比。消融实验和参数敏感性分析也很到位。结果令人信服。

学术研究价值:★★★★✰

不仅给出了一个好的方法,更重要的是它提供了一个新的思考方向:如何更精细地利用LLM的内部表征。对后续跨领域、多模态、长序列等任务的融合设计有借鉴意义。

稳定性:★★★★✰

在不同数据集和不同骨干网络下表现稳定,没有出现过拟合或不收敛的情况。但方法对LLM的选择(文中主要用了LLaMA-3-8B)比较敏感,换更小的LLM效果可能打折扣。

适应性以及泛化能力:★★★★✰

泛化能力较强,能适配多种语义增强和推荐主网络。但主要设计思路是为序列推荐优化,直接迁移到其他任务(如CTR预估或CTR、重排模型)可能还需要一些调整。

硬件需求及成本:★★★★★

极低。额外参数仅3万,推理时间几乎无增加,训练时仅需少量梯度计算。普通GPU甚至CPU都能轻松运行。

复现难度:★★★✰✰

论文给出了详细的公式和框架图,但未明确说明是否开源。由于需要使用LLaMA-3-8B这样的大模型进行推理,即使输出是离线的,也需要较大的存储空间。但如果开源代码,门槛会大大降低。

产品化成熟度:★★★★✰

高度成熟。模块可以即插即用,不改变现有系统架构。唯一需要注意的是:你需要有足够资源离线用大模型计算所有物品的每一层输出。一旦建好缓存,线上推理非常快。

可能的问题:底层LLM冻结,只用了其前向输出,如果换更复杂或更大规模的LLM,可能需要重新离线缓存。另外,专家模板数量(文中用了3个)是一个超参数,不同任务最优值可能不同。


主要参考文献

[1] Yuheng Zheng, Yu Cui, Bin Wu, et al. IMFuse: Instance-Aware Multi-Layer Fusion for LLM-Enhanced Sequential Recommendation. arXiv:2607.27002, 2026.
[2] Wang-Cheng Kang and Julian McAuley. Self-Attentive Sequential Recommendation (SASRec). ICDM, 2018.
[3] Zhichao Xu, Ruoyu Li, et al. SpecTran: Spectral Adaptation for Language-Enriched Recommendation. SIGIR, 2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
推荐系统与大模型结合正是当下热点,想和同行深入交流?加入龙哥读论文粉丝群,添加龙哥助手微信号kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称。群内已有图像处理、大模型、自动驾驶、AI医疗、AI金融等方向,一起碰撞最新思路~
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。