← 返回 PaperDaily 大模型与智能体

西南大学新方法:Titans+卡尔曼滤波,冷启动推荐效果飙升2%+

冷启动推荐一直是个老大难问题,新物品刚上线,缺反馈、随时间变化,模型到底该信谁?西南大学的这项研究脑洞大开,把Titans的记忆机制和卡尔曼滤波的时序建模结合起来,用后验协方差作为“不确定性信号”来引导静态语义和时序特征的融合。这一招让推荐效果直接起飞,非常值得关注。

原论文信息如下:
论文标题:
NMKFR: A Robust Framework for Time-Aware Cold-Start Recommendation
发表日期:
2026年07月
发表单位:
西南大学
原文链接:
https://arxiv.org/pdf/2607.26429v1.pdf
开源代码链接:
暂无
项目链接:
暂无
开源数据集链接:
暂无

冷启动推荐为何难以平衡多源证据?

推荐系统里最头疼的场景之一,就是新物品刚上线的时候——没有用户交互数据,只有标题、描述、类别这些静态信息,俗称“冷启动”。更麻烦的是,用户兴趣和物品流行度还在随时间变化,同一件商品在不同时间点对同一个用户的吸引力可能天差地别。现有的冷启动方法要么只靠文本特征,要么只靠有限的行为反馈,要么只抓时间信号,但很少考虑这些证据在不同生命周期阶段的可靠性差异:刚上线时文本最可靠,但跟热门物品的语义相似度很快会过时;早期反馈虽然直接,却夹杂着曝光偏差和短期流行;时序信号能捕捉变化,但数据一稀疏就变成“盲猜”。
这篇由西南大学提出的 NMKFR(Neural Memory Kalman Fusion Recommender)框架,核心思路就是把三种证据的协调问题显式地建模出来:用Titans的记忆机制编码文本语义,用卡尔曼滤波跟踪用户-物品交互时序的隐状态,再通过后验协方差——也就是不确定性信号——动态调整静态语义和时序特征的融合权重。简单说,它让系统在不确定性大的时候更依赖文本,在状态明确的时候相信时序,并且能用前一个时间步的不确定性反馈到记忆检索中。这种设计使得模型能够在物品生命周期的不同阶段,自动选择最可靠的证据来源,从而在整体上提升冷启动推荐的鲁棒性和准确性。
图1:时序感知冷启动推荐中的证据协调问题——现有方法可以加强单个证据源,但静态内容、早期反馈和时序状态在不同阶段的联合可靠性仍未充分建模。图中直观展示了三种证据源各自在不同时间窗口内的优势与局限,以及NMKFR如何通过不确定性信号实现动态协调。

双分支架构:记忆编码+时间状态跟踪

NMKFR的整体架构如图2所示,包含两个并行分支和一个融合模块。语义分支负责将物品文本转化为语义观察向量,时序分支基于卡尔曼滤波对用户历史中的物品进行隐状态估计,融合模块根据不确定性信号自适应组合两路特征。整个框架的输入是用户的历史交互序列(每个交互包含物品ID、文本描述和时间戳)以及候选物品的文本信息,输出是用户对候选物品的偏好得分。两个分支各自独立处理输入,最终在融合模块中协同产生推荐结果。
图2:NMKFR整体架构。FD-TSE编码物品文本,TA-KDT进行时间条件隐状态估计,UDFM提供后验不确定性信号给ACFM用于静态-时序融合。在首次有效交互后,前一个后验不确定性信号还会反馈调制FD-TSE的记忆检索。图中箭头清晰展示了数据流和反馈回路,其中红色虚线表示不确定性反馈路径,蓝色实线表示前向计算路径。
反馈驱动的Titans语义编码器(FD-TSE):采用了Titans架构中的MAG形式,将有限上下文的自注意力与可学习的长期记忆并行。对于物品文本(标题、类别、短描述),自注意力捕获局部短语证据,记忆分支则通过读写操作存储跨位置的复用语义。具体来说,自注意力模块处理长度为L的文本序列,输出上下文感知的token表示;记忆模块则维护一个可学习的键值记忆矩阵,通过读写操作实现跨序列的信息复用。关键创新在于:从第二个有效交互开始,FD-TSE会利用前一个时间步的后验协方差(记为 P̄t)来调制记忆检索:当上下文不确定性大时,模型更依赖当前token的嵌入,减少对早期记忆的依赖(公式4)。同时,不确定性信号还会偏置注意力分支与记忆分支的融合门控(公式5)。这种设计使得语义编码器能够根据时序状态的不确定性动态调整其内部信息融合策略,从而在冷启动早期更依赖文本本身的语义,在后期则能更好地利用积累的交互知识。
时间感知卡尔曼动力学追踪器(TA-KDT):将FD-TSE输出的语义向量作为观测值,通过卡尔曼滤波估计一个隐式的时序推荐状态。为了处理不规则时间间隔,它先将原始时间差归一化再用Log1p压缩,然后通过矩阵指数函数计算时变转移矩阵(公式7-8)。具体而言,对于时间间隔Δt,首先计算归一化时间差δ = Δt / Δt_max,然后应用Log1p变换得到τ = log(1+δ),最后通过矩阵指数函数F(τ) = exp(A·τ)得到转移矩阵,其中A是学习到的状态转移速率矩阵。每个用户历史按时间顺序进行预测-更新,得到后验状态均值 xt|t和后验协方差 Pt|t。后验协方差表征了当前隐状态估计的不确定性,是整个不确定性引导融合的关键。卡尔曼滤波的预测步骤根据转移矩阵和过程噪声协方差更新状态分布,更新步骤则根据观测值和观测噪声协方差修正状态估计,这种递归机制使得模型能够在线地、高效地处理变长的用户交互序列。
自适应比较融合模块(ACFM):不是简单拼接或加权求和,而是构建了拼接、绝对差、逐元素积三种交互特征,分别刻画两分支的一致性/矛盾性(公式14)。拼接特征保留了完整信息,绝对差特征捕捉两分支的差异程度,逐元素积特征则强调两者共同激活的模式。然后通过两个分支的logit,并利用后验不确定性信号作为偏置(公式16)进行softmax归一化,得到α,最后线性融合成最终物品表示。这种融合方式比简单的加权求和更具表达能力,能够捕捉到两分支之间复杂的非线性交互关系。融合后的物品表示既包含了静态语义信息,又融入了时序动态特征,且两者的权重由不确定性信号自适应调节。
用户表示则由学习到的用户嵌入与历史物品融合表示的均值构成,候选物品的得分采用余弦相似度。整个模型使用listwise + pairwise + pointwise的混合损失训练。其中listwise损失采用交叉熵形式,鼓励模型将正样本排在负样本之前;pairwise损失采用BPR形式,进一步强化正负样本的排序差异;pointwise损失采用MSE形式,辅助模型学习准确的评分预测。三种损失通过超参数加权组合,使得模型在排序任务和评分预测任务上都能取得良好表现。

后验协方差:不确定性引导融合的关键

卡尔曼滤波的核心输出有两样东西:后验状态均值(隐状态估计)和后验协方差(状态不确定性)。许多推荐系统只用均值做特征,NMKFR则把后验协方差物尽其用——它既是当前时间步融合权重的调节器,又是前一个时间步记忆检索的反馈信号。这种双重利用使得不确定性信息在整个模型中循环流动,形成了一个自适应的闭环系统。
不确定性驱动的反馈机制(UDFM):UDFM将当前后验协方差的迹(trace)Ut = tr(Pt|t)作为不确定性信号。在ACFM中,该信号的log值作为偏置加入到两个分支的logit上:
高不确定性(大Ut)会降低时序分支的权重,迫使模型更依赖静态语义;低不确定性则让模型信任时序状态。另一方面,前一个时间步的后验协方差(P̄t)在FD-TSE中用于调制记忆检索:当历史状态不确定性大时,记忆检索权重降低,模型更关注当前token。这种双路反馈形成了一个闭合回路:时序分支的不确定性被用来校准语义分支的记忆提取,同时又被用来调整两分支的最终融合。这种设计使得模型能够根据当前状态估计的置信度,动态地平衡不同证据源的贡献,从而在冷启动的不同阶段都能做出合理的推荐决策。
论文还展示了后验协方差在训练过程中的行为轨迹(图3)以及在不同时间间隔下的分布(图4),证明它保持有界且稳定,为UDFM提供可用的输入。具体来说,后验协方差的迹在训练初期较大,随着模型逐渐收敛而减小并趋于稳定;在不同时间间隔下,后验迹的值虽然有所波动,但始终保持在合理的数值范围内,不会出现发散或坍缩到零的情况。这种数值稳定性对于不确定性信号的可靠使用至关重要。
图3:后验协方差与创新尺度代理的优化轨迹。在两个数据集上,后验迹均保持有限且不坍缩,为UDFM提供稳定的输入。图中横轴为训练轮次,纵轴为数值大小,可以看到后验迹在初始阶段快速下降后进入平稳状态,而创新尺度代理则始终保持在较低水平。
图4:时间间隔分层下的排名质量与后验协方差迹。NDCG@10在7-30天达到峰值,后验迹则保持有界。这表明模型在中等时间间隔内能够最有效地利用时序信息,而极短或极长的时间间隔下,不确定性信号会引导模型更多地依赖静态语义特征。

全面实验:十二个基线下的性能领先

论文在Amazon Video Games和MovieLens-32M两个真实数据集上,按照时序感知冷启动和物品冷启动两种协议进行评估。Amazon Video Games数据集包含约23万用户、4.5万物品和120万条交互记录,物品具有标题、类别等文本信息;MovieLens-32M数据集包含约20万用户、8万部电影和3200万条评分记录,电影具有标题和类型标签。对比了12个基线,包括基于对比学习的CLCRec/CCFRec、图方法LightKG/M2GNN、元学习PAML、序列模型SASRec/BERT4Rec、状态空间模型Mamba4Rec以及时序感知方法TDRO/TPAB/CDTR等。这些基线覆盖了冷启动推荐的主要技术路线,确保了对比的全面性和公平性。最终NMKFR在报告的所有指标上均取得了最好成绩。
表1:Amazon Video Games和MovieLens-32M上两种协议下的完整对比。加粗为最优,下划线为次优。NMKFR在所有场景中均取得最佳结果。具体指标包括Recall@10、NDCG@10和MRR,涵盖了召回率、排序质量和平均倒数排名等多个维度。
在时序感知冷启动下,NMKFR相对于最优基线在Amazon上的提升至少2.16%,在MovieLens上提升至少3.39%。在物品冷启动下,提升分别为至少3.10%和0.40%。值得注意的是,MovieLens上的提升幅度在排序敏感指标(NDCG@10、MRR)上更为明显,说明NMKFR擅长将真正的相关物品排到更靠前的位置。这种优势在物品冷启动场景中尤为突出,因为该场景下模型完全没有目标物品的历史交互信息,只能依赖文本语义和用户的一般偏好模式。
消融实验(表2)验证了每个组件的贡献:移除ACFM造成NDCG@10下降最大(Amazon),移除Titans在MovieLens上影响最大,移除UDFM影响Recall@10。整体来看,四个组件都不可缺失。具体来说,在Amazon数据集上,移除ACFM导致NDCG@10下降约8%,移除Titans下降约5%,移除UDFM下降约4%,移除TA-KDT下降约6%;在MovieLens数据集上,各组件的影响趋势类似但幅度略有不同。这些结果充分说明了每个模块在整体框架中的独特作用。
表2:组件消融实验结果。完整模型在所有指标上最优,每个组件都有明确贡献。表中还包含了将ACFM替换为简单拼接或加权求和的变体结果,进一步证明了自适应比较融合设计的有效性。
结合PaperDaily MCP已收录论文的同基准对比,目前库中未抽到这两个数据集/协议下的明确数值,因此无法严格验证NMKFR是否在所有对比中绝对占优,但本文报告的结果在限定设置下确实领先。读者需要注意不同论文可能使用不同的数据划分和负采样策略,直接比较需要谨慎。建议读者关注NMKFR在消融实验和鲁棒性分析中展现出的内部一致性,这些结果比绝对数值更能说明方法的有效性。

鲁棒性分析:噪声与稀疏历史的考验

RQ4设计了两类噪声实验:token级输入扰动(概率0~0.2)和历史长度截断(0~10个前缀)。token级输入扰动是指以一定概率随机替换物品文本中的token,模拟实际场景中文本描述可能存在的拼写错误或噪声;历史长度截断则是限制模型可用的用户历史交互数量,模拟冷启动初期数据稀疏的情况。结果如图5所示,NMKFR在所有扰动水平和前缀长度下均优于固定增益的融合变体。特别地,当历史长度为0(完全冷启动)时,NMKFR的Amazon NDCG@10为0.0562,随着历史增加到10步提升到0.2366,而固定增益变体提升更慢。这印证了自适应融合在不确定性变化场景中的价值。值得注意的是,即使在20%的token噪声下,NMKFR的NDCG@10仍然保持在0.15以上,显著优于固定增益变体的0.12,说明不确定性引导机制能够有效缓解输入噪声带来的负面影响。
图5:鲁棒性分析——token噪声(左)和历史长度(右)。NMKFR始终优于固定增益变体。左图横轴为噪声概率,纵轴为NDCG@10,可以看到NMKFR的下降曲线更为平缓;右图横轴为历史长度,纵轴为NDCG@10,NMKFR的上升曲线更为陡峭,说明其能更有效地利用新增的交互信息。
此外,论文还进行了合成时间间隔的数值敏感性实验(图6),将输入间隔从0天变化到1095天,观察卡尔曼诊断量的变化。结果显示,创新尺度代理、后验迹和卡尔曼增益范数的最大变化仅为0.2%以内,证明log压缩+矩阵指数的设计数值稳定。这种数值稳定性对于模型在实际部署中的可靠性至关重要,因为真实场景中的时间间隔分布往往极不均匀,从几秒到几年都有可能。
图6:合成时间间隔的数值敏感性。变化在0.2%以内,表明数值稳定。图中三条曲线分别对应创新尺度代理、后验迹和卡尔曼增益范数,在0到1095天的时间间隔范围内均保持平稳。

结论与未来展望

NMKFR在时间感知冷启动推荐上提出了一套完整的解决方案,核心创新点在于将Titans的记忆机制与卡尔曼滤波的时变状态估计结合起来,并用后验协方差作为不确定性信号来引导静态和动态证据的融合。在多个数据集的评估中取得了领先结果。该方法不仅在标准冷启动场景中表现优异,在噪声干扰和数据稀疏等挑战性条件下也展现出了良好的鲁棒性。
未来工作作者提到了更严格的特征可用性协议、更大的候选集评估、在线反馈实验以及多模态物品信息。这些方向都是冷启动领域真正实用的痛点——比如大规模候选下的排序效率、跨模态信息的对齐等。此外,将NMKFR的不确定性引导框架推广到其他推荐场景(如会话推荐、序列推荐)也是一个有前景的研究方向。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

NMKFR中的Titans具体是什么?和常见的Transformer有何不同?Titans是2025年NeurIPS上提出的一种新型序列模型,它把自注意力(有限上下文)和神经长期记忆(可读写)分开。本文用的是Titans的MAG(Memory as a Gate)形式,自注意力处理局部短语,记忆分支存储跨位置的复用语义。相比标准Transformer,Titans在长序列上更高效,且记忆可以独立于输入长度更新。在冷启动场景中,物品文本较短,但Titans的记忆机制允许模型在少量文本上建立更鲁棒的语义表示。具体来说,Titans的记忆模块通过一个可微的读写操作实现,能够在不增加序列长度的情况下存储和检索信息,这与Transformer需要维护整个上下文窗口的方式有本质区别。

后验协方差是如何计算的?在NMKFR中它起了什么作用?后验协方差Pt|t由卡尔曼滤波的更新步骤计算得出,公式为Pt|t = (I - KtH)Pt-(I - KtH)⊤ + KtRtKt⊤。它衡量了当前隐状态估计的不确定性。在NMKFR中,它的迹(trace)被用作不确定性信号:对当前时间步,调节ACFM中静态与动态特征的融合权重;对前一个时间步,反馈到FD-TSE的记忆检索中,当不确定性大时,模型更依赖当前token而非历史记忆。这种双重利用机制使得不确定性信息能够在模型的语义编码和特征融合两个层面同时发挥作用,形成了一个完整的自适应闭环。

论文的实验设置是否公平?论文报告了12个基线,覆盖了主要的冷启动方法,且所有模型共享数据拆分、候选集、历史限制和评估指标。但需要注意,论文使用的是采样的候选排名(1个正样本+100个负样本),而非全排序,这与真实生产环境的差距较大。此外,部分基线可能没有针对时间感知冷启动进行调整(如SASRec、BERT4Rec)。因此,结果倾向于NMKFR是合理的,但实际部署可能仍需更多验证。建议读者关注NMKFR在消融实验和鲁棒性分析中展现出的内部一致性,这些结果比绝对数值更能说明方法的有效性。

龙哥点评

论文创新性分数:★★★★☆

将Titans记忆编码与卡尔曼滤波状态估计结合用于冷启动推荐,并用后验协方差作为不确定性信号引导融合,思路新颖。虽然不是革命性突破,但在推荐系统领域属于巧妙且合理的创新。

实验合理度:★★★★☆

对比了12个代表性基线,涵盖主要方法类型。共享数据划分,消融实验完整。但采样排名协议和基线调优细节未充分披露(如SASRec/BERT4Rec是否针对冷启动优化),且未在大规模全排序上验证,扣一星。

学术研究价值:★★★★☆

为冷启动推荐提供了可解释的不确定性引导融合框架,卡尔曼滤波与记忆机制的混合具有理论推广潜力。未来可推广到多模态、在线学习等场景。

稳定性:★★★☆☆

后验协方差在训练和不同时间间隔下保持有界,数值稳定。但从鲁棒性实验看,在20% token噪声下Amazon NDCG@10从0.24下降到0.15,虽仍优于固定增益,但绝对下降幅度较大,实际输入质量敏感。

适应性以及泛化能力:★★★★☆

在两个数据集(电商、电影)上均表现良好,物品冷启动和时序冷启动两种协议都适用。但实验仅基于文本模态,对多模态场景的泛化未验证。

硬件需求及成本:★★★☆☆

模型包含Transformer、Titans记忆、卡尔曼滤波和融合模块,计算量较大。消融实验显示去掉任何组件都有较大下降,说明不能简化。训练和推理需要GPU。但卡尔曼滤波部分的计算开销较小(k=32维),主要成本在Titans编码器。

复现难度:★★★☆☆

论文未开源代码,对Titans的实现细节(如记忆更新公式、损失函数)描述较简略。卡尔曼滤波的噪声矩阵参数化依赖于“补充材料”,未提前充分公开。复现需要一定工作量。

产品化成熟度:★★☆☆☆

学术价值高,但离产品化较远。问题包括:采样排名协议与实际全排序差距大;未考虑推理效率;未在在线环境验证;训练依赖混合损失,调参复杂。可作为推荐系统冷启动模块的候选方案雏形。

可能的问题:作者在多处使用“best overall results”等表述,但MCP对比确认库中无同基准可验证,且采样排名协议比全排序更易获得高指标,读者应审慎解读。此外,Titans的引入是否必须(消融显示移除后仍有一定性能,尤其Amazon)值得商榷。论文对基线调优细节披露有限,可能高估自身优势。


主要参考文献

[1] Behrouz, A.; Zhong, P.; and Mirrokni, V. 2025. Titans: Learning to Memorize at Test Time. In NeurIPS 2025.
[2] Revach, G.; et al. 2021. KalmanNet: Neural Kalman Filtering with Learned Measurement Noise Covariance. In ICASSP 2021.
[3] Wei, Y.; et al. 2021. Contrastive Learning for Cold-Start Recommendation. In ACL 2021.
[4] Lin, X.; et al. 2024. Temporally and Distributionally Robust Optimization for Cold-Start Recommendation. In AAAI 2024.
[5] Liu, C.; Zeng, N.; Qu, Z. 2027. NMKFR: A Robust Framework for Time-Aware Cold-Start Recommendation. In AAAI 2027.

融会贯通

结合PaperDaily MCP已收录论文的同基准对比,当前库中在Amazon Video Games和MovieLens-32M数据集上,以及Time-aware Cold-Start和Item Cold-Start协议下,未检索到与NMKFR完全一致的评估设置(如同样的采样策略、负样本数、历史长度等)。因此无法通过库内已有数据严格验证NMKFR是否在所有对比方法中具有统计显著优势。但本文报告的消融、鲁棒性分析和内部诊断实验设计严谨,提供了合理的工程洞察。
读者在参考该结果时应注意:论文使用了采样的候选排名(1正+100负),这与工业界的全排序差距较大,且负样本中可能存在未交互的热门物品,会导致Recall虚高。此外,基线方法(如SASRec、BERT4Rec)若不做时间感知调整,其性能可能被低估。因此,NMKFR的优势更多体现在“同设置下的相对提升”,而非“绝对的工业级领先”。
从方法论角度看,NMKFR将卡尔曼滤波的后验协方差显式用于推荐系统的证据融合,这为后续研究提供了一个可扩展的范式——任何具有不确定性估计的序列模型(如贝叶斯RNN、概率状态空间模型)都可以类似地用于动态调节多源特征融合。这是本论文最有价值的启发。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
冷启明星途,谁指引方向?
后验协方差,融汇双模态。
想了解更多NMKFR的实战技巧和代码解读?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 推荐系统+重庆+西南大学+小刘),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。