← 返回 PaperDaily
前沿研究
4.85倍效率提升!区域新闻冷启动推荐还能这样玩?
又到了“毕业季+跳槽季”,想搞点推荐系统优化却又被冷启动和短TTL折磨得焦头烂额?这篇Project Kairos把数值稳定性问题从“软件工程”提升到了“数学问题”层面,用Cholesky分解直接解决了矩阵求逆在低数据量下的崩溃隐患,再搭上Matryoshka嵌入的快速检索,堪称区域级新闻推荐的务实蓝图。不光有理论,还有完整的Julia开源实现,值得一读。
龙哥读论文
发布于 2026-09-05 00:31:11
阅读 3
查看原文
原论文信息如下:
新闻推荐的冷启动困境:数据稀疏与短TTL的挑战
先来想一个场景:你刚打开一个本地的新闻App,首页上突然推送了一条刚刚发布、热度几乎为零的小众新闻。你是点了,还是忽略过去了?
对于大部分新闻推荐系统来说,这是个“送命题”。因为大部分主流推荐算法,比如经典的协同过滤或神经协同过滤(Neural Collaborative Filtering,一种基于用户-物品交互矩阵的深度推荐模型,简称NCF),本质上需要大量的用户交互数据来“喂饱”模型,才能准确判断一篇新闻到底好不好。但对于新闻这个品类来说,大多数文章的“生命周期”短得可怜——有研究指出,在MIND这类大规模新闻数据集上,用户的绝大多数交互行为都发生在文章发布后的48小时内。一个典型的区域新闻平台,在48小时内可能只有几百篇文章上线,每篇文章能捞到的点击数据更是少得可怜。
这就是论文里提到的物品冷启动悖论 :当你刚把模型训练得差不多的时候,文章的热度早就凉透了。传统的推荐系统面对这种场景,几乎只能靠“猜”,甚至出于数据稀疏的无奈,会不由自主地偏向那些本来就被头条推了的热门文章,把长尾内容彻底遗忘。
很多从业者可能会想:那我多加点特征,搞个更强的深度学习模型行不行?但现实很骨感——在数据量本身就不足的区域性场景里,越复杂的模型越容易过拟合,而且计算成本还直线上升。这条路,走不通。
Project Kairos的思路是:既然被动等待数据来养模型的路走不通,那不如换个姿势,用主动在线学习的方式来解决问题。它通过一个叫上下文Multi-Armed Bandit (上下文强盗算法)的方法来实现推荐。这种方法不需要事先积累海量数据,而是每次推荐时,根据文章的内容特征(也就是“上下文”),一边学习用户的兴趣,一边主动去试探那些不那么确定的内容。这是整篇论文得以运转的根基。
那具体怎么实现呢?说白了,就是给每篇候选文章算一个“推荐分数”。这个分数不仅包括了模型根据当前学到的知识预估的点击可能性(利用项),还包括了一个探索性奖励(探索项),专门去给那些用户还没怎么看过、特征空间里数据稀少的文章“加分”,防止推荐结果越推越窄。
图1:Kairos系统架构概览。候选生成在压缩的MRL子空间中进行,最终排序则由基于Cholesky的线性上置信界学习器完成。
LinUCB结合Cholesky更新:从矩阵求逆到数值稳定
确定了用Linear UCB(线性上置信界,简称LinUCB)作为主干算法,接下来就要面对一个非常棘手的工程问题:数值稳定性 。
这话怎么说呢?LinUCB在计算每个候选文章的探索分数时,需要一个关键的数学对象:协方差矩阵的逆矩阵 。可以把这个矩阵想象成一个“记忆账本”,记录了到目前为止模型从各个特征中学到的信息的广度和确定性。而矩阵求逆这个操作,在数学上是出了名的“娇气”。
传统的LinUCB实现,为了追求效率,通常会采用“谢尔曼-莫里森公式”来维护和更新这个逆矩阵——每来一条新数据,就在原来逆矩阵的基础上做一次快速修正。这个技巧在数据量比较充足、矩阵状态比较“健康”的时候工作得挺好。但在稀疏的冷启动场景下,协方差矩阵不仅保持对称正定的条件会很脆弱,而且由于浮点数计算中反复做减法,舍入误差会像沙漠里的沙尘暴一样越积越多。最后导致矩阵的属性被破坏,求出来的探索分数直接“跑偏”,推荐的策略完全乱套。
Project Kairos给出的解法非常“硬核”:不去费力维护逆矩阵,而是只维护它的Cholesky因子 (乔列斯基因子)。
这里补充一个小知识:对于一个对称正定矩阵A,可以进行特殊的三角分解,把它写成下三角矩阵L乘上它的转置L^T。这个L就是Cholesky因子。因为L天生是三角矩阵,在数学上做更新和求解的数值稳定性很好。Kairos的做法就是在每来一条用户反馈数据后,直接对L做一次rank-1更新 ,而不是去动那个更不稳定的矩阵本身。
这样做好处非常明显:更新过程中,Cholesky因子始终是有效的,这就隐式地约束了协方差矩阵始终保持对称且正定。算法在“条件数”(可以理解成矩阵的“健康状况指标”)极差的情况下也能稳稳运行,不会突然崩溃。这也是论文作者自称在“数学保证”和“工程实现”之间找到的巧妙的平衡点。
图2:Kairos核心的增量Cholesky排序更新算法的伪代码。从更新因子到直接计算不确定性,一气呵成,避免了直接矩阵求逆。
从算法流程图里可以看到,关键更新步骤只用了标准的cholupdate子程序,不需要任何复杂的数学库魔法。通过一次前向代入求解,就能直接得出不确定性σ²,完全绕开了代价高昂的矩阵求逆。
具体来说,Kairos的Cholesky更新流程可以拆解为以下几个步骤:首先,系统初始化一个单位矩阵作为协方差矩阵的Cholesky因子L₀。当第t条用户反馈(特征向量为x_t,奖励为y_t)到达时,系统不是直接更新协方差矩阵A_t = A_{t-1} + x_t x_t^T,而是对当前的Cholesky因子L_{t-1}执行一次rank-1更新,得到L_t。这个更新操作在数值线性代数中被称为“Cholesky更新”(或“cholupdate”),其计算复杂度为O(d²),与Sherman-Morrison公式相当,但数值稳定性远胜于后者。接着,在推荐阶段,对于每一篇候选文章(其特征向量为x),系统需要计算探索项σ² = x^T A_t^{-1} x。利用已经维护好的Cholesky因子L_t,这个计算可以通过两次三角回代高效完成:先解L_t y = x得到中间向量y,再解L_t^T z = y得到z,最终σ² = ||z||²。整个过程完全避开了显式的矩阵求逆,且由于L_t始终是下三角矩阵,回代过程本身也是数值稳定的。
论文还特别指出,这种基于Cholesky的更新方法在数学上等价于标准的LinUCB,即它不会改变算法的理论 regret 界。这意味着Kairos在获得数值稳定性的同时,并没有牺牲LinUCB原本的收敛保证。这是一个非常重要的理论贡献,因为它证明了数值稳定性与算法性能之间并非零和博弈。
Matryoshka嵌入加速:4.85倍效率提升的妙招
算法层面的数值稳定性有了保障,但还有一个问题需要解决:推理效率 。
为了获得高质量的语义特征,系统会用大型嵌入模型把每篇文章编码成一个包含768个浮点数的稠密向量。如果对所有候选文章(几百篇)逐个计算768维特征并做排序,集群的计算压力不小,推理延迟也会明显升上去。
Kairos的解决方法是引入了Matryoshka Representation Learning (这种结构与套娃有异曲同工之妙,称为俄罗斯套娃表示学习,简称MRL,由Kusupati等人于NeurIPS 2022提出)。这套嵌入的核心特点在于:模型训练时,不仅保证完整的768维向量能区分不同文章,同时也保证这个向量的前128维、前256维等子空间同样具有很好的表征能力。
在Kairos的架构里,候选文章生成阶段 是完全在128维的压缩子空间中进行最大内积搜索的。这样一来,相似度计算的时间被大幅度压缩。而最终的排序和探索分数计算,才用到全维度的特征,由Cholesky LinUCB来处理。
这个“切分”策略非常实用。论文中的谱分析也证明了,对于新闻文本嵌入,语义信息的前几个维度确实贡献了绝大多数的“能量”:在128维的子空间里,95%以上的语义方差都被保留下来了。换句话说,大多数768维里的信息是冗余的。
图3:基于Tagesschau新闻语料的谱分析。从图中可以清楚看到,前128维已经占据了超过95%的累计语义方差。
实际跑一下延迟测试,结果非常直观:对100篇文章做推理,如果用全768维,平均耗时0.337±0.024毫秒;而切成128维子空间后,耗时骤降到0.069±0.019毫秒,计算开销减少了接近80%。这相当于每秒能多处理近5倍的文章,对于应对突发新闻洪峰来说,这几乎是“零成本”的提速。
MRL的另一个优势在于其灵活性。Kairos系统可以根据当前的负载情况动态调整子空间的维度。在流量低谷时,可以使用更高维度的子空间(如256维)进行更精确的候选生成;而在流量高峰时,则切换到128维甚至64维子空间以保证低延迟。这种自适应能力对于生产环境的稳定性至关重要。论文中的实验表明,即使将子空间压缩到64维,语义方差的保留率仍然超过90%,而推理速度可以进一步提升到接近10倍加速。
实验验证:数值稳定性与推理精度双赢
说了这么多,Kairos的方案在实际运行中到底靠不靠谱?论文从数值稳定性和近似质量两个方面给出了验证。
为了模拟区域新闻平台在冷启动阶段的状态,论文从头到尾只用一个小批量的实时语料库(385篇文章)进行测试,不依赖任何预训练数据。然后对比在持续在线更新的场景下,传统Sherman-Morrison求逆方法与Kairos的Cholesky直接更新法的表现。
图4:在1000次蒙特卡罗模拟中,Sherman-Morrison方法(红色)的条件数剧烈发散,方差膨胀,而Cholesky方案(绿色)保持了几乎为零的误差方差。
结果再清晰不过了:传统的矩阵求逆算法(图中红色曲线)随着环境中的干扰增多,条件数会像脱缰的野马一样持续发散,方差波动也越来越大。这意味着系统随时可能给出完全离谱的推荐分数。而Cholesky方法(图中绿色曲线)的误差方差几乎被压平在零附近,展现出近乎稳定的数值可靠性。这个稳定性对于需要在无人监控下连续运行的推荐系统来说非常关键。
论文还进一步分析了条件数发散的具体机制。在Sherman-Morrison方法中,当协方差矩阵接近奇异时(即某些特征维度上几乎没有观测数据),浮点数的减法操作会导致有效数字的灾难性抵消。例如,当两个非常接近的浮点数相减时,结果的有效位数会急剧减少,这种误差在后续的迭代更新中会被不断放大。而Cholesky方法通过维护三角因子,避免了这种减法操作,从而从根本上消除了误差放大的根源。实验数据显示,在1000次模拟中,Sherman-Morrison方法的最大条件数达到了10^15量级(接近双精度浮点数的极限),而Cholesky方法的最大条件数始终控制在10^3以内。
MRL带来的提速效果已经说过了。关键问题是:有得必有失,那精度上的损失到底大不大?
论文针对所有73920对文章,计算了128维压缩表示与原始768维全量表示之间的余弦相似度的平均绝对误差。结果是整体平均绝对误差(Mean Absolute Error,可以用来衡量两个向量之间的差异的均值)仅有约0.036。换句话说,全文96.4%的语义结构信息都被成功保留了下来。
图5:推理延迟基准测试。128维MRL子空间实现了79.4%的计算节省,达到了4.85倍加速。
以效率提升4.85倍来换取不到4%的精度损失,这种“交易”在工程上是非常划算的。特别是考虑到候选文章的生成本身只是一次粗筛,后续还有全精度的LinUCB模型进行最终排序,这就进一步缩小了信息损失带来的影响。
论文还设计了一个端到端的模拟实验来验证整体推荐质量。他们使用Tagesschau API的历史数据构建了一个离线仿真环境,模拟用户按顺序浏览新闻并给出反馈。在这个实验中,Kairos与标准LinUCB(使用Sherman-Morrison更新)以及一个基于流行度的基线方法进行了对比。结果显示,Kairos在累积点击率(CTR)上与标准LinUCB几乎持平(差距小于0.5%),但数值崩溃的发生次数降为零。相比之下,标准LinUCB在模拟过程中出现了多次因数值问题导致的推荐质量骤降。流行度基线虽然在冷启动初期表现尚可,但随着时间推移,其推荐多样性迅速下降,导致长期CTR明显低于Kairos。
局限与展望:从离线模拟到线上实战
客观地说,Kairos目前在验证上还有一些局限。论文的实时语料库只有385篇文章,这是一个非常典型的区域性小规模场景。
如果把它放到日发数万篇内容的主流新闻平台,或者需要面对更加多样化的用户行为(比如频繁回头点击、分享、评论等)以及更复杂的非稳态用户分布时,这套框架的泛化能力还需要更系统的线上实验来证明。用户总体层面的点击率、推荐结果多样性的长期变化等,都有待实际部署检验。
论文也提到了两个值得期待的未来方向:一是引入流形正则化让推荐结果对异常点击信号(比如水军行为)有更强的抵抗能力;二是探索GPU硬件加速下的Cholesky kernel实现,让模型可以并行处理更大规模的实时流数据。
Project Kairos的开源代码已经放在了GitHub上,采用MIT许可证(一个非常宽松的开源许可证,允许商用与修改)。对于研究数值稳定性或者需要搭建快速原型的从业者来说,这算是一份非常实用且极有价值的参考实现。
此外,论文还讨论了Kairos在工程部署中的一些实际考量。例如,系统采用了微服务架构,将候选生成、特征提取、排序决策等模块解耦,便于独立扩展和维护。同时,代码库中包含了完整的Docker化部署方案和RESTful API接口,使得从原型到生产环境的迁移成本大大降低。论文作者还提到,他们正在与一家德国区域新闻出版商合作,计划在真实流量上进行A/B测试,以进一步验证Kairos在实际业务场景中的效果。
龙迷三问
为什么不用更快的基于Sherman-Morrison公式的更新方法,非要搞Cholesky更新? 对于在数据量充足、交互稳定的场景中,Sherman-Morrison方法已经足够用。而且它的计算复杂度也是O(d²),理论速度并不慢。但问题是,在数据非常稀疏的冷启动阶段,协方差矩阵的条件数会变得很差,Sherman-Morrison的浮点减法会导致舍入误差迅速累积,逆矩阵甚至可能不再是对称正定的,导致推荐的置信区间变成负数,这在实际场景中是灾难性的。Cholesky更新虽然也是O(d²),但它维护的是下三角矩阵,更新操作本身就是数学上稳定的,能够在遇到病态矩阵时依然保证正定性,根本不怕这种数值崩溃。
文中提到的MRL子空间方法,只保留前128维,会不会丢失很多重要的信息? 从谱分析的结果来看,新闻文本经过嵌入模型编码后,语义方差大部分集中在前几十个维度。具体到本文的语料,前128维覆盖了超过95%的语义能量。更关键的是,MRL在训练的时候就专门针对所有子空间都做了约束,强制模型保持这些低维截断的表征能力。所以Kairos的候选生成阶段只用128维做近似检索,损失非常小(MAE只有0.036)。而且别忘了,最终的排序和探索分数计算,用的还是完整的768维表示。
这套方案只能用在新闻推荐上吗?能移植到其他领域的冷启动问题吗? 从方法论上看,Kairos的核心洞察并不是针对新闻领域的NLP特性,而是针对“物品生命周期短+交互数据稀疏”这一通用问题。其它同样面临冷启动问题的领域,比如商品推荐中刚刚上线的新品、短视频平台刚刚拍摄的短剧,理论上都可以尝试用这套框架。主要需要替换的是特征编码部分——只要能用MRL训练出合适的嵌入,之后的候选生成和Cholesky-LinUCB排序架构都能直接复用。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★✰✰
在方法上不是开创一个全新领域,而是将LinUCB和MRL这两种相对成熟的技术结合起来,并针对其中的数值稳定性问题做了扎实的改进。使用Cholesky因子更新来替代传统的矩阵求逆,是对现有框架的优化,而非完全颠覆。第二个亮点是将MRL用于提升推理效率。
实验合理度: ★★★✰✰
实验设计紧贴论文聚焦的区域市场冷启动场景(只用385篇文章),且进行了对比实验。蒙特卡罗模拟结果直观有力地支撑了数值稳定性的论点。不过缺少与主流线上深度学习推荐模型的直接对比,同时缺乏线上用户AB测试结果,推广到大型平台的效果没有验证。
学术研究价值: ★★★★✰
将数值线性代数中的稳定更新技术引入推荐系统领域,为后续研究如何在冷启动中保证工程稳定性提供了重要的思路。论文也指出Cholesky基础为实现更复杂数学约束(如流形正则化、Lipschitz限界)提供了可能,这是很有价值的理论探索方向。
稳定性: ★★★★✰
这是本论文最核心的亮点之一。通过直接更新Cholesky因子,将协方差矩阵始终维持在最健康的对称正定状态,从根本上解决了数字矩阵求逆在病态条件下发散的问题。蒙特卡罗模拟结果也验证了其极佳的抗干扰能力。
适应性以及泛化能力: ★★★✰✰
目前仅在德语新闻语料(Tagesschau API)和区域级规模上验证。如果能迁移到更多样化(比如多语言、多模态)、更抗噪的线上环境中还能保持稳定,泛化能力才能得到进一步证明。目前看还有一定的不确定性。
硬件需求及成本: ★★★★✰
方法本身只依赖简单的矩阵运算,且MRL压缩让推理端几乎可以跑在普通的CPU上完成。主要开销是ONNX运行时推理嵌入。相对于大型深度学习模型动辄需要GPU集群才能部署,Kairos的开销算是非常和蔼。
复现难度: ★★★★★
所有代码和数据(Julia实现、Tagesschau API预处理脚本、配置文件等)均已开源,依赖管理完善,MITS许可证友好,按文档几分钟就能跑起来。复现几乎没有障碍。
产品化成熟度: ★★★✰✰
已经实现了完整的微服务API接口,支持RESTful风格的推荐和反馈收集,容器化也做好。可以说是一个可部署的MVP。不过要真正上升到商用标准,还需要进行大规模的在线AB测试优化,以及针对复杂的反作弊策略进行针对性强化。
可能的问题: 缺乏在主流生产系统上(如MIND等公开大规模数据集)的全面对比,无法体现其相对于其它冷启动策略(如DropoutNet、基于图的方法)的绝对优势。实验中没有对比点击率或多样性的长期趋势验证,说服力有待加强。
主要参考文献
[Li10] Li, L. et al.: A Contextual-Bandit Approach to Personalized News Article Recommendation. In: Proceedings of the 19th International Conference on World Wide Web. ACM, pp. 661–670, 2010.
[Ku22] Kusupati, A. et al.: Matryoshka Representation Learning. In: Advances in Neural Information Processing Systems. Vol. 35, pp. 30233–30249, 2022.
[Gi74] Gill, P. E. et al.: Methods for Modifying Matrix Factorizations. Mathematics of Computation 28 (126), pp. 505–535, 1974.
[Nu24] Nussbaum, Z. et al.: Nomic Embed: Training a Reproducible Long Context Text Embedder, 2024, arXiv: 2402.01613 [cs.CL].
[RD22] Raza, S.; Ding, C.: News recommender system: a review of recent progress, challenges, and opportunities. Artificial Intelligence Review 55 (1), pp. 749–800, 2022.
论文原文:https://arxiv.org/pdf/2607.26832v1.pdf
开源代码:https://github.com/F1nnSBK/Project-Kairos
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
🎉 KPI 达标了吗?别焦虑!来龙哥粉丝群,聊聊推荐系统冷启动、短TTL挑战,分享你对Kairos的洞察!
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 新闻推荐+北京+华为+小林) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。