← 返回 PaperDaily 大模型与智能体

一张嵌入管两用:推荐提升1.88%还可解释

这篇论文很实在:不跟你玩虚的,直接把金融网站的点击流拆成“可预测的嵌入”和“人能看懂的意图标签”。更妙的是,LLM 负责起名,小模型负责上生产,速度和效果都没掉链子。

一张嵌入管两用:推荐提升1.88%还可解释
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文很实在:不跟你玩虚的,直接把金融网站的点击流拆成“可预测的嵌入”和“人能看懂的意图标签”。更妙的是,LLM 负责起名,小模型负责上生产,速度和效果都没掉链子。


原论文信息如下:
论文标题:
From Clicks to Intent: Cross-Platform Session Embeddings with LLM-Distilled Taxonomy for Financial Services Recommendations
发表日期:
2026年06月
发表单位:
Capital One
原文链接:
https://arxiv.org/pdf/2606.26904v1.pdf

金融推荐新范式:从凌乱点击到清晰意图

金融服务里的推荐,最怕的不是“没数据”,而是“有一堆数据,但看不懂用户到底想干嘛”。网页上点了半天,可能是在比信用卡,也可能是在看贷款,甚至只是随手逛逛;一旦用户登录 App,系统又常常把前面那些浏览痕迹当成空气,重新从零开始猜。这个论文就专门盯住了这个尴尬点:把登录前的点击流,变成登录后的可用信号,而且还要同时满足两个要求:一边能做推荐,一边人还看得懂。
图1:系统整体架构图
图1:系统架构总览。左边是多模态点击流编码成会话嵌入,右边是聚类采样、迭代生成意图分类、标签分配与蒸馏的完整流程。简单说,就是先把“用户在网页上乱点”翻译成向量,再把向量翻译成人话。
这篇工作的关键词其实很直白:会话嵌入意图分类。前者负责“算得准”,后者负责“讲得明白”。论文里还顺手解释了几个常见缩写:LLM 是 Large Language Model,中文是“大语言模型”;Transformer 就是大家熟悉的 transformer 编码器;K-Means 是一种经典聚类方法,用来把相似会话先分堆,方便后续抽样;BCE 是 Binary Cross-Entropy,中文叫二元交叉熵损失,常用于多标签分类。
这类问题之所以难,不只是因为点击流长得像“用户的脚印”,更因为金融场景有个天然特性:登录前浏览往往比登录后行为更能暴露真实意图。用户还没登录时,可能在认真比较产品;登录后反而开始办事、查账、还款,信号变得更碎、更偏服务。论文的思路很妙:既然前面这段浏览最有价值,那就别浪费,直接把它变成可复用的“意图金矿”。

双重输出:一个嵌入,两种用途

本论文最核心的设计,不是单纯再堆一个更大的模型,而是把同一段点击流压成一个共享表示,再从这个表示里拆出两种输出:一种是给下游排序、预测用的稠密向量,另一种是给运营、分析、解释用的人类可读标签。说得接地气一点,就是“同一份作业,既要交给机器打分,也要交给人看得懂”。
第一条输出是会话嵌入。模型把每个页面浏览事件看成一个带属性的 token:页面标题、URL、停留时长、事件类型、页面内容等都被编码进同一个向量空间。这里有个很关键的细节:论文没有只看 URL 这种“地址标签”,而是把页面 HTML 抽出来,提取正文,再用预训练的句子编码器得到语义向量。这样一来,模型不只是知道“用户进了某个页面”,还知道“这个页面大概在讲什么”。这比只看点击位置聪明多了,毕竟网页不是路牌,用户也不是在做迷宫题。
每个事件的多个特征先分别嵌入,再拼接后送入一个多层感知机,随后加上位置编码,最后交给 transformer 编码整段会话。这里的逻辑很顺:特征先“各自说话”,再统一翻译成同一种语义空间,这样 transformer 才能在整段序列上做注意力建模。训练方式也很朴素:用自监督任务去预测下一个页面标题和 URL,或者预测被遮住的事件。没有人工标注也能学,特别适合点击流这种“量大但标签贵”的场景。
第二条输出是意图标签。光有向量还不够,业务同学看到“64维浮点数”大概率会沉默,分析同学看到“0.382、-1.07、2.91”也很难立刻知道用户到底在干嘛。于是论文引入 LLM 生成的意图分类体系,再把这些标签蒸馏成一个轻量分类器。这样就出现了很有意思的分工:LLM 负责起名字,轻量模型负责跑生产。大模型像博学的命名师,小模型像勤快的前台,前者想得明白,后者跑得飞快。

三步走意图金库:聚类采样、LLM构建、轻量蒸馏

如果把整套方法拆开看,最有意思的是后半段:怎么从海量点击流里,整理出一套既稳定又能解释的意图体系。论文没有直接让 LLM 对所有会话自由发挥,因为那样标签会像春天的野草一样乱长;也没有直接人工定义规则,因为金融页面变化太快,维护成本会把人逼疯。它采用的是一种更现实的路线:先聚类抽样,再让 LLM 生成和迭代意图分类,最后把这些标签蒸馏成小模型
第一步是聚类采样。论文对会话嵌入做 K-Means 或 HDBSCAN 聚类,然后按簇抽样,让 LLM 看到的不是随机碎片,而是覆盖更全面的行为分布。这里的“聚类”不是为了把用户永久分组,更像是一个抽样器:它负责把不同类型的会话分层送进 LLM,避免某些高频行为把低频但重要的意图淹没掉。这个细节很实用,因为真实业务里,用户行为分布从来都不均匀,随机抽样很容易抽成“常见动作大全”。
表1:主页卡片类别示例
表1:主页卡片类别示例。可以看到,登录后首页的卡片不只是“产品”,还包括旅行、购物、推荐奖励等不同业务入口,这也解释了为什么跨平台意图建模很有必要——用户前面看的内容,可能决定后面会点哪张卡。
表2:用户转化示例
表2:用户转化示例。这里的“转化”包括开信用卡、申请车贷、开通无纸化账单、预订旅行等,说明金融推荐的目标并不只是“点了什么”,而是“最后做了什么”。
第二步是 LLM 构建意图分类。论文采用的是迭代式生成流程:先给一小批会话,让 LLM 生成初始分类;再不断把新批次样本喂进去,要求它增删合并拆分这些类别;最后再做一次复核,检查是否覆盖完整、是否互斥、是否清楚。这个流程对应论文里提到的 TnT-LLM 思路,英文全称是 Topic-and-Taxonomy LLM(出处:TnT-LLM [21]),意思是用大模型迭代生成主题/分类体系。论文把这套思路迁移到点击流意图上,解决了“标签既要懂业务、又要能动态更新”的问题。
第三步是标签蒸馏。LLM 先给代表性会话打上多标签,并附置信度,然后训练一个轻量 MLP 去拟合这些输出。这里的蒸馏不是把大模型“复制一遍”,而是把大模型的判断逻辑压缩进一个能在生产里快速跑的学生模型。换句话说,LLM 负责“想清楚”,学生模型负责“想得差不多但快很多”。论文还特意把置信度作为软目标,等于告诉学生模型:别只学结论,也学一点老师的犹豫。这种做法通常比硬标签更稳。
表4:两种粒度下生成的意图示例
表4:两种粒度下生成的意图示例。比如“信用卡预审批”“信用卡权益”“借记卡信息”“存款利率比较”等,说明模型并不是在胡乱贴标签,而是在把真实会话中的细碎行为整理成可理解的业务主题。粒度更细时,分类会更丰富;粒度更粗时,则更适合做全局概览。
这套三步走流程的价值在于,它没有把“可解释性”当成额外装饰,而是从一开始就把它做成了系统的一部分。很多系统是“先把效果做出来,再想怎么解释”,最后解释层像临时贴的便利贴;这篇论文则是从表示学习阶段就为后面的标签体系留了接口,所以最后能同时服务推荐、分析和运营。

实战效果:推荐精准度飙升,推理成本狂降3000倍

实验部分最值得看的,不是某个单点指标,而是这套方法在两个业务任务上都能站得住:一个是登录后首页卡片排序,一个是用户转化预测。前者更像“推荐是不是更准”,后者更像“意图是不是更像人话且有业务价值”。论文的设计很稳:先用相同的下游模型框架,只替换输入特征,尽量把差异归因到表示本身,而不是模型结构偷偷帮忙。
表3:主页卡片排序任务的总体结果
表3:主页卡片排序任务总体结果。三种会话嵌入变体都优于基线,其中双向注意力加平均池化的版本最好,宏平均 Recall@1 提升 1.88%,Log Loss 下降 13.38%。这说明预登录会话里的顺序信息和语义内容,确实比简单的页面计数更有用。
为什么双向注意力会更好?因为这里做的是整段会话编码,不是流式一步步在线预测。既然完整会话都在手里了,那就没必要只看过去;让每个事件同时参考前后文,通常会得到更丰富的上下文表示。为什么平均池化又比最后一个隐藏状态更稳?因为会话最后一个动作未必最有信息,可能只是跳转、关闭、甚至“误触后迅速撤退”。平均一下,能减少“最后一脚踩空”的偏差。
表5:转化预测结果
表5:转化预测结果。手工特征明显不够用,蒸馏后的意图标签保住了大部分教师模型性能,而会话嵌入本身效果最好,微平均 F1 比 LLM 教师还高 4.3%。这说明稠密表示保留了更多原始信息,而意图标签则在可解释和高效之间做了很好的折中。
再看蒸馏结果,学生模型相对 LLM 教师只掉了 7% 左右的性能,却能直接在嵌入上推理,不用每次都调用大模型。论文给出的效率数字非常有冲击力:100K 条会话,Transformer 编码大约 60 秒,蒸馏后的 MLP 再花 0.009 秒,总计不到 61 秒;如果直接用 LLM 做逐条标签推理,单条 2 到 4 秒,串起来就是八十多个小时。这个对比不是“快一点”,而是从等外卖变成点外卖,量级差得相当离谱。
这里还有一个很实用的结论:LLM 标签并不是为了替代嵌入,而是为了补齐嵌入的“人类可读性”。如果目标是纯预测,嵌入更强;如果目标是给业务团队看、给分析师做分群、给运营做解释,蒸馏标签就非常合适。也就是说,这篇论文并没有硬拗“一个模型包打天下”,而是把任务分得很清楚:预测归预测,解释归解释,互相配合。

未来可期:迈向全场景的跨平台智能推荐

这篇论文最值得肯定的地方,在于它不是为了“炫技式解释”而解释,也不是为了“纯效果党”而把可解释性扔掉,而是把两者一起做成了可部署的系统。对于金融服务这种既要效果、又要审计、还要合规的场景,这种设计很对路。尤其是跨平台这一点很关键:网页端的探索意图,常常是移动端个性化的上游信号,能把这条链路打通,推荐系统就不再是“登录后再临时猜”,而是能沿着用户真实旅程提前布局。
当然,论文也诚实地承认了边界:它主要基于单一机构的金融网站数据,泛化到其他行业还需要验证;同时,意图分类虽然已经挺实用,但仍然依赖标签体系的持续维护。未来如果能把 taxonomy 自动更新做得更稳,再加上在线 A/B 测试验证真实收益,这套方法就会更像一个成熟产品,而不只是一个漂亮原型。
插图
如果把这篇工作的思路迁移到更一般的产品里,启发也很明确:当用户行为是长序列、且中间夹杂大量语义信息时,单纯做计数特征往往不够;而当业务又要求解释性时,最好不要把“解释”留到最后补课,而是直接把它设计进表示学习流程里。这样训练出来的系统,才更像能上生产的系统,而不是实验室里看起来很美的 demo。😊

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是金融服务里“登录前点击流很重要,但登录后系统经常把它忘了”的问题。论文把预登录网页点击流编码成会话嵌入,再把嵌入蒸馏成人类可读的意图标签,从而同时支持推荐和解释。

LLM 蒸馏出来的“意图标签”是什么意思?可以把它理解成给一段点击流贴的人话标签,比如“信用卡预审批”“借记卡信息”“旅行预订”等。LLM 先根据代表性会话生成这些标签,再训练一个轻量模型在嵌入空间里复现它们,方便大规模上线。

为什么会话嵌入比手工特征更强?因为会话嵌入不仅看“用户点了哪些页面”,还看“页面内容是什么、顺序如何、停留多久、事件类型是什么”。它把语义、顺序和行为一起编码了,所以比简单的页面计数更能捕捉真实意图。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把会话嵌入和 LLM 意图分类体系打通,思路不算“天外飞仙”,但把两个原本分开的方向拼成了可落地系统,组合创新很实在。

实验合理度:★★★★☆。下游任务选择贴近业务,且分别验证了排序和转化两类目标;不过数据来自单一机构,外部泛化还需要更多证据。

学术研究价值:★★★★☆。它把“可解释推荐”从口号变成了工程流程,对点击流建模、LLM 标签体系和蒸馏结合都有启发。

稳定性:★★★☆☆。嵌入本身较稳,但意图 taxonomy 仍依赖数据分布和持续维护,业务变化太快时需要再调。

适应性以及泛化能力:★★★☆☆。方法框架通用,但页面内容丰富、登录前后链路清晰的场景更适合;换到别的行业未必能原样照搬。

硬件需求及成本:★★★★☆。训练端有 transformer 和 LLM 参与,但上线端只需嵌入模型和轻量 MLP,成本控制得不错。

复现难度:★★★☆☆。核心思路清楚,但数据和业务链路是内部的,外部复现会卡在数据获取和标签定义上。

产品化成熟度:★★★★☆。蒸馏后的标签体系很适合生产环境,尤其适合推荐、分群和分析联动;前提是业务能接受 taxonomy 的持续迭代。

可能的问题:单机构数据验证,标签体系仍需人工复核;如果页面内容噪声大、跨端链路不完整,效果可能会打折。


主要参考文献

[1] Shelby D. Bernhard, Carson K. Leung, Vanessa J. Reimer, and Joshua Westlake. 2016. Clickstream Prediction Using Sequential Stream Mining Techniques with Markov Chains. IDEAS ’16.
[2] William Black, Alexander Manlove, Jack Pennington, Andrea Marchini, Ercument Ilhan, and Vilda Markeviciute. 2024. TRACE: Transformer-based user Representations from Attributed Clickstream Event sequences.
[10] Shuai Yuan et al. SASRec: Self-Attentive Sequential Recommendation.
[20] BERT4Rec: Sequential Recommendation with Bidirectional Encoder Representations from Transformer.
[21] TnT-LLM: Topic-and-Taxonomy Generation with Large Language Models.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。