← 返回 PaperDaily
大模型与智能体
Capital One新招:点击流蒸馏成意图,提升1.88%
金融推荐最难的地方,不是“看见了什么”,而是“没登录时到底想干啥”。这篇论文把点击流拆成可用的向量和可读的意图标签,既能提效果,又能撑解释,挺适合落地。
龙哥读论文
发布于 2026-08-14 21:47:10
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 金融推荐最难的地方,不是“看见了什么”,而是“没登录时到底想干啥”。这篇论文把点击流拆成可用的向量和可读的意图标签,既能提效果,又能撑解释,挺适合落地。
原论文信息如下:
引言
金融服务里的点击流,表面上是“点了什么”,本质上是“想干什么”。这篇论文抓住了一个很实用的问题:未登录网页上的浏览意图,不能一到登录就当场失忆。
文章上半部分子标题
文章下半部分子标题
### 文章上半部分子标题:为什么金融APP需要看懂你的“未登录”行为,创新!一个Transformer搞定“嵌入+分类”,三步炼成AI金融意图分类
### 文章下半部分子标题:效果与效率:5.5亿级规模下的最优解,总结与展望,龙迷三问,龙哥点评,参考文献
### 文章开头部分内容:
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
原论文信息如下:
金融推荐这件事,最容易被忽略的不是“用户点了什么”,而是“用户在登录前到底想干什么”。在电商和内容平台里,登录前后的行为往往还能勉强串起来;但在金融服务里,未登录网页常常是用户真正做功课的地方:查信用卡、比贷款、看利率、瞅福利,像极了在柜台前先把菜单翻烂了再点单。
问题是,很多系统一到登录就“失忆”了。未登录时的浏览轨迹、停留时长、页面顺序、内容语义,明明都在,却因为跨平台身份对齐麻烦、特征表达太粗糙,最后只能当作背景噪音。这篇论文的切入点很实在:把未登录点击流变成两样东西——一个能喂给推荐模型的会说话的向量 ,一个能给业务同学看的人话标签 。一个管效果,一个管解释,金融场景里这组合拳就很对味。
金融场景的“未登录行为”就像用户偷偷写在纸条上的真实需求,登录之后如果直接揉掉,推荐系统就只能靠猜。
这里先把几个缩写顺手捋一下,免得看着像在拆盲盒。LLM 是 Large Language Model,中文就是“大语言模型”;Transformer 还是那个熟悉的 Transformer;BCE 是 Binary Cross-Entropy,二元交叉熵;F1 是 Precision 和 Recall 的调和平均;R@K 是 Recall@K,意思是前 K 个结果里能不能把用户真正点的东西捞上来。
创新!一个Transformer搞定“嵌入+分类”
这篇论文最有意思的地方,不是又发明了一个花里胡哨的推荐器,而是把问题拆成了两个层次:第一层,先把原始点击流压成一个高质量的会话表示;第二层,再把这个表示翻译成可解释的意图标签。前者服务于预测,后者服务于分析,二者共享同一套底座,避免了“一个模型负责打分,另一个模型负责讲故事,结果彼此不认识”的尴尬。
如果只做向量,推荐分数可能不错,但业务方会问:这串数字到底在说啥?如果只做标签,解释性是有了,但信息损失也很容易把精度拉胯。论文的思路相当务实:先用自监督 Transformer 学一个“浓缩版用户意图”,再让 LLM 帮忙生成一套意图分类体系,最后把 LLM 的知识蒸馏进一个轻量分类器。这样一来,线上推理不用每次都请大模型出场,成本不会像开会一样一路膨胀。
三步炼成AI金融意图分类
本方法的核心流程可以理解成“三步走”,而且每一步都不是摆设。
输入是一个按时间排序的会话序列,每个事件不只是“访问了某页”,还带着停留时长、事件类型、页面内容等多种特征。论文没有偷懒只看 URL,而是把页面 HTML 抽取正文后,先用预训练句子编码器提取语义,再和离散特征的 embedding、位置编码一起送进 MLP 和 Transformer。这样做的好处很直白:页面语义不再只是冷冰冰的地址字符串,而是“这页到底在讲信用卡、贷款还是账户服务”。
训练方式也很符合工业场景:不依赖人工标签,而是做自监督学习。根据注意力方向不同,可以做下一事件预测,也可以做掩码重建。最终作者发现,双向注意力 + 平均池化 在效果上更稳,因为完整会话在推理时本来就是可见的,没必要把自己锁进“只能看过去”的小黑屋里。
如果直接把海量会话一股脑喂给 LLM,结果很可能不是“智能总结”,而是“随机背题”。所以论文先对会话嵌入做聚类,再从每个簇里抽样,尽量保证样本覆盖不同类型的行为。这里作者比较了 K-Means 和 HDBSCAN,最后选择了 K-Means,因为在轮廓系数、DBI 和 CHI 上更合适。说人话就是:先把用户行为分门别类,再让大模型见识一下“金融用户的众生相”,别只看见最常见的那一类。
这一招很关键。因为金融网站的意图往往不是单标签的,用户可能既在看信用卡福利,也在顺手研究利率,甚至还夹杂着防诈骗信息浏览。聚类在这里不是为了“最终定类”,而是为了给 LLM 做一个更均衡的采样器。换句话说,它不是裁判,是导游。
分类体系不是手工硬编的,而是通过“生成—更新—复核”的迭代流程得到。先让 LLM 基于一批会话提出初始意图集合,再根据后续批次不断合并、拆分、补充,最后做完整性和清晰度复核。这样得到的标签不是那种“看起来像分类,实际上全靠拍脑袋”的东西,而是尽量贴近真实行为分布的意图目录。
有了 LLM 产出的标签后,论文没有停在“让大模型打工”的阶段,而是把这些标签蒸馏进一个轻量 MLP。这个学生模型直接吃会话嵌入,输出每个意图的概率。训练时用的是 LLM 的置信度作为软目标,损失函数本质上还是按标签做 BCE,只不过不再要求学生死记硬背,而是学老师的判断边界。这样线上推理时就不需要再调用 LLM 了,速度和成本都友好得多。
效果与效率:5.5亿级规模下的最优解
这部分最值得看的是,它不是只在离线指标上“自嗨”,而是接了金融服务里真正有意义的两个任务:一个是移动端首页 tile 排序,一个是用户后续转化预测。前者看的是登录后首页上哪些内容更容易被点,后者看的是用户最终会不会申请信用卡、开通自动贷款、订阅无纸化账单等。也就是说,论文不是在玩数据集,而是在碰业务真问题。
在首页 tile 排序任务上,作者把会话嵌入作为额外特征加到基线 LightGBM 上。结果很清楚:三种嵌入版本都比原始基线更好,其中双向注意力 + 平均池化 最好,macro Recall@1 提升 1.88%,Log Loss 降低 13.38%。这说明会话嵌入确实补到了原有 CTR 和 site retargeting features 没覆盖到的那部分信息,而且不仅把“能不能捞到”做高了,还把“概率准不准”一起改善了。
更有意思的是,论文把“意图标签”和“原始嵌入”放在转化预测任务里做对比。结果显示,手工特征明显不够看;LLM teacher 的标签已经挺强;蒸馏后的学生模型能保住大部分性能;而会话嵌入本身 表现最好,micro F1 比 LLM teacher 还高 4.3%。这其实很合理:标签是对信息的压缩,向量才是原始信息的高密度载体。标签负责解释,嵌入负责上分,分工明确,谁也别抢谁饭碗。
效率上,这套方案也很像工业界会爱的那种“别跟我讲理想,先讲能不能跑”。直接用 LLM 给每个会话打标签,单条延迟是秒级,批量一大就容易把系统拖成慢动作回放;而论文里的做法是先把 10 万条会话编码成嵌入,再用蒸馏后的 MLP 批量推理,整体吞吐提升超过 3000 倍。注意,这不是单纯靠“模型小”换来的,而是把高成本的语言理解转移到了离线阶段,线上只保留轻量分类器。
从业务角度看,这种设计的价值在于:既能用会话嵌入做排序、转化预测、个性化推荐,也能用意图标签做用户分群、运营分析、策略解释。对于金融这种既要效果又要合规解释的行业,这种“双产出”路线比单纯追求一个分数更像正经方案。
总结与未来展望
这篇论文最值得肯定的,是它没有把“解释性”和“效果”当成二选一,而是用同一套会话表示把两者串了起来。对金融推荐来说,这种思路很接地气:前端需要能用的排序特征,运营需要能读的意图标签,风控和合规则需要能追溯的行为语义。把点击流从“日志”升级成“意图”,这一步很实用。
不过它也有边界。首先,实验主要来自单一机构的金融网站,跨行业泛化还需要验证;其次,意图分类体系虽然经过人工复核,但随着产品变化、页面改版、活动策略变动,标签体系也得跟着更新,不然很容易“今天的分类,明天就过时”。最后,蒸馏后的轻量模型虽然很快,但它毕竟是在压缩信息,遇到特别复杂、特别稀有的行为模式时,可能还是不如原始嵌入灵活。
如果继续往前走,比较自然的方向有三个:一是把意图从会话级扩展到用户级,做长期兴趣建模;二是把 taxonomy 做成持续更新的动态体系,减少人工维护;三是进一步做在线 A/B 测试,真正验证它对业务指标的影响。毕竟离线分数再漂亮,最后还是得回到线上看真刀真枪的表现。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是金融服务里“未登录浏览行为难以被利用”的问题。论文把未登录点击流编码成会话嵌入,用于排序和转化预测,同时再把同一批行为蒸馏成可解释的意图标签,兼顾效果和解释。
文中的“意图分类体系”是什么意思? 可以把它理解成一套金融浏览行为的“标签字典”。比如信用卡、贷款、账户服务、旅行奖励等大类下面,还能继续细分成“信用卡预审批”“信用卡权益”“车辆搜索”这类更具体的意图,方便机器理解,也方便人看懂。
为什么会话嵌入比蒸馏标签更强? 因为嵌入保留的信息更多。标签是把复杂行为压缩成有限类别,适合解释和分析;嵌入则保留了更细的序列顺序、语义和上下文,所以在下游预测任务上通常更强。这也是论文“双输出”设计的核心逻辑。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。把会话嵌入和 LLM 蒸馏意图体系拼在一起,思路不算玄学,但组合得很实用,尤其适合金融推荐这种既要预测又要解释的场景。
实验合理度: ★★★★☆。任务选得贴近业务,基线也比较清楚,既看排序又看转化,能比较全面地验证表示学习和蒸馏的价值。
学术研究价值: ★★★★☆。它把“行为表示学习”和“LLM 生成 taxonomy”连成一条线,对工业推荐和可解释建模都有启发。
稳定性: ★★★☆☆。嵌入模型本身较稳,但 taxonomy 和蒸馏效果会受页面变化、业务漂移影响,仍需持续维护。
适应性以及泛化能力: ★★★☆☆。方法框架通用,但当前验证集中在金融服务单域,迁移到别的行业还要重新校准 taxonomy 和特征。
硬件需求及成本: ★★★★☆。离线阶段需要 Transformer 和 LLM 参与,但线上蒸馏后推理很轻,成本控制得不错。
复现难度: ★★★☆☆。思路清楚,但涉及内部点击流、跨平台对齐和页面语义抽取,公开复现门槛不低。
产品化成熟度: ★★★★☆。如果有稳定的点击流埋点和身份链接,这套方案很适合落到推荐、分群和解释分析里。
可能的问题: 标签体系会随业务变化而漂移,且单域数据上的提升未必能原样复制到别的行业,落地前还得做持续监控和再训练。
主要参考文献
Dianjing Fan, Yao Li, Kyaw Hpone Myint, Dwipam Katariya, Alexandre Day, Pranab Mohanty, Giri Iyengar. From Clicks to Intent: Cross-Platform Session Embeddings with LLM-Distilled Taxonomy for Financial Services Recommendations. arXiv:2606.26277v1, 2026.
S. D. Bernhard et al. Clickstream Prediction Using Sequential Stream Mining Techniques with Markov Chains. IDEAS 2016.
W. Black et al. TRACE: Transformer-based user Representations from Attributed Clickstream Event sequences. 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群