← 返回 PaperDaily
大模型与智能体
GPT-4.1给推荐系统暖启动:线上180万用户实测CTR涨9.51%
这篇来自NAVER WEBTOON的工业界论文,把大语言模型从“在线排序器”降级成了“离线先验估计器”,用GPT-4.1从评论文本里提炼贝叶斯先验给Thompson采样暖启动。真实线上A/B/C测试近180万用户,冷启动10-49印象桶CTR涨了9.51%,还顺手揭示了一个反直觉现象:内容先验降CTR却升CVR。想抄作业的做推荐的都该看看。
龙哥读论文
发布于 2026-08-29 00:20:02
阅读 6
查看原文
原论文信息如下:
冷启动推荐为何难?当新评论没有点击历史时,多臂老虎机如何破局
在韩漫平台Webtoon上,用户面对的是大约4000部连载作品,口味千差万别——有人看画风、有人看叙事节奏、有人专门吃角色感情线。为了帮读者在“一秒定生死”的浏览阶段快速判断一个作品对不对味,平台上线了一个评论推荐组件,把其他读者写下的评论直接推到作品封面附近的推荐位上。一条评论的文案,往往比标题和封面更能透露一部作品到底值不值得追。
但这里有个很现实的问题:评论推荐组件是全新上线的,系统能看到的候选评论里,大量评论的展示次数和点击次数都接近于零。这种“啥数据都没有还硬要推荐”的局面,就是推荐系统里大名鼎鼎的冷启动问题。评论本身又是短文本,不像作品有丰富的元数据可供建模,新评论之间几乎没有任何行为历史可以共享,冷启动难度直接拉满,龙哥看着都替平台头疼。
那传统的在线学习算法能不能顶上?多臂老虎机框架(Multi-Armed Bandit,MAB)是个经典答案。想象一排老虎机,每台的吐钱概率不同但未知,玩家需要一边探索新机器、一边利用已知最好的机器,来最大化总收益。在推荐场景中,每条评论就是一台老虎机,用户的点击就是吐出的硬币。Thompson采样(汤普森采样,Thompson Sampling)是这家族里最优雅的选手之一:它为每台老虎机维护一个Beta分布(贝塔分布)来刻画点击率的不确定性,每次推荐前从每个分布里抽一个样本,把样本值最大的K条评论推给用户;看到点击反馈后,再更新这个分布。点击多了,分布就往高处集中;一直没人点,分布就老实蹲在低位。
但Thompson采样也有个天生的软肋:新评论入场时,它的Beta分布只能从均匀、无信息的默认状态开始,前期的每一次推荐都像在黑夜里盲射。冷启动阶段的试错成本高得让人心疼。要破局,就得给这台“老虎机”塞一点初始情报。而这些情报,恰恰就藏在评论文本本身里——一条评论写得好不好、适不适合某类人、能不能传递作品的独特气质,从文字上就能看出七八分,根不需要等点击数据来填空。
这就引出这篇论文的核心思想:为何不用大语言模型(Large Language Model,LLM)把评论文本转换成贝叶斯先验(Bayesian Prior),直接给Thompson采样做“暖启动”?这个思路听着顺理成章,但真在一家大型内容平台上线跑四星期,还要跟“温和的随机对照”正面硬刚,就不是随便说说那么轻松了。
用大模型给老虎机“暖启动”:从评论文本中提炼贝叶斯先验的两条技术路线
先把问题形式化。每个推荐请求都关联一个用户分群 s = (g, a),其中g表示性别(男性/女性),a表示年龄分组(≤17、18–27、28–37、38+两个性别乘四个年龄段,一共八个分段)。平台按“性别×年龄”这个粒度来维护行为统计,既不细到个人导致数据碎片化,也不粗到全体抹平差异。
对某条评论i和分段s而言,一次展示的奖励被定义为“是否被点击”的二值变量。系统假设评论i在分段s中的点击概率θ服从Beta分布(贝塔分布),服务时从该分布抽取一个样本,再按样本值大小取Top-K条展示(K=10)。这个过程是Thompson采样的标准操作。
本论文的加工重点,在于如何初始化这个Beta分布。整个LLM先验构造被拆成三步走。
第一步,估算基础分(Base Score)。 系统要求GPT-4.1给每条评论打一个“CTR-like”的基础分,反映这条评论对初次读者的一般吸引力。评分标准很直接:简洁、秒懂、情绪有张力的评论得分高;流水账、日记体、过度依赖圈内黑话的评论得分低。基础分被校准在[0,1]区间,大多数评论落在0.10到0.30之间,强钩子评论能到0.30到0.50,超过0.50的属于凤毛麟角。
第二步,引入两种可选的修正信号。 第一种是性别先验(Gender Prior):Prompt要求LLM输出一个区间在[−0.35, 0.40]的性别亲和力增量ΔF和ΔM,表示这条评论对女性、男性读者的相对吸引力。这个信号被刻意设计成“弱信号”,只用它校准冷启动阶段的分段差异,并不对具体用户做刻板假设。第二种是内容先验(Content Prior):先让LLM阅读一个作品标题下的全部候选评论,提炼出五个能代表这部作品核心看点的主题;再用另一个Prompt给每条评论打分,判断它在多大程度上表达了一个或多个主题,输出一个非负增量ΔT∈[0,1]。这样,“这部作品独特气质是什么”这个抽象问题,就被转换成了一条条具体可比的评论得分。
第三步,把基础分与修正量叠加,再转换成Beta伪计数。 以内容先验为例,先验均值μTi = clip(bi + λTΔTi, 0, 1),其中bi是基础分,λT是缩放系数(论文中取1.0)。性别先验的均值结构类似,只是按分段性别取对应的Δ,且λG取2.0。
换算成Beta参数时,论文用κ表示先验强度(伪展示次数),取κ=40,从而得到α0 = 1 + round(κμ)和β0 = 1 + round(κ(1−μ))。
为什么κ取40?这数字不是拍脑袋定的。线上评论的7日中位展示次数只有12次,75分位约40次。κ=40意味着先验的权重相当于“40次伪曝光”,对大多数评论而言,在冷启动阶段先验一直占据主导;等评论跑到曝光量的上半区,真实行为数据的分量才逐渐追上来,形成“先验领跑、数据接管”的平滑过渡。
在线上的正式实验里,论文围绕这两条路线设计了三个变体:变体A用均匀先验做对照(α=β=1),变体B用性别先验,变体C用内容先验。后验更新每小时执行一次,滚动7天窗口,按分段独立聚合最近7天的曝光和点击数据,再与先验参数相加得到后验参数。这样一小时内能看到新反馈,但不会因为偶发波动把分布搅得乱七八糟。表2汇总了三个评分模块的配置,表3展示了简化的Prompt模板结构。
整个管线分成离线和在线两段:离线阶段用GPT-4.1对全部新晋评论批量打分,生成先验表,每天凌晨对新增或变更的评论增量重跑一次;在线阶段每小时聚合曝光与点击日志,套用后验更新公式刷新参数。离线管线还带校验机制——如果检测到先验表里缺了标题或评论覆盖率丢失超过1%,就拒绝发布新表,继续沿用上一版,绝不让不完整的LLM输出悄悄影响线上服务。这个“宁可停更也不带病上线”的工程细节,值得不少团队抄作业。
在线实验全解剖:CTR不涨反降背后,内容先验如何变成“筛选器”
实验是在真实线上环境跑的四星期A/B/C测试,三个变体各分配约59.5万用户,分析窗口固定在2026年3月7日到4月3日。候选评论不是从全库抽的,而是来自上游“新作推荐模型”给每个用户挑出的50部作品标题,评论推荐组件只在这50个标题的候选池里选10条展示。注意,所有候选评论上线前都经过人工筛选,这意味着即使是对照组(均匀先验),候选池本身质量也不差——LLM先验要在这种“本来就不弱”的基线上跑出增量,难度比从零开始更大。
第一眼看上去有点令人失望:性别先验(变体B)的CTR只涨了+1.48%,CVR涨了+1.23%,方向都正确,但都没达到统计显著(p值分别为0.144和0.082)。内容先验(变体C)更扎眼——CTR显著下降了−5.68%(p<0.001),但CVR反而上升+1.37%(p=0.054)。
怎么大模型精心给的先验,点击率反而还跌了?把推荐漏斗摊开想一步就通了。CTR衡量的是“点击/曝光”,即即时吸引力;CVR衡量的是“点击后阅读/点击”,即内容匹配的深度。内容先验偏爱那些能把作品核心看点讲清楚的评论,这类评论本身就是一把“筛子”——它把真正对味的读者筛进来,同时对没那么感兴趣的用户施加了某种劝退效果。于是曝光转化为点击的比例下降,但留下来点进去的人阅读转化率更高。论文将这种“CTR降、CVR升”的组合称为自选择过滤器 机制:这不是两个互相矛盾的结果,而是同一个设计的一体两面。
相比之下,性别先验捕捉的是更外显、更直接的口味信号——“文案语气和表达方式对哪个性别更有吸引力”。这种信号对点击行为天然友好,所以它CTR提升、CVR也小幅提升,是顺着漏斗往下走的。两种先验作用于漏斗的不同位置,这个分岔本身就让“到底该用哪种先验”变成了一个业务目标问题,而不是纯粹的技术问题。
+9.51%不是终点:冷启动分桶、人口异质性与先验-奖励对齐的多维分析
只看总体指标会低估这篇文章的价值。论文最漂亮的一组证据来自冷启动分桶分析。它把每条评论按“当前曝光发生前已经累计了多少次展示”分成0–9、10–49、50–199、200+四个桶,然后看每个桶内的CTR提升率。这样做可以直接回答一个关键问题:先验到底在什么阶段发挥作用?
结果很有戏剧性。在最冷的0–9桶,两个先验的提升方向为正但不显著,置信区间宽得能跑马——评论在大约10次曝光以内,先验虽有情报,但证据太弱、噪声太大。到了10–49桶,性别先验的CTR提升达到+9.51%(p<0.001),内容先验也达到+7.76%(p<0.001),这是全实验最亮眼的高光时刻。50–199桶里性别先验仍保持+6.72%,到200+桶还维持+3.07%;而内容先验在50–199桶就开始衰减,200+桶直接反向变成−4.16%。
这条曲线的含义很清晰:LLM先验的实际角色不是“替代探索”,而是“加速学习”。它让评论在刚积累一点曝光历史时就能更快地收敛到合适排序位置;一旦行为数据多起来,先验的话语权下降,优势自然衰减。如果哪个团队指望大模型先验能一劳永逸地取代在线学习,那这个衰减曲线就是最直白的提醒。
接下来是先验-奖励对齐分析。论文在变体A(均匀先验)的曝光日志上,把评论按先验分数从低到高划分成十等份(十分位),画出每个分位里先验均值与真实CTR的关系。结果如图2所示:两个性别特定先验(女/男)与CTR呈清晰的单调正相关——先验分打得越高,真实点击率确实越高;基础分只有弱对齐;内容先验则完全没有清晰的单调关系。这说明性别先验的分数确实押中了行为规律,而内容先验的分数本身并不是一个有效的CTR预测器,它的价值体现在漏斗更深层。
再看人口异质性。论文按性别-年龄八分段把处理效应拆开,结果发现同样一个先验,在不同分段里的表现天差地别:有的分段CTR提升非常显著,有的分段几乎纹丝不动,甚至出现方向相反的情况。八个分段的方差很大,混合到总体样本里,自然就把均值拉平了。这也解释了为什么总体结果“看起来平淡”——不是没效果,而是效果在不同人群间互相抵消。
论文还额外检查了曝光集中度与标题流行度两个维度。曝光集中度分析显示,两个LLM先验变体都会把曝光向更少的评论集中,说明先验让系统更早进入“利用”模式,但这也带来曝光多样性下降的副作用。标题流行度分组分析(表4)则显示性别先验在不流行标题上收益更大,内容先验与标题热门度的关系则较弱、且不太稳定。
这里有个值得玩味的矛盾:探索集中度下降(多样性受损)和冷启动桶CTR提升(效率获益)其实是同一枚硬币。先验给系统注入了“预判”,系统自然更早地集中火力到高潜力评论上。对多样性敏感的业务,需要额外在探索机制上加约束,否则热门会被更强的马太效应固化。
这些发现能否迁移?从评论推荐到泛化text-rich bandit场景的思考
这套方法并不难移植。任何一个“候选物自带文本、且文本能反映吸引力”的推荐场景——电商商品评论、短视频标题、弹幕、社区帖子——都可以套用“LLM离线算先验 + 分段Thompson采样在线更新”的框架。成本上,LLM推理只发生在离线阶段,在线服务时只做Beta分布采样,额外开销几乎为零。这种“知识注入但不过度接管”的范式,恰好踩在传统bandit算法和重LLM排序器之间,给推荐系统工程师留出了非常舒服的改造空间。
但想照搬到自己的业务里,有三盆冷水得先泼一泼。第一,实验环境的候选评论池经历过严格的人工筛选,LLM先验是在“池子已经比较干净”的前提下发挥作用的;如果直接用于完全放任的UGC内容池,LLM打分和人工筛选的语义偏差可能叠加,效果未必有这么干净。第二,κ=40、λG=2.0、λT=1.0这些超参数都是定性校准出来的,不是生产环境最优化选择;不同流量量级下,先验强度的取值可能需要重新调节,论文也没给出敏感性分析。第三,先验信号特别是内容先验,在提升深层转化(CVR)的同时牺牲了点击(CTR),如果业务的营收计费依赖曝光或点击,这种漏斗偏移是好事还是坏事,需要完全不同的生意判断。
从更广的视角看,这篇论文最值得借鉴的设计决策,是把LLM从“在线排序器”降级为“离线先验估计器”。这个定位转变绕开了LLM在线推理的高延迟和高成本,让语义知识以一种贝叶斯系统能够自然消费的形式进入决策闭环,并且在行为数据到达后自动衰减、有序退场。对于所有“文本丰富但行为稀疏”的推荐场景,这套思路都值得认真抄一遍。
龙迷三问
这篇论文到底在解决什么问题? 韩国网漫平台NAVER WEBTOON提出用GPT-4.1从评论文本提取语义信号,转化为贝叶斯先验为Thompson采样“暖启动”。
这篇工作最值得看的点是什么? 整体上变体B(性别先验)CTR+1.48%(p=0.144)、CVR+1.23%(p=0.082)方向正向但不显著;变体C(内容先验)CTR显著下降-5.68%(p<0.001)但CVR+1.37%(p=0.054)。冷启动分桶分析显示1…
这篇工作的边界或风险在哪里? 优点——1)将LLM语义信号与Thompson采样先验结合,形成“离线语义推断+在线行为学习”的闭环,LLM仅在离线构造先验、在线仅需轻量Beta采样,工程成本可控;2)加性先验分解(基础分+性别/内容调整)可解释性强、便于调试,两阶段内…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
利用大语言模型从用户生成的评论文本中提取语义信号,构建性别先验和内容先验两类Beta先验参数,以在稀疏反馈阶段暖启动汤普森采样算法。
学术研究价值: ★★★★☆
利用大语言模型从用户生成的评论文本中提取语义信号,构建性别先验和内容先验两类Beta先验参数,以在稀疏反馈阶段暖启动汤普森采样算法。
稳定性: ★★★☆☆
优点——1)将LLM语义信号与Thompson采样先验结合,形成“离线语义推断+在线行为学习”的闭环,LLM仅在离线构造先验、在线仅需轻量Beta采样,工程成本可控;2)加性先验分解(基础分+性别/内容调整)可解释性强、便于调试,两阶段内…
适应性以及泛化能力: ★★★☆☆
优点——1)将LLM语义信号与Thompson采样先验结合,形成“离线语义推断+在线行为学习”的闭环,LLM仅在离线构造先验、在线仅需轻量Beta采样,工程成本可控;2)加性先验分解(基础分+性别/内容调整)可解释性强、便于调试,两阶段内…
硬件需求及成本: ★★★☆☆
方法无显式FLOPs报告。离线阶段LLM评分按标题级批量调用GPT-4.1完成,每日仅对新增或变化评论增量重跑;在线服务阶段仅执行Beta分布采样与Top-K排序,计算开销极低。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
优点——1)将LLM语义信号与Thompson采样先验结合,形成“离线语义推断+在线行为学习”的闭环,LLM仅在离线构造先验、在线仅需轻量Beta采样,工程成本可控;2)加性先验分解(基础分+性别/内容调整)可解释性强、便于调试,两阶段内…
可能的问题: 优点——1)将LLM语义信号与Thompson采样先验结合,形成“离线语义推断+在线行为学习”的闭环,LLM仅在离线构造先验、在线仅需轻量Beta采样,工程成本可控;2)加性先验分解(基础分+性别/内容调整)可解释性强、便于调试,两阶段内…
主要参考文献
Lee, E., Kang, B., Choi, O., & Jang, T. LLM-Derived Priors for Thompson Sampling in Cold-Start Comment Recommendation. arXiv:2608.03382v1.
Thompson, W. R. (1933). On the likelihood that one unknown probability exceeds another in view of the evidence of two samples. Biometrika, 25(3-4), 285–294.
Wang, H., Wang, N., & Yeung, D.-Y. (2015). Collaborative Deep Learning for Recommender Systems. Proceedings of the 21st ACM SIGKDD.
Zheng, L., Noroozi, V., & Yu, P. S. (2017). Joint Deep Modeling of Users and Items Using Reviews for Recommendation. Proceedings of the 10th ACM WSDM.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 “阅读原文”, 查看更多原论文细节哦!
看完了这波“LLM当先验”的骚操作,是不是也想找同好聊聊推荐系统的冷启动困境?😏
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 推荐系统+上海+NAVER+小龙) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,推荐系统的小伙伴一般都在大模型及智能体群里扎堆~