← 返回 PaperDaily 大模型与智能体

中科大&美团CHAP:生成式检索告别逐层解码,线上成交大涨2.98%

传统生成式检索有个"中看不中用"的槽点:每个语义ID都要逐层解码,重型Transformer要在线跑好几遍,工业场景根本扛不住。中国科大联合美团提出CHAP,把多步解码压成单次Transformer加轻量残差块,线上A/B测试支付订单量直接涨了2.98%,看完只想说一句:这才是能落地的检索新范式。

中科大&美团CHAP:生成式检索告别逐层解码,线上成交大涨2.98%
原论文信息如下:
论文标题:
Preference Shapes Relevance: Cross-component Hierarchical Semantic Alignment for Personalized Generative Retrieval
发表日期: 2026年8月
发表单位: 中国科学技术大学 & 美团
开源代码链接: https://github.com/zzzgm/CHAP

生成式检索的语义鸿沟与效率瓶颈

封面
在电商平台搜"无皮三明治机",结果跳出来一屏烤箱和微波炉——这大概是传统搜索最让人血压飙升的瞬间。你以为它在"理解"你,实际上它只是把关键词丢进一个巨大的匹配管道,精搜乱搜一视同仁。近年来炒得火热的生成式检索(Generative Retrieval,GR)宣称要从根上改变这一切:不建索引、不做召回,直接让模型"生成"目标物品的语义ID。听起来很美对吧?但中国科学技术大学和美团的研究者发现,现有GR方案藏着三个致命伤:语义鸿沟、结构浪费、延迟爆炸。他们提出的CHAP,正在把这三个问题一次性按住。
先快速说下生成式检索是啥。传统检索走的是"索引-召回-排序"三段式:先把海量物品建成倒排索引或向量索引,用户来一个查询,就在索引里捞候选,再精排。生成式检索彻底换了个玩法——它把检索目标编码成一段离散的语义ID(Semantic ID,SID),训练一个序列生成模型,输入用户查询和交互历史,直接生成目标物品对应的SID。这里的SID通常由一个叫RQ-VAE(Residual Quantized Variational Autoencoder,残差量化变分自编码器)的工具生成:先把物品文本编码成稠密向量,再用多层码本逐级量化,得到一串"由粗到细"的离散编码。
图1:RQ-VAE生成语义ID(SID)的示意图
RQ-VAE生成语义ID(SID)的示意图。物品先编码为稠密向量,再经多层码本逐级量化,形成"由粗到细"的分层离散ID。
生成式检索的数学目标可以写成一个条件概率:给定用户查询q和历史交互S,模型最大化生成目标SID c = (c⁰, c¹, …, cˡ⁻¹)的联合概率。标准做法是按层自回归解码——先生成第一层码,再生成第二层,逐层往下。
生成式检索的条件概率分解公式
这是生成式检索的目标函数:给定查询q和交互历史S,最大化目标SID每一层码的生成概率连乘。
这套范式有潜力,但论文把现有方法的问题归纳为三点。

第一,语义鸿沟。TIGER、HierGR这些经典方法在训练SID时只用物品语料,码本天然"不认识"查询。用户搜"无皮三明治机",SID空间里可能根本没有与之对齐的码,生成结果自然跑偏。这是查询意图与静态物品表示之间的系统性错位。

第二,结构浪费。RQ-VAE产生的SID本身有清晰的"粗码→细码"层次:第一层可能代表"相机"这个大品类,第二层才是"网络摄像头",第三层进一步区分"带麦克风"的型号。但现有模型常把这个层次结构当成扁平符号序列,白白浪费了层次带来的泛化能力和语义稳定性。

第三,延迟爆炸。标准生成式检索推理时,每生成一层码都要跑一遍重型Transformer解码器(尤其昂贵的交叉注意力层)。L层SID就要解码L次,在线服务延迟高到工业界无法接受。这直接堵死了生成式检索在大规模电商、本地生活等延迟敏感场景的部署路。

CHAP就是冲着这三大痛点来的。它的思路可以概括为两句话:先用层次语义对齐让SID"懂"查询,再用残差级联生成让解码"变快"。

层次语义对齐:弥合查询与物品的语义鸿沟

CHAP的整体架构如图2所示,左侧是层次语义对齐(HSA),右侧是双视角序列建模和残差级联生成。
图2:CHAP整体架构图
图2:CHAP总体架构。左边是层次语义对齐(HSA)模块,用于弥合查询与物品之间的语义鸿沟;右边是双视角个性化序列建模与残差级联生成,实现高效由粗到细检索。
HSA模块的核心思想很直接:既然现有SID是拿物品语料预训练出来的、不懂查询,那就主动把查询的表示空间"拽"到物品的量化空间里去。具体动作分三步。

第一步,跨样本对齐。把RQ-VAE里原本用在同一物品上的重构损失和承诺损失,换成"查询-目标"跨样本版本:查询的残差要贴近目标物品选中的码字(Cross-Commitment Loss),而且从查询的量化表示出发,要能重构出目标物品的原始文本向量(Cross-Reconstruction Loss)。这两个损失一拉一推,查询的表示就被拽进了物品的量化空间。

跨承诺损失公式
跨承诺损失(Cross-Commitment Loss):强制查询的每一层残差对齐目标物品在对应层选中的码字。这里sg是停止梯度操作,β是平衡系数。

第二步,层次感知对比学习。为了让"粗→细"的层次结构真正被利用起来,CHAP在每个层级上都做了一次对比学习:查询在第l层的部分量化表示要去贴近目标物品在第l层的部分量化表示,同时拉远和其他负样本的距离。这样,每层码的语义区分度都被显式优化过——第一层分大类,第二层分小类,第三层抠属性,每一层都有"对口"的判别能力。

层次感知对比学习损失公式
层次感知对比学习(HCL)损失:对SID的每一层分别计算对比损失,确保每层码都在对应粒度上具有判别性。

第三步,软概率蒸馏。硬量化就像"一刀切",容易让查询编码器的输出分布发生剧烈漂移。CHAP引入KL散度,让查询编码器输出的软分配概率去逼近目标物品在冻结码本上的软分配概率。这相当于给查询提供了一个稳定、平滑的"导航信号",防止语义对齐过程中把原有结构搞崩。

软概率蒸馏损失公式
软概率蒸馏损失:用KL散度让查询的软码字分配逼近物品侧冻结码本的软分配,稳定对齐过程。
三步加起来,就是HSA的总损失:
HSA总损失公式
HSA总损失:跨样本对齐损失(CSA)+ 层次感知对比损失(HCL)+ 软概率蒸馏损失,其中γ和δ是权重系数。

双视角序列建模:融合稀疏与稠密表示

HSA把SID调教明白之后,下一个问题是怎么做个性化。用户搜索"相机",一个摄影爱好者想要的是全画幅微单,一个网课老师想要的却是带麦克风的摄像头——同一查询,完全不同的意图。
CHAP的做法是双视角序列建模(Dual-View Sequence Modeling)。用户的每个交互物品,同时用两种视角喂给模型:一个是稀疏视角,即对齐后的SID聚合向量,提供粗粒度结构信息;另一个是稠密视角,即物品原始语言模型向量,提供细粒度语义信息。查询本身也带上双视角表示,拼接成输入序列。
这种设计的好处是互补:稀疏SID像"骨架",保证生成结果落在合理的语义结构里;稠密向量像"血肉",负责捕捉SID量化后损失的细粒度语义细节。刷到这一步,可以理解本文反复强调的观点——纯离散SID做检索,等于扔掉了大量信息。
训练阶段采用混合优化,同时优化稀疏生成损失和稠密对比损失:
稀疏生成损失公式
稀疏生成损失:对SID每一层做分类,标准交叉熵。
稠密对比损失公式
稠密对比损失:基于InfoNCE,在batch内做正负样本对比。
两者配合会产生一种"课程学习"效果:稀疏结构约束先把语义轮廓框定,稠密对比再在轮廓内做精细排序,训练过程更稳,收敛更快。

残差级联生成:单次推理的高效解码

方法部分最妙的设计来了。标准生成式检索逐层解码,每一层都过一遍Transformer解码器,延迟让人头大。CHAP的残差级联生成(Residual Cascading Generation)直接把多步解码砍成单步。
具体做法是:Transformer解码器只对查询输入跑一次,得到两个输出隐状态——一个对应稀疏查询位,一个对应稠密查询位。之后每一层SID的预测,不再回解码器,而是用轻量残差块(ResBlock)在这个全局结构锚点之上逐层累加。残差块的更新方式如下:
残差块更新公式
残差块更新公式:h是残差块的隐状态,e是第l层选中的码字向量,h_dec_sparse是解码器输出的全局结构锚点。
这个设计把"重活"(历史意图路由、跨注意力计算) 全都压在解码器的单次前向里,后续层级只做轻量残差计算。按照论文给出的数据,CHAP的吞吐量比标准自回归解码提升近一倍(QPS从40.5涨到78.9),而性能不降反升。
稠密向量的预测也复用了这个结构:把稀疏量化重建的ẑ注入稠密预测头,让稠密预测在离散结构指导下完成,实现"由粗到细"的语义修正。
稠密向量预测公式
稠密向量预测公式:将解码器的稠密隐状态与量化重建向量拼接后,经预测头得到稠密预测。
推理阶段,CHAP用并行采样一次性生成M个候选SID(论文取M=50),每个候选同时算两个分数:SID路径的累计对数概率作为稀疏信号,预测稠密向量与候选物品原始向量的余弦相似度作为稠密信号。两者分别做温度缩放Softmax归一化后相乘,得到最终融合分数。
最终融合分数公式
最终融合分数:稀疏信号和稠密信号各自归一化后相乘。

实验结果与在线验证:全面超越基线

实验部分论文做了非常完整的验证。数据集方面用了四个:ESCI-us(亚马逊真实查询)、KuaiSearch(快手电商搜索)、Amazon(带用户画像的电商数据)和一个工业数据集Local-Life(某头部平台30天用户日志)。
表1:实验数据集统计信息
表1:实验数据集统计。Local-Life是千万级物品、百万级查询的大规模工业数据集。
基线选了14个,覆盖四类:稀疏检索(BM25、Doc2Query、DeepCT)、稠密检索(DPR、Sen-T5、MPNet)、个性化检索(TEM、CoPPS)、生成式检索(DSI、NCI、TIGER、LTRGR、MERGE、COBRA)。领域内该对比的基本都齐了。
表2:四个数据集上的性能对比
表2:四个数据集上的性能对比。加粗表示显著优于所有基线(配对t检验,p<0.05),下划线为第二好结果。
结果很干脆:CHAP在四个数据集上全面碾压。ESCI-us上R@10达到0.1127,比第二名的MERGE(0.0612)高出84%;Local-Life上R@10达0.5803,比COBRA(0.5020)高出15.6%。特别值得注意的是,传统GR方法如TIGER在某些场景下反而不如BM25——语义鸿沟的影响肉眼可见。CHAP做了语义对齐之后,稠密检索的语义理解能力和GR的结构精确性被真正融合到了一起。
消融实验(表3)也做得很扎实。去掉HSA时R@10从0.5803降到0.5115,说明语义对齐贡献显著;去掉稠密细化(即只用稀疏SID)时直接掉到0.4352,证明双视角设计不可或缺。最亮眼的是残差级联生成:把Residual Generation换回标准自回归,性能略降(0.5285 vs 0.5803),但QPS从78.9腰斩到40.5——效率优势一目了然。
表3:CHAP在Local-Life上的消融研究
表3:消融实验。每一行去掉一个核心组件,观察性能变化,同时用QPS监控工业效率。
效率对比(表4)更加直观:相比COBRA这种需要生成多个稠密表示的模型,CHAP在SID构建和模型训练上的总耗时都更短,推理吞吐量则大幅领先。
表4:Local-Life上的效率对比
表4:效率对比。ItemID表示SID构建时间,Seq表示生成式检索模型训练时间,Total为两者之和。
最能说明落地价值的是线上A/B测试(表5)。在14天测试窗口内,CHAP相比线上基线,支付订单量提升2.98%,商品点击率提升3.61%,搜索引导成交总额提升3.15%。这个提升幅度放在电商场景是相当可观的。
表5:线上A/B测试结果
表5:线上A/B测试结果(14天)。所有指标均通过配对t检验(p<0.05)。
论文还做了若干深入分析。图3是用PCA降维后可视化的查询-物品分布:原始RQ-VAE生成的SID空间里,相关物品(橙色)离散地散落在查询(红色)周围,看不到清晰聚类;CHAP做完整语义对齐后,相关物品紧密聚拢在查询周围,不相关物品被明确推开。
图3:三个查询下物品分布的PCA可视化
图3:物品分布可视化。左为原始RQ-VAE,右为CHAP。CHAP使查询(红色)周围紧密聚集相关物品(橙色),并推开不相关物品。
图4按查询意图做了细分:在多意图查询(如"买相机送人")、长尾查询和短查询上,CHAP都有一致的提升,不会出现某一类查询特别拉胯的情况。
图4:按查询意图划分的细分分析
图4:意图维度查询段分析。CHAP在不同查询意图上的提升较为一致,没有明显短板。
实验部分给人的整体感觉是:该做的对比都做了,该分析的维度都分析了,而且不是"码出来一个点"就交差,而是把查询意图、语义分布、推理效率、线上收益全都验证了一遍。这种完整度在学术论文里算得上优秀。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?中国科大与美团提出CHAP,从分层语义对齐、双视图序列建模、残差级联生成三方面重构个性化生成式检索。四个数据集刷新SOTA,Local-Life上R@10达0.5803,QPS达78.9;线上A/B测试支付订单量提升2.98%。代
这篇工作最值得看的点是什么?CHAP在所有四个数据集上均取得最优结果,显著超越所有基线方法,包括先进的GR模型COBRA和MERGE;在线A/B测试中UV-CTR提升0.77%,UV-CXR提升2.09%,Pay Orders提升2.98%。
这篇工作的边界或风险在哪里?优点:1)层次语义对齐有效弥合查询-物品语义鸿沟;2)双视角序列建模融合稀疏和稠密表示,提升个性化检索精度;3)残差级联生成机制大幅提升推理效率。缺点:1)冻结物品侧码本可能限制物品表示的动态更新;2)框架主要验证于RQ-VAE生成的层次化SID,对其他类型ItemID的泛化性需进一步研究。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出CHAP框架,通过层次语义对齐模块将查询潜在空间与物品量化路径对齐,并利用残差级联生成机制实现单次推理的高效个性化生成式检索。

实验合理度:★★★★☆

Recall@K, Hit Ratio@K, Mean Reciprocal Rank@K, NDCG@K

学术研究价值:★★★★☆

提出CHAP框架,通过层次语义对齐模块将查询潜在空间与物品量化路径对齐,并利用残差级联生成机制实现单次推理的高效个性化生成式检索;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

训练使用8×A100(80G) GPU集群,推理QPS为78.9,显著高于对比方法。

复现难度:★★★☆☆

https://github.com/zzzgm/CHAP

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)冻结物品侧码本可能限制物品表示的动态更新;2)框架主要验证于RQ-VAE生成的层次化SID,对其他类型ItemID的泛化性需进一步研究。

主要参考文献

[1] Rajput S, et al. TIGER: Generative Retrieval with Semantic IDs. 2023.
[2] Tay Y, et al. DSI: Differentiable Search Index. 2022.
[3] Yang Y, et al. COBRA: Personalized Generative Retrieval with Sparse and Dense Views. 2025.
[4] Zhang G, et al. MERGE: Multi-level Correlation Enhanced Generative Retrieval. 2025.
[5] Li X, et al. KuaiSearch: A Search Engine Benchmark with User Behavior. 2026.
[6] Reddy C K, et al. ESCI: Shopping Queries Dataset. 2022.

end
🎉 读得过瘾吗?像CHAP这种"原理讲透+数据给足"的解读,龙哥星球里还有很多!想和实战派一起追前沿?加龙哥助手微信:kangjinlonghelper,备注:研究方向+地点+学校/公司+昵称。图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5群等你加入!🚀
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。