实验部分论文做了非常完整的验证。数据集方面用了四个:ESCI-us(亚马逊真实查询)、KuaiSearch(快手电商搜索)、Amazon(带用户画像的电商数据)和一个工业数据集Local-Life(某头部平台30天用户日志)。表1:实验数据集统计。Local-Life是千万级物品、百万级查询的大规模工业数据集。基线选了14个,覆盖四类:稀疏检索(BM25、Doc2Query、DeepCT)、稠密检索(DPR、Sen-T5、MPNet)、个性化检索(TEM、CoPPS)、生成式检索(DSI、NCI、TIGER、LTRGR、MERGE、COBRA)。领域内该对比的基本都齐了。表2:四个数据集上的性能对比。加粗表示显著优于所有基线(配对t检验,p<0.05),下划线为第二好结果。结果很干脆:CHAP在四个数据集上全面碾压。ESCI-us上R@10达到0.1127,比第二名的MERGE(0.0612)高出84%;Local-Life上R@10达0.5803,比COBRA(0.5020)高出15.6%。特别值得注意的是,传统GR方法如TIGER在某些场景下反而不如BM25——语义鸿沟的影响肉眼可见。CHAP做了语义对齐之后,稠密检索的语义理解能力和GR的结构精确性被真正融合到了一起。消融实验(表3)也做得很扎实。去掉HSA时R@10从0.5803降到0.5115,说明语义对齐贡献显著;去掉稠密细化(即只用稀疏SID)时直接掉到0.4352,证明双视角设计不可或缺。最亮眼的是残差级联生成:把Residual Generation换回标准自回归,性能略降(0.5285 vs 0.5803),但QPS从78.9腰斩到40.5——效率优势一目了然。表3:消融实验。每一行去掉一个核心组件,观察性能变化,同时用QPS监控工业效率。效率对比(表4)更加直观:相比COBRA这种需要生成多个稠密表示的模型,CHAP在SID构建和模型训练上的总耗时都更短,推理吞吐量则大幅领先。表4:效率对比。ItemID表示SID构建时间,Seq表示生成式检索模型训练时间,Total为两者之和。最能说明落地价值的是线上A/B测试(表5)。在14天测试窗口内,CHAP相比线上基线,支付订单量提升2.98%,商品点击率提升3.61%,搜索引导成交总额提升3.15%。这个提升幅度放在电商场景是相当可观的。表5:线上A/B测试结果(14天)。所有指标均通过配对t检验(p<0.05)。论文还做了若干深入分析。图3是用PCA降维后可视化的查询-物品分布:原始RQ-VAE生成的SID空间里,相关物品(橙色)离散地散落在查询(红色)周围,看不到清晰聚类;CHAP做完整语义对齐后,相关物品紧密聚拢在查询周围,不相关物品被明确推开。图3:物品分布可视化。左为原始RQ-VAE,右为CHAP。CHAP使查询(红色)周围紧密聚集相关物品(橙色),并推开不相关物品。图4按查询意图做了细分:在多意图查询(如"买相机送人")、长尾查询和短查询上,CHAP都有一致的提升,不会出现某一类查询特别拉胯的情况。图4:意图维度查询段分析。CHAP在不同查询意图上的提升较为一致,没有明显短板。实验部分给人的整体感觉是:该做的对比都做了,该分析的维度都分析了,而且不是"码出来一个点"就交差,而是把查询意图、语义分布、推理效率、线上收益全都验证了一遍。这种完整度在学术论文里算得上优秀。
[1] Rajput S, et al. TIGER: Generative Retrieval with Semantic IDs. 2023.[2] Tay Y, et al. DSI: Differentiable Search Index. 2022.[3] Yang Y, et al. COBRA: Personalized Generative Retrieval with Sparse and Dense Views. 2025.[4] Zhang G, et al. MERGE: Multi-level Correlation Enhanced Generative Retrieval. 2025.[5] Li X, et al. KuaiSearch: A Search Engine Benchmark with User Behavior. 2026.[6] Reddy C K, et al. ESCI: Shopping Queries Dataset. 2022.