先看最基础的事实:模态信息本身确实有用。在Tsinghua ShortVideo上,一个全局模态权重比无模态基线在PairAcc上高1.89个百分点;在KuaiRand-27K上高3.61个百分点;在MicroLens-100K上高3.50个百分点,全部p<.001。PairAcc是成对排序准确率(Pairwise Ranking Accuracy),衡量模型在曝光对中把正样本排到负样本前面的比例,是最直接探测模态驱动偏好的指标。但全局权重在NDCG上可能掉分,在Recall上常常涨分——这是模态信息和协同信息之间的一种已知张力,不同语料库表现不一样。这种张力不会干扰审计结论,因为所有对比都是配对的,同涨同跌,两边都被同样的张力影响。表2:单个全局模态权重相对于无模态基线的内容增益(GM−BPR,百分点)。增益集中在成对准确率和召回率上,全局权重在部分语料库上牺牲了NDCG,这是一种已知的模态-协同张力。五个种子,配对t检验。真正颠覆认知的是表3里的结果。把模态权重从全局共享改成每个用户单独一份之后,六个加权头没有一个能在三个语料库、三个指标上全面打赢全局权重。偶有正收益也小得可怜,最多0.9个百分点,而且换个数据集就翻绿为红。具体来看:在Tsinghua ShortVideo上,每个头在NDCG和Recall上都输给全局权重,六个头里五个在PairAcc上也输;在KuaiRand-27K上,元权重家族(MWN)是唯一赢家,在NDCG上最高涨0.88个百分点,但同一批头在Tsinghua ShortVideo和MicroLens-100K上几乎全军覆没;在MicroLens-100K上,六个头在三个指标上全部为负,一胜难求。这张表把“个性化”打成了一场花式亏本买卖。表3:六种每用户加权头相对单个全局权重的效用缺口(real-GM,百分点),覆盖三个语料库和三个指标。没有一个头能在所有语料库上全指标获胜,少数正收益也很小且不稳定。下标d标记解耦门控变体。五个种子,配对t检验,星号表示每列内六头的Benjamini–Hochberg FDR校正q值。有人可能会说:是不是GM太强了?GM不是弱基线,但团队还额外跑了一个容量匹配的GMc基线,把元权重级别的参数花在“物品内容”上,而不是花在“用户身份”上。结果GMc比GM还要差,在Tsinghua ShortVideo上损失2.84个百分点PairAcc,在MicroLens-100K上损失3.75个百分点,在KuaiRand-27K上PairAcc持平但NDCG崩了7.59个百分点、Recall崩了16.77个百分点。这说明:不是GM太强所以打不过,而是“把额外容量用来拟合每用户权重”这个方向本身就不对。Table 1: Six per-user weighting heads audited on the shared backbone. The rightmost column marks whether the gate reads the shared collaborative embedding \mathbf { p } _ { u } , which is the key variable in the decoupling analysis.这张汇总表清晰展示了趋势:全局权重的内容增益集中在PairAcc和Recall上,NDCG有正有负;每用户加权相对于这个全局基线,大部分时候是负贡献,偶有正贡献也远小于全局权重本身带来的增益。数据集的选取也值得一提。Tsinghua ShortVideo是清华的短视频平台日志,过滤到至少30次曝光的用户后留了4099个活跃用户,模态特征有256维视觉嵌入、128维文本嵌入和元数据通道;KuaiRand-27K是快手随机曝光日志,2.7万用户,特征来自58维标签、39维音乐和22维元数据;MicroLens-100K来自另一个UGC平台,10万用户,使用1024维CLIP-RN50视觉嵌入和1024维BGE-M3文本嵌入。三者规模不同、平台不同、模态结构不同,结论却高度一致。这样的独立重复,让“个性化无用”的结论有了足够底气。
[1] Zheng J, Zhang X, Gu Y, et al. Is Personalized Modality Weighting Actually Personalized? A Controlled Audit of Per-User Weighting Claims in Multimodal Recommenders[J]. arXiv preprint arXiv:2608.05655v1, 2026.[2] Chen J, et al. M3CSR: 面向冷启动短视频推荐的十亿用户多模态框架[C]// 2024.[3] Dong X, et al. MARGO: 基于模态可靠性估计的个性化加权[C]// 2025.[4] Shu J, et al. 元权重超网络用于模态加权[C]// 2019.[5] Ferrari Dacrema M, Cremonesi P, Jannach D. 神经推荐方法的可复现性问题[C]// 2019.[6] Rendle S, et al. 关于深度推荐模型与经典基线对比的实证研究[C]// 2020.[7] Breiman L. 随机森林中的置换特征重要性[J]. Machine Learning, 2001.[8] He R, McAuley J. VBPR: 基于视觉的推荐排序模型[C]// 2016.[9] 开源代码: https://github.com/ziyi0227/personalized-modality-weighting-audit.