← 返回 PaperDaily
视觉与图像
视频推荐只会"哪里相关"?反事实测试揭开"是否真有证据"的谎言
推荐系统平时只知道"你爱看什么",却说不清"视频里哪一秒、哪个画面真正打动你"。这篇论文设计了一套反事实测试:把证据片段替换掉,看模型还坚不坚持原先的判断。结果扎心——不少模型定位很准,但证据判断相当糊弄。值得所有做视频推荐、时间定位和可解释推荐的读者一读。
龙哥读论文
发布于 2026-09-05 00:31:07
阅读 1
查看原文
原论文信息如下:
你刷短视频的时候,有没有想过一个问题:系统到底是因为什么把某条视频推给你的?
是因为封面好看?标题带劲?还是因为视频里某个具体的画面、某个关键动作,恰好戳中了你最近反复观看的内容?
大多数视频推荐系统只会告诉你"我推荐,因为你喜欢这类内容"。但你追问它"到底是视频里的哪一段让你这么认为",它多半答不上来。而另一条技术路线——时间定位(Temporal Grounding)倒是能指出"查询相关的那几秒出现在哪里",可它同样有个软肋:它从不质疑"这段内容对某个具体用户来说,到底算不算真正的推荐证据" 。
打个比方:全班五十个人考同一张卷子,AI能精准指出"这道题在第3页第2题",但它完全不知道这道题你其实不会做——找出题目的位置,和判断你能否答对,是两码事。
本文介绍的这篇论文,要解决的正是这个被长期忽视的断层。论文提出了一个全新的诊断任务——反事实行为证据检索(Counterfactual Behavior-Grounded Evidence Retrieval, CBGER) ,配套构建了一个包含5000对受控"事实-反事实"视频对的基准CBGER-10K,并给出了一个轻量级解决方案CBGER。
引言
先来说说视频推荐这个老问题。如今主流的个性化视频推荐系统,本质上还是在做"视频级"的偏好预测:系统根据你历史上点击、点赞、看完的视频集合,学习一个用户表征,再去和候选视频的内容表征做匹配,输出一个相关度分数。它要回答的只有一个问题:这个视频,你大概会喜欢吗?
至于"视频里到底是哪段内容让你喜欢",推荐系统不关心,也不输出。这不一定是系统偷懒,更关键的是推荐模型的训练信号来自隐式反馈(点击、播放时长等),这些信号天然是视频级的——用户点了个赞,系统只知道他喜欢这条视频,却不知道他喜欢的是第几秒到第几秒的画面。
与此同时,视频理解领域有一条独立的技术脉络——时间定位。给定一段视频和一个语言查询(比如"小狗翻越栅栏"),时间定位模型要在未剪辑的长视频中找出与查询匹配的那个时间段。这类任务评估的是"定位精度" ,也就是找得准不准。
但作者敏锐地发现了一个逻辑漏洞:定位准,不代表证据成立 。一个模型在视频里把某段内容排到第一,可能只是因为剩下的片段都太弱了——"瘸子里面拔将军"罢了。而真正决定推荐是否合理的关键,是另一个问题:对这位用户来说,这条视频里到底存不存在足够支撑推荐的行为证据?
为了把这个"隐藏的断层"暴露出来,作者提出了一个精妙的测试思路——构造"事实-反事实"视频对。简单来说:给定一个用户,取一条真实存在的视频时间线(事实版),其中包含一段与该用户历史行为高度匹配的"焦点片段";然后用一段内容相似但对该用户支持度更弱的新片段,在同一时间位置替换掉这段焦点片段(反事实版),其余干扰片段全部原封不动。
一个"诚实"的模型应当做到三件事:第一,在事实版中正确找到焦点片段的位置(Where);第二,在视频级别上认为事实版比反事实版包含更强的证据(Whether);第三,当焦点片段被替换后,该位置的局部分数要相应下降(干预一致性 Intervention)。
为了验证这个问题,论文构建了一个名为CBGER-10K的新基准,包含3026位用户的5000对事实-反事实样本,并提出了一个轻量级的基准模型CBGER。下面咱们一层层拆开看。
视频推荐只问"哪里相关"够吗?一个反事实测试揭示隐藏缺陷
聊方法之前,先把这个任务定义说透。作者把个性化视频证据检索拆成了三个维度来考核模型:
Where(定位): 对于事实时间线V+,模型能否把行为支持的片段y排在干扰片段前面?标准的检索指标MRR和NDCG可以衡量这一点。
Whether(证据存在性判断): 模型能否区分事实版(有证据)和反事实版(证据被削弱)在视频整体层面的证据强度?用Pair Accuracy衡量,即 q(u, V+) > q(u, V-) 的比例。
Intervention Consistency(干预一致性): 把焦点片段替换后,模型在同一个位置y上的局部分数是否会下降?也就是 s_y(u, V+) > s_y(u, V-) 的比例。
前两个维度对应模型的两项预测能力,第三个维度则对应反事实一致性。为什么需要分开看?因为一个模型可能Where做得很好、但Whether一塌糊涂——它能准确找出"最相关的那段",却无法判断"这段内容到底够不够格作为证据"。反过来,Whether做得好的模型,也不一定干预一致性就好。三项指标各管一段,谁也代替不了谁。
作者强调,这项测试衡量的是"模型对指定证据的依赖程度",而非对真实用户参与行为的因果推断。这是一个非常严谨的定位:它不宣称能预测你的真实点击率,只是想看看模型的预测在受控条件下是不是"言行一致"。
从"定位"到"证据验证":Where与Whether的双维解耦
为什么要做这种"双维解耦"?这得从时间定位和推荐两个领域各自的盲区说起。
时间定位领域有个典型的陷阱:在标准的grounding评测中,查询和视频的对应关系是预先定义好的——评测者默认"查询相关的事件一定出现在视频里"。所以模型要做的只是"找出那个片段"。但是,如果查询对应的内容压根不存在呢?传统基准压根不设置这种"负样本"。虽然近年有一些工作开始考虑"负查询"(比如Negative-Aware Video Moment Retrieval要求模型拒绝查询事件不存在的视频),但它们处理的仍然是查询-视频对应关系 ,而非用户-视频个性化证据关系 。
推荐领域则存在另一层盲区。传统推荐系统在视频级别做打分,然后在粗粒度主题上做匹配。你说用户喜欢"做菜",系统就推各种做菜视频——但它完全不知道这条做菜视频里哪个环节让用户停留了。推荐理由说了等于没说。
CBGER把这两个领域拧在一起:一个行为衍生的用户画像定义了"个性化证据"的参照系,而配对的事实-反事实视频则把"证据更换"变成实验变量。这就把"哪里相关"和"是否真有证据"彻底切开了 。
做个类比来帮你建立直觉。想象一位侦探追查案件(用户行为画像),他需要判断某个嫌疑人(候选视频)是否与案件相关。传统推荐模型就像是个"印象派侦探"——凭直觉觉得"这人看起来像罪犯";时间定位模型则负责找到"犯罪现场中与案件描述匹配的那个房间"(定位片段)。但这一切都建立在"案件确实发生过"的前提上。CBGER提出的问题是:如果房间里的关键物证被替换成相似但不相关的物品,侦探还会坚持原来的判断吗? 一个优秀侦探不仅应该指出案发房间,还应该能识别"证据链断没断"。
CBGER-10K:5000对受控反事实样本如何构建?
造数据是个细致活。作者从两个现成资源出发:行为数据来自MicroLens(一个大规模用户-微视频交互数据集),视频内容来自FineVideo(一个带时间区间和结构化描述的创意共用视频集)。整体构造流程如下图所示。
第一步:行为画像构建。 用户的MicroLens行为历史(按时间排序的观看记录+视频标题)被拿来构造行为支持的画像。具体做法是:对标题做分词后的unigram和bigram进行统计,计算用户级逆文档频率,加权后挑选出支持度最高的短语及关联的历史条目,组成该用户的行为画像 pu。这些画像只是"可观测消费行为的操作性摘要",作者坦诚它不代表用户心理层面的真实兴趣。这里有个用心的细节:没有观测到的条目不会被视为负样本——毕竟用户没看过不等于不喜欢。
第二步:语义标注与匹配。 FineVideo提供的视频片段时长限制在1到12秒之间,这些候选片段由Qwen3-VL-8B-Instruct进行结构化视觉语义标注,包括对象、动作、有序事件、状态变化、结果、主题和不确定性估计。标注质量阈值卡在0.5这个阈值上——无效输出以及不确定性高于0.5的标注会被直接丢弃,最终留下7651个有效片段。这些结构化语义被序列化成一段统一的文本模板,依次包含主题、对象、有序动作、事件、状态变化和结果等要素。换句话说,每个片段都被“翻译”成一段能让模型读懂发生了什么的小剧本。
真正体现“受控”二字的,是第三步:事实-反事实配对构造。作者把用户画像和片段语义分别用BGE-M3编码成归一化向量,通过内积计算用户画像与片段之间的构造相似度m(u, v)。这个分数越高,说明片段和该用户历史行为在语义上越贴近。论文选用的“事实片段”要求m(u, v) ≥ 0.30;作为对照的“反事实片段”则需要与事实片段内容足够相似,但对该用户的支持度明显更弱。具体筛选条件如下方公式所示:
这样一来,每条事实时间线恰好包含9个片段:1个焦点证据片段加上8个“难缠”的干扰片段。焦点位置用固定随机种子采样;反事实时间线和事实时间线共享用户、共享历史、共享焦点所在时间槽,也共享那8个干扰片段,唯一的变化就是焦点片段被替换成内容相近但支持度更弱的内容邻居。这种“单槽替换”极大压缩了变量空间,使得模型在事实与反事实上的任何分数差异,都能直接归因到那一处被替换的证据上。
轻量级评分器+结构化反事实学习:CBGER的核心机制
数据造好了,需要一个能同时答对“Where”和“Whether”的模型。如果基线模型做不到,可能会有人反驳说“只是现有方法没针对这个任务设计而已”。所以论文顺手提出了一个轻量级框架CBGER,用极少的可训练参数完成三维度学习。
模型的设计思路非常克制。首先,它使用冻结的CLIP图文编码器作为特征抽取器;CLIP(Contrastive Language-Image Pre-training,对比语言-图像预训练)能把图像和文本映射到同一个向量空间,这个空间里用户画像和视频片段天然可比。接下来,模型只训练一个轻量打分器:先用一个残差分支继承CLIP的语义相似度,再用一个很小的相对时间MLP补充时序关系,最终输出每个片段的证据分s_i。
有了打分通路还不够,关键是让模型学会对“反事实替换”做出正确响应。作者设计了一套结构化反事实损失,把事实时间线和反事实时间线喂进同一套参数,得到两组片段分数后,同时施加五个目标的监督,总损失如下方公式所示:
整套模型的可训练参数只有若干轻量投影矩阵、门控标量和那个小型MLP,CLIP双子塔完全冻结。这意味着它在推理时的开销几乎可以忽略,工程上非常友好。更难得的是,它把“Where、Whether、Intervention”三个目标统一在同一个共享特征空间里,而不是各做各的、各训各的模块。这种“一个打分器、多个结构化约束”的设计,让模型既不会为了定位精度牺牲证据判断,也不会反过来为了排序正确而丢掉时间定位能力。
实验结果:定位相似但证据判断差距显著
为了验证CBGER的诊断价值,论文在CBGER-10K上对比了六类基线:冻结CLIP相似度、PR-Net(个性化高亮检测模型)、QD-DETR、TR-DETR、FlashVTG和MQVTG。其中QD-DETR、TR-DETR、FlashVTG和MQVTG都是近年来具有代表性的时序定位/高亮检测方法,原本使用语言查询;为适配任务,实验里把用户行为画像序列化文本作为查询输入。所有方法共享同一套CLIP ViT-B/32特征、同一套候选时间线和同一套评测实现,公平性有保障。
最有意思的对比发生在CBGER与QD-DETR之间。二者的时间定位能力几乎打平:CBGER的MRR为0.4432,QD-DETR为0.4231,差距只有0.0201;论文用按用户聚类的10,000次bootstrap重采样做了显著性检验,95%置信区间为[-0.0027, 0.0433],p值为0.0832——也就是说,从统计上看,CBGER的MRR并没有显著优于QD-DETR。但再看PairAcc,CBGER达到0.6977,比QD-DETR的0.5873高出整整11.03个百分点,95%置信区间为[0.0765, 0.1430],p值小于0.0001;Intervention也提升了4.7个百分点,p值为0.0022。这个结果直接验证了论文的核心观点:两个模型的时间定位精度相近,并不意味着它们在“这条视频到底有没有为用户提供足够证据”这件事上同样可靠 。
再看传统时间定位方法的整体表现:TR-DETR的PairAcc为0.6320,FlashVTG为0.6207,MQVTG为0.6073。它们都具备不错的定位能力,但在“证据被替换后视频级分数是否下降”这个考验上,全部低于CBGER约6到9个百分点。这说明只靠“找出最相关片段”训练出来的模型,确实容易学会一种捷径:在9个片段里选一个最高的,而不去判断这个最高值是否真的达到了“证据门槛”。
局限与展望:诊断基准而非部署模拟
必须强调,CBGER-10K是一个诊断基准,而不是对真实推荐系统的完整模拟。作者在论文里明确列出了几条边界:
第一,标签是“银的”。Qwen3-VL负责语义标注,BGE-M3负责画像与片段匹配,这两个模型都可能自带偏见。虽然作者在构造时过滤了不确定性高于0.5的样本,并把构造所用的表征与下游模型的冻结CLIP特征隔离开,降低构造者到求解器的直接泄漏,但无法彻底消除大模型自身的“教师偏差”。
第二,反事实替换片段只是在构造标准下“行为支持更弱”,并不保证对所有用户都绝对无关。第三,用户历史来自MicroLens,候选视频来自FineVideo,因此这个基准衡量的是“行为支持的证据”,而不是用户真实曝光下的反馈,更不能说明现实中用户会不会真的点击。第四,固定九段时间线、冻结CLIP骨干这些设计提高了实验可控性,但也限制了对无限长、跨域视频的泛化。最后,PairAcc衡量的只是配对内的相对排序,不是校准后的参与概率。
这些局限并没有削弱论文的意义,反而划清了它的适用边界:它适合用来给推荐模型做“压力测试”,排查模型是否真的依赖个性化证据,而不是预测线上点击率。如果以后要落地,可以沿着三条路径走:一是用更高精度的多模态大模型加人工抽检来生成更干净的金标签;二是把固定九段扩展成动态可变窗口,贴近真实视频长度分布;三是把CBGER-10K的构造思路改造成轻量级评估工具,嵌入视频平台的内容理解pipeline中,对“推荐理由是否有据可依”做常态化监控。
龙迷三问
这篇论文到底在解决什么问题? 传统视频推荐与时间定位只回答"哪里相关",却回避"是否真有证据支持推荐给这个用户"。
这篇工作最值得看的点是什么? CBGER在所有三个评估维度上均取得最佳性能:MRR 0.4432、PairAcc 0.6977、Intervention 0.6987。与QD-DETR相比,MRR差异不显著(p=0.0832),但PairAcc提升11.03个百分点(p<0.0001),Intervention提升4.70个百分点(p=0.0022)。
这篇工作的边界或风险在哪里? 优点:(1) 提出新颖的Where-Whether-Intervention三维评估框架,揭示定位精度与证据可靠性之间的差距;(2) 构建了大规模受控反事实基准CBGER-10K,具有用户和来源不重叠的划分;(3) 模型设计紧凑高效,参数无关的均值池化策略简洁有效;(4) 结构化反事实学习损失函数设计合理,消融实验验证各组件贡献。缺点:(1) 基准构建依赖自动标注(Qwen3-VL和BGE-M3),存在教师偏差风险;(2) 固定9片段时间线限制了对任意长度视频的泛化能力;(3) 使用冻结CLIP特征,未探索更强大的视觉表示;(4) 反事实替换仅保证行为支持度较弱,不保证语义无关性。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出CBGER框架,将个性化视频证据检索解耦为Where(片段级定位)与Whether(视频级证据存在性)两个决策维度,通过结构化反事实监督联合训练,使用参数无关的均值池化聚合片段分数以判断证据存在性。
实验合理度: ★★★★☆
MRR、NDCG@1/3/5(Where),Pair Accuracy(Whether),Intervention Consistency(干预一致性)
学术研究价值: ★★★★☆
提出CBGER框架,将个性化视频证据检索解耦为Where(片段级定位)与Whether(视频级证据存在性)两个决策维度,通过结构化反事实监督联合训练,使用参数无关的均值池化聚合片段分数以判断证据存在性;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
模型轻量,仅训练投影层和相对时间MLP,参数量远小于完整transformer架构,适合快速训练和推理。
复现难度: ★★★☆☆
https://anonymous.4open.science/r/cbger-111E
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 现有材料尚未充分覆盖分布外泛化、部署成本、长期稳定性和失败案例。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!