← 返回 PaperDaily 视觉与图像

康奈尔新基准揭秘:GPT-4o看电影败在“看不见”

康奈尔大学CVPR 2026新作,用电影解说视频自动构建8231个问答对,提出无参考评估新范式。结果发现GPT-4o、Claude 3.5等顶级模型看电影,视觉几乎帮不上忙,纯靠字幕反而分更高,值得所有做多模态的人细品。

康奈尔新基准揭秘:GPT-4o看电影败在“看不见”

paperdaily_reaction_gif


原论文信息如下:
论文标题:
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
发表日期:
CVPR 2026 录用(具体日期未公开)

发表单位:
康奈尔大学(Cornell University)

原文链接:
https://arxiv.org/abs/2601.02536


想象一下:你给AI放一部《搏击俱乐部》,问它:“主角被解雇后经历了怎样的挣扎?”它需要听懂台词里“let go”指被炒鱿鱼,再看画面判断人物反应,最后把两条线索拼起来。这是康奈尔大学在CVPR 2026上给出的新挑战——让AI真正“看懂”电影。
然而现实很骨感。现有视频问答基准大多停留在选择题阶段,模型就算没看懂视频,也能靠选项统计规律“蒙对”不少。更头疼的是,开放式问答的评估本身是个大坑——标准答案不唯一,语义相似度分数和人类判断相关性低得可怜。康奈尔团队找到了一个巧妙的突破口:YouTube上动辄百万播放量的“X分钟看完电影”解说视频。

引言

先聊一个反直觉的现象。大家刷短视频时,常看到“10分钟看完一部电影”的解说视频——画面剪辑飞快,旁白把故事线捋得明明白白。在大多数人眼里,这只是“电子榨菜”。但在康奈尔大学作者眼里,这些解说视频是“数据金矿”:它们天然地把电影关键画面和旁白叙述绑定在一起,一段话对应一段剧情,一段画面讲述一个事件,比人工标注高效得多。
基于此,团队构建了名为MovieRecapsQA的全新基准。它包含60部电影的8231个开放式问答对,每个问题都标注了所需模态类型(对话、视觉、多模态),还配套了人类评估子集。核心贡献有两块:一是构建高质量多模态问答基准,二是提出一套无参考(reference-free)评估指标,让开放式问答的自动评估终于能跟人类判断对齐。
那大模型“看电影”的能力到底怎么样?论文里用了一个扎眼的词——视觉信息差距(Visual Information Gap)。实验发现,GPT-4o、Claude 3.5 Sonnet等顶级闭源模型,在只看字幕的情况下,事实性得分居然比“视频+字幕”都高。换句话说,把图像输入给模型,它反而不如不看。好比学生考试时配了台显微镜,看完后答得还不如裸眼——显微镜没帮上忙,反而把他看晕了。
图1:MovieRecapsQA基准示例。来自《搏击俱乐部》的示例展示了多模态大模型如何利用解说视频帧和对齐的字幕来回答问题。
MovieRecapsQA基准示例。以《搏击俱乐部》为例,展示了多模态大模型如何利用解说视频帧与对齐的电影字幕来回答问题。Q1由事实(3)和(5)构建,需要整合视觉线索(帧2)与字幕证据(第4行和第6行)。图中展示了人类答案与模型输出的对比,基于0-5的事实接地量表评估相关性与事实性,颜色从低到高表示质量:X, X, ✓, ✓。

电影理解新挑战:开放式视频问答为何难以评估?

先回到基础问题:为什么视频问答到现在还没有一个让人满意的基准?浏览现有数据集就能发现,TVQA、MovieQA、DramaQA这些经典基准,清一色全是选择题。选择题的好处是评估简单——答案非A即B,机器自动判分就行;但坏处也很明显,模型完全可以通过选项之间的语言先验来“蒙混过关”,不需要真正理解视频。就连CinePile这种2024年的新基准,也依然采用选择题形式。
真正开放式的问答基准少得可怜,难点卡在两头:一头是“出题难”,要有专业人工标注才能设计出需要多模态推理的高质量问题,成本高到不现实;另一头是“打分难”,开放式的回答五花八门,用ROUGE、BERTScore这些传统指标去衡量和人类判断的相关性极低。更尴尬的是,在文本问答里,拿大模型当裁判(LLM-as-a-judge)已快成标配,但这一套搬到视频问答里就失灵了——总不能让裁判先把一整部电影看完再打分吧?那计算成本和管理成本都吃不消。
所以,要突破这个僵局,关键不是设计更好的模型,而是先设计更好的数据和评估方式。MovieRecapsQA的思路就是从数据源头解决问题——用解说视频这个中间表示,把“出题”和“打分”两步全部自动化。

MovieRecapsQA:从解说视频自动构建多模态问答基准

先看整体流程。MovieRecapsQA的数据构建分两大步:第一步是“收集与对齐”,把解说视频和原片逐场景对齐;第二步是“问答生成”,从解说词里抽取事实并生成问题。这两步之间有一个关键的耦合点:解说视频中旁白和画面的严格对应关系,是后续对齐和问答生成的基础
先说说数据收集。团队选了1980到2024年间60部电影,覆盖《阿凡达》这种大众片和《元年》这类小众片。解说视频的来源是YouTube上10个最受欢迎的解说频道,通过官方API抓取每部电影排名前五的搜索结果,再人工筛选确认解说内容确实与电影剧情对得上。
这里有个很细节的处理:很多解说频道为了避免版权问题,故意不在标题里写电影名。所以研究者要对解说视频前10秒做OCR识别,把电影标题提取出来,才能确认是哪部电影的解说。拿到视频后,再用付费服务Rev.ai转录旁白,得到带时间戳的解说词。
接下来是重头戏:场景对齐。解说视频是剪辑过的,单独看视频猜不出它在原片里的位置,需要算法自动匹配。具体做法是:先用SceneDetect把原片和解说视频都切成场景,然后用SlowFast模型提取每个场景首尾三秒的视频特征,再算余弦相似度来匹配对应的镜头。
不过解说视频为了叙事节奏,经常会打乱原片的顺序。为了处理这种乱序,论文里还加了一个“半时序对齐”的统计校准步骤。图S3展示了对齐效果——大多数情况下对齐结果接近一条对角线,说明时间顺序基本一致,但局部偶尔会有跳变,比如《元年》里解说提前引入了某个角色,导致左上角区域出现离群点。
图S3(a):《元年》解说视频与电影的对齐结果。
图S3(a):《元年》解说视频与电影的对齐结果。x轴是电影时间戳,y轴是解说视频时间戳,理想情况下应呈对角线分布。
图S3(b):《碟中谍》解说视频与电影的对齐结果。
图S3(b):《碟中谍》解说视频与电影的对齐结果。y轴方向较长的一段对应电影中时间很短但情节密集的段落,说明动作片中关键情节包含大量需要解说的信息。
对齐完场景之后,字幕自然就跟上了——因为字幕本来就带时间戳。这样一来,每个解说视频段落、对应的原片片段、以及相应的字幕,三者就全部联系起来了。
接下来是问答生成。拿到对齐好的数据后,问答对的构建采用了一套“三段式”提示词流水线,全部由GPT-4.1完成。
图2:MovieRecapsQA问答生成流水线。
图2:MovieRecapsQA问答生成流水线。以《大话王》解说视频的片段“00:06:50–00:12:42”(电影对应“00:31:44–00:50:12”)为例,红色高亮文本表示用于提取事实并生成对应问答对的片段输入。
第一步是事实抽取。把每段解说词喂给大模型,让它把文本拆解成原子事实——每个事实是一句可以独立验证的陈述句。比如“泰勒威胁要毁掉叙述者的公寓”就是一个原子事实。对于“他后来去了市中心”这种指代模糊的描述,提示词要求模型把代词还原成具体的人名,保证每条事实单独拿出来也说得通。
第二步是生成问答对。基于一段内的一个或多个事实,让大模型生成“详细版问题+答案”。但问题来了——直接用这些详细问题去考模型,往往太简单,因为问题里把关键信息都透露光了。而且很多问题会提到角色名字,正好字幕里对应段落不一定有这个名字,导致模型无法定位。
第三步是问题简化。针对这些问题,再让大模型生成一个“简化版”——去掉名字和具体细节,增加歧义性,让问题更难更贴近真实世界的提问方式。比如详细版问题是“尼奥吞下红色药丸后发现自己处于什么境地?”,简化后就变成了“一个人在做出某种选择后发现了什么?”。最终的问答对是取“详细版的答案”配上“简化版的问题”,这样既保证了答案有据可依,问题又足够有挑战性。
MovieRecapsQA的构造流程分成两大步:收集与对齐、问答生成。收集阶段选了1980至2024年间60部电影,覆盖《阿凡达》这类大众片和《元年》这类小众片;解说视频则来自YouTube上10个最受欢迎的解说频道。每个问答对都附带四层输入:解说视频片段、对应的原电影片段、对齐的字幕文本,以及支撑答案的原子事实集合。这种多粒度设计让研究者可以自由切换输入模态,单独考察视觉、对话或组合的作用。
对齐环节用SceneDetect把原片和解说视频切成场景,再用SlowFast提取每个场景首尾三秒的视频特征,通过余弦相似度匹配对应镜头。考虑到解说视频常为叙事节奏打乱顺序,还加了半时序对齐校准。问答生成则完全由GPT-4.1自动完成:先把解说词拆成原子事实,再由事实生成详细版问答对,最后做一轮“问题简化”让问题更难、更像真实提问。
与已有数据集相比,MovieRecapsQA的独特之处一目了然。下表汇总了主流视频问答数据集的对比:绝大多数老牌基准都是选择题,几乎没有模态标注;MovieRecapsQA不仅全是自由形式问答,还显式区分了对话、视觉和多模态三种问题类型。
表1:现有视频问答数据集对比。本文提出的数据集引入了多模态区分和自由形式问题类型,与之前的基准有所不同。
表1:现有视频问答数据集对比。MovieRecapsQA引入了多模态区分和自由形式问题类型,与之前的基准有所不同。
整个基准包含8231个问答对、16462条原子事实,平均每条问答对对应的原片片段约14分钟、解说片段约73秒。从问题类型分布来看,叙事与情节分析占比最高(3294条),角色与关系动态紧随其后(3149条),而模态分布上多模态问题最多(3525条),对话居中(2932条),纯视觉最少(1774条)。这组数据意味着模型要答好这套题,必须兼顾对话理解与画面细节。
表2:MovieRecapsQA数据集的整体统计信息。
表2:MovieRecapsQA数据集的整体统计信息。
表3:MovieRecapsQA的问题统计:模态分布(上)和类别分布(下),共8231个问题。
表3:MovieRecapsQA的问题统计:模态分布(上)和类别分布(下),共8231个问题。

无参考评估新范式:基于原子事实的事实性评分

评估框架是这篇论文最硬核的贡献。先看传统方案的槽点:ROUGE这类n-gram重合指标只能看表面文字;BERTScore、BARTScore虽然聪明些,但本质还是跟参考答案做相似度匹配。更致命的是,这些指标在长回答上给分极其“扁平”,稍微换个说法分数就崩。参考型LLM裁判(比如HELMET的Correctness维度)倒是能理解语义,可它依然被“标准答案”这一个锚点绑架——如果模型答得比参考答案更好,裁判反而给低分。
MovieRecapsQA的破局点是原子事实。所谓原子事实,就是从解说词里拆出来的一条条最小可验证命题,比如“泰勒威胁要毁掉叙述者的公寓”。每条事实都是独立、可验证的陈述,不依赖某个标准答案的措辞。评估时,裁判拿到的是“问题 + 模型回答 + 与该问题相关的原子事实集合 + 对应字幕”,然后对回答的事实性相关性分别打0到5分。
这样一来,裁判评判的是“回答有没有被视频事实支撑”,而不是“回答像不像参考答案”。大模型裁判用的是GPT-4.1 mini,论文里专门验证过它与GPT-4.1的评分一致性。问答对的数据结构可以形式化表达为:{问题、答案、解说视频片段、解说词片段、电影片段、电影字幕、原子事实集合}。这个结构是后续所有场景化评估的基础——你可以单独抽走视频只留字幕,也可以只留视频不放字幕,自由度极高。
表S12:无参考事实性评估的提示词。
表S12:无参考事实性评估的提示词。裁判被要求逐条核对模型答案中的陈述是否被给定事实支持。
表S13:无参考相关性评估的提示词。
表S13:无参考相关性评估的提示词。裁判需要判断模型回答是否紧扣问题,是否引入了没有依据的题外话。
论文还测了连贯性维度,但因为回答太短、内部矛盾不明显,连贯性分数的方差接近于零,区分度太低,干脆从主结果里去掉了,只放在附录里备查。这个细节很见功力——不为了凑指标而保留没信息量的维度。
表S7:连贯性分数(1-5)。所有模型和人类标注者的平均分±方差,保留两位小数。持续较低的方差证实连贯性对短文视频问答不是有区分度的指标。
表S7:连贯性分数。持续较低的方差证实连贯性对短文视频问答不是有区分度的指标。

七大多模态模型全面评测:视觉感知是最大瓶颈

基准建好了,接下来就是“考试”。论文一口气评测了七个主流多模态大模型:闭源的GPT-4o、Gemini 2.5 Flash、Claude 3.5 Sonnet、Amazon Nova Lite,开源的LLaVA-NeXT-Video、MiniCPM-o和Qwen2.5-VL。所有模型都在零样本设置下、用统一的提示词和输入格式进行测试——能直接吃视频的模型传视频,只能吃帧的模型均匀抽帧。
下表展示了所有模型在各类指标上的表现。注意看:语义指标那一栏,ROUGE-L全都挤在0.22到0.28之间,BERTScore也只在0.63到0.69之间波动,完全拉不开差距;而换到无参考评估的事实性分数,模型从2.96到3.99,队列一下子就拉开了。GPT-4o拿下了最高分3.99,但人类平均分是4.01、最佳人类是4.59,说明目前最强模型离人类的理解水平还有明显距离。
表4:模型性能总表。报告了语义指标、参考型评估和无参考评估下的模型表现,并加入了人类在118个问题抽样子集上的表现。
表4:模型性能总表。报告了语义指标、参考型评估和无参考评估下的模型表现,并加入了人类在118个问题抽样子集上的表现。
还有一个扎心的发现藏在模态维度里。按问题类型拆开看,纯视觉类问题的得分全线垫底:专有模型从对话类3.63降到视觉类3.15,开源模型从3.21降到3.05,连人类也从4.17降到3.84。这证实了一个判断:MovieRecapsQA里最难的关卡不是剧情推理,而是从画面里把细粒度视觉信息准确捞出来。
表5:消融实验。报告了开源模型和专有模型在无参考评估指标下的平均性能,按问题类型和类别拆分,包括仅视频帧、仅对话和完整上下文三种输入设置,并给出了人类平均表现。
表5:消融实验。报告了开源模型和专有模型在无参考评估指标下的平均性能,按问题类型和类别拆分,包括仅视频帧、仅对话和完整上下文三种输入设置,并给出了人类平均表现。

移除视觉输入反而提升性能?视觉信息差距的启示

论文里最反直觉的发现无疑是这一条:把视觉输入直接删掉,只看字幕,专有模型的事实性得分反而更高。对话类问题提升0.49分,视觉类问题提升0.73分,多模态问题提升0.70分。这意味着什么?意味着对GPT-4o这种级别的模型来说,视频帧不但没有帮它理解剧情,反而成了干扰源,把它从原本靠语言先验就能得出的正确答案上拽开了。
表S8/S9:模型在不同问题类型和类别上的平均表现(相关性/事实性)。箭头表示相对于完整模型基线的提升或下降。
表S8/S9:模型在不同问题类型和类别上的平均表现(相关性/事实性)。箭头表示相对于完整模型基线的提升或下降。
更耐人寻味的是,这种“视觉拖后腿”的现象在专有模型上尤其明显——它们本来拥有强大的语言先验和世界知识,视觉输入一旦质量不够,反而把回答带偏。开源模型本来语言先验就弱一些,视觉干扰的副作用相对小。这直接指向一个核心结论:当前多模态大模型在电影理解上的最大瓶颈是视觉感知,而不是视觉推理。换句话说,模型不是不知道看了什么该推理,而是根本没从画面里看到该看到的东西。
那人类的表现如何?人类在纯视觉问题上的确也会掉分,但掉得比模型少得多。更重要的是,人类能在多模态输入下稳定拿到4分以上,而模型在同样条件下大多在3分上下挣扎。论文把这种差距称为“视觉信息差距”:模型看不到、看不清画面里的细粒度视觉线索,比如角色的细微表情、场景里的关键道具。Relevance分数在各模态下都稳定在3.6到3.9,恰恰说明模型知道该关注哪里,但就是“看不清”后说不出所以然。
表S11:模型回答及评估的典型示例。问题是:“这群人用父亲留下的东西做了什么?”答案:“这群人剥了父亲的皮,用他处理过的皮肉做了面具和胸甲。”展示模型回答如何被逐条评估。
表S11:模型回答及评估的典型示例。展示模型回答如何被逐条评估。

总结与展望:迈向更可靠的多模态视频理解

MovieRecapsQA的贡献可以归结为一句话:把开放式视频问答从“没法大规模评估”变成了“可以自动可靠评估”。原子事实这套中介表示,既降低了数据构建成本,又让评估不再被单一参考答案绑架。更关键的是,它把长期被选择题基准掩盖的“视觉感知短板”第一次清清楚楚地暴露了出来——这对整个多模态领域都是一个有价值的警钟。
当然,这个基准也有边界。60部电影的数量在多模态数据集里只能算中等;电影题材偏叙事类,动作场面的视觉问题占比不高;自动对齐和GPT生成的原子事实也难免带噪声。未来的工作方向很清晰:把数据规模从电影扩展到纪录片、短视频、监控视频等更多长视频场景;把原子事实的验证从“对齐解说词”升级为“对齐原片画面”,甚至利用更好的视觉基础模型直接抽取可验证的视觉事实。
说到底,MovieRecapsQA更像一面镜子,照出了多模态模型在“看懂世界”这件事上的真实水位。那些让观众一眼就懂的镜头语言、转场暗示、表情细节,对当前最聪明的模型来说依然是一片迷雾。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?康奈尔大学提出MovieRecapsQA开放式视频问答基准,基于60部电影解说视频构建8231个问答对,首创无参考评估指标。评测7个多模态大模型发现:视觉感知是最大瓶颈,移除视觉输入反而提升事实性。
这篇工作最值得看的点是什么?论文提出的无参考评估指标能有效区分模型性能,且与人类偏好一致;视觉中心问题在所有模型上得分最低;移除视觉输入反而提升专有模型的事实性得分;主要瓶颈在于视觉感知而非推理。
这篇工作的边界或风险在哪里?优点:(1) 创新性地利用电影解说视频自动构建大规模开放式视频问答基准,解决了人工标注成本高的问题;(2) 提出基于原子事实的无参考评估框架,有效解决了开放式问答评估难题;(3) 数据集包含多粒度视频输入设置和模态类型标注,支持细粒度分析。缺点:(1) 数据集完全依赖自动生成,可能存在噪声和错误;(2) 评估指标依赖GPT-4.1 mini作为评判者,存在一定偏差风险;(3) 仅使用60部电影,规模相对有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

利用电影解说视频(recap videos)作为数据源,自动构建大规模开放式多模态视频问答基准,并提出基于原子事实的无参考评估指标。

实验合理度:★★★★☆

ROUGE-L, BERTScore, BARTScore, G-Eval, HELMET (Fluency & Correctness), 以及提出的无参考评估指标(Factuality, Relevance, Coherence)

学术研究价值:★★★★☆

利用电影解说视频(recap videos)作为数据源,自动构建大规模开放式多模态视频问答基准,并提出基于原子事实的无参考评估指标;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;(2) 提出基于原子事实的无参考评估框架,有效解决了开放式问答评估难题;(3) 数据集包含多粒度视频输入设置和模态类型标注,支持细粒度分析。缺点:(1) 数据集完全依赖自动生成,可能存在噪声和错误;(2) 评估指标依赖GPT-4.

主要参考文献

[1] Tapaswi et al. MovieQA: Understanding Stories in Movies through Question-Answering. CVPR 2016.
[2] Lei et al. TVQA: Localized, Compositional Video Question Answering in Episode Television. ICCV 2018.
[3] Choi et al. DramaQA: Character-Centered Video Story Understanding with Hierarchical QA. AAAI 2021.
[4] Rawal et al. CinePile: A Long Video Question Answering Dataset and Benchmark. NeurIPS 2024.
[5] Shaar et al. MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark. CVPR 2026.

融会贯通

把这篇论文放回PaperDaily已收录的工作里看,一个有趣的呼应出现了:视觉感知作为短板这件事,已经不止在一个基准里被独立观察到。不同团队用不同数据源、不同任务设置,最终都指向类似的结论——多模态模型对细粒度视觉信息的提取能力,远落后于其语言推理能力。MovieRecapsQA用40年跨度的电影和8.2K个开放问答再次印证了这一点,而且第一次把“无参考评估”的可行性落到了视频领域。
不过要提醒一句:PaperDaily已收录的相关论文里,暂时没有足够多的同基准数值可供直接横评,不同论文在视频采样方式、字幕对齐粒度、评分裁判模型上都有差异,不能简单断言某个模型“一定比另一个强”。这种横向对比的严谨性,恰恰是多模态评测领域最稀缺的品质——每个基准都在试图定义“看懂视频”这件事,但各自量出来的尺子还不完全一样。MovieRecapsQA的价值在于,它递上了一把更靠谱的尺子,剩下的就看整个领域怎么用了。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!     


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球