← 返回 PaperDaily 视觉与图像

仅用7%成本就吊打全场?北卡大学提出TIMEPROVE,让长视频问答学会“先找证据再说话”

长视频问答一直是个“贵”且“难”的活儿——处理一小时视频,光视觉token就超200万。北卡大学夏洛特分校的TIMEPROVE,提供了极其优雅的解决思路:先用轻量级的动作检测模块“侦察”出关键证据片段,再只把这些精挑细选的短片段送给VLM做“终审”。结果准确率涨了7.3%,VLM调用次数锐减75%,推理成本暴跌93%!这简直就是给LVQA这个“烧钱”领域的一

仅用7%成本就吊打全场?北卡大学提出TIMEPROVE,让长视频问答学会“先找证据再说话”
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
长视频问答一直是个“贵”且“难”的活儿——处理一小时视频,光视觉token就超200万。北卡大学夏洛特分校的TIMEPROVE,提供了极其优雅的解决思路:先用轻量级的动作检测模块“侦察”出关键证据片段,再只把这些精挑细选的短片段送给VLM做“终审”。结果准确率涨了7.3%,VLM调用次数锐减75%,推理成本暴跌93%!这简直就是给LVQA这个“烧钱”领域的一剂经济适用“良药”。


原论文信息如下:
论文标题:
TIMEPROVE: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living
发表日期: 2026年6月
发表单位: 北卡罗来纳大学夏洛特分校
原文链接: https://arxiv.org/pdf/2606.20561v1.pdf
开源代码链接: https://github.com/thearkaprava/TimeProVe
项目链接: https://thearkaprava.github.io/timeprove/

想象一下,你有一个小时的监控录像,想知道“这个人吃药了吗?吃完药之后喝水了吗?”如果让如今的VLM来处理,以1 FPS采样、SigLIP编码器为例,一小时视频就能产生超过260万个视觉token。单次推理代价高到令人发指,实际部署几乎不可承受。
北卡大学夏洛特分校的研究团队给出的答案是:TIMEPROVE——先提出假设(Propose),再进行验证(Verify)。

长视频问答的成本黑洞,TIMEPROVE如何打破?

解决LVQA成本问题,主要有几条路线:密集caption让LLM读,但依赖caption质量,易丢失细粒度动作;token压缩常伴随细节丢失;记忆机制易发生“信息飘移”。这些方法本质上还是在“处理全部视频”。
TIMEPROVE的思路截然不同:不追求“处理全部”,而是追求“只在需要的时候处理”。它把过程解耦成两个阶段:一个昂贵的、能“看”的VLM,只有在证据确凿需要“终审”时才被请出来。
下图直观展示了这一理念。传统方法(上)需要把整个长视频喂给VLM,而TIMEPROVE(下)则先通过ACE模块定位到几个小的相关片段,然后只将这些片段发送给VLM验证,极大降低了计算与传输成本。
图1:TIMEPROVE通过先本地提出与查询相关的证据,再进行VLM验证,大大降低了长视频LVQA的成本。
图1:TIMEPROVE通过先本地提出与查询相关的证据,再进行VLM验证,大大降低了长视频LVQA的成本。

方法概述

TIMEPROVE整体框架如图2。它由两个核心组件构成:一是基于动作的候选证据模块(ACE),在本地轻量级处理整个视频;二是时序验证器(Temporal Verifier),只在云端调用昂贵VLM对ACE递来的候选片段进行最终核实。
图2:TIMEPROVE 总览。ACE 从全视频中构建时序动作结构并生成查询相关的假设。
图2:TIMEPROVE 总览。ACE 从全视频中构建时序动作结构并生成查询相关的假设。

Step 1:轻量ACE模块,生成“靠谱”候选

ACE模块是TIMEPROVE的“侦察兵”,它有两个主要部分。

动作检测器:全视频的“快速扫描”

一个轻量级(仅17M参数)的时序动作检测器MS-Temba对整段视频进行一次性的快速扫描。它把视频分成小段,预测每一段发生了哪些动作(如“坐下”、“喝水”),构成一条稀疏的“动作时间线”。这个模块处理完整视频但非常快,因为它只输出动作标签和时间。

查询条件化提案生成器:给“线索”排队

有了动作时间线,哪些“线索”和用户问题最相关?这由查询条件化提案生成器(一个边缘LLM,如Gemma4-2B)来完成。它干三件事:
候选窗口构建:为每个检测到的动作生成一个“原子窗口”。如果问题需要更广泛的上下文,还会把相邻或重叠的动作窗口合并成“合并窗口”。
评分与重排序:候选窗口很多,但全送去VLM验证依然是浪费。ACE通过一个精巧的评分函数进行本地排序,综合考虑四个因素:时间兼容性(窗口时间点是否符合问题时序意图)、语义相关性(窗口内动作与查询词匹配程度)、概念覆盖率(窗口内动作集合覆盖多少查询概念)、窗口紧凑性(避免过长片段)。
下图展示了各个评分指标的影响。时间兼容性(Rtmp)最重要,去掉它性能直接掉到和无排序版本差不多。
图3:评分指标。去掉时间兼容性(Rtmp)导致性能大幅下降。

Step 2:云端VLM精准“终审”,效率与精度兼得

ACE模块选出了得分最高的候选答案及其对应的证据窗口。接下来,TIMEPROVE将这个短的RGB视频片段,连同原始问题和候选答案,一起发送给部署在云端的、能力更强的VLM(如VideoLLaMA3或GPT-4o)。
VLM扮演严格的“终审法官”角色,判断短片段中是否包含足够视觉证据支持候选答案。如果确认,系统输出最终答案及证据;如果被驳回,自动转到下一高分候选,直到验证预算耗尽。这种设计使VLM不再需要“大海捞针”,只需要“精确打击”。

OTB新基准:考验真实ADL场景的时序推理

现有长视频问答基准大多是多选题,选项泄露信息且少有精确时间定位标注。论文推出了OPENTSUBENCH(OTB)——一个建立在丰田智能家居未经剪辑视频(TSU)基础上的开放域基准。
OTB包含3,567个问答对,覆盖185段未经剪辑的日常活动(ADL)视频,平均每段21分钟。按推理难度划分为5个层级:Object-Centric(物体中心)、Temporal Positioning(时序定位)、Compositional Actions(复合动作)、State Transition(状态转换)、Long-Horizon Sparse Evidence(长跨度稀疏证据)。
图5:OPENTSUBENCH(OTB)概览。
图5:OPENTSUBENCH(OTB)概览。

实验全面碾压,成本降低93%!

表1展示了TIMEPROVE在OTB上与SOTA方法的对比。基线包括有监督微调VLM(如VideoLLaMA3、Qwen2.5-VL等)和基于智能体的框架(如VideoTree、VideoAgent、GPT-4o)。
表1:与SOTA方法在OPENTSUBENCH上的对比。
表1:TIMEPROVE(Qwen2-7B + GPT-4o)以45.1%总体精度领先,比最强基线VideoAgent(33.9%)提升11.2%。
TIMEPROVE在“时序定位”和“长跨度稀疏证据”层级上尤其突出,分别拿到47.9%和35.7%的准确率。效率对比(表3)显示,TIMEPROVE只处理123.6秒视频,延迟18.7秒,准确率却高出近10个百分点。
表3:效率对比。
表3:效率对比。TIMEPROVE以123.6秒处理时长、18.7秒延迟达到44.8%准确率。
在Charades-STA数据集上(表4),TIMEPROVE+Time-R1在R1@0.5达到62.0%,成为新SOTA。消融实验(表2)验证了每个组件的贡献:动作检测器提升24.7→36.4%,边缘LLM再提升3.6%,评分重排序再提升2.7%。
表4:在Charades-STA上的时序定位结果。
表4:TIMEPROVE+Time-R1在R1@0.5达到62.0%。
表2:消融实验。
表2:消融实验。

龙迷三问

为什么用动作检测器而不是直接用VLM做候选?动作检测器仅17M参数,跑一遍全视频只需几毫秒;VLM处理一帧就要上千tokens。用动作检测器相当于用极其廉价的“筛子”先粗筛一遍,过滤掉99%不相关片段。

为什么不包括一些最新的长视频VLM?从效率结果(表3)看,Full-Video方法准确率仅35.0%,落后于TIMEPROVE的44.8%。单纯增加上下文长度并不会带来更好的推理——稀疏证据需要精准定位。

如果动作检测器预测不准会崩吗?论文做了鲁棒性分析:即使给动作开始/结束时间加上±6秒随机偏移,精度仅下降不到2%;即使随机替换20%动作标签,精度下降也不到4%。TIMEPROVE对动作检测误差很鲁棒。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

提出了“提案-验证”混合范式,将动作检测与VLM验证解耦,思路新颖且优雅。但整体框架延续了“先检索后验证”的基本路线。

实验合理度:★★★★★

对比基线全面,在OTB、Charades-STA两个基准上均做了测试,提供了详细消融和效率分析。开源了OTB基准和代码。

学术研究价值:★★★★✰

为长视频高效时序推理提供了一种实用的低成本范式。OTB基准的开源将推动领域发展。方法更偏向工程优化,理论深度中等。

稳定性:★★★★✰

对动作检测误差具有较好鲁棒性,但整体系统依赖于动作检测器性能。不过论文显示了替换更强检测器的能力。

适应性以及泛化能力:★★★★✰

在ADL视频和日常动作视频上都取得了好成绩。但尚未在室外、多视角等更具挑战性的场景中测试。动作检测器需要预定义动作类别。

硬件需求及成本:★★★★★

推理成本降低93%,VLM调用减少75%,可在普通CPU/边缘设备上跑ACE,云端仅需少量VLM推理。对实际部署非常友好。

复现难度:★★★★★

论文已开源代码,提供完整配置和提示词。使用的模型都公开可得,复现门槛低。

产品化成熟度:★★★★✰

已具备产品化雏形:混合部署非常适合实际场景。但还需要做更多场景适配。

可能的问题:1. 动作检测器依赖预定义动作类别,对开放世界新动作无法检测;2. 当查询所需证据完全不包含已知动作时,ACE无法生成候选;3. 论文没有分析验证预算耗尽时的性能表现。


主要参考文献

[1] Sinha, Arkaprava, et al. "TIMEPROVE: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living." arXiv:2606.20561, 2026.
[2] Dai, Rui, et al. "Toyota Smarthome Untrimmed: Real-World Untrimmed Videos for Activity Detection." arXiv:2205.xxxxx, 2022.
[3] Wang, X., et al. "VideoAgent: Long-form Video Understanding with Large Language Model as Agent." arXiv:2403.xxxxx, 2024.
[4] Sinha, Arkaprava, et al. "MS-Temba: Multi-Scale Temporal Encoder for Mobile Action Detection." (2026).
[5] Zhang, B., et al. "VideoLLaMA3: A Large Video-Language Model." arXiv:2503.xxxxx, 2025.

* 本文所有图片均来自原论文或项目主页,表格截图来自原论文。封面图来自项目主页演示视频。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨~ 想了解更多原文细节的小伙伴,可以点击"阅读原文"查看更多原论文细节哦!

end
TIMEPROVE给长视频问答带来了什么启发?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。