← 返回 PaperDaily
视觉与图像
越南AI挑战赛夺魁!Vortex多模态视频检索系统,单模型搞定4大任务,90.5%准确率!
想找一个能同时理解文本、图像、语音,还能进行时序推理和交互反馈的视频检索系统?Vortex做到了。它在一个统一的框架内,巧妙融合了最新的视觉语言模型和经典的检索算法,并在激烈的AI大赛中取得了90.5%的惊人成绩。这不仅仅是技术堆叠,更是一场工程与算法的完美交响。
龙哥读论文
发布于 2026-08-27 00:20:09
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 想找一个能同时理解文本、图像、语音,还能进行时序推理和交互反馈的视频检索系统?Vortex做到了。它在一个统一的框架内,巧妙融合了最新的视觉语言模型和经典的检索算法,并在激烈的AI大赛中取得了90.5%的惊人成绩。这不仅仅是技术堆叠,更是一场工程与算法的完美交响。
原论文信息如下:
好的,龙哥来安排!这篇有意思。
想象一下,你有一个巨大的视频库,里面是成百上千小时的新闻、体育、娱乐节目。现在,你要找到那个“主持人提到某种化学反应会释放氢气”的片段,或者“足球运动员在罚丢点球后庆祝”的连续镜头。这要是靠人肉看,眼睛不瞎也得看吐。但Vortex,这个由越南国立大学胡志明分校(VNU-HCM) 的FocusOnFun团队捣鼓出来的多模态视频检索系统,就在2025年胡志明市AI挑战赛(AIC'25)上,把这活儿干得漂漂亮亮。
它可不是简单的“看图说话”,而是把视觉、语言、语音 三条线索捏在一起,还加上了能跟人互动的“智能大脑”,最终在比赛中拿下了90.5% 的惊人成绩,尤其在问答任务上,直接拿了“杰出(Outstanding)” 评级。这到底是堆了多少技术?别急,龙哥带你一层层剥开它。
系统架构与数据处理:Vortex如何构建多模态视频检索框架
Vortex的整个系统架构可以看作是一个“预处理-索引-搜索-反馈” 的完整闭环。核心目标只有一个:把视频变成机器能理解、能快速搜索的“结构化数据”。
Vortex的整个数据预处理流水线,分为三大关键步骤 :
视频是连续的,但真正有用的信息往往集中在场景切换的时刻。Vortex采用“粗筛+细滤” 的两阶段策略。
第一阶段:镜头分割。 利用AutoShot 把视频按语义切分成“镜头”(Shot),把视频从“剧本”变成“章节”。
第二阶段:基于L2范数过滤的关键帧选择。 先每8帧采样一次,然后比较相邻采样帧之间的视觉差异,使用相对差异(relative difference) 指标。
关键帧有了,但机器还看不懂。Vortex又给它开了“天眼”和“顺风耳”:
“天眼”——Qwen2.5-VL模型。 做两件事:一是光学字符识别(OCR) ,读出画面里的文字;二是图片描述(Captioning) ,自动生成一句话描述画面内容,把像素信息变成文本信息。
“顺风耳”——Whisper模型。 OpenAI开源的语音识别模型,把视频里的音频转成带时间戳的文字,并与最接近的关键帧对齐,补全纯视觉所缺失的语义信息。
经过这三步,原始视频被转化为关键帧 + 图像特征 + 文本描述 + 语音文字 的丰富结构,存储在Milvus(向量数据库) 和Elasticsearch(文本检索引擎) 中,为后续快速检索打下基础。
混合检索策略:融合CLIP与SigLIP2,实现全局与细粒度语义平衡
很多检索系统只用一种模型做特征提取。但Vortex的团队发现,不同模型看问题的角度不同。CLIP 擅长理解大局,比如“这是一场足球比赛”;SigLIP2 擅长捕捉细节,比如识别球衣号码或广告牌文字。
它提出了一个混合检索(Hybrid Retrieval) 策略,核心是互惠排名融合(RRF,Reciprocal Rank Fusion) 。
第一步:双路检索。 用户输入查询,系统分别用CLIP和SigLIP2生成嵌入向量,去Milvus里各搜索一遍,得到两个按相似度排序的候选结果列表。
第二步:RRF融合。 两个排名列表合并成一个更牛的列表。RRF公式如下:
交互式查询优化:时序搜索与相关性反馈如何提升复杂查询的准确性
RRF虽然强,但遇到更复杂的场景,比如时序检索(Temporal Search) 和交互式反馈(Relevance Feedback) ,就需要更高阶的玩法了。
在AIC 2025中,有个任务叫TRAKE(Temporal Retrieval and Alignment of Key Events) ,要求系统不仅找到包含某个事件的视频,还要准确定位到“事件A发生后,紧接着事件B,然后事件C”这样的连续序列。
Vortex的解决方案:把复杂查询拆解成“之前(Before)、现在(Now)、之后(After)” 三个子问题,进行多阶段重排序。
系统先分别对三个子查询独立搜索,得到三个结果列表。然后,对于“现在”列表里的每个候选关键帧,检查同一视频里是否有在“之前”和“之后”列表中排名靠前的帧。最终得分是三者得分相加。
有时候第一次搜索的结果并不完美。Vortex提供了一种更智能的方式:相关性反馈(Relevance Feedback) 。
它基于经典信息检索算法Rocchio算法 。用户在结果列表里点“喜欢”或“不喜欢”,系统收集反馈后用下面的公式优化查询向量:
图5:时序搜索模式界面,提供“之前(Before)、现在(Now)、之后(After)”三个输入框。
LLM辅助查询理解:如何利用大语言模型进行查询解释而不偏离用户意图
Vortex用LLM的方式很谨慎。它不是让LLM自动重写用户的查询——因为这样容易产生幻觉或误解用户意图——而是把它当作一个“查询解释助手(Query Interpretation Assistant)” 。
比如,用户输入模糊的词“大楼”。LLM分析后给用户提供几个明确的选项:“您是想找一座高耸的写字楼、一栋正在施工的建筑,还是一所大学的教学楼?”用户自己选最符合意图的。这样,系统既利用了LLM的语义理解能力消除歧义,又把最终决定权牢牢握在用户手里,实现“前后双保险” :搜索前用LLM提炼查询,搜索后用Rocchio反馈优化结果,整个检索过程既智能又透明。
实验与结果展示:Vortex在AIC’25大赛中的卓越表现与案例分析
吹得天花乱坠,不如看真实战果。AIC 2025的初步轮(Preliminary Round)比赛,一共分三轮进行,Vortex的成绩变化非常有意思:
这张表完美展示了Vortex各模块的贡献:从只有CLIP的基线系统(20.6分),到加入混合RRF(CLIP + SigLIP2)后提升到27.8分,再到加入时序搜索和相关性反馈后飙升至31.2分。最终,Vortex以79.6/88(90.5%) 的总成绩杀入决赛,并在决赛轮中,整体表现被评为“优秀(Excellent)” 。其中,文本已知项搜索(TKIS)和视频已知项搜索(VKIS)表现优秀,时序检索(TRAKE)表现很好,而问答(Q&A)任务则获得了“杰出(Outstanding)” 的最高评级。
为了更直观地展示它的实战能力,我们来看几个在比赛中的实际查询案例截图:
龙迷三问
这篇论文主要解决了什么问题? 论文针对大规模视频库中的复杂检索任务,提出了一套名为Vortex的多模态视频检索系统。它不仅要处理常见的文字搜视频(Textual KIS),还要处理用视频搜视频(Video KIS)、视频问答(Q&A)以及多事件时序对齐(TRAKE)等挑战性任务。核心问题是如何融合视觉、文本、语音多种信息,并让机器能“理解”视频内容的上下文和时间关系,从而进行高效、精准的交互式搜索。
RRF, CLIP, SigLIP2, Rocchio这些缩写具体是什么意思? RRF (互惠排名融合)是一种融合多个排序结果的方法,通过计算排名的倒数来加权。 CLIP 和SigLIP2 都是多模态模型,能将图像和文本映射到同一个向量空间。 Rocchio算法 是一种经典反馈算法,通过调整查询向量向相关文档中心靠近,远离不相关文档中心,来优化检索结果。
Vortex系统的创新点主要在哪里?为什么不直接用LLM重写查询? Vortex的创新点在于系统级的“组合拳”:“双向量检索+RRF融合 + 时序重排序 + Rocchio反馈 + LLM辅助解释” 的一整套循环。不直接用LLM重写查询是为了避免“意图漂移”或“幻觉” ,确保用户对检索过程的完全控制。LLM只负责提供可能的解释选项,决策权还是用户自己。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★✰
系统级别的创新实打实,将RRF、CLIP+SigLIP2混合、多阶段时序搜索和Rocchio反馈捏合成闭环,在比赛中得到验证。
实验合理度: ★★★★★
实验在官方标准数据集上进行,评估指标和流程设计严谨,能清晰证明每个组件的贡献,结果说服力高。
学术研究价值: ★★★★✰
工程框架为后续多模态视频检索研究提供了完整范本,特别是如何平衡不同模型特性、设计交互式反馈、利用LLM而不被其绑架,有很高参考价值。
稳定性: ★★★★✰
比赛环境下表现稳定,四个不同类型任务都取得优异或优秀成绩。但仍是比赛系统,开放环境泛化能力需更多测试。
适应性以及泛化能力: ★★★★✰
系统设计已考虑多模态和多任务,但关键超参数和模型选择针对比赛数据集优化,迁移到别的领域可能需要重新调参。
硬件需求及成本: ★★★✰✰
使用了多个大型模型进行数据预处理和检索,对GPU和内存要求较高。但预处理是离线的,在线搜索通过向量数据库可快速响应。
复现难度: ★★★✰✰
代码未开源,核心组件可找到开源版本,但无缝组合并调优到比赛效果需要很强工程能力,复现有一定门槛。
产品化成熟度: ★★★✰✰
比赛系统已展示极高产品潜力,特别是交互设计。但要变为成熟产品,还需在用户体验、系统稳定性、扩展性上做更多打磨。
可能的问题: 论文主要贡献在于系统集成,而非单个组件算法创新。对Rocchio反馈的权重参数如何设定、对检索效果敏感度如何,没有进行消融实验。希望作者未来能开源代码,造福社区。
主要参考文献
[1] Nguyen D T, Tran-Minh H H, Lam K H, et al. Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval. arXiv:2606.19682, 2026.
[2] Cormack G V, Clarke C L A, Buettcher S. Reciprocal rank fusion outperforms condorcet and individual rank learning methods. In SIGIR, 2009.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
视频检索太强了!
想第一时间获取这种AI大赛的夺冠方案和前沿开源项目?
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 多模态检索+上海+胡志明大学+龙哥) ,根据格式备注,可更快被通过且邀请进群。