← 返回 PaperDaily 视觉与图像

越南AI挑战赛夺魁!Vortex多模态视频检索系统,单模型搞定4大任务,90.5%准确率!

想找一个能同时理解文本、图像、语音,还能进行时序推理和交互反馈的视频检索系统?Vortex做到了。它在一个统一的框架内,巧妙融合了最新的视觉语言模型和经典的检索算法,并在激烈的AI大赛中取得了90.5%的惊人成绩。这不仅仅是技术堆叠,更是一场工程与算法的完美交响。

越南AI挑战赛夺魁!Vortex多模态视频检索系统,单模型搞定4大任务,90.5%准确率!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
xingqiu_header

龙哥推荐理由:
想找一个能同时理解文本、图像、语音,还能进行时序推理和交互反馈的视频检索系统?Vortex做到了。它在一个统一的框架内,巧妙融合了最新的视觉语言模型和经典的检索算法,并在激烈的AI大赛中取得了90.5%的惊人成绩。这不仅仅是技术堆叠,更是一场工程与算法的完美交响。


原论文信息如下:
论文标题:
Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval
发表日期:
2026年06月
发表单位:
越南国立大学胡志明市分校(University of Science, VNU-HCM)
原文链接:
https://arxiv.org/pdf/2606.19682v1.pdf
好的,龙哥来安排!这篇有意思。
插图
同志们,朋友们,龙哥今天要聊的可不是什么天马行空的科幻故事,而是一个实实在在把“大海捞针”变成“精准定位”的硬核系统——Vortex
想象一下,你有一个巨大的视频库,里面是成百上千小时的新闻、体育、娱乐节目。现在,你要找到那个“主持人提到某种化学反应会释放氢气”的片段,或者“足球运动员在罚丢点球后庆祝”的连续镜头。这要是靠人肉看,眼睛不瞎也得看吐。但Vortex,这个由越南国立大学胡志明分校(VNU-HCM)的FocusOnFun团队捣鼓出来的多模态视频检索系统,就在2025年胡志明市AI挑战赛(AIC'25)上,把这活儿干得漂漂亮亮。
它可不是简单的“看图说话”,而是把视觉、语言、语音三条线索捏在一起,还加上了能跟人互动的“智能大脑”,最终在比赛中拿下了90.5%的惊人成绩,尤其在问答任务上,直接拿了“杰出(Outstanding)”评级。这到底是堆了多少技术?别急,龙哥带你一层层剥开它。

系统架构与数据处理:Vortex如何构建多模态视频检索框架

Vortex的整个系统架构可以看作是一个“预处理-索引-搜索-反馈”的完整闭环。核心目标只有一个:把视频变成机器能理解、能快速搜索的“结构化数据”。
先看这张总览图,感受下五脏俱全的麻雀:
图1:Vortex系统总体架构图
图1:Vortex系统总体架构图,包含两大工作流:查询处理与反馈循环。
Vortex的整个数据预处理流水线,分为三大关键步骤
图2:数据预处理流水线
图2:数据预处理流水线,包括关键帧提取、多模态特征提取和语音识别。

1. 关键帧提取:不放过任何“名场面”

视频是连续的,但真正有用的信息往往集中在场景切换的时刻。Vortex采用“粗筛+细滤”的两阶段策略。
第一阶段:镜头分割。利用AutoShot把视频按语义切分成“镜头”(Shot),把视频从“剧本”变成“章节”。
第二阶段:基于L2范数过滤的关键帧选择。先每8帧采样一次,然后比较相邻采样帧之间的视觉差异,使用相对差异(relative difference)指标。
关键帧选择公式
其中 e_currente_prev 分别是当前帧和上一个被保留的关键帧的嵌入向量。公式计算欧氏距离的相对变化率,只有当变化率超过0.4时,当前帧才被保留。这能有效过滤冗余帧,同时捕捉场景切换和动作发生的关键瞬间。

2. 多模态特征提取:给每一帧打上“身份标签”

关键帧有了,但机器还看不懂。Vortex又给它开了“天眼”和“顺风耳”:
“天眼”——Qwen2.5-VL模型。做两件事:一是光学字符识别(OCR),读出画面里的文字;二是图片描述(Captioning),自动生成一句话描述画面内容,把像素信息变成文本信息。
“顺风耳”——Whisper模型。OpenAI开源的语音识别模型,把视频里的音频转成带时间戳的文字,并与最接近的关键帧对齐,补全纯视觉所缺失的语义信息。
经过这三步,原始视频被转化为关键帧 + 图像特征 + 文本描述 + 语音文字的丰富结构,存储在Milvus(向量数据库)Elasticsearch(文本检索引擎)中,为后续快速检索打下基础。

混合检索策略:融合CLIP与SigLIP2,实现全局与细粒度语义平衡

数据准备好了,现在要回答一个核心问题:怎么搜?
很多检索系统只用一种模型做特征提取。但Vortex的团队发现,不同模型看问题的角度不同。CLIP擅长理解大局,比如“这是一场足球比赛”;SigLIP2擅长捕捉细节,比如识别球衣号码或广告牌文字。
Vortex的聪明之处,在于它全都要
它提出了一个混合检索(Hybrid Retrieval)策略,核心是互惠排名融合(RRF,Reciprocal Rank Fusion)
具体流程如下:
图3:检索模块:混合检索与互惠排名融合(RRF)
图3:检索模块:混合检索与互惠排名融合(RRF)
第一步:双路检索。用户输入查询,系统分别用CLIP和SigLIP2生成嵌入向量,去Milvus里各搜索一遍,得到两个按相似度排序的候选结果列表。
第二步:RRF融合。两个排名列表合并成一个更牛的列表。RRF公式如下:
互惠排名融合(RRF)公式
公式核心:对于每个候选关键帧d,新得分是它在CLIP和SigLIP2结果列表中排名的倒数之和(经常数k平滑)。如果某个关键帧在两个列表中排名都靠前,RRF得分会非常高。这综合了两种模型的优势,结果更鲁棒、更精准。

交互式查询优化:时序搜索与相关性反馈如何提升复杂查询的准确性

RRF虽然强,但遇到更复杂的场景,比如时序检索(Temporal Search)交互式反馈(Relevance Feedback),就需要更高阶的玩法了。

1. 多阶段时序搜索:理解视频的“前世今生”

在AIC 2025中,有个任务叫TRAKE(Temporal Retrieval and Alignment of Key Events),要求系统不仅找到包含某个事件的视频,还要准确定位到“事件A发生后,紧接着事件B,然后事件C”这样的连续序列。
Vortex的解决方案:把复杂查询拆解成“之前(Before)、现在(Now)、之后(After)”三个子问题,进行多阶段重排序。
系统先分别对三个子查询独立搜索,得到三个结果列表。然后,对于“现在”列表里的每个候选关键帧,检查同一视频里是否有在“之前”和“之后”列表中排名靠前的帧。最终得分是三者得分相加。
时序搜索最终得分公式
这个公式很直观:如果一个视频能把三个事件的精彩瞬间全包圆,最终得分S_final自然远超只包含单一事件的视频。

2. Rocchio相关性反馈:让机器越搜越懂你

有时候第一次搜索的结果并不完美。Vortex提供了一种更智能的方式:相关性反馈(Relevance Feedback)
它基于经典信息检索算法Rocchio算法。用户在结果列表里点“喜欢”或“不喜欢”,系统收集反馈后用下面的公式优化查询向量:
Rocchio算法公式
公式含义:新的查询向量 q_m,在原始查询向量 q_0 的基础上,加上所有“喜欢”的帧的平均向量,减去所有“不喜欢”的帧的平均向量。新的查询点更靠近用户想要的东西,同时远离不想要的东西,检索精度自然提升。
这套交互机制在用户界面上也设计得很贴心:
图4:系统用户界面概览
图4:系统用户界面概览,左侧为搜索管理,右侧为查询与结果展示。
图5:时序搜索模式界面,提供“之前(Before)、现在(Now)、之后(After)”三个输入框。

LLM辅助查询理解:如何利用大语言模型进行查询解释而不偏离用户意图

Vortex用LLM的方式很谨慎。它不是让LLM自动重写用户的查询——因为这样容易产生幻觉或误解用户意图——而是把它当作一个“查询解释助手(Query Interpretation Assistant)”
比如,用户输入模糊的词“大楼”。LLM分析后给用户提供几个明确的选项:“您是想找一座高耸的写字楼、一栋正在施工的建筑,还是一所大学的教学楼?”用户自己选最符合意图的。这样,系统既利用了LLM的语义理解能力消除歧义,又把最终决定权牢牢握在用户手里,实现“前后双保险”:搜索前用LLM提炼查询,搜索后用Rocchio反馈优化结果,整个检索过程既智能又透明。

实验与结果展示:Vortex在AIC’25大赛中的卓越表现与案例分析

吹得天花乱坠,不如看真实战果。AIC 2025的初步轮(Preliminary Round)比赛,一共分三轮进行,Vortex的成绩变化非常有意思:
表1:Vortex系统在AIC’25初步轮三个子轮的官方最终得分
表1:Vortex系统在AIC‘25初步轮的官方最终得分,清晰展示了模块集成带来的性能提升。
这张表完美展示了Vortex各模块的贡献:从只有CLIP的基线系统(20.6分),到加入混合RRF(CLIP + SigLIP2)后提升到27.8分,再到加入时序搜索和相关性反馈后飙升至31.2分。最终,Vortex以79.6/88(90.5%)的总成绩杀入决赛,并在决赛轮中,整体表现被评为“优秀(Excellent)”。其中,文本已知项搜索(TKIS)和视频已知项搜索(VKIS)表现优秀,时序检索(TRAKE)表现很好,而问答(Q&A)任务则获得了“杰出(Outstanding)”的最高评级。
为了更直观地展示它的实战能力,我们来看几个在比赛中的实际查询案例截图:
(a) tkis-02: 全局OCR过滤器搜索“hidro”
(a) 一个非常直接的查询:“释放氢气”。用户直接利用全局OCR功能搜了个单词“hidro”,系统立刻命中目标,这就是多模态中OCR的威力。
(d) qa-02: 初始搜索配料
(d) Q&A任务中,问题是一个三明治被切成了几块?用户首先搜索了描述中提到的“西瓜、菠萝、梨”等配料,快速定位到了相关视频的起始位置。
(e) qa-02: “附近帧”功能展示切的过程
(e) 定位视频后,使用“附近帧”功能,迅速找到明确展示被切成两块的画面,精准回答。这就是交互式时序搜索的强大之处。
(f) vkis-07: OCR过滤器搜索“DI TICH KIM LONG”
(f) 在视频KIS任务中,用户从视频里看到一个牌子上写着“DI TICH KIM LONG”(金龙遗迹),直接输入OCR搜索,系统秒定位。这对SigLIP2的细节识别能力是极大的考验。
(g) trake-03 (E1, 步骤1): OCR搜索记分牌 (i) trake-03 (E1, 步骤3): 通过视觉搜索精准定位进球瞬间
(g)(i) 在TRAKE任务中,用户需要定位“第一个进球”的精确帧。他先用OCR搜索记分牌找到进球后瞬间(g),然后利用“附近帧”功能回溯,再用视觉搜索精确锁定球越过门线的瞬间(i)。这个“OCR粗筛→时间导航→视觉精校”的流程,完美体现了Vortex在处理复杂时序查询时的交互能力。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文主要解决了什么问题?论文针对大规模视频库中的复杂检索任务,提出了一套名为Vortex的多模态视频检索系统。它不仅要处理常见的文字搜视频(Textual KIS),还要处理用视频搜视频(Video KIS)、视频问答(Q&A)以及多事件时序对齐(TRAKE)等挑战性任务。核心问题是如何融合视觉、文本、语音多种信息,并让机器能“理解”视频内容的上下文和时间关系,从而进行高效、精准的交互式搜索。

RRF, CLIP, SigLIP2, Rocchio这些缩写具体是什么意思?RRF(互惠排名融合)是一种融合多个排序结果的方法,通过计算排名的倒数来加权。 CLIPSigLIP2都是多模态模型,能将图像和文本映射到同一个向量空间。 Rocchio算法是一种经典反馈算法,通过调整查询向量向相关文档中心靠近,远离不相关文档中心,来优化检索结果。

Vortex系统的创新点主要在哪里?为什么不直接用LLM重写查询?Vortex的创新点在于系统级的“组合拳”:“双向量检索+RRF融合+ 时序重排序 + Rocchio反馈 + LLM辅助解释”的一整套循环。不直接用LLM重写查询是为了避免“意图漂移”或“幻觉”,确保用户对检索过程的完全控制。LLM只负责提供可能的解释选项,决策权还是用户自己。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

系统级别的创新实打实,将RRF、CLIP+SigLIP2混合、多阶段时序搜索和Rocchio反馈捏合成闭环,在比赛中得到验证。

实验合理度:★★★★★

实验在官方标准数据集上进行,评估指标和流程设计严谨,能清晰证明每个组件的贡献,结果说服力高。

学术研究价值:★★★★✰

工程框架为后续多模态视频检索研究提供了完整范本,特别是如何平衡不同模型特性、设计交互式反馈、利用LLM而不被其绑架,有很高参考价值。

稳定性:★★★★✰

比赛环境下表现稳定,四个不同类型任务都取得优异或优秀成绩。但仍是比赛系统,开放环境泛化能力需更多测试。

适应性以及泛化能力:★★★★✰

系统设计已考虑多模态和多任务,但关键超参数和模型选择针对比赛数据集优化,迁移到别的领域可能需要重新调参。

硬件需求及成本:★★★✰✰

使用了多个大型模型进行数据预处理和检索,对GPU和内存要求较高。但预处理是离线的,在线搜索通过向量数据库可快速响应。

复现难度:★★★✰✰

代码未开源,核心组件可找到开源版本,但无缝组合并调优到比赛效果需要很强工程能力,复现有一定门槛。

产品化成熟度:★★★✰✰

比赛系统已展示极高产品潜力,特别是交互设计。但要变为成熟产品,还需在用户体验、系统稳定性、扩展性上做更多打磨。

可能的问题:论文主要贡献在于系统集成,而非单个组件算法创新。对Rocchio反馈的权重参数如何设定、对检索效果敏感度如何,没有进行消融实验。希望作者未来能开源代码,造福社区。


主要参考文献

[1] Nguyen D T, Tran-Minh H H, Lam K H, et al. Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval. arXiv:2606.19682, 2026.
[2] Cormack G V, Clarke C L A, Buettcher S. Reciprocal rank fusion outperforms condorcet and individual rank learning methods. In SIGIR, 2009.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
视频检索太强了!
想第一时间获取这种AI大赛的夺冠方案和前沿开源项目?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 多模态检索+上海+胡志明大学+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。