← 返回 PaperDaily
视觉与图像
中科院新Agent:AI City 2026三赛通吃,FETV斩获亚军
一个统一框架同时接管监控、鱼眼和行车记录仪三类交通视频,在AI City 2026出战三个赛道,FETV与第一名只差0.0007。这套「观察-推理-行动-验证」的智能体工作流拆解起来很有嚼头,适合所有对多模态视频理解与跨域泛化感兴趣的读者。
龙哥读论文
发布于 2026-08-17 00:20:12
阅读 7
查看原文
原论文信息如下:
先说个结论:这篇论文不是那种憋大招憋出个新模型的类型,它更像是把「多模态大模型 + 智能体工作流」这套组合拳,在真实交通视频推理赛场上认认真真打了一遍,而且打得还不赖。开篇说了,这套框架零微调在 AI City 2026 拿下了 FETV 第二、PSI-VQA 第四,TAR 也跑进了公开榜前 20。那它到底是怎么做到的?先别急着钻进细节,先聊聊为什么这个问题本身就很难。
交通视频理解为何如此困难?
在第十届 AI City Challenge 的 Track 3 里,中科院团队这套名为 UniTrafic-Agent 的方案,拿下了鱼眼交通事件理解(FETV)第二名、行人意图问答(PSI-VQA)第四名,而且整个过程没有做任何任务特定的微调。换句话说,一个框架,三种镜头,零微调,直接跨域出成绩。这就是本文最值得读的地方。
如果只是人眼看,这当然不算难。可要是让多模态大语言模型(MLLM,Multimodal Large Language Model,可同时理解图像、文本等多模态信息的大语言模型)来做,麻烦就来了。第一,关键证据太稀疏。一段视频抽 8 帧可能全是普通场景,抽 16 帧刚好错过事故瞬间,抽 32 帧模型输入长度又吃紧。第二,视角差异太大。同一个“闯红灯”行为,在普通监控里是俯视全景,在鱼眼摄像头里是一张严重畸变的画面,在行车记录仪里又是另一个高低角度。模型在一种视角下学到的规律,换个摄像头可能完全不适用。第三,一个片段往往对应着多个问题,如果每个问题单独问一次,模型给出的回答可能互相矛盾——前面说“红色轿车闯红灯”,后面又说“蓝色SUV 闯红灯”,这种不一致在现实系统里是致命的。
第十届 AI City Challenge 的 Track 3 正好把这些难点全叠在了一起。赛道主任务是交通异常推理(TAR,Traffic Anomaly Reasoning,要求对监控视频中的异常事件进行多类型问答与原因推理),同时还附带两个跨域评测任务:鱼眼交通事件理解(FETV,Fisheye Traffic Event understanding,要求生成包含违规者、轨迹、道路、环境、时间等 13 个字段的结构化违规记录)和行人场景意图视觉问答(PSI-VQA,Pedestrian Scenario Intention Visual Question Answering,要求判断红框标记行人的过街意图并定位支撑证据)。三种镜头域、三种问题体系、三种输出格式,却要求同一个系统通吃。这就是 UniTrafic-Agent 要解决的问题。
UniTrafic-Agent:一个统一的观察-推理-行动-验证框架
UniTrafic-Agent 的思路很明确:与其为每个赛道单独训练一个模型,不如把整个流程拆成四个环节——观察(observe)、推理(reason)、行动(act)、验证(verify),让同一个多模态大语言模型在这四个环节里各司其职。注意,这四个环节不是四个不同的模型,而是同一个模型在不同阶段做不同的事。整套系统把“视频片段”而不是“单个问题”作为基本推理单元,一次请求同时处理一个片段的所有任务输出。
观察环节负责选帧,目标是花最少的帧数捕捉最多的有效信息;推理环节负责理解,把选中的帧连同所有问题一起丢给模型,生成一个共享的事件描述——道路布局、相关参与者、事件从发生到结束的时间演变、最终结果;行动环节是任务适配器,把这份共享理解转换成 TAR、FETV、PSI-VQA 三种赛道各自要求的格式;验证环节则以“官方标识符校验、类别值归一化、时间区间合法性检查”等方式兜底,遇到解析失败或者缺漏的情况,会用缓存的视觉证据重新取帧再试一次。
这套流程最讨巧的地方在于,三个赛道共享了观察策略、模型接口、缓存机制和验证流程,唯一不同的是行动适配器。换句话说,换赛道不需要换框架,只需要换一个“翻译官”。下面把每个环节拆开看。
时间戳感知采样:如何抓住关键帧
视频理解的第一步是选帧。把整段视频所有帧都发给模型,先不说输入长度允不允许,光计算成本就扛不住。UniTrafic-Agent 把选帧预算限制在最多 32 帧,其中 16 帧用于全局均匀覆盖,让模型对整段视频有个整体印象。但仅仅均匀采样远远不够,因为交通事件往往只出现在很短的瞬间,均匀采样很可能完美错过。
于是系统引入了一个“时间戳感知”机制。在 TAR 和 PSI-VQA 里,问题本身可能带有明确的时间戳,比如“在 00:12 到 00:15 之间发生了什么”。对于这类带时间锚点的问题,系统会在每个锚点的前后各 1 秒范围内再密集采样一小组帧,把关键瞬间的细节补上。除此之外,系统还会根据视频总时长动态生成一个“持续时间自适应网格”——视频越长,网格点越多,避免把长视频的时间结构压缩得太狠。
如果这些候选帧加起来超过了 32 帧的预算,系统会按照优先级排序来裁剪:靠近时间戳锚点的帧和视频首尾帧优先保留,剩下的名额再从均匀网格里补充。最终所有帧按时间顺序排列并去重,每帧都配上对应的时间戳,打包成一份“有序帧包”发给模型。为了让模型能正确理解相邻帧之间的时间间隔,提示词里还会专门说明:相邻输入帧之间可能相隔好几秒,请勿把它们当作连续视频流。
这里还有一个工程上很实用的细节:解码后的 JPEG 帧会被缓存下来,而且用质量 100、最大边长 768 像素的配置保存。一旦某个请求因为网络或者解析问题失败,重试的时候用的是同一批缓存帧,不会因为重新解码产生像素级差异。这种“所见即所得”的缓存策略,保证了错误恢复的一致性,也避免了重复解码带来的计算浪费。
视频级联合推理:如何保证预测一致性
选好帧之后,下一步是让模型理解视频内容。一个很自然的做法是把每个问题单独发给模型,分别得到答案。但这样做有一个隐患:同一个片段里的多个问题描述的是同一件事,如果每个问题独立回答,模型可能在回答“这辆车是什么颜色”时说红色,在回答“事故原因是什么”时又说“蓝色车辆变道导致”,前后矛盾。
UniTrafic-Agent 的做法很直接:把一段视频的所有问题和输出字段拼进同一个请求,让模型先建立一份共享事件上下文,再基于这份上下文统一回答所有问题。 提示词会引导模型先观察道路布局,识别相关参与者,梳理事件从初始状态到最终结果的完整演变过程,然后一次性输出所有答案。这样做的直接收益是:参与者身份、因果解释、时间边界在这些答案之间保持一致,不会出现各说各话的情况。
从成本角度看,视频级联合推理也比“逐问题调用”更省。一个片段如果有 9 个问题,逐问题调用需要发 9 次请求;联合推理只需要 1 次请求,输入里带上所有问题。虽然单次请求的输入 token 变长了,但总开销仍然更划算,而且不同请求之间的延迟也被省掉了。官方代码里还支持视频级请求并行处理,多个视频可以同时跑,吞吐量进一步拉高。
任务特定适配器:如何适配三个异构基准
共享事件上下文生成之后,接下来要面对的问题是:三个赛道的答案格式差异实在太大了。TAR 要的是 CSV 格式的混合答案,包含二选一题、多选题、自由文本描述、因果解释、摘要和时间区间;FETV 要的是 JSON 格式的 13 字段违规记录,包括违规者类型、颜色、初始位置、最终位置、初始车道、最终车道、交叉口类型、天气、光照、日期、时间、事件描述等;PSI-VQA 要的则是某个特定行人的过街意图、支撑性视觉线索和时间区间。指望模型直接输出三种不同格式且完全符合官方规范,显然不现实。于是就有了任务特定适配器,它的作用是充当“翻译官”。
在 TAR 适配器里,系统会对 BCQ(Binary Choice Question,二选一问题)和 MCQ(Multiple Choice Question,多选题)的选项做约束,让模型只能从给定选项里选择,同时允许开放式任务输出自由文本。最终预测结果会被匹配到官方标识符,写入 CSV。在 FETV 适配器里,系统把事件解释拆解成 13 个字段,并特别区分“3×3 网格中的位置”和“由行驶方向定义的车道编号”——这两个概念在鱼眼视频里很容易混淆。在 PSI-VQA 适配器里,系统会识别红框标记的目标行人,并区分“观察到的运动”和“推断出来的过街意图”这两种不同层次的信息,决策相关的时间区间则覆盖“从行人开始影响驾驶决策到相关动作结束或行人离开视野”的整段时间。
写完适配器,还需要一道验证关卡。验证环节会恢复官方标识符、归一化类别值、验证时间区间合法性、检查输出完整性,但不会去修改语义上本来正确的答案。所有原始响应和校验结果都会留存,方便赛后做错误分析。如果某个输出缺失或者无法解析,系统会用缓存的帧发起重试。整套机制保证了系统不是“答完就完”,而是“答完还要查一遍”。
实验结果:域外泛化的胜利与不足
先看总成绩。MR-CAS(中科院计算所团队)在三个任务上的官方公开榜表现如下:TAR 排第 16,得分 0.5780;FETV 排第 2,得分 0.4884,与第一名仅差 0.0007;PSI-VQA 排第 4,得分 64.4161。
这个成绩最值得注意的地方在于:FETV 和 PSI-VQA 都是 TAR 之外的跨域评测,一个来自鱼眼镜头,一个来自行车记录仪。也就是说,这套系统并没有针对这两个赛道做任何微调,仅靠 TAR 赛道上的通用能力就拿到了第二和第四。零微调跨域,这在竞赛里是不多见的。下面逐赛道拆解一下各个组件分数的细节。
先解释评测指标。TAR 的总分公式是 9 种任务类型的未加权平均,其中包含 BCQ(二选一题准确率)、MCQ(多选题准确率)以及 7 种开放任务(场景描述、因果关联、时间描述、摘要、时间定位等)的 BERTScore F1。
这里 BERTScore 是一种基于 BERT 语义相似度的文本生成评估指标,它不要求生成文本与参考文本逐字相同,而是看语义是否接近。FETV 的总分则按 0.25·CIDEr + 0.25·BERTScore + 0.5·MacroF1 加权,其中 CIDEr 是图像描述领域经典的 n-gram 匹配指标,MacroF1 是对每个结构化属性字段单独算 F1 再取平均的宏平均 F1。
PSI-VQA 则包含四个子任务:PSI-T1 用宏平均 F1 评估过街意图判断,PSI-T2 用线索级 F1 评估视觉线索识别,PSI-T3 用准确率评估多选推理,PSI-T4 用时间定位的平均交并比(mIoU,mean Intersection over Union,即预测时间区间与真实决策相关区间重叠度的均值)评估时间边界预测,四个子任务等权相加。
TAR 的表现呈现明显的“选择题强、开放文本弱”的两极分化。BCQ 准确率 0.9187,MCQ 准确率 0.9500,MCQ-OE(多选题的开放解释 F1)达到 0.9604,与领先队伍持平。但在开放文本类任务上差距被拉大:场景描述只有 0.2667,时间描述 0.3248,摘要 0.3992,均显著落后于领先队伍。比较亮眼的是时间定位(Temporal localization)达到了 0.6936,与领先队伍的差距相对较小。这个组合说明,系统能够定位到异常事件发生的时间段,但在把事件细节以参考答案相同的粒度表述出来这件事上还欠火候。
FETV 是 MR-CAS 表现最好的赛道,0.4884 对第一名 0.4891,只差 0.0007。具体来看,事件描述得分比领先队伍高 0.024,违规者类型、初始位置、最终位置、最终车道等字段也都有小幅领先。天气、光照、日期三个字段拿到满分 1.0,时间字段 0.995。最明显的短板是“交叉口类型”只有 0.5749,而领先队伍直接满分。这个结果其实是鱼眼镜头物理特性导致的:广角畸变让路口的几何结构严重变形,模型很难以固定的方向感判断“这是十字路口还是T型路口”,更别提更复杂的五叉路口了。
PSI-VQA 里有一个很有趣的现象:Open-QA Cue(即开放问答中的视觉线索识别 F1)做到了 0.6389,高于领先队伍的 0.5833。这说明模型确实能从画面里捕捉到行人的支撑性视觉证据。但 BCQ(二选一问题)只有 0.5934,明显低于领先队伍的 0.7084;时间定位 0.5751 对 0.7427,差距是四个子任务里最大的。换句话说,模型“看到了证据”但不一定“用对了证据”:它能认出“行人回头看了一眼来车方向”这个线索,却在“这个行人到底会不会过马路”这个最终判断上失分,或者在判断对了之后,把影响驾驶决策的时间窗口切得不够准。
把三个赛道放在一起看,结论很清楚:UniTrafic-Agent 的核心优势来自“时间戳感知采样 + 视频级联合推理 + 结构化适配器”这套组合拳,它让模型能拿到关键帧、保持一致的故事线、准确输出结构化字段;核心短板则集中在三类问题上——开放文本生成需要与参考答案逐句对齐,鱼眼几何需要更强的空间推理,行人意图判断需要把“看到什么”进一步转化为“对方打算做什么”。这三个短板恰好指向了未来交通视频智能体值得深耕的方向。
融会贯通
结合 PaperDaily 已收录的多篇交通视频理解论文可以观察到,目前大多数工作仍然聚焦于单一摄像头域或单一任务——要么只做监控场景的异常检测,要么只做行车记录仪视角的行人意图预测。UniTrafic-Agent 的价值在于它用一套统一工作流把监控、鱼眼、行车记录仪三个差异极大的域串在了一起,并且用竞赛官方评测证明了零微调跨域的可行性。这种“统一框架 + 任务适配器”的架构思路,对后续做多域视频理解的团队来说是一个值得参考的范式。
不过也需要注意,不同论文在自家实验里采用的训练/测试划分、评测协议和基线选择可能各不相同,跨论文直接对比数字需要格外谨慎。UniTrafic-Agent 的官方成绩来自 AI City Challenge 的统一评测系统,这一点保证了它内部三个赛道之间的可比性;但如果拿这个结果与其他论文在非官方协议下跑出的数字做横向对比,就必须考虑 split 和 setting 差异,不能想当然地认为分数高就是全面领先。
龙迷三问
这篇论文到底在解决什么问题? UniTrafic-Agent提出观察-推理-行动-验证统一工作流,以片段级联合推理驾驭监控、鱼眼与行车记录仪三类交通视频。在AI City 2026公开榜上FETV排名第二、PSI-VQA第四,零微调实现跨域泛化,代码已开源。
这篇工作最值得看的点是什么? MR-CAS在FETV上排名第2(0.4884,与第1名仅差0.0007),PSI-VQA上排名第4(64.4161),TAR上排名第16(0.5780)。在PSI-VQA的Open-QA Cue-F1上超过领先队伍,在FETV的描述、违规者类型、图像位置和最终车道等字段上表现竞争力。
这篇工作的边界或风险在哪里? 优点:(1)提出统一的观察-推理-行动-验证工作流,支持跨三个异构视频域的交通理解任务;(2)时间戳感知的帧采样策略有效平衡全局覆盖与局部细节;(3)视频级联合推理提高预测一致性;(4)任务特定动作适配器灵活适配不同输出格式;(5)在FETV和PSI-VQA两个域外任务上表现优异,验证了方法的泛化能力。缺点:(1)TAR上长文本生成任务(场景描述、时间描述、摘要)与领先队伍差距较大;(2)鱼眼视频的交叉口类型识别准确率低(0.5749 vs 1.0000);(3)PSI-VQA的BCQ和时间定位分数明显低于领先队伍;(4)依赖商业API(GPT-5.5),可复现性和成本受限;(5)缺乏消融实验验证各组件贡献。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
“观察-推理-行动-验证”的工作流设计和任务适配器机制有不错的工程整合价值,但整体属于面向竞赛的系统级创新,底层方法没有提出新的学习范式。
实验合理度: ★★★★☆
三个赛道共用官方评测系统,指标定义清晰,组件级结果汇报完整,对比公平性有保障。可惜没有自建消融实验,无法看出各模块的独立贡献度。
学术研究价值: ★★★☆☆
跨域泛化的评测结论对交通视频理解社区有参考价值,但方法本身的学术增量有限,更像是对现有 MLLM 能力的系统化发挥。
稳定性: ★★★☆☆
验证与重试机制显著提升了输出稳定性,但整套系统仍依赖云 API 的返回质量,模型对开放文本生成的随机性和不确定性没有被完全消除。
适应性以及泛化能力: ★★★★☆
零微调跨三种镜头域并拿到好名次,是泛化能力的有力证明。不过从 TAR 第 16 名看,在监控视频的开放文本任务上还有明显提升空间,不能说过所有场景都强。
硬件需求及成本: ★★☆☆☆
依赖 gpt-5.5 和 gpt-5.4 这类商业闭源模型 API,每个视频 32 帧、单次请求完成所有任务,推理成本由 API 定价决定,自部署几乎不可能,成本可控性差。
复现难度: ★★★★☆
代码在 GitHub 开源(Roclp/UniTraffic-Agent),MIT 许可证,项目结构清晰,配置好 API 密钥即可跑通。主要门槛在于需要获取 gpt-5.5 等模型的访问权限。
产品化成熟度: ★★★☆☆
作为竞赛方案,面向的是学术评测而非真实部署,缺少端到端时延、并发压力、成本核算等产品化指标。要落地到真实交通管理场景,还需要在模型轻量化、私有化部署和实时性上做大量工作。
可能的问题: 长文本生成类任务与参考答案对齐不足,鱼眼几何推理薄弱,行人意图判断停留在线索识别层面,且整体依赖商业闭源模型,缺少对开源小模型的验证,工程拼装感较强。
主要参考文献
[1] Li P, Xu Q, Bao S, et al. UniTrafic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations. arXiv:2608.13031, 2026.
[2] Tang Z, Wang S, Anastasiu D C, et al. The 10th AI City Challenge. ECCV Workshops, 2026.
[3] Abduljawad A, Shaik N S, S S M, et al. FETV: Fisheye Traffic Event and Violation Dataset. GitHub: MoyoG/FETV, 2026.
[4] ISE-ICE Lab. PSI-VQA: AI City Challenge 2026 Track 3 Out-of-Domain Pedestrian Intent VQA Dataset. Hugging Face: ise-ice-lab/PSI_VQA, 2026.
[5] Zhang T, Kishore V, Wu F, et al. BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675, 2019.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
交通视频里的门道,一台Agent全看透:监控、鱼眼、行车记录仪,三种镜头一个框架通吃!🐱 想第一时间解锁更多竞赛夺冠思路和多模态视频理解新姿势?
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 视频理解+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群