← 返回 PaperDaily 视觉与图像

RPI这篇新方法,把公交视频分析压到零样本了

公交监控最烦的不是“看不见”,而是“看见了也不知道该看哪”。这篇论文把长视频先压成门、乘客、付费箱三层证据,再把大模型只用在关键片段上,思路很工程,也很实在。

RPI这篇新方法,把公交视频分析压到零样本了
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
公交监控最烦的不是“看不见”,而是“看见了也不知道该看哪”。这篇论文把长视频先压成门、乘客、付费箱三层证据,再把大模型只用在关键片段上,思路很工程,也很实在。


原论文信息如下:
论文标题:
GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
发表日期:
2026年07月
发表单位:
Rensselaer Polytechnic Institute
原文链接:
https://arxiv.org/pdf/2607.13569v1.pdf

公交监控难题:零样本、细粒度、高成本挑战

公交车上的视频分析,看起来像是“摄像头一开,答案自动出来”,现实却完全不是这么回事。真正麻烦的地方不在于有没有视频,而在于视频里该看的人、该看的动作、该看的位置都被挤在一条很长、很乱、很糊的时间线上。乘客进出、低照度、遮挡、反光、抖动、站立姿态变化、刷卡和扫码动作都很短,偏偏还要把这些短事件和具体乘客一一对应起来,难度不比在地铁早高峰里找一把掉在地上的钥匙低。
传统做法通常有两条路。第一条是监督学习的视频模型,先拿一堆标注好的样本训练,再去识别上车、下车、付费、逃票等行为。问题是,公交场景里的付费方式非常碎:二维码、刷卡、挥卡、现金、逃票,动作又短又稀有,标注成本高得离谱。第二条是直接把视觉语言模型硬塞进长视频里,让它自己找证据、自己判断行为。听起来很美,实际很容易在长视频里“看着看着就跑偏”,而且推理成本也不便宜。论文的核心判断很直接:公交视频分析不是“单靠大模型硬刚”就能解决的,得先把证据压缩好,再让大模型做它最擅长的语义判断。
Figure 1
图1:面向公交视频分析,模型式流水线、纯视觉语言模型方案和本文的“接地式混合推理”对比。前者有明确定位,但要专门训练;后者能开放词汇推理,却容易在长视频里丢重点、推理成本也高;本文方案把“先定位、再推理”结合起来,试图让零样本公交分析真正落地。

GHR-VLM:边缘+云结合,让零样本视频分析落地

这篇论文的名字里有个关键词很关键:GHR-VLM,全称是 Grounded Hybrid Reasoning Vision-Language Model,中文可以理解为“接地式混合推理视觉语言模型”。这里的“接地”不是让模型去接地气,而是指把长视频里的语义判断,先落到具体的空间位置、时间片段和乘客轨迹上,再交给大模型做高层推理。
它的思路很工程,也很现实:边缘端负责“盯场子”,云端负责“动脑子”。边缘端用轻量模型持续监控车门状态、截取停靠区间、追踪乘客并切成短片段;云端视觉语言模型只看这些已经被筛过、裁过、聚焦过的证据。这样一来,云端不必对整段长视频做无差别扫射,推理次数少了,带宽压力小了,最重要的是,模型终于不用在一团乱麻里自己猜“该看哪里”。
Figure 2
图2:GHR-VLM整体流程。系统先锁定前门区域,再只在开门的停靠区间里做后续分析;随后通过规则化跟踪生成乘客片段;接着用视觉语言模型筛掉非上车乘客;最后在付费箱区域做两阶段推理,输出支付类型。
如果把这套系统比作侦探破案,边缘模型不是主角,但它负责把案发现场先圈出来;视觉语言模型才是最后定案的人。这个分工很重要,因为大模型最怕的不是不会推理,而是证据太散、上下文太长、目标太小。论文做的事情,本质上就是把“长视频大海捞针”改造成“先把针放到桌上,再让模型看”。

三阶段接地:从门状态→乘客→付费箱,层层递进

这篇方法最像样的地方,是它没有一上来就问“大模型:这个乘客到底有没有逃票”。那样太莽了。论文把问题拆成三层:先判断什么时候发生了上下车相关事件,再判断哪一个乘客真的要去付费,最后才判断他到底怎么付的。这三步看起来朴素,但正好把长视频分析里最费命的三个问题拆开了:时间太长、目标太多、行为太细。
第一层是门状态过滤。车门不开,通常就没必要分析乘客支付事件;车门一开,才进入候选区间。这里用的是 SAM 3,即 Segment Anything with Concepts,中文可理解为“带概念提示的通用分割模型”。它先在第一帧里定位前门区域,然后只在这个区域里看门是开还是关。这样做的好处很直接:把无关背景尽量屏蔽掉,减少后续模型在车内晃来晃去的注意力浪费。
Figure 3
图3:C3_1 和 C3_3 两段真实公交视频的全视频时间线。上半部分和下半部分分别展示了真实标注、原始第一轮预测,以及经过方向过滤和停靠合并后的第二轮预测。
第二层是乘客跟踪与片段切分。系统在停靠区间内追踪乘客实例,把连续视频拆成一个个乘客级短片段。这里的关键不是“找得到人”,而是“找得到同一个人”。因为公交车内人群密集,乘客会互相遮挡,镜头又固定,身份很容易在短时间内漂移。论文采用规则化跟踪和身份修复,把一帧一帧的局部身份串起来,最后变成可供大模型消费的短视频证据。
第三层是付费箱区域接地。乘客级短片段已经比整段长视频干净很多,但真正决定支付类型的证据往往只出现在付费箱附近的几帧里。于是系统再把“付费箱”这个小区域单独抓出来,让后面的视觉语言模型只盯着这个区域做判断。这个设计的逻辑非常朴素:先缩小搜索空间,再提高局部证据密度。这比让模型在整车视频里猜二维码、刷卡、挥卡、现金要靠谱得多。
论文里还有一个很实用的细节:它不是一口气把所有帧都送进云端,而是按阶段逐步筛。门状态筛掉大部分无效时段,乘客跟踪筛掉非目标人,付费箱接地再筛掉无关背景。这样下来,云端模型看到的不是“公交车全景直播”,而是一串已经被整理过的证据包。这个思路对工程落地很重要,因为它把大模型从“全能苦力”变成了“最后裁判”。

方向映射“由繁到简”:让VLM只判断角度,不判断行为

这一段是论文里很聪明的一招。直接问大模型“这个人是不是上车乘客”,其实问题太复杂了:它既要理解车内结构,又要知道乘客朝向,还要推断动作阶段,还得结合公交摄像头的固定视角。对大模型来说,这属于“题目没错,但太多隐含条件”。论文干脆把这个复杂任务改写成一个简单任务:判断朝向
这就是论文里说的 Complex-to-Simple(CS)映射,中文可理解为“由复杂任务映射到简单任务”。具体做法是:给模型看一个已经切好的乘客短片段,只让它判断人物朝向属于前、侧、后、车内这几类,再根据公交车内摄像头的固定几何关系,把朝向映射回“是不是正在上车并靠近付费区域”的判断。换句话说,大模型不需要理解整个公交业务流程,只需要做好它更擅长的视觉判断。
这个设计的妙处在于,它把“行为识别”拆成了“视觉方向判断 + 规则映射”。前者交给视觉语言模型,后者交给人类先验。这样做不是偷懒,而是承认一个现实:在固定车载视角下,很多业务判断本来就可以由几何关系近似得到。大模型负责语义,规则负责常识,二者配合,反而更稳。

两级付费箱VLM推理:粗筛+精调,抓取关键支付证据

真正难的部分其实在最后:判断支付类型。因为二维码、刷卡、挥卡、现金、逃票这些动作,很多都只在极小的局部区域里出现,而且持续时间很短。你让模型直接看整段乘客视频,它很可能“知道这人在付费”,但说不清楚到底是扫码还是挥卡。论文的解法是两级推理,先粗后细,别一上来就把模型逼到墙角。
第一阶段先在整段乘客片段上做粗分类。系统会把整个片段均匀采样成 16 帧,并把每帧都裁到付费箱附近,拼成一张接触表,让视觉语言模型先判断大类支付行为,同时给出它认为最能支撑判断的证据帧。这个“让模型指出证据”的设计很关键,因为它不只是要答案,还要看模型到底在看什么。说白了,就是防止模型一本正经地胡说八道。
第二阶段再围绕第一阶段选出来的证据片段做精调。如果第一轮没有给出有效证据,就回退到整段片段重新采样;如果选出了有效证据,就只在这个更短的时间窗口里重新看一遍,并用更紧的付费箱裁剪区域再做一次判断。这样做的本质是把“全片搜索”变成“局部复核”,减少噪声帧干扰,也让模型更容易抓住细粒度动作。
Figure 4
图4:两段视频在两级视觉语言模型中的支付类型混淆矩阵。每个格子表示真实类别被预测成对应类别的样本数。
这套两级设计的优点很明确:先用宽视野找线索,再用窄视野抠细节。但代价也同样明显:如果第一阶段就把关键证据漏掉了,第二阶段再精也救不回来。所以它不是“分两步就一定更强”,而是“在证据质量足够时,分两步更容易把模型的注意力拉回正轨”。这也是后面实验里为什么会出现白天和夜晚差异的根源。

真实场景表现:白天vs夜晚,光照决定效果好坏

论文没有把结果吹成“全面碾压”,这点其实挺好。它很老实地告诉读者:场景质量决定上限。白天强光、阴影、车厢局部过曝,会让乘客轮廓和付费箱细节一起糊掉;夜晚如果光照更稳定,模型反而更容易抓住动作边界。这说明系统的瓶颈不只是推理策略,还有视频本身的可见性。
从实验现象看,边缘模块在第二轮后,停靠区间和乘客片段的预测更接近真实标注,说明“先过滤再跟踪”的思路确实能把长视频变短、变干净;但付费识别并没有因此一劳永逸。尤其在复杂光照下,第二阶段有时会因为证据裁剪过窄而损失上下文,导致精调不一定总比粗筛更强。这个结果很真实,也很有工程味:方法再巧,也得看原始视频给不给面子
Table 1
表1:停靠区间与乘客片段的检测结果。表中对比了第一轮和第二轮预测在两段真实公交视频上的精度、召回率和 F1 值。第二轮通过方向过滤和停靠合并,明显减少了过多预测,但也带来了一定召回损失。
从这张表能看出,系统的边缘侧并不是“顺手做个预处理”那么简单,而是整个方法能不能成立的地基。第一轮更像“宁可多抓,不可漏抓”,所以召回高但误报多;第二轮则通过方向过滤和停靠合并,把过碎的区间整理成更像真实业务的事件序列。这个变化很像做账:第一遍先把流水全记上,第二遍再把重复项和噪声剔掉。工程上虽然不浪漫,但非常有用。
VLM 部分的结果也体现了同样的规律。对于光照更稳定的视频,第二阶段的局部重采样和紧裁剪能提升对细粒度动作的捕捉;但对于强遮挡、强过曝的视频,过于依赖局部证据反而可能把错误放大。也就是说,这个系统不是“越精越好”,而是“在证据足够清楚时,精调才有意义”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是公交车长视频里“乘客级付费分析”难落地的问题。不是只统计人数,而是要把每一次上车、每一位乘客、每一种支付行为串成可追踪的证据链。

CS Mapping 是什么意思?CS Mapping 指 Complex-to-Simple Mapping,中文是“由复杂到简单的映射”。论文把复杂的“是否上车乘客”问题,改写成更容易的“朝向判断”,再用公交车固定视角的几何关系把结果映射回业务判断。

为什么还要做两阶段付费箱推理?因为付费动作太短、证据太小,单次推理很容易漏掉关键帧。先粗筛找证据,再精调复核,能让模型把注意力集中到最有信息量的局部区域,但前提是原始视频质量不能太差。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

把视觉语言模型和边缘视觉模块做成分层接地推理,这个思路有工程上的聪明劲,但核心更偏系统整合与任务重构,不是那种一眼惊艳的全新算法。

实验合理度:★★★★☆

实验设置贴近真实公交视频,且有时间线、混淆矩阵和分阶段结果,能看出每一步到底帮了什么忙;不足是数据规模仍偏小,且不同光照条件下波动明显。

学术研究价值:★★★☆☆

它把“长视频 + 零样本 + 细粒度业务分析”这个难题拆得比较清楚,对交通视频理解和边云协同都有启发,但离通用方法论还有距离。

稳定性:★★☆☆☆

对光照、遮挡和低清晰度很敏感,说明这套方法更像“条件合适时好用”,还谈不上稳如老狗。

适应性以及泛化能力:★★★☆☆

零样本思路让它在新场景里有一定潜力,但强依赖固定摄像头视角、门位和付费箱布局,换车种后大概率要重新调。

硬件需求及成本:★★★☆☆

边缘端轻量、云端按需调用,整体比全视频喂给大模型省得多;但云端仍要跑视觉语言模型,成本不算低。

复现难度:★★☆☆☆

流程写得清楚,但真实公交数据、场景配置和标注都不容易拿到,复现门槛主要卡在数据而不是代码。

产品化成熟度:★★☆☆☆

适合做原型验证或半自动分析工具,离稳定上线还差一截,尤其是夜间、强遮挡、强过曝场景要先补课。

可能的问题:方法太依赖视频质量和固定视角,且两阶段精调并不总能带来收益;如果证据链前面断了,后面再会推理也没用。


主要参考文献

Kaicong Huang, Weiheng Oh, and Ruimin Ke. 2026. GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning. arXiv preprint arXiv:2607.13569v1.
Nicolas Carion et al. 2025. SAM 3: Segment Anything with Concepts.
Shilong Liu et al. 2024. Grounding DINO: Marrying DINO with Grounded Pre-training for Open-Set Object Detection.
Nikhila Ravi et al. 2025. SAM 2: Segment Anything in Images and Videos.
Haotian Liu et al. 2023. Visual Instruction Tuning.

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。