西安交大新作TempoGround:流式目标不再“跟丢”,3D指标均提升7.5
视频流一帧一帧地来,模型能不能不串号、不手抖、不跟丢?西安交大联合EngineAI提出TempoGround,让视觉语言模型在流式输入下连续输出稳定的2D/3D框,3D精度平均提升7.5。这套“状态感知课程预测+强化学习”的组合拳,值得做具身智能和多模态感知的同学认真看一眼。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
视频流一帧一帧地来,模型能不能不串号、不手抖、不跟丢?西安交大联合EngineAI提出TempoGround,让视觉语言模型在流式输入下连续输出稳定的2D/3D框,3D精度平均提升7.5。这套“状态感知课程预测+强化学习”的组合拳,值得做具身智能和多模态感知的同学认真看一眼。
跑姿分析一直被认为是专业实验室的专利,动辄几十万的设备劝退了大多数人。这篇论文用五个成熟姿态估计模型+后处理,把髋膝关节角度估测误差压到5.3°,还配套了网页演示平台,属于典型的低成本高性价比工作,做运动科学和姿态估计的朋友值得一读。
GNSS接收机的跟踪环路,一直是导航接收机设计中“牵一发动全身”的地方。这篇来自萨马拉大学的论文,没有堆砌高深理论,而是老老实实把积分间隔、相关器间距和滤波器参数这三个工程变量的实测结果摆出来,还附带了FPGA实现的经验教训。想搞懂GPS接收机怎么调优的同学,这篇值得花十分钟细读。
视频模型看懂动作却丢了空间结构,图像模型擅长几何却不懂运动——DeepMind用一套循环掩码自编码器RVM把两边的好处全占了,只靠像素重构损失,小模型还不需要蒸馏,参数效率最高领先30倍。这事儿有点意思,值得花三分钟读一读。
传感器协同跟踪的老问题:摄像头这类高成本传感器,到底该让哪几个节点开机?UCLA这篇论文把“选传感器”当成“做推荐”,用双塔MLP加声学频带特征,在真实外场干扰环境下把命中率从80.4%拉到98.4%,每次决策的在线计算只要约1毫秒。思路跨界又好落地,值得一读。
多帧视觉跟踪里模板帧越堆越多,效果却可能越堆越差?ETCTrack用一个可学习的ATC模块把历史模板Token动态压缩60%,MACs直降21.4%,精度只掉0.4%,还在七个基准上拿下SOTA。代码已开源,看完这篇也许能重新理解“给Transformer减负”这件事。
Google DeepMind把动态4D重建做成了"点单式"服务:一段视频编码一次,任何时间、任何空间位置的3D坐标随查随到。200+FPS位姿估计、18-300倍跟踪提速,CVPR 2026最佳论文的含金量,龙哥带大家一探究竟。
医生看病是逐步问诊、看检查单、更新诊断假设的过程,但现有的AI评估全是单轮问答,完全不接地气。这篇论文搞了一个1089例真实病例的多轮诊断基准,把15个模型按真实临床流程从头考到尾。结果发现推理模式反而帮倒忙,医疗微调在小模型上有用、大模型反而没优势。想了解AI在临床诊断中到底几斤几两?这篇必须读。
视频实例分割通常需要昂贵的视频标注和复杂的时序建模,但QueenVIS仅用单帧图像训练就拿到了接近SOTA的结果。它通过两个轻量辅助头把外观和空间先验注入Transformer查询,推理时零参数开销,在长视频上提升10.3 AP,简直是为标注稀缺场景量身打造。方法干净、实用,值得工程团队关注。
视频实例分割的“天价标注”让人头疼,QueenVIS却告诉你:只用单帧图像训练,效果堪比视频监督!它通过两个超级简单的辅助头(特征预测+中心预测)把外观和空间先验注入查询向量,推理时零开销、零参数增加。在YouTube-VIS长视频上直接飙了10.3 AP,比很多视频监督模型还稳。代码已开源,值得一试!
野外多动物跟踪最缺的不是模型花活,而是“像样的数据考场”。这篇工作直接把考场搬到了4大洲、741个站点、99个物种上,还顺手把分割级标注做到了能真刀真枪测跟踪。
多目标跟踪最怕的不是“看不见”,而是“看见了也分不清”。这篇论文直接把 re-ID 的训练方式改成和推理同一套“整帧竞争”逻辑,再用共性外观抑制去压蜜蜂这种高相似目标的混淆,思路很对症。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球