RPI这篇新方法,把公交视频分析压到零样本了
公交监控最烦的不是“看不见”,而是“看见了也不知道该看哪”。这篇论文把长视频先压成门、乘客、付费箱三层证据,再把大模型只用在关键片段上,思路很工程,也很实在。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
公交监控最烦的不是“看不见”,而是“看见了也不知道该看哪”。这篇论文把长视频先压成门、乘客、付费箱三层证据,再把大模型只用在关键片段上,思路很工程,也很实在。
自动驾驶里最容易被忽略的坑,不是模型不会开车,而是学会开车后把老本行忘了。这篇论文第一次把“灾难性遗忘”做成可量化基准,还给出了一种不乱改权重的解法,挺适合认真看一遍。😊
这篇论文最有意思的地方,不是又训练了一个奖励模型,而是把“奖励”这件事倒过来做了:让预训练多模态大模型回读提示词,看图能不能把原话读回来。结果很直接——不用偏好标注,不用再养模型,照样能把文生图强化学习带起来。
这篇论文最有意思的地方,不是又测出一个“更强的评审模型”,而是直接把评审这件事拆成了管线问题。模型、视角、输入、提示词,谁都别想装作无关;结果也很实在:六视图RGB加规则提示,成了最稳的低成本默认方案。
这篇论文不讲虚的,直接盯住工业机械臂最现实的问题:显存不够、全量微调太贵、LoRA到底能不能顶住。结果很有意思,r=32 基本就到头了。
机器人强化学习最怕的不是“学不会”,而是“根本不知道哪里错了”。DenseReward偏偏把失败这件事做成了数据,顺手把奖励从“看终局”升级成“看过程”,这就很对路。 项目视频:https://dense-reward.github.io/assets/videos/DenseReward.mp4
这篇论文最有意思的地方,不是又堆了多少花活,而是把小型视觉语言模型的“考试成绩”拆成了两件事:先能不能把答案写出来,再谈会不会想。结果很不客气——很多提升其实来自解析格式和 token 预算,不是复杂搜索。
这篇论文把一个很现实的问题挑明了:多模态大模型不是不会说细节,而是细节一多就更容易“翻车”。GRANFACT、层级评测和RP-DPO三件套,正好把“说得更细”和“说得更准”这对老冤家拎到台面上狠狠干一架。
视频理解和视频生成长期像两拨人:一边要“看懂”,一边要“画准”。Vega直接把两件事塞进同一个框架里,还用3B参数在多个基准上打出了很能打的成绩,值得细看。
机器人偏好学习最烦的不是“没数据”,而是“数据看起来很多,实际全在讲废话”。这篇 FPL 直接把偏好拆成速度、安全、质量等自然语言轴,监督更细,策略也更会“看脸色”了。
多模态推理最怕“越想越跑偏”,这篇 VisRef 直接把问题说透了:不是单纯让模型多想,而是让它想的时候还记得回头看图。无需再训练,固定预算下还能稳定涨点,工程味很足。
复杂多实例生成最烦的不是“画不出来”,而是“画对了对象却串了属性”。InstanceControl 直接绕开手工实例标注,用视觉语言模型先把文本和区域对上,再用自适应掩膜细化兜底,思路很工程,效果也很实在。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球