4B参数搞定视频理解?VideoChat3把算力省下来了
一个模型把细粒度动作、长视频问答和直播流主动响应都装进去了,还只用4B参数。更关键的是,模型、代码、训练策略和数据集全开源,社区终于不用对着“半遮半掩”的视频大模型干瞪眼了。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
一个模型把细粒度动作、长视频问答和直播流主动响应都装进去了,还只用4B参数。更关键的是,模型、代码、训练策略和数据集全开源,社区终于不用对着“半遮半掩”的视频大模型干瞪眼了。
这篇论文把“心梗定位”这件事从单视图硬猜,推进到了 稀疏运动先验 + 多视图融合 。亮点不在堆大模型,而在于用一张标注帧撬动整套追踪流程,工程味很足。
多模态Agent最尴尬的不是不会做题,而是做对一次后,下一次还得从头学一遍。SPyCE直接把成功轨迹蒸馏成可复用技能,并让技能和策略在训练中一起进化,思路很顺,实验也够硬。
公交监控最烦的不是“看不见”,而是“看见了也不知道该看哪”。这篇论文把长视频先压成门、乘客、付费箱三层证据,再把大模型只用在关键片段上,思路很工程,也很实在。
CLIP最烦人的地方,不是不会对齐,而是对齐得太“粗”。这篇论文把文本语义当作“方面标签”,先分组再约束,思路很顺,实验也比较扎实,适合想看表征空间怎么被真正修干净的人。
自动驾驶里最容易被忽略的坑,不是模型不会开车,而是学会开车后把老本行忘了。这篇论文第一次把“灾难性遗忘”做成可量化基准,还给出了一种不乱改权重的解法,挺适合认真看一遍。😊
单图生成3D场景,最难的不是“能生成”,而是“生成后还能不能继续细化且不跑偏”。HIVE-3D把粗场景、2D分割、注意力对齐和体素超分辨率串成一条链,思路很工程,也很实用。
这篇论文最有意思的地方,不是模型把胸片分类做到了多高,而是它专门证明了:有些“高分”其实是报告文本在偷跑。对于做医疗多模态的人,这篇更像一场防作弊演习,值得认真看。
机器人采数据最怕“同一个坑反复踩”。PhysClaw-0把一次纠错变成后面都能复用的规则,省人力还不丢数据质量,属于很会过日子的机器人系统。
这篇论文最有意思的地方,不是又堆了多少模块,而是很直接地指出:视频时空定位真正卡脖子的,往往不是“看不见”,而是“边界看不准”。ScanFocus把任务拆成粗扫和细抠两步,思路朴素,但对长视频定位很对症。
这篇论文最值钱的不是单点技巧,而是把电脑智能体最卡脖子的三件事一次打通:题不够、采样不准、训练太慢。清华团队把可验证任务合成、前沿采样和视觉上下文分割拼成一条流水线,直接把开源模型推到 68.7%。
这篇论文最有意思的地方,不是“翻译”本身,而是把古手稿识别、现代越南语生成和偏好对齐揉成一个端到端问题。PPO、DPO、KTO三种RLHF路线同台对决,结果也很诚实:DPO在多数翻译质量指标上最稳,PPO更偏覆盖,KTO则保留了自己的性价比。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球