腾讯PCG新方法:34K数据把视频感知拉升5.2%?
视频推理这事,很多时候不是“会不会想”,而是“看没看见关键帧”。这篇论文直接把矛头对准感知短板,用注意力把稀疏奖励拆成帧级、Token级信号,思路很硬,实验也够实。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
视频推理这事,很多时候不是“会不会想”,而是“看没看见关键帧”。这篇论文直接把矛头对准感知短板,用注意力把稀疏奖励拆成帧级、Token级信号,思路很硬,实验也够实。
视频生成最怕的不是“算不动”,而是“算力明明省下来了,GPU却在等别人”。FVAttn抓住的正是这个系统级痛点:自适应稀疏注意力一边提质量,一边制造负载不均。论文把运行时修负载、空闲算力再利用和计算通信重叠串起来,思路很工程,也很实用。
视频生成最贵的地方,不是模型不会画,而是算力先被注意力“拖死”了。FVAttn的思路很实在:先把多卡负载不均修掉,再把空出来的等待时间塞回高价值计算里,属于工程味很浓、也很能打的一类工作。
这篇工作最狠的地方,不是“能修视频”,而是把“多步扩散修复”硬生生压成了一步,还顺手把对外部草稿的依赖也掐掉了。对于视频对象移除这种既要像真、又要够快的任务,D2DF给出了一条很工程化的路子。
如果有一项技术能从你的手机视频中提取出世界的3D结构,像人眼一样感知景深,你会用它做什么?上海AI实验室联合浙大、悉尼大学,最近放了一个大招:Depth Any Video。这个模型直接在Stable Video Diffusion上「开刀」,并靠着从游戏世界收集来的600万帧高质量深度数据,实现了视频深度估计的时空一致性全面飞跃。效果拉满,看了演示gif保
视频深度估计一直卡在“没数据”上。这篇来自上海AI Lab、浙大和悉大的论文,直接去游戏里“白嫖”了4万段高精度视频深度数据,再把手里的视频生成扩散模型改成深度估计模型,3步去噪就出结果,跑得比谁都快。效果直接起飞,把之前所有生成式深度模型都甩在身后。
这篇论文最有意思的地方,不是“删掉了什么”,而是“删掉之后还能不能把视频保住”。SIRUS把遗忘、保真、质量、鲁棒性和效率拆开测,终于不再让概念擦除只靠一张嘴说服人。
视频模型最尴尬的地方,不是不会画,而是会画却不会“想”。HDR把这个矛盾掰开了:先粗后细地推理,再保持流式低延迟输出,六个多步任务上把成功率从34.22拉到60.29,确实有点东西。
这篇论文最有意思的地方,不是又堆了一个更大的流式模型,而是把“视频”重新解释成了“世界 + 事件流”。这个视角一换,预训练目标、交互形式、行为控制,全都顺了。
视频扩散Transformer最烦的不是“能不能生成”,而是“生成一段视频到底要烧掉多少算力”。Kaleido不跟稀疏注意力硬卷,而是从潜空间通道相关性下手,顺手把算法和硬件一起改了,思路很工程,也很狠。
视频生成模型最烦的不是“不会画”,而是“画得太慢”。Kaleido不走粗暴删算子那条路,而是盯住潜空间里的通道相关性做复用,结果是加速和画质居然能同时保住。
机器人规划最怕什么?不是动作难,而是“想一帧未来”都要慢吞吞算半天。DriftWorld直接把扩散式多步采样改成单步漂移生成,推理速度平均快17倍,还能拿去做规划和离线评估,够硬。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球