SceneTok来了:3D场景压成32K token,5秒还能生成
3D场景生成一直卡在两个字:太大。SceneTok偏偏反着来,把场景先压成少量无序token,再把“渲染”和“生成”拆开做,结果是压缩率高得离谱,速度还不慢,挺像把大卡车拆成乐高再开回去。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
3D场景生成一直卡在两个字:太大。SceneTok偏偏反着来,把场景先压成少量无序token,再把“渲染”和“生成”拆开做,结果是压缩率高得离谱,速度还不慢,挺像把大卡车拆成乐高再开回去。
视频修复最难的不是“修清楚一帧”,而是“修完一整条还不闪”。LPM把数据、训练、推理和部署一起打通,直接做到工业级落地,还顺手把带宽成本打下来了,属于论文里少见的真能进生产线的狠角色。
这篇论文最有意思的地方,不是又做了一个视频自编码器,而是把“只会理解”的冻结视频基础模型,硬生生改造成了能重建、能生成、还能加速训练的通用视频潜空间。更妙的是,它把连续和离散两条生成路线都打通了,工程味很足。
视频生成最烦的不是“生成不出来”,而是“生成得太慢”。这篇 ACID 直接盯住动态缓存里那个最容易被忽略的点:固定阈值一刀切,天然把速度和画质拴死了。它的思路很朴素,但很有效——该省的时候猛省,该稳的时候别乱抠。
视频扩散模型看着很会“画”,但一遇到连续依赖事件就容易露馅。本文用最干净的硬球碰撞任务,把这个短板拆得明明白白。
3D贴图最烦的不是“有没有”,而是“能不能把复杂花纹贴得像真的”。Ink3D的思路很直接:几何交给3D模型,纹理交给视频生成,再用烘焙把两边缝起来,工程味很足,也很有启发。
这篇论文最有意思的地方,不是把视频放大,而是把“放大倍率”和“生成成本”硬生生拆开了。AVSR-Diff 用固定低分辨率潜空间做扩散,再用连续解码补细节,2×到8×都能跑,内存还几乎不涨,工程味很足。
视频理解和视频生成长期像两拨人:一边要“看懂”,一边要“画准”。Vega直接把两件事塞进同一个框架里,还用3B参数在多个基准上打出了很能打的成绩,值得细看。
假视频越来越像真视频,传统只看像素伪影的办法已经不太够用了。这篇 DeepMind 的 ReStraV 反其道而行,盯着视频在 DINOv2 特征空间里“走路直不直”,思路简单,效果却很能打。
长视频重光照最烦的不是“能不能变亮”,而是“每一块都别自己演戏”。这篇 NVIDIA 新作把问题改写成跨块连续翻译,再加暖启动提示,思路很工程,也很实用。
这篇论文最有意思的地方,不是又堆了一个更大的自动驾驶模型,而是把“中间表示”当成了真正要训练的对象。它把视频生成、轨迹规划和安全边界三件事拆开处理,结果还真把收敛速度和闭环表现一起抬起来了。
自回归视频最怕的不是慢,而是“顺序一乱就全乱”。TempAct 把规划和执行拆开,再用分层强化学习去训,专治复杂时间指令下的语义混淆、提示切换失灵和误差传染,思路很像给视频模型配了个会排兵布阵的总指挥。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球