快手与北航新范式:从“挑视频”到“造视频”,广告视频可以现场拍
如果把短视频推荐系统想象成一家大型仓库,算法的工作就是“在仓库里找一件用户最可能喜欢的东西”。仓库越大,推荐越准。可问题在于:算法再聪明,也只能在仓库里挑,不能在用户最想要的那一刻,照着用户的心思现场做一件出来。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
如果把短视频推荐系统想象成一家大型仓库,算法的工作就是“在仓库里找一件用户最可能喜欢的东西”。仓库越大,推荐越准。可问题在于:算法再聪明,也只能在仓库里挑,不能在用户最想要的那一刻,照着用户的心思现场做一件出来。
大模型生成视频"看起来美,动起来假"的顽疾有解了。这篇来自四川大学的工作,不去堆算力,而是给视频生成装上"物理事件链"大脑,用可量化的物理公式约束每个中间状态,在PhyGenBench上把物理贴合度均值提升到72.5%,值得做视频生成与世界模型的朋友细读。
视频生成卷到今天,画面早就不稀奇了,但大部分模型要么不出声,要么声音是后期硬贴上去的。阿里DreamX团队直接把声音和画面“打包生成”,还只用了7B参数就敢对标22B/33B的大块头,并且开源了2K精炼器,值得想搞多模态生成的朋友细品。
又一篇零样本视频修复的狠活。天津大学团队把文本到图像扩散模型用出了花:不用训练就能修视频,还支持文本、图像两种参考输入,推理速度直接砍到三分之一,时序一致性指标WE降到原来的五分之一。被视频闪烁折磨过的同学,这篇值得重点研究。
斯坦福在CVPR 2026交出的这份P3Sim答卷,把"世界模型"从玄学拉回了工程:概率图模型+自回归Transformer+几何条件化,三大件拼出一个能从单张图推演3D物理变化的模拟器。新视角合成在SEVA基准上RE10K达到21.54的PSNR,3D物体操作在3DEditBench上PSNR冲到23.12。7月底刚聊过同团队PhyWM,这篇更像是把"懂物
还在为AI视频生成几秒就崩、动作循环重复而头疼?UCLA携手字节跳动Seed团队祭出LoL大招,让视频生成一口气跑12小时不带喘的,关键还不用重新训练模型!
机器人操作正从“看一步动一步”走向“预见式决策”,但生成未来视频开销太大。上海交大等团队提出的ForeWAM,用一次KV预填充让动作模型“脑补”动态未来,不生成视频、不用未来观测,LIBERO成功率96.7%,动作延迟比Fast-WAM降67%。这篇论文值得细读。
你第一眼看到的那种画面流畅、动作丝滑的机器人操作视频,可能只是“好看”,并不是真的“会干活”。上海交大与上海AI实验室等提出的H2R-Bench基准,把11个主流视频生成模型拉到真实的人类演示数据上逐一“体检”,结果发现视频画质与跨实体迁移成功率的相关系数只有0.14。想搞清楚视频生成模型到底能不能帮机器人学数据,这篇必读。
视频配音总是慢半拍?清华联手上海AI Lab把RLHF里的偏好优化搬进了视频配音任务,音画同步和听感双双拉满,还顺手解决了重建损失"听着对、感觉不对"的老毛病。
手术机器人学动作,最缺的就是带标签数据。这篇来自中佛罗里达大学等机构的工作,首次把世界-动作模型(WAM)用到手术机器人上,在动作标签预算固定的条件下,用免费的无动作视频预训练就把闭环成功率从63.5%拽到77.8%,PegTransfer单任务直接涨了20个百分点。视频不要钱、标签贵上天,这条路子值得所有做医疗机器人的人看一眼。
视频生成要当世界模型,最大的坑就是训练时乱炖噪声、推理时要按顺序去噪。华中科大联合地平线这篇Stream Forcing把“训练节奏”做成课程:先广撒网、再精对齐,UCF-101上FVD直接降了36.6%,还能零样本飙到128帧。继2026年6月聊过NVIDIA+清华的Causal-rCM之后,这是又一篇把流式生成训练做扎实的工作。
游戏行业离不开RGBA动画,但“先生成RGB再抠图”的老路子,一到半透明边缘就翻车。字节联合北大清华带来一个反直觉方案:既然alpha本身就是可见性信号,那干脆用它来跳过计算——用2.4K个游戏资产视频训练RGBA生成器,1.2倍提速,FVD 174.4,质量几乎无损。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球