华中科大+地平线新作:流式视频生成FVD暴降36.6%,训练推理终于“对齐”了
视频生成要当世界模型,最大的坑就是训练时乱炖噪声、推理时要按顺序去噪。华中科大联合地平线这篇Stream Forcing把“训练节奏”做成课程:先广撒网、再精对齐,UCF-101上FVD直接降了36.6%,还能零样本飙到128帧。继2026年6月聊过NVIDIA+清华的Causal-rCM之后,这是又一篇把流式生成训练做扎实的工作。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1660 篇文章
视频生成要当世界模型,最大的坑就是训练时乱炖噪声、推理时要按顺序去噪。华中科大联合地平线这篇Stream Forcing把“训练节奏”做成课程:先广撒网、再精对齐,UCF-101上FVD直接降了36.6%,还能零样本飙到128帧。继2026年6月聊过NVIDIA+清华的Causal-rCM之后,这是又一篇把流式生成训练做扎实的工作。
多路径传输一直在“盲人摸象”——调度器只看字节,不懂视频帧的关键程度。代尔夫特理工这篇MoMQ,首次把MoQT的元数据变成路径调度规则,在Starlink+WiFi真实测试床上把P99.9延迟从384.7ms砍到114.1ms,实时视频终于能跑进150ms交互预算。想法巧妙,实验扎实,值得一读。
凸优化理论又整新活了!以色列理工的Dan Garber把上一版随机化的Frank-Wolfe变体改造成确定性算法,还顺手把严格互补假设给干掉了。全局线性收敛、无burn-in、不依赖任何先验参数——想学无投影法最新进展的,这篇不容错过。
音频生成图像终于有了像样的"教材"!中科大联合电信AI研究院打造的A2I-Set数据集,32.3万组高质量三元组,配合FAT-Fusion的AudioCanvas模型,让"听声作画"不再是鸡同鸭讲。数据开源的诚意之作,值得细品。
这篇论文把格拉斯曼流形上悬而未决近40年的“非零度映射不存在”问题,一口气推广到任意部分旗流形,还顺手证明了上同调刚性。最大看点:不靠复杂几何,全靠有理上同调环加上辫子超平面排列的代数刚性,干净利落。
看长视频最怕"看多少、看哪里"的选择困难。商汤这篇EVA直接用强化学习把"先规划再看片"的训练出来,多个长视频基准提升6-12%,视觉token还省得惊人。让AI学会"聪明地看",这个方向值得重点关注。
同样一个因果语言模型,不加回归头、不加策略头,只靠输出token就把三步收益预测和五ETF动态配置全干了;池化净夏普从1.394提到1.494,2025年多模态优势最猛。想看看语言模型怎么绕过"换任务就换头"的套路直接当金融决策接口?这篇值得一读。
同一个分子的“骨架图”,量子化学家画出了三个版本,还都觉得自己画的才对。这篇河套数学与交叉科学研究院新作,用两个能精确求解的玩具模型,把Born-Oppenheimer面、Born-Huang面和精确分解面放在一起当面对质,顺带揭开了基态能量排序和量子度量之间的秘密,值得一看。
城市道路的自动驾驶已经卷成红海,矿区这种“路不成路、灰比雾厚”的硬骨头却少有人啃。中科院团队让规划器学会区分“看得见的安全”与“看不见的风险”,碰撞率直降七成多,这波操作值得研究!
游戏行业离不开RGBA动画,但“先生成RGB再抠图”的老路子,一到半透明边缘就翻车。字节联合北大清华带来一个反直觉方案:既然alpha本身就是可见性信号,那干脆用它来跳过计算——用2.4K个游戏资产视频训练RGBA生成器,1.2倍提速,FVD 174.4,质量几乎无损。
这篇论文把图形感知领域的老底给掀了——四十年跑实验攒下来的编码排名,被一个彩虹色图的反转案例直接打脸。作者主张别再做无穷无尽的受试者实验,而是把可视化当作图像,用视觉计算模型来评估。用散点图相关性判断做验证,模型居然复现了人类感知曲线。想搞明白人到底怎么看图,这篇值得细读。
算法展开(Algorithm Unrolling)一直是可解释深度学习的招牌做法,把迭代优化变成可学习的网络。这篇论文却给这个招牌泼了一盆冷水:图拉普拉斯去噪器的展开网络,无论怎么学,都只是多项式图滤波器,而且可达集还是测度零的严格子集——值得所有做可解释深度学习的人看一眼。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球