LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:视频生成

共 73 篇
视频生成不懂物理?川大新框架用事件链思维,物理正确率暴涨至72.5%
视觉与图像

视频生成不懂物理?川大新框架用事件链思维,物理正确率暴涨至72.5%

大模型生成视频"看起来美,动起来假"的顽疾有解了。这篇来自四川大学的工作,不去堆算力,而是给视频生成装上"物理事件链"大脑,用可量化的物理公式约束每个中间状态,在PhyGenBench上把物理贴合度均值提升到72.5%,值得做视频生成与世界模型的朋友细读。

图像恢复|天津大学ZVRM:零样本视频修复提速近3倍,时序闪烁减八成
视觉与图像

图像恢复|天津大学ZVRM:零样本视频修复提速近3倍,时序闪烁减八成

又一篇零样本视频修复的狠活。天津大学团队把文本到图像扩散模型用出了花:不用训练就能修视频,还支持文本、图像两种参考输入,推理速度直接砍到三分之一,时序一致性指标WE降到原来的五分之一。被视频闪烁折磨过的同学,这篇值得重点研究。

CVPR 2026斯坦福新作:一张图推演3D世界,碰撞也能预测
视觉与图像

CVPR 2026斯坦福新作:一张图推演3D世界,碰撞也能预测

斯坦福在CVPR 2026交出的这份P3Sim答卷,把"世界模型"从玄学拉回了工程:概率图模型+自回归Transformer+几何条件化,三大件拼出一个能从单张图推演3D物理变化的模拟器。新视角合成在SEVA基准上RE10K达到21.54的PSNR,3D物体操作在3DEditBench上PSNR冲到23.12。7月底刚聊过同团队PhyWM,这篇更像是把"懂物

上海交大最新基准:视频画质高≠机器人操作迁移成功,11个模型实测最高84.6
视觉与图像

上海交大最新基准:视频画质高≠机器人操作迁移成功,11个模型实测最高84.6

你第一眼看到的那种画面流畅、动作丝滑的机器人操作视频,可能只是“好看”,并不是真的“会干活”。上海交大与上海AI实验室等提出的H2R-Bench基准,把11个主流视频生成模型拉到真实的人类演示数据上逐一“体检”,结果发现视频画质与跨实体迁移成功率的相关系数只有0.14。想搞清楚视频生成模型到底能不能帮机器人学数据,这篇必读。

告别昂贵遥操作?这家机构用"看视频"教手术机器人操作
视觉与图像

告别昂贵遥操作?这家机构用"看视频"教手术机器人操作

手术机器人学动作,最缺的就是带标签数据。这篇来自中佛罗里达大学等机构的工作,首次把世界-动作模型(WAM)用到手术机器人上,在动作标签预算固定的条件下,用免费的无动作视频预训练就把闭环成功率从63.5%拽到77.8%,PegTransfer单任务直接涨了20个百分点。视频不要钱、标签贵上天,这条路子值得所有做医疗机器人的人看一眼。

华中科大+地平线新作:流式视频生成FVD暴降36.6%,训练推理终于“对齐”了
视觉与图像

华中科大+地平线新作:流式视频生成FVD暴降36.6%,训练推理终于“对齐”了

视频生成要当世界模型,最大的坑就是训练时乱炖噪声、推理时要按顺序去噪。华中科大联合地平线这篇Stream Forcing把“训练节奏”做成课程:先广撒网、再精对齐,UCF-101上FVD直接降了36.6%,还能零样本飙到128帧。继2026年6月聊过NVIDIA+清华的Causal-rCM之后,这是又一篇把流式生成训练做扎实的工作。

字节等发布RGBA视频生成新作:跳过35%透明token,1.2倍提速画质不降
视觉与图像

字节等发布RGBA视频生成新作:跳过35%透明token,1.2倍提速画质不降

游戏行业离不开RGBA动画,但“先生成RGB再抠图”的老路子,一到半透明边缘就翻车。字节联合北大清华带来一个反直觉方案:既然alpha本身就是可见性信号,那干脆用它来跳过计算——用2.4K个游戏资产视频训练RGBA生成器,1.2倍提速,FVD 174.4,质量几乎无损。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球