LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12787 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:视频生成

共 73 篇
北大阿里最新:两步视频生成新范式DUET,质量追平DMD、多样性翻倍!
视觉与图像

北大阿里最新:两步视频生成新范式DUET,质量追平DMD、多样性翻倍!

两步视频生成一直面临“要质量还是要多样性”的取舍难题。北大、阿里与清华联手提出的DUET,干脆让sCM和DMD两位专家按噪声级分工,高噪声步管结构多样性,低噪声步管细节质量,实验显示多样性比DMD翻倍、质量还追平了DMD。思路简单到让人拍大腿,效果却相当能打。

快手Kling团队新作:16 FPS实时生成多镜头连贯视频,一个模型搞定生成、参考与编辑
视觉与图像

快手Kling团队新作:16 FPS实时生成多镜头连贯视频,一个模型搞定生成、参考与编辑

告别逐镜头生成的割裂感,快手Kling团队联合清华、南大提出的ContextMaster,把生成、参考和编辑统一进一个模型,在单卡上跑到16 FPS的同时,还能让角色和场景在多镜头之间保持一致。🔍 想看懂这套固定预算稀疏路由怎么在有限算力下留住完整记忆?这篇值得细读。

清华AIR最新研究:视频扩散模型做规划不用跑完,170ms就够?
视觉与图像

清华AIR最新研究:视频扩散模型做规划不用跑完,170ms就够?

视频扩散模型做驾驶规划,一定要把未来视频全部生成完吗?清华AIR这篇工作给出了否定的答案:中间层特征已经足够解码出好轨迹。它给六个中间层装上"提前出口",配一个轻量质量打分器,分数够了就立刻刹车返回,平均端到端延迟只有170毫秒,比全深度规划省下47%的时间,数值还更高。把视频生成的成本巧妙避开了,这个思路在同类工作里相当眼前一亮。

AI · PAPER
视觉与图像

香港科技大学提出LiveLight:视频重光照首次实时化,交互式打光边播边调

实时移动光源,画面即刻响应——LiveLight 让视频重光照从『渲染后等待』变为『边播边调』。香港科技大学联合多家机构提出首个基于扩散模型的实时流式视频重光照框架,仅用4步采样跑出15.78FPS还把质量做到SOTA,视频编辑领域值得重点关注的方向性工作。

视频生成|复旦快手新研究:同一个PE写两边,T2V多事件生成全面涨点
视觉与图像

视频生成|复旦快手新研究:同一个PE写两边,T2V多事件生成全面涨点

如果你在公众号里刷到过AI视频生成的翻车现场,大概率见过这种名场面:你明明输入的是“一只熊推开树桩、找到食物、抓住老鼠、吃掉它”,生成的视频里熊只做到了一半就停下来,甚至干脆把树桩忘了。这不能全怪视频生成模型“笨”。真…

AI · PAPER
视觉与图像

文生视频最难啃的骨头,被cIPO用"重建误差"啃下来了

文生视频最讨厌的就是中间有几帧突然崩坏,而现有DPO类偏好优化连"错题"都找不准。快手Kling团队这篇cIPO,直接从模型自己的去噪重建误差里抠出偏好信号,把优化火力集中到高错误时间窗口,不用人工标注、不用外部奖励模型,MotionBench上Forensic从0.830涨到0.876,思路清奇且工程上很容易复现。

AI · PAPER
视觉与图像

视频阴影去除新SOTA!杭电等高校新方法,0.82dB领先

夏天在景区拍照,最难缠的不是人潮,而是地上那道怎么躲都躲不开的影子。照片还能靠后期硬修,一到视频里影子跟着物体动起来,简直是在考验修图师的心脏。今天这篇AAAI 2027论文《WildShadowRemover》,把“去除视频阴影”这件事直接交给视频扩散模型来搞定。看完只能说一句:还是让模型去扛吧,人眼真的看不过来。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球