LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12809 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:视频生成

共 73 篇
AI · PAPER
视觉与图像

Netflix ID-V2V开源:一招锁住人脸,重风格化零损失

Netflix 这次玩真的——以前给演员换背景换灯光,人脸基本就崩了。ID-V2V 把身份保持当成了重光照问题,用“重光照面部”+“法线图”把演员的脸死死锁住,单视频就能训,真人脸相似度直接拉到 0.701,比第二名高出 30% 多,还能同时管住多人场景。做视频后期的小伙伴,这篇一定得看。

AI · PAPER
视觉与图像

GenVC:首个压缩导向视频扩散模型,码率省62%秒变15fps

继7月聊过北大用0.005bpp还原视频细节之后,微软亚洲研究院带着GenVC来了——这是**首个面向视频压缩、从头训练的像素域视频扩散模型**。它不自欺欺人地继承百亿参数预训练骨架,而是用5.78亿参数干到码率省六成、解码15fps。更关键的是,它发现直接暴力蒸馏会让运动卡死,于是提出了**自适应分数蒸馏**来精准纠偏。想搞懂视频压缩+扩散模型的最强实战,

首尔大学提出Robot-Rendering:让世界模型直接"看到"机器人动作,告别动作编码!
视觉与图像

首尔大学提出Robot-Rendering:让世界模型直接"看到"机器人动作,告别动作编码!

机器人世界模型怎么喂动作?直接喂控制信号?还得自己学动作实现。首尔大学这招妙:先把动作在仿真里走一遍,渲染成机器人几何和深度,然后把"这堆像素"喂给视频模型。模型直接"看见"机器人怎么动,只负责学场景怎么响应。效果嘛——比喂状态向量强一截,还能直接泛化到没见过的机械臂和人类演示。

字节跳动新作!给视频配音就像改字幕,声效可控性暴增40.7%
视觉与图像

字节跳动新作!给视频配音就像改字幕,声效可控性暴增40.7%

说到给视频配音效,很多人会想:不就是根据画面内容生成声音吗,猫叫就是喵喵,打雷就是轰隆,有什么难的?但如果你脑洞再大一点——比如,你想让视频里原本只是“喵喵”叫的猫,在00:07秒的那一声突然变成“狮子吼”;或者你希望整个视频的音频听起来就像是从一部80年代复古游戏机里传出来的;再或者在火柴划过的一瞬间,不仅要有摩擦声,还要叠加一声魔幻的“呼——嗖”……你会

视频换脸数据合成不再“裸奔”:自适应锚定闭环放置,告别美颜滤镜式失真
视觉与图像

视频换脸数据合成不再“裸奔”:自适应锚定闭环放置,告别美颜滤镜式失真

视频换脸的一大痛点就是没有“正确答案”用来训练。DreamID-V虽用首尾帧锚定加姿势驱动生成了配对数据,但中间帧的身份漂移和皮肤像美颜滤镜一样平滑,一直没解决。这篇2026年7月的新论文直接把锚点放置闭环化,哪里漂插哪里,还从真实视频里扒纹理补回去——思路简单粗暴,实验设计也很严谨,七组实验一一对应验证假设。做换脸、视频生成或数据增强的小伙伴值得看看。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球