Netflix ID-V2V开源:一招锁住人脸,重风格化零损失
Netflix 这次玩真的——以前给演员换背景换灯光,人脸基本就崩了。ID-V2V 把身份保持当成了重光照问题,用“重光照面部”+“法线图”把演员的脸死死锁住,单视频就能训,真人脸相似度直接拉到 0.701,比第二名高出 30% 多,还能同时管住多人场景。做视频后期的小伙伴,这篇一定得看。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
Netflix 这次玩真的——以前给演员换背景换灯光,人脸基本就崩了。ID-V2V 把身份保持当成了重光照问题,用“重光照面部”+“法线图”把演员的脸死死锁住,单视频就能训,真人脸相似度直接拉到 0.701,比第二名高出 30% 多,还能同时管住多人场景。做视频后期的小伙伴,这篇一定得看。
在视频生成领域,肖像动画一直是个既要保身份又要跟表情的棘手活。传统3DMM渲染生硬,纯扩散模型控制不准。本篇来自TUM和丰田的ViDS巧妙地把3DMM法线图作为视频扩散的条件,实现了精细、稳定的肖像动画生成,FID低至21.29,用户评分领先对手一大截。
继7月聊过北大用0.005bpp还原视频细节之后,微软亚洲研究院带着GenVC来了——这是**首个面向视频压缩、从头训练的像素域视频扩散模型**。它不自欺欺人地继承百亿参数预训练骨架,而是用5.78亿参数干到码率省六成、解码15fps。更关键的是,它发现直接暴力蒸馏会让运动卡死,于是提出了**自适应分数蒸馏**来精准纠偏。想搞懂视频压缩+扩散模型的最强实战,
单步扩散视频超分整天被时间抖动折磨?AMD和维尔茨堡大学这次玩了个新思路:给token搞“分班”,重要的走精品班,不重要的走大班合班,最后再无缝合回来。结果你猜怎么着?推理加速了,质量一点没掉,甚至更稳了。全开源的代码,值得一试。
机器人世界模型怎么喂动作?直接喂控制信号?还得自己学动作实现。首尔大学这招妙:先把动作在仿真里走一遍,渲染成机器人几何和深度,然后把"这堆像素"喂给视频模型。模型直接"看见"机器人怎么动,只负责学场景怎么响应。效果嘛——比喂状态向量强一截,还能直接泛化到没见过的机械臂和人类演示。
继2026年5月推送的NeoVerse之后,斯坦福又带来一款暴力物理世界模型PhyWM。它没有标注,没有动作标签,仅靠自回归预测光流和RGB,就能零样本完成物体分割、3D操纵甚至Visual Jenga。对机器人、具身智能来说,这是一条通往物理智能的捷径。
说到给视频配音效,很多人会想:不就是根据画面内容生成声音吗,猫叫就是喵喵,打雷就是轰隆,有什么难的?但如果你脑洞再大一点——比如,你想让视频里原本只是“喵喵”叫的猫,在00:07秒的那一声突然变成“狮子吼”;或者你希望整个视频的音频听起来就像是从一部80年代复古游戏机里传出来的;再或者在火柴划过的一瞬间,不仅要有摩擦声,还要叠加一声魔幻的“呼——嗖”……你会
视频换脸的一大痛点就是没有“正确答案”用来训练。DreamID-V虽用首尾帧锚定加姿势驱动生成了配对数据,但中间帧的身份漂移和皮肤像美颜滤镜一样平滑,一直没解决。这篇2026年7月的新论文直接把锚点放置闭环化,哪里漂插哪里,还从真实视频里扒纹理补回去——思路简单粗暴,实验设计也很严谨,七组实验一一对应验证假设。做换脸、视频生成或数据增强的小伙伴值得看看。
视频压缩最难的,不是把码率压低,而是把画面压低以后还不让人想砸键盘。北大这篇直接把“结构锚点”和“运动细节”拆开处理,用生成模型补细节,思路很硬,码率也压得够狠。
长视频生成最怕两件事:记忆丢了,画面崩了;算力花了,速度没了。Surprise Forcing把这两个问题一起管了,用训练免费的方式做“该记的记住、该跳的跳过”,而且还真在长视频基准上跑出了像样的结果。
视频摘要最容易犯的错,不是总结得不够短,而是把最关键的证据先删没了。HAS偏偏反着来:不做硬挑帧,而是把“高光分布”变成推理时的注意力引导,思路很干净,实验也够实在。
边缘视频生成最烦的,不是模型不够大,而是缓存一多就把显存和PCIe一起拖下水。CODA的思路很硬:把算子拆开、把等待藏起来,系统味很足,值得细看。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球