香港科技大学提出LiveLight:视频重光照首次实时化,交互式打光边播边调
实时移动光源,画面即刻响应——LiveLight 让视频重光照从『渲染后等待』变为『边播边调』。香港科技大学联合多家机构提出首个基于扩散模型的实时流式视频重光照框架,仅用4步采样跑出15.78FPS还把质量做到SOTA,视频编辑领域值得重点关注的方向性工作。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
实时移动光源,画面即刻响应——LiveLight 让视频重光照从『渲染后等待』变为『边播边调』。香港科技大学联合多家机构提出首个基于扩散模型的实时流式视频重光照框架,仅用4步采样跑出15.78FPS还把质量做到SOTA,视频编辑领域值得重点关注的方向性工作。
文生图提示优化一直是热门,但之前的方法要么只看文本要么只给分数,缺少结构化图像诊断。PRISM另辟蹊径,用一个VLM同时当裁判和教练,先看图挑毛病再针对性改提示,最后用强化学习让模型越改越好。在TIFA上从76.1飙升到91.4,关键是可解释性极强——每个修改都有理有据。
还在担心你的照片被 PimEyes、Clearview AI 这类“人脸搜索引擎”人肉吗?港大团队提出的 Protego 通过一个独特的 3D 隐私纹理,让你的面部在搜索引擎中彻底“隐身”——即使查询图像也是被保护过的,仍然无法匹配。实验显示召回率暴降 3.5 倍,而且能流畅保护视频,效果自然得像是没加过工。
统一多模态模型(UMM)过去要么贵得离谱(训练成本几万美元、数据上亿),要么理解与生成总得二选一。Sony AI这篇Argus-Unified直接掏出“混合视觉令牌”方案,把预训练VLM的视觉编码器冻住,只花$2000和1500万数据就训出比7B模型还强的理解能力,生成效果也不拉胯。对搞低预算落地的团队来说,这是一份很实在的参考。
这篇来自弗吉尼亚大学的Lantern直面物理引导扩散在量热器模拟中的梯度冲突问题,设计GradBlend让物理辅助损失不妨碍生成保真度,并引入新度量CFD诊断层间与体素相关性。实验显示Lantern在FPD上持平纯去噪基线,而普通多任务方法性能崩溃2-100倍。对想给生成模型加物理约束的团队极有启发性。
Netflix 这次玩真的——以前给演员换背景换灯光,人脸基本就崩了。ID-V2V 把身份保持当成了重光照问题,用“重光照面部”+“法线图”把演员的脸死死锁住,单视频就能训,真人脸相似度直接拉到 0.701,比第二名高出 30% 多,还能同时管住多人场景。做视频后期的小伙伴,这篇一定得看。
在视频生成领域,肖像动画一直是个既要保身份又要跟表情的棘手活。传统3DMM渲染生硬,纯扩散模型控制不准。本篇来自TUM和丰田的ViDS巧妙地把3DMM法线图作为视频扩散的条件,实现了精细、稳定的肖像动画生成,FID低至21.29,用户评分领先对手一大截。
摄影后期调色还在手动拉曲线?Hist2Style把大型图像编辑模型“压缩”成一个1.5M参数的轻量网络,用直方图作为控制界面,让你像调音量一样调色调。在用户研究里,它赢了82%的对比试验,而且支持实时4K处理,简直是调色师的效率神器。
视频换脸的一大痛点就是没有“正确答案”用来训练。DreamID-V虽用首尾帧锚定加姿势驱动生成了配对数据,但中间帧的身份漂移和皮肤像美颜滤镜一样平滑,一直没解决。这篇2026年7月的新论文直接把锚点放置闭环化,哪里漂插哪里,还从真实视频里扒纹理补回去——思路简单粗暴,实验设计也很严谨,七组实验一一对应验证假设。做换脸、视频生成或数据增强的小伙伴值得看看。
你是不是也遇到过这种尴尬:下载了一个精美的3D模型,结果纹理一放大全是马赛克,UV接缝处裂开得像补丁?传统图像超分模型拿到纹理图上直接翻车,生成模型又一味“自由发挥”不保留原细节。浙大团队这次祭出Texture++,用“自适应视角+四叉树掩码+局部单步扩散”三板斧,既保真又无缝,4倍超分PSNR飙到37.53,比SOTA高出1.5个dB,关键是——不需要梯度
这篇论文最有意思的地方,不是“又做了一个扩散逆问题方法”,而是把原本很容易写成一团经验技巧的 posterior sampling,硬生生拆成了按奇异方向逐坐标更新的 DDIM。更狠的是,它还给出后验一致性证明,属于“能跑、能讲、还能证”的那类工作。
最狠的地方不是“生成得像”,而是 不用再训练一个新模型 ,直接把多个单条件扩散模型拼起来,就能同时听懂框、点、草图、深度、参考图和文字。更离谱的是,它还敢说理论上条件数量不限。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球