ICCV 2026风格D2DF:视频移物一步搞定,还能不要草稿
这篇工作最狠的地方,不是“能修视频”,而是把“多步扩散修复”硬生生压成了一步,还顺手把对外部草稿的依赖也掐掉了。对于视频对象移除这种既要像真、又要够快的任务,D2DF给出了一条很工程化的路子。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇工作最狠的地方,不是“能修视频”,而是把“多步扩散修复”硬生生压成了一步,还顺手把对外部草稿的依赖也掐掉了。对于视频对象移除这种既要像真、又要够快的任务,D2DF给出了一条很工程化的路子。
高速运动把图像“拍糊”这件事,常见到让人麻木,但真要把它从3D重建里彻底修好,难点就来了。JADE-GS的思路很直接:让事件相机补时间信息,再让3D几何反过来约束2D去模糊,效果和效率都比单向流水线更像样。
单像素光谱成像最怕“拍得慢还拍不准”。这篇论文的思路很直接:先拍一点点,再让模型决定后面该拍哪些 Hadamard 模式,结果在仿真和近红外实拍里都比固定排序更稳。
这篇论文最有意思的地方,不是“把事件相机加进来”这么简单,而是先把雨和背景拆开,再让两种模态按角色配合。对动态雨天视频来说,这种“先分家,后合作”的思路,比粗暴融合更像正经工程。
视频修复最难的不是“修清楚一帧”,而是“修完一整条还不闪”。LPM把数据、训练、推理和部署一起打通,直接做到工业级落地,还顺手把带宽成本打下来了,属于论文里少见的真能进生产线的狠角色。
尿检这件事,卡住的往往不是模型,而是显微镜前那一步“得先拍出一张够清楚的图”。这篇工作很朴素:不用昂贵自动对焦,改成手动调焦录视频,再把最清楚的片段拼成全聚焦图,适合基层实验室看门道。
这篇论文最有意思的地方,不是“翻译”本身,而是把古手稿识别、现代越南语生成和偏好对齐揉成一个端到端问题。PPO、DPO、KTO三种RLHF路线同台对决,结果也很诚实:DPO在多数翻译质量指标上最稳,PPO更偏覆盖,KTO则保留了自己的性价比。
这篇论文最有意思的地方,不是又堆了一个大模型,而是把超分辨率的“起跑线”往前挪了一步:不再从纯噪声出发,而是让低质图像自己带路。再加上两阶段训练,既能单步快跑,也能多步细修,工程味很足。
轻量超分最怕两件事:一是只顾省算力,结果图像糊成一锅粥;二是只顾补细节,显存和延迟直接炸锅。CUST这篇的思路挺实在,先用跨窗口相似聚类把“远处但相关”的信息拎过来,再用误差驱动的局部注意力补纹理,最后在精度、显存、速度之间给出一个比较像样的平衡。
这篇工作不玩花活,专盯RAW无损压缩里最容易被忽略的“对齐”问题。看似只是把亮度样本挪一挪,实际却能让CfL预测更稳,JPEG XS里也更能省码率。
去雾这事最烦的不是“有雾”,而是雾还会挑地方、挑光照、挑场景。BPUL的思路很直接:别假装雾是确定性的,先把不确定性拎出来,再用物理一致性和对比约束把模型拽回正轨。😊
这篇论文很实在:不追求大模型堆参数,而是盯着视频通话最真实的痛点——带宽不够、画面糊、还得实时。它用少量人脸帧就能快速训练一个CPU可跑的增强模型,属于“能落地”的那种小聪明。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球