← 返回 PaperDaily 视觉与图像

快手LPM工业级视频修复:45%观看时长都在用

视频修复最难的不是“修清楚一帧”,而是“修完一整条还不闪”。LPM把数据、训练、推理和部署一起打通,直接做到工业级落地,还顺手把带宽成本打下来了,属于论文里少见的真能进生产线的狠角色。

快手LPM工业级视频修复:45%观看时长都在用
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
视频修复最难的不是“修清楚一帧”,而是“修完一整条还不闪”。LPM把数据、训练、推理和部署一起打通,直接做到工业级落地,还顺手把带宽成本打下来了,属于论文里少见的真能进生产线的狠角色。


原论文信息如下:
论文标题:
LPM: Industrial-Scale Generative Video Restoration
发表日期:
2026年07月
发表单位:
快手科技
原文链接:
https://arxiv.org/pdf/2607.13460v1.pdf

引言

这篇论文最有意思的地方,不是又堆了一个“更大”的视频修复模型,而是把一个老问题讲透了:真实世界的视频不是实验室样片,噪声、模糊、压缩、转码、长视频漂移,样样都来。LPM的思路很直接——先把数据做干净,再把图像修复能力练扎实,最后再把时序一致性和长视频推理补齐,硬是把生成式修复从“能看”推到了“能上线”。
更夸张的是,它不是只在论文里跑分,而是已经在快手生产系统里跑起来了,覆盖平台约45%的观看时长。对视频修复来说,这句话的含金量比“刷新几个指标”高得多,因为工业场景最怕的不是分数低,而是高分模型一上线上演翻车现场

方法概述

图2:数据构建流程总览
图2:数据构建流程总览。论文先做大规模高质量数据工程,再进入分阶段训练,最后配合长视频推理策略,形成一条完整的工业级视频修复链路。

核心设计

图3:LPM-Video结构与时序模块
图3:LPM-Video结构与时序模块。它在LPM-Image的空间修复能力上叠加分解式时序注意力,并用掩码引导参考帧,让跨片段信息能接着传下去。
图3:LPM-Video结构与时序模块
LPM分成两个阶段。第一阶段是LPM-Image,先把空间修复底子打牢,靠大规模数据和渐进式训练学会“怎么把一张图修好”。第二阶段是LPM-Video,把这个空间先验搬到视频里,再加上时间维度的建模,解决逐帧修复最容易出现的闪烁和漂移问题。
它没有走“把视频当一堆图片分别修”的偷懒路线,而是用分解式的空间+时间注意力,在保留细节的同时控制计算量。这个设计挺务实:既想要画质,又不想把显存和延迟一起烧穿。
这里最值得记住的一点是:LPM不是单纯追求“更像真”,而是把“更像真”和“更稳定”一起做。这在视频修复里很关键,因为观感最怕的不是一帧糊,而是每一帧都“差不多糊但还不一样糊”。

数据准备及实验设计

论文的数据工程很重,但思路并不绕。先用KVQ筛掉低质量样本,再用KTQ保住高频纹理丰富的内容,还要处理分辨率分层、语义均衡、去重,以及视频里额外的场景切分、运动分布平衡和时间一致性过滤。说白了,就是先把“脏数据”和“没营养的数据”尽量踢出去,不然再强的模型也只能学会一本正经地胡修。
图4:LPM-Video退化与数据构建流程
图4:LPM-Video退化与数据构建流程。视频训练时,退化参数在一个片段内保持一致,再叠加不同码率压缩,更接近真实分发场景里的退化分布。
实验设计上,论文也很讲究“先广后精”。先用大规模数据学通用修复,再用高质量小集合做细化,最后还专门补了文字、细纹理和大运动场景,避免模型一遇到复杂运动就开始抖、糊、飘。这个节奏很像训练一个老练修图师:先见多识广,再精雕细琢,最后专治疑难杂症。

核心原理推导

这部分不硬推新公式,直接说人话:LPM-Image本质上还是条件扩散/流匹配范式,输入是低质图像,目标是恢复出高质图像。它把低质输入和当前噪声状态拼在一起送进DiT,让模型学会从“脏图”里一步步把干净图抠出来。
真正巧的是条件注入方式。不是再搭一个ControlNet分支,也不是搞一堆花里胡哨的跨注意力,而是把低质潜变量和当前状态直接拼接。好处很朴素:结构对应关系更直接,参数更省,训练和部署都更轻。
图6:轨迹蒸馏与三阶段截断一致性模型
图6:轨迹蒸馏与三阶段截断一致性模型。论文把25步采样压到更少步数,靠一致性模型、多步积分和三阶段训练,把“快”和“像”尽量同时保住。
加速部分也很现实。工业系统不能老靠25步慢慢磨,LPM把扩散轨迹蒸馏成单步或两步,再配合FP8、INT8、TensorRT-LLM和分块VAE,最终把端到端速度提了39.5倍。这个数字不是“论文里看着爽”,而是能决定一个功能能不能真上线。

实验结果

图7:与开源方法和商业方法的对比结果
图7:与开源方法和商业方法的对比结果。整体观感上,LPM-Video在去噪、细节恢复和时序稳定之间找到了更均衡的位置,没有一味把画面磨得像打了高斯柔光。
定量结果也比较硬气:图像修复上,LPM-Image在多个基准上拿到最优或接近最优的感知质量分数;视频修复上,LPM-Video在公开视频集和自建基准上普遍领先,尤其在VideoLQ上提升非常明显。更关键的是,它不是只在一个指标上“刷存在感”,而是在画质、结构、时序一致性之间同时占优。
生产侧的结果更有说服力。论文明确写到,LPM已经服务于快手平台约45%的观看时长,并且在关键体验指标上持续改善;同时在相近感知质量下,码率还能比自研编码器降低20%以上。换句话说,它不仅让视频看起来更顺眼,还真能帮平台省下真金白银的带宽钱。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

为什么LPM不直接拿图像修复模型逐帧套视频?因为逐帧修复最容易出的问题不是“单帧不够清”,而是帧与帧之间长得不一样,最后整段视频开始闪。LPM专门补了时序建模和跨片段参考,才把这个坑填上。

这套方法最值钱的地方是什么?不是单纯的指标提升,而是把数据、训练、推理、部署串成了一条能跑的工业链路。论文里“45%观看时长”和“带宽降20%”这两个数字,比很多花哨结构都更有分量。

普通团队能直接抄作业吗?思路可以抄,整套工业化能力不太能照搬。真正难的不是模型名字,而是大规模高质量数据、长视频推理和低成本部署这三件事能不能一起落地。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是只改一个模块,而是把数据工程、渐进训练、时序建模和部署加速做成整套系统,工业味很足。

实验合理度:★★★★☆ 公共基准、自建基准、在线业务指标和带宽收益都给了,论证链条比较完整。

学术研究价值:★★★★☆ 对生成式视频修复的长视频一致性和工业落地都有参考意义,不只是快手内部自嗨。

稳定性:★★★★☆ 通过金字塔推理和参考帧锚定,明显在对抗长视频漂移这件事上更稳。

适应性以及泛化能力:★★★☆☆ 覆盖了复杂UGC,但长尾内容和高质量输入上的收益仍有限,论文自己也承认了边界。

硬件需求及成本:★★★★☆ 训练肯定不便宜,但推理侧做到了FP8/INT8和TensorRT优化,部署思路很务实。

复现难度:★★★★☆ 数据、训练阶段、推理链路都比较重,想完整复现不是小工程。

产品化成熟度:★★★★★ 已经进生产,而且覆盖45%观看时长,这一项基本不用再解释。

可能的问题:数据和系统都太“工业级”了,普通团队很难完全复刻;另外高质量输入上的收益不大,说明模型仍然主要吃“修烂片”的红利。


主要参考文献

Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer. High-resolution image synthesis with latent diffusion models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 10684–10695, June 2022.
William Peebles and Saining Xie. Scalable diffusion models with transformers. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 4195–4205, 2023.
Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang, Yaohui Wang, Yu Qiao, Maneesh Agrawala, Dahua Lin, and Bo Dai. Animatediff: Animate your personalized text-to-image diffusion models without specific tuning. In International Conference on Learning Representations (ICLR), 2024.
Xingchao Liu, Chengyue Gong, and Qiang Liu. Flow straight and fast: Learning to generate and transfer data with rectified flow. In The Eleventh International Conference on Learning Representations (ICLR), 2023.
Yang Song, Prafulla Dhariwal, Mark Chen, and Ilya Sutskever. Consistency models. In International Conference on Machine Learning, pages 32211–32252. PMLR, 2023.
Jianyi Wang, Zhijie Lin, Meng Wei, Yang Zhao, Ceyuan Yang, Chen Change Loy, and Lu Jiang. SeedVR: Seeding infinity in diffusion transformer towards generic video restoration. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 2161–2172, 2025.

快手大规模生成式视频恢复模型问世,覆盖45%观看时长!

视频修复这件事,最怕的不是“修不清”,而是“修完还在闪”。单帧看着挺像样,一连起来就像屏幕在抽风。LPM这篇工作最狠的地方,不是把某个指标抬高一点,而是把生成式视频恢复真正推到了工业级:不仅已经在快手生产系统里跑起来,还覆盖了平台约45%的观看时长。对一个视频平台来说,这不是论文里的漂亮数字,而是实打实的线上流量。
更关键的是,LPM没有走“把视频当成一堆图片逐帧修”的老路,而是把数据工程、空间修复、时序建模、长视频推理和部署加速整成一套系统。说白了,它不是一个单点模型,而是一条能落地的工业链路。这类工作最难得的地方,不是会讲故事,而是故事讲完了还能上线。
图1:Kwai UltraVision数据集的质量、分辨率与类别分布
图1:Kwai UltraVision数据集的质量、分辨率与类别分布。LPM能跑出工业级效果,第一步不是模型够大,而是先把训练数据做得足够“像真实世界”。

挑战工业级视频修复:从数据、模型到推理的全链路设计

先把问题说人话:真实视频不是实验室样片,而是UGC(User-Generated Content,用户生成内容)。它们通常同时带着噪声、模糊、压缩块、转码痕迹、低分辨率,甚至还有长视频里的漂移和闪烁。传统修复方法常常只擅长其中一小类问题,碰到复杂退化就原地打滑。LPM要解决的,是“复杂、真实、长视频”这三个词叠在一起时的修复难题。
论文的思路很直接:先做数据,再做模型,最后做推理。数据不干净,模型学出来只会更会糊弄;模型不懂时序,视频就会闪;推理不够聪明,长视频一上来就卡死。LPM把这三件事串起来,形成了一个完整闭环。

方法概述

图2:数据构建流程总览
图2:数据构建流程总览。整个系统先用大规模高质量数据打底,再通过分阶段训练逐步提升修复能力,最后用长视频推理把结果稳定送到生产侧。
论文把整体框架拆成两阶段:LPM-Image负责把“单张图修好”,LPM-Video负责把“视频修稳”。先训练图像修复,是因为空间细节和纹理生成是根基;再扩展到视频,是因为时间一致性不能靠逐帧碰运气。这个顺序很像盖楼:地基没打好,楼再高也会晃。
图3:LPM-Video结构与时序模块
图3:LPM-Video结构与时序模块。LPM-Video在空间DiT块之后插入分解式时序注意力,并通过掩码引导参考帧,把前一个片段修好的信息继续传给后一个片段。
这里先解释两个缩写。DiT是Diffusion Transformer,中文可理解为“扩散式 transformer”;VAE是Variational Autoencoder,中文是“变分自编码器”。LPM在空间建模上用DiT,在压缩表示上用VAE,再把时序注意力加进去,形成一个既能生成细节、又能处理视频连续性的框架。
它最务实的地方在于,没有为了“看起来高级”而上来就堆一个超重的视频生成骨架,而是沿着工业约束反推设计:空间能力要强、时序代价要低、长视频要稳、部署要便宜。这个思路很像做系统工程,不像做论文包装。

逐层解密LPM核心组件:渐进式训练与金字塔推理

LPM的核心,不是“一个超级模型”,而是“几个合理模块拼起来后刚好能打”。它的训练和推理都遵循同一条逻辑:先学会修图,再学会修视频;先看清局部,再保住长程一致性。

渐进式训练:先学空间,再学时间

LPM-Image先做大规模预训练,再做高质量微调,最后还有一个“忠实度强化”阶段。这个三段式训练很重要,因为生成式修复最大的坑就是:模型会修,但也会乱编。前两步让它学会“像真的”,最后一步让它别把原图里本来对的东西修没了。
其中,KVQ(Kuaishou Visual Quality,快手视觉质量)和KTQ(Kuaishou Texture Quality,快手纹理质量)是数据筛选的关键。KVQ主要筛掉模糊、噪声、压缩痕迹明显的低质样本,KTQ则尽量保住纹理丰富的内容。换句话说,前者管“清不清”,后者管“有没有料”。
图4:LPM-Video退化与数据构建流程
图4:LPM-Video退化与数据构建流程。视频训练时,同一片段内共享退化参数,再叠加不同码率压缩,更接近真实分发链路里的退化模式。
视频训练比图像更麻烦,因为退化往往不是逐帧随机的,而是带着时间相关性。论文没有把每一帧单独乱退化,而是让一个clip里的退化配置保持一致,再叠加视频压缩。这个做法很关键:如果每帧退化都不一样,模型学到的就不是视频规律,而是“随机抖动玄学”。

金字塔推理:长视频不能只靠硬切窗口

图5:时序金字塔推理
图5:时序金字塔推理。恢复后的关键帧提供长程引导,重叠帧负责短程连续性,长镜头则递归处理,避免窗口之间出现断层。
长视频推理是工业场景里真正的难点。直接整段送进模型,算力和显存先投降;切成滑窗处理,又容易在窗口边界出现断裂。LPM的temporal-pyramid inference,中文可理解为“时序金字塔推理”,就是用长程引导和短程锚点一起工作:关键帧负责把大方向稳住,重叠帧负责把局部连续性接上,长镜头则递归往前推。
这招看起来朴素,实际很有效。因为视频修复最怕的不是某一帧“没修好”,而是前后帧的纹理、颜色、边缘状态不一致。金字塔推理本质上是在给模型补一个“记忆系统”,让它别每个窗口都像失忆了一样从头开始。

39.5倍加速!揭秘LPM的低成本部署秘诀

很多生成式模型的问题都不是“效果不行”,而是“效果行但太贵”。LPM在部署侧做了很现实的优化:一方面用更轻的2D VAE和分解式2D+1D结构,另一方面把采样过程做轨迹蒸馏和训练感知加速。最后的结果是,端到端速度最高能达到39.5倍提升。
图6:LPM中的轨迹蒸馏与三阶段截断一致性模型
图6:LPM中的轨迹蒸馏与三阶段截断一致性模型。论文把原本多步采样压缩成更少步数,并通过一致性建模和多阶段训练尽量保持画质不掉太多。
这里可以顺手解释一个术语:Rectified Flow,中文通常译作“整流流”或“校正流”,它是一种把生成过程学成连续速度场的方式。相较于传统扩散采样,它在采样路径和训练目标上更简洁,适合做加速。LPM把它和一致性模型、分阶段截断训练结合起来,本质上是在压缩推理成本。
更接地气地说,LPM不是只会“修得好”,还懂得“别修太久”。工业系统里,延迟、显存、吞吐和成本都是真问题。一个功能能不能上线,往往不取决于它比别人多0.2分,而取决于它能不能在服务器上活下来。

全面碾压现有方法:定量与定性实验深度解析

实验部分的看点有两个:一个是修复质量,另一个是效率和系统收益。前者决定模型是不是“看起来厉害”,后者决定它是不是“真的有用”。LPM两者都给了答案。
表1:VAE重建质量对比
表1:VAE重建质量对比。LPM-VAE在内部基准上同时拿到更高的PSNR和SSIM,说明它在潜空间压缩时更能保住结构和细节,这对后续生成式修复非常关键。
先看基础组件。表1显示,LPM-VAE在重建质量上优于多个图像和视频VAE基线。这个结果并不花哨,但很重要,因为VAE一旦压坏了,后面的扩散模型再强也只能在“有损底图”上做文章。LPM先把底层表示做稳,后面才能谈高质量生成。
表3:RealSR与RealSet上的图像超分辨率结果
表3:RealSR与RealSet上的图像超分辨率结果。LPM-Image在真实退化场景下表现更强,说明它学到的不是“某个固定数据集的套路”,而是更通用的恢复先验。
表4:LPM-Benchmark上的图像超分辨率结果
表4:LPM-Benchmark上的图像超分辨率结果。这里的优势更能体现工业数据分布下的适应性,说明大规模数据工程和渐进训练确实不是摆设。
再看视频结果。LPM-Video在公开视频集和内部基准上都表现稳定,尤其在复杂退化、长视频和大运动场景里更占优势。它的优势不只是“更清晰”,而是“更连续”。视频修复里,连续性往往比单帧锐度更难做,也更能决定观感。
表5:公开视频基准与LPM-Benchmark上的视频修复结果
表5:公开视频基准与LPM-Benchmark上的视频修复结果。LPM-Video在多个指标上领先,说明它不仅能修单帧,还能把时间维度一起照顾好。
图7:与开源方法和商业方法的对比结果
图7:与开源方法和商业方法的对比结果。直观上,LPM在去噪、纹理恢复和时序稳定之间找到了更均衡的位置,没有把画面修得像塑料,也没有把细节磨成一片糊。
最有分量的还是线上结果。论文写得很明确:LPM已经服务于快手约45%的观看时长,并且在关键体验指标上持续改善;在相近感知质量下,码率还能比自研编码器降低20%以上。这个结果的含金量在于,它同时说明了两个问题:第一,修复后的内容真的更适合用户观看;第二,修复后的内容还能帮助平台省带宽。一个技术如果既提升体验又降成本,工业价值就很难再被忽视。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“真实世界长视频怎么又清楚、又稳定、还别太贵”这个问题。不是单帧修复,而是工业级视频恢复。

KVQ、KTQ、NoPE分别是什么意思?KVQ是Kuaishou Visual Quality,快手视觉质量;KTQ是Kuaishou Texture Quality,快手纹理质量;NoPE是No Temporal Positional Encoding,意思是“不使用显式时间位置编码”。

普通团队最值得抄哪一部分?最值得抄的是“先做高质量数据,再做渐进训练,最后做长视频推理”的系统思路。单抄模型结构意义不大,真正值钱的是整条链路的设计方法。

龙哥点评

论文创新性分数:★★★★☆ LPM的创新不在某一个小点,而在于把数据、模型、推理和部署串成工业闭环,这种系统级创新更接地气。

实验合理度:★★★★☆ 公共基准、内部基准、在线指标和带宽收益都给了,证据链比较完整,属于能站得住的类型。

学术研究价值:★★★★☆ 对生成式视频恢复、长视频一致性和工业落地都有参考意义,不只是业务论文。

稳定性:★★★★☆ 金字塔推理和参考帧锚定让长视频更稳,但极端长尾场景仍然可能有漂移风险。

适应性以及泛化能力:★★★★☆ 面向复杂UGC,覆盖面很广;不过高质量输入上的收益会收窄,这是这类方法的天然边界。

硬件需求及成本:★★★★☆ 训练成本不低,但推理侧已经做了明显优化,39.5倍加速说明部署意识很强。

复现难度:★★★☆☆ 数据工程、训练阶段和推理链路都重,想完整复现不是小作业。

产品化成熟度:★★★★★ 已经在快手生产系统里跑起来,而且覆盖45%观看时长,这一项几乎没悬念。

可能的问题:系统太完整,普通团队很难原样复刻;另外它对“修烂片”更强,对本来就很好的视频提升有限。


主要参考文献

LPM Team
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。