← 返回 PaperDaily
视觉与图像
NVRC++来了:7.6倍提速,还把视频压缩复杂度钉死了
NVRC++最值钱的地方,不是“又做了一个视频压缩模型”,而是把INR视频编码最头疼的两件事——复杂度随码率乱飘、长序列高分辨率网格难训练——一起按住了。四档复杂度、宽码率范围、实时解码,这套组合拳很适合想看“论文怎么往工程落地靠”的读者。
龙哥读论文
发布于 2026-08-16 11:00:49
阅读 5
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: NVRC++最值钱的地方,不是“又做了一个视频压缩模型”,而是把INR视频编码最头疼的两件事——复杂度随码率乱飘、长序列高分辨率网格难训练——一起按住了。四档复杂度、宽码率范围、实时解码,这套组合拳很适合想看“论文怎么往工程落地靠”的读者。
原论文信息如下:
隐式神经表示(INR)视频编码的瓶颈在哪里?
先说人话:INR 视频编码 这条路线,想做的事很朴素——不用把视频硬塞进传统压缩器的“块、预测、变换、熵编码”流水线里,而是让一个神经网络直接“背下”这段视频。看起来很优雅,像是把视频变成了一个可学习的函数。
问题也正出在这里。INR(Implicit Neural Representation,隐式神经表示) 本质上是用坐标去查像素值:给它一个时间坐标和空间坐标,它输出这一点的颜色。为了把视频压得更好,模型通常会被“过拟合”到单个视频上,再把网络参数压成码流。听起来像“模型记住了视频”,但真正落地时,麻烦比想象中多得多。
这篇论文抓住的核心矛盾很直接:想要高质量,就得堆更大的模型;想要低复杂度,又容易掉码率和质量;想要支持不同码率档位,复杂度还会跟着码率一起飘 。换句话说,很多 INR 视频编码方法不是“好但太慢”,就是“快但不够好”,中间那条又快又稳的路,一直没人真正走顺。
论文里最有意思的一点,是它没有继续在“单点最优”上死磕,而是把目标改成了极端复杂度与极端质量范围下都能工作 。这就像不是只造一辆跑车,而是想造一套能从代步车到性能车都能切换的底盘。NVRC++ 就是这样一个底盘。
NVRC++:层次化参数编码结构 + 高维特征网格,让复杂度与质量解耦
NVRC++ 的第一刀,砍在“复杂度跟着码率乱跑”这个老毛病上。传统高性能 INR 方法为了追求更高画质,往往要把模型做大;结果一到高码率,解码计算量也跟着上去,最后用户得到的不是“更清晰”,而是“更卡”。NVRC++ 选择反着来:把模型复杂度固定在几个档位上,再通过高分辨率特征网格拉开质量范围 。
这里的“特征网格”可以理解成一张可学习的三维地图:空间位置和时间位置对应到网格中的特征,再通过插值和神经网络还原像素。网格越细,能装下的细节越多;但网格太细,也会带来训练和压缩负担。NVRC++ 的思路不是简单把网格做大,而是让不同分辨率的网格协同工作,形成从低到高的多档表示。
这套结构里最关键的,是论文提出的in-parameter coding structure(参数内部编码结构) 。名字很拗口,意思其实很直白:不是把视频帧当成一串独立对象去编码,而是把网格参数本身按时间切片,再像传统视频编码那样做层次化依赖建模。这样一来,前面的切片可以给后面的切片提供上下文,减少冗余。
更重要的是,这种层次结构并不是为了“学术上看起来像视频编码”,而是实打实地解决了一个工程问题:高分辨率网格太大,直接端到端优化会把显存和时间都烧穿 。NVRC++ 把依赖关系拆开,训练时只处理部分参数,避免了一口气缓存整条长视频的激活值。论文甚至提到,最大模型在 24GB 消费级显卡上也能编码 600 帧 1080p 视频,这就不是纸上谈兵了。
这里还有一个很实用的改动:feature grid masking(特征网格遮挡) 。高分辨率网格很容易在训练早期“抢戏”,把低层网格的作用压没了,结果低码率性能反而变差。NVRC++ 用类似 dropout 的随机遮挡,让模型先学会依赖低层表示,再逐步放开高层细节。这种策略不花哨,但很像真正懂训练的人会做的事:先管住模型别太贪,后面再慢慢放权。
多维网格熵模型:融合时间、空间、尺度先验,压缩高维参数
高维网格一旦上来,新的麻烦也来了:参数多了,怎么压?如果只是粗暴量化,再配一个慢吞吞的自回归熵模型,压缩效果是能上去一点,但速度会很难看。论文在这里换了思路:不再只盯着“更准”,而是让熵模型同时吃进尺度先验、时间先验、空间先验 ,尽量把高维参数的统计规律榨干。
先说尺度先验。低分辨率网格先编码,高分辨率网格再以它们为条件,这很像先看粗轮廓,再补细节。再说时间先验。因为网格被切成时间切片,前面的切片可以作为后面切片的上下文,减少重复信息。最后是空间先验。单个切片内部也不是一锅粥,而是按空间顺序逐步编码,让已经编码的邻域去帮助后续位置建模。
这一套的核心价值在于:它不是单纯追求更复杂的熵模型,而是在速度和效果之间找平衡 。论文明确提到,编码步骤并没有无限增加,而是根据分辨率控制在 1 到 4 步之间。这个选择很工程化:够用就行,别把好不容易提起来的解码速度又折腾没了。
如果把这个模块翻译成普通人能懂的话,大概就是:以前是“一个大箱子一把锁”,现在变成“分层抽屉、分步上锁、边锁边看上下文”。箱子还是那个箱子,但锁法更聪明了。
HiNeRV++:轻量快速却强大,解码性能飙升7.6倍
NVRC++ 并不是只靠“网格更大”取胜,真正把它拉起来的,还有改进后的 INR 主干:HiNeRV++ 。这是在 HiNeRV 基础上的增强版,目标很明确:在不同复杂度档位下都能保持实时解码,同时尽量别把表示能力砍太狠。
它做了三件事。第一,使用更高分辨率的特征网格,让模型能在同样的网络复杂度下装下更多细节。第二,把多个相邻原始切片作为输入参考,而不是只依赖插值后的特征。这个变化很关键,因为插值过的特征再怎么平滑,也不如原始邻域信息“新鲜”。第三,把最高层的一些重块替换成更轻的 Pixel Shuffle 输出层,减少高分辨率阶段的计算压力。
这部分最值得记住的,不是某个单独小技巧,而是它把“轻量”和“高性能”这对老冤家拉到了一张桌子上。论文给出的结果显示,NVRC++ 在保持接近甚至达到 SOTA 的压缩性能时,解码速度相较 NVRC 最快可提升 7.6 倍 。对视频压缩来说,这种提升不是“锦上添花”,而是直接决定能不能上设备、能不能实时跑。
实验结果:各复杂度级别性能全面超越SOTA,实时解码可行
先看实验设置,论文选了两个标准数据集:UVG 和 MCL-JCV ,都是 1080p 高分辨率视频序列。对视频压缩来说,这种数据集比较能看出模型到底是在“真会压”,还是只会在小样本和低分辨率上装样子。
更关键的是,NVRC++ 不是单一配置,而是做了四档复杂度:S1 到 S4。这个设计非常对路,因为真实系统里根本不存在“所有设备都能跑同一个最优模型”的童话。手机、边缘设备、工作站、服务器,算力预算完全不同。NVRC++ 的价值就在于:同一套方法,能按硬件预算切不同档位 。
从结果上看,NVRC++ 的表现很像“把两条路都走通了”:一方面,S3、S4 这类中高复杂度配置已经能接近或超过最强的 INR 基线;另一方面,S1、S2 又没有因为追求轻量而彻底掉队。尤其是和 NVRC 相比,NVRC++ 不是只在某个点赢,而是在更宽的质量区间里保持更稳定的权衡 。这说明它的改动不是“调参碰运气”,而是确实把结构问题解决了一部分。
论文里还有一个很值得工程师关注的点:解码速度和熵编码时间被分开统计 。这不是“故意拆指标”,而是因为 INR 类方法的熵编码和帧解码本来就是不同阶段。把它们分开看,才能更真实地判断方法是不是适合实时场景。按这个口径,NVRC++ 的解码速度已经明显优于 NVRC,同时还能维持竞争力的压缩性能。
消融实验也支持这个结论。论文的表 2、表 3 显示,层次化参数编码、高维特征网格、随机采样优化、特征遮挡、多维熵模型和 HiNeRV++ 这些模块不是摆设,而是各自都在往同一个方向推:让高质量和低复杂度不再互相掐架 。尤其是 HiNeRV++ 的改动,说明主干网络并没有被“越改越重”,反而更适合做可扩展的轻量解码器。
定性结果也挺说明问题。图 5 里,NVRC++ 在细节纹理、边缘轮廓和局部结构上都更稳,尤其是在复杂纹理区域,不容易出现“看着像压过了,其实是糊过去了”的情况。对视频压缩来说,能把这种局部细节保住,通常就意味着它的率失真优化没有跑偏。
展望:迈向实用的INR视频编码新起点
NVRC++ 的意义,不只是又一个视频压缩模型刷新了指标,而是它把 INR 视频编码最难落地的两个问题——复杂度不可控 和 高分辨率长序列难训练 ——同时往前推了一步。这个方向很对,因为真正能用的系统,从来不是“某一个指标很漂亮”,而是“在不同设备和不同码率下都不翻车”。
当然,论文也不是没有边界。首先,这类方法依旧依赖较长的优化过程,编码端成本不低;其次,虽然解码已经很快,但离“像传统编解码器那样无感部署”还有一段距离;再者,多档复杂度虽然实用,但每一档的训练和调优都意味着额外工程成本。也就是说,NVRC++ 更像是把 INR 视频编码从“能看”推进到“更像能用” ,还不是最终答案。
但这已经很有价值了。因为一旦视频编码开始真正考虑复杂度分档、长序列训练、熵模型速度和实际硬件预算,论文就不再只是“比别人高一点”,而是在往产品化的方向挪。对于想做神经视频压缩、边缘端媒体处理、或者高质量视频存储的人来说,这篇工作提供了一个很明确的信号:INR 不必只能做实验室里的漂亮模型,也可以朝工程可用的架构演进 。
龙迷三问
这篇论文到底解决了什么问题? 它主要解决的是 INR 视频编码里“高性能”和“低复杂度”长期打架的问题。NVRC++ 通过高维特征网格、层次化参数编码和改进熵模型,让同一套方法在多个复杂度档位下都能保持较好的码率-质量权衡。
“in-parameter coding structure”是什么意思? 可以把它理解成“在模型参数内部做层次化视频编码”。不是直接把视频帧当独立对象处理,而是把网格参数切成时间片,再利用前面切片的上下文去压缩后面的切片,减少冗余。
为什么还要单独做 HiNeRV++,不能只改网格吗? 因为网格解决的是“装多少信息”,主干网络解决的是“怎么把这些信息高效地还原出来”。如果主干太弱,网格再好也会浪费;HiNeRV++ 通过多参考输入、更多高分辨率网格和更轻的输出层,把解码效率和重建质量一起往上拉。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 把层次化参数编码、高维网格和多先验熵模型拼成一套完整系统,思路不算“从零发明”,但把 INR 视频编码最难的工程矛盾处理得比较漂亮。
实验合理度: ★★★★☆ 对比对象覆盖传统编解码器、自动编码器和 INR 基线,且给出了复杂度、速度和率失真三类信息,整体比较能说明问题。
学术研究价值: ★★★★☆ 对神经视频压缩的可扩展性问题有明确启发,尤其适合后续继续研究“统一架构 + 多档复杂度”的方向。
稳定性: ★★★☆☆ 方法设计偏完整,但仍依赖较重的优化流程,编码端稳定性和实际部署还需要更多验证。
适应性以及泛化能力: ★★★★☆ 多复杂度档位和宽码率范围是加分项,但目前主要还是围绕特定视频压缩任务展开,跨场景泛化还要继续看。
硬件需求及成本: ★★★☆☆ 解码端已经比较友好,但训练和编码仍然不轻松;好消息是论文至少没有把显存需求写成“只适合神仙卡”。
复现难度: ★★★☆☆ 结构较多,训练链路也不短,复现门槛中等偏上;如果后续开源完整训练细节,会更友好。
产品化成熟度: ★★★☆☆ 离大规模商用还有距离,但在高质量离线压缩、边缘端视频存储或特定实时场景中,已经有一定落地想象空间。
可能的问题: 亮点在系统整合,但编码端成本仍高,且多模块叠加后需要更多消融和跨数据集验证来证明普适性。
主要参考文献
[1] Ho Man Kwan, Tianhao Peng, Fan Zhang, Mike Nilsson, Andrew Gower, David Bull. Enhanced Neural Video Representation Compression across Extreme Complexity and Quality Scales. arXiv:2606.28163, 2026.
[2] NVRC: Neural Video Representation Compression. 原论文所引 SOTA INR-based 视频编码方法。
[3] HiNeRV: 高效的隐式神经视频表示方法,NVRC++ 的基础模型之一。
[4] 论文中使用的公开视频压缩基线包括 x265、HM-18.0、VTM-20.0、DCVC-FM、DCVC-RT、HiNeRV、NVRC 和 C3。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
视频压缩、隐式神经表示、模型结构、工程落地这些话题,群里都能聊。