← 返回 PaperDaily
视觉与图像
ACM MM 2026:让超分模型学会"随机应变"?测试时自适应让模糊视频秒变清晰
视频超分模型碰到真实世界里的压缩伪影、噪点、模糊就翻车,这是老难题了。这篇论文把「测试时自适应」玩出了花:不重新训练、不要高清参考,AI模型边推理边自我调整,画质和文字清晰度都有实打实的提升。思路接地气,实验做得很扎实,值得一读。
龙哥读论文
发布于 2026-08-14 21:50:22
阅读 4
查看原文
原论文信息如下:
看视频的时候,最怕遇到什么?不是剧情拖沓,而是画面糊成一团。在线会议、网课录屏、直播回放,视频经过采集、压缩、网络传输几道折腾,画质早就惨不忍睹。想用超分辨率模型救一救,结果模型在实验室的干净数据上威风凛凛,一到真实世界就原形毕露。
问题出在哪?说白了,大部分超分模型都是在合成的低分辨率-高分辨率对上训练的,退化过程是人为设定的,比如简单的双三次下采样。可真实世界的视频呢?压缩伪影、传感器噪声、运动模糊、码率波动,各种退化混在一起,还随设备、编码器、网络状况变化。模型没见过这种阵仗,自然就翻车了。
印度理工学院查谟分校(IIT Jammu)的Ajeet Kumar Verma最近在ACM Multimedia 2026上发表了博士研究论文,专门解决这个痛点。
测试时自适应:让超分模型学会"随机应变"
测试时自适应(Test-Time Adaptation,简称TTA)这个思路,听起来高大上,其实道理很简单:模型在测试的时候,可以根据当前输入的数据,自己调整一下参数,适应当前数据的分布。就像一个人到了新环境,会自觉调整自己的行为方式,而不是死守着老一套。
这篇论文的核心洞察是:既然超分模型在真实复杂的退化面前无能为力,那就给它一个"自适应"的能力,让它根据当前测试视频的特点,动态调整自己的行为。而且这一切都不需要重新训练,也不需要高清参考图。这个想法在真实应用中极具价值,因为收集高清参考数据的成本高得吓人。
无参考质量评估如何成为超分的"指南针"
想让超分模型在测试时自我调整,得先有一个"指南针"来告诉它哪个方向是对的。这个指南针就是视频质量评估(Video Quality Assessment,VQA)。传统的全参考质量评估需要高清原始视频做对比,但真实场景中这玩意儿根本不存在。于是论文把目光投向了无参考质量评估。
但无参考VQA模型本身也是在不同数据集上训练的,面对真实复杂退化,它们的评估结果也不一定靠谱。怎么办?论文的解决办法是:给VQA模型也来一套TTA,让它在测试时先适应一下当前视频的退化分布,然后再用它来评估超分模型的效果。
组对比损失的思路是:质量相近的视频片段在特征空间里应该靠得近,质量差异大的应该离得远。排序损失则是让模型正确判断成对样本的质量优劣顺序。这两个损失互相配合,让VQA模型在无监督的情况下逐步校准自己的"审美标准"。
实验在五个主流VQA模型上进行,结果见表1。加了这个TTA模块后,所有模型的性能都有了提升。其中SAMA模型提升最明显,斯皮尔曼秩相关系数(SRCC)从0.6930涨到0.7471,涨了7.24%。这说明轻量级单分支的VQA模型从TTA中获益最大,因为它的归一化层对分布变化更敏感。
*表格超出部分左右可以滑动
Table 1: Performance comparison of base VQA methods and their adapted versions using the proposed TTA algorithm, Symbol ↑ represents higher is better and ↓ represents lower is better.
有了这个"校准过"的VQA模型,接下来就可以把它作为自适应损失函数,指导真实世界视频超分(RW-VSR)模型的训练。如图3所示,思路很直接:先用TTA-VQA评估超分模型输出的视频,再和原始高清视频的质量分数做对比,两者之差就是自适应质量损失。这个损失通过红色虚线回传给超分模型,告诉它"你的输出质量还差得远,继续努力"。
*表格超出部分左右可以滑动
值得注意的是,在所有骨干网络上,加了自适应损失之后,平均分都有提升。特别是在运动模糊和K|Lens这类退化严重的数据集上,提升更加明显。论文分析认为,感知损失和对抗损失在训练时容易放大高频噪声,而自适应质量损失能够引导模型生成视觉上更干净、更稳定的输出。
屏幕内容超分:文字清晰度的终极挑战
除了真实的自然视频,还有一个更刁钻的场景:屏幕录制视频。在线会议、远程教学、游戏直播,这些都是屏幕内容,里面充满了文字、图表、UI元素。传统的超分模型专注于提升美感,往往把文字给"美化"得缺胳膊少腿。想象一下,一份合同上的数字被超分模型"脑补"错了,那可不是闹着玩的。
实验结果非常亮眼。表3展示了在不同量化参数(QP)下的表现,QP值越高意味着压缩越狠、退化越严重。可以看到,在所有压缩级别下,ScrVSR的PSNR和SSIM都超越了基线方法,CER更是大幅降低。
*表格超出部分左右可以滑动
Table 3: Comparison of the proposed model with BTC and ITSRN across diferent quantization settings. Higher values are better for PSNR and SSIM (↑), and lower values are better for CER (↓).
这背后还有一个真实的故事:这套方案在IEEE ICME 2025视频会议超分挑战赛上拿到了第二名,而且推理时间只需要2.4秒,第一名虽然赢了精度,但推理时间是23秒。十倍的速度差距,在实际部署中的意义不亚于精度上的领先。
区域感知自适应:文本与自然场景的"分而治之"
既然屏幕内容里文字和图表的退化规律不一样,那能不能把两者分开处理?SCISR-TTA就是这么干的。它把自适应过程分成两个阶段:第一阶段用OCR和一个小型语言模型(SLM)的双重反馈,专门优化文字区域;第二阶段用基于重建的辅助损失优化非文字区域,目标是抑制压缩伪影、提升视觉连贯性。
*表格超出部分左右可以滑动
Table 4: Performance comparison of baseline SCISR methods and their adapted versions using the proposed SCISR-TTA framework.
为什么在速度和精度的权衡上,这个第二名比第一名更值得关注?2.4秒对23秒,接近十倍的推理速度差距,放在视频会议这种实时性敏感的场景里,就是"能用"与"不能用"的分界线。Rank-2的名次背后,是精度与速度之间一个非常务实的取舍。在真实产品中,用户不会为了多一个点的PSNR多等20秒,但一定会为了快十倍而接受几乎可以忽略的精度妥协。
ScrVSR能同时兼顾速度和精度,关键在于训练策略。预训练ITSRN权重的引入让模型不用从零开始学,迁移效率很高。但真正让它在文字区域表现优异的是那套多损失组合:CER损失直接以OCR识别的准确度为目标,让模型知道"看起来像文字"远远不够,必须"读起来正确";CLIP-based质量损失从语义层面约束超分结果与高清版本的对应关系;VGG感知损失则保证整体的结构一致性。三重约束下来,文字的笔画和边缘自然被保护得更好。
区域感知自适应:文本与自然场景的"分而治之"
ScrVSR解决了"如何从零训练一个好用的屏幕内容超分模型",但有一个问题它回答不了:如果不想重新训练,能不能让现成的模型在推理时自己适应?毕竟真实世界的屏幕内容千变万化,每次都为新场景单独训练一个模型,成本高得离谱。这正是SCISR-TTA要解决的事情。
SCISR-TTA是一个双分支的TTA框架,核心思想是"文字归文字,内容归内容",把屏幕内容图像的适应过程拆成两个阶段,分别针对文本区域和非文本区域。这种区域感知的设计,直接回应了屏幕内容超分最独特的难题:文字对失真极其敏感,笔画稍微模糊一点OCR就认错;而自然图像区域更关心纹理连贯性,对硬边缘的容忍度反而高一些。用同一套目标去优化两个不同质的区域,效果注定会打折扣。
等文本分支的更新收敛得差不多了,内容分支再上场。内容分支使用基于重建的辅助损失,目标不是文字而是整体画面的连贯性,抑制压缩伪影、保持边缘锐度,让图像在视觉上更自然。两个分支顺序执行,各自负责自己擅长的区域,不互相干扰。
这种顺序优化策略的好处非常明显。文本区域和自然区域的退化模式不同,对损失的响应也不同。硬把它们揉在同一个更新目标里,很可能顾此失彼。分阶段处理,相当于让模型的"注意力"先聚焦在最影响用户体验的文字区域,再处理整体观感。整个适应过程完全无需高清参考图,只依赖测试视频自身的统计特性,这一点对真实部署意义重大——毕竟现实中很难为每段视频都找到对应的原始高清版本。
从实验室到真实世界:TTA框架的落地价值
如果把这篇博士论文中的三块工作放在一起看,会发现一条清晰的技术主线:先用TTA把无参考VQA校准成可靠的"质量度量衡",再用它作为自适应损失去引导超分模型;同时针对屏幕内容,分别从模型训练(ScrVSR)和推理时自适应(SCISR-TTA)两个维度补齐短板。
表1和表2给出了更完整的数据证据。表1中,五个VQA基线在TTA加持后相关性指标全面上涨,SAMA的SRCC涨幅达到7.24%,FAST-VQA、DOVER等也有1.8%以上的提升。这说明TTA对质量评估模型的分布偏移校准确实有效,而且对轻量级单分支模型的效果格外显著——它们的归一化层对分布变化更敏感,稍微调整就能产生明显的性能变化。
从更长远的角度来看,这篇论文的目标是一个完全自适应的视频增强系统:视频流进来,系统自动感知退化类型、自动调整模型参数、自动评估增强效果,全程不需要人工干预。论文的三个框架分别对应感知(TTA-VQA)、行动(RW-VSR自适应损失)和场景适配(ScrVSR与SCISR-TTA),拼在一起已经具备了这个闭环的雏形。这个愿景一旦实现,无论是直播、点播还是实时通信的画质优化,都会进入一个全新的维度。
龙迷三问
这篇论文到底在解决什么问题? 针对真实视频超分在未知退化下泛化难的痛点,IIT Jammu提出一套测试时自适应框架,无需高清参考即可提升画质、文字清晰度与质量评估准确率,在多项基准上带来一致增益。
这篇工作最值得看的点是什么? 论文方法在所有对比基线上均取得一致性提升。VQA任务中SRCC提升0.45%-7.24%;VSR任务中所有backbone均有性能提升,尤其在MotionBlur和K|Lens数据集上提升显著;屏幕内容SR在PSNR、SSIM和CER指标上全面优于对比方法。
这篇工作的边界或风险在哪里? 优点:(1) 提出统一的TTA框架解决真实世界VSR和屏幕内容SR的泛化问题;(2) 无需配对HR数据和重训练即可实现自适应;(3) 在多个任务和数据集上验证了方法的有效性。缺点:(1) 论文为博士研究摘要,各子方法描述较为简略;(2) 缺乏对TTA计算开销的详细分析;(3) 未显式建模时间依赖性,对视频时序一致性处理不足;(4) 部分实验对比不够全面。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
将测试时自适应系统性地引入视频质量评估与超分联合优化,用VQA校准结果反哺VSR训练,这一闭环思路在当前超分领域并不常见。区域感知的双分支TTA设计也很有新意,但整体框架更偏"组合式创新",各模块单独拆开看,都能在已有文献中找到影子。
实验合理度: ★★★☆☆
VQA部分覆盖了5个基线模型,VSR部分覆盖了6个骨干网络和4个真实世界数据集,screen content部分也有3个以上基线的对比,实验广度值得肯定。但作为ACM Multimedia的短文(5页),各实验的深度有限——比如TTA消融实验只展示了归一化层更新一种策略,没有对比更新全部参数或只更新偏置项的差异;表格中也没有报告方差或显著性检验。
学术研究价值: ★★★★☆
把质量评估从"打分工具"升级为"训练信号源",这个视角的转换对超分领域有启发意义。论文中提出的"VQA适应→用于引导VSR"框架,可以迁移到其他low-level视觉任务。区域感知的TTA策略也为后续研究提供了一个新的方向。对于TTA这个子领域来说,这篇论文拓展了它的应用边界。
稳定性: ★★★☆☆
TTA在测试时更新归一化层参数,在分布偏移可控的情况下表现稳定,但在极端退化或视频内容剧烈变化时,连续自适应的累积误差风险仍然存在。论文没有讨论适应步长、更新次数等超参数对稳定性的影响,也缺少对超长视频连续TTA的测试。产品落地时可能需要设置额外的安全机制来保证结果不退化。
适应性以及泛化能力: ★★★★☆
论文同时覆盖了自然视频(RW-VSR)和屏幕内容(ScrVSR、SCISR-TTA)两个场景,跨域实验数据扎实。VQA自适应对五个基线模型都有收益,说明框架不依赖特定网络结构。不过目前验证的退化类型主要是压缩、模糊、噪声等常见失真,对抗性退化或混合型退化的组合爆炸场景还没有充分覆盖。
硬件需求及成本: ★★★★☆
论文清楚地展示了ScrVSR在ICME挑战赛上2.4秒的推理时间(对比第一名23秒),效率优势明显。测试时只更新归一化层的设计让额外计算开销降到很低,主要成本集中在forward/backward的额外一次传播。训练阶段由于预训练初始化合理,也能节省不少算力。整体来看,对工业部署比较友好。
复现难度: ★★★☆☆
论文对方法和实验的描述比较清晰,三套框架的结构图都有给出。但当前没有提供官方开源代码,也没有公开训练数据列表,复现需要自己收集屏幕内容数据集和预训练模型,工作量不小。ICME挑战赛的赛道环境可能有一些公开资源可以参考,但整体复现门槛偏高。
产品化成熟度: ★★★☆☆
ScrVSR在ICME挑战赛上获得了Rank-2的成绩,推理速度优势明显,这部分已经接近可用状态。TTA-VQA和SCISR-TTA的框架设计也比较贴近工程实践,不需要高清参考图。但真实产品中,需要进一步验证在超长视频、多路并发、设备资源受限等条件下的稳定性与吞吐量,这些问题论文还没有给出明确的实验答案。
可能的问题: 论文标题是"Towards Adaptive Super-Resolution and Quality Assessment",但三个框架(TTA-VQA、ScrVSR、SCISR-TTA)之间的逻辑联系可以更紧密。当前结构更像三篇独立论文的摘要合集,缺乏一个统一的实验平台或评价体系来验证"自适应闭环"的端到端效果。用VQA指导VSR时,如果VQA模型本身有偏好性,质量损失会放大这种偏好,论文没有讨论这个问题。此外,对比的VQA方法多来自两年前,缺少与最新的Q-Align、DepictQA等大模型质量评估方法的对比,会让部分读者对结论的时效性打问号。
主要参考文献
Verma A K. Towards Adaptive Super-Resolution and Quality Assessment via Test-Time Adaptation[C]//Proceedings of the 34th ACM International Conference on Multimedia (MM '26). 2026. https://doi.org/10.1145/3767308.3832539
Chan K C K, Wang X, Yu K, et al. BasicVSR: The Search for Essential Components in Video Super-Resolution and Beyond[C]//CVPR 2021. [2]
Chen J, et al. HAT: Hybrid Attention Transformer for Image Restoration[J]. arXiv, 2023. [7]
Wu H, et al. FAST-VQA: Efficient End-to-end Video Quality Assessment with Fragment Sampling[C]//ECCV 2022. [23]
Wang P, et al. DOVER: A Method for Combining Disentangled Quality Predictors[C]//ICLR 2023. [25]
Liu C, et al. ITSRN: Iterative Super-Resolution Network for Screen Content Images[J]. IEEE TCSVT, 2022. [27]
原文链接: https://arxiv.org/pdf/2608.08508v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。视频超分与质量评估的话题,欢迎来图像处理群一起聊!