← 返回 PaperDaily 视觉与图像

ACM MM 2026:让超分模型学会"随机应变"?测试时自适应让模糊视频秒变清晰

视频超分模型碰到真实世界里的压缩伪影、噪点、模糊就翻车,这是老难题了。这篇论文把「测试时自适应」玩出了花:不重新训练、不要高清参考,AI模型边推理边自我调整,画质和文字清晰度都有实打实的提升。思路接地气,实验做得很扎实,值得一读。

ACM MM 2026:让超分模型学会"随机应变"?测试时自适应让模糊视频秒变清晰
原论文信息如下:
论文标题:
Towards Adaptive Super-Resolution and Quality Assessment via Test-Time Adaptation
发表日期:
2026年8月

发表单位:
Indian Institute of Technology Jammu

原文链接:
https://arxiv.org/pdf/2608.08508v1.pdf

看视频的时候,最怕遇到什么?不是剧情拖沓,而是画面糊成一团。在线会议、网课录屏、直播回放,视频经过采集、压缩、网络传输几道折腾,画质早就惨不忍睹。想用超分辨率模型救一救,结果模型在实验室的干净数据上威风凛凛,一到真实世界就原形毕露。
问题出在哪?说白了,大部分超分模型都是在合成的低分辨率-高分辨率对上训练的,退化过程是人为设定的,比如简单的双三次下采样。可真实世界的视频呢?压缩伪影、传感器噪声、运动模糊、码率波动,各种退化混在一起,还随设备、编码器、网络状况变化。模型没见过这种阵仗,自然就翻车了。
印度理工学院查谟分校(IIT Jammu)的Ajeet Kumar Verma最近在ACM Multimedia 2026上发表了博士研究论文,专门解决这个痛点。

测试时自适应:让超分模型学会"随机应变"

测试时自适应(Test-Time Adaptation,简称TTA)这个思路,听起来高大上,其实道理很简单:模型在测试的时候,可以根据当前输入的数据,自己调整一下参数,适应当前数据的分布。就像一个人到了新环境,会自觉调整自己的行为方式,而不是死守着老一套。
这篇论文的核心洞察是:既然超分模型在真实复杂的退化面前无能为力,那就给它一个"自适应"的能力,让它根据当前测试视频的特点,动态调整自己的行为。而且这一切都不需要重新训练,也不需要高清参考图。这个想法在真实应用中极具价值,因为收集高清参考数据的成本高得吓人。
图1:基线模型与其自适应版本之间的定性比较。裁剪的低分辨率区域以红色突出显示,基础模型输出以蓝色突出显示,带自适应质量损失的模型输出以黄色突出显示【放大查看效果更佳】。
图1展示了这个"随机应变"的效果:红色框是原始的低分辨率区域,蓝色框是基础超分模型的输出,黄色框是加了自适应质量损失之后的输出。放大看,黄色框里的文字边缘更锐利,细节更丰富。这还只是冰山一角。

无参考质量评估如何成为超分的"指南针"

想让超分模型在测试时自我调整,得先有一个"指南针"来告诉它哪个方向是对的。这个指南针就是视频质量评估(Video Quality Assessment,VQA)。传统的全参考质量评估需要高清原始视频做对比,但真实场景中这玩意儿根本不存在。于是论文把目光投向了无参考质量评估。
但无参考VQA模型本身也是在不同数据集上训练的,面对真实复杂退化,它们的评估结果也不一定靠谱。怎么办?论文的解决办法是:给VQA模型也来一套TTA,让它在测试时先适应一下当前视频的退化分布,然后再用它来评估超分模型的效果。
图2:所提出的基于TTA的RW-VSR-QA算法概述,其中TTA结合了组对比损失和质量感知排序损失作为辅助任务,以提高视频质量评估算法在真实世界退化下的性能。
如图2所示,TTA更新的是VQA网络中的归一化层参数,而不是全部参数。这样设计的好处是:既能适应当前分布,又不会破坏模型在训练时学到的语义知识。为了驱动这个适应过程,论文设计了两个辅助学习目标:基于质量的组对比损失(Group Contrastive Loss)和质量感知排序损失(Quality-Aware Rank Loss,QARL)。
组对比损失的思路是:质量相近的视频片段在特征空间里应该靠得近,质量差异大的应该离得远。排序损失则是让模型正确判断成对样本的质量优劣顺序。这两个损失互相配合,让VQA模型在无监督的情况下逐步校准自己的"审美标准"。
实验在五个主流VQA模型上进行,结果见表1。加了这个TTA模块后,所有模型的性能都有了提升。其中SAMA模型提升最明显,斯皮尔曼秩相关系数(SRCC)从0.6930涨到0.7471,涨了7.24%。这说明轻量级单分支的VQA模型从TTA中获益最大,因为它的归一化层对分布变化更敏感。
*表格超出部分左右可以滑动 Table 1: Performance comparison of base VQA methods and their adapted versions using the proposed TTA algorithm, Symbol ↑ represents higher is better and ↓ represents lower is better.
Table 1: Performance comparison of base VQA methods and their adapted versions using the proposed TTA algorithm, Symbol ↑ represents higher is better and ↓ represents lower is better.

有了这个"校准过"的VQA模型,接下来就可以把它作为自适应损失函数,指导真实世界视频超分(RW-VSR)模型的训练。如图3所示,思路很直接:先用TTA-VQA评估超分模型输出的视频,再和原始高清视频的质量分数做对比,两者之差就是自适应质量损失。这个损失通过红色虚线回传给超分模型,告诉它"你的输出质量还差得远,继续努力"。
图3:所提出的RW-VSR框架概述,使用RW-VSR-QA算法作为自适应损失函数。红色虚线表示权重更新过程,d表示质量差异。
这个自适应损失的好处在于:它不需要为每种退化类型单独设计损失函数,而是通过VQA模型自动感知当前的失真类型和程度。论文在6个主流VSR骨干网络上、4个真实世界数据集上验证了效果,结果见表2。
*表格超出部分左右可以滑动 图7
图7

值得注意的是,在所有骨干网络上,加了自适应损失之后,平均分都有提升。特别是在运动模糊和K|Lens这类退化严重的数据集上,提升更加明显。论文分析认为,感知损失和对抗损失在训练时容易放大高频噪声,而自适应质量损失能够引导模型生成视觉上更干净、更稳定的输出。

屏幕内容超分:文字清晰度的终极挑战

除了真实的自然视频,还有一个更刁钻的场景:屏幕录制视频。在线会议、远程教学、游戏直播,这些都是屏幕内容,里面充满了文字、图表、UI元素。传统的超分模型专注于提升美感,往往把文字给"美化"得缺胳膊少腿。想象一下,一份合同上的数字被超分模型"脑补"错了,那可不是闹着玩的。
图4:所提出的ScrVSR模型概述。训练是监督式的;在预训练初始化后,损失在高分辨率(HR)和超分辨率(SR)输出之间计算。所有损失以正则化方式组合并反向传播。
论文提出的ScrVSR模型,基于ITSRN架构改进,专门针对屏幕分享视频优化。如图4所示,训练过程是监督式的,但损失函数设计很讲究。除了常规的像素损失和感知损失,还引入了一个基于字符错误率(Character Error Rate,CER)的损失,直接用OCR识别准确率来衡量文字重建的质量。别出心裁。再加上CLIP-based的质量损失提供语义层面的反馈,让超分结果不仅仅像素对齐,还要"语义对齐"。
实验结果非常亮眼。表3展示了在不同量化参数(QP)下的表现,QP值越高意味着压缩越狠、退化越严重。可以看到,在所有压缩级别下,ScrVSR的PSNR和SSIM都超越了基线方法,CER更是大幅降低。
*表格超出部分左右可以滑动 Table 3: Comparison of the proposed model with BTC and ITSRN across diferent quantization settings. Higher values are better for PSNR and SSIM (↑), and lower values are better for CER (↓).
Table 3: Comparison of the proposed model with BTC and ITSRN across diferent quantization settings. Higher values are better for PSNR and SSIM (↑), and lower values are better for CER (↓).

这背后还有一个真实的故事:这套方案在IEEE ICME 2025视频会议超分挑战赛上拿到了第二名,而且推理时间只需要2.4秒,第一名虽然赢了精度,但推理时间是23秒。十倍的速度差距,在实际部署中的意义不亚于精度上的领先。

区域感知自适应:文本与自然场景的"分而治之"

既然屏幕内容里文字和图表的退化规律不一样,那能不能把两者分开处理?SCISR-TTA就是这么干的。它把自适应过程分成两个阶段:第一阶段用OCR和一个小型语言模型(SLM)的双重反馈,专门优化文字区域;第二阶段用基于重建的辅助损失优化非文字区域,目标是抑制压缩伪影、提升视觉连贯性。
图5:所提出的SCISR-TTA概述。底层模型通过两个区域特定的分支进行适应,并顺序优化。文本适应分支首先更新模型,随后是内容分支。
如图5所示,这个框架是通用的,可以加持在任意屏幕内容超分模型之上。表4的结果耐人寻味:所有基线模型在被SCISR-TTA加持后,CER都有下降,感知指标也有提升。LTE模型提升最大,CER从0.8051降到0.7669,DISTS指标从0.0485涨到0.0853,增幅超过75%。
*表格超出部分左右可以滑动 Table 4: Performance comparison of baseline SCISR methods and their adapted versions using the proposed SCISR-TTA framework.
Table 4: Performance comparison of baseline SCISR methods and their adapted versions using the proposed SCISR-TTA framework.

为什么在速度和精度的权衡上,这个第二名比第一名更值得关注?2.4秒对23秒,接近十倍的推理速度差距,放在视频会议这种实时性敏感的场景里,就是"能用"与"不能用"的分界线。Rank-2的名次背后,是精度与速度之间一个非常务实的取舍。在真实产品中,用户不会为了多一个点的PSNR多等20秒,但一定会为了快十倍而接受几乎可以忽略的精度妥协。
ScrVSR能同时兼顾速度和精度,关键在于训练策略。预训练ITSRN权重的引入让模型不用从零开始学,迁移效率很高。但真正让它在文字区域表现优异的是那套多损失组合:CER损失直接以OCR识别的准确度为目标,让模型知道"看起来像文字"远远不够,必须"读起来正确";CLIP-based质量损失从语义层面约束超分结果与高清版本的对应关系;VGG感知损失则保证整体的结构一致性。三重约束下来,文字的笔画和边缘自然被保护得更好。
表3:所提模型与BTC和ITSRN在不同量化设置下的比较,PSNR和SSIM越高越好(↑),CER越低越好(↓)。
表3展示了不同量化参数(QP)下的完整结果。QP值越高代表压缩越狠、输入退化越严重,ScrVSR的领先幅度反而越稳定。特别值得注意的是CER指标:在QP-17档位上,ScrVSR把CER从ITSRN的0.2724拉低到0.1927,接近30%的相对改善。换算成实际体验,相当于每100个字符中大约能少认错8个。在合同条款、代码片段、数字报表这些场景里,这个差距足以决定一套超分方案能否被用户真正信任。越高的压缩强度下,ScrVSR相对基线的优势越明显,也说明它的字符重建能力不是碰运气,而是真的学到了文字结构的先验。

区域感知自适应:文本与自然场景的"分而治之"

ScrVSR解决了"如何从零训练一个好用的屏幕内容超分模型",但有一个问题它回答不了:如果不想重新训练,能不能让现成的模型在推理时自己适应?毕竟真实世界的屏幕内容千变万化,每次都为新场景单独训练一个模型,成本高得离谱。这正是SCISR-TTA要解决的事情。
SCISR-TTA是一个双分支的TTA框架,核心思想是"文字归文字,内容归内容",把屏幕内容图像的适应过程拆成两个阶段,分别针对文本区域和非文本区域。这种区域感知的设计,直接回应了屏幕内容超分最独特的难题:文字对失真极其敏感,笔画稍微模糊一点OCR就认错;而自然图像区域更关心纹理连贯性,对硬边缘的容忍度反而高一些。用同一套目标去优化两个不同质的区域,效果注定会打折扣。
图5:所提出的SCISR-TTA概述。底层模型通过两个区域特定的分支进行适应,并顺序优化。文本适应分支首先更新模型,随后是内容分支。
文本适应分支先登场。这个分支同时利用OCR和一个小型语言模型(SLM)对超分结果进行双重反馈。OCR关注字符层面是否正确,SLM则从语义和上下文合理性的角度兜底。两者合力,确保模型在更新参数时优先照顾文字的可读性。这里SLM的存在很妙——单纯靠OCR只能知道"每个字是什么",但无法判断"这句话通不通",加上SLM的语义判断,就能抑制那些OCR暂时没发现、但语义上明显不合理的"脑补"输出。
等文本分支的更新收敛得差不多了,内容分支再上场。内容分支使用基于重建的辅助损失,目标不是文字而是整体画面的连贯性,抑制压缩伪影、保持边缘锐度,让图像在视觉上更自然。两个分支顺序执行,各自负责自己擅长的区域,不互相干扰。
这种顺序优化策略的好处非常明显。文本区域和自然区域的退化模式不同,对损失的响应也不同。硬把它们揉在同一个更新目标里,很可能顾此失彼。分阶段处理,相当于让模型的"注意力"先聚焦在最影响用户体验的文字区域,再处理整体观感。整个适应过程完全无需高清参考图,只依赖测试视频自身的统计特性,这一点对真实部署意义重大——毕竟现实中很难为每段视频都找到对应的原始高清版本。
表4:基线SCISR方法及其使用所提SCISR-TTA框架版本的性能比较。
表4是SCISR-TTA在五个基线模型上的加持效果。所有基线模型在被TTA改造后,CER都有下降,DISTS感知指标也有全面改善。其中LTE模型提升最明显,CER从0.8051降到0.7669,DISTS从0.0485涨到0.0853,增幅超过75%。这种"即插即用"的增益,意味着已有的屏幕内容超分系统不需要推倒重来,加一个轻量自适应模块就能在真实部署中获得实打实的画质提升,这一点对存量系统的升级尤其友好。

从实验室到真实世界:TTA框架的落地价值

如果把这篇博士论文中的三块工作放在一起看,会发现一条清晰的技术主线:先用TTA把无参考VQA校准成可靠的"质量度量衡",再用它作为自适应损失去引导超分模型;同时针对屏幕内容,分别从模型训练(ScrVSR)和推理时自适应(SCISR-TTA)两个维度补齐短板。
表1和表2给出了更完整的数据证据。表1中,五个VQA基线在TTA加持后相关性指标全面上涨,SAMA的SRCC涨幅达到7.24%,FAST-VQA、DOVER等也有1.8%以上的提升。这说明TTA对质量评估模型的分布偏移校准确实有效,而且对轻量级单分支模型的效果格外显著——它们的归一化层对分布变化更敏感,稍微调整就能产生明显的性能变化。
表1:基础VQA方法及其使用所提TTA算法版本的性能对比,符号↑表示越高越好,↓表示越低越好。
表2讲的是另一个维度的故事。在六个VSR骨干网络上,加了自适应质量损失之后,平均分全部提升,且没有任何一个数据集出现回退。HAT的平均分从0.6883涨到0.7106,SRWD从0.7054涨到0.7312,RBVSR从0.7128提升到0.7265。尤其值得关注的是运动模糊(MotionBlur)和K|Lens这两个退化严重的子集,提升幅度普遍更大。原因在于,感知损失和对抗损失在训练时容易过度放大高频细节,把噪点也当成纹理"脑补"出来。自适应质量损失就像一个客观的"质检员",能在训练过程中把模型的疯狂拉回正轨。
表2:各种VSR模型及其使用所提RW-VSR-QA算法作为自适应损失的增强版本的定量比较。
落地场景方面,这套技术栈瞄准的都是硬需求。在线会议中,网络带宽受限时自动降清晰度是常态,接收端的超分模型如果能根据当前视频的压缩特征自适应,会议体验会大幅改善。远程教学的屏幕录制、游戏录屏的二次加工、监控视频的细节增强,都是TTA能直接发力的地方。尤其屏幕内容超分这块,在线教育平台如果把ScrVSR部署在服务端,学生端看到的共享课件就不会再出现文字模糊到看不清的问题。
meng.jpeg
当然,不是说这套框架没有短板。TTA在测试时更新模型参数,意味着每一条视频都需要额外的计算开销。虽然论文中只更新归一化层,参数更新量很小,但在大规模视频处理场景中,累积的耗时依然需要认真评估。此外,TTA的适应效果依赖于一个合理的预训练起点,如果预训练模型本身已经偏离目标分布太远,仅靠归一化层的微调也难以力挽狂澜。最后,归一化层参数调整的幅度目前缺少足够强的理论约束,如果测试数据过于极端,理论上存在适应失稳的风险,在实际部署时需要设置阈值或回退机制来兜底。
从更长远的角度来看,这篇论文的目标是一个完全自适应的视频增强系统:视频流进来,系统自动感知退化类型、自动调整模型参数、自动评估增强效果,全程不需要人工干预。论文的三个框架分别对应感知(TTA-VQA)、行动(RW-VSR自适应损失)和场景适配(ScrVSR与SCISR-TTA),拼在一起已经具备了这个闭环的雏形。这个愿景一旦实现,无论是直播、点播还是实时通信的画质优化,都会进入一个全新的维度。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对真实视频超分在未知退化下泛化难的痛点,IIT Jammu提出一套测试时自适应框架,无需高清参考即可提升画质、文字清晰度与质量评估准确率,在多项基准上带来一致增益。
这篇工作最值得看的点是什么?论文方法在所有对比基线上均取得一致性提升。VQA任务中SRCC提升0.45%-7.24%;VSR任务中所有backbone均有性能提升,尤其在MotionBlur和K|Lens数据集上提升显著;屏幕内容SR在PSNR、SSIM和CER指标上全面优于对比方法。
这篇工作的边界或风险在哪里?优点:(1) 提出统一的TTA框架解决真实世界VSR和屏幕内容SR的泛化问题;(2) 无需配对HR数据和重训练即可实现自适应;(3) 在多个任务和数据集上验证了方法的有效性。缺点:(1) 论文为博士研究摘要,各子方法描述较为简略;(2) 缺乏对TTA计算开销的详细分析;(3) 未显式建模时间依赖性,对视频时序一致性处理不足;(4) 部分实验对比不够全面。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将测试时自适应系统性地引入视频质量评估与超分联合优化,用VQA校准结果反哺VSR训练,这一闭环思路在当前超分领域并不常见。区域感知的双分支TTA设计也很有新意,但整体框架更偏"组合式创新",各模块单独拆开看,都能在已有文献中找到影子。

实验合理度:★★★☆☆

VQA部分覆盖了5个基线模型,VSR部分覆盖了6个骨干网络和4个真实世界数据集,screen content部分也有3个以上基线的对比,实验广度值得肯定。但作为ACM Multimedia的短文(5页),各实验的深度有限——比如TTA消融实验只展示了归一化层更新一种策略,没有对比更新全部参数或只更新偏置项的差异;表格中也没有报告方差或显著性检验。

学术研究价值:★★★★☆

把质量评估从"打分工具"升级为"训练信号源",这个视角的转换对超分领域有启发意义。论文中提出的"VQA适应→用于引导VSR"框架,可以迁移到其他low-level视觉任务。区域感知的TTA策略也为后续研究提供了一个新的方向。对于TTA这个子领域来说,这篇论文拓展了它的应用边界。

稳定性:★★★☆☆

TTA在测试时更新归一化层参数,在分布偏移可控的情况下表现稳定,但在极端退化或视频内容剧烈变化时,连续自适应的累积误差风险仍然存在。论文没有讨论适应步长、更新次数等超参数对稳定性的影响,也缺少对超长视频连续TTA的测试。产品落地时可能需要设置额外的安全机制来保证结果不退化。

适应性以及泛化能力:★★★★☆

论文同时覆盖了自然视频(RW-VSR)和屏幕内容(ScrVSR、SCISR-TTA)两个场景,跨域实验数据扎实。VQA自适应对五个基线模型都有收益,说明框架不依赖特定网络结构。不过目前验证的退化类型主要是压缩、模糊、噪声等常见失真,对抗性退化或混合型退化的组合爆炸场景还没有充分覆盖。

硬件需求及成本:★★★★☆

论文清楚地展示了ScrVSR在ICME挑战赛上2.4秒的推理时间(对比第一名23秒),效率优势明显。测试时只更新归一化层的设计让额外计算开销降到很低,主要成本集中在forward/backward的额外一次传播。训练阶段由于预训练初始化合理,也能节省不少算力。整体来看,对工业部署比较友好。

复现难度:★★★☆☆

论文对方法和实验的描述比较清晰,三套框架的结构图都有给出。但当前没有提供官方开源代码,也没有公开训练数据列表,复现需要自己收集屏幕内容数据集和预训练模型,工作量不小。ICME挑战赛的赛道环境可能有一些公开资源可以参考,但整体复现门槛偏高。

产品化成熟度:★★★☆☆

ScrVSR在ICME挑战赛上获得了Rank-2的成绩,推理速度优势明显,这部分已经接近可用状态。TTA-VQA和SCISR-TTA的框架设计也比较贴近工程实践,不需要高清参考图。但真实产品中,需要进一步验证在超长视频、多路并发、设备资源受限等条件下的稳定性与吞吐量,这些问题论文还没有给出明确的实验答案。

可能的问题:论文标题是"Towards Adaptive Super-Resolution and Quality Assessment",但三个框架(TTA-VQA、ScrVSR、SCISR-TTA)之间的逻辑联系可以更紧密。当前结构更像三篇独立论文的摘要合集,缺乏一个统一的实验平台或评价体系来验证"自适应闭环"的端到端效果。用VQA指导VSR时,如果VQA模型本身有偏好性,质量损失会放大这种偏好,论文没有讨论这个问题。此外,对比的VQA方法多来自两年前,缺少与最新的Q-Align、DepictQA等大模型质量评估方法的对比,会让部分读者对结论的时效性打问号。


主要参考文献

Verma A K. Towards Adaptive Super-Resolution and Quality Assessment via Test-Time Adaptation[C]//Proceedings of the 34th ACM International Conference on Multimedia (MM '26). 2026. https://doi.org/10.1145/3767308.3832539
Chan K C K, Wang X, Yu K, et al. BasicVSR: The Search for Essential Components in Video Super-Resolution and Beyond[C]//CVPR 2021. [2]
Chen J, et al. HAT: Hybrid Attention Transformer for Image Restoration[J]. arXiv, 2023. [7]
Wu H, et al. FAST-VQA: Efficient End-to-end Video Quality Assessment with Fragment Sampling[C]//ECCV 2022. [23]
Wang P, et al. DOVER: A Method for Combining Disentangled Quality Predictors[C]//ICLR 2023. [25]
Liu C, et al. ITSRN: Iterative Super-Resolution Network for Screen Content Images[J]. IEEE TCSVT, 2022. [27]
原文链接: https://arxiv.org/pdf/2608.08508v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。

『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。视频超分与质量评估的话题,欢迎来图像处理群一起聊!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。