← 返回 PaperDaily
视觉与图像
极端场景OCR实战:为什么超分比大模型更重要?
极端场景下车牌只有12像素宽,笔画宽度2-3像素,常规OCR盲猜等于送分给负分。这篇ICIP 2026挑战赛高分方案证明了:把超分做到位(HAT 4倍提升),再搭配两个架构差异够大的识别器做集成,最后根据计分规则(+2/-1/0)设定弃权阈值,即使没有外部数据和私有模型,照样拿到9.73 wECR。核心思路很简单:先让字看得清,再让模型认得出,认不出的时候就
龙哥读论文
发布于 2026-09-05 00:31:11
阅读 4
查看原文
原论文信息如下:
想象一下这样一个场景:一辆汽车飞驰而过,监控摄像头抓拍到的车牌,在画面里只有指甲盖那么大,大约12像素宽。别说上面的字母数字了,连颜色都快分不清。如果是你,能认出来这是“AB123CD”吗?别急着回答,更残酷的是,如果你猜错了,系统还要扣分——猜对得+2分,猜错扣-1分,不猜得0分。这规则下,瞎猜就等于送分。
ICIP 2026举办的极端场景车牌超分与识别挑战赛(XLPSR),给出的正是这种“地狱级难题”。但来自独立研究者Karthik Sivarama Krishnan和Koushik Sivarama Krishnan的方案,硬是拿下了9.73 wECR的惊人高分。他们的思路简单到让人想拍大腿:既然看不清,那就先让图片变清晰,再让两个眼力好的模型一起认,最后实在拿不准的位置,就老老实实承认“我没把握,不猜了”。
这套被龙哥称为“教科书级别工程组合”的方法,究竟有什么魔力?它又是怎么在几乎不加外部数据、不用超大规模模型的前提下,把识别效果拉到极致的?咱们今天就来深扒一下。
极端车牌识别:12像素宽的车牌能认出吗?
首先,我们得搞清楚,为什么12像素宽的车牌是个大问题。对于人类来说,这么模糊的图片或许还能连蒙带猜,但对于基于深度学习的OCR(光学字符识别,Optical Character Recognition)模型来说,这几乎等同于对着一堆随机噪点做阅读理解。每个字符的笔画宽度可能只有2到3个像素,在这种尺度下,笔画之间、字符和背景之间的边界已经完全糊在一起了。常规的识别模型,其训练数据大多是清晰度尚可的场景文字,碰上这种输入,输出基本就是“瞎蒙”。
更狡猾的是比赛的计分规则:识别对了一个字符,得+2分;识别错了,扣-1分;如果选择不回答(即“弃权”),得0分。这就意味着,如果模型对某个字符的把握低于33.3%(也就是瞎猜的胜率),那么猜了还不如不猜——猜就是负收益。这种不对称的评分规则,直接决定了整个系统的设计哲学:宁可不认,绝不瞎认。
超分先行:HAT让字符从亚像素中浮现
面对如此极端的低分辨率输入,这套方案的第一步就是——搞超分。而且,它用的还不是什么花里胡哨的新东西,而是有现成预训练权重的 HAT (Hybrid Attention Transformer,混合注意力Transformer) 超分模型。HAT出自CVPR 2023,由陈鑫、王鑫、周杰、乔宇、董超等人提出,是一种基于Transformer架构的超分辨率网络。本文使用了它的GAN版本 Real-HAT-GAN-SRx4,可以将输入图像放大4倍。
HAT模型内部包含了6个RHAG(Residual Hybrid Attention Group,残差混合注意力组)模块,嵌入维度为180,窗口大小为16,重叠比例为0.5,最后通过PixelShuffle上采样器实现4倍放大。这里的关键在于,他们直接用了公开的预训练权重,没有在车牌数据上进行任何额外的微调。也就是说,HAT的“超分能力”完全是通用的,但依然在车牌上发挥了巨大作用。
但是,在做超分之前,还有一个重要的预处理步骤:多帧融合。每个样本包含一个10帧的车辆视频序列。首先,他们用拉普拉斯方差(Laplacian variance)对每一帧的清晰度进行打分,选出最清晰的一帧作为参考帧。然后,使用 ECC (Enhanced Correlation Coefficient,增强相关系数)算法 ,在仿射变换模型下,将其他帧对齐到参考帧上,最后进行像素级的平均值融合,生成一个信息更丰富、更清晰的融合帧。
为什么不用更流行的光流法?作者的答案是:ECC在低对比度条件下的鲁棒性更好,而且XLPSR数据集中的车牌对比度往往非常差,光流在这种场景下不稳定。另外,ECC不需要真实光流作为监督,可以纯CPU端预处理,速度快。通过这一步,他们最终将参考帧、最多4个对齐帧以及融合帧,共6个不同的视图,送入后续流程。
超分是整个系统里贡献最大的单一模块。后面的消融实验会告诉我们,没有超分,系统性能直接跌了2个多wECR,足以说明问题。
双模型集成:PARSeq与CLIP4STR的强强联合
图片被超分和融合之后,接下来就是识别了。这里作者没有选择用一个超大的模型硬扛,而是聪明地用了两个差异巨大的模型来做集成。
第一个是 PARSeq-S v2 (Permuted Autoregressive Sequence Model,排列自回归序列模型) ,由Bautista和Atienza提出于ECCV 2022。它是一个2380万参数的模型,基于ViT-Small骨干网络,输入尺寸为32×128。它最大的特点是采用了一种“排列自回归”的解码策略,可以在训练时通过随机打乱字符的预测顺序来学习到更具鲁棒性的序列依赖关系。
第二个是 CLIP4STR-B ,由赵爽、权睿、朱磊、杨宇等人提出于2023年。它是一个1.58亿参数的模型,使用了CLIP的ViT-B/16作为视觉骨干(backbone),输入尺寸为224×224。CLIP4STR的核心思路是利用CLIP这个从4亿图文对中训练出来的强大视觉-语言模型,作为场景文字识别的基础,效果拔群。
这两个模型在多个层面上形成了鲜明的互补:PARSeq-S小、快、输入分辨率低;CLIP4STR-B大、准、输入分辨率高,且预训练数据来自海量图文对。更重要的是,它们共享了“排列自回归”这同一类解码家族,这保证了它们的输出在结构上是一致的,为后续的投票奠定了基础。
这两个模型都是在公开权重基础上,用XLPSR的少量开发集(39个序列,100倍过采样)和20万张自制的合成法国车牌图像进行了微调。训练时,CLIP4STR使用了焦点交叉熵损失(focal cross-entropy,γ=2)、标签平滑(label smoothing,0.1)、差异化学习率(编码器1e-5,解码器1e-4)、指数移动平均(EMA,0.999)和随机权重平均(SWA),可谓下了血本。
聪明弃权:低置信度不猜,分数反而更高
当两个模型都对同一张图给出了识别结果(包括预测的字符和每个位置上每个字符的soft-max置信度),最后的重头戏——投票和弃权环节就开始了。
首先,他们会确定一个统一的字符串长度。因为是法国车牌(格式为7个字符的SIV格式),所以优先选择7个字符的长度。然后,对每个字符位置,把两个模型所有视图(共6个视图,每个视图两个模型,就是12个预测结果)的soft-max置信度进行累加。这里有个关键技巧:PARSeq的投票权重是CLIP4STR的两倍 (2:1)。这个权重是作者在验证集上通过消融实验调出来的,比简单的1:1权重带来了0.04 wECR的提升。
接下来,最巧妙的操作来了:判断是否弃权 。他们设定了一个弃权阈值τ = 0.33。如果对于某个字符位置,胜出类别(即被投票选中的那个字符)的加权soft-max置信度总和低于0.33,那么系统就会对这个位置“弃权”,输出一个下划线“_”。为什么是0.33?很简单,因为猜对的概率如果低于1/3,那么从计分规则上看,猜的期望收益(2 * 1/3 + (-1) * 2/3 = 0)等于不猜的0分。阈值定在0.33,正好就是+2/-1/0评分规则的盈亏平衡点。
此外,还有一个小的SIV格式修正:对于7字符车牌,第1到第4个字母位上,强制将“I”映射为“J”,“O”映射为“D”,“U”映射为“V”。这是因为法国SIV格式中为了易读性(比如避免I和1混淆),禁用了I、O、U三个字母。这个修正带来了额外的精度提升。而一开始尝试的更严格的格式约束投票(比如强行过滤掉非法字符),反而因为误杀了正确的边缘情况,导致wECR下降,所以被果断舍弃了。
实验结果与消融分析
论文在公共验证集上做了详细的消融实验,一步一步展示了每个模块带来的提升。下面这张表可以清晰说明问题:
我们来逐行解读这个表格,看看每个模块的贡献有多大。图中,基线(无超分)的wECR只有7.27。单独加入PARSeq和HAT超分后,飙升至9.27,说明超分是最大的单点贡献者。在超分基础上,加入CLIP4STR做1:1投票,提升到9.58。将投票权重调整为2:1(PARSeq:CLIP4STR),微调至9.62。加入硬格式约束,效果反而下降了0.11。最后,加上弃权机制并设定τ=0.33,一举达到9.73。
1. 超分是霸主 :无论是用哪个识别模型,引入超分都带来了2个多wECR的巨大提升。在极端低分辨率下,任何花哨的识别模型在“看不看得清”这个根本问题面前都是徒劳。先把像素拉回来,比什么都重要。
2. 模型多样性 > 模型数量 :简单地把两个模型堆起来(PARSeq + CLIP4STR),比单独用一个PARSeq增加了0.31 wECR,这是明显的正收益。但作者在前期尝试中加入第三个识别模型SVTRv2(基于CTC解码)后,效果反而下降了。这说明,不是模型越多越好。只有解码策略相似、输出结构一致的模型,才能产生有意义的投票结果。CTC解码器和自回归解码器输出分布差异太大,增加的只是噪声,而不是信号。
最后,弃权机制在最终版本里贡献了+0.11 wECR。它平均每段序列会把0.4个字符从“可能猜错(扣分)”变成“弃权(0分)”,净赚了分数。
总结:可复现的冠军方案
回顾整个方案,最让人感慨的是它的“实在”与“可复现”。它没有发明任何新的理论,没有使用任何神秘的私有数据集,也没有依赖参数量千亿的超级大模型。它完全是由几个公开可用的模块,通过严谨的工程分析和巧妙的策略组合,拼装而成的。
整套pipeline在RTX 3090上,每个序列的处理时间仅为1.7秒(最坏情况2.7秒,99分位2.4秒),峰值显存占用约3.2GB。相比于比赛设定的每序列60秒的时间预算,足足有22到35倍的余量。这意味着,即使部署到算力更弱的边缘设备上,经过一些优化(比如用作者之前提出的SwiftSRGAN替换HAT),也完全有可能满足实时性要求。
这个方案告诉我们的道理朴素而深刻:在解决一个具体问题时,深刻理解任务本身的约束和评价指标,往往比片面追求模型性能更重要。把有限的资源精准地投入到最关键的短板(超分)上,并利用规则(弃权)来规避风险,这正是顶级工程师思维的体现。
龙迷三问
什么是wECR? wECR是Weighted Character Error Rate(加权字符错误率)的缩写。这是XLPSR挑战赛的专用评估指标。它不同于常规的字符错误率(CER),因为比赛的计分规则是识别正确得+2分,错误得-1分,弃权得0分。wECR的值越高,代表系统在该计分规则下表现越好。满分是10.0,意味着所有字符都识别正确。
ECC算法和光流法相比,优点在哪里? ECC(Enhanced Correlation Coefficient)是一种基于互信息最大化思想的图像配准算法。它通过最大化两个图像之间的相关系数,来寻找最佳的空间变换参数。在这个场景下,它的优点主要有两个:第一,它对低对比度、低纹理的区域非常鲁棒,这在车牌等小目标上很关键;第二,它是一种参数化方法,直接在仿射变换空间内优化,不需要学习一个通用的光流场,计算效率高且不需要训练数据。
这个方案能否直接用于其他国家的车牌识别? 整体框架(多帧融合 -> 超分 -> 双模型集成 -> 投票弃权)是通用的,但需要注意几点:1) 车牌格式需要调整,比如法国SIV格式是7位,如果换成中国(通常是7位,第一位是汉字)或美国(格式多样),需要对长度预测和字符集做相应修改。2) 模型中SIV格式修正(I->J, O->D, U->V)是法国专用的,其他国家的车牌格式约束不同,需要重新定义。3) 如果目标场景不是极端低分辨率,超分模块带来的收益可能会降低,甚至可以被跳过以节省算力。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★☆☆☆
方法本身是一个精巧的工程组合,使用了已有的HAT、PARSeq、CLIP4STR架构,核心创新在于对评分规则的建模(弃权阈值)和集成的优化策略。学术创新性不算高,但对任务的理解和落地非常到位。
实验合理度: ★★★★★
消融实验设计非常清晰,每个模块的贡献都量化出来了。对失败案例的分析(如SVTRv2为何无效、硬格式约束为何降分)也很有说服力。实验设计是本文最大的亮点之一。
学术研究价值: ★★☆☆☆
本文的学术贡献更偏向于应用和工程实践,而非理论突破。它证实了一些已知的学理性原则(如超分在低分辨率下的决定性作用、集成中多样性比数量更重要),但没有提出新的理论或新的模块。
稳定性: ★★★★☆
整个pipeline设计得非常稳健。多帧融合、ECC对齐、基于置信度阈值的弃权机制,这些设计都旨在提升系统在各种极端条件下的鲁棒性。从较长的时序预算来看,处理速度也完全稳定。
适应性以及泛化能力: ★★★☆☆
方法框架是通用的,但具体组件(如SIV格式修正)是针对法国车牌设计的。要适配其他国家的车牌系统,需要替换识别器、微调字母集和格式规则。泛化到风格差异巨大的其他识别任务(如手写体)可能需要较大调整。
硬件需求及成本: ★★★★☆
在RTX 3090上跑1.7-2.7秒/序列,显存占用3.2GB,算力开销合理。考虑到60秒的时间预算,甚至有充足的余量进行优化。如果换成更轻量的SwiftSRGAN,可以进一步降低门槛。
复现难度: ★★★★☆
论文明确列出了所用到的所有外部资源(HAT、PARSeq、CLIP4STR的公开权重、200K合成数据生成方法),并对训练超参数做了详尽的描述。只要熟悉PyTorch,按图索骥,复现难度不高。
产品化成熟度: ★★★★★
这是一篇非常成熟的产品化技术报告。它关注的不是论文发表,而是如何在一个苛刻的竞赛规则下拿到最好的分数。所有设计都围绕最终指标(wECR)和工程约束(时间、显存)进行优化,几乎可以直接迁移到相关产品中。
可能的问题: 这套方案对合成数据质量很敏感,如果实际场景的退化模式与BSRGAN风格的合成数据差异较大,效果可能会打折扣。另外,弃权阈值τ=0.33严格依赖soft-max校准效果,如果模型校准不好,这个最优阈值可能偏移。
主要参考文献
[1] X. Chen, X. Wang, J. Zhou, Y. Qiao, and C. Dong, "Activating More Pixels in Image Super-Resolution Transformer," in Proc. IEEE Conf. Comput. Vis. Pattern Recognit. (CVPR), 2023.
[2] D. Bautista and R. Atienza, "Scene Text Recognition with Permuted Autoregressive Sequence Models," in Proc. Eur. Conf. Comput. Vis. (ECCV), 2022.
[3] S. Zhao, R. Quan, L. Zhu, and Y. Yang, "CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model," arXiv:2305.14014, 2023.
[4] A. Radford et al., "Learning Transferable Visual Models From Natural Language Supervision," in Proc. Int. Conf. Mach. Learn. (ICML), 2021.
[5] K. Zhang, J. Liang, L. Van Gool, and R. Timofte, "Designing a Practical Degradation Model for Deep Blind Image Super-Resolution," in Proc. IEEE Int. Conf. Comput. Vis. (ICCV), 2021.
[6] K. S. Krishnan and K. S. Krishnan, "SwiftSRGAN — Rethinking Super-Resolution for Efficient and Real-Time Inference," in Proc. Int. Conf. Intell. Cybern. Technol. Appl. (ICICyTA), 2021.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
车牌再模糊,也逃不过超分+集成的火眼金睛!想和龙哥一起刷遍顶会论文、复现SOTA方案?
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。