← 返回 PaperDaily 视觉与图像

西北工业大学最新研究:图像超分和文字预测一个模型搞定,速度比DiffTSR快101倍

场景文本超分是OCR落地硬骨头——图要修得漂亮,字还得认得准。西北工业大学等机构提出的DualTSR把图像生成和文字预测塞进同一个Transformer,训练时同步加噪、推理时互相引导,把DifTSR参数量砍掉六倍、速度快一百倍,识别率反而大涨12.78个百分点。一个字:值。

西北工业大学最新研究:图像超分和文字预测一个模型搞定,速度比DiffTSR快101倍
原论文信息如下:
论文标题:
Coupled Continuous–Discrete Generation for Scene Text Image Super-Resolution
发表日期:
2026年08月
发表单位:
西北工业大学,韩国科学技术院(KAIST)
原文链接:
https://arxiv.org/pdf/2608.04525v1.pdf

图2:真实场景RealCE数据集上×4倍率下的视觉效果对比。对比方法包括ESRGAN、MSRResNet、SwinIR、SRFormer、MARCONet、MARCONet++、DifTSR以及本文提出的DualTSR。
出门旅游拍路牌,回来糊成马赛克;老旧证件想扫描留档,放大全是锯齿边。这是很多人生活里的日常,也是场景文本图像超分辨率(STISR)想解决的痛点:把模糊到看不清字的文本照片,还原成既清晰、又真实、还能被OCR正确读出来的图。
这个任务要同时打“两场仗”:图像细节恢复和字符语义保真。普通超分方法可以把纹理修得很漂亮,却常常把“日”字修成“目”字;而只强调文字可读性的方法,又容易让画面失真。更麻烦的是,汉字字符集庞大、笔画结构极其敏感,一个像素级误差就可能让整个字符语义跑偏。

场景文本超分新突破:DualTSR如何统一图像生成与文本预测?

过去几年,STISR的主流做法是“借力打力”:从外部OCR模型里读一段文本序列,再作为条件引导超分网络生成对应字符。代表方法包括Text Gestalt、TATT、C3-STISR,以及采用OCR先验的TSRN、TBSRN等。然而这类方法的命门也很明显:外部OCR一旦认错,错误就会被放大并“灌输”进超分网络,生成出凭空捏造的笔画,反而把图片带偏。
为了摆脱外部OCR依赖,后续研究引入结构先验。例如MARCONet学习字符结构码本,GlyphSR用SAM生成字形掩码监督细粒度笔画重建。这些方法缓解了OCR不稳定问题,但流程越来越复杂、模块越来越多,训练和推理成本水涨船高。
扩散模型的出现给STISR带来另一种可能。近期DifTSR便是代表——用两个独立扩散分支分别建模图像和文本,再用多模态融合模块(MoM)把双方信息强行拼在一起,在中文场景文本超分上取得亮眼效果。但DifTSR结构仍偏重:1.23B参数量、13.3秒端到端延迟、图像和文本分支只在特定融合点交换信息,效率和交互深度都有很大提升空间。
西北工业大学等单位提出的DualTSR,换了一条更简洁的路径:干脆把图像生成和文本预测装进同一个多模态Transformer里。图像分支采用条件流匹配(Conditional Flow Matching)恢复连续图像潜变量,文本分支采用吸收态离散扩散(Absorbing-state Discrete Diffusion)重建文字token序列。两个过程共享同一套骨干网络,图像状态与文本状态在网络每一层都能相互影响,而不是只在某个融合点碰一次头。这样训练出来的模型,推理阶段完全不需要外部OCR先验,语义信息由模型内部自行产生。
效果如何?在CTR-TSR合成基准上,DualTSR在×2和×4两种倍率下都拿到FID、LPIPS、ACC、NED四项指标最优;在真实世界数据集RealCE对齐子集上,同样在FID、ACC、NED三项取得最优,LPIPS也与最佳结果接近。更重要的是效率。与DifTSR在×4倍率下对比,DualTSR将ACC从44.87%提升到57.65%,提升12.78个百分点,同时把参数量从1.23B降到203M,端到端推理延迟从13.3秒压缩到132毫秒。
这套“把两件事当成一件事来学”的思路,确实让人眼前一亮。

从分离到统一:DualTSR的核心架构设计

要理解DualTSR的架构设计,先要看清楚它与既往路线的根本差异。图1给出了三类代表性STISR架构的对比。
图1
图1:代表性STISR架构对比。DualTSR将图像生成与文本预测统一在一个模型内。(a) Baseline:直接从低分辨率输入建模高分辨率图像分布,不使用文本先验。(b) DifTSR:独立建模图像和文本先验,再通过多模态模块(MoM)融合二者表示。(c) DualTSR:通过两个耦合的扩散过程,在一个统一多模态Transformer中联合优化图像生成与文本预测。
第一种架构(a)只是把低分辨率图像映射到高分辨率图像,没有语义约束,超分结果常常“好看但字不对”。第二种架构(b)是DifTSR的做法,图像分支和文本分支各跑各的扩散,到融合点才交换一次信息,本质上是两套独立系统的外部对接。第三种架构(c)是DualTSR的做法,把两个任务塞进同一个网络,从浅层到深层全程保持双向信息流通。
DualTSR的整体建模目标,是学到一个条件联合分布:给定低分辨率图像,同时预测高分辨率图像和对应的文本序列。这个联合分布被拆成两个相互耦合的生成过程——连续域上的图像生成和离散域上的文本生成。围绕这两个过程,模型包含三个核心组件:条件流匹配图像分支、吸收态离散扩散文本分支,以及共享的多模态Transformer骨干。
多模态Transformer的设计借鉴了Stable Diffusion 3(SD3)中的MM-DiT模块。图像潜变量被分割成patch序列,文本token被映射成向量序列,二者拼在一起送入同一组注意力层。联合注意力机制让图像patch和文本token可以在每层Transformer中自由交互,图像分支的细化过程与文本分支的重建过程并行推进、互相“看得见”。图4展示了这个联合注意力模块的结构。
图4
图4:联合注意力机制示意。借鉴SD3中的MM-DiT模块设计,联合注意力模块使图像潜变量细化和文本重建过程能够并行交互。
图像生成走的是流匹配路线。流匹配(Flow Matching)是近年兴起的生成模型范式,核心思想不是逐步去噪,而是学习一个随时间变化的“速度场”,让噪声沿一条直线轨迹流向真实数据。给定噪声样本和高分辨率图像样本,二者之间的线性插值路径定义为x_t = (1−t)x_0 + tx_1,对应的真实速度就是u_t = x_1 − x_0。
公式1
其中x₀是目标高分辨率图像的潜变量,x₁是高斯噪声样本,t是0到1之间的时间步。训练时,网络学习预测这个速度,损失函数为L_CFM,即预测速度与真实速度之间的均方误差。
公式2
这里的c是条件信息,在DualTSR中包括低分辨率图像以及(训练时)文本标签。文本分支走的则是另一条路——离散扩散。文本token来自一个有限的字符表,不适合直接在连续空间里做加噪去噪,因此DualTSR采用吸收态扩散:前向过程把文本token按时间步t逐渐替换成特殊的掩码token [MASK]。
公式3
其中α_t是噪声调度函数,α_t x 表示保留原token的概率,剩余的(1−α_t)概率被分配给掩码token m。当t从0增大到1,文本逐渐被掩码吞没。反向过程则是从全掩码序列出发,逐一恢复出原始文本。训练目标采用简化后的负变分下界(NELBO),让模型在给定被掩码token和时间步的条件下预测原始token序列。
公式4
至此,DualTSR把图像维度的连续生成和文本维度的离散生成组合成了同一个骨干网络里的两个头部:一个输出图像速度,一个输出文本分布。关键问题来了:如何让这两个过程在训练和推理时真正耦合起来,而不是各学各的?

耦合训练与联合推理:连续-离散生成的关键机制

DualTSR的耦合机制,最核心的设计是“同步加噪”。在训练时,图像和文本使用同一个时间步t。图像按流匹配方式加噪,文本按吸收态方式掩码,然后把两个被破坏的状态同时送入多模态Transformer,让模型同时完成两件事:预测图像速度、重建被掩码的文本token。
为什么要同步加噪?如果图像和文本的退化程度不一致——比如图像已经很模糊、文本却还很完整——那模型就可以“偷看”文本信息来推断图像,或者反过来“偷看”图像来识别文字,两个分支就不需要真正学会跨模态的联合推理。只有当图像和文本都处于同样的不确定状态时,模型才被迫从图像状态去推测文本、从文本状态去修正图像,形成双向依赖
训练目标由三部分构成。L_IMG是图像生成损失,模型以低分辨率图像和真实文本标签为条件,预测图像速度。L_TXT是文本重建损失,模型以低分辨率图像和高分辨率图像为条件,从被掩码的token中重建文本。L_JOINT是联合损失,在这一项里,图像用被掩码的部分文本为条件,文本用加噪的部分图像为条件,两边的信息都残缺,模型必须同时修复两路信息才能把损失降下来。
公式5
图:图像生成损失L_IMG,c^img = {低分辨率图像, 真实文本}。
公式6
图:文本重建损失L_TXT,c^txt = {低分辨率图像, 高分辨率图像}。K个时间步采用对偶采样近似连续时间目标。
公式7
图:基础版总体目标L_Overall = L_IMG + L_TXT + L_JOINT。
除了这三个损失项,DualTSR还引入了一个提升训练质量的细节——模型引导(Model-Guided Training,MG)。这里借鉴了分类器自由引导的思想,但又有所不同:它不是直接用EMA教师做推理,而是用EMA教师的预测结果来构造训练目标。具体做法是,对图像速度目标做一个修正:原始速度u_t加上引导尺度w乘以EMA条件预测与EMA无条件预测之差,并停止梯度回传。
公式8
图中sg表示停梯度操作,w为引导尺度,EMA表示指数移动平均教师模型。训练时,条件c会以一定概率被替换为空条件,让模型同时学会条件预测和无条件预测。这样修正后的速度目标包含了更丰富的条件信息,辅助学生网络更稳定地收敛。
公式9
最终训练目标为L_Overall = L_IMG-MG + L_TXT + L_JOINT-MG。
推理阶段,DualTSR的流程和训练保持对称。给定一张低分辨率图,图像分支从高斯噪声出发,文本分支从全掩码序列出发,然后循环执行若干步:每一步中,模型同时输出图像速度预测和文本token分布预测;图像按欧拉法更新,文本则在被掩码的位置按预测分布重新采样,已经生成出来的token保持不变。如此反复迭代,直到t=0。最后把图像潜变量通过VAE解码回RGB空间,得到最终的超分结果。默认配置下,DualTSR只需要4步ODE采样就能完成推理。
公式10
其中x_s^hr表示更新后的图像潜变量,x_t^hr为当前潜变量,(t−s)是步长,û_t为网络预测的速度。
这种“边生成图像边猜测文本”的推理机制,带来了一个很自然的优势:当前的文本假设可以即时反馈给图像分支,指导字形恢复;而正在成形的图像又可以反过来修正文本预测。文本和图像不再是先验与结果的单向关系,而是变成了对话关系。图3给出了不同采样步数下的视觉变化示例。
图3
图3:不同采样步数下的视觉示例。更多步数能提升纹理平滑度,但可能让字符笔画变得模糊。

实验全面领先:精度与效率的双重提升

为了验证DualTSR的实际性能,论文在合成和真实两个维度的基准上做了全面评测。合成数据方面,团队按照DifTSR论文中描述的流程,重新构建了CTR-TSR数据集,包含64139张训练图和8690张测试图,退化配方与DifTSR保持一致。真实数据方面,使用RealCE数据集,并参照DifTSR的做法,筛选出300对干净且对齐良好的低分辨率-高分辨率图像对进行评测。
评价指标选取了五个维度:PSNR评估像素级重建精度,LPIPS衡量感知质量,FID评估生成分布的真实性,ACC和NED则是面向文本的指标。ACC由固定OCR识别器对恢复图像做整词匹配;NED则通过归一化编辑距离计算字符级相似度,公式如下。
公式11
其中ED表示编辑距离,|g|和|p|分别表示真实文本与预测文本的长度。NED越高说明识别结果与真实文本越接近。
表1和表2汇总了CTR-TSR与RealCE上的定量对比结果。对比方法包括通用超分领域的ESRGAN、MSRResNet、SwinIR、SRFormer,以及针对文本场景的MARCONet、MARCONet++和DifTSR。
表1和表2
表1:合成基准CTR-TSR上的定量对比(加粗为最优)。表2:真实基准RealCE上的定量对比(加粗为最优)。
先看合成基准CTR-TSR。一个有意思的现象是:通用超分方法在PSNR上表现不错,但在FID、LPIPS和文本指标上全面落后。这说明像素级重建指标好,不代表生成结果视觉真实,更不代表文字容易被识别。MARCONet和MARCONet++虽然在文本结构上做了约束,但合成训练管线破坏了场景一致性,感知指标反而被拖累。DifTSR凭借扩散模型的双分支设计,在FID上有所改善,但ACC和NED仍然不高。
DualTSR则呈现出另一种面貌。以CTR-TSR ×4倍率为例,其FID为16.42,远低于所有对比方法;ACC达到57.65%,比DifTSR高出12.78个百分点;NED达到76.64%,同样是最优。在×2倍率下优势同样明显。RealCE真实数据集的趋势也基本一致,DualTSR在FID、ACC、NED三项上取得最优,LPIPS与最佳结果差距很小。这说明它能从真实场景的低质量文本图像中恢复出既自然又可读的结果。
图6
图6:合成CTR-TSR测试集上×2倍率的视觉对比。
图7
图7:合成CTR-TSR测试集上×4倍率的视觉对比。DualTSR恢复的文字在笔画结构上更接近真实字形,而对比方法容易出现笔画粘连、字形失真等问题。
图10
图10:真实数据集RealCE上×2倍率的视觉对比。
实验中最突出的一点是效率。在CTR-TSR ×4倍率下,论文对比了DualTSR与DifTSR的参数量、峰值内存、推理延迟等指标,结果非常直观。
表3
表3:CTR-TSR ×4倍率下的效率对比。运行时间在单张NVIDIA A100上测量,batch size为1,输出分辨率128×512。NFE表示网络函数评估次数。
DifTSR需要1.23B参数和13.3秒才能完成一次端到端推理,而DualTSR只用了203M参数和132毫秒。这意味着参数量减少约6.1倍,峰值内存降低约4.5倍,推理速度快了大约101倍。这种量级的效率差异,直接决定了技术能否从实验室走向真实产品。
为了验证各个设计模块的贡献,论文还做了消融实验。表4是从内部文本评估视角检验恢复图像的OCR识别率,表5则比较了不同损失项的效果。
表4和表5
表4:CTR-TSR ×4倍率下的内部文本评估,“OCR on SR”表示对恢复图像进行TransOCR评估。表5:CTR-TSR ×4倍率下的损失消融。所有变体均训练300k迭代,batch size为128,以进行高效对比。
从消融结果可以看到,去掉联合损失L_JOINT之后,ACC和NED都出现了明显下降,这直接验证了同步加噪和多模态联合训练的价值。单独移除文本分支损失L_TXT的影响也很显著,说明文本监督不仅仅是为了识别,也对图像生成质量有正向反馈。
补充实验结果
补充实验对比结果。
引导尺度w的选择同样关键。模型引导中w控制条件信息对生成过程的影响强度。实验表明,w=1.0是整体权衡最优的配置——w过大会让FID恶化,继续增大还会连累NED。这说明适度的条件引导能帮助图像-文本双向纠正,但过强的引导会让生成过程过度依赖某一时刻的不完整文本信息,导致生成质量波动。
表6
表6:引导尺度w在CTR-TSR ×4倍率上的影响。增大w会恶化FID,并最终损害NED。
采样步数的影响也值得关注。图5显示,增加采样步数可以改善FID,在约40步时达到最佳感知质量;但步数过多会让字符笔画过度平滑,NED反而下降。DualTSR选择4步作为平衡点,在效率与质量之间找到一个实用的折中。
图5
图5:采样步数与感知质量、文本保真度之间的权衡。FID随步数增加而改善,在约40步达到最佳;NED则因字符笔画过度平滑而变差。论文选取4步作为均衡操作点。

局限与展望:DualTSR的边界与未来方向

尽管DualTSR在多个指标上表现亮眼,但仍然存在一些值得注意的边界。
第一,PSNR指标并不占优。在CTR-TSR上,DualTSR的PSNR为22.43(×2)和20.54(×4),低于SwinIR、SRFormer等通用超分方法。这并不奇怪——生成模型通常倾向于生成感知上更真实但像素级偏差稍大的结果。但对一些对像素精度要求苛刻的工业场景,比如印刷品检测、票据存档,PSNR偏低可能成为落地障碍。
第二,真实场景的评测子集并非官方划分。由于DifTSR没有公开其使用的RealCE子集划分,DualTSR团队按照同样的考量标准自行构建了300对对齐良好的子集。评测数据不完全一致,意味着与DifTSR等方法的数字对比只能作为参考,不能作为严格意义上的公平比较。
第三,采样步数与文本保真度之间存在矛盾。更多步数带来更好的感知质量(FID),但会模糊字符笔画、拉低NED。这表明当前模型对“纹理平滑”和“笔画锐利”之间的平衡还不够理想,需要未来在架构或损失设计上做进一步优化。
从更大的视角看,DualTSR的核心价值不在于某一个指标上的突破,而在于它展示了图像生成与文本理解可以共享同一个生成框架。这种“耦合连续-离散生成”的范式,未来有可能推广到视频场景文字增强、图文混合文档修复、多语言场景文字超分等更广的任务上。在当前研究大多围绕“引入更强的外部先验”打转的情况下,DualTSR提供了一条“从模型内部长出语义理解”的新路径。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?DualTSR将场景文本图像超分与文字识别统一为连续-离散耦合生成任务,在共享Transformer中同时完成图像重建与文本预测。无需外部OCR先验,4步采样下速度达132毫秒,…
这篇工作最值得看的点是什么?在CTR-TSR上×2和×4均取得最佳FID、LPIPS、ACC和NED;在RealCE子集上取得最佳FID、ACC和NED及有竞争力的LPIPS;相比DifTSR在×4下ACC提升12.78个百分点,参数减少6.1倍,延迟降低约101倍
这篇工作的边界或风险在哪里?优点:(1)统一框架避免外部OCR先验的误差传播;(2)共享transformer实现图像和文本的深度交互;(3)计算效率显著优于现有生成式方法;(4)在感知质量和文本保真度上均取得最优。缺点:(1)PSNR低于回归式方法,存在感知-失真…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将条件流匹配与吸收态离散扩散放进同一个多模态Transformer,实现图像-文本逐层交互。相比DifTSR的分离式双分支架构,统一建模的思路具有明显的架构创新价值,但在单个模块的设计上仍是对已有技术的组合。

实验合理度:★★★★☆

对比方法覆盖面广,从通用超分到专用文本超分都有涉及;消融实验验证了联合损失和引导尺度的作用。扣一星是因为RealCE评测子集是自建划分而非官方版本,数字对比存在一定的不确定性。

学术研究价值:★★★★☆

把文本知识从“外部先验”变成“模型内生”,这个转变对STISR领域有方法论层面的启发。耦合连续-离散生成的范式,也值得在其他图像-文本联合任务中尝试。

稳定性:★★★☆☆

在合成和真实数据集上都有稳定的领先表现,对引导尺度w和采样步数也给了详细分析。但PSNR偏低以及真实子集划分不一致,让稳定性的评价需要打一点折扣。

适应性以及泛化能力:★★★☆☆

在中文场景文本上表现突出,但实验集中在中文数据。对英文、数字、混合语种场景,以及艺术字、手写体等特殊字形的泛化能力尚未验证。

硬件需求及成本:★★★★☆

推理阶段203M参数、132毫秒延迟、普通GPU即可流畅运行,产品化潜力很强。但训练需要4张A100共700k迭代,这个训练成本不是一般团队能轻松承受的。

复现难度:★★★★☆

论文表示会公开代码、数据集构建脚本和预训练权重。CTR-TSR数据集虽然需要按描述自行构建,但有明确的流程指引,整体复现难度可控。

产品化成熟度:★★★★☆

推理速度快、参数量小、不依赖外部OCR,这三点组合起来已经具备很强的落地基础。适合做移动端文档扫描、门牌照识别等场景的预处理模块。不过真实世界评测数据量偏小,距离大规模商用还需要更多场景验证。

可能的问题:真实数据评测子集为自行构建,与DifTSR的对比并非完全公平;PSNR显著低于通用超分方法,可能影响精度敏感型应用;跨语言和跨字体的泛化尚未验证,未来需要补充更丰富的实验证据。

主要参考文献

[1] Zhang et al. DifTSR: Dual-branch diffusion for scene text image super-resolution. 2024.
[2] Lipman et al. Flow Matching for Generative Modeling. ICLR 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球