← 返回 PaperDaily
视觉与图像
快慢双路径Mamba + D-βB门控,文档二值化新范式
每次遇到新档案馆里那些发黄、透墨、满是污渍的老旧文档,你是不是还得重新标注数据、重新微调模型?本论文的DR-Mamba让你彻底告别这个繁琐环节——它利用巧妙的快慢双路径Mamba和样本条件的自适应减法门,在模型前向推理时就能自动适应每张文档的独特退化类型,效果还特别能打,尤其对最难处理的极端退化样本效果拔群。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
每次遇到新档案馆里那些发黄、透墨、满是污渍的老旧文档,你是不是还得重新标注数据、重新微调模型?本论文的DR-Mamba让你彻底告别这个繁琐环节——它利用巧妙的快慢双路径Mamba和样本条件的自适应减法门,在模型前向推理时就能自动适应每张文档的独特退化类型,效果还特别能打,尤其对最难处理的极端退化样本效果拔群。
原论文信息如下:
DIBCO赛道上的“隐形斗篷”:DR-Mamba如何让模型自动适应未知退化?
想象一下这个场景:你辛辛苦苦训练了一个模型,用来把扫描的旧文档变成清晰的黑白图片。在测试集上表现不错,结果一碰到档案馆里那些泛黄、透墨、有水渍和污渍的真实老书页,模型立马“原形毕露”,效果惨不忍睹。
这就是一直困扰文档图像二值化领域的“域偏移”(Domain Shift)问题。说白了,就是训练数据(干净的扫描件)和实际应用数据(脏兮兮的老文档)长得不一样,模型“懵了”,无法做出正确判断。
来自台湾淡江大学的 Sheng-Wei Chan 和 Jen-Shiun Chiang 两位研究者提出了一个全新的解决方案——DR-Mamba。它的核心思想非常巧妙:不需要额外的数据,不需要微调参数,仅仅通过一次前向传播,模型就能根据输入图片“自适应”地去除了背景干扰,就像给模型穿上了一件可以应对各种复杂情况的“隐形斗篷”。
从加法到减法:快慢双路径Mamba的“取精去糟”之道
要理解DR-Mamba的精妙之处,首先得知道以往的方法是怎么“翻车”的。传统的深度学习模型,比如Unet或者Transformer,在处理文档二值化时,通常会把提取到的所有特征(不管是前景的笔画,还是背景的污渍)简单粗暴地融合在一起。
这就像做一道好菜,把上等的牛肉和发霉的菜叶子都扔进锅里乱炖——结果是,你无法得到纯粹的精华。
DR-Mamba的厉害之处在于,它把这个“炖”的过程,变成了一个“选”和“减”的过程。它用了一个非常先进的网络结构——Mamba,来构建两条并行的“路径”,分别负责处理文档的不同信息。
Mamba是一种近两年兴起的状态空间模型,它最主要的优势在于能以近乎线性的时间复杂度处理超长序列,完美解决了传统Transformer在长序列任务中计算量爆炸的瓶颈,因此在图像、文本等任务中都展现出巨大潜力。
DR-Mamba借鉴了它的“选择性扫描”机制,但赋予了更具体的分工:
第一条是“快路径”(Fast Detail Route)。这条路径的“记忆”很短,更新得快,专门用来捕捉文档中那些变化剧烈、高频的细节信息——比如锐利的笔画、文字的轮廓。它的“遗忘率”(decay rate)很高,今天看到了,明天就忘了,只关注眼前的局部细节。
第二条是“慢路径”(Slow Background Route)。这条路径的“记忆”很长,更新得慢,专门用来积累那些空间上持续存在的、缓慢变化的背景退化信息——比如大片的水渍、泛黄的底色、顽固的墨渍。它的“遗忘率”很低,就像是把一张底片上慢慢感光的背景阴霾,一点点累积起来。
这种“快慢结合”的设计,完成了一次漂亮的信息分解:一条路径提炼出了“精华”(细节笔画),另一条路径则识别出了“糟粕”(背景干扰)。
自适应减法门D-βB:每个文档、每个像素的专属“去污剂”
有了两条路径,下一步就是如何把它们整合起来,得到最终干净的图像。这里,DR-Mamba做了一个革命性的改变:它不再使用传统的加法(特征叠加)或者拼接(特征拼接),而是用了一个减法—— D - βB。
这里的D代表 “快路径”提取到的细节特征(Detail),B代表 “慢路径”累积的背景干扰特征(Background)。关键的变量就是这个β。这个β可不是一个固定的数字,它是一个由模型根据当前输入样本,为每一个像素点预测出来的“抑制强度”。
“自适应减法”这个设计非常优雅。试想一下,如果一个文档背景只有轻微泛黄,那么B这条路径几乎不会累积到什么“污渍”,减法也就不会生效,模型更专注于前景细节的提取。而一旦文档出现大片深色污渍,B路径就会迅速响应,并指导一个大的β值,模型立刻就会采取强力“去污”行动。这种“一事一议”的动态策略,比任何全局的、固定的处理方法都要灵活和鲁棒。
告别微调:一次前向传播搞定域适应
说完了核心机制,我们再来看它带来的最大好处——无需微调的域适应。
很多域适应方法(如测试时训练Tent,测试时自适应TTA等)要求在推理阶段通过反向传播更新模型的参数。这不仅计算量大,而且需要小批量数据(batch)来计算统计量,对于一个一个单独到来的文档,处理起来很麻烦。
DR-Mamba完全不同。它把“域适应”的能力直接编码在了它的网络结构里。当一张新文档图片输入时,模型会一前一后地执行两条路径(快路径和慢路径),并通过自适应减法门D-βB完成输出。这一切都在一次前向传播(Forward Pass)中完成。
可以说,DR-Mamba把适应不同的退化类型,变成了网络自身的“本能反应”,而非“临时学习”。
实验结果揭秘:最难2019年数据上,谁是“最靓的仔”?
口说无凭,评价一个模型好不好,还得看疗效。作者设计了一个非常严苛的实验方案,叫做“留一年法”(Leave-One-Year-Out, LOO)。简单来说,就是把不同年份的DIBCO(Document Image Binarization COntest)比赛数据集当作不同的域。比如,用2009年到2018年的数据训练,然后用2019年的数据测试,看模型在“从未见过”的年份数据上表现如何。
以下DIBCO和H-DIBCO是文档图像二值化领域最权威的基准测试集(DIBCO全称Document Image Binarization COntest,H-DIBCO代表手写文档的版本),它们包含了从正常到严重退化的各种文档样张,是衡量模型性能的“金标准”。
实验结果分析
首先看表1,这是DR-Mamba与其他主流方法的总体对比。需要说明的是,由于这些对比方法本身的训练协议和测试年份划分不完全一致,所以此表只能作为参考,而非严格控制的复现对比。但即便如此,DR-Mamba在p-FM(伪F-measure,这个指标特别关注对细笔画的保留)上依然取得了最高的得分,体现了其在保留精细笔画方面的优势。
更关键的是表2,完整的留一年法测试结果。在绝大部分年份的数据上,DR-Mamba的表现都非常稳定。所有的指标FM、p-FM、PSNR(峰值信噪比,衡量像素级相似度)、DRD(距离倒数失真度,衡量人眼感知到的失真)都说明了模型的鲁棒性。
但真正的试金石是2019年的数据。这一年包含了最为严重的背景干扰和低对比度笔画。结果如何?请看表3。
在2019这个最难的数据集上,DR-Mamba的FM(F-measure,二值化分类的综合评价指标)和PSNR都达到了最高,p-FM(细笔画保留指标)也排在前列。反观某些在总体对比中表现强劲的方法(比如DocBinFormer和TransDocUNet),在2019年数据上分数直接“崩塌”(FM低于61),而DR-Mamba的FM依然稳定在75.16,性能退化幅度远小于竞争对手。
为什么能取得这样的效果?我们从消融实验(表4)中得到了答案。作者通过逐步添加各个模块,清晰地展示了每个设计的贡献。
在消融实验中,A0是只有单路径Mamba和简单BCE(二元交叉熵)损失的基线模型。A1增加了双路径(但用拼接融合),效果略有提升(+0.57FM)。A2引入了自适应减法门D-βB,效果一跃提升了1.52FM!这充分说明,减法门的设计才是DR-Mamba获得跨域鲁棒性的核心。A3加入了细节引导重建模块,效果进一步提升。A4引入了针对细笔画的复合损失函数,最终达到了FM 92.06的最佳效果。这个实验清晰地揭示了“取精去糟”后的减法,是模型强大泛化能力的“心脏”。
表6非常直观地展示了“减法”相对于“加法”和“拼接”的绝对优势。自适应减法D-βB的FM比固定β的减法高,比简单的减法高,更比加法高了将近5个点!
最后,我们通过一张可视化对比图来感受一下(图2)。可以看到,在处理带有严重背景干扰的文档时,其他方法往往要么无法消除污渍,要么误删了笔画。而DR-Mamba不仅干净地抑制了背景污渍,还完整地保持了纤细、断续的笔画的原始形态。
龙迷三问
这篇论文解决什么问题?这篇论文主要解决文档图像二值化中,因训练数据和实际应用数据(如不同年份、不同老化程度的文档)之间存在“域偏移”而导致模型效果变差的问题。它提出了一种无需微调、无需额外标签,仅通过一次前向传播就能自动适应新文档退化类型的方法。
DR-Mamba中的Mamba是什么?Mamba是一种先进的状态空间模型,可以看作是对Transformer的一种高效替代。它能以极低的计算量处理非常长的序列(比如高分辨率图像),非常适合做密集预测任务。DR-Mamba利用了Mamba的“选择性扫描”能力,并将其改造为两条分工不同的路径。
文中提到的D-βB门控机制是如何工作的?请举例说明。D代表细节路径的输出,B代表背景路径的输出。β是一个由网络为每个位置预测的0到1之间的值。举个例子,在文字的笔画处,β值接近于0,公式变为D - 0*B = D,所以保留所有细节笔画信息。而在一个墨渍的边缘,β值会接近1,公式变为D - 1*B = D - B,模型会将墨渍的干扰特征从细节特征中减去,从而在最终输出中“擦除”墨渍,但保留文字的细节。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★✰
将Mamba的结构改造为任务驱动的快慢双路径,并配合自适应减法门D-βB来完成背景抑制式的域适应,这一设计思路在文档二值化领域非常新颖且巧妙。
实验合理度:★★★★✰
采用的“留一年法”协议非常严苛,能有效检验模型的域适应能力。消融实验设计清晰,逐一剥离每个组件,有力地证明了核心设计的必要性。但部分对比实验结果(如表1、表3)因训练协议差异而被作者注明为“参考”,使其对比的说服力有所减弱。
学术研究价值:★★★★✰
提出了“推理时域适应”这一高效范式,具有较高的理论价值。其将特征分解、背景抑制与状态空间模型结合的思路,为其他图像修复、医疗图像分割等任务提供了新的研究方向。
稳定性:★★★★✰
从2019年最难数据上的表现来看,性能虽有显著下降,但与其他方法相比依然是最稳定的,说明其具备一定的鲁棒性。但在极端情况下效果仍不尽如人意,还有提升空间。
适应性以及泛化能力:★★★★✰
总体上在多个年份的数据集上表现优异,泛化能力很强。但“留一年法”只能验证跨时间,其面对全新的扫描仪、完全不同的墨水类型和书写材料(真实的产品级域漂移)时,其适应能力还需进一步检验。
硬件需求及成本:★★✰✰✰
模型参数量为33.51M,在512*512输入下的FLOPs为178G,对计算资源有一定要求。而且训练时用了复合损失函数,训练过程较为复杂。推理时虽然是前向传播,但相较简单模型,仍需要高端GPU。
复现难度:★★★✰✰
论文对核心思想交代得很清楚,但未提及代码开源。若要复现,关键难点在于Mamba相关的自定义模块和复杂的损失函数组合,对研究者的工程能力有一定挑战。
产品化成熟度:★★★✰✰
该方法的范式(一次前向推理,无需微调)非常有利于产品化。但模型参数量大,可能不适合在端侧设备上运行;且面对真实世界极端多样的退化时,其泛化能力是否依然可靠,还需更多测试。
可能的问题:整体而言,这篇论文的方法设计和实验都很出色。但对比实验没能做到严格公平复现,削弱了部分结论的绝对可信度;此外,模型训练依赖复杂的数据增强和复合损失,构建过程略显繁琐,对后续研究者复现和推广造成一定门槛。
主要参考文献
[1] Sheng-Wei Chan and Jen-Shiun Chiang. DR-Mamba: Automatic Inference-Time Domain Adaptation for Document Image Binarization via Sample-Conditioned Detail-Background Suppression. arXiv:2606.22625, 2026.
[2] Albert Gu and Tri Dao. Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752, 2023.
[3] DIBCO & H-DIBCO Benchmarks. https://diuf.unifr.ch/imaging/dibco/.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群