← 返回 PaperDaily 视觉与图像

ICLR 2025后续新作:BRACE让屏幕拍照条纹退场

屏幕拍照最烦的不是糊,而是那种彩条、锯齿、色偏混在一起,像手机在认真拆台。BRACE干脆换了思路:不再死磕单帧,直接上多帧包围曝光RAW,把“看不清的条纹”变成“能对照的证据”。

ICLR 2025后续新作:BRACE让屏幕拍照条纹退场
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
屏幕拍照最烦的不是糊,而是那种彩条、锯齿、色偏混在一起,像手机在认真拆台。BRACE干脆换了思路:不再死磕单帧,直接上多帧包围曝光RAW,把“看不清的条纹”变成“能对照的证据”。


原论文信息如下:
论文标题:
Bricker to BRACE: A Bracket Exposure RAW Dataset and Restoration Model for Flicker-Banding
发表日期:
2026年06月
发表单位:
上海交通大学;华为消费者业务集团
原文链接:
https://arxiv.org/pdf/2606.31997v1.pdf
开源代码链接:
https://github.com/ZZH-qwq/BRACE
项目链接:
https://github.com/ZZH-qwq/BRACE

引言

拍屏幕这件事,看起来简单,实际很容易翻车:同一张图,可能冒出彩色条纹、锯齿边、局部色偏,甚至把文字内容也一起“洗掉”。问题的根子不在图像本身,而在相机卷帘快门和屏幕亮度调制的时间混叠。
图1:Bricker数据集与BRACE模型总览,左侧展示合成与真实图像对,右侧展示BRACE的去条带效果。
这篇论文最值得读的地方,不是“又做了一个去条纹网络”,而是先把问题掰开揉碎:复杂频闪条带到底长什么样、为什么会随曝光变化、单帧方法为什么容易把纹理当噪声。然后才顺势推出 Bricker 数据集和 BRACE 模型,逻辑很顺,工程味也很足。

方法概述

本论文的主线其实很清楚:先造数据,再做模型,最后拿一个更像样的指标去评估。Bricker 是一套合成+真实的多帧包围曝光 RAW 数据集,BRACE 则是专门吃这套数据的恢复模型,核心目标是利用不同曝光下“条纹表现不一样、内容却基本不变”这一点,把条带从真实纹理里分离出来。
图3:合成数据生成管线概览,展示物理驱动仿真流程及其与真实拍摄条纹模式的对比。
数据构建这部分很关键。合成部分不是简单贴几条黑白线,而是用光线追踪去模拟屏幕成像,再把滚动快门、显示刷新、噪声、反向 ISP 都串起来,尽量逼近真实拍屏。真实部分则靠自动化多曝光采集工具,解决了多帧 RAW 对齐和采集成本高这两个老大难。
图4:真实数据采集流程,展示曝光序列设置以及不同内容和拍摄条件下的样例。
模型侧的思路也不绕弯:先从频域里抓条带的主方向和主频率,形成一个频率感知条带先验,再把这个先验喂给多尺度空间交叉注意力调制器 MSCAM。说人话就是,模型先知道“条纹大概朝哪儿、能量有多强”,再决定该从哪一帧借信息、借多少信息。

闪烁带去除的难题与突破:为什么多帧RAW是关键?

封面:Bricker数据集与BRACE模型总览
手机拍屏幕,最烦的往往不是模糊,而是那种彩色条纹、锯齿边和局部色偏一起上阵的“精神污染”。更麻烦的是,这些条纹还很会伪装:一会儿像真实纹理,一会儿像噪声,单帧修复模型很容易把内容和伪影搅成一锅粥。
这篇论文先把问题讲透了:闪烁带(Flicker-Banding,FB)本质上来自相机卷帘快门和屏幕亮度调制之间的时间混叠。卷帘快门是逐行曝光,屏幕却在按自己的节奏闪;两者一撞,时间域里的变化就被投影到空间域里,最后在图像上变成一条条亮暗交替的带状伪影。
单帧方法的问题也很直接:当屏幕内容本身就有密集文字、网格、边框时,模型根本不知道哪些是真纹理,哪些是条带。于是论文干脆换思路——不再死磕一张图,而是利用不同曝光下条带形态会变化、内容却基本不变这一事实,改用多帧包围曝光 RAW来给模型提供“对照证据”。简单说,单张图像像做阅读理解,多张不同曝光图像则像开了答案解析。
更关键的是,RAW 不是普通的成像结果,而是更接近传感器原始读数的数据形式。它保留了线性响应和高位深信息,少了很多 ISP 处理带来的“二次加工”。对于这种和曝光、亮度调制强相关的退化,RAW 天然比 sRGB 更适合建模。论文的判断很朴素:如果条带是从物理成像链路里长出来的,那修复也最好在物理信息更完整的 RAW 域里完成。

从物理模拟到真实采集:Bricker数据集构建全解析

图2:真实拍摄中常见的复杂频闪条带形态,通过物理驱动仿真管线渲染展示。
先看数据集。论文发现,真实拍屏里的条带并不只是简单的平行黑白线,常见形态包括色偏条带复合周期条带锯齿/菱形条带。这些形态和显示器亮度调制策略、局部亮度分区、曝光时间都有关,不是随便画几条线就能糊弄过去的。
图3:合成数据生成管线概览,展示物理驱动仿真流程及其与真实拍摄条纹模式的对比。
合成部分 Bricker 不是“贴条纹”式的粗糙模拟,而是用光线追踪去还原完整屏幕成像链路。流程里先随机放置虚拟屏幕和相机,加入轻微抖动,再根据滚动快门、屏幕刷新方式和曝光窗口去计算每个像素接收到的亮度积分,之后再走反向 ISP、Bayer 马赛克和传感器噪声,最后得到 RAW 域的退化序列与对应真值。
这套模拟的价值在于,它不是只生成“像条带”的图,而是尽量生成“为什么会有这种条带”的图。也正因为如此,论文能观察到条带在不同曝光下的形态、强度、对比度明显变化,这正是后面多帧恢复成立的前提。
图4:真实数据采集流程,展示曝光序列设置以及不同内容和拍摄条件下的样例。
真实数据这边更像工程活。现有手机拍摄工具大多只能做固定 ISO 的包围曝光,想要同时控制曝光和 ISO、还要输出 RAW 并尽量对齐,麻烦得像在手机里做一台小型摄影棚。论文基于 Android 和 Camera2 接口做了自动化采集工具,把曝光参数控制、RAW 序列采集、对齐流程都串了起来,采集成本明显下降。
真实集的一个巧思是:通过保持 ISO×曝光时间近似恒定,用更长曝光逐步逼近近乎无条带的真值帧。这样做的好处是,条带会随着曝光增大而减弱,而画面内容和位置还能尽量保持一致。论文最终构建了 250 个训练场景和 40 个测试场景,覆盖了不同屏幕类型、内容类型和拍摄条件。
这一步很重要,因为多帧方法最怕的不是模型不够大,而是数据对不齐、退化不一致、真值不靠谱。Bricker 的意义就在于把这三个坑尽量填平了。

频率先行:揭秘FABP如何精准定位闪烁带

图5:BRACE方法总览,包含整体架构、频率分析与SFC指标。
BRACE 的第一层本事,不是直接“擦条纹”,而是先读懂条纹。论文提出了Frequency-Aware Banding Prior,FABP,中文可以理解为“频率感知条带先验”。这里的先验不是玄学,而是先从频域里找条带的主方向、主频率和能量分布,让模型知道条带大概长什么样。
具体做法也不复杂。论文先把每帧 Bayer RAW 的四通道平均成灰度图,再减均值、乘 Hann 窗抑制频谱泄漏,然后做二维傅里叶变换,找出有效频带中的最大峰值。这个峰值对应的就是条带的主频率和方向。换句话说,条带如果在空间域里像“看得见的麻烦”,那在频域里就会变成“更容易抓的尖峰”。
论文这里还顺手提出了一个评估指标:Stripe Frequency Consistency,SFC,即条带频率一致性。它的英文全称是 Stripe Frequency Consistency,中文就是“条带频率一致性”。这个指标不是看图像是否“看起来顺眼”,而是看预测结果和真值在条带方向上的频谱能量分布是否一致,尤其适合衡量条带有没有被真正压下去,而不是被模型糊掉了。
SFC 的设计挺有意思。它不是简单看频谱总能量,而是先用最短曝光帧提取条带主方向,再在该方向附近统计能量比例和径向分布;如果条带本来就很弱,SFC 还会自动降低惩罚,避免把“本来就没条带”的结果误判为坏结果。这个指标的思路很务实:别让评价指标跟着视觉错觉一起跑偏。

交叉融合的艺术:MSCAM如何实现跨曝光空间融合?

有了条带先验,下一步就是把多帧信息用起来。BRACE 的第二个关键模块是Multi-scale Spatial Cross-Attention Modulator,MSCAM,中文可理解为“多尺度空间交叉注意力调制器”。名字很长,作用其实很明确:在不同曝光帧之间,挑出最值得借的信息,再按条带先验去调制特征。
它的做法不是直接堆一个大注意力,而是更省算力地走“先对齐,再筛选,再调制”的路线。论文先结合光流和可变形卷积对齐各帧特征,然后在三个尺度上做平均池化,得到粗细不同的 token。接着把这些 token 和全局条带先验融合,再让参考帧作为 query、其他帧作为 key 和 value 做交叉注意力。这样一来,模型就能知道哪一帧在当前区域更可靠,哪一帧更适合补细节。
最后,MSCAM 不直接输出一坨新特征,而是生成类似 FiLM 的调制参数,对通道进行缩放和平移。这样做的好处是,模型可以在不引入过重密集注意力的情况下,实现跨曝光的选择性融合。说得更直白一点:不是把五帧全揉成一团,而是让模型学会“谁该多说话,谁该少添乱”。
图6:真实数据集上的视觉对比,BRACE 相比其他方法更干净。
整体模型还保留了多帧恢复里常见的 recurrent 结构,并借鉴了 TRMNet 的时间聚合模块。训练上则分两阶段:先用合成数据预训练,让模型先学会“条带长什么样”;再用真实数据微调,补上真实拍摄里的色偏、反光、镜头畸变和轻微失配。这个路线很像先在模拟器里练车,再上真实道路,稳一点。

全面领先的实验:BRACE在合成与真实场景下的卓越表现

实验部分的结论很干脆:BRACE 在合成集和真实集上都拿到了最好的结果,而且不是只在某一个指标上偷跑,而是 PSNR、SSIM、LPIPS、DISTS、MS-SWD 和 SFC 基本都一起领先。这说明它不只是“看起来更干净”,而是真的把条带压下去了,同时还保住了颜色和纹理。
表1:Bricker合成与真实数据集上的定量比较。
表 1 里最扎眼的地方,是 BRACE 在真实集上把 PSNR 提到了 28.15,SSIM 提到 0.8007,同时 LPIPS、DISTS、MS-SWD 和 SFC 也都压到了最优。相比之下,一些方法要么条带残留明显,要么颜色修复不稳,还有的方法在这个任务上直接“水土不服”,说明 FB 去除不是换个恢复网络就能顺手解决的。
表3:Bricker真实测试集上的SFC分解结果。
更有意思的是 SFC 的分解结果。这个指标能更细地看出,BRACE 不只是把条带“弄淡”,而是把条带方向上的能量结构也尽量恢复到了合理状态。对于这类任务,传统像素指标有时会被“糊平了但也糊坏了”骗过去,而频域指标能补上这个漏洞。
图6:真实数据集上的视觉对比,BRACE 相比其他方法更干净。
从视觉结果看,BRACE 对强条带、色偏和细纹理的处理更均衡。别的方法常见问题是:条带还在,或者条带没了但颜色飘了,或者细文字被抹得像刚从洗衣机里捞出来。BRACE 的优势在于它知道该借哪一帧的信息,因此在保细节和去伪影之间没有那么容易翻车。
表2:不同组件的消融实验。
消融实验也很诚实。去掉 MSCAM、去掉波形频率损失、去掉颜色损失,结果都会掉。尤其是 MSCAM 的加入,对 DISTS 和 SFC 的改善很明显,说明把条带先验真正注入跨帧融合,确实能减少残余条纹。合成预训练单独拿出来也能在真实集上工作,说明仿真管线不是纸上谈兵,而是确实学到了接近真实的退化规律。
图7:消融设置的视觉对比。
如果只看图 7,会更直观:少了关键模块后,条带残影、颜色偏移和纹理缺失都会更明显。BRACE 的完整版本并不是“多堆几层网络”的胜利,而是数据、频域先验和跨曝光融合三者配合后的结果。

总结与展望:方法、局限与未来方向

这篇工作最有价值的地方,不是单纯把一个任务做高分,而是把“拍屏去条带”这件事从经验问题拉回到了物理成像和多帧建模的框架里。Bricker 解决了数据缺口,FABP 提供了可解释的频域抓手,MSCAM 让跨曝光信息融合有了更明确的方向,SFC 则补上了评价体系里常被忽略的一块。
不过,这类方法也有边界。首先,多帧包围曝光意味着采集成本更高,真实场景下对齐和稳定性仍然是门槛;其次,模型依赖相对规范的多曝光序列,如果输入只有单帧,或者拍摄对象本身在多帧间变化很大,效果就未必还能这么稳;最后,SFC 虽然比纯像素指标更懂条带,但它仍然主要服务于“频率一致性”这个维度,不能替代全部视觉质量判断。
未来如果继续往前走,大概率有两条路值得试:一条是把这种物理驱动的多帧 RAW 思路扩展到更多屏幕拍摄问题,比如摩尔纹、色偏和刷新条纹混合退化;另一条是进一步降低对严格包围曝光采集的依赖,让模型在更少帧、更弱对齐甚至部分缺帧条件下也能工作。要是这两点都能兼顾,拍屏修复才算真正从实验室走向日常产品。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?解决的是拍屏幕时常见的频闪条带去除问题。它不是只做单张图修复,而是用多帧包围曝光 RAW,把不同曝光下条带变化、内容稳定的特点利用起来,从而更容易把条带和真实纹理分开。

FABP 和 SFC 分别是什么意思?FABP 是 Frequency-Aware Banding Prior,中文是“频率感知条带先验”,作用是从频域里定位条带主方向、主频率和能量分布;SFC 是 Stripe Frequency Consistency,中文是“条带频率一致性”,用来衡量恢复结果在频域上是否真的把条带结构压下去了。

为什么一定要用多帧 RAW,而不是单帧 RGB?因为条带和曝光、刷新机制强相关,单帧里信息太少,模型很容易把条带当纹理。RAW 保留了更完整的传感器信息,多帧包围曝光则提供了互补观察,能让条带在不同帧里“露出破绽”,这比单帧硬猜靠谱得多。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把屏幕拍摄的条带去除从单帧改成多帧包围曝光 RAW,再配上物理仿真数据集和频域先验,这个组合不算“天外飞仙”,但确实抓住了任务本质。

实验合理度:★★★★☆

对比方法、合成/真实双基准、消融和频域指标都比较完整,尤其 SFC 很贴任务;不足是部分结论仍依赖自建数据,跨数据集泛化还需要更多验证。

学术研究价值:★★★★☆

Bricker 和 SFC 都有研究延展性,能给后续屏幕拍摄、频域恢复、多帧 RAW 任务提供直接参考,属于能继续长出论文的那种工作。

稳定性:★★★☆☆

多帧 RAW 和对齐流程本身就增加了系统复杂度,真实产品里对拍摄稳定性、对齐误差和采集流程都有要求,离“随手拍就稳”还有距离。

适应性以及泛化能力:★★★☆☆

对屏幕拍摄条带这类场景很合适,但对单帧输入、剧烈运动、复杂背景干扰等情况,适应性会明显下降。

硬件需求及成本:★★★☆☆

训练在 A6000 上完成,推理还要多帧输入和对齐模块,算力不算夸张,但采集成本和部署门槛比单帧方法高。

复现难度:★★★☆☆

代码已开源是加分项,但多曝光 RAW 采集、设备参数控制和对齐流程都不算轻松,光有代码不等于一把梭就能复现。

产品化成熟度:★★★☆☆

在需要高质量拍屏修复的场景有落地潜力,但更适合专业采集流程或半自动工作流,不是那种立刻能塞进所有手机相册里的通用功能。

可能的问题:方法依赖多帧 RAW 与对齐,工程链路偏长;真实泛化仍受设备、屏幕和拍摄姿态影响,离“随手拍都稳”还有一段路。


主要参考文献

[1] Zihan Zhou, Libo Zhu, Jue Gong, Zhiyi Zhou, Jiezhang Cao, Yong Guo, Yulun Zhang. Bricker to BRACE: A Bracket Exposure RAW Dataset and Restoration Model for Flicker-Banding. arXiv, 2026.
[2] BRACE 项目主页与代码:https://github.com/ZZH-qwq/BRACE
[3] 原论文链接:https://arxiv.org/pdf/2606.31997v1.pdf

屏幕一拍就出彩条、锯齿、色偏?BRACE这类工作专治“拍屏翻车”。想继续追这类能落地、能复现、还能看懂的AI论文,欢迎加入龙哥读论文粉丝群,一起把前沿方法拆明白。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。