← 返回 PaperDaily 视觉与图像

直接CfL会翻车?空间对齐后RAW压缩更省码率

这篇工作不玩花活,专盯RAW无损压缩里最容易被忽略的“对齐”问题。看似只是把亮度样本挪一挪,实际却能让CfL预测更稳,JPEG XS里也更能省码率。

直接CfL会翻车?空间对齐后RAW压缩更省码率
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
这篇工作不玩花活,专盯RAW无损压缩里最容易被忽略的“对齐”问题。看似只是把亮度样本挪一挪,实际却能让CfL预测更稳,JPEG XS里也更能省码率。


原论文信息如下:
论文标题:
Spatially-Aligned Chroma from Luma Prediction for Lossless JPEG XS Raw Image Compression
发表日期:
2026年07月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2607.12636v1.pdf

原始图像压缩的挑战与现有方法的局限

RAW 压缩这件事,表面上像“把文件变小”,本质上却是在和传感器采样方式、颜色相关性、噪声分布三件事同时掰手腕。普通 RGB 图像已经经过黑电平校正、白平衡、去马赛克、伽马等一串处理,信息被“整理”过了;而 RAW 图像还保留着相机最原始的 CFA(Color Filter Array,彩色滤光阵列)采样状态,每个像素位置只记录红、绿、蓝中的一个分量。也就是说,压缩对象不是一张规规矩矩的彩色图,而是一张“半成品原料图”。
这就带来一个老问题:传统图像压缩里常见的“颜色变换+预测”套路,在 RAW 域里不一定好使。因为 RAW 并不是完整 RGB,颜色样本在空间上是交错采样的,绿色还占了更高比例,红蓝则稀疏分布。再加上传感器噪声往往带有位置相关和强度相关特征,简单照搬全彩图像里的 Chroma from Luma(CfL,Chroma from Luma,从亮度预测色度)预测,常常会出现一个很尴尬的现象:有些图像压缩效果更好,有些反而更差,像在开盲盒。
论文先从 JPEG XS 里的核心变换 Star-Tetrix Transform,STT,星形-四面体变换 说起。STT 本身就是为 Bayer RAW 设计的可逆多分量变换,目标很明确:把原本纠缠在一起的空间冗余和光谱冗余拆开,让后续熵编码更省码率。它已经挺能打了,但作者盯上的不是“能不能用”,而是“还能不能再省一点”。于是,思路就落到了 CfL 上:既然色度和亮度之间本来就有相关性,为什么不让亮度来帮色度“打工”呢?问题不在于这个想法本身,而在于 RAW 域里,亮度和色度样本没对齐,这就像拿隔壁桌同事的笔记去做题,方向不一定错,但抄得很容易歪。
图1:Kodak 数据集 Parrot 图像中的 Bayer 图案示意,左侧为 RGB 全彩图像,右侧为模拟 RAW 图像及对应结构图。
图1:Kodak 数据集 Parrot 图像中的 Bayer 图案示意,左侧为 RGB 全彩图像,右侧为模拟 RAW 图像及对应结构图。这个图的意义很直白:RAW 不是“少一点颜色”的 RGB,而是“颜色本来就按棋盘格分布”的传感器原始数据。后面所有预测、变换、对齐讨论,都是围绕这个采样结构展开的。

空间对齐的CfL预测:从亮度到色度的精准映射

先说人话:这篇论文做的不是“更复杂的模型”,而是“把拿来预测的亮度样本摆到正确位置”。作者提出的 CfL-STT,本质上是在 STT 里嵌入 CfL 预测,让色度分量不再直接从原始亮度生硬回归,而是先找一个与色度采样网格对齐的亮度版本,再做线性预测。
这个“对齐”听起来简单,实际很关键。传统 CfL 默认亮度和色度是共址的,但在 Bayer RAW 里,STT 之后的 U、V 分量并不和 Y 完全落在同一个采样点上。如果直接拿最近的 Y 去预测 U、V,相当于强行把不同位置的样本拉来做回归,边缘、纹理和噪声都会把预测带偏。作者的做法是:对亮度做横向或纵向线性插值,构造出与色度网格对应的 空间对齐亮度,再做线性拟合。
图2:STT 的实现流程,箭头表示 lifting 过程中的各个步骤。
图2:STT 的实现流程,箭头表示 lifting 过程中的各个步骤。这里可以把 STT 理解成一套“先拆再压”的整数可逆变换:先用绿色近似红蓝,得到初步色度;再更新亮度和差分分量,最后形成 Y、Δ、U、V 四个相对更独立的通道。它的强项是可逆、轻量、适合 JPEG XS 这种低时延标准。
图3:CfL-STT 的实现流程,箭头表示空间对齐的 CfL 操作。
图3:CfL-STT 的实现流程,箭头表示空间对齐的 CfL 操作。和图2相比,这里多出来的不是“大块头网络”,而是一个很朴素的插值与线性回归模块。作者强调,这一步不是为了追求最优插值,而是为了在几乎不增加复杂度的前提下,把预测位置摆正。
如果把公式翻译成工程语言,流程大概是这样:
    1. 先用 STT 把 CFA RAW 变成 Y、Δ、U、V;
    2. 对 U、V 对应位置构造空间对齐的亮度 YC;
    3. 用 YC 作为自变量,对 U 或 V 做线性回归;
    4. 得到残差 D⋆U、D⋆V,替代原始色度进行编码;
    5. 解码端用同样的参数与对齐方式,严格还原原始 RAW。
    这里的关键变量也得说清楚。YC 是与色度网格对齐后的亮度;αβ 是线性回归参数;D⋆U、D⋆V 是预测残差。由于整个过程仍然建立在整数 lifting 和可逆线性预测上,所以它没有破坏无损压缩最在意的那条底线:解码后必须一模一样
    更有意思的是,这个对齐还有一个“副作用”,而且是好副作用:线性插值本身带一点低通效果,会顺手压掉一些高频传感器噪声。也就是说,它不是单纯把样本搬家,还顺带做了轻微去噪。对 RAW 来说,这种“预测前先把噪声捋顺一点”的思路,往往比空谈复杂模型更实在。

    无损压缩效率显著提升:实验验证与对比分析

    实验部分的设计比较朴素,但也正因为朴素,结果更有说服力。作者把方法集成进 JPEG XS 参考软件,在无损 RAW 压缩场景下,与基线 STT 以及一个“直接用 CfL、不做空间对齐”的版本做对比。测试集包含 MIT-Adobe FiveK 的 DNG 图像和 iPhone SE3 采集的 DNG 图像,位深为 12 或 14 bit。评价指标就是最直白的码率,单位是 bpp(bits per pixel,每像素比特数)。
    先看视觉层面的结果。作者用伪彩色图展示了 STT、直接 CfL-STT、对齐 CfL-STT 三种方法下的残差分布。残差越接近蓝色,说明数值越接近零,越容易压缩。结果很明确:直接 CfL 版本在某些图像上残差反而更散,说明“没对齐就硬上”确实会翻车;而空间对齐版本的残差更集中,色度和亮度之间的冗余被压得更干净。
    图4:图像 m0005 的去相关分量伪彩色可视化,从上到下分别为 (U, V)、(DU, DV) 和 (D⋆U, D⋆V)。
    图4:图像 m0005 的去相关分量伪彩色可视化,从上到下分别为 (U, V)、(DU, DV) 和 (D⋆U, D⋆V)。这张图的直观含义很强:直接 CfL 的残差并不稳定,而空间对齐后的残差更“安静”,也就是熵更低、压缩更省码率。对于无损编码来说,这种“安静”很值钱。
    再看表格结果。作者给出两组数据集上的逐图码率对比,基线 STT 的平均码率分别为 7.00 和 7.29 bpp;直接 CfL-STT 分别是 7.01 和 7.32 bpp,基本没占到便宜,甚至还略有退步;而对齐版 CfL-STT 则降到 6.94 和 7.16 bpp。别看绝对值只降了 0.06 和 0.13 bpp,在无损 RAW 压缩里,这已经是稳定且一致的收益,而不是一两张图碰巧赢了。
    表1:无损压缩比特率结果,粗体表示最佳结果,蓝色/红色表示相对 STT 的提升/退化。
    表1:无损压缩比特率结果,粗体表示最佳结果,蓝色/红色表示相对 STT 的提升/退化。这里最值得注意的不是“某几张图赢了多少”,而是对齐版在全部测试图像上都没有翻车。对于压缩算法而言,稳定性往往比偶发的峰值更重要,因为工程里最怕的就是“有时神,有时鬼”。
    作者还补了一步更接近实际部署的模拟:按 16 个 component lines 估计一次回归参数,相当于 32 条输入 RAW 行。即便把这部分侧信息算进去,平均码率仍然保持优势。说明这个方法并不依赖“整帧统计”这种偏理想化设定,局部估计也能保住收益。对工程实现来说,这一点很关键,因为真正在线编码时,谁都不想为了一点码率省吃俭用,最后把缓存和时延一起吃爆。

    轻量级方法、实用性与未来展望

    这篇工作的优点,恰恰在于它没有走“把问题交给大模型”的路子,而是老老实实把几何关系和采样关系理顺了。方法主体只有三层:STT 负责基础去相关,空间插值负责对齐,线性回归负责预测残差。没有庞大的训练流程,没有额外的学习参数,没有复杂的推理图。对 JPEG XS 这种强调低时延、可逆、轻量的标准来说,这种设计方向非常对路。
    但这类方法也有边界。第一,它依赖 Bayer RAW 这类规则 CFA 结构,换成更复杂的传感器排列,空间对齐策略就得重做。第二,它的收益来自“预测更准”,不是来自“表达能力更强”,所以在噪声特别重、纹理特别复杂的场景下,提升幅度不会无限放大。第三,论文目前主要验证的是无损压缩,若要扩展到有损场景,还得进一步考虑量化、率控和视觉失真之间的平衡。
    不过,正是因为它足够轻,才有实用价值。很多压缩论文的问题不是想法不酷,而是实现太贵:训练成本高、推理链长、部署门槛大,最后只能停留在 demo。CfL-STT 反过来,像是给 RAW 压缩加了一个“更聪明但不更重”的小外挂。它告诉人们:有时候最有效的优化,不是多加一层网络,而是把“样本该站哪儿”这件事先想明白。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:

    这篇论文到底解决了什么问题?它解决的是 RAW 无损压缩里“直接套用 CfL 容易失配”的问题。核心不是发明新编码器,而是让亮度样本先和色度采样位置对齐,再做预测,所以更稳、更省码率。

    STT、CfL、Y∆DuDv 这些词分别是什么意思?STT 是 Star-Tetrix Transform,JPEG XS 里用于 Bayer RAW 的可逆多分量变换;CfL 是 Chroma from Luma,意思是“用亮度预测色度”;Y∆DuDv 则是经过 STT 和 CfL-STT 后得到的表示,Y 是亮度,Δ 是空间差分,Du/Dv 是色度残差。

    为什么只是“插值对齐”就能带来提升?因为 RAW 域里最怕的不是模型简单,而是样本位置不对。对齐后的亮度和色度更接近同一空间位置,线性回归更容易把真正的跨通道相关性学出来,同时插值还会轻微抑制高频噪声,所以残差更集中,压缩更省。

    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★☆☆

    创新点不在“发明了新理论”,而在于把 CfL 精准地搬进 RAW/STT 场景,并且把“空间对齐”这件事做实了。思路不花哨,但抓住了问题的根。

    实验合理度:★★★★☆

    对比了基线 STT、直接 CfL 和对齐 CfL,测试集也覆盖了不同来源的 DNG 图像,能说明“对齐”确实是关键变量。若后续补更广泛传感器与更复杂场景,会更完整。

    学术研究价值:★★★☆☆

    对 RAW 压缩和可逆颜色变换研究有直接启发,尤其说明了采样对齐在跨通道预测中的重要性。理论上不算大开大合,但属于能被后续工作继续接力的类型。

    稳定性:★★★★☆

    对齐版在测试图像上表现一致,没有明显“某些图像翻车”的问题。因为方法本身是确定性的插值+线性回归,稳定性比很多学习式压缩方案更靠谱。

    适应性以及泛化能力:★★★☆☆

    对 Bayer RAW 和 JPEG XS 场景很合适,但对其他 CFA 结构、不同相机管线的迁移还需验证。属于“在明确场景里很能打”,不是“放哪都行”。

    硬件需求及成本:★★★★★

    额外开销主要是插值、线性预测和少量统计量,几乎没有重推理成本。对低时延编码标准来说,这种成本非常友好。

    复现难度:★★★★☆

    参考软件和流程都比较清楚,复现门槛不高。真正需要注意的是与 JPEG XS 参考实现的接口细节,以及可逆性约束下的参数传递。

    产品化成熟度:★★★☆☆

    在 RAW 无损压缩、低时延编码链路里有较强落地潜力,但要进入完整产品,还得补齐不同传感器、不同码控策略和更细粒度局部估计的验证。

    可能的问题:提升幅度不算大,且主要验证在 Bayer RAW 与 JPEG XS 框架内;对其他采样模式和有损场景的外推还不充分。


    主要参考文献

    [4] A. Descampe, T. Richter, T. Ebrahimi, S. FOBel, J Keinert, T. Bruylants, P. Pellegrin, C. Buysschaert, and G. Rouvroy, “JPEG XS–A new standard for visually lossless low-latency lightweight image coding,” Proc. IEEE, vol. 109, no. 9, pp. 1559–1577, May 2021.
    [10] T. Richter, S. FoBel, A. Descampe, and G. Rouvroy, “Bayer pattern compression with JPEG XS,” IEEE Trans. Image Process., vol. 30, pp. 6557–6569, Jul. 2021.
    [15] L. Trudeau, N. Egge, and D. Barr, “Predicting chroma from luma in AV1,” in Proc. DCC, Snowbird, UT, USA, Mar. 2018, pp. 374–382.
    [20] Joint Photographic Experts Group (JPEG), “JPEG XS Reference Software,” https://jpeg.org/jpegxs/software.html, Accessed: Apr. 1, 2026.

    end
    欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。RAW、压缩、图像恢复、视频编码方向的小伙伴尤其适合来,群里一起聊工程细节,不聊空话。
    wechat_helperdianzan
    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。