← 返回 PaperDaily 视觉与图像

ICASSP 2026新作:场景驱动Hadamard排序,30%采样也能稳拿高质量光谱图

单像素光谱成像最怕“拍得慢还拍不准”。这篇论文的思路很直接:先拍一点点,再让模型决定后面该拍哪些 Hadamard 模式,结果在仿真和近红外实拍里都比固定排序更稳。

ICASSP 2026新作:场景驱动Hadamard排序,30%采样也能稳拿高质量光谱图
原论文信息如下:
论文标题:
Deep Scene-Driven Ordering of Hadamard Basis for Single-Pixel Spectral Imaging
发表日期: 2026年07月
发表单位:
原文链接: https://arxiv.org/pdf/2607.15045v1.pdf
开源代码链接: GitHub(论文中明确提到 Pytorch implementation is available on GitHub)
项目链接:
开源数据集链接:

告别“一刀切”:场景感知的哈达玛排序新范式

单像素光谱成像最尴尬的地方,不是“拍不到”,而是“拍得太慢,还拍得不够准”。传统 Hadamard 排序的思路很朴素:把一套固定顺序的调制图案从头拍到尾,大家都按同一份菜单吃饭。问题也很直接——不同场景的光谱能量分布根本不一样,卫星地物和近红外实拍的“脾气”更是两码事,固定排序很容易把采样预算浪费在不太关键的系数上。这种“一刀切”的采样策略,在压缩感知理论框架下尤其显得笨拙:既然我们相信自然图像在某个变换域是稀疏的,那为什么还要用一套对所有场景都一成不变的顺序去采集呢?
这篇论文干的事,说白了就是把“拍哪些 Hadamard 模式”这件事,从拍摄前就写死的规则,改成了先看场景,再决定后面拍什么。它没有抛弃 Hadamard 基,也没有搞一套花里胡哨的自由调制矩阵,而是保留了 DMD 友好的二值 Hadamard 模式,只把采样顺序交给神经网络去动态判断。这个思路很务实:硬件不折腾,聪明劲儿放在“选谁先上场”上。本质上,这是将“采样策略”从静态先验升级为动态后验,让每一次测量都更有目的性。
封面
图:论文整体思路示意。核心不是“换掉 Hadamard”,而是“让 Hadamard 的顺序跟着场景走”。这种“场景感知”的理念,让采样过程从被动记录变成了主动探索。

两阶段采样:先用固定模板探路,再用AI精确定位

论文把采样流程拆成了两步。第一步是预设采样,先按照一个稳定、可复现的 Hadamard 排序策略采一小段测量值;第二步是场景驱动采样,把这部分初始测量喂给神经网络,让模型预测后续最值得采的系数位置。这个流程很像先派侦察兵摸底,再派主力部队精准补刀,避免一上来就把弹药乱撒。这种“粗采+精采”的级联架构,在计算成像领域并不罕见,但将其巧妙地与 Hadamard 基的排序问题结合,是本文的一个亮点。
图4:场景驱动 Hadamard 单像素成像的两阶段采样协议
图4:场景驱动 Hadamard 单像素成像。(a)参考支持掩码 ms 的构造方式:从 Hadamard 谱中选出最重要的 ka 个系数,作为监督信号。(b)先用预设掩码 mp 采一段初始测量 Yp,再由模型预测场景驱动掩码 ma。这个两阶段流程清晰地划分了“探索”与“利用”的边界。
这里有个关键点:论文里说的“ordering”,不是把所有 Hadamard 模式重新发明一遍,而是在固定预算下决定哪些系数优先被测到。也就是说,模型输出的是一个二值支持掩码,告诉系统下一批该选哪些行。由于第二阶段选中的系数是在同一批次里一起采的,内部先后顺序本身并不重要,重要的是“谁进名单,谁出局”。这就把问题从复杂的连续光学设计,降维成了更适合落地的离散选择问题。这种“选子集”而非“排顺序”的思路,极大地简化了问题的复杂度,使得神经网络可以专注于学习一个二分类任务。
为了让读者不被符号绕晕,先把几个基础概念说人话。Hadamard 矩阵是一类元素只取 ±1 的正交矩阵,优点是实现简单、恢复快、适合 DMD 这种二值光学器件。单像素成像(SPI,Single-Pixel Imaging)则是用一组空间调制图案去和整幅图像做内积,最后靠测量值重建图像。光谱成像比普通成像更狠一点,它不是只拍亮度,而是要在多个波段上都保留信息,所以对采样效率更敏感。在光谱 SPI 中,每个测量值都包含了所有波段的信息,如何高效地分离和重建这些信息,是核心挑战。
公式:完整 Hadamard 单像素测量模型
公式含义很直白:Y = HX + Z。Y 是测量值,H 是 Hadamard 基,X 是待成像的光谱图像,Z 是噪声。它描述的是“拿图案去照场景,再把结果记下来”的基本物理过程。这个模型是后续所有推导的基础,它简洁地概括了从场景到测量值的线性变换。
公式:Hadamard 子采样测量模型
当只保留部分 Hadamard 行时,测量模型变成 Y = M H X。这里 M 是二值选择矩阵,哪个系数被采到,就在对应位置记为 1。所谓压缩采样,本质上就是少拍一些,但尽量别拍错。M 矩阵的设计,就是整个采样策略的核心,而本文正是通过学习一个数据驱动的 M 来替代人工设计的固定 M。
公式:Hadamard 反投影重建
当 Hadamard 基是正交的,最简单的粗重建可以直接用转置做反投影:X̂ = 1/n H⊤Y。它快,但不够聪明,所以后面通常还要接正则化或 Plug-and-Play 重建器来补细节。这个简单的反投影为后续更复杂的重建算法提供了一个快速且稳定的初始化。

核心解密:如何用少量测量值“猜”出最优采集模式?

这部分是论文真正的“脑子活”所在。它不是直接预测图像,而是把问题改造成了一个二分类/多标签选择问题:给定第一阶段的初始测量,模型要判断剩下的 Hadamard 系数里,哪些最值得采。这样做有两个好处。第一,输出形式天然适合“选或不选”的采样决策;第二,训练目标简单,不需要让网络同时学成像、去噪、选模三件事。这种任务分解的策略,使得每个子任务都更容易被优化,也提高了模型的稳定性和可解释性。
图1和图2:Hadamard 图案生成与排序策略对比
图1和图2:Hadamard 图案从矩阵行到 DMD 模式的生成方式,以及几种经典排序策略的差异。传统方法本质上都是“先验排序”,而这篇论文想做的是“根据当前场景再排一次”。从图中可以直观地看到,不同排序策略对应的空间频率分布差异巨大,这直接影响了它们对不同纹理场景的适应性。
训练时,论文先用完整 Hadamard 分解得到每个样本的系数,再按幅值排序,把最重要的 ka 个系数当作“参考支持” ms。这相当于告诉模型:在理想情况下,哪些位置更该被选中。随后,网络根据第一阶段的测量 Yp 去预测 ma,并用二元交叉熵(BCE,Binary Cross-Entropy,二元交叉熵损失)去逼近参考支持。这个“参考支持”的生成过程,本质上是利用“上帝视角”(完整数据)来为“有限视角”(部分测量)的训练提供监督信号。
公式:预设阶段测量
先验阶段的测量写成 Yp = Mp H X。Mp 是第一阶段固定选中的 Hadamard 行,作用是先拿到一小撮“探路信息”。这个 Mp 的选择本身也是一个超参数,论文中通过实验探讨了其最优设计。
公式:模型预测场景驱动掩码
随后由模型 Pθ(Yp) 预测场景驱动掩码 ma。这里 θ 是网络参数,输出的是每个候选系数的得分,再经过阈值化和筛选,得到最终要采的模式。这个预测过程是实时的,意味着在每次成像时,模型都需要根据当前的初始测量进行一次前向推理。
公式:第二阶段场景驱动测量
第二阶段的测量写成 Ya = Ma H X。Ma 由模型预测而来,和第一阶段互补,二者合起来才构成最终的采样集合。这种互补性保证了最终用于重建的测量值集合是完整且高效的。
这里的设计其实挺克制:网络不是直接生成自由形式的光学掩码,而是在 Hadamard 基上做“重新排序”。这就像在既定车道里重新安排车流,而不是把路全拆了重修。工程上更稳,硬件上也更容易兼容。这种“在约束下优化”的思路,是许多成功工程应用的共同特点,它确保了创新点能够顺利地从仿真走向现实。
公式:BCE 训练目标
训练目标就是 BCE[ms, Pθ(Yp)]。说白了,模型要学会把“该采的系数”打高分,把“别采的系数”压下去。这个损失函数虽然简单,但非常有效,它直接驱动模型去学习 Hadamard 系数的重要性排序。

实战检验:从卫星图到近红外实拍,性能全面超越

论文的实验不是只在一个数据集上自嗨,而是做了仿真数据集 + 真实近红外测试平台的双重验证。仿真部分用 EuroSAT 和 ARAD,真实部分则在近红外单像素平台上跑。这个组合很重要,因为很多“论文里很美”的方法,一到真实硬件就开始掉链子;而这篇工作至少把“能不能落地”这件事认真测了一遍。EuroSAT 数据集包含了大量不同地物类型的卫星图像,而 ARAD 则提供了更精细的高光谱数据,两者结合能全面检验方法的泛化能力。
图3:Hadamard 单像素成像的基本光路
图3:Hadamard 单像素成像的基本流程。场景先被空间调制,再通过光学系统进入探测端,最终把光谱信息记录下来。这个光路图清晰地展示了从空间光调制器(DMD)到单点探测器(或光谱仪)的信号流动路径。
表1:不同重建算法下的场景驱动排序结果
表1:在不同重建算法下,场景驱动排序都能保持较稳定的优势。这里比较的是反投影、Wavelet 稀疏、Median Filter、Total Variation 和 Consensus Equilibrium 等重建器,说明方法不是只对某一种后端“偏心”,而是具有一定重建器无关性。这种鲁棒性对于实际应用至关重要,因为用户可以根据自己的需求选择最合适的重建算法。
从表1能看出一个很现实的结论:采样顺序本身就能显著影响重建上限。同样是 10%、20%、30% 的采样预算,换了排序,PSNR、SSIM 和 SAM 都会跟着变。尤其在低采样率下,好的排序相当于把有限测量优先花在“最值钱”的系数上,重建器才不至于拿着一堆噪声瞎忙活。例如,在10%采样率下,场景驱动排序相比最差的固定排序,PSNR 提升可达 2-3 dB,这在图像质量上是肉眼可见的差距。
表2:EUROSAT 数据集上的对比结果
表2:EUROSAT 上的对比结果。这里和 Sequency、Zig-Zag、XY、Cake-Cutting 等固定排序做比较,论文方法在多个采样率下都取得更好的综合指标,说明它不是靠某一个偶然场景“碰巧赢了”。值得注意的是,Cake-Cutting 排序在某些采样率下表现也不错,但场景驱动方法在所有情况下都优于或持平于它,展现了更稳定的性能。
表4:EUROSAT 上与固定排序方法的定量比较
表4:EUROSAT 上的定量比较。固定排序方法的共同问题是“先验太死”,而场景驱动排序会根据当前样本的 Hadamard 能量分布动态调整,因而在 PSNR 和 SSIM 上更占优,SAM 也更低。SAM(光谱角映射器)是衡量光谱保真度的关键指标,其数值越低,说明重建的光谱曲线与真实值越接近。
表3:ARAD 数据集上的对比结果
表3:ARAD 上的对比结果。ARAD 更能体现高光谱数据的细粒度差异,论文方法依然保持领先,说明它不是只对某一种数据分布有效。在 ARAD 这种包含更多波段和更丰富光谱信息的数据集上,场景驱动排序的优势更加明显,因为它能更精准地捕捉到不同波段间的能量分布差异。
更值得注意的是真实近红外实验。论文把在 EuroSAT 上训练好的选择器,直接拿去近红外测试平台上用,没有再做微调,结果依然能稳定超过固定排序。这一点很关键:如果一个方法只能在训练数据的舒适区里工作,那叫“会做题”;能跨到真实硬件上继续发挥,才算有点工程味道。这种“零样本”的跨域迁移能力,证明了模型学到的是关于“如何高效采样”的通用知识,而非仅仅是训练集上的统计模式。
图7:近红外单像素测试平台光学装置
图7:真实近红外单像素平台。包括红外光源、适配近红外的 DMD、NIRQuest 光谱仪以及相关光学元件。这个实验说明方法不只是仿真里好看,而是能在真设备上跑起来。该平台的搭建本身就具有挑战性,因为近红外波段的光学元件和探测器与可见光波段有显著不同。
图8:真实近红外重建效果。论文方法在锐度、伪影控制和光谱一致性上都更稳,尤其在高采样率下,PSNR 和 SSIM 的提升比较扎实,不是那种“只涨一点点但看不出来”的安慰奖。从重建图像上可以明显看出,场景驱动方法恢复的纹理更清晰,边缘更锐利,而固定排序方法则容易出现模糊和振铃效应。
图6:与固定 Hadamard 排序方法的可视化对比
图6:和 Sequency、Zig-Zag、XY、Cake-Cutting 的可视化对比。最直观的感受就是:固定排序容易让细节发虚,而场景驱动排序的图像边缘更干净、结构更完整。这种视觉上的优势,在诸如目标识别、地物分类等下游任务中,可能会转化为更高的准确率。
论文还专门分析了训练成本函数和预设采样比例的影响。这个实验的价值在于,它不是只报一个最好结果,而是去看“先拍多少,再让模型接管”这个比例怎么配更合理。说白了,第一阶段太少,模型拿到的信息不够;第一阶段太多,第二阶段就没多少发挥空间,整个系统又退回“固定采样”那套老路。实验结果表明,存在一个最优的预设比例区间,在这个区间内,场景驱动方法的性能达到峰值。
图10:不同总采样率与预设比例下的性能变化
图10:不同总采样率 δ 和预设比例下的性能变化。它揭示了一个很工程化的问题:不是“越早交给模型越好”,也不是“固定采样越多越稳越好”,而是要找到一个合理的折中点。例如,当总采样率为20%时,预设比例在5%-10%之间效果最好,过多或过少都会导致性能下降。
图9:不同训练目标下的性能对比
图9:不同训练目标下的性能对比。论文用这个图说明,训练策略并不是装饰品,损失函数选得不合适,采样器就会学歪。例如,直接使用 L2 损失来训练,效果远不如使用 BCE 损失,这验证了将问题建模为二分类选择的合理性。

与固定排序有何不同?一张图看懂效果碾压

固定排序方法的问题,不是它们“完全没用”,而是它们默认所有场景都长一个样。Sequency、Zig-Zag、XY、Cake-Cutting 这些方法,本质上都是先验驱动:先根据一般图像的统计规律排好序,再让所有样本照单全收。可光谱图像的 Hadamard 系数分布会随场景变化,卫星地物、材料反射、近红外目标的能量集中区域都不一样。于是,固定排序就像拿同一把尺子量所有人,偶尔合身,大多数时候都差点意思。例如,对于纹理丰富的场景,高频系数更重要;而对于平滑场景,低频系数则占主导。固定排序无法适应这种变化。
这篇论文真正的差异在于,它先用少量测量值估计当前场景的系数分布,再把采样预算投向更可能携带有效信息的位置。换句话说,固定排序是在“拍之前就决定一切”,而场景驱动方法是在“拍了一点之后再优化剩下的选择”。这中间的差别,往往就体现在更少的伪影、更好的边缘、更低的光谱失真上。这种“反馈式”的采样策略,是自适应成像的核心思想。
公式:Hadamard 系数的分段表示
这个分段公式把系数拆成三类:第一阶段已采的、第二阶段最相关的、以及其余不太相关的。论文的目标就是尽量把第二阶段的预算花在“最相关”那一段上。这个公式清晰地定义了“好”的采样策略应该是什么样的:它应该最大化地覆盖那些能量高、信息量大的系数。
如果把这个方法放到更大的背景里看,它其实是在做一件很朴素但很重要的事:把“先验固定”变成“轻量自适应”。它没有追求端到端地把成像系统全盘重写,而是只改最容易影响效果、也最容易落地的那一环——采样顺序。这样的设计往往比“豪华大模型接管一切”更接近真实设备的演进路线。它代表了一种“小步快跑”的迭代式创新思路,即在现有硬件基础上,通过智能算法实现性能的跃升。

深度剖析:场景驱动感知的优势与未来方向

这篇工作的优点,首先是硬件友好。它保留了 Hadamard 的二值结构,和 DMD 光学实现天然兼容,不需要引入难以落地的连续值调制。其次是重建器无关:采样策略训练好以后,可以接不同的后端重建算法,不必为每个 solver 重新训练一遍。第三是跨数据集和跨硬件都有验证,这比单纯在仿真里涨几个点更有说服力。这些优点共同指向了一个方向:该方法具有很高的实用价值和推广潜力。
但它也不是没有边界。第一,模型本质上仍然依赖训练数据的统计规律,遇到特别离谱的场景分布,预测的系数支持未必稳定。例如,如果测试场景中出现了训练数据中从未有过的奇异光谱特征,模型的预测可能会失效。第二,第一阶段采样比例怎么设,仍然需要经验和实验去调,不是一个参数就能通吃。这增加了实际部署时的调参成本。第三,网络规模虽然不算夸张,但在高采样率、高分辨率或更复杂光谱维度下,训练和部署成本还是会往上走。也就是说,它解决的是“固定排序太死”的问题,不是“所有成像问题从此自动退休”的问题。未来的工作可以探索更鲁棒的训练策略、自适应调整预设比例的方法,以及更轻量级的网络结构。
公式:端到端训练目标
端到端训练目标是最小化期望损失。这里的关键不是把网络训练得多复杂,而是让“采样决策”和“重建质量”在同一个目标下协同优化。这个公式揭示了本文方法的最终目标:不是简单地预测一个掩码,而是通过预测掩码来最小化最终的重建误差。
从方法论上看,这篇论文给光学感知一个挺实在的启发:与其一味追求“更强的重建网络”,不如先问“采样有没有拍对”。很多成像系统的瓶颈并不在后端,而在前端采样是不是把信息抓对了。把采样策略做成可学习、可自适应、又不破坏硬件约束的形式,往往比单纯堆模型更值钱。这个观点对于整个计算成像领域都具有指导意义,它提醒我们,数据采集和数据处理是同等重要的两个环节。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是 Hadamard 单像素光谱成像里“采样顺序固定、不同场景不适配”的问题。方法先采少量固定模式,再根据这些初始测量动态决定后续该采哪些系数,从而提升重建质量。简单说,就是让采样过程“看人下菜碟”,变得更聪明。

文中的 ms、mp、ma 分别是什么意思?mp 是第一阶段预设采样掩码,它决定了“侦察兵”先去哪些位置。ma 是模型预测出的场景驱动采样掩码,它决定了“主力部队”后续该去哪里。ms 是从完整 Hadamard 分解里提取出来的“参考支持”,也就是训练时的监督标签,它是我们期望模型能预测出的理想掩码。

为什么这套方法比固定排序更有用?因为固定排序默认所有图像的 Hadamard 能量分布都差不多,而真实场景并不是这样。场景驱动方法先看当前样本的初始测量,再把采样预算投向更可能承载有效信息的位置,所以在仿真和真实近红外实验里都更稳。它实现了从“被动记录”到“主动感知”的转变。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

不是在 Hadamard 基上“发明新宇宙”,而是把场景驱动思想塞进了最容易落地的采样顺序里,思路新但不浮夸。

实验合理度:★★★★☆

同时做了仿真、跨数据集和真实近红外平台验证,还比较了多种重建器和固定排序,实验链条比较完整。

学术研究价值:★★★★☆

它给“如何让压缩感知更场景化”提供了一个很实用的范式,尤其适合光学成像和计算成像方向继续延伸。

稳定性:★★★☆☆

在论文测试场景里表现不错,但本质仍依赖训练分布,极端场景下的鲁棒性还需要更多验证。

适应性以及泛化能力:★★★★☆

能跨数据集、跨重建器、跨硬件做验证,这一点加分不少;但更大分辨率和更多波段下还要继续测。

硬件需求及成本:★★★★☆

保留 Hadamard + DMD 的二值实现,硬件门槛不高;额外成本主要在模型推理和训练,不算离谱。

复现难度:★★★☆☆

论文提到代码在 GitHub,但真实光学平台复现成本不低,仿真部分相对友好,硬件部分更考验条件。

产品化成熟度:★★★☆☆

在固定光学架构里有不错的工程潜力,但要真正进产品,还得补上在线稳定性、不同场景自适应策略和系统级优化。

可能的问题:方法依赖训练分布,第一阶段比例和模型输出阈值都需要调参;离真实大规模部署还有一段路,但方向是对的。


主要参考文献

[1] Monroy B, Garcia H, Arguello H, Bacca J. Deep Scene-Driven Ordering of Hadamard Basis for Single-Pixel Spectral Imaging. arXiv:2607.15045v1, 2026.
[2] 论文原文链接:https://arxiv.org/pdf/2607.15045v1.pdf
[3] 代码信息:Pytorch implementation is available on GitHub(论文原文所述)

单像素光谱成像这活,最怕的不是算不出来,而是拍得太慢、拍得太死。想看更多论文拆解、工程落地和少走弯路的真话,欢迎加入龙哥读论文粉丝群,和一群同样爱抠细节的人一起聊模型、聊实验、聊部署。记得备注:研究方向+地点+学校/公司+昵称。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。单像素、光谱成像、Hadamard排序、图像恢复相关问题都可以来聊,别让实验室里的“慢采样”继续拖后腿。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。