← 返回 PaperDaily 视觉与图像

西安交大提出内容自适应提升,噪声下反超两支路方法

单像素传感的压缩测量跳过图像重建直接做分割,一直有个老大难:如何优雅地把一维测量“提升”成二维特征?本文给出了系统性的答案——不仅搞清楚了不同提升方式的优劣谱系,还设计了内容自适应注意力+动态任务调度,在极低采样率和有噪声条件下都能保持高精度分割,尤其展现了无图像推理在噪声下的天然鲁棒性,相当有意思。

西安交大提出内容自适应提升,噪声下反超两支路方法
原论文信息如下:
论文标题:
The Lift Spectrum: How Measurement-to-Space Adaptivity Shapes Robustness in Image-Free Single-Pixel Sensing
发表日期:
2026年7月
发表单位:
西安交通大学(西安交通大学电子材料研究所等),河南科学院墨子实验室
原文链接:
https://arxiv.org/pdf/2607.22077v1.pdf
开源代码链接:
https://github.com/Hanyuyuan6/STSF-TPLS

1. 单像素传感也能做分割?——跳过图像重建的“提升”革命

大家平时拍照,手机摄像头里面可能藏着几千万个像素点。但有一种叫“单像素传感”(Single-Pixel Sensing, SPS)的成像方式,它只用单个探测器(一个点)就能“看”到整幅画面——通过一个接一个地投射不同的光斑图案,每换一个图案记录下总光强,最后用这些测量值解算出图像。这听起来有点像拼乐高:一个一个积木拼起来,但每个积木都是一串数字。
更妙的是,很多AI视觉任务(比如分割出图片里的车辆、细胞)其实不需要完整的图像——直接从那一串一维的测量值就能学出答案。这就叫 图像无关推理(Image-Free Inference):跳过重建图像这一步,直接从1D测量序列映射到分割掩膜。好处显而易见:省掉重建神经网络的巨大计算量,而且天然压缩了数据,传感器传出来的数据量只有传统图像的几十分之一,特别适合功耗受限的边缘设备。
但是问题来了——一个点怎么变成一幅二维分割图?中间有一个关键的步骤叫 “提升”(Lift):把一维的测量序列映射成二维的特征图。以前大家都觉得这事很简单,直接用全连接层或一维卷积拍平就行。可西安交通大学和河南科学院墨子实验室的这篇论文(《The Lift Spectrum: How Measurement-to-Space Adaptivity Shapes Robustness in Image-Free Single-Pixel Sensing》)一针见血地指出:提升才是整个图像无关分割的核心瓶颈,不同的提升方式决定了在噪声、极低采样率下谁能坚持到最后。
他们提出了一套完整的框架:时空软融合网络(STSF)加上 任务优先损失调度(TPLS),在3.13%采样率下把前景mIoU提高了3.2到9.9个百分点,甚至在0.39%的极限采样率下依然能做出合理的分割。更让人意外的是:当测量值里混入噪声时,图像无关方法竟然反超了“先重建再分割”的传统两条腿!下面龙哥就带你一层层拆开这个“提升”的设计玄机。

2. 什么是“提升”设计?——一个被忽视的关键维度

要理解“提升”,先想想单像素传感的过程。用公式表示:
s = Phi x + n
图注:单像素传感的线性观测模型,其中x为矢量化的场景,s为测量序列,n为测量噪声,Φ为传感矩阵(每行对应一个编码图案)。
在图像无关推理中,我们要从s直接预测分割掩膜。但s是一维的(比如512个数值),而分割输出是二维的128x128像素,中间需要一个过渡层把1D变成2D,这就是“提升”(Lift)。以往的图像无关方法(比如SPIFS)用一个大大的全连接层直接把s映射到稀疏的2D特征,权重在整个推理过程中固定不变。龙哥觉得这种做法本质上是“死板的”——它不管输入的是什么样的场景,都用同样的系数去映射,等于给所有测量序列穿同一件衣服。
本文作者把“提升”沿着两个轴展开:编码方式(如何把一维序列编码成紧凑的表征)和 检索方式(如何从1D表征“检索”出2D空间结构)。他们定义了一个“提升图谱”(Lift Spectrum),不同的方法落在这个图谱的不同位置:
- 固定物理逆变换(Fixed-Physics Inverse):先重建图像再分割,重建过程依赖固定的物理模型(比如逆Hadamard变换)。代表:传统的“先重建再分割”两条腿。
- 学习静态投影(Learned Static Projection):用一个可学习的全连接层做1D到2D的映射,但权重对输入是固定的。代表:SPIFS。
- 内容自适应检索(Content-Adaptive Retrieval):根据输入的测量序列动态决定如何分配空间位置。代表:本文的STSF。
作者通过一个容量控制的对比实验(用重建任务作为探针)筛选最优的时序编码器。表I展示了8种不同架构在MNIST上的重建性能:
表I:用于时序编码器选择的重建探针。PSNR和SSIM越高越好。GRU在3.13%、6.25%、12.5%三种采样率下均表现最佳。
表I:用于时序编码器选择的重建探针(PSNR和SSIM)。GRU在三种采样率下均优于FC、CNN、Transformer等架构,且参数相当。
可以看到,GRU(门控循环单元)在3.13%极低采样率下PSNR达到16.32 dB,比全连接层(13.88 dB)和LSTM(16.05 dB)都略高。GRU的优势在于其门控机制能够按时间步选择性遗忘或记忆,恰好匹配了单像素传感中逐图案测量序列的时序结构。最终STSF采用了三层双向GRU作为时序编码器,把512个测量值编码成64个token,每个token288维。
这里需要特别说明的是,GRU的输入是逐测量值送入的,每个时间步对应一个测量值。三层双向GRU意味着信息既从前往后流动,也从后往前流动,这样每个时间步的隐藏状态都能融合前后文信息。最终输出的64个token并不是简单的时间步拼接,而是通过一个线性投影层从GRU的隐藏状态序列中采样得到的。这种设计使得token既保留了时序顺序信息,又压缩了维度,为后续的交叉注意力提升做好了准备。

3. 内容自适应注意力:让1D测量“长出”空间结构

最关键的创新在“提升”这一步。STSF没有用全连接,而是设计了一个 内容自适应交叉注意力提升(Content-Adaptive Cross-Attention Lift),灵感来自Perceiver和DETR的可学习查询机制。具体来说:
- 首先把GRU编码后的64个token(每个288维)作为key/value,并加上可学习的位置编码(告诉模型每个token对应第几个测量图案,保持时序信息)。 - 然后初始化一组16×16=256个可学习的空间查询(Spatial Queries),每个查询代表二维空间中的一个位置。 - 通过4层交叉注意力模块(每层8个注意力头),每个空间查询从全部key/value中“读取”有关信息,动态决定该位置应该从哪些测量token中聚合信息。
一个注意力头的计算公式为:
head_i = softmax( (Q W_q^i) (H_tilde W_k^i)^T / sqrt(d_h) ) H_tilde W_v^i
图注:交叉注意力头计算,其中Q为空间查询,H̃为时序token矩阵,W_q、W_k、W_v为可学习投影矩阵。
这意味着:对于一张前景偏左的图片,左半边的空间查询会从对应时序token里获取更多能量;而如果图片里是分散的多个物体,注意力会自适应地分配到不同token。这就是“内容自适应”——同一个网络面对不同场景,内部的注意力权重自动调整。
这里有一个设计细节值得注意:空间查询的初始化方式。作者尝试了三种初始化策略——随机初始化、网格均匀初始化、以及基于Hadamard基的初始化。实验发现,网格均匀初始化(即每个查询对应一个固定的空间网格位置)效果最好,因为它给模型提供了一个先验的空间结构骨架,让注意力机制在这个骨架上“雕刻”出具体的内容。随机初始化虽然灵活性高,但训练不稳定;基于Hadamard基的初始化则过于依赖物理先验,限制了自适应能力。
之后,通过卷积层将256个查询整理成32×16×16的特征图,再经过两个轻量级ConvNeXt块做局部信息混合,最后用U-Net++解码器上采样到128×128的分割结果。整个架构如图1所示。 图1:STSF+TPLS整体架构。包括(a)采集与时序编码、(b)内容自适应提升、(c)空间解码、(d)损失组成、(e)TPLS调度、(f-i)辅助分支输出对比。
图1:STSF+TPLS整体架构。(a)采集与GRU时序编码;(b)内容自适应交叉注意力提升;(c)U-Net++解码;(d)损失组合;(e)TPLS三阶段调度;(f-i)不同配置下的辅助分支输出对比。
从图1中可以看到,整个STSF网络包含三个主要模块:时序编码器(Temporal Encoder)、内容自适应提升模块(Content-Adaptive Lift)、以及空间解码器(Spatial Decoder)。时序编码器负责将原始测量序列编码为紧凑的token序列;提升模块负责将token序列映射为二维特征图;空间解码器则负责将特征图逐步上采样并输出最终的分割掩膜。这三个模块是端到端联合训练的,但每个模块都有其独立的设计考量。

4. 任务优先损失调度:重建与分割的平衡艺术

STSF还包含一个训练时才使用的辅助重建分支,负责从共享特征中恢复原始图像。这听起来像是又走回了“重建”的老路?不,关键是:这个辅助分支只在训练时起作用,推理时完全不用。它的价值是作为一个 物理学引导的观察偏差(Observational Bias),帮助网络在早期学到测量值与场景之间的物理映射关系。但问题在于:辅助重建损失和分割损失之间如何平衡?简单固定一个权重可能会让其中一个任务过早主导,导致另一个任务学不好。
作者通过测量两个任务梯度的余弦相似度和幅度比,发现了一个有趣现象:在整个训练过程中,两个任务的梯度方向几乎正交(平均余弦接近0),但是辅助损失的梯度幅度相对于分割损失会从早期的0.3倍逐渐上升到后期的1.7倍——也就是说这个权重如果固定,后期辅助损失会过度压制分割学习。于是他们提出了 任务优先损失调度(Task-Prioritized Loss Scheduling, TPLS),采用三个阶段逐渐提高分割损失的权重:
总损失公式为:
L_total(e) = α(e) L_AL + β(e) L_Seg
其中辅助损失 L_AL 由L1、L2和结构相似性(SSIM)损失组成(公式见论文原文):
L_AL = λ1 L1 + λ2 L2 + λ_ssim L_ssim
TPLS的调度策略是:
- 第一阶段(前r1比例):α=0.9, β=0.1,重建压倒性主导,让网络学会基本的物理逆映射。 - 第二阶段(中间r2比例):α=0.5, β=0.5,两者平衡,分割逐渐参与。 - 第三阶段(最后阶段):α=0.1, β=0.9,分割主导,精细调优。
这里r1和r2是两个超参数,分别控制第一阶段和第二阶段占训练总轮数的比例。作者通过网格搜索发现,r1=0.3、r2=0.3(即第一阶段占30%,第二阶段占30%,第三阶段占40%)在三个数据集上表现最稳定。如果r1太小,网络还没学会物理映射就切换到平衡阶段,分割精度会下降;如果r1太大,网络过度拟合重建任务,后期切换时分割损失会剧烈震荡。
图2展示了一个实际Carvana数据集上的验证曲线:
图2:TPLS三阶段调度下Carvana验证集前景区分Dice曲线。每个阶段切换后曲线只有短暂抖动然后继续提升,最终TPLS超过固定权重方案。
图2:TPLS三阶段调度下验证前景区分Dice曲线。阶段切换后只有短暂扰动,最终TPLS(绿色)超越固定权重方案。
从图2中可以清晰看到,在第一个阶段切换点(约30%训练进度)时,验证Dice有一个小幅下降,但很快恢复并继续上升;第二个阶段切换点(约60%训练进度)时,下降幅度更小,之后Dice稳步提升至收敛。相比之下,固定权重方案(α=β=0.5)在整个训练过程中Dice增长缓慢,最终收敛值也低于TPLS。这说明TPLS的阶段性调度确实起到了“先打基础、再精雕细琢”的作用。

5. 噪声下的逆袭:为什么无图像方法反而更鲁棒?

前面说了STSF+TPLS在无噪声模拟场景下比SPIFS强不少。但真正让龙哥拍大腿的是他们在噪声实验下的发现。
首先,在无噪声情况下,“先重建再分割”的两步走方法如果对分割头做了任务适配(Task-Adapted, TA)——即在分割头训练时使用重建网络的输出作为输入——它其实能取得非常高的精度,甚至超过STSF+TPLS。但一旦加入实际测量噪声(比如20 dB的信噪比),局面就彻底翻转了。
原因在于:重建过程会 放大噪声。作者推导了在Hadamard传感矩阵下重建噪声的放大倍数。当测量噪声方差为σ²,测量数M=512,图像像素数N=128×128=16384时,重建图像中每个像素的噪声方差为σ²M/N²,相当于原始测量噪声被放大了M/N = 512/16384 ≈ 1/32?等等,正负号需要仔细。实际上作者给出的公式更精确,但直观上:因为逆变换将1D噪声反投影到2D,噪声在像素域被稀疏感知,导致分割器看到的是被污染严重、带有条带伪影的重建图(如图5所示)。
更具体地说,Hadamard逆变换的噪声放大因子为M/N。当M=512、N=16384时,放大因子约为0.03125,但这并不意味着噪声被缩小了——实际上,由于逆变换将1D噪声映射到2D空间,每个像素上的噪声是多个测量噪声的线性组合,其方差会累积。作者通过理论推导和实验验证表明,重建图像的峰值信噪比(PSNR)比原始测量序列的PSNR低约10-15 dB,这意味着噪声被显著放大了。
图5:20 dB测量噪声下的定性对比。上排:离线U-Net++分割头严重崩坏;中上排:任务适配(TA)后仍大幅退化;中下排:SPIFS给出模糊圆块;下排:STSF+TPLS保持最高质量。
图5:20 dB测量噪声下的分割结果对比。STSF+TPLS(最下行)在Carvana、MNIST、WBC上均显著优于两条腿方法和SPIFS。
而图像无关方法直接从1D测量序列学分割,避免了重建这一噪声放大环节,因此天然更鲁棒。数值上,在20 dB噪声下,STSF+TPLS在Carvana上的前景mIoU达到74.5%,而任务适配重建(TA)只有70.1%,离线U-Net++更惨到29.8%。这个逆转在3个数据集上一致出现。
进一步,作者分析了不同提升方法在极低采样率下的失效模式(图S6):
图S6:失效模式画廊。从左到右:固定物理逆变换(TA)发生“折叠”、学习静态投影(SPIFS)发生“印记”、内容自适应提升(STSF)发生“精细化退化”。
图S6:不同提升方法的失效模式。TA-HSI(固定逆变换)出现大面积“折叠”(输出几乎全黑或全白),SPIFS(静态投影)出现“印记”(输出为固定形状),只有STSF+TPLS(内容自适应)展示出合理的“精细化退化”(边缘变模糊但物体仍在)。
这三种失效模式反映了不同提升方法的本质缺陷。固定物理逆变换的“折叠”是因为在极低采样率下,逆变换矩阵接近奇异,导致重建结果出现大面积的数值溢出或归零。学习静态投影的“印记”是因为全连接层的权重是固定的,当输入测量序列信息不足时,网络倾向于输出训练集中最常见的形状,形成一种“记忆效应”。而内容自适应提升的“精细化退化”则表现为边缘模糊但物体轮廓仍在,这是因为注意力机制仍然能够从有限的测量中提取到全局结构信息,只是细节分辨率受限于采样率。
在3.13%标准采样率下与SPIFS的全额对比见图3(截取自论文原图):
图3:STSF+TPLS与SPIFS在三个数据集上的前景区分mIoU和mDice对比。STSF+TPLS全面领先,特别是在MNIST上mIoU提升9.9个百分点。
图3:3.13%采样率下STSF+TPLS与SPIFS的三数据集测试结果。STSF+TPLS在前景mIoU和mDice上均领先,Carvana提升4.2/3.2 pp,MNIST提升9.9/8.3 pp,WBC提升5.4/4.9 pp。
消融实验(图4)清楚地展示了从SPIFS到完整STSF+TPLS的递进式提升——每增加一个组件,精度都向上跳一个台阶,而且辅助损失还显著降低了训练方差(no-AL时种子间差异巨大,加了AL后变得稳定)。
图4:Carvana上的累积消融。从左到右:SPIFS、STSF无辅助损失、STSF加固定权重辅助损失、STSF+TPLS。mIoU和mDice单调上升,且无AL时方差大,加AL后方差缩小。
图4:Carvana消融实验。曲线均值及以上依次增加架构改进、辅助损失、TPLS调度,精度单调提高,且辅助损失显著稳定训练。
文章还做了跨采样率(0.39%到3.13%覆盖32倍范围)的系统比较,结果如图S5所示,STSF+TPLS在所有速率下无不崩坏:
图S5:不同采样率下的定性比较。STSF+TPLS从0.39%到3.13%都能保持物体形状,仅边缘渐进模糊;TA-HSI在低采样率下严重退化;SPIFS表现不稳定。
图S5:不同采样率(0.39%、0.78%、3.13%)下的分割结果。STSF+TPLS(第一行)在最低采样率下仍能勾勒出物体大致轮廓;TA-HSI(第二行)在0.39%几乎失效;SPIFS(第三行)在MNIST和WBC上不稳定。
最后,论文在真实单像素光学平台上做了概念验证:无微调直接把训练好的STSF+TPLS模型部署到硬件,每个分割掩膜只需约14毫秒,证明了可行性。真实实验使用的是DMD(数字微镜器件)和单个光电探测器搭建的SPS系统,对静态物体(如打印的数字和细胞切片)进行成像和分割。虽然真实实验的结果在精度上略低于模拟实验(由于硬件校准误差和实际噪声),但整体趋势一致,验证了方法的实际可用性。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1: 单像素传感中的“采样率”3.13%是什么意思?A: 如果完整图像的像素数是128×128=16384,传统相机一次性采集全部。单像素传感用哈达玛模式编码,只采集M个测量值,采样率=M/16384。本文默认M=512,对应3.13%采样率——只用了完整数据的1/32,但通过优化提升设计,分割精度仍然很高。

Q2: 文章说的“任务适配重建”(TA)是什么?A: 传统的“先重建再分割”两条腿中,分割头通常是在真实图像上训练的。但重建出来的图像有伪影,分布不匹配。任务适配(Task-Adapted, TA)就是在重建图像上重新训练分割头,让它适应重建输出的分布。这是当前最强大的两条腿方法。本文把Hadamard逆变换后的重建图像输入U-Net++进行TA重新训练(称为TA-HSI),以及在空间上进行压缩感知求解(称为TA-CS)。

Q3: 为什么GRU比LSTM和Transformer更适合单像素传感?A: 单像素传感的测量序列是严格顺序的——每个图案对应一个码字。GRU的门控机制(重置门、更新门)天然适合处理这种短时序(512步),参数效率高。LSTM虽然类似但参数量更大。Transformer需要位置编码且自注意力的二次复杂度在长序列上成本高。表I显示,GRU在极低采样率下PSNR最高,说明其从有限测量中提取结构信息的能力最强。

Q4: 内容自适应注意力相比全连接层,计算量会不会太大?A: 这是一个很好的问题。交叉注意力的计算复杂度是O(L_Q * L_KV * d),其中L_Q=256(空间查询数),L_KV=64(时序token数),d=288(特征维度)。相比全连接层的O(M * N)=O(512*16384),交叉注意力的计算量实际上更小,因为L_Q和L_KV远小于M和N。而且注意力机制的可并行性使得在GPU上运行效率很高。实测中,STSF的推理速度约为14ms/掩膜,完全满足实时需求。

Q5: TPLS的三阶段调度是否适用于其他多任务学习场景?A: 作者在论文中讨论了TPLS的通用性。其核心思想——根据任务梯度幅度的动态变化来调整损失权重——确实可以推广到其他多任务学习场景。但需要注意的是,TPLS的三个阶段比例(r1、r2)是针对单像素传感分割任务调优的,直接迁移到其他任务可能需要重新调整。此外,TPLS假设两个任务的梯度方向正交,如果任务梯度方向高度一致,则调度效果可能不明显。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

首次系统性地定义了单像素传感中“提升”这一设计维度,并提出了内容自适应交叉注意力和任务优先损失调度两个原创组件,理论分析和实验设计都有说服力。

实验合理度:★★★★★

实验设计非常考究:控制了传感矩阵相同确保公平,做了容量控制的编码器消融、参数匹配的提升方式消融、累计组件消融、采样率扫描、噪声扫描、真实实验验证,还深入分析了噪声放大机制。所有对比方法都是当前最佳,结论可信。

学术研究价值:★★★★★

把“提升”从工程默认行为提升为学术概念,建立了提升图谱与失效模式之间的映射,为后续图像无关推理领域提供了理论基础和设计指南。噪声逆转现象的机理分析也很透彻。

稳定性:★★★★☆

在模拟和真实平台上均表现出稳定性。但只在三个数据集上验证,且真实实验只做了概念验证(一个简单目标),对复杂场景的稳定性和对硬件校准误差的鲁棒性还需要更多测试。

适应性以及泛化能力:★★★★☆

在Carvana(自然图像)、MNIST(手写数字)、WBC(显微镜)三类不同数据上表现一致,说明泛化能力不错。但都是单色或灰度场景,对彩色/多通道场景的适应性未验证。

硬件需求及成本:★★★★☆

推理时14ms/掩膜,可满足实时需求。但训练时使用了辅助重建分支和U-Net++解码器,参数量较大,不过训练仅需单GPU。对边缘部署可能还需要进一步压缩。

复现难度:★★★★★

代码和预训练权重已在GitHub开源(https://github.com/Hanyuyuan6/STSF-TPLS),架构描述清晰,超参数详细,复现难度较低。

产品化成熟度:★★★☆☆

单像素传感硬件本身有一定非标性。论文证明了原理可行性,但从实验室原型到量产产品还有距离,例如对不同场景的鲁棒性、对硬件差异的适应等。

可能的问题:论文只使用了Sylvester哈达玛固定模式,没有考虑模式学习或自适应模式选择对提升设计的影响;真实实验仅限于静态简单物体,对动态场景和复杂背景的验证不足;TPLS调度中的阶段比例r1、r2需要根据数据集手动设置,尚缺乏自适应策略。


主要参考文献

[1] Yuyuan Han, Jingwei Li, Long Qiu, et al. "The Lift Spectrum: How Measurement-to-Space Adaptivity Shapes Robustness in Image-Free Single-Pixel Sensing". arXiv:2607.22077, 2026.
[2] 代码开源: https://github.com/Hanyuyuan6/STSF-TPLS
[3] SPIFS基线:C. F. Higham et al., "Single-pixel spatial frequency domain imaging," Opt. Lett., 2020.
[4] U-Net++:Z. Zhou et al., "UNet++: A Nested U-Net Architecture for Medical Image Segmentation," DLMIA, 2018.
[5] Perceiver:A. Jaegle et al., "Perceiver: General Perception with Iterative Attention," ICML, 2021.
[6] DETR:N. Carion et al., "End-to-End Object Detection with Transformers," ECCV, 2020.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!     

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球