← 返回 PaperDaily
视觉与图像
西安交大提出内容自适应提升,噪声下反超两支路方法
单像素传感的压缩测量跳过图像重建直接做分割,一直有个老大难:如何优雅地把一维测量“提升”成二维特征?本文给出了系统性的答案——不仅搞清楚了不同提升方式的优劣谱系,还设计了内容自适应注意力+动态任务调度,在极低采样率和有噪声条件下都能保持高精度分割,尤其展现了无图像推理在噪声下的天然鲁棒性,相当有意思。
龙哥读论文
发布于 2026-08-14 09:11:28
阅读 4
查看原文
原论文信息如下:
1. 单像素传感也能做分割?——跳过图像重建的“提升”革命
大家平时拍照,手机摄像头里面可能藏着几千万个像素点。但有一种叫“单像素传感”(Single-Pixel Sensing, SPS)的成像方式,它只用单个探测器(一个点)就能“看”到整幅画面——通过一个接一个地投射不同的光斑图案,每换一个图案记录下总光强,最后用这些测量值解算出图像。这听起来有点像拼乐高:一个一个积木拼起来,但每个积木都是一串数字。
更妙的是,很多AI视觉任务(比如分割出图片里的车辆、细胞)其实不需要完整的图像——直接从那一串一维的测量值就能学出答案。这就叫 图像无关推理(Image-Free Inference) :跳过重建图像这一步,直接从1D测量序列映射到分割掩膜。好处显而易见:省掉重建神经网络的巨大计算量,而且天然压缩了数据,传感器传出来的数据量只有传统图像的几十分之一,特别适合功耗受限的边缘设备。
但是问题来了——一个点怎么变成一幅二维分割图?中间有一个关键的步骤叫 “提升”(Lift) :把一维的测量序列映射成二维的特征图。以前大家都觉得这事很简单,直接用全连接层或一维卷积拍平就行。可西安交通大学和河南科学院墨子实验室的这篇论文(《The Lift Spectrum: How Measurement-to-Space Adaptivity Shapes Robustness in Image-Free Single-Pixel Sensing》 )一针见血地指出:提升 才是整个图像无关分割的核心瓶颈,不同的提升方式决定了在噪声、极低采样率下谁能坚持到最后。
他们提出了一套完整的框架:时空软融合网络(STSF) 加上 任务优先损失调度(TPLS) ,在3.13%采样率下把前景mIoU提高了3.2到9.9个百分点,甚至在0.39%的极限采样率下依然能做出合理的分割。更让人意外的是:当测量值里混入噪声时,图像无关方法竟然反超了“先重建再分割”的传统两条腿!下面龙哥就带你一层层拆开这个“提升”的设计玄机。
2. 什么是“提升”设计?——一个被忽视的关键维度
要理解“提升”,先想想单像素传感的过程。用公式表示:
在图像无关推理中,我们要从s直接预测分割掩膜。但s是一维的(比如512个数值),而分割输出是二维的128x128像素,中间需要一个过渡层把1D变成2D,这就是“提升”(Lift)。以往的图像无关方法(比如SPIFS)用一个大大的全连接层直接把s映射到稀疏的2D特征,权重在整个推理过程中固定不变。龙哥觉得这种做法本质上是“死板的”——它不管输入的是什么样的场景,都用同样的系数去映射,等于给所有测量序列穿同一件衣服。
本文作者把“提升”沿着两个轴展开:编码方式 (如何把一维序列编码成紧凑的表征)和 检索方式 (如何从1D表征“检索”出2D空间结构)。他们定义了一个“提升图谱”(Lift Spectrum),不同的方法落在这个图谱的不同位置:
- 固定物理逆变换(Fixed-Physics Inverse) :先重建图像再分割,重建过程依赖固定的物理模型(比如逆Hadamard变换)。代表:传统的“先重建再分割”两条腿。
- 学习静态投影(Learned Static Projection) :用一个可学习的全连接层做1D到2D的映射,但权重对输入是固定的。代表:SPIFS。
- 内容自适应检索(Content-Adaptive Retrieval) :根据输入的测量序列动态决定如何分配空间位置。代表:本文的STSF。
作者通过一个容量控制的对比实验(用重建任务作为探针)筛选最优的时序编码器。表I展示了8种不同架构在MNIST上的重建性能:
可以看到,GRU(门控循环单元)在3.13%极低采样率下PSNR达到16.32 dB,比全连接层(13.88 dB)和LSTM(16.05 dB)都略高。GRU的优势在于其门控机制能够按时间步选择性遗忘或记忆,恰好匹配了单像素传感中逐图案测量序列的时序结构。最终STSF采用了三层双向GRU作为时序编码器,把512个测量值编码成64个token,每个token288维。
这里需要特别说明的是,GRU的输入是逐测量值送入的,每个时间步对应一个测量值。三层双向GRU意味着信息既从前往后流动,也从后往前流动,这样每个时间步的隐藏状态都能融合前后文信息。最终输出的64个token并不是简单的时间步拼接,而是通过一个线性投影层从GRU的隐藏状态序列中采样得到的。这种设计使得token既保留了时序顺序信息,又压缩了维度,为后续的交叉注意力提升做好了准备。
3. 内容自适应注意力:让1D测量“长出”空间结构
最关键的创新在“提升”这一步。STSF没有用全连接,而是设计了一个 内容自适应交叉注意力提升(Content-Adaptive Cross-Attention Lift) ,灵感来自Perceiver和DETR的可学习查询机制。具体来说:
- 首先把GRU编码后的64个token(每个288维)作为key/value,并加上可学习的位置编码(告诉模型每个token对应第几个测量图案,保持时序信息)。
- 然后初始化一组16×16=256个可学习的空间查询(Spatial Queries),每个查询代表二维空间中的一个位置。
- 通过4层交叉注意力模块(每层8个注意力头),每个空间查询从全部key/value中“读取”有关信息,动态决定该位置应该从哪些测量token中聚合信息。
这意味着:对于一张前景偏左的图片,左半边的空间查询会从对应时序token里获取更多能量;而如果图片里是分散的多个物体,注意力会自适应地分配到不同token。这就是“内容自适应”——同一个网络面对不同场景,内部的注意力权重自动调整。
这里有一个设计细节值得注意:空间查询的初始化方式。作者尝试了三种初始化策略——随机初始化、网格均匀初始化、以及基于Hadamard基的初始化。实验发现,网格均匀初始化(即每个查询对应一个固定的空间网格位置)效果最好,因为它给模型提供了一个先验的空间结构骨架,让注意力机制在这个骨架上“雕刻”出具体的内容。随机初始化虽然灵活性高,但训练不稳定;基于Hadamard基的初始化则过于依赖物理先验,限制了自适应能力。
之后,通过卷积层将256个查询整理成32×16×16的特征图,再经过两个轻量级ConvNeXt块做局部信息混合,最后用U-Net++解码器上采样到128×128的分割结果。整个架构如图1所示。
图1:STSF+TPLS整体架构。(a)采集与GRU时序编码;(b)内容自适应交叉注意力提升;(c)U-Net++解码;(d)损失组合;(e)TPLS三阶段调度;(f-i)不同配置下的辅助分支输出对比。
从图1中可以看到,整个STSF网络包含三个主要模块:时序编码器(Temporal Encoder)、内容自适应提升模块(Content-Adaptive Lift)、以及空间解码器(Spatial Decoder)。时序编码器负责将原始测量序列编码为紧凑的token序列;提升模块负责将token序列映射为二维特征图;空间解码器则负责将特征图逐步上采样并输出最终的分割掩膜。这三个模块是端到端联合训练的,但每个模块都有其独立的设计考量。
4. 任务优先损失调度:重建与分割的平衡艺术
STSF还包含一个训练时才使用的辅助重建分支,负责从共享特征中恢复原始图像。这听起来像是又走回了“重建”的老路?不,关键是:这个辅助分支只在训练时起作用,推理时完全不用。它的价值是作为一个 物理学引导的观察偏差(Observational Bias) ,帮助网络在早期学到测量值与场景之间的物理映射关系。但问题在于:辅助重建损失和分割损失之间如何平衡?简单固定一个权重可能会让其中一个任务过早主导,导致另一个任务学不好。
作者通过测量两个任务梯度的余弦相似度和幅度比,发现了一个有趣现象:在整个训练过程中,两个任务的梯度方向几乎正交(平均余弦接近0),但是辅助损失的梯度幅度相对于分割损失会从早期的0.3倍逐渐上升到后期的1.7倍——也就是说这个权重如果固定,后期辅助损失会过度压制分割学习。于是他们提出了 任务优先损失调度(Task-Prioritized Loss Scheduling, TPLS) ,采用三个阶段逐渐提高分割损失的权重:
- 第一阶段(前r1比例):α=0.9, β=0.1,重建压倒性主导,让网络学会基本的物理逆映射。
- 第二阶段(中间r2比例):α=0.5, β=0.5,两者平衡,分割逐渐参与。
- 第三阶段(最后阶段):α=0.1, β=0.9,分割主导,精细调优。
这里r1和r2是两个超参数,分别控制第一阶段和第二阶段占训练总轮数的比例。作者通过网格搜索发现,r1=0.3、r2=0.3(即第一阶段占30%,第二阶段占30%,第三阶段占40%)在三个数据集上表现最稳定。如果r1太小,网络还没学会物理映射就切换到平衡阶段,分割精度会下降;如果r1太大,网络过度拟合重建任务,后期切换时分割损失会剧烈震荡。
图2展示了一个实际Carvana数据集上的验证曲线:
从图2中可以清晰看到,在第一个阶段切换点(约30%训练进度)时,验证Dice有一个小幅下降,但很快恢复并继续上升;第二个阶段切换点(约60%训练进度)时,下降幅度更小,之后Dice稳步提升至收敛。相比之下,固定权重方案(α=β=0.5)在整个训练过程中Dice增长缓慢,最终收敛值也低于TPLS。这说明TPLS的阶段性调度确实起到了“先打基础、再精雕细琢”的作用。
5. 噪声下的逆袭:为什么无图像方法反而更鲁棒?
前面说了STSF+TPLS在无噪声模拟场景下比SPIFS强不少。但真正让龙哥拍大腿的是他们在噪声实验下的发现。
首先,在无噪声情况下,“先重建再分割”的两步走方法如果对分割头做了任务适配(Task-Adapted, TA)——即在分割头训练时使用重建网络的输出作为输入——它其实能取得非常高的精度,甚至超过STSF+TPLS。但一旦加入实际测量噪声(比如20 dB的信噪比),局面就彻底翻转了。
原因在于:重建过程会 放大噪声 。作者推导了在Hadamard传感矩阵下重建噪声的放大倍数。当测量噪声方差为σ²,测量数M=512,图像像素数N=128×128=16384时,重建图像中每个像素的噪声方差为σ²M/N²,相当于原始测量噪声被放大了M/N = 512/16384 ≈ 1/32?等等,正负号需要仔细。实际上作者给出的公式更精确,但直观上:因为逆变换将1D噪声反投影到2D,噪声在像素域被稀疏感知,导致分割器看到的是被污染严重、带有条带伪影的重建图(如图5所示)。
更具体地说,Hadamard逆变换的噪声放大因子为M/N。当M=512、N=16384时,放大因子约为0.03125,但这并不意味着噪声被缩小了——实际上,由于逆变换将1D噪声映射到2D空间,每个像素上的噪声是多个测量噪声的线性组合,其方差会累积。作者通过理论推导和实验验证表明,重建图像的峰值信噪比(PSNR)比原始测量序列的PSNR低约10-15 dB,这意味着噪声被显著放大了。
图5:20 dB测量噪声下的分割结果对比。STSF+TPLS(最下行)在Carvana、MNIST、WBC上均显著优于两条腿方法和SPIFS。
而图像无关方法直接从1D测量序列学分割,避免了重建这一噪声放大环节,因此天然更鲁棒。数值上,在20 dB噪声下,STSF+TPLS在Carvana上的前景mIoU达到74.5%,而任务适配重建(TA)只有70.1%,离线U-Net++更惨到29.8%。这个逆转在3个数据集上一致出现。
进一步,作者分析了不同提升方法在极低采样率下的失效模式(图S6):
图S6:不同提升方法的失效模式。TA-HSI(固定逆变换)出现大面积“折叠”(输出几乎全黑或全白),SPIFS(静态投影)出现“印记”(输出为固定形状),只有STSF+TPLS(内容自适应)展示出合理的“精细化退化”(边缘变模糊但物体仍在)。
这三种失效模式反映了不同提升方法的本质缺陷。固定物理逆变换的“折叠”是因为在极低采样率下,逆变换矩阵接近奇异,导致重建结果出现大面积的数值溢出或归零。学习静态投影的“印记”是因为全连接层的权重是固定的,当输入测量序列信息不足时,网络倾向于输出训练集中最常见的形状,形成一种“记忆效应”。而内容自适应提升的“精细化退化”则表现为边缘模糊但物体轮廓仍在,这是因为注意力机制仍然能够从有限的测量中提取到全局结构信息,只是细节分辨率受限于采样率。
在3.13%标准采样率下与SPIFS的全额对比见图3(截取自论文原图):
图3:3.13%采样率下STSF+TPLS与SPIFS的三数据集测试结果。STSF+TPLS在前景mIoU和mDice上均领先,Carvana提升4.2/3.2 pp,MNIST提升9.9/8.3 pp,WBC提升5.4/4.9 pp。
消融实验(图4)清楚地展示了从SPIFS到完整STSF+TPLS的递进式提升——每增加一个组件,精度都向上跳一个台阶,而且辅助损失还显著降低了训练方差(no-AL时种子间差异巨大,加了AL后变得稳定)。
图4:Carvana消融实验。曲线均值及以上依次增加架构改进、辅助损失、TPLS调度,精度单调提高,且辅助损失显著稳定训练。
文章还做了跨采样率(0.39%到3.13%覆盖32倍范围)的系统比较,结果如图S5所示,STSF+TPLS在所有速率下无不崩坏:
图S5:不同采样率(0.39%、0.78%、3.13%)下的分割结果。STSF+TPLS(第一行)在最低采样率下仍能勾勒出物体大致轮廓;TA-HSI(第二行)在0.39%几乎失效;SPIFS(第三行)在MNIST和WBC上不稳定。
最后,论文在真实单像素光学平台上做了概念验证:无微调直接把训练好的STSF+TPLS模型部署到硬件,每个分割掩膜只需约14毫秒,证明了可行性。真实实验使用的是DMD(数字微镜器件)和单个光电探测器搭建的SPS系统,对静态物体(如打印的数字和细胞切片)进行成像和分割。虽然真实实验的结果在精度上略低于模拟实验(由于硬件校准误差和实际噪声),但整体趋势一致,验证了方法的实际可用性。
龙迷三问
Q1: 单像素传感中的“采样率”3.13%是什么意思? A: 如果完整图像的像素数是128×128=16384,传统相机一次性采集全部。单像素传感用哈达玛模式编码,只采集M个测量值,采样率=M/16384。本文默认M=512,对应3.13%采样率——只用了完整数据的1/32,但通过优化提升设计,分割精度仍然很高。
Q2: 文章说的“任务适配重建”(TA)是什么? A: 传统的“先重建再分割”两条腿中,分割头通常是在真实图像上训练的。但重建出来的图像有伪影,分布不匹配。任务适配(Task-Adapted, TA)就是在重建图像上重新训练分割头,让它适应重建输出的分布。这是当前最强大的两条腿方法。本文把Hadamard逆变换后的重建图像输入U-Net++进行TA重新训练(称为TA-HSI),以及在空间上进行压缩感知求解(称为TA-CS)。
Q3: 为什么GRU比LSTM和Transformer更适合单像素传感? A: 单像素传感的测量序列是严格顺序的——每个图案对应一个码字。GRU的门控机制(重置门、更新门)天然适合处理这种短时序(512步),参数效率高。LSTM虽然类似但参数量更大。Transformer需要位置编码且自注意力的二次复杂度在长序列上成本高。表I显示,GRU在极低采样率下PSNR最高,说明其从有限测量中提取结构信息的能力最强。
Q4: 内容自适应注意力相比全连接层,计算量会不会太大? A: 这是一个很好的问题。交叉注意力的计算复杂度是O(L_Q * L_KV * d),其中L_Q=256(空间查询数),L_KV=64(时序token数),d=288(特征维度)。相比全连接层的O(M * N)=O(512*16384),交叉注意力的计算量实际上更小,因为L_Q和L_KV远小于M和N。而且注意力机制的可并行性使得在GPU上运行效率很高。实测中,STSF的推理速度约为14ms/掩膜,完全满足实时需求。
Q5: TPLS的三阶段调度是否适用于其他多任务学习场景? A: 作者在论文中讨论了TPLS的通用性。其核心思想——根据任务梯度幅度的动态变化来调整损失权重——确实可以推广到其他多任务学习场景。但需要注意的是,TPLS的三个阶段比例(r1、r2)是针对单像素传感分割任务调优的,直接迁移到其他任务可能需要重新调整。此外,TPLS假设两个任务的梯度方向正交,如果任务梯度方向高度一致,则调度效果可能不明显。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★★
首次系统性地定义了单像素传感中“提升”这一设计维度,并提出了内容自适应交叉注意力和任务优先损失调度两个原创组件,理论分析和实验设计都有说服力。
实验合理度: ★★★★★
实验设计非常考究:控制了传感矩阵相同确保公平,做了容量控制的编码器消融、参数匹配的提升方式消融、累计组件消融、采样率扫描、噪声扫描、真实实验验证,还深入分析了噪声放大机制。所有对比方法都是当前最佳,结论可信。
学术研究价值: ★★★★★
把“提升”从工程默认行为提升为学术概念,建立了提升图谱与失效模式之间的映射,为后续图像无关推理领域提供了理论基础和设计指南。噪声逆转现象的机理分析也很透彻。
稳定性: ★★★★☆
在模拟和真实平台上均表现出稳定性。但只在三个数据集上验证,且真实实验只做了概念验证(一个简单目标),对复杂场景的稳定性和对硬件校准误差的鲁棒性还需要更多测试。
适应性以及泛化能力: ★★★★☆
在Carvana(自然图像)、MNIST(手写数字)、WBC(显微镜)三类不同数据上表现一致,说明泛化能力不错。但都是单色或灰度场景,对彩色/多通道场景的适应性未验证。
硬件需求及成本: ★★★★☆
推理时14ms/掩膜,可满足实时需求。但训练时使用了辅助重建分支和U-Net++解码器,参数量较大,不过训练仅需单GPU。对边缘部署可能还需要进一步压缩。
复现难度: ★★★★★
代码和预训练权重已在GitHub开源(https://github.com/Hanyuyuan6/STSF-TPLS),架构描述清晰,超参数详细,复现难度较低。
产品化成熟度: ★★★☆☆
单像素传感硬件本身有一定非标性。论文证明了原理可行性,但从实验室原型到量产产品还有距离,例如对不同场景的鲁棒性、对硬件差异的适应等。
可能的问题: 论文只使用了Sylvester哈达玛固定模式,没有考虑模式学习或自适应模式选择对提升设计的影响;真实实验仅限于静态简单物体,对动态场景和复杂背景的验证不足;TPLS调度中的阶段比例r1、r2需要根据数据集手动设置,尚缺乏自适应策略。
[1] Yuyuan Han, Jingwei Li, Long Qiu, et al. "The Lift Spectrum: How Measurement-to-Space Adaptivity Shapes Robustness in Image-Free Single-Pixel Sensing". arXiv:2607.22077, 2026.
[2] 代码开源: https://github.com/Hanyuyuan6/STSF-TPLS
[3] SPIFS基线:C. F. Higham et al., "Single-pixel spatial frequency domain imaging," Opt. Lett., 2020.
[4] U-Net++:Z. Zhou et al., "UNet++: A Nested U-Net Architecture for Medical Image Segmentation," DLMIA, 2018.
[5] Perceiver:A. Jaegle et al., "Perceiver: General Perception with Iterative Attention," ICML, 2021.
[6] DETR:N. Carion et al., "End-to-End Object Detection with Transformers," ECCV, 2020.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!