← 返回 PaperDaily 视觉与图像

斯旺西大学联合伦敦大学学院全息成像新作:每个高斯只加一个曲率参数,灰度重建提升0.33 dB

原文标题: Hologram Representation via Quadratic Phase Gaussian Splatting 首次公开: 2026年9月10日 主要署名单位: 斯旺西大学、伦敦大学学院 原文链接: https://arxiv.org/abs/2609.11434

原文标题:Hologram Representation via Quadratic Phase Gaussian Splatting

首次公开:2026年9月10日

主要署名单位:斯旺西大学、伦敦大学学院

原文链接:
https://arxiv.org/abs/2609.11434

龙哥导读

这篇论文最有意思的地方,不是又堆了一层网络,而是给每个复高斯多装了一枚“微型虚拟透镜”:只增加一个可学习曲率参数,就让原本平直的局部波前能够会聚或发散。十个场景、两个传播深度、10%与20%两档压缩预算下,灰度重建相对同数量平面高斯平均提升约0.33 dB,彩色提升约0.19 dB;即使给旧方法补足到相同参数量,新方法仍占优。它真正回答的是一个很工程的问题:当表示预算很紧时,增加高斯数量和增强单个高斯的物理表达力,哪一种更划算?

先想象一个看似反常识的场景:一张全息图看起来可能只是一片密集条纹,但光经过传播以后,却能在不同距离上重新聚成清晰图像。这里保存的不是普通照片的亮度,而是光场的复数信息——振幅决定“有多亮”,相位决定不同位置的光如何相互加强或抵消。

问题来了:如果用许多二维高斯去压缩这张全息图,每个高斯内部的相位都保持不变,它就像一小块只会发出平面波的灯片。高斯可以移动、旋转、拉长,也能改颜色和整体相位,却不会在自己的覆盖区域内产生逐渐弯曲的波前。对于低频缓变内容,这样做问题不大;到了决定细线、纹理和聚焦锐度的中高频部分,表达就容易吃紧。

斯旺西大学与伦敦大学学院这项工作的核心,就是不急着增加高斯数量,而是先让每个高斯学会“弯曲光”。作者把这种新原语称为复值二次相位高斯。名字很长,直觉却很直接:高斯负责“这一团光覆盖哪里、强度怎样衰减”,二次相位负责“这一团光向外发散、保持平直,还是向内会聚”。

图1|论文方法总览。左侧是带振幅、颜色、位置、尺度、旋转、相位和曲率的高斯集合;中间先光栅化成复数全息图,再传播到前后两个深度平面;下方由目标图与深度图合成训练目标;右侧损失把误差反传到高斯参数。黄色模块是尺度自适应曲率控制。来源:论文 Figure 1。

一、全息图为什么比普通图片更难压缩

普通图片可以把每个像素理解为一个颜色样本。相邻像素经常相似,所以压缩算法会利用空间平滑性,把大块缓慢变化的区域表示得很省。全息图则不同。它要让传播后的光在指定深度重新聚焦,图面上因此充满快速变化的干涉条纹;这些条纹哪怕只挪动一点,相位叠加的结果也可能明显变化。

论文把目标写成一个多平面优化问题。输入是一张目标图和对应深度图,系统先在多个深度平面合成理想强度,再寻找一张复数全息图,使它经过光传播以后,在每个平面都尽量接近目标。这里的难点不是只把某一平面做清楚,而是要同时照顾前景聚焦、后景聚焦以及自然的离焦效果。

此前的平面复高斯已经迈出重要一步:它不再逐像素保存完整全息图,而是用一组可优化的二维高斯来表示。每个原语包含不透明度、各颜色通道振幅、二维位置、两个尺度、旋转角和各通道相位。二维协方差决定椭圆的方向与长短轴,高斯指数决定离中心越远贡献越小。

但它的相位在整个高斯有效区域内是常数。换成生活化的比喻:旧高斯像一张可以拉伸和旋转的彩色透明贴纸,贴纸整体能调相位,却始终是平的。真实衍射里,局部波前经常带曲率;如果想用很多平贴纸逼近弯曲波面,就只能靠更多、更小的贴纸拼出来,参数预算会被迅速吃掉。

这也是本文的切入点。作者没有否定平面高斯,而是把它视为低频骨架:先让旧原语搭出大体结构,再开放曲率去补残余细节。新方法是对原表示的“每原语一维升级”,不是另起炉灶。

二、每个高斯加一个曲率,到底改变了什么

二次相位因子可以理解为一枚数学透镜。标准形式中,相位随像素到高斯中心距离的平方变化,曲率由焦距的倒数控制。曲率为正时,波前向一个方向弯;曲率为负时,向相反方向弯;曲率等于零时,相位因子退化为1,原语就回到平面复高斯。

这种退化关系很关键。它意味着新方法至少包含旧方法能表达的全部情况:如果某个区域不需要额外曲率,优化器完全可以把曲率推到零;只有在弯曲波前确实能降低重建误差时,这个参数才会发挥作用。于是,“加一个参数”并不是强迫所有高斯都变成小透镜,而是给每个高斯一次选择。

图2|方法总览左半部分放大。最左侧原语参数集合比平面复高斯多出曲率标量γ;经过光栅化后,所有原语在像素网格上相加,形成同时包含振幅与相位的复数全息图。曲率改变的是每个原语内部的相位分布,而不是简单修改颜色。

单个新原语可以拆成四项相乘。第一项是不透明度,控制整体权重;第二项是颜色振幅;第三项是普通高斯包络,决定空间覆盖;第四项是复相位,由常数相位与二次相位共同组成。最后,所有原语在同一像素上的复数贡献相加,得到全息图。

请注意这里是复数相加,不是普通图片中的颜色叠加。两个振幅都不小的原语,如果相位相反,叠加后可能互相抵消;如果相位接近,则可能增强。曲率因此能在一个高斯内部组织更细的干涉结构,恰好补足平面相位对高频变化的表达不足。

作者把曲率写成焦距的倒数,这还有一个数值上的好处。直接优化焦距时,平面波对应正负无穷大的焦距,训练很难处理;改成曲率以后,平面波恰好对应零。会聚、平面、发散三个状态可以沿一条连续数轴平滑切换。

从表示效率看,这个设计把“多放几个平面高斯”改成“让现有高斯多掌握一种物理自由度”。这正是后面等参数实验要检验的核心:收益究竟来自总参数变多,还是来自参数放在了更对的位置。

三、为什么不能直接套一个圆形二次相位

到这里还有一个容易忽略的几何矛盾。二维高斯通常不是圆,而是带方向的椭圆:它可以横向很长、纵向很窄,也可以旋转任意角度。标准二次相位只看普通欧氏距离,产生的是同心圆条纹。于是,振幅包络是椭圆,相位条纹却是圆,两套几何结构对不上。

论文用马氏距离解决这个问题。普通欧氏距离问的是“像素离中心多少”;马氏距离还会参考高斯的协方差,问“沿这个高斯自己的长短轴尺度,像素离中心多少”。沿长轴移动同样的像素距离,标准化后可能并不算远;沿短轴移动相同距离,却会被判得更远。

图3|论文对单个高斯的受控比较。左图是共同的椭圆振幅包络;中图使用标准二次相位,条纹保持同心圆;右图使用马氏距离,条纹变成与包络同方向、同比例的椭圆。来源:论文 Figure 2。

读图时先看左侧振幅:颜色从中心向外衰减,椭圆的长轴向右上方倾斜。再看中间,相位环像把圆形靶纸硬盖在椭圆上,长短轴和旋转信息都没有进入相位。右侧则把相位环一起拉伸、旋转,使同一条相位等值线与振幅等值线对齐。

公式里,马氏距离是位置偏移向量、协方差逆矩阵与位置偏移向量的二次型。协方差逆矩阵相当于先把旋转的椭圆“扶正”,再按两个尺度归一化。作者还乘上尺度矩阵行列式,使相位变化与原语实际尺度建立联系。这样,振幅和相位共用同一套局部坐标系。

这一设计并不是为了公式看起来更复杂。全息条纹对方向很敏感;如果长条形原语的相位仍按圆形扩散,优化器就需要用其他参数补偿不匹配。马氏二次相位把这种补偿提前写进原语结构,让每个参数更容易做自己该做的事。

四、曲率不是越大越好:采样混叠才是硬约束

二次相位本质上是一种线性啁啾:离中心越远,相位变化越快。它能补充高频,也可能制造超过显示器采样能力的高频。空间光调制器的像素间距有限,和相机像素一样存在奈奎斯特极限;相位在相邻像素之间转得太快,就会被错误地折回较低频率,形成混叠。

作者没有给所有高斯使用同一个固定曲率范围,而是按每个高斯的尺度计算上限。先把有效区域限制在三倍标准差范围内,再求这个范围里最高的瞬时空间频率。要求该频率不超过每像素0.5个周期,便得到曲率上限。

上限与波长成正比,与高斯尺度和像素间距的平方成反比。直觉是:高斯越大,二次相位在覆盖区域边缘积累得越快,因此允许的曲率越小;高斯越小,覆盖范围短,可以承受更大的弯曲。论文还使用0.9的放松系数,给采样极限留出余量。

自适应上限不是训练小技巧,而是把显示硬件的采样能力直接写进每个原语的可学习范围。如果没有这一步,模型为了降低训练误差,可能学出数值上很激进、实际采样时却折叠成伪纹理的曲率。

图4|方法总览右半部分放大。复数全息图经过带限角谱传播,在前后深度平面形成重建强度;目标图和深度图生成对应监督。误差反传时,曲率先经过尺度相关的上限约束,再与其他高斯参数共同更新。

训练还采用两阶段热身。前400步把所有曲率固定为零,只让平面高斯先拟合低频主体;随后解锁曲率,与其他参数一起优化剩余细节。整个训练共2000步。这个顺序类似先搭建筑主体,再做细部雕刻:一开始就让曲率自由追逐高频,容易把主体结构和细纹优化搅在一起。

渲染阶段则很朴素:把全部原语在像素网格上的复数贡献累加成全息图,再用带限角谱法传播到每个深度平面,比较重建强度与目标强度。损失由重建误差和结构相似度项组成,并对全部深度平面求和。

这条方法链值得记住三个词:先用曲率增强单原语表达,再用马氏距离对齐振幅与相位形状,最后用尺度自适应上限压住采样混叠。三者缺一,实验收益都会缩水。

五、10%与20%压缩预算,数字应该怎样读

实验从高分辨率图像数据集和真实前向场景数据集构造十个场景,并用单目深度估计模型生成深度图。全息分辨率是640×480,传播到1毫米和5毫米两个深度平面。像素间距设为3.74微米,红绿蓝波长分别为639、532和473纳米。

所有方法使用相同训练流程和优化器,在单张英伟达显卡上训练,因此表中差异主要来自表示本身。

所谓10%与20%预算,指用相对于像素规模的一定比例高斯来表示全息图。彩色20%使用30720个原语,彩色10%使用15360个;灰度通道更少,同样预算分别是15360和7680个。预算越低,每个原语承担的区域越大,对单原语表达力的要求也越高。

在同数量高斯比较中,彩色20%预算下,平面基线峰值信噪比为29.265 dB,新方法为29.450 dB,增加0.185 dB;彩色10%预算下,从28.034提升到28.225 dB,增加0.191 dB。因此论文把彩色平均收益概括为约0.19 dB

灰度结果更明显:20%预算从29.504提升到29.834 dB,增加0.331 dB;10%预算从28.076提升到28.398 dB,增加0.322 dB,平均约0.33 dB。结构相似度、感知距离、视觉差异和显示感知质量四类指标也都朝更优方向变化,不是只挑峰值信噪比这一项报喜。

0.19或0.33 dB听起来不大,需要结合条件判断。第一,它是十个场景、两个深度平面的平均,不是单张最好结果。第二,新方法每个高斯只多一个标量,而彩色高斯原本有12个参数、灰度高斯原本有8个参数。第三,实验还安排了等参数基线,专门排除“参数多一点自然更好”的解释。

等参数比较怎么做?彩色情况把旧基线的高斯数量扩大到原来的13/12,20%预算从30720个增至33280个,10%预算从15360个增至16640个;灰度则扩大到9/8,分别增至17280和8640个。也就是说,旧方法可以把新方法省下的那一维预算全部换成更多原语。

结果仍是新方法领先。彩色20%时,等参数基线为29.386 dB,新方法29.450;彩色10%时是28.179对28.225。灰度20%是29.753对29.834,灰度10%是28.317对28.398。差距缩小了,却没有消失。这说明预算放在曲率上,比把同样预算全部换成更多平面高斯更有效。

图5|论文按空间频率统计新方法相对基线的均方误差降幅。四条曲线对应彩色与灰度的10%、20%预算。低频附近收益很小,进入中高频后上升,彩色峰值约11%,灰度峰值约22%,接近奈奎斯特极限时又回落。来源:论文 Figure 3。

频率图进一步告诉我们,平均分数为什么会提升。曲线在接近零频时几乎没有收益,说明大色块和缓慢变化本来就不是旧方法的主要短板;到了中高频,误差下降明显,正对应叶片纹理、花瓣细节、细线和聚焦结构。再往最极端高频走,收益趋近于零,因为显示采样极限仍在那里,曲率也不能凭空创造不可采样的信息。

六、重建图告诉我们的,不只是“更清晰”

论文给出彩色20%预算、30720个原语的前后深度平面对比。观察时不要只看整张花朵图,因为平均提升有限,真正差异集中在局部纹理和聚焦区域。左两幅是新方法在1毫米与5毫米平面的重建,右两幅是平面基线;每幅下方还列出五项指标和局部放大。

图6|彩色20%预算的模拟全息重建。左侧两图为新方法在1毫米、5毫米平面的结果,右侧两图为同数量平面高斯基线。放大区域显示,新方法在聚焦叶片和花朵纹理上更利落,噪声与细节糊化略少。来源:论文 Figure 4。

这里不能把0.19 dB翻译成“肉眼全面碾压”。在大面积低频区域,两者相当接近;差异主要出现在对焦平面的细小纹理。更准确的说法是:新方法用相同数量原语,更稳定地保住了一部分中高频,而不是把整个重建质量抬高一个量级。

作者还专门用西门子星检验高频解析力。这个图案越靠中心,黑白辐条越密,特别适合看模型能否保住快速变化。新方法达到34.57 dB,基线为31.53 dB,单个受控案例提升3.04 dB;中心密集区域的辐条也更容易分开。

图7|上排是西门子星:新方法34.57 dB,平面基线31.53 dB,黄色框标出中心高频区域。下排展示另一面:全息图边缘被突然截断时,新方法的啁啾相位会产生波纹状振铃,基线没有同样现象;论文使用余弦渐变窗平滑边缘。来源:论文 Figure 5。

这张图最有价值的是同时展示优势和代价。二次相位让高斯更会表达高频,但相位在全息图边缘突然终止时,也更容易激起振铃。作者通过余弦渐变窗让边缘平滑衰减,降低伪影。它提醒我们:增强高频能力从来不是免费午餐,表示、采样与窗口处理必须一起设计。

七、消融实验:真正决定收益的是哪一步

消融实验采用五个场景、彩色10%预算和15360个原语。平面基线是29.809 dB;完整模型达到29.994 dB,提高0.185 dB。接下来作者分别拿掉尺度自适应曲率上限、换回标准圆形二次相位,以及同时拿掉两项关键设计。

最醒目的结果是自适应上限。把它换成固定上限以后,增益从0.185 dB跌到0.048 dB,结构相似度从0.8471降到0.8438,感知距离也明显变差。也就是说,曲率参数本身并不足够;它必须知道每个高斯的大小,才能在细节表达和采样稳定之间取得平衡。

把马氏二次相位换回标准圆形二次相位,增益从0.185降到0.149 dB,损失0.036 dB。幅度不如自适应上限那样大,却稳定说明椭圆振幅与椭圆相位的几何对齐确实有用。论文正文有一句把这一结果称为对“各向同性相位”的确认,结合方法和表格语境,应理解为标准圆形相位不如形状自适应相位,而不是圆形设计更优。

如果两项都不用,只给每个高斯机械地挂上标准二次相位,收益只剩0.046 dB,几乎与移除自适应上限的版本相当。消融结果把贡献排序得很清楚:采样约束是决定性部件,马氏几何对齐提供额外收益,单纯“加曲率”远远不够。

八、与3D高斯、2D高斯相比,它继承了什么,又改变了什么

要理解这项工作,最好把它放回高斯泼溅的两条经典路线。2023年的三维高斯泼溅用各向异性三维高斯表示场景,从稀疏结构恢复点云出发,联合优化位置、协方差、不透明度和方向相关颜色,再通过分块、排序和透明度混合实现实时新视角渲染。它解决的是“怎样快速表示并渲染三维辐射场”。

三维高斯的关键贡献,是把可增删、可移动的显式原语与高效光栅化结合起来。与需要沿光线反复采样的神经辐射场相比,它更接近传统图形管线,训练和渲染都更快。但它最终主要输出相机看到的颜色,核心组合规则是按深度排序后的透明度混合;它并不直接表示全息平面上的复数振幅和衍射相位。

2024年的二维高斯泼溅进一步把原语从三维椭球改成带方向的二维椭圆盘,并显式计算像素射线与高斯盘的交点。这样做让不同视角对同一表面的取值更一致,还能直接利用原语法线,通过深度畸变和法线一致性正则改善几何重建。它解决的是“怎样让高斯表示更像真实表面”。

本论文借用了二维高斯“显式椭圆原语”的形式,却把任务从三维场景表面搬到二维全息平面。这里没有沿相机光线寻找表面交点,也不做按深度透明度混合;每个原语直接贡献一个复数光场,所有贡献先在全息平面相加,再经过波动光学传播得到不同深度的强度图。

三篇工作的共同精神,是把复杂连续场拆成可优化、可光栅化的高斯原语;真正不同的是原语承载的物理量。三维高斯承载位置、形状、不透明度与视角相关颜色;二维高斯强调表面盘、射线交点和几何一致性;本文的复值二次相位高斯承载全息振幅、相位和局部波前曲率。

因此,不能把本文理解成“三维高斯又多了一个参数”,也不能把0.33 dB与新视角渲染榜单直接横比。它的输入、输出和成像方程都不同。更准确的技术谱系是:高斯泼溅提供了高效显式表示的思想,二维复高斯把它引入全息表示,而本文继续追问单个原语能否携带更符合衍射物理的波前。

九、为什么灰度收益高于彩色

四组实验里,灰度增益约0.32到0.33 dB,彩色只有约0.19 dB。论文给出的解释是:当前设计让红、绿、蓝通道共享同一个曲率,但三种颜色的波长不同。一个曲率值对某个波长接近最优时,对另外两个波长未必同样合适。

公式也支持这个判断。曲率引起的空间频率与波长成反比;同一个高斯、同一个曲率,在639纳米红光、532纳米绿光和473纳米蓝光上会产生不同的相位变化速度。灰度只有一个波长通道,不存在三种波长争用一个曲率的问题,所以新自由度更容易被充分利用。

这同时指出一条自然的后续路线:让曲率具备颜色通道差异,或者设计更复杂的相位形式。但参数一多,原论文“每个高斯只增加一个标量”的轻量优势会减弱,采样上限也要按波长分别处理。下一步不是简单复制三份曲率,而要重新权衡质量、参数量和优化稳定性。

十、离真实全息显示还有多远

这篇论文验证的是模拟全息重建。训练和评估都使用数值传播,论文没有展示空间光调制器、激光器、光路、相机组成的真实光学平台。现实系统还会遇到器件相位响应不准、像素串扰、光源不均匀、机械误差、散斑和相机噪声;模拟中的0.19或0.33 dB能保留多少,需要实机实验回答。

分辨率目前是640×480,场景数量是十个,深度只有1毫米和5毫米两个平面。论文没有测试更高分辨率显示、连续深度体、更多焦平面,也没有给出随分辨率和原语数增长的训练时间、显存与渲染吞吐。对于消费级近眼显示,这些系统指标往往和画质一样重要。

场景也是静态图像与估计深度构成的合成目标。动态全息需要在时间维度保持相位和外观稳定,还要满足交互帧率;本文没有动态序列、快速运动或时域闪烁实验。高斯显式表示通常适合快速渲染,但这篇工作只报告单张英伟达显卡上的2000步优化设置,没有给出实时更新结论。

数据方面,深度来自Depth Anything V2估计,而不是精密采集的真实几何。它足以构造多平面目标并比较表示能力,却不能等同于完整三维光场数据。十个场景的平均趋势值得重视,但仍需要更多内容类型、真实深度与硬件测试来确认泛化。

所以当前最稳妥的结论是:作者证明了曲率是一种更高效的全息高斯参数,但还没有完成从模拟画质优势到真实动态显示系统的闭环。这不削弱方法价值,只是告诉工程团队下一组实验该往哪里做。

十一、龙哥点评:小参数为什么可能比大模型更值得看

龙哥觉得,这篇工作最值得学的不是“0.33 dB很大”,而是它找到了参数预算的正确落点。旧表示缺的不是更多相同形状的积木,而是一种与波动光学直接相关的新自由度。于是每个原语只多一个标量,就能在多个指标和两档压缩预算上稳定改善。

它也体现了一个经常被忽略的研究方法:先问失败来自容量不足,还是归纳偏置不对。如果只是容量不足,多加原语就应该追上;而等参数基线仍落后,说明原来的平面相位假设限制了表达。好的轻量创新,往往不是让模型什么都能学,而是把一个关键物理关系直接交给它。

不过,漂亮的小改动也要接受系统级追问。真实设备上是否仍有收益?高分辨率时曲率上限会不会过紧?动态内容的时间一致性怎样?按颜色分曲率以后,收益能否覆盖额外参数和训练复杂度?这些问题比继续在十张模拟场景上多争零点几分更重要。

对做计算成像、近眼显示、可微渲染的团队,这篇论文提供了一个明确可复用的思路:把物理上重要、数学上连续、参数上便宜的自由度塞进显式原语,再用硬件采样规律约束它。对普通读者,它则展示了全息技术的一个本质——真正决定“光在哪里成像”的,不只是亮度图案,更是看不见的相位结构。

十二、龙迷三问

第一问:0.33 dB值不值得兴奋?如果把它当成一次革命,不值;如果考虑每个高斯只增加一个参数、十个场景和多项指标方向一致、等参数基线仍被超过,它是一项扎实的表示效率改进。西门子星单例的3.04 dB说明,高频内容上潜力可能显著高于自然图像平均值。

第二问:曲率参数会不会越多越好?未必。按颜色甚至按更高阶相位增加参数,理论上能提升表达力,也会加重优化难度与采样风险。本文最有说服力的部分恰恰是一个参数配一个严格上限,而不是无限扩张自由度。

第三问:它能马上进入全息眼镜吗?还早。现有结果来自640×480模拟传播、两个深度平面和静态内容;真实光学平台、器件校准、散斑、动态帧率与高分辨率成本都未完成验证。它更像一块值得继续搭建的表示模块,而不是已经封装好的显示产品。

十三、总结

这项工作把平面复高斯升级为复值二次相位高斯:曲率塑造局部波前,马氏距离对齐相位与振幅,自适应上限避免混叠。十个场景的结果说明,给单个原语增加一个物理上对路的参数,比把相同预算全部换成更多平面高斯更有效。

如果只记住一句话,可以记这一句:全息高斯的下一步,不只是“铺得更多”,而是“让每一团光拥有正确的波前”。

本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。

论文指标均来自原文模拟实验,具体设置与解释请以论文为准。

主要参考:
https://arxiv.org/abs/2609.11434
https://arxiv.org/abs/2403.17888
https://arxiv.org/abs/2308.04079

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球