原文标题:3D Point Splatting for mmWave Radar Novel View Synthesis
首次公开:2026年9月11日(北京时间)
主要署名单位:康奈尔理工学院(Cornell Tech,经论文首页核验)
原文链接:
https://arxiv.org/abs/2609.11894
龙哥导读
相机的新视角渲染,大家已经见过不少;但把镜头换成毫米波雷达,事情立刻变味了。雷达不只记录“哪里亮”,还记录复数相位、天线阵列、传播距离与材料散射。康奈尔理工学院这项工作没有把雷达硬塞进光学渲染框架,而是从雷达方程出发,做出一种可微的三维点泼溅:六个室外场景平均只训练约3分钟,留出视角的距离—方位图相关性达到0.587,同时保留从一份场景生成原始采样、复数距离剖面和距离—方位图的能力。亮点很硬,边界也很清楚:它依赖配准激光雷达、主要处理静态室外场景,并采用单次反射假设。
先抛一个具体问题:如果自动驾驶车辆只在一条道路上采过少量毫米波雷达数据,能不能像移动虚拟相机那样,换到一个没采过的位置,合成那里应该看到的雷达回波?
这件事的价值并不玄学。真实雷达数据贵、车型和阵列配置差异大,雨雾、灰尘、遮挡与稀有危险场景又很难反复采。新视角合成如果可靠,就能补充训练视角、构造传感器仿真数据,也能帮助研究者检查同一场景换个位置后,回波结构是否仍然一致。
但雷达不是“黑白相机”。相机像素大体回答颜色和亮度;调频连续波雷达接收到的是多发射、多接收天线共同形成的复数信号。只拟合最终雷达热力图,可能看起来像,却无法保证相位、旁瓣、天线方向图和中间信号产品仍然对。这正是本文选择重新设计渲染原语,而不是继续套用光学神经渲染的原因。
图1|论文核心总览。上半部分比较蒙特卡洛光线追踪、光学新视角方法迁移与本文方法:前者物理可信但慢,后者快却丢相位,本文方法试图同时满足物理建模、复数输出和多视角可优化。下半部分展示同一场景生成的距离—方位图、原始采样幅度与按材料参数着色的点云。来源:论文 Figure 1。
一、为什么毫米波雷达的新视角这么难
第一个难点是回波高度稀疏,而且常带镜面反射特征。在60—77吉赫兹附近,汽车外壳、路牌、护栏与建筑表面并不会像漫反射墙纸那样均匀返回能量。传感器姿态略变,强回波可能就从一个位置跳到另一个位置。把这种现象当普通图像纹理插值,很容易得到“形状差不多、物理上不连贯”的结果。
第二个难点是多数商用雷达的垂直孔径有限。常见距离—方位图把高度方向积掉,监督近似二维;训练视角通常又只有少数几个。也就是说,模型面对的是“少视角、少回波、少高度信息”三重稀疏。论文明确指出,在这种设定下,仅凭距离—方位图反推完整三维结构并不现实。
第三个难点是相位。复数雷达信号既有幅度,也有相位。相位与传播路径长度直接相关,后续的距离快速傅里叶变换、方位变换、窗函数和天线排列都会用到它。丢掉相位以后,模型还能拟合一张功率图,却很难回到原始模数转换采样,不能自由替换天线方向图或信号处理链。
传统可微蒙特卡洛光线追踪知道这些物理过程,也能显式处理材料和复数信号;代价是太慢。论文给出的同硬件参考中,Sionna雷达光线追踪器在500次迭代预算下,单一视角拟合约需27.3分钟。新视角合成却要同时优化多个位置,时间会继续叠加。
另一边,Radar Fields、雷达高斯泼溅和另一条隐式路线训练更快,因为它们把问题压缩成最终功率图的拟合。它们对新视角合成很重要,却没有同时做到“显式材料模型、复数输出、多视角可承受”。论文把这三个条件放在一张表里,核心矛盾一下就清楚了:真正缺的不是又一种更大的网络,而是一种适合雷达信号链的快速可微原语。
二、三维点泼溅的答案:带方向、带材料、带相位的点
三维点泼溅方法(3DPS)是论文提出的雷达原生表示。这里的“点”不是只有坐标的小圆点。每个点至少携带四类信息:三维位置、表面法线、代表的表面积,以及一组材料参数。材料部分遵循国际电信联盟无线电通信部门的P.2040建议书,包括复介电常数的实部和虚部、表面粗糙度、相关长度、散射混合权重与材料厚度。
为什么不用常见三维高斯?因为光学高斯泼溅最擅长的是把一个椭球投影成屏幕上的二维椭圆,再做透明度混合;而雷达方程需要明确的散射位置、法线、入射方向、出射方向和材料。论文的选择很朴素:既然雷达物理最终要在表面散射点上计算,那就直接用带方向的点来承载它。
几何初始化来自配准的激光雷达点云。作者先做方位锥裁剪、遮挡射线检查、按法线余弦重采样与最远点采样,最终保留2万个带方向点。训练时,位置只允许围绕激光雷达脚手架小幅调整,法线、面积和材料则根据雷达监督优化。
图2|根据论文 Figure 2 重绘的竖版流程。读图顺序从上到下:激光雷达脚手架→每点物理参数→逐收发天线对计算→15格点扩散函数泼溅→方位变换→输出多种雷达产品。重绘只改变排版,不改变步骤和数值。
一轮前向渲染可以拆成六步。第一步,读取某个发射天线、接收天线与三维点之间的几何关系。第二步,根据点的法线判断它是否朝向接收端。第三步,用材料模型求相干镜面项和非相干漫散射项。第四步,把传播距离、天线增益与材料散射合成复数振幅。第五步,把这个复数相量泼进距离轴附近15个格子。第六步,把所有虚拟天线的复数距离剖面堆起来,做方位快速傅里叶变换,得到距离—方位图。
这条链的关键是“复数信息一直在”。最终训练损失虽然只比较距离—方位图的幅度,但渲染器内部的传播相位来自几何路径,而不是让网络随便学一个隐藏向量。因此,优化完成后,同一场景可以经过标准信号处理得到复数距离剖面、原始采样包络和距离—方位图,不需要针对每一种产品重新训练。
三、关键公式一:一个点怎样变成复数回波
论文从标准雷达方程出发。下面这张公式卡保留了决定读者理解的主干:波长、发射功率、收发天线增益、往返距离、散射截面与传播相位。复杂的下标看着吓人,直觉其实很简单——一个点能返回多少能量,取决于“发出去多少、天线朝哪、路有多远、材料怎么反射”;返回波落在复平面的哪个角度,则由传播路程决定。
公式1|论文式(1)的紧凑写法。距离项控制衰减,材料散射截面控制回波强弱,指数项记录传播相位。相位不是装饰,它决定不同点、不同天线与不同距离格之间如何相干叠加。
式中的两个距离分别是发射天线到散射点、散射点到接收天线。它们既出现在分母里控制振幅衰减,也出现在指数相位里。两个几何位置看似只差一点点,到了毫米波波长尺度,相位就可能发生明显变化。这也是为什么“把雷达图当灰度图生成”会漏掉重要结构。
材料散射截面也不是单个可学习颜色。3DPS把它拆成菲涅耳反射系数、粗糙度衰减的相干镜面项、非相干漫散射项,以及两类近似的混合。光滑金属、粗糙混凝土、不同入射角,对能量和方向的影响不同。优化后的参数仍能映射回物理含义,这比完全不透明的特征向量更容易编辑和检查。
当然,“可解释”不等于“自动识别真实材质标签”。训练只拿幅度图监督,材料参数与法线之间可能存在补偿关系;某个点参数变了,说明它帮助拟合了雷达响应,不等于系统已经认出那是钢、玻璃或混凝土。论文也把这些可辨识性问题放进局限部分。
四、关键公式二:为什么“泼15格”能把速度拉下来
如果严格在每个采样时刻合成调频连续波,再做距离快速傅里叶变换,每个点都要参与大量时间采样,成本大约与“点数×采样数”成正比。3DPS利用线性性,把快速傅里叶变换提前分解:一个点在距离频域中对应一个已知形状的点扩散函数,只要直接把复数贡献写到附近距离格即可。
公式2|论文式(4)的主干。每个可见点的面积、复数振幅与Hann点扩散函数相乘,再累加到复数距离剖面。默认核长度L=15,即每点只更新最近15个距离格。
这里的“小数距离格”很重要。真实传播距离通常不会刚好落在某个整数格中心。如果直接四舍五入,能量会跳格,优化也会不连续。点扩散函数根据小数偏移调整15个格子的权重,相当于保留窗函数快速傅里叶变换应有的频谱泄漏形状。
于是,每个点、每个收发天线对,不再合成完整时间序列,只执行一次固定长度的散射加法。复杂度由“点数×采样数”降到“点数×15”。论文进一步把材料计算、泼溅和解析反向传播融合成三个显卡计算内核,并利用多输入多输出阵列中的公共几何量减少重复计算。
这个加速不是删掉雷达物理,而是把标准信号链中可预计算、可交换顺序的部分整理出来。这也是本文最值得工程团队借鉴的地方:很多“物理模型太慢”的问题,未必只能用黑箱网络替代;有时更好的办法,是找到与硬件数据结构相匹配的稀疏算子。
五、Radar Fields与RadarSplat铺了什么路,3DPS又补了什么
理解3DPS,不能把前两条路线只当成“被超过的基线”。它们分别解决了毫米波雷达神经表示中的关键难题,3DPS正是在这些工作之后,把目标推向“多种信号产品、显式材料和快速优化同时成立”。
Radar Fields的贡献,是把雷达学习从传统点云处理推进到频率空间神经场。它用隐式网络表示占据与反射特性,让物理传感器模型直接解释原始调频连续波观测,不依赖光学体渲染那套密集采样。它证明了二维雷达扫描可以支持更丰富的三维占据重建,也展示了恶劣天气下毫米波感知的价值。
但放到本文的稀疏视角同基准里,Radar Fields主要监督最终距离—方位幅度,场景表征是隐式特征,不输出复数距离剖面与原始采样。在六场景留出视角上,它的平均相关性为0.133,训练约1.63分钟。它很快,却没有承担本文要求的完整产品链。
雷达高斯泼溅方法(RadarSplat)的贡献,是把三维高斯泼溅带进雷达数据合成与场景重建,并认真处理噪声、占据和雷达成像特点。它把快速显式原语引入自动驾驶雷达,强调多径、饱和等高噪声现象,而不是简单复制彩色图像高斯。相较此前方法,它在自己的任务与数据上报告更好的图像合成和几何重建。
但RadarSplat的高斯仍面向功率型距离—方位图,材料和相位没有显式进入可编辑信号链。在3DPS采用的六场景同基准中,它的留出视角相关性为0.339,平均训练约19.74分钟。3DPS保留了“快速显式点原语”的方向,却把椭圆投影改成沿距离轴的复数点扩散函数泼溅,并把材料模型与传播相位接回来。
图3|三条路线的关系。Radar Fields强调频率空间神经场,RadarSplat强调雷达高斯与噪声建模,3DPS则把带材料的定向点、复数相位和标准信号链组合起来。时间和相关性数字来自3DPS论文在统一六场景设置下的表格,不代表对三篇论文全部任务的总排名。
把三篇论文连起来看,路线演进很清晰:先证明雷达可以拥有自己的神经场,再证明显式泼溅原语能服务雷达重建,接着追问——能不能不牺牲相位与材料物理,还保持多视角训练速度?3DPS给出的答案是“能做到一部分,而且结果明显更好”。
这里仍要避免一个误解:0.587不是“准确率58.7%”,也不是说生成雷达可以替代真实测量。Pearson相关性衡量预测图和真实图的线性结构一致程度;数值越高,强弱分布越同步,但它不能独立说明绝对幅值校准、稀有目标真实性和下游检测性能。
六、实验数字怎么读:强在哪里,又没有证明什么
实验使用科罗拉多雷达数据集的六个室外静态场景。每个场景选8个训练帧,并保留中间一个未参与训练的视角做测试。训练默认500次Adam迭代,2万个点,单张英伟达4090显卡。论文报告的平均训练时间是3.17分钟,场景范围2.3—3.7分钟;摘要将其概括为约3分钟。
在留出视角的距离—方位幅度图上,本文方法平均Pearson相关性0.587、峰值信噪比28.8 dB、结构相似性0.734、归一化均方根误差0.0369。三条光学式迁移基线中,RadarSplat相关性0.339、Radar Fields为0.133、另一条隐式基线为0.112,因此0.587约为它们的1.7倍到5.2倍。
图4|留出视角平均相关性。本文方法为0.587,RadarSplat为0.339,Radar Fields为0.133,另一条隐式基线为0.112。图表按论文 Table 2 重绘。
训练视角上的差距更大:本文方法相关性0.812,RadarSplat为0.365,Radar Fields为0.218,另一条隐式基线为0.033。更值得注意的是,只有本文方法能在同一场景中报告复数距离剖面和原始采样相关指标:测试复数距离剖面幅度相关性0.603,原始采样包络相关性0.613。
相位也做了检查。论文使用对绝对相位偏移不敏感的相对相位一致性指标,测试时距离方向为0.371、虚拟天线方向为0.434、原始采样时间差分为0.414,随机参考是0。数字不算完美,却至少说明复数链条不是只在接口上“有一个虚部”,而是保留了可测的相对相位结构。
图5|论文 Figure 3。列是六个ColoRadar场景,行依次是真值、本文方法、RadarSplat、Radar Fields和另一条隐式基线;每格叠加该帧相关性。本文方法更稳定地恢复主要高能结构,但仍存在回波变弱、局部扩散与细节遗漏。
逐列看图5,比只看均值更有用。真值中的亮弧、道路边缘和集中反射,在3DPS行通常能找到位置对应;部分基线会把能量涂得更散,或只剩少数亮块。六个测试场景里,3DPS相关性从0.508到0.657,并非每个场景都接近满分。
消融实验也给出几个有意思的反直觉结果。把点数从2万增到5万,测试相关性反而从0.587降到0.538,时间增到5.1分钟;1万个点已达到0.586。这说明当前瓶颈不是“点越多越好”,更多点可能让幅度监督下的优化更难约束。
只用2个训练视角,相关性仍有0.573,训练仅0.9分钟;4个视角为0.575,6个视角为0.586。这个结果支持方法对稀疏视角的适应性,但不能推出任意道路、任意视角都只需两帧。六场景规模不大,几何脚手架又来自激光雷达,数据分布仍较受控。
关闭自适应点密度,相关性降到0.553;不用多输入多输出几何分解,降到0.555且时间变为5.3分钟;不做载波相位梯度分离,降到0.537。相反,移除遮挡射线检查竟达到0.600,略高于默认设置。论文如实保留这一结果,说明初始化与遮挡策略仍有优化空间,而不是每个模块都单调贡献。
七、3分钟很亮眼,但工程落地要先看四条边界
第一,3分钟是单场景优化时间,不是通用模型一次训练后到处生成。换一个场景,需要新的配准点云、雷达观测与位姿,再做一次场景级拟合。它更像快速建立一个可编辑的数字雷达场,而不是开箱即用的全球雷达基础模型。
第二,方法依赖配准激光雷达。这份几何先验解决了距离—方位监督缺少高度信息的问题,也把困难从“无中生有恢复三维”改成“在可信几何上学习雷达材料与细微修正”。如果激光雷达漏扫、标定偏差或位姿错误,问题会沿脚手架传到渲染结果。
第三,单次反射假设对室外静态场景更友好。地下车库、室内走廊、金属密集区域可能存在强多径;车辆和行人运动还会引入多普勒与时变几何。当前系统没有把多次反射、动态对象与完整多普勒合进主实验,因此不能把结果直接外推到所有毫米波雷达环境。
第四,训练只使用距离—方位幅度损失。复数相位来自几何前向模型,这带来产品无关的优势;但未被幅度监督唯一约束的绝对相位、材料参数与法线,仍可能出现多解。论文用相对相位指标和材料、法线可视化做检查,却没有把“物理可解释”包装成“参数都是真实测量值”。
此外,实验比较集中在六个ColoRadar场景,论文没有证明合成数据已经提升下游目标检测、自由空间估计或规划。对产品团队来说,这一步非常关键:渲染指标好,不代表训练出来的感知模型一定更安全。下一阶段应把“图像像不像”接到“检测是否稳、极端天气是否真有收益、错误是否可控”上。
八、龙哥点评:这篇论文真正值钱的,不只是0.587
把最近几类泼溅工作放在一起看,一个趋势越来越明显:大家不再满足于“把彩色相机的三维高斯换个数据集”。烟雾场景会追问成像链和介质,热红外会追问温度与辐射,毫米波雷达则必须追问信号相位、天线阵列与材料散射。传感器一变,正确的原语和损失也应该跟着变。
这篇工作的第一价值,是找对了抽象层。它没有在蒙特卡洛光追和纯黑箱神经场之间二选一,而是把雷达方程离散到带方向点,再用固定长度点扩散函数完成稀疏写入。物理可信与计算高效并非天然对立,关键是能否找到可交换、可预计算、可并行的那一步。
第二价值,是输出接口更接近真实雷达工程。很多论文只给最终热力图,换一种窗函数、天线方向图或阵列配置就要重新学习。3DPS保留复数距离剖面,标准快速傅里叶变换前后的产品能互相转换,理论上更适合做传感器配置研究和信号链调试。
第三价值,是时间成本真的进入了可迭代区间。约3分钟仍依赖高端显卡,但与多小时的多视角物理拟合相比,已经从“离线研究演示”靠近“团队可以反复调参数”的范围。对研究生和小团队而言,迭代频率往往比一次跑出的最高分更决定项目能不能做下去。
不过,龙哥不会因为3分钟和0.587就直接给出“可替代采集”的结论。当前实验仍是静态室外、小规模场景、激光雷达辅助、单次反射。真正落地还要跨过动态目标、多径、跨雷达硬件、标定误差、下游任务收益和安全冗余。漂亮的渲染图只是第一关。
如果是做自动驾驶仿真、雷达数字孪生或多传感器研究的团队,这篇论文值得细读,因为它提供了一条“物理模型如何落到显卡稀疏算子”的完整范例。如果只是寻找无需激光雷达、输入几帧雷达就恢复任意动态世界的通用系统,那它还不是答案。
九、龙迷三问
问一:既然训练损失只看幅度,复数输出可靠吗?
比完全丢相位的模型多了一层物理约束,因为相位由传播距离和雷达方程生成;论文的相对相位指标也显著高于随机参考。但绝对相位未被唯一约束,不能把它等同于经过完整硬件标定的真实原始信号。
问二:为什么不用更多点把结果继续堆高?
消融显示5万个点反而低于2万个点。幅度监督、位置锚定、点密度和材料自由度之间需要平衡;点太多可能增加冗余和多解,训练时间也更长。高效表示追求的是足够表达,不是无上限堆容量。
问三:它会减少真实雷达数据采集吗?
短期更可能用于补充视角、做可控仿真和压力测试,而不是替代真实采集。只要动态、多径、硬件噪声与长尾目标还没被充分验证,合成数据就应该是补充证据,不是安全关键系统的唯一依据。
十、总结:从“生成一张雷达图”走向“渲染一条雷达信号链”
3DPS用2万个带方向、带材料的三维点承载场景;用雷达方程生成复数振幅;用长度15的Hann点扩散函数把每个点写入距离格;再通过标准快速傅里叶变换得到距离—方位图。它把一次场景优化控制在约3分钟,并在六个留出视角上达到0.587平均相关性。
与Radar Fields相比,它减少了不透明隐式特征,补上显式材料与复数产品;与RadarSplat相比,它从功率图高斯渲染推进到雷达原生的复数点泼溅。真正的核心亮点,是同一份优化场景能沿标准信号链生成原始采样、复数距离剖面和距离—方位图,而不是只产出一张最终热力图。
它还不是完整雷达世界模型:需要激光雷达脚手架,主要面向静态室外和单次反射,也没有证明合成数据已经改善下游安全任务。但作为一种雷达原生可微渲染器,它把物理、速度与多产品输出拉到了一条可讨论、可迭代的工程线上。这个方向,值得继续追。
本文依据原论文及公开资料整理。实验数字均为论文报告结果,本文未进行训练或指标复现;文章用于技术解读,不构成对安全关键部署的背书。
原论文:
https://arxiv.org/abs/2609.11894
RadarSplat:
https://arxiv.org/abs/2506.01379
Radar Fields:
https://arxiv.org/abs/2405.04662