← 返回 PaperDaily 视觉与图像

29个检测器12个数据集实测:自动驾驶存储减负新范式

这篇文章切入角度很刁钻:别人都在优化模型算力,它却盯上了摄像头到内存的搬运能耗。用一个带语义感知的存储编码器,在保护行人检测精度的前提下,把前视相机接口能耗砍掉约36%,而且跨29个检测器、12个数据集验证,落地感很强。

29个检测器12个数据集实测:自动驾驶存储减负新范式
原论文信息如下:
论文标题:
Coding What Matters: A Semantic-Aware Memory Interface for Energy-Efficient Perception in Autonomous Vehicles
发表日期:
2026年08月
发表单位:
没有(未在论文第一页找到明确单位信息)
原文链接:
https://arxiv.org/pdf/2608.29000v1.pdf

一辆自动驾驶汽车,周身摄像头每秒吞吐海量画面。这些画面在被神经网络“看懂”之前,得先写进内存、再读出来。就这么一段“搬运”过程,耗掉的能量比你想象中大得多,而且它跟画面内容里的行人重不重要,毫无关系。
这篇论文提出的 MotiMem-Ω,就是要给这条数据通路做“语义感知”的瘦身:天空和路面背景可以狠砍精度省电,行人和骑行者则必须重点保护。最终在保住90%检测精度的同时,把前视相机接口能耗降了约36%,还挺实在。

自动驾驶的隐形能耗:传感器到存储器的数据通路

现在业界谈自动驾驶效率,十有八九在聊网络算力、模型压缩、量化剪枝。这些手段确实让神经网络跑得更快更省,但它们管的是“帧已经存好之后”的事。在一个典型的自动驾驶感知系统里,摄像头先把原始帧写进 DRAM 或 SRAM 帧缓冲,再读出来交给检测器。这一写一读,数据在总线上来回跑,每一比特的翻转都在消耗能量。
这里有个反直觉的点:存储能耗跟像素的“语义价值”没有任何关系。一个行人、一辆车、一段路面、一片天空,在字节层面都是0和1,存储单元充放电、总线电平翻转,消耗的能量由“1”的数量和相邻比特翻转次数决定。一个像素再重要,也得老老实实变成位串在内存里躺着。
随着摄像头数量和分辨率不断堆高,这条传感器到存储器的数据通路能耗越来越扎眼。而现有的低功耗方案,要么是均匀地丢位(不管内容是什么都一视同仁),要么是搞熵编码压缩文件大小,但文件变小了不代表存进内存的字节模式更省电——熵编码后的比特流“1”密度往往接近一半,翻转还可能更频繁。

语义感知编码:让存储接口理解交通场景

MotiMem-Ω 的核心思路很朴素:人类司机不会用同样的注意力看路上的每个像素,那么近似帧缓冲也不该一视同仁。代码里内置了一个“语义重要性场”,把交通参与者看作决策关键证据,其中行人、骑行者、摩托车手(也就是弱势道路使用者,VRU)需要最强的精度保护;而天空和空旷背景属于低风险区域,可以大胆降精度省电;路面和地面则保持保守的高精度,因为远处或尚未被检测到的道路使用者很可能出现在地面上。
这里有个关键设计细节:语义重要性场不是靠一个额外的重网络现场算出来的,而是复用感知栈已有的检测结果。当前帧的字节流要写入内存,但上一帧的检测框可以作为“哪些地方值得保护”的先验。考虑到自车和物体都在运动,论文用自车运动补偿加匀速模型,把上一帧的检测框投影到当前帧坐标系下,这样即使物体移动了,保护区域依然能罩住它。整个流程可以参考论文的管线总览图。
图2:MotiMem-Ω编码管线总览:第t-1帧检测结果生成语义重要性场,再经过分层分层编码(加上天空先验),写入DRAM/SRAM帧缓冲,解码后送入感知模型;重要性场通过自车补偿的运动模型从第t-1帧投影到第t帧。
图2给出了整个编码管线的数据流。上一帧的检测结果经过运动补偿投影,得到一个块级别的重要性场;再结合一个轻量分割网络产出的天空掩码,形成分层的语义精度分配;最后在字节层面做格雷编码、选择性翻转和位丢弃,写入帧缓冲。整个过程是一个闭环:当前帧解码后送给感知模型,感知模型输出的检测结果又成为下一帧的重要性场先验。

分层精度分配:从VRU安全下限到天空激进截断

论文把重要性场转换成一个分层的精度分配问题。每个图像块根据它覆盖的检测类别、尺度、位置和置信度,得到一个重要性分数。然后通过一个带约束的能量-失真优化,决定每个语义层使用多少比特精度。对象层用接近无损的 k=7,背景层用 k=5,天空层则激进地压到 k=2。
这里有个挺妙的细节:对象层虽然用了接近无损的精度,但它的编码方式是“翻转最低有效位”,也就是重建误差只有±1,所以对象区域的检测精度几乎不掉。而字节级编码用格雷码减少相邻电平翻转,再配合选择性反转把“1”多的码字变成“0”多的码字,这样写进内存的字节流天然就是低能耗的。
比较有意思的是校准实验揭示的规律:对象精度的选择是“精度受限”,背景精度的选择是“拐点受限”,而天空精度的选择纯粹是“能耗受限”。论文在图3的工作点扫描中展示了这些规律。k=7之所以是对象层的最优选择,一方面它是可用的最高精度,另一方面7是奇数,不存在“一半位数是1”的平局情况,能让翻转操作把位密度压得更低。而天空从k=5降到k=2,用大约3个百分点mAP的代价,换来了整个帧里最便宜的能耗。
图3:跨数据集工作点扫描(12个数据集×29个检测器),用于确定固定配置。每个子图改变一个设计变量并绘制保留率与能耗代理的关系,星标为选中点。(a)对象精度k_obj:所有可用值k≤7都是接近无损的(±1位翻转,平坦的约98%保留率),k=7既是最高精度又是奇数k低位密度点。(b)背景精度k_bg:保留率在k=5后饱和,k=6时ρ1跳升,因此选k_bg=5。(c)天空精度k_sky:天空从未截断的k=5降到k_sky=2,以较小精度代价换来能耗收益。(d)块模式权重λ:组合能耗在λ=1时最小。(e)RoI膨胀:VRU召回率在20像素处饱和。

跨数据集全面验证:29个检测器、12个数据集、39个模型的统一评估

这篇论文的验证规模相当扎实:29个检测器、12个驾驶数据集、5个占用预测模型、5个分割网络,外加约10种编码基线。数据集横跨五大洲,涵盖白天、夜晚、雪天、沙漠等不同场景。论文报告说,MotiMem-Ω在全部模型上都保持了一致的精度保留,而且所有编码配置是固定的,没有针对某个数据集单独调参。
先说检测任务。在12个数据集上,MotiMem-Ω保留了90%的mAP和91%的VRU召回率,而基线方案只有83%/79%,能耗匹配的朴素截断只有80%。图1展示了检测精度与内存接口能耗的权衡全景。
图1:12个驾驶数据集上的检测精度与内存接口能耗权衡。纵轴为mAP保留率(29个检测器各自相对原始帧检测结果的度量,再在12个数据集上取平均);横轴为归一化位1密度ρ1,即内存接口能耗代理。MotiMem-Ω在能量降低方法中给出最强的精度-能耗权衡,在ρ1≈0.48时保留约90%的mAP,而能耗匹配的截断(均匀4位、全局k=4)和基线在相同或更高能耗下损失7到10个百分点的精度,图像编解码器则位于ρ1≥1且无内存节省。
值得注意的是,MotiMem-Ω的PSNR只有25.0 dB,在所有编码方法里几乎是最低的,但任务保留率却最高。这说明它把比特预算花在了对象上,而不是人类视觉关注的背景保真度上。图像编解码器(JPEG、WebP等)能把PSNR做到40-57 dB,但ρ1都大于等于1,也就是说完全没有内存接口能耗节省。
表2给出了完整的检测对比结果,可以看到MotiMem-Ω在12个数据集上全部领先,AV2和BDD这两个数据集的mAP提升最明显,都超过了10个百分点,说明语义分配在复杂城区和夜间场景效益最大。而VRU召回率上的优势,则直接关系到自动驾驶的安全底线。
表2(第一部分):全面检测对比:每种编码方法(行)在每个指标上,对29个检测器取平均。左块:每个数据集的mAP保留率加平均值;右块:聚合所有类别的召回率(全类和VRU),以及图像质量指标。所有数值都是相对原始帧预测的保留率。 表2(第二部分):全面检测对比扩展,包含更多数据集列和能量代理指标。 表2(第三部分):全面检测对比的图像质量列,显示MotiMem-Ω的低PSNR但高任务保留特性,以及编解码器的高PSNR但无能量节省。 表2(第四部分):全面检测对比的剩余列,包括每个方法的能量代理和最终平均指标。
图4是定性对比,可以直观看出MotiMem-Ω(红色框)保留住了基线和朴素截断方法丢失的检测目标。特别是那些从上一帧检测框移出去的目标,基线因为缺少运动补偿的闭环,会把它们截断掉。
图4:12个数据集(行)×七种编码方法(列)的定性检测结果,使用原生YOLO26框显示在解码帧上。MotiMem-Ω(红色)保留了基线和朴素截断方法丢失的检测:基线没有运动补偿闭环,因此移出上一帧RoI的目标被截断丢失,而MotiMem-Ω的分层分配能保留它们。图像编解码器改变比特流但不影响预测。覆盖雪天(CADC)、夜晚(BDD)和晴天场景。
再看分割任务。五种分割架构下,MotiMem-Ω比能耗匹配的朴素截断平均高出4.9到9.0个百分点。在DeepLabV3上跨12个数据集的平均优势是4.8个百分点。图5的可视化更能说明问题:MotiMem-Ω(第二列)复现了原始标注,几乎不产生错误像素。
图5:七种编码方法(列)下五种分割架构(行)的语义分割定性结果,基于一个nuScenes帧。每个格子将模型的分割图融合在解码帧上;相对于原始帧分割图类别改变的错误像素以红色高亮显示,并标注错误百分比。MotiMem-Ω(第二列)在所有五个模型上都以几乎零错误复现了原始标注。
3D占用预测是另一个亮点。在五个SOTA占用模型上,MotiMem-Ω保留了98.2%到99.9%的原始得分,而基线和朴素截断要损失2到7个百分点。特别在几何敏感的GaussRender模型上,MotiMem-Ω保留了99.7%,基线只有94.8%。这说明密集的体素级感知,恰恰是语义分配最能发挥作用的场景。图6的占用可视化同样展示了这一优势。
图6:五个SOTA模型(行)上的3D占用预测结果:BEV(上)+ 3D(下),分别对应原始输入、MotiMem-Ω(红色)、基线和JPEG;改变的体素以浅蓝色高亮。每个列标题给出保留率(占模型原生mIoU/RayIoU的百分比)和位1密度ρ1。MotiMem-Ω是唯一同时做到高保留率(98.2%-99.9%)和低能耗(ρ1=0.6)的方法。
论文还做了一个很有意思的跨任务分析:语义分配带来的优势,会随着感知输出密度的增加而放大。稀疏的、基于目标的检测比较宽容,因为检测器对整体目标做推理,能容忍背景被过度简化;但逐像素和逐体素的密集感知就不一样了,它们要读取每一个位置,均匀截断把背景压平,就等于重写了密集标签或体素场。这个规律解释了为什么MotiMem-Ω的PSNR虽低,但任务精度反而高。

这里先解释两个贯穿全文的关键概念。第一个是位1密度(bit-1 density,ρ₁),它衡量的是存储的字节流里,有多少比特是“1”。为什么关心这个?因为在DRAM和SRAM中,给存“1”的单元充电比存“0”更耗能,这是芯片物理特性决定的。第二个是翻转活动(switching activity,α),它衡量的是相邻比特之间发生0→1或1→0变化的频率。数据总线上的每次电平翻转都会消耗动态能量,遵循公式E∝CV²。这两个量共同决定了传感器到存储器这条路径上的接口能耗,但它们跟像素的语义价值毫无关系。
JEDEC在DDR4标准中官方化的数据总线反转(Data Bus Inversion,DBI)技术,就是利用了这个物理特性:当一条字节线上“1”的数量超过一半时,对整个字节取反并用一个额外标志位记录,这样大部分比特都变成“0”,从而降低写功耗。MotiMem-Ω的字节级编码,正是把这种工业级省电思路从总线扩展到了整个帧缓冲的存储模式上。
图1展示了论文最核心的成果:在12个驾驶数据集上,MotiMem-Ω以不到0.5的归一化位1密度,保住了约90%的mAP。相比之下,能耗匹配的朴素截断(uniform 4-bit、global k=4)和会议版基线在相同或更高能耗下,精度损失了7到10个百分点。而JPEG、WebP这些图像编解码器虽然精度保持得很好,但ρ₁都大于等于1,在内存接口能耗上完全是负收益。
图1:12个驾驶数据集上的检测精度与内存接口能耗权衡。纵轴为mAP保留率(29个检测器各自相对原始帧检测结果的度量,再在12个数据集上取平均);横轴为归一化位1密度ρ₁,即内存接口能耗代理。MotiMem-Ω在能量降低方法中给出最强的精度-能耗权衡,在ρ₁≈0.48时保留约90%的mAP,而能耗匹配的截断和基线在相同或更高能耗下损失7到10个百分点的精度,图像编解码器则位于ρ₁≥1且无内存节省。
这里有个特别反直觉的现象:MotiMem-Ω的PSNR只有25.0 dB,是所有编码方法里几乎最低的,但任务保留率却是最高的。这意味着它的目标从来不是让画面看起来漂亮,而是把比特预算花在“机器要看的对象”上。图像编解码器能把PSNR做到40-57 dB,但代价是ρ₁≥1,完全没有内存接口能耗节省。这就是“编码给机器看”和“编码给人看”的本质区别。

能量-精度联合优化:从代理指标到推导的接口能量降低

讲完了方法体系和实验验证,这一节把目光拉回工程落地最关心的问题:位1密度和翻转活动这两个代理指标,到底能转化成多少实际的内存接口能量节省?论文用了一个带系数扫描的内存能量模型来回答这个问题,而不是拍脑袋给一个数字。
模型的核心是上面的公式(2):接口能耗E(b)由三部分组成——位1密度驱动的单元阵列和DBI能耗、翻转活动驱动的I/O总线能耗,以及一个常数项。系数(w₁, w_α, w₀)的取值范围取自低功耗存储文献,DDR4的数据总线反转标准化工作、近似DRAM的品质可配置刷新策略、以及选择性比特丢弃的实测数据,共同约束了这些系数的合理区间。通过在这个区间内扫描系数组合,论文得到的是接口能量降低的一个稳健范围,而不是依赖某一个特定系数值的脆断结果。
公式(2):内存接口能耗代理模型E(b) = w₁·ρ₁(b)/ρ₁⁰ + w_α·α(b)/α⁰ + w₀,其中ρ₁⁰和α⁰是未编码原始帧的位1密度和翻转活动,(w₁, w_α, w₀)是能量分解系数,其合理取值范围取自内存能量文献。
这部分采用了更严谨的评估框架。之前的评估统一使用12个数据集的平均值来比较各方法,而这里把保真度差异和跨数据集差异分开考量。表VI直接给出了推导的内存接口能量降低结果,同时列出了一个与系数无关的降低区间,这个科学严谨的表示方式让结果更可信。
表VI:推导的内存接口能量。从测得的ρ₁和α比值出发,公式(2)的模型给出能量降低ΔE,并附有一个与系数无关的范围。
前视相机位1密度降低52%,对应建模的内存接口能量降低约36%,下限在27%左右。这个数字之所以不是单点值而是一个范围,是因为内存能量模型中的系数(w₁, w_α, w₀)在文献中有一个合理的浮动区间,不同芯片微架构、不同存储工艺下,位密度和翻转活动对总能耗的贡献比例本来就不一样。论文选择了把这种不确定性诚实地暴露出来,而不是用一个虚高的单点数字吸引眼球。
表VII从另一个角度验证了设计的鲁棒性:它系统性地扰动能量相关的设计选择,并交换时间先验,观察指标如何变化。这种敏感性分析在学术论文里并不常见,但它恰恰是工程落地最需要的证据——它告诉我们,如果某个模块失效或者某个参数偏移,系统会优雅地降级还是彻底崩溃。结果是令人放心的:各项指标对设计扰动呈现平滑退化,没有出现灾难性失效点。
表VII:检测设计敏感性。前几行扰动能量相关的设计选择;最后几行交换时间先验。指标归一化到原始帧。
再来看密集感知任务的表现。表IV是五个分割架构的mIoU保留率对比,MotiMem-Ω在每个架构上都领先。特别值得注意的是,它的优势在DeepLabV3上跨12个数据集平均有4.8个百分点,而在个别数据集上最多能拉到10.7个百分点。分割是逐像素的任务,任何背景被过度简化都会直接反映在错误像素上,所以这种一致性的领先很有说服力。
表IV:分割mIoU保留率(相对原始帧分割图)在五种架构上的对比(nuScenes;base = MotiMem [4],G-k4 = 全局k4,Unif = 均匀4位;ρ行 = 位1密度)。Ω(粗体)在每个架构上都领先;JPEG只有在ρ₁≈1(无节省)时才追平。这一优势在12个数据集上也保持一致(DeepLabV3为0.906对比0.858,+4.8个百分点;范围+1.2到+10.7)。
表V展示了五个SOTA 3D占用模型的保留率。占用预测是把整个三维空间划分为体素网格,每个体素预测是否被占据,这种逐体素的输出对输入质量极其敏感。MotiMem-Ω在五个模型上保留了98.2%到99.9%的原始得分,而基线和朴素截断要损失2到7个百分点。在几何敏感的GaussRender模型上,MotiMem-Ω保留了99.7%,基线只有94.8%——这个差距在自动驾驶的感知链路里,可能就是一次有效刹停和一次碰撞的差别。
表V:3D占用保留率(每个模型原生mIoU/RayIoU相对原始的百分比)在五种SOTA模型上的对比(base = MotiMem [4],G-K4 = 全局k4,Unif = 均匀4位;ρ₁行 = 位1密度)。Ω(粗体)在节能方法中保留最多;base和朴素方法损失2-7个百分点,而JPEG只有在ρ₁ > 1(无节省)时才追平。
到这里可以做一个整体判断了。MotiMem-Ω的价值不在于它把某个单一指标刷到了多高,而在于它在“能耗-精度”这个自动驾驶感知的核心权衡上,给出了一个可复现、跨模型泛化、且带有安全下限的系统性方案。29个检测器、12个数据集、5个占用模型、5个分割网络,加上约10种编码基线,这个验证矩阵的广度在同类工作中确实不多见。更难得的是,所有实验用的都是同一组固定配置,没有针对某个数据集单独调参。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?自动驾驶摄像头每帧图像都要写入内存再读回,这条数据通路的能耗不容小觑。
这篇工作最值得看的点是什么?在29个检测器、12个驾驶数据集、5个占用率模型和5个分割网络上,MotiMem-Ω保留了约90%的检测mAP、91%的VRU召回率、超过98%的占用率精度,并将前摄像头位密度降低52%,对应建模的存储接口能量降低约36%。
这篇工作的边界或风险在哪里?优点:1) 提出语义感知的存储接口编码范式,填补了低能耗存储与场景感知感知之间的空白;2) 通过数据驱动的类敏感度权重和VRU安全下限,实现了安全关键内容的保护;3) 跨数据集、跨模型的广泛验证,实验设计全面。缺点:1) 能量估计基于代理指标而非直接硅片测量;2) 节省效果依赖场景中天空/背景比例,城市峡谷场景节省有限;3) 不适用于单目度量深度估计等密集任务。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种语义感知的存储接口编码器MotiMem-Ω,通过构建语义重要性场将检测结果和天空先验转化为块级存储重要性,并采用分层精度分配机制,在降低存储接口能量消耗的同时保持感知精度。

实验合理度:★★★★☆

mAP保留率, VRU召回率, mIoU/RayIoU保留率, 位密度ρ₁, 切换活动α, SSIM, PSNR, LPIPS

学术研究价值:★★★★☆

提出一种语义感知的存储接口编码器MotiMem-Ω,通过构建语义重要性场将检测结果和天空先验转化为块级存储重要性,并采用分层精度分配机制,在降低存储接口能量消耗的同时保持感知精度;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

轻量级numpy/OpenCV变换,无需专用加速器

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1) 能量估计基于代理指标而非直接硅片测量;2) 节省效果依赖场景中天空/背景比例,城市峡谷场景节省有限;

主要参考文献

[1] MotiMem-Ω: Coding What Matters: A Semantic-Aware Memory Interface for Energy-Efficient Perception in Autonomous Vehicles. Haohua Que and Handong Yao. arXiv:2608.29000v1.
[2] MotiMem (conference version): 会议版基线方案,统一以单一精度编码一个感兴趣区域。
[3] Bus-invert coding and DDR4 data-bus inversion (JEDEC标准):低功耗存储接口领域的基础技术,也是本文字节级编码直接参考的工业实践。
[4] 图像编解码器对比组:JPEG、WebP、PNG、JPEG2000、AVIF、HEIF。
[5] 原文链接:https://arxiv.org/pdf/2608.29000v1.pdf

end
看完这篇,是不是觉得“给内存做减法”也挺有讲究?想跟龙哥一起蹲更多自动驾驶节能好活儿,欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 自动驾驶+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。