← 返回 PaperDaily 大模型与智能体

真实驾驶场景SOTA?双光谱Mamba有点东西

这篇论文把车载心率估计从“看天吃饭”往前推了一步:RGB 负责信号强度,NIR 负责抗光照,Mamba 负责长时序建模。更妙的是,它不是只在实验室里自嗨,还专门搞了真实驾驶数据集,挺适合想看落地价值的读者。

真实驾驶场景SOTA?双光谱Mamba有点东西
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文把车载心率估计从“看天吃饭”往前推了一步:RGB 负责信号强度,NIR 负责抗光照,Mamba 负责长时序建模。更妙的是,它不是只在实验室里自嗨,还专门搞了真实驾驶数据集,挺适合想看落地价值的读者。


原论文信息如下:
论文标题:
MS-rPPG: Multi-spectral State Space Model for Remote Photoplethysmography in Driver Monitoring Systems
发表日期:
2026年06月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2606.21115v1.pdf
开源代码链接:
github.com/ziiho08/MS-rPPG

驾驶健康监测新突破:MS-rPPG如何应对复杂光照?

开车这件事,表面上是方向盘和油门,实际上还得盯着驾驶员的状态:困没困、累没累、心率稳不稳。问题是,车里不是实验室,光照一会儿明一会儿暗,脸还总爱左看右看,传统的远程光电容积描记(rPPG,remote photoplethysmography,中文可理解为远程光电容积描记)就很容易“看走眼”。
这篇论文的思路很直接:既然 RGB 视频在光照稳定时信号强,近红外(NIR,near-infrared,中文为近红外)视频在暗光和强光变化下更稳,那就别让它们单打独斗,干脆把两路信息一起喂给模型,再让一个擅长长序列建模的状态空间模型来收拾时间维度上的“烂摊子”。
封面
图2:整体框架图。MS-rPPG 同时输入 RGB 和 NIR 脸部视频,通过跨光谱线性调制(CSLM)先做融合,再交给多光谱 Mamba(MS-Mamba)处理长时序和通道依赖,最后回归远程心率信号。
这类任务最怕什么?不是模型不够大,而是场景太“野”。驾驶场景里,脸部局部区域会因为转头、遮挡、车窗反光、阴影切换而频繁变化;对 rPPG 来说,皮肤颜色里的微弱脉搏波,本来就像人群里的小声说话,再被光照一搅和,基本就只剩“听个寂寞”。所以,真正难的不是估计心率,而是在乱七八糟的环境里,先把可用信号捞出来。
本论文的核心价值就在这里:它不是继续在 RGB 单模态里“卷姿势”,而是把“多光谱”这件事认真做了一遍。RGB 提供更强的脉搏纹理,NIR 提供更强的抗光照能力,两者互补,像一个负责火力输出,一个负责抗揍。再加上 Mamba 的线性复杂度,长视频不至于像 transformer 那样越看越贵,比较适合车载这种要实时、要稳定、还不能太吃算力的场景。

双光谱融合之道:从RGB到NIR的互补优势

先把基础概念捋顺:rPPG 的目标,是从摄像头拍到的人脸视频里,提取出和血容量变化相关的微弱周期信号。人脸皮肤会随着血液流动产生极细微的颜色变化,这些变化肉眼几乎看不见,但模型如果足够会“听”,就能估计心率。
RGB 的优势是信号强,尤其在光照正常时,脉搏波更容易被捕捉;缺点也很明显,光照一变,脸上的颜色信息就跟着变,模型容易把“灯光变化”当成“心率变化”。NIR 则相反,近红外波段受可见光环境影响更小,低照度下更稳,但它对血红蛋白吸收较弱,脉搏信号本身会更弱,信噪比常常不如 RGB。简单说,RGB 像嗓门大但容易受环境干扰,NIR 像嗓门小但抗干扰能力强。
图1:近期基于Mamba的rPPG框架对比
图1:近期基于 Mamba 的 rPPG 框架对比。论文想表达的重点很清楚:以前的 Mamba-rPPG 多数还停留在单模态或较简单的时序建模阶段,而 MS-rPPG 直接把双光谱融合和通道依赖一起处理,思路更完整。
论文没有把 RGB 和 NIR 直接“硬拼接”了事,而是提出跨光谱线性调制(CSLM,cross-spectral linear modulation,中文可理解为跨光谱线性调制)。这个名字听起来有点学术,但本质很像“让一个模态去给另一个模态打补丁”:从源模态提取调制参数,再去动态调整目标模态的特征。这样做的好处是,不是把两路特征一股脑混在一起,而是让它们互相参考、互相修正,避免简单拼接带来的信息稀释。
更妙的一点在于,CSLM 不是瞎调参数,而是先做频域分析。论文把输入信号做快速傅里叶变换(FFT,fast Fourier transform,中文为快速傅里叶变换),再用带通掩码保留 40 到 200 次/分钟这一生理心率范围内的频率成分。也就是说,它先告诉模型:别盯着那些乱晃的灯光和噪声,先看像心跳的那部分。这个设计很像在嘈杂房间里先把“人声频段”挑出来,再去分析说话内容。
图3:Mamba与CSLM结构示意
图3:Mamba 与 CSLM 的结构示意。CSLM 先从源模态里提取调制参数,再对目标模态做线性变换;图里能看出它不是简单加和,而是带有“条件控制”的动态融合。

核心模块揭秘:跨光谱线性调制与多光谱Mamba

这部分是整篇论文最“像样”的地方。先说整体流程:输入的 RGB 和 NIR 视频先经过特征提取器,得到时序特征;然后 CSLM 用一个模态去调制另一个模态,完成跨光谱融合;接着 MS-Mamba 进一步处理时间依赖和通道依赖;最后由回归头输出预测的 rPPG 信号。
如果把这个流程翻成大白话,就是:先把视频拆成有用的局部动作,再让 RGB 和 NIR 互相“校正口径”,最后交给一个既能看长时间变化、又能看通道之间关系的模型统一裁决。这样做比单纯堆 CNN 或堆 transformer 更适合这个任务,因为 rPPG 不是识别一只猫一辆车,而是在长时间里追踪一个非常弱、非常连续、还很容易被噪声淹没的周期信号。
图2:整体框架图
图2:整体框架图再次看一眼会更清楚。两个模态并行进入,CSLM 负责跨模态信息交换,MS-Mamba 负责长时序建模和通道扫描,最后输出心率相关波形。
Mamba 的背景也得顺手解释一下。Mamba 是一种状态空间模型(SSM,state space model,中文为状态空间模型),主打线性复杂度,擅长长序列建模。相比 transformer 动不动就要算一大坨注意力矩阵,Mamba 在长视频上更省算力,也更适合实时任务。论文先回顾了 Mamba 的离散化过程、状态更新和卷积等价形式,核心意思其实很朴素:把连续时间系统变成可训练的离散序列模型,然后利用递推结构高效处理长序列。
但原版 Mamba 也不是万能药。它更擅长沿时间轴建模,却容易忽略通道之间的交互。rPPG 的特征通道可不是摆设,不同通道里可能分别装着颜色变化、局部纹理、频率响应等线索,彼此之间是会“串供”的。于是论文提出多光谱 Mamba(MS-Mamba),把融合后的特征在通道维度上重新组织成序列,再进行双向扫描。这个设计相当于告诉模型:别只盯时间线,通道之间也得挨个问问,看看谁在提供真正有用的脉搏线索。
表3:关键模块消融实验
表3:关键模块消融实验。这里能看出两个结论:一是 CSLM 不是可有可无的装饰,二是通道扫描,尤其是双向通道扫描,对最终效果确实有帮助。
损失函数也比较务实。论文用负皮尔逊相关损失来约束时域趋势,让预测波形尽量和真值波形同步起伏;同时再加一个频域约束,鼓励预测信号在功率谱上和真实心率对齐。这样做的好处是,模型不只是“形状像”,还得“频率对”。毕竟心率估计不是画波形比赛,最后还是要落到频率峰值上。

实车验证:从实验室到真实道路,一次全面的实验评估

这篇论文最让人舒服的一点,是它没有只在“静坐、正脸、光照均匀”的舒适区里打转,而是拿出了两个数据集来验证:一个是公开的 MR-NIRP Car,另一个是作者自己采集的 MS-Drive。后者尤其关键,因为它更接近真实驾驶状态,参与者是真正在车里开车,不是坐着摆拍。对车载健康监测来说,这种数据才更像真刀真枪。
图6:MS-Drive数据采集设置
图6:MS-Drive 数据采集设置。可以看到,RGB、NIR 和 ECG 同步采集,硬件和同步链路都为后续实验打了基础。
图4:MS-Drive数据样例
图4:MS-Drive 数据样例。RGB、NIR 和 ECG 同步采集,说明这个数据集不是拿来“凑数”的,而是为真实生理估计任务准备的。
图5:MS-Drive中不同肤色类型分布
图5:MS-Drive 中不同肤色类型分布。这个分布很重要,因为 rPPG 对肤色、光照和成像条件都比较敏感,数据多样性越高,结论越不容易“偏科”。
实验设置也比较规范:输入视频先切成 160 帧片段,做人脸检测和裁剪,再统一缩放;视频用 DiffNormalized 做差分归一化,减少静态外观差异的干扰;训练时采用公开工具箱,尽量保证和已有方法公平比较。评价指标也很标准,MAE、RMSE、MAPE、Pearson 相关系数和 SNR 都上了,属于“该看的都看了”。
表1:MR-NIRP车载数据集内评估结果
表1:MR-NIRP 车载数据集内评估结果。小运动和大运动两种场景都测了,能比较直观看到 MS-rPPG 的优势不是只在“安静模式”里成立。
图7:MR-NIRP上的预测波形可视化
图7:MR-NIRP 上的预测波形可视化。红色是真值,蓝色是预测值,波形越贴近,说明模型越能抓住脉搏节律。
从表1看,MS-rPPG 在小运动和大运动下都拿到了最优或接近最优的结果,尤其是在大运动场景里,很多方法直接“崩了”,而 MS-rPPG 还能保持相对稳定。这个现象很符合设计直觉:RGB 和 NIR 的互补融合让模型不至于被单一模态的光照波动拖垮,而 MS-Mamba 又把长时序关系抓得更稳,所以在大幅头动下仍能维持较好的相关性和误差水平。
表2:跨数据集评估结果
表2:跨数据集评估结果。模型在 MR-NIRP 上训练,再去 MS-Drive 上测试,考验的是泛化能力,不是背题能力。
跨数据集结果更能说明问题。很多方法在同数据集里看着还行,一换场景就露馅,像考试前背得滚瓜烂熟,换个卷子就开始发呆。MS-rPPG 在 MS-Drive 上的表现依旧最好,说明它不是只适合“自家数据”,而是确实学到了一些更稳健的表征。尤其和近期一些 Mamba 方案相比,它在跨数据集下的误差更低,说明多光谱融合对真实驾驶环境的泛化帮助是实打实的。
消融实验也挺有说服力。去掉 CSLM,性能会明显掉;把通道扫描换成更简单的做法,效果也会变差;不做双向扫描,说明通道依赖没有被充分建模。换句话说,这篇论文不是把一堆花活堆在一起,而是每个模块都在为“复杂驾驶环境下的稳健心率估计”服务,彼此之间有明确分工。

总结与展望:MS-rPPG的潜力与未来方向

整体来看,MS-rPPG 的思路很清晰:用 RGB 和 NIR 的互补性应对车载场景里的光照波动,用频域先验约束跨光谱融合,用 Mamba 把长时序和通道依赖一起建模。它的价值不只是“又做了一个模型”,而是比较认真地回应了车载 rPPG 的真实痛点:场景复杂、信号弱、实时性要求高。
当然,这类方法离真正上车量产还有距离。首先,NIR 传感器和补光硬件会增加系统成本;其次,真实道路环境比数据集更复杂,夜间、逆光、遮挡、驾驶员姿态变化、眼镜反光等问题都可能继续挑战模型;再者,rPPG 估计的是生理信号,不是万能体检仪,离“直接判断疲劳、疾病、情绪”还差好几层验证。
不过,论文已经给出了一个比较有前景的方向:如果未来车载摄像头能和红外补光、座舱感知系统更深度联动,多光谱 rPPG 也许能成为驾驶健康监测链条里的一个稳定传感器。至少从这篇工作看,“只看 RGB”已经不够了,“RGB+NIR+长序列建模”才更像真实世界里的解法

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是车载场景下 rPPG 心率估计不稳的问题,尤其是光照变化大、头部运动频繁时,单靠 RGB 很容易失真。MS-rPPG 用 RGB+NIR 双光谱融合,再配合长时序建模,目标就是让心率估计在真实驾驶环境里更靠谱。

CSLM 和 MS-Mamba 分别是干什么的?CSLM 是跨光谱线性调制模块,作用是让一个模态去调节另一个模态,融合 RGB 和 NIR 的互补信息;MS-Mamba 则负责把融合后的特征沿时间轴和通道轴都建模起来,补上长时序依赖和通道交互这两块短板。

为什么要特意用 NIR,而不是只用 RGB?因为 RGB 在光照变化时容易被干扰,而 NIR 对环境光更不敏感,能在低照度或剧烈光照变化下提供更稳的信号。虽然 NIR 自身脉搏信号也不算特别强,但和 RGB 组合后,能形成互补,整体鲁棒性会更好。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把双光谱融合、频域先验和双向通道扫描放在同一个车载 rPPG 框架里,组合拳打得比较完整,不是那种“换个名字继续卷”的套路。

实验合理度:★★★★☆

同数据集和跨数据集都做了,还专门采了真实驾驶数据,比较能说明问题。若能进一步覆盖更多夜间和极端天气场景,说服力会更强。

学术研究价值:★★★★☆

对车载生理监测和多模态序列建模都有启发,尤其适合后续研究“弱信号+复杂环境”的问题。

稳定性:★★★☆☆

比单 RGB 稳不少,但真实车载部署还会碰到硬件、同步、遮挡和夜间场景的额外挑战,离“随便装上就能跑”还有距离。

适应性以及泛化能力:★★★★☆

跨数据集结果不错,说明泛化能力比很多只会在自家数据上表演的模型更强,但不同车内环境仍可能带来分布偏移。

硬件需求及成本:★★★☆☆

Mamba 本身不算太吃算力,但 NIR 摄像头和补光方案会增加系统成本,车载落地要看硬件预算。

复现难度:★★★★☆

代码已开源,实验流程也比较清楚,复现门槛不算高;真正麻烦的是拿到同等质量的多光谱驾驶数据。

产品化成熟度:★★★☆☆

适合做原型验证或车载健康监测研究,离大规模量产还需要更强的鲁棒性验证和更低成本的硬件方案。

可能的问题:方法思路完整,但对 NIR 硬件依赖较强;真实道路的极端遮挡、夜间和复杂反光场景还需要更多验证,别把“数据集最优”直接等同于“车上即用”。


主要参考文献

[1] A. Hajr, B. Tarvirdizadeh, K. Alipour, and M. Ghamari, “Contactless health monitoring: An overview of video-based techniques utilising machine/deep learning,” IET Wireless Sensor Systems, vol. 15, no. 1, p. e70009, 2025.
[5] C. Nowara et al., MR-NIRP Car dataset and NIR-based rPPG study, cited in the paper.
[9] DeepPhys. [10] EfficientPhys. [11] PhysFormer. [12] RhythmFormer. [13] Mamba. [14] PhysMamba. [15] RhythmMamba.
论文原文:https://arxiv.org/pdf/2606.21115v1.pdf
开源代码:https://github.com/ziiho08/MS-rPPG

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
这篇讲的是车载场景里的“看脸测心率”——欢迎来群里继续聊多光谱、Mamba 和真实驾驶数据集这些硬货~ 🚗💙
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。