← 返回 PaperDaily 大模型与智能体

IIT Indore新作:摄像头测呼吸,不再"看肤色下菜碟"!MAE直降42.1%

传统摄像头测呼吸,一到深肤色就"翻车"——信号弱、噪声大,原因在于方法"一刀切",不懂因肤制宜。IIT Indore这篇ELITE-RR,用肤色感知投影+运动信号去噪+双表征对比学习,三招齐下,把呼吸率估计误差直接砍掉42.1%,还开源了首个印度族裔呼吸数据集。方法设计干净利落,实验全面无死角,干货满满,值得一读!

IIT Indore新作:摄像头测呼吸,不再"看肤色下菜碟"!MAE直降42.1%
🐉 龙哥读论文知识星球
想深入搞懂ELITE-RR的肤色自适应投影去噪、对比学习等细节?星球里不仅有这篇文章的完整源码解读和实验深层分析,还有每日全球AI论文分类速递,帮你省下80%的读论文时间!每天2分钟,刷完就能用~ 👇扫码加入「龙哥读论文」知识星球,跟龙哥一起,把顶会论文"吃"透! xingqiu_header

龙哥推荐理由:
传统摄像头测呼吸,一到深肤色就"翻车"——信号弱、噪声大,原因在于方法"一刀切",不懂因肤制宜。IIT Indore这篇ELITE-RR,用肤色感知投影+运动信号去噪+双表征对比学习,三招齐下,把呼吸率估计误差直接砍掉42.1%,还开源了首个印度族裔呼吸数据集。方法设计干净利落,实验全面无死角,干货满满,值得一读!


原论文信息如下:
论文标题:
A Skin-Tone-Aware Dual-Representation Remote Photoplethysmography Framework for Contactless Respiratory Rate Estimation
发表日期:
2026年6月

发表单位:
Indian Institute of Technology (IIT) Indore, India; University of Turku, Finland

原文链接:
https://arxiv.org/pdf/2606.21511v1.pdf

开源代码链接:
论文接受后将开源

开源数据集链接:
论文接受后将开源RR-rPPG数据集

摄像头就能测呼吸?这个方法让肤色不再是障碍

深呼吸……呼……吸……正常人每分钟呼吸12~20次。呼吸率(RR)一旦异常——过快、过慢、不规律——往往是肺栓塞、心脏骤停等危重疾病的早期信号。
传统方法——呼吸带、血氧仪、鼻导管——都免不了接触身体。对于长期监护或远程诊疗,这种“绑起来”的方式体验极差。
怎么办?用摄像头零接触测呼吸。但有一个“拦路虎”:皮肤颜色。摄像头测呼吸的原理是捕捉面部血流变化引起的颜色波动(rPPG)。深色皮肤下信号衰减严重,导致估算不准。
来自IIT Indore的研究者提出了ELITE-RR 框架——一个肤色感知、双表征融合的呼吸率远程估计算法。不仅把误差砍掉42.1%,还开源了首个南亚人群呼吸面部视频数据集。
想一探究竟?龙哥带你把ELITE-RR吃透。

由浅入深:三招搞定远程呼吸监测难题

先理清关键概念:为什么摄像头能测呼吸?依赖于两种互补的“感知通道”:

欧拉表征:盯住面部固定像素点,分析颜色(RGB)随时间变化。吸气时皮肤微红,呼气时相反。但不同肤色RGB基线不同,传统固定权重会埋没信号。

拉格朗日表征:追踪面部特征点(如鼻孔)的微小位移。对肤色不敏感,但易受表情、转头等非呼吸运动干扰。

ELITE-RR 直接上了三套组合拳:

第一招:肤色感知动态投影——欧拉分支不再“一刀切”。从每个面部小区域提取12维肤色感知特征(平均强度、时间标准差、通道比、归一化RGB),喂给3层全连接网络,实时输出权重α, β, γ:
s_e = α·s_r + β·s_g + γ·s_b
深色皮肤上调高红色通道权重?算法自己学会的!


肤色感知特征向量构成(12维)

第一组(3维):第一帧RGB均值——皮肤基础色调

第二组(3维):RGB序列时间标准差——颜色稳定性

第三组(3维):通道间均值比率 R/G, G/B, B/R——色彩平衡

第四组(3维):归一化RGB向量——纯肤色信息

完全数据驱动,推理仅需几毫秒。

第二招:专用去噪网络——拉格朗日分支信号混着头动噪声。ELITE-RR设计1D卷积自编码器,将原始运动轨迹编码成32维潜向量再重建。潜向量上附加呼吸率回归头,强制保留呼吸频率信息。训练时加入微小高斯噪声(ε=10⁻⁶)做正则化。

图2:去噪网络架构
图2:去噪网络架构。输入加噪声后经4层1D卷积编码、全连接投影到32维潜空间,解码器对称重建。

第三招:跨表征对比学习——欧拉和拉格朗日信号相位可能差半拍,但呼吸频率一致。ELITE-RR提出相位无关对比光谱损失:对两个信号做FFT取幅度谱,归一化为概率分布,计算CDF的L1距离(地球移动距离),强迫频谱分布一致,完全忽略相位。

总损失:
L_total = λ1·L_c(se, sd) + λ2·L_c(se, sgt) + λ3·L_c(sd, sgt) + λ4·L_df(rrl, rrgt)
其中L_c是对比光谱损失,L_df是呼吸率回归MSE。
插图

双管齐下:欧拉与拉格朗日的完美联姻

ELITE-RR 整体流程见图1。视频按12秒切成不重叠片段,用MediaPipe检测面部关键点,提取额头和脸颊(含鼻孔)两个ROI区域,去掉眼睛和嘴巴避免干扰。
图1:ELITE-RR方法总览
图1:ELITE-RR总览。欧拉分支:ROI分块→肤色特征→投影网络→rPPG信号;拉格朗日分支:跟踪特征点→垂直位移→去噪网络→纯净运动信号;最后SNR加权融合。
欧拉分支:每个ROI分割成不重叠patch,提取三通道时序信号,经0.08~0.5Hz带通滤波。用肤色感知网络预测权重加权得到一维rPPG信号。测试时只保留SNR最高的patch做频谱分析。
拉格朗日分支:用Lucas-Kanade光流追踪ROI内特征点轨迹,仅保留Y方向位移。每条轨迹带通滤波后选SNR最高的喂给去噪网络。呼吸率从干净信号频谱峰值获得(BrPM = 峰值频率×60)。
质量感知融合
rr_final = (q_e·rr_e + q_l·rr_l) / (q_e + q_l)
信噪比高的分支话语权更大,保证遮挡时仍可靠。

数据说话:两大数据集上的碾压性优势

ELITE-RR对比6种主流方法(CHROM、ICA、POS、DeepPhys、PhysNet、RespNet),评价指标MAE、RMSE、Pearson r。数据来自自建RR-rPPG(119名印度受试者)和公开COHFACE(160片段)。
表2:ELITE-RR与现有方法的对比分析
表2:ELITE-RR与现有方法对比。粗体为最优。
结果炸裂!RR-rPPG上ELITE-RR的MAE仅1.13 BrPM,第二好的方法1.95 BrPM,误差减少42.1%!COHFACE上MAE=0.86,其他方法最低1.38。
Bland-Altman图显示散点几乎全落在±1.96标准差区间内,偏差小,无系统性偏移,达到临床可接受水平。
图7:ELITE-RR在COHFACE+RR-rPPG上的Bland-Altman图
图7:Bland-Altman图。实线为平均差,虚线为一致性界限。
不同肤色类型(Fitzpatrick量表)下,ELITE-RR在深色皮肤(IV-VI型)上MAE几乎平坦,其他方法急剧上升。跨数据集测试(RR-rPPG训练→COHFACE测试)MAE从1.5升到3.8,仍优于其他方法。
图8:不同Fitzpatrick肤色尺度下的MAE
图8:不同肤色类型的MAE。ELITE-RR(红色)在深肤色上保持低误差。

深度剖析:消融实验与泛化性验证

消融实验(表3)逐个去掉核心模块:去掉去噪网络,拉格朗日分支MAE从1.13升到1.47;去掉对比学习损失(用MSE代替),MAE升到1.35。每个模块贡献约20~25%性能提升。
表3:消融实验——不同组件的重要性分析
表3:消融实验。完整版在所有数据集上最优。
视频片段长度实验(图6)显示最佳点在12秒:太短频谱分辨率不够,太长易引入呼吸节律变化误差。
图6:不同视频片段长度下的性能
图6:不同片段长度下ELITE-RR性能。最优为12秒。
跨数据集泛化(表4):RR-rPPG训练→COHFACE测试,MAE为3.84,虽比同数据集高,但远低于其他方法(5.0+),说明学到了通用呼吸表征。
表4:跨数据集分析
表4:跨数据集验证。ELITE-RR在两种跨域设置下均优于其他方法。

总结与展望:连接未来医疗的桥梁

ELITE-RR 贡献可归纳为:
(1)数据驱动的肤色感知动态RGB投影网络,将欧拉信号提取从“开环固定”变为“闭环自适应”;
(2)为拉格朗日运动信号设计的去噪自编码器;
(3)相位无关对比光谱损失函数,让两个分支在频率域对齐;
(4)首个面向南亚人群的rPPG呼吸数据集RR-rPPG。
未来方向:部署到低功耗移动端、扩展更多呼吸疾病检测、结合心率估计形成多模态生命体征监测。

龙迷三问

下面是龙哥为大家解答可能的三点疑问:

Q1:什么是rPPG?和传统PPG有什么区别?rPPG用普通RGB摄像头从人脸视频中捕捉血流变化引起的皮肤颜色波动,推算心率、呼吸率。传统PPG需接触式探头,rPPG完全非接触。

Q2:文中提到的“CHROM”方法是什么?CHROM是经典rPPG方法,通过固定公式对RGB通道线性组合消除光照变化。但不针对个体肤色优化,深肤色表现不佳。ELITE-RR用学习取代了CHROM。

Q3:相位无关对比光谱损失的直观理解是什么?欧拉和拉格朗日信号可能相位不同,但呼吸频率相同。对比光谱损失不看时间对齐,只看频谱分布是否相似——就像两人唱同一首歌,不管谁先开口,音调一致就行。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆
肤色感知动态投影+拉格朗日去噪+相位无关对比损失,三个点首次针对呼吸率rPPG,组合扎实。

实验合理度:★★★★★
对比6种主流方法,两个独立数据集,跨域验证、消融、超参数分析、Bland-Altman图,全面公平。

学术研究价值:★★★★☆
为解决rPPG肤色偏差提供新思路,相位无关损失可推广到其他异质信号对齐。数据集填补南亚人群空白。

稳定性:★★★★☆
SNR融合使单分支失效时仍稳定。跨数据集性能下降明显(MAE从1升到近4),环境变化敏感。

适应性以及泛化能力:★★★★☆
在两个数据集上均获最佳,跨数据集误差相对低。但未验证大范围运动、遮挡、弱光等极端条件。

硬件需求及成本:★★★☆☆
需GPU训练(V100),推理网络极轻可在CPU实时运行。采集设备仅需普通RGB摄像头,成本可控。

复现难度:★★★★☆
代码和数据将开源,方法细节清晰,超参数完备。唯一门槛是数据集采集,但跨数据集可用COHFACE。

产品化成熟度:★★☆☆☆
实验室阶段,场景受控。需测试移动端部署、多光照/多姿态鲁棒性、实时反馈、隐私合规等。

可能的问题:Lucas-Kanade光流在大运动下易失效;EMD计算涉及排序,训练时可能不够平滑;数据集男女比例不均衡(93男/26女)。


主要参考文献

[1] Trishna Saikia, Anup Kumar Gupta, Puneet Gupta, Pasi Liljeberg. "A Skin-Tone-Aware Dual-Representation Remote Photoplethysmography Framework for Contactless Respiratory Rate Estimation". arXiv:2606.21511v1, 2026.
[2] G. de Haan and V. Jeanne. "Robust pulse rate from chrominance-based rPPG". IEEE TBME, 2013.
[3] W. Wang et al. "Algorithmic principles of remote PPG". IEEE TBME, 2017.
[4] R. Heusch, A. Anjos, and S. Marcel. "A reproducible study on remote heart rate measurement". arXiv, 2017.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨,理性发言~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
呼吸之间,尽在掌握。想跟龙哥和各位同好一起,深挖ELITE-RR这类带你"涨姿势"又"涨点"的论文吗?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
「龙哥读论文」微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。来这里,和一起"沉迷学习"的小伙伴们,把技术聊透!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。