← 返回 PaperDaily 视觉与图像

五种姿态估计器实测短跑:RTMPose-M平均6.99度成黑马

跑姿分析一直被认为是专业实验室的专利,动辄几十万的设备劝退了大多数人。这篇论文用五个成熟姿态估计模型+后处理,把髋膝关节角度估测误差压到5.3°,还配套了网页演示平台,属于典型的低成本高性价比工作,做运动科学和姿态估计的朋友值得一读。

五种姿态估计器实测短跑:RTMPose-M平均6.99度成黑马
原论文信息如下:
论文标题:
VideoRun2D Demo:用于跑步生物力学分析的无标记身体跟踪
发表日期:
2026年08月

发表单位:
马德里自治大学(UAM)与马德里理工大学(UPM)

原文链接:
https://arxiv.org/pdf/2608.19480v1.pdf

演示链接:
论文中提供了VideoRun2D Demo在线演示平台,可自行上传视频进行短跑生物力学分析

跑步分析的新利器:无标记运动捕捉技术

聊到专业跑步分析,很多人的第一反应可能是这样的:一间布满摄像头的实验室,运动员身上贴满反光标记点,穿着带传感器的紧身衣,旁边还有工程师在调试设备。这套流程确实精准,但代价也相当感人——设备昂贵、操作复杂、耗时长,普通人基本无缘。

有没有一种办法,让教练举着手机拍一段视频,就能得到运动员的跑姿分析数据?VideoRun2D Demo这篇论文想解决的,正是这个被很多人忽视却真实存在的需求。

来自马德里自治大学与马德里理工大学的研究团队,搭建了一套名为VideoRun2D的无标记短跑生物力学分析系统。这套系统的核心思路不复杂:用现成的二维人体姿态估计模型从普通视频中提取关节点,再把这些关节点换算成生物力学上有关键意义的关节角度,从而分析短跑过程中髋关节和膝关节的屈伸变化。

在体育科学领域,短跑技术的好坏直接决定了运动员的水平上限。过去,教练靠肉眼观察和经验判断,这种方法主观性很强,不同教练可能给出完全不同的意见。后来出现了人工标注制度,通过逐帧标注视频获得客观数据,但这种方法极其耗时,一帧一帧地标注,一个步态周期下来就是百来张图。再后来有了基于标记点的运动捕捉系统(Marker-based),精度确实高,但也把运动分析锁死在了专业实验室里。惯性测量单元(IMU)虽然可以穿戴,但存在传感器漂移的问题,关节角度的估算精度口碑也不算好。

换句话说,运动分析领域长期存在一个矛盾:要么贵而准,要么便宜而糙。无标记运动捕捉(Markerless Motion Capture)作为第三种选项,这几年随着深度学习的发展逐渐成熟,它直接从普通视频里提取人体关键点,成本低、使用门槛低,理论上普通人都能用。但问题是,这类方法在生物力学分析中的精度到底够不够用?有没有系统性验证?针对短跑这一特定场景,它能不能替代传统设备?

这篇论文正是冲着回答这些疑问来的。研究团队系统评估了五种主流姿态估计器在短跑场景下的关节角度估算能力,并与专家人工标注结果进行了全面对比。实验的数据基础是44名职业运动员的314次短跑,总共925个跑步步态周期。这个数据规模在同类研究中算得上相当扎实了。

从结果来看,表现最好的跟踪器在关节角度预测上的平均均方根误差(RMSE)达到了6.99°,其中膝关节角度的最低误差只有5.30°。配合论文提出的后处理和融合策略后,整体误差进一步下降到6.88°。这个数字距离临床级应用的2°到5°精度要求还有差距,但作为低成本的替代方案,已经展示出相当可观的应用潜力。

更有意思的是,研究团队还搭建了一个在线演示平台,用户可以直接上传短跑视频,选择不同的跟踪器进行关节角度估计,最后还能导出CSV格式的数据。视频上传、自动识别、生物力学分析、数据导出,全流程在线完成,不需要任何本地环境配置。这种把研究成果直接变成工具的思路,在学术论文里确实不多见。

接下来,咱们拆解一下这个系统具体是怎么工作的。

跑步分析的新利器:无标记运动捕捉技术

表情包

系统整体架构:五个模块的流水线

VideoRun2D系统的整体框架如图1所示。整个系统可以看作一条流水线,视频数据从一端流入,关节角度数据从另一端流出。中间经过了预处理、姿态跟踪、跟踪后处理、生物力学特征生成这些环节。

图1:VideoRun2D系统框图,系统包含五个模块来估计关节角度
VideoRun2D系统框图,系统包含五个模块来估计关节角度
模块一:视频预处理

视频预处理模块做的事情,是把原始视频帧变成适合姿态估计模型输入的形式。输入的视频分辨率通常是1920×1080,而姿态估计模型一般期望较小的输入尺寸。研究者先用一个人体检测器找到场景中离镜头最近的人,然后以这个人中心做一个正方形裁剪,把图像从1920×1080缩小到300×300。这一步其实很有讲究:短跑视频里往往不止运动员一个人,直接送进姿态估计器可能会导致模型找错目标,先定位再裁剪能有效避免这个坑。

模块二:姿态跟踪器

姿态跟踪模块是系统的核心。研究团队测试了五种二维人体姿态估计器,分别是:ViTPose-B、ViTPose-L、RTMPose-M和两个输入尺寸版本的RTMPose-L(256×192和384×288)。这些模型的任务是从裁剪后的图像中检测出人体关键点——包括肩膀、肘部、手、髋部、膝盖和脚踝,左右两侧共12个点。

ViTPose和RTMPose走的是两条不同的技术路线。ViTPose用Vision Transformer(ViT)作为骨干网络,把人体姿态估计当作一个视觉Transformer任务来处理;RTMPose则采用CNN-Transformer混合架构,通过OpenMMLab的MMPose工具库实现。简单理解,前者是纯Transformer路线,后者是混合路线,两者在特征提取能力和计算效率上各有侧重。

模块三:跟踪后处理

姿态估计器直接输出的结果并不能直接用,因为短跑场景中常出现遮挡和矢状面歧义问题,导致三种典型错误:关键点丢失、左右关节点混淆、身体点错误分配。针对这些问题,研究团队设计了一个基于SVR(支持向量回归)的后处理模块。

具体做法是:对每个关节点的轨迹分别进行SVR平滑,得到平滑后的轨迹;然后计算每个采样点原始轨迹与平滑轨迹之间的误差;当某个点的误差超过3倍标准差时,就判定为异常值。异常值的处理方式是:先尝试交换左右分配来纠正,如果纠正后误差仍然很大,就用SVR平滑后的值直接替代该点。这个后处理模块对膝盖和脚踝关节特别重要,因为这两个部位在跑步过程中遮挡最频繁、最容易出现左右混淆。

图2展示了一个后处理前后的膝关节角度对比示例。可以看到,后处理之前,左膝关节角度曲线在某些步态周期内出现了明显的异常尖峰和波动;后处理之后,曲线整体变得平滑,步态周期的模式清晰可辨。

图2(左):所有用户左膝关节角度(RTMPose-M),后处理之前
图2(左):所有用户左膝关节角度(RTMPose-M),后处理之前
图2(右):所有用户左膝关节角度(RTMPose-M),后处理之后
图2(右):所有用户左膝关节角度(RTMPose-M),后处理之后

模块四:生物力学特征生成

得到修正后的关键点轨迹后,下一步是计算生物力学特征。论文关注两个关键角度:髋关节角度(躯干与大腿之间的夹角)和膝关节角度(大腿与小腿之间的夹角)。每个步态周期都会被时间归一化,从0%(初始脚触地)到100%(下一次脚触地),这样不同运动员、不同步速之间的数据可以互相对比。


五种姿态估计器大比拼:谁更精准?

整个系统的评测逻辑,是把五种跟踪器各自输出的关节角度与专家人工标注的结果进行对比,用RMSE作为衡量误差的指标。数据集来自44名职业运动员的314次短跑,总共925个步态周期,这个规模在运动生物力学领域算是相当有说服力的。

实验分两个阶段:第一阶段是单一跟踪器的表现评测,第二阶段是跟踪器融合策略的评测。

单模型结果:RTMPose-M成为黑马

先看单模型的表现。表1列出了五种跟踪器在髋关节和膝关节左右两侧的RMSE数值。

*表格超出部分左右可以滑动 TABLE I RMSE VALUES FOR ALL EVALUATED TRACKERS (SECTION II-A2). BOLDFACE INDICATES THE BEST RESULT IN EACH COLUMN.
TABLE I RMSE VALUES FOR ALL EVALUATED TRACKERS (SECTION II-A2). BOLDFACE INDICATES THE BEST RESULT IN EACH COLUMN.
把前面这一整套流水线串起来看,VideoRun2D系统的本质,其实是在“精度”和“门槛”之间找平衡。传统标记点动捕精度高,但设备、场地、人员成本全都高;惯性测量单元(IMU)穿戴方便,但漂移问题始终让人头疼;纯靠教练肉眼观察,又难免主观。而深度学习方案直接从视频里算关节角度,成本几乎为零,唯一的问题就是:误差到底能不能接受。

这篇论文的价值恰恰在于把这个问题量化了。研究者没有发明新的姿态估计模型,而是把现有五种开源模型搬到短跑场景里做了系统的生物力学验证,还配上了后处理模块和在线演示平台。用925个跑步步态周期、专家人工标注做基准,测出每种方案的真实误差水平。这种“用现成工具解决真实问题”的思路,恰好是很多实验室缺的那一环。毕竟学术圈不缺惊艳的新模型,缺的是有人肯花力气把现有模型放到真实场景里做严谨评测,把“能不能用”这个问题回答清楚。

五种姿态估计器大比拼:谁更精准?

观察表1的数值能发现几个有意思的规律。先看平均误差,RTMPose-M以6.99°拿下头名,紧跟其后的是RTMPose-L*(7.12°)和RTMPose-L(7.15°),ViTPose-L排在第四(7.21°),ViTPose-B垫底(7.96°)。单看这些数字,RTMPose系列明显整体占优,尤其是参数规模更小的RTMPose-M居然干翻了大尺寸的ViTPose-L,这个结果稍微有点反常识。
表1:所有评估跟踪器的RMSE数值(粗体表示每列最佳结果)
表1:所有评估跟踪器的RMSE数值(粗体表示每列最佳结果)
看到小尺寸模型干翻大尺寸模型,不少人的表情大概是这样的🤨:
621df26778f05KkH.gif
为什么RTMPose能赢?这跟模型设计有关——RTMPose采用CNN-Transformer混合架构,输入尺寸为256×192,对运动场景中关键点的定位更稳健,训练时还针对实时场景做了大量优化;ViTPose虽然特征表达能力强,但在关节遮挡和模糊场景下容易把关键点“飘”到错误位置。

再看误差分布,膝关节的误差普遍低于髋关节。比如RTMPose-L在右膝关节达到5.30°,而左髋关节的误差即使最好的模型也有9.17°。这个差异其实符合短跑生物力学特点:跑步过程中膝关节摆动幅度大、周期规律强,姿态估计模型能从中提取到清晰的运动模式,估算反而更准;髋关节靠近躯干,受躯干晃动、衣物遮挡和视角影响更大,而且左右髋在矢状面上极易混淆,误差自然偏高。

还有个细节值得注意:所有模型的左髋误差都明显高于右髋。这大概率不是模型缺陷,而是拍摄视角造成的系统性偏差——短跑视频通常拍摄的是运动员侧面,远离镜头的一侧关节点特征更弱,容易产生左右互换或定位漂移。正是为了应对这类问题,论文才设计了专门的后处理和融合策略。

后处理与融合策略:如何进一步提升精度?

单个模型再强,也架不住遮挡和左右混淆这两大坑。论文在系统设计里为这两类问题准备了两层防线,正好对应系统框图中的两个模块:第一层是跟踪后处理,用支持向量回归(SVR)对轨迹做平滑和异常值检测;第二层是融合策略,把多个跟踪器的结果平均起来。
图2(右):后处理之后
图2(右):后处理之后的左膝关节角度曲线(RTMPose-M)
SVR后处理的逻辑之前介绍过:把每个关节点的坐标轨迹过一遍SVR回归,得到平滑后的参考轨迹;然后逐点计算原始坐标和平滑坐标的误差,超过三倍标准差的点就被标记为异常值。异常值先尝试左右交换修复,不行就直接用平滑值替换。这套规则简单,但在跑步场景里非常对症——绝大多数左右混淆都发生在膝盖和脚踝,这两个部位的轨迹又具有很强的周期性,SVR能很好地捕捉周期模式。

融合策略的思路更直接:既然不同跟踪器的错误模式不一样,那把它们的输出平均一下,理论上可以抵消部分误差。表2列出了多种融合组合的RMSE数值。
表2:对跟踪器姿态估计进行平均后得到的RMSE数值。缩写:VL=ViTPose-L,RM=RTMPose-M,RL=RTMPose-L,RL*=RTMPose-L*(384×288输入)
表2:对跟踪器姿态估计进行平均后得到的RMSE数值。缩写:VL=ViTPose-L,RM=RTMPose-M,RL=RTMPose-L,RL*=RTMPose-L*(384×288输入)
从表2看,ViTPose-L + RTMPose-M + RTMPose-L* 的组合效果最好,平均RMSE从单模型最优的6.99°降到了6.88°,总共降了0.11°。其中左髋关节的增益最明显,从9.36°降到9.17°,下降了0.19°;左膝、右膝也分别降了0.10°和0.12°;但右髋关节几乎没有变化。

说实话,这个改进幅度不算大,融合了个寂寞?倒也不能这么说。融合策略本来就不是魔法,当单模型已经接近信息极限时,靠平均带来的增益自然有限。但融合没有引入额外计算成本,绝大多数组合都比最差的单模型强,整体稳定性更好,作为一种“免费午餐”式的兜底方案还是值得用的。

值得一提的是,作者团队去年在FG 2025会议上发表的前序工作中,视觉跟踪模型的后处理前平均误差为11.4°,后处理后为7.0°。而本次评测中RTMPose-M的单模型平均误差已经达到6.99°,说明随着姿态估计模型本身的迭代,无标记方案的整体精度正在稳步提升。

从实验室到实际应用:VideoRun2D Demo平台

论文的另一个亮点,是把整套流程打包成了一个在线演示平台。图3展示了平台的操作流程:用户上传短跑视频、标注运动员出现的时间戳、选择跟踪器、系统自动推断并生成关节角度时间信号、右侧可视化展示、最后还可选导出CSV数据。
图3:VideoRun2D Demo平台操作框图
图3:VideoRun2D Demo平台操作框图
这个流程设计得很贴心。上传视频后,用户不需要配置Python环境、不需要懂深度学习,全程在网页上点击操作就能拿到髋膝关节角度曲线和原始数据。对于教练、运动康复师甚至是田径爱好者来说,这个门槛低到了“能用”的程度。

图4展示了四名短跑运动员使用RTMPose模型经过后处理后生成的关节点和角度可视化结果。橙色代表身体右侧,紫色代表左侧,可以直观看到每个步态周期中四肢的摆动轨迹。
图4:使用RTMPose模型并经过跟踪后处理后计算的四名短跑运动员关节点和角度可视化。橙色线条和点代表右侧,紫色代表左侧
图4:使用RTMPose模型并经过跟踪后处理后计算的四名短跑运动员关节点和角度可视化。橙色线条和点代表右侧,紫色代表左侧
从演示效果看,关节轨迹平滑连续,左右侧标识清晰,跑步的周期性节奏也能清楚辨认。这种可视化对于非专业用户非常友好——不需要读懂均方根误差(RMSE),看一眼图就能感受到这套系统确实在干活。

不过也要泼一盆冷水:当前平台是研究性质的演示工具,没有针对大规模并发做优化,也没有提供API接口,距离产品级SaaS服务还有距离。但作为学术论文的配套工具,已经是超出预期的一步了。这种把研究成果直接变成可交互网页的做法,值得更多论文借鉴。

挑战与展望:临床应用的差距与未来方向

最后聊聊这套系统的边界。研究者把误差数字和临床标准放在了一起对比:临床上可接受的关节角度误差通常在2°到5°之间,而VideoRun2D的最佳平均误差6.88°、最佳膝关节角度5.30°,刚好卡在临界线附近。也就是说,作为运动表现的评估辅助工具已经够用,但要直接用于临床诊断或康复决策,精度还差了一口气。

遮挡和左右混淆是误差的主要来源,SVR后处理减轻了但没根治;融合策略的增益也有限。作者在论文中列了几个未来方向:一是引入基于视觉注意力机制的图像特征(论文引用了AttZoom相关工作),让模型更关注关键部位;二是利用前沿的视觉语言模型(VLM)辅助理解人体运动语义,比如自动判断遮挡关系;三是系统性消除偏差,包括性别、种族、体型等维度,确保算法在不同人群上的表现一致。

另外值得关注的是合规问题。论文明确提到要尊重机器学习与AI系统的相关法规(如欧盟AI法案),并关注检测深度伪造等合成媒体内容的需求。这套系统未来如果真的要商业化,数据隐私、模型可解释性和安全审计都是绕不开的课题。

总体来看,VideoRun2D Demo的价值不在于技术上的颠覆性突破,而在于它把“深度学习姿态估计能不能用于跑步生物力学分析”这个问题,用严谨的实验数据和可交互的演示平台给出了一个阶段性的答案:可以,而且正在接近临床门槛。做运动科学、计算机视觉交叉方向的朋友,或者对低成本运动分析工具感兴趣的开发者,这篇论文值得找来读一读。😊

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?短跑生物力学分析长期依赖昂贵设备。VideoRun2D Demo用普通视频和五种姿态估计器实现无标记关节角度测量,在44名职业运动员314次短跑中验证,膝关节角度误差最低降至5.30°。
这篇工作最值得看的点是什么?单模态跟踪中RTMPose-M表现最佳,平均RMSE为6.99°;多模态融合策略中ViTPose-L+RTMPose-M+RTMPose-L*组合表现最优,平均RMSE降至6.88°,较最佳单跟踪器提升0.11°。
这篇工作的边界或风险在哪里?优点:1) 提出低成本、非侵入性的跑步生物力学分析方案;2) 系统评估了五种先进姿态估计器;3) 提出有效的后处理模块和融合策略;4) 提供交互式Web平台。缺点:1) 角度误差仍高于临床可接受范围(2°-5°);2) 仅评估2D姿态估计,缺乏3D信息;3) 数据集规模有限(44名运动员);4) 未与其他无标记系统进行直接对比。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

本文提出VideoRun2D Demo系统,利用五种2D人体姿态估计器(ViTPose-B/L、RTMPose-M/L)对短跑视频进行无标记运动捕捉,结合SVR平滑后处理与多跟踪器融合策略,实现髋关节和膝关节角度的生物力学分析。

实验合理度:★★★★☆

均方根误差(RMSE),单位为度(°)

学术研究价值:★★★★☆

本文提出VideoRun2D Demo系统,利用五种2D人体姿态估计器(ViTPose-B/L、RTMPose-M/L)对短跑视频进行无标记运动捕捉,结合SVR平滑后处理与多跟踪器融合策略,实现髋关节。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

论文未明确给出具体FLOPs数值,但RTMPose系列模型设计为实时推理,ViTPose系列模型计算量较大。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1) 角度误差仍高于临床可接受范围(2°-5°);2) 仅评估2D姿态估计,缺乏3D信息;3) 数据集规模有限(44名运动员);4) 未与其他无标记系统进行直接对比。

主要参考文献

[36] Y. Xu, J. Zhang, et al. ViTPose: Simple vision transformer baselines for human pose estimation. NeurIPS, 2022.
[37] T. Jiang, P. Lu, et al. RTMPose: Real-time multi-person pose estimation based on MMPose. arXiv:2303.07399, 2023.
[38] MMPose Contributors. OpenMMLab pose estimation toolbox and benchmark, 2020.
[15] G. Garrido-Lopez, L. F. Gomez, J. Fierrez, et al. VideoRun2D: Cost-effective markerless motion capture for sprint biomechanics. ICPRw, 2024.
[33] L. F. Gomez, et al. Comparison of visual trackers for biomechanical analysis of running. IEEE FG, 2025.
[35] J. L. McGinley, R. Baker, et al. The reliability of three-dimensional kinematic gait measurements: a systematic review. Gait & Posture, 2009.
[4] J. Yang, K. Park. Improving gait analysis techniques with markerless pose estimation based on smartphone location. Bioengineering, 2024.

融会贯通

结合PaperDaily已收录论文可以观察到,目前关于姿态估计模型用于跑步生物力学分析的公开量化评测仍比较稀缺,多数工作使用自有数据集或私有标注,评测标准和拍摄设置差异很大,横向比较时需要格外注意数据集划分(split)和实验设置(setting)的差异。VideoRun2D在925个步态周期上取得的6.88°平均RMSE,应被理解为该特定数据集下的结果,而不是全领域绝对领先的证据。

从趋势上可以提炼几点:一是基于Transformer的姿态估计模型正在快速取代传统CNN方案,ViTPose和RTMPose的竞争已经从通用姿态估计扩展到了运动科学领域;二是“模型+后处理”的组合优化比单纯换更大更贵的模型更有性价比,本轮实验中RTMPose-M仅用较小参数量就超越了更大模型,这对算力有限的团队是个好消息;三是研究成果“工具化”越来越重要,提供在线演示让非AI背景的教练和康复师能直接试用,这种做法值得更多论文借鉴。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
跑步想提速、训练想少受伤?来群里一起研究视频跑姿分析的正确打开方式!欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 运动分析+北京+某体校+阿飞),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。