跑步分析的新利器:无标记运动捕捉技术
聊到专业跑步分析,很多人的第一反应可能是这样的:一间布满摄像头的实验室,运动员身上贴满反光标记点,穿着带传感器的紧身衣,旁边还有工程师在调试设备。这套流程确实精准,但代价也相当感人——设备昂贵、操作复杂、耗时长,普通人基本无缘。
有没有一种办法,让教练举着手机拍一段视频,就能得到运动员的跑姿分析数据?VideoRun2D Demo这篇论文想解决的,正是这个被很多人忽视却真实存在的需求。
来自马德里自治大学与马德里理工大学的研究团队,搭建了一套名为VideoRun2D的无标记短跑生物力学分析系统。这套系统的核心思路不复杂:用现成的二维人体姿态估计模型从普通视频中提取关节点,再把这些关节点换算成生物力学上有关键意义的关节角度,从而分析短跑过程中髋关节和膝关节的屈伸变化。
在体育科学领域,短跑技术的好坏直接决定了运动员的水平上限。过去,教练靠肉眼观察和经验判断,这种方法主观性很强,不同教练可能给出完全不同的意见。后来出现了人工标注制度,通过逐帧标注视频获得客观数据,但这种方法极其耗时,一帧一帧地标注,一个步态周期下来就是百来张图。再后来有了基于标记点的运动捕捉系统(Marker-based),精度确实高,但也把运动分析锁死在了专业实验室里。惯性测量单元(IMU)虽然可以穿戴,但存在传感器漂移的问题,关节角度的估算精度口碑也不算好。
换句话说,运动分析领域长期存在一个矛盾:要么贵而准,要么便宜而糙。无标记运动捕捉(Markerless Motion Capture)作为第三种选项,这几年随着深度学习的发展逐渐成熟,它直接从普通视频里提取人体关键点,成本低、使用门槛低,理论上普通人都能用。但问题是,这类方法在生物力学分析中的精度到底够不够用?有没有系统性验证?针对短跑这一特定场景,它能不能替代传统设备?
这篇论文正是冲着回答这些疑问来的。研究团队系统评估了五种主流姿态估计器在短跑场景下的关节角度估算能力,并与专家人工标注结果进行了全面对比。实验的数据基础是44名职业运动员的314次短跑,总共925个跑步步态周期。这个数据规模在同类研究中算得上相当扎实了。
从结果来看,表现最好的跟踪器在关节角度预测上的平均均方根误差(RMSE)达到了6.99°,其中膝关节角度的最低误差只有5.30°。配合论文提出的后处理和融合策略后,整体误差进一步下降到6.88°。这个数字距离临床级应用的2°到5°精度要求还有差距,但作为低成本的替代方案,已经展示出相当可观的应用潜力。
更有意思的是,研究团队还搭建了一个在线演示平台,用户可以直接上传短跑视频,选择不同的跟踪器进行关节角度估计,最后还能导出CSV格式的数据。视频上传、自动识别、生物力学分析、数据导出,全流程在线完成,不需要任何本地环境配置。这种把研究成果直接变成工具的思路,在学术论文里确实不多见。
接下来,咱们拆解一下这个系统具体是怎么工作的。
跑步分析的新利器:无标记运动捕捉技术
系统整体架构:五个模块的流水线
VideoRun2D系统的整体框架如图1所示。整个系统可以看作一条流水线,视频数据从一端流入,关节角度数据从另一端流出。中间经过了预处理、姿态跟踪、跟踪后处理、生物力学特征生成这些环节。
视频预处理模块做的事情,是把原始视频帧变成适合姿态估计模型输入的形式。输入的视频分辨率通常是1920×1080,而姿态估计模型一般期望较小的输入尺寸。研究者先用一个人体检测器找到场景中离镜头最近的人,然后以这个人中心做一个正方形裁剪,把图像从1920×1080缩小到300×300。这一步其实很有讲究:短跑视频里往往不止运动员一个人,直接送进姿态估计器可能会导致模型找错目标,先定位再裁剪能有效避免这个坑。
模块二:姿态跟踪器
姿态跟踪模块是系统的核心。研究团队测试了五种二维人体姿态估计器,分别是:ViTPose-B、ViTPose-L、RTMPose-M和两个输入尺寸版本的RTMPose-L(256×192和384×288)。这些模型的任务是从裁剪后的图像中检测出人体关键点——包括肩膀、肘部、手、髋部、膝盖和脚踝,左右两侧共12个点。
ViTPose和RTMPose走的是两条不同的技术路线。ViTPose用Vision Transformer(ViT)作为骨干网络,把人体姿态估计当作一个视觉Transformer任务来处理;RTMPose则采用CNN-Transformer混合架构,通过OpenMMLab的MMPose工具库实现。简单理解,前者是纯Transformer路线,后者是混合路线,两者在特征提取能力和计算效率上各有侧重。
模块三:跟踪后处理
姿态估计器直接输出的结果并不能直接用,因为短跑场景中常出现遮挡和矢状面歧义问题,导致三种典型错误:关键点丢失、左右关节点混淆、身体点错误分配。针对这些问题,研究团队设计了一个基于SVR(支持向量回归)的后处理模块。
具体做法是:对每个关节点的轨迹分别进行SVR平滑,得到平滑后的轨迹;然后计算每个采样点原始轨迹与平滑轨迹之间的误差;当某个点的误差超过3倍标准差时,就判定为异常值。异常值的处理方式是:先尝试交换左右分配来纠正,如果纠正后误差仍然很大,就用SVR平滑后的值直接替代该点。这个后处理模块对膝盖和脚踝关节特别重要,因为这两个部位在跑步过程中遮挡最频繁、最容易出现左右混淆。
图2展示了一个后处理前后的膝关节角度对比示例。可以看到,后处理之前,左膝关节角度曲线在某些步态周期内出现了明显的异常尖峰和波动;后处理之后,曲线整体变得平滑,步态周期的模式清晰可辨。
模块四:生物力学特征生成
得到修正后的关键点轨迹后,下一步是计算生物力学特征。论文关注两个关键角度:髋关节角度(躯干与大腿之间的夹角)和膝关节角度(大腿与小腿之间的夹角)。每个步态周期都会被时间归一化,从0%(初始脚触地)到100%(下一次脚触地),这样不同运动员、不同步速之间的数据可以互相对比。
五种姿态估计器大比拼:谁更精准?
整个系统的评测逻辑,是把五种跟踪器各自输出的关节角度与专家人工标注的结果进行对比,用RMSE作为衡量误差的指标。数据集来自44名职业运动员的314次短跑,总共925个步态周期,这个规模在运动生物力学领域算是相当有说服力的。
实验分两个阶段:第一阶段是单一跟踪器的表现评测,第二阶段是跟踪器融合策略的评测。
单模型结果:RTMPose-M成为黑马
先看单模型的表现。表1列出了五种跟踪器在髋关节和膝关节左右两侧的RMSE数值。
*表格超出部分左右可以滑动
TABLE I RMSE VALUES FOR ALL EVALUATED TRACKERS (SECTION II-A2). BOLDFACE INDICATES THE BEST RESULT IN EACH COLUMN.
这篇论文的价值恰恰在于把这个问题量化了。研究者没有发明新的姿态估计模型,而是把现有五种开源模型搬到短跑场景里做了系统的生物力学验证,还配上了后处理模块和在线演示平台。用925个跑步步态周期、专家人工标注做基准,测出每种方案的真实误差水平。这种“用现成工具解决真实问题”的思路,恰好是很多实验室缺的那一环。毕竟学术圈不缺惊艳的新模型,缺的是有人肯花力气把现有模型放到真实场景里做严谨评测,把“能不能用”这个问题回答清楚。
五种姿态估计器大比拼:谁更精准?
再看误差分布,膝关节的误差普遍低于髋关节。比如RTMPose-L在右膝关节达到5.30°,而左髋关节的误差即使最好的模型也有9.17°。这个差异其实符合短跑生物力学特点:跑步过程中膝关节摆动幅度大、周期规律强,姿态估计模型能从中提取到清晰的运动模式,估算反而更准;髋关节靠近躯干,受躯干晃动、衣物遮挡和视角影响更大,而且左右髋在矢状面上极易混淆,误差自然偏高。
还有个细节值得注意:所有模型的左髋误差都明显高于右髋。这大概率不是模型缺陷,而是拍摄视角造成的系统性偏差——短跑视频通常拍摄的是运动员侧面,远离镜头的一侧关节点特征更弱,容易产生左右互换或定位漂移。正是为了应对这类问题,论文才设计了专门的后处理和融合策略。
后处理与融合策略:如何进一步提升精度?
融合策略的思路更直接:既然不同跟踪器的错误模式不一样,那把它们的输出平均一下,理论上可以抵消部分误差。表2列出了多种融合组合的RMSE数值。
说实话,这个改进幅度不算大,融合了个寂寞?倒也不能这么说。融合策略本来就不是魔法,当单模型已经接近信息极限时,靠平均带来的增益自然有限。但融合没有引入额外计算成本,绝大多数组合都比最差的单模型强,整体稳定性更好,作为一种“免费午餐”式的兜底方案还是值得用的。
值得一提的是,作者团队去年在FG 2025会议上发表的前序工作中,视觉跟踪模型的后处理前平均误差为11.4°,后处理后为7.0°。而本次评测中RTMPose-M的单模型平均误差已经达到6.99°,说明随着姿态估计模型本身的迭代,无标记方案的整体精度正在稳步提升。
从实验室到实际应用:VideoRun2D Demo平台
图4展示了四名短跑运动员使用RTMPose模型经过后处理后生成的关节点和角度可视化结果。橙色代表身体右侧,紫色代表左侧,可以直观看到每个步态周期中四肢的摆动轨迹。
不过也要泼一盆冷水:当前平台是研究性质的演示工具,没有针对大规模并发做优化,也没有提供API接口,距离产品级SaaS服务还有距离。但作为学术论文的配套工具,已经是超出预期的一步了。这种把研究成果直接变成可交互网页的做法,值得更多论文借鉴。
挑战与展望:临床应用的差距与未来方向
遮挡和左右混淆是误差的主要来源,SVR后处理减轻了但没根治;融合策略的增益也有限。作者在论文中列了几个未来方向:一是引入基于视觉注意力机制的图像特征(论文引用了AttZoom相关工作),让模型更关注关键部位;二是利用前沿的视觉语言模型(VLM)辅助理解人体运动语义,比如自动判断遮挡关系;三是系统性消除偏差,包括性别、种族、体型等维度,确保算法在不同人群上的表现一致。
另外值得关注的是合规问题。论文明确提到要尊重机器学习与AI系统的相关法规(如欧盟AI法案),并关注检测深度伪造等合成媒体内容的需求。这套系统未来如果真的要商业化,数据隐私、模型可解释性和安全审计都是绕不开的课题。
总体来看,VideoRun2D Demo的价值不在于技术上的颠覆性突破,而在于它把“深度学习姿态估计能不能用于跑步生物力学分析”这个问题,用严谨的实验数据和可交互的演示平台给出了一个阶段性的答案:可以,而且正在接近临床门槛。做运动科学、计算机视觉交叉方向的朋友,或者对低成本运动分析工具感兴趣的开发者,这篇论文值得找来读一读。😊
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
本文提出VideoRun2D Demo系统,利用五种2D人体姿态估计器(ViTPose-B/L、RTMPose-M/L)对短跑视频进行无标记运动捕捉,结合SVR平滑后处理与多跟踪器融合策略,实现髋关节和膝关节角度的生物力学分析。实验合理度:★★★★☆
均方根误差(RMSE),单位为度(°)学术研究价值:★★★★☆
本文提出VideoRun2D Demo系统,利用五种2D人体姿态估计器(ViTPose-B/L、RTMPose-M/L)对短跑视频进行无标记运动捕捉,结合SVR平滑后处理与多跟踪器融合策略,实现髋关节。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
论文未明确给出具体FLOPs数值,但RTMPose系列模型设计为实时推理,ViTPose系列模型计算量较大。复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:1) 角度误差仍高于临床可接受范围(2°-5°);2) 仅评估2D姿态估计,缺乏3D信息;3) 数据集规模有限(44名运动员);4) 未与其他无标记系统进行直接对比。
主要参考文献
融会贯通
从趋势上可以提炼几点:一是基于Transformer的姿态估计模型正在快速取代传统CNN方案,ViTPose和RTMPose的竞争已经从通用姿态估计扩展到了运动科学领域;二是“模型+后处理”的组合优化比单纯换更大更贵的模型更有性价比,本轮实验中RTMPose-M仅用较小参数量就超越了更大模型,这对算力有限的团队是个好消息;三是研究成果“工具化”越来越重要,提供在线演示让非AI背景的教练和康复师能直接试用,这种做法值得更多论文借鉴。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
跑步想提速、训练想少受伤?来群里一起研究视频跑姿分析的正确打开方式!欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 运动分析+北京+某体校+阿飞),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群