← 返回 PaperDaily 视觉与图像

港大清华开源XPolicyLab:42个机器人策略一套接口打通,集成效率提升10倍

机器人领域最缺的不是新模型,而是让模型跑起来的"标准化插头"。港大MMLab与清华联合开源的XPolicyLab,把N个策略连M个环境的成本从O(NM)压到O(N+M),实测集成时间从5小时干到30分钟,是真实工程痛点的一记重拳。

港大清华开源XPolicyLab:42个机器人策略一套接口打通,集成效率提升10倍
原论文信息如下:
论文标题:
XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment
发表日期:
2026年08月
发表单位:
MMLab@HKU(香港大学)& THU(清华大学)
原文链接:
https://arxiv.org/pdf/2608.09892v1.pdf
项目链接:
https://xpolicylab.github.io/
在开始今天的内容之前,先来看看XPolicyLab的整体架构示意图——一个适配器如何同时服务于基准测试、模拟器和物理机器人:

引言

XPolicyLab基础设施示意图
XPolicyLab基础设施示意图,展示一个适配器如何服务于基准测试、模拟器和物理机器人
机器人领域的通用策略模型(VLA、具身基础模型)发展飞快,但有个尴尬现实卡着行业脖子:训练好的模型很难被“插”到新的仿真器或物理机器人上跑起来。不同策略的软件依赖不兼容、数据格式各异、检查点约定五花八门,把A模型部署到B环境,常常需要重写大量胶水代码,每换一个环境几乎全部重来。
更麻烦的是,这种各自为政会“静默地”引入隐蔽bug——相机命名不一致、图像通道顺序反了、夹爪尺度不对,导致评测结果无法跨策略比较。用系统工程师的话总结:把N个策略连接到M个评估环境,当前成本是O(NM)次独立集成。这个复杂度在策略和环境爆炸式增长的今天,已成真实瓶颈。
港大MMLab与清华联合推出的XPolicyLab,正是冲着这个问题来的。它定义了统一的策略适配契约和标准化的观察、动作、轨迹数据模式,配合依赖隔离的服务架构,把策略推断与仿真环境彻底解耦。最终效果是,任何新策略接入任意环境只需写一个适配器;任何新环境接入任意策略只需写一个客户端——集成成本从O(NM)降为O(N+M)。
截至2026年8月,XPolicyLab已集成42个机器人策略,覆盖VLA模型、世界动作模型、扩散视觉运动策略、记忆增强策略及传统模仿学习基线,并在RoboTwin、RoboDojo仿真和RoboDojo-RealEval真实机器人评估上完成部署验证。

问题背景及相关工作

数据采集、数据集标准化和训练基础设施这几年已有长足进展。DROID和BridgeData提供多样的真实世界操作数据,FastUMI支持与形态无关的数据采集,LeRobot标准化数据集处理和策略训练,RLinf为策略优化提供可扩展基础设施。这些系统做的是“生产检查点”那一侧的事。
训练好的策略与执行它的环境之间的边界地带,一直没有被系统性解决。仿真基准方面,RLBench、ManiSkill2、LIBERO、RMBench等平台定义了各自的任务语义和评估协议;RoboTwin覆盖多种双臂操作任务,RoboDojo结合能力导向仿真与标准化实物评估;RoboArena和RoboChallenge则跨机构协调分布式真机评估。它们都规定“评估什么”,但都没有提供策略侧抽象——每接入一个新策略,基准平台就得维护一套模型专属服务堆栈。
再看策略部署侧。OpenVLA、π₀、GR00T等模型都自带针对特定架构定制的推理和部署代码,依赖、观察格式、动作表示各不相同。XPolicyLab不做“又一个统一建模框架”,它不规定网络架构、训练目标、动作解码器或时间视野——它只定义策略与环境之间的“接口”,这正是其适配器能跨环境复用的关键。

方法概述

XPolicyLab采用“策略中心”的抽象方式,把策略计算与环境执行彻底分开。核心原则是:每个策略对外暴露一个稳定契约,同时保留对自身架构、依赖、检查点和推理流程的完全控制。这样,异构仿真器、基准客户端和物理机器人就能通过同一条执行路径调用任意策略。
图1:XPolicyLab总览
图1:XPolicyLab总览。异构策略运行时(左侧)保留原生依赖和流程,评估环境(右侧)保留各自仿真器和机器人堆栈。XPolicyLab(中间)通过统一生命周期、极简适配器契约、标准化观察动作模式及依赖隔离服务桥接,将两者连接。一个适配器可同时服务公共基准、仿真后端和物理机器人,支持本地或远程执行及批处理、有状态推理。
系统由四个功能组件构成:环境后端执行任务,环境客户端管理交互循环,通信层传输观察和动作,策略服务器托管模型及适配器。另有横切流程的工具链,统一管理安装、配置、调试、训练、服务和评估。策略服务器运行在独立软件环境中,可与环境客户端同机或放在远程计算节点。
架构上定义两条稳定边界。语义边界定义共享观察和动作模式;执行边界定义策略服务器与环境客户端间的通信协议。对观察o_t、可选内部状态s_t和动作视野H,策略推理可表达为公式(1):
公式1:策略推理的通用形式。其中 gingout 负责在共享数据模式和策略原生表示间映射,πθ 是策略网络本身。XPolicyLab标准化外部映射,完全不约束 πθ、gin、gout 的内部形式。
每个策略适配器只需实现四种核心操作:模型构造加载检查点和配置;观察更新接收标准化观察并更新上下文;动作预测返回标准化动作块;回合重置清空内部状态。对有循环结构或显式记忆的策略,reset是必须的。还提供批处理变体,支持并行评估多个环境实例。
观察模式也被标准化。一份标准观察表示为五元组:视觉输入 vt、关节状态 qt、笛卡尔位姿 pt、语言指令 l 和可选元数据 mt
公式2:标准观察的五元组表示
公式2:标准观察的五元组表示。视觉输入按相机名称索引,可含RGB、深度图和标定参数;机器人状态支持单臂和双臂;笛卡尔位姿遵循 [x, y, z, qw, qx, qy, qz] 四元数约定。所有字段可选——按策略需求填写。
细节:图像解码固定在服务端完成,而非留给适配器。这意味着每个适配器拿到的图像都是同样的颜色顺序和布局,从根上杜绝“训练时用一种通道顺序、评测时用另一种”这类隐蔽错误。服务层做传输级反序列化和图像解码,适配器只做模型相关变换(缩放、归一化、token化等),职责划分清晰。

依赖隔离架构:让策略与仿真环境各得其所

机器人项目的现实是:策略模型的软件依赖和仿真器的依赖经常冲突。这边要PyTorch特定版本,那边要Isaac Sim另一环境,硬装在一起分分钟搞崩。XPolicyLab的解法是进程级隔离——策略服务器在自己的原生环境里加载模型,环境客户端留在仿真器或机器人驱动所需环境里,两边通过WebSocket协议通信,用MessagePack序列化外加数组扩展。消息集包含HELLO、PREPARE CASE、RESET、INFER、CALL、TRIAL END、HEARTBEAT、CLOSE八种,每种都带确认帧或结果帧。
这种架构的直接好处是:动作块(action chunking)的执行策略可由环境客户端灵活决定。有的环境控制频率高,可能只想执行预测动作块里的前几步就重新请求;有的环境控制频率低,可把整个动作块执行完再请求。这个决策天然应放在知道控制频率的那一侧。
通信层的可靠性设计也花了心思。因为策略是有状态的,朴素的“断线重试”可能导致严重问题:如果客户端重发请求,但服务器已处理完只是响应丢了,重试会让策略在同一个观察上推理两次,内部状态被污染。XPolicyLab给每个请求分配唯一标识符,服务端缓存已完成响应。遇到瞬时断连后的重试,直接返回缓存结果。若服务器重启,handshake阶段的实例标识符会变化,客户端直接判定当前回合失败——因为重启后的服务器已丢失回合状态。这种“表面多此一举、实际救大命”的细节,正是系统工程魅力。
依赖隔离的另一好处是部署灵活性。推理可放在专用GPU服务器上跑,仿真和物理控制留在靠近环境一侧的机器上。这意味着实验室可在真机旁只放轻量级控制机,把大模型推理丢到远程GPU集群。对于动辄几十GB的VLA模型,这个能力直接决定评估流程能否在实际中跑起来。

42个策略的生态验证:从RoboTwin到RoboDojo-RealEval

截至2026年8月8日,XPolicyLab已集成42个机器人策略,覆盖VLA模型、世界动作模型、扩散视觉运动策略、记忆增强策略及传统模仿学习基线。从单步预测到动作块生成、从时序聚合到显式记忆,从几十MB轻量基线到几十GB大模型,全部通过同一个适配器契约被吸收。当然,“能接进来”和“接得好”是两回事,论文在系统评估部分用定量实验回答了这个问题。
图2:通过XPolicyLab进行的跨平台策略评估
图2:通过XPolicyLab进行的跨平台策略评估。共享策略代码库和标准化服务接口,让同一个策略集成在RoboTwin 2.0、RoboDojo仿真和RoboDojo真实世界评估中都能以极少的策略侧适配运行。
验证场景覆盖三个评估环境:RoboTwin仿真、RoboDojo仿真和RoboDojo真实世界评估。这三个环境在任务定义、仿真器基础设施、机器人本体和评估协议上都有明显差异,但共享同一个策略抽象和服务架构。RoboTwin评估50个双臂操作任务,在干净和随机化两种设置下进行;RoboDojo仿真把42个仿真任务组织成五大能力维度——泛化、精度、长视野、记忆和开放。
表II:RoboTwin排行榜前10名的策略(按干净设置下的平均成功率排序,快照日期2026年8月10日)
表II:RoboTwin排行榜前10名策略,按干净设置下平均成功率(Clean SR)排序,同时给出随机化设置表现(Randomized SR)。快照日期2026年8月10日。
看RoboTwin榜单(表II),排名第一的FastWAM在干净设置下平均成功率77.8%,但随机化设置下只有1.9%;第二名Spatial Forcing干净设置77.2%、随机化9.5%;第三名ππ0.5干净设置70.7%、随机化46.0%。这个巨大落差非常有意思——它能被清晰度量,恰恰因为所有策略共享同一个观察契约。若每个提交都自带一套预处理流程,这么大的差距根本分不清是模型能力差异还是数据打包方式差异。
RoboDojo仿真榜单(表III)用综合分数(Score)排名,同时给出成功率(SR)。综合分数额外奖励部分任务进度,成功率只统计完整执行任务。排名靠前的G0.5和Xiaomi-Robotics-1同时也在RoboTwin榜单出现,说明这些模型确实具备跨平台泛化能力,而非在单一数据集上过拟合。
表III:RoboDojo仿真榜单前10名策略(按平均分数排序,快照日期2026年8月4日)
表III:RoboDojo仿真榜单前10名策略,按平均分数排序,同时给出成功率。快照日期2026年8月4日。
RoboDojo-RealEval则把同一套服务架构延伸到18个物理任务上,横跨三种双臂机器人本体:ARX X5、Piper和Piper X。机器人控制器作为XPolicyLab环境客户端,策略推理在独立进程中运行,可放在远程GPU服务器上。每个策略在每项任务上跑10次试验,三个本体共180次物理试验。表IV展示排名前十的策略。
表IV:RoboDojo-RealEval榜单前10名策略(按平均分数排序,快照日期2026年8月4日)
表IV:RoboDojo-RealEval榜单前10名策略,按平均分数排序,同时给出成功率。快照日期2026年8月4日。
实际应用案例展示
论文对真实榜单数据的态度比较冷静。两点评述值得注意:第一,绝对成功率在仿真和真实环境中都不高,且真实世界排名和仿真排名只有部分相关性——当前真正卡住社区进度的不是再跑多少个仿真种子,而是物理试验本身太贵。第二,RoboTwin干净设置与随机化设置间的成功率差距在不同策略间差异极大,这个差距之所以可解释,正因为所有条目共享同一个观察契约。
值得一提的是,XPolicyLab也是RoboDojo-RealEval官方公开排行榜的策略提交与执行工作流提供方。这意味着真实的第三方策略可通过标准化接口参与跨机构评测,而不需要为每个参赛模型单独搭一套服务。这种“公共基础设施”的定位,已超越普通开源工具的范围。

集成效率的量化革命:从5小时到30分钟

论文给了一个非常硬核的量化实验。他们设计了一个受控研究:让6名不熟悉XPolicyLab的工程师,把π0.5连接到RoboDojo仿真评估并复现闭环结果。每名参与者都要在三种条件下完成任务:①只用上游模型仓库从零开始;②按XPolicyLab标准手动写适配器;③用XPolicyLab加上打包的Agent Skills,让编码智能体在人工监督下执行“搭脚手架-实现-调试”循环。
实验设计挺讲究。这是被试内设计,每名参与者都必须完成全部三种条件。6个参与者对应3个条件的6种排列顺序,每人分到一种,避免某个条件在位置上系统性占便宜。两场session之间至少隔一天,且不允许跨条件复用代码或笔记。当然,这种设计无法完全消除参与者对π0.5本身的熟悉度差异,所以论文自己也很克制地说这是“指示性案例研究”,不是“对标准的孤立受控测量”。
表V:将π0.5连接到RoboDojo仿真的集成成本(N=6名参与者的中位数,智能体条件使用Cursor搭配Opus 5)
表V:将π0.5连接到RoboDojo仿真的集成成本(N=6名参与者的中位数,智能体条件使用Cursor搭配Opus 5)。数据表明,从零开始的集成耗时超过5小时,按照XPolicyLab标准手动接入约为2小时,配合Agent Skills进一步压缩到约30分钟。
表V数据很有说服力。从零开始集成耗时超5小时,其中环境搭建2小时、观察和动作胶水代码2小时、调试到首次rollout还要1.5小时;按XPolicyLab标准手动接入降到约2小时,其中胶水代码仍要1小时;配合Agent Skills后总耗时约30分钟,三阶段各压缩到10分钟。人工手写代码量从约300行降到约120行再到约0行。论文特别注明“手写代码”指人写的、而非智能体生成后被审核的代码;同时排除检查点下载时间,这部分受带宽限制,三种条件下都一样。
还有一个容易被忽略但实际价值极高的数据:复现一个已经集成好的策略的评估,从安装到执行单条评估命令只需约10分钟(同样排除检查点下载)。相比之下,没有共享层的话,重建环境和胶水代码要花好几个小时。这意味着当XPolicyLab成为社区共同基础设施后,“复现一篇论文的评测结果”这个动作的成本从“小时级”降到“分钟级”——对提高整个领域的可复现性是实质性推动。
关于Agent Skills的设计,思路很聪明。既然一致性流程被完整写成规范,那么让编码智能体(如Cursor、Claude Code、Codex)来执行而不是让人来读规范,就成了顺理成章的选择。仓库里打包了两种技能:集成技能(integration skill)编码了适配器布局、契约规则、检查点规范和调试闭环流程;审计技能(audit skill)在人工审查前用同样的门禁检查提交。在受控实验中,所有参与者都使用Cursor加Opus 5的组合,固定了智能体栈,因此对比的是“技能”本身的增益,而非模型选择的差异。
这套流程设计里的一个亮点是分级验证策略:适配器先在离线闭环客户端上进行验证,检查服务器启动、观察序列化、动作结构、批处理执行和回合重置,直到确定性的完成标记;通过了这些接口级检查之后,才连到受支持的环境跑正式评测。换句话说,大部分适配器的bug可以在没有仿真器、没有真实机器人的情况下自动暴露,能省下大量反复烧仿真资源的排队时间。

开放生态与未来展望

XPolicyLab已以共享基础设施形式开源,项目网站是xpolicylab.github.io。从定位上看,它不是一个具体的算法贡献,而是为整个机器人社区提供一个可复现策略比较和标准化部署的公共层。它解决的核心痛点是“让一个检查点在从未跑过的环境中正确运行”——这是当前制约可复现比较的真正瓶颈。
论文结语里有一段话说得很好:“这个标准无法消除物理环境的随机性,也无法解决标准化机器人时间稀缺的问题;它只能确保稀缺的时间被花在物理交互本身,而不是花在反复摸索怎么把checkpoint喂给一个新环境。”这句话把系统工作的价值边界划得很清楚——基础设施不解决算法问题,但能让算法工作者的每一分钟都花在真正有价值的地方。
横向对比来看,机器人领域已有基础设施大多聚焦在数据侧和训练侧——DROID、BridgeData、FastUMI、LeRobot、RLinf这些工作把“生产一个检查点”的成本降下来了;仿真基准平台如RLBench、ManiSkill2、LIBERO、RoboTwin、RoboDojo等定义了“评估什么、在什么条件下评估”;RoboArena和RoboChallenge则尝试跨机构协调分布式真机评估。XPolicyLab补上的是中间那条“策略与其执行环境之间的边界”,与这些工作形成互补而非替代关系。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?XPolicyLab由港大MMLab与清华联合打造,定义机器人策略评估与部署的统一标准和开源生态,将N策略连M环境的成本从O(NM)降至O(N+M),实测集成时间从5小时压缩到30分钟。
这篇工作最值得看的点是什么?论文通过受控实验证明,符合XPolicyLab标准可将代表性策略的集成时间从5小时以上降至约2小时,配合代理技能进一步降至30分钟;42个策略适配器成功部署于多个评估平台。
这篇工作的边界或风险在哪里?优点:1) 提出统一的策略-环境接口契约,有效解决机器人策略部署碎片化问题;2) 依赖隔离架构设计合理,支持本地和远程部署;3) 将一致性流程封装为机器可读的代理技能,创新性地降低集成门槛;4) 生态系统覆盖42个策略,规模可观。缺点:1) 受控实验样本量较小(N=6),且参与者对π0.5的熟悉程度可能影响结果;2) 论文未提供与现有方案(如LeRobot等)的定量对比;3) 真实世界评估的绝对性能较低,系统对策略性能提升的直接贡献有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一个统一的策略适配器契约和依赖隔离的服务架构,将异构机器人策略与多种评估环境解耦,使集成成本从O(NM)降至O(N+M)。

实验合理度:★★★★☆

平均成功率(SR)、综合得分(Score,额外奖励部分任务进度)

学术研究价值:★★★★☆

提出一个统一的策略适配器契约和依赖隔离的服务架构,将异构机器人策略与多种评估环境解耦,使集成成本从O(NM)降至O(N+M);更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

https://xpolicylab.github.io/

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;2) 依赖隔离架构设计合理,支持本地和远程部署;3) 将一致性流程封装为机器可读的代理技能,创新性地降低集成门槛;4) 生态系统覆盖42个策略,规模可观。缺点:1) 受控实验样本量较小(N=6),且参与者对π0.5的熟悉程度可能影响结果;

主要参考文献

[1] XPolicyLab Contributors. XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment. arXiv preprint arXiv:2608.09892, 2026.
[2] 项目官网: https://xpolicylab.github.io/
[3] RoboTwin基准: https://robotwin-platform.github.io/leaderboard
[4] RoboDojo基准: https://robodojo-benchmark.com/leaderboard

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
🧠 想让更多机器人策略“插上电就能跑”?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 机器人+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。

『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。机器人策略部署这件“小事”,进群和大伙儿一起聊透!
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。