← 返回 PaperDaily 视觉与图像

复旦等机构新框架OmniAct:40个真实任务更稳了

这篇 OmniAct 很适合机器人/具身智能方向的读者:它不是把“规划、记忆、执行”揉成一锅粥,而是拆成三层各司其职,专门解决长程任务里最烦的两件事——工具太杂、失败太多。更有意思的是,它在真实家庭场景里把开源模型也拉到了接近商用的表现,思路相当顺手。

复旦等机构新框架OmniAct:40个真实任务更稳了
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇 OmniAct 很适合机器人/具身智能方向的读者:它不是把“规划、记忆、执行”揉成一锅粥,而是拆成三层各司其职,专门解决长程任务里最烦的两件事——工具太杂、失败太多。更有意思的是,它在真实家庭场景里把开源模型也拉到了接近商用的表现,思路相当顺手。


原论文信息如下:
论文标题:
Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
发表日期:
2026年06月
发表单位:
Fudan University, Shanghai Innovation Institute, Jilin University
原文链接:
https://arxiv.org/pdf/2606.27251v1.pdf
开源代码链接:
https://github.com/EmbodiedForge/RAS_interactivate_planner
项目链接:
https://huaizz-shawen.github.io/OmniAct

🚀 从孤立技能到日常自主:OmniAct如何让机器人“融会贯通”?

先看一眼这个演示:机器人不只是“会干活”,而是能把手机、家电、机械臂、移动平台和网页工具串成一条完整链路,遇到物理执行出错还能自己刹车、回看、重来。说白了,OmniAct 想解决的不是单个技能能不能做,而是一连串现实任务能不能稳稳做完。这件事听起来像“机器人终于长脑子了”,但落到工程上,难点其实很朴素:工具太杂、记忆太长、失败太多。
整体效果展示视频
图:OmniAct 在真实家庭环境中执行长程物理任务的整体演示。可以看到它不是单点炫技,而是把跨域工具调度、视觉抢占和自主恢复连在一起,形成一个闭环。
这类系统最容易翻车的地方也很现实:前一秒让机器人去开灯,后一秒又让它去拿杯子,再加一句“顺手把网页上的配送状态查一下”,如果没有统一编排,系统就会像一个同时接了三份兼职的实习生——忙是忙了,结果全乱套。OmniAct 的思路比较清楚:不要指望一个大模型从头到尾包圆一切,而是把规划、记忆、验证拆开,各干各的,再通过异步机制协同工作。

🧠 三大核心模块:规划、记忆、验证的完美协作

图2 OmniAct框架总览图
图2:OmniAct 框架总览图。系统由三部分组成:多模态语义规划器、带异步视觉抢占的闭环执行引擎、自适应分层记忆。三者分别负责“想什么、怎么做、做得对不对”。
先解释一个基础概念:具身智能体不是只会聊天的模型,而是要能在真实世界里感知、决策、行动。这里的“感知”包括图像、语音、状态信息,“行动”既可能是机械臂抓取,也可能是调用 IoT 设备或网页接口。问题在于,现实任务并不是一条直线,而是一串交织的事件:先看环境,再决定调用哪个工具,再执行物理动作,再检查有没有出错。OmniAct 把这条链路拆成三个层次,避免一个模块既当裁判又当运动员,最后两边都不讨好。
第一层是多模态语义规划器。它吃进来的不只是文字指令,还包括图像和状态信息,然后把任务拆成可执行的技能路由。论文里把动作空间定义成“技能路由”形式:每一步不是直接输出低层控制量,而是先选目标技能,再给这个技能附条件参数。这样做的好处很直接:API、IoT、机械臂、移动机器人这些风格完全不同的执行器,终于可以在同一张“任务菜单”里被统一调度。
第二层是自适应分层记忆。长程任务最怕什么?不是做错一次,而是做着做着忘了前面说过啥。很多智能体把历史对话一股脑往上下文里塞,结果越塞越满,越满越乱,最后模型像背着一麻袋旧账上山。OmniAct 不这么干,它把记忆分成感知记忆、情景记忆和反思记忆:近处的原始观测给执行器用,中间的事件历史做压缩,长期的经验和失败教训单独存放,等规划时再取出来。这个设计的核心,是让记忆不再“线性膨胀”。
第三层是异步视觉抢占引擎。这部分很像给机器人装了一个“中途体检员”。传统 VLA(Vision-Language-Action,视觉-语言-动作)模型通常是开环执行,意思是动作发出去以后就不管了,像把球踢出去就转身刷手机。可现实里球可能踢歪、杯子可能滑落、门可能没关上。OmniAct 让视觉监控和物理执行并行:一边执行,一边隔一段时间看一眼当前画面,如果发现异常,就立刻中断,回到规划器重新算。这就是“视觉抢占”的意思,抢的是执行权,不是抢镜头。

⚙️ 闭环执行:用“视觉抢占”捕捉不可见的物理故障

这部分最值得细讲。很多人会觉得,机器人执行失败不就是“没抓稳”“走偏了”吗?问题是,低层控制器往往只知道自己发了什么指令,不一定知道现实世界到底发生了什么。比如机械臂手已经松了,物体却掉到了桌边;或者机器人朝目标走了,但中途被椅子挡住了。对控制器来说,它还在“正常执行”;对任务来说,已经开始事故现场了。
图1 真实世界长程具身部署的两个关键挑战
图1:真实世界长程具身部署的两个关键挑战。左边强调单条用户指令可能同时涉及 IoT、机械臂、移动平台和网页接口;右边强调长时间运行后,必须能自主发现并恢复物理失败。
OmniAct 的做法不是去强化低层控制器的“肌肉记忆”,而是给它加一个语义层面的监视器。这个监视器用视觉语言模型(VLM,Vision-Language Model,视觉语言模型)周期性检查:目标物体还在不在?动作是否真的推进到了预期状态?当前画面是否出现异常?一旦判断不对劲,就触发抢占,把执行流直接打断。这个机制的妙处在于,它不只看几何是否安全,还看任务语义是否还成立。比如目标杯子还在不在手里、机器人是不是还在往正确方向前进,这些都不是简单的关节限位能判断的。
表6 视觉监控模型的延迟与验证准确率
表6:候选视觉语言模型作为视觉监控器时的延迟与任务完成验证准确率。论文用一个平衡测试集检查它们能不能分辨“成功动作”和“失败/受扰动作”,这一步很关键,因为监控器本身要是看走眼,后面全白搭。
视觉抢占还有一个很实用的副作用:它把失败变成了可学习的经验。每次检测到异常,系统都会把失败原因、修正策略、当时状态写进反思记忆。这样下一次遇到类似情况时,不需要从零猜谜,而是能把“上次怎么翻车的”直接拿出来参考。这个设计有点像老司机带新人:不是只告诉你方向盘怎么打,还会提醒你“前面那段路有坑,别又开沟里去”。

🧩 事件边界记忆:让机器人记住该记住的,忘掉该忘掉的

这套记忆机制的关键词是 event-boundary-driven compression,中文可以理解为“基于事件边界的压缩”。先解释一下:在长程任务里,交互历史并不是均匀的流水账,而是天然分段的。比如“拿起杯子”是一段,“把杯子放到桌上”是另一段,“打开灯并继续操作”又是另一段。OmniAct 认为,真正值得压缩的不是随便哪一帧,而是事件结束、状态切换这些边界点。
它的分层设计也很讲究。感知记忆像短期工作台,存最近的画面和状态,供执行器和监视器快速读取;情景记忆负责把一段段互动压成紧凑摘要,保留关键状态变化、动作结果和时间戳;反思记忆则像长期经验库,专门存工具结构、技能说明、失败复盘和纠错建议。这样一来,模型不必把所有历史原封不动塞进上下文,既省 token,也减少“旧信息把新信息淹没”的问题。
图4 270轮交互中的输入token变化
图4:270轮交互中每次调用的输入 token 变化。上图是直接拼接历史,token 数量一路线性飙升;下图是 OmniAct 的分层记忆,token 基本维持在一个较稳定的区间。
这里要重点理解一个现实问题:上下文窗口不是无限的。长程任务跑得越久,历史越长,输入 token 就越多,模型越容易“看不过来”。所以表面上看,压缩记忆像是在做数据整理,实际上是在给系统续命。OmniAct 的结果是,随着交互轮次增加,输入 token 近似保持平坦,不会像原始历史那样一路冲到天花板。这意味着它更适合真正的长期运行,而不是只在短 demo 里精神抖擞。
表1 长程场景中的约束满足率与压缩比
表1:三种长程场景下的约束满足率与上下文压缩比。这里的“约束”指的是前面设定过的长期偏好或规则能不能被持续遵守,比如前面说了不要糖,后面又说想要有味道,系统得同时记得两件事。
从结果看,单纯滑动窗口虽然压缩得最狠,但也最容易把早先的重要约束删掉,属于“眼前省事,后面翻车”。直接保留全部历史又会遇到信息太长、检索困难的问题。OmniAct 的分层记忆之所以更稳,是因为它不是简单删减,而是把关键语义提炼出来,再把失败反思单独保留。换句话说,它不是把过去扔了,而是把过去整理成了可用的经验。

🏆 实验验证:40个任务全面领先,轻量模型也能媲美顶级商用

实验设计比较扎实。论文不是拿一个单一任务凑热闹,而是在两个真实机器人平台上做了 40 个长程任务:UR5e 机械臂和 Keenon 移动机器人,各自覆盖操作和导航两类场景,再按复杂度分成三档。这样的设置有个好处:既能看“能不能做”,也能看“复杂起来会不会崩”。
图3 长程任务上的端到端与子任务成功率
图3:长程跨域任务上的端到端成功率和子任务成功率。可以明显看到,任务复杂度从 L1 到 L3 增加时,基线方法掉得比较快,OmniAct 的下降则更平缓。
这里先解释两个指标。子任务成功率看的是每一步有没有完成;端到端成功率看的是整条链路有没有最终做完。前者像“中途打卡”,后者像“全程完赛”。长程任务里,很多方法看上去每一步都还行,但只要中间错一次,后面就全崩,所以端到端指标更残酷,也更接近现实。
从图3能看出,OmniAct 在更难的 L3 任务上依然保持了相对稳定的表现。它的优势不是“单点爆发”,而是“全链路不掉链子”。这恰恰说明,异步视觉抢占和反思记忆不是摆设:当某一步执行偏了,系统能及时止损,而不是让错误像多米诺骨牌一样往下倒。
表2 不同基础模型接入OmniAct前后的约束满足率
表2:不同基础模型接入 OmniAct 前后的约束满足率对比。这里的重点不是某一个大模型“天生更强”,而是看 OmniAct 这套编排框架能不能把不同底座都拉起来。
这张表的意思很有启发:中等规模的开源模型在接入 OmniAct 后提升最明显,甚至能追平某些商用模型的裸奔表现。这个结论挺重要,因为它说明问题不全在“模型够不够大”,还在“系统组织得够不够聪明”。换句话说,别老盯着参数量发呆,架构设计也能救场。
表5 三个复杂度层级的代表性任务请求
表5:三个复杂度层级的代表性任务请求。L1 主要是单一物理操作,L2 开始掺入 IoT 或网页工具,L3 则把语音、多工具和物理执行全混在一起,最接近真实家庭场景。
还有一个细节值得一提:论文对视觉监控器也做了候选模型比较,说明它不是随便挑个看图模型就上。监控器既要够快,也要够准,否则异步抢占就会变成“瞎抢占”。这类工程问题往往最不起眼,但真正决定系统能不能落地。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“长程具身智能体怎么在真实世界里持续干活”这个问题。核心不是让模型会一个动作,而是让它能协调多种工具、记住长期约束、并在物理失败后自己恢复。

“视觉抢占”和“事件边界压缩”分别是什么意思?视觉抢占就是执行中用视觉监控实时检查,一旦发现异常就中断并重规划;事件边界压缩则是把长历史按任务事件分段压缩,保留关键语义和失败经验,避免上下文无限膨胀。

为什么它能让开源模型接近商用模型表现?因为提升不只来自底座模型本身,还来自系统组织方式。OmniAct 把规划、记忆和验证拆开后,中等规模模型也能更稳定地调度工具、避免历史冲突、及时修正失败,所以整体表现会明显上来。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是把单个模块做大做强,而是把规划、记忆、验证拆成协作系统,这种“异步分层”思路挺对路。

实验合理度:★★★★☆ 真实机器人平台、长程任务、跨复杂度分层、再加上多种基线和消融,整体比较扎实。

学术研究价值:★★★★☆ 对具身智能长期自治很有启发,尤其适合后续研究“如何让智能体不只会做,还能持续做”。

稳定性:★★★☆☆ 方向不错,但真实世界里视觉监控、工具接口和执行器可靠性都会影响稳定性,离大规模无人值守还有距离。

适应性以及泛化能力:★★★★☆ 在不同机器人平台和不同基础模型上都能起作用,说明方法不是只吃某一种底座。

硬件需求及成本:★★★☆☆ 训练未必重,但真实部署涉及机器人、IoT 和视觉监控,系统成本不低。

复现难度:★★★☆☆ 代码和项目页给了,但真实家庭长程任务、硬件环境和执行细节,复现门槛仍然不低。

产品化成熟度:★★★☆☆ 在受控家庭/实验环境里已经很像样,但要进更复杂的真实场景,还需要更强鲁棒性和更完备的安全策略。

可能的问题:框架很强,但依赖监控器、规划器和工具接口都稳定;一环掉链子,闭环就会变成“闭着眼跑”。


主要参考文献

Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang. Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy. arXiv:2606.27251, 2026.
项目主页:https://huaizz-shawen.github.io/OmniAct
开源代码:https://github.com/EmbodiedForge/RAS_interactivate_planner

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。