← 返回 PaperDaily 视觉与图像

FORGE-plus来了:LLM给机器人定力上限,压不坏还会修

机器人装配里最容易翻车的,不是“不会做”,而是“太用力”。这篇工作把LLM从“嘴强王者”变成了会给力控设预算、会看力信号选恢复动作的监督器,思路非常工程化。

FORGE-plus来了:LLM给机器人定力上限,压不坏还会修
原论文信息如下:
论文标题:
FORGE-plus: Force-Budgeted Recovery for Contact-Rich Assembly with a Frozen LLM Supervisor
发表日期:
2026年07月
发表单位:
Independent Researcher
原文链接:
https://arxiv.org/pdf/2607.21227v1.pdf
项目链接:
https://robot-team00.github.io/FORGE-plus/

机器人力控装配的预算与修复困境

机器人做装配,最怕的往往不是“够不着”,而是“太能使劲”。力一上头,轻则卡死,重则把脆弱零件直接按碎,现场画风立刻从自动化变成“人工检修”。这篇论文盯住的,就是这种很现实、也很尴尬的问题:力控装配到底该由谁来定力上限,失败之后又该怎么恢复
传统做法里,很多方法默认“力越大越容易成功”,于是失败后最自然的动作就是继续加力。但这个思路只对钢件、刚性件比较友好,一旦装配对象里混进脆弱件,比如薄壁瓶体、易裂齿轮,继续加压就不是恢复,而是拆台。论文把这个矛盾说得很直白:能把零件装进去的力,不一定是能把零件保住的力
更麻烦的是,失败时真正有用的信息,常常不在图像里,而在力信号里。视觉看上去像“卡住了”,但卡住的原因可能完全不同:可能是边缘顶住了,可能是姿态歪了,也可能是接触面已经开始打滑。只靠图像,容易把不同故障看成同一类;只靠加力,又容易把可修复问题变成不可修复事故。论文正是抓住了这个缝隙:让冻结的LLM只做“慢决策监督”,而不是下场直接控制力

核心机制:冻结LLM设定力上限 + 硬限制保安全

这套方法的思路其实很像工厂里的“总工审批 + 设备保险丝”。LLM负责理解“这是什么零件、它大概有多娇气”,然后给出一个每个对象专属的力预算;真正执行动作的控制器则在底层把命令硬性截断,保证机器人不会越过上限。也就是说,LLM会提建议,但最后拍板的是控制回路,不是语言模型。
Figure 1
图1:两层式架构。冻结LLM只输出一个数值Fmax和一个恢复动作选择;命令力不超过Fmax的保证来自快速控制回路中的硬截断,并叠加了120 N的全局硬上限和JSON范围校验。隐藏的Fbreak只用于评估器的破坏检测。
这里有两个关键动作。第一步是“预算设定器”:输入零件身份、材料、几何标签、任务类型,输出一个Fmax,也就是允许的最大力。这个Fmax不是拍脑袋的全局常数,而是按对象来定,脆的就给低一点,硬的就给高一点。第二步是“恢复选择器”:当插入失败时,LLM读取一个简短的力/接触签名,比如峰值力、插入深度、是否持续上升、是否存在横向偏置、是否有滑移事件,再从固定菜单里选一个恢复动作,例如撤回重试、摆动搜索、旋转对齐、重新抓取或直接终止。
这套设计最有意思的地方在于:恢复菜单里故意没有“提高力上限”这个选项。原因很朴素——如果失败后允许继续抬高预算,那LLM很容易把“修复”理解成“加压”,而这恰恰是脆弱装配最危险的动作。论文把这个口子堵死,恢复层只负责换动作,不负责放宽安全边界。
Figure 2
图2:脆弱恢复场景示意。LLM看到的不是图像,而是力签名:峰值16.1 N、净插入1.6 mm、持续上升、横向偏置稳定。它据此选择rotate_align(旋转对齐),并且始终遵守同一个Fmax,不允许“越修越猛”。
论文还专门强调了三条“非循环”约束,保证评估不是自嗨。第一,隐藏的破坏阈值Fbreak只给评估器看,任何学习模块都看不到;第二,恢复过程中Fmax不允许被改写;第三,真正的力控制权永远在快速控制回路里,而不是在LLM嘴上。这样一来,模型如果表现好,靠的是对象识别和恢复策略真的靠谱,而不是“偷看答案”。
从工程角度看,这种架构很像给大模型装了一个“物理保险箱”。LLM可以很聪明,但它不直接碰力;控制器可以很快,但它不懂对象语义。两者分工后,系统既保留了语义层面的判断能力,又把最危险的那部分权力锁在了底层。

实验验证:两个任务、七项指标、五种基线的全面比拼

这篇工作的实验设计,算是把“力上限”和“失败恢复”这两个问题都掰开了揉碎了测。任务只有两个,但都很典型:一个是脆弱瓶体放入瓶架,另一个是紧公差齿轮插入。前者考验的是“别把东西按碎”,后者考验的是“别把东西卡死”。两个任务都很接地气,也很适合看出恢复策略到底是在救火,还是在添油。
论文一共看了七类指标,覆盖得比较完整:闭环成功率、破坏率、预算是否合适、恢复是否有效、力是否省、命令是否真的被截断、以及跨夹爪迁移能力。这个组合很重要,因为只看成功率,容易把“暴力成功”误判成“方法优秀”;只看破坏率,又可能把“根本不工作”的方法错当成安全方案。七项一起看,才更像真实工程里的验收单。
Table 2
表2:脆弱ABS齿轮上的预算基线对比。实验在Franka上进行,采用确定性均值策略、每格约200个episode、严格判定标准。Margin表示平均破坏阈值与Fmax的差值。没有力上限的基线之所以显示为“非功能而非安全”,是因为力条件超出训练分布后,策略甚至连接触都进不去。
先看预算这件事。表2里最扎眼的不是“我们方法赢了”,而是“oracle也会翻车”。所谓oracle,是直接把Fmax设成Fbreak减去一个很小的ε,听上去像是最优答案,结果却因为控制命令在接触中会发生超调,导致一半左右的脆弱件还是被打坏。这个结果很关键,它说明只把名义上的上限设低还不够,必须把超调分布也算进去。换句话说,安全不是“写在纸面上”就算数,得真能压住物理世界的脾气。
再看恢复。论文在5毫米夹持内滑移的扰动下,比较了五种恢复方式:力签名链、视觉LLM代理、手工启发式、继续加压、以及不恢复。结果很有戏剧性:真正能把“歪掉的抓持”重新救回来的,只有读力签名的那条链路,因为它能识别出“问题跟着零件走”,所以会选择重新抓取;而视觉代理和手工规则常常分不清当前到底该转、该退,还是该重抓。
Table 3
表3:5毫米夹持滑移下的恢复扫表。实验在脆弱ABS齿轮上进行,每格25个episode,Fmax始终不提高。两张表使用了不同的步数上限和不同检查点,因此只适合在各自表内比较,不适合跨表硬比。
表3里最值得看的是“加压修复”的两张脸。在Robotiq 2F-140上,它几乎是徒劳的:因为歪掉的孔根本没吃上力,力上限抬高也没用,最后只剩超时;在Franka上,它又变成了破坏性极强的策略,24个脆弱件里几乎全被压坏。也就是说,同一个“继续加压”动作,在不同夹爪和不同接触状态下,可能分别表现为“没用”或者“毁掉”。这才是工程里最烦的地方:看起来像同一个按钮,按下去却是两种事故。
Figure 4
图4:恢复扫表的柱状图版本。可以直观看到,加压修复在2F-140上是徒劳的,在Franka上则是破坏性的。论文把这两种失败都摆出来,反而更诚实,也更有说服力。
另一个很有意思的实验,是“非循环评估设计”。论文没有把破坏阈值Fbreak暴露给模型,也没有允许恢复阶段修改Fmax。这样做的好处是,评估结果能真实反映方法是否真的懂“对象脆弱性”,而不是靠作弊式的阈值记忆。这个设计看着保守,实际上非常必要,因为一旦把隐藏阈值泄露出来,模型就有机会学成一个“会抄答案的控制器”。

关键发现:加压修复的两面性 & 非循环评估设计

这篇论文最有价值的地方,不只是提出了一个新框架,而是把两个很容易被“默认合理”的想法直接打脸:第一,失败后继续加压不一定是恢复,很多时候只是把问题推向破坏;第二,评估如果不把隐藏阈值隔离开,最后很容易变成一场“模型知道答案”的表演。
论文里还给了一个很重要的现实提醒:即便LLM设了比较保守的预算,恢复阶段的接触过程仍然可能比清洁插入更激烈。也就是说,恢复不是“低风险重试”,而是“在更差的姿态和更糟的接触状态下继续工作”。这也解释了为什么恢复阶段的峰值力往往比正常流程更高。对工程系统来说,这意味着恢复策略不能只看动作类别,还要看动作之后的接触轨迹是否真的更安全。
从实验结论看,这个方法的强项并不是“把所有任务都做满分”,而是在脆弱件和刚性件混合存在时,仍然能维持一条安全边界内的恢复路径。这比单纯追求成功率更接近真实产线,因为产线最怕的不是偶尔失败,而是某个失败动作把整批零件带走。
当然,局限也很明显。首先,这一切都发生在刚体仿真里,破坏只用一个隐藏标量阈值来建模,没有真实材料断裂和形变;其次,LLM只看文本,不看图像,适合做对象身份和恢复菜单选择,但不适合直接承担感知;最后,恢复策略虽然比加压更稳,但在某些设置下仍然会有超时和接触过冲,说明离“拿来就能上产线”还有距离。论文自己也没有把仿真结果包装成现实落地,这一点算是比较诚实。

总结与讨论:仿真局限与未来方向,龙迷三问,龙哥点评,参考文献

如果把这篇论文压缩成一句话,那就是:让LLM负责“懂对象”,让控制器负责“守底线”,让恢复策略只在安全边界内换动作。这个思路很朴素,但很工程。它没有幻想语言模型去接管物理世界,而是把语言模型放在它真正擅长的位置上:做语义判断、做策略选择、做低频监督。
未来如果要继续往前走,最值得补的有三件事。第一,把刚体仿真升级到更接近真实材料的接触建模,至少要看看形变和摩擦变化会不会把这些结论冲散。第二,把文本身份输入扩展成更可靠的对象描述来源,避免真实工厂里“零件名写错了,预算也跟着错了”。第三,把恢复策略和力预算联合优化,但依旧要保留硬约束,不然又会滑回“为了成功率,先把零件按坏再说”的老路。
从行业角度看,这类方法最适合的场景不是“特别炫”的机器人秀,而是那些零件类型混杂、脆弱件很多、失败代价很高的装配线。真正的价值不在于把峰值成功率再抬高一点,而在于把“出错时别把事情做更糟”这条底线真正落地。这个方向如果继续成熟下去,后面很可能会成为力控装配系统里的标准安全组件。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“力控装配里谁来定力上限、失败后怎么恢复”这两个现实问题。核心答案不是让模型更会加力,而是让模型先学会给零件分配一个合理预算,再在预算内选择恢复动作。

Fmax、Fbreak、force signature分别是什么意思?Fmax是允许的最大力上限,论文里由冻结LLM根据对象身份来设定;Fbreak是零件的破坏阈值,只给评估器看,模型看不到;force signature就是失败时的一段简短力/接触摘要,用来帮助LLM判断当前更像是顶住了、歪了、还是滑了。

为什么论文强调“不能继续加压”?因为继续加压只对一部分刚性件有用,对脆弱件往往是灾难。论文的实验已经证明,加压修复在不同夹爪和不同接触状态下,可能分别变成“无效”和“破坏”,所以它不能被当成通用恢复策略。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

创新点不在某个单点大招,而在“冻结LLM + 力预算 + 恢复菜单 + 硬约束”这组组合拳。思路工程味很足,属于把几个容易被忽略的安全细节认真拼起来的工作。

实验合理度:★★★★☆

任务、基线、指标和非循环设计都比较完整,尤其把“oracle也会翻车”这个事实测出来了,很加分。唯一遗憾是全部停留在仿真,离真实装配还有一段路。

学术研究价值:★★★★☆

它把“力控装配中的语义监督”和“物理安全边界”连接起来了,对后续做安全机器人、接触恢复、脆弱件装配的人都有启发。研究意义不低,尤其适合当作后续系统设计的模板。

稳定性:★★★☆☆

在仿真里已有不错表现,但恢复阶段仍有超时和过冲,说明系统还没有到“随便上产线”的程度。对脆弱件来说,稳定性比成功率更重要,这里还有提升空间。

适应性以及泛化能力:★★★☆☆

跨夹爪、跨对象类别做了验证,说明有一定泛化味道;但对象身份依赖、任务范围和仿真设定都比较明确,泛化还没到“哪里都能用”的程度。

硬件需求及成本:★★★★☆

冻结LLM只在低频调用,真正高频的还是传统控制回路,所以在线成本不算夸张。真正的成本主要在策略训练、仿真调参和恢复流程设计上,不在推理算力本身。

复现难度:★★★☆☆

论文给了项目页和日志,信息算比较全,但系统包含多层控制、恢复菜单、隐藏阈值和不同夹爪配置,复现起来仍然不算轻松。属于“有路标,但路不短”。

产品化成熟度:★★☆☆☆

目前更像一个安全架构原型,适合做研究平台和策略验证,不适合直接当产线方案。要进产品,至少还需要真实材料、真实传感和更稳的恢复闭环。

可能的问题:最大的问题不是思路不对,而是仿真过于理想化,且恢复阶段仍会出现超调和超时。顶会标准下,这篇更像“把安全边界讲清楚了”,而不是“已经把工业装配彻底解决了”。


主要参考文献

[1] Factory: contact-rich assembly benchmark and simulation line.
[2] IndustReal: industrial manipulation benchmark in simulation.
[3] AutoMate: assembly-focused manipulation benchmark.
[4] FORGE: force-conditioned RL skill for contact-rich insertion.
[5] REFLECT. [6] DoReMi. [7] AHA. [8] Tactile-VLA. [9] PaCo-VLA. [10] ForceVLA. [11] CompliantVLA-adaptor. [12] Isaac Lab. [13] GraspGen. [14] PPO. [15] DAgger. [16] Weight soup.
论文原文:https://arxiv.org/pdf/2607.21227v1.pdf
项目页:https://robot-team00.github.io/FORGE-plus/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
机器人装配别再靠“猛男式加压”了,脆弱件真的扛不住。进群一起聊聊这类力控装配、LLM监督、失败恢复的实战设计,少踩坑,多省零件。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。