论文标题:
World Translation: Minimizing Sim-to-Real Gap with Backward Dynamics Extraction and Unpaired Domain Translation
发表日期:
2026年07月
发表单位:
没有
原文链接:
https://arxiv.org/pdf/2607.18154v1.pdf
先把这套方法翻译成人话:它不是直接预测“下一步会怎样”,而是先从“这一步为什么会变成那一步”里提炼出一个中间特征,再把这个特征从仿真域搬到真实域,最后再解码成真实世界的下一步观测。整个链条可以理解成三段:倒着提信息、跨域换皮、再正着还原。图1:World Translation通过提取转移动力学特征并跨域翻译来弥合仿真到现实的差距。黑色箭头表示训练阶段的数据流,蓝色箭头表示推理阶段:先把仿真中的动力学特征翻译到现实域,再解码成现实世界的下一步转移。论文里把不可见因素分成两类:一类是时间变化的隐藏变量,比如接触、扰动、负载晃动;另一类是域特征,比如仿真和现实在摩擦、刚度、质量参数上的系统差异。前者决定“同样的输入为什么会走向不同结果”,后者决定“同样的隐藏变量为什么在两个域里表现不一样”。World Translation 的目标不是把所有不可见因素都一次性解决,而是把能从转移结果里恢复的那部分先抓出来,再把它翻到目标域去。图2:不可观测因素的分类。传统动力学模型往往只能隐式学习时间不变的域特征,却难以在历史信息不足时显式捕获时间变化的隐藏变量;World Translation 通过反向提取补上这一块,但如果某些现象在仿真里压根不存在,那就属于“源系统里根本没货”,这部分是翻不出来的。具体实现上,论文把反向提取做成了一个变分自编码器。输入不是单纯的当前观测,而是转移三元组:当前观测、动作、下一步观测。编码器先把这三者压成一个动力学特征 z,解码器再用当前观测、动作和 z 去重建下一步观测。这个设计的关键点在于:z 不是拿来背答案的,而是拿来装“导致这次转移发生的隐含原因”。为了防止编码器偷懒,论文还加了两个辅助设计。一个是“盲解码器”,只看 z 不看当前观测和动作,如果它还能把下一步观测猜得太准,说明 z 里塞的不是抽象动力学,而是直接把答案背进去了;于是训练时就要惩罚这种捷径。另一个是域分类器和 FiLM 调制,目的不是让模型更会“认域”,而是强迫 z 真的把域差异也编码进去,这样后面的跨域翻译才有东西可翻。这一步很像给编码器上了一道“别装傻”的约束:既要保留隐藏变量信息,又要把域信息装进去,还不能把原始观测直接抄进去。听起来有点拧巴,但这正是这类方法最现实的难点——既要抽象,又不能抽空;既要跨域,又不能丢物理。
J. Hwangbo, J. Lee, A. Dosovitskiy, D. Bellicoso, V. Tsounis, V. Koltun, and M. Hutter, “Learning agile and dynamic motor skills for legged robots,” Science Robotics, vol. 4, no. 26, p. eaau5872, 2019.J. Tobin, R. Fong, A. Ray, J. Schneider, W. Zaremba, and P. Abbeel, “Domain randomization for transferring deep neural networks from simulation to the real world,” in 2017 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). IEEE, 2017, pp. 23–30.Y. Chebotar, A. Handa, V. Makoviychuk, M. Macklin, J. Issac, N. Ratliff, and D. Fox, “Closing the sim-to-real loop: Adapting simulation randomization with real world experience,” in 2019 International Conference on Robotics and Automation (ICRA). IEEE, 2019, pp. 8973–8979.D. Hafner, T. Lillicrap, I. Fischer, R. Villegas, D. Ha, H. Lee, and J. Davidson, “Learning latent dynamics for planning from pixels,” in International conference on machine learning. PMLR, 2019, pp. 2555–2565.D. Hafner, T. Lillicrap, J. Ba, and M. Norouzi, “Dream to control: Learning behaviors by latent imagination,” in International Conference on Learning Representations (ICLR), 2020.J.-Y. Zhu, T. Park, P. Isola, and A. A. Efros, “Unpaired image-to-image translation using cycle-consistent adversarial networks,” in Proceedings of the IEEE international conference on computer vision, 2017, pp. 2223–2232.E. Perez, F. Strub, H. De Vries, V. Dumoulin, and A. Courville, “Film: Visual reasoning with a general conditioning layer,” in Proceedings
仿真到现实,最难的不是“像”,而是“像得对”。如果这篇 World Translation 让人看懂了动力学怎么翻译,欢迎来『龙哥读论文』继续拆论文、聊机器人、看真机落地。想进群的同学,扫描下方二维码或加龙哥助手微信 kangjinlonghelper,备注“研究方向+地点+学校/公司+昵称”,更快通过~