整个流程可以理解成三步。第一步,flow actor 一次性生成 K 个候选动作;第二步,HCPG 根据当前是否接触到物体,决定到底该盯着“末端到物体的距离”,还是盯着“物体到目标的距离”;第三步,把每个候选动作对这个距离的一阶缩短效果算出来,再在候选集内部标准化,最后用温度控制的软嵌入方式合成真正执行的动作。这里最值得注意的是“软嵌入”而不是硬选一个最大值。硬 argmax 看上去干脆,实际上很容易让动作在候选之间跳来跳去;软加权则更平滑,也更像把多个“差不多靠谱”的提案揉成一个更稳的执行指令。对于真实机器人,这种平滑性很重要,毕竟机械臂不是拿来玩抽卡的。
[1] T. Haarnoja, A. Zhou, P. Abbeel, and S. Levine, “Soft actor-critic: Offpolicy maximum entropy deep reinforcement learning with a stochastic actor,” in International Conference on Machine Learning, 2018.[2] C. Chi, Z. Xu, S. Feng, E. Cousineau, Y. Du, B. Burchfiel, R. Tedrake, and S. Song, “Diffusion policy: Visuomotor policy learning via action diffusion,” in Robotics: Science and Systems, 2023.[3] Y. Zhang, S. Yu, T. Zhang, M. Guang, H. Hui, K. Long, Y. Wang, C. Yu, and W. Ding, “SAC Flow: Sample-efficient reinforcement learning of flow-based policies via velocity-reparameterized sequential modeling,” in International Conference on Learning Representations, 2026. [Online]. Available: https://openreview.net/forum?id=zZvWj4JrYj[4] L. Mao, H. Xu, X. Zhan, W. Zhang, and A. Zhang, “Diffusion-DICE: In-sample diffusion guidance for offline reinforcement learning,” in Advances in Neural Information Processing Systems, vol. 37, 2024.[5] Z. Wang, J. J. Hunt, and M. Zhou, “Diffusion policies as an expressive policy class for offline reinforcement learning,” in International Conference on Learning Representations, 2023.[6] A. Zeng, P. Florence, J. Tompson, S. Welker, J. Chien, M. Attarian, T. Armstrong, I. Krasin, D. Duong, V. Sindhwani, and J. Lee, “Transporter networks: Rearranging the visual world for robotic manipulation,” in Conference on Robot Learning, 2021.[7] C. Chi, Z. Xu, C. Pan, E. Cousineau, B. Burchfiel, S. Feng, R. Tedrake, and S. Song, “Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots,” in Robotics: Science and Systems, 2024.
论文把动作选择拆成了三个动作:先采样,再打分,最后软融合。第一步,flow actor 一次性生成 K 个动作候选;第二步,HCPG 用接触状态决定当前应该看“靠近物体”还是“推进任务”;第三步,把每个候选动作对目标距离的一阶缩短效果算出来,再在候选集内部标准化,最后用温度控制的软嵌入方式合成一个真正执行的动作。这里最值得琢磨的是“软嵌入”而不是硬 argmax。硬选一个最大值看似干脆,实际上容易让动作在候选之间跳来跳去;软加权则更平滑,也更像把几个“差不多靠谱”的提案揉成一个稳一点的执行指令。对真实机器人来说,这种平滑性是有价值的,尤其在接触任务里,动作抖一下,可能就从“快成功”变成“又来一遍”。论文里还有一个很关键的细节:它并不直接用原始分数,而是在候选集合内部做标准化。这个设计的意思很明确——不同任务、不同状态下的绝对分数尺度可能差很多,没必要让分数值本身“吵架”,只要保证同一批候选里谁更像正解就行。再配合温度参数,最终执行动作不会被单个异常候选硬拽走。