← 返回 PaperDaily
视觉与图像
不看全局,每台机器人只花256字节就能预测集群未来?
集群机器人最烦的就是每台各看各的、未来状态对不上账。ITMO这篇CS-JEPA让每台机器人只靠局部观测和单轮256字节消息,独立预测同一个未来集体状态,只给6个全局标注样本就开始见效,拓扑、规模外推和规划价值评估全都能打,值得细读。
龙哥读论文
发布于 2026-08-14 09:12:04
阅读 3
查看原文
原论文信息如下:
想象一下:一队无人机编队飞行,每架无人机只看得见附近几个邻居,但所有人都必须预测“整个集群”10秒后是聚拢、散开还是旋转。更难的是,每架无人机各自脑补,结果还得对得上账。是不是有点像学生闭卷考试,题目一样、答案得差不多?😏 ITMO大学这篇论文,就是想解决这个“闭卷考试”的难题:让每台机器人只靠局部观测和极小的通信量,独立预测同一个未来集体状态。而且,只给6个全局标注样本 ,就已经开始起作用。听起来有点意思,接着往下看。
1. 每个机器人都能预测同一个未来?——去中心化集体状态预测问题
先搞清楚“去中心化集体状态预测”到底在说什么。机器人集群,比如蜂群、无人机群,会涌现出整体的行为模式——结队飞行、分裂绕行、旋转聚拢、保持连通。问题在于:没有哪个机器人能直接看到这个“整体模式”,每台机器人只有自己的局部视野,加上从邻居那里收到的有限消息。
传统做法大致有几种。一种是单机器人轨迹预测 ,只预测每台机器人自己的未来路径;一种是集中式全局状态预测 ,假设有中央节点汇总一切。但这里要的不是这些,而是一个更拧巴的设定:每台机器人 都各自独立输出同一个未来集体状态 的预测。没有中央服务器、没有全局信息池、没有统一的时钟,而且每个机器人的预测还不能差太多。
这个问题为什么难?难点在于“信息不对称”与“目标一致”之间的张力。机器人 i 能看到机器人 j 看不到的东西,但它们要预测同一个未来。如果大家各自为政,预测结果一定发散;如果强行压低分歧,又容易坍缩成无意义的“复读机”输出。这篇论文的答案是:与其直接逼机器人互相看齐,不如让它们都去预测同一个“潜在未来”——一个经过编码压缩的共享目标。这个思路,和 JEPA 家族一脉相承。
先解释一下这里的关键概念。JEPA(Joint-Embedding Predictive Architecture) ,联合嵌入预测架构,核心思想是:不在原始像素或原始坐标空间做预测,而是先把输入映射到一个“嵌入空间”(latent space),再在这个抽象空间里预测未来。就好比看球赛时,不需要复现每个球员的每一帧动作细节,只需要预测“这次进攻是打左路还是右路”。去掉琐碎细节,才能抓住真正的结构。Google Brain 的 I-JEPA、Meta 的 Video JEPA 都是这个思路——论文引了 LeCun 提出的 JEPA 框架,以及图像/视频领域的 JEPA 工作作为背景。
本论文提出的架构叫 CS-JEPA(Collective-State JEPA) ,即“集体状态联合嵌入预测架构”。它把“未来集群是什么样”定义为一个固定维度的潜在目标,然后让每台机器人独立地朝这个目标预测。图 1 展示了整体思路。
图1:每一个机器人,同一个未来。部署时机器人 i 只用自己的局部历史+收到的循环消息,输出 t+4 时刻的预测;机器人 j 也独立预测同一个共享目标。特权未来路径和接收器锚定只存在于预训练阶段。
2. CS-JEPA:用共享潜在目标让局部观测“殊途同归”
CS-JEPA 的整体结构可以拆成三块:接收器局部的循环传播、一个大小不变(size-invariant)的未来目标、以及一个训练时才有的接收器锚定。
接收器局部循环传播。 每台机器人先用一个冻结的局部编码器把自己的观测映射成 64 维向量。每个时间步,它向所有邻居广播自己的上一时刻循环状态 {h_j}^{t-1}(64 个 float,正好 256 字节)。接收方把收到的邻居记忆做平均,再送入一个 GRU。公式表达如下:
h̄_i^{t-1} = (1/|N_t(i)|) × Σ_{j∈N_t(i)} h_j^{t-1}
h_i^t = GRU([e_i^t, h̄_i^{t-1}], h_i^{t-1})
其中 N_t(i) 是 t 时刻邻居集合,|N_t(i)| 是邻居数,e_i^t 是局部编码后的自观测向量,GRU 是门控循环单元,h_i^t 是机器人 i 在 t 时刻的隐藏状态。这里用的是均值聚合,好处是:邻居数量变化了,输入宽度不变,模型不依赖集群大小。
大小不变的目标。 训练时,一个冻结的目标编码器把未来所有活动机器人编码,再经过一个置换不变的集合分词器,输出一个全局 token 加一个 4×4 空间场,共 17 个 token,每个 token 65 维。加起来正好 1105 维的固定向量 Z_{t+h}。无论集群里有 10 台还是 108 台机器人,这个目标向量的维度不变。空间 token 的计算采用高斯核加权:
z_k = [ Σ_j w_jk e_j / Σ_j w_jk , Σ_j w_jk / |V_{t+h}| ]
w_jk = exp( −‖p_j − a_k‖² / 2σ² ),其中 σ=0.22。a_k 是空间锚点,p_j 是机器人 j 的位置,e_j 是它的未来嵌入。前半部分是加权后的空间内嵌入均值,后半部分是“存在质量”,相当于告诉模型这个格子附近有多少机器人。这样得到的目标既有全局概览、也有空间分布细节,还天然对机器人编号不敏感。
预测器则是“角色条件”的:先用 t+2 的预测结果作为输入,再推导 t+4 的预测,同时把第一段预测的梯度截断(stop-gradient)。核心损失如下:
L_CS = (1/M_Z) × Σ_{b,i,h} ‖Ẑ_{t+h} − sg(Z_{t+h})‖² / D_Z
sg 是 stop-gradient,意思是目标分支的梯度不反传回编码器,避免退化。注意:损失里没有显式的“让机器人互相一致”的惩罚项 。机器人的预测之所以能收敛到一致,不是因为互相看了答案,而是因为它们都在朝同一个目标对齐。
接收器锚定。 如果模型只去预测整个集群的集体目标,可能会丢掉一台机器人自己的动态信息。于是训练时额外加一个 MLP,让它从自己的隐藏状态预测自己的未来嵌入。这就是“接收器锚定”,权重 λ=2。部署时这个 head 直接丢掉,不影响推理参数。这套设计的完整性可以看表 1 的部署契约。
表1:固定的表示与部署契约。16帧局部历史、零时钟、零动作输入;预测 t+2 和 t+4 两个时刻;共享目标为1个全局+16个空间 token;通信为每向边每步256字节。
特别注意表里的“部署参数只有 123,713 个”。加上下游读取头也就 134,773 个——一个很小的模型。而对比方法 Future-Recon 在训练时要额外加一个原始未来重建解码器,多了 9,607 个训练参数,部署参数反而一样。这就在训练容量上给基线“占了便宜”,最后的胜负才公平。
3. 标签效率的严苛检验:6/12/24个标注episode下的对决
一个预测模型好不好,光看自监督损失不够。真正的问题是:下游任务要多少带标签数据才够用? 在这篇论文里,下游任务是把每台机器人的预测解码成 10 个集体指标:极化度、目标对齐、凝聚力、离散度、角动量、连通性、归一化簇数、碰撞率、平均速度和任务分数。
实验设计走的是“前瞻性注册”路线——先把评估协议原封不动地定死,再生成新数据。训练在 N∈{10, 18} 的有界小世界图上进行,最大度数为 4,任务有三种:集结(flocking)、编队(formation)和覆盖(coverage),每个 episode 长 200 步。数据分裂如表 2。
表2:前瞻性注册的后续数据家族。训练/标签池使用小世界图(10、18机器人);ID测试也用小世界;拓扑OOD用环图和互kNN图;规模OOD用36、72、108机器人。
每个种子(seed)只给 6、12 或 24 个“全局标注 episode”来训练一个岭回归读取头(ridge probe,α=10⁻³)。标签子集按任务和规模分层抽取,且抽的时候不读标签值。误差指标是 10 维物理量归一化后的 MSE,还要计算机器人之间的预测一致性 MSE。最终用梯形 AUC 汇总:AUC = 0.25×E₆ + 0.50×E₁₂ + 0.25×E₂₄。为什么这么加权?对数坐标下 6→12 和 12→24 两个区间等宽,这样 AUC 把整条标签效率曲线都考虑进去,而不是挑一个最好看的点来报数。
主对照是 Future-Recon——保持冻结编码器、循环通信、角色预测器、1105 维瓶颈、优化器设置、探针协议完全一致,只把“预测潜在目标”换成“重建原始未来场”。前者的参数量还多了 9,607。也就是说,如果 CS-JEPA 赢了,赢的不是参数量,而是“预测什么”这个目标本身。结果见表 3。
表3:前瞻性锚定匹配后续实验。数值为“重建−JEPA”的误差AUC差,95%外层种子置信区间;正值偏好CS-JEPA。
全部四个分裂(ID、环拓扑、互kNN、规模OOD)的准确率和一致性“所有 5 个外层种子都为正”,而且置信区间下限全部在零以上。ID 上的优势最小(准确率Δ=0.004636),因为任务就在训练分布内,两边都做得不错;但一出分布,差距立刻拉开——环拓扑的准确率优势跳到 0.057,互kNN 和规模OOD 也有 0.04~0.05。图 2 展示了不同标签预算下的绝对误差曲线。
图2:锚定匹配后续的绝对标签效率曲线。每个点是5个外层种子平均(先平均5个固定标签子集抽取,再按任务平衡),竖条是95%外层种子bootstrap区间。越低越好。
可以看到,CS-JEPA 曲线在每一个标签预算和每一个分裂下都压在 Future-Recon 下面。优势不集中在某一个标签量上,而是 6→12→24 全程存在。这里有个关键细节:CS-JEPA 的“一致性更好”不是靠所有机器人输出同一个毫无信息的默认值实现的——因为准确率同时也在涨。也就是说,预测既对得上、又准,这个组合排除了“坍缩到平均值”的作弊可能。
4. 拓扑与规模外推:小世界到环形、kNN再到108个机器人
深度学习模型最怕的一件事就是“换场景就翻车”。这篇论文专门测了两种外推:拓扑外推 (训练时用有界小世界图,测试时换成环图和互 kNN 图)和规模外推 (训练 N=10/18,测试 N=36/72/108,最大到训练规模的 6 倍)。
为什么 CS-JEPA 能扛住这种外推?两个设计功不可没。一是均值消息聚合 ——邻居数从 3 变成 5、8,输入宽度不变;二是集合分词器 ——不管集群里有几十还是上百台机器人,最终都映射成固定的 17 个 token。模型参数完全与 N 无关,所以规模变了,模型本身不用动。
图 3 给出了 5 个外层种子各自的效应值。每个点代表一个完整独立训练的种子,看的是“每个种子里 CS-JEPA 是否都赢”。除了 ID 精确率优势较小之外,三个 OOD 分裂的效应都很稳定:环上的精确率优势约 0.057,一致性优势接近 0.099——在正则化的误差指标里这已经是相当可观的优势。
图3:前瞻性注册效应的种子级一致性。空心圆是5个外层种子各自效应,实心圆是均值,横线是95% bootstrap置信区间。正值偏好CS-JEPA。
论文里还报告了一个早期的 GSP 风格直接监督诊断(表 4):直接用未来集体状态做监督信号来训练,而不是用 JEPA 目标。结果是直接监督在精确率上全面不如 CS-JEPA(ID 优势 0.092),但一致性更好。翻译一下:直接监督的机器人“互相之间更同意”,但“整体更不准”——典型的集体一致但方向跑偏。这正好反衬出 JEPA 目标的抽象能力:压缩后的潜在目标保住了“该准的东西”,而不是让机器人一起错。
表4:早期独立的GSP式直接监督诊断。数值为“监督−CS-JEPA”误差AUC差;正值偏好CS-JEPA。
为什么 OOD 时 JEPA 优势反而更大?一种合理的解释是:潜在目标把“可预测的结构”和“随机细节”分开,Future-Recon 在分布内还能靠记住细节遮掩,但一旦拓扑和规模变了,对细节的重建反而变成负担。CS-JEPA 预测的是抽象集体结构,不依赖训练时见过的具体邻居计数或连接模式,所以外推更稳。
5. 从预测到规划:四步反事实价值估计的额外证据
预测未来集体状态不只是为了“看着好玩”,真正的价值在于:帮机器人做规划时评估“如果我走这条路,集群会变成什么样”。论文第二部分做了一个密封八种子(sealed eight-seed)的后续实验:给每个候选的四步控制计划配上动作条件版本,让 CS-JEPA 和 Future-Recon 都基于“观察+候选计划”输出对应的预测表示,再训练一个标量读取头来估计效用值:u(a) = task − 0.5(1 − connectivity) − 2·collision。翻译一下:任务得分要高、连接性要尽量保持、碰撞要尽量避免。
结果见表 5。CS-JEPA 的效用值 MSE 从 0.02847 降到 0.01553,整体下降了 45.5% ,而且 8/8 个种子全部正效应(p=0.0078125)。在未见过的 N=32 集群上,MSE 甚至下降 50.6%。候选计划的打分相关性(Pearson)也提升了 0.129。换句话说,CS-JEPA 的预测表示能让机器人更准确地判断“这个计划到底好不好”。
表5:密封八种子四步价值确认。MSE越低越好;“减少”列为相对于Future-Recon的降幅;每个指标在8/8种子中均偏好CS-JEPA。
但值得注意:更精确的效用值估计并没有转化为“选择计划”的后悔度优势(Δ=+0.00066,p=0.734)。论文作者对这个结果的处理很诚实——价值估计更准了,但离端到端决策优势还差一步。龙哥觉得这一点其实很常见:价值估计误差下降不等于策略收益提升,中间还隔着控制策略、探索方式和执行噪声。
另外,论文还在早期队列上测了通信鲁棒性(表 6):单独 20% 丢包或单步延迟时,CS-JEPA 仍有 5/5 种子的正效应;但 20% 丢包+延迟同时出现时,优势跌到 2/5 种子;40% 丢包时甚至反转。这说明这个架构在“中度单一故障”下稳健,但扛不住并发复合故障。这给想用这套方法的团队提了个醒:通信保障机制还是不能省。
表6:早期队列冻结12标签消息损坏扫描(对比无锚定Future-Recon)。精度为归一化MSE差,一致性为解码分歧MSE差;正值偏好CS-JEPA。
还有一个额外结果值得提:把 CS-JEPA 的冻结表示用在一个“50% 机器人故障预警”任务上,平均精度比 Future-Recon 高出 0.0065,5/5 种子正效应。说明这套预测表示不仅预测集体状态有用,还能迁移到异常监测类任务上,作为预警信号使用。
6. 局限与未来:仿真之外的真实集群挑战
论文的优秀与局限都同样明显。优秀之处在于实验纪律:前瞻性注册、外层种子隔离、目标路径隔离、标签子集分层抽取、密封八种子确认,这些在机器人学习论文里并不多见。局限则在于:目前全部是仿真验证,没有真实机器人数据;默认所有机器人共享归一化世界坐标系,观测也是无噪声的;预训练阶段用到了“特权未来状态”——这在真实物理系统里是不可能提前拿到的。论文作者自己也承认了这些限制。
不过换个角度看,CS-JEPA 的真实应用潜力不小。它的部署推理非常轻量:单机器人只需 16 帧局部历史、每向边每步 256 字节、123K 参数。没有全局池化、没有时钟、没有未来动作输入。这种“贫瘠”的接口,恰恰是真实的弱通信机器人集群所需要的。未来如果能在真实机器人上解决坐标对齐和观测噪声的问题,这套方法有希望走向产品化。
论文还指出,JEPA 目标可以在不显式优化一致性的情况下,让不同接收器的预测“自然对齐”。这个发现如果能在更复杂的真实多智能体场景中复现,对分布式决策系统的设计会有很大启发:与其加一个“保持一致性”的损失来和任务目标对抗,不如改变模型的学习目标本身。标签效率的提升意味着集中式标注和感知的压力可以大幅降低——这和业界在成本控制上的诉求完全一致。
整体来看,CS-JEPA 给出了一个清晰的信号:在多智能体系统中,“预测什么”比“怎么预测”更重要——一个设计良好的共享潜在目标,可以让局部观测殊途同归。
龙迷三问
问:JEPA 到底是什么?为什么预测潜在目标比重建原始未来帧更好? JEPA,全称 Joint-Embedding Predictive Architecture,联合嵌入预测架构,由 LeCun 等提出并发展。它的核心思想是:把输入(图像、视频、机器人状态)通过编码器映射到一个抽象的嵌入空间,在这个空间里做预测,而不是在原始像素或原始坐标空间做重建。直接重建原始未来帧会迫使模型把算力浪费在大量无关细节上(比如草地纹理、背景光照),而预测潜在目标可以让模型只关注真正影响未来的结构信息。在机器人集群场景,这个区别被进一步放大:集中精力去预测“集体会怎么演化”而不是“精确复现每个机器人的坐标”,才能在小样本下有更好的泛化。
问:为什么 CS-JEPA 在 OOD(分布外)时优势反而更大? 因为 Future-Recon 重建的是原始未来场,它对训练分布里的具体细节(邻居数、连接方式、位置坐标分布)形成了过拟合。一旦换上环图、互kNN、或规模增加到 108,重建目标里的大部分细节都变得陌生,预测自然变差。而 CS-JEPA 预测的是潜在集体状态,已经经过了一次抽象压缩,丢掉了很多“只在训练集里成立”的表面规律。所以分布偏移越大,越能体现出抽象潜在目标的价值。
问:论文里反复强调的“接收器锚定”到底起什么作用? 接收器锚定,就是训练时让模型额外用自己的隐藏状态去预测“自己”的未来嵌入。它防止模型只顾着集体状态、丢掉个体动态。论文实验表明,加上这个锚定能提升精确率端点。部署时锚定 head 会被整个扔掉,不影响运行时的参数和计算量。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性: ★★★★☆
将 JEPA 思想引入“去中心化多机器人共享未来状态预测”,提出固定大小集合分词目标+接收器锚定组合,任务定义本身就有新意。
实验合理度: ★★★★★
前瞻性注册协议+外层种子隔离+目标路径隔离,对比方法还额外多给 9,607 个训练参数,这个实验设计在同类论文里属于标杆级别。
学术研究价值: ★★★★☆
为“预测同一个未来集体状态”提供了第一个系统的 JEPA 解法,为后续多智能体世界模型研究提供了新视角和强基线。
稳定性: ★★★☆☆
中度通信故障下依然稳健,但 40% 丢包或并发故障时优势消失甚至反转;且缺少真实硬件和真实通信信道的验证。
适应性以及泛化能力: ★★★★☆
拓扑、规模外推表现优异,还能迁移到故障预警任务;但任务类型本身较为简单(三种),真实复杂场景还需验证。
硬件需求及成本: ★★★★☆
部署极轻量:123K 参数、64维浮点消息、单轮通信,普通嵌入式设备即可运行;训练也只需单卡即可完成。
复现难度: ★★★☆☆
协议描述非常详细,但未见明确开源代码与训练用数据集的完整发布计划,复现仍需自行实现全部流程。
产品化成熟度: ★★☆☆☆
目前是仿真验证,离真实机器人还有距离。预训练依赖特权未来状态,实际部署时如何获取同质量的目标是一大门槛。
可能的问题: 种子数量(5/8)虽然统计显著但绝对值偏少;共享归一化坐标和无观测噪声的假设限制了结论的适用范围;规划实验中价值估计更准但决策收益未提升,暴露了预测到决策之间的缺口。
主要参考文献
[1] LeCun Y. A Path Towards Autonomous Machine Intelligence[R]. 2022.
[2] Assran M, Duval Q, Misra I, et al. Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture[C]. CVPR 2023.
[3] Bardes A, Ponce J, LeCun Y. V-JEPA: Latent Video Prediction for Visual Representation Learning[J]. 2024.
[4] Otte M W. An Artificial Group Mind[J]. IEEE Robotics & Automation Magazine, 2015.
[5] 原文链接: https://arxiv.org/pdf/2607.28443v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
每台机器人都能预测同一个未来,龙哥读论文陪你一起预见AI技术的下一站!🚀
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,总有一个适合你~