← 返回 PaperDaily 视觉与图像

Yann LeCun参与,SkyJEPA:让四旋翼在潜空间预测,零样本仿真直飞现实世界!

Yann LeCun的JEPA思想终于上天了!这篇工作提出了第一个用于四旋翼实时控制的JEPA风格潜空间动力学模型SkyJEPA。它完全在仿真中通过域随机化训练,却能零样本迁移到现实世界,在户外飞行中跟踪误差降低近40%,换了桨叶、加了负载也不掉链子。想看世界模型怎么帮无人机“闭眼预测”的,这篇必读。

Yann LeCun参与,SkyJEPA:让四旋翼在潜空间预测,零样本仿真直飞现实世界!
🐉 龙哥读论文知识星球来了!
想让你的无人机学会在脑子里做"潜空间预演"么?星球无上限分享世界模型、飞行机器人、模型预测控制等AI前沿论文每日拆解,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
Yann LeCun的JEPA思想终于上天了!这篇工作提出了第一个用于四旋翼实时控制的JEPA风格潜空间动力学模型SkyJEPA。它完全在仿真中通过域随机化训练,却能零样本迁移到现实世界,在户外飞行中跟踪误差降低近40%,换了桨叶、加了负载也不掉链子。想看世界模型怎么帮无人机“闭眼预测”的,这篇必读。


原论文信息如下:
论文标题:
SkyJEPA: Learning Long-Horizon World Models for Zero-Shot Sim-to-Real Control of Quadrotors
发表日期:
2026年06月
发表单位:
New York University, Rutgers University, UCLA, UC Berkeley
原文链接:
https://arxiv.org/pdf/2606.23444v1.pdf
插图

从潜空间预测到四旋翼控制:如何实现零样本仿真到现实迁移

四旋翼无人机自主飞行的核心是“预知未来”——根据当前状态和控制指令准确预测后续轨迹。这个“世界模型”直接决定了模型预测控制(MPC)的效果。传统物理建模简单但精度差;神经网络一步逼近再自回归滚动预测则存在误差累积,在高度非线性的航空动力学中尤为严重。
图1:四旋翼世界模型的理想属性:准确的长时域预测、可解释性、实时闭环推理、零样本任务泛化
图1:四旋翼世界模型的理想属性:准确的长时域预测、可解释性、实时闭环推理、零样本任务泛化
Yann LeCun等人提出的联合嵌入预测架构(JEPA)提供了新思路:将观测编码为抽象潜变量,在潜空间中递归预测,再通过轻量“探针网络”解码回物理量。潜表示可忽略与动力学无关的噪声,专注于核心运动模式。
本文SkyJEPA首次将JEPA用于四旋翼实时控制。模型完全在仿真中通过域随机化训练,零样本迁移到真实世界,户外飞行跟踪误差降低近40%,更换桨叶、增加负载依然稳健。
图2:本文提出的框架总览
图2:本文提出的框架总览:JEPA风格潜空间动力学模型,配合物理启发的探针网络,实现稳定长时域预测。训练在域随机化仿真数据上完成,部署到采样优化控制器中。
SkyJEPA由纽约大学、罗格斯大学、UCLA、UC Berkeley联合完成,一作Pratyaksh Rao,通讯作者包括Yann LeCun和Giuseppe Loianno。

潜空间预测vs状态空间预测:消除误差累积的关键

传统状态空间预测中,设状态xt(18维,含位置、速度、姿态等)和动作at,动力学为xt+1=f(xt, at)。训练神经网络hθ最小化一步预测损失,但在MPC中需递归展开T步,每一步误差ε都会传递给下一步,导致误差累积
SkyJEPA的解决方案:利用历史窗口编码成潜变量st和zt,然后在潜空间递归预测。训练损失为多步潜预测一致性损失加上防崩塌正则项(SIGReg,强制潜分布接近各向同性高斯)。总损失L_total = L_pred + λ_sig L_SIGReg。
潜空间更稳定的原因在于潜表示可“时间直线化”——复杂高维动力学被嵌入低维流形,轨迹方向一致性更高,递归预测不易漂移。下图展示了潜轨迹的PCA投影和直线性得分:
图7:潜滚动的‘时间直线化’分析
图7:潜滚动的时间直线化分析。(a) 示例笛卡尔轨迹;(b) PCA投影的潜轨迹;(c) 时间直线性得分;得分越高说明潜演化越平滑。
图6:递归滚动误差分析
图6:递归滚动误差分析。左图为开环与教师强迫预测的复合比;右图为误差增长率。本方法更接近教师强迫行为,误差增长更慢。

物理启发的探测网络:从抽象潜变量到可解释物理量

潜预测精度高但输出抽象,无法直接用于控制器。SkyJEPA在第二阶段训练一个物理启发的探针网络,将冻结后的潜滚动翻译成可解释状态。
图3:两阶段训练流程
图3:两阶段训练流程。第一阶段编码器和预测器学习潜空间动力学,第二阶段探针网络在冻结的潜表示上训练。
探针网络ψ接收潜变量s̃t+k,输出残差加速度Δv̇和残差角加速度参数K,通过可微刚体动力学积分器得到完整状态。该设计保留SO(3)几何结构,确保预测姿态始终有效。探针在冻结潜空间上训练,使用stop-gradient阻止状态监督信号反向传播,确保潜表示由自监督目标驱动。
探针损失为多步状态预测的均方误差。相比直接预测状态,这种两步走策略让潜空间保持高效,同时保证输出可解释性。图8表明物理启发的探针显著优于纯MLP解码器。
图8:不同动力学模型的开环滚动保真度
图8:不同动力学模型的开环滚动保真度。直接预测模型误差快速累积,潜空间模型增长更慢,物理启发的探针大幅提升了状态恢复质量。

域随机化+自动数据合成:规模化与多样性的来源

SkyJEPA设计了一套完全在仿真中完成的自动数据合成流程:1. 随机采样贝塞尔曲线生成平滑轨迹;2. 使用标称PD控制器跟踪并施加随机扰动,记录状态-动作序列;3. 域随机化,每次轨迹生成时随机改变质量、惯性、推力系数等物理参数。表I列出了随机化范围:
表I:域随机化参数
表I:用于仿真数据收集的域随机化参数
论文定义轨迹分布质量(TDQ)指标量化数据集多样性,发现TDQ从0.01提高到0.94时,状态预测误差从5.4下降至1.4(Figure 12)。
图12:TDQ与状态RMSE关系
图12:随着数据集规模增加,TDQ从0.01上升至0.94,状态RMSE从5.4下降至1.4。

开环与闭环双验证:从仿真到真实世界的全面胜出

开环预测:在仿真数据集上比较SkyJEPA与多种基线,SkyJEPA在所有滚动长度上预测精度最高,姿态预测提升显著(图8),且对观测噪声鲁棒性更强(图9)。
图9:观测噪声鲁棒性
图9:观测噪声鲁棒性。JEPA模型始终优于预测基线,且随噪声增大优势更明显。
真实世界闭环控制:将SkyJEPA嵌入MPPI控制器,在户外进行轨迹跟踪实验。图4展示了标称跟踪、载荷变化、桨叶更换三种场景。
图4:真实世界闭环评估设置
图4:真实世界闭环评估设置:(a)标称轨迹跟踪;(b)负载变化;(c)桨叶更换。
定量结果见表IV。SkyJEPA平均跟踪误差比纯物理模型降低近40%,比Residual MLP降低25%以上,且在负载和桨叶变化下误差增加极小。
表IV:真实轨迹跟踪定量结果
表IV:真实轨迹跟踪定量结果。每条轨迹执行5次,报告均值和方差。
图10:真实世界零样本轨迹跟踪
图10:真实世界零样本轨迹跟踪。飞行轨迹叠加在期望参考上,颜色指示跟踪误差(cm)。
图11:平台变化下的真实世界跟踪
图11:平台变化下的真实世界跟踪(无需重训练)。(a)负载运输;(b)桨叶更换。执行轨迹仍接近参考路径。
推理速度方面,在NVIDIA Orin NX上,使用滚动步长H=15和采样数S=300,单次推理时间低于10ms,满足实时控制需求(图5)。
图5:NVIDIA Orin NX上的推理速度
图5:NVIDIA Orin NX上的推理速度。选定的步长确保低于10ms的实时控制预算。
表II:MPPI参数
表II:MPPI参数
表III:潜预测模型参数
表III:潜预测模型参数
表V:消融实验结果
表V:消融实验结果(替换电机、桨叶的平台变化)

龙迷三问

JEPA和传统自回归预测的核心区别是什么?传统方法在状态空间自回归,误差累积。JEPA在潜空间预测,潜表示丢弃噪声,几何结构更平坦,递归方向更一致,误差增长慢。JEPA学的是“动力学的本质”。

物理启发的探针网络比普通MLP解码器强在哪里?普通MLP忽略动力学结构。探针网络输出残差加速度,通过可微刚体动力学积分器得到状态,保留SO(3)几何约束,输出姿态永远是合法旋转矩阵。且探针在冻结潜表示上训练,不干扰自监督学习。

零样本仿真到现实迁移成功的关键是什么?第一,域随机化让模型见过大量不同物理特性的无人机,学会提取与参数无关的特征。第二,JEPA潜表示的抽象能力,忽略传感器噪声等细节,只关注状态演化本质模式。

如果你还有哪些想要了解的,欢迎在评论区留言讨论~

龙哥点评

论文创新性分数:★★★★✰

将JEPA架构引入四旋翼实时控制是新颖想法,首次在潜空间学习动力学并配合物理探针进行控制。创新点明确:潜空间预测+物理探针+域随机化数据合成。

实验合理度:★★★★✰

实验设计全面,包含开环预测和真实世界闭环控制,基线选择合理,统计报告均值和方差,对比充分,结果可信。

学术研究价值:★★★★★

为学习型世界模型在控制中的应用提供高质量范本,证明潜空间预测能缓解误差累积,对后续研究有重要启发。

稳定性:★★★★✰

真实户外实验表现稳健,载荷和桨叶变化后误差增加有限。但实验时间有限,环境条件相对温和,极端天气下稳定性待验证。

适应性以及泛化能力:★★★★✰

通过域随机化实现了对负载、桨叶的零样本泛化,但未测试完全不同的飞机构型。框架理论上可推广到其他机械系统。

硬件需求及成本:★★★★★

在NVIDIA Orin NX上低于10ms推理,满足100Hz控制更新率。模型参数量不大,训练在单GPU上即可完成,适合嵌入式部署。

复现难度:★★★✰✰

论文详细描述了架构和参数,但未提供开源代码,需自行实现JEPA编码器、探针网络和MPPI优化器,有一定工程工作量。

产品化成熟度:★★★✰✰

当前为学术验证原型,户外有限条件下表现良好。达到工业级还需更长时间稳定性测试、抗风能力验证等,但潜力很大。

可能的问题:(1)仅在一台真实四旋翼上验证,不同硬件泛化性未确认。(2)潜空间表示缺乏可视化解释。(3)探针残差校正是否完全补偿未建模效应需更深入消融。(4)对比基线中的Latent-MLP未采用相同物理探针,对比不够公平。(5)未探讨更高效的优化方法如iLQR。


主要参考文献

[1] Pratyaksh Rao et al. "SkyJEPA: Learning Long-Horizon World Models for Zero-Shot Sim-to-Real Control of Quadrotors". arXiv:2606.23444v1, 2026.
[2] Yann LeCun. "A Path Towards Autonomous Machine Intelligence". 2022.
[3] Williams et al. "Information-Theoretic Model Predictive Control". IEEE TRO, 2018.
[4] Balestriero et al. "SIGReg: Sketched Isotropic Gaussian Regularization". 2024.
[5] Assran et al. "Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture". CVPR 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨。想了解更多原文细节的小伙伴,可以点击"阅读原文"

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。备注:研究方向+地点+学校/公司+昵称
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。