返回行业动态
研究前沿

Meta FAIR 开源 RoboJEPA:8B 参数机器人世界模型首次给出缩放定律

Meta FAIR 联合 Mila 等机构发布机器人世界模型 RoboJEPA,并开源全部检查点与训练、真机部署代码。模型基于 JEPA 架构,在 12 种机器人本体、约 1.5 万小时机器人视频上训练,参数从 2200 万扩展到 80 亿。研究发现其「想象误差」随算力呈二阶幂律,可用小规模拟合外推到更大模型,真机上仅给一张目标图即可完成抓取、举升与抓放等长程规划任务。

来源:Meta FAIR / Hugging Face Papers:RoboJEPA: Scaling Robotic Latent World Models原标题:RoboJEPA: Scaling Robotic Latent World Models查看原文
明亮实验室中白色机械臂与彩色积木,上方悬浮预测轨迹光点网格,配中文标题「机器人世界模型」

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

Meta FAIR 联合 Mila 等机构发布机器人世界模型 RoboJEPA,并开源全部模型检查点与训练、真机部署代码。该模型基于 JEPA(联合嵌入预测架构),在 23 个公开操作数据集、12 种机器人本体、26 种动作空间、合计约 15,022 小时机器人视频上训练,参数规模从 2,200 万扩展到 80 亿,作者称其为迄今最大的 JEPA 预测器模型。论文为预印本,核心贡献是首次为「多本体机器人世界模型」建立缩放定律。

  • 核心结论:模型的「想象误差」(对潜在轨迹的预测误差)随算力呈二阶幂律 L(C)=E+A·C^(α−γlnC),可用 2,200 万至 20 亿规模拟合的结果外推到未见过的 40 亿、80 亿模型。
  • 拟合精度:DROID 留出集上外推误差 0.6×10⁻³,优于一阶幂律的 2.0×10⁻³。
  • 能力阈值:末端三维到达约 10²⁰ FLOPs、避障约 10²¹、精细物体动力学(如推动)约 10²²,长程非贪心规划在 10²² 以上(即 20 亿至 80 亿区间)。
  • 真机验证:单臂 Franka 配合 DROID 栈,仅给一张目标图,8B 模型抓取成功率 67%、举升 50%、抓放 27%。

为什么重要

这把大语言模型「缩放定律」的方法搬到了机器人世界模型:给出可预算的算力—能力曲线,让做真机栈的团队在训练前就能预估模型质量,并把「想象误差」当作真机评测的代理指标。对具身智能的投入决策而言,这是从「更大就更好」转向「可预测地更大」的一步:算力投入与预期能力之间第一次有了可外推的定量关系,资源有限的团队可据此选择在何处停下。此外,全部权重与部署代码开源,也降低了高校与中小团队复现与二次开发的门槛;把「想象误差」作为真机评测代理,还可减少昂贵且耗时的实机反复试验。

不确定之处

其一,论文为预印本、未经同行评议;与 π0-FAST、π0.5 等 VLA 基线的对比被作者标注为「情境参考」而非直接可比,因目标描述方式与训练数据不同(π0.5 抓放为 53%)。其二,图像编码器被冻结,拟合曲线已「接近当前数据饱和」(不可约误差项 DROID 0.218、RoboCasa 0.1709),作者认为下一步需要更多样化的机器人数据而非单纯堆参数。其三,模型不使用文本,泛化到开放的自然语言指令仍待验证。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

Meta FAIR 开源 RoboJEPA:8B 机器人世界模型首证缩放定律|北京拓实科技