发生了什么
Meta FAIR 联合 Mila 等机构发布机器人世界模型 RoboJEPA,并开源全部模型检查点与训练、真机部署代码。该模型基于 JEPA(联合嵌入预测架构),在 23 个公开操作数据集、12 种机器人本体、26 种动作空间、合计约 15,022 小时机器人视频上训练,参数规模从 2,200 万扩展到 80 亿,作者称其为迄今最大的 JEPA 预测器模型。论文为预印本,核心贡献是首次为「多本体机器人世界模型」建立缩放定律。
- 核心结论:模型的「想象误差」(对潜在轨迹的预测误差)随算力呈二阶幂律 L(C)=E+A·C^(α−γlnC),可用 2,200 万至 20 亿规模拟合的结果外推到未见过的 40 亿、80 亿模型。
- 拟合精度:DROID 留出集上外推误差 0.6×10⁻³,优于一阶幂律的 2.0×10⁻³。
- 能力阈值:末端三维到达约 10²⁰ FLOPs、避障约 10²¹、精细物体动力学(如推动)约 10²²,长程非贪心规划在 10²² 以上(即 20 亿至 80 亿区间)。
- 真机验证:单臂 Franka 配合 DROID 栈,仅给一张目标图,8B 模型抓取成功率 67%、举升 50%、抓放 27%。
为什么重要
这把大语言模型「缩放定律」的方法搬到了机器人世界模型:给出可预算的算力—能力曲线,让做真机栈的团队在训练前就能预估模型质量,并把「想象误差」当作真机评测的代理指标。对具身智能的投入决策而言,这是从「更大就更好」转向「可预测地更大」的一步:算力投入与预期能力之间第一次有了可外推的定量关系,资源有限的团队可据此选择在何处停下。此外,全部权重与部署代码开源,也降低了高校与中小团队复现与二次开发的门槛;把「想象误差」作为真机评测代理,还可减少昂贵且耗时的实机反复试验。
不确定之处
其一,论文为预印本、未经同行评议;与 π0-FAST、π0.5 等 VLA 基线的对比被作者标注为「情境参考」而非直接可比,因目标描述方式与训练数据不同(π0.5 抓放为 53%)。其二,图像编码器被冻结,拟合曲线已「接近当前数据饱和」(不可约误差项 DROID 0.218、RoboCasa 0.1709),作者认为下一步需要更多样化的机器人数据而非单纯堆参数。其三,模型不使用文本,泛化到开放的自然语言指令仍待验证。

