返回行业动态
研究前沿

World Labs 用 32 张照片把英伟达园区变成可实时漫游的三维世界,并公布零样本自主无人机飞行

9 月 17 日,英伟达与李飞飞联合创办的空间智能公司 World Labs 联合展示:仅用 32 张英伟达总部 Voyager 园区的照片,Atlas 世界模型即可重建出可在其中实时穿行的三维场景,用户可自选路径、查看园区任一区域。Atlas 在英伟达 Blackwell GPU 上从零预训练。World Labs 同时公布零样本全自主无人机飞行结果,其具身基础模型把内部世界模型、具身推理与直接控制统一在同一模型内。

来源:HuggingNews(引述 World Labs 与英伟达官方演示)原标题:World Labs Atlas AI Generates Real Time 3D Nvidia Campus From 32 Images on Blackwell GPUs查看原文
俯瞰视角的现代科技园区,建筑与绿化区域之上叠加半透明三维网格与点云结构,一架白色无人机悬停于画面上方,示意由照片重建的可交互三维世界

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

9 月 17 日,英伟达与 World Labs 联合展示了一项空间智能演示:输入 32 张英伟达总部 Voyager 园区的照片,Atlas 世界模型即可重建出可在其中实时穿行的三维场景。演示中,用户可自行选择路径、查看园区任一指定区域,相机视角可精确控制。World Labs 与英伟达方面均确认,Atlas 在英伟达 Blackwell GPU 上完成从零预训练。

同一场发布中,World Labs 公布了零样本全自主无人机飞行结果。其具身基础模型把内部世界模型、具身推理与直接控制统一在同一模型内,无需预先建图或针对特定场景训练即可完成飞行。

  • 输入规模:32 张园区照片。
  • 输出形态:可在其中实时漫游的三维场景,支持自选路径与精确相机控制。
  • 多模态底座:Atlas 把文本、图像、视频与 3D 数据纳入统一的空间上下文,同一模型承担新视角生成、场景重建与世界模拟三类任务。
  • 训练与算力:从零预训练,算力平台为英伟达 Blackwell GPU。
  • 实机验证:World Labs 称曾在 Atlas 生成的环境中让 5 个机器人平台各连续运行 1 小时,期间无需人工干预。

为什么重要

世界模型的核心价值主张是样本效率。机器人、自动驾驶等物理 AI 场景的真实数据采集成本高、极端工况难以复现;若模型能用有限真实数据构建可模拟环境,智能体便可先在虚拟空间中反复试错,再进入现实执行。Atlas 试图解决的正是这一环——把现实场景低成本转化为可交互的仿真环境。

从技术路线看,Atlas 的一个特点是重建与生成共用同一网络:既能从多视角照片恢复场景几何,也能对输入中不存在的视角进行外推,例如从一张街景照片生成该街区的俯瞰视图。对机器人应用而言更关键的一点是「环境与机器人的传感器视图来自同一个模型」,这使仿真环境与实机感知在数据分布上更为接近,有助于缩小仿真到实机的迁移落差。

尚待观察

需要指出的是,上述结果均为厂商在自选测试集上的自评数据。World Labs 承认「没有任何单一基准能够完整刻画 Atlas 的能力」;其与视频模型的偏好对比测试,所选择的也恰是 Atlas 被专门优化的相机控制任务。重建类对比虽基于 DTU、ETH3D、KITTI、ScanNet 等公开数据集,但目前尚无独立第三方复现。此外,Atlas 于 9 月 2 日发布,本次为围绕英伟达园区的实机演示,其能力边界与商用可得性仍待验证。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。