← 文章 / AI技术
The Decoder 1小时前 · 2026-09-03 18:08:26 · 1 阅读

World Labs 发布 Atlas:单一 AI 模型可从少量照片生成、重建并模拟 3D 世界

Image description

由 AI 研究者李飞飞联合创办的 World Labs 发布了 Atlas——一个能从少量图片生成、重建并模拟 3D 场景的世界模型。该公司称其在各项任务上超越了专用模型,这意味着许多现有模型可能不再需要。

自成立起,World Labs 就一直追求「空间智能」的目标,即让 AI 像人类一样理解 3D 空间。Atlas 是公司首个为此规模化构建的模型,它不产出平面图片或视频片段,而是理解场景从任意角度的样貌以及随时间的变化。

World Labs 将 Atlas 描述为一个从头训练的通用模型,使用文本、图像、视频和 3D 数据训练。所有输入都被锚定到 3D 空间中的具体位置,而非作为扁平序列处理。公司称这种共享的空间理解能力为「空间上下文(spatial context)」,模型正是用它来生成每一帧画面或新视角。据 World Labs 称,这种锚定机制将 Atlas 与纯语言或视频模型区分开来。

李飞飞在 2025 年 11 月发表的文章中曾明确提出这一问题:她认为,当前多模态语言模型和视频扩散模型将数据切割成一维或二维序列,导致简单的空间任务也变得不必要地困难。真正需要的,是能够以 3D 或 4D 感知的方式组织分词、上下文和记忆的新架构。

1440p 分辨率下的一分钟视频

在相机可控生成方面,Atlas 接收一张或多张图片,在自由选择的相机位置和角度输出新视角。相机运动直接作为几何输入传入,而不像许多视频模型那样依赖文本提示描述。

该模型可输出最高一分钟 1440p 的视频。用户可以自主控制每一个镜头,而非像 World Labs 所说的「拨老虎机赌运气」,以此划清了可控生成与随机输出的界限。

A three-part view showing an input image of a vine-covered cathedral, a sketched camera path, and the generated output image of the same hall from a new perspective.
Atlas 将输入图像与特定的相机运动轨迹作为几何输入,生成对应的新视角。 | 图片来源:World Labs

在空间重建方面,Atlas 仅需一张到数十张输入图像即可完成真实场景的重建,无需特殊拍摄设备。输入图像越多,模型需要依赖自身知识"脑补"的部分就越少。

World Labs 表示,仅凭两三张图像,Atlas 就能产出忠实于原景的结果,且优于专用 3D 模型。它也能处理上百张输入图像。在一次演示中,该模型从 2 到 25 张地面视角照片逐步拼合出斯坦福大学主广场的全貌,并生成了校园上空的高空俯视视角。

Aerial view of the San Francisco skyline with the Transamerica Pyramid, with the street-level input photo shown as a small inset in the lower left.
仅凭一张街景照片,Atlas 即可生成城市高空的鸟瞰视角。 | 图片来源:World Lab

这正是现有模型的软肋。在 OpenWorldLib 框架内的对比实验中,VGGT 和 InfiniteVGGT 等系统在相机发生明显位移时便出现了几何结构不一致和纹理模糊的问题。

原生 3D 输出与机器人仿真

Atlas可以输出真正的3D数据,而不仅仅是图像或视频,因为它能同时处理深度信息和RGB信息。支持的格式包括点云和3D高斯泼溅(3D Gaussian splats),后者由大量小型空间数据点构建场景,可从任意角度平滑观察。这与该公司现有产品Marble所使用的表示方式一致。
A living room reconstructed as a point cloud with sofa, rug, and fireplace, floating above a grid floor, with marked camera positions and a blue camera path.
除了图像,Atlas还可以将场景输出为显式的3D数据,此处以点云形式展示,并标注了对应的相机路径。| 图片来源:World Lab
作为模拟器,Atlas将空间和时间统一建模。仅凭少量摄像头拍摄的视频素材,它就能产生"子弹时间"效果——冻结场景,让用户以现实中无法实现的角度进行观察。演示视频由几部智能手机和运动相机拍摄,而非专业设备。
对于机器人领域,Atlas充当了real-to-sim工具。它可以重建房间,并生成模拟机器人沿路径移动时传感器会看到的图像和深度数据。只需几张照片,用户就能通过替换物体、位置、光照或背景来模拟和调整抓取与运动任务。其目标是生成多样化的机器人训练数据,而无需在现实世界中录制每一种情况。
World Labs在2026年8月曾以独立产品的形式展示过这一方法,即其real-to-sim-to-real引擎。该引擎从单个真实任务中生成数千个变体,完全在模拟环境中训练控制模型。据公司称,在五个机器人平台上,模型各自连续运行了一小时,无需人工干预。这项技术来自SceniX,一家World Labs于7月收购的初创公司。

该公司表示,文字生成图像并非主要方向,但 Atlas 也能遵循复杂的提示词、渲染文字、生成不同视觉风格,并创建 360 度全景图。

语言模型的效率,扩散模型的质量

Atlas 融合了语言模型和视频模型的思路。它像语言模型一样逐段生成输出,因此可以复用 KV 缓存等加速技术;同时它还采用了图像和视频模型中的扩散原理,从噪声中逐步过滤出最终结果。后者让它能够利用缩短去噪过程或提升图像质量的方法。

World Labs 表示,没有单一的基准测试能全面反映 Atlas 的能力,但他们展示了两组测试结果:在由外部人类评估者评判的相机控制生成任务和少视角 3D 重建任务中,Atlas 均超越了更具针对性的专业模型。

在对战中,人类评估者在 75% 的情况下更偏好 Atlas(对阵 MiniMax H3),81% 胜过 Gemini Omni Flash,86% 胜过 Happy Horse 1.1,93% 胜过 [原文此处缺模型名],94% 胜过 Seedance 2.5。在重建方面,Atlas 的中位误差为 25.3,领先于 Pi3X 和 VGGT-Ω 1B。

Dot plot with confidence intervals showing the share of human evaluators who prefer Atlas, ranging from 75 percent against MiniMax H3 to 94 percent against Seedance 2.5.
在相机引导生成的直接对比中,多数评估者一致选择了 Atlas。| 图片来源:World Labs

公司表示,Atlas 的性能随训练算力的增加而提升,并预计这一趋势将在扩展时持续。Atlas 将驱动 Marble 的未来版本及其他产品,目前正通过早期准入计划向部分合作夥伴开放。

Atlas 3D重建误差柱状图,Atlas为25.3,Pi3X为28.7,π³为34.7,VGGT-Ω 1B为36.4,Depth Anything 3为39.3,MapAnything为47.7。
Atlas的平均重建误差在所有对比的专用模型中最低,数值越低表现越好。| 图片来源:World Lab

从可漫游的图像到全能模型

World Labs由ImageNet的创建者李飞飞于2024年创立,她曾于2017至2018年担任Google Cloud的AI部门主管。公司在启动时已获得Andreessen Horowitz、AMD、Intel和Nvidia的投资。

2024年底推出的首个系统虽能生成交互场景,但用户仅能移动几米虚拟距离就会碰到隐形边界。2025年11月,Marble系统问世。2026年2月,Autodesk、Andreessen Horowitz、Nvidia和AMD领投了10亿美元融资轮。此前彭博社曾报道过估值达50亿美元的相关谈判。

学术界对「世界模型」的界定仍存在争议。2026年4月,北京大学牵头的国际团队通过OpenWorldLib项目提出了一套统一定义,将纯文本到视频生成模型排除在外,原因是这类模型缺乏与真实世界的反馈循环。而Atlas中的3D重建和模拟器等技术,因能提供可验证物理规律的环境,在该框架中被视为核心构建模块。

原始来源: The Decoder

评论 (0)