← 文章 / AI技术
Hacker News 2小时前 · 2026-09-02 12:42:47 · 4 阅读

Atlas:面向空间智能的世界模型

世界模型可以生成、重建并模拟一切可能的世界。它们理解世界如何呈现、如何运作、如何演化,从而为创意用户渲染想象中的世界,高保真地模拟真实世界,并帮助机器人规划动作。在 World Labs,我们致力于构建这些通用世界模型,追求空间智能。

今天,我们推出 Atlas——我们的下一代世界模型。Atlas 是一种全能模型,从零开始预训练,原生支持文本、图像、视频和 3D。它是一个多模态自回归扩散 Transformer:所有输入被融合到一个统一的空间上下文中。Atlas 利用该上下文来预测接下来要生成的内容,在三维空间中与它所见过的一切保持一致,并想象超出视野之外的部分。Atlas 具备良好的可扩展性:随着训练算力的增加,其性能持续提升,我们预计这一趋势将在后续扩展中继续保持。

Atlas 能够执行广泛的任务,涵盖世界生成、重建与模拟:

Atlas 将为 Marble 的未来版本以及 World Labs 的其他产品提供核心支持。

申请 Atlas 抢先体验

相机可控生成

Atlas 接收一张或多张参考图像,然后根据你指定的任意相机位置和角度生成新视角。生成画面在内容和几何结构上与输入图像保持一致,并在输入之外自然延伸,构想出画面中未显示的场景部分。

Atlas 适用于多种场景类型、视觉风格和相机运动。

基于 1 到 6 张输入图像,配合手动设计的相机路径生成视频

像素级精确的相机控制

Atlas 把精确的相机几何参数作为原生输入,而不仅仅依赖粗粒度的文本描述来控制相机。这让你能够精确取景,全面掌控画面运动。

在下面的示例中,Atlas 仅凭单张输入图像就生成了完整的场景。它结合图像内容和自身的世界知识,构想出新角度下场景应有的样子。例如,它生成了机器人的背面,并推测泳池旁应该有一片草坪。

基于单张图像,Atlas 可以从任意角度生成新视角。拖动即可切换视图。

结合空间上下文生成

与 LLM 类似,Atlas 先把输入编码成上下文,再在条件约束下生成输出。不过 Atlas 的独特之处在于:每张图像都被锚定在三维空间中的某个位置上,由此构成一种空间上下文。

管理这种空间上下文解锁了全新的创意控制方式。例如,你可以把两张无关的参考图像放入上下文,并在三维空间中分别放置它们;Atlas 便会生成一个在二者之间平滑过渡的世界。

这些示例展现了模型的世界知识与创造力——它会想象出门厅、走廊、壁龛等过渡空间,把原本毫不相关的图像对自然衔接起来。

选择左右两张图像来构建空间上下文,Atlas 会将它们拼接在一起

可控的长视频生成

Atlas 让你能够结合相机运动和空间上下文管理,精确控制地生成长视频。每个场景、每个机位都由你亲自设计。这让你真正坐上导演的位置——你在搭建场景,而不是在拉老虎机的摇杆。

在下面的示例中,我们仅使用少量参考图像,就生成了 1440p 分辨率、时长 1 分钟的视频。我们手工设计了一条穿越场景的相机路径,Atlas 则据此生成一个连贯的世界。本页其他视频均经过压缩以优化页面加载速度。

空间重建

Atlas 能够从一个或多个输入图像重建真实世界空间。它无需特殊采集设备,也无需成百上千张密集视角,即可忠实还原物体和场景。我们认为,Atlas 在解决「从稀疏输入图像进行新视角合成」这一问题上迈出了重要一步——这也是三维计算机视觉领域数十年来的一项基础难题。

从多张图像重建

Atlas 可以接收数量可变的场景输入视角。当世界中的某些部分在输入视角中不可见时,Atlas 会基于其丰富的世界知识,以合理的方式填补这些空缺。

但有时你并不希望它去想象,而是想要对真实地点的精确重建。提供更多的输入图像能为 Atlas 带来更多上下文信息:看到的越多,想象的就越少。Atlas 通常仅需两三张图像就能给出忠实重建,其效果优于专为三维重建训练的当前最优模型。同时,Atlas 也能利用超过一百张输入图像所提供的空间上下文,实现对真实环境的忠实复现。

在下面的第一个示例中,Atlas 仅凭一张地面视角的照片,就生成了场景的航拍视图。输入照片中可见的花园在模型输出中被准确还原,而场景的其余部分则由模型想象生成。在加入第二张真实图像——花园旁的村舍——之后,模型的输出同时呈现了花园和村舍,但左侧的房子仍是想象出来的。再加入第三张主屋的输入图像后,整个场景便得到了准确呈现。

在第二个示例中,我们一步步搭建起斯坦福主广场:从绿草如茵的主入口开始,到纪念教堂外墙上缤纷的马赛克装饰结束。尽管 Atlas 仅接收了 2 到 25 张地面视角的输入图像,它却能生成远高于校园上空的航拍路径。

重建多样化路径

Atlas 可以在同一个场景中生成多种不同的轨迹,从同一组输入图像中呈现全新的视角。无论你如何改变相机路径,场景都保持一致。

在下面的示例中,我们展示的是:给定一小批输入图像,Atlas 就能在同一个场景中生成多条相机路径。不同的路径可以突出场景的不同部分,也可以通过改变速度、长度或复杂度来营造不同的氛围。

仅凭一小批输入图像,Atlas 就能在同一个场景中生成多条不同的路径。

显式 3D 输出

在上面的结果中,你已经看到 Atlas 输出 2D 图像和视频,这对某些应用来说已经够用了。但机器人、游戏、设计、VFX 等领域的工作流往往需要显式的 3D 输出。Atlas 天然支持 2D 图像帧和 3D 深度图,因此可以直接将世界输出为点云或 3D Gaussian splats。

从一张图像出发,Atlas 生成新视角和 3D 几何,再转换为 3D Gaussian splats

从单张输入图像,Atlas 通过联合生成新视角并估计其几何来构建完整的 3D 世界。从一段真实空间的视频,它预测每一帧的深度,并将它们融合成 3D 重建。无论哪种情况,Atlas 都会补全那些任何相机都未曾看到的区域。

Atlas 可以从输入视频重建 3D 点云

点云能估算场景的几何,但要让场景真正可用,还得靠 3D Gaussian splats。Atlas 会填补剩余的空白,把点云变成一个完整的 splat 场景,在设备端以高分辨率和高帧率渲染。这也是 Marble 使用的表示方式,使 Atlas 能够自然地与我们其他产品集成。

时空仿真

Atlas 同时扮演着世界模拟器的角色。它既理解世界的空间结构,也理解世界随时间演变的方式。空间与时间能力的结合,为 VFX、机器人等领域带来了新的应用可能。

重构视频

Atlas 把几台普通相机变成一个"子弹时间"多视角拍摄工作室。仅凭三台相机的素材,它就能冻结时间并重构镜头,让你从不可能的角度观看事件。

无需昂贵的拍摄棚,也能从全新视角重构真实世界的视频画面

值得一提的是,这些镜头并不需要专业摄影师或特种设备——全部由几位工程师和研究人员用几台手机搭配三脚架和夹具,在背包里就完成了拍摄。Atlas 只需三到五个视角就能重建整个场景,之后你可以随心所欲地调整镜头。

幕后花絮:以上画面仅用几台手机和运动相机拍摄完成

机器人仿真

Atlas 为导航和操作任务中的 Real-to-Sim 提供了全新的规模化路径。

你已见过 Atlas 仅凭几张图像就能以显式 3D 重建空间。但对机器人而言,重建只是第一步:当仿真机器人在空间中移动时,Atlas 还会同步生成其传感器沿途观测到的 RGB 和深度数据。世界本身和机器人眼中的世界,源自同一个模型。

在以下示例中,我们用手机视频拍摄了两个大型环境,每个仅用 24 帧进行重建。传统方式扫描这样的空间通常需要复杂且昂贵的设备。随后,我们仿真了不同机器人在不同路径上的导航过程,并用 Atlas 从机器人机身摄像头的视角生成对应画面。

Atlas 重建空间并辅助机器人导航仿真

机器人操作更进一步。仅凭几段随手拍摄的录像,Atlas 就能帮助构建仿真环境,并还原物体的运动与交互方式。一旦任务被仿真出来,你就可以轻松变换各种条件:更换物体、调整位置、改变机器人动作、切换光照和背景。这为机器人大规模训练提供了多样化的数据和测试环境。

浏览器不支持视频播放。

Atlas 仅凭少量真实录像即可实现 Real-to-Sim,重现刚体、铰接体和可形变物体之间的物理交互,同时支持可控的变量调整。

图像生成

Atlas 的核心定位是世界建模,每张图像都是通往某个可能世界的窗口。 虽然图像生成并非它的主要目标,但 Atlas 本身也是一个能力出色的图像生成器: 它能理解复杂的 prompt,渲染文字,并生成多种多样的视觉风格。

Atlas 还能根据文本或图像 prompt 生成 360 度全景图像,同样可以覆盖丰富的场景类型和视觉风格。

技术细节

模型架构

Atlas 是一个 omni 模型,旨在用一套统一的架构同时处理多种任务、多种输入和输出数据类型,将空间控制置于模型的核心位置。 为了实现这些目标,我们必须跳出现有 LLM 和视频模型所采用的标准架构,设计一种全新的基础架构,作为未来世界模型的基石。

Atlas 是一个多模态自回归扩散 Transformer。它的输入以 3D 空间为锚点形成空间上下文,并在此上下文条件下生成多模态输出。

Atlas 是一个多模态自回归扩散 Transformer。 它作用于多模态序列,一次生成序列中的一个新元素。 这些架构特性相互配合,共同服务于我们的目标, 并共同支撑起一种基于空间上下文的全新生成范式。 下面我们逐一展开:

  • 多模态:Atlas 原生支持多种不同数据类型。 目前可处理文本、图像、相机位姿以及 3D 深度图, 视频则表示为图像序列。 每张图像和深度图都以一个明确的相机位姿作为条件, 使空间控制成为架构中的核心组件。
  • 自回归:Atlas 在元素序列上运行, 每个元素是上述某种多模态数据类型。 每个输出依次生成,以上下文序列中已生成的部分为条件。 这种灵活的设计天然适配各式各样的任务: 每种任务都只是某种特定形式的序列,由输入后接输出组成。
  • Diffusion:Atlas 是一个 rectified flow 模型,通过逐步去噪来生成输出。Diffusion 模型擅长建模图像、视频等高维连续数据,并且可以通过调整推理时的去噪步数,在速度和画质之间灵活取舍。
  • Transformer:Transformer 架构的核心是大规模矩阵乘法运算,非常适合现代硬件。它是世界建模领域稳健的主干网络。

Atlas 融合了现代大语言模型和视频模型的设计思路,能够同时受益于两类模型在架构、算法和系统层面的最新进展。

和 LLM 类似,它是一个自回归 Transformer,因此可以借助 KV caching、cache-aware routing、分离式推理(disaggregated serving)等用于 LLM 服务和加速的创新技术。和现代图像或视频模型类似,它是一个潜空间扩散模型,可以采用 diffusion distillation、classifier-free guidance、shifted noise schedule 以及 VAE 设计方面的新成果。

基准测试

Atlas 是一个面向世界建模的通用模型,能够胜任多种任务,因此没有任何单一基准可以完整衡量它的通用性。我们重点展示 Atlas 在两个关键任务上的量化评估结果:相机可控生成和三维重建。在这两项任务上,它都优于更专门化的模型。

在相机可控生成任务上,我们与一批表现优异的视频模型进行对比。每一轮测试中,我们给定一张输入图像和一组一至三个电影级相机运动(pan、truck、crane 等)。

我们用单张输入图像和目标相机路径对每个模型进行提示。对于 Atlas,我们使用其原生的相机输入格式对相机路径进行编码;其他模型并不接受相机作为原生输入,因此我们用标准的电影术语在文本提示中描述相机路径。理论上,更精细的提示工程或更巧妙的多模态提示有可能提升某些模型的相机跟随效果,但我们仍采用文本提示,因为这是描述相机运动最常见的输入方式。

由第三方人类评分员判断哪个模型更好地遵循了指定的相机路径。结果显示,Atlas 在相机可控生成上优于近期视频模型,并且随着相机轨迹变得更复杂,这一优势进一步扩大。

相机可控生成

我们还在稀疏视角三维重建任务上对 Atlas 进行了评估。 在每次测试中,模型接收一组图像及其对应的相机位姿, 然后为每个输入像素预测一个三维点。 这个问题在学术界备受关注, 近年来涌现了许多专门的三维重建模型。

Atlas 是一个既能生成又能重建的通用模型。 尽管具有这种通用性,Atlas 的表现仍然优于最好的专用开源重建模型。

我们在该任务的多个最先进基准上进行了评测, 并复现了所有基线方法的结果, 以确保不同方法之间采用统一公平的评估标准。

三维重建误差(越低越好)

Atlas (我们的方法)Pi3X(带位姿)π³VGGT-Ω 1BDepth Anything 3MapAnything

模型扩展

现代 AI 的进步主要来自规模化扩展。 模型能力的提升,很大程度上是通过将简单算法扩展到更大规模的数据和算力上来实现的。

我们有充分的理由相信 Atlas 在规模化扩展下会持续进步。 我们在一个大规模、多样化的多模态数据语料上从零预训练了 Atlas。 在整个开发过程中, 我们训练了一系列规模逐增、训练算力逐步提升的模型, 发现每一级算力的提升都能解锁模型的新能力。 我们坚信未来的世界模型将延续这一趋势—— 随着我们持续扩大规模,模型能力将大幅提升。

使用 Atlas 进行构建

Atlas 正在面向部分合作伙伴开放早期试用。 如果你希望基于 Atlas 进行开发,请在下方申请接入权限,我们会与你联系。 我们非常期待看到你的作品,也希望与你携手,将 Atlas 打造成用于生成、重建和模拟任意世界的首选世界模型。

申请 Atlas 早期试用

同时,我们也在 招聘 研究和工程人才,共同推动空间智能的发展。

本文由 World Labs 团队撰写,引用格式如下:

@article{worldlabs2026atlas,
    author = {World Labs Team},
    title = {Atlas: A World Model for Spatial Intelligence},
    journal = {World Labs Blog},
    year = {2026},
    note = {https://www.worldlabs.ai/blog/atlas},
}
原始来源: Hacker News

评论 (0)