World Labs 发布 Atlas:单一 AI 模型可从少量照片生成、重建并模拟 3D 世界
由 AI 研究者李飞飞联合创办的 World Labs 发布了 Atlas——一个能从少量图片生成、重建并模拟 3D 场景的世界模型。该公司称其在各项任务上超越了专用模型,这意味着许多现有模型可能不再需要。
自成立起,World Labs 就一直追求「空间智能」的目标,即让 AI 像人类一样理解 3D 空间。Atlas 是公司首个为此规模化构建的模型,它不产出平面图片或视频片段,而是理解场景从任意角度的样貌以及随时间的变化。
World Labs 将 Atlas 描述为一个从头训练的通用模型,使用文本、图像、视频和 3D 数据训练。所有输入都被锚定到 3D 空间中的具体位置,而非作为扁平序列处理。公司称这种共享的空间理解能力为「空间上下文(spatial context)」,模型正是用它来生成每一帧画面或新视角。据 World Labs 称,这种锚定机制将 Atlas 与纯语言或视频模型区分开来。
李飞飞在 2025 年 11 月发表的文章中曾明确提出这一问题:她认为,当前多模态语言模型和视频扩散模型将数据切割成一维或二维序列,导致简单的空间任务也变得不必要地困难。真正需要的,是能够以 3D 或 4D 感知的方式组织分词、上下文和记忆的新架构。
1440p 分辨率下的一分钟视频
在相机可控生成方面,Atlas 接收一张或多张图片,在自由选择的相机位置和角度输出新视角。相机运动直接作为几何输入传入,而不像许多视频模型那样依赖文本提示描述。
该模型可输出最高一分钟 1440p 的视频。用户可以自主控制每一个镜头,而非像 World Labs 所说的「拨老虎机赌运气」,以此划清了可控生成与随机输出的界限。

在空间重建方面,Atlas 仅需一张到数十张输入图像即可完成真实场景的重建,无需特殊拍摄设备。输入图像越多,模型需要依赖自身知识"脑补"的部分就越少。
World Labs 表示,仅凭两三张图像,Atlas 就能产出忠实于原景的结果,且优于专用 3D 模型。它也能处理上百张输入图像。在一次演示中,该模型从 2 到 25 张地面视角照片逐步拼合出斯坦福大学主广场的全貌,并生成了校园上空的高空俯视视角。

这正是现有模型的软肋。在 OpenWorldLib 框架内的对比实验中,VGGT 和 InfiniteVGGT 等系统在相机发生明显位移时便出现了几何结构不一致和纹理模糊的问题。
原生 3D 输出与机器人仿真
Atlas可以输出真正的3D数据,而不仅仅是图像或视频,因为它能同时处理深度信息和RGB信息。支持的格式包括点云和3D高斯泼溅(3D Gaussian splats),后者由大量小型空间数据点构建场景,可从任意角度平滑观察。这与该公司现有产品Marble所使用的表示方式一致。
该公司表示,文字生成图像并非主要方向,但 Atlas 也能遵循复杂的提示词、渲染文字、生成不同视觉风格,并创建 360 度全景图。
语言模型的效率,扩散模型的质量
Atlas 融合了语言模型和视频模型的思路。它像语言模型一样逐段生成输出,因此可以复用 KV 缓存等加速技术;同时它还采用了图像和视频模型中的扩散原理,从噪声中逐步过滤出最终结果。后者让它能够利用缩短去噪过程或提升图像质量的方法。
World Labs 表示,没有单一的基准测试能全面反映 Atlas 的能力,但他们展示了两组测试结果:在由外部人类评估者评判的相机控制生成任务和少视角 3D 重建任务中,Atlas 均超越了更具针对性的专业模型。
在对战中,人类评估者在 75% 的情况下更偏好 Atlas(对阵 MiniMax H3),81% 胜过 Gemini Omni Flash,86% 胜过 Happy Horse 1.1,93% 胜过 [原文此处缺模型名],94% 胜过 Seedance 2.5。在重建方面,Atlas 的中位误差为 25.3,领先于 Pi3X 和 VGGT-Ω 1B。

公司表示,Atlas 的性能随训练算力的增加而提升,并预计这一趋势将在扩展时持续。Atlas 将驱动 Marble 的未来版本及其他产品,目前正通过早期准入计划向部分合作夥伴开放。

从可漫游的图像到全能模型
World Labs由ImageNet的创建者李飞飞于2024年创立,她曾于2017至2018年担任Google Cloud的AI部门主管。公司在启动时已获得Andreessen Horowitz、AMD、Intel和Nvidia的投资。
2024年底推出的首个系统虽能生成交互场景,但用户仅能移动几米虚拟距离就会碰到隐形边界。2025年11月,Marble系统问世。2026年2月,Autodesk、Andreessen Horowitz、Nvidia和AMD领投了10亿美元融资轮。此前彭博社曾报道过估值达50亿美元的相关谈判。
学术界对「世界模型」的界定仍存在争议。2026年4月,北京大学牵头的国际团队通过OpenWorldLib项目提出了一套统一定义,将纯文本到视频生成模型排除在外,原因是这类模型缺乏与真实世界的反馈循环。而Atlas中的3D重建和模拟器等技术,因能提供可验证物理规律的环境,在该框架中被视为核心构建模块。