← 文章 / AI视频与短剧
InfoQ 1小时前 · 2026-09-03 18:08:02 · 0 阅读

李飞飞首个多模态世界模型 Atlas 正式发布:从零开始预训练,几张图就能构建世界

李飞飞的 Atlas 来了

一张照片能够告诉 AI,房间里有一张桌子。但如果把镜头移到桌子背后,那里应该是什么样?如果机器人伸手推动桌上的杯子,接下来又会发生什么?

识别物体、生成画面和理解空间,是相互关联、却不能直接画等号的能力。李飞飞创办的 World Labs,正在尝试跨越它们之间的距离。

昨晚,World Labs 发布新一代世界模型 Atlas,这是一款全域模型,团队从零开始预训练,使其能够原生处理文本、图像、视频和 3D 数据。Atlas 它将用于后续 Marble 及其他产品,目前面向部分合作伙伴开放早期访问,而非全面上线。

这款备受关注的多模态世界模型的亮点是什么?

按照官方披露,Atlas 的主要能力包括世界生成、重建和模拟等广泛任务:

  • 可控运镜:Atlas 可利用像素级相机控制,从一张或多张图像生成图像和视频,输出长达 1 分钟的 1440p 视频。

  • 空间重建:Atlas 可以根据一张或数十张输入图像重建真实世界场景。它既可以生成来自新视角的图像帧,也可以生成明确的 3D 输出,其性能优于目前最先进的 3D 重建专用模型。

  • 时空模拟:Atlas 通过输入视频对空间和时间进行建模,重新构建视频以获得戏剧性的视觉效果,并为机器人实现真实到模拟的工作流程。

  • 图像生成:Atlas 可以根据文本生成图像和 360 度全景图;它可以遵循复杂的提示,渲染文本,并生成各种各样的视觉风格。

提示词:“一张极具电影感的超写实广角镜头,展现了一座被丛林吞噬的寺庙中,一座巨大的石头女神端坐于宝座之上,下方是瀑布、探险者和碧绿的水池。”

提示词:“一张宽幅室内设计照片,展示了一间以淡蓝色鲸鱼为主题的儿童卧室,卧室里有一张可爱的鲸鱼床,床下是一幅海底壁画。”

提示词:“一张逼真的过肩特写照片,展现了花店老板在温暖的灯光下用牛皮纸包装一束粉色牡丹花。”

提示词:“一张 20 世纪 60 年代法国新浪潮电影海报,将地球仪和复古机器人以撕裂的照片蒙太奇形式层叠在一起,并以红色、蓝色和黄色的字体加以点缀。

Atlas 采用多模态自回归扩散 Transformer:序列元素逐个生成,每一步参考已有上下文,而视觉输出通过去噪产生;相机位姿和深度也是模型处理的数据类型。

这套设计的重要性,可以用一个拍摄任务来理解。

“让镜头向左移动”是一句意图描述;指定相机在空间中的位置和朝向,则是一组可检验的约束。前者需要模型猜测用户想要什么,后者允许创作者检查镜头到底有没有到达指定位置。

对于需要反复修改、衔接不同镜头的制作流程,差别不只是控制更细,是用户能否把同一个环境当作可重复使用的场景,而非每次重新抽取一段视频。

重建与生成也有类似关系:证据充分的区域,应当尽量还原;没有拍到的区域,只能依据已有信息推测。一个模型同时承担这两种任务,意味着使用者必须清楚,哪些部分来自观测,哪些部分来自补全。

但这里需要值得注意的是,生成得合理,不代表它就是现实中原本的样子。

即便如此,Atlas 的生成效果也足够令人惊叹。

而更耐人寻味的是,交出这份答卷的并不是 OpenAI、Google 这类资源无上限的巨头,而是李飞飞在 2024 年才创办的 World Labs。那么,为什么做出这款多模态世界模型的是她的团队?

World Labs 的故事,不能只从 Atlas 开始讲。

李飞飞 1999 年获得普林斯顿大学物理学学士学位,2005 年获得加州理工学院电气工程博士学位。她推动的 ImageNet 及相关竞赛,是现代计算机视觉发展的重要基础;她也曾于 2017 年至 2018 年担任谷歌副总裁及 Google Cloud AI/ML 首席科学家。

为啥要把她的履历再介绍一遍,因为把她一直在做的事放在一起看,可以发现问题的延续性。

ImageNet 时代,一项核心任务是让机器识别照片里的内容。空间智能则把问题推进了一层:不仅要知道“这是什么”,还要知道它在哪里、从另一个方向看是什么样,以及它与周围物体存在什么关系。

例如,“这是一把椅子”是类别识别;判断机器人能否从椅子和墙壁之间穿过去,则需要尺度、几何和行动后果。语言可以描述这个问题,但文字描述本身不能替代空间判断。

2024 年 9 月,World Labs 公开亮相。早期投资方 Radical Ventures 当时披露,公司从起步阶段就将目标设定为感知、生成和交互三维世界,并计划先从创作者能够使用的虚拟空间切入,再扩展能力。

因此,今天的机器人方向并不是看到具身智能升温后突然增加的一条业务线。更准确地说,创造空间是较早可以交付的入口,而让机器在空间中行动,是更难兑现的长期目标。

创始团队的构成,也能解释这条路线。World Labs 由李飞飞与 Justin Johnson、Ben Mildenhall、Christoph Lassner 共同创办,几人的积累集中在视觉、图形学和三维表示,而不只是语言建模。

Ben Mildenhall 于 2020 年在加州大学伯克利分校获得博士学位,之后在 Google Research 工作。他是 NeRF 论文的共同第一作者之一。这项研究利用神经网络表示场景,并从已有照片合成新视角,是理解这支团队技术背景的重要线索。

Justin Johnson 的研究涉及视觉推理、视觉与语言、图像生成和三维推理,博士毕业于斯坦福。

Christoph Lassner 则长期研究高效的场景表示和渲染,开发过后来成为 PyTorch3D 球体渲染后端的 Pulsar。目前 Lassner 已公开宣布退出日常职位,继续担任顾问。

这些经历并不能证明 Atlas 直接采用了某项早期研究,但能解释团队为什么会执着于同一件事:画面背后的空间,能否被稳定地表示、重建和调用。

从 Marble 到 RTFM:先让世界存在,再让世界持续生成

回看公开研发节点,World Labs 并不是一开始就拿出了今天这套完整能力。

2024 年 12 月,公司首先展示可在浏览器中探索、具有持续性的三维世界。2025 年 9 月,展示重点转向更大、更精细的环境,Marble 也进入早期测试。

到 2025 年 11 月 12 日,Marble 正式向所有用户开放。

Marble 的意义,是把研究结果变成能够继续加工的资产。

用户不仅可以从文本、图像、视频和粗略三维布局生成世界,还能编辑、扩展、合并场景,并导出高斯泼溅、网格或视频。对于创作者来说,这比一次性生成结果更接近工作流:生成之后,还能修改和交付。

与此同时,团队在 2025 年 10 月公开了另一条研究线:RTFM,即 Real-Time Frame Model。

据官方博客透露,RTFM 的设计围绕三个关键原则:

它探索的是“学习出来的渲染器”。传统图形系统先建立几何、材质、光照,再计算画面;RTFM 则从已有画面预测新视角,不必先建立显式三维模型。官方当时将目标定为在单张 H100 上实现交互式帧率,并通过优化架构、蒸馏和推理系统达到这一目标。

这里最难的,不只是速度,而是记忆。

假如用户先进入客厅,再走到厨房,最后回到客厅,模型不能重新“发明”一间客厅。但如果把用户看过的所有画面都放进上下文,计算与存储开销又会不断增加。

RTFM 的解决思路是给画面绑定空间位置:生成新视角时,检索附近的相关帧,而不是始终处理全部历史。这种空间化的记忆组织,是其保持场景持续性的关键设计。

从公开技术路线看,Atlas 与这一思路存在连续性:上下文不仅是按时间排列的信息,还包含“从哪里看到什么”。

2026 年 1 月,World Labs 进一步推出 World API,让开发者以程序方式调用 Marble 的世界生成能力。至此,公司的公开路线已经包括模型、创作产品和开发接口,而不仅是研究演示。

Atlas 的出现,更适合被理解为沿着这些路线向统一模型推进。

2026 年 6 月,World Labs 专门发表文章,将世界模型分成三类:生成观察画面的渲染器、描述世界状态与变化的模拟器,以及决定下一步动作的规划器。

这套分类指出了一个容易被忽略的区别:一段视频看上去符合现实,不代表它能充当可靠的训练环境。模拟器需要对几何和动态行为负责,规划器则必须据此采取行动。

以机器人拿杯子为例,影视镜头只需要让手与杯子的接触看起来自然;训练环境却要回答,抓取位置偏移后是否会滑落、动作改变后结果是否一致,以及模拟中的改进能否迁移到真实机器上。

为了补齐这部分能力,7 月 21 日,World Labs 宣布收购机器人公司 SceniX,将学习式仿真与真实机器人闭环作为重点方向。

一周后,公司发布 Real-to-Sim-to-Real 技术进展:把现实任务转换成可控仿真环境,在其中训练或评估策略,再到真实机器人上验证。官方展示涵盖线缆操作、试管转移和杂乱物体抓取等任务,部分演示报告了连续一小时无需人工干预的运行结果。

上图展示的一个真实任务,成千上万种变体:研发团队将一个真实任务重建为交互式仿真,保留与任务相关的观测与动力学特性,再系统地改变外观、物体布局、背景杂乱度、物理参数、机器人状态和相机视角,从而生成机器人实现泛化所需的丰富经验。

从产业角度看,这条路线争夺的不只是机器人“大脑”,还包括机器人反复练习和接受考试的环境。

现实中的失败需要重置设备、恢复场景,有时还伴随损坏风险。如果仿真能够有效预测真实系统的表现,研发团队就可以把更多方案筛选移到虚拟环境中,再用有限的实机时间验证最有希望的结果。

但前提依然是“有效预测”。生成一万个看起来真实的房间,并不自动等于获得一万个有用的机器人训练环境。

10 亿美元融资背后,是算力和专业工作流两道门槛

这条研发路线也解释了 World Labs 为什么需要大量资金。

2026 年 2 月,公司宣布新增 10 亿美元融资,投资者包括 AMD、Autodesk、英伟达、Fidelity 等。其中,Autodesk 单独披露了 2 亿美元战略投资,并表示会在研究和模型层面开展合作。

芯片公司与设计软件公司的同时出现,值得注意:一端关系到训练和推理成本,另一端关系到模型能否进入专业生产流程。

世界模型必须处理大量连续视觉信息;而当它进入建筑、制造或影视流程时,仅仅生成效果好还不够。用户还需要编辑、尺寸约束、资产兼容和稳定交付。资金可以支持更大规模的训练,却不能直接替代这些工程工作。

Autodesk 在投资说明中强调空间、结构、材料、物理和时间,也反映出专业软件用户对 AI 的要求,与普通图像生成用户并不完全相同。

所以这笔投资其实指向了一种更现实的合作方向:生成模型降低创建成本,专业工具继续承担约束、验证与生产责任。二者如何结合,仍需产品证明。

参考链接:

https://www.worldlabs.ai/blog/atlas

https://www.worldlabs.ai/blog/rtfm

https://x.com/theworldlabs/status/2094839756329041984

原始来源: InfoQ

评论 (0)