← 文章 / AI视频与短剧
Latent Space 6小时前 · 2026-09-25 16:28:43 · 2 阅读

Runway WorldPrompt 与实时世界生成的工程实践

本月早些时候,世界模型公司 Runway 发布了 GWM Worlds 2,一个研究预览版,宣称能“把高保真的视频和音频生成变成实时交互式模拟”。Runway 称其为“自回归扩散”模型,其中“自回归”描述的是它随时间逐步生成的方式。

有一个新功能尤其引起我们的注意:WorldPrompt,这是一种用于指定生成世界及其内部动作的输入格式提案。它可以固定模拟环境的某些方面——包括首帧——然后创建一系列带时间戳的事件。这些事件或动作甚至可以实时输入。

为了理解 WorldPrompt 的意义,我们采访了 Runway CTO Kamil Sindi 以及生成式视频与多模态 AI 方向的首席研究科学家 Robin Kahlow。此外,swyx 和 Vibhu 在播客中对 Runway 联合创始人兼联席 CEO Anastasis Germanidis 的采访,也为我们提供了独家观点。

谁在构建实时交互式世界模型?

先介绍一下能够实时生成交互式视频和音频的世界模型的背景。

根据今年 2 月 完成的 3.15 亿美元最新融资,Runway 估值 reportedly 达 53 亿美元。它的首个产品 GWM Worlds 于去年 12 月上线。

除了 Runway,这个领域还有几个值得关注的项目:Google DeepMind 的 Genie 3(同样支持 720p、24 fps 生成)、Odyssey-2 Pro,以及 World Labs 的 RTFM(Real-Time Frame Model)。下表总结了它们的差异:

鉴于实时视频和音频生成的复杂性及巨大的延迟要求(下文将详述),上述所有项目均存在局限性。例如,Google 指出 Genie 3 “目前仅支持几分钟的持续交互,而非数小时。”

但正如我们对 Runway 的采访所示,实质性进展正在取得。

WorldPrompt 的核心理念

WorldPrompt 是 GWM Worlds 2 中的新功能,有助于 Runway 在竞争中脱颖而出。你可以将其视为角色、摄像机和环境的控制层。用 Kahlow 的话说,这是一种“控制世界中所有不同主体”的方式——类似于电脑游戏。

“比如,如果某个 NPC [非玩家角色] 在那里,它可能会走向你并说点什么。你可以用这种模型实现类似效果,从而对场景中的每个元素进行非常细致的控制。”

顾名思义,WorldPrompt 是一种提示机制——而非编程语言。因此,与 Minecraft 或 Roblox 等虚拟世界游戏不同,GWM Worlds 2 不提供脚本功能或状态控制能力。但正如 Sindi 指出的,这也具有独特优势。

“你可以按需创建可提示的世界,实现视频和音频在不同领域和环境中的同步,”他说,“这并不是遥远未来的假设。”

但对世界模型进行提示也存在局限性。我们询问模型遵循指令的可靠性如何,例如创建重力法则或赋予角色特定能力?

“嗯,这是一款研究预览版,”Kahlow回答道,“当然不完美,还有一些缺陷。效果很大程度上取决于动作的复杂程度。我认为目前的运动生成相当可靠。”

Sindi补充说,更多的训练以及数据和模型的规模扩展带来了“更好的跟随性”。

视频模型如何转变为实时运行时环境

尽管 GWM Worlds 2 目前存在局限性——尤其是与 Minecraft 或 Roblox 这类预设且可脚本化的世界相比——但 Runway 等世界模型真正的价值在于,它们终将引领出完全自我生成、实时的游戏与体验。正如 Kahlow 提醒我们的,这是一个极具挑战性的工程问题。

“主要有两个难点。一是让模型不要一次性生成整个片段。相反,我们希望它在用户观看的同时逐帧生成。另一个难点是让生成速度足够快,从而实现实时播放。”

GWM Worlds 2 流程的高层视图

GWM Worlds 2 提供实时交互世界,以 720p 分辨率、每秒 24 帧(fps)的连续视频流以及 48,000 Hz 的音频进行传输。

Runway 首先通过基于其底层音视频生成模型,并针对新的 WorldPrompt 格式进行微调,使模型能够遵循该格式。随后,对模型进行后训练,以实现自回归生成。

“之后,我们通过蒸馏方法来使其实现实时化,”Kahlow补充道。

联合创始人兼首席执行官 Anastasis Germanidis 在我们的播客节目中提供了更多技术细节。他指出,该过程始于双向扩散,它基本上可以一次性生成整个视频,然后将其转变为自回归模式。这使得模型能够“每次生成一帧或几帧”。

自回归因果扩散模型 vs 传统视频模型;图片来自 Runway

Germanidis 提到了实现实时化的两种蒸馏方式:一是把大模型蒸馏成小模型,二是减少扩散步数。他举了个通用的例子:模型的去噪步数可以从 50 步左右降到 4 步,质量上会有一定损失,但效果可能相差不大。

实时生成的挑战

Germanidis 承认,在生成实时交互视频方面还存在一些问题。

“自回归模型最大的挑战是误差累积,”他说,“你把生成的帧喂回模型去生成下一帧,只要有微小的误差,就会随着时间不断累积。”

误差会不断叠加;图片来自 Runway

Sindi 告诉我们,在处理内容的“无限生成”时同样存在挑战。

“哪些上下文要保留、哪些不重要的内容要丢弃,这些问题一大堆。所以我们要做很多优化,不然 GPU 显存就要爆了。”

另一个目前的限制是长期记忆。“模型的记忆并不完美,”Kahlow 说,“这仍是一个有待解决的研究课题。”

因果关系与正确性

虽然性能是 Runway 当前的首要挑战,但世界模型在用户做出不同操作时,还需要产出符合情理的后果。

Germanidis 以模拟足球为例:他指出,网络视频训练数据中进球成功的画面远多于射门失败的画面,所以视频模型渲染前者时可能会更逼真。

“如果我选择这个动作,或者那个动作,我希望模型能生成同样逼真的结果,”他对我们说。“我认为,这正是视频模型与世界模型之间的关键差距所在,即反事实生成。”
图片来自 Runway

Sindi 告诉我们,随着交互的复杂性增加,评估的难度也随之上升。

“如果一个环境中包含多个提示、多个角色和多个场景,你真的很难理解哪些是因果结果,哪些不是。”

为了解决这个问题,Runway 采用了一些可自动验证的测试方法。不过 Kahlow 也指出,由于 GWM Worlds 2 目前仍处于研究预览阶段,建议用户也亲自进行测试——“亲手试用模型以发现不足之处,这一点非常重要。”

不仅是游戏——还有智能体用例

游戏显然是 Runway 当前建设方向的最直接应用场景,但也存在其他用途。Kahlow 提到了机器人技术,例如利用模拟环境来测试机器人的功能表现。

另一个更具吸引力的用例是大规模测试智能体。

“如果你拥有 GWM Worlds 这样的合适模型,构建数千个模拟环境就不那么有挑战性了,”Kahlow 说。

那么,智能体如何感知世界中的变化——它读取的是结构化的状态数据,还是仅仅在消费和理解生成的视频与音频?

“这里没有结构化的状态,”Kahlow 回答。“它只是观察你在现实生活中会看到的东西,只是这次是通过摄像头来观察。”

Sindi 指出,GWM Worlds 还可用于“为智能体生成合成数据”。

最后,Germanidis 建议可以将这些世界模型与推理模型结合使用。

“你可以用一些推理能力来规划场景,然后将其输入到实际生成像素的扩散头中。”


Anastasis Germanidis


时间戳

00:00:00 介绍

00:05:17 Runway 的起源与对生成式视频的押注

00:12:23 Stable Diffusion 的故事

00:18:44 Gen-2、可控性与周末黑客精神

00:23:02 从视频生成到世界模型

00:28:03 从世界学习,而不仅仅从语言学习

00:35:04 Sora、Runway 的存在主义危机与 Gen-3

00:39:39 为什么实时视频是不可避免的

00:43:06 界面世界模型:无代码软件

00:50:25 全神经网络操作系统

00:55:11 用于机器人的世界模型

01:02:32 机器人策略与世界动作模型

01:07:47 清醒梦测试

01:11:41 视频智能体与全模态模型

01:23:12 艺术家、AI 与创意工作流

01:27:14 物理 AI 与世界模型的未来


文字记录

介绍:Runway、创意 AI 与早期论题

Swyx [00:00:00]: 好的,我们现在和 Runway 的 Anastassios 在一起,还有我和 Vibhu 在演播室。欢迎。

Anastasis [00:00:08]: 很高兴来到这里。

Swyx [00:00:09]: 祝贺 Runway 取得的所有成功和进展。你们正在世界各地开设办公室。你们最初创业时预见到了这一景象吗?

Anastasis [00:00:16]: 不完全是。其实从最开始我们就有一个判断:这不是会不会的问题,而是什么时候的问题。我们看到了 2016、2017 年那些早期生成模型,然后据此推演,认为分辨率和画质会随时间稳步提升,总有一天大部分内容都会是生成的。Runway 最初的设想大概就是:有了这些生成模型之后,创作工具需要被重新构想。而随着我们在生成模型背后的研究不断深入,才逐渐发现它们的用途远远不止于此。

Anastasis 的背景:艺术、仿真与机器学习

Swyx [00:00:57]: 现在回头看就更明显了,尤其是我们后面要聊的现实世界场景和 world models。我挺好奇,你是怎么从 Zocdoc 和计算机视觉的背景走到 Runway 的?带我们回到你和 Chris 以及其他联合创始人的早期对话吧。

Anastasis [00:01:14]: 我一直穿梭在两个世界之间。一边是我自己的艺术实践,很长时间里我都在做互动艺术。另一边我在创业公司工作,做过 ML 工程师、后端工程师。我对编程和计算一直很感兴趣,尤其着迷于仿真(simulation),后来还把它融入了我早期的艺术创作。与此同时,我也对……

Swyx [00:01:43]: 你的个人网站上就有几个这样的作品,对吧?

Anastasis [00:01:44]: 对。

Swyx [00:01:45]: 有没有一个值得我们调出来看看的?我就是喜欢怀旧一把。

Anastasis [00:01:50]: 可以。

Swyx [00:01:50]: 好,这个是什么?

Anastasis [00:01:51]:这是我 2015 年左右做的一个项目。我开发了一款软件,它会在画廊空间里向人们发出语音指令,协调人与人之间的互动。软件首先会赋予你一个身份,比如“你是一名 30 岁的建筑师,喜欢运动”,然后将你与另一人配对,生成一段完全虚构的互动。当时语言模型技术还不够成熟,所以系统混合使用了模板和马尔可夫链生成的文本,模拟画廊里所有人的寒暄对话。一方面,我一直对生成式模型及当时的早期机器学习工作充满好奇;另一方面,我也关注模拟本身及其含义——通过构建极简的人类互动与行为模型,我们能从中学到什么?

早期生成艺术:pix2pix、GAN 与恐怖谷

Vibhu [00:02:56]:那些提示词,比如“30 岁”等设定,是你生成的吗?还是程序自动生成的?怎么运作

Anastasis [00:03:03]:没错。程序会自动生成这些内容。对,很多部分类似于“疯狂填词”游戏

Vibhu [00:03:10]:是的

Anastasis [00:03:10]:它拥有职业、

Vibhu [00:03:14]:爱好

Anastasis [00:03:15]:性格类型以及不同年龄段的列表等。然后程序会将这些元素随机组合。接下来我们聊到的下一个项目可能是《Uncanny Valley》(恐怖谷)或《Uncanny Road》(恐怖路),那是

Swyx [00:03:27]:基于 GAN 的?

Anastasis [00:03:27]: 这是我和联合创始人 Chris 早期构建的项目之一。我们基于 NVIDIA 在 2016 或 2017 年发布的 pix2pixHD 开发,那是早期的图生图模型。它能接收场景的语义地图,生成近乎照片级的输出。由于处于非常早期的阶段,输出保真度不高,但我认为它是首个能生成 1K 分辨率图像的模型。该模型完全在自动驾驶数据集上训练,支持的语义类别仅限于道路上的事物,如行人、交通标志,

Vibhu [00:04:16]: 红绿灯。

Anastasis [00:04:17]: 自行车、红绿灯。这是我们的首个征兆,表明人们会用它创作各种超现实图像,比如一百万个加一百万个行人、一百万个交通标志,或巨大的人类。这也预示了你可以将模型基于枯燥的数据集训练——毕竟道路上并不会发生什么有趣的事——然后重新利用它,使其大幅超出分布范围,创作出艺术上令人惊叹的作品。从某种程度上说,这正是 Runway 论点的缩影:使用相同的生成模型,若从不同视角审视,围绕它们构建有趣的工具并交给艺术家,他们就会做出你意想不到的事情。

Vibhu [00:05:02]: 很酷。我喜欢它的用户体验。你只是得到一个空白画布,想试什么就试什么,想做什么都行。另一个特点,像看到每个人都带着有线耳机?那是非常……

Anastasis [00:05:16]: 苹果的

Vibhu [00:05:17]: 是的

Anastasis [00:05:17]: 苹果,你的版本。

Vibhu [00:05:17]: 原始广告。是的。把我们带到当下。你在 Runway 已经七年了。我们是如何走到这一步的?从驾驶模拟数据到这一切是如何发生的?你们覆盖了生成媒体的整个技术栈吗?

从创意工具到研究机构

Anastasis [00:05:33]: 有意思的是,我们差不多又绕回了原点。现在我们不仅在把模型用于创意工具,还拓展到了真实世界的场景。但这中间经历了一个漫长的过程。很早期我们就发现,Runway 最初其实就是让大家能方便地使用当时那些开源模型,比如 pix2pix,并把它们交给艺术家。最初的想法就是这样:这些模型对非机器学习工程师来说太难用了,那如果交给艺术家会怎样?很快我们意识到,必须在 Runway 内部建立一个研究团队,这大概是第一年的事。当时的目标很明确:那个年代的图像生成、视频生成模型——其实视频生成几乎还不存在——远没有成熟到可以产品化、融入创意工作流工具的程度。所以我们得自己去推动研究前沿。Runway 最初四年,研究基本都是在幕后进行的,直到 2022 年,随着 latent diffusion 和 DALL-E 2 的出现,出现了质的跃迁,大家可能还记得那段时间。

Swyx [00:06:49]: 我就是因为 latent diffusion 和 Stable Diffusion 才进入这个领域的。

Anastasis [00:06:54]: 嗯。

Swyx [00:06:54]: 因为我当时就觉得:"哇,这不仅可行,而且在消费级硬件上就能跑。"

Anastasis [00:07:01]: 完全正确。

Vibhu [00:07:01]: 而且提升幅度特别大。我学过 pix2pix,那时候这是机器学习的入门内容,就是 TensorFlow、Jupyter、Google Colab 那种 notebook,然后突然就出现了 diffusion 带来的飞跃。从早期 diffusion 到现在的发展路径很清晰。那之后还有什么关键的技术研究突破吗?

绿幕、Rotomation 与早期 Runway

Anastasis [00:07:26]: 从我们 2018 年创立到 2022 年之间?

Vibhu [00:07:29]: 对。

Anastasis [00:07:29]: 我们早期做的重点工作之一就是解决分割问题,也就是图像和视频分割。这是个非常关键的问题,因为大部分 VFX 的核心本质上就是把画面分离出来——

Swyx [00:07:42]: Rotoscope

Anastasis [00:07:42]: 即逐帧抠图。没错,就是 Rotoscoping。这个过程极其手动,没人喜欢干。因此,Runway 早期主要就是在开发这款工具。它叫 Green Screen,很长一段时间内是人们使用 Runway 的主要用途。它甚至被用在了《瞬息全宇宙》等多部高知名度的电影和系列剧中。但本质上,Runway 长期都是一款后期制作工具,直到 latent diffusion 以及 Gen-1、Gen-2 的出现才改变了局面。

Swyx [00:08:12]: 不错。让我们跳过那个阶段。你们已经走了很远,随后开始发布自研模型。不妨也描述一下那段旅程。

扩展视频模型与对 1,000 块 A100 的押注

Anastasis [00:08:20]: 是的,我们回到另一个时间点。2022 年年中,大家意识到我们当时是在相对较小的算力规模下进行研究的,并且明确看到扩展定律同样适用于图像和视频生成,正如它应用于语言生成一样。于是我们做了一个大胆的决定。我想当时,作为一家处于 B 轮融资阶段的初创公司,我们签署了一份协议来构建一个由一千块 A100 组成的集群。这个决定在当时尚略显非理性,但我们坚信,如果大规模训练视频模型,最终会得到一个卓越的模型。当时,我们将目标设定在 2022 年秋季:对于视频领域,属于 Stable Diffusion 的“潜伏扩散”时刻究竟是什么样子的?彼时最好的模型叫 CogVideo,它是早期的视频模型之一,分辨率仅为 256x256,质量并不高。因此,我们决定搭建这个集群,投资构建自研视频模型。在训练 Gen-1 的过程中,我们发现很难一步到位。我们希望实现文生视频(text-to-video),但随即发现从视频到视频(video-to-video)是更简单的起点。因为更强的条件约束使得“为现有视频重新定风格”比“从零生成视频”容易得多。所以,我们先发布了 Gen-1,那是在 2023 年 1 月。没错。

Vibhu [00:10:04]: 说实话,这就是一档视觉播客。比如我们看 2023 年 2 月的资料,能回顾当时的技术状态。

Gen-1:视频转视频与深度条件控制

Anastasis [00:10:10]: 当时看那些结果真的很有意义。你会觉得这太不可思议了,好像图像或视频生成问题都快被解决了。但几年后回头看,你会发现自己对这些模型的结果适应得特别快。不过在那个刚看到效果的初期,确实觉得非常惊艳,尤其是能获得的质量水平。Gen-1 是一个基于深度条件的视频模型,它接收输入视频,先预测出深度图,然后利用潜扩散模型生成像素。

Swyx [00:11:01]: 对,效果非常显著。

Vibhu [00:11:02]: 是的。我没意识到看那个博客文章会让我这么分心。抱歉。

Anastasis [00:11:05]: 嗯,Gen-1 里让我印象最深的应用场景之一是故事板。当你使用 mode 3 或 mode 2 时,人们可以制作……

Vibhu [00:11:18]: 噢

Anastasis [00:11:18]: 他们……

Vibhu [00:11:20]: 你可以调整这些……

Anastasis [00:11:20]: 比如用书或者纸箱搭一座城市,用手机拍段视频,然后把它转成照片级写实的输出。这些模型在当时有很多这样的用法,比如用于分镜预览,还有另一种模式:把没有贴图的 3D 场景转换成照片级的画面。我们很早就看到不少这样的用例,一些熟悉 VFX 的资深剪辑师会直接拿 Blender 的渲染结果,用 Gen-1 转换处理;或者在 Unity 里搭一个场景,录一段视频再进行风格化转换。所以我至今仍然觉得 video-to-video 很有威力。我们最近也推出了一个 video-to-video 模型。这是我最喜欢的一种用法:把真实拍摄的视频当作初始素材,然后转换成不同的风格或不同的输出。

Stable Diffusion、Stability AI 与开源

Swyx [00:12:23]: 接下来我们聊聊 Runway 的其他经历,帮大家补补课。我想先谈谈所谓的 Stable Diffusion 争议,或者说 Stability AI 那件事的来龙去脉。这事有两面性,一部分是公司里人来人往的正常现象,但事隔几年,现在回头看你怎么评价?

Anastasis [00:12:49]: 嗯,这说来话长。

Swyx [00:12:53]: 我记得你还为此写过一篇很长的文章。

Anastasis [00:12:56]: 要细讲的话,估计能把这一小时都聊完。简单说,latent diffusion 论文是在 2021 年底发表的。论文作者之一 Patrick Esser 当时就在 Runway 工作,他是在 CompVis 那个实验室里,和 Robin Rumbach 以及其他几位合作者一起做出 latent diffusion 的。

Swyx [00:13:26]: 一个研究小组,对。

Anastasis [00:13:27]:发布早期的 latent diffusion model 之后,他们的目标基本上就是持续迭代模型,扩大规模,引入新数据和任务。Stable Diffusion 本质上是同一个模型,只是用了更多算力训练,并加入了一些技巧,比如后来出现的 classifier-free guidance 论文,我记得那是在 2022 年初。而这

Swyx [00:13:52]:嗯,那是一个巨大的 prompt 改进。

Anastasis [00:13:55]:是的。

Swyx [00:13:55]:?

Anastasis [00:13:56]:它提升了结果。它使用了更好的数据进行训练,比如 LAION 中更美观的子集,但底层架构其实没有变。当时在 Stability 的集群上进行了一次大规模的训练运行,Stability 为这次运行提供了资金。回顾这段历史,我认为构建和训练该模型的工作已经完成。这是一个研究项目,也是 latent diffusion 工作的延续。我想,这个模型随后取得了巨大成功。由于这种成功,其他公司试图探索其商业化路径。但对我们来说,非常重要的一点是,我们必须确保……它被设计为一个开源研究项目,因此我们决定继续发布新版本,因为这是 Stable Diffusion 最初的目标,这也导致了 Stable Diffusion 1.5 的发布。中间可能有一天左右的小误会,但最终在几小时内就迅速解决了。所以是的,那里

Swyx [00:15:12]:好吧

Anastasis [00:15:12]:不是特别愉快

Swyx [00:15:13]:我只是想说……你必须

Anastasis [00:15:15]:是的。

Swyx [00:15:15]:你是这段旅程中的主要参与者之一,所以听到第一手的事后真相真的很有价值。是的。

Anastasis [00:15:22]:是的。我觉得那都已经是过去的事了

Swyx [00:15:26]:是的

Anastasis [00:15:26]:我可以这么说。两家公司的走向不同,Stability 走了一条路,Runway 走了另一条路。

Swyx [00:15:32]: 没错。还有一点是,詹姆斯·卡梅隆正支持新的 Stability 团队,无论他们现在跟好莱坞制片厂在搞什么。

Anastasis [00:15:38]: 对。

Swyx [00:15:38]: 我不太确定他们在做什么。有一件事让我印象深刻,虽然我很乐意继续往下聊,但回到那个时期,比如 2021 年、2022 年,当时有一群你参与其中的研究者在探索这些技术,对吧?根据我后来和当时活跃的那些人交谈的情况来看,似乎大家心里都隐约觉得,迟早会有人完成那种“英雄式”的训练跑通,从而产出 Stable Diffusion。所以,我想问的是,当时你确实做出了投资,展现了远见。可以说,这反映了当时人们的普遍想法吗?还是说,大家当时更多的心态其实是“嗯,这东西大概只能用作后期制作工具之类的吧,我也不太确定”?换句话说,能不能回忆一下,当时社区里的情绪大概处于什么阶段?

早期的创意 AI 社区

Anastasis [00:16:28]: 我充满怀念之情,特别是 2018 年到 2022 年这最早的那几年。那是一个规模极小的圈子,正如你所说,圈子里的人都坚信这会成为一件大事。当时因为圈子很小,任何人只要在这个圈子里做出相关项目,就能迅速走红。所以说,

Swyx [00:16:55]: 那时候你甚至不知道他们是谁,对吧?他们只是 GitHub 或 Hugging Face 上的某个名字。

Anastasis [00:16:59]: 完全正确。我记得创意 AI 最早的出圈时刻之一,是那篇关于神经风格迁移(neural style transfer)的论文

Swyx [00:17:09]: 嗯?

Anastasis [00:17:09]: 它

Swyx [00:17:10]: 是那个叫“梦境”的东西吗?

Anastasis [00:17:11]: 我觉得就叫神经风格迁移。

Swyx [00:17:14]: 好的。

Anastasis [00:17:14]: 还有 Deep Dream,那个把小狗切片图搞出迷幻效果的案例

Swyx [00:17:16]: 有印象。

Anastasis [00:17:16]: 那个项目也很酷。Jim Kogan 是 Runway 的早期顾问之一,也是那种……

Swyx [00:17:25]: 做营销的。

Anastasis [00:17:26]: 对,创意 AI 圈子里的大人物。他就拍了一段自己坐纽约地铁、经过 Williamsburg 大桥的视频,然后用梵高还是哪位画家的风格做了风格化处理。在当时,这实在太震撼了,直接火遍全网。人们第一次意识到,生成式模型居然能做到这种事。而那不过是大约十年前的事,可见这一切发展得多快。

Vibhu [00:18:02]: 确实疯狂。从那以后,技术栈的每个层面都有人在用——开发者、创意人员、艺术家、爱好者,全都在用。早期尝试过的人应该记得,用原版 diffusion 是多难的事。现在你随便用个 ChatGPT 图像生成之类的工具,一句话就能得到漂亮的输出。但当年的 diffusion 满屏都是 ultra HD、4K、高分辨率这种参数,prompt 的写法完全不同。你们在工具层面的积累——从现在的产品就能看出来——确实把前沿研究带给了所有人使用。这方面有什么有趣的经历可以分享吗?

从 Gen-2 到可控视频生成

Anastasis [00:18:44]: 我们得从零搭建视频扩散模型的整套模型服务基础设施,因为当时市面上没有任何现成的东西——Gen-2 应该是最早推向市场的文生视频模型。这一路学到了很多东西。我觉得最重要的一点是:很早我们就清楚地意识到,纯文本生成视频并不是答案。用户想要的可控性远不止于此,所以我们很快就在模型之上投入控制能力的建设:怎么用相机轨迹做控制?怎么用初始输入帧做控制?这是我们很早的一个教训。Gen-2 作为文生视频模型,在视频质量上是跨时代的提升,但大家更多是拿它做探索性尝试,因为没有可以锚定的东西——没法引入参考素材,没法真正控制相机运动,也没法控制物体运动。所以 2023 年的第一年,我们基本都在研究有哪些有趣的方式可以给这些模型加条件,在基座模型上做了大量 post-training 迭代,就是想搞清楚大家到底想怎么控制它们。于是很快推出了一系列功能,比如 Motion Brush——你可以画箭头,指定场景中的物体往哪个方向移动。

Vibhu [00:20:09]: 太酷了。

Anastasis [00:20:09]: 还有 camera control,可以直接描述你想让相机在场景中怎么移动。因为 Runway 的大部分历史里我们一直和电影制作人合作,所以我们很快就收到了这类反馈,并决定这值得投入。可控性很早就成了我们构建这些模型时的一大主题。还有件有意思的事,我之前没怎么聊过,就是 Gen-2 是怎么从 Gen-1 里诞生的。这事其实有点奇怪,因为我们在 Gen-1 发布两个月后就宣布了 Gen-2,而且——

Gen-2 是怎么从一个周末 Hack 里诞生的

Vibhu [00:20:43]: 我们在加速推进。

Anastasis [00:20:44]: 那时候 Gen-1 甚至还没正式开放。Gen-1 是一个 depth-to-video 模型,输入深度图,输出 RGB。当时 text-to-video 和 image-to-video 都做不通,所以我们才从深度图入手。我们讨论过,要不要接下来六个月投入 text-to-video,扩一扩算力或模型规模,训练个更大的模型。后来我有个周末项目式的想法:能不能先拿一个从文本生成深度图的模型,再用 Gen-1 把深度图转成 RGB?

Vibhu [00:21:29]: 那估计能行。

Anastasis [00:21:30]: Gen-2 就是这么来的。

Vibhu [00:21:32]: 哦,原来是个 hackathon 流水线。

Swyx [00:21:35]: 周末 hackathon 拼出来的流水线。

Anastasis [00:21:36]: 对。

Vibhu [00:21:37]: 但效果看着不错。

Anastasis [00:21:38]: 确实效果挺好。如果你知道它是这种两段式流水线,有些情况下能看出视频结构有点不对劲,因为得先生成深度图才能出最终视频。但它确实能用,让我们很快就把产品交付给了用户。有意思的是,现在大家又在回归这种近乎两段式的思路。比如几个月前发布的 Reve text-to-image 模型,就有一个 planner 模型先生成 bounding box,再喂给 diffusion transformer。

Swyx [00:22:19]: 对,Ideogram 同一天也发布了,用的同样的思路。

Anastasis [00:22:22]: 嗯。

Swyx [00:22:22]: 我记得当时觉得很奇怪,两家同一天发布,创新点还一模一样。

Anastasis [00:22:26]: 圈子很小嘛。

Swyx [00:22:28]: 我当时还在想,这完全是巧合吧?

Anastasis [00:22:32]: 大家平时都交流的。所以这个思路确实有它的价值。现在每一个上线运行的视频生成模型,底层都在用一个复杂的 prompt 补全流水线,这已经不是什么秘密了。

Swyx [00:22:48]:人类在编写提示词方面普遍表现得很糟糕。

提示词重写、镜头控制与世界模型的萌芽

Vibhu [00:22:51]:我觉得这是普遍现象。

Anastasis [00:22:51]:没错。

Vibhu [00:22:52]:对,我认为 Sora 最初那篇博文就已经指出,处理你的输入后,系统实际上是在重写你的提示词,使其描述得更为详尽,以贴合你的预期。

Anastasis [00:23:02]:正是如此。在此之前,DALL-E 3 的论文就已经首次公开揭示了合成字幕和极其详细的字幕效果非常好,Sora 则在此基础上进一步发展。是的,那是在 2023 年。当时我们正在发布 Gen-2 的诸多更新,比如镜头控制和 Motion Brush(动态笔刷)。镜头控制有一件特别有意思的事:那是我第一次感觉到,我们不再是“制作”一段短视频,而是在“探索”这个世界内部。我认为镜头控制可能是世界模型相关理念的一个种子,也真正开启了这一研究方向。我们意识到,Gen-1 和 Gen-2 模型的这一系列进展向我们证明了,这正是……

Swyx [00:23:56]:很有意思。

Anastasis [00:23:57]: 所以这不是最初的 camera control,而是在 Gen-3 基础上更新的版本。不过我认为正是它让这些模型真正可以被电影人使用,camera control 当时非常受欢迎。我们由此意识到,看待这些模型有两种方式:一种是把它们仅仅当作内容生成机器;另一种是,模型为了把视频预测好,就必须以越来越强的能力去模拟世界。如果 scaling laws 在视频上成立,就像在语言模型上一样,那么随着投入的算力增加,这些模型就能模拟物理规律、模拟人类行为和动态,而且效果会越来越好、越来越可预测。这就是我们做世界模型工作的核心论点。为此我们专门成立了一个研究小组,专注于世界模型,思考如何把我们正在构建的视频生成模型拓展成更宏大的东西,让它的用途超越内容创作。

Swyx [00:25:04]: 那大概是什么时候?

Anastasis [00:25:06]: 嗯,那是

Swyx [00:25:06]: 哦

Anastasis [00:25:07]: 2023 年底。

Vibhu [00:25:08]: 有意思。现在很多视频生成模型公司都纷纷转型做世界模型,但你们 2023 年就已经在布局了。

世界模型:从视频生成到模拟

Swyx [00:25:21]: 说转型其实有争议。

Vibhu [00:25:23]: 是啊。

Swyx [00:25:23]: 比如说

Vibhu [00:25:24]: 嗯

Swyx [00:25:24]: 这本来就是你们迟早要走的方向,对吧?

Anastasis [00:25:26]: 某种程度上这是应用范围的拓展

Vibhu [00:25:28]: 嗯

Anastasis [00:25:28]: 模型能力变强之后

Vibhu [00:25:29]: 是

Anastasis [00:25:29]: 能做的事情自然就更多了。

Vibhu [00:25:31]: 从早期迹象看,你们最初的模型常被人说很不符合 bitter lesson 的路线,对吧?加各种提示词、重写 prompt,还有一堆一次性的 hack——但那只是当时技术水平的局限,而不是未来。就像你说的,这套东西是可以规模化到世界模型的。

Anastasis [00:25:50]: 对,就是这么一路走过来的。如果你看过 Gen-2 的输出——

Vibhu [00:25:56]: 嗯。

Anastasis [00:25:56]: 当时确实很难让人相信它能扩展成一个通用的世界模拟器。移动能力很有限,保真度和分辨率都很低,人体解剖结构错误百出,各种局限。但我们的想法是:这就是 GPT-2 时刻——GPT-2 那时候连通顺的句子都勉强生成,Gen-2 也只是勉强能生成连贯的视频,但只要规模化上去,没有理由不成立。这就是 Runway 一直以来的思维方式:做外推。哪怕 2018 年我们刚起步时,看当时的结果你也不能只看眼前,而要看趋势——从 2014、2015 年第一代 GAN 问世算起,一开始只能生成 32×32 的人脸图像,到 2018 年已经能以 1K 分辨率生成街景了。世界模型也是一样,这些早期迹象背后是远比现在更大的东西。

Swyx [00:27:08]: 对,我正想说,这就像是在通过 diffusion 逐渐聚焦——你逐年看可见的输出,整个过程本身就像一个 diffusion 过程。

Anastasis [00:27:17]: 没错。

Vibhu [00:27:17]: 尤其是翻那些早期的旧博客,真的能看出画面的卡顿和细节上的粗糙。

Anastasis [00:27:24]: 是啊,就像人类文明从随机噪声开始,然后——

Vibhu [00:27:27]: 嗯。

Anastasis [00:27:27]: 一点点去噪。

Swyx [00:27:28]: 对,让它再跑个一百年。

Anastasis [00:27:30]: 就跑出文明了。

Swyx [00:27:30]: 哈哈。

Vibhu [00:27:31]: 这说明你走对了路,还在不断加噪,对吧?

Swyx [00:27:34]: 对。我很喜欢你们六月份发布时的说法——你们配了一个视频解说:「人类心智不再是 AI 的中心,我们的世界才是。」过去五年基于 LLM 的 AI,基本上是在模仿人类偏好和人类语言,但现在这部分问题大体上已经解决了。我觉得这就是你那篇文章的背景——你也是差不多同期写的。而现在,重心已经转向如何精确地对世界建模。

视频的 Scaling Laws,以及为什么预测像素很重要

Anastasis [00:28:03]: 没错。我们的看法是,DeepMind 的初始使命宣言是「先解决智能,再用它解决其他一切问题」。但我认为,从「其他一切问题」入手,同样有价值。世界的复杂度和细节实在太丰富了,仅靠人类对世界的文字描述来学习是很困难的。语言模型本质上是基于人类写下的一切来学习,也就是我们截至 2020 年代的认知——但我们不知道的东西太多了,现有文本没有涵盖的东西也太多了,包括世界的底层动力学。比如说,让你描述「怎么系鞋带」,用语言描述会非常困难,但动手演示却一目了然。这就是莫拉维克悖论(Moravec's paradox)的更多体现:我们总是低估那些人类下意识就能完成的事情背后的复杂度,甚至常常找不到合适的词语来描述它们。所以在我看来,模拟世界、模拟物理、模拟世界的动力学,一直被低估了;我们把太多重心放在了容易谈论的东西上。但世界本身就充满复杂性和丰富性——如果我们直接在这些观测数据上训练,而不是在「人们如何描述世界」上训练,就能学到一些原本学不到的新东西。

Swyx [00:29:54]: 你觉得现有的架构范式就够了?不需要再加一层什么,比如 JEPA?某位很有名的纽约 AI 领袖不就主张这个吗?

Anastasis [00:30:05]: 我们是一个非常务实的研究实验室。只要发现有证据表明某种方法比我们现在的好,我们毫不犹豫就会采用。但我们至今没看到任何迹象表明视频预测这条路无法扩展。你看现在,不只是我们,别人在机器人领域最有前景的一些工作,也都是从视频预测模型出发,再把它改造成带动作输出的模型。所以几乎没有证据表明需要别的东西,也没有证据表明把时间花在发明新架构上比改进数据、把现有方法规模化更值得。至于那个反方论点——我记得 Yann LeCun 前几天还发推说,理解世界的动态和生成可爱视频完全是两回事。

Swyx [00:31:05]: 而你的回答是:不,它们是一回事。

Anastasis [00:31:07]: 对,就是一回事。

Swyx [00:31:08]: 我看猫视频就等于在学物理。

Anastasis [00:31:11]: 对,因为如果你想生成视频,模型是可以“作弊”的——比如给出场景的一系列不同镜头,这样就不用去模拟那些困难的物理过程。模型有很多种方式可以掩盖自己的不足,所以很重要的一点是别被当前视频模型的表现过度迷惑。挑几个好例子太容易了,很容易让人觉得视频模型比实际水平更先进。所以在改进这些模型上,我们还有很多工作要做。但在我看来,这和语言模型的发展非常相似:从勉强能拼出通顺的句子,到能和人对话,再到能自主运行一整天、写出完整的代码库。这中间虽然有一些架构上的改进,但关键还是规模。视频模型也是同样的押注,而且我们没有任何迹象表明它已经到达饱和。我们有专门衡量模型物理能力的基准测试,随着模型规模扩大,这些指标在可预期地提升。如果你想去 Google 一下,Physics-IQ 就是其中一个基准,用来衡量模型在固体力学、流体动力学或光学方面的表现。

Vibhu [00:32:32]: 我很好奇,你有没有观察到什么涌现现象,或者说这个领域的 scaling law?

Swyx [00:32:37]: 对,他刚才就是在说存在 scaling law,对吧?

Anastasis [00:32:39]: 没错。

Vibhu [00:32:40]: 是啊,

Anastasis [00:32:40]: 这些模型和基准测试的工作方式是:研究者们先拍摄了一些能代表不同物理现象的视频,然后取视频的第一帧,输入 image-to-video 模型,让它生成后续的画面。比如你有一个挂在天花板上的球,把它作为输入,模型要预测球落地时会怎样。这衡量的其实是我们人类对物理的直觉理解——你知道如果我松手,这个瓶子会发生什么。所以它测的就是模型有没有同样的直觉物理理解。我们在不同模型规模和算力规模下都测过这个指标,发现 Physics IQ 的得分会随规模扩大而可预测地提升。当然还有一些别的技巧和手段能进一步提升分数,但光是扩大规模本身,就足以让模型学到更好的物理规律。

Swyx [00:33:40]: 我最认同 Yann LeCun 的地方,就是柏拉图洞穴那个比喻。你是从某个系统的输出中学习,而不是它的内部过程,而且这些输出噪声很大。要是能观察系统的内部就好了。人类的心智内部很难观察,但物理规律、运动、重力、各种相互作用——我们明明有一整套现成的物理学可以用来建模,却把它全扔掉了,只说“堆数据、扩大规模就行”。这确实是无监督学习一贯的经验教训,但总觉得不对劲。这就是我想表达的核心观点。

Anastasis [00:34:21]: 纵观机器学习的历史,觉得“不对劲”往往恰恰是常态。

Swyx [00:34:25]: 对,这就是所谓的“苦涩的教训”嘛。答案往往就是这么简单粗暴。

Vibhu [00:34:29]: 我想知道,这个能扩展到什么程度?就拿视频生成来说,视频理解是一回事,视频生成这边,我们以后还能不能有工具支持生成两小时、二十小时的内容?技术上可以用基础设施分批生成再拼接起来,但我们就是一路加大规模就行吗?长视频生成的一致性这些能不能一直规模化下去?再联系我们现在的位置,从 Runway 2 一路看到 4.5。

Gen-3、Sora 与 Runway 的扩展拐点

Anastasis [00:34:58]: 嗯。

Vibhu [00:34:58]: 从技术上说,到今天我们取得了哪些进展?你觉得接下来还会往哪走?

Anastasis [00:35:04]: 一部分答案肯定是规模。这一点我们在 Gen-3 上深刻领教过。Gen-3 是我们第二年、也就是 2024 年发布的模型,在 Sora 发布几个月之后。这背后还有段有意思的故事。做 Gen-3 时,我们第一次真正需要在几个月内补完语言模型领域花了两三年才学到的所有教训。Sora 最大的改变之一,就是用 diffusion transformer 替代了 convnet——早期的 latent diffusion 模型,扩散模型那部分用的都是 convnet。2023 年 diffusion transformer 论文出来,展示了图像 diffusion transformer 的 scaling laws。我们当时就意识到,必须投资模型并行的基础设施,才能把训练规模扩展到几十亿参数以上。于是 2023 年秋天,我们大部分时间都在搭建分布式训练的基础设施。在这个过程中,我们尝试扩展图像和视频 diffusion transformer 时走了不少弯路,经历了很多失败。然后 2024 年 2 月,Sora 发布了,效果

Anastasis [00:36:35]: 远超 Gen-2 的水平。Twitter 上顿时一片热议,都说 Runway 完了,Runway 根本追不上。而且你可能还记得,那时候 OpenAI 在 2020 年代初的表现,感觉真的就像——

Swyx [00:36:56]: 要一飞冲天了。

Anastasis [00:36:57]: 现在它是个强劲的对手,但那时候,OpenAI 正处于巅峰状态,没人能望其项背。当时 Gemini 刚发布第一版。所以 Sora 出来的时候,质量提升特别大,让我经历了几个小时的存在主义危机。但我觉得 Runway 的厉害之处在于——我们已经成立了八年,在 AI 行业几乎是恐龙级别的老公司了——我们经历过很多这样的时刻,不得不快速学习、适应,补齐团队原本不具备的技能。如果你问在那段时期待过的人,Runway 最难忘的时刻是什么,那一定是那三个月里拼尽全力打造一个超越 Sora 的模型。我们把模型规模和训练算力扩大了 10 倍,还搞定了模型并行——在那之前我们在这方面毫无经验。那年夏天我们推出了 Gen-3。我觉得那是公司的一个重要转折点:研究团队迅速扩张,Gen-3 发布之后,我们才真正开始认真追求通用世界模型的愿景。

Swyx [00:38:12]: 是啊,这就是从零开始构建的特别之处——没有现成的技术栈可依赖,一切都得自己发明,必须做到完全的全栈。现在有 Fal 这样的推理服务商可以帮你做模型服务,你们应该也和他们有合作。但那时候什么都没有。想象一下 Sora 发布时,大家都在质疑你们公司还有没有存在的必要,那个时候你会怎么做,这确实很有意思。

蒸馏、Turbo 模型与实时视频

Anastasis [00:38:41]: 是的,而且当时没有扩散模型的 VLM 可参考。我们只能自己搭建整套模型服务基础设施,并把效率做上去。Gen-3 发布几个月后,我们推出了 Turbo 版本,我觉得那应该是首个投入生产环境的单步蒸馏模型。

Swyx [00:38:56]: 那后来成了我们报道过的一大趋势。是啊。

Anastasis [00:38:59]: 这样我们就能以更大的规模来服务这些模型了,因为第一版 Gen-3 的服务成本还挺高的。

原始来源: Latent Space

评论 (0)