← 文章 / AI视频与短剧
Google Research 博客 6小时前 · 2026-09-25 16:28:44 · 2 阅读

自动化生成长篇连贯AI视频:多智能体联合导演框架

视频扩散模型的最新进展表明,这些模型已经能在几秒内渲染出高保真的逼真场景。然而,尽管扩散模型可以生成高质量的视频片段,要把它们变成连贯的长篇叙事引擎,仍然是一个难题。

现有的 agentic 流水线大多通过串联多个模块来自动化这一过程,但由于各环节独立、提示词依赖手工编写,容易出现语义漂移(角色服装或场景在镜头之间发生细微变化)和级联失败(例如上游素材的瑕疵污染下游视频合成)。早期错误会不断传播、破坏长程一致性,因此往往需要大量人工干预。从结构上看,这正是经典的信用分配问题:最终的失败很难追溯到具体某条提示词。此外,现有方法还面临特征漂移——实体和环境在无意中逐渐变化——以及内容塌缩——叙事无法有效推进。

今天,我们发布 AI 视频联合导演的研究成果:一个统一的多智能体框架,能在多镜头叙事中显式规划视觉连续性。该框架构建在 Gemini 和 Veo 之上的编排层,天然继承了 SynthID 水印等安全机制。通过把长视频生成建模为全局优化和世界状态追踪问题,我们开发了一系列框架——Co-Director(将发表于 COLM 2026)、CANVAS(将发表于 EMNLP 2026)、A²RD 和 VQQA——把人类的高层创作意图转化为实际执行,自动完成从多模型提示、镜头串联到闭环视觉精修等重复性编排任务。

我们设计这些框架,是为了让它们成为灵活响应的创作伙伴,把维持视觉连贯性的繁重工作抽象出来,让用户可以专注于讲故事本身。这套架构通过将质量建模为测试时目标,把创作生成与一致性维护解耦开来。在全面评估中,我们的框架在多镜头叙事一致性和角色持续性方面取得了显著提升,能够生成长达数分钟的视频,同时有效抑制视觉漂移和管线中的误差累积。

工作原理

为了攻克长视频生成这一多维度难题,我们将研究拆解为四大支柱,分别解决生成管线中的具体瓶颈。

1. 用 AI 视频联合导演统筹创作意图

为了保证整段视频的语义连贯性,我们提出了 AI video co-director,这是一个分层多智能体框架,将视频叙事形式化为全局优化问题。我们不再依赖僵化的线性提示链,而是引入分层参数化:由 multi-armed bandit(MAB)在全局层面识别有前景的创作方向。

这将创作过程形式化为在探索新叙事策略与利用有效创作配置之间寻找最优平衡的搜索问题。系统会采样抽象的创作轨迹——比如将信息型策略与小品式叙事模式、某种特定美学原型组合起来——并动态注入子智能体的系统提示词中。这种自上而下的引导确保整条管线在统一的创作愿景下运行。由于 AI video co-director 框架作为编排层运作,它通过将这些结构化提示词直接输入底层的 Gemini 和 Veo 模型来实现这一愿景(其模型无关的架构也允许它叠加在任何基础生成模型之上)。这一架构确保所有生成的图像、视频和音频天然带有原生安全保护,包括 SynthID 水印。在生产环境中,还可以对最终视频额外应用安全分类器,防范单独合规的片段在组合后产生的意外情境交互。

整个流程通过两个相互衔接的循环执行全局优化:战略调度和多阶段制作。首先,Orchestrator Agent 使用 MAB 算法评估输入,从三个维度选定创作配置:(1) 创作策略(意图)、(2) 叙事模式(故事结构)和 (3) 美学原型(视觉基调与镜头语言)。该配置驱动整个制作层级:Pre-Production Agent 将简报、逐场景剧情线和视觉素材整合为统一的分镜脚本;随后 Production Agent 借助专门的子 Agent 把分镜转化为具体的视听内容——Keyframe Agent 固定角色和场景的视觉形象,Video Agent 添加动态效果,Audio Agent 配上相应的旁白和配乐。 最后,一个多模态 LLM(MLLM)Judge 会依据上述三个维度对成片进行评审,并将分解后的奖励信号回馈给 MAB,在后续多轮生成循环中持续迭代、优化各项选择。 AI 视频联合导演流程图,包含 Orchestrator、Pre-Production、Production 和 Post-production 等智能体。 AI 视频联合导演的多 Agent 流程。上半部分:Orchestrator Agent 利用 MAB 在分解后的创作动作空间中探索;下半部分:Pre-Production Agent 整合创作简报、剧情线和视觉素材,生成风格一致的分镜脚本,再由 Production Agent 转化为同步的关键帧、视频片段和音频。MLLM Judge 对最终视频进行评估,生成分解的奖励信号并回传给 MAB,在多轮优化循环中迭代完善创作配置。

2. 基于 CANVAS 的视觉分镜

即便有了统一剧本,生成长序列镜头时仍常出现角色形象漂移和场景不稳定的问题。为此,我们提出了 Continuity-Aware Narratives via Visual Agentic Storyboarding(CANVAS),一个能在多镜头叙事中显式规划视觉连贯性的多 Agent 框架。

CANVAS 通过在剧情推进过程中为角色、场景和物体状态维护结构化表示来保证连贯性。它构建为 Gemini 之上的一个编排层,依赖持久化的视觉记忆。通过从记忆中检索视觉锚点,或在必要时初始化新的锚点,CANVAS 确保同一场景内的过渡自然流畅。这种显式的世界状态建模,保证了角色在再次出场时保持身份一致,环境在重现时保留空间结构。

下方的图展示了一个多镜头的博物馆盗窃序列,将 CANVAS 与代表性基线进行对比:包括直接使用底层基础模型(Gemini-3.1-Pro)生成,以及另一个多智能体框架(AutoStudio)。图底部的提示词标出了需要保持视觉特征一致的重现元素,如小偷、展厅和宝石。可以观察各方法如何处理相邻镜头的过渡(如角色服装),以及非相邻镜头的过渡(如镜头绕开后又回到主厅)。单独使用 Gemini-3.1-Pro 生成会出现道具不一致(文物发生变化)和背景漂移(房间布局改变),体现了无引导生成的局限。AutoStudio 在镜头切换后同样会退化,表现为角色漂移(小偷的帽子消失)和背景不一致。相比之下,CANVAS 的持久化视觉记忆确保角色、空间几何和物体状态在整个叙事中保持完全一致。

对比 AutoStudio、Gemini 和 Canvas 在博物馆盗窃场景上视频生成一致性的分镜图。

在 HardContinuityBench 的博物馆盗窃序列上,CANVAS 与 AutoStudio、Gemini-3.1-Pro 基线的视觉分镜对比。

3. 用 A²RD 扩展时序动态

为了将分镜脚本转化为实际的长达数分钟的视频,我们开发了 A²RD——一种智能体式自回归视频生成架构。A²RD 的特点是逐段生成,并配备多模态视频记忆来跟踪各段的上下文与动态变化。

对每个视频段,系统都会执行"检索—合成—精修—更新"的循环。这个循环中的关键环节,是智能体如何自适应地决定该段的生成模式:它可以在外推与内插之间平滑切换——外推让叙事自然推进,内插则将新片段锚定在已有的实体和环境上。这样就在"故事向前发展"与"保持场景物理真实感"之间取得了平衡。

为了测试这套系统,我们制作了下面这部十分钟的电影,展示跨越数分钟时间间隔的长时生成,它要求叙事在长时间跨度上保持连贯。影片展示了系统如何在两种运行模式之间动态切换:用外推把剧情推向新的叙事节点,用内插把回归的角色和环境锚定在原有设计上。标准视频生成器往往会出现严重的视觉退化——角色变形、场景走样——而 A²RD 则持续查询其多模态视频记忆,从开场镜头到最后一帧都保持角色身份、服装细节和建筑几何结构的一致。

观看影片

Youtube 视频链接

这段长时视频展示了 A²RD 在连续十分钟内保持严格视觉一致性与叙事推进的能力。

4. 基于 VQQA 的闭环精修

最后,我们还需要让系统能够自主发现并修复视觉瑕疵。现有的测试时优化方法要么计算开销巨大,要么需要白盒访问模型内部。为此,我们开发了 Video Quality Question Answering(VQQA)——一个统一的多智能体框架,可泛化应用于多种输入模态和视频生成任务。

VQQA 会针对具体提示词动态生成视觉问题,并将 Vision-Language Model(VLM)给出的评价用作语义梯度——即以自然语言提供方向性反馈,引导迭代优化,作用类似于反向传播中的数值梯度。这用人类可读、可执行的自然语言反馈,取代了传统被动的评估指标。系统由此能通过自然语言接口执行高效的迭代反馈循环:模型生成视频,用视觉问题对其评估,再依据评价结果优化文本提示词。为防止优化过程中出现语义漂移,VQQA 采用了一种 Global Selection 机制:并非盲目采用最后一次迭代的输出,而是由一个全局 VLM 评分器对照最初未经修改的提示词,对整条优化路径上生成的每个视频逐一评分,然后选出得分最高的候选结果,确保局部修正不会损害整体语义。 在实践中,VQQA 是一个黑盒提示词优化器,而非像素级编辑器。它不直接修改像素,而是通过迭代优化文本提示词,来纠正属性绑定错误、角色属性不一致等高层次的构图缺陷。更新后的提示词会引导生成器在其潜空间中采样出一条新的路径。在下方的示例中,VQQA 既没有遮盖也没有涂抹原始画面,而是通过在严格的立方体几何结构上渲染出逼真的迈拉气球材质,解决了模型的材质绑定难题;并通过让小提琴手和钢琴手在镜头切换中始终与各自的乐器保持对应,修复了演出中途混乱的乐器更换问题。 播放静音循环视频 暂停静音循环视频 取消视频静音 视频静音

解决属性绑定错误。提示词:"一只长方体气球飘过一个圆形窗户,阳光透过玻璃窗洒入。"原始生成结果(左)未能体现气球的特性,渲染出一个僵硬、无纹理的立方体;而 VQQA(右)成功约束出预期的长方体形状,同时保留了充气气球的纹理和材质。借助迭代式视觉反馈,优化后的提示词引导生成器渲染出一个边缘和接缝清晰、箱型的铝箔气球,平稳地飘过洒满阳光的窗户。

播放静音循环视频 暂停静音循环视频 取消视频静音 视频静音

解决时间一致性问题。提示词:"小提琴手与钢琴家上演一场和谐动人的二重奏。"原始生成结果(左)在镜头切换时出现严重的连贯性断裂:开头是一位女钢琴家和一位男小提琴手,镜头一切换,拉小提琴的却突然变成了那位女性。VQQA(右)在整个演奏过程中保持严格的语义一致性,让女钢琴家和男小提琴手始终与各自的乐器对应。

关键成果与基准测试

为了严格评估我们的框架,我们开发了三个专门的基准测试,用于还原专业视频制作中的真实挑战。

  1. GenAD-Bench:采用人机协同流程,将 Gemini 3 Pro 与专用图像模型结合,构建了 50 个虚构品牌,每个品牌包含四款不同的产品。该基准在 400 个独特场景中测试精确的营销约束,不依赖版权冲突或训练先验。
  2. HardContinuityBench:专为评估空间和环境连续性而设计。该基准通过复杂的 GPT-5.2 多镜头叙事分镜生成,考验模型应对场景间隔大量镜头才重现、演员频繁更换服装和配饰,以及交互道具状态复杂变化等挑战的能力。
  3. LVBench-C:针对长时间跨度的时序动态。该数据集包含 120 个纯文本场景,分为三类:角色状态演变、物体属性变化和环境渐进揭示,并设有严格的间隔规则——关键视觉元素必须至少消失 10 个片段后才能重新出现,且重现身后的变化需符合叙事逻辑。

评估结果显示,这些框架相比现有视频生成架构都有可量化的性能提升。通过在创意策略搜索空间中进行导航,AI video co-director 在 GenAD-Bench 上取得了 81.4 的最高质量分数,并在 ViStoryBench 上表现出更强的故事一致性。CANVAS 利用结构化视觉记忆来抑制场景漂移,在 ST-Bench 和 HardContinuityBench 的场景重现测试中带来了显著的连贯性提升。针对长时序动态,A²RD 将布局漂移降至最低,在 VBench-Long 和 LVBench-C 的连续多分钟运行中提升了角色与环境的一致性。最后,VQQA 的闭环提示词优化解决了物理与构图方面的不一致问题,在 T2V-CompBench、VBench2 和 VBench-I2V 上均取得了明显的绝对质量提升。关于模型架构、训练配置和基线评估的完整细节,请参阅各篇论文。

一个数据表格,对比了四个 AI 视频生成框架——AI video co-director、CANVAS、A²RD 和 VQQA——的评估基准、关键性能指标以及相对基线的提升幅度。

未来方向

这些框架为创作者实现连贯的长时程视觉叙事迈出了基础性的一步。随着我们持续完善这些 agentic 架构,也在探索如何融入 human-in-the-loop 工作流。我们的最终目标不是取代人类的叙事创作,而是帮助创作者卸下时间一致性和世界状态追踪这类繁琐复杂的工作,让创作方向和叙事设计始终掌握在他们自己手中。

致谢

这项工作离不开 Google 各研究团队的辛勤付出。感谢 Andrew Pan、Brett Slatkin、Burak Gokturk、Carina Claassen、Daniel Vlasic、Do Xuan Long、Ishani Mondal、Jasmine Leon、Jingyun Liu、Joe Timmons、Jordan Boyd-Graber、Khanh G. LeViet、Kuang Su、Long T Le、Mihir Parmar、Min-Yen Kan、Nathan Hodson、Nick Losier、Palash Goyal、Rhyard Zhu、Sebastian Ko、Scott Penberthy、Yan Xu、Yang Li、Ye Jin、Zack Chomyn 和 Tomas Pfister 为这项研究做出的宝贵贡献。

原始来源: Google Research 博客

评论 (0)