← 文章 / AI视频与短剧
DeepMind 博客 7小时前 · 2026-08-29 07:10:58 · 1 阅读

Gemini Omni 1.1 Flash 上线:让开发者更可控地进行构建

今天,我们推出 Gemini Omni 1.1 Flash,为开发者带来一套全新的创作控制功能和生成式视频能力。Gemini Omni 将现实世界推理能力引入生成式创作,而此次更新则让 Omni 1.1 通过 Google AI Studio 中的 Gemini API 达到可用于生产环境的水准。

无论你是在构建生成式视频工作流、创意工具还是媒体编辑软件,这些更新都能让生成式视频更易于控制、更快迭代,也更适合实际部署。以下是本次更新的主要内容:

延长场景,讲述更长故事

场景延展功能可以基于现有视频无缝续写,从上一个片段结束的位置继续生成画面。

在 Omni 1.1 中,模型现在最多可以分析此前 10 秒的内容,相比只能参考最后 1 秒的旧模型有了显著提升。这样不仅能增强画面的一致性和叙事连贯性,还能帮助你讲述更长的故事,或拓展出全新的创作方向。视频每次可延长 10 秒,累计时长最长可达 40 秒。

提示词 1:镜头缓缓向一侧摇移,这时我们看到她正在和一个卷发男人交谈。画面中能看到男人的背影,他说:“我也看到了。”配上戏剧性的配乐。

提示词 2:镜头缓缓拉远,展现出一座被遗忘、积满尘土的地下墓穴,配上戏剧性的配乐。
提示词 3:镜头缓缓拉远,展现出一座宏伟的图书馆:书架和书籍在尘埃弥漫的虚空中失重漂浮,配上戏剧性的配乐。

提示词 1:继续生成视频。执行电影感的光学 dolly-zoom 镜头:摄影机向前推进,同时镜头不断拉远,让角色震惊而凝固的面孔始终保持完全相同的画面尺寸。背景中由石柱构成的长廊在强烈的光学透视畸变下急剧延伸、变深。建筑结构简洁,保持连续、不间断的镜头。

提示词 2:继续生成视频。摄影机快速执行机械式 snap-zoom,直接推进至角色睁大的双眼。采用风格化的电影级镜头控制。

提示词 3:继续生成视频。时间彻底凝固成静止的一刻:角色和被风吹起的外套都保持静止。摄影机以平滑、高速的 360 度环绕方式围绕静止的角色旋转,展现柱廊中强烈的 3D 景深和视差效果。确保画面衔接无瑕。

提示词 1:穿蓝色毛衣的男人回答:“你父亲也坐船出海了吗?”

提示词 2:他继续讲述故事:“他以前常说,这座港口是有灵魂的,而船也是我们的一部分。”镜头在连贯后拉的同时,音乐逐渐高昂。

提示词 1:他直视镜头,谈论最后一章将如何收尾!

提示词 2:随后他站起身,绕过桌子走到镜头前,说:“你会怎么选?”

下面介绍如何通过 Gemini API 延续场景:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=previous_video_interaction.id,
    input=[
        {"type": "text", "text": "继续这个场景。"}
    ],
    response_format={
        "resolution": "360p",
    },
)

指定起始帧和结束帧

通过指定镜头的起始帧和结束帧,实现流畅的转场和镜头运动。Omni 1.1 会在两个关键帧之间生成连续视频,非常适合制作复杂的环绕运镜、变焦转场或无缝循环片段。

提示词 1:一位身穿米色西装的时尚鼓手在宏伟大厅中演奏红色架子鼓,镜头以快速摇摄转向一侧,展现出一位与芭蕾舞者一同演奏的年长萨克斯手。舞者身穿白色服装,在柔和的紫色舞台灯光下旋转。整个过程保持一个连续镜头,不要跳切。

提示词 2:镜头不断推近电视屏幕,我们看到开头出现的同一位女性和同一场景。视频无缝衔接。保持一个连续镜头,不要跳切。

使用 360p 更高效地生成视频草稿

与 Omni 1.1 的标准 720p 分辨率相比,使用 360p 分辨率生成轻量级预览,速度最高可提升 60%*,成本仅为三分之一。这对于快速原型设计、分镜迭代,以及在开发者平台上快速渲染都很有帮助。

*速度最高提升 60%,依据 360p 与 720p 分辨率下的系统吞吐量测算

提示词:微观视角下的虹彩海洋硅藻,呈现精巧、玻璃般的硅质外壳与令人惊叹的自然对称结构。色彩从深邃的火山琥珀、温暖的铜色,到鲜艳的绿松石色和紫罗兰色,展现大地与海洋的丰富色谱。细小精致的结构在干净、深色的背景上柔和发光。高保真科学成像,细节锐利,质感自然,微距摄影风格。整段视频始终保持显微镜镜头效果。

最高支持放大至 4K 分辨率

借助 Omni 1.1,生成经过精细处理的高分辨率 1080p 或 4K 成片,可直接用于专业制作。

提示词 1:鱼群游动,跟拍镜头

提示词 2:一只小花栗鼠从画面左侧的树林中飞快跑出,好奇地嗅闻空气,随后迅速从画面右侧跑出

提示词 3:电影感微距特写:鲜艳的金橙色日本枫叶长在纤细的枝条上,在柔和、富有节奏感的秋风中轻轻 rustle 摇曳。阳光穿过半透明的叶片,营造温暖、明亮的光影效果。浅景深,梦幻散景背景,纹理细节丰富,照片级真实感,4K。

在多模态输入中添加视频参考

创作场景时可参考最长三秒的视频,并根据视频素材保持视觉连贯性和角色一致性。

提示词:使用上传的三段舞者视频,并将其中的舞者替换为提供的角色。让角色分别演绎参考视频中的舞蹈,同时出现在所提供图片中的宽敞开放空间内。

狗狗角色 dog.png 需要表演 dance3.mp4 中的古典舞;章鱼角色 octo.png 需要表演 dance1.mp4 中的街舞;熊角色 bear.png 需要表演 dance2.mp4 中的霹雳舞。最终结果应为一个连续镜头,不能出现镜头切换。

激发创意:你可以构建什么

下面是一些示例,展示开发者如何将这些新能力应用到定制工具和创意工作流中。

在这个应用中,你可以放入首帧和末帧,再通过预设或提示词生成两帧之间的过渡。得益于 Omni 的全上下文推理,生成的镜头运动看起来会更加真实。

这款应用会带着镜头穿过房间:环绕、推进、拉远,在最理想的时间呈现房屋最具吸引力的一面,同时不会凭空添加不存在的家具或细节。

创作者通常要先生成多个视频,才能选出最合适的版本。Draft Room 让这一探索过程更低成本、更有条理:以 360p 生成 3~4 个草稿版本,每次只调整一个变量,再将它们并排对比。

了解客户如何将 Omni Flash 用于生产

我们的客户已经通过 Agent Platform API,借助 Gemini Omni Flash 开展实际生产。下面一起看看他们创作的视频,以及他们如何使用这一模型。

Adobe 已将 Gemini Omni Flash 集成到 Adobe Firefly 中。欢迎观看下面这段展示其视频编辑能力的视频。

“Gemini Omni Flash 是 Figma Weave 中最强大的视频模型之一。借助画布,创意团队可以在每次生成的基础上继续创作:添加参考素材、分支出不同版本,并逐步打造独一无二的作品。通过扩展能力、更丰富的参考素材和 4K 分辨率,Gemini Omni Flash 让团队不止于生成视频,而是真正开始执导视频。”——Itay Schiff,Figma Weave 创意总监

“GMI Cloud 为创作者提供统一入口,让他们能够使用全球最强大的模型。Gemini Omni Flash 最突出的一点是准确性:即使仔细检查,细节依然经得起推敲。对于制作教育和讲解内容的客户来说,准确无误至关重要,这种可靠性比任何单一功能都更有价值。Omni 让 AI 视频真正适用于此前无法依赖这项技术的用户群体。”——Louisa Guo,GMI Cloud 市场副总裁

“Omni Flash 很自然地融入了人们使用 Runway 的方式:从提示词、图片或视频开始,然后继续生成或编辑。它让用户能够在不同创意之间快速切换。”——Jamie Umpherson,Runway 首席创意官

立即使用 Gemini Omni 1.1 Flash 开始构建

Gemini Omni 1.1 Flash 定价表。

A table with pricing numbers for the Gemini Omni 1.1 Flash model.

Omni 1.1 正陆续登陆 Google 开发者生态:

  • 在 Google AI Studio 中开始构建:直接在 Google AI Studio 试用 Omni 1.1。
  • 基于 Gemini Enterprise Agent Platform 构建:企业可直接通过 Agent Platform API 使用 Omni 1.1 进行开发。
  • 查阅开发者文档:阅读官方文档开发指南提示词指南,了解如何将场景扩展、视频参考和超分辨率功能集成到应用中。

从今天起,全球所有 Google AI Plus、Pro 和 Ultra 订阅用户都可以在 Google Flow 中使用 Omni 1.1。全球所有 Google AI Plus、Pro 和 Ultra 订阅用户也可以在 Gemini 应用中使用场景扩展功能。

原始来源: DeepMind 博客

评论 (0)