Gemini Omni 1.1 Flash:以更强控制力构建应用
今天,我们推出了 Gemini Omni 1.1 Flash,为开发者带来一套全新的创意控制功能和生成式视频能力。Gemini Omni 将现实世界推理能力引入生成式创作,而今天的更新则让 Omni 1.1 通过 Google AI Studio 中的 Gemini API 达到可用于专业生产环境的水平。
无论你是在构建生成式视频工作流、创意工具还是媒体编辑软件,这些更新都让生成式视频更易控制、迭代更快,也更适合实际部署。以下是本次更新的主要内容:

延展场景,讲述更长故事
场景延展功能可以基于现有视频无缝生成后续片段,让故事自然地继续发展。
借助 Omni 1.1,模型现在最多可以分析前 10 秒的视频上下文。这相比以往只能参考最后 1 秒的模型是一次大幅提升。由此带来的是更稳定的画面一致性和更强的叙事连贯性,既能帮助你讲述更长的故事,也能让创作自然转向新的方向。视频每次可延展 10 秒,累计时长最长可达 40 秒。
提示词 1:镜头轻轻横摇,现在我们看到她正在和一个卷发男人交谈。画面中能看到男人的背影,他说道:“我也看到了。”配上戏剧性的配乐。
提示词 2:镜头缓缓拉远,展现一片被遗忘、积满尘土的地下墓穴,配上戏剧性的配乐。
提示词 3:镜头缓缓拉远,展现一座宏伟的图书馆,书架和书籍漂浮在布满尘埃的虚空中,配上戏剧性的配乐。
提示词 1:继续视频。执行一段电影感十足的光学 dolly-zoom 镜头。镜头向前推进的同时逐渐拉远,始终让角色惊愕、僵住的脸保持完全相同的尺寸。背景中由石柱组成的长廊在强烈的光学透视畸变下不断拉伸、延伸,显得更加深邃。建筑结构简洁,镜头连续不中断。
提示词 2:继续视频。镜头快速机械式 snap-zoom,直接推进到角色睁大的双眼。采用风格化的电影级镜头控制。
提示词 3:继续视频。时间彻底冻结,定格在这一刻:角色和被风吹起的外套都保持静止。镜头以平滑的高速 360 度环绕方式围绕静止的角色旋转,展现柱廊中富有戏剧性的 3D 景深和视差效果。衔接完美。
提示词 1:穿蓝色毛衣的男人回答:“你父亲也出海了吗?”
提示词 2:他继续讲述自己的故事:“他以前常说,这座港口拥有灵魂,而那些船也是我们的一部分。”镜头在一次连续运动中向后拉远,音乐逐渐高昂。
提示词 1:他直视镜头,讲述最终一章将如何收尾!
提示词 2:随后,他站起身,绕过桌子走到镜头前,说:“你会怎么选?”
你可以通过 Gemini API 延续当前场景:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=previous_video_interaction.id,
input=[
{"type": "text", "text": "Continue the scene."}
],
response_format={
"resolution": "360p",
},
)
指定首帧和尾帧
通过指定镜头的起始帧和结束帧,实现流畅的转场和镜头运动。Omni 1.1 会在两个关键帧之间生成连贯的视频,非常适合复杂的环绕运镜、变焦转场或无缝循环片段。
提示词 1:低机位近景,一位身穿米色西装的时尚鼓手正在大厅里演奏红色架子鼓。镜头快速甩向侧面,展现出一位正在演奏的年长萨克斯手,以及一位穿着白色服装、在柔和紫色舞台灯光下旋转的芭蕾舞者。全程一个连续镜头,不要跳切。
提示词 2:镜头推近电视屏幕,我们看到开头出现的同一位女性和同一场景。画面无缝衔接。全程一个连续镜头,不要跳切。
使用 360p 更高效地制作视频草稿
以 360p 分辨率生成轻量级预览,速度最高可提升 60%*,成本仅为 Omni 1.1 标准 720p 分辨率的三分之一。这对于快速原型设计、分镜迭代,以及在开发者平台上快速渲染都很有帮助。
*速度最高提升 60%,依据 360p 与 720p 分辨率下的系统吞吐量测算
提示词:微观视角下的彩虹色海洋硅藻,展现精巧、玻璃般的二氧化硅外壳和令人惊叹的自然对称性。色彩从深邃的火山琥珀色、温暖的铜色,到鲜艳的青绿色和紫罗兰色,仿佛浓缩了大地与海洋的丰富色彩。细小精致的结构在干净的深色背景上柔和发光。高保真科学成像,细节清晰,呈现有机纹理和显微摄影质感。整个视频始终保持显微镜镜头效果。
最高放大至 4K 分辨率
使用 Omni 1.1 生成精良的高分辨率 1080p 或 4K 成片,可直接用于专业制作。
提示词 1:鱼群游动,跟拍镜头
提示词 2:一只小花栗鼠从画面左侧的树林里飞快窜出,好奇地嗅闻空气,随后从画面右侧冲出镜头
提示词 3:电影感微距特写:纤细枝条上鲜艳的金橙色日本枫叶,在柔和而富有节奏感的秋风中轻轻 rustle 摇曳。阳光穿过半透明的叶片,营造出温暖、通透的发光效果。浅景深、梦幻散景背景、纹理极其细腻、照片级真实感、4K。
在多模态输入中添加视频参考
创作场景时,最多可参考三秒钟的视频,让模型根据视频参考保持视觉上下文和角色的一致性。
提示词:使用上传的三段舞者视频,并将舞者替换为提供的角色。让它们分别表演参考视频中的舞蹈,同时出现在所提供图片里的宽敞开放空间中。
狗狗角色 dog.png 表演 dance3.mp4 中的古典舞;章鱼 octo.png 表演 dance1.mp4 中的嘻哈舞;熊 bear.png 表演 dance2.mp4 中的霹雳舞。最终结果应为一个连续镜头,中间不得切换场景。
激发创意的应用构想
下面是一些示例,展示开发者如何将这些新能力应用于定制工具和创意工作流。
在这个应用中,你可以指定起始帧和结束帧,再通过预设或提示词生成两者之间的转场。得益于 Omni 的全上下文推理能力,生成的镜头运动看起来更加真实自然。
这个应用可以让镜头在房间之间移动:环绕、推进或拉远,展现一天中光线最理想时刻的理想家居状态,同时不会凭空添加原本不存在的家具或细节。
创作者通常要生成多个视频,才能选出合适的版本。Draft Room 让这一探索过程更低成本、更有条理:以 360p 生成 3~4 个草稿版本,每次只改变一个变量,再将它们并排比较。
了解客户如何将 Omni Flash 用于生产
我们的客户已经通过 Agent Platform API,使用 Gemini Omni Flash 推动实际生产。下面可以查看他们制作的视频,了解他们如何使用这一模型。
Adobe 已将 Gemini Omni Flash 集成到 Adobe Firefly 中。观看下面的视频,了解它的视频编辑能力。
“Gemini Omni Flash 是 Figma Weave 中最强大的视频模型之一。借助画布,创意团队可以在每次生成的基础上继续创作——添加参考素材、分支出不同版本,并逐步塑造出独一无二的作品。通过扩展功能、更丰富的参考素材和 4K 分辨率,Gemini Omni Flash 不只是帮助团队生成视频,更让他们真正能够执导视频。”——Figma Weave 创意总监 Itay Schiff
“在 GMI Cloud,我们为创作者提供集中访问全球顶尖模型的能力。Gemini Omni Flash 最突出的一点是准确性:即使仔细检查,细节依然经得起推敲。对于制作教育和说明类内容的客户来说,准确无误至关重要,因此这种可靠性比任何单一功能都更有价值。Omni 让 AI 视频真正适用于过去无法依赖这类技术的用户群体。”——GMI Cloud 市场营销副总裁 Louisa Guo
“Omni Flash 很自然地融入了人们使用 Runway 的方式:从提示词、图片或视频开始,然后在此基础上生成或编辑内容。它为用户提供了另一种在不同创意之间快速切换的方式。”——Runway 首席创意官 Jamie Umpherson
立即使用 Gemini Omni 1.1 Flash 开始构建
Gemini Omni 1.1 Flash 的定价表。
Omni 1.1 正陆续登陆 Google 开发者生态:
- 在 Google AI Studio 中开始构建:直接在 Google AI Studio 中试用 Omni 1.1。
- 基于 Gemini Enterprise Agent Platform 构建:企业可以通过 Agent Platform API 直接使用 Omni 1.1 进行开发。
- 查看开发者文档:阅读官方文档、cookbook和提示词指南,了解如何在应用中集成场景扩展、视频参考素材和超分辨率放大功能。
从今天起,全球所有 Google AI Plus、Pro 和 Ultra 订阅用户都可以在 Google Flow 中使用 Omni 1.1。场景扩展功能也已面向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户,在 Gemini 应用中开放。