Gemini 推出智能体视频理解能力
今天,我们在最新一批模型中正式推出智能体视频理解能力,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。这项新能力在显著降低视频分析 token 用量和成本的同时,进一步提升了准确率。与将代码执行与 Gemini 模型原生图像理解相结合的智能体视觉类似,智能体视频理解借助 Gemini 原生的视频工具来提升表现并解锁新能力,例如亚秒级关键片段检索、更精准的异常检测、精确计数等。
该功能即日起通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent 平台,面向视频上传和 YouTube 视频开放使用。
基准测试
传统的"静态"处理方式是以固定的帧率(默认 1 FPS,可通过 API 调整)将视频帧送入模型,而智能体视频理解则将模型的核心推理能力与原生视频工具相结合,能够跨视觉帧、音频和字幕动态地搜索、扫描和检查目标片段。在标准视频分析基准测试中,搭载智能体视频理解的 Gemini 模型,分析成本最高降低 66%,token 消耗最高减少 88%,准确率最高提升 7%。
在长视频场景下(从 10 分钟教程到 90 分钟讲座,再到数小时的长录屏),这种效率提升尤为显著——因为静态处理迫使开发者在高昂的 token 成本和可能丢失关键细节的处理方式之间二选一。
在 Gemini 3.7 Flash 上启用智能体视频理解后,token 消耗最高降低 88%,准确率最高提升 7%。
尽管上述提升在全部三款支持的模型上均有体现,但综合来看,搭载智能体视频理解的 Gemini 3.7 Flash 在质量上达到了最佳水准,并在质量与成本效率的平衡上表现最优,处于本次参评模型中视频理解质量与成本的帕累托前沿。
采用智能体式视频理解后,Gemini 3.7 Flash 在视频分析的精度-成本帕累托前沿上达到了最优表现。
工作原理
不同于以固定帧率被动摄入媒体流的传统处理方式,智能体式视频理解让 Gemini 能够主动地、以目标为导向地决定观看哪些内容、以何种速度观看,以及通过帧、音频还是字幕来理解,从而只获取真正需要的时间片段和信息。虽然开发者此前也可以手动实现这一流程,但借助智能体式视频理解,Gemini 能通过智能体循环自动调用内部工具来加载视频的对应部分,大幅降低了开发成本。
能力与应用场景
智能体式视频理解改变了开发者处理长视频内容的方式,可应对各类高要求的应用场景。
- 亚秒级关键时刻定位:精准捕捉每秒内的状态变化和紧凑的剪辑切换点——这些细节在 1 FPS 下很容易遗漏,从而实现精确的自动化视频剪辑。
- 长视频大海捞针式检索:在长达数小时的视频中回答复杂问题,且无需消耗上百万 token。
- 异常检测:对感兴趣的时间段提高帧率重采样,以检查快速运动和细微的视觉瑕疵。
- 动作与物体计数:准确跟踪随时间发生的重复动作和不同物体。
高效 token 的长视频分析
查看 Gemini 3.7 Flash 在 LongVideoBench(长视频理解基准测试)上启用与不启用智能体式视频理解时的表现对比:注意 token 大幅减少的同时准确率还有所提升。
借助动态帧率实现精准的快速动作分析
通过智能体式视频理解,3.7 Flash 能够按需以不同帧率扫描和回看视频,从而准确计数高速运动。
高效 token 的大海捞针式检索
借助 agentic video understanding,Gemini 3.7 能够基于视频内容准确回答复杂问题,同时相比静态分析消耗的 token 数量大幅减少。
实际效果
许多早期接入的合作伙伴在测试 agentic video understanding 时都取得了出色的表现。以下是他们的反馈:
快速上手
Agentic video understanding 已通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 上线,逐步覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。它采用标准 Gemini API 的 token 计费,无需额外支付功能费用。
只需在 API 配置中将 processing 设为 "agentic" 即可启用该功能。阅读我们的开发者指南,深入了解该功能及上手方式。
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)
我们还将 agentic video understanding 的效率与质量提升带到 Google 各项产品中的数十亿用户。该功能将很快在 Gemini 应用的 Flash 和 Flash-Lite 模型上向所有用户推出。未来几个月,agentic video understanding 还将为 YouTube 视频观看页面上的“Ask YouTube”功能提供支持,借助 Gemini 根据视频画面给出质量更高、依据更充分的答案。
感谢 Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin 以及 Agentic Vision 团队对这项工作的贡献。