← 文章 / AI技术
DeepMind 博客 10小时前 · 2026-09-02 04:27:01 · 0 阅读

Gemini 推出智能体视频理解能力

今天,我们在最新一批模型中正式推出智能体视频理解能力,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。这项新能力在显著降低视频分析 token 用量和成本的同时,进一步提升了准确率。与将代码执行与 Gemini 模型原生图像理解相结合的智能体视觉类似,智能体视频理解借助 Gemini 原生的视频工具来提升表现并解锁新能力,例如亚秒级关键片段检索、更精准的异常检测、精确计数等。

该功能即日起通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent 平台,面向视频上传和 YouTube 视频开放使用。

基准测试

传统的"静态"处理方式是以固定的帧率(默认 1 FPS,可通过 API 调整)将视频帧送入模型,而智能体视频理解则将模型的核心推理能力与原生视频工具相结合,能够跨视觉帧、音频和字幕动态地搜索、扫描和检查目标片段。在标准视频分析基准测试中,搭载智能体视频理解的 Gemini 模型,分析成本最高降低 66%,token 消耗最高减少 88%,准确率最高提升 7%。

在长视频场景下(从 10 分钟教程到 90 分钟讲座,再到数小时的长录屏),这种效率提升尤为显著——因为静态处理迫使开发者在高昂的 token 成本和可能丢失关键细节的处理方式之间二选一。

在 Gemini 3.7 Flash 上启用智能体视频理解后,token 消耗最高降低 88%,准确率最高提升 7%。

分析 token 效率和准确率提升的图表

尽管上述提升在全部三款支持的模型上均有体现,但综合来看,搭载智能体视频理解的 Gemini 3.7 Flash 在质量上达到了最佳水准,并在质量与成本效率的平衡上表现最优,处于本次参评模型中视频理解质量与成本的帕累托前沿。

采用智能体式视频理解后,Gemini 3.7 Flash 在视频分析的精度-成本帕累托前沿上达到了最优表现。

坐标图,横轴为"每次查询成本",纵轴为"准确率"

工作原理

不同于以固定帧率被动摄入媒体流的传统处理方式,智能体式视频理解让 Gemini 能够主动地、以目标为导向地决定观看哪些内容、以何种速度观看,以及通过帧、音频还是字幕来理解,从而只获取真正需要的时间片段和信息。虽然开发者此前也可以手动实现这一流程,但借助智能体式视频理解,Gemini 能通过智能体循环自动调用内部工具来加载视频的对应部分,大幅降低了开发成本。

从查询到输出的流程示意图

能力与应用场景

智能体式视频理解改变了开发者处理长视频内容的方式,可应对各类高要求的应用场景。

  • 亚秒级关键时刻定位:精准捕捉每秒内的状态变化和紧凑的剪辑切换点——这些细节在 1 FPS 下很容易遗漏,从而实现精确的自动化视频剪辑。
  • 长视频大海捞针式检索:在长达数小时的视频中回答复杂问题,且无需消耗上百万 token。
  • 异常检测:对感兴趣的时间段提高帧率重采样,以检查快速运动和细微的视觉瑕疵。
  • 动作与物体计数:准确跟踪随时间发生的重复动作和不同物体。

高效 token 的长视频分析

查看 Gemini 3.7 Flash 在 LongVideoBench(长视频理解基准测试)上启用与不启用智能体式视频理解时的表现对比:注意 token 大幅减少的同时准确率还有所提升。

借助动态帧率实现精准的快速动作分析

通过智能体式视频理解,3.7 Flash 能够按需以不同帧率扫描和回看视频,从而准确计数高速运动。

高效 token 的大海捞针式检索

借助 agentic video understanding,Gemini 3.7 能够基于视频内容准确回答复杂问题,同时相比静态分析消耗的 token 数量大幅减少。

实际效果

许多早期接入的合作伙伴在测试 agentic video understanding 时都取得了出色的表现。以下是他们的反馈:

Ponder 的评价 Revyl 的评价 Mosaic 的评价 Resemble.AI 的评价

快速上手

Agentic video understanding 已通过 Gemini API 在 Google AI StudioGemini Enterprise Agent Platform 上线,逐步覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。它采用标准 Gemini API 的 token 计费,无需额外支付功能费用。

只需在 API 配置中将 processing 设为 "agentic" 即可启用该功能。阅读我们的开发者指南,深入了解该功能及上手方式。

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic"
        },
        {
            "type": "text",
            "text": "What are the 3 most important announcements in this keynote?",
        },
    ],
)

print(interaction.output_text)

我们还将 agentic video understanding 的效率与质量提升带到 Google 各项产品中的数十亿用户。该功能将很快在 Gemini 应用的 Flash 和 Flash-Lite 模型上向所有用户推出。未来几个月,agentic video understanding 还将为 YouTube 视频观看页面上的“Ask YouTube”功能提供支持,借助 Gemini 根据视频画面给出质量更高、依据更充分的答案。

感谢 Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin 以及 Agentic Vision 团队对这项工作的贡献。

原始来源: DeepMind 博客

评论 (0)