← 文章 / AI技术
The Decoder 4小时前 · 2026-09-02 18:02:26 · 4 阅读

谷歌 Gemini 新型智能体视频分析:token 消耗最高降 88%

Image description

要点

  • 谷歌正为其 Gemini Flash 模型配备基于智能体(agent)的视频分析:不再按固定模式逐帧扫描,而是动态检索视频内容。
  • 模型会自主决定分析视频的哪些片段、如何分析。据谷歌称,这最多可节省 88% 的 token、降低 66% 的成本,并提升准确率。
  • 该功能现已通过 Gemini API 上线,可用于在长视频中定位特定场景,后续还将集成到 Gemini 应用和 YouTube。

谷歌正在为多款 Gemini 模型加入基于智能体的视频分析。模型不再以固定速率逐帧扫描视频,而是自行搜寻相关片段,谷歌称这将大幅削减 token 用量和成本。

最新的 Gemini 3.7 Flash3.6 Flash 和 3.5 Flash-Lite 能够捕捉短于 1 秒的瞬间,包括按每秒 1 帧采样时会漏掉的状态变化或镜头切换。谷歌表示,这让自动化视频剪辑精确得多。

该系统还能在数小时长的素材中定位单个场景,而不会烧掉数百万 token。它会对可疑时间窗口以更高帧率重新采样来发现异常,并能随时间推移准确统计重复动作和单个物体的数量。

Zwei Balkendiagramme vergleichen Gemini 3.7 Flash mit und ohne agentische Verarbeitung auf Minerva, 1H-VideoQA und LVBench, links Tokens pro Anfrage, rechts Genauigkeit.
在 1H-VideoQA 和 LVBench 上,token 用量下降 88%,准确率还略有提升。| 图片来源:Google

在此之前,Gemini 依赖的是静态处理:默认以每秒 1 帧的固定帧率对视频采样,并可通过 API 调整。自 2025 年推出原生视频分析以来,Gemini 一直在转录音轨并按秒分析画面。

谷歌表示,智能体模式将模型的推理直接与原生视频工具挂钩:看哪些片段、以什么速度看、通过哪种模态看(画面、音频还是文字稿),都由模型自行决定,只提取当前任务真正需要的瞬间和信号。

Gemini 现在只加载视频中真正重要的部分

Gemini 现在会使用一个内部工具,仅抓取视频文件中相关的部分。这类选择性处理方案开发者过去可以手动搭建,如今由模型自动完成。

Ablaufdiagramm einer Gemini-Schleife aus Query, Think, Observation und Output mit den Werkzeugen get_transcript, get_frames(start, end, fps) und get_audio(start, end).
Gemini 不再按固定帧率加载整段视频,而是通过「查询—思考—观察—输出」的循环,按需选择性地从所需片段获取画面、音频或文字稿。| 图片来源:Google

这一方案建立在「agentic vision」之上,谷歌已于1 月为 Gemini 3 Flash 推出该能力。它让模型编写并运行 Python 代码来缩放、裁剪和标注图像,并在回答前于「思考—行动—观察」循环中逐一检验结果。上线之初它并非在所有情况下都能自动触发,但基础已经打好。当谷歌在 12 月发布 Gemini 3 Flash 时,就把面向视频的视觉与空间推理列为即将到来的能力。

效率提升在长视频上最为明显:从 10 分钟的教程到 90 分钟的讲座,再到数小时的录像都适用。在静态处理下,开发者只能在高昂的 token 成本与丢弃重要细节的方法之间二选一。在包括 LongVideoBench 在内的谷歌自研基准上,启用智能体分析的 Gemini 3.7 Flash 获得最高的整体质量评分,并交出准确率与成本效率的最佳组合。

Streudiagramm mit Kosten pro Anfrage auf der X-Achse und Genauigkeit auf der Y-Achse; Gemini 3.7 Flash mit agentischer Verarbeitung liegt bei rund 90 Prozent über GPT 5.6 Terra, Claude Opus 5.0 und Grok 4.6.
在谷歌自家的 1H-VideoQA 评测中,Gemini 3.7 Flash 以每次查询最低的成本拿下最高准确率。| 图片来源:Google

通过 API 使用不额外收费

该功能现已支持视频上传和 YouTube 视频,可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 使用。开发者只需在 API 配置中将处理模式设为 "agentic",按标准 Gemini API token 费率付费,无需额外费用。更多细节见开发者指南

谷歌也计划把这些改进带到自家产品中。该功能应很快向 Gemini 应用中所有 Flash 和 Flash Lite 用户推出。未来几个月,基于智能体的视频分析还将驱动播放页上的「Ask YouTube」功能,让回答更贴近视频中实际可见的内容。

原始来源: The Decoder

评论 (0)