谷歌 Gemini 新型智能体视频分析:token 消耗最高降 88%
要点
- 谷歌正为其 Gemini Flash 模型配备基于智能体(agent)的视频分析:不再按固定模式逐帧扫描,而是动态检索视频内容。
- 模型会自主决定分析视频的哪些片段、如何分析。据谷歌称,这最多可节省 88% 的 token、降低 66% 的成本,并提升准确率。
- 该功能现已通过 Gemini API 上线,可用于在长视频中定位特定场景,后续还将集成到 Gemini 应用和 YouTube。
谷歌正在为多款 Gemini 模型加入基于智能体的视频分析。模型不再以固定速率逐帧扫描视频,而是自行搜寻相关片段,谷歌称这将大幅削减 token 用量和成本。
最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 能够捕捉短于 1 秒的瞬间,包括按每秒 1 帧采样时会漏掉的状态变化或镜头切换。谷歌表示,这让自动化视频剪辑精确得多。
该系统还能在数小时长的素材中定位单个场景,而不会烧掉数百万 token。它会对可疑时间窗口以更高帧率重新采样来发现异常,并能随时间推移准确统计重复动作和单个物体的数量。

在此之前,Gemini 依赖的是静态处理:默认以每秒 1 帧的固定帧率对视频采样,并可通过 API 调整。自 2025 年推出原生视频分析以来,Gemini 一直在转录音轨并按秒分析画面。
谷歌表示,智能体模式将模型的推理直接与原生视频工具挂钩:看哪些片段、以什么速度看、通过哪种模态看(画面、音频还是文字稿),都由模型自行决定,只提取当前任务真正需要的瞬间和信号。
Gemini 现在只加载视频中真正重要的部分
Gemini 现在会使用一个内部工具,仅抓取视频文件中相关的部分。这类选择性处理方案开发者过去可以手动搭建,如今由模型自动完成。

这一方案建立在「agentic vision」之上,谷歌已于1 月为 Gemini 3 Flash 推出该能力。它让模型编写并运行 Python 代码来缩放、裁剪和标注图像,并在回答前于「思考—行动—观察」循环中逐一检验结果。上线之初它并非在所有情况下都能自动触发,但基础已经打好。当谷歌在 12 月发布 Gemini 3 Flash 时,就把面向视频的视觉与空间推理列为即将到来的能力。
效率提升在长视频上最为明显:从 10 分钟的教程到 90 分钟的讲座,再到数小时的录像都适用。在静态处理下,开发者只能在高昂的 token 成本与丢弃重要细节的方法之间二选一。在包括 LongVideoBench 在内的谷歌自研基准上,启用智能体分析的 Gemini 3.7 Flash 获得最高的整体质量评分,并交出准确率与成本效率的最佳组合。

通过 API 使用不额外收费
该功能现已支持视频上传和 YouTube 视频,可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 使用。开发者只需在 API 配置中将处理模式设为 "agentic",按标准 Gemini API token 费率付费,无需额外费用。更多细节见开发者指南。
谷歌也计划把这些改进带到自家产品中。该功能应很快向 Gemini 应用中所有 Flash 和 Flash Lite 用户推出。未来几个月,基于智能体的视频分析还将驱动播放页上的「Ask YouTube」功能,让回答更贴近视频中实际可见的内容。