Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型
面向生产环境构建 AI agent 的开发者和客户,需要更高的 token 利用率、更低的延迟,以及更稳定可靠的性能。我们的 Flash 系列模型致力于在效率与质量之间取得最佳平衡,从而支持 agent 工作流规模化落地。在 Gemini 3.5 Flash 的基础上,我们推出了以下全新 Gemini 模型:
- 3.6 Flash:我们的主力模型,在编程、知识工作和多模态任务上的表现更出色。根据 Artificial Analysis Index,其输出 token 用量较 3.5 Flash 减少了 17%;在 Datacurve 的 DeepSWE 等基准测试中,降幅最高可达 65%,同时每个输出 token 的成本更低。
- 3.5 Flash-Lite:3.5 系列中速度最快、性价比最高的模型。根据 Artificial Analysis Index,其生成速度达到每秒 350 个输出 token;在 agent 工作流中,它也显著优于此前几代 Flash-Lite 模型。
- CodeMender 中的 3.5 Flash Cyber:要成功应用于网络安全领域,必须将模型与 agent 基础设施进行精心编排。为此,我们推出了全新的高效专业网络安全模型,并将其与 CodeMender 代码安全 agent 结合,在前沿水平上实现了出色的竞争力。
除了今天发布的模型,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,准备就绪后我们会尽快面向更广泛的用户开放。与此同时,团队也已开始专注于下一代模型的研发。我们已经启动了迄今最雄心勃勃的 Gemini 4 预训练工作,并对目前取得的进展感到振奋。
3.6 Flash:效率和质量均优于 3.5 Flash
Gemini 3.6 Flash 直接吸收了开发者和客户对 3.5 Flash 的反馈。它不仅在编程和知识工作方面实现了性能提升,还显著提高了 token 利用率。例如,在 Artificial Analysis Index 上,3.6 Flash 的输出 token 用量比 3.5 Flash 少 17%。完成多步骤工作流时,它所需的推理步骤和工具调用次数也更少。
效率提升的同时,3.6 Flash 的价格也低于 3.5 Flash。输入 token 价格为每 1M 个 $1.50,输出 token 价格为每 1M 个 $7.50,可降低每项 agent 任务的整体成本,让 agent 的构建和运行更加经济高效。
在 OSWorld Verified 任务中,3.6 Flash 比 3.5 Flash 具备更高的 token 效率,输出也更简洁(API)
在提升效率的同时,3.6 Flash 在各类应用场景中的表现也全面超越 3.5 Flash:
- 3.6 Flash 精度更高,错误代码修改更少,执行循环也更少。在 DeepSWE 中,其得分为 49%,高于 3.5 Flash 的 37%;在 MLE Bench 的机器学习研究任务中,提升更为明显,得分达到 63.9%,而 3.5 Flash 为 49.7%。
- 它的计算机操作能力也有所提升,在 OSWorld-Verified 中的得分为 83.0%,高于 3.5 Flash 的 78.4%。如今,计算机操作已通过 Gemini API 和 Gemini Enterprise 成为内置的客户端工具。
- 在知识工作方面,3.6 Flash 同样优于 3.5 Flash,GDPval-AA v2 等基准测试中的得分为 1421,而 3.5 Flash 为 1349。Hebbia、Harvey 等客户表示,它尤其擅长文档解析、图表与数据分析、报告撰写等多模态任务。
在 AIS 上使用 Managed Agents 时,3.6 Flash 能够比 3.5 Flash 更高效、准确地解析和分析财务数据与访谈记录(AIS)
在 AGY 上通过多智能体编排执行代码迁移时,3.6 Flash 的延迟更低、质量更高(AGY)
3.6 Flash 借助 canvas,帮助开发用于 3D 工作流的照片纹理提取器(Gemini App)
3.6 Flash 利用 AGY 和 tldraw 离线编辑器,结合出色的视觉理解能力,构建交互式主题工作室(AGY)。
客户反馈称,3.6 Flash 在成本和质量两方面都实现了明显进步,能够在复杂工作流和知识型任务中兼顾 token 效率、准确性与速度:
以安全为基础
3.6 Flash 发布时已在化学、生物、放射性、核(CBRN)以及网络攻击滥用等领域,配备了强化版 Frontier Safety 安全防护机制。这些防护措施显著提升了模型抵御越狱攻击的能力。同时,我们也对模型进行了训练,尽量减少其在有益场景中的拒答。
详情请参阅 3.6 Flash 模型卡。
3.5 Flash-Lite:为智能体工作流规模化而生
除了 Flash,我们还发布了 Gemini 3.5 Flash-Lite。该模型既适用于低延迟任务,也适合开发者工作流中对高吞吐量要求较高的场景,例如智能体搜索和文档处理。
3.5 Flash-Lite 是 3.5 系列中速度最快的模型。根据 Artificial Analysis 的测算,其输出速度可达每秒 350 个 token。输入价格为 $0.3/1M tokens,输出价格为 $2.5/1M tokens。相比 3.1 Flash-Lite,3.5 Flash-Lite 的质量显著提升,能够为开发者和需要处理高吞吐量生产流量的客户提供出色的性价比。
在执行大规模任务时,3.5 Flash-Lite 的延迟低于 3.5 Flash。
3.5 Flash-Lite 可高效扩展智能体系统。在不同思考级别下,该模型的表现都显著优于 3.1 Flash-Lite。开发者可以根据工作负载灵活配置:对于大批量任务,选择 minimal 或 low 思考级别,以优先保证低延迟和低成本;对于多步骤子智能体任务,则启用更高思考级别。该模型还内置了 computer use 工具,能够在不同平台上可靠地完成这类智能体任务。
在编程和智能体任务上,3.5 Flash-Lite 也实现了大幅提升:Terminal-Bench 2.1 得分为 54%,相比之下 3.1 Flash-Lite 为 31%;长上下文能力在 GDM-MRCR v2 中达到 72.2%,高于后者的 60.1%;真实世界任务执行能力在 GDPval-AA v2 中得分 1140,也明显高于后者的 642。
事实上,在许多智能体和编程评测中,3.5 Flash-Lite 的表现甚至超过了 3 Flash。例如,它在 SWE-Bench Pro 中的得分为 54.2%,高于 3 Flash 的 49.6%;在 OSWorld-Verified 中则达到 74.0%,高于后者的 65.1%。这使它成为适用于 2.5 和 3 Flash 工作负载的更快、更强选择。
3.5 Flash-Lite 可从海量电商数据集中提取产品特征,并对其进行综合分析。
与作为主智能体的 3.6 Flash 协同工作时,3.5 Flash-Lite 能即时生成 25 个独特且可直接探索的网页设计方案。
凭借多模态理解能力,3.5 Flash-Lite 可以大规模完成收据翻译和摘要生成。
3.5 Flash-Lite 能通过即时生成并迭代多个方案,快速完成游戏开发。
3.5 Flash-Lite 的早期客户表示,这款模型兼具速度、智能和成本效率,非常适合扩展智能体工作流和数据处理任务:
如需了解模型详情,请参阅 3.5 Flash-Lite 模型卡。
3.5 Flash Cyber 加入 CodeMender,高效发现并修复漏洞
AI 模型发现安全漏洞的速度已经超过现有系统修复漏洞的速度。面对日益加剧的威胁,我们需要一种兼具强大能力与高效率的软件安全方案。
Flash 出色的性能和效率,使其成为大规模检测、验证并修复代码安全问题的理想基础模型。Gemini 3.5 Flash Cyber 基于 3.5 Flash 构建,并经过针对性微调,能够以低于大型模型的每 token 成本发现和修复网络安全漏洞。
CodeMender 会让多个 3.5 Flash Cyber 智能体协同工作,最终生成一份综合报告。在广受采用的 CyberGym 基准测试中,3.5 Flash Cyber 已达到具有竞争力的前沿水平。
鉴于这项技术具有双重用途,我们对 3.5 Flash Cyber 的部署采取了审慎的策略。该模型很快将通过 CodeMender,以限量试点的形式独家提供给政府机构和可信合作伙伴。这将帮助一线防御人员抢先发现并修复关键漏洞,在漏洞遭到利用前争取应对时间,同时降低技术被滥用的风险。
3.6 Flash 和 3.5 Flash-Lite:立即开始使用
3.6 Flash 和 3.5 Flash-Lite 今日起开放使用:
- 面向开发者,可通过 Google AI Studio 和 Android Studio 使用 Gemini API。3.6 Flash 也已在 Google Antigravity 上线。请参阅开发者指南开始使用。
- 面向企业,可通过 Gemini Enterprise Agent Platform 使用。3.6 Flash 也已集成到 Gemini Enterprise 应用中。
- 面向所有用户,可通过 Gemini 应用使用。3.5 Flash-Lite 也将陆续在 Google Search 中上线。
欢迎大家开始使用 3.6 Flash 和 3.5 Flash-Lite,并向我们反馈使用体验,帮助我们改进后续 Gemini 模型。我们也期待很快发布 3.5 Pro。