Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型
Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 正式发布
2026 年 7 月 21 日
我们最新的 Gemini 模型在效率、延迟和可靠性方面均有提升,能够大规模构建 AI 智能体。
Tulsee Doshi
产品管理高级总监,代表 Gemini 团队
分享
开发者和客户在构建生产级 AI 智能体时,需要更高的 Token 效率、更低的延迟和更可靠的性能。我们的 Flash 系列模型正是为了在效率与质量之间找到最佳平衡点,从而支持规模化智能体工作流而设计的。在 Gemini 3.5 Flash 的基础上,我们推出了新的 Gemini 模型:
- **3.6 Flash**:这是我们主力模型,在编程、知识工作及多模态任务上表现更优。根据 [Artificial Analysis Index](https://artificialanalysis.ai/models/gemini-3-6-flash) 的数据,与 3.5 Flash 相比,其输出 token 用量减少了 17%;而在 [Datacurve](https://deepswe.datacurve.ai/) 的 DeepSWE 等基准测试中,我们观察到降幅高达 65%,且每个输出 token 的成本更低。
- **3.5 Flash-Lite**:这是我们 3.5 系列中速度最快、性价比最高的模型。根据 Artificial Analysis Index,其每秒可输出 350 个 token,并且在智能体工作流中的表现也显著优于前代 Flash-Lite 模型。
- **CodeMender 中的 3.5 Flash Cyber**:成功的网络安全应用需要将模型与智能体基础设施进行精心编排。我们推出了一款结合了新型高效专用网络安全模型与 CodeMender 代码安全智能体的方案,能在前沿领域提供具有竞争力的性能。
3.6 Flash:比 3.5 Flash 更高效、质量更高
Gemini 3.6 Flash 直接基于开发者和客户对 3.5 Flash 的反馈进行构建。它不仅提升了编程和知识工作的能力,还显著提高了 token 效率。例如,在 Artificial Analysis Index 上,我们看到 3.6 Flash 消耗的输出 token 比 3.5 Flash 少 17%。同时,完成多步骤工作流所需的推理步骤和工具调用也更少。 这种增强的效率还伴随着比 3.5 Flash 更低的价格。以每 100 万输入 token 1.50 美元、每 100 万输出 token 7.50 美元的价格,3.6 Flash 降低了每个智能体任务的总成本,使得构建和运行智能体更具成本效益。 在 OSWorld 验证任务(API)中,3.6 Flash 相比 3.5 Flash 展现出更好的 token 效率和更简洁的输出。 尽管效率更高,3.6 Flash 在多种应用场景下的性能相比 3.5 Flash 仍有提升:- **3.6 Flash** 在 DeepSWE 基准测试中(49% 对比 37%)展现了更高的精度,减少了不必要的代码编辑和执行循环;在 MLE Bench(63.9% 对比 49.7%)上,ML 研究能力也有显著提升。
- 其计算机使用能力得到增强,在 OSWorld-Verified 基准测试中(83.0% 对比 78.4%)有所体现。现在,通过 Gemini API 和 Gemini Enterprise,计算机使用已成为内置的客户端工具。
- 在知识工作方面,3.6 Flash 优于 3.5 Flash,GDPval-AA v2(1421 对比 1349)等基准测试证明了这一点。Hebbia 和 Harvey 等客户发现,它在文档解析、图表和数据分析以及报告起草等多模态任务上尤其出色。
客户反馈称,3.6 Flash 在成本和质量上均有所进步,在复杂工作流和知识型任务中平衡了 Token 效率、准确性和速度:
安全为先的设计
3.6 Flash 在化学、生物、放射性和核(CBRN)以及网络攻击滥用领域,配备了增强的 前沿安全 防护措施。这些防护措施使模型对越狱攻击的抵抗力大幅提升。同时,该模型经过训练,能最大程度减少对有益用途的拒绝。
更多信息,请参阅 3.6 Flash 模型卡。
3.5 Flash-Lite:专为扩展智能体工作流而构建
除了 Flash,我们还发布了 Gemini 3.5 Flash-Lite,它既适用于低延迟任务,也适用于开发者工作流中高吞吐量至关重要的场景,例如智能体搜索和文档处理。
3.5 Flash-Lite 是 3.5 系列中最快的模型。根据 Artificial Analysis 的测量,其运行速度可达 350 输出 tokens/秒。定价为每百万输入 tokens 0.3 美元,每百万输出 tokens 2.5 美元,且质量显著优于 3.1 Flash-Lite,为运行高吞吐量生产流量的开发者和客户提供了极具竞争力的性价比。
3.5 Flash-Lite 能以比 3.5 Flash 更低的延迟执行高容量任务。
3.5 Flash-Lite 能够高效扩展智能体系统。在各个思考层级上,该模型的表现都显著优于 3.1 Flash-Lite。根据工作负载的不同,开发者可以配置模型,在“最低”和“低”思考层级下,优先为高容量任务提供低延迟、低成本的执行;或者启用更高的思考层级,以处理多步骤的子智能体工作负载。该模型现在还将计算机使用作为内置工具,以可靠地支持跨平台的这些智能体任务。
在编码和智能体任务方面,它实现了显著提升,如 Terminal-Bench 2.1 所示(54% 对比 31%);在长上下文方面,如 GDM-MRCR v2 所示(72.2% 对比 60.1%);以及在真实世界任务执行方面,如 GDPval-AA v2 所示(1140 对比 642)。
事实上,在多项智能体与编程评测中,3.5 Flash-Lite 的表现甚至优于 3 Flash,包括 SWE-Bench Pro(54.2% 对比 49.6%)和 OSWorld-Verified(74.0% 对比 65.1%),使其成为 2.5 Flash 和 3 Flash 工作负载中更快、更强的选择。
3.5 Flash-Lite 从海量电商数据集中提取产品特征并进行综合。
与 3.6 Flash 作为主智能体协同工作时,3.5 Flash-Lite 能瞬间生成 25 个独特、可直接探索的网页设计概念。
凭借多模态理解能力,3.5 Flash-Lite 可规模化处理收据翻译与摘要任务。
3.5 Flash-Lite 通过即时生成并迭代多个选项来构建游戏。
3.5 Flash-Lite 的早期客户正强调其在扩展智能体工作流与数据处理任务时,速度、智能与成本效益的独特结合:
更多模型信息,请参阅 3.5 Flash-Lite 模型卡片。
CodeMender 中的 3.5 Flash Cyber:高效发现并修复漏洞
AI 模型发现安全漏洞的速度已超过现有系统的修复能力。应对这一日益严峻的威胁,需要一种兼具高能力与高效率的软件安全方法。
Flash 的性能和效率使其成为大规模检测、验证和修复代码安全问题的理想基础。Gemini 3.5 Flash Cyber 基于 3.5 Flash 构建,经过微调,能以比大型模型更低的每 token 成本来发现和修复网络安全漏洞。 在 CodeMender(它使用多个 3.5 Flash Cyber 智能体协同工作,生成一份综合报告)中,3.5 Flash Cyber 在热门基准测试 CyberGym 上达到了前沿水平的竞争力。
考虑到这项技术的双重用途性质,我们在部署 3.5 Flash Cyber 时采取了审慎的态度。该模型将作为有限访问试点计划的一部分,很快通过 CodeMender 独家提供给政府和受信任的合作伙伴。这将让一线防御者抢在关键漏洞被利用之前发现并修复它们,同时降低被滥用的风险。
3.6 Flash 和 3.5 Flash-Lite:立即开始使用
3.6 Flash 和 3.5 Flash-Lite 即日起可用:- 开发者可通过 Google AI Studio 和 Android Studio 在 Gemini API 中使用。3.6 Flash 也已在 Google Antigravity 中提供。请参阅 开发者指南 开始使用。
- 企业可通过 Gemini Enterprise Agent Platform 使用。3.6 Flash 也已在 Gemini Enterprise 应用 中提供。
- 所有人均可通过 Gemini 应用 使用。3.5 Flash-Lite 也正在 Google 搜索中逐步推出。
在您开始使用 3.6 Flash 和 3.5 Flash-Lite 构建时,我们欢迎您提供反馈,以改进未来的 Gemini 模型,并期待很快发布 3.5 Pro。