← 文章 / AI技术
DeepMind 博客 1小时前 · 2026-09-03 04:48:52 · 0 阅读

谷歌发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

基于三周前 3.7 Flash 的热度,并在短短六周内推出第三款 Flash 模型,今天我们正式发布 Gemini 3.8 —— 我们迄今最强的推理与编程模型,速度和成本与 3.7 保持一致。Gemini 3.8 提供两个版本:
  • Gemini 3.8 Flash:我们的主力智能模型,在软件工程、智能体任务和细分领域多步推理方面相比 3.7 Flash 带来显著提升,定价与 3.7 Flash 相同:1 百万输入 token 0.75 美元,百万输出 token 3.75 美元。
  • Gemini 3.8 Flash Cyber:功能最强的网络安全模型,在漏洞检测和自动修复方面达到前沿级性能,通过我们的 Fairwind 计划 向受信防御者开放。

两个版本针对不同部署环境设计,但底层由相同的基座智能驱动,并通过长期运行的智能体循环持续递归评估和优化底层模型。这一共享核心的显著编程与推理突破来自多项创新,包括在严苛的网络安全领域的深度训练。

Gemini 3.8 Flash:专为长周期编程和自主智能体打造

Gemini 3.8 Flash 相比 3.7 Flash 带来显著提升,性能往往可逼近更高成本的顶级模型。

comparison chart showing Gemini 3.8 Flash and other models

在 DeepSWE v1.1(长周期软件工程)评测中,3.8 Flash 能够以极低开销自主端到端解决复杂工程问题,性能超越多数更大的顶级模型。

此外,3.8 Flash 在各类专业知识领域也展现出关键企业自主性所需的可靠性。在需要高级分析和报告的量化与专业领域,3.8 Flash 在 Vals Finance Agent V2Harvey's Legal Agent Benchmark 等基准测试中超越 3.7 Flash 及其他前沿模型。它还在 HLE-Verified 上取得 54.9% 的得分,证明其具备跨 STEM、人文和专业领域的多步推理能力。 chart showing Gemini 3.8 Flash Vals Finance Agent v2 a chart showing Gemini 3.8 Flash Harvey's Legal Agent Benchmark a chart showing Gemini 3.8 Flash HLE-Verified 这些性能提升源于一个核心设计选择:3.8 Flash 更努力。面对复杂任务时,它会执行额外的推理步骤并迭代调用工具——更加勤奋。有时模型会使用更多 token 来最大化性能,尤其是在更高的努力级别下。 对于将计算效率视为首要约束的应用,开发者可以选择更低的努力级别以减少 token 开销,也可以继续使用 Gemini 3.7 Flash——它在效率优先的工作负载中仍得到全面支持。 Gemini 3.8 Flash 通过一条简单提示词(使用 Google Antigravity 中的循环指令)构建了这款游戏。游戏融合了谜题、环境叙事以及用 Nano Banana 生成的纹理,打造出一个沉浸式 3D 关卡——玩家扮演一名在城堡中穿行的巫师。 Gemini 3.8 Flash 仅用一条提示词便在 Google Antigravity 中构建出功能完整的 DOS 版 Google Maps,包含地点、方向和街景,可完整游玩。 通过Google Antigravity中基于Gemini 3.8 Flash构建的著名地理地标地形图,探索实时截面、2D投影以及来自美国地质调查局(USGS)真实数据集的科学解说。 Hardware Anatomy是一款使用Gemini 3.8 Flash在Google AI Studio中构建的交互式3D可视化工具,能够生成符合物理比例的硬件设备拆解效果逼真三维渲染。它可自动将设备分解为多个图层,并可通过拆解滑块进行爆炸视图和检查。

Gemini 3.8 Flash Cyber:专业级网络安全性能

Gemini 3.8 Flash Cyber现已通过Fairwind计划向一批受信任的防御者提供,凭借Flash的速度和成本优势支持快速迭代,在当前复杂的网络安全格局中带来决定性优势。

自主漏洞发现

在行业标准的漏洞发现基准测试CyberGym上,Gemini 3.8 Flash Cyber展现了前沿水平的自主漏洞发现能力,性能超越包括3.5 Flash Cyber在内的大多数更大规模的前沿模型。

Gemini 3.8 Flash Cyber CyberGym Pass@1图表

为了更好地捕捉不限于CyberGym中C/C++代码库的真实防御需求,我们还在一项综合内部基准测试中对Gemini 3.8 Flash Cyber进行了评估。该测试要求模型在涵盖20种编程语言的复杂代码库中发现各类漏洞。在此场景下,该模型展现出远超我们以往模型的显著提升,成功率超过70%。

Gemini 3.8 Flash Cyber真实世界漏洞发现图表

自动补丁生成

针对Gemini 3.8 Flash Cyber,我们专注于为防御者配备专家级能力,使其在对抗攻击者时占据优势。这也是我们从一开始就重点投入漏洞修复工作,并将其置于漏洞利用等进攻性能力之上的原因。

由 Collinear 运营的 CWE-Bench 是一个极具挑战性的代码修补能力外部基准测试。在该基准上,Gemini 3.8 Flash Cyber 处于帕累托前沿:其 pass@1 达到 47.2%,与领先的 47.8% 几乎持平,但成本大幅更低。 Chart showing Gemini 3.8 Flash Cyber StaticBench Pass@1 vs Cost Per Rollout

实际影响:守护 Google 的代码安全

我们已在 Google 内部全面部署 Gemini 3.8 Flash Cyber 来保障代码安全。例如:

  • Chrome 安全团队发现,3.8 Flash Cyber 修复 Chrome 漏洞的正确补丁数量是体积大得多的顶级商业模型的 2.6 倍。
  • Wiz 发现,Gemini 3.8 Flash Cyber 在其内部渗透测试基准上的召回率提升 7.5-9.7%,而成本仅为其他领先模型的 1/2.3 到 1/5.2。
  • Google 云漏洞研究团队利用 3.8 Flash Cyber 在不到 2 小时内发现了一个关键的基础性漏洞,而这类漏洞的研究和发现通常需要数月时间。

Fairwind 项目合作伙伴的评价

quote from David Slater, Founder and Chief Architect, Armadin quote from Charlie Sestito, Director, Office of the CTO, Palo Alto Networks quote from Mayank Upadhyay, CSTO, Snowflake quote from Gal Nagli, Head of Threat Exposure, Wiz

从设计上保障安全

Gemini 3.8 Flash 根据我们的前沿安全框架,在化学、生物、放射性和核(CBRN)以及赛博攻击领域内置了防止滥用的安全措施,同时支持有益的应用场景。3.8 Flash Cyber 则配备更为宽松的网络安全缓解措施,因此仅限需要更完整赛博能力矩阵的可信赖防御者使用。 Gemini 3.8 系列模型在 Gray Swan 测度下,提示注入鲁棒性也实现了显著提升,为 Gemini 模型用户提供了针对提示注入相关恶意攻击的有效防护。 a chart showing Gemini 3.8 Flash Cyber Gray Swan IPI Benchmark

Gemini 3.8 Flash 与 Cyber 版本:立即上手

  • 开发者:基于 3.8 Flash 构建应用,或在 Google Antigravity 中探索以 Agent 为核心的工作流;也可通过 Google AI StudioAndroid Studio 中的 Gemini API 即刻开始构建,或在 Stitch 中生成用户界面。参考我们的 开发者文档 快速入门。
  • 企业用户:在 Gemini Enterprise 中使用 3.8 Flash。
  • 个人用户:3.8 Flash 已面向 Google AI Pro 和 Ultra 订阅用户开放,可通过 Gemini App、Google Search 中的 AI 模式,以及 Google Sheets 中的 Gemini 功能使用。
  • 网络安全:通过我们的新 Fairwind 计划,我们正在为可信赖的政府机构、关键基础设施运营商及软件维护者提供 Gemini 3.8 Flash Cyber 的优先访问权限。申请接入
a chart showing Gemini 3.8 Flash Cyber Gray Swan IPI Benchmark
原始来源: DeepMind 博客

评论 (0)