DeepMind 博客 1小时前 · 2026-09-03 04:48:52 · 0 阅读
谷歌发布 Gemini 3.8 Flash 与 3.8 Flash Cyber
基于三周前 3.7 Flash 的热度,并在短短六周内推出第三款 Flash 模型,今天我们正式发布 Gemini 3.8 —— 我们迄今最强的推理与编程模型,速度和成本与 3.7 保持一致。Gemini 3.8 提供两个版本:
这些性能提升源于一个核心设计选择:3.8 Flash 更努力。面对复杂任务时,它会执行额外的推理步骤并迭代调用工具——更加勤奋。有时模型会使用更多 token 来最大化性能,尤其是在更高的努力级别下。
对于将计算效率视为首要约束的应用,开发者可以选择更低的努力级别以减少 token 开销,也可以继续使用 Gemini 3.7 Flash——它在效率优先的工作负载中仍得到全面支持。
Gemini 3.8 Flash 通过一条简单提示词(使用 Google Antigravity 中的循环指令)构建了这款游戏。游戏融合了谜题、环境叙事以及用 Nano Banana 生成的纹理,打造出一个沉浸式 3D 关卡——玩家扮演一名在城堡中穿行的巫师。
Gemini 3.8 Flash 仅用一条提示词便在 Google Antigravity 中构建出功能完整的 DOS 版 Google Maps,包含地点、方向和街景,可完整游玩。
通过Google Antigravity中基于Gemini 3.8 Flash构建的著名地理地标地形图,探索实时截面、2D投影以及来自美国地质调查局(USGS)真实数据集的科学解说。
Hardware Anatomy是一款使用Gemini 3.8 Flash在Google AI Studio中构建的交互式3D可视化工具,能够生成符合物理比例的硬件设备拆解效果逼真三维渲染。它可自动将设备分解为多个图层,并可通过拆解滑块进行爆炸视图和检查。

- Gemini 3.8 Flash:我们的主力智能模型,在软件工程、智能体任务和细分领域多步推理方面相比 3.7 Flash 带来显著提升,定价与 3.7 Flash 相同:1 百万输入 token 0.75 美元,百万输出 token 3.75 美元。
- Gemini 3.8 Flash Cyber:功能最强的网络安全模型,在漏洞检测和自动修复方面达到前沿级性能,通过我们的 Fairwind 计划 向受信防御者开放。
两个版本针对不同部署环境设计,但底层由相同的基座智能驱动,并通过长期运行的智能体循环持续递归评估和优化底层模型。这一共享核心的显著编程与推理突破来自多项创新,包括在严苛的网络安全领域的深度训练。
Gemini 3.8 Flash:专为长周期编程和自主智能体打造
Gemini 3.8 Flash 相比 3.7 Flash 带来显著提升,性能往往可逼近更高成本的顶级模型。
在 DeepSWE v1.1(长周期软件工程)评测中,3.8 Flash 能够以极低开销自主端到端解决复杂工程问题,性能超越多数更大的顶级模型。
此外,3.8 Flash 在各类专业知识领域也展现出关键企业自主性所需的可靠性。在需要高级分析和报告的量化与专业领域,3.8 Flash 在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 等基准测试中超越 3.7 Flash 及其他前沿模型。它还在 HLE-Verified 上取得 54.9% 的得分,证明其具备跨 STEM、人文和专业领域的多步推理能力。
这些性能提升源于一个核心设计选择:3.8 Flash 更努力。面对复杂任务时,它会执行额外的推理步骤并迭代调用工具——更加勤奋。有时模型会使用更多 token 来最大化性能,尤其是在更高的努力级别下。
对于将计算效率视为首要约束的应用,开发者可以选择更低的努力级别以减少 token 开销,也可以继续使用 Gemini 3.7 Flash——它在效率优先的工作负载中仍得到全面支持。
Gemini 3.8 Flash 通过一条简单提示词(使用 Google Antigravity 中的循环指令)构建了这款游戏。游戏融合了谜题、环境叙事以及用 Nano Banana 生成的纹理,打造出一个沉浸式 3D 关卡——玩家扮演一名在城堡中穿行的巫师。
Gemini 3.8 Flash 仅用一条提示词便在 Google Antigravity 中构建出功能完整的 DOS 版 Google Maps,包含地点、方向和街景,可完整游玩。
通过Google Antigravity中基于Gemini 3.8 Flash构建的著名地理地标地形图,探索实时截面、2D投影以及来自美国地质调查局(USGS)真实数据集的科学解说。
Hardware Anatomy是一款使用Gemini 3.8 Flash在Google AI Studio中构建的交互式3D可视化工具,能够生成符合物理比例的硬件设备拆解效果逼真三维渲染。它可自动将设备分解为多个图层,并可通过拆解滑块进行爆炸视图和检查。
Gemini 3.8 Flash Cyber:专业级网络安全性能
Gemini 3.8 Flash Cyber现已通过Fairwind计划向一批受信任的防御者提供,凭借Flash的速度和成本优势支持快速迭代,在当前复杂的网络安全格局中带来决定性优势。
自主漏洞发现
在行业标准的漏洞发现基准测试CyberGym上,Gemini 3.8 Flash Cyber展现了前沿水平的自主漏洞发现能力,性能超越包括3.5 Flash Cyber在内的大多数更大规模的前沿模型。
为了更好地捕捉不限于CyberGym中C/C++代码库的真实防御需求,我们还在一项综合内部基准测试中对Gemini 3.8 Flash Cyber进行了评估。该测试要求模型在涵盖20种编程语言的复杂代码库中发现各类漏洞。在此场景下,该模型展现出远超我们以往模型的显著提升,成功率超过70%。
自动补丁生成
针对Gemini 3.8 Flash Cyber,我们专注于为防御者配备专家级能力,使其在对抗攻击者时占据优势。这也是我们从一开始就重点投入漏洞修复工作,并将其置于漏洞利用等进攻性能力之上的原因。
由 Collinear 运营的 CWE-Bench 是一个极具挑战性的代码修补能力外部基准测试。在该基准上,Gemini 3.8 Flash Cyber 处于帕累托前沿:其 pass@1 达到 47.2%,与领先的 47.8% 几乎持平,但成本大幅更低。
实际影响:守护 Google 的代码安全
我们已在 Google 内部全面部署 Gemini 3.8 Flash Cyber 来保障代码安全。例如:
- Chrome 安全团队发现,3.8 Flash Cyber 修复 Chrome 漏洞的正确补丁数量是体积大得多的顶级商业模型的 2.6 倍。
- Wiz 发现,Gemini 3.8 Flash Cyber 在其内部渗透测试基准上的召回率提升 7.5-9.7%,而成本仅为其他领先模型的 1/2.3 到 1/5.2。
- Google 云漏洞研究团队利用 3.8 Flash Cyber 在不到 2 小时内发现了一个关键的基础性漏洞,而这类漏洞的研究和发现通常需要数月时间。
Fairwind 项目合作伙伴的评价
从设计上保障安全
Gemini 3.8 Flash 根据我们的前沿安全框架,在化学、生物、放射性和核(CBRN)以及赛博攻击领域内置了防止滥用的安全措施,同时支持有益的应用场景。3.8 Flash Cyber 则配备更为宽松的网络安全缓解措施,因此仅限需要更完整赛博能力矩阵的可信赖防御者使用。 Gemini 3.8 系列模型在 Gray Swan 测度下,提示注入鲁棒性也实现了显著提升,为 Gemini 模型用户提供了针对提示注入相关恶意攻击的有效防护。
Gemini 3.8 Flash 与 Cyber 版本:立即上手
- 开发者:基于 3.8 Flash 构建应用,或在 Google Antigravity 中探索以 Agent 为核心的工作流;也可通过 Google AI Studio 或 Android Studio 中的 Gemini API 即刻开始构建,或在 Stitch 中生成用户界面。参考我们的 开发者文档 快速入门。
- 企业用户:在 Gemini Enterprise 中使用 3.8 Flash。
- 个人用户:3.8 Flash 已面向 Google AI Pro 和 Ultra 订阅用户开放,可通过 Gemini App、Google Search 中的 AI 模式,以及 Google Sheets 中的 Gemini 功能使用。
- 网络安全:通过我们的新 Fairwind 计划,我们正在为可信赖的政府机构、关键基础设施运营商及软件维护者提供 Gemini 3.8 Flash Cyber 的优先访问权限。申请接入。

原始来源: DeepMind 博客