← 文章 / AI技术
Hacker News 2小时前 · 2026-09-03 04:10:19 · 1 阅读

Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

承接三周前 3.7 Flash 的势头,在短短六周内推出第三次 Flash 版本,今天我们正式介绍 Gemini 3.8——迄今最强推理与编码模型,具备与 3.7 相同的速度与成本优势。Gemini 3.8 提供两个变体:

  • Gemini 3.8 Flash:我们最智能的主力模型,在软件工程、智能体任务和专业领域的复杂多步推理方面,较 3.7 Flash 实现显著提升。首发价格与 3.7 Flash 一致 1 :输入每百万 token $0.75,输出每百万 token $3.75。
  • Gemini 3.8 Flash Cyber:我们最强大的网络安全模型,在漏洞检测和自动补丁方面达到前沿水平,可通过全新推出的 Fairwind Program 向受信任的安全防御者开放。

两款发布版本针对不同的部署环境定制,但均由相同的底层智能驱动,并通过精心设计的长程智能体循环持续递归评估和优化基础模型,进一步释放性能。这一共享核心的编码和推理能力大幅提升,得益于多项创新,包括在极具挑战性的网络安全领域进行严格训练。

Gemini 3.8 Flash:为长周期编码和自主智能体而生

Gemini 3.8 Flash 相较 3.7 Flash 带来显著跃升,在多项任务上已接近成本更高的前沿模型水平。

comparison chart showing Gemini 3.8 Flash and other models

在 DeepSWE v1.1(长周期软件工程)评测中,3.8 Flash 在自主端到端解决复杂工程问题方面超越了大多数体量更大的前沿模型,而成本仅为其一小部分。

chart showing Gemini 3.8 Flash DeepSWE v1.1

此外,3.8 Flash 在专业领域展现出企业级关键自主所需的高可靠性。在需要深度分析与专业报告的量化领域,3.8 Flash 在 Vals Finance Agent V2Harvey's Legal Agent Benchmark 等评测中均超越了 3.7 Flash 及其他前沿模型。它在 HLE-Verified 上达到 54.9% 的成绩,进一步印证了其在理工、人文及专业领域处理多步推理的能力。

chart showing Gemini 3.8 Flash Vals Finance Agent v2 a chart showing Gemini 3.8 Flash Harvey's Legal Agent Benchmark a chart showing Gemini 3.8 Flash HLE-Verified

这些性能提升源于一个核心设计选择:3.8 Flash 会更加努力工作。面对复杂任务时,它会表现出更强的勤奋度——执行额外的推理步骤,并进行迭代式的工具调用。在某些情况下(尤其是高努力级别),模型会使用更多 token 来换取最佳性能表现。

对于计算效率为主要约束的应用场景,开发者可选择更低努力级别以降低 token 开销,或继续依赖 Gemini 3.7 Flash —— 该版本针对效率优先型工作负载仍获得完整支持。

Gemini 3.8 Flash 借助 Google Antigravity 中的循环指令,通过简单提示构建了这款游戏。游戏融合了谜题、环境叙事以及通过 Nano Banana 生成的纹理贴图,打造出一个沉浸式 3D 城堡关卡,玩家将扮演一名在城堡中探索的巫师。

Gemini 3.8 Flash 还在 Google Antigravity 中通过单次提示,生成了一个功能完整的 Google Maps DOS 版本。该版本涵盖地点、路线导航和街景功能,可完整游玩。

在美国地质调查局的真实数据集支持下,基于 Gemini 3.8 Flash 在 Google Antigravity 中构建了著名地理景观的三维地形图,支持探索实时横截面、2D 投影及科学解释。

"Hardware Anatomy"是一款基于 Gemini 3.8 Flash 在 Google AI Studio 上打造的交互式 3D 可视化演示,通过 Three.js 生成符合物理比例的硬件拆解真实渲染图。它能自动将设备分层,配合拆解滑块即可随时查看爆炸视图和内部细节。

Gemini 3.8 Flash Cyber:专家级网络安全性能

Gemini 3.8 Flash Cyber 现已通过 Fairwind 计划向部分值得信赖的防御者开放。凭借 Flash 级别的运行速度与成本优势,它支持快速迭代,助力防御者在当今复杂的网络安全格局中占据决定性的先机。

自主漏洞发现

在衡量漏洞发现能力的行业标准基准测试 CyberGym 上,Gemini 3.8 Flash Cyber 展现了前沿级别的自主发现性能,不仅超越了 3.5 Flash Cyber,更大幅领先于参数量大得多的前沿模型。

展示 Gemini 3.8 Flash Cyber 在 CyberGym Pass@1 中表现的图表

为了更贴近现实防御需求(CyberGym 仅局限于 C/C++ 代码),我们还在一项综合内部基准测试中评估了 Gemini 3.8 Flash Cyber,要求模型在跨越 20 种编程语言的复杂代码库中发现各类漏洞。结果显示,该模型相较此前作品实现了飞跃式进步,成功率突破 70%。

展示 Gemini 3.8 Flash Cyber 现实世界漏洞发现能力的图表

自动补丁修复

针对 Gemini 3.8 Flash Cyber,我们的核心目标是赋能防御者,助其在攻防对抗中掌握主动权。因此,我们自始至终将重心放在漏洞修复上,而非利用漏洞等进攻性手段。

由 Collinear 运营的 CWE-Bench 是一款极具挑战性的外部漏洞修复基准测试。在该榜单上,Gemini 3.8 Flash Cyber 稳居帕累托前沿:pass@1 达到 47.2%,仅比顶尖前沿模型的 47.8% 略低 0.6 个百分点,成本却显著更低。

Gemini 3.8 Flash Cyber 在 StaticBench 的 Pass@1 与单次生成成本对比图

实际影响:守护 Google 的代码库

我们已在 Google 内部全面部署 Gemini 3.8 Flash Cyber 以加固代码安全。典型案例如下:

  • Chrome 安全团队发现,相较于体积大得多的商用顶级模型,3.8 Flash Cyber 生成的 Chrome 漏洞正确补丁多出 2.6 倍。
  • Wiz 测试显示,与其他领先前沿模型相比,Gemini 3.8 Flash Cyber 的内部渗透测试召回率提升 7.5%~9.7%,成本却降低 2.3~5.2 倍。
  • Google 云漏洞研究团队利用该模型在不到 2 小时内便挖掘出一个关键基础漏洞,而同类漏洞的传统研究通常需要数月时间。

Fairwind 计划合作伙伴的评价

Armadin 创始人兼首席架构师 David Slater 的评语 Palo Alto Networks CTO 办公室总监 Charlie Sestito 的评语 Snowflake 首席安全官 Mayank Upadhyay 的评语 Wiz 威胁暴露负责人 Gal Nagli 的评语

安全设计为先

根据我们的 Frontier Safety Framework,3.8 Flash 内置了针对化学、生物、放射性和核(CBRN)以及网络攻击领域滥用的防护机制,同时支持有益的用途。3.8 Flash Cyber 则配备了更宽松的网络防御缓解措施,因此仅面向需要更全面网络能力的受信任安全人员开放。 Gemini 3.8 模型在 Gray Swan 测试中,对抗提示注入的鲁棒性也有了显著提升,有效保护 Gemini 模型用户免受相关恶意攻击。 a chart showing Gemini 3.8 Flash Cyber Gray Swan IPI Benchmark

Gemini 3.8 Flash 与 Cyber:即刻上手

原始来源: Hacker News

评论 (0)