← 文章 / AI技术
The Decoder 1小时前 · 2026-09-03 04:53:48 · 0 阅读

六周内第三款预算模型,Gemini 3.8 Flash发布

Gemini 3.7 Flash 发布三周后,Google 又带来了 Gemini 3.8 Flash。这款预算级模型在编程能力上被预期大幅超越前代。 Google 正在发布两个版本的 Gemini 3.8 Flash:一个是通用推理与编程模型,另一个是专注于网络安全的专业版本 3.8 Flash Cyber。六周内的第三次 Flash 发布,这快速节奏究竟是实力的体现,还是 distracting from 仍在缺席的前沿模型 Gemini 3.5 Pro 和 Gemini 4,取决于你问的是谁。而 新任 DeepMind 负责人 Koray Kavukcuoglu 明确表示,Google 并非只追求性价比优化,在原始能力上仍要争第一。 根据 Google 自己的数据,Gemini 3.8 Flash 在面向长周期软件工程任务的 DeepSWE v1.1 基准测试中取得 73.7%。这略低于 Claude Opus 5 的 74.0%,但明显领先于 Claude Sonnet 5(53.8%)、GPT-5.6 Sol(72.7%)和前代 3.7 Flash(65.3%)。
Google 称 Gemini 3.8 Flash 在多项基准测试中击败 Anthropic 的 Opus 5 和 OpenAI 的 GPT-5.6 Sol,尽管成本远低于它们。不过这些只是基准测试数据,实际体验可能大相径庭。 | 图源:Google
Google 还表示新模型在 3D 生成方面有所提升。下方视频展示了据称由 Gemini 3.8 Flash 通过单一提示在 Google 的 AI 编程工具 Antigravity 中构建的 3D 游戏,贴图则由 Google 的 Nano Banana 图像模型生成。 Gemini 3.8 Flash 以降价姿态发布,输入 token 定价为每百万 $0.75,输出 token 为每百万 $3.75,与 3.7 Flash 持平。2027年1月起,常规价格将上调至 $1.50 和 $7.50。作为对比,Claude Opus 5 的输入价格为每百万 $5.00、输出为 $25.00,GPT-5.6 Sol 则为 $4.00 和 $20.00。即便促销期结束后,Gemini 3.8 Flash 的每 token 成本仍 远低于 OpenAI 和 Anthropic 的顶级模型。 但 Google 解释称,3.8 Flash 相比 3.7 的性能提升,部分来源于对复杂任务执行额外推理步骤并迭代调用工具。模型会"更加卖力"地工作,这意味着更高的 token 消耗,一定程度上抵消了单价优势。对于计算效率最为关键的使用场景,Google 建议降低推理强度,或直接使用 仍受支持的 3.7 Flash。 Gemini 3.8 Flash 已通过 Google AI StudioGoogle Antigravity 和 Android Studio 面向开发者开放。企业可通过 Gemini Enterprise 获取。普通用户可在 Gemini App、Google Search 的 AI Mode,以及付费订阅者的 Google Sheets 中使用。

性价比出众,但 token 消耗不可忽视

独立基准测试平台 Artificial Analysis 给予 Gemini 3.8 Flash 智能力指数 59 分,较前代 3.7 Flash 的 56 分高出 3 分。这一分数使其与 GPT-5.6 Sol(高推理模式)和 Grok 4.6(中等推理模式)并列,三者均为 59 分。据 Artificial Analysis 分析,智能力指数的提升主要来自代理类基准测试(如工具使用和编程任务)的更强表现。
Gemini 3.8 Flash 在 Artificial Analysis 智能指数上得分 59,与 GPT-5.6 Sol 和 Grok 4.6 持平。在性价比图表(底部)中,该模型位于帕累托前沿,在其智能档位提供了最低的每任务成本。| 图片来源:Artificial Analysis

根据 Artificial Analysis 的评估,3.8 Flash 在每任务成本上同样落在帕累托前沿,单次任务成本 0.58 美元,是该智能档位中最便宜的模型。但与 3.7 Flash 的 0.40 美元相比上涨了约 40%,尽管单 token 价格保持不变——这大概也是 Google 建议在以效率为导向的工作负载中继续使用 3.7 Flash 的原因。

在高推理层级,3.8 Flash 每秒约输出 300 个 token,平均任务耗时 2.5 分钟。略快于 GPT-5.6 Luna(2.6 分钟)和 GPT-5.6 Terra(3.3 分钟),但慢于 Claude Fable 5.1(2.1 分钟)和较早的 3.7 Flash(2.2 分钟)。在低推理层级,耗时降至约 48 秒。

网络安全模型仍限于通过审核的防御方使用

Gemini 3.8 Flash Cyber 与其前身 3.5 Flash Cyber 一样并未面向公众开放。Google 通过 Fairwind 计划将其定向分发给政府机构、关键基础设施运营商和软件维护方。由于专为防御性网络安全工作设计,该模型的安全限制比标准版本更为宽松。

在 C/C++ 漏洞检测的行业标准基准测试 CyberGym 上,3.8 Flash Cyber 得分 86.2%,超越前代 3.5 Flash Cyber(77.5%)、GPT-5.6 Sol(83.6%)和 GPT-5.5-Cyber(85.6%)。在外部 CWE-Bench 自动补丁测试中,3.8 Flash Cyber 的 Pass@1 达到 47.2%,几乎追平领先的前沿模型(47.8%),而成本却低得多。

该模型在抵御提示注入攻击方面也表现出更强的韧性。在 Gray Swan IPI 基准测试 中,Gemini 3.8 Flash 的攻击成功率仅为 5.5%,而 DeepSeek V4 Pro 为 60.1%,Kimi K3 为 52.7%,Grok 4.6 为 51.8%。Anthropic 的 Claude Opus 5 表现略优,为 4.8%;启用额外安全选项的 Opus 5 在 Claude 生态内得分更低
原始来源: The Decoder

评论 (0)