← 文章 / AI技术
DeepMind 博客 6小时前 · 2026-10-01 04:25:46 · 3 阅读

Gemini 4 Argon:开启前沿智能新时代

今天,我们正式发布新一代前沿模型 Gemini 4 Argon。目前,该模型正通过我们的 Fairwind 计划 向一批受信任的网络防御者推送。Argon 旨在支持跨复杂、长周期工作流的深度推理,正在从根本上改变我们在 Google 内部的工作与构建方式。它在现实世界的软件工程、法律与金融等企业知识工作以及网络安全防御等复杂工作流中,均展现出前沿水平的性能。

如此级别的前沿能力发布需要分阶段实施。我们正在积极参与美国政府自愿的预发布模型访问流程,同时逐步扩大访问范围。在尽可能快地向开发者、企业和消费者开放 Argon 之前,我们将持续收集早期测试者的反馈并迭代优化安全护栏。

Argon 将以引入阶段的价格发布:1 每百万输入代币 2 美元,每百万输出代币 10 美元,缓存的输入代币价格比输入代币价格低 95%。

改变 Google 内部的工作与构建方式

Gemini 4 Argon 已驱动我们的内部工作流,数千名 Google 员工认可了该模型在专业编码任务、深度研究和写作质量方面的优势。它正帮助团队更快构建,推动工程生产力的边界,并加速突破性进展:

  • 量子算法优化:Argon 正在帮助我们的量子计算研究人员优化限制关键应用发展的子程序的时空资源(量子比特 × 门)。在一个例子中,它在几分钟内就比已发布的基线性能高出 40%。
  • 内存效率:一个 Argon 智能体团队分析了全机群的配置遥测数据,自主识别并应用了跨越 Google 数据中心的内存优化。全面部署后,已释放超过 300 TiB 的内存,预计总节省量在 500 TiB 到 1 PiB 之间。
```html
  • 大规模代码库迁移与优化:Argon Agent 正在 Google 内部参与将 C/C++ 代码库迁移至 Rust 的工作,规模从 re2、libgav1 等核心库的数万行代码,扩展至 Fuchsia 操作系统 Zircon 内核的 80 万行以上。鉴于这些系统的重要性,此类大规模重写在投入生产前,需经过严格的自动化和人工审计、仿真测试及代码审查。

    以 libgav1(Google 的视频解码开源软件)为例,Argon Agent 在现有 Rust 移植版本的基础上,通过多轮基于性能剖析的实验,深入分析编译器输出,生成了安全 Rust 代码,使编译器能够自动进行向量化优化。最终结果是一个内存安全的视频解码器,性能比原有 Rust 版本快 2.7 倍,视频输出完全一致,更接近优化后的 C++ 版本性能。

攻克最复杂的问题

为支撑 Gemini 4 Argon 在更长的复杂用例中的能力,我们已将模型的输出 token 上限大幅扩展至行业领先的 100 万,取代此前的 64K。当模型拥有足够的空间进行深度思考并生成数十万个 token 时,它就能在一次流程中展现出更强的推理深度,以一次性解决难题。

a benchmark chart showing Gemini 4 Argon capabilities

赋能跨领域的编码与企业工作流

Gemini 4 Argon 在编码、推理和 多模态方面的能力,以及处理长多步骤任务的性能,使其能够胜任各类企业工作流。

Google 工程师已在日常工作中使用 Argon,涵盖从普通调试到大规模代码库迁移及算法设计等场景。在衡量模型处理真实世界长期软件工程任务表现的 DeepSWE v1.1 基准测试中,它取得了 77.9% 的成绩,刷新了当前最佳纪录。

``` 除了编程之外,Argon 在 Vals Index 上也排名第一。该基准衡量模型在金融、编程、法律和税务等领域的经济影响力,各领域按其在美国 GDP 中的贡献加权。在其他领域专项评测中,Argon 同样表现领先,例如 Vals Finance Agent v2(多步骤金融研究)和 Harvey 的 Legal Agent Benchmark(法律研究与文书起草)。在 Zapier 衡量核心业务端到端执行能力的 AutomationBench 上,Argon 以 51.3% 的成绩排名第一。 当知识工作需要视觉理解时,Argon 也具备独特的优势。它能进行专业的图表分析、从长视频中识别细节,并基于一系列文档采取行动。例如,在衡量长视频理解能力的 LVBench 上,Argon 以 91.7% 的成绩达到业界最先进水平。

防御性网络安全的领先者

为了让网络防御者更好地应对新型网络攻击,我们将 Gemini 4 Argon 训练成网络安全防御方面的顶尖模型。Argon 能够自主发现、验证并修复关键软件漏洞。对于可信的防御者以及 Google 内部团队,我们将发布不带网络安全防护限制的 Argon 版本,让他们能够充分发挥其前沿水平的网络安全防御能力。

Wiz 已在通过其“公益扫描”(Scan for Good)项目利用 Argon 进行网络安全防御。该计划致力于免费保护关键公共基础设施,通过发现并修复高危漏洞来降低风险。在一项早期演示中,该模型在医疗软件中发现了一个关键漏洞,该漏洞会导致全球医院使用的系统泄露敏感个人信息。这一严重风险是此前其他前沿模型未能察觉的。 在评估模型修复安全漏洞能力的 CWE-bench v1 基准测试中,Argon 以 68% 的最高得分并列第一,延续了 3.8 Flash Cyber 在 CWE-bench v0 基准测试中的前沿表现。 CWE benchmark chart 相比 3.8 Flash Cyber,Gemini 4 Argon 在漏洞发现方面实现了显著飞跃,例如:
  • 在 Google 内部综合漏洞基准测试中,Argon 在涵盖 20 种编程语言的大型复杂代码库中发现了广泛的潜在风险。
  • 在 Wiz 内部的黑盒渗透测试基准测试中(该测试评估模型在无法获取源代码的情况下分析实时 Web 系统的能力),Argon 在发现攻击面、识别漏洞以及生成概念验证(PoC)证据以验证漏洞方面,表现均优于 3.8 Flash Cyber。
security vulnerabilities chart

在广泛发布前强化前沿安全防护

在全面推广 Gemini 4 Argon 之前,我们正继续从四个主要方面强化关键的前沿安全防护措施:

防范滥用:为阻止恶意行为者利用 Argon 实施网络攻击或涉及化学、生物、辐射及核领域(CBRN)的攻击,模型被设计为拒绝危险请求,同时保留合法的、具有双重用途的科学研究,遵循我们的前沿安全框架。我们正在强化此次发布的安全措施稳健性,包括改进监测模型内部激活以发现滥用行为的技术。这些安全措施已经过内部和外部红队测试,测试采用了手动和自动化攻击方法的组合。

防范提示注入攻击:Argon 也是我们对间接提示注入攻击最具韧性的模型,这类攻击通过恶意指令或上下文劫持模型的行为。这些攻击复杂且需要保持警惕和多层次防御。通过自动化红队测试和对抗训练,Gemini 4 Argon 在 Gray Swan 的间接提示注入(IPI)基准测试的提示注入稳健性方面领先。

Gray Swan evaluation

监测错位行为:为防止 Argon 越界,即采取超出用户意图的方式来执行任务,我们正在部署错位缓解措施,监测 Argon 的思维链和动作,并在必要时停止执行。

我们使用了类似的系统来监测训练运行并向专门的应急响应团队发送警报,并谨慎防止将结果反馈到训练中,以避免塑造 Argon 的推理以规避我们的监测。我们强烈鼓励行业其余部分在这些能力增强的关键时期保持推理透明,以应对错位风险,使模型思考在识别和诊断错位时保持有用。

加固系统:随着前沿模型能力日益增强,对它们进行安全测试需要能跟上系统自身水平的安全环境。按照我们的智能体管控路线图,我们正在加固沙盒环境——在高风险训练或评估开始之前,先对其进行隔离和封闭。我们也承诺与合作伙伴分享这些智能体安全最佳实践,提升整个生态系统的安全性。

即将推出

Gemini 4 Argon 在编程、知识工作、网络安全防御和创意写作方面具备前沿级能力,旨在成为开发者、专业人士和企业攻克最难题目时的伙伴。我们感谢首批网络安全防御者和可信测试者,他们的真实场景评估和反馈将帮助我们在正式发布前进一步强化系统。发布将首先面向付费 API 客户和 Google AI Ultra 订阅用户,随后逐步开放给开发者、企业和消费者。

原始来源: DeepMind 博客

评论 (0)