← 文章 / 行业与公司动态
The Decoder 4小时前 · 2026-10-01 06:23:01 · 4 阅读

谷歌 Gemini 4 Argon 缩小与 OpenAI、Anthropic 的差距,但未明显领先

图片描述

核心要点

  • 谷歌发布了 Gemini 4 Argon,这是其最新旗舰模型,缩小了与 OpenAI 和 Anthropic 前沿模型的差距,并在部分关键基准测试中超越了对手。
  • 新增功能:Argon 支持最高一百万输出 tokens,使其能够一次性完成复杂推理而不会超时。
  • 谷歌正分阶段推出 Argon,入门价为每百万输入 tokens $2,每百万输出 tokens $10;常规价格随后将升至 $4 和 $20。缓存输入享有 95% 的折扣。

谷歌发布了 Gemini 4 Argon,这款新前沿模型缩小了与 OpenAI 和 Anthropic 竞争对手的差距,在部分关键基准测试中表现更佳。尽管它未必明显领跑,但作为前沿模型,其入门价相对便宜。

Argon 是谷歌在 Gemini 3.1 Pro 之后时隔七个月推出的首个前沿模型。这使这家广告巨头重回 AI 实验室前三名,尽管 Anthropic 很可能仍保持领先。在经历了一段艰难且拖沓的开发期后——已宣布的 Gemini 3.5 前沿模型被完全跳过——谷歌重新加入竞争。

大多数用户需等待

Argon 将首先提供给“可信网络防御者”群体,这是 Fairwind 计划 的一部分。这些用户及谷歌内部团队将获得无网络护栏限制的模型版本。谷歌以“分阶段方法”为逐步推出策略辩护,称此级别的 AI 能力需要如此安排。该公司还参与美国政府自愿计划,在模型公开发布前允许政府机构访问。

早期测试者的反馈将用于完善模型的安全机制。谷歌计划在此之后再向开发者、企业和消费者开放 Argon,首先面向付费 API 客户和 Google AI Ultra 订阅用户。公司未给出具体日期,仅表示“尽快”。

价格已经确定,至少作为入门定价:每百万输入 Token 2 美元,每百万输出 Token 10 美元。缓存输入 Token 的价格比常规价格低 95%,折合每百万 Token 约 0.10 美元。作为对比,Gemini 3.8 Flash 的缓存折扣率为 90%。在原始 Token 单价上,谷歌远低于其他前沿模型,但在 Token 消耗量上并非如此(详见下文)。

每百万 Token 价格 Gemini 4 Argon (促销) Gemini 4 Argon (常规) GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
输入 Token $2 $4 $10 $10 $4
输出 Token $10 $20 $50 $50 $20
缓存读取操作 $0.10* $0.20* $1 $0.25 $0.20
缓存写入操作 不适用 不适用 $12.50 $12.50 (5 分钟) / $20 (1 小时) $5 (5 分钟) / $8 (1 小时)

*谷歌未明确列出该具体数值,但指出缓存价格比常规输入 Token 价格低 95%。

谷歌还将输出限制从 64,000 Token 提升至 100 万 Token,称此举为行业首创。其初衷是,若模型能在单次推理轨迹中生成数十万 Token,便能更深入地思考复杂问题,并一次性解决。为此,谷歌将在 Gemini API 中新增“长解码续传”(Long Decode Continuation)功能。该功能允许暂停长响应,并通过后续请求恢复,从而避免推理过程因超时而中断。

输入上下文窗口维持 100 万 Token 不变。Argon 支持文本、图像、视频和音频作为输入,但仅支持文本输出。

独立测试显示 Argon 与 GPT-6 Astra 表现相当,但 Token 消耗更大

Artificial Analysis 提供了早期的独立评估。在最高推理级别“高”(High)下,Gemini 4 Argon 在 Artificial Analysis 智能指数上得分为 53。这一成绩与 OpenAI 的 GPT-6 Astra(最大模式)和 Claude Fable 5.1 持平,并领先 GPT-6.1 Sol(最大模式)1 分。

Anthropic 的模型仍然领先:Claude Opus 5.5 得分 58,Claude Sonnet 5.5 得分 56。相比之下,Google 上一代旗舰模型 Gemini 3.1 Pro Preview,Argon 一口气提升了 23 分。"High" 通常是 Gemini 模型的最高推理档位,有时还支持一个特殊的 "Deep Think" 模式。

按当前促销价计算,完成一项 Intelligence Index 任务需要 1.99 美元,是 GPT-6 Astra(3.26 美元)的 60%,但比 GPT-6.1 Sol 贵 2.7 倍。折扣结束后价格升至 3.98 美元,比 GPT-6 Astra 高出约 20%。它的价格优势来自更低的 token 单价,而非效率更高——Argon 平均每任务消耗 6.2 万个输出 token,而 GPT-6 Astra 只需 2.7 万个。

Artificial Analysis 的结果显示,Argon 在 "High" 档位下正在追平第一梯队。 | 图片来源:Artificial Analysis

Argon 在 agentic 任务上也有显著进步,而这正是 Artificial Analysis 指出的 Gemini 模型弱项。在 Artificial Analysis 自家变体 AutomationBench-AA 上,Argon 以 77.5% 夺得第一,领先 Claude Sonnet 5.5(max)6 个百分点。在 Terminal Bench 4 上,它达到 57%,比 Gemini 3.1 Pro Preview 暴涨 53 个百分点,但仍落后于 Claude Sonnet 5.5(64%)、Claude Opus 5.5(60%)和 GPT-6 Astra(59%)。

Artificial Analysis 还强调了 Argon 的低幻觉率。在测试事实性知识和知识盲区诚实度的 AA-Omniscience 基准上,Argon 的幻觉率为 15%,而 GPT-6 Astra(max)高达 51%,GPT-6.1 Sol(max)为 54%。Argon 更倾向于承认自己不知道,而不是瞎猜。不过它的准确率只有 50%,比 Gemini 3.1 Pro Preview 低 5 分,比 GPT-6 Astra(max,63%)低 13 分。在该基准的总分上,Argon 得 42 分,与 GPT-6 Astra(43 分)和 GPT-6.1 Sol(42 分)基本持平。

Google 自己公布的基准测试结果则要好看得多:Argon 在其中大部分基准上都领先,有时优势还相当明显。

Google 内部基准测试中 Gemini 4 Argon 的成绩。| 图片来源:Google

Argon 还在 Vals Index 中占据领先位置。根据 Vals AI 的数据,其得分为 68.9%,位列第一,这也是 Gemini 系列模型首次登顶该指数。Argon 在 22 项测试基准中有 20 项进入前五,尤其在金融、法律、编码和安全领域表现突出。不过需要注意,在同一测试中,中端模型 Sonnet 5.5 的排名也超过了 Anthropic 的旗舰模型 Opus 5.5,因此这份成绩单需持保留态度。

老生常谈,AI 模型终究要经得住现实场景的检验。最终表现不仅取决于模型本身,还取决于外围软件包的质量。而这恰恰是 Google 目前的短板:与 Claude Cowork 和 ChatGPT Work 相比,Gemini 应用依然落后。

Argon 在文本人类偏好排名中拔得头筹

在由人类对模型输出进行两两对比评分的 Arena.ai 平台上,Argon 表现不俗。在文本竞技场中,Gemini 4 Argon(High)以 1525 分位居榜首,领先第二名 Claude Opus 4.6(High) 20 分。这使得它成为写作任务强有力的竞争者,尤其是在经历了长时间缺乏有竞争力的写作模型,且 Opus 5.5 在人类偏好排名中仍未超越 Opus 4.6 的背景下。Google 的上代模型 Gemini 3.8 Flash(High)此前排名仅为第十一。

Arena 数据显示,Argon 在编码、高难度提示词、指令遵循、长查询以及创意写作方面均居前列。在所有受评估的专业领域,以及英语、中文、俄语和其他非英语查询中,它都排名第一。

Web 开发领域的结果则相对保守。在 Code Arena:WebDev 项目中,Argon 得分为 1679 分,位列第八。虽然较 Gemini 3.8 Flash(High) 提升了 96 分,排名也从第 29 名大幅跃升,但仍未进入前三梯队。

论性价比,Argon 在 Arena 榜单上领先。其混合输入输出费用为每百万 token 8 美元,使 Argon 在文本榜单中刷新了帕累托前沿,成为当前成本效益最高的模型。

原始来源: The Decoder

评论 (0)