Claude Haiku 5.5 发布:价格大幅下调,证明 AI 定价战远未结束
核心要点
- Anthropic 发布了 Claude Haiku 5.5,这是其目前最快且成本最低的小型模型,专为数据查询和客户支持等大规模任务打造。
- 与 Haiku 4.5 相比,Haiku 5.5 在基准测试中表现显著提升,而 token 价格最高降低 90%。此外,其在 agentic coding 等领域也优于 OpenAI 的预算模型 GPT-6 Luna。
- Haiku 5.5 现已在 AWS、Google Cloud 和 Azure 上可用。Anthropic 还将 Sonnet 5.5 的缓存读取成本减半,并向订阅用户推出月度 API 额度。
Anthropic 发布了 Claude Haiku 5.5,这是其迄今最快且最具性价比的小型模型。基准测试结果显示,该模型性能较前代大幅提升。此外,Anthropic 还下调了 Sonnet 5.5 的价格。
据 Anthropic 介绍,Haiku 5.5 专为摘要生成、数据库查询、分类和实时客户支持等高吞吐量、对成本敏感的任务而设计。平均而言,该模型的成本比 Haiku 4.5 低约 75%。对于 prompt 长度在 10 万 token 以内的请求(Anthropic 表示这约占此前所有 Haiku 请求的 90%),价格最高可降低 90%。而 prompt 超过 10 万 token 时,价格则为前者的五倍。
| 每百万 token 价格 | Haiku 5.5(prompt 小于/超过 10 万) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| 缓存读取 | $0.01 / $0.05 | $0.10 | $0.10 |
| 缓存写入 | $0.125 / $0.625 | $1.25 | $2.50 |
| 输入 token | $0.10 / $0.50 | $1.00 | $2.00 |
| 输出 token | $0.50 / $2.50 | $5.00 | $10.00 |
Anthropic 指出,Haiku 5.5 使用了更新的分词器(tokenizer),导致完成同一任务时消耗的 token 数略多于前代。Opus 4.x 系列模型也出现过类似情况,仅因分词器变更,token 用量就增加了约 30%。因此,实际节省的金额可能低于单看 token 价格所暗示的幅度。
基准测试显示相比 Haiku 4.5 有巨大飞跃
在知识基准测试 GDPval-AA v2.1 中,Haiku 5.5 得分为 1,620,超过其前代版本的 735 分一倍以上。在“人类最后考试”(Humanity's Last Exam)中,它在不使用工具时得分 45.9%,使用工具时达到 57.4%,而前代版本分别为 10.2% 和 18.7%。
提升最显著的是计算机使用(computer use)能力,即模型自主操作电脑的场景。由于该任务消耗大量 tokens,像 Haiku 5.5 这样廉价且快速的模型是理想选择。它在 OSWorld-2.1 上得分 72.4%,比之前的 15.7% 有了大幅提升。在 Agent 编程基准测试 Terminal-Bench 4.0 上,其得分为 39.2%,而 Haiku 4.5 得分为零。
Anthropic 还将 OpenAI 的性价比模型GPT-6 Luna 纳入对比。在所有测试类别中,Haiku 5.5 均领先于 GPT-6 Luna。不过,参考 Sonnet 5.5 的得分来看,Haiku 5.5 距离 Anthropic 更大规模的模型仍有较大差距。
| Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 | |
|---|---|---|---|---|
| 知识工作 / GDPval-AA v2.1 | 1,620 | 735 | 1,437 | 1,840 |
| 知识工作 / AA-Briefcase v1.1 | 1,578 | 614 | 1,336 | 1824 |
| 计算机使用 / OSWorld 2.1 | 72.4% (离线子集) | 15.7% (离线子集) | 48.9% (离线子集) | 83.9% (离线子集) |
| 多学科推理 / Humanity's Last Exam | 45.9% (无工具) | 10.2% (无工具) | — | 56.9% (无工具) |
| 57.4% (有工具) | 18.7% (有工具) | — | 64.5% (有工具) | |
| Agent 编程 / Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| Agent 编程 / FrontierCode 1.1 (Main) | 46.4% | — | 42.4% | 52.1% (Xhigh) |
| 视觉推理 / Chartography | 46.4% (无工具) | 6.4% (无工具) | 29.1% (无工具) | 61.6% (无工具) |
首代 Haiku 模型让用户能在成本与性能间权衡
Haiku 5.5 是首款支持可调节推理等级的 Haiku 级模型,用户可以在成本与质量之间灵活权衡。Anthropic 表示,该模型最适合范围明确的小型任务,如压缩、摘要或子代理工作。至于复杂的 agentic 编程,Sonnet 5.5 和 Opus 5.5 仍是更好的选择。
在网络安全防护方面,Haiku 5.5 比上一代更严格,但比 Sonnet 5.5 允许更广泛的防御类任务,部分原因是模型整体能力更弱。渗透测试仍被禁止。有更大需求的组织可以申请 Anthropic 的生命科学与网络安全验证项目。
Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。
Sonnet 5.5 也降价了,Anthropic 还发放 API 额度
在推出 Haiku 的同时,Anthropic 将 Sonnet 5.5 的缓存读取成本下调 50%,从每百万 token 0.20 美元降至 0.10 美元。公司表示,这应该能让大多数 agentic 任务的成本降低约 20%。此举几乎可以肯定是对 OpenAI 新推出的 GPT-6.1 系列的回应,表明 AI 价格战正打得比以往更加激烈。
Anthropic 还推出了每月 API 额度:Max-5x 订阅用户可获得 100 美元,Max-20x 订阅用户 200 美元,Team 订阅用户每月最高 500 美元。用户可以通过 API 把这些额度用于试验各类工具、应用和 agent。
公司还更新了 Python 和 TypeScript SDK,新增对计算机使用和浏览器使用的 beta 支持。