← 文章 / 行业与公司动态
Hacker News 5小时前 · 2026-10-08 02:41:17 · 8 阅读

Anthropic 发布 Claude Haiku 5.5:更快、更便宜的小模型

我们推出 Claude Haiku 5.5——有史以来最便宜、最快、也最强大的小模型。

Claiku 5.5 专为高并发、对成本敏感的任务设计,能稳定处理快速且重复性的工作负载,比如摘要、压缩、数据库查询和分类请求。在编码工作中,它可以作为 subagent 与 Opus 5.5 和 Sonnet 5.5 搭配使用。此外,它也是我们目前速度最快的模型,特别适合在线客服、浏览器操作等对速度要求高的任务。¹

Haiku 5.5 的价格比 Haiku 4.5 低得多,平均运行成本降低了约 75%。²

伴随本次发布,我们还提升了整个模型系列的价值:将 Claude Sonnet 5.5 的缓存读取价格减半,Sonnet 5.5 在大多数 agentic 工作上的成本因此降低约 20%;同时为 Claude Max 和 Team 订阅用户推出新的月度 API 额度,帮助大家基于 Claude Platform 构建新的 agent 和应用。

性能

以下是 Claude Haiku 5.5 在各项 benchmark 上的表现:

Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5(供参考)
知识工作GDPval-AA v2.1
知识工作GDPval-AA v2.1162073514371840
知识工作AA-Briefcase v1.1
知识工作AA-Briefcase v1.1157861413361824
计算机使用OSWorld 2.1
计算机使用OSWorld 2.172.4%离线子集15.7%离线子集48.9%离线子集83.9%离线子集
多学科推理Humanity’s Last Exam
多学科推理Humanity’s Last Exam45.9%无工具10.2%无工具—56.9%无工具
57.4%使用工具18.7%使用工具—64.5%使用工具
Agentic 编码Terminal-Bench 4.0
Agentic 编码Terminal-Bench 4.039.2%0.0%16.4%70.6%
Agentic 编码FrontierCode 1.1 (Main)
Agentic 编码FrontierCode 1.1 (Main)46.4%—42.4% 52.1%Xhigh
视觉推理:制图能力
视觉推理:制图能力46.4%(无工具)6.4%(无工具)29.1%(无工具)61.6%(无工具)

关于评估方法的具体细节,请参阅 Haiku 5.5 系统卡片。

Haiku 5.5 是我们首个提供可调节精力设置(effort setting)的 Haiku 级别模型。这意味着,与我们的其他模型一样,用户可以根据需求选择优化成本或优化智能表现。下图展示了 Haiku 5.5 在不同精力设置下于三项基准测试中的表现:

计算机使用:OSWorld知识工作:GDPval-AA多学科推理:Humanity’s Last Exam计算机使用:OSWorld知识工作:GDPval-AA多学科推理:Humanity’s Last Exam
OSWorld 2.1(离线子集)准确率与成本对比
  • Haiku 5.5
  • Haiku 4.5
  • Sonnet 5.5
  • GPT-6 Luna

OSWorld 2.1 衡量智能体操作真实计算机以完成复杂长流程任务的能力。

GDPval-AA v2.1准确率与成本对比
  • Haiku 5.5
  • Haiku 4.5
  • Sonnet 5.5
  • GPT-6 Luna

Artificial Analysis 的 GDPval-AA v2.1 涵盖 44 个职业,评估智能体在真实世界专业工作场景中的表现。

Humanity’s Last Exam(无工具)准确率与成本对比
  • Haiku 5.5
  • Haiku 4.5
  • Sonnet 5.5

Humanity’s Last Exam(HLE)旨在测试专家级的学术知识与推理能力。

在早期测试中,客户反馈的结果与上述展示的性能提升和成本优化一致。以下是他们对该新模型的评价:

Asana HubSpot AlphaSense Box Rogo Cognition Asana HubSpot AlphaSense Box Rogo Cognition Quote

“Claude Haiku 5.5 让我们印象深刻,尤其是它的速度。我们用它测试了 AI Teammates(我们的 AI Agent 产品)的评估套件,涵盖 bug 分诊、项目初始化、以及在大型项目组合中查找高风险或逾期任务等场景。与目前使用的模型相比,任务完成延迟降低了 30% 以上,每次 Agent 轮次的推理速度提升了 2.5 倍。体验明显更流畅。”

CompanyAsanaAuthorAaron Vinh, Staff Software EngineerQuote

“在 HubSpot,我们使用模拟门户网站来评估新模型在 CRM 任务(如交易报告)上的表现。我们主要测试更小、更高效的模型。Claude Haiku 5.5 在该套件中取得了目前为止的最高分,三次运行的平均分为 92.8%。其中一项 CRM 审计任务要求模型识别过时但模糊的记录。在所有受测模型中,Haiku 5.5 完成任务的速度最快,且命中率最高,误报率最低。”

CompanyHubSpotAuthorZe’ev Klapow, Distinguished Software EngineerQuote

“Ask in Document 是我们主要的算力消耗来源之一,生产环境每周约有 800 万次调用。它基于单个或多个文档回答非常具体的问题。我们运行了 400 条查询,Claude Haiku 5.5 相比 Haiku 4.5 有统计学上的显著改进:0.84 对 0.76。”

CompanyAlphaSenseAuthorDaniel Campos, Distinguished EngineerQuote

“我们的客户利用 Box AI 处理大量企业内容。广泛使用带来了对效率和成本管控的需求,以及为特定任务寻找最佳模型的诉求。在早期测试中,Claude Haiku 5.5 的得分比 Haiku 4.5 高 11 分,而延迟仅约为其一半。我们计划将其用于大规模运行的分析工作,包括成本报告、财务摘要和每周例行审查。”

CompanyBoxAuthorYashodha Bhavnani, VP of AI ProductsQuote

“短文本和高吞吐量任务正是 Claude Haiku 5.5 适合我们的地方,例如快速查找、子 Agent 和摘要。当大型模型构建演示文稿时,Haiku 5.5 子 Agent 可以深入 10-K 文件,提取演示文稿所需的分部收入数据。它的准确性足以让我们放心使用,而且速度够快、成本够低,可以高频运行。”

公司:Rogo 作者:Alex Wang,Applied AI 引言:

“Claude Haiku 5.5 作为 Devin Fusion 中的副手模型,表现出色。搭载 Haiku 5.5 后,Fusion 在 FrontierCode 上拿下了 66.2 的顶级分数,同时降低了成本和延迟。你现在就可以在 Devin CLI 中搭配 Opus 5.5 作为主模型来体验。”

公司:Cognition 作者:Walden Yan,联合创始人兼 CPO

定价

下表展示了 Claude Haiku 5.5 与我们其他模型的定价对比。当任务提示词在 100,000 tokens 以内时,Haiku 5.5 的性价比尤为突出——这类请求约占此前 Haiku 模型总请求量的 90%。

每百万 tokens 价格Haiku 5.5
提示词 ≤100k / >100k
Haiku 4.5Sonnet 5.5
缓存读取$0.01 / $0.05$0.10$0.10
缓存写入$0.125 / $0.625$1.25$2.50
输入 tokens$0.10 / $0.50$1.00$2.00
输出 tokens$0.50 / $2.50$5.00$10.00

安全性

对齐。与 Haiku 4.5 相比,Claude Haiku 5.5 在我们几乎所有的对齐评估中都有显著提升。尤其值得一提的是,模型出现不良行为的情形大幅减少,配合滥用的意愿也更低。模型的 system card 详细介绍了我们的评估流程和结果。

安全防护。与其能力相匹配,Haiku 5.5 在网络安全方面的防护比 Haiku 4.5 更严格,但比我们近期其他模型略宽松一些。在网络安全领域,它允许的任务范围比 Sonnet 5.5 的防护标准更广,但仍会阻止渗透测试等更可能被攻击者利用的技术手段。

Haiku 5.5 在生物安全层面的防护措施与 Sonnet 5、Sonnet 5.5 及 Opus 5 保持一致。我们允许处理学术研究性质的生物学问题,但会限制我们认为可能导致危害的请求。从事更广泛生物学和网络活动的机构,可以申请加入我们的生命科学验证计划和网络验证计划。

可用性

Claude Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude 平台上,开发者可以使用 claude-haiku-5-5 开始开发。

请查阅我们的迁移指南了解详情。

更多更新

除了 Claude Haiku 5.5 的新定价,我们还在进一步提升模型和产品的价值。

首先,从今天起,我们降低了 Claude Sonnet 5.5 的缓存读取价格。缓存读取费用降低 50%:从每百万 token $0.20 降至 $0.10。由于缓存读取占模型 token 消耗量的很大比例,这一调整使 Sonnet 5.5 在大多数 agentic 任务上的成本降低了约 20%。

例如,这次降价对 Sonnet 5.5 在 Terminal-Bench 4.0 基准测试中“性能相对成本”表现的影响如下:

Terminal-Bench 4.0 准确率 vs. 成本
  • Haiku 5.5
  • Haiku 4.5
  • Sonnet 5.5($0.10 缓存读取)
  • Sonnet 5.5($0.20 缓存读取)

Terminal-Bench 4.0 用于衡量模型在命令行界面中完成复杂多步骤专业任务的能力。

这张图表揭示了 Haiku 5.5 与我们更大模型之间的重要差异。对于 Terminal-Bench 4.0 所衡量的复杂 agentic 编码任务,Sonnet 5.5 和 Opus 5.5 仍是更佳选择。相比之下,Haiku 5.5 最适合那些范围更窄的任务——在过去版本的 Claude 中,这类任务可能因成本过高而难以实施,例如上下文压缩、摘要生成或 subagent 工作。

其次,本周我们将面向所有 Max 和 Team 订阅用户推出每月 API 额度,供其在 Claude Platform 上使用。Max 5x 用户每月可获 100 美元额度,Max 20x 用户每月可获 200 美元,Team 订阅用户则可共享最高 500 美元额度。这些额度旨在让用户能够尝试开发调用我们 API 的工具、应用和 Agent。它们可适用于我们任意模型。详情可参见我们的帮助中心文章。

面向开发者,我们还将更新 Claude Python 和 TypeScript SDK,以在 Beta 版本中支持 computer use 和 browser use。鉴于 Haiku 5.5 在速度、能力和价格上的综合优势,它尤其适合这类任务。更多内容可查阅我们的 Claude Platform 文档。

脚注

1 在各模型的标准速度下,Claude Haiku 5.5 是我们迄今最快的模型,但在 Fast Mode 下,其运行速度不及 Opus 系列模型。

2 对于 100,000 tokens 以内的请求,Claude Haiku 5.5 的价格比 Claude Haiku 4.5 低 90%;对于超过 100,000 tokens 的请求,则低 50%。在 Haiku 4.5 上,90% 的请求属于前者。此计算还考虑了 Haiku 4.5 与 Haiku 5.5 在完成相同工作量时所用 token 数量的差异:Haiku 5.5 采用了更新的 tokenizer(与 Sonnet 5.5 和 Opus 5.5 类似),这意味着它每任务消耗的 token 略多。

原始来源: Hacker News

评论 (0)