Anthropic 发布 Claude Sonnet 5.5:基准测试逼近 Opus 5.5,单任务成本降低 30%
要点
- Anthropic 发布了 Claude Sonnet 5.5,输出速度快 30% 以上,并通过更高效的 token 使用将单任务成本降低最多 30%。
- Sonnet 5.5 在编程和知识工作类基准测试中提升显著,部分测试已接近顶级模型 Opus 5.5,而成本只有其零头。
- 模型现已在 AWS、Google Cloud 和 Azure 上线。Anthropic 还新增了针对网络安全风险和蒸馏攻击的防护措施。
Anthropic 发布了 Claude 5.5 系列的第二款模型 Claude Sonnet 5.5。它的输出速度提升 30% 以上,单任务成本最多降低 30%,多项基准测试成绩已逼近 Opus 5.5。
Opus 5.5 面向需要审慎判断的复杂任务,而 Sonnet 5.5 则针对定义明确的日常工作,如修 bug、写文档、做演示文稿和电子表格。Anthropic 还宣布 Claude Haiku 5.5 将在未来几周发布,主打高吞吐、低成本的场景。
凭借 Fable、Opus 和 Sonnet,Anthropic 已对标 OpenAI 的 GPT-6 Astra、Sol 和 Luna——正是后者掀起了这轮价格战。大致来看,Opus 略高于 Sol,Sonnet 略高于 Luna,Fable 略高于 Astra,只是 Anthropic 的整体定价更高。既然同级别模型性能差距很小,成本可能就成了决定性因素,而 Haiku 或许能帮 Anthropic 补上这块短板。
编程性能大幅跃升
据 Anthropic 称,Sonnet 5.5 相比前代提升最大的领域是编程。在测试 agentic 编程能力的 Terminal-Bench 4.0 上,Sonnet 5.5 达到 70.6%,而 Sonnet 5 仅为 10.3%。在复现 Cursor 编辑器真实编程场景的 CursorBench 4.0 上,Sonnet 5.5 得分 55.5%,前代为 34.1%,仅比 Opus 5.5(57.8%)低两个百分点。
Anthropic 表示,在 FrontierCode 1.1 的“High”设置下,Sonnet 5.5 比 Sonnet 5 高出 10 分,且单任务成本仅约为前者的十五分之一。早期测试者称赞该模型能快速理解代码库。Sonnet 5.5 比前代版本更频繁地批量处理工具调用,从而减少了所需步骤。
推理强度存在一个反常之处。在最高努力等级“Max”下,Sonnet 5.5 在 FrontierCode 上的得分反而低于“Xhigh”级别。Anthropic 称,在最大努力模式下,模型更频繁地触发代码审查功能,将工作拆分给多个子代理。在某些情况下,这导致超时或超出任务范围的修改,而这两者都会受到 FrontierCode 的惩罚。
知识工作性能几乎追平 Opus 5.5
在 GDPval-AA 上,这是一项由 OpenAI 开发、涵盖 44 种职业和 9 个行业任务的知识工作基准测试,Sonnet 5.5 得分 1,844 分。该成绩几乎与 Opus 5.5(1,846 分)持平,且比 Sonnet 5(1,449 分)高出约 400 分。根据 Anthropic 的数据,OpenAI 的 GPT-6 Sol 得分为 1,487 分。在 Chartography 视觉图表识别测试中,Sonnet 5.5 的准确率从 15.6% 跃升至 61.6%。
| 类别 | 基准测试 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|---|
| 代理式编程 | Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | — |
| 代理式编程 | FrontierCode 1.1 (Main) | 46.2% (Max); 52.1% (Xhigh)² | 42.4% | 54.4% | 49.3% |
| 代理式编程 | CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| 知识工作 | GDPval-AA v2.1³ | 1,844 | 1,449 | 1,846 | 1,487 |
| 知识工作 | AA Briefcase v1.1³ | 1,811 | 1,359 | 1,822 | 1,483 |
| 跨学科思维 | Humanity's Last Exam (with tools) | 64.5% | 54.9% | 67.7% | — |
| 计算机技能 | OSWorld 2.1 (partial evaluation) | 80.1% | 57.0% | 81.8% | — |
| 视觉图表识别 | Chartography (without tools) | 61.6% | 15.6% | 64.4% | 53.6% |
¹ 对于 Opus 5.5,Terminal-Bench 4.0 在“Xhigh”设置下显示最高得分。² Sonnet 5.5 在“Max”设置下的 FrontierCode 得分低于“Xhigh”设置。³ Sonnet 5.5 的数据来自一个预发布版本,其中后来修复的某个 bug 可能影响了结构化输出。
早期测试者表示,Sonnet 5.5 是一个更自然的对话伙伴,且具备设计感。Anthropic 称,该模型能够重构用户界面并执行幻灯片模板,效果极佳,几乎无需后期润色。
Anthropic 还表示,Sonnet 5.5 是首个仅通过截图就能通关《宝可梦红》的 Sonnet 模型。OpenAI 的 Astra 最近在游戏基准测试中也展现了类似的进展。就在几年前,此类任务仍被视为难题,通常还需要定制算法。如今,即使是产品系列中的中端模型也能应对这些挑战。
Token 单价不变,每任务 Token 消耗更少
Sonnet 5.5 每百万 token 的价格与 Sonnet 5 相同:输入 token 为 $2,输出 token 为 $10,缓存读取为 $0.20。由于模型在每个任务中使用的 token 更少,Anthropic 称有效成本最多可降低 30%。输出生成速度也提升了 30% 以上。这些说法仍需独立测试来验证。
| 每百万 token 价格 | Claude Opus 5.5 | GPT-6 Sol | Claude Sonnet 5.5 | GPT-6 Luna |
|---|---|---|---|---|
| 输入 token | 4 $ | 2 $ | $2 | $0.10 |
| 输出 token | $20 | $10 | $10 | $0.50 |
| 缓存读取访问 | $0.20 | $0.20 | $0.20 | $0.01 |
| 缓存写入访问 | $5 | $2.50 | $2.50 | $0.125 |
与 Anthropic 的其他模型及 OpenAI 的对应产品一样,Sonnet 5.5 提供可调整的努力度设置,允许用户在成本、速度与输出质量之间进行权衡。Anthropic 表示,在低或中档设置下,Sonnet 5.5 已在多个基准测试中击败了 Sonnet 5 的最高分,且每任务成本仅约为其十分之一。不过,为每个任务找到合适的努力度水平,目前仍更像是一门艺术而非科学。
面向更强大模型的新网络安全保障措施
Claude Sonnet 5.5 现已在各大云平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。与 Opus 5.5 和 Sonnet 5 一样,Anthropic 为该模型提供零数据保留选项。开发者可通过 Claude Platform 使用模型 ID「claude-sonnet-5-5」来调用它。
由于 Sonnet 5.5 在网络安全领域的能力远超前代,Anthropic 首次为 Sonnet 系列模型加入了防护措施:涉及高风险网络安全任务的请求会被明显地重新路由到 Sonnet 5。合格的专业人士可通过扩展的 Cyber Verification Program 申请分级访问权限。
Anthropic 还新增了针对蒸馏攻击的安全分类器,与其最强模型所采用的方案相同。这些措施是否真正有效,未来几个月内应该就能见分晓。如果中国实验室确实一直在利用这类攻击,堵住这一途径或将再次拉开他们与西方实验室之间的差距。