Anthropic 发布 Claude Opus 5.5:性能比肩 Fable 5.1,成本更低且承诺减少“Claude 味”文风
Anthropic 发布了 Claude Opus 5.5,这是全新模型系列的首款产品。公司表示,该模型在性能上与 Claude Fable 5.1 相当,但成本更低、运行速度更快。
据 Anthropic 介绍,Opus 5.5 在“大多数任务”上的表现与 Claude Fable 5.1 持平,而运行成本比 Opus 5 低约 40%。Claude Sonnet 5.5 和 Haiku 5.5 预计将在未来几周内推出,它们在性能、效率和安全性方面也将有类似的提升。Anthropic 的基准测试显示,新款 Opus 模型在大多数任务上超越了 Fable 5.1 以及 OpenAI 昂贵得多的 GPT-6 Astra。
| 基准测试 / 能力 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| 自主编码 Terminal-Bench 4.0[1] |
66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| 自主编码 FrontierCode v1.1 (Main) |
54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| 自主编码 CursorBench 4.0 |
57.8% | 51.8% | 46.6% | N/A | 41.7% |
| 知识工作 GDPval-AA v2.1 |
1,846 | 1,735 | 1,708 | 1,542 | 1,588 |
| 商业流程 AutomationBench[1] |
40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| 多学科推理 Humanity's Last Exam |
67.7% (使用工具) |
65.6% (使用工具) |
63.6% (使用工具) |
57.2% (使用工具) |
N/A |
| 自主科学研究 Terminal-Bench-Science 0.1[1] |
58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| 计算机使用 OSWorld 2.0 |
81.8% (部分) |
80.7% (部分) |
74.0% (部分) |
不适用 | 不适用 |
| 视觉图表识别 Chartography |
89.0% (使用工具) |
88.4% (使用工具) |
83.4% (使用工具) |
不适用 | 不适用 |
Anthropic 表示,新系列主要针对客户关于成本、效率以及沟通质量的反馈进行了优化,尤其是在金融服务、法律及软件开发领域。
更低的价格与 Token 用量削减运营成本
Anthropic 将 Opus 5.5 定价为每百万输入 Token $4,每百万输出 Token $20,较 Opus 5 的 $5 和 $25 分别有所下降。这意味着 Token 价格降低了 20%。该公司还将缓存读取成本降低了 60%。
Anthropic 称,综合运营成本(同时计入 Token 价格和用量)预计比 Opus 5 低约 40%。新模型使用的 Token 更少,且生成输出速度提升了 30% 以上。
| 每百万 Token 价格 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| 缓存读取 | $0.20 | $0.50 |
| 输入 Token | $4 | $5 |
| 输出 Token | $20 | $25 |
| 缓存写入 | $5 | $6.25 |
订阅用户的五小时用量限制将提高 20%。得益于模型成本的降低,Anthropic 表示,整体而言这些限制的有效期将延长 25%。用户还可以保存一次限制重置机会,以便在急需时使用。
Anthropic 正在利用编码基准测试来证明其在价格和性能上的优势。在 FrontierCode 上,该公司称 Opus 5.5 以每任务约 20% 的成本击败了 OpenAI 的 GPT-6 Astra。在 Terminal-Bench 4.0 上,其声称在 40% 的成本下达到了与 Astra 相同的性能。在 CursorBench 上,它表示 Opus 5.5 以三分之一的成本在 GPT-5.6 Sol 的基础上领先 11 分。
此次降价是对 OpenAI 尤其是中国 AI 模型带来压力的回应,这些模型性能略逊一筹,但价格只有零头。
Anthropic 承诺减少"Claudish"腔调
Anthropic 表示,Opus 5.5 的表达会比之前的模型更自然:把最重要的信息放在前面,少用行话,更严格地遵循写作指令。早期测试者评价它的文字更清晰易懂,Anthropic 认为这让它更适合长时间协作。现有 Claude 模型的写作一直饱受批评,被认为套路化、绕来绕去,有人戏称之为"Claudish"。

Opus 5.5 还是首个在网络安全、生物和前沿 LLM 开发方面拥有与 Fable 5.1 同等防护措施的 Opus 模型。Anthropic 称,一旦触发这些防护,请求会被透明地转交给另一个模型处理。
用户仍然可以用它查找和修复代码中的 bug,但大部分网络安全任务会转给旧款 Opus 4.8;被分类器标记为涉及生物或前沿 LLM 开发的请求,则会转给 Opus 5。
经过验证的组织可以通过生命科学验证计划(Life Sciences Verification Program)申请将该模型用于生物学研究。Anthropic 还计划在未来几周内,把现有的网络安全验证计划(Cyber Verification Program)扩展到 Opus 5.5。
Claude Opus 5.5 现已在包括 Amazon Web Services、Google Cloud 和 Microsoft Azure 在内的所有平台上线。使用 Claude Platform 的开发者可以通过模型 ID claude-opus-5-5 调用。
Anthropic 呼吁:模型能力越强,安全标准应越高
Anthropic 计划对强化学习环境进行更严格的审查。该公司指出,有缺陷的训练环境是导致模型行为与对齐目标偏差的主要原因之一。同时,它还在研究更优的对齐奖励机制、自动化生成安全训练场景的方法,以及强化安全与监控措施。
各 AI 实验室正在讨论如何把握发布更强模型的速度。OpenAI 近期呼吁为具备自我改进能力的 AI 系统制定国际标准,而多位研究人员也公开敦促实验室放缓发布节奏,直至对齐技术追赶上来。Anthropic 持类似立场,主张对能够完全自动化 AI 研究的模型设定更高的安全标准。该公司认为,公共政策应在制定该标准中发挥更大作用。外部机构 Frontier Design 和 METR 在 Opus 5.5 发布前对其进行了测试。
新限制措施针对蒸馏攻击,以符合欧盟 AI 法案
Anthropic 还引入了针对所谓“蒸馏攻击”的应对措施。该公司称,攻击者利用数千个虚假账户,以工业级规模提取模型能力,从而构建出不带有任何安全护栏的高性能模型。Anthropic 援引了一份 2026 年 9 月的威胁报告,其中记录了其迄今已发现并拦截的非法蒸馏活动。
Opus 5.5 推出了“保留思考”(Preserved Thinking)功能,这是首次随 Fable 5.1 引入的反蒸馏措施。它可防止 API 用户通过篡改 Claude 的历史上下文来提取其推理过程。该措施适用于 2026 年 8 月 31 日及之后创建的 API 账户,涵盖 Fable 5.1 和 Opus 5.5。
Opus 5.5 还加入了水印机制,以符合欧盟《人工智能法案》(EU AI Act)的要求。该模型已不支持关闭“Thinking”模式,并且提供零数据保留(Zero Data Retention)选项。