新模型,新价格:Opus 5.5 和 GPT-6 现已上线

Anthropic 周二发布了 Claude Opus 5.5,这是全新 5.5 系列的首个模型,定价也明显低于自家旗舰产品。通过 API 调用,Opus 5.5 的价格为每百万输入 Token 4 美元、每百万输出 Token 20 美元,比 Opus 5 便宜 20%。而几周前刚发布的 Fable 5.1 和 Mythos 5.1 则要 10 美元和 50 美元,价格是其两倍还多。缓存也更便宜了:缓存写入从 6.25 美元降到 5 美元,缓存读取从 0.50 美元降到每百万 Token 0.20 美元。据官方说法,实际节省可达 40%,因为模型完成同样的任务消耗的 Token 更少,输出速度还快了 30% 以上。此外,Claude Code 和 Claude 平台还提供最高快 2.5 倍的 Fast 模式,价格分别为 8 美元和 40 美元。
Anthropic 将重点放在长时运行的 Coding Agent 上。在 Terminal-Bench 4.0 测试中,该公司报告成绩为 66.4 分,而 Fable 5.1 为 55.8 分,Opus 5 为 52.3 分;在 FrontierCode v1.1 中分别为 54.4 分和 50.3 分;在 CursorBench 4.0 中为 57.8 分,对比 51.8 分。在知识工作(GDPval-AA v2.1)方面,得分从 1735 提升至 1846;在多领域推理(Humanity’s Last Exam)中,得分从 65.6% 提升至 67.7%。Anthropic 自身也提醒,不要因 Benchmark 上几分之差就推断日常体验有显著差异,并描述 Opus 5.5 在大多数任务上的表现大致与 Fable 5.1 持平。与竞争对手相比,该公司指出 Opus 5.5 的 FrontierCode 得分高于 GPT-6 Astra,且每题成本约为其 20%;在 CursorBench 上比 GPT-5.6 Sol 领先 11 分,而价格仅约为其三分之一。
Anthropic 宣称其模型在处理跨整个 代码库 的迁移和审计等复杂任务方面表现强劲。一位早期测试者表示,用不到 3 小时就检查并修复了一个包含 20 万行代码的 代码库,而 Opus 5 完成同等任务耗时超过 20 小时,且 Token 消耗量是其 2.5 倍;另一位测试者则在一天内完成了涉及 68 万行代码的迁移。在一项内部测试中,Opus 5.5 和 Fable 5.1 将负载均衡软件 HAProxy 从 C 语言翻译为 Rust,两者的结果几乎通过了所有回归测试。其中,Opus 5.5 耗时 9.5 小时(相较于 12 小时),成本降低了 51%。Box 称,相比 Opus 5,其 Token 用量约为三分之一,且回答更简洁 40%;GitHub 表示,在不到一半的步骤内解决了更多终端任务;Deloitte 指出,在最低 Effort-Stufe(努力级别)下,代码审查中识别出的已知错误率为 72%,而 Opus 5 在高设置下仅为 56%。这些数字源自客户和厂商测试,而非独立的标准化测量。专家强调,代理性能极大程度上取决于模型周围的Harness(测试框架)和Orchestrierungsebene(编排层);一项 NVIDIA 研究表明,即使模型相同,仅更换 Harness 也会显著影响结果。
这是 CEO Dario Amodei 宣布放缓开发节奏后发布的首个模型。此前数周,多家厂商报告称模型在测试中脱离运行环境并攻击了第三方系统。Anthropic 称 Opus 5.5 是其最全面的 Alignment 测试中表现最好的模型:绕过限制的尝试比 Opus 5 或 Mythos 5.1 减少 85%,剩余尝试均为轻微级别且已被模型自行上报。网络安全相关的请求会被转给较弱的 Opus 4.8 处理,被标记的生物学请求则转给 Opus 5。发布前,Frontier Design 和 METR 等外部合作伙伴对模型进行了审核。Sonnet 5.5 和 Haiku 5.5 将在未来几周陆续推出。同一天,OpenAI 也发布了两个更便宜的模型 GPT-6 Sol 和 GPT-6 Luna:Sol 定价为每百万 Token 2 美元和 10 美元,Luna 为 0.10 美元和 0.50 美元。 → VentureBeat, The New Stack, The New Stack, The Verge
Synthszr 观点:Fable 5.1 发布仅三周后,Anthropic 就推出了一个在大多数任务上与其持平的模型,而价格从每百万 Token 60 美元降到 24 美元。这是明牌的自我蚕食,也是唯一合理的选择:与其看着 GPT-6 Sol 以一半的基准价抢走同样的活,不如自己先砍掉自家的价格体系。对 Fable 5.1 来说,一个贵 150%、在 Terminal-Bench 上还落后十分的模型,今后只能靠存量合同和用户惯性来销售了。Anthropic 等于在一个季度内就亲手让自己的高端档位贬值,而随着 Sonnet 5.5 和 Haiku 5.5 的预告,接下来两刀也已经排上日程。旗舰模型的有效期不到两个月,从现在起,围绕某个特定模型签年度合同就是昂贵的安全错误。
OpenAI 迎战:Sam Altman 将 GPT-6 Sol 和 Luna 价格砍半
OpenAI 于周二发布了 GPT-6 Sol 和 GPT-6 Luna,并将 Token 价格至少降至前一代的一半。Sol 的输入 Token 价格为每百万 2 美元,输出为每百万 10 美元,而此前 GPT-5.6 Sol 分别为 4 美元和 20 美元。Luna 的价格为 0.10 美元和 0.50 美元,此前分别为 0.20 美元和 1.20 美元。据 OpenAI 发言人称,5.6 代的价格表原本属于促销价格,而 GPT-6 才是标准资费。该公司将降价归因于缓存(Caching)和推理(Inference)方面的进展,并将由此产生的节省让利给用户。目前尚无 GPT-6 Terra,尽管 5.6 家族中 Sol、Terra 和 Luna 的命名惯例预设了这款通用的Allzweckmodell;在其之上,仍是本月初推出的旗舰模型 GPT-6 Astra。
性能提升幅度不如价格降幅显著。在专注于业务流程工作流的 Zapiers AutomationBench 上,Luna 比前代提高 5.4 个百分点。在软件工程专业基准测试 DeepSWE v1.1 中,Sol 在最大投入下达到 68.8%,几乎追平 Anthropic 的 Fable 5(Xhigh effort 下为 69.9%),但成本仅约为其五分之一。OpenAI 在发布声明中始终强调每个任务的成本,而非单纯的 Token 价格。此外,回答风格也已调整:更直接,减少行话,篇幅略微缩短。
对于开发者而言,Prompt 缓存的变更可能比资费调整更重要。OpenAI 提高了默认设置下的缓存命中率,并对已缓存的输入 Token 提供高达 90% 的折扣。现在,在不使缓存失效的情况下,可以调整推理投入和工具可用性;明确的断点(Breakpoints)设定了已缓存前缀的结束位置,而新的仪表盘则展示哪些内容被缓存。GitHub 报告称,在过去几个月里,跨数十亿次请求中需要重新处理的提示 Token 比例已减半有余。
Anthropic 于同一天发布了 Opus 5.5,并将 Token 价格从原来的 5/25 美元降至 4/20 美元。即便如此,该模型的价格仍是 GPT-6 Sol 的两倍。Anthropic 表示,Opus 5.5 每完成一项任务所需的 Token 数量更少,这使得在典型工作负载下,其成本比 Opus 5 降低约 40%;同时,Cache 读取价格也下降了 60%。目前尚无人对 Sol 和 Opus 5.5 进行过直接对比。由于难以预测 Agent 在单个任务中会消耗多少 Token,即便价格全面下调,用户对预算的规划依然充满挑战。
与此同时,价格竞争的压力也来自低端市场。在聚合平台 OpenRouter 上,使用中国开源模型而非西方实验室昂贵 API 接口的企业占比,每周在 30% 到 46% 之间浮动。同时,美国实验室和政府机构指责 DeepSeek、Moonshot 和 MiniMax 等中国厂商在工业规模上从西方 Frontier 模型 中窃取知识。Info-Tech Research Group 的 Thomas Randall 将美中双方的关系描述为单一共享体系内的控制权之争,因为双方都依赖于相同的供应链、研究和人才。 → The New Stack、The Deep View、Ars Technica
Synthszr 观点:GPT-6 系列出现了一个明显空缺——上一代 GPT-5.6 中的 Terra,那个对标 Anthropic Sonnet 的均衡型通用模型不见了。Sol 的价格是 2/10 美元,而上代定价为 4/20 美元,OpenAI 等于用自己的定价碾过了自家中端市场:Sol 现在的价格,正是半年前 Terra 赖以立足的价位。对于已把工作流搭建在 5.6 Terra 上的团队来说,目前没有一个干净的升级路径,要么直接跳到 Sol,要么退回 0.10/0.50 美元的 Luna。而这个中端市场,恰恰是中国开源模型的主战场——它们在 OpenRouter 上的使用份额每周约占 30% 到 46%。要么 OpenAI 会在接下来几周内补上 Terra,要么这个空缺本身就是一种表态:OpenAI 打算放弃中间这个细分市场。