GPT-6.1 Sol 性能逼近 Astra,价格仅为其五分之一
要点
- OpenAI 发布 GPT-6.1 Sol,性能接近计划中的旗舰模型 Astra,但成本只有其五分之一。
- 旗舰模型 GPT-6.1 Astra 因安全问题暂缓发布——内部测试中它出现欺骗行为,并擅自调用工具。
- Sol 现已面向付费用户开放,可用于 ChatGPT Work、Codex 和 API,定价与 Claude Sonnet 5.5 相当。
OpenAI 的新模型 GPT-6.1 Sol 以极低的成本逼近 GPT-6 Astra 的性能,而原定旗舰 Astra 因安全问题暂时搁置。
OpenAI 这次押注的是性价比,而不是极致性能。旗舰模型 GPT-6.1 Astra 因安全问题未能按计划发布,公司转而推出价格低得多的 GPT-6.1 Sol。据 OpenAI 称,该模型在 agentic coding、computer use 和办公任务上的表现接近 Astra,成本只有五分之一。
API 定价为输入每百万 token 2 美元、输出 10 美元,与 GPT-6 Sol 和 Anthropic 的 Claude Sonnet 5.5 持平。缓存输入每百万 0.10 美元,比非缓存输入便宜 95%,而 Sonnet 5.5 的缓存输入为 0.20 美元。这对需要在多次请求间复用上下文的 agent 来说尤其划算。
| 每百万 token 价格 | Claude Opus 5.5 | GPT-6 Sol | GPT-6.1 Sol | Claude Sonnet 5.5 |
|---|---|---|---|---|
| 输入 token | 4 $ | 2 $ | 2 $ | 2 $ |
| 输出 token | $20 | $10 | $10 | $10 |
| 缓存读取 | $0.20 | $0.20 | $0.10 | $0.20 |
| 缓存写入 | $5 | $2.50 | $2.50 | $2.50 |
从今天起,Plus、Pro、Business、Enterprise 和 Edu 用户就可以在 ChatGPT Work 和 Codex 中使用 Sol,不过它尚未在普通聊天功能中上线。开发者可以在 API 中以 gpt-6.1-sol 的标识访问该模型。一款极速版 Sol 预计将在未来几天内推出,它在 Codex 中的 Token 生成速度将提升最高八倍。
OpenAI 官方数据:Sol 表现略逊于 Astra
所有基准测试数据均来自 OpenAI,该机构将其描述为初步结果。包括与 Sonnet 5.5 在内的公平对比,要等到正式发布后才可能进行。
在 DeepSWE v1.1 编程基准测试中,OpenAI 表示 Sol 的成本约为 Astra 的五分之一,表现却与其持平,且比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。在测试计算机操作能力的 OSWorld 2.0 基准测试中,Sol 比其前代产品高出 7 分,得分接近 Astra 但落后 2.1 分,成本约为 Astra 的七分之一。
在 GDP.pdf 文档基准测试中,OpenAI 称 Sol 的成本不到 Anthropic Opus 5.5 的一半,但表现更优。在涵盖多步骤业务流程的 AutomationBench 中,在中等推理力度下,Sol 以约三分之一的成本领先 Opus 5.5 2.2 分。
根据 OpenAI 数据,在 Terminal-Bench 科学测试中,Sol 的成绩是其前代产品的两倍多。一个平均科学任务的成本为 5.47 美元,而 Opus 5.5 为 23.21 美元,Astra 为 23.80 美元。Astra 仍以 68.1% 的最高得分领先,OpenAI 继续推荐用 Astra 处理最具挑战性的研究任务。
OpenAI 还声称 Sol 在事实准确性上更可靠。在一些早期模型容易出错的刻意高难度提示下,低推理力度时错误答案的比例从 11.4% 降至 7.7%。OpenAI 承认,这些提示并不具备普通使用场景的代表性。
Sol 恰恰在 Astra 表现不佳的领域变得更安全
OpenAI 表示,Sol 在安全测试中的表现也远超前代产品,尽管仍略逊于 Astra。Sol 绕过“访问被拒绝”等明确阻断机制的尝试发生在 23.5% 的案例中,低于 GPT-6 Sol 的 64.4%。Astra 的这一比例为 17.4%。未经授权交易等不良结果在 Sol 中发生率为 4.3%,而前代产品为 17.4%,Astra 为 2.9%。
搜索工具一旦失效,Sol 会在 2.8% 的情况下选择隐瞒而非上报;GPT-6 Sol 的隐瞒率为 4.9%,Astra 仅为 1.5%。与 Astra 及其前代一样,Sol 从未试图绕过自动安全检查。OpenAI 强调,这些测试刻意设置了极高难度,且未启用产品实际部署时的全套安全护栏。 安全性也是该旗舰模型存在的短板。据《华尔街日报》报道,OpenAI 已决定放弃原计划,不再于十月在 ChatGPT 和 Codex 中上线 GPT-6.1 Astra,原因是内部测试阶段研究人员提出了安全隐忧。安全负责人 Saachi Jain 表示,该模型的欺骗性更强,且常在未经许可的情况下自行推进任务,有时甚至以高风险方式使用外部工具,尽管它在任务完成度上表现更佳。 OpenAI 并未打算彻底放弃该模型。其计划将基础模型用于后续强化学习训练,并可能为未来 GPT-6 代际提供支撑。Jain 指出,公司亟需找到平衡点:既要让模型严格遵循任务边界,又要避免其变得消极怠工。