OpenAI GPT-6 Sol 和 Luna 价格减半但性能提升有限
随着 GPT-6 Sol 和 Luna 的推出,OpenAI 在其产品阵容中新增了两款更便宜的模型。这两款新模型在性能上与前辈持平,但 Token 价格减半,旨在与 Anthropic 的一些高价模型相抗衡。
最显著的变化是与 GPT-5.6 Sol 和 Luna 相比,价格大幅削减了 50%。目前,GPT-6 Sol 的输入费用为每百万 Token 2 美元,输出费用为每百万 Token 10 美元;而 Luna 的输入费用为每百万 Token 0.10 美元,输出费用为每百万 Token 0.50 美元。
OpenAI 将价格下调归因于缓存和推理方面的改进,并表示这些节省的成本将直接惠及用户。这使得其定价区间与更便宜的开放权重模型处于同一水平。此前阵容中最便宜的模型 Terra 已不再提供。
| 模型 | 输入 | 输出 |
|---|---|---|
| GPT-6 Sol 对比 GPT-5.6 Sol | $4 → $2 | $20 → $10 |
| GPT-6 Luna 对比 GPT-5.6 Luna | $0.20 → $0.10 | $1.20 → $0.50 |
根据 OpenAI 的介绍,Sol 专为重复性复杂任务设计,例如构建新功能、代码审查、调试以及数据分析。而 Luna 则旨在以低成本处理大量定义明确的常规任务,如文档摘要、信息提取和简短问答。
除了降低 Token 价格外,OpenAI 还声称已改进了 GPT-6 的提示词缓存功能,对缓存的输入 Token 提供 90% 的折扣。全新的提示词缓存仪表盘和诊断工具旨在帮助开发者优化缓存使用;此外,开发者现在可以调整推理努力和工具可用性,而无需使缓存失效。
发布初期,这两款模型均可在 ChatGPT Work 和 Codex 中使用,覆盖 Plus、Pro、Business、Enterprise 和 Edu 订阅用户。免费和 Go 用户可通过桌面版应用访问 Luna,但这两款模型最初不会在常规聊天界面中提供。在 API 中,它们分别标识为 gpt-6-sol 和 gpt-6-luna,而在 ChatGPT 中的访问权限正逐步开放。
GPT-6 Sol 和 Luna 的基准测试优势主要体现在成本上
OpenAI 将新模型的定位重点放在与 Anthropic Claude 系列相比的性价比上。在测试计算机使用能力的 OSWorld 2.0 基准测试中,OpenAI 表示 GPT-6 的表现与 Claude Opus 5 相当,但成本降低了约 80%,尽管 Astra 在该类别中仍然领先。
在测试 47 种工具跨业务工作流程的 AutomationBench 上,据报道 GPT-6 Sol 在最高力度设置下击败了处于最高力度的 Claude Opus 5。OpenAI 指出,Sol 的单任务成本仅为 Opus 的 9%。与此同时,Luna 在性能上较前代提升了 5.4 个百分点,成本却降低了 58%。
在编程方面,OpenAI 提供了两项基准测试的结果。FrontierCode 1.1 测试 AI 代理生成的代码是否真正能整合到现有代码库中,重点检查测试质量、代码风格以及需求合规性。在最高力度设置下,GPT-6 Sol 的得分为 49.3%,单任务成本为 2.14 美元,这与 Claude Fable 5.1 的表现大致持平。后者在最高力度下得分 50.3%,但单任务成本高达 12.83 美元,是前者的六倍。Claude Opus 5 在中等力度设置下(该设置在其最佳结果中表现最佳)得分为 53.4%,单任务成本为 4.31 美元。
OpenAI 的推理等级设置愈发复杂
在 DeepSWE v1.1 基准测试中,该测试专门针对在真实代码库中进行长时间的高难度软件工程任务,OpenAI 报告 GPT-6 Sol 在最高力度下的得分率为 68.8%。这一成绩与 Claude Fable 5 在“xhigh”设置下的最佳得分 69.9% 仅相差 1.1 个百分点;而 Fable 在“max”设置下得分为 69.7%,单任务成本为 21.63 美元。
当然,Sol 的目标并非在此处冲击性能极限。Claude Opus 5 在最高力度下的得分率达 73.7%,单任务成本为 11.84 美元;而 OpenAI 自家的 GPT-5.6 Sol 得分率为 72.7%,单任务成本为 6.46 美元。GPT-6 Sol 的卖点在于以极低的价格接近这些顶级成绩。在“xhigh”设置下,其得分率为 66.6%,单任务成本仅为 1.00 美元。Luna 的价格更低,在最高力度下达到了相同的得分率,单任务成本仅为 0.22 美元。OpenAI 表示,Luna 的结果与处于中等力度的 Claude Opus 5 和 Claude Fable 5 相当,但成本比 Opus 低 93%,比 Fable 低 96%。
DeepSWE 的结果也让 OpenAI 在自家模型之间的选择变得头疼。Luna 开到最高推理力度就能追平 "xhigh" 档的 Sol,成本还便宜 78%。而把 Sol 也开到最高,成绩只到 68.8%,仅比 Luna 高 2.2 个百分点。实际使用中,谁有精力去仔细分辨这些差别?

总体来看,OpenAI 挑选的基准测试颇有"拣好听的说"之嫌。像衡量知识工作的 GDPval、衡量智能体编程的 Terminal-Bench 4.0 这类常规项目都没出现。此外,OpenAI 似乎也没注意到 Opus 5.5 的发布——它可能比 Opus 5 便宜最多 40%,性能还显著更强。
第三方分析:实际进步有限
据 Artificial Analysis 分析,GPT-6 Sol 和 Luna 的单任务成本比前代减半,但智能评分仍停留在 GPT-5.6 的水平——部分测试有提升,部分反而退步。在编程智能体指数上,Sol 升了 2 分,Luna 降了 2 分。

Artificial Analysis 还发现,两款模型在两个重要的知识工作基准上出现了退步。在覆盖 44 个专业领域、测试计算机知识工作能力的 GDPval-AA v2.1 上,Sol 约跌了 100 Elo 分,Luna 约跌 75 分。人工检查显示,退步主要源于输出呈现质量下降和结果不完整。
Artificial Analysis 之前也遭遇过批评,起因是它因使用过时的基准测试,对 OpenAI 的 Astra 模型评分过低。随后进行了两次基准更新,Astra 重新夺回榜首。这次会发生什么,尚待观察。
无论如何,OpenAI 在 GPT-6 Sol 和 Luna 上明显押注于价格优势。如今,这些模型需要在日常实际工作中证明自己,因为基准测试只能反映部分情况。这也可能解释了为何 OpenAI 省略了部分测试。结合不同的推理层级,以及有时看似为基准测试优化过的结果(无论是否有意为之),每次新模型发布都让基准测试这场游戏显得愈发荒谬。