OpenAI 发布 GPT-6 Astra 大模型
API 定价与 Claude Fable 5 和 5.1 相同:输入 $10/百万 token,输出 $50/百万 token。这显然是 OpenAI 对标 Fable 的产品,在 OpenAI 自评的大多数基准测试中得分高于 Fable。
最引人注目的是,Astra 在近期(3 月发布)的 ARC-AGI 3 基准测试中拿到 99.9%——但值得注意的是 Fable 5 尚无公开成绩,且 ARC-AGI 博客指出,99.9% 的成绩是用 OpenAI 自定义的"Provider Adapter harness"以 $19K 成本达成的,而默认的 ARC-AGI harness 仅得 62.7%,耗资 $26K。
Provider Adapter harness 在请求之间保留不透明的推理状态,并对更长对话使用压缩,使模型能复用之前的工作。
鉴于最近的 Hugging Face 事件,Astra 在安全任务上表现出色也就不足为奇了:ExploitBench 满分 100%(GPT-5.6 Sol 得 78.5%),ExploitGym 得 42.4%(Sol 得 30.3%),SRE-Bench 二进制逆向工程四次内达成 99.2%(Sol 得 68.7%)。
长上下文方面也更胜一筹:在 OpenAI 的八针测试中,256K–512K token 得 100%,512K–1M token 得 96.3%。OpenAI 或许已攻克长上下文处理的一项持续挑战。
不过它并非全能。Artificial Analysis指出,Astra 在智能指数上仍不敌 Fable:
与 GPT-5.6 Sol 并驾齐驱:GPT-6 Astra 在指数中得 61 分,与 GPT-5.6 Sol 持平,比 Claude Fable 5.1(含回退)低 5 分。模型也落后于 Meta 新发布的 Muse Spark 1.3(最高分)。
但在编码智能指数上表现更好:
引领 Coding Agent Index 成本效率前沿:在最高计算量下,GPT-6 Astra 的成本与 GPT-5.6 Sol (max) 基本持平,Index 得分却高出 2 分;若追求同等得分,其单次任务成本仅为 Claude Fable 5 的一半以下。
待获取访问权限后,我会进一步介绍 Astra。正式发布时,其 API 模型标识将定为 gpt-6-astra。