← 文章 / AI技术
Simon Willison 4小时前 · 2026-09-04 05:12:46 · 0 阅读

OpenAI 发布 GPT-6 Astra 大模型

GPT‑6 Astravia)GPT-6 Astra "今日开始向部分机构开放,未来几天将陆续面向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户,以及 OpenAI API 和 AWS 用户"——我自己还没试用,暂时没什么好说的。

API 定价与 Claude Fable 5 和 5.1 相同:输入 $10/百万 token,输出 $50/百万 token。这显然是 OpenAI 对标 Fable 的产品,在 OpenAI 自评的大多数基准测试中得分高于 Fable。

最引人注目的是,Astra 在近期(3 月发布)的 ARC-AGI 3 基准测试中拿到 99.9%——但值得注意的是 Fable 5 尚无公开成绩,且 ARC-AGI 博客指出,99.9% 的成绩是用 OpenAI 自定义的"Provider Adapter harness"以 $19K 成本达成的,而默认的 ARC-AGI harness 仅得 62.7%,耗资 $26K。

Provider Adapter harness 在请求之间保留不透明的推理状态,并对更长对话使用压缩,使模型能复用之前的工作。

鉴于最近的 Hugging Face 事件,Astra 在安全任务上表现出色也就不足为奇了:ExploitBench 满分 100%(GPT-5.6 Sol 得 78.5%),ExploitGym 得 42.4%(Sol 得 30.3%),SRE-Bench 二进制逆向工程四次内达成 99.2%(Sol 得 68.7%)。

长上下文方面也更胜一筹:在 OpenAI 的八针测试中,256K–512K token 得 100%,512K–1M token 得 96.3%。OpenAI 或许已攻克长上下文处理的一项持续挑战。

不过它并非全能。Artificial Analysis指出,Astra 在智能指数上仍不敌 Fable:

与 GPT-5.6 Sol 并驾齐驱:GPT-6 Astra 在指数中得 61 分,与 GPT-5.6 Sol 持平,比 Claude Fable 5.1(含回退)低 5 分。模型也落后于 Meta 新发布的 Muse Spark 1.3(最高分)。

但在编码智能指数上表现更好:

引领 Coding Agent Index 成本效率前沿:在最高计算量下,GPT-6 Astra 的成本与 GPT-5.6 Sol (max) 基本持平,Index 得分却高出 2 分;若追求同等得分,其单次任务成本仅为 Claude Fable 5 的一半以下。

待获取访问权限后,我会进一步介绍 Astra。正式发布时,其 API 模型标识将定为 gpt-6-astra

原始来源: Simon Willison

评论 (0)