GPT-6 Astra 发布:OpenAI 宣布迈入 AGI 时代
要点
- OpenAI 正在推出 GPT-6 Astra,这是其迄今最强大的模型。付费 ChatGPT 用户和云平台用户将在未来几天内获得访问权限。
- 在基准测试中,Astra 在逻辑、数学和软件工程等关键领域均大幅领先前代 GPT-5.6 Sol 以及 Anthropic 的 Fable 5 模型。
- Token 价格高出 2.5 倍,与 Anthropic 的 Fable 5.1 持平,但 OpenAI 认为根据具体使用场景,每个任务的完成成本实际上更低。
更新 – 2026 年 9 月 3 日
- 补充了 Codex 和 GPT-6 Pro 的详情以及发布视频
OpenAI 已正式推出 GPT-6 Astra,这是其迄今能力最强的模型。总裁 Greg Brockman 表示,它或许已经达到「AGI」的标准,或至少触手可及——按 OpenAI 自己的定义,即一种在大多数具有经济价值的任务上超越人类表现的 AI 系统。
GPT-6 Astra 首先通过 OpenAI 的 Daybreak 计划向精选机构开放,ChatGPT Plus、Pro、Business 和 Enterprise 用户的更广泛可用性预计在未来几天内上线。该模型也将通过 API 以及 AWS Bedrock、Microsoft Azure 等云平台提供。Pro、Business 和 Enterprise 订阅用户可访问 GPT-6 Astra Pro——一个性能更高的变体版本,但企业工作区管理员需要手动启用该模型。
Astra 在德克萨斯州的 Stargate 设施中使用超过 10 万张 GPU 进行预训练。OpenAI 研究员 Aidan Clark 称这是该公司有史以来规模最大的训练任务。Clark 表示,从 Sol 到 Astra 的能力跃升,大于此前模型到 Sol 的提升幅度,部分原因在于之前的 AI 模型参与了训练过程的监控。
在OpenAI发布的基准测试中,Astra的表现远超其前身GPT-5.6 Sol及Anthropic的Fable系列。Astra在多个领域均斩获顶尖成绩:逻辑推理(ARC-AGI-3高达99.9%,不过是在其自有测试条件下达成)、数学(FrontierMath Tier 4 v2达97.6%)、软件工程(DeepSWE v1.1达74.1%)、专家知识(GPQA Diamond达96%)、工程(BenchCAD达95.9%)以及网络安全(ExploitBench满分100%)。
计算机使用能力
| 基准测试 | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| Agents' Final Exam | 59.3% | 53.6% | 48.7% | 55.5% | ||
| OSWorld 2.0(离线、部分) | 72.6% | 65.7% | 70.2% ³ | |||
| ScreenSpot-Pro(无工具) | 92.7% | 76.9% | 87.3% ¹⁷ |
专业能力
| 基准测试 | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | |
| BenchCAD | 95.9% | 83.3% | 84.3% ⁵ | 67.5% ⁵ | 82.1% ⁵ | |
| BrowseComp | 91.5% | 90.4% | 87.4% | 90.8% | ||
| OpenScore String Quartets | 0.84 | 0.19 | ||||
| 内部设计任务 | 50.0% | 47.4% | 35.8% | |||
| 内部数据科学任务 | 40.9% | 30.5% | 34.7% | |||
| AA Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
BenchCAD成本:较Sol低约43%,较Fable 5.1低约86%。
编程
| Benchmark | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| Terminal Bench 4.0 | 57.7% | 37.3% | 55.8% | 42.0% | 52.3% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended | 64.5% ⁸ | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main | 53.3% ⁸ | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration | 63.9% | 42.7% | 57.8% | 50.3% | ||
| AA Coding Agent Index v1.4 | 67.0 | 65.1 | 67.2 | 68.1 | 61.2 |
Terminal-Bench 4.0 成本:比 Sol 低约 9%,比 Fable 5.1 低约 63%。
学术能力
| Benchmark | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | |
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 87.8% | 73.2% | |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
| Humanity's Last Exam (tools) | 57.2% | 65.0% | 63.8% | 63.6% |
低成本配置:Terminal-Bench Science 得分 61.1%,成本降低约 27%;GPQA Diamond 得分 94.9%,成本降低约 37%。质数间隔从 240 优化至 186,且一个在大间隔边界项上取得了 80 多年来的首次改进。
科学与健康
| Benchmark | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gem 3.8 F |
|---|---|---|---|---|---|---|
| GeneBench Pro | 37.8% | 28.7% | ||||
| MedChemBench(内部) | 49.3% | 47.4% | ||||
| LifeSciBench | 60.3% | 59.9% | ||||
| HealthBench Professional | 63.4% | 60.5% | 56.6% ¹¹ | 60.9% ¹¹ | 54.5% ¹¹ | 52.1% |
Fable 5 和 5.1 因拒绝回答大多数问题,未纳入 LifeSciBench、GeneBench Pro 和 MedChemBench 的统计。
网络安全
| 基准测试 | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| ExploitBench | 100.0% | 78.5% | 70% | ||
| ExploitGym | 42.4% ¹³ | 30.3% ¹³ | 30.4% ¹⁷ | 28.4% ¹⁷ | 22.0% ¹⁷ |
| ExploitBench(2026年6–8月) | 39.0% | 5.5% | |||
| SRE-Bench | 88.0% | 55.9% | 12.5% | ||
| SEC-Bench Pro | 85.4% | 79.1% |
SRE-Bench 在四次尝试内的结果:Astra 为 99.2%,Sol 为 68.7%。评估期间 Astra 发现了两个此前未知的零日漏洞。
对齐表现(越低越好,Impossible ExploitGym 除外)
| 指标 | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| 计算机安全 | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% |
| 加 AutoReview 后同上 | 1.8% | 4.5% | |||
| 规避率 | 0.00% | 0.29% | |||
| ExploitGym 诱捕 | 0.0% | 48.2% | |||
| Impossible ExploitGym | 100.0% | ||||
| 幻觉率 | 4.2% | 12.2% |
不可能任务范围测试:Sol 有 48% 的时间超出了其授权目标,而 Astra 为 0%。Astra 错误陈述自身能力的概率低 3 倍。
长上下文
| 基准测试 | Astra | Sol |
|---|---|---|
| MRCR v2 8-needle 256K–512K | 100.0% | 91.5% |
| MRCR v2 8-needle 512K–1M | 96.3% | 73.8% |
抽象推理
| 基准测试 | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% ¹ | 7.8% | – | – | 30.2% |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% |
据报道,在科学工作中,该模型改进了关于素数间隙的数学结果,并在生物学、化学、医学和物理学评估中创下新纪录。OpenAI 还将 Astra 定位为能够像人类一样可靠操作计算机的模型;在衡量该能力的 OSWorld 2.0 基准上,Astra 平均每题耗时约 40 分钟,得分 72.6%,而 Sol 平均每题耗时约 75 分钟,得分 65.7%。“你在电脑上能做的事,Astra 都能替你做到,而且更快。” 公司声称。
与此同时,OpenAI 还更新了其 Codex 编程环境。一项新的实验性功能允许模型在长会话期间跨多个上下文窗口做笔记,而不是每次都把所有内容压缩成单一摘要。较早的上下文窗口仍可搜索,因此即使之前的消息内容未被记录在笔记中,Astra 也能查找需求或测试结果。OpenAI 计划在未来几周内将此功能设为默认。
比 Sol 更贵,但 OpenAI 称单次任务成本更低
GPT-6 Astra 通过 API 的标准模式收费为每百万输入 token $10、每百万输出 token $50。承诺速度提升 2.5 倍的快速模式价格翻倍,使 Astra 比 GPT-5.6 Sol 贵 2.5 倍,定价区间与 Anthropic 的 Fable 5.1 相当。
Brockman 认为,token 价格已不再是比较模型的可靠指标,因为 OpenAI 的 token 与竞争对手的不同,甚至在不同模型系列之间也不可简单比较。他指出,关键在于 每个完成任务的单价,而 OpenAI 已在 尝试这种定价模式。据公司称,在 DeepSWE v1.1 上,Astra 的最高配置相比 Sol 将每项任务的预估 API 成本降低了约 57%。
在媒体简报会上,Brockman 承认并不存在一个明确定义的 AGI 时刻;OpenAI 创始之初,团队原以为会有人人都能识别的明显门槛,但实际情况并非如此,过渡过程比预期更为渐进,这与 去年春天 OpenAI 阐述的立场一致。Brockman 在简报会结尾 表示:“欢迎进入 AGI 时代。”此前,OpenAI CEO Sam Altman 曾表示,按他的定义,到今年年底将迎来 AGI。
首个触及 OpenAI 关键网络安全阈值的模型
Astra 是 OpenAI 在《准备框架》(Preparedness Framework)中首次归类为“高风险”的模型。这意味着在获得相应工具和权限后,该模型无需人类逐步引导,即可在防护严密的系统中发现未知漏洞并构建利用链。OpenAI 同时承认,Astra 的书面推理能力比 GPT-5.6 Sol 更难监控。
在衡量模型发现并利用真实软件漏洞能力的 ExploitBench 基准测试中,Astra 取得了满分 100%。OpenAI 表示,评估过程中该模型发现了两个此前未知的漏洞,公司随后已向受影响厂商报告。人类专家证实,Astra 能够识别包括浏览器和操作系统在内的多个软件类别中的新型零日漏洞。
目前,这些最先进的网络安全能力仅限用于 Daybreak Blue 计划中的受信任防御方。OpenAI 此前曾推迟 Astra 的发布,以进行更多安全测试。这类双重用途技术是把双刃剑:能自主发现漏洞的智能体,既可以辅助防御者修补漏洞,也可以协助攻击者加以利用。