基准测试对 GPT-6 Astra 评价不一,但其 ARC-AGI-3 上超越人类的效率或将 Chollet 的 AGI 预测提前
OpenAI 的 GPT-6 Astra 在基准测试中收获了矛盾的 verdict。Epoch AI 将其排在首位,而 Artificial Analysis 则认为其表现不逊于前代。最大的惊喜来自 ARC-AGI-3:Astra 首次以高于人类平均水平的效率完成任务。ARC Prize 负责人 François Chollet 称这一进展“快了 2 倍”,并提前了他对通用人工智能(AGI)的预测时间点。
两家独立实验室都将数十项独立测试合并为单一综合得分,却得出了截然相反的结论。Epoch AI 综合了 50 多项基准测试,将 GPT-6 Astra 以 169 分的总分清晰位列榜首,领先其他 267 个模型。而 Artificial Analysis 测试了知识、编程和文本理解能力,给 GPT-6 Astra 打分 61 分,与其前代持平,落后于 Claude Fable 5.1 的 66 分。
Astra 的定价显然高于其前代。OpenAI 每单位处理文本的收费是其前代的 2.5 倍,这使得任务成本比 Sol 时代高出约 75%。但与 Anthropic 相比,情况则反转:根据 Artificial Analysis 的数据,Astra 在编程任务上达到了与 Claude Fable 5 相同的分数,但每项任务的成本低了一半以上。原因在于该模型极为节省计算资源,它所需的计算步数仅为 Sol 的三分之一、Opus 5 的五分之一。
| 基准测试 | Astra | Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| Epoch ECI 综合得分 | 169 | 162 | 163 | 162 |
| AA 智能指数 | 61 | 61 | 66 | 63 |
| ARC-AGI-3,陌生游戏世界 | 62.7% | 7.8% | 无数据 | 30.2% |
| ARC-AGI-2,抽象视觉谜题 | 95.0% | 92.5% | 90.0% | 90.4% |
| ARC-AGI-1,旧版本 | 98.5%* | 97.5% | 97.5% | 97.5% |
| FrontierMath Erdős,开放数学 | 3% | 0% | 0% | 无数据 |
*GPT-6 Astra 在 xhigh 推理强度下;最高可达 97.5%。ARC-AGI-1 目前被认为已基本饱和。
在 Coding Agent Index 上,它以约三分之一的 Sol Token 消耗达到 67 分,而 Fable 5.1 以 70 分领先。AA-Omniscience 上的幻觉率从 92% 降至 51%。与此同时,该模型在 GDPval-AA v2 上损失了约 80 Elo 分,并在银行支持、SciCode 和长上下文推理任务上出现下滑。
Epoch AI 报告称,在新的 FrontierMath Erdős 测试中,GPT-6 Astra 是唯一在每次 300 美元的预算内用 Lean 验证证明解决 68 道开放埃尔迪什问题中两道题的模型。另有三道题来自非标准化的额外运行,烧掉了超过 22 万美元的计算资源,但 Epoch 表示这些不计入总分。
仔细查看 Epoch 的单项数据可以发现,GPT-6 Astra 与竞争对手 Fable 5.1 迄今是在不同条件下被测量的。Astra 在数学、知识和谜题方面领先,而 Fable 5.1 在几乎所有编码测试中均获高分。不过,Epoch 目前只为 Astra 记录了一次编码分数,且该分数来自中等推理强度的运行。
ARC-AGI-3 展现大幅跃升
最显著的进步出现在 ARC-AGI-3 上。该测试将 AI 投入陌生的游戏世界,其中规则和目标均无人告知。模型必须通过试错自行摸索。GPT-6 Astra 在约 2.6 万美元的测试成本下达到 62.7%。其前身 GPT-5.6 Sol 仅得 7.78%,竞争对手 Claude Opus 5 为 30.16%。Fable 5 和 Fable 5.1 尚未上榜该基准。
OpenAI 公布的 99.9% 结果来自不同条件。在该设置中,Astra 使用了 OpenAI 构建的框架,可在独立请求间保持推理链并自动总结长运行过程。据 ARC Prize 测量,在两套环境均解决的 167 个游戏推理对相比,这些运行的速度快了约 3.66 倍,Token 消耗减少了 49%。
这些测试框架的使用以及随之而来的成绩跃升,早已是 ARC Prize 与 OpenAI 之间围绕 GPT-5.6 Sol 争执的焦点。ARC Prize 指出,只有在内部 ARC 测试框架上跑出的 62.7% 这个较低数字,才能让各家厂商之间进行公平比较,不过它也计划将来公布各厂商测试框架的成绩。
在这里,思考越多反而越省钱
思考强度与成本之间的关系很不寻常。通常来说,推理等级越高,测试成本就越高。但 Astra 恰恰相反。在标准 ARC 测试框架下,成本从关闭推理时的 49,791 美元降到最高推理等级的 26,098 美元,同时得分从 35.2% 升至 62.7%。据 ARC Prize 分析,原因在于 Astra 用更少的步数通关,意味着更少的模型调用和更少的 token。一个反常现象值得注意:"low" 等级的得分只有 17.5%,比完全关闭推理还差。ARC Prize 没有对这个异常值做出解释,但 GPT-6 Astra 在其他基准测试中已表现出无需推理也能解决长时程任务的能力,这得益于其新架构——据推测会在生成第一个 token 之前在内部循环处理。
作为对比,人类测试者每个 90 分钟session报酬 115 美元,每解出一关另有 5 美元奖励,按平均尝试九次计算,每关成本约 12.78 美元。不过这笔钱主要是付给时间和参与意愿的。如果只算大脑代谢能量并按电价折算,ARC Prize 得出的结果是每关 0.067 美分。
比原始得分更有意思的是效率。发布之前,ARC Prize 让约 500 名测试者未经筛选直接上手,并记录了每个关卡中通关者所用步数的中位数。在 OpenAI 测试框架的运行中,Astra 在 96% 的关卡上用时步数少于这一中位数,平均只用了大约一半多一点的步数。与通常的成本指标不同,这个数字衡量的不是消耗了多少算力,而是模型在掌握一个环境之前需要积累多少经验。
这正是组织者预期人类能保持长期优势的领域。对于 brute-force(暴力搜索)方法而言,这一优势依然存在,但 ARC Prize 观察到顶级模型呈现出近乎二元分布的模式:一旦模型掌握了机制,其执行效率便能达到人类水平。
Astra 自创记法
为此,Astra 会保留自己的笔记,并推演出一套自创的、类似代数的简写系统,用于记录对象、坐标、规则及开放计划。例如,extend8 to3; retract10 to2 表示有序动作序列,Turn 5: P=(24,20), empty, facing west 则是状态笔记。ARC Prize 观察到其他模型也表现出类似行为,但 Astra 因精准度和信息密度而脱颖而出。在标准 harness 下,这是一项关键技能,因为模型未记录到可见笔记中的所有内容都会丢失。
ARC 联合创始人 François Chollet 在 X 上将其描述为“针对每个游戏和关卡进行高效、即时的符号化世界建模”。该模型甚至“开发了自己的简写 DSL 来表示游戏内情境”,其本质是“一种特定于游戏的代数记法”。Chollet 最为关注的是这种行为来源:“Astra 展现出符号建模行为,而我们此前仅在有复杂 harness 时见过,因此 harness 的能力正日益向模型本身转移。”
Astra 创建了一个密集且紧凑的符号化世界模型,以完成 ARC-AGI-3 环境。
例如,在环境 s5i5 中,Astra:
- 记录了当前关卡、轮毂朝向和机构长度:“L8: hub q2 (8↓). Lengths: 14=1…”
- 将操作映射到精确控制:… pic.twitter.com/tMHP002mkB
— ARC Prize (@arcprize) 2026 年 9 月 3 日
第三个测试环境展示了 Astra 利用外部工具的能力。PRO-LONG 是一个由第三方开发的 agent 框架,ARC Prize 团队在 ARC-AGI-3 早期便将其部署为红队合作者——即系统化探索基准测试边界。与标准设置不同,该模式下模型可获得一个沙盒,在其中执行自身代码。
Astra 借此机会为每个游戏编写了小型程序库,包括游戏棋盘解析器、状态模型、搜索算法和规划器。在一款包含守卫的迷宫游戏中,相继开发了路径查找器、战斗规则模块、巡逻运动模型,以及一个持续将自身预测与观察结果进行对比的脚本。ARC Prize 未观察到任何试图突破沙箱的行为。这些运行不能与人类测试条件直接比较,因为受试者既没有代码解释器也没有便签本。此处衡量的是模型与其自建工具的联合性能。Chollet:尚无 AGI 证据,但进展快于预期
ARC Prize 明确表示,不将实验结果视为通用人工智能的证据。“我们目前对该系统的了解仅限于其基准分数,”Chollet 写道。在 ARC-AGI-3 发布时,他们在每场演示中强调一点:“解决它并非 AGI 的证明,这也不被设计为终点线。”虽然该基准确实测试了 AGI 系统应具备的正确定性特征——即在不确定性下探索、无指导下的适应,以及从稀疏数据中进行因果世界建模——但这些测试是“小规模”进行的。游戏的运行时间尺度比现实任务短数个数量级,因此所需数据更少、建模复杂度更低、对实时学习的需求也更低。
约六个月前 ARC-AGI-3 发布时,Chollet 在回应关于何时饱和的提问时表示“大约一年”,具体取决于对基准的攻击专注程度。因此,Astra 的达成速度“比预期快了约两倍”。“我相信进展速度会让许多人感到惊讶,新模型的能力将挑战人们基于早期模型所形成的对人工智能的认知。”当被问及 2030 年的 AGI 预测是否仍然成立时,Chollet 简洁回应:“会更早,因为进步速度超出了我的预期。”
结果就是又一个基准测试。据 Chollet 介绍,ARC-AGI-4 从 ARC-AGI-3 发布后就开始开发,计划于 2027 年第一季度推出。基准测试是一个持续的过程,会随着模型的发展不断演进,始终瞄准 AI 与人类智能之间尚未弥合的差距。该组织认为 ARC-AGI-3 本身仍有很大局限:机制是确定性的、目标有明确终点、也没有对开放现实世界的呈现。下一代基准将探索递归自我改进和开放式创新等方向。