OpenAI的GPT-6 Astra在ARC-AGI-3基准测试中的表现
- GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上以 $26K 成本取得 62.7% 的分数(Standard harness 允许模型携带自行选择的注释贯穿整个环境);而以 $19K 成本在 Provider Adapter harness 下取得 99.9% 的分数(该 harness 在请求之间保留不透明的推理状态,并使用压缩处理更长对话,使模型能够复用先前工作)。
- GPT-6 Astra 在 ARC-AGI-3 的行动效率上超越人类基线,在 96% 的关卡中使用的行动次数少于受测人类的中位数。
- GPT-6 Astra 的一个关键行为是,它能够将陌生环境转化为紧凑的符号化世界模型:将游戏机制表示为逻辑规则,并构建自己的领域专用语言速记来跟踪状态、规划行动。
ARC-AGI-3 是一个用于研究代理智能的基准测试,采用新颖、抽象的回合制环境。代理必须在没有明确指令的情况下,通过探索、推断目标并构建对环境的内部模型来有效规划行动。你可以亲自体验 ARC-AGI-3。
你的浏览器不支持内嵌视频。
这些环境仅包含核心知识先验,并通过与人类参与者的受控测试校准难度。人类可以解决 100% 的环境。
ARC-AGI 系列的目标是衡量当前人工智能与 AGI 之间的"剩余差距"。我们将 AGI 定义为系统以等同于人类的效率掌握人类能够掌握的任何技能的能力。
ARC-AGI-3 是ARC-AGI 基准系列的第三代产品,在ARC-AGI-1和ARC-AGI-2的基础上测试更广泛的代理能力。每一代都在前一代基础上扩展——随着前沿 AI 能力的进步,我们的基准也必须同步推进。
ARC-AGI-3 测试代理智能的四个组成部分:
- 探索:在真实环境中,信息很少被动提供。代理必须通过主动与环境互动来获取信息。
Astra 成绩

使用我们的 Standard 接口Standard接口允许模型携带自己选择保留的笔记贯穿整个环境。(该接口支持模型携带自身筛选出的笔记贯穿整个环境),OpenAI 的 Astra(max)在 ARC-AGI-3 Semi-Private 上取得 62.7% 的得分,花费 $26K。使用 Provider Adapter 接口Provider适配器接口在不同请求间保留不透明推理状态,并针对长对话使用压缩技术,使模型能够复用前期工作。(该接口在不同请求之间保留不透明推理状态,并对长对话采用压缩策略,允许模型复用先前的工作成果),Astra(high)得分达 99.9%,花费 $19K。两者均为目前最优成绩。详见 排行榜。
| 推理强度 | Standard 接口Standard接口允许模型携带自己选择保留的笔记贯穿整个环境。 | Provider Adapter 接口Provider适配器接口在不同请求间保留不透明推理状态,并针对长对话使用压缩技术,使模型能够复用前期工作。 |
|---|---|---|
| max | 62.7%,$26,098 | 98.6%,$17,332 |
| xhigh | 59.3%,$37,317 | 98.4%,$18,147 |
| high | 54.8%,$40,705 | 99.9%,$18,817 |
| medium | 38.6%,$48,090 | 98.4%, $19,285 |
| low | 17.5%, $38,166 | 98.0%, $21,298 |
| none | 35.2%, $49,791 | 96.7%, $23,457 |
为对比成本,在受控测试中,人类参与者每次90分钟报酬115美元,另加每完成一局奖5美元。参与者每轮约尝试九局,不含奖金时每局尝试成本约12.78美元。
这笔费用主要买的是参与者的时间与意愿,而非大脑实际消耗的精力(后者才是对比AI的合理参照)。若仅计算大脑能耗并按电费折算,每次会话仅需约0.6美分,折合每局尝试约0.067美分。1
分析
除了分数,Astra的回放记录还展示了它如何将陌生的游戏机制转化为实用的工作模型。其中三点尤为突出:它自行提炼的紧凑代数符号、与人类对比的行动效率,以及它自研的定制工具。
自定义代数符号
游玩ARC-AGI-3时,Astra会自行筛选要保留的策略笔记。它会跟踪物体、坐标、规则及待办计划,同时使用一套专为当前环境生成的自定义领域特定语言(DSL)进行标注。
我们曾在其他模型中也见过类似做法,但Astra的笔记胜在精准且信息密度极高。它将场景提炼为一套紧凑的类代码符号体系:明确物体位置、交互方式,以及各动作的严格执行顺序。这属于临场即兴的代数速记,而非成熟的编程语言。例如:
- 游戏状态:
L8: hub q2 (8↓). Lengths: 14=1…用于记录关卡、局部旋转索引及机构长度。s5i5,第219帧 - 多步计划:
extend8 to3; retract10 to2; shorten8 to1记录了颜色-8 和颜色-10 机制的一系列有序变更。s5i5, frame 219 - 控件与坐标:
9−=(39,4), rotate=(49,18), 14+=(59,11)将操作映射到执行该操作的控件坐标。s5i5, frame 235 - 时间与位置:
Turn 5: P=(24,20), empty, facing west将回合计数器与玩家的位置、携带状态和朝向结合起来。wa30, frame 708

s5i5,利用实时生成的代数速记法追踪状态并规划动作。动作效率与人类对比
在推出 ARC-AGI-3 之前,我们测试了约 500 名普通公众,以建立人类在动作效率上的基线,即人们多快能解决每个环境。参与者并非基于解谜经验或能力进行筛选。2
对于每个关卡,我们以完成该关卡的玩家动作数的中位数作为"人类基线"。这为我们对比人类和 AI 的表现提供了参照。需要更多动作的 AI 动作效率较低,反之则更高。
在 Provider Adapter harness(该框架可在请求之间保留不透明的推理状态,并对更长对话使用压缩,从而让模型复用已有成果)中,Astra (max) 在 96.0% 的关卡上使用的动作数少于人类基线,且平均每个关卡少用 51.7% 的动作。这是一个实质性里程碑——按 ARC-AGI-3 的动作效率衡量标准,Astra 已达到并超越了人类水平。
顺带一提,在推出 ARC-AGI-3 之前,我们曾假设动作效率仍将是人类与 AI 的分水岭。我们预料即使 AI 解决了某个环境,其所需探索(动作)量可能也远超人类。暴力方法确是如此,但前沿 AI 呈现出更偏二值化的模式:一旦前沿 AI "理解"了机制,其执行效率通常就在人类效率范围内。
Astra 与人类的动作效率对比

每个点代表 Astra (max) 完成的一个关卡。位于实线下方的点表示其动作数少于人类基线。
上图将 Astra 完成各关卡所用动作数与人类基线进行对比。这也进一步说明了为何 ARC-AGI-3 衡量的是动作效率而不仅是任务是否完成——仅以完成度计分,我们只知道 Astra 完成了某个环境,却不知道它学习解决问题的效率有多高。
大多数基准测试只衡量成本效率——即计算资源的消耗——但行动效率衡量的是与环境的交互经验消耗。
Astra 的结果显示,其执行方案所需的交互次数少于人类基线。
Agent Harness 中的自定义工具
我们还在 PRO-LONG harness(论文)中评估了 Astra,这是 ARC-AGI-3 的早期红队测试伙伴。在该高级设置中,Astra 可以访问一个沙盒环境来执行自定义代码 3。
我们观察到 Astra 为每个游戏创建了定制的 tool 集合:棋盘解析器、游戏状态模型、搜索算法、规划器以及持久化笔记。在更复杂的运行中,Astra 甚至生成了面向特定游戏的小型软件库。
例如,在 tu93(一个有守卫和移动巡逻队的迷宫类游戏)中,Astra 从导航入手构建了 maze_solver.py,随后在 combat_solver.py 中加入战斗规则,在 patrol_solver.py 中对移动巡逻队建模,并用 sync_state.py 来验证预测与观测的一致性。
分析 Astra 在 PRO-LONG 中的表现很有价值,因为它展示了借助外部工具时的能力上限。但这与受控人类测试的条件不同——我们的测试参与者没有代码解释器、草稿纸等辅助工具,因此 PRO-LONG 的结果应理解为模型与其工具的联合性能。

tu93。两种 Harness,两个问题
我们的标准 harness 用于 ARC-AGI-3,考察的是模型在统一、中性的最小接口下如何比较。该接口提供了解决每个游戏所需的全部信息,但保留哪些内容写在可见笔记中则由模型自行决定。我们相信,未来的 AGI 应当能在这些条件下解答 ARC-AGI-3。统一的接口也让我们得以在不同厂商之间进行公平对照。
另一种情况:模型能否充分利用上下文管理功能?
这里存在一个独立的问题:当模型能够使用其提供商为其设计的上下文管理功能时,表现如何?对于Astra而言,这意味着在请求之间保留不透明的推理状态(我们无法看到),并使用压缩功能来管理更长的对话。
借助Provider Adapter框架,Astra在ARC-AGI-3 Semi-Private上的最佳观测得分从62.7%提升至99.9%。在Public和Semi-Private以及所有推理级别上,使用Provider Adapter的运行方式总体耗时减少了约3.66倍,且两个框架共同解决的167组游戏推理对的总token消耗量减少了49%。
展望未来,我们将在ARC-AGI排行榜上同时报告Standard harness和Provider Adapter harness的结果,并清楚标注每种评估条件。我们的开源测试仓库和测试政策文档均介绍了这两种方法。
ARC-AGI系列
ARC-AGI-3继续为研究者和智能体提供了一个有价值的探索平台,用于熟悉未知环境、发现规则并通过交互学习。Astra的成绩也是一个值得庆祝的重要里程碑。在我们看来,Astra代表了前沿模型能力的一个显著跃升。
当我们发布ARC-AGI-3时,我们明确表明,在该基准上达到饱和并不等同于"实现AGI的证明"。因此,虽然我们坚信Astra代表了向通用化迈进的重要进展,但我们并不声称它就是AGI。
ARC-AGI基准系列旨在与前沿AI同步演进,从而在新兴研究问题与AI能力进步之间形成反馈循环。ARC-AGI-3是我们首个交互式基准测试,要求AI高效合成因果世界模型并在无具体指令的情况下达成目标——Astra成功通过了这一考验。与此同时,ARC-AGI-3具有严格限定的范围和格式,其环境采用确定性、封闭式的机制和目标设定,并不代表现实世界的复杂性和开放性。
我们正在积极探讨应塑造下一代基准测试的问题,包括如何评估递归自我改进和开放式创新。Astra 的进展有助于厘清哪些 AI 能力尚不可及,以及哪些问题仍未解决。
感谢 François Chollet、Mike Knoop、Matt Mazur、Ethan Bond 和 Derek Smith 对本帖的早期审阅。
- 假设 人脑代谢功耗约为 20 W,电费为 $0.20/kWh:0.020 kW × 1.5 小时 = 0.030 kWh,每局成本约 $0.006,或 $0.006 ÷ 9 ≈ $0.00067 每次尝试。
- 参见 ARC-AGI-3 人类测试论文。
- 未观察到试图突破沙盒的证据。