GPT-6 Astra 通关宝可梦、Factorio 与辐射3,却因一只苦力怕在 Minecraft 里摆烂种土豆
只用18小时而非96小时拿下宝可梦冠军,在《异星工厂》中成功发射火箭,并通关了《辐射3》。GPT-6 Astra 击败了之前难住所有模型的游戏。但在《Minecraft》中,一只苦力怕炸毁了它的物资,随后它就花了几个钟头在那种土豆。
六根烈焰棒,三颗末影珍珠。据 Vals AI 称,没有任何 AI 系统在《Minecraft》中取得过比 GPT-6 Astra 更深的进度。它在下界建起了半自动烈焰农场,在扭曲森林中击杀了半打以上的末影人,并收集了合成末影之眼的材料。这能用来定位通往游戏最终Boss战的传送门。数千观众观看了直播,看着 Astra 将战利品存入箱子。
接着,苦力怕出现了。爆炸摧毁了箱子和床。一切化为乌有,等 Astra 反应过来时,天已经开始下雨了。
Astra 记下了一个便签,部分使用大写强调:“关键物品务必开启 keepInventory 保留;以后绝不再往无保护的箱子里存物。” 随后,它花了好几个小时几乎只种土豆。
比之前的任何模型都快
在那之前,GPT-6 Astra 已经在这个游戏里投入了远超100小时。Vals AI 最终在141小时时终止了这次运行。将其与早期《Minecraft》 AI 代理的表现相比,这种飞跃显而易见。2022年,OpenAI 的 VPT 仅在有2.5%的尝试中做出了钻石镐,离传送门还差得远。根据 Vals AI 的一项对比,VPT 需要10分钟才能到达该进度。
与较新模型最直观的对比来自另一个项目:“GPT 玩宝可梦”。据操作者 Clad3815 称,Astra 在《宝可梦 火红》中用了18小时12分钟获得冠军头衔。GPT-5.6 Sol 需要96小时35分钟。GPT-5.5 在超过218小时后仍未通关。
社区一次 Factorio: Space Age 的运行也讲述了类似的故事。通过自定义 Lua mod 和 MCP 接口操控,Astra 用了约两小时生产出蓝色科学包,大约十小时后发射了第一枚火箭。而在同样的设置下,GPT-5.6 Luna 和 Fable 5.1 始终卡在电力供应和石油勘探阶段。
还有一些通关没有直接的对比数据。Astra 通关了 Portal 直到片尾字幕,用 22 小时通关了 Fallout 2,在 RimWorld 里带一个殖民地扛过数次袭击并最终离开星球,还花约 59 小时打完了 Fallout 3 的主线剧情。
早在社区测试之前,ARC-AGI-3 就已经表明这是一次飞跃,而不只是寻常的进步。这项基准测试会把模型丢进陌生、抽象的游戏环境中,让它们通过自身行动摸索规则。Astra 在标准接口下达到 62.7%,用 OpenAI 自家的测试框架则达到约 99.9%。相比之下,GPT-5.6 Sol 得分 7.78%,Claude Opus 5 略高于 30%。
先验证,再复用
ARC Prize 作为该基准背后的组织,解释了这一飞跃是如何实现的:Astra 会把陌生的游戏机制转化为简洁的符号化描述,并用一套自创的速记方式追踪物体、坐标、规则和计划中的动作。观察变成规则,规则变成计划。
把经验转化为可复用规则的想法并不新鲜。早在 2023 年,由 Nvidia 和 Caltech 参与的研究项目 Voyager 就让 GPT-4 在 Minecraft 中自主提出任务、编写 JavaScript 代码,并根据报错信息不断修改。能正常运行的代码会存入一个技能库。
但 Voyager 从未真正“看过”游戏画面。它接收的是结构化数据,通过 Mineflayer 编程接口来控制游戏。相比之下,根据 Vals AI 的说法,其 Minecraft 运行 是通过通用计算机使用来实现的,也就是操作屏幕、鼠标和键盘,没有任何专用的游戏接口。曾经需要研究员围绕模型构建的环境,如今 Astra 能够自行搞定。在不到三个小时内,它建造了地狱传送门,击退了僵尸,困住了骷髅,并找到了返回基地的路。
Fallout 3 的运行展示了类似的结构。用户 imjustnewatai 在 YouTube 上发布了完整的游戏录像,他亲自游玩了 101 号避难所的开头,然后将存档文件交给 OpenAI 的智能体工具 Codex,并将 Astra 设置为最大推理模式。从那时起,智能体自主选择路线和行动。银河新闻网、寻找父亲、GECK、逃离 Raven Rock、纯净计划。它通过正常的游戏输入进行游戏,以暂停、观察和行动的循环进行操作。存档、同伴和快速旅行都是允许的。大约 59 小时后,片尾字幕开始滚动。
ARC Prize 描述的模式在这次运行最艰难的阶段表现得最为明显。在 87 号避难所中,角色死了几次,弹药耗尽,Astra 不得不回头治疗。这一阶段的状态消息都遵循相同的结构:一个操作没有产生效果,Astra 没有重复该操作,而是寻找原因并记录结果。
一张本应治疗角色的床起初没有反应。Astra 让游戏运行了一会儿,再次尝试,并报告道:“让游戏短暂运行后,床起作用了。生命值已完全恢复至 260/260。”对敌人的射击一直未命中。Astra 发现视线中有障碍物,于是靠近了一些,并记录道:“靠近后消除了之前的障碍物,之前的射击因此受到影响。”在键盘前,它等待游戏确认按键按下后才继续前进。
回顾这些插曲,Astra 将它们提炼为一条单一原则:在重复操作之前,检查输入是否生效。这听起来微不足道,但正是这项技能让智能体避免陷入重复无用操作的循环。它也可能是后来成为问题的行为模式的起点。
不再有无防备的箱子
同一段录像也暴露了它的弱点。在 87 号避难所经历死亡后,状态信息开始堆积。Astra 保存了进度,检查了录像,并在继续行动前逐一核对每一步与可见环境是否匹配:“我正在将每一次短程移动与可见的几何结构比对,以确保离开时不会丢失已保存的进度。” 这让进程大幅放缓,但并未导致彻底停滞。
然而在 Minecraft 中,情况完全不同。在苦力怕爆炸发生后,Astra 给自己定下了一条规则:重要物品必须随身携带,绝不再存入没有守卫的箱子里。在接下来的几个小时里,它对所有高大的绿色物体都充满警惕(“前方那个高大的绿色物体是甘蔗,不是苦力怕!”),并对自己非常苛刻。它在笔记中写道,犯错和因此丢失物品是不可避免的,但它不想再浪费一个夜晚去追逐“深粉色的像素”——即猪,这是 Minecraft 中一种容易获取的食物来源,Astra 显然曾在夜间尝试狩猎但未果。唯一安全的地方是土豆田,据 Vals AI 称,它在土豆田停留了数小时。
于是,一次糟糕的经历变成了永久规则,而即使这条规则已不再适用,它依然固守。在 ARC-AGI-3 中,这种倾向有助于模型仅凭几次尝试就推断出游戏机制。但在一个充满随机事件的开放世界里,它明显会导致模型过度修正,甚至偏离实际目标。尽管如此,相比旧模型,这一跳跃式的进步依然显著。这也表明,负责 ARC-AGI 基准测试的团队再次构建了一项测试,充当了 AI 进步领域的“金丝雀”,正如早期在 ARC-AGI-1 上的胜利标志着推理模型时代的开启。

