← 文章 / AI技术
Tom's Hardware 7小时前 · 2026-09-27 20:31:04 · 2 阅读

开发者称 AI 决策模型 Jev 不到一周通关《Pokémon Red》

根据开发者在项目页面的介绍,TypeSafe AI 的 Jev 于 2026 年 9 月 23 日在《Pokémon Red》中击败了四天王和冠军,并进入了名人堂。与那些花了几周甚至几个月时间才通关《Pokémon Blue》的聊天机器人不同,Jev 只能从一个选项列表中进行选择。不过,它并非单打独斗。Anthropic 的 Claude Opus 5 全程监控游戏日志,并在 Jev 游玩时不断调整选项及其措辞,实际上充当了教练的角色。

开发者 Andrew Boyd 是 Standard Agents Inc. 的创始人,该公司销售构建 AI agent 的平台。Boyd 最初在 X 上宣布该项目,并声称胜利将在一周内到来。游戏过程进行了直播,用户可以在浏览器或终端中观看,其中还包含由 Jev 主持的聊天功能。

让我们出发!Jev 玩 Pokémon。请关注此处:https://t.co/64naxTJlDg 或者,在终端中运行 `npx jev-plays-pokemon` 即可在 TUI 界面中同步观看(含聊天功能)。聊天需要 GitHub OAuth 授权。Jev 既是玩家也是聊天主持人。让我们去收服所有宝可梦吧!2026 年 9 月 17 日

Jev 是一个近期发布的决策模型,返回解决方案时会附带一个置信度数值。它既不是聊天机器人,也不是 LLM。在游戏中,Jev 参考一份包含事实信息的选项列表,基于概率选出最佳选项。它不读取屏幕画面,也不生成文本或图像。传统的 LLM Claude Opus 5 通过监控游戏日志来协助 Jev 应对卡关情况,其间接作用方式是修改提供给 Jev 的选项和数据。

该页面的 harness 变更日志共有 474 条记录,其中大多数是“游戏日志中的失败”与“所采取的应对措施”的配对。失误案例包括:朝 Lorelei 关闭的入口“撞了 53 次”、在 10 分钟内跨过 Rock Tunnel 的同一部梯子“124 次”,以及在击败全部四位四天王成员后却被冠军的 Alakazam 击败,迫使 Jev 不得不重新击败四位四天王,才在当天晚些时候击败了冠军。

Opus 在兼顾准确率与成本的前提下做出了调整。借助 TypeSafe 对模型特性的记录,它将发送给 Jev 的文本量削减了约三分之二,并改用文字描述代替数字。当 Jev 陷入死循环时,系统框架被修改为每 6 秒请求一次决策,而非原先的约每秒一次。人工干预也参与其中:观众在聊天区发送提示,其中有效的建议被用来优化 Jev 的选项列表。对 Opus、开发者及观众的依赖,充分展现了决策模型的优势与局限。

Christian Mathiesen(来自 Frigade)完成了基于 Jev 的第二次运行,展示了另一种思路。根据其 README 描述,该场景下的系统框架“读取游戏内存,列出合法选项……并由 Jev 做出选择”,但绝不向游戏内存写入数据。Mathiesen 表示,他最初允许 Jev 直接按键的版本“从未离开过华蓝市”。按他的估算,成本约为“每 24 小时 1 至 1.70 美元”。

另一项《宝可梦 红》实验则采用了不同路径。一位署名为 stmonty 的开发者,在 RTX 3080 Ti 显卡上利用超过 42,000 帧游戏画面训练了一个小型世界模型。据 stmonty 的博客文章记录,从大木研究所的存档开始,该模型在 100 次尝试中有 52 次成功选到了初始宝可梦。与 Jev 相比,这项实验的目标设定与辅助资源都要小得多:stmonty 的模型仅凭截图,就必须自行学习每个输入对应的作用。

原始来源: Tom's Hardware

评论 (0)