游戏中学到的技能能否迁移到现实工作?

“游戏一直是被低估的教育工具。它们极具亲和力,充满人文气息。”
这话出自 Alex Duffy 之口,他是 Good Start Labs 的联合创始人兼 CEO。他向 Latent Space 解释了公司为何正在将游戏转化为 AI 模型的训练材料。这家公司是去年十月从 AI 媒体与工具公司 Every 分拆出来的,获得了来自 General Catalyst、Inovia、Every 及天使投资人的360 万美元融资。
这一想法源于2025 年一场关于前沿模型玩《外交》(Diplomacy)游戏的 Twitch 直播。Duffy 表示,这通常是一款需要“花几天甚至几周时间”的游戏。当时他在 Every 担任 AI 训练负责人。

(若想深入了解《外交》与 LLM,请参阅我们去年对 Noam Brown 的访谈,那是在他赢得 2025 年世界《外交》锦标赛冠军后不久。)
观看 AI 智能体在《外交》游戏中激烈对抗的场景,让 Alex Duffy 看到了各前沿模型在游戏情境下的差异化表现。他特别注意到,OpenAI 的模型(o3)通过规划未来的背叛赢得了所有对局,而 Claude 模型(Opus 4)则因拒绝撒谎而“被彻底击溃”。 基于此,Duffy 得出结论:在《外交》这类游戏中训练 AI 模型,有助于培养其战略思维等技能。尤其是这类游戏的结果是可验证的。Duffy 随后在 Every 平台发表文章指出:“在战略游戏《外交》上对模型进行微调,提升了其在客户支持和工业运营基准测试中的表现。”

Duffy 和他的联合创始人 Tyler Marques 创办 Good Start Labs,目的是探索其他能让 AI 模型学到实用技能的游戏。
“我们很快意识到,强化学习环境是教会模型各种可验证技能最可靠的途径之一。”他说。
更深层的想法是:游戏以什么方式呈现给 AI,决定了它能学到哪些技能,以及这些技能能否迁移到游戏之外的实际工作中。目前最好的证据,来自一款十九世纪的铁路游戏。
当游戏训练迁移到金融研究
Good Start Labs 最近在游戏《1830: 铁路与强盗大亨》中训练了一个 30B 模型。这款游戏在维基百科上被描述为“一款策略游戏,唯一的运气成分只是决定初始出牌顺序”。
随后,他们用同一个模型测试金融研究任务。这项实验的目的,是验证在游戏中学到的习惯能否迁移到游戏之外。
“这款游戏中嵌入了股票市场机制,”Duffy解释道。“你要竞拍这些铁路公司的股票,试图构建一个物流网络。我们设计了一系列任务,让模型通过数据库查找游戏的历史信息,将其整理到 Excel 文件中,进行推理、编写函数,并据此计算得出答案。这一过程模拟了典型的金融工作流,只不过是在游戏环境中进行的。”

已发布的研究结果对比了两种模式:单轮问答,即向模型展示游戏状态并要求其决定下一步;以及多轮终端智能体,后者利用工具探索环境、制定策略并实时调整。
两种训练设计都提升了各自的游戏内目标表现,但只有终端智能体的设计在 Finance-Agent 基准测试中带来了性能提升。
设计学习环境以培养能力
1830 项目的结果表明,训练设计至关重要。Duffy 进一步指出,Good Start Labs 还可以引入一个专家模型,提供更高密度、分步骤的奖励信号。

该运行框架还允许环境以不同的方式接近同一款游戏。
“你如何设计那个[评估框架],会完全改变模型能学到什么,”Duffy 说道。“你可以想象,一个观察图片的模型,与一个阅读自然文本或将所有内容以 Python 形式呈现的模型,它们学到的东西是不同的。”
Duffy 描述 Good Start Labs 的整体目标是弄清楚“如何设计学习环境来教授特定能力”。
这个问题在由 Duffy 和 Marques 与几所大学的研究人员合著的论文《COS-PLAY:面向长时程任务的 LLM 决策与技能库智能体协同进化》中得到了探讨,该论文链接为 COS-PLAY: Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks。

在这篇论文中,该系统赋予决策智能体访问作者所称的“可学习的技能库以指导行动”的能力。另一个独立的技能库智能体研究行动轨迹并修改技能库,随后将其循环反馈用于下一轮运行。
那最新的前沿模型呢?
我询问 Good Start Labs 是否已在相同的游戏环境中对比过更新的模型,例如Claude Fable 5.1和GPT-6 Astra?引申开来,随着基础模型能力的不断提升,评估框架和训练环境的重要性是否会降低?
“我们会对比每一个新模型,”Duffy 回答,并补充说较新、能力更强的模型往往在游戏中表现更好。然而,与 2025 年模型在 Twitch 直播中展示的情况类似,新模型在“个性维度”上出现了分歧,例如:背叛、合作、心智理论等。”
alex duffy@alxai_AI 进步了两年,写段子还是不行。 在 14000 多局真实 @playbadcards 对局上,Astra 在我们更新的 LOL-Alignment 基准中登顶,与人类评委的打分有 50% 的时间一致。 两年过去,只比 GPT-4o 高出 2%! 幽默很主观,而游戏让它变得可衡量。…
4:39 PM · 2026年9月9日 · 2.02K 次浏览3 条回复 · 3 次转发 · 37 个赞
至于 harness,他说“能力更强的模型完成同样的任务当然需要更少的引导。”
但对 Good Start Labs 的做法——把“环境当作课程”——harness“不但不不重要,反而更重要”。
“GPT-6 Astra 报告称自己减少了思维链、直接给出答案,”Duffy 说。“如果你希望模型在解题时按某种方式工作,harness 就是强制它这么做的手段。Astra 或许能心算出结果,但你更希望它用代码来算,这样结果才可信。”
Good Start Labs 卖的是什么?
在最近的一篇博客中,公司介绍了他们在“改进循环”方面的工作,包括训练系统、harness 和可观测性。但这些如何转化为提供给其他公司的产品?
“在 AI 改进方面,我们卖的主要是数据和学习环境,”Duffy 回答。他们的主要客户是前沿实验室——为他们提供强化学习数据,帮助进一步训练模型。
他将该产品的数据部分归为两类。第一类是“智能体玩游戏的轨迹数据”——即智能体观察到了什么、做出了什么决策、执行了哪些动作以及随后发生了什么。

第二类是针对特定游戏发行商的定制数据,在这种场景下“智能体实时运行在其游戏中”。这些智能体可以在游戏内游玩,生成可能对训练和评估有帮助的交互数据。Duffy 表示,出售给模型开发者的任何数据都会经过匿名化处理,并移除个人身份信息。
Good Start Labs 出售的学习环境是“模型可以从头玩到尾的完整游戏”,他补充道。不过,重点并不在于赢得游戏。更在于教会 AI 模型如何解决问题。
“我们还会创建许多任务,其中模型利用游戏引擎作为可验证的奖励来源,但以你可能意想不到的方式解决问题。”
那么,游戏技能能迁移到现实工作吗?
除了为客户提供的定制服务外,Good Start Labs 还在训练一个通用模型,该模型基于其针对特定游戏构建的专家模型进行整合。Duffy 表示,其设想是将这些专家模型“统一成一种可在各处应用的通用游戏智能”。
尽管 1830 年的实验表明,基于智能体的游戏训练确实可以迁移到结构相似的金融研究任务中,但其能否更广泛地迁移到现实场景仍不明确。我询问 Duffy,目前的证据到底说明了什么?
“目前的证据非常明确地表明,目标导向的执行至关重要,且推理能力是可以迁移的,”他回答道。他指出了Surge AI 近期的一篇文章,该文展示了办公工作的后训练改善了编码能力,并补充道“DeepSeek R1 更广泛地证明了这一点”。
“我们也亲身观察到过两次:一个是 1830 金融任务,另一个是通过 Diplomacy 训练提升了客服代理的表现。我们所搭建的每一个环境都会促进下游的工具使用。”
因此,对我们核心问题的答案是肯定的,但需要限定条件:部分游戏技能能够迁移到现实工作中。但 Duffy 指出,这些技能能在多大范围、以多可靠的程度实现迁移,仍是一个悬而未决的问题。