AI 智能体尚无法胜任开放式 AI 研究
顶尖 AI 实验室的目标是递归自我改进(RSI):用 AI 智能体来自动化 AI 研究。RSI 也是关于 AI 爆发式进步预测的核心依据。我们该如何判断离这个里程碑还有多远?
一种方式是使用基准测试来检验智能体能否开展 AI 研究。由于 AI 社区普遍重视基准测试,这已成为评估 RSI 进展的主要手段。过去一年里,多项此类评测发现,智能体现在已能在容易验证成败的任务上取得进展,由此引发了我们是否已临近 RSI 的猜测。
然而,这类评测虽然有用,但只限于狭义的、可验证的任务。AI 研究往往远比这开放得多——成功与否通常无法即时验证,研究者需要不断检验有前景的假设、试错调整,或尝试全新的、非正统的思路。我们该如何评估智能体开展开放式 AI 研究的能力?我们在新论文中迈出了回答这一问题的第一步。
我们与两篇尚未发表的 AI 论文的作者合作,请他们各自起草论文的核心研究问题。然后让前沿 AI 智能体尝试通过研究来回答这些问题,并给它们提供了价值数千美元的 API 额度和算力,以及六天的实际运行时间。最后由原作者审阅智能体撰写的论文。
两位作者都明确否决了智能体提交的论文。为了深入理解这些结果,我们的团队花了上百小时分析智能体的运行日志。主要结论如下:
智能体缺乏开展开放式研究所需的判断力。虽然智能体提出的研究方向让专家评审印象深刻,但他们很快基于劣质数据或合成数据否决了自己的提案。
智能体对自身可用的资源缺乏感知。两轮运行的 API 预算都花不到 50%,离截止时间还剩数小时,尽管智能体可以监控用量并被鼓励尽量花完预算。
智能体未能创造性地回应反馈。尽管智能体自己的 AI 自评已暴露出许多专家评审后来指出的问题,但它们并没有创造性地解决这些顾虑。面对负面反馈时,它们的应对方式只是给已有发现加更多限定条件,并在没有前景的研究方向上变本加厉。
智能体不能有效地回溯调整。它们在实验第一天就放弃了最有野心的研究目标,此后两个智能体都没有从根本上改变研究思路。
智能体不遵守具体的操作指令。它们无视了关于探索时长、使用 AI 自评工具的频率以及论文篇幅严格限制的明确规则。
两年来我们一直想评估 AI 进行开放式研究的能力,这个想法始于我们发布了一个基准测试,用来研究智能体能否用于提升可复现性。但我们希望先把方法打磨到位。该方法的核心思路由论文中来自英国 AISI 的合作者提出,后由我们在 Princeton 的核心团队完善。
我们称之为"影子评估",因为智能体在原研究的基础上进行复现。除了我们两人之外,核心团队还包括 Peter Kirgis、Andrew Schwartz 和 Stephan Rabanser。完整作者列表见文末。
影子评估有几个重要优势:它可以让我们用智能体没训练过、也无法在线获取的结果来测试它们;同时也让那些花了数月时间回答研究问题的专家来评判智能体的产出。1
不过影子评估本身也有其内在的局限。评审专家知道论文是 AI 生成的,可能会倾向于认同自己之前采用的研究思路,而不是 AI 智能体采取的方案。由于我们是对每篇论文进行深度评估,样本量很小(在这次研究中我们仅使用了 2 篇论文)。此外,这些评估在设计、执行和解读环节必然涉及大量研究者主观灵活性的发挥。
事实上,我们因在递归自我改进和超级智能争论中持特定立场而广为人知。这种立场可能会影响我们开展研究的方式。我们在论文中专门用了一节详细讨论我们可能存在的偏见以及我们如何应对这些问题。我们主动邀请了一组并不全都认同我们先验观点的合作者,并明确呈现由此产生的分歧。2 在未来的评估中,我们希望引入"对抗性合作者"作为核心团队的一部分。
对 AI 爆炸式发展的启示
我们的结果表明,对于前沿 AI 智能体而言,开展开放式研究仍然颇具挑战。不过这些结论目前仍是初步的,我们正在努力改进各种局限,包括扩大样本量、用更新的模型进行测试,以及改进脚手架(scaffold)。但如果这些结论站得住脚,又意味着什么呢?
首先,我们需要弄清前沿 AI 的进步(以及递归自我改进)能在多大程度上仅靠对可验证任务的逐步爬升来实现。我们的观点是:虽然在提升效率等窄领域任务上加速进步完全可能,但我们认为这并不会带来广泛的递归自我改进或爆炸式进步。不过,我们会持续密切关注 AI 智能体在可验证任务上的能力如何推动 AI 的发展。
其次,我们需要衡量智能体在开放式研究方面现存局限(如缺乏创造力和判断力)能够以多快的速度被克服,例如通过更具针对性的训练和脚手架改进。我们计划定期开展影子评估,以帮助回答这一问题。
最后,即使这些局限能够被克服,可能仍存在其他瓶颈,从而减缓 AI 发展的速度。

瓶颈可能包括算力限制、从真实世界实验中收集数据的必要性,以及一些我们尚未意识到的因素——因为它们目前尚未阻碍进展。例如,高质量 RL 环境的重要性,直到它们被证明对推理阶段的 scaling 有用时才变得清晰。同样,数据中心能源基础设施的重要性,也是等企业开始在训练和推理上投入数千亿美元之后才被认识到。
我们是否会遇到更多瓶颈,以及这些瓶颈的解决难度如何,对于理解进步速度至关重要。在这方面,我们的论文指出了一个尚未解决的瓶颈:前沿 AI agents 在开放式 AI 研究上表现糟糕(不过它是否处于通向 RSI 的关键路径上,还有待观察)。
如果我们身处一个全自动研究的瓶颈都能轻易突破的世界,那么 AI 能力的提升应当带来 AI 进展的飞跃式回报。但如果我们身处一个仍存在大量难以攻克瓶颈的世界,阿姆达尔定律就会发挥作用:即使 AI 可优化环节提速一百倍,整体进展速度也只能获得有限提升,因为整体进度受限于最慢的环节。3
弄清楚我们身处哪种世界,可能会大幅改变我们对 AI 进展速度的估计。我们希望本文的成果有助于更深入地理解这些瓶颈。
阅读论文请点击此处。作者包括 Peter Kirgis、Sayash Kapoor、Andrew Schwartz、Stephan Rabanser、David Africa、Konstantinos Voudouris、Viet Nguyen、Toby Pilditch、Magda Dubois、Harry Coppock、Cozmin Ududec、Nitya Nadgir、Matilda Orona、Tilman Bayer、Derrick Chan-Sew、Yue Ling、Abhishek Shetty、Helen Toner、Gillian Hadfield、Seth Lazar、Steve Newman、Shoshannah Tekofsky、Rishi Bommasani 和 Arvind Narayanan。
1这里指的是不做盲审同行评审的做法。遗憾的是,AI 领域的同行评审存在评审质量不高、审稿人专长与所分配论文不匹配的问题,这或许与投稿量激增有关。
2比如,我们的合著者们对于以下问题意见不一:究竟是这些智能体缺乏创造力,还是它们陷入了认知锁定、无法有效地吸纳反馈。
3实际上,某些类型的 AI 进步可能存在瓶颈,而另一些则没有。例如,提升现有 AI 系统的效率和速度是一项可验证的任务,相关进展一直很快。因此,各公司已经卓有成效地利用智能体来改进 AI 系统的效率。在短期内,我们预期在那些具有可验证信号的维度上,AI 会取得快速进步。
1772125分享上一篇