← 文章 / AI技术
AI Snake Oil 7小时前 · 2026-09-01 05:44:21 · 6 阅读

Google 的 AI Agent 真的只花 916 美元就"构建"了一个操作系统吗?

作者:Stephan Rabanser、Sayash Kapoor、Rishi Bommasani、Andrew Schwartz、Arvind Narayanan

在本周早些时候的 Google 开发者大会上,Google 发布了最新模型 Gemini 3.5 Flash,以及一款新的 agent 应用 Antigravity 2.0。为了展示这套新 agent 系统的能力,Google 声称一支 agent 团队构建了一整套操作系统。据称,整个过程只需要一个 prompt、约 900 美元的 API 费用,由几十个子 agent 协作完成。

这是否意味着现在可以用 AI 低成本地构建复杂软件?先别急着下结论:

  • "单个 prompt"的说法具有误导性。博客文章称操作系统是由单个 prompt 构建的。但文章进行到一半时,Google 又透露这个 prompt"最终长达数千行"。生成这个 prompt 花了多少次尝试?对 agent 的指令具体到什么程度?缺少这些关键细节,我们无从判断真正的亮点究竟在于模型本身的提升,还是仅仅在于在提示工程上投入了更多精力。此外,整个运行过程是在一套脚手架(scaffold)1 上完成的,该脚手架具备专门的角色分工、子 agent 委派机制,以及一个用于检测和防止作弊的 agent。在发布博文中,Google 把这套脚手架视为产品特性。但我们并不知道这套脚手架是否是专门为"从零构建操作系统"这一任务做了过拟合,也无法判断它在其他复杂软件工程任务上是否同样有效。

  • Google 的说明并未明确界定什么算作人为干预。文章提到最终那次构建操作系统的运行"无需人类提供额外的指导或修正",但并未定义这个标准。文章描述了用于中止和重启卡住 agent 的基础设施,也提到在之前的某次运行中 agent 似乎出现了作弊行为,团队随后加入了防作弊措施并重新执行了任务。但文章既没有把试运行(dry runs)纳入方法论加以报告,也没有清楚说明是否有 agent 向人类求助、最终那次运行是否需要人工重启、审批或修复,更没有说明 agent 最终成功之前经历了多少次重试。

  • 文章并未说明他们是否分析过智能体究竟是自行编写代码,还是直接从互联网上复制现有代码。值得肯定的是,博客中提到过,玩具操作系统是常见的本科课程作业,网上很容易找到公开实现。文章本身也提出了担心:智能体可能只是复述了已有信息,而非从零构建。但文章并未回应这一担忧——既没有做相似度分析,也没有日志分析来核查智能体是否复制了已有代码。即使不存在直接复制,由于训练数据中记忆了大量模式,智能体写一个操作系统可能本来就比较容易,因此这并不能说明智能体有创造全新软件的能力。

  • Google 没有公开那条冗长的提示词、智能体写出的代码,以及运行日志,因此外界无法独立验证这些说法。如果能公开源代码或智能体日志,独立研究者就可以评估产物的质量,并回答诸如"智能体是否复制了已有代码"这样的问题。博客中只附了一段短视频,记录了开发过程中的某个瞬间和整个实验的大致叙述。

  • 另一方面,博客确实给出了构建该操作系统的确切花费(916.92 美元)以及总的 token 预算(总共 26 亿 token)。这些数据提供了有用的背景,这一点我们也要给 Google 一些肯定。我们之前调研过的很多评估根本没有公开成本,导致其标题中的结论很难与其他评估横向比较。

    不过,Google 的这篇博客本质上就是一篇宣传稿。我们也理解,指望它做到科学严谨并不现实。像这样一次长时、真实的任务评估——只跑一次,由实验人员口述智能体的行为——如今已经司空见惯。而由于这类评估大多由 AI 公司自己来做,整个品类很容易被当成吹嘘而一笔勾销。

    但这么想会有失偏颇。我们把这种新兴范式称为"开放世界评估"(open-world evaluations),并在最近的一篇论文(以及配套的博客文章)中注意到了这一趋势。关键在于,我们认为开放世界评估需要一套全新的方法论规范。做好了,它能提供基于基准的评估所无法提供的宝贵视角。

    Google 的实验进一步印证了一个趋势:智能体或智能体团队能够自主或近乎自主地在某些类型的任务上长时间工作,不断取得进展而不卡壳或迷失方向。正如我们在论文中所述,对于这类任务,基准评估因成本等多种原因几乎无法实施。因此,对于学术界、非营利组织和政府机构的独立评估者来说,这正是一个大显身手的时机——由他们来为开放世界评估注入严谨性和可信度,这是 AI 厂商自身的声明所难以提供的。

    基于"AI 即常规技术"(AI as Normal Technology)框架的分析与评论

    订阅

    1

    脚手架(scaffold)是指围绕 AI 模型构建的代码、提示词和工具层,它赋予模型自主行动的能力,处理记忆、工具调用和与环境交互等事项。例如,Claude Code 就是让 Anthropic 的 Claude 模型能够充当编程智能体的脚手架。

    1442411 分享 上一条 下一条

    原始来源: AI Snake Oil

    评论 (0)