研究:AI Agent 团队成本暴涨,质量提升却微乎其微
研究发现,AI 代理团队的效果几乎与单一代理无异。
评估公司 Vals AI 在 “Vibe Code Bench” 上测试了 GPT-6 Sol 和 Claude Opus 5.5,涵盖单一代理和团队两种模式,并分别在中等和最高推理档位下运行。测试显示,团队模式的成本比单一代理高出 1.8 倍至 5.1 倍。
在团队与单一代理的四项对比中,仅有一项显示出统计上的显著提升:GPT-6 Sol 在中等推理档位下,团队得分高出 7.3 分。但在最高推理档位下,无论是 Sol 还是 Opus 5.5,团队模式均未带来实质性优势。结果表明,在大多数情况下——尤其是当模型已以满算力运行时——代理团队额外的成本并不划算。

| 使用 Opus 5.5 执行的任务 | 1 个代理 | 10 个代理 | 30 个代理 | 100 个代理 |
|---|---|---|---|---|
| 知识库 | 0.53 | 0.70 | 0.71 | 0.74 |
| Lean 定理证明 | 0.39 | 0.66 | 0.66 | 0.68 |
在超过 10 个代理的 Lean 定理证明任务中,Fable 5.1 展现出了更强的质量增益,但其所有测试得分仍低于 Opus 5.5。在知识库任务中,当 Fable 的代理规模从 30 扩展到 100 时,得分反而略有下降。
更多代理只能买速度,买不到更好的输出
OpenAI 研究员 Noam Brown 在 Dwarkesh 播客中证实,多智能体系统主要带来速度的提升,而非质量的改善。四个智能体将任务解决速度提高了两倍,但成本也随之翻倍。当智能体数量扩展到 16 个时,这一趋势依然成立,但效率略有下降。
这种效果高度依赖于任务类型。他解释说,网络搜索和数学计算适合并行处理,但写小说则不然。他说,往小说创作中扔进 1 万个智能体,就像扔进 1 万个人一样毫无意义。Brown 承认,由于成本过高,向极大规模智能体网络扩展的研究仍基本处于空白状态。
OpenAI 开发者 Eric Provencher 近期也警告,不要使用智能体集群,原因正是如此。他认为这很可能纯属浪费金钱,因为智能体之间的协调机制会失效。他称之为“协调税”。