← 文章 / AI技术
The Decoder 5小时前 · 2026-10-12 01:24:13 · 9 阅读

研究:AI Agent 团队成本暴涨,质量提升却微乎其微

图片描述

研究发现,AI 代理团队的效果几乎与单一代理无异。

评估公司 Vals AI 在 “Vibe Code Bench” 上测试了 GPT-6 Sol 和 Claude Opus 5.5,涵盖单一代理和团队两种模式,并分别在中等和最高推理档位下运行。测试显示,团队模式的成本比单一代理高出 1.8 倍至 5.1 倍。

在团队与单一代理的四项对比中,仅有一项显示出统计上的显著提升:GPT-6 Sol 在中等推理档位下,团队得分高出 7.3 分。但在最高推理档位下,无论是 Sol 还是 Opus 5.5,团队模式均未带来实质性优势。结果表明,在大多数情况下——尤其是当模型已以满算力运行时——代理团队额外的成本并不划算。

Vals AI 的基准测试展示了 Vibe Code Bench 中每个应用的成本与得分关系。箭头指向相同推理力度下,从各模型的单一代理指向其团队版本。团队成本大幅上升,但得分改善甚微。 | 图片:Vals AI[
Anthropic 在使用 Opus 5.5 进行的两项内部测试中观察到,随着代理数量增加,质量增益逐渐缩小。虽然大规模团队能更快达到既定性能水平,但从 10 个增加到 100 个代理时,24 小时后的得分提升仅微乎其微。在单独的 ProgramBench 测试中,速度提升是以更高的 token 消耗为代价的。

使用 Opus 5.5 执行的任务 1 个代理 10 个代理 30 个代理 100 个代理
知识库 0.53 0.70 0.71 0.74
Lean 定理证明 0.39 0.66 0.66 0.68

在超过 10 个代理的 Lean 定理证明任务中,Fable 5.1 展现出了更强的质量增益,但其所有测试得分仍低于 Opus 5.5。在知识库任务中,当 Fable 的代理规模从 30 扩展到 100 时,得分反而略有下降。

更多代理只能买速度,买不到更好的输出

OpenAI 研究员 Noam Brown 在 Dwarkesh 播客中证实,多智能体系统主要带来速度的提升,而非质量的改善。四个智能体将任务解决速度提高了两倍,但成本也随之翻倍。当智能体数量扩展到 16 个时,这一趋势依然成立,但效率略有下降。

这种效果高度依赖于任务类型。他解释说,网络搜索和数学计算适合并行处理,但写小说则不然。他说,往小说创作中扔进 1 万个智能体,就像扔进 1 万个人一样毫无意义。Brown 承认,由于成本过高,向极大规模智能体网络扩展的研究仍基本处于空白状态。

OpenAI 开发者 Eric Provencher 近期也警告,不要使用智能体集群,原因正是如此。他认为这很可能纯属浪费金钱,因为智能体之间的协调机制会失效。他称之为“协调税”。

原始来源: The Decoder

评论 (0)