← 文章 / AI技术
The Decoder 3小时前 · 2026-09-27 02:27:20 · 3 阅读

Nvidia SoL-Pi 系统优化编码 Agent Harness,Token 消耗近乎减半

Image description

Nvidia 的新论文介绍了一套能自动优化编码 Agent 控制层(即 harness)的系统。研究人员表示,在性能基本保持不变的情况下,Token 消耗几乎减半。

AI Agent 无监督运行时间越长,成本越高。单一的预测演变为漫长的推理链、工具调用和反馈循环,Token 用量随之激增。

Nvidia 研究团队的新 研究 没有从模型层面入手,而是针对 harness 进行优化。Harnness 是模型与其环境之间的控制层,被 Codex、Claude Code、OpenClaw 等系统使用。

Diagram of the SoL-Pi auto-research loop showing research environments, a research AI, an idea pool, and four retained mechanisms, alongside bar charts comparing score and API costs for Codex, Claude Code, Pi, and SoL-Pi on EdgeBench.
研究 AI 分析 Agent 执行轨迹,提出 harness 修改方案,仅保留那些能维持性能同时降低成本的改动。在 EdgeBench 测试中,SoL-Pi 相比 Codex 节省 50%,相比 Claude Code 节省 54.3%。| 图片来源:Nvidia

Harnness 决定了 Agent 如何感知状态、执行动作以及处理反馈。目前大多数效率优化方法都聚焦于降低单 Token 成本,例如更快的 Attention 内核、服务基础设施、模型量化等压缩技术,或替换为更便宜的模型。

AI 探索 152 个方向以寻找更精简的控制逻辑

在实际操作中,优化 harness 难度很大,因为工具使用、上下文管理、验证和中断逻辑紧密耦合。某处节省 Token 的改动可能在别处引发错误,或只是将成本推到了后续阶段。通常,人类需要翻阅冗长的执行轨迹,将重复出现的故障模式转化为代码。

这套系统名为 SoL-Pi,把这项工作自动化了。一个研究智能体会观察另一个智能体的运行轨迹,提出改进方案,并在预先准备好的环境中进行测试。能力和效率检查会决定哪些候选方案得以保留。据作者介绍,这一思路借鉴了递归自我改进的理念。

Flowchart of the search pipeline from trajectory rollouts through map-reduce analysis, mechanism proposal, candidate implementation, independent review, and development validation to a separate held-out evaluation.
留出评估只在 harness 冻结之后进行,且不会反馈到搜索过程中。| 图片来源:Nvidia

系统在 535 个可执行环境中探索了 152 个方向,其中包括从 GitHub issue 与 pull request 配对中派生出的 495 个任务,以及 40 个合成测试用例。整个过程共产生了 3000 多次运行和超过 60000 次智能体与环境的交互。研究人员表示,这一规模体现了系统搜索范围之广,但搜索量更大并不必然带来更好的结果——这正是本方案面临的风险,因为此前的研究表明,自动优化的 harness 往往会过拟合训练任务,在陌生任务上收效甚微。

SoL-Pi 的应对方式是将搜索反馈与评估严格分离。研究人员选用 EdgeBench 作为测试基准,并将其与搜索过程完全隔离。在其 51 个公开任务中,11 个用于对最终候选方案做一次性验证,其余 40 个则专门用于最终评估,这些结果不会回流到搜索过程中。

四个消除无效功的机制

搜索最终产出了四个机制。Action Fusion 将两个连续步骤合并为一个,比如代码修改后紧接测试运行,从而省去一整次语言模型调用。Online Context Compact 在每个规划步骤之后运行,在不丢失重要信息的前提下对累积的上下文进行压缩。

ObservationPack 会归档较长的工具输出,在后续步骤中用简短摘要代替,避免每次重新发送完整文本。Evidence-Preserving Reducer 则将大型错误和测试日志分流给成本更低的模型,将其浓缩为核心发现,并配合自动验证步骤,防止关键线索被遗漏。

四格图示,展示 Action Fusion 如何合并连续 API 调用,Online Context Compact 如何在子任务完成后精简上下文,ObservationPack 如何用简短摘要归档大型工具输出,以及 Evidence-Preserving Reducer 如何通过更便宜的模型蒸馏错误日志并进行自动验证。
Nvidia 在 535 个可执行环境中搜索机制,并将 EdgeBench 保留用于最终评估。| 图片来源:Nvidia

根据研究人员称,在 EdgeBench 的 51 个公开任务中,SoL-Pi 的表现与原版 Pi harness 相当。Token 用量的降幅取决于具体配置。最高效的变体结合了全部四种机制,Token 用量减少 49%,得分达到 Pi 的 93.7%。若用户更看重性能并仅选择最强的单项机制,得分可超过 Pi 5.3%,同时仍能节省 Token。两种变体下,Token 用量均下降 44.7% 至 49%。

GPT-5.6 Sol 在 Codex、OpenSquilla、Oh-My-Pi、OpenCode、Oh-My-Opencode、Pi 及两种 SoL-Pi 变体中的对比表,展示了 Token 流量、成本、平均得分和 Token 效率。
SoL-Pi 的高效变体相比 Pi 将 Token 用量减半,成本从 $1,339 降至 $894,但得分略有降低。| 图片来源:Nvidia

以美元计算,基于当前 API 价格,作者估算与原生 Codex 和 Claude Code harness 相比,每小时可节省 $8.75 至 $13.50;与 Pi 相比,每小时可节省 $4.36 至 $5.71。

研究人员仅使用 GPT-5.6 Sol 构建了该系统,随后未经任何修改便将其应用于 Opus 5。在该场景下,系统保留了 Pi 94.3% 的性能,并保持了类似的节省效果。不过,在 Opus 5 环境中,这些机制的触发频率更低、力度更弱,研究人员认为这是因为该框架(harness)仅基于 GPT-5.6 Sol 的轨迹进行了优化。

在其他基准测试中,结果更加参差

除 EdgeBench 外,整体表现喜忧参半。在 Terminal-Bench 4 的 63 个 CPU 任务中,SoL-Pi 仅解决 15 个,而 Codex 和 Pi 各自解决了 18 个。尽管任务解决率较低,但总成本仍比 Pi 低约四分之一。

在 2026 年国际数学奥林匹克竞赛(IMO 2026)的 Lean 4 形式化验证任务中,该系统以单题最低成本解决了六道题中的三道。在一项内核优化实验中,由 20 个 SoL-Pi 工作者组成的集群,相比同等规模的 Pi 集群,将成本削减了 26.8%。

Architecture of an agent swarm with a Codex coordinator and five groups of four workers, alongside progress curves and bar charts comparing cycle counts and model costs.
在内核优化测试中,SoL-Pi 工作者集群取得了最佳结果,成本比 Pi 工作者集群低约四分之一。| 图片:Nvidia

效率的提升伴随着权衡,因为更短的上下文可能会降低 prompt cache 的重用率。在一次测试运行中,总成本仍从 $1,339 降至 $894。展望未来,作者建议像预训练模型那样,针对多种任务预训练该框架,并利用已有的精简框架来降低寻找下一代框架的搜索成本。作者将这种递归的效率改进视为一种愿景,而非当前研究的结论。

工具链对 agent 成本的影响有多大,从 Composio 今年 8 月的一次测试中可见一斑:该公司让 Deepseek V4 Flash 在四个 agent 框架上运行,其中包括 Claude Code 和基于 Pi 的 Oh My Pi。结果发现,尽管用的是同一个模型,每解决一个任务的成本相差近 3 倍。

随着 agent 消耗的 token 越来越多,定价和优化方面的压力也在不断加大。据 OpenRouter 分析师 Peter Walker 统计,自 2026 年 2 月以来,agentic 场景的 token 用量增长了 14 倍,其中近 70% 来自缓存的 prompt。

不过,SoL-Pi 这类上下文压缩方案也存在副作用。有研究发现,压缩后平均只能保留 17% 的用户指令。并行 agent 同样会推高成本。Codex 开发者 Eric Provencher 近日警告说,子 agent 超过两个几乎必然浪费 token,质量却不会有提升,因为它们大部分时间都花在互相检查对方的工作上。

原始来源: The Decoder

评论 (0)