Nvidia SoL-Pi 系统优化编码 Agent Harness,Token 消耗近乎减半
Nvidia 的新论文介绍了一套能自动优化编码 Agent 控制层(即 harness)的系统。研究人员表示,在性能基本保持不变的情况下,Token 消耗几乎减半。
AI Agent 无监督运行时间越长,成本越高。单一的预测演变为漫长的推理链、工具调用和反馈循环,Token 用量随之激增。
Nvidia 研究团队的新 研究 没有从模型层面入手,而是针对 harness 进行优化。Harnness 是模型与其环境之间的控制层,被 Codex、Claude Code、OpenClaw 等系统使用。

Harnness 决定了 Agent 如何感知状态、执行动作以及处理反馈。目前大多数效率优化方法都聚焦于降低单 Token 成本,例如更快的 Attention 内核、服务基础设施、模型量化等压缩技术,或替换为更便宜的模型。
AI 探索 152 个方向以寻找更精简的控制逻辑
在实际操作中,优化 harness 难度很大,因为工具使用、上下文管理、验证和中断逻辑紧密耦合。某处节省 Token 的改动可能在别处引发错误,或只是将成本推到了后续阶段。通常,人类需要翻阅冗长的执行轨迹,将重复出现的故障模式转化为代码。
这套系统名为 SoL-Pi,把这项工作自动化了。一个研究智能体会观察另一个智能体的运行轨迹,提出改进方案,并在预先准备好的环境中进行测试。能力和效率检查会决定哪些候选方案得以保留。据作者介绍,这一思路借鉴了递归自我改进的理念。

系统在 535 个可执行环境中探索了 152 个方向,其中包括从 GitHub issue 与 pull request 配对中派生出的 495 个任务,以及 40 个合成测试用例。整个过程共产生了 3000 多次运行和超过 60000 次智能体与环境的交互。研究人员表示,这一规模体现了系统搜索范围之广,但搜索量更大并不必然带来更好的结果——这正是本方案面临的风险,因为此前的研究表明,自动优化的 harness 往往会过拟合训练任务,在陌生任务上收效甚微。
SoL-Pi 的应对方式是将搜索反馈与评估严格分离。研究人员选用 EdgeBench 作为测试基准,并将其与搜索过程完全隔离。在其 51 个公开任务中,11 个用于对最终候选方案做一次性验证,其余 40 个则专门用于最终评估,这些结果不会回流到搜索过程中。
四个消除无效功的机制
搜索最终产出了四个机制。Action Fusion 将两个连续步骤合并为一个,比如代码修改后紧接测试运行,从而省去一整次语言模型调用。Online Context Compact 在每个规划步骤之后运行,在不丢失重要信息的前提下对累积的上下文进行压缩。
ObservationPack 会归档较长的工具输出,在后续步骤中用简短摘要代替,避免每次重新发送完整文本。Evidence-Preserving Reducer 则将大型错误和测试日志分流给成本更低的模型,将其浓缩为核心发现,并配合自动验证步骤,防止关键线索被遗漏。

根据研究人员称,在 EdgeBench 的 51 个公开任务中,SoL-Pi 的表现与原版 Pi harness 相当。Token 用量的降幅取决于具体配置。最高效的变体结合了全部四种机制,Token 用量减少 49%,得分达到 Pi 的 93.7%。若用户更看重性能并仅选择最强的单项机制,得分可超过 Pi 5.3%,同时仍能节省 Token。两种变体下,Token 用量均下降 44.7% 至 49%。

以美元计算,基于当前 API 价格,作者估算与原生 Codex 和 Claude Code harness 相比,每小时可节省 $8.75 至 $13.50;与 Pi 相比,每小时可节省 $4.36 至 $5.71。
研究人员仅使用 GPT-5.6 Sol 构建了该系统,随后未经任何修改便将其应用于 Opus 5。在该场景下,系统保留了 Pi 94.3% 的性能,并保持了类似的节省效果。不过,在 Opus 5 环境中,这些机制的触发频率更低、力度更弱,研究人员认为这是因为该框架(harness)仅基于 GPT-5.6 Sol 的轨迹进行了优化。
在其他基准测试中,结果更加参差
除 EdgeBench 外,整体表现喜忧参半。在 Terminal-Bench 4 的 63 个 CPU 任务中,SoL-Pi 仅解决 15 个,而 Codex 和 Pi 各自解决了 18 个。尽管任务解决率较低,但总成本仍比 Pi 低约四分之一。
在 2026 年国际数学奥林匹克竞赛(IMO 2026)的 Lean 4 形式化验证任务中,该系统以单题最低成本解决了六道题中的三道。在一项内核优化实验中,由 20 个 SoL-Pi 工作者组成的集群,相比同等规模的 Pi 集群,将成本削减了 26.8%。

效率的提升伴随着权衡,因为更短的上下文可能会降低 prompt cache 的重用率。在一次测试运行中,总成本仍从 $1,339 降至 $894。展望未来,作者建议像预训练模型那样,针对多种任务预训练该框架,并利用已有的精简框架来降低寻找下一代框架的搜索成本。作者将这种递归的效率改进视为一种愿景,而非当前研究的结论。
工具链对 agent 成本的影响有多大,从 Composio 今年 8 月的一次测试中可见一斑:该公司让 Deepseek V4 Flash 在四个 agent 框架上运行,其中包括 Claude Code 和基于 Pi 的 Oh My Pi。结果发现,尽管用的是同一个模型,每解决一个任务的成本相差近 3 倍。
随着 agent 消耗的 token 越来越多,定价和优化方面的压力也在不断加大。据 OpenRouter 分析师 Peter Walker 统计,自 2026 年 2 月以来,agentic 场景的 token 用量增长了 14 倍,其中近 70% 来自缓存的 prompt。
不过,SoL-Pi 这类上下文压缩方案也存在副作用。有研究发现,压缩后平均只能保留 17% 的用户指令。并行 agent 同样会推高成本。Codex 开发者 Eric Provencher 近日警告说,子 agent 超过两个几乎必然浪费 token,质量却不会有提升,因为它们大部分时间都花在互相检查对方的工作上。