进阶 docs.antigma.ai 2026-10-08 09:54:38 · 6 阅读

第8章 Terminal-Bench 基准测试

基准测试 测试我们交付的产品 我们的基准测试设计遵循可核查原则:

* 我们测试的是交付物。所有评估都运行在固定且可公开下载的 Ante 版本上(例如 0.preview.43),这与 `ante update` 安装的二进制文件完全一致。不存在仅供评估用的分支,也没有针对基准测试的专用 prompt。 * 运行过程可审计。每个结果都链接到原始的 Harbor 运行记录,任何人都可以查看数字背后的试验细节。 * 约束条件为官方标准。所有试验均采用与官方 Terminal-Bench 排行榜相同的参数:89 个任务,每个任务 5 次试验,严格的超时和硬件限制。 * 结果实时更新。我们在 antigma.ai/eval 持续发布最新数据。

Terminal-Bench 2.1:一套框架,适配任意模型 我们评估的是 Agent 框架(harness),而非模型。因此,我们不发布单一的“英雄数字”,而是公布 Ante 在多种模型上的得分。对于我们运行的每一个模型,Ante 都是该模型下排名第一的 Agent:没有其他框架能以该模型取得更高的分数。

实时仪表盘亮点(截至 2026 年 6 月):

| 模型 | 准确率 | 同模型排名 | | :--- | :--- | :--- | | DeepSeek V4.1 Flash | 83.9% | #1 | | GLM 5.2 | 74.6% ±2.06 | #1 | | MiMo V2.5 | 65.8% ±2.30 | #1 | | DeepSeek V4 Pro | 65.8% ±2.25 | #1 | | DeepSeek V4 Flash | 62.7% ±2.29 | #1 | | MiniMax M3 | 62.1% ±2.33 | #1 |

有两点值得注意:

Ante + DeepSeek V4.1 Flash 达到 83.9%:在官方 Terminal-Bench 2.1 约束下,445 次试验中通过 370 次,完整运行的推理成本仅约 18 美元。 Ante + GLM 5.2 达到 74.6%,使用开放权重模型跻身公开验证排行榜的顶尖梯队。

优秀的框架能让前沿技术触达更广泛的领域:它让开放权重模型也能完成通常需要支付前沿模型价格才能做到的工作。 查看实时结果 →

历史战绩 * Terminal Bench 1.0 排行榜第一名(2025) * Terminal Bench 2.0 排行榜已验证 Agent 中第一名,且是 Gemini 系 Agent 中的最优表现(2026 年 2 月)

* Terminal Bench 1.0:Ante 于 2025 年 9 月 30 日位列公开排行榜第一。 * Terminal Bench 2.0:Ante 于 2026 年 1 月 6 日位列已验证 Agent 第一,总排名第二,且是展示排行榜中排名最高的 Gemini 系 Agent。

我们将 Terminal Bench 和 Harbor 作为主要外部基准。Harbor 和 Terminal Bench 背后的团队是真正的研究者——严谨、有原则,且致力于追求正确而非炒作。

为何选择 Terminal Bench: * 严谨。任务规范无歧义,尽可能采用确定性评分,且使用隔离的执行环境。 * 聚焦核心能力。Agent 能否在真实 Shell 中完成实际任务?阅读上下文、推理、行动、验证——这正是我们构建 Ante 的核心循环。

资源占用 能力只是一半的故事,运行成本是另一半。参见资源占用章节,查看 Docker 测量的 CPU、内存和磁盘使用情况,涵盖 20 个并行任务——对比 Ante、Claude Code 和 Opencode。

评估原则 大部分魔力来自模型——但 Agent 框架是人与 AI 之间的关键通道。

* 评估 Agent 及其引导模型力量的能力,而非模型本身。

改进框架,而非 Prompt。当评估分数需要提升时,我们投资 Agent 底盘——运行时、编排、可靠性——而非针对特定基准测试进行 Prompt 工程。如果系统真正变好而分数提升,这种提升是持久的。如果是因为调整了 Prompt,那是脆弱的。 早启动,保持简单。从实际失败中汲取的小型但诚实的评估集,优于大型的人造评估集。 隔离与复现。每次评估运行都从干净状态开始。当分数下降时,我们知道这反映了真实的回归(regression)。

评论 (0)